O Gemini 3.5 Flash-Lite é o modelo de eficiência de disponibilidade geral do Google para tarefas agênticas de alto volume, tradução, processamento de documentos, classificação e extração estruturada. Lançado em 21 de julho de 2026, é o modelo mais rápido da série Gemini 3.5 e foi desenvolvido para aplicações em que latência, throughput e custo da API são restrições mais rigorosas do que a profundidade máxima de raciocínio.
A API do Google Gemini 3.5 Flash-Lite aceita texto, imagens, vídeo, áudio e arquivos PDF em uma janela de entrada de 1.048.576 tokens. Ela produz respostas de texto de até 65.536 tokens e oferece suporte a raciocínio, saídas estruturadas, chamadas de função, caching, execução de código, pesquisa de arquivos, contexto de URL e grounding de pesquisa na API nativa do Google. Ela não gera imagens nem áudio e não oferece suporte à Live API. A disponibilidade de ferramentas específicas do provedor pode variar por meio de um gateway compatível com OpenAI, portanto, consulte a documentação do GPTProto antes de depender de uma extensão nativa do Google.
| Especificação |
Gemini 3.5 Flash-Lite |
| Provedor |
Google |
| ID estável do modelo |
gemini-3.5-flash-lite |
| Estágio de lançamento |
Disponibilidade geral |
| Data de lançamento |
21 de julho de 2026 |
| Limite de entrada |
1.048.576 tokens |
| Saída máxima |
65.536 tokens |
| Entradas aceitas |
Texto, imagem, vídeo, áudio, PDF |
| Saída |
Texto |
| Principais recursos |
Raciocínio, saídas estruturadas, chamadas de função, caching |
| Não compatível |
Geração de imagens, geração de áudio, Live API, ajuste |
Melhores usos para o Gemini 3.5 Flash-Lite
O Flash-Lite é mais útil quando uma aplicação repete tarefas específicas em alto volume. Ele pode atuar como um modelo executor de menor custo sob a coordenação de um orquestrador mais avançado ou lidar com fluxos de trabalho completos cujas decisões são restritas e fáceis de validar.
-
Classificação e roteamento: Rotule tickets de suporte, detecte intenções, atribua documentos ou escolha a próxima ferramenta sem pagar por um modelo de ponta em cada solicitação.
-
Análise de documentos e extração para JSON: Leia PDFs, faturas, recibos, relatórios e registros de produtos e, em seguida, retorne campos que correspondam a um esquema definido.
-
Tradução e sumarização: Processe grandes filas de textos multilíngues, transcrições de reuniões, avaliações ou conteúdo de catálogos em que o custo unitário afeta as despesas operacionais totais.
-
Análise multimodal: Extraia texto e fatos de imagens, áudios gravados, vídeos e PDFs, mantendo a saída em um fluxo de trabalho subsequente baseado em texto.
-
Subagentes especializados: Delegue pesquisas, recuperação, edições de código, verificações e chamadas de ferramentas a executores especializados, reservando um modelo mais avançado para o planejamento ou a revisão final.
O modelo é menos adequado quando uma solicitação difícil exige a maior precisão possível em programação, planejamento de longo prazo ou recuperação repetida de erros de ferramentas. Para essas cargas de trabalho, teste o Gemini 3.5 Flash ou o Gemini 3.6 Flash com o mesmo conjunto de avaliação antes de escolher apenas pelo preço dos tokens.
Escolha um nível de raciocínio de acordo com a complexidade da tarefa
O Gemini 3.5 Flash-Lite oferece suporte a raciocínio configurável na API nativa do Google. O Google recomenda MINIMAL para classificação, roteamento e extração de JSON sensíveis à latência. Essa configuração é o padrão e limita tokens de raciocínio desnecessários em tarefas previsíveis.
Use MEDIUM ou HIGH para subagentes que escrevem código, executam comandos de terminal, chamam várias APIs ou precisam se recuperar de erros intermediários. Mais raciocínio pode melhorar a execução em várias etapas, mas também aumenta o uso de tokens de saída e o tempo de resposta. Se você chamar o modelo por meio do endpoint compatível com OpenAI do GPTProto, consulte a documentação atual para verificar o parâmetro de raciocínio correspondente antes de enviar campos específicos do provedor.
Gemini 3.5 Flash-Lite vs Gemini 3.5 Flash
O Gemini 3.5 Flash-Lite e o Gemini 3.5 Flash compartilham uma janela de contexto de 1.048.576 tokens e uma saída máxima de 65.536 tokens, mas foram projetados para diferentes aspectos econômicos das cargas de trabalho. O Flash-Lite prioriza throughput e baixo custo unitário; o Flash é direcionado a programação mais complexa, planejamento agêntico e trabalho intensivo de conhecimento.
| Comparação |
Gemini 3.5 Flash-Lite |
Gemini 3.5 Flash |
| Mais adequado para |
Subagentes de alto volume, extração, tradução, análise de documentos |
Programação complexa, planejamento agêntico, trabalho de conhecimento mais aprofundado |
| Posicionamento do modelo |
Modelo mais rápido e de menor custo da série 3.5 |
Modelo mais avançado da categoria Flash |
| Contexto de entrada |
1.048.576 tokens |
1.048.576 tokens |
| Saída máxima |
65.536 tokens |
65.536 tokens |
| Preço padrão de entrada do Google |
$0.30 por 1M de tokens |
$1.50 por 1M de tokens |
| Preço padrão de saída do Google |
$2.50 por 1M de tokens |
$9.00 por 1M de tokens |
| Preço do Flash-Lite no GPTProto |
$0.18 de entrada / $1.50 de saída por 1M de tokens |
Veja a página do modelo Gemini 3.5 Flash |
Nas tarifas padrão do Google, o Flash-Lite custa 80% menos para entrada e cerca de 72% menos para saída do que o Gemini 3.5 Flash. Escolha-o quando o volume de solicitações e o tempo de resposta forem mais importantes do que o custo de novas tentativas ocasionais. Escolha o Flash quando um número menor de tarefas mais difíceis tornar a qualidade na primeira tentativa mais importante do que a menor tarifa por token.
Usando o Gemini 3.5 Flash-Lite por meio do GPTProto
O GPTProto oferece acesso à API do Gemini 3.5 Flash-Lite pela mesma conta, chave de API e saldo usados para mais de 200 modelos. Isso reduz a fragmentação de contas e faturamento quando uma aplicação encaminha extrações simples para o Flash-Lite, raciocínios complexos para o Gemini 3.5 Flash ou Gemini 3.6 Flash e tarefas de mídia para modelos separados de imagem, vídeo ou áudio.
Para uma aplicação existente compatível com OpenAI, mantenha a estrutura do cliente ao redor e use o endpoint, o método de autenticação e a string do modelo mostrados na documentação do GPTProto. Não presuma que todos os campos nativos do Google tenham correspondência direta. Teste os controles de raciocínio, caching, grounding, manipulação de arquivos, esquemas de ferramentas e comportamento de streaming antes de direcionar tráfego de produção.
Notas de migração para cargas de trabalho Gemini existentes
O Google documenta várias diferenças de compatibilidade que podem afetar migrações de modelos Gemini mais antigos. Valores personalizados de temperature, top-K e top-P podem ser ignorados. Penalidades personalizadas de frequência e presença podem retornar um erro. Solicitações cuja última mensagem da conversa tenha a função model também não são compatíveis.
Antes de mudar um fluxo de trabalho de alto volume, reproduza um conjunto de testes representativo e verifique a conformidade com o esquema JSON, a conclusão de chamadas de ferramentas, o uso de tokens, a latência e a frequência de novas tentativas. Uma implantação econômica da API do Gemini 3.5 Flash-Lite deve ser avaliada pelo custo por tarefa bem-sucedida, não apenas pelo custo por token. Isso é especialmente importante para agentes de várias etapas, nos quais uma configuração de raciocínio excessivamente baixa pode interromper uma sequência de ferramentas cedo demais.