A API Gemini 3.6 Flash oferece aos desenvolvedores acesso programático ao modelo Flash geralmente disponível do Google para agentes de codificação, análise multimodal, trabalho com conhecimento em contextos longos e automação orientada por ferramentas. O Google lançou o modelo estável gemini-3.6-flash em 21 de julho de 2026. Diferentemente do anterior gemini-3-flash-preview, este é um ID de modelo estável destinado ao uso contínuo em aplicações.
O Gemini 3.6 Flash aceita texto, imagens, vídeo, áudio e arquivos PDF, mas retorna apenas texto. Sua janela de entrada de 1.048.576 tokens comporta grandes repositórios, conjuntos extensos de documentos ou entradas de mídia prolongadas, enquanto o limite de saída de 65.536 tokens permite gerar relatórios detalhados, código e respostas estruturadas. O Google lista armazenamento em cache, saída estruturada, chamadas de função, execução de código, pesquisa de arquivos, contexto de URL, fundamentação por Pesquisa, fundamentação por Maps e pensamento configurável entre os recursos do modelo subjacente.
Os limites de capacidade são importantes. O Gemini 3.6 Flash não gera imagens nem áudio e não oferece suporte à Live API. O uso do computador está disponível como recurso de prévia, e não como capacidade totalmente estável. Quando uma integração depender de uma ferramenta nativa do Google, confirme se a camada de compatibilidade do GPTProto a expõe antes da migração. Se o seu produto exigir interação de fala para fala, geração nativa de imagens ou estabilidade rigorosa para automação de desktop, encaminhe essa parte da carga de trabalho para outro modelo.
| Especificação |
Gemini 3.6 Flash |
| Provedor |
Google |
| Status |
Geralmente disponível |
| ID do modelo estável |
gemini-3.6-flash |
| Tipos de entrada |
Texto, imagem, vídeo, áudio, PDF |
| Tipo de saída |
Texto |
| Limite de tokens de entrada |
1,048,576 |
| Limite de tokens de saída |
65,536 |
| Níveis de pensamento |
minimal, low, medium, high |
| Nível de pensamento padrão |
medium |
| Ferramentas listadas pelo Google |
Chamadas de função, execução de código, pesquisa de arquivos, Pesquisa, Maps, contexto de URL |
| Uso do computador |
Compatível em prévia |
| Não compatível |
Geração de imagens, geração de áudio, Live API |
Onde o Gemini 3.6 Flash se encaixa melhor
O Gemini 3.6 Flash é mais útil quando uma tarefa exige tanto um contexto de trabalho amplo quanto chamadas repetidas de ferramentas. Ele não é automaticamente a opção mais barata para todos os prompts curtos, e seu nível de pensamento médio padrão pode consumir mais tokens do que um modelo sem raciocínio em classificações simples. Adapte o nível de pensamento e a rota do modelo ao trabalho real.
| Carga de trabalho |
Por que se encaixa |
Observação de implementação |
| Agentes de codificação para repositórios |
Menos edições indesejadas e ciclos de execução do que o Gemini 3.5 Flash nos testes do Google |
Use o pensamento medium ou high e valide as alterações com testes |
| Análise multimodal de documentos |
Lê PDFs, imagens, gráficos, áudio e vídeo na mesma solicitação |
Solicite uma saída estruturada quando os sistemas downstream precisarem de campos estáveis |
| Pesquisa em contexto longo |
1 milhão de tokens de entrada e armazenamento em cache de contexto compatível |
Armazene em cache corpora repetidos em vez de reenviar arquivos inalterados |
| Automação de navegador ou desktop |
Ferramentas nativas de uso do computador e 83,0% no OSWorld-Verified na avaliação do Google |
Trate o uso do computador como prévia e mantenha etapas de aprovação para ações consequenciais |
| Assistentes fundamentados |
O modelo subjacente é compatível com Pesquisa, Maps, pesquisa de arquivos e contexto de URL |
Habilite apenas as ferramentas necessárias para cada solicitação e acompanhe o uso de tokens resultante |
Gemini 3.6 Flash vs Gemini 3.5 Flash
O Gemini 3.6 Flash é uma atualização direta de eficiência em relação ao Gemini 3.5 Flash, e não um substituto com contexto maior. Ambos os modelos mantêm a mesma classe de contexto de 1 milhão e o nível de pensamento médio padrão. A diferença está na eficiência das tarefas: o Google relata 17% menos tokens de saída em cargas de trabalho da Artificial Analysis, menos turnos de raciocínio e chamadas de ferramentas, além de resultados superiores em codificação, engenharia de machine learning, uso do computador e recuperação em contexto longo.
A tarifa oficial de entrada permanece em US$ 1,50 por 1 milhão de tokens, enquanto a tarifa oficial de saída cai de US$ 9,00 para US$ 7,50. No GPTProto, o Gemini 3.6 Flash custa US$ 0,90 por 1 milhão de tokens de entrada e US$ 4,50 por 1 milhão de tokens de saída; o Gemini 3.5 Flash custa atualmente US$ 0,90 e US$ 5,40. Para novos sistemas agênticos ou multimodais, o 3.6 Flash é a melhor opção padrão. Mantenha o 3.5 Flash apenas quando você já tiver validado seu comportamento e precisar de tempo para testar a migração contra regressões.
| Métrica |
Gemini 3.6 Flash |
Gemini 3.5 Flash |
| Janela de contexto |
1,048,576 |
1,048,576 |
| Saída máxima |
65,536 |
65,536 |
| Pensamento padrão |
Médio |
Médio |
| Entrada / saída padrão do Google por 1 milhão |
$1.50 / $7.50 |
$1.50 / $9.00 |
| Entrada / saída do GPTProto por 1 milhão |
$0.90 / $4.50 |
$0.90 / $5.40 |
| DeepSWE v1.1 |
49.0% |
37.0% |
| MLE-Bench |
63.9% |
49.7% |
| OSWorld-Verified |
83.0% |
78.4% |
| GDM-MRCR v2 em 1 milhão |
54.0% |
26.6% |
Os números de benchmark acima foram informados pelos provedores. Use-os para escolher candidatos e, em seguida, execute os dois modelos com seus próprios prompts, ferramentas e critérios de sucesso antes de direcionar tráfego de produção.
Alterações na API a verificar antes da migração
Não trate a migração para o 3.6 Flash apenas como uma substituição do nome do modelo se sua aplicação usar a API Interactions nativa do Google. O Google alterou vários campos de geração e conversa para os modelos mais recentes:
- Altere o ID do modelo para
gemini-3.6-flash.
- Remova
temperature, top_p e top_k da configuração de geração.
- Substitua
thinking_budget por thinking_level; os valores compatíveis são minimal, low, medium e high.
- Remova
candidate_count, que não é compatível com o Gemini 3.x.
- Não envie turnos de modelo pré-preenchidos. Para sessões com vários turnos na API Interactions, use o
previous_interaction_id do lado do servidor.
- Faça testes de regressão nos esquemas de ferramentas, nas saídas estruturadas e no tratamento de arquivos antes de transferir todo o tráfego.
Se você usar o formato de solicitação compatível com OpenAI do GPTProto, siga o Início rápido e a documentação do GPTProto nesta página, em vez de copiar diretamente os campos nativos do Google. A vantagem prática é que uma única chave de API e saldo do GPTProto também podem chamar Gemini 3.5 Flash, GPT-5.6 Luna, Claude Opus 4.8, Kimi K3 e mais de 200 outros modelos, permitindo executar o mesmo conjunto de avaliações sem abrir contas separadas com cada provedor.