Contexto Multimodal de 1M de Tokens
Analise texto, imagens, vídeo, áudio e PDFs em uma janela de entrada de 1,048,576 tokens. As respostas são somente texto, com uma saída máxima de 65,536 tokens.
curl --request POST "https://gptproto.com/v1/chat/completions" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"model": "gemini-3.8-flash",
"messages": [
{
"role": "user",
"content": "Hello"
}
]
}'Chat, agentes de programação e trabalho com documentos. Preço por 1M de tokens — entrada, entrada em cache e saída são cobradas separadamente. GPTProto está 40% abaixo das tarifas oficiais.
| Cenário | Lista de Google | OpenRouter | GPTProto | Economia / mês |
|---|---|---|---|---|
| Pessoal10M tokens / mês (4.8M cache) | $20.52 | $21.65 | $12.31 | −$8.21≈ $98.50 / ano |
| Equipe100M tokens / mês (48M cache) | $205.20 | $216.49 | $123.12 | −$82.08≈ $984.96 / ano |
| Empresarial500M tokens / mês (240M cache) | $1026.00 | $1082.43 | $615.60 | −$410.40≈ $4924.80 / ano |
Execute o Gemini 3.8 Flash por meio do GPTProto para trabalho de software com vários arquivos, uso iterativo de ferramentas e análise de mídia mista. O modelo aceita texto, imagens, vídeo, áudio e PDFs e retorna até 65,536 tokens de texto.
Contexto Multimodal de 1M de Tokens
Analise texto, imagens, vídeo, áudio e PDFs em uma janela de entrada de 1,048,576 tokens. As respostas são somente texto, com uma saída máxima de 65,536 tokens.
Ganhos de Programação de Longo Horizonte
Use o Gemini 3.8 Flash para refatoração de vários arquivos e trabalho conduzido pelo terminal. O Google relata 90.8% no Terminal-Bench 2.1, em comparação com 81.6% para o Gemini 3.7 Flash.
Níveis Ajustáveis de Pensamento
Defina esforço de pensamento baixo, médio ou alto para equilibrar latência, uso de tokens e profundidade de raciocínio. Médio é o padrão; o nível mínimo não é suportado e retorna um erro.
Ferramentas e Saída Estruturada
Crie agentes com chamada de funções, execução de código, busca de arquivos, fundamentação da Pesquisa Google, contexto de URL, cache e saída estruturada. O uso do computador também é suportado em pré-visualização.
A API do Google Gemini 3.8 oferece acesso programático ao Gemini 3.8 Flash, um modelo de raciocínio com disponibilidade geral lançado em 2 de setembro de 2026. Seu ID oficial de modelo é gemini-3.8-flash. O Google o posiciona para engenharia de software de longo horizonte, agentes autônomos e fluxos de trabalho empresariais complexos.
O Gemini 3.8 é um modelo de entrada multimodal e saída de texto. Uma solicitação pode combinar texto, imagens, vídeo, áudio ou PDFs dentro de uma janela de entrada de 1,048,576 tokens; as respostas podem conter até 65,536 tokens de texto. As ferramentas compatíveis incluem chamada de função, execução de código, busca de arquivos, grounding do Google, contexto de URL, cache, saída estruturada e computer use em prévia. Ele não gera imagens ou áudio e não oferece suporte à Live API.
Na GPTProto, um único saldo e uma única chave de API funcionam com o Gemini 3.8 Flash e mais de 200 outros modelos, simplificando roteamento, fallback e testes A/B controlados.
| Especificação | Gemini 3.8 Flash |
|---|---|
| Provedor | |
| Status de lançamento | Disponibilidade geral (GA) |
| Data de lançamento | 2 de setembro de 2026 |
| ID oficial do modelo | gemini-3.8-flash |
| Tipos de entrada | Texto, imagem, vídeo, áudio, PDF |
| Tipo de saída | Texto |
| Limite de contexto de entrada | 1,048,576 tokens |
| Saída máxima | 65,536 tokens |
| Níveis de raciocínio | Baixo, médio, alto; médio por padrão |
| Ferramentas principais | Chamada de função, execução de código, busca de arquivos, grounding do Search e Maps, contexto de URL |
| Outros recursos | Cache, saída estruturada, Batch API, inferência Flex, inferência Priority |
Codificação em escala de repositório: Forneça arquivos-fonte, testes, contexto de issues e ferramentas para depuração de vários arquivos, refatoração, planejamento de migração e validação baseada em terminal.
Agentes de longo horizonte: Use chamadas de função para busca, execução de código, recuperação e loops de validação. Defina condições de parada explícitas, permissões de ferramentas e verificações de aceitação em torno do modelo.
Análise multimodal: Combine PDFs, capturas de tela, gráficos, áudio e vídeo com instruções para revisão de documentos, análise de reuniões, QA visual ou extração estruturada.
Fluxos de trabalho com grounding: Combine Google Search, Maps, busca de arquivos ou contexto de URL com saída estruturada para pesquisa, ferramentas de conhecimento interno ou análise com reconhecimento de localização.
O Gemini 3.8 mantém o mesmo contexto de 1M tokens, limite de saída de 64K, tipos de entrada e taxas introdutórias de tokens do Google que o Gemini 3.7 Flash. O Google relata resultados mais fortes em codificação, multimodal e agentes, mas o 3.8 pode usar mais tokens à medida que raciocina, chama ferramentas e verifica o trabalho.
| Fator de decisão | Gemini 3.8 Flash | Gemini 3.7 Flash |
|---|---|---|
| Terminal-Bench 2.1 | 90.8% | 81.6% |
| SWE-Bench Pro | 61.6% | 60.4% |
| SWE-Atlas | 51.9% | 48.0% |
| tau3-bench Banking | 38.1% | 30.9% |
| CharXiv multimodal | 86.2% | 84.5% |
| Humanity's Last Exam | 45.4% | 45.7% |
| Taxa introdutória oficial de entrada/saída | $0.75 / $3.75 por 1M | $0.75 / $3.75 por 1M |
| Melhor indicação | Codificação difícil, agentes, raciocínio com mídia mista | Fluxos de trabalho com foco em eficiência e menor uso de tokens |
Estas são avaliações relatadas pelo Google, não testes independentes da GPTProto. O Gemini 3.8 melhora a maioria dos resultados listados, mas não todas as linhas, e taxas de tokens iguais não garantem custo igual por tarefa concluída.
Alterar o nome do modelo é apenas o primeiro passo da migração. Verifique estas regras de solicitação documentadas:
Substitua as configurações de número inteiro thinking_budget por thinking_level: low, medium ou high.
Não envie minimal; o Gemini 3.8 Flash não oferece suporte a isso.
Remova frequency_penalty, presence_penalty e candidate_count, que podem retornar erros de validação.
Não dependa de temperature, top_k ou top_p; o Google documenta estes campos de amostragem como ignorados para este modelo.
Faça a correspondência de cada resposta de função com o ID, o nome e a contagem de execução da chamada de função anterior.
Remova turnos de modelo preenchidos previamente; não termine o histórico com uma mensagem de papel de modelo.
Para uma integração compatível com OpenAI, mantenha o payload mínimo e verifique os campos mapeados em staging. Execute um teste canário com os mesmos prompts, ferramentas, timeouts e critérios de sucesso do modelo atual.
Benchmarks entre fornecedores raramente usam ferramentas ou orçamentos idênticos. Teste cada candidato na mesma tarefa e meça taxa de conclusão, chamadas de ferramenta inválidas, latência, tokens de saída e custo por execução bem-sucedida.
| Consulta de comparação | Teste mais útil |
|---|---|
| Claude Fable 5.1 vs Gemini 3.8 | Implementação com vários arquivos, ferramentas, testes e um orçamento fixo de saída |
| Gemini 3.8 vs GPT-5.6 | Geração de código, depuração, saída estruturada e recuperação de uma chamada de ferramenta com falha |
| Gemini 3.8 vs Grok 4.6 | Pesquisa com grounding de busca, com qualidade da fonte, latência e custo medidos separadamente |
| Qwen3.8-Max-0902vs Gemini 3.8 | Codificação de contexto longo e análise de documentos corporativos no mesmo conjunto de entrada |
| Gemini 3.8 vs Kimi K3 | Loops longos de agentes com regras de parada e esquemas de ferramentas idênticos |
| GLM-5.3 Flash vs Gemini 3.8 | Tarefas de codificação em alto volume, total de tokens usados e custo por resultado aceito |
O Gemini 3.8 é um forte candidato quando uma solicitação precisa combinar entrada de mídia mista com grounding do Google ou ferramentas de código. Não há vencedor universal sem testes no nível da carga de trabalho.
Escolha o Gemini 3.8 Flash para entrada de mídia mista, contexto de 1M tokens, loops longos de ferramentas ou comportamento de terminal mais forte que o Gemini 3.7. Ele se adapta a agentes de codificação, pesquisa multimodal, análise de documentos e fluxos de trabalho corporativos estruturados.
Mantenha o Gemini 3.7 ou uma alternativa de menor custo quando a eficiência de tokens importa mais do que a verificação extra. Para extração simples ou chat, teste esforço de raciocínio baixo e compare o custo por tarefa bem-sucedida.
Guias, comparações e atualizações relacionadas a este modelo.
Todos os artigos
Claude Fable 5.1 e Mythos 5.1 compartilham um modelo, mas diferem no acesso. Veja preços, recursos, benchmarks, salvaguardas e mudanças na migração da API.

Qwen3.8-Flash-Next vs GLM-5.3 Flash comparados para programação, agentes, trabalho de frontend, velocidade, preços, contexto, licenças e uso em produção.

O que é Tencent Hy4 Preview? Veja seu status de lançamento, design MoE de 770B, contexto de 1M, preços da API, benchmarks, limites e comparações de modelos.

Gerencie melhor sua stack com uma chave de API para vários modelos de IA. Acesse GPT, Claude e Gemini de um único endpoint e reduza seu tempo de desenvolvimento. Experimente agora.