Contexte multimodal de 1 M de tokens
Analysez du texte, des images, de la vidéo, de l'audio et des PDF dans une fenêtre d'entrée de 1,048,576 tokens. Les réponses sont uniquement textuelles, avec une sortie maximale de 65,536 tokens.
curl --request POST "https://gptproto.com/v1/chat/completions" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"model": "gemini-3.8-flash",
"messages": [
{
"role": "user",
"content": "Hello"
}
]
}'Chat, agents de codage et travail documentaire. Facturé par million de tokens — l'entrée, l'entrée en cache et la sortie sont facturées séparément. GPTProto est 40 % en dessous des tarifs officiels.
| Scénario | Liste Google | OpenRouter | GPTProto | Économies / mois |
|---|---|---|---|---|
| Personnel10M tokens / mois (4.8M en cache) | $20.52 | $21.65 | $12.31 | −$8.21≈ $98.50 / an |
| Équipe100M tokens / mois (48M en cache) | $205.20 | $216.49 | $123.12 | −$82.08≈ $984.96 / an |
| Entreprise500M tokens / mois (240M en cache) | $1026.00 | $1082.43 | $615.60 | −$410.40≈ $4924.80 / an |
Exécutez Gemini 3.8 Flash via GPTProto pour le travail logiciel multi-fichiers, l'utilisation itérative d'outils et l'analyse multimédia. Le modèle accepte le texte, les images, la vidéo, l'audio et les PDF, tout en renvoyant jusqu'à 65,536 tokens de texte.
Contexte multimodal de 1 M de tokens
Analysez du texte, des images, de la vidéo, de l'audio et des PDF dans une fenêtre d'entrée de 1,048,576 tokens. Les réponses sont uniquement textuelles, avec une sortie maximale de 65,536 tokens.
Gains en codage à long horizon
Utilisez Gemini 3.8 Flash pour la refactorisation multi-fichiers et le travail piloté par terminal. Google rapporte 90.8% sur Terminal-Bench 2.1, contre 81.6% pour Gemini 3.7 Flash.
Niveaux de réflexion ajustables
Définissez un effort de réflexion faible, moyen ou élevé pour équilibrer la latence, l'utilisation de tokens et la profondeur de raisonnement. Le niveau moyen est celui par défaut ; le niveau minimal n'est pas pris en charge et renvoie une erreur.
Outils et sortie structurée
Créez des agents avec l'appel de fonctions, l'exécution de code, la recherche de fichiers, l'ancrage Google Search, le contexte URL, la mise en cache et la sortie structurée. L'utilisation de l'ordinateur est également prise en charge en préversion.
L'API Google Gemini 3.8 offre un accès programmatique à Gemini 3.8 Flash, un modèle de raisonnement généralement disponible, publié le 2 septembre 2026. Son ID de modèle officiel est gemini-3.8-flash. Google le positionne pour l'ingénierie logicielle de long terme, les agents autonomes et les flux de travail d'entreprise complexes.
Gemini 3.8 est un modèle à entrée multimodale et sortie texte. Une requête peut combiner du texte, des images, de la vidéo, de l'audio ou des PDF dans une fenêtre d'entrée de 1 048 576 jetons ; les réponses peuvent contenir jusqu'à 65 536 jetons de texte. Les outils pris en charge incluent l'appel de fonction, l'exécution de code, la recherche de fichiers, l'ancrage Google, le contexte d'URL, la mise en cache, la sortie structurée et l'utilisation d'ordinateur en aperçu. Il ne génère pas d'images ni d'audio et ne prend pas en charge l'API Live.
Sur GPTProto, un seul solde et une seule clé API fonctionnent avec Gemini 3.8 Flash et plus de 200 autres modèles, ce qui simplifie le routage, la redondance et les tests A/B contrôlés.
| Spécifications | Gemini 3.8 Flash |
|---|---|
| Fournisseur | |
| Statut de publication | Disponibilité générale (GA) |
| Date de publication | 2 septembre 2026 |
| ID de modèle officiel | gemini-3.8-flash |
| Types d'entrée | Texte, image, vidéo, audio, PDF |
| Type de sortie | Texte |
| Limite de contexte d'entrée | 1 048 576 jetons |
| Sortie maximale | 65 536 jetons |
| Niveaux de réflexion | Faible, moyen, élevé ; moyen par défaut |
| Outils principaux | Appel de fonction, exécution de code, recherche de fichiers, ancrage Search et Maps, contexte d'URL |
| Autres capacités | Mise en cache, sortie structurée, API Batch, inférence Flex, inférence Priority |
Codage à l'échelle du dépôt : Fournissez les fichiers sources, les tests, le contexte des tickets et les outils pour le débogage multi-fichiers, la refactorisation, la planification de migration et la validation en terminal.
Agents à long terme : Utilisez des appels de fonction pour les boucles de recherche, d'exécution de code, de récupération et de validation. Définissez des conditions d'arrêt explicites, des autorisations d'outils et des contrôles d'acceptation autour du modèle.
Analyse multimodale : Combinez des PDF, des captures d'écran, des graphiques, de l'audio et de la vidéo avec des instructions pour la revue de documents, l'analyse de réunions, l'assurance qualité visuelle ou l'extraction structurée.
Flux de travail ancrés : Associez Google Search, Maps, la recherche de fichiers ou le contexte d'URL à une sortie structurée pour la recherche, les outils de connaissance interne ou l'analyse sensible à la localisation.
Gemini 3.8 conserve le même contexte de 1 M de jetons, la même limite de sortie de 64 K, les mêmes types d'entrée et les mêmes tarifs d'introduction par jeton Google que Gemini 3.7 Flash. Google rapporte de meilleurs résultats en codage, multimodal et agents, mais la version 3.8 peut utiliser plus de jetons lorsqu'elle raisonne, appelle des outils et vérifie le travail.
| Facteur de décision | Gemini 3.8 Flash | Gemini 3.7 Flash |
|---|---|---|
| Terminal-Bench 2.1 | 90.8% | 81.6% |
| SWE-Bench Pro | 61.6% | 60.4% |
| SWE-Atlas | 51.9% | 48.0% |
| tau3-bench Banking | 38.1% | 30.9% |
| CharXiv multimodal | 86.2% | 84.5% |
| Humanity's Last Exam | 45.4% | 45.7% |
| Tarif d'introduction officiel entrée/sortie | $0.75 / $3.75 par 1 M | $0.75 / $3.75 par 1 M |
| Idéal pour | Codage difficile, agents, raisonnement multimédia | Flux de travail axés sur l'efficacité avec une utilisation réduite des jetons |
Il s'agit d'évaluations rapportées par Google, et non de tests indépendants de GPTProto. Gemini 3.8 améliore la plupart des résultats listés, mais pas toutes les lignes, et des tarifs par jeton égaux ne garantissent pas un coût égal par tâche terminée.
Changer le nom du modèle n'est que la première étape de la migration. Vérifiez ces règles de requête documentées :
Remplacez les paramètres entiers thinking_budget par thinking_level : low, medium, ou high.
N'envoyez pas minimal ; Gemini 3.8 Flash ne le prend pas en charge.
Supprimez frequency_penalty, presence_penalty, et candidate_count, qui peuvent renvoyer des erreurs de validation.
Ne vous fiez pas à temperature, top_k, ou top_p ; Google documente ces champs d'échantillonnage comme ignorés pour ce modèle.
Faites correspondre chaque réponse de fonction à l'ID, au nom et au nombre d'exécutions de l'appel de fonction précédent.
Supprimez les tours de modèle préremplis ; ne terminez pas l'historique par un message de rôle modèle.
Pour une intégration compatible OpenAI, gardez la charge utile minimale et vérifiez les champs mappés en préproduction. Exécutez un canari avec les mêmes invites, outils, délais d'attente et critères de réussite que le modèle actuel.
Les benchmarks multi-fournisseurs utilisent rarement des outils ou des budgets identiques. Testez chaque candidat sur la même tâche et mesurez le taux d'achèvement, les appels d'outils invalides, la latence, les jetons de sortie et le coût par exécution réussie.
| Requête de comparaison | Test le plus utile |
|---|---|
| Claude Fable 5.1 vs Gemini 3.8 | Implémentation multi-fichiers avec outils, tests et budget de sortie fixe |
| Gemini 3.8 vs GPT-5.6 | Génération de code, débogage, sortie structurée et récupération après un appel d'outil échoué |
| Gemini 3.8 vs Grok 4.6 | Recherche ancrée sur la recherche avec qualité des sources, latence et coût mesurés séparément |
| Qwen3.8-Max-0902vs Gemini 3.8 | Codage à contexte long et analyse de documents d'entreprise sur le même ensemble d'entrées |
| Gemini 3.8 vs Kimi K3 | Boucles d'agents longues avec règles d'arrêt et schémas d'outils identiques |
| GLM-5.3 Flash vs Gemini 3.8 | Tâches de codage à grand volume, total de jetons utilisés et coût par résultat accepté |
Gemini 3.8 est un candidat solide lorsqu'une requête doit combiner une entrée multimédia avec l'ancrage Google ou des outils de code. Il n'y a pas de gagnant universel sans tests au niveau de la charge de travail.
Choisissez Gemini 3.8 Flash pour une entrée multimédia, un contexte de 1 M de jetons, de longues boucles d'outils ou un comportement en terminal plus solide que Gemini 3.7. Il convient aux agents de codage, à la recherche multimodale, à l'analyse de documents et aux flux de travail d'entreprise structurés.
Conservez Gemini 3.7 ou une alternative moins coûteuse lorsque l'efficacité des jetons importe plus que la vérification supplémentaire. Pour une extraction simple ou du chat, testez un effort de réflexion faible et comparez le coût par tâche réussie.
Guides, comparaisons et mises à jour liés à ce modèle.
Tous les articles
Claude Fable 5.1 et Mythos 5.1 partagent un même modèle mais diffèrent en termes d’accès. Découvrez les tarifs, fonctionnalités, benchmarks, garde-fous et changements de migration API.

Qwen3.8-Flash-Next vs GLM-5.3 Flash comparés pour le codage, les agents, le travail frontend, la vitesse, les tarifs, le contexte, les licences et l’utilisation en production.

Qu’est-ce que Tencent Hy4 Preview ? Découvrez son statut de sortie, sa conception MoE de 770B, son contexte de 1M, les tarifs API, les benchmarks, les limites et les comparaisons de modèles.

Gérez mieux votre stack avec une seule clé API pour plusieurs modèles d’IA. Accédez à GPT, Claude et Gemini depuis un seul point de terminaison et réduisez votre temps de développement. Essayez dès maintenant.