L’API Gemini 3.6 Flash offre aux développeurs un accès programmatique au modèle Flash de Google, désormais disponible de manière générale, pour les agents de codage, l’analyse multimodale, le traitement de connaissances avec un long contexte et l’automatisation pilotée par des outils. Google a publié le modèle stable gemini-3.6-flash le 21 juillet 2026. Contrairement au modèle précédent gemini-3-flash-preview, il s’agit d’un identifiant de modèle stable destiné à une utilisation continue en production.
Gemini 3.6 Flash accepte les textes, images, vidéos, fichiers audio et PDF, mais renvoie uniquement du texte. Sa fenêtre d’entrée de 1 048 576 tokens peut contenir de vastes dépôts, de longues collections de documents ou des entrées multimédias étendues, tandis que sa limite de sortie de 65 536 tokens permet de générer des rapports détaillés, du code et des réponses structurées. Google répertorie parmi les fonctionnalités du modèle sous-jacent la mise en cache, les sorties structurées, l’appel de fonctions, l’exécution de code, la recherche de fichiers, le contexte d’URL, l’ancrage Search, l’ancrage Maps et des niveaux de réflexion configurables.
Les limites de ses capacités sont importantes. Gemini 3.6 Flash ne génère ni images ni audio et ne prend pas en charge l’API Live. L’utilisation de l’ordinateur est disponible comme fonctionnalité en préversion, et non comme capacité totalement stable. Lorsqu’une intégration dépend d’un outil natif de Google, vérifiez que la couche de compatibilité GPTProto l’expose avant la migration. Si votre produit nécessite une interaction vocale de type parole-à-parole, la génération native d’images ou une stabilité stricte pour l’automatisation des ordinateurs de bureau, orientez cette partie de la charge de travail vers un autre modèle.
| Spécification |
Gemini 3.6 Flash |
| Fournisseur |
Google |
| Statut |
Disponible de manière générale |
| Identifiant du modèle stable |
gemini-3.6-flash |
| Types d’entrée |
Texte, image, vidéo, audio, PDF |
| Type de sortie |
Texte |
| Limite de tokens en entrée |
1,048,576 |
| Limite de tokens en sortie |
65,536 |
| Niveaux de réflexion |
minimal, low, medium, high |
| Niveau de réflexion par défaut |
medium |
| Outils répertoriés par Google |
Appel de fonctions, exécution de code, recherche de fichiers, Search, Maps, contexte d’URL |
| Utilisation de l’ordinateur |
Prise en charge en préversion |
| Non pris en charge |
Génération d’images, génération audio, API Live |
Les meilleurs cas d’utilisation de Gemini 3.6 Flash
Gemini 3.6 Flash est particulièrement utile lorsqu’une tâche nécessite à la fois un vaste contexte de travail et des appels répétés à des outils. Ce n’est pas automatiquement le choix le moins coûteux pour chaque requête courte, et son niveau de réflexion moyen par défaut peut consommer davantage de tokens qu’un modèle sans raisonnement pour une classification simple. Adaptez le niveau de réflexion et le modèle utilisé à la tâche réelle.
| Charge de travail |
Pourquoi il convient |
Note d’implémentation |
| Agents de codage sur dépôt |
Moins de modifications indésirables et de boucles d’exécution que Gemini 3.5 Flash lors des tests de Google |
Utilisez une réflexion medium ou high et validez les modifications avec des tests |
| Analyse multimodale de documents |
Lit les PDF, images, graphiques, fichiers audio et vidéos dans une même requête |
Demandez une sortie structurée lorsque les systèmes en aval ont besoin de champs stables |
| Recherche avec long contexte |
1 million de tokens en entrée et mise en cache du contexte prise en charge |
Mettez en cache les corpus récurrents au lieu de renvoyer les fichiers inchangés |
| Automatisation du navigateur ou de l’ordinateur de bureau |
Outil natif d’utilisation de l’ordinateur et score de 83,0 % dans OSWorld-Verified lors de l’évaluation de Google |
Considérez l’utilisation de l’ordinateur comme une préversion et maintenez des étapes d’approbation pour les actions importantes |
| Assistants ancrés dans des sources |
Le modèle sous-jacent prend en charge Search, Maps, la recherche de fichiers et le contexte d’URL |
Activez uniquement les outils nécessaires à chaque requête et suivez la consommation de tokens qui en résulte |
Gemini 3.6 Flash face à Gemini 3.5 Flash
Gemini 3.6 Flash constitue une amélioration directe de l’efficacité par rapport à Gemini 3.5 Flash, plutôt qu’un remplacement offrant un contexte plus vaste. Les deux modèles conservent la même classe de contexte de 1 million de tokens et le même niveau de réflexion moyen par défaut. La différence réside dans l’efficacité pour les tâches : Google indique 17 % de tokens de sortie en moins sur les charges de travail d’Artificial Analysis, moins d’étapes de raisonnement et d’appels d’outils, ainsi que de meilleurs résultats en codage, en ingénierie du machine learning, dans l’utilisation de l’ordinateur et pour la récupération avec long contexte.
Le tarif officiel d’entrée reste de 1,50 $ par million de tokens, tandis que le tarif officiel de sortie passe de 9,00 $ à 7,50 $. Sur GPTProto, Gemini 3.6 Flash coûte 0,90 $ par million de tokens en entrée et 4,50 $ par million de tokens en sortie ; Gemini 3.5 Flash coûte actuellement 0,90 $ et 5,40 $. Pour les nouveaux systèmes agentiques ou multimodaux, 3.6 Flash constitue le meilleur choix par défaut. Conservez 3.5 Flash uniquement si vous avez déjà validé son comportement et avez besoin de temps pour tester la migration contre les régressions.
| Métrique |
Gemini 3.6 Flash |
Gemini 3.5 Flash |
| Fenêtre de contexte |
1,048,576 |
1,048,576 |
| Sortie maximale |
65,536 |
65,536 |
| Réflexion par défaut |
Moyenne |
Moyenne |
| Entrée / sortie standard Google par million |
$1.50 / $7.50 |
$1.50 / $9.00 |
| Entrée / sortie GPTProto par million |
$0.90 / $4.50 |
$0.90 / $5.40 |
| DeepSWE v1.1 |
49.0% |
37.0% |
| MLE-Bench |
63.9% |
49.7% |
| OSWorld-Verified |
83.0% |
78.4% |
| GDM-MRCR v2 à 1 million |
54.0% |
26.6% |
Les chiffres des benchmarks ci-dessus sont communiqués par les fournisseurs. Utilisez-les pour sélectionner des candidats, puis exécutez les deux modèles avec vos propres requêtes, outils et critères de réussite avant de transférer le trafic de production.
Modifications de l’API à vérifier avant la migration
Ne considérez pas la migration vers 3.6 Flash comme un simple remplacement du nom du modèle si votre application utilise l’API Interactions native de Google. Google a modifié plusieurs champs de génération et de conversation pour les modèles les plus récents :
- Modifiez l’identifiant du modèle en
gemini-3.6-flash.
- Supprimez
temperature, top_p et top_k de la configuration de génération.
- Remplacez
thinking_budget par thinking_level ; les valeurs prises en charge sont minimal, low, medium et high.
- Supprimez
candidate_count, que Gemini 3.x ne prend pas en charge.
- N’envoyez pas de tours de conversation préremplis par le modèle. Pour les sessions multi-tours de l’API Interactions, utilisez
previous_interaction_id côté serveur.
- Testez les schémas d’outils, les sorties structurées et la gestion des fichiers contre les régressions avant de transférer l’ensemble du trafic.
Si vous utilisez le format de requête compatible OpenAI de GPTProto, suivez le guide de démarrage rapide et la documentation GPTProto de cette page plutôt que de copier directement les champs natifs de Google. L’avantage pratique est qu’une seule clé API et un seul solde GPTProto permettent également d’appeler Gemini 3.5 Flash, GPT-5.6 Luna, Claude Opus 4.8, Kimi K3 et 200+ autres modèles, afin d’exécuter le même jeu d’évaluation sans ouvrir de comptes distincts auprès des fournisseurs.