Gemini 3.5 Flash-Lite est le modèle d’efficacité en disponibilité générale de Google pour les tâches agentiques à grand volume, la traduction, le traitement de documents, la classification et l’extraction structurée. Sorti le 21 juillet 2026, c’est le modèle le plus rapide de la série Gemini 3.5 et il est conçu pour les applications où la latence, le débit et le coût d’API sont des contraintes plus strictes que la profondeur maximale de raisonnement.
L’API Google Gemini 3.5 Flash-Lite accepte les textes, images, vidéos, audios et fichiers PDF dans une fenêtre d’entrée de 1 048 576 jetons. Elle produit des réponses textuelles pouvant atteindre 65 536 jetons et prend en charge la réflexion, les sorties structurées, l’appel de fonctions, la mise en cache, l’exécution de code, la recherche de fichiers, le contexte d’URL et l’ancrage de la recherche dans l’API native de Google. Elle ne génère pas d’images ni d’audio et ne prend pas en charge l’API Live. La disponibilité des outils spécifiques au fournisseur peut différer via une passerelle compatible OpenAI, consultez donc la documentation GPTProto avant de vous appuyer sur une extension native de Google.
| Spécifications |
Gemini 3.5 Flash-Lite |
| Fournisseur |
Google |
| ID de modèle stable |
gemini-3.5-flash-lite |
| Étape de lancement |
Disponibilité générale |
| Date de sortie |
21 juillet 2026 |
| Limite d’entrée |
1 048 576 jetons |
| Sortie maximale |
65 536 jetons |
| Entrées acceptées |
Texte, image, vidéo, audio, PDF |
| Sortie |
Texte |
| Fonctionnalités principales |
Réflexion, sorties structurées, appel de fonctions, mise en cache |
| Non pris en charge |
Génération d’images, génération audio, Live API, réglage fin |
Meilleures utilisations de Gemini 3.5 Flash-Lite
Flash-Lite est le plus utile lorsqu’une application répète des tâches ciblées à grand volume. Il peut servir de modèle d’exécution à moindre coût sous un orchestrateur plus performant, ou gérer des workflows complets dont les décisions sont limitées et faciles à valider.
-
Classification et routage : Étiquetez les tickets d’assistance, détectez l’intention, assignez des documents ou choisissez l’outil suivant sans payer un modèle de pointe à chaque requête.
-
Analyse de documents et extraction JSON : Lisez les PDF, factures, reçus, rapports et fiches produits, puis renvoyez les champs correspondant à un schéma défini.
-
Traduction et synthèse : Traitez de grandes files de textes multilingues, de transcriptions de réunions, d’avis ou de contenus de catalogue lorsque le coût unitaire affecte les dépenses opérationnelles totales.
-
Examen multimodal : Extrayez du texte et des faits à partir d’images, d’audio enregistré, de vidéos et de PDF tout en conservant la sortie dans un flux aval textuel.
-
Sous-agents ciblés : Déléguez la recherche, la récupération, les modifications de code, la vérification et les appels d’outils à des travailleurs spécialisés tout en réservant un modèle plus puissant pour la planification ou la révision finale.
Le modèle est moins adapté lorsqu’une requête difficile exige la plus grande précision de code possible, une planification à long terme ou une récupération répétée après des erreurs d’outils. Pour ces charges de travail, testez Gemini 3.5 Flash ou Gemini 3.6 Flash sur le même ensemble d’évaluation avant de choisir uniquement sur la base du prix au jeton.
Choisissez un niveau de réflexion selon la complexité de la tâche
Gemini 3.5 Flash-Lite prend en charge une réflexion configurable dans l’API native de Google. Google recommande MINIMAL pour la classification, le routage et l’extraction JSON sensibles à la latence. Ce réglage est le paramètre par défaut et limite les jetons de raisonnement inutiles sur les tâches prévisibles.
Utilisez MEDIUM ou HIGH pour les sous-agents qui écrivent du code, exécutent des commandes de terminal, appellent plusieurs API ou doivent se remettre d’erreurs intermédiaires. Une réflexion plus poussée peut améliorer l’exécution en plusieurs étapes, mais elle augmente aussi l’utilisation de jetons de sortie et le temps de réponse. Si vous appelez le modèle via le point de terminaison compatible OpenAI de GPTProto, consultez la documentation actuelle pour connaître le paramètre de réflexion mappé avant d’envoyer des champs spécifiques au fournisseur.
Gemini 3.5 Flash-Lite vs Gemini 3.5 Flash
Gemini 3.5 Flash-Lite et Gemini 3.5 Flash partagent une fenêtre de contexte de 1 048 576 jetons et une sortie maximale de 65 536 jetons, mais ils sont conçus pour des économies de charge de travail différentes. Flash-Lite privilégie le débit et le faible coût unitaire ; Flash cible le codage plus complexe, la planification agentique et le travail de connaissance.
| Comparaison |
Gemini 3.5 Flash-Lite |
Gemini 3.5 Flash |
| Meilleure utilisation |
Sous-agents à grand volume, extraction, traduction, analyse de documents |
Codage complexe, planification d’agents, travail de connaissance plus approfondi |
| Positionnement du modèle |
Modèle le plus rapide et le moins cher de la série 3.5 |
Modèle de la gamme Flash plus performant |
| Contexte d’entrée |
1 048 576 jetons |
1 048 576 jetons |
| Sortie maximale |
65 536 jetons |
65 536 jetons |
| Prix d’entrée standard Google |
0,30 $ par million de jetons |
1,50 $ par million de jetons |
| Prix de sortie standard Google |
2,50 $ par million de jetons |
9,00 $ par million de jetons |
| Prix GPTProto Flash-Lite |
0,18 $ en entrée / 1,50 $ en sortie par million de jetons |
Voir la page du modèle Gemini 3.5 Flash |
Aux tarifs standard de Google, Flash-Lite coûte 80 % de moins en entrée et environ 72 % de moins en sortie que Gemini 3.5 Flash. Choisissez-le lorsque le volume de requêtes et le temps de réponse dominent le coût des nouvelles tentatives occasionnelles. Choisissez Flash lorsqu’un plus petit nombre de tâches plus difficiles rend la qualité du premier passage plus importante que le tarif au jeton le plus bas.
Utiliser Gemini 3.5 Flash-Lite via GPTProto
GPTProto fournit un accès à l’API Gemini 3.5 Flash-Lite via le même compte, la même clé API et le même solde utilisés pour plus de 200 modèles. Cela réduit la fragmentation des comptes et de la facturation lorsqu’une application oriente l’extraction simple vers Flash-Lite, le raisonnement complexe vers Gemini 3.5 Flash ou Gemini 3.6 Flash, et le travail média vers des modèles d’image, de vidéo ou d’audio distincts.
Pour une application existante compatible OpenAI, conservez la structure client existante et utilisez le point de terminaison, la méthode d’authentification et la chaîne de modèle indiqués dans la documentation GPTProto. Ne supposez pas que chaque champ natif de Google correspond un à un. Testez les contrôles de réflexion, la mise en cache, l’ancrage, la gestion des fichiers, les schémas d’outils et le comportement de streaming avant de transférer le trafic de production.
Notes de migration pour les charges de travail Gemini existantes
Google documente plusieurs différences de compatibilité qui peuvent affecter les migrations depuis les anciens modèles Gemini. Les valeurs personnalisées de temperature, de top-K et de top-P peuvent être ignorées. Les pénalités personnalisées de fréquence et de présence peuvent renvoyer une erreur. Les requêtes dont le dernier tour de conversation a le rôle model ne sont pas non plus prises en charge.
Avant de basculer un workflow à grand volume, rejouez un ensemble de tests représentatif et vérifiez la conformité au schéma JSON, la complétion des appels d’outils, l’utilisation de jetons, la latence et la fréquence des nouvelles tentatives. Un déploiement rentable de l’API Gemini 3.5 Flash-Lite doit être évalué en fonction du coût par tâche réussie, et non uniquement du coût par jeton. C’est particulièrement important pour les agents multi-étapes, où un niveau de réflexion trop faible peut interrompre une séquence d’outils trop tôt.