Gemini 3.5 Flash-Lite ist Googles Effizienzmodell mit allgemeiner Verfügbarkeit für agentische Aufgaben mit hohem Volumen, Übersetzungen, Dokumentverarbeitung, Klassifizierung und strukturierte Extraktion. Es wurde am 21. Juli 2026 veröffentlicht, ist das schnellste Modell der Gemini-3.5-Serie und richtet sich an Anwendungen, bei denen Latenz, Durchsatz und API-Kosten strengere Einschränkungen darstellen als die maximale Tiefe der Schlussfolgerungen.
Die Google-Gemini-3.5-Flash-Lite-API akzeptiert Text, Bilder, Videos, Audio und PDF-Dateien innerhalb eines Eingabefensters von 1.048.576 Tokens. Sie erzeugt Textantworten mit bis zu 65.536 Tokens und unterstützt Thinking, strukturierte Ausgaben, Funktionsaufrufe, Caching, Codeausführung, Dateisuche, URL-Kontext und Suchverankerung in Googles nativer API. Sie generiert keine Bilder oder Audiodateien und unterstützt die Live API nicht. Die Verfügbarkeit anbieterspezifischer Tools kann über ein OpenAI-kompatibles Gateway abweichen. Prüfen Sie daher die GPTProto-Dokumentation, bevor Sie sich auf eine Google-native Erweiterung verlassen.
| Spezifikation |
Gemini 3.5 Flash-Lite |
| Anbieter |
Google |
| Stabile Modell-ID |
gemini-3.5-flash-lite |
| Veröffentlichungsstatus |
Allgemeine Verfügbarkeit |
| Veröffentlichungsdatum |
21. Juli 2026 |
| Eingabelimit |
1.048.576 Tokens |
| Maximale Ausgabe |
65.536 Tokens |
| Akzeptierte Eingaben |
Text, Bild, Video, Audio, PDF |
| Ausgabe |
Text |
| Zentrale Fähigkeiten |
Thinking, strukturierte Ausgaben, Funktionsaufrufe, Caching |
| Nicht unterstützt |
Bildgenerierung, Audiogenerierung, Live API, Tuning |
Beste Einsatzmöglichkeiten für Gemini 3.5 Flash-Lite
Flash-Lite ist besonders nützlich, wenn eine Anwendung fokussierte Aufgaben in hohem Volumen wiederholt. Es kann als kostengünstigeres Arbeitsmodell unter einem leistungsfähigeren Orchestrator dienen oder vollständige Workflows übernehmen, deren Entscheidungen eng begrenzt und leicht zu validieren sind.
-
Klassifizierung und Routing: Support-Tickets kennzeichnen, Absichten erkennen, Dokumente zuweisen oder das nächste Tool auswählen, ohne für jede Anfrage ein Frontier-Modell bezahlen zu müssen.
-
Dokumentanalyse und JSON-Extraktion: PDFs, Rechnungen, Quittungen, Berichte und Produktdatensätze lesen und anschließend Felder zurückgeben, die einem definierten Schema entsprechen.
-
Übersetzung und Zusammenfassung: Große Mengen mehrsprachiger Texte, Besprechungstranskripte, Bewertungen oder Kataloginhalte verarbeiten, bei denen die Kosten pro Einheit die gesamten Betriebsausgaben beeinflussen.
-
Multimodale Prüfung: Text und Fakten aus Bildern, aufgezeichnetem Audio, Videos und PDFs extrahieren und die Ausgabe dabei in einem textbasierten nachgelagerten Workflow halten.
-
Fokussierte Subagenten: Suche, Abruf, Codeänderungen, Verifizierung und Tool-Aufrufe an spezialisierte Arbeitsmodelle delegieren und ein leistungsfähigeres Modell für die Planung oder abschließende Prüfung reservieren.
Das Modell eignet sich weniger, wenn eine schwierige Anfrage die höchstmögliche Programmiergenauigkeit, langfristige Planung oder wiederholte Fehlerbehebung nach Tool-Fehlern erfordert. Für solche Workloads sollten Sie Gemini 3.5 Flash oder Gemini 3.6 Flash anhand desselben Evaluierungssatzes testen, bevor Sie ausschließlich nach dem Tokenpreis entscheiden.
Wählen Sie die Thinking-Stufe nach der Aufgabenkomplexität
Gemini 3.5 Flash-Lite unterstützt konfigurierbares Thinking in Googles nativer API. Google empfiehlt MINIMAL für latenzempfindliche Klassifizierung, Routing und JSON-Extraktion. Diese Einstellung ist der Standard und begrenzt unnötige Reasoning-Tokens bei vorhersehbaren Aufgaben.
Verwenden Sie MEDIUM oder HIGH für Subagenten, die Code schreiben, Terminalbefehle ausführen, mehrere APIs aufrufen oder sich von Zwischenfehlern erholen müssen. Mehr Thinking kann die Ausführung mehrerer Schritte verbessern, erhöht jedoch auch den Verbrauch von Ausgabetokens und die Antwortzeit. Wenn Sie das Modell über GPTProtos OpenAI-kompatiblen Endpunkt aufrufen, prüfen Sie vor dem Senden anbieterspezifischer Felder die aktuelle Dokumentation zum zugeordneten Thinking-Parameter.
Gemini 3.5 Flash-Lite im Vergleich zu Gemini 3.5 Flash
Gemini 3.5 Flash-Lite und Gemini 3.5 Flash teilen sich ein Kontextfenster von 1.048.576 Tokens und eine maximale Ausgabe von 65.536 Tokens, sind jedoch für unterschiedliche Kostenstrukturen bei Workloads konzipiert. Flash-Lite priorisiert Durchsatz und niedrige Stückkosten; Flash ist auf komplexere Programmierung, agentische Planung und Wissensarbeit ausgerichtet.
| Vergleich |
Gemini 3.5 Flash-Lite |
Gemini 3.5 Flash |
| Am besten geeignet für |
Subagenten mit hohem Volumen, Extraktion, Übersetzung, Dokumentanalyse |
Komplexe Programmierung, agentische Planung, anspruchsvollere Wissensarbeit |
| Positionierung des Modells |
Schnellstes und kostengünstigstes Modell der 3.5-Serie |
Leistungsfähigeres Modell der Flash-Klasse |
| Eingabekontext |
1.048.576 Tokens |
1.048.576 Tokens |
| Maximale Ausgabe |
65.536 Tokens |
65.536 Tokens |
| Googles Standardpreis für Eingaben |
$0.30 pro 1 Mio. Tokens |
$1.50 pro 1 Mio. Tokens |
| Googles Standardpreis für Ausgaben |
$2.50 pro 1 Mio. Tokens |
$9.00 pro 1 Mio. Tokens |
| GPTProto-Flash-Lite-Preis |
$0.18 Eingabe / $1.50 Ausgabe pro 1 Mio. Tokens |
Siehe die Gemini-3.5-Flash-Modellseite |
Zu Googles Standardpreisen kostet Flash-Lite bei Eingaben 80 % weniger und bei Ausgaben etwa 72 % weniger als Gemini 3.5 Flash. Wählen Sie es, wenn Anfragevolumen und Antwortzeit die Kosten gelegentlicher Wiederholungen dominieren. Wählen Sie Flash, wenn eine geringere Anzahl schwierigerer Aufgaben die Qualität im ersten Durchlauf wichtiger macht als den niedrigsten Tokenpreis.
Gemini 3.5 Flash-Lite über GPTProto verwenden
GPTProto bietet Zugriff auf die Gemini-3.5-Flash-Lite-API über dasselbe Konto, denselben API-Schlüssel und dasselbe Guthaben, die für mehr als 200 Modelle verwendet werden. Dadurch wird die Fragmentierung von Konten und Abrechnungen reduziert, wenn eine Anwendung einfache Extraktionen an Flash-Lite, komplexe Schlussfolgerungen an Gemini 3.5 Flash oder Gemini 3.6 Flash und Medienaufgaben an separate Bild-, Video- oder Audiomodelle weiterleitet.
Bei einer bestehenden OpenAI-kompatiblen Anwendung können Sie die umgebende Client-Struktur beibehalten und den in der GPTProto-Dokumentation angegebenen Endpunkt, die Authentifizierungsmethode und den Modellnamen verwenden. Gehen Sie nicht davon aus, dass jedes Google-native Feld eins zu eins zugeordnet wird. Testen Sie Thinking-Steuerungen, Caching, Grounding, Dateiverarbeitung, Tool-Schemas und Streaming-Verhalten, bevor Sie Produktionsdatenverkehr umstellen.
Migrationshinweise für bestehende Gemini-Workloads
Google dokumentiert mehrere Kompatibilitätsunterschiede, die Migrationen von älteren Gemini-Modellen beeinflussen können. Benutzerdefinierte Werte für temperature, top-K und top-P werden möglicherweise ignoriert. Benutzerdefinierte Frequenz- und Präsenzstrafen können einen Fehler verursachen. Anfragen, deren letzter Gesprächsbeitrag die Rolle model hat, werden ebenfalls nicht unterstützt.
Bevor Sie einen Workflow mit hohem Volumen umstellen, spielen Sie einen repräsentativen Testsatz erneut ab und prüfen Sie die Einhaltung des JSON-Schemas, die Vollständigkeit von Tool-Aufrufen, den Tokenverbrauch, die Latenz und die Häufigkeit von Wiederholungen. Eine kosteneffiziente Bereitstellung der Gemini-3.5-Flash-Lite-API sollte anhand der Kosten pro erfolgreich erledigter Aufgabe bewertet werden, nicht nur anhand der Kosten pro Token. Dies ist besonders für mehrstufige Agenten wichtig, bei denen eine zu niedrige Thinking-Einstellung eine Tool-Sequenz zu früh beenden kann.