Die Gemini 3.7 Flash API ermöglicht Entwicklern den programmatischen Zugriff auf Googles neuestes allgemein verfügbares Flash-Modell. Es wurde am 13. August 2026 veröffentlicht und ist für Softwareentwicklung, Webentwicklung, die Arbeit mit multimodalen Dokumenten und mehrstufige Agenten konzipiert, die eine bessere Befolgung von Anweisungen und eine zuverlässigere Nutzung von Tools benötigen als die vorherige Flash-Version.
Gemini 3.7 Flash akzeptiert Text-, Bild-, Video-, Audio- und PDF-Eingaben, gibt jedoch ausschließlich Text zurück. Daher eignet es sich zum Verstehen eines Produktscreenshots, zur Überprüfung eines aufgezeichneten Workflows, zum Extrahieren von Belegen aus Berichten oder zum Schlussfolgern über ein Repository hinweg. Es ist kein natives Modell zur Bild-, Video- oder Audiogenerierung.
Auf GPTProto können Entwickler auf das Modell zugreifen, ohne für jeden Anbieter ein separates Guthaben verwalten zu müssen. Mit demselben Schlüssel lassen sich Anfragen an mehr als 200 unterstützte Modelle weiterleiten. Dadurch wird es einfacher, Gemini mit Alternativen zu vergleichen oder einen Fallback hinzuzufügen, ohne ein weiteres Anbieter-Konto zu eröffnen. Das Live-Preisfenster ist die maßgebliche Quelle für die aktuellen Preise der Gemini 3.7 Flash API und den angezeigten Rabatt von 40 %.
| Spezifikation |
Gemini 3.7 Flash |
| Anbieter |
Google |
| Veröffentlichungsstatus |
Allgemein verfügbar (GA) |
| Veröffentlichungsdatum |
13. August 2026 |
| Offizielle Modell-ID |
gemini-3.7-flash |
| Eingabemodalitäten |
Text, Bild, Video, Audio und PDF |
| Ausgabemodalität |
Text |
| Eingabe-Token-Limit |
1,048,576 Token |
| Maximale Ausgabe |
65,536 Token |
| Denkstufen |
low, medium (Standard), high |
| Unterstützte Upstream-Funktionen |
Caching, Function Calling, strukturierte Ausgaben, Codeausführung, Dateisuche, URL-Kontext, Suche und Maps Grounding, Computer Use (Vorschau) |
| Nicht upstream unterstützt |
minimales Denken, native Bildgenerierung, Audiogenerierung und Live API |
| Upstream-Nutzungsoptionen |
Standard, Batch, Flex und Priority |
Anwendungen der Gemini 3.7 Flash API
Die Gemini 3.7 Flash API eignet sich am besten für Workloads, die mehrere Schritte kombinieren, statt eine einzelne kurze Antwort anzufordern. Beim Programmieren kann sie den Repository-Kontext untersuchen, ein Problem dateiübergreifend verfolgen, einen minimalen Patch vorschlagen und die Änderung erklären. Für Frontend-Arbeiten kann ein Screenshot oder eine Designreferenz in die Anfrage aufgenommen werden, damit das Modell das gewünschte Layout mit der Implementierung vergleichen kann.
Bei Agenten-Workflows kann das Modell entscheiden, wann eine Funktion aufgerufen werden soll, Tool-Ergebnisse interpretieren und eine Antwort zurückgeben, die einem JSON-Schema folgt. Zu den praktischen Einsatzmöglichkeiten gehören die Triage von Support-Tickets, die Extraktion von Dokumenten in Datenbanken, Compliance-Prüfungen, interne Recherche und Workflow-Automatisierung. Entwickler können das Reasoning für zeitkritische Klassifizierungen reduzieren oder für schwierige Debugging- und Planungsaufgaben erhöhen.
Die multimodale Eingabe ist auch für Wissensarbeit nützlich. Ein einzelner Workflow kann PDFs, Diagramme, Screenshots, aufgezeichnete Besprechungen und schriftliche Anweisungen kombinieren. Da die Ausgabe weiterhin Text ist, sollte ein dediziertes Generierungsmodell verwendet werden, wenn das Endergebnis eine Bild-, Video- oder Audiodatei sein muss.
Gemini 3.7 Flash vs. Gemini 3.6 Flash
Gemini 3.7 Flash behält dasselbe Eingabe-Limit von 1,048,576 Token, dasselbe Ausgabe-Limit von 65,536 Token und die umfassenden Eingabemodalitäten von Gemini 3.6 Flash bei. Der Grund für ein Upgrade ist kein größeres Kontextfenster. Entscheidend sind die Verbesserungen bei Programmierung, Webentwicklung, Dokumentverständnis, Befolgung von Anweisungen und Agentenausführung.
Googles Launch-Evaluierungen berichten die folgenden Änderungen. Dabei handelt es sich um vom Anbieter gemeldete Benchmark-Ergebnisse, nicht um unabhängige GPTProto-Tests.
| Evaluierung |
Gemini 3.7 Flash |
Gemini 3.6 Flash |
Gemeldete Änderung |
| FrontierCode 1.1 Main |
43.6% |
34.4% |
+9.2 Punkte |
| DeepSWE v1.1 |
65.3% |
49.0% |
+16.3 Punkte |
| WebDev Arena |
1588 Elo |
1538 Elo |
+50 Elo |
| GDP.pdf |
34.0% |
22.0% |
+12.0 Punkte |
| AutomationBench |
30.4% |
17.0% |
+13.4 Punkte |
Es gibt einen Kompatibilitätskompromiss: Gemini 3.6 Flash akzeptiert die Denkstufen minimal, low, medium und high, während 3.7 nur low, medium und high unterstützt. Wenn ein bestehender Workflow für einfache Anfragen mit hohem Volumen auf nahezu null Reasoning angewiesen ist, sollte 3.6 in einem A/B-Test beibehalten oder vor der Migration des gesamten Datenverkehrs mit einem Flash-Lite-Modell verglichen werden.
Migrationsdetails, die vor dem Wechsel geprüft werden sollten
Die Änderung des Modellnamens ist nur der erste Schritt. Verwenden Sie die folgende Checkliste, bevor Sie Gemini 3.6 Flash, Gemini 3.5 Flash, Gemini 3 Flash Preview oder Gemini 3.1 Pro in einer bestehenden Anwendung ersetzen:
Verwenden Sie die exakte Modellzeichenfolge aus der GPTProto-Dokumentation. Googles offizielle stabile ID lautet gemini-3.7-flash; bestätigen Sie vor der Veröffentlichung oder Bereitstellung, dass die GPTProto-Route dieselbe Zeichenfolge verwendet.
Senden Sie nicht thinking_level: "minimal". Google dokumentiert medium als Standard und gibt einen Validierungsfehler zurück, wenn minimal ausgewählt wird.
Entfernen Sie bei Migrationen der nativen Gemini Interactions API die veralteten Einstellungen temperature, top_p, top_k und candidate_count, ersetzen Sie thinking_budget durch thinking_level und entfernen Sie vorausgefüllte Modell-Turns.
Halten Sie die Erwartungen an multimodale Funktionen präzise: Bilder, Audio, Video und PDFs sind Eingabeformate, während die Antwort aus Text besteht.
Gehen Sie nicht davon aus, dass jedes Google-Tool aus dem Upstream automatisch über eine OpenAI-kompatible Route verfügbar ist. Prüfen Sie die aktuelle GPTProto-API-Dokumentation auf unterstützte Parameter, Tools, Dateiverarbeitung und Antwortfelder.
Führen Sie einen Canary-Test mit Ihren eigenen Programmieraufgaben, Schemata, Tool-Aufrufen, Latenzzielen und Token-Budgets durch, bevor Sie alle Anfragen umstellen.
Diese Migrationsanleitung ist ein wesentlicher Unterschied zwischen einer einfachen Modellübersicht und einer nutzbaren Zugriffsseite für die Gemini 3.7 Flash API: Sie zeigt Entwicklern, welche bestehenden Anfragen fehlschlagen können, selbst wenn die neue Modell-ID korrekt ist.
Wann sollten Sie Gemini 3.7 Flash wählen?
Wählen Sie Gemini 3.7 Flash, wenn ein Workload ein großes Kontextfenster, mehrere Eingabeformate, bessere Programmierung im ersten Durchlauf oder eine mehrstufige Tool-Orchestrierung zu einem niedrigeren Tokenpreis als größere Spitzenmodelle benötigt. Behalten Sie Gemini 3.6 Flash bei, wenn minimales Reasoning wichtig ist oder eine bestehende Anwendung ihre Regressionstests noch nicht bestanden hat.
Bei Grok 4.6 vs. Gemini 3.7 Flash fällt die Entscheidung spezifischer aus. Gemini akzeptiert Audio-, Video- und PDF-Eingaben und bietet mehr als doppelt so viel Kontext wie Grok. Grok 4.6 ergänzt eine xhigh-Reasoning-Option, und SpaceXAI dokumentiert kein festes Limit für die Textausgabe. Kein Modell ist universell besser. Daher sollten repräsentative Aufgaben vor der Auswahl eines Standardmodells über beide Modelle geleitet werden.
| Entscheidungsfaktor |
Gemini 3.7 Flash |
Gemini 3.6 Flash |
Grok 4.6 |
| Am besten geeignet für |
Programmierung, Designtreue, multimodale Dokumente, mehrstufige Agenten |
Bestehende Flash-Workflows und Datenverkehr mit minimalem Reasoning |
Programmierung und Agenten, die xhigh Reasoning oder eine sehr lange Textausgabe benötigen |
| Kontextfenster |
1,048,576 Token |
1,048,576 Token |
500,000 Token |
| Native Eingaben |
Text, Bild, Video, Audio, PDF |
Text, Bild, Video, Audio, PDF |
Text, Bild |
| Textausgabe-Limit |
65,536 Token |
65,536 Token |
Kein festes Limit von SpaceXAI dokumentiert |
| Reasoning-Steuerung |
Niedrig, mittel, hoch |
Minimal, niedrig, mittel, hoch |
Niedrig, mittel, hoch, xhigh |
| Offizieller Tokenpreis für kurzen Kontext* |
$0.75 Eingabe / $3.75 Ausgabe bis zum 31. Dez. 2026 |
$0.75 Eingabe / $3.75 Ausgabe bis zum 31. Dez. 2026 |
$2 Eingabe / $6 Ausgabe bei weniger als 200.000 Eingabe-Token |
*Die offiziellen Anbieterpreise werden nur zum Vergleich bei der Modellauswahl angezeigt. Verwenden Sie das Live-Preisfenster von GPTProto für den über GPTProto abgerechneten Tarif.