Computernutzung und Tool-Unterstützung
Google führt Function Calling und Computernutzung als Tools des Modells auf. Gemini 3.6 Flash erreichte 83,0 % in Googles Evaluation OSWorld-Verified, doch die Computernutzung bleibt eine Vorschaufunktion.
curl --request POST "https://gptproto.com/v1/chat/completions" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"model": "gemini-3.6-flash",
"messages": [
{
"role": "user",
"content": "Hello"
}
]
}'Chat, Coding-Agenten und Dokumentenarbeit. Preise pro 1 Mio. Tokens – Eingabe, gecachte Eingabe und Ausgabe werden separat abgerechnet. GPTProto liegt 40% unter den offiziellen Preisen.
| Szenario | Google Liste | OpenRouter | GPTProto | Du sparst / Monat |
|---|---|---|---|---|
| Persönlich10 Mio. Tokens / Monat (4.8 Mio. im Cache) | $20.52 | $21.65 | $12.31 | −$8.21≈ $98.50 / Jahr |
| Team100 Mio. Tokens / Monat (48 Mio. im Cache) | $205.20 | $216.49 | $123.12 | −$82.08≈ $984.96 / Jahr |
| Business500 Mio. Tokens / Monat (240 Mio. im Cache) | $1026.00 | $1082.43 | $615.60 | −$410.40≈ $4924.80 / Jahr |
Nutzen Sie Googles allgemein verfügbares Flash-Modell mit 1 Mio. Tokens Kontext, 64K Output-Tokens, vier Thinking-Stufen und nativen Tools auf GPTProto zu einem Preis, der 40 % unter Googles Standardpreisen pro Token liegt.
Computernutzung und Tool-Unterstützung
Google führt Function Calling und Computernutzung als Tools des Modells auf. Gemini 3.6 Flash erreichte 83,0 % in Googles Evaluation OSWorld-Verified, doch die Computernutzung bleibt eine Vorschaufunktion.
Multimodaler Kontext mit 1 Mio. Tokens
Verarbeiten Sie Texte, Bilder, Videos, Audiodateien und PDF-Eingaben innerhalb eines Fensters mit 1.048.576 Tokens und geben Sie bis zu 65.536 Text-Tokens zurück. Bei Videos unterstützen Modelle mit 1-Mio.-Token-Kontext eine Stunde bei standardmäßiger Medienauflösung oder drei Stunden bei niedriger Auflösung.
Effizienteres agentisches Programmieren
Gemini 3.6 Flash erzielte in von Google berichteten Evaluationen 49 % bei DeepSWE und 58,7 % bei SWE-Bench Pro. Bei Workloads von Artificial Analysis nimmt es 17 % weniger Output-Tokens als Gemini 3.5 Flash in Anspruch und führt weniger unerwünschte Codeänderungen durch.
Vier Thinking-Stufen
Legen Sie thinking_level auf minimal, low, medium oder high fest, um Latenz, Token-Verbrauch und Tiefe der Schlussfolgerungen auszubalancieren. Medium ist die Standardeinstellung. Verwenden Sie niedrigere Stufen für routinemäßige Extraktionen und höhere Stufen für mehrstufiges Programmieren oder Analysieren.
Die Gemini 3.6 Flash API bietet Entwicklern programmgesteuerten Zugriff auf Googles allgemein verfügbares Flash-Modell für Coding-Agenten, multimodale Analysen, Wissensarbeit mit langen Kontexten und toolgesteuerte Automatisierung. Google hat das stabile gemini-3.6-flash-Modell am 21. Juli 2026 veröffentlicht. Anders als das frühere gemini-3-flash-preview ist dies eine stabile Modell-ID für den fortlaufenden Einsatz in Anwendungen.
Gemini 3.6 Flash akzeptiert Text, Bilder, Videos, Audio- und PDF-Dateien, gibt jedoch nur Text zurück. Sein Eingabefenster mit 1.048.576 Token kann große Repositories, umfangreiche Dokumentsammlungen oder längere Medieneingaben aufnehmen, während das Ausgabelimit von 65.536 Token detaillierte Berichte, Code und strukturierte Antworten unterstützt. Google führt Caching, strukturierte Ausgaben, Function Calling, Codeausführung, Dateisuche, URL-Kontext, Search Grounding, Maps Grounding und konfigurierbares Denken als Funktionen des zugrunde liegenden Modells auf.
Die Grenzen der Fähigkeiten sind wichtig. Gemini 3.6 Flash generiert weder Bilder noch Audio und unterstützt die Live API nicht. Computer Use ist als Vorschaufunktion und nicht als vollständig stabile Funktion verfügbar. Wenn eine Integration von einem nativen Google-Tool abhängt, vergewissern Sie sich vor der Migration, dass die GPTProto-Kompatibilitätsschicht dieses Tool bereitstellt. Wenn Ihr Produkt Sprach-zu-Sprach-Interaktion, native Bildgenerierung oder strikte Stabilität für Desktop-Automatisierung erfordert, leiten Sie diesen Teil der Arbeitslast an ein anderes Modell weiter.
| Spezifikation | Gemini 3.6 Flash |
|---|---|
| Anbieter | |
| Status | Allgemein verfügbar |
| Stabile Modell-ID | gemini-3.6-flash |
| Eingabetypen | Text, Bild, Video, Audio, PDF |
| Ausgabetyp | Text |
| Eingabe-Token-Limit | 1,048,576 |
| Ausgabe-Token-Limit | 65,536 |
| Denkstufen | minimal, low, medium, high |
| Standard-Denkstufe | medium |
| Von Google aufgeführte Tools | Function Calling, Codeausführung, Dateisuche, Search, Maps, URL-Kontext |
| Computer Use | In der Vorschau unterstützt |
| Nicht unterstützt | Bildgenerierung, Audiogenerierung, Live API |
Gemini 3.6 Flash ist besonders nützlich, wenn eine Aufgabe sowohl einen großen Arbeitskontext als auch wiederholte Tool-Aufrufe erfordert. Es ist nicht automatisch die günstigste Wahl für jede kurze Eingabe, und seine standardmäßige mittlere Denkstufe kann bei einfacher Klassifizierung mehr Token verbrauchen als ein Modell ohne Schlussfolgerungen. Stimmen Sie Denkstufe und Modellroute auf die tatsächliche Aufgabe ab.
| Arbeitslast | Warum es passt | Implementierungshinweis |
|---|---|---|
| Coding-Agenten für Repositories | Weniger unerwünschte Änderungen und Ausführungsschleifen als bei Gemini 3.5 Flash in Googles Tests | Verwenden Sie medium oder high als Denkstufe und validieren Sie Änderungen mit Tests |
| Multimodale Dokumentenanalyse | Liest PDFs, Bilder, Diagramme, Audio und Video in derselben Anfrage | Fordern Sie strukturierte Ausgaben an, wenn nachgelagerte Systeme stabile Felder benötigen |
| Recherche mit langem Kontext | 1 Mio. Eingabe-Token und unterstütztes Kontext-Caching | Cachen Sie wiederkehrende Korpora, anstatt unveränderte Dateien erneut zu senden |
| Browser- oder Desktop-Automatisierung | Native Computer-Use-Tools und 83,0 % OSWorld-Verified in Googles Evaluierung | Behandeln Sie Computer Use als Vorschau und behalten Sie Genehmigungsschranken für folgenschwere Aktionen bei |
| Grounded Assistants | Das zugrunde liegende Modell unterstützt Search, Maps, Dateisuche und URL-Kontext | Aktivieren Sie nur die Tools, die jede Anfrage benötigt, und verfolgen Sie den daraus resultierenden Token-Verbrauch |
Gemini 3.6 Flash ist ein direktes Effizienz-Upgrade gegenüber Gemini 3.5 Flash und kein Ersatz mit größerem Kontext. Beide Modelle behalten dieselbe Kontextklasse von 1 Mio. Token und die standardmäßige mittlere Denkstufe bei. Der Unterschied liegt in der Aufgabeneffizienz: Google berichtet über 17 % weniger Ausgabetoken bei Workloads von Artificial Analysis, weniger Denkrunden und Tool-Aufrufe sowie bessere Ergebnisse bei Coding, Machine-Learning-Engineering, Computer Use und Retrieval mit langem Kontext.
Der offizielle Eingabepreis bleibt bei 1,50 $ pro 1 Mio. Token, während der offizielle Ausgabepreis von 9,00 $ auf 7,50 $ sinkt. Bei GPTProto kostet Gemini 3.6 Flash 0,90 $ pro 1 Mio. Eingabetoken und 4,50 $ pro 1 Mio. Ausgabetoken; Gemini 3.5 Flash kostet derzeit 0,90 $ bzw. 5,40 $. Für neue agentische oder multimodale Systeme ist 3.6 Flash die bessere Standardwahl. Behalten Sie 3.5 Flash nur dann bei, wenn Sie sein Verhalten bereits validiert haben und Zeit für Regressionstests der Migration benötigen.
| Metrik | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|
| Kontextfenster | 1,048,576 | 1,048,576 |
| Maximale Ausgabe | 65,536 | 65,536 |
| Standardmäßiges Denken | Medium | Medium |
| Googles Standard-Eingabe / -Ausgabe pro 1 Mio. | $1.50 / $7.50 | $1.50 / $9.00 |
| GPTProto-Eingabe / -Ausgabe pro 1 Mio. | $0.90 / $4.50 | $0.90 / $5.40 |
| DeepSWE v1.1 | 49.0% | 37.0% |
| MLE-Bench | 63.9% | 49.7% |
| OSWorld-Verified | 83.0% | 78.4% |
| GDM-MRCR v2 bei 1 Mio. | 54.0% | 26.6% |
Die oben genannten Benchmarkwerte wurden vom Anbieter angegeben. Nutzen Sie sie zur Auswahl geeigneter Kandidaten und führen Sie anschließend beide Modelle mit Ihren eigenen Eingaben, Tools und Erfolgskriterien aus, bevor Sie Produktionsdatenverkehr umleiten.
Betrachten Sie die Migration zu 3.6 Flash nicht nur als Ersetzung des Modellnamens, wenn Ihre Anwendung Googles native Interactions API verwendet. Google hat mehrere Generierungs- und Konversationsfelder für die neuesten Modelle geändert:
gemini-3.6-flash.temperature, top_p und top_k aus der Generierungskonfiguration.thinking_budget durch thinking_level; unterstützte Werte sind minimal, low, medium und high.candidate_count, das von Gemini 3.x nicht unterstützt wird.previous_interaction_id.Wenn Sie das OpenAI-kompatible Anfrageformat von GPTProto verwenden, befolgen Sie den Quick Start und die GPTProto-Dokumentation auf dieser Seite, anstatt Google-native Felder direkt zu kopieren. Der praktische Vorteil besteht darin, dass ein einziger GPTProto-API-Schlüssel und ein Guthaben auch Aufrufe an Gemini 3.5 Flash, GPT-5.6 Luna, Claude Opus 4.8, Kimi K3 und 200+ weitere Modelle, ermöglichen, sodass Sie denselben Evaluierungssatz ausführen können, ohne separate Anbieterkonten zu eröffnen.