Native Vision und 1M Kontext
Verarbeite Texte, Screenshots, Diagramme, gescannte Seiten und lange Dokumente in einer Anfrage – mit nativem Bildverständnis und einem Kontextfenster von bis zu einer Million Tokens.
curl --request POST "https://gptproto.com/v1/chat/completions" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"model": "deepseek-flash",
"messages": [
{
"role": "user",
"content": "Hello"
}
]
}'Chat, Coding-Agenten und Dokumentenarbeit. Preise pro 1 Mio. Tokens – Eingabe, gecachte Eingabe und Ausgabe werden separat abgerechnet.
| Szenario | DeepSeek Liste | OpenRouter | GPTProto | Du sparst / Monat |
|---|---|---|---|---|
| Persönlich10 Mio. Tokens / Monat (4.8 Mio. im Cache) | $3.39 | $3.58 | $3.39 | −$0.00≈ $0.00 / Jahr |
| Team100 Mio. Tokens / Monat (48 Mio. im Cache) | $33.89 | $35.75 | $33.89 | −$0.00≈ $0.00 / Jahr |
| Business500 Mio. Tokens / Monat (240 Mio. im Cache) | $169.44 | $178.76 | $169.44 | −$0.00≈ $0.00 / Jahr |
Entwickle mit dem aktuellen Flash-Modell von DeepSeek für Coding auf Repository-Ebene, die Analyse langer Dokumente, strukturierte Ausgaben, Tool-Aufrufe und natives Bildverständnis. Das Modell unterstützt bis zu 1 Mio. Tokens Kontext, bis zu 384K Tokens Ausgabe sowie den Thinking- und den Non-Thinking-Modus. Für die Extraktion von Bildern und visuelle Prompt-Anleitungen nutze die DeepSeek Flash Image-to-Text API.
Native Vision und 1M Kontext
Verarbeite Texte, Screenshots, Diagramme, gescannte Seiten und lange Dokumente in einer Anfrage – mit nativem Bildverständnis und einem Kontextfenster von bis zu einer Million Tokens.
Effiziente CED-Architektur
Das MoE-Modell mit 552 Milliarden Parametern aktiviert beim Prefill 8 Milliarden und bei der Generierung 16 Milliarden Parameter. Dadurch sinken der Rechenaufwand und der Bedarf an KV-Cache bei Workloads mit umfangreicher Eingabe.
Anpassbarer Reasoning-Aufwand
Nutze den Thinking-Modus für schwierige Coding- und Agent-Aufgaben oder den Non-Thinking-Modus für Routinearbeiten. Passe anschließend den Reasoning-Aufwand an Qualität, Latenz und Tokenverbrauch an.
Agent-Workflows mit Tool-Unterstützung
Kombiniere Tool-Aufrufe, JSON-Ausgabe, Streaming und einen langen Konversationsverlauf für Agents, die Repositories untersuchen, visuelle Belege analysieren, Funktionen aufrufen und über mehrere Schritte hinweg arbeiten.
Die DeepSeek Flash API verwendet exakt den Modell-String deepseek-flash, um auf DeepSeek V4.1 Flash zuzugreifen. Das am 10. September 2026 veröffentlichte multimodale Mixture-of-Experts-Modell nimmt Text und Bilder entgegen und generiert Text. Es ersetzt die eingestellten experimentellen Modelle V4 Flash und V4 Flash Vision, die zuvor über ihre Legacy-Aliase verfügbar waren.
Seine 40-schichtige Causal-Encoder-Decoder-Architektur umfasst 20 Encoder- und 20 Decoder-Schichten. Das Backbone mit 552B Parametern aktiviert beim Prefill 8B und beim Decode 16B Parameter pro Token. DeepSeek gibt einen globalen KV-Cache von 890 Byte pro Token an – etwa ein Viertel des Werts von V4 Flash – sowie einen persistenten Speicherbedarf von etwa einem Achtel der bisherigen Größe. Das Design ist auf agentenintensive Eingaben und Workflows mit langen Dokumenten ausgelegt.
GPTProto bietet das Modell zum Standardpreis an und beansprucht daher keinen Rabatt. Der Vorteil liegt im gebündelten Zugriff: Mit einem Schlüssel und Guthaben kannst du es neben über 200 Alternativen testen und Fallbacks konfigurieren, ohne separate Anbieter-Konten einzurichten.
| Spezifikation | DeepSeek Flash auf GPTProto |
|---|---|
| GPTProto-Modell-String | deepseek-flash |
| Aktuelle Modellversion | DeepSeek V4.1 Flash |
| Anbieter | DeepSeek |
| Veröffentlichungsdatum | 10. September 2026 |
| Modelltyp | Multimodales Mixture-of-Experts-Modell |
| Ein- und Ausgabe | Text und Bilder zu Text |
| Kontextfenster | Bis zu 1M Tokens |
| Maximale Ausgabe | Bis zu 384K Tokens |
| Backbone-Parameter | 552B |
| Aktive Parameter | 8B beim Prefill; 16B beim Decode |
| Architektur | 40-schichtiger Causal Encoder-Decoder |
| API-Funktionen | Denk- und Nicht-Denk-Modi, Tool-Aufrufe, JSON-Ausgabe, Streaming, Responses API und Anthropic-kompatible API |
| Open-Weight-Status | Modellgewichte unter der MIT-Lizenz veröffentlicht |
| Preisgestaltung | GPTProto-Standardpreis für das Modell; kein Rabattversprechen |
deepseek-flash ist der API-Modell-String; DeepSeek V4.1 Flash ist die Version, die aktuell über diese Route bereitgestellt wird. Es handelt sich nicht um separate Stufen. Daher beantwortet diese Seite auch Suchanfragen nach „deepseek-v4.1-flash API“, ohne diesen Ausdruck als zweite Request-ID darzustellen.
| Name | Rolle | Empfohlene Verwendung |
|---|---|---|
deepseek-flash |
Aktueller API-Modell-String | Nach Bestätigung des Dashboard-Werts in GPTProto-Anfragen verwenden |
| DeepSeek V4.1 Flash | Aktuelle zugrunde liegende Modellversion | In Seitentexten, Evaluierungsberichten und Versionshinweisen verwenden |
deepseek-v4-flash |
Kompatibilitätsalias für eingestelltes Modell | Neue Integrationen auf deepseek-flash umstellen |
deepseek-v4-flash-vision-exp |
Alias für eingestelltes Vision-Experiment | Visuelle Workflows auf deepseek-flash umstellen |
Leite aus dem Veröffentlichungsnamen keinen versionierten API-String ab. Behalte deepseek-flash in der Konfiguration bei und protokolliere die aufgelöste Version in den Evaluierungsprotokollen.
V4.1 führt den allgemeinen Flash-Zugriff und den experimentellen Vision-Zugriff in einer multimodalen Route zusammen. Das asymmetrische CED-Design verwendet für Eingaben weniger aktive Parameter als für Ausgaben, während CSA2-Attention und komprimiertes KV-Caching den Speicherbedarf langer Prompts verringern. DeepSeek hat außerdem das agentenorientierte Post-Training erweitert.
Teste vor der Migration einer bestehenden V4-Flash-Anwendung das Parsen von Antworten, Tool-Argumente, Reasoning-Felder, Latenz und Tokenverbrauch. Kompatibilitätsaliase verweisen nicht mehr auf die eingestellten Modelle, für die sie ursprünglich vorgesehen waren.
Programmierung auf Repository-Ebene: Führe relevante Quelldateien, Spezifikationen, Protokolle und Testergebnisse für dateiübergreifende Analysen, Migrationsplanung, Debugging, Patch-Entwürfe und Reviews zusammen.
Analyse langer Dokumente: Prüfe Spezifikationen, Verträge, Berichte, Transkripte oder Supportverläufe mit mehr Quellenmaterial im Kontext. Formuliere den Prompt gezielt und begrenze die Ausgabe.
Mehrstufige Agenten: Nutze Tool-Aufrufe, strukturierte Ausgaben und Streaming, um Daten zu prüfen, Funktionen aufzurufen, Ergebnisse auszuwerten und einen Plan anzupassen. Deine Anwendung führt die Tools weiterhin selbst aus und setzt Berechtigungen durch.
Bildgestützte Workflows: Verknüpfe Screenshots, Diagramme, Grafiken oder gescannte Seiten mit schriftlichem Kontext. Für OCR-ähnliche Texterkennung, visuelle Fragen und Antworten sowie aufgabenspezifische Bildbeschränkungen findest du weitere Informationen in der DeepSeek Flash Image-to-Text API.
DeepSeek führt derzeit deepseek-flash und deepseek-v4-pro als separate aktive APIs. Das Unternehmen hat eine geplante Ausmusterung von V4 Pro rückgängig gemacht und bietet den Dienst auch nach dem 14. September 2026 weiter an. Vergleiche beide Modelle mit deinen tatsächlichen Prompts, Tools, Limits und Abnahmetests.
| Entscheidungsfaktor | DeepSeek Flash (V4.1 Flash) | DeepSeek V4 Pro |
|---|---|---|
| API-Modell-String | deepseek-flash |
deepseek-v4-pro |
| Aktuelle Version | DeepSeek V4.1 Flash | DeepSeek V4-Pro-0813 |
| Native Bildeingabe | Unterstützt | Nicht unterstützt |
| Kontextfenster | 1M Tokens | 1M Tokens |
| Maximale Ausgabe | 384K Tokens | 384K Tokens |
| Backbone-Parameter | 552B | 1.6T |
| Aktive Parameter | 8B Prefill / 16B Decode | 49B |
| Terminal-Bench 2.1 | 90.6 | 87.9 |
| DeepSWE v1.1 | 74.2 | 62.7 |
| Aktueller Anbieterstatus | Aktiv | Nach dem 14. September 2026 aktiv; künftige Änderungen müssen angekündigt werden |
| Praktischer Ausgangspunkt | Neue multimodale, Coding-, Langkontext- und Agenten-Deployments | Regressionskontinuität für bestehende V4-Pro-Workloads und reine Textvergleichstests |
Dies sind von DeepSeek gemeldete Ergebnisse bei maximaler Reasoning-Intensität, keine unabhängigen GPTProto-Tests. Flash lag bei diesen agentischen Evaluierungen vorn, während V4 Pro bei einigen Wissens- und Reasoning-Tests in derselben Modellkarte besser abschnitt. Kein einzelner Wert belegt eine allgemeine Überlegenheit.
Der Denkmodus ist in der nativen API von DeepSeek's standardmäßig aktiviert. Dort haben temperature, presence_penalty und frequency_penalty keine Wirkung; top_p beträgt im Denkmodus mindestens 0.95 und ist ansonsten fest auf 1.0 eingestellt. Prüfe die in GPTProto verfügbaren Steuerungsmöglichkeiten, bevor du Code veröffentlichst.
Bei Anfragen im Denkmodus mit Tools verlangt DeepSeek, dass nachfolgende Anfragen zuvor reasoning_content enthalten; andernfalls gibt die native API einen 400-Fehler zurück. Überprüfe die Verarbeitung durch GPTProto, validiere Tool-Argumente, beschränke Berechtigungen und setze Limits für Schritte, Tokens und Zeitüberschreitungen.
Wähle DeepSeek Flash für native visuelle Eingaben, Kontext auf Repository-Ebene, lange Ausgaben, Coding-orientiertes Reasoning oder wiederholte Tool-Nutzung. Geeignete Workloads umfassen Screenshot-gestütztes Debugging, die Analyse technischer Dokumente, die Migration von Codebasen und zustandsbehaftete Agenten.
Vergleiche für kurze Klassifizierungs-, Routing- oder Umformulierungsaufgaben ein kleineres Modell. Führe bei schwierigen Aufgaben dieselbe Evaluierung mit einer anderen Option aus dem GPTProto-Modellverzeichnis durch und vergleiche Qualität, Latenz, Tokenverbrauch und Fehlerbehebung.
Anleitungen, Vergleiche und Updates zu diesem Modell.
Alle Artikel
Vergleiche MiniMax M3 und Tencent Hunyuan 4 hinsichtlich Programmierung, Frontend-Aufgaben, KI-Agenten, Preisen, Kontext und Self-Hosting. Erfahre, welches Modell zu deinem Projekt passt.

DeepSeek V4.1 Flash erklärt: Erfahre mehr über den Beta-Status, die gemeldete Geschwindigkeit von 300–500 Tok/s, die Preise, native multimodale Funktionen und Modellvergleiche.

Vergleiche GPT-6 Astra und Claude Fable 5.1 hinsichtlich Programmierung, Frontend-Entwicklung, KI-Agenten, Benchmarks, API-Preisen, Cache-Kosten und Kosten pro erfolgreich erledigter Aufgabe.

Vergleiche Qwen3.8-Max-0902 und Claude Fable 5.1 hinsichtlich Programmierung, Frontend-Entwicklung, KI-Agenten, API-Preisen, Kontext und Kosteneffizienz.