DeepSeek V4 Pro 0813 vs. Kimi K3 im Überblick
| Kategorie |
DeepSeek V4 Pro 0813 |
Kimi K3 |
Bessere Wahl |
| Aktueller unabhängiger Intelligence Index |
53 |
60 |
Kimi K3 |
| Ausgabegeschwindigkeit |
83.2 Token/s |
40.8 Token/s |
DeepSeek V4 Pro |
| Zeit bis zum ersten Token |
1.63 Sekunden |
2.97 Sekunden |
DeepSeek V4 Pro |
| Kontextfenster |
Etwa 1 Mio. Token |
Etwa 1 Mio. Token |
Unentschieden |
| GPT Proto-Eingabepreis |
$1.044 pro 1 Mio. Token |
$2.70 pro 1 Mio. Token |
DeepSeek V4 Pro |
| GPT Proto-Ausgabepreis |
$2.088 pro 1 Mio. Token |
$13.50 pro 1 Mio. Token |
DeepSeek V4 Pro |
| Auf GPT Proto verfügbare Eingaben |
Text |
Text, Bild, Dokument |
Kimi K3 |
| Reasoning-Steuerung |
Non-Thinking, Hoch, Max |
Immer aktives Reasoning mit Steuerung des Aufwands |
Aufgabenabhängig |
| Open-Weight-Lizenz |
MIT |
Kimi-K3-Lizenz |
DeepSeek für einfacheres kommerzielles Self-Hosting |
| Am besten geeignet für |
Textbasiertes Codieren und Agents mit hohem Volumen |
Anspruchsvolle multimodale und visuelle Agent-Aufgaben |
Aufgabenabhängig |
Die oben genannten Benchmark-, Geschwindigkeits- und Latenzdaten stammen aus der aktuellen direkten Vergleichsevaluierung von Artificial Analysis. Der Intelligence Index verwendet für beide Modelle denselben Bewertungsrahmen und ist daher aussagekräftiger, als die Einführungscharts zweier Anbieter nebeneinanderzustellen.
Was hat sich bei DeepSeek V4 Pro 0813 geändert?
DeepSeek V4 Pro 0813 ist die aktuelle Produktionsversion von V4 Pro und kein separates API-Produkt. Laut der Dokumentation von DeepSeek verweist der Alias deepseek-v4-pro jetzt auf DeepSeek-V4-Pro-0813; die Aufrufmethode bleibt unverändert. Dieselbe Dokumentation nennt ein Kontextfenster von einer Million Token, bis zu 384K Ausgabe, Thinking- und Non-Thinking-Modi, JSON-Ausgabe und Tool-Calling.
Diese Namensentscheidung ist wichtig, da datierte Modellnamen Entwickler oft dazu zwingen, Konfigurationsdateien, Routing-Regeln und Evaluierungsaufzeichnungen zu ändern. Hier erfolgt das Upgrade hinter dem stabilen Alias. Auf GPT Proto gilt dasselbe Prinzip: Verwenden Sie in Ihrer Anfrage weiterhin deepseek-v4-pro.
Auch das aktuelle unabhängige Ergebnis unterscheidet sich von den Zahlen vieler Vergleichsartikel aus dem Juli. Artificial Analysis gibt dem Modell 0813 inzwischen einen Intelligence-Index-Wert von 53 beim maximalen Reasoning-Aufwand. Kimi K3 erreicht in der aktuellen Evaluierung 60.
Ich würde das nicht als klare Verbesserung um neun Punkte gegenüber dem älteren Wert von 44 bezeichnen. Das Modell hat sich verändert, aber auch Benchmark-Suites und Evaluierungsversionen können sich ändern. Die belastbare Schlussfolgerung ist enger gefasst: Vergleiche auf Basis der Vorschau beschreiben nicht mehr das heute bereitgestellte Modell, und aktuelle unabhängige Tests ordnen 0813 näher bei Kimi K3 ein, als die Berichterstattung aus der Vorschauzeit vermuten ließ.
DeepSeek hat die grundlegende Produktform des Modells nicht verändert. Es bleibt ein Mixture-of-Experts-Modell mit 1,6 Billionen Parametern, von denen pro Token 49 Milliarden aktiv sind, mit Texteingabe, einem großen Ausgabelimit und wählbarem Reasoning-Aufwand. Die Veröffentlichung 0813 ist daher am besten als Produktions- und Post-Training-Upgrade und nicht als neuer multimodaler Zweig zu verstehen.
Benchmarks: Kimi K3 führt weiterhin, aber nicht überall
Kimi K3 führt im breiten unabhängigen Vergleich mit 60 zu 53. Dieser Unterschied von sieben Punkten ist relevant, wenn ein Workflow Reasoning, Wissen, Coding und langfristige Planung kombiniert. Er bedeutet jedoch nicht, dass Kimi bei jedem Repository oder jedem Prompt ein besseres Ergebnis liefert.
Die beiden Modelle setzen unterschiedliche Prioritäten. Moonshot beschreibt Kimi K3 als natives multimodales Agent-Modell mit 2,8 Billionen Parametern, das für langfristiges Coding und Wissensarbeit entwickelt wurde. Die offizielle Model Card dokumentiert für das vorgelagerte Modell das Verständnis von Text, Bildern und Videos sowie ein Kontextfenster von einer Million Token. Die aktuelle Kimi-K3-Route von GPT Proto führt Text-, Bild- und Dokumenteingaben auf.
DeepSeek V4 Pro 0813 ist zwar textbasiert, erzeugt in den Tests von Artificial Analysis jedoch 83,2 Token pro Sekunde. Kimi K3 erreicht 40,8 Token pro Sekunde. DeepSeek beginnt außerdem früher mit der Antwort: 1,63 Sekunden bis zum ersten Token gegenüber 2,97 Sekunden bei Kimi.
Einfach ausgedrückt: Kimi hat den höheren Wert bei der Gesamtfähigkeit. DeepSeek liefert Text ungefähr doppelt so schnell und ist dabei deutlich günstiger.
Hier gibt es noch eine weitere Benchmark-Falle. Coding-Werte von Anbietern verwenden häufig unterschiedliche Agent-Setups, Reasoning-Einstellungen, Repository-Snapshots oder Bestehenskriterien. Ein mit Kimi Code erzielter Kimi-Wert kann nicht automatisch mit einem DeepSeek-Wert verglichen werden, der aus einem anderen Evaluierungs-Setup stammt. Verwenden Sie für die Modellauswahl unabhängige, abgestimmte Evaluierungen als gemeinsame Grundlage und testen Sie anschließend die Aufgabe, die Ihr Produkt tatsächlich beeinflusst.
Dieser Artikel behauptet nicht, einen privaten Coding-Test mit identischem Prompt durchgeführt zu haben. Ohne einen solchen Test wäre die Aussage, eines der beiden Modelle sei der universelle Coding-Sieger, stärker, als es die Belege erlauben.
Welches Modell eignet sich besser für Coding- und Agent-Workflows?
Für textbasiertes Coding mit hohem Volumen würde ich mit DeepSeek V4 Pro 0813 beginnen.
Der Grund ist nicht, dass es Kimi bei jedem Maß schlägt. Das tut es nicht. Der Grund ist, dass produktive Coding-Agents wiederholt Kontext verarbeiten und Reasoning, Patches, Testpläne und Tool-Anweisungen erzeugen. Die Ausgabekosten summieren sich über jede Schleife. Mit den wählbaren Reasoning-Modi von DeepSeek können Entwickler außerdem maximalen Aufwand für schwierige Aufgaben reservieren, anstatt dieses Verhalten bei jeder Anfrage zu bezahlen.
Damit ist DeepSeek eine starke Standardwahl für:
Lesen von Repositories und Q&A zu Codebasen
Pull-Request-Reviews
Fehlerlokalisierung
Refactoring-Pläne
Testgenerierung
Textbasiertes Tool-Calling
Agents für Hintergrundaufgaben mit hohem Volumen
Strukturierte JSON-Antworten
Kimi K3 wird attraktiver, wenn die Kosten eines Fehlversuchs höher sind als die Tokenrechnung. Sein höherer unabhängiger Intelligenzwert macht es zu einem sinnvollen Eskalationsmodell für lange, schwierige Aufgaben, die DeepSeek nicht abschließen kann. Außerdem ist Kimi die klare Wahl, wenn die Anfrage visuelle Informationen enthält.
Ein praktisches Produktionsmuster lautet daher nicht „für immer eines auswählen“. Leiten Sie routinemäßige Textaufgaben an DeepSeek weiter und wiederholen Sie ausgewählte fehlgeschlagene oder multimodale Aufgaben mit Kimi. Da beide über einen einzigen GPT Proto-API-Key und ein gemeinsames Guthaben verfügbar sind, muss nur das Feld model geändert werden.
DeepSeek V4 Pro vs. Kimi K3 beim Frontend-Coding
„Frontend-Coding“ umfasst zwei unterschiedliche Workloads, die nicht zu einem einzigen Urteil zusammengefasst werden sollten.
Der erste ist Text-zu-Code: React-Komponenten, CSS, Seitenstrukturen, Barrierefreiheitskorrekturen oder TypeScript-Logik aus einer schriftlichen Spezifikation zu erzeugen. Es gibt noch nicht genügend abgestimmte öffentliche Belege, um zu behaupten, dass Kimi K3 oder DeepSeek V4 Pro 0813 diese Kategorie allgemein gewinnt. Die niedrigeren Kosten und die höhere Ausgabegeschwindigkeit machen DeepSeek zum wirtschaftlicheren ersten Versuch.
Der zweite ist die visuelle Frontend-Iteration: dem Modell einen Screenshot zu zeigen, es Abstands- oder Layoutprobleme identifizieren zu lassen und die Benutzeroberfläche anhand des visuellen Feedbacks zu überarbeiten. Kimi K3 eignet sich für diesen Workflow besser, da es Bildeingaben akzeptiert. DeepSeek V4 Pro ist textbasiert, daher müsste ein Entwickler den Screenshot zunächst in Text umwandeln oder ein separates Vision-Modell verwenden.
Verwenden Sie DeepSeek für die skalierte Implementierung von UIs anhand von Textbeschreibungen. Verwenden Sie Kimi, wenn das Modell die Benutzeroberfläche sehen muss.
API-Preise: DeepSeek gewinnt deutlicher, als die Schlagzeile vermuten lässt
GPT Proto berechnet derzeit für DeepSeek V4 Pro $1.044 pro Million Eingabetoken und $2.088 pro Million Ausgabetoken. Kimi K3 kostet $2.70 für Eingaben und $13.50 für Ausgaben.
| GPT Proto-Preis pro 1 Mio. Token |
DeepSeek V4 Pro |
Kimi K3 |
Kimi-Preisvielfaches |
| Eingabe |
$1.044 |
$2.70 |
2,59× |
| Ausgabe |
$2.088 |
$13.50 |
6,47× |
DeepSeek ist bei Eingaben 61,3 % und bei Ausgaben 84,5 % günstiger. Der Unterschied bei den Ausgaben ist für Reasoning-intensive Agents besonders wichtig, da deren interne Arbeit und endgültige Antworten lang werden können.
Tokenpreise sind weiterhin abstrakt. Betrachten wir daher zwei hypothetische Workloads.
| Workload |
Tokenannahme |
DeepSeek V4 Pro |
Kimi K3 |
| Umfangreiches Code-Review |
100K Eingabe + 20K Ausgabe |
$0.146 |
$0.540 |
| Agent-Aufgabe auf Repository-Ebene |
1 Mio. Eingabe + 250K Ausgabe |
$1.566 |
$6.075 |
Im Beispiel auf Repository-Ebene kostet Kimi etwa 3,88-mal so viel. Das macht Kimi nicht grundsätzlich zu einer schlechten Wahl. Wenn es eine schwierige Aufgabe in einem Versuch erledigt, während ein günstigeres Modell wiederholte Wiederholungen und menschliche Nacharbeit benötigt, kann der teurere Aufruf insgesamt dennoch günstiger sein.
Die richtige Produktionskennzahl sind die Kosten pro akzeptiertem Ergebnis, nicht allein die Tokenkosten. Erfassen Sie für jede Aufgabenkategorie das Modell, die Token, die Versuche, die Latenz, das Testergebnis und die Abnahme durch den Reviewer. Ein niedriger Preis pro Token wird erst dann zu einer echten Einsparung, wenn die Ausgabe erfolgreich ist.
Geschwindigkeit und Latenz
Artificial Analysis misst DeepSeek V4 Pro 0813 derzeit mit 83,2 Ausgabetoken pro Sekunde und Kimi K3 mit 40,8. Die Zeit bis zum ersten Token beträgt bei DeepSeek 1,63 Sekunden und bei Kimi 2,97 Sekunden.
Diese Werte sprechen für DeepSeek bei interaktiven Coding-Assistenten und parallel arbeitenden Agent-Workern. Ein Modell, das Token doppelt so schnell liefert, kann die wahrnehmbare Wartezeit verkürzen, selbst wenn beide Modelle letztlich eine akzeptable Antwort erreichen.
Die Geschwindigkeit eines Anbieters ist jedoch keine dauerhafte Eigenschaft der Modellgewichte. Sie hängt auch von der Serverauslastung, Quantisierung, Bündelung, Promptlänge, dem Reasoning-Aufwand und dem Bereitstellungsort der Anfrage ab. Betrachten Sie die aktuellen Messungen als vergleichbare Momentaufnahme und nicht als Latenzgarantie für jeden Aufruf.
Unterschiede bei Kontext, Reasoning und Bereitstellung
Beide Modelle unterstützen ungefähr eine Million Token Kontext, daher entscheidet die Kontextgröße allein diesen Vergleich nicht. Wichtiger ist, wie sie diesen Kontext nutzen.
DeepSeek unterstützt Non-Thinking- und Thinking-Modi mit Steuerung des Reasoning-Aufwands für schwierigere Aufgaben. Laut der aktuellen DeepSeek-API-Spezifikation sind außerdem bis zu 384K Ausgabetoken möglich. Diese Flexibilität eignet sich für Routing-Systeme, die schnelle Antworten für einfache Aufgaben und tieferes Reasoning nur bei Bedarf einsetzen.
Kimi K3 verwendet dauerhaft aktives Reasoning mit konfigurierbarem Aufwand. Seine größere 2,8-T-Architektur und das multimodale Design zielen auf langfristige Aufgaben mit Dokumenten, Code, Bildern und Tool-Nutzung. Der Nachteil sind höhere Ausgabekosten und eine geringere gemessene Generierungsgeschwindigkeit.
Beide Modelle verfügen über herunterladbare Gewichte, aber „Open Weight“ bedeutet nicht identische Lizenzbedingungen. DeepSeek V4 Pro verwendet die MIT-Lizenz. Kimi K3 verwendet seine eigene Kimi-K3-Lizenz. Teams, die kommerzielles Self-Hosting planen, sollten die genauen Kimi-Bedingungen prüfen, statt von einer Übereinstimmung mit MIT auszugehen.
Auch die Hardwareanforderungen liegen weit über denen eines gewöhnlichen lokalen Arbeitsplatzrechners. Für die meisten Entwicklungsteams ist die Evaluierung über eine gehostete API der realistische Ausgangspunkt, selbst wenn die Gewichte verfügbar sind.
So greifen Sie mit einem API-Key auf DeepSeek V4 Pro 0813 und Kimi K3 zu
GPT Proto stellt beide Modelle über einen OpenAI-kompatiblen Chat-Completions-Endpunkt bereit. Starten Sie mit DeepSeek, indem Sie MODEL_ID auf deepseek-v4-pro setzen:
export GPTPROTO_API_KEY="your_api_key"
export MODEL_ID="deepseek-v4-pro"
curl --request POST "https://gptproto.com/v1/chat/completions" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data "{
\"model\": \"$MODEL_ID\",
\"messages\": [
{
\"role\": \"user\",
\"content\": \"Review this function for correctness and return the answer as concise Markdown.\"
}
]
}"
Um dieselbe Textanfrage an Kimi K3 zu senden, ändern Sie eine Zeile:
export MODEL_ID="kimi-k3"
Führen Sie anschließend dieselbe curl-Anfrage erneut aus. Sie benötigen kein separates Moonshot-Konto, kein zweites Guthaben und kein DeepSeek-Versionssuffix.
Halten Sie für einen kontrollierten Vergleich Prompt, Kontext, Reasoning-Einstellung und Ausgabelimit identisch. Protokollieren Sie die zurückgegebenen Nutzungsfelder zusammen mit Latenz, Versuchen und der Frage, ob das Ergebnis Ihre Tests bestanden hat. Der Vergleich jeweils einer überzeugenden Antwort beider Modelle reicht für eine Produktionsentscheidung zum Routing nicht aus.
Welches Modell sollten Sie wählen?
Wählen Sie DeepSeek V4 Pro 0813, wenn:
Ihr Workload hauptsächlich aus Text und Code besteht
Das Ausgabevolumen die Tokenkosten wichtig macht
Geringe Latenz die Benutzererfahrung verbessert
Sie Non-Thinking und tieferes Reasoning unter einer Modell-ID wünschen
Sie eine Self-Hosting-Möglichkeit mit MIT-Lizenz benötigen
Sie ein Standardmodell für Agents mit hohem Volumen auswählen
Wählen Sie Kimi K3, wenn:
Das Modell Screenshots, Bilder oder Dokumente prüfen muss
Der derzeit höchste unabhängige Intelligenzwert wichtiger ist als der Preis
Eine fehlgeschlagene Aufgabe mehr kostet als ein Premium-API-Aufruf
Sie langfristige multimodale Agents entwickeln
Sie die schwierigsten Anfragen eskalieren möchten, nachdem ein günstigeres Modell scheitert
Für die meisten Entwickler ist DeepSeek zuerst und Kimi bei Bedarf die beste Routing-Strategie. So nutzen Sie den größten Teil von DeepSeeks Kosten- und Geschwindigkeitsvorteil, ohne den Zugang zu Kimis Multimodalität und höherem Fähigkeitspotenzial aufzugeben.
Fazit
DeepSeek V4 Pro 0813 ist für die meisten textbasierten Coding- und Agent-Workloads die bessere Standardwahl. Im aktuellen Artificial Analysis Intelligence Index liegt es sieben Punkte hinter Kimi K3, erzeugt Ausgaben jedoch ungefähr doppelt so schnell und kostet auf GPT Proto deutlich weniger – insbesondere bei ausgabelastigen Agent-Schleifen.
Kimi K3 ist der bessere Spezialist. Wählen Sie es, wenn die Aufgabe visuelle Eingaben umfasst, das anspruchsvollste mögliche Reasoning wichtiger ist als die Rechnung oder DeepSeek bereits gescheitert ist und ein weiterer Versuch günstiger wäre als manuelle Wiederherstellung.
Das 0813-Update macht Kimi nicht überflüssig. Es schärft die Routing-Entscheidung: DeepSeek für Volumen, Geschwindigkeit und Text; Kimi für Multimodalität und das höhere gemessene Fähigkeitspotenzial.