Zwei Modelle, zwei Philosophien
Die meisten direkten Vergleiche stellen diese beiden Modelle so dar, als wären sie dasselbe Produkt zu unterschiedlichen Preisen. Das sind sie nicht. DeepSeek hat V4 Pro am 24. April 2026 unter einer MIT-Lizenz veröffentlicht, und es ist der tiefere Spezialist — ein reines Text-Mixture-of-Experts-Modell, das stark auf agentisches Programmieren und MINT-Denken getrimmt ist. MiniMax hat M3 am 1. Juni 2026 veröffentlicht, und es ist der breitere Generalist — das erste Open-Weight-Modell, das Spitzen-Codierung, ein Millionen-Token-Kontextfenster und native Bild- und Video-Eingabe in einem System vereint.
Dieser einzige Unterschied — multimodal versus nur Text — entscheidet mehr über die Wahl als jeder Benchmark. Daher ist es besser, es klar zu sagen, bevor die Zahlen kommen: Sie wählen nicht das „bessere Modell“. Sie wählen, welche Form von Modell zur Aufgabe passt. Der Rest dieses Vergleichs dreht sich darum, diese Entscheidung anhand echter Daten statt eines Leaderboard-Screenshots zu treffen.
Seite an Seite: Spezifikationen und Preis
Hier sind die harten Fakten auf dem Papier, basierend auf den tatsächlichen Preisen pro Million Tokens von GPT Proto, statt einer Schlagzeile aus einem Launch-Post.
| |
MiniMax M3 |
DeepSeek V4 Pro |
| Veröffentlicht |
1. Juni 2026 |
24. April 2026 |
| Architektur |
MoE, 428B gesamt / 23B aktiv |
MoE, 1,6T gesamt / 49B aktiv |
| Aufmerksamkeitsdesign |
MiniMax Sparse Attention (MSA) |
DeepSeek Sparse Attention (DSA) |
| Kontextfenster |
1M Tokens |
1M Tokens (384K max. Ausgabe) |
| Eingabemodalitäten |
Text, Bild, Video |
nur Text |
| Ausgabe |
Text |
Text |
| Lizenz / Gewichte |
Open Weights (Hugging Face) |
MIT, Open Weights (Hugging Face) |
| GPT Proto Eingabepreis |
$0,48 / 1M Tokens |
$1,3914 / 1M Tokens |
| GPT Proto Ausgabepreis |
$0,96 / 1M Tokens |
$2,7838 / 1M Tokens |
Zwei Dinge in dieser Tabelle sind wichtiger als der Rest. M3 nimmt Bild- und Videoeingaben entgegen; DeepSeek nicht. Und DeepSeek aktiviert etwa doppelt so viele Parameter pro Token (49B vs 23B) aus einem Pool, der fast viermal so groß ist — es ist das schwerere, dichtere Modell, das mehr Rechenleistung pro Token aufwendet, was sich in seinen Deep-Reasoning-Werten und bei den meisten Hosts auch im Preis zeigt.
Codierungs- und Agentenleistung
Hier geht der Vergleich meist schief, also lesen Sie die Zahlen genau.
DeepSeek V4 Pro erreicht in seinem maximalen Reasoning-Modus 80,6% auf SWE-bench Verified — der höchste Wert aller Open-Weight-Modelle, gleichauf mit Gemini 3.1 Pro. Es erzielt außerdem 93,5 auf LiveCodeBench und eine Codeforces-Wertung von 3206. Das sind algorithmische und wettbewerbsorientierte Programmierstärken, und DeepSeeks Werte wurden für unabhängige Wiederholungen aufgegriffen, was für das Vertrauen wichtig ist.
Die offiziellen Codierungswerte von MiniMax M3 sind 59,0% auf SWE-Bench Pro, 66,0% auf Terminal-Bench 2.1, 34,8% auf SWE-fficiency, 28,8% auf KernelBench Hard und 74,2% auf MCP Atlas. Im unabhängigen Intelligence Index von Artificial Analysis — einem modellübergreifenden Score, keinem Hersteller-Benchmark — erreicht M3 einen Wert von 44, den zweiten Platz in der von ihm verfolgten Vergleichsgruppe, gegenüber einem Median von etwa 25 in der Kategorie.
Nun die Falle. Sie werden Dutzende Seiten sehen, die M3s „59%“ neben DeepSeeks „80,6%“ stellen und DeepSeek zum überlegenen Codierungs-Sieger erklären. Dieser Vergleich ist ungültig. SWE-bench Pro und SWE-bench Verified sind zwei verschiedene Benchmarks mit unterschiedlichen Problemstellungen und Schwierigkeitsgraden — Pro ist die schwierigere, neuere Variante. Einen Pro-Score mit einem Verified-Score zu vergleichen, sagt nichts darüber aus, welches Modell besser ist; es ist ein Einheitenfehler, der als Schlussfolgerung verkleidet ist. Die beiden Labore haben einfach unterschiedliche Benchmarks veröffentlicht, und keines hat einen sauberen direkten Vergleich auf demselben Benchmark veröffentlicht. Meine Einschätzung: Bei unabhängig gemessener allgemeiner Intelligenz liegen sie nahe beieinander; bei veröffentlichten Deep-Reasoning- und Wettbewerbs-Codierungswerten sind DeepSeek's höher und besser verifiziert; bei jeder Aufgabe, die Sehen erfordert, beginnt der Vergleich gar nicht, weil M3 das einzige ist, das dazu in der Lage ist.
Die eine Fähigkeit, die kein Unentschieden ist
DeepSeek V4 Pro ist reiner Text. MiniMax M3 wurde von Anfang an multimodal aufgebaut und akzeptiert Bilder und Videos neben Text am selben Endpunkt. Das ist keine Fußnote im Datenblatt — es ist ein kategorialer Unterschied.
Wenn Sie einen Agenten bauen, der anhand eines Screenshots debuggt, ein Figma-Mockup in eine Komponente umwandelt, ein Diagramm liest oder eine Bildschirmaufnahme einer Reproduktion ansieht, um den Fehler zu finden, kann M3 das und DeepSeek nicht. Es gibt kein Prompt, keinen Preis und kein Fine-Tuning, das einem reinen Textmodell Augen verleiht. Für jede Arbeitsumgebung, in der das Modell Teil dessen ist, was der Benutzer sieht und mit dem er interagiert — UI-Arbeit, visuelle Qualitätssicherung, Dokumentenanalyse mit Diagrammen — ist die Entscheidung getroffen, bevor Sie sich überhaupt einen Benchmark ansehen. Umgekehrt: Wenn in Ihrer Pipeline nie ein Bild vorkommt, bezahlen Sie für eine Fähigkeit, die Sie nie nutzen werden, und DeepSeeks Textspezialisierung ist der gezieltere Kauf.
Kosten, ehrlich
Auf GPT Proto, wenn beide Modelle von einem Guthaben aus betrieben werden, ist MiniMax M3 das günstigere der beiden — $0,48 Eingabe und $0,96 Ausgabe pro Million Tokens, gegenüber $1,3914 und $2,7838 für DeepSeek V4 Pro. Zu GPT Protos Preisen kostet M3 etwa ein Drittel von V4 Pro pro Token in beide Richtungen.
Aber ich würde Sie in die Irre führen, wenn ich dort aufhören würde, denn „was ist günstiger“ hängt stark davon ab, wo Sie jedes Modell ausführen. DeepSeek's eigene native Wirtschaftlichkeit für V4 Pro ist aggressiv, und zwar in einer Weise, die nicht immer überlebt, wenn es anderswo gehostet wird: In der hauseigenen API von DeepSeek liegt das Modell bei etwa $0,435 Eingabe und $0,87 Ausgabe pro Million Tokens, und — der Teil, der die Rechnungen wirklich bewegt — ein Cache-Treffer kostet etwa $0,003625 pro Million, weit über hundertmal günstiger als ein Cache-Fehlschlag. Agentische Codierungsschleifen senden bei jeder Runde denselben System-Prompt und Dateikontext erneut, sodass der Großteil ihrer Eingabe im Cache landet. Wenn Sie große Mengen reinen Textes verarbeiten und bereit sind, DeepSeek nativ zu betreiben, ist diese Cache-Preisgestaltung wirklich schwer zu schlagen, und es ist das stärkste einzelne Argument für V4 Pro.
Die ehrliche Betrachtung der Kosten hat also zwei Ebenen. Bei einem aggregierten Schlüssel über GPT Proto ist M3 der niedrigere Posten pro Token. Für rohen, hochvolumigen Textdurchsatz, bei dem Sie sich um die native Cache-Rate von DeepSeek optimieren, ziehen die V4 Pro-Ökonomien voraus. Und darunter: Der Preis pro Token ist nicht der Preis pro Aufgabe. Ein Modell, das weniger pro Token kostet, aber drei Versuche braucht, um einen funktionierenden Patch zu liefern, ist nicht die günstige Option — es hat die Kosten nur in Ihre Debugging-Zeit verlagert. Vergleichen Sie die beiden mit Ihren eigenen Aufgaben, bevor Sie eine Preistabelle entscheiden lassen.
Kontext und Effizienz
Beide Modelle haben ein 1M-Token-Kontextfenster, und beide haben dies erreicht, indem sie die standardmäßige dichte Aufmerksamkeit durch ein spärliches Design ersetzt haben — aber auf unterschiedlichen Wegen, und der Unterschied ist real, nicht kosmetisch.
DeepSeek's DSA setzt auf starke Kompression: Bei 1M Token benötigt V4 Pro nur etwa 27% der Rechenleistung für die Inferenz eines einzelnen Tokens und 10% des KV-Cache seines eigenen Vorgängers V3.2. MiniMax's MSA führt stattdessen eine blockweise Auswahl auf unkomprimierten Key-Values durch, was MiniMax als Vorteil ansieht, um die Präzisionskosten zu vermeiden, die kompressionsbasierte Verfahren bei langen Distanzen zahlen; bei 1M Kontext reduziert es die Rechenleistung pro Token auf etwa 1/20 des vorherigen M2-Modells, mit einer Vorbefüllung, die mehr als 9× schneller ist, und einer Dekodierung, die mehr als 15× schneller ist. Dies ist ein Punkt, an dem ich die Behauptungen auf beiden Seiten als herstellergetrieben bezeichnen würde — jedes Labor beschreibt seinen eigenen Ansatz als den ohne Kompromisse. Was Sie mitnehmen können, ist, dass beide speziell für Langkontext-Arbeit entwickelt wurden und beide pro Token bei großer Länge günstig genug sind, dass eine vollständige Repository- oder Langdokument-Arbeitslast praktisch und nicht nur eine Vision ist.
Was die Community tatsächlich prüft
Wenn Sie nach Reaktionen auf diese beiden Modelle suchen — die Suche nach „MiniMax M3 vs DeepSeek V4 Pro reddit“, die viele Leute durchführen, bevor sie sich festlegen — tauchen zwei Themen häufiger auf als jedes Benchmark-Argument, und beide sind ernst zu nehmen.
Das erste ist die Verifizierung. Die Startwerte von M3 wurden auf der eigenen Infrastruktur von MiniMax mit dem eigenen Agenten-Gerüst ausgeführt, was für einen Start normal ist, aber genau das, was Entwickler abwerten, bis unabhängige Zahlen vorliegen. Diese Zahlen haben begonnen: Open Weights von M3 wurden am 7. Juni auf Hugging Face veröffentlicht, und der unabhängige Index von Artificial Analysis bestätigt jetzt, dass es sich um ein wirklich erstklassiges Modell handelt und nicht um ein Artefakt des Benchmark-Tages. DeepSeek hatte hier den Vorteil — seine Werte wurden früh von unabhängigen Prüfern wiederholt, und seine MIT-lizenzierten Gewichte waren von Anfang an für jeden verfügbar, um sie zu überprüfen. Wenn unabhängig verifizierte Leistung eine harte Anforderung ist, hat DeepSeek immer noch die längere Erfolgsbilanz, obwohl M3 den meisten Abstand inzwischen aufgeholt hat.
Das zweite ist der Punkt, dass „günstigster pro Token“ und „günstigster, um die Aufgabe zu erledigen“ unterschiedliche Zahlen sind. Ein Modell, das plausiblen Code schreibt und einen fehlschlagenden Test übersieht, ist nicht kostengünstig; es ist ein Modell, das seine Kosten nachgelagert in Ihre Überprüfung verschoben hat. Aus diesem Grund gelangt der Praktikerkonsens immer wieder zu demselben Rat: Wählen Sie nach Fähigkeitspassung und Zuverlässigkeit für Ihre eigene Arbeitslast, und lassen Sie den Token-Preis bei Gleichstand entscheiden, anstatt die Entscheidung zu treffen.
Beide mit demselben Schlüssel ausführen
Der praktische Vorteil der Nutzung beider über GPT Proto ist, dass der Modellwechsel eine einzeilige Änderung ist — derselbe Schlüssel, dieselbe OpenAI-kompatible Anfrageform, andere Modellzeichenfolge. Hier ist eine Chat-Vervollständigung gegen M3, mit einem auskommentierten Wechsel zu V4 Pro:
from openai import OpenAI
client = OpenAI(
api_key="sk-your-key-here", # ein Schlüssel erreicht beide Modelle
base_url="https://gptproto.com/v1", # OpenAI-kompatibles Gateway
)
def ask(model, prompt):
resp = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": prompt}],
)
return resp.choices[0].message.content
# Nur Text-Reasoning — jedes Modell kann das.
print(ask("deepseek-v4-pro", "Refactor this function for readability:\n<paste code>"))
# Bildeingabe — nur M3 kann das; DeepSeek ist nur Text.
def ask_with_image(image_url, prompt):
resp = client.chat.completions.create(
model="MiniMax-M3",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": prompt},
{"type": "image_url", "image_url": {"url": image_url}},
],
}],
)
return resp.choices[0].message.content
print(ask_with_image(
"https://example.com/ui-bug-screenshot.png",
"This screen renders wrong on mobile. What's the likely CSS cause?",
))
Derselbe erste Aufruf in cURL:
curl https://gptproto.com/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer sk-your-key-here" \
-d '{
"model": "deepseek-v4-pro",
"messages": [
{"role": "user", "content": "Refactor this function for readability."}
]
}'
Um eine Textaufgabe von einem Modell auf das andere zu verschieben, ändern Sie eine Zeichenfolge — MiniMax-M3 oder deepseek-v4-pro — und derselbe Schlüssel erreicht beide plus über 200 andere Modelle auf einem Guthaben. Wenn Sie noch keinen Schlüssel haben, erstellen Sie einen über das GPT Proto-Dashboard und überprüfen Sie die Preisseite für den genauen aktuellen Satz für jedes Modell, bevor Sie einen Batch ausführen.
Welches sollten Sie verwenden?
Wenn Ihre Arbeitslast aus Text, Code, Logs und strukturierter Ausgabe besteht — Backend-Agenten, Extraktion großer Mengen, wettbewerbsorientierte algorithmische Probleme — verwenden Sie DeepSeek V4 Pro. Es hat die höheren verifizierten Deep-Reasoning-Werte, die tiefere unabhängige Erfolgsbilanz und eine native Wirtschaftlichkeit, die hochvolumigen Text durch seine Cache-Preise belohnt.
Wenn irgendetwas in Ihrer Pipeline ein Bild oder ein Video ist — UI-Debugging, Design-to-Code, visuelle Qualitätssicherung, diagrammreiche Dokumente — verwenden Sie MiniMax M3, weil es das einzige der beiden ist, das sehen kann, und auf GPT Proto ist es auch die günstigere Option pro Token.
Und wenn Sie etwas Reales bauen, ist die Antwort oft beides: Leiten Sie Text- und reine Reasoning-Aufgaben an V4 Pro, geben Sie die visuellen Aufgaben an M3 und betreiben Sie sie mit einem Schlüssel, damit keine zweite Integration gewartet werden muss. „MiniMax M3 oder DeepSeek V4 Pro“ ist für die meisten Teams der falsche Rahmen — sie sind Spezialisten für verschiedene Dinge, und die stärkste Konfiguration verwendet jedes dort, wo es gewinnt.