Ist MiniMax M3 gut zum Programmieren geeignet? Die kurze Antwort lautet: ja, für agentenbasierte Aufgaben und Arbeiten über mehrere Dateien hinweg – mit zwei Einschränkungen, die ich offen nennen möchte, bevor Sie weiterlesen. Die meisten der prominenten Coding-Ergebnisse wurden von MiniMax auf der eigenen Infrastruktur ermittelt, und der „Kontext von 1 Million Tokens“ hat ab 512K eine Preisklippe, die insbesondere Coding-Agenten trifft. Beides lässt sich handhaben, sobald man davon weiß. In den meisten Berichten zum Launch wird keines von beiden klar herausgestellt.
Ich schreibe diesen Artikel, weil der Coding-Pitch rund um M3 auf eine einzige Zahl reduziert wurde – 59 % bei SWE-Bench Pro – und diese Zahl für viele unbelegte Schlussfolgerungen herhalten muss. Im Folgenden erfahren Sie, was das Modell tatsächlich ist, wo unabhängige Messungen liegen, was es bei einer realen Coding-Arbeitslast kostet und wie Sie es über die GPTProto-API aufrufen. Wenn Sie nur ein Fazit möchten: Ein unabhängiger Tester, der dieselbe Testbatterie bei jedem ernstzunehmenden Modell durchführt, stufte M3 als „beim echten Programmieren nahe an GPT und Opus, aber noch nicht an ihnen vorbei“ ein. Das entspricht auch der Position der neutralen Benchmarks.
Was MiniMax M3 aus Sicht des Programmierens ist
M3 wurde am 1. Juni 2026 veröffentlicht. Es handelt sich um ein Mixture-of-Experts-Modell – Community-Tracker, die den veröffentlichten Checkpoint analysiert haben, kommen auf ungefähr 428 Milliarden Parameter insgesamt und etwa 23 Milliarden aktive Parameter pro Token. MiniMax selbst hat jedoch keine vollständige Aufschlüsselung der Parameter veröffentlicht; betrachten Sie die genauen Zahlen daher als zweitrangig. Das Modell ist nativ multimodal (Eingaben: Text, Bilder und Videos; Ausgabe: Text) und verfügt über einen Denkmodus, den Sie pro Anfrage aktivieren können.
Doch zunächst zur Motivation: Warum sollte sich ein Coding-Modell überhaupt für die Kontextlänge interessieren? Weil echte Entwicklungsarbeit nicht aus einer einzelnen Datei besteht. Sie umfasst ein Repository, einen Stacktrace, die Testausgabe und die drei Dateien, die Sie zur Behebung des Problems ändern müssten – alles lange genug an einem Ort, um Zusammenhänge zwischen ihnen zu erkennen. M3 beantwortet diese Anforderung mit einem Kontextfenster von 1 Million Tokens und einer garantiert nutzbaren Untergrenze von 512K Tokens. Die darunterliegende Technik ist MiniMax Sparse Attention (MSA), bei der Blöcke des Key-Value-Caches ausgewählt werden, statt jedes Token-Paar zu berücksichtigen. MiniMax berichtet, dass bei 1 Million Tokens dadurch der Rechenaufwand pro Token gegenüber der vorherigen Generation ungefähr auf ein Zwanzigstel sinkt, bei etwa 9-fach schnellerem Prefill und 15-fach schnellerem Decoding. Das sind Herstellerangaben zur Architektur und keine unabhängigen Messungen, aber die Richtung entspricht dem, was Sparse Attention leisten soll.
Es gibt außerdem eine hauseigene Coding-Oberfläche – MiniMax Code, den eigenen auf dem Modell basierenden Agenten. Es ist nützlich zu wissen, dass sie existiert; darum geht es in diesem Beitrag jedoch nicht, denn Sie möchten das Modell aus Ihrem eigenen Code heraus aufrufen.
Ein Satz zum Merken: M3 ist für ausdauernde, mehrstufige Arbeit über einen großen Kontext hinweg ausgelegt, nicht für einmalige Code-Snippets. Diese Perspektive erklärt fast jeden der folgenden Kompromisse.
Die Coding-Benchmarks: Was MiniMax berichtet im Vergleich zu unabhängigen Messungen
Hier liegt der Unterschied, den die meisten Artikel zusammenfassen. Links stehen die von MiniMax selbst berichteten Coding- und agentenbasierten Ergebnisse. Rechts sehen Sie, was eine neutrale dritte Partei gemessen hat.
| Quelle |
Metrik |
Ergebnis |
| MiniMax (vom Hersteller auf eigener Infrastruktur ausgeführt, Claude-Code-Gerüst) |
SWE-Bench Pro |
59,0 % |
| MiniMax |
SWE-Bench Verified |
80,5 % |
| MiniMax |
Terminal-Bench 2.1 |
66,0 % |
| MiniMax |
SWE-fficiency |
34,8 % |
| MiniMax |
KernelBench Hard |
28,8 % |
| MiniMax |
MCP Atlas (Tool-Orchestrierung) |
74,2 % |
| Artificial Analysis (unabhängig) |
Intelligence Index (kombiniert) |
55 – Nr. 1 in seiner Open-Weight-Klasse |
Zwei Dinge werden Sie der Herstellertabelle nicht entnehmen. Erstens ist die Tatsache, dass diese Tests vom Hersteller durchgeführt wurden, hier wichtiger als sonst: Der SWE-Bench-Pro-Wert wurde auf dem eigenen Setup von MiniMax mit Claude Code als Harness ermittelt, und die unabhängige Replikation holt noch auf. Betrachten Sie 59 % als starkes Signal für die Leistungsklasse, in der M3 konkurriert, nicht als endgültiges Ergebnis. Zweitens – und das ist das Detail, das ich in keinem einzigen Coding-fokussierten Artikel gesehen habe – verbesserten sich bei der Aufschlüsselung von M3 im Vergleich zum Vorgänger durch Artificial Analysis die meisten Evaluationen (Humanity's Last Exam 28→37, GPQA Diamond 87→93, Reasoning mit langem Kontext 69→74), doch SciCode, die Coding-Evaluation in diesem Datensatz, sank leicht von 47 auf 45. Das ist ein kleiner Rückgang, den ich nicht überinterpretieren würde. Aber es ist der eine Datenpunkt, der die klare Geschichte vom „deutlich besseren Programmieren“ komplizierter macht – und es ist bezeichnend, dass er überall unerwähnt blieb.
Meine Einschätzung: M3 ist bei angewandter Softwareentwicklung tatsächlich nahe an der Spitzenklasse – beim Schreiben von Patches, bei Änderungen über mehrere Dateien hinweg und bei Terminal-Aufgaben – und die Unterstützung durch den unabhängigen Index (55, Spitzenreiter seiner Klasse) ist real und kein Marketing. Es stellt jedoch nicht auf jeder Coding-Achse einen grundlegenden Sprung gegenüber der letzten Generation dar, und die Lücke beim abstrakten Schlussfolgern ist real (mehr dazu weiter unten). Fazit: Vertrauen Sie auf die Leistungsklasse, überprüfen Sie aber die genaue Zahl anhand Ihrer eigenen Aufgaben.
Was es bei einer Coding-Arbeitslast tatsächlich kostet
Zuerst der Listenpreis, denn der faire Vergleich ist nicht der, den Sie in den meisten Beiträgen sehen werden. Über die GPT Proto-Modellseite kostet M3 im Standardtarif 0,48 $ pro Million Eingabetokens und 0,96 $ pro Million Ausgabetokens.
Zum Vergleich: Der effektive Eigenpreis von MiniMax – nach dem dauerhaften Rabatt von 50 % auf den Listenpreis – beträgt etwa 0,30 $ für Eingaben und 1,20 $ für Ausgaben. Seien Sie beim Vergleich also präzise, statt pauschal von „günstiger“ zu sprechen: Über GPT Proto sind Eingaben teurer als beim direkten Aufruf von MiniMax, Ausgaben hingegen günstiger. Welche Variante gewinnt, hängt vollständig vom Verhältnis zwischen gelesenen und geschriebenen Tokens Ihrer Arbeitslast ab. Ein Coding-Agent, der ein großes Repository einliest und einen kleinen Diff ausgibt, ist eingabelastig, sodass der Eingabepreis dominiert; ein ausgab lastiger Job verschiebt das Verhältnis in die andere Richtung. Der Grund, M3 über einen Aggregator zu routen, ist kein plakattauglicher Rabatt, sondern der operative Vorteil: ein Schlüssel und eine OpenAI-kompatible Oberfläche für M3 zusammen mit dem restlichen Katalog, statt ein separates MiniMax-Konto, einen regionalen Endpunkt und einen Abonnementschlüssel einzurichten.
Nun zum Teil, der Coding-Rechnungen tatsächlich bestimmt, und zum Grund, warum „1M Kontext“ mit einem Sternchen versehen werden sollte. Die Preise bleiben nur bis zu 512K Eingabetokens unverändert. Überschreiten Sie diese Grenze, wird die gesamte Anfrage – Eingaben, Ausgaben und Cache-Lesevorgänge – mit dem 2-fachen Preis berechnet. Es handelt sich um eine Sprungfunktion, nicht um einen gleitenden Anstieg. Betrachten wir einen normalen Agenten-Loop: Sie beginnen mit 400K Eingabetokens und 100K Ausgabetokens und liegen damit bequem unter der Grenze. Agenten-Loops werden jedoch länger. Nach zehn oder fünfzehn Durchläufen wurde nichts gekürzt, und ein Durchlauf überschreitet unbemerkt 512K – ab diesem Punkt wird für den gesamten Durchlauf alles doppelt berechnet, nicht nur die Tokens oberhalb des Schwellenwerts. Eine Erhöhung der Eingabemenge um 20 % kann die Kosten eines Aufrufs mehr als verdoppeln.
Der Hebel in die andere Richtung ist Caching: Wiederholte Eingaben (Ihr System-Prompt und die stabilen Teile der Codebasis) werden beim erneuten Lesen zu einem Bruchteil des Standardpreises berechnet. In Agenten-Loops ist ein großer Teil der Eingaben cachebar, daher lohnt es sich, dies frühzeitig einzurichten. Fazit: Bei M3 wird Ihre Coding-Rechnung davon bestimmt, wie viel Kontext Sie mitschleppen und wie gut Sie ihn cachen – nicht von der Zahl pro Token auf der Preiskarte. Planen Sie die Arbeitslast, nicht den Listenpreis.
M3 über die GPT Proto-API aufrufen
Der Endpunkt ist die OpenAI-kompatible Chat-Oberfläche. Die Authentifizierung erfolgt über einen rohen API-Schlüssel im Authorization-Header – ohne das Bearer-Präfix, was Nutzer anderer Anbieter häufig irritiert. Ersetzen Sie die Modellzeichenfolge durch MiniMax-M3, und schon läuft der Aufruf.
import requests, json, glob
# Einige Quelldateien in einen einzigen Prompt mit langem Kontext einlesen.
# Die Untergrenze von M3 liegt bei 512K Tokens, daher passen ein Dutzend Dateien hinein, ohne die Preisklippe zu erreichen.
files = glob.glob("src/**/*.py", recursive=True)[:20]
codebase = "\n\n".join(f"# ---- {p} ----\n{open(p).read()}" for p in files)
prompt = (
"Hier ist ein Teil eines Python-Dienstes. Finde jede Stelle, an der eine Datenbankverbindung auf einem Ausnahmeweg offen bleiben kann, "
"und gib die Behebung als Unified Diff zurück.\n\n"
+ codebase
)
resp = requests.post(
"https://gptproto.com/v1/chat/completions",
headers={
"Authorization": "sk-your-gptproto-key", # roher Schlüssel, KEIN "Bearer"-Präfix
"Content-Type": "application/json",
},
data=json.dumps({
"model": "MiniMax-M3",
"messages": [{"role": "user", "content": prompt}],
"temperature": 0.2, # Standardwert ist 0.95 — für deterministische Codeänderungen reduzieren
"stream": False,
}),
timeout=120,
)
print(resp.json()["choices"][0]["message"]["content"])
Zwei praktische Hinweise. Der Standardwert für temperature auf dieser Oberfläche beträgt 0,95, was für Code hoch ist – ich würde ihn auf 0,2 oder niedriger setzen, wenn Sie reproduzierbare Diffs statt kreativer Variationen möchten. Außerdem ein Hinweis zur Transparenz: Dieser Endpunkt und das Authentifizierungsmuster mit dem rohen Schlüssel wurden anhand der aktuellen MiniMax-Modelldokumentation von GPT Proto bestätigt, wobei die Modellzeichenfolge durch MiniMax-M3 ersetzt wurde. Ich habe diesen exakten Aufruf jedoch nicht selbst mit M3 getestet. Führen Sie daher eine Live-Anfrage aus und prüfen Sie die Antwortstruktur, bevor Sie ihn in CI integrieren.
„Unterstützt 1M“ bedeutet nicht „sollte bei 1M ausgeführt werden“
Es lohnt sich, zwei Aussagen zu trennen, die häufig vermischt werden. M3 unterstützt ein Fenster von 1 Million Tokens. Ob Sie es nutzen sollten, ist eine andere Frage – und beim Programmieren lautet die Antwort meist nein. Bei Modellen mit langem Kontext ist dokumentiert, dass sie den Anfang und das Ende eines Prompts gut berücksichtigen, während sie Informationen in der Mitte leichter übersehen. MiniMax zufolge wurde M3 speziell dagegen trainiert, und erste Berichte deuten darauf hin, dass der Abruf über den Großteil des Fensters hinweg stabil bleibt. Doch „der Großteil“ ist in diesem Satz entscheidend, und ich würde das Verhalten am äußersten Ende anhand Ihrer eigenen auf Abruf angewiesenen Aufgaben überprüfen. Zusammen mit der Preisklippe bei 512K ergibt sich eine klare Empfehlung: Nutzen Sie den langen Kontext bewusst – etwa für Überlegungen über das gesamte Repository, wenn Sie tatsächlich dateiübergreifendes Verständnis benötigen – und nicht als Standardablage für jede Datei, die gerade herumliegt.
M3 vs. DeepSeek V4 Pro fürs Programmieren
Wenn Sie beim Programmieren zwischen den beiden Open-Weight-Modellen aus China auf Spitzenklassen-Niveau wählen, ist die entscheidende Achse klar. M3 bietet native Multimodalität und ein 1M-Fenster – es kann neben dem Code auch einen Screenshot einer fehlerhaften Benutzeroberfläche verarbeiten. DeepSeek V4 Pro ist textbasiert und günstiger, außerdem stark bei verifizierten Software-Engineering-Suites. Meine grobe Einordnung: Greifen Sie zu M3, wenn multimodale Eingaben oder ein sehr langer Kontext den Aufpreis rechtfertigen, und zu DeepSeek, wenn Sie den günstigsten leistungsfähigen reinen Text-Coder möchten und keine Bildverarbeitung benötigen. Die direkten Vergleichszahlen verdienen eine eigene Betrachtung, daher beschränke ich mich hier auf die Entscheidungskriterien und habe den ausführlichen Vergleich in MiniMax M3 vs. DeepSeek V4 Pro ausgelagert.
Wer M3 fürs Programmieren nutzen sollte – und wer nicht
Nutzen Sie es, wenn Ihre Arbeit agentenbasiert ist und sich über mehrere Dateien erstreckt: Patches in einer gesamten Codebasis, terminalgesteuerte Aufgaben, lange Debugging-Sitzungen, bei denen der Verlauf wichtig ist, oder Workflows, in denen es wirklich nützlich ist, einen Screenshot der Benutzeroberfläche an das Modell zurückzugeben. Für dieses Profil wurde M3 trainiert, und das zeigt sich.
Lassen Sie es aus oder testen Sie es zumindest zunächst gründlich in drei Fällen. Wenn Sie den absolut günstigsten textbasierten Coder benötigen und nie Bilder oder riesige Kontexte verwenden, kostet ein schlankeres Textmodell pro Token weniger. Wenn Ihr Problem echtes neuartiges abstraktes Schlussfolgern statt kompetenter Ausführung erfordert – der unabhängige Tester, der M3s angewandte Coding-Leistung positiv bewertete, stellte auch Rückstände bei Benchmarks zum abstrakten Schlussfolgern fest –, liegt M3 nicht in seinem stärksten Bereich. Und wenn Sie vorhaben, die Gewichte für die kommerzielle Nutzung selbst zu hosten, lesen Sie die Lizenz, bevor Sie sich festlegen: M3 wird unter der MiniMax Community License veröffentlicht, die restriktiver ist als die MIT- oder Apache-Bedingungen mancher Wettbewerber, und der Status als Open-Weight-Modell war seit dem Launch Veränderungen unterworfen. Für die API-Nutzung über die Modellseite gilt diese Lizenzhürde nicht – Sie mieten den Zugang, statt Gewichte weiterzuverteilen.