Preise+7% Bonus
Schuyler Stacy2026-07-02

MiniMax M3 fürs Programmieren: Benchmarks, echte Preise und der API-Aufruf (2026)

Ist MiniMax M3 gut zum Programmieren? Unabhängige Benchmarks im Vergleich zu Herstellerangaben, die tatsächlichen API-Kosten mit erklärter Preisklippe bei 512K sowie ausführbarer GPTProto-Code.

MiniMax M3 fürs Programmieren: Benchmarks, echte Preise und der API-Aufruf (2026)

Ist MiniMax M3 gut zum Programmieren geeignet? Die kurze Antwort lautet: ja, für agentenbasierte Aufgaben und Arbeiten über mehrere Dateien hinweg – mit zwei Einschränkungen, die ich offen nennen möchte, bevor Sie weiterlesen. Die meisten der prominenten Coding-Ergebnisse wurden von MiniMax auf der eigenen Infrastruktur ermittelt, und der „Kontext von 1 Million Tokens“ hat ab 512K eine Preisklippe, die insbesondere Coding-Agenten trifft. Beides lässt sich handhaben, sobald man davon weiß. In den meisten Berichten zum Launch wird keines von beiden klar herausgestellt.

Ich schreibe diesen Artikel, weil der Coding-Pitch rund um M3 auf eine einzige Zahl reduziert wurde – 59 % bei SWE-Bench Pro – und diese Zahl für viele unbelegte Schlussfolgerungen herhalten muss. Im Folgenden erfahren Sie, was das Modell tatsächlich ist, wo unabhängige Messungen liegen, was es bei einer realen Coding-Arbeitslast kostet und wie Sie es über die GPTProto-API aufrufen. Wenn Sie nur ein Fazit möchten: Ein unabhängiger Tester, der dieselbe Testbatterie bei jedem ernstzunehmenden Modell durchführt, stufte M3 als „beim echten Programmieren nahe an GPT und Opus, aber noch nicht an ihnen vorbei“ ein. Das entspricht auch der Position der neutralen Benchmarks.

Inhaltsverzeichnis

Was MiniMax M3 aus Sicht des Programmierens ist

M3 wurde am 1. Juni 2026 veröffentlicht. Es handelt sich um ein Mixture-of-Experts-Modell – Community-Tracker, die den veröffentlichten Checkpoint analysiert haben, kommen auf ungefähr 428 Milliarden Parameter insgesamt und etwa 23 Milliarden aktive Parameter pro Token. MiniMax selbst hat jedoch keine vollständige Aufschlüsselung der Parameter veröffentlicht; betrachten Sie die genauen Zahlen daher als zweitrangig. Das Modell ist nativ multimodal (Eingaben: Text, Bilder und Videos; Ausgabe: Text) und verfügt über einen Denkmodus, den Sie pro Anfrage aktivieren können.

Doch zunächst zur Motivation: Warum sollte sich ein Coding-Modell überhaupt für die Kontextlänge interessieren? Weil echte Entwicklungsarbeit nicht aus einer einzelnen Datei besteht. Sie umfasst ein Repository, einen Stacktrace, die Testausgabe und die drei Dateien, die Sie zur Behebung des Problems ändern müssten – alles lange genug an einem Ort, um Zusammenhänge zwischen ihnen zu erkennen. M3 beantwortet diese Anforderung mit einem Kontextfenster von 1 Million Tokens und einer garantiert nutzbaren Untergrenze von 512K Tokens. Die darunterliegende Technik ist MiniMax Sparse Attention (MSA), bei der Blöcke des Key-Value-Caches ausgewählt werden, statt jedes Token-Paar zu berücksichtigen. MiniMax berichtet, dass bei 1 Million Tokens dadurch der Rechenaufwand pro Token gegenüber der vorherigen Generation ungefähr auf ein Zwanzigstel sinkt, bei etwa 9-fach schnellerem Prefill und 15-fach schnellerem Decoding. Das sind Herstellerangaben zur Architektur und keine unabhängigen Messungen, aber die Richtung entspricht dem, was Sparse Attention leisten soll.

Es gibt außerdem eine hauseigene Coding-Oberfläche – MiniMax Code, den eigenen auf dem Modell basierenden Agenten. Es ist nützlich zu wissen, dass sie existiert; darum geht es in diesem Beitrag jedoch nicht, denn Sie möchten das Modell aus Ihrem eigenen Code heraus aufrufen.

Ein Satz zum Merken: M3 ist für ausdauernde, mehrstufige Arbeit über einen großen Kontext hinweg ausgelegt, nicht für einmalige Code-Snippets. Diese Perspektive erklärt fast jeden der folgenden Kompromisse.

Die Coding-Benchmarks: Was MiniMax berichtet im Vergleich zu unabhängigen Messungen

Hier liegt der Unterschied, den die meisten Artikel zusammenfassen. Links stehen die von MiniMax selbst berichteten Coding- und agentenbasierten Ergebnisse. Rechts sehen Sie, was eine neutrale dritte Partei gemessen hat.

Quelle Metrik Ergebnis
MiniMax (vom Hersteller auf eigener Infrastruktur ausgeführt, Claude-Code-Gerüst) SWE-Bench Pro 59,0 %
MiniMax SWE-Bench Verified 80,5 %
MiniMax Terminal-Bench 2.1 66,0 %
MiniMax SWE-fficiency 34,8 %
MiniMax KernelBench Hard 28,8 %
MiniMax MCP Atlas (Tool-Orchestrierung) 74,2 %
Artificial Analysis (unabhängig) Intelligence Index (kombiniert) 55 – Nr. 1 in seiner Open-Weight-Klasse

Zwei Dinge werden Sie der Herstellertabelle nicht entnehmen. Erstens ist die Tatsache, dass diese Tests vom Hersteller durchgeführt wurden, hier wichtiger als sonst: Der SWE-Bench-Pro-Wert wurde auf dem eigenen Setup von MiniMax mit Claude Code als Harness ermittelt, und die unabhängige Replikation holt noch auf. Betrachten Sie 59 % als starkes Signal für die Leistungsklasse, in der M3 konkurriert, nicht als endgültiges Ergebnis. Zweitens – und das ist das Detail, das ich in keinem einzigen Coding-fokussierten Artikel gesehen habe – verbesserten sich bei der Aufschlüsselung von M3 im Vergleich zum Vorgänger durch Artificial Analysis die meisten Evaluationen (Humanity's Last Exam 28→37, GPQA Diamond 87→93, Reasoning mit langem Kontext 69→74), doch SciCode, die Coding-Evaluation in diesem Datensatz, sank leicht von 47 auf 45. Das ist ein kleiner Rückgang, den ich nicht überinterpretieren würde. Aber es ist der eine Datenpunkt, der die klare Geschichte vom „deutlich besseren Programmieren“ komplizierter macht – und es ist bezeichnend, dass er überall unerwähnt blieb.

Meine Einschätzung: M3 ist bei angewandter Softwareentwicklung tatsächlich nahe an der Spitzenklasse – beim Schreiben von Patches, bei Änderungen über mehrere Dateien hinweg und bei Terminal-Aufgaben – und die Unterstützung durch den unabhängigen Index (55, Spitzenreiter seiner Klasse) ist real und kein Marketing. Es stellt jedoch nicht auf jeder Coding-Achse einen grundlegenden Sprung gegenüber der letzten Generation dar, und die Lücke beim abstrakten Schlussfolgern ist real (mehr dazu weiter unten). Fazit: Vertrauen Sie auf die Leistungsklasse, überprüfen Sie aber die genaue Zahl anhand Ihrer eigenen Aufgaben.

Was es bei einer Coding-Arbeitslast tatsächlich kostet

Zuerst der Listenpreis, denn der faire Vergleich ist nicht der, den Sie in den meisten Beiträgen sehen werden. Über die GPT Proto-Modellseite kostet M3 im Standardtarif 0,48 $ pro Million Eingabetokens und 0,96 $ pro Million Ausgabetokens.

Zum Vergleich: Der effektive Eigenpreis von MiniMax – nach dem dauerhaften Rabatt von 50 % auf den Listenpreis – beträgt etwa 0,30 $ für Eingaben und 1,20 $ für Ausgaben. Seien Sie beim Vergleich also präzise, statt pauschal von „günstiger“ zu sprechen: Über GPT Proto sind Eingaben teurer als beim direkten Aufruf von MiniMax, Ausgaben hingegen günstiger. Welche Variante gewinnt, hängt vollständig vom Verhältnis zwischen gelesenen und geschriebenen Tokens Ihrer Arbeitslast ab. Ein Coding-Agent, der ein großes Repository einliest und einen kleinen Diff ausgibt, ist eingabelastig, sodass der Eingabepreis dominiert; ein ausgab lastiger Job verschiebt das Verhältnis in die andere Richtung. Der Grund, M3 über einen Aggregator zu routen, ist kein plakattauglicher Rabatt, sondern der operative Vorteil: ein Schlüssel und eine OpenAI-kompatible Oberfläche für M3 zusammen mit dem restlichen Katalog, statt ein separates MiniMax-Konto, einen regionalen Endpunkt und einen Abonnementschlüssel einzurichten.

Nun zum Teil, der Coding-Rechnungen tatsächlich bestimmt, und zum Grund, warum „1M Kontext“ mit einem Sternchen versehen werden sollte. Die Preise bleiben nur bis zu 512K Eingabetokens unverändert. Überschreiten Sie diese Grenze, wird die gesamte Anfrage – Eingaben, Ausgaben und Cache-Lesevorgänge – mit dem 2-fachen Preis berechnet. Es handelt sich um eine Sprungfunktion, nicht um einen gleitenden Anstieg. Betrachten wir einen normalen Agenten-Loop: Sie beginnen mit 400K Eingabetokens und 100K Ausgabetokens und liegen damit bequem unter der Grenze. Agenten-Loops werden jedoch länger. Nach zehn oder fünfzehn Durchläufen wurde nichts gekürzt, und ein Durchlauf überschreitet unbemerkt 512K – ab diesem Punkt wird für den gesamten Durchlauf alles doppelt berechnet, nicht nur die Tokens oberhalb des Schwellenwerts. Eine Erhöhung der Eingabemenge um 20 % kann die Kosten eines Aufrufs mehr als verdoppeln.

Der Hebel in die andere Richtung ist Caching: Wiederholte Eingaben (Ihr System-Prompt und die stabilen Teile der Codebasis) werden beim erneuten Lesen zu einem Bruchteil des Standardpreises berechnet. In Agenten-Loops ist ein großer Teil der Eingaben cachebar, daher lohnt es sich, dies frühzeitig einzurichten. Fazit: Bei M3 wird Ihre Coding-Rechnung davon bestimmt, wie viel Kontext Sie mitschleppen und wie gut Sie ihn cachen – nicht von der Zahl pro Token auf der Preiskarte. Planen Sie die Arbeitslast, nicht den Listenpreis.

M3 über die GPT Proto-API aufrufen

Der Endpunkt ist die OpenAI-kompatible Chat-Oberfläche. Die Authentifizierung erfolgt über einen rohen API-Schlüssel im Authorization-Header – ohne das Bearer-Präfix, was Nutzer anderer Anbieter häufig irritiert. Ersetzen Sie die Modellzeichenfolge durch MiniMax-M3, und schon läuft der Aufruf.

import requests, json, glob
 
# Einige Quelldateien in einen einzigen Prompt mit langem Kontext einlesen.
# Die Untergrenze von M3 liegt bei 512K Tokens, daher passen ein Dutzend Dateien hinein, ohne die Preisklippe zu erreichen.
files = glob.glob("src/**/*.py", recursive=True)[:20]
codebase = "\n\n".join(f"# ---- {p} ----\n{open(p).read()}" for p in files)
 
prompt = (
    "Hier ist ein Teil eines Python-Dienstes. Finde jede Stelle, an der eine Datenbankverbindung auf einem Ausnahmeweg offen bleiben kann, "
    "und gib die Behebung als Unified Diff zurück.\n\n"
    + codebase
)
 
resp = requests.post(
    "https://gptproto.com/v1/chat/completions",
    headers={
        "Authorization": "sk-your-gptproto-key",  # roher Schlüssel, KEIN "Bearer"-Präfix
        "Content-Type": "application/json",
    },
    data=json.dumps({
        "model": "MiniMax-M3",
        "messages": [{"role": "user", "content": prompt}],
        "temperature": 0.2,   # Standardwert ist 0.95 — für deterministische Codeänderungen reduzieren
        "stream": False,
    }),
    timeout=120,
)
 
print(resp.json()["choices"][0]["message"]["content"])

Zwei praktische Hinweise. Der Standardwert für temperature auf dieser Oberfläche beträgt 0,95, was für Code hoch ist – ich würde ihn auf 0,2 oder niedriger setzen, wenn Sie reproduzierbare Diffs statt kreativer Variationen möchten. Außerdem ein Hinweis zur Transparenz: Dieser Endpunkt und das Authentifizierungsmuster mit dem rohen Schlüssel wurden anhand der aktuellen MiniMax-Modelldokumentation von GPT Proto bestätigt, wobei die Modellzeichenfolge durch MiniMax-M3 ersetzt wurde. Ich habe diesen exakten Aufruf jedoch nicht selbst mit M3 getestet. Führen Sie daher eine Live-Anfrage aus und prüfen Sie die Antwortstruktur, bevor Sie ihn in CI integrieren.

„Unterstützt 1M“ bedeutet nicht „sollte bei 1M ausgeführt werden“

Es lohnt sich, zwei Aussagen zu trennen, die häufig vermischt werden. M3 unterstützt ein Fenster von 1 Million Tokens. Ob Sie es nutzen sollten, ist eine andere Frage – und beim Programmieren lautet die Antwort meist nein. Bei Modellen mit langem Kontext ist dokumentiert, dass sie den Anfang und das Ende eines Prompts gut berücksichtigen, während sie Informationen in der Mitte leichter übersehen. MiniMax zufolge wurde M3 speziell dagegen trainiert, und erste Berichte deuten darauf hin, dass der Abruf über den Großteil des Fensters hinweg stabil bleibt. Doch „der Großteil“ ist in diesem Satz entscheidend, und ich würde das Verhalten am äußersten Ende anhand Ihrer eigenen auf Abruf angewiesenen Aufgaben überprüfen. Zusammen mit der Preisklippe bei 512K ergibt sich eine klare Empfehlung: Nutzen Sie den langen Kontext bewusst – etwa für Überlegungen über das gesamte Repository, wenn Sie tatsächlich dateiübergreifendes Verständnis benötigen – und nicht als Standardablage für jede Datei, die gerade herumliegt.

M3 vs. DeepSeek V4 Pro fürs Programmieren

Wenn Sie beim Programmieren zwischen den beiden Open-Weight-Modellen aus China auf Spitzenklassen-Niveau wählen, ist die entscheidende Achse klar. M3 bietet native Multimodalität und ein 1M-Fenster – es kann neben dem Code auch einen Screenshot einer fehlerhaften Benutzeroberfläche verarbeiten. DeepSeek V4 Pro ist textbasiert und günstiger, außerdem stark bei verifizierten Software-Engineering-Suites. Meine grobe Einordnung: Greifen Sie zu M3, wenn multimodale Eingaben oder ein sehr langer Kontext den Aufpreis rechtfertigen, und zu DeepSeek, wenn Sie den günstigsten leistungsfähigen reinen Text-Coder möchten und keine Bildverarbeitung benötigen. Die direkten Vergleichszahlen verdienen eine eigene Betrachtung, daher beschränke ich mich hier auf die Entscheidungskriterien und habe den ausführlichen Vergleich in MiniMax M3 vs. DeepSeek V4 Pro ausgelagert.

Wer M3 fürs Programmieren nutzen sollte – und wer nicht

Nutzen Sie es, wenn Ihre Arbeit agentenbasiert ist und sich über mehrere Dateien erstreckt: Patches in einer gesamten Codebasis, terminalgesteuerte Aufgaben, lange Debugging-Sitzungen, bei denen der Verlauf wichtig ist, oder Workflows, in denen es wirklich nützlich ist, einen Screenshot der Benutzeroberfläche an das Modell zurückzugeben. Für dieses Profil wurde M3 trainiert, und das zeigt sich.

Lassen Sie es aus oder testen Sie es zumindest zunächst gründlich in drei Fällen. Wenn Sie den absolut günstigsten textbasierten Coder benötigen und nie Bilder oder riesige Kontexte verwenden, kostet ein schlankeres Textmodell pro Token weniger. Wenn Ihr Problem echtes neuartiges abstraktes Schlussfolgern statt kompetenter Ausführung erfordert – der unabhängige Tester, der M3s angewandte Coding-Leistung positiv bewertete, stellte auch Rückstände bei Benchmarks zum abstrakten Schlussfolgern fest –, liegt M3 nicht in seinem stärksten Bereich. Und wenn Sie vorhaben, die Gewichte für die kommerzielle Nutzung selbst zu hosten, lesen Sie die Lizenz, bevor Sie sich festlegen: M3 wird unter der MiniMax Community License veröffentlicht, die restriktiver ist als die MIT- oder Apache-Bedingungen mancher Wettbewerber, und der Status als Open-Weight-Modell war seit dem Launch Veränderungen unterworfen. Für die API-Nutzung über die Modellseite gilt diese Lizenzhürde nicht – Sie mieten den Zugang, statt Gewichte weiterzuverteilen.

Creative Studio

Erstelle Bilder, Videos und mehr mit APIs für den Produktionseinsatz.

Mit dem Erstellen beginnen
Creative Studio
Verwandte Modelle
Alle Modelle
MiniMax
20% OFF
DeepSeek
15% OFF
Google
40% OFF
OpenAI
20% OFF

FAQ

Ist MiniMax M3 gut zum Programmieren geeignet?

Für agentenbasiertes Programmieren, Aufgaben über mehrere Dateien hinweg und Arbeiten mit langem Kontext: ja – im unabhängigen Artificial-Analysis-Index liegt es an der Spitze seiner Open-Weight-Klasse und bei angewandten Software-Engineering-Aufgaben nahe an der geschlossenen Spitzenklasse. Für Probleme mit abstraktem Schlussfolgern und für besonders günstige reine Text-Arbeitslasten ist es weniger geeignet.

Wie viel kostet M3 über die API?

Über GPTProto: 0,48 $ pro Million Eingabetokens und 0,96 $ pro Million Ausgabetokens im Standardtarif. Achten Sie auf die Grenze von 512K – Anfragen darüber werden für den gesamten Aufruf mit dem 2-Fachen berechnet. Die aktuellen Preise finden Sie auf der Modellseite.

Gibt es eine kostenlose Möglichkeit, M3 auszuprobieren?

MiniMax hat direkt Testguthaben angeboten. Verfügbarkeit und Werbeangebote ändern sich häufig. Prüfen Sie daher die aktuellen Bedingungen bei dem Anbieter, den Sie verwenden möchten, statt einer Zahl aus einem Blogbeitrag zu vertrauen.

Hat MiniMax M3 Open Weights?

MiniMax kündigte beim Launch Open Weights an und veröffentlichte sie unter der MiniMax Community License. Drittanbieter-Tracker haben die Gewichte jedoch nicht einheitlich als öffentlich verfügbar aufgeführt, und die Situation hat sich seit Juni verändert. Wenn Sie Self-Hosting planen, überprüfen Sie die aktuelle Verfügbarkeit der Gewichte und die Lizenzbedingungen direkt, bevor Sie darauf aufbauen.

M3 oder DeepSeek V4 Pro fürs Programmieren?

M3 für multimodale Eingaben und sehr lange Kontexte; DeepSeek für das günstigste leistungsfähige textbasierte Programmieren. Die vollständige Aufschlüsselung: MiniMax M3 vs. DeepSeek V4 Pro.

Verwandte Artikel

Weitere Blogbeiträge
MiniMax M3 vs DeepSeek V4 Pro: Preis, Benchmarks und welchen man tatsächlich nutzen sollte

MiniMax M3 vs DeepSeek V4 Pro: Preis, Benchmarks und welchen man tatsächlich nutzen sollte

TL;DR — Dies sind die beiden Open-Weight-Modelle aus China, die momentan jeder vergleicht, und die ehrliche Antwort ist, dass sie kaum konkurrieren. DeepSeek V4 Pro ist ein reiner Textalgorithmus-Spezialist: Es erzielt den höchsten SWE-bench Verified Score aller Open-Weight-Modelle (80,6%) und seine native Token-Ökonomie ist schwer zu schlagen, besonders bei Cache-Treffern. MiniMax M3 ist ein nativ multimodaler Generalist: Es liest Bilder und Videos, nicht nur Text, und belegt den zweiten Platz im Cross-Model-Intelligence-Index von Artificial Analysis. Wenn Ihre Arbeit mit Text, Code und Logs zu tun hat und Ihnen die Kosten pro Token wichtig sind, nehmen Sie DeepSeek V4 Pro. Wenn Ihr Agent einen Screenshot, ein Design-Mockup oder eine Bildschirmaufnahme betrachten muss, nehmen Sie M3 — DeepSeek kann das zu keinem Preis. Beide bieten jetzt Open Weights und haben ein 1M-Token-Kontextfenster, also ist dies nicht der Kampf „einer muss verlieren“, wie ihn die meisten Vergleichsseiten darstellen.

Tiffany Layne | 2026-07-01

Was ist GLM 5.2? Open-Weight-Coding zum Sechstel des Preises

Was ist GLM 5.2? Open-Weight-Coding zum Sechstel des Preises

Ein chinesisches Labor hat ein Modell veröffentlicht, das du kostenlos herunterladen, auf deiner eigenen Hardware ausführen und für ungefähr ein Sechstel dessen betreiben kannst, was geschlossene Frontier-Modelle verlangen – und das bei realen Coding-Benchmarks nur wenige Punkte hinter Claude Opus 4.8 liegt. Dann wurde das Ganze ausgeliefert, ohne auch nur einen einzigen offiziellen Benchmark zu veröffentlichen. Das ist GLM 5.2, und der Abstand zwischen „keine Marketingzahlen“ und „innerhalb einer Woche fast an der Spitze jeder unabhängigen Rangliste“ ist der Hauptgrund, warum es sich lohnt, das Modell zu verstehen. Ich schreibe viele solcher Erklärartikel, und die meisten Beiträge zu neuen Modellen sind schnell vergessen, weil sie nur ein Datenblatt wiederholen. Dieser hier unterscheidet sich in einem Punkt, der für Entwickler tatsächlich wichtig ist: Die Gewichte stehen unter einer MIT-Lizenz offen zur Verfügung. Dadurch lässt sich die übliche Frage – „Ist der Benchmark echt oder nur Marketing?“ – ungewöhnlich klar beantworten. Die Menschen haben das Modell heruntergeladen und selbst getestet. Hier erfährst du, was GLM 5.2 ist, wie es funktioniert und wo seine Grenzen liegen.

Michael Johnson | 2026-07-15

Claude Fable 5: Der vollständige Leitfaden und ehrliche Test (2026)

Claude Fable 5: Der vollständige Leitfaden und ehrliche Test (2026)

Anthropic warnte monatelang davor, dass seine leistungsfähigsten Modelle zu gefährlich würden, um sie allgemein zu veröffentlichen. Dann veröffentlichte das Unternehmen am 9. Juni 2026 doch eines – zumindest teilweise. Claude Fable 5 ist das erste Modell aus Anthropics oberster „Mythos“-Klasse, das die Öffentlichkeit tatsächlich aufrufen kann, und es steht eine ganze Stufe über der Opus-Familie. Der Haken ist ungewöhnlich: Bei einem Teil sensibler Fragen leitet die Version, für die Sie bezahlen, Ihre Anfrage unbemerkt an ein anderes, schwächeres Modell weiter und lässt dieses antworten. Diese eine Designentscheidung verrät bereits vieles darüber, was Fable 5 anders macht – und genau hier beginnt dieser Leitfaden. Dies ist ein Leitfaden für Entwickler aus der Praxis, keine Zusammenfassung zum Launch-Tag. Wir haben die Spezifikationen und das Verhalten aus Anthropics eigener Dokumentation, unabhängigen Benchmarks und den ersten Praxistests seit dem Launch zusammengetragen – und Zahlen, die wir nicht überprüfen konnten, bewusst weggelassen.

Schuyler Stacy | 2026-06-11

Claude Sonnet 5: Was neu ist, was es kostet und wie es sich mit Sonnet 4.6 vergleicht (Leitfaden 2026)

Claude Sonnet 5: Was neu ist, was es kostet und wie es sich mit Sonnet 4.6 vergleicht (Leitfaden 2026)

Anthropic hat Claude Sonnet 5 am 30. Juni 2026 veröffentlicht, und innerhalb einer Stunde war meine Feed voller derselben zwei Fragen: Sollte ich von Sonnet 4.6 wechseln, und stimmt die Aussage „derselbe Listenpreis wie 4.6“ tatsächlich, sobald man echten Traffic darüber laufen lässt? Genau diese Fragen interessieren auch mich. Deshalb dreht sich dieser Leitfaden um sie und nicht um die Höhepunkte des Launch-Posts. Alle technischen Angaben hier gehen auf den offiziellen Launch-Post und die Dokumentation von Anthropic zurück. Wenn eine Zahl aus der Presseberichterstattung statt aus einer Seite stammt, die ich direkt lesen konnte, sage ich das dazu. Eine Sache vorweg, weil viele frühe Berichte sie falsch darstellen: Der Vorgänger von Sonnet 5 ist Sonnet 4.6 (veröffentlicht im Februar 2026), nicht Sonnet 4.5. Wenn du mit 4.5 oder einem noch älteren 3.5 vergleichst, vergleichst du zwei Upgrades auf einmal, und die folgenden Zahlen werden nicht zusammenpassen. Darauf komme ich noch zurück.

Schuyler Stacy | 2026-07-01