Preise+7% Bonus
Tiffany Layne2026-07-01

MiniMax M3 vs DeepSeek V4 Pro: Preis, Benchmarks und welchen man tatsächlich nutzen sollte

MiniMax M3 vs DeepSeek V4 Pro verglichen: Preis, Benchmarks und Multimodalität. Welches chinesische Open-Weight-Modell man tatsächlich verwenden sollte – und die SWE-bench-Falle, die die meisten Leitfäden falsch darstellen.

MiniMax M3 vs DeepSeek V4 Pro: Preis, Benchmarks und welchen man tatsächlich nutzen sollte

TL;DR — Dies sind die beiden Open-Weight-Modelle aus China, die momentan jeder vergleicht, und die ehrliche Antwort ist, dass sie kaum konkurrieren. DeepSeek V4 Pro ist ein reiner Textalgorithmus-Spezialist: Es erzielt den höchsten SWE-bench Verified Score aller Open-Weight-Modelle (80,6%) und seine native Token-Ökonomie ist schwer zu schlagen, besonders bei Cache-Treffern. MiniMax M3 ist ein nativ multimodaler Generalist: Es liest Bilder und Videos, nicht nur Text, und belegt den zweiten Platz im Cross-Model-Intelligence-Index von Artificial Analysis. Wenn Ihre Arbeit mit Text, Code und Logs zu tun hat und Ihnen die Kosten pro Token wichtig sind, nehmen Sie DeepSeek V4 Pro.

Wenn Ihr Agent einen Screenshot, ein Design-Mockup oder eine Bildschirmaufnahme betrachten muss, nehmen Sie M3 — DeepSeek kann das zu keinem Preis. Beide bieten jetzt Open Weights und haben ein 1M-Token-Kontextfenster, also ist dies nicht der Kampf „einer muss verlieren“, wie ihn die meisten Vergleichsseiten darstellen.

 

Inhaltsverzeichnis

Zwei Modelle, zwei Philosophien

Die meisten direkten Vergleiche stellen diese beiden Modelle so dar, als wären sie dasselbe Produkt zu unterschiedlichen Preisen. Das sind sie nicht. DeepSeek hat V4 Pro am 24. April 2026 unter einer MIT-Lizenz veröffentlicht, und es ist der tiefere Spezialist — ein reines Text-Mixture-of-Experts-Modell, das stark auf agentisches Programmieren und MINT-Denken getrimmt ist. MiniMax hat M3 am 1. Juni 2026 veröffentlicht, und es ist der breitere Generalist — das erste Open-Weight-Modell, das Spitzen-Codierung, ein Millionen-Token-Kontextfenster und native Bild- und Video-Eingabe in einem System vereint.

Dieser einzige Unterschied — multimodal versus nur Text — entscheidet mehr über die Wahl als jeder Benchmark. Daher ist es besser, es klar zu sagen, bevor die Zahlen kommen: Sie wählen nicht das „bessere Modell“. Sie wählen, welche Form von Modell zur Aufgabe passt. Der Rest dieses Vergleichs dreht sich darum, diese Entscheidung anhand echter Daten statt eines Leaderboard-Screenshots zu treffen.

Seite an Seite: Spezifikationen und Preis

Hier sind die harten Fakten auf dem Papier, basierend auf den tatsächlichen Preisen pro Million Tokens von GPT Proto, statt einer Schlagzeile aus einem Launch-Post.

  MiniMax M3 DeepSeek V4 Pro
Veröffentlicht 1. Juni 2026 24. April 2026
Architektur MoE, 428B gesamt / 23B aktiv MoE, 1,6T gesamt / 49B aktiv
Aufmerksamkeitsdesign MiniMax Sparse Attention (MSA) DeepSeek Sparse Attention (DSA)
Kontextfenster 1M Tokens 1M Tokens (384K max. Ausgabe)
Eingabemodalitäten Text, Bild, Video nur Text
Ausgabe Text Text
Lizenz / Gewichte Open Weights (Hugging Face) MIT, Open Weights (Hugging Face)
GPT Proto Eingabepreis $0,48 / 1M Tokens $1,3914 / 1M Tokens
GPT Proto Ausgabepreis $0,96 / 1M Tokens $2,7838 / 1M Tokens

Zwei Dinge in dieser Tabelle sind wichtiger als der Rest. M3 nimmt Bild- und Videoeingaben entgegen; DeepSeek nicht. Und DeepSeek aktiviert etwa doppelt so viele Parameter pro Token (49B vs 23B) aus einem Pool, der fast viermal so groß ist — es ist das schwerere, dichtere Modell, das mehr Rechenleistung pro Token aufwendet, was sich in seinen Deep-Reasoning-Werten und bei den meisten Hosts auch im Preis zeigt.

Codierungs- und Agentenleistung

Hier geht der Vergleich meist schief, also lesen Sie die Zahlen genau.

DeepSeek V4 Pro erreicht in seinem maximalen Reasoning-Modus 80,6% auf SWE-bench Verified — der höchste Wert aller Open-Weight-Modelle, gleichauf mit Gemini 3.1 Pro. Es erzielt außerdem 93,5 auf LiveCodeBench und eine Codeforces-Wertung von 3206. Das sind algorithmische und wettbewerbsorientierte Programmierstärken, und DeepSeeks Werte wurden für unabhängige Wiederholungen aufgegriffen, was für das Vertrauen wichtig ist.

Die offiziellen Codierungswerte von MiniMax M3 sind 59,0% auf SWE-Bench Pro, 66,0% auf Terminal-Bench 2.1, 34,8% auf SWE-fficiency, 28,8% auf KernelBench Hard und 74,2% auf MCP Atlas. Im unabhängigen Intelligence Index von Artificial Analysis — einem modellübergreifenden Score, keinem Hersteller-Benchmark — erreicht M3 einen Wert von 44, den zweiten Platz in der von ihm verfolgten Vergleichsgruppe, gegenüber einem Median von etwa 25 in der Kategorie.

Nun die Falle. Sie werden Dutzende Seiten sehen, die M3s „59%“ neben DeepSeeks „80,6%“ stellen und DeepSeek zum überlegenen Codierungs-Sieger erklären. Dieser Vergleich ist ungültig. SWE-bench Pro und SWE-bench Verified sind zwei verschiedene Benchmarks mit unterschiedlichen Problemstellungen und Schwierigkeitsgraden — Pro ist die schwierigere, neuere Variante. Einen Pro-Score mit einem Verified-Score zu vergleichen, sagt nichts darüber aus, welches Modell besser ist; es ist ein Einheitenfehler, der als Schlussfolgerung verkleidet ist. Die beiden Labore haben einfach unterschiedliche Benchmarks veröffentlicht, und keines hat einen sauberen direkten Vergleich auf demselben Benchmark veröffentlicht. Meine Einschätzung: Bei unabhängig gemessener allgemeiner Intelligenz liegen sie nahe beieinander; bei veröffentlichten Deep-Reasoning- und Wettbewerbs-Codierungswerten sind DeepSeek's höher und besser verifiziert; bei jeder Aufgabe, die Sehen erfordert, beginnt der Vergleich gar nicht, weil M3 das einzige ist, das dazu in der Lage ist.

Die eine Fähigkeit, die kein Unentschieden ist

DeepSeek V4 Pro ist reiner Text. MiniMax M3 wurde von Anfang an multimodal aufgebaut und akzeptiert Bilder und Videos neben Text am selben Endpunkt. Das ist keine Fußnote im Datenblatt — es ist ein kategorialer Unterschied.

Wenn Sie einen Agenten bauen, der anhand eines Screenshots debuggt, ein Figma-Mockup in eine Komponente umwandelt, ein Diagramm liest oder eine Bildschirmaufnahme einer Reproduktion ansieht, um den Fehler zu finden, kann M3 das und DeepSeek nicht. Es gibt kein Prompt, keinen Preis und kein Fine-Tuning, das einem reinen Textmodell Augen verleiht. Für jede Arbeitsumgebung, in der das Modell Teil dessen ist, was der Benutzer sieht und mit dem er interagiert — UI-Arbeit, visuelle Qualitätssicherung, Dokumentenanalyse mit Diagrammen — ist die Entscheidung getroffen, bevor Sie sich überhaupt einen Benchmark ansehen. Umgekehrt: Wenn in Ihrer Pipeline nie ein Bild vorkommt, bezahlen Sie für eine Fähigkeit, die Sie nie nutzen werden, und DeepSeeks Textspezialisierung ist der gezieltere Kauf.

Kosten, ehrlich

Auf GPT Proto, wenn beide Modelle von einem Guthaben aus betrieben werden, ist MiniMax M3 das günstigere der beiden — $0,48 Eingabe und $0,96 Ausgabe pro Million Tokens, gegenüber $1,3914 und $2,7838 für DeepSeek V4 Pro. Zu GPT Protos Preisen kostet M3 etwa ein Drittel von V4 Pro pro Token in beide Richtungen.

Aber ich würde Sie in die Irre führen, wenn ich dort aufhören würde, denn „was ist günstiger“ hängt stark davon ab, wo Sie jedes Modell ausführen. DeepSeek's eigene native Wirtschaftlichkeit für V4 Pro ist aggressiv, und zwar in einer Weise, die nicht immer überlebt, wenn es anderswo gehostet wird: In der hauseigenen API von DeepSeek liegt das Modell bei etwa $0,435 Eingabe und $0,87 Ausgabe pro Million Tokens, und — der Teil, der die Rechnungen wirklich bewegt — ein Cache-Treffer kostet etwa $0,003625 pro Million, weit über hundertmal günstiger als ein Cache-Fehlschlag. Agentische Codierungsschleifen senden bei jeder Runde denselben System-Prompt und Dateikontext erneut, sodass der Großteil ihrer Eingabe im Cache landet. Wenn Sie große Mengen reinen Textes verarbeiten und bereit sind, DeepSeek nativ zu betreiben, ist diese Cache-Preisgestaltung wirklich schwer zu schlagen, und es ist das stärkste einzelne Argument für V4 Pro.

Die ehrliche Betrachtung der Kosten hat also zwei Ebenen. Bei einem aggregierten Schlüssel über GPT Proto ist M3 der niedrigere Posten pro Token. Für rohen, hochvolumigen Textdurchsatz, bei dem Sie sich um die native Cache-Rate von DeepSeek optimieren, ziehen die V4 Pro-Ökonomien voraus. Und darunter: Der Preis pro Token ist nicht der Preis pro Aufgabe. Ein Modell, das weniger pro Token kostet, aber drei Versuche braucht, um einen funktionierenden Patch zu liefern, ist nicht die günstige Option — es hat die Kosten nur in Ihre Debugging-Zeit verlagert. Vergleichen Sie die beiden mit Ihren eigenen Aufgaben, bevor Sie eine Preistabelle entscheiden lassen.

Kontext und Effizienz

Beide Modelle haben ein 1M-Token-Kontextfenster, und beide haben dies erreicht, indem sie die standardmäßige dichte Aufmerksamkeit durch ein spärliches Design ersetzt haben — aber auf unterschiedlichen Wegen, und der Unterschied ist real, nicht kosmetisch.

DeepSeek's DSA setzt auf starke Kompression: Bei 1M Token benötigt V4 Pro nur etwa 27% der Rechenleistung für die Inferenz eines einzelnen Tokens und 10% des KV-Cache seines eigenen Vorgängers V3.2. MiniMax's MSA führt stattdessen eine blockweise Auswahl auf unkomprimierten Key-Values durch, was MiniMax als Vorteil ansieht, um die Präzisionskosten zu vermeiden, die kompressionsbasierte Verfahren bei langen Distanzen zahlen; bei 1M Kontext reduziert es die Rechenleistung pro Token auf etwa 1/20 des vorherigen M2-Modells, mit einer Vorbefüllung, die mehr als 9× schneller ist, und einer Dekodierung, die mehr als 15× schneller ist. Dies ist ein Punkt, an dem ich die Behauptungen auf beiden Seiten als herstellergetrieben bezeichnen würde — jedes Labor beschreibt seinen eigenen Ansatz als den ohne Kompromisse. Was Sie mitnehmen können, ist, dass beide speziell für Langkontext-Arbeit entwickelt wurden und beide pro Token bei großer Länge günstig genug sind, dass eine vollständige Repository- oder Langdokument-Arbeitslast praktisch und nicht nur eine Vision ist.

Was die Community tatsächlich prüft

Wenn Sie nach Reaktionen auf diese beiden Modelle suchen — die Suche nach „MiniMax M3 vs DeepSeek V4 Pro reddit“, die viele Leute durchführen, bevor sie sich festlegen — tauchen zwei Themen häufiger auf als jedes Benchmark-Argument, und beide sind ernst zu nehmen.

Das erste ist die Verifizierung. Die Startwerte von M3 wurden auf der eigenen Infrastruktur von MiniMax mit dem eigenen Agenten-Gerüst ausgeführt, was für einen Start normal ist, aber genau das, was Entwickler abwerten, bis unabhängige Zahlen vorliegen. Diese Zahlen haben begonnen: Open Weights von M3 wurden am 7. Juni auf Hugging Face veröffentlicht, und der unabhängige Index von Artificial Analysis bestätigt jetzt, dass es sich um ein wirklich erstklassiges Modell handelt und nicht um ein Artefakt des Benchmark-Tages. DeepSeek hatte hier den Vorteil — seine Werte wurden früh von unabhängigen Prüfern wiederholt, und seine MIT-lizenzierten Gewichte waren von Anfang an für jeden verfügbar, um sie zu überprüfen. Wenn unabhängig verifizierte Leistung eine harte Anforderung ist, hat DeepSeek immer noch die längere Erfolgsbilanz, obwohl M3 den meisten Abstand inzwischen aufgeholt hat.

Das zweite ist der Punkt, dass „günstigster pro Token“ und „günstigster, um die Aufgabe zu erledigen“ unterschiedliche Zahlen sind. Ein Modell, das plausiblen Code schreibt und einen fehlschlagenden Test übersieht, ist nicht kostengünstig; es ist ein Modell, das seine Kosten nachgelagert in Ihre Überprüfung verschoben hat. Aus diesem Grund gelangt der Praktikerkonsens immer wieder zu demselben Rat: Wählen Sie nach Fähigkeitspassung und Zuverlässigkeit für Ihre eigene Arbeitslast, und lassen Sie den Token-Preis bei Gleichstand entscheiden, anstatt die Entscheidung zu treffen.

Beide mit demselben Schlüssel ausführen

Der praktische Vorteil der Nutzung beider über GPT Proto ist, dass der Modellwechsel eine einzeilige Änderung ist — derselbe Schlüssel, dieselbe OpenAI-kompatible Anfrageform, andere Modellzeichenfolge. Hier ist eine Chat-Vervollständigung gegen M3, mit einem auskommentierten Wechsel zu V4 Pro:

from openai import OpenAI

client = OpenAI(
    api_key="sk-your-key-here",           # ein Schlüssel erreicht beide Modelle
    base_url="https://gptproto.com/v1",   # OpenAI-kompatibles Gateway
)

def ask(model, prompt):
    resp = client.chat.completions.create(
        model=model,
        messages=[{"role": "user", "content": prompt}],
    )
    return resp.choices[0].message.content

# Nur Text-Reasoning — jedes Modell kann das.
print(ask("deepseek-v4-pro", "Refactor this function for readability:\n<paste code>"))

# Bildeingabe — nur M3 kann das; DeepSeek ist nur Text.
def ask_with_image(image_url, prompt):
    resp = client.chat.completions.create(
        model="MiniMax-M3",
        messages=[{
            "role": "user",
            "content": [
                {"type": "text", "text": prompt},
                {"type": "image_url", "image_url": {"url": image_url}},
            ],
        }],
    )
    return resp.choices[0].message.content

print(ask_with_image(
    "https://example.com/ui-bug-screenshot.png",
    "This screen renders wrong on mobile. What's the likely CSS cause?",
))

Derselbe erste Aufruf in cURL:

curl https://gptproto.com/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer sk-your-key-here" \
  -d '{
    "model": "deepseek-v4-pro",
    "messages": [
      {"role": "user", "content": "Refactor this function for readability."}
    ]
  }'

Um eine Textaufgabe von einem Modell auf das andere zu verschieben, ändern Sie eine Zeichenfolge — MiniMax-M3 oder deepseek-v4-pro — und derselbe Schlüssel erreicht beide plus über 200 andere Modelle auf einem Guthaben. Wenn Sie noch keinen Schlüssel haben, erstellen Sie einen über das GPT Proto-Dashboard und überprüfen Sie die Preisseite für den genauen aktuellen Satz für jedes Modell, bevor Sie einen Batch ausführen.

Welches sollten Sie verwenden?

Wenn Ihre Arbeitslast aus Text, Code, Logs und strukturierter Ausgabe besteht — Backend-Agenten, Extraktion großer Mengen, wettbewerbsorientierte algorithmische Probleme — verwenden Sie DeepSeek V4 Pro. Es hat die höheren verifizierten Deep-Reasoning-Werte, die tiefere unabhängige Erfolgsbilanz und eine native Wirtschaftlichkeit, die hochvolumigen Text durch seine Cache-Preise belohnt.

Wenn irgendetwas in Ihrer Pipeline ein Bild oder ein Video ist — UI-Debugging, Design-to-Code, visuelle Qualitätssicherung, diagrammreiche Dokumente — verwenden Sie MiniMax M3, weil es das einzige der beiden ist, das sehen kann, und auf GPT Proto ist es auch die günstigere Option pro Token.

Und wenn Sie etwas Reales bauen, ist die Antwort oft beides: Leiten Sie Text- und reine Reasoning-Aufgaben an V4 Pro, geben Sie die visuellen Aufgaben an M3 und betreiben Sie sie mit einem Schlüssel, damit keine zweite Integration gewartet werden muss. „MiniMax M3 oder DeepSeek V4 Pro“ ist für die meisten Teams der falsche Rahmen — sie sind Spezialisten für verschiedene Dinge, und die stärkste Konfiguration verwendet jedes dort, wo es gewinnt.

 

Creative Studio

Erstelle Bilder, Videos und mehr mit APIs für den Produktionseinsatz.

Mit dem Erstellen beginnen
Creative Studio
Verwandte Modelle
Alle Modelle
MiniMax
20% OFF
DeepSeek
15% OFF
Google
40% OFF
OpenAI
20% OFF

FAQ

Was ist der Hauptunterschied zwischen MiniMax M3 und DeepSeek V4 Pro?

Die Fähigkeitsform. M3 ist nativ multimodal – es verarbeitet Text, Bild und Video – während DeepSeek V4 Pro nur Text verarbeitet, aber ein tieferer algorithmischer und Reasoning-Spezialist ist. Beide sind Open-Weight-Chinese-MoE-Modelle mit 1M-Token-Kontextfenstern.

Ist DeepSeek V4 Pro besser als MiniMax M3 für die Codierung?

Bei veröffentlichten, unabhängig verifizierten Werten wie SWE-bench Verified (80,6%) und LiveCodeBench (93,5) führt DeepSeek V4 Pro bei textbasierter und algorithmischer Codierung. Aber der weit verbreitete Vergleich von M3s 59% SWE-bench Pro mit DeepSeek's 80,6% Verified ist ungültig – das sind unterschiedliche Benchmarks. Für Codierung, die Screenshots oder UI beinhaltet, gewinnt M3 standardmäßig, da DeepSeek keine Bilder verarbeiten kann.

Welches ist günstiger?

Auf GPTProto ist MiniMax M3 ($0,48 Eingabe / $0,96 Ausgabe pro 1M Tokens) günstiger als DeepSeek V4 Pro ($1,3914 / $2,7838). Auf DeepSeek's eigener nativer API liegen die Listen- und Cache-Treffer-Preise von V4 Pro niedriger, was die Nutzung von reinem Text in großen Mengen begünstigt. Der Preis pro Token ist nicht die Kosten pro Aufgabe – testen Sie beide mit Ihrer eigenen Arbeitslast.

Wie schneiden diese chinesischen Modelle im Vergleich zu geschlossenen Modellen wie GPT-5.5 oder Claude Opus ab?

Beide werden als Open-Weight-Alternativen zu einem Bruchteil der Token-Kosten geschlossener Modelle positioniert. DeepSeek V4 Pro's SWE-bench Verified Score erreicht Gleichstand mit Gemini 3.1 Pro in der Spitzengruppe, und MiniMax M3 belegt den zweiten Platz im unabhängigen Intelligence Index von Artificial Analysis für seine Vergleichsgruppe. Die offenen Gewichte und der niedrigere Preis sind der Kompromiss für die breitere Ökosystemunterstützung geschlossener Modelle.

Kann ich beide ohne separate Konten ausführen?

Ja. Über GPTProto erreichen ein API-Schlüssel und ein OpenAI-kompatibler Endpunkt sowohl MiniMax M3 als auch DeepSeek V4 Pro auf einem einzigen Guthaben – der Modellwechsel ist eine einzeilige Änderung.

Verwandte Artikel

Weitere Blogbeiträge
Doubao API: Der vollständige Leitfaden (2026) – Welches Modell Sie aufrufen sollten und wie

Doubao API: Der vollständige Leitfaden (2026) – Welches Modell Sie aufrufen sollten und wie

Suchen Sie nach „doubao api“, stoßen Sie schnell auf eine Sackgasse. Die offizielle Konsole heißt Volcano Engine, die Seiten sind standardmäßig auf Chinesisch, und bei der Registrierung ist eine Identitätsprüfung erforderlich, die die meisten Entwickler außerhalb Chinas nicht an einem Nachmittag abschließen können. Dazu kommt die Namensgebung: Doubao, Dola, Cici, Seed, Seedream, Seedance, Volcengine – alles ByteDance, und keines davon ist offensichtlich das, wonach Sie gesucht haben. Ich schreibe Integrationsleitfäden für GPTProto, und nach Doubao werde ich am häufigsten gefragt. Deshalb ist dies der Leitfaden, den ich selbst gerne gehabt hätte: Welches Doubao-Modell welche Aufgabe übernimmt, was die einzelnen Modelle tatsächlich kosten und wie Sie sie per Copy-and-paste aufrufen – für Text, Bilder und Videos – über einen einzigen Endpunkt, ohne chinesische Telefonnummer. Hier sehen Sie ein Bild, das das Videomodell Seedance 2.0 aus einem Textprompt erzeugt hat – genau über die API aufgerufen, wie es der weiter unten stehende Code macht. Wir arbeiten uns Schritt für Schritt dorthin vor.

Schuyler Stacy | 2026-06-23

So verwenden Sie Kling 3.0 Motion Control: Ein Entwicklerleitfaden (Web + API)

So verwenden Sie Kling 3.0 Motion Control: Ein Entwicklerleitfaden (Web + API)

Kling 3.0 Motion Control animates a static character image with the movement from a reference video. You give it two inputs — a picture of your character and a video of someone moving — and it returns a new clip where your character performs that exact choreography while keeping their own face, outfit, and look. This is motion transfer, not text-to-motion. Instead of describing an action in a prompt and hoping the model interprets it, you show it the action frame by frame. That makes it far more reliable for repeatable character animation, dance, and gesture work. This guide covers both paths: the Kling web app for one-off clips, and the GPTProto API for wiring Motion Control into a pipeline. We'll cover inputs and limits, the `pro` vs `std` tiers, prompt technique, full runnable code, pricing, and the failure modes worth knowing before you spend credits.

Michael Johnson | 2026-06-30

Was ist GLM 5.2? Open-Weight-Coding zum Sechstel des Preises

Was ist GLM 5.2? Open-Weight-Coding zum Sechstel des Preises

Ein chinesisches Labor hat ein Modell veröffentlicht, das du kostenlos herunterladen, auf deiner eigenen Hardware ausführen und für ungefähr ein Sechstel dessen betreiben kannst, was geschlossene Frontier-Modelle verlangen – und das bei realen Coding-Benchmarks nur wenige Punkte hinter Claude Opus 4.8 liegt. Dann wurde das Ganze ausgeliefert, ohne auch nur einen einzigen offiziellen Benchmark zu veröffentlichen. Das ist GLM 5.2, und der Abstand zwischen „keine Marketingzahlen“ und „innerhalb einer Woche fast an der Spitze jeder unabhängigen Rangliste“ ist der Hauptgrund, warum es sich lohnt, das Modell zu verstehen. Ich schreibe viele solcher Erklärartikel, und die meisten Beiträge zu neuen Modellen sind schnell vergessen, weil sie nur ein Datenblatt wiederholen. Dieser hier unterscheidet sich in einem Punkt, der für Entwickler tatsächlich wichtig ist: Die Gewichte stehen unter einer MIT-Lizenz offen zur Verfügung. Dadurch lässt sich die übliche Frage – „Ist der Benchmark echt oder nur Marketing?“ – ungewöhnlich klar beantworten. Die Menschen haben das Modell heruntergeladen und selbst getestet. Hier erfährst du, was GLM 5.2 ist, wie es funktioniert und wo seine Grenzen liegen.

Michael Johnson | 2026-07-15

Claude Fable 5: Der vollständige Leitfaden und ehrliche Test (2026)

Claude Fable 5: Der vollständige Leitfaden und ehrliche Test (2026)

Anthropic warnte monatelang davor, dass seine leistungsfähigsten Modelle zu gefährlich würden, um sie allgemein zu veröffentlichen. Dann veröffentlichte das Unternehmen am 9. Juni 2026 doch eines – zumindest teilweise. Claude Fable 5 ist das erste Modell aus Anthropics oberster „Mythos“-Klasse, das die Öffentlichkeit tatsächlich aufrufen kann, und es steht eine ganze Stufe über der Opus-Familie. Der Haken ist ungewöhnlich: Bei einem Teil sensibler Fragen leitet die Version, für die Sie bezahlen, Ihre Anfrage unbemerkt an ein anderes, schwächeres Modell weiter und lässt dieses antworten. Diese eine Designentscheidung verrät bereits vieles darüber, was Fable 5 anders macht – und genau hier beginnt dieser Leitfaden. Dies ist ein Leitfaden für Entwickler aus der Praxis, keine Zusammenfassung zum Launch-Tag. Wir haben die Spezifikationen und das Verhalten aus Anthropics eigener Dokumentation, unabhängigen Benchmarks und den ersten Praxistests seit dem Launch zusammengetragen – und Zahlen, die wir nicht überprüfen konnten, bewusst weggelassen.

Schuyler Stacy | 2026-06-11