Was ist Claude Sonnet 5?
Sonnet 5 ist Anthropics neuestes Modell der mittleren Leistungsklasse und wird als das bisher agentischste Sonnet positioniert: Es plant, steuert Browser und Terminals und führt mehrstufige Aufgaben selbstständig aus. Der zentrale Ansatz von Anthropic ist ein Kosten-Leistungs-Verhältnis — eine Leistung nahe Opus 4.8 zu Sonnet-Preisen.
Warum diese Einordnung wichtig ist, bevor wir zu den Details kommen: Während des größten Teils des vergangenen Jahres wurden die größten agentischen Fortschritte in der Opus-Klasse erzielt, nicht bei Sonnet. Teams mit umfangreichen agentischen Workloads mussten daher Opus-Preise für Fähigkeiten bezahlen, die sie meist nur zeitweise benötigten. Sonnet 5 ist Anthropics Versuch, einen Teil dieser Fähigkeiten in eine günstigere Preisklasse zu bringen. Das ist das „Warum“ und erklärt die meisten Designentscheidungen, die folgen.
Die technischen Eckdaten laut Anthropics Dokumentation: Sonnet 5 ist ein direkter Ersatz für Sonnet 4.6, verwendet die API-Modell-ID claude-sonnet-5, wird mit einem Kontextfenster von 1 Mio. Tokens sowohl als Standard als auch als Maximum ausgeliefert und unterstützt bis zu 128.000 Ausgabe-Tokens. Text und Bilder hinein, Text hinaus.
| |
Claude Sonnet 5 |
| Veröffentlicht |
30. Juni 2026 |
| API-Modell-ID |
claude-sonnet-5 |
| Kontextfenster |
1 Mio. Tokens (Standard und Maximum) |
| Maximale Ausgabe |
128.000 Tokens |
| Eingabe / Ausgabe |
Text + Bild hinein, Text hinaus |
| Verhältnis zu 4.6 |
Direkter Ersatz |
Was ist neu gegenüber Sonnet 4.6?
Wenn du bereits Sonnet 4.6 einsetzt, besteht das Upgrade nicht nur aus neuen Gewichten. Laut Anthropics Dokumentation werden drei Verhaltensänderungen deinen Code beeinflussen:
- Adaptives Denken ist standardmäßig aktiviert.
- Manuelles erweitertes Denken gibt jetzt einen 400-Fehler zurück (bei 4.6 war es bereits veraltet).
- Das Setzen von Sampling-Parametern — temperature, top_p, top_k — auf Werte ungleich den Standardwerten gibt einen 400-Fehler zurück.
Zwei weitere Änderungen sind für den Betrieb wichtig. Sonnet 5 bietet Aufwandsstufen (low, medium, high und xhigh), wobei höhere Aufwände mehr Tokens für die Begründung verwenden, um mehr Qualität zu erzielen — und höhere Kosten. Außerdem ist es das erste Modell der Sonnet-Klasse mit standardmäßig aktivierten Echtzeit-Schutzmaßnahmen gegen Cyberbedrohungen. Diese Schutzmaßnahmen haben eine Besonderheit, die du kennen solltest, bevor du das Modell in einen Agenten integrierst: Wenn das Modell eine markierte Anfrage ablehnt, wird die Ablehnung als erfolgreiche HTTP-200-Antwort mit stop_reason: "refusal" zurückgegeben, nicht als Fehler. Wenn deine Fehlerbehandlung davon ausgeht, dass eine Ablehnung eine Exception auslöst, funktioniert sie nicht.
Die Änderung mit der größten Reichweite steht allerdings in keiner Überschrift: der Tokenizer. Ich widme ihm einen eigenen Abschnitt, weil er die Preisberechnung verändert.
Wichtige Funktionen und Leistung
Anthropic positioniert Sonnet 5 als klare Verbesserung gegenüber 4.6 bei Reasoning, Tool-Nutzung, Programmierung und Wissensarbeit sowie als so nah an Opus 4.8, dass du deinen Punkt auf der Kosten-Leistungs-Kurve mit dem Aufwandsregler wählen kannst. Die konkreten Benchmark-Werte unten stammen laut Berichten aus den Launch-Materialien von Anthropic und der Berichterstattung am ersten Tag. Betrachte die exakten Zahlen als Angaben von Anthropic, bis du sie selbst im System Card gelesen hast.
| Benchmark |
Sonnet 5 |
Sonnet 4.6 |
Opus 4.8 |
| SWE-bench Pro (agentische Programmierung) |
63.2% |
58.1% |
69.2% |
| OSWorld-Verified (Computernutzung) |
81.2% |
78.5% |
— |
| Terminal-Bench 2.1 |
80.4% |
67.0% |
— |
| Humanity's Last Exam (mit Tools) |
57.4% |
46.8% |
57.9% |
| GDPval-AA v2 (Wissensarbeit) |
1,618 |
— |
1,615 |
Werte laut Angaben aus dem Launch von Anthropic am 30. Juni 2026; Gedankenstriche kennzeichnen Felder, die ich nicht bestätigen konnte.
Lies diese Tabelle ehrlich, und zwei Dinge fallen auf. Bei der Programmierung liegt Sonnet 5 deutlich vor 4.6, bleibt aber hinter Opus 4.8 zurück — es verringert den Abstand, schließt ihn aber nicht. Bei der Wissensarbeit liegt es knapp vor Opus 4.8 (1.618 gegenüber 1.615). Daher stammt die Aussage „schlägt Opus manchmal“, die du überall lesen wirst. Sie stimmt, aber nur knapp und bei einem Benchmark.
Hier liegt der von der Vermarktung übersprungene Kostenpunkt. Die eigenen Diagramme von Anthropic zeigen, dass Sonnet 5 bei niedrigem und mittlerem Aufwand den besten Wert bietet. Stellst du es auf xhigh, können die Kosten laut Berichten vom Launch-Tag bei vergleichbarer Qualität über Opus 4.8 steigen. „Günstiger als Opus“ ist also eine Aussage mit Sternchen: günstiger bei den Aufwandsstufen, bei denen du tatsächlich zu einem Sonnet greifen würdest, aber nicht unbedingt, wenn du den Regler ganz nach oben schiebst. Meine Einschätzung: Wenn eine Aufgabe wirklich xhigh-Reasoning benötigt, kalkuliere Opus 4.8, bevor du standardmäßig Sonnet 5 verwendest — die Annahme, dass das kleinere Modell immer günstiger ist, gilt am oberen Ende des Reglers nicht.
Bei der Sicherheit berichtet Anthropic von niedrigeren Raten bei Halluzinationen, übermäßiger Gefälligkeit und unerwünschtem Verhalten als bei 4.6 sowie von einer besseren Resistenz gegen bösartige Anfragen und Prompt-Injection-Übernahmen. Der von Anthropic selbst veröffentlichte Vorbehalt: Sonnet 5 zeigt bei der internen Prüfung weiterhin häufiger fehlgeleitetes Verhalten als Opus 4.8. Im Cyberbereich erzeugte es in Tests nie einen vollständig funktionierenden Exploit — dort ist die Fähigkeit absichtlich niedrig. Das ist ein Vorteil, wenn du einen kundenorientierten Agenten auslieferst, aber eine Einschränkung, wenn autorisierte Sicherheitsarbeit dein Anwendungsfall ist.
Claude-Sonnet-5-Preise: Ist es tatsächlich günstiger?
Die Listenpreise — direkt bei Anthropic sowie der aktuelle Preis von GPT Proto:
| |
Eingabe / 1 Mio. |
Ausgabe / 1 Mio. |
| Sonnet 5 — Einführungspreis (bis 31. Aug. 2026) |
$2 |
$10 |
| Sonnet 5 — Standardpreis (ab 1. Sept. 2026) |
$3 |
$15 |
| Sonnet 5 — über GPT Proto (aktuell) |
$1.6 |
$8 |
| Sonnet 4.6 |
$3 |
$15 |
| Opus 4.8 |
$5 |
$25 |
Beim Standardpreis kostet Sonnet 5 pro Token genauso viel wie 4.6 und liegt deutlich unter Opus 4.8. So weit, so einfach. Doch der Preis pro Token ist nicht die gesamte Rechnung.
Sonnet 5 wird mit einem neuen Tokenizer ausgeliefert — demselben, den Anthropic mit Opus 4.7 eingeführt hat. Derselbe Text wird je nach Inhaltstyp nun ungefähr auf 1,0- bis 1,35-mal so viele Tokens abgebildet. Anthropic weist in einer Fußnote offen darauf hin, ebenso auf die Konsequenz: Der Einführungspreis ist so festgelegt, dass der Wechsel von 4.6 während des Einführungszeitraums in etwa kostenneutral bleibt. Lies das sorgfältig. Der Launch-Preis von 2/10 US-Dollar ist kein reiner Rabatt; ein Teil davon gleicht die zusätzlichen Tokens aus. Und ab dem 1. September, wenn der Preis auf 3/15 US-Dollar zurückkehrt — auf dem Papier identisch mit 4.6 — kann dich eine gleichwertige Anfrage mehr kosten als bei 4.6, weil für denselben Text mehr Tokens abgerechnet werden.
Ist Sonnet 5 also günstiger als 4.6? Die ehrliche Antwort lautet: Es hängt davon ab, wann und wie intensiv du es einsetzt. Bis August effektiv ja. Danach solltest du bei derselben Arbeitslast mit Kosten pro Anfrage rechnen, die gleich bleiben oder moderat steigen, nicht sinken — und deine eigenen Prompts mit dem neuen Tokenizer messen, statt der Preisangabe pro Token blind zu vertrauen.
Wenn du Claude über GPT Proto statt direkt aufrufst, ist Sonnet 5 auf der Plattform verfügbar für 1,6 $ / 1 Mio. Eingabe-Tokens und 8 $ / 1 Mio. Ausgabe-Tokens — 20 % unter dem Anthropic-Einführungspreis von 2/10 $. Damit ist es günstiger, solange der Einführungspreis gilt. Zum Vergleich: Auf derselben Plattform kostet Sonnet 4.6 2,4/12 $ und Opus 4.8 4/20 $. Die ausführbaren Aufrufe im nächsten Abschnitt verweisen direkt auf Sonnet 5.
Claude Sonnet 5 über die API verwenden
Sonnet 5 ist jetzt auf GPT Proto verfügbar. Die ausführbaren Beispiele unten rufen es direkt auf der Modellseite von Claude Sonnet 5 auf. Wenn du von 4.6 migrierst, ist dies der von Anthropic beworbene direkte Austausch — ändere claude-sonnet-4-6 zu claude-sonnet-5 und lasse den Rest des Aufrufs unverändert.
GPT Proto stellt Claude im nativen Messages-Format von Anthropic unter https://gptproto.com/v1/messages mit einem Bearer-Token bereit. Beginnen wir mit cURL:
curl --request POST "https://gptproto.com/v1/messages" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--header "anthropic-version: 2023-06-01" \
--data '{
"model": "claude-sonnet-5",
"max_tokens": 1024,
"messages": [
{ "role": "user", "content": "Explain what an agentic coding model does in two sentences." }
]
}'
Derselbe Aufruf in Python, ausschließlich mit requests:
import os
import requests
resp = requests.post(
"https://gptproto.com/v1/messages",
headers={
"Authorization": f"Bearer {os.environ['GPTPROTO_API_KEY']}",
"Content-Type": "application/json",
"anthropic-version": "2023-06-01",
},
json={
"model": "claude-sonnet-5",
"max_tokens": 1024,
"messages": [
{"role": "user", "content": "Explain what an agentic coding model does in two sentences."}
],
},
timeout=60,
)
resp.raise_for_status()
data = resp.json()
print(data["content"][0]["text"])
Zwei Dinge solltest du bei der Migration zu Sonnet 5 beachten. Erstens verändert der Tokenizer-Wechsel deine Tokenanzahl — und damit deine Rechnung sowie den verfügbaren Spielraum bei max_tokens — selbst wenn sich der Text nicht ändert. Miss daher neu, bevor du annimmst, dass deine bisherigen Limits weiterhin ausreichen. Zweitens: Wenn dein aktueller Code temperature, top_p oder top_k auf benutzerdefinierte Werte setzt oder manuelles erweitertes Denken aktiviert, entferne diese Einstellungen. Bei Sonnet 5 führen sie zu einem 400-Fehler.
Ein einziger Schlüssel bei GPT Proto bietet Zugriff auf Claude und mehr als 200 weitere Modelle über ein gemeinsames Guthaben. So kannst du Sonnet 5 über denselben Anfragepfad mit beispielsweise einem günstigeren Modell vergleichen, ohne mehrere Anbieter zu verwalten. Die vollständige Liste findest du im Modellkatalog.
Sonnet 5 vs. Sonnet 4.6 (und falls du noch 4.5 oder 3.5 verwendest)
Dies wäre der direkte Vergleich, den ich für die Entscheidung verwenden würde, mit Opus 4.8 als Referenz für die obere Leistungsgrenze:
| |
Sonnet 5 |
Sonnet 4.6 |
Opus 4.8 |
| Positionierung |
Agentische Arbeit nahe Opus zum Sonnet-Preis |
Bisheriger Standard der mittleren Klasse |
Genauigkeitsgrenze |
| Programmierung (SWE-bench Pro) |
63.2% |
58.1% |
69.2% |
| Bester Wert bei |
Niedrigem / mittlerem Aufwand |
— |
Schwierigsten Aufgaben |
| Standardpreis (Eingabe/Ausgabe pro 1 Mio.) |
$3 / $15 |
$3 / $15 |
$5 / $25 |
| Kontext |
1 Mio. |
bis zu 1 Mio. |
200.000 |
| Kostenhinweis |
Der neue Tokenizer berechnet mehr Tokens; xhigh kann die Kosten von Opus übersteigen |
Vertrauter Tokenizer |
Für das obere Ende preislich ausgelegt |
Meine Einschätzung: Wenn du 4.6 einsetzt und dauerhaft agentische oder Programmieraufgaben ausführst, ist Sonnet 5 das Upgrade, das du testen solltest — die Fortschritte bei Programmierung und Tool-Nutzung sind real, und der Einführungspreis macht den Versuch günstig. Wenn deine Arbeitslast am oberen Ende genauigkeitskritisch ist — bei Aufgaben, bei denen eine falsche Antwort teuer wird — behalte Opus 4.8 im Einsatz und reserviere Sonnet 5 für das umfangreiche Mittelfeld. Wenn du ständig auf xhigh zurückgreifst, ist das ein Signal, Opus 4.8 zu kalkulieren, nicht anzunehmen, dass Sonnet günstiger ist.
Verwendest du noch Sonnet 4.5 oder 3.5? Dann ist das Upgrade-Argument noch stärker. Ich würde allerdings keinen eindeutigen „5 vs. 3.5“-Benchmark zitieren, weil Anthropic keinen veröffentlicht hat — alle Vergleichswerte oben beziehen sich auf 4.6. Was ich richtungsweisend sagen kann: Zwischen 3.5 und 5 liegen zwei Generationen agentischer Fortschritte, vor allem bei genau der Tool-Nutzung und Zuverlässigkeit langer Aufgaben, bei denen ältere Sonnet-Versionen an ihre Grenzen kamen. Der praktische Schritt ist unabhängig vom Ausgangspunkt derselbe: Richte deinen Code auf Sonnet 5 auf GPT Proto aus und überlasse den Rest dem Aufwandsregler.
Lohnt es sich? Eine ehrliche Einschätzung
Die Reaktionen am ersten Tag waren geteilt, und diese Teilung ist aufschlussreich. Das Lob konzentrierte sich auf das Preis-Leistungs-Verhältnis zum Einführungspreis. Die Zweifel drehten sich um dieselbe Frage, die dieser Leitfaden immer wieder aufgreift: Hält das Modell stand, wenn der Standardpreis von 3/15 $ zurückkehrt und die Token-Inflation des Tokenizers im Hintergrund ihre Wirkung entfaltet?
Das nützlichste Signal, das ich gesehen habe, war kein Benchmark, sondern ein Praxistest eines Teams für Code-Review-Tools, das das Modell mit echter Arbeit eingesetzt hat. Das Ergebnis spricht in beide Richtungen, weshalb ich ihm vertraue: Beim Schreiben und Erstellen von Code war Sonnet 5 das stärkste Modell dieser Klasse, das sie verwendet hatten. Beim Review von Code war es ein Kompromiss — die Kommentare waren sauberer und präziser, aber es entdeckte weniger Fehler als die bereits produktiv eingesetzten Modelle, bei leicht höheren Kosten pro Review. Außerdem bemerkten sie zwei Verhaltensweisen, die in Agentenschleifen die Produktivität steigern: Das Modell schreibt tendenziell Tests vor der Funktion und überarbeitet seinen eigenen Plan während einer langen Aufgabe, statt einen veralteten Plan stur weiterzuverfolgen. Der von ihnen genannte Haken entspricht Anthropics eigener Anmerkung — die neuen Cyber-Schutzmaßnahmen lösen gelegentlich bei legitimer Sicherheitsarbeit aus.
Es lohnt sich, daran zu denken: Die begeisterten Zitate im Launch-Post stammen von Early-Access-Partnern von Anthropic. Sie sind echt, aber ausgewählt, und ein Anbieter, der seine eigenen Testimonials aussucht, liefert keine neutrale Evidenz. Die unabhängige Praxiseinschätzung — stark bei der Generierung, schwächer und teurer beim Review — ist die ehrlichere Ausgangsbasis.
Wer sollte also wechseln? Teams mit umfangreicher Programmierung, Tool-Nutzung, Browser- und Terminal-Automatisierung oder Wissensarbeit, bei denen bisher für Opus zu viel bezahlt wurde, sollten wechseln und dies während des Einführungszeitraums tun, solange der Test günstig ist. Teams, deren Kernprozess aus sorgfältigen Reviews oder genauigkeitskritischen Entscheidungen besteht, sollten es testen, aber das aktuelle Modell am Launch-Tag nicht ausmustern und vor einer Festlegung die eigene Evaluierungssuite erneut ausführen.
Kurz gesagt: Sonnet 5 ist ein echter Schritt nach vorn für agentische und Programmieraufgaben, und der Einführungspreis macht es günstig zum Ausprobieren — lies „derselbe Listenpreis wie 4.6“ nur nicht als „dieselbe Rechnung“ und kalkuliere Opus 4.8, bevor du den Aufwandsregler ganz nach oben stellst. Du kannst Claude Sonnet 5 heute über GPT Proto für 1,6 $ / 8 $ aufrufen — 20 % unter Anthropics Launch-Preis — mit einem Guthaben und einem API-Schlüssel für mehr als 200 Modelle, wenn du kostenempfindliche Aufrufe an anderer Stelle routen möchtest.