Preise+7% Bonus

Was ist Step 5 Preview? StepFuns 600B-Agentenmodell erklärt

Step 5 Preview erklärt: Entdecken Sie StepFuns 600B-MoE-Modell, Preise, Benchmarks für Programmieren und Finanzen, den Kontext von 1M Tokens, den API-Zugang und den Veröffentlichungsstatus.

Was ist Step 5 Preview? StepFuns 600B-Agentenmodell erklärt

Aktualisiert am 21. September 2026

Step 5 Preview ist StepFuns neues Flaggschiffmodell für logisches Denken, Programmierung, lang laufende Agenten, professionelle Recherche und Finanzanwendungen. Die Eckdaten sind ungewöhnlich: eine dünn besetzte Mixture-of-Experts-Architektur mit 600 Milliarden Parametern, 27 Milliarden aktive Parameter pro Token, ein Kontextfenster von 1 Million Tokens und native Eingabe von Text, Bildern und Videos.

Diese Spezifikationen machen das chinesische KI-Modell interessant, sagen aber noch nicht aus, ob es sich für den Einsatz in einer Produktionsumgebung eignet. Unabhängige Tests bescheinigen ihm einen kleinen Vorsprung bei der Intelligenz gegenüber GLM 5.3 Flash und DeepSeek V4.1 Flash; beide Konkurrenten sind günstiger, und DeepSeek ist schneller.

Ein Hinweis zur Verfügbarkeit ist wichtig, bevor wir fortfahren: Step 5 Preview ist über die eigene API von StepFun verfügbar, aber Stand 21. September 2026 noch nicht auf GPTProto verfügbar. GPTProto plant, das Modell später hinzuzufügen. Entwickler, die heute ein Modell über GPTProto benötigen, können GLM 5.3 Flash, DeepSeek Flash testen oder den Katalog der Textmodelle durchstöbern.

Inhaltsverzeichnis

Was ist Step 5 Preview?

Step 5 Preview ist ein multimodales Reasoning-Modell, das vom in Shanghai ansässigen Unternehmen StepFun entwickelt wurde. Es soll planen, Tools aufrufen, Ergebnisse prüfen, seinen Ansatz überarbeiten und so lange weitermachen, bis es ein fertiges Ergebnis liefert.

Hier sind die wichtigsten Fakten aus der offiziellen Modelldokumentation und der Launch-Seite von StepFun:

Spezifikation Step 5 Preview
Entwickler StepFun
Modell-ID step-5-preview
Architektur Sparse Mixture of Experts
Parameter 600B insgesamt, 27B aktiv pro Token
Kontextfenster 1M Tokens
Maximale Ausgabe 64K Tokens
Eingabe Text, Bilder und Video
Ausgabe Text
Reasoning-Steuerung low, medium oder high
API-Status Bei StepFun verfügbar
Open-Weight-Status Veröffentlichung für den 15. Oktober 2026 geplant
GPT Proto-Status Noch nicht verfügbar; Integration geplant

„Preview“ ist wichtig. Die API kann bereits verwendet werden, aber Verhalten, Limits, Preise und sogar der Name können sich vor einer stabilen Veröffentlichung noch ändern. StepFun zufolge werden die Modellgewichte am 15. Oktober 2026 veröffentlicht. Bis dahin sollte das Modell als gehostetes proprietäres Modell betrachtet werden – nicht als Open-Weight-Modell, das bereits selbst gehostet werden kann.

Funktionen und Architektur von Step 5 Preview

600B Parameter, ohne alle 600B zu aktivieren

Step 5 Preview verwendet eine Sparse-Mixture-of-Experts-Architektur (MoE). Insgesamt umfasst das Modell 600 Milliarden Parameter, aber pro Token sind nur 27 Milliarden aktiv. Ein Routing-System wählt die Experten aus, die für die jeweilige Eingabe relevant sind.

„600B“ bezeichnet die Gesamtkapazität; es bedeutet nicht, dass jedes Token die Kosten eines dichten 600B-Modells verursacht. Für die Inferenz-Effizienz ist die Zahl der aktiven Parameter aussagekräftiger, doch tatsächliche Leistung hängt weiterhin von Hardware, Batching, Reasoning-Länge und Anbieterkapazität ab.

Ein Kontext mit 1M Tokens und eine Ausgabe mit 64K Tokens

Das Kontextfenster mit 1 Million Tokens ist auf große Repositories, Berichte, Unterhaltungen und Dokumentensammlungen ausgelegt. Die maximale Ausgabe beträgt 64.000 Tokens. Auch bei großem Kontext ist eine disziplinierte Informationssuche wichtig: Mehr Material kann irrelevante Belege, widersprüchliche Anweisungen und höhere Kosten mit sich bringen.

Prompt-Caching macht wiederholte Arbeit mit derselben Codebasis, Richtliniensammlung oder demselben Forschungskorpus deutlich günstiger, als nicht zwischengespeicherte Eingaben wiederholt zu senden.

Text-, Bild- und Videoeingaben

Das Modell akzeptiert Text, bis zu 60 Bilder pro Anfrage und Videos. Bilder können im JPEG-, PNG-, WebP- oder statischen GIF-Format vorliegen. Zu den Videoformaten gehören MP4, QuickTime und Matroska; StepFun empfiehlt Clips mit einer Länge von weniger als fünf Minuten.

In Datenbanken von Drittanbietern werden möglicherweise nur Text- und Bildeingaben aufgeführt. Das widerspricht StepFun nicht unbedingt. Artificial Analysis dokumentiert beispielsweise die Modalitäten, die in seinem Eintrag und seinen Tests abgedeckt werden, während StepFun die Video-Unterstützung in der eigenen API dokumentiert. Für Implementierungslimits sollten Sie die Dokumentation des Anbieters verwenden, für Leistungsvergleiche unabhängige Tests.

Tool-Aufrufe bedeuten keinen integrierten Zugriff auf die Außenwelt

Step 5 Preview unterstützt Streaming, Function Calling, den JSON-Modus, JSON Schema und eine einstellbare Reasoning-Intensität. Das Modell kann jedoch nicht eigenständig im Web suchen, Code ausführen oder auf Dateien von Entwicklern zugreifen. StepFun weist ausdrücklich darauf hin, dass die integrierende Anwendung Suche, Codeausführung, Dokumentenverarbeitung und andere Tools bereitstellen muss.

Das Modell kann entscheiden, wann und wie es ein Tool verwendet. Das umgebende Agentensystem kontrolliert jedoch die verfügbaren Tools, Berechtigungen und Ergebnisvalidierung.

Step 5 Preview für Coding und agentische Aufgaben

In einem Coding-Agent erhält das Modell ein Ziel, liest Dateien, nimmt Änderungen vor, führt Tests aus, wertet Fehler aus und wiederholt den Prozess. Dank des langen Kontexts kann es die Repository-Struktur und frühere Entscheidungen über mehrere Durchläufe hinweg berücksichtigen.

StepFun gibt für das Modell bei hoher Reasoning-Intensität folgende Ergebnisse an:

Benchmark Ergebnis von Step 5 Preview Was getestet wird
DeepSWE v1.1 67.7% Softwareentwicklung auf Repository-Ebene
StepCodeBench 49.0% Programmieraufgaben in mehreren Sprachen
Terminal-Bench v4 33.3% Coding- und Terminal-Tool-Nutzung
Agents’ Last Exam (ALE-CLI) 29.5% Aufgaben für Agenten zur Computernutzung
GPQA Diamond 93.5% Reasoning und Wissen auf Hochschulniveau
HLE 46.5% Breit gefächerte, schwierige Expertenfragen

Diese Ergebnisse wurden vom Anbieter gemeldet. StepCodeBench ist ein interner Benchmark; einige Konkurrenzmodelle verwenden die Reasoning-Stufe „Max“, während Step 5 „High“ nutzt; und bei manchen Vergleichen mit HLE und Tools kommen unterschiedliche Teilmengen zum Einsatz. Die Ergebnisse zeigen Leistungsfähigkeit, aber keine garantierte Überlegenheit bei einem bestimmten Repository.

StepFun räumt bei den schwierigsten, lang andauernden Coding-Aufgaben eine erhebliche Leistungslücke ein. Testen Sie die Fehlerbehebung, Funktionserweiterungen, Testgenerierung und das Zurücksetzen von Änderungen mit Ihrem eigenen Code und messen Sie anschließend die Zahl der akzeptierten Aufgaben pro Dollar und Minute.

Frühe Erfahrungsberichte aus der Community sind rar. In einem Launch-Thread auf Linux DO gefiel einem Nutzer das sichtbare Zwischendenken; in Reddit-Diskussionen ging es eher um durchgesickerte oder gespiegelte Gewichte als um die Zuverlässigkeit im Produktivbetrieb. Solche Anekdoten vom Launch-Tag liefern Anhaltspunkte für Tests, aber keine Rangfolge.

Warum Step 5 Preview auf Finanzen ausgerichtet ist

Bei Step 5 Preview im Finanzbereich geht es nicht einfach darum, Fragen zur Buchhaltung zu beantworten. StepFun zielt auf Analysten-Workflows ab, in denen Unternehmensberichte und Marktdaten zusammengetragen, Definitionen abgeglichen, Bewertungen erstellt, Berechnungen durchgeführt und prüfbare Berichte erstellt werden. Quellen, Annahmen, Formeln und Sensitivitäten müssen nachvollziehbar bleiben.

StepFun gibt für den externen Benchmark FrontierFinance 66.4% an. Außerdem meldet das Unternehmen 74.5% bei FinStepBench LiveSearch, 60.6% bei CorporateValuation und 55.8% bei Finance Deep Research. Die letzten drei Benchmarks stammen von StepFun selbst und sollten daher weniger stark gewichtet werden als unabhängige Tests, bis Dritte die Ergebnisse reproduziert haben.

Ein gutes Ergebnis macht unbeaufsichtigte Finanzentscheidungen nicht sicher. Sorgen Sie für nachvollziehbare Quellenangaben, Berechnungsverläufe, Freigabeschritte und menschliche Prüfung – insbesondere bei Anlage-, Kredit-, Steuer- oder Compliance-Entscheidungen.

Wie gut schneidet Step 5 Preview in unabhängigen Tests ab?

Artificial Analysis bewertet Step 5 Preview mit einem Intelligence-Index-Wert von 44. Auf der API von StepFun wurden eine Ausgabe von 99.8 Tokens pro Sekunde, eine Zeit bis zum ersten Token von 2.96 Sekunden und Kosten von $0.72 pro Intelligence-Index-Aufgabe gemessen.

Der wichtige Vorbehalt betrifft die Ausführlichkeit: Bei der Evaluation wurden 160 Millionen Ausgabetokens erzeugt, gegenüber einem Median von 92 Millionen für die Klasse. Selbst ein günstiger Tokenpreis kann zu hohen Kosten pro Aufgabe führen. Deshalb benötigen Produktivsysteme Ausgabelimits, eine angemessene Reasoning-Intensität und Abbruchbedingungen.

Unabhängige Tests führen außerdem Text- und Bildeingaben, aber keine Videoeingaben auf. Das spiegelt den Umfang des Modelleintrags beim Evaluator wider; für die Videofähigkeit ist weiterhin die offizielle API-Dokumentation von StepFun maßgeblich. Wenn Sie diese beiden Arten von Nachweisen getrennt betrachten, wird ein Unterschied im Testumfang nicht fälschlich als Widerspruch interpretiert.

Die Preise von Step 5 Preview erklärt

Auf der offiziellen Preisseite von StepFun werden drei Tarife pro 1 Million Tokens aufgeführt:

Tokentyp Preis
Nicht zwischengespeicherte Eingabe $1.00
Zwischengespeicherte Eingabe $0.05
Ausgabe $2.70

Bei Step 5 Preview umfasst der Preis für Eingaben bei einem Cache-Miss das Schreiben neuer Inhalte in den Cache. Bei der Abrechnung der Ausgabe zählen sowohl Reasoning-Tokens als auch die endgültige Antwort; verstecktes Reasoning ist also nicht kostenlos.

Zum Beispiel kosten 100.000 nicht zwischengespeicherte Eingabetokens plus 10.000 Ausgabetokens etwa $0.127. Ist die Eingabe vollständig zwischengespeichert, kostet dieselbe Anfrage etwa $0.032. Tool-Schleifen, Wiederholungen und die Länge des Reasonings können die Gesamtkosten verändern.

Das ist der Preis von StepFun, nicht der Preis von GPT Proto. GPT Proto hat das Modell noch nicht aufgenommen, daher gibt es keinen gültigen GPT Proto-Preis für Step 5 Preview.

Step 5 Preview im Vergleich zu GLM 5.3 Flash und DeepSeek Flash

Diese Tabelle verwendet Daten von Artificial Analysis mit Stand vom 21. September 2026. DeepSeek Flash bezeichnet DeepSeek V4.1 Flash bei maximaler Reasoning-Intensität.

Modell Intelligence Index Ausgabegeschwindigkeit Eingabe / Ausgabe pro 1M Tokens Kosten pro Aufgabe Kontext Gewichte
Step 5 Preview 44 99.8 tok/s $1.00 / $2.70 $0.72 1M Geplant für 15. Okt.
GLM 5.3 Flash 42 95.0 tok/s $0.15 / $0.50 $0.25 1M Offen, MIT
DeepSeek V4.1 Flash 39 242.3 tok/s $0.30 / $1.20 $0.27 1M Offen, MIT

GLM 5.3 Flash im Vergleich zu Step 5 Preview

Step 5 Preview liegt beim Index um zwei Punkte vorn und erreicht eine ähnliche Geschwindigkeit. GLM ist deutlich günstiger, und seine MIT-lizenzierten Gewichte sind bereits verfügbar. Step 5 ist für Finanz-Workflows oder offizielle Videoeingaben interessanter; GLM ist der bessere Ausgangspunkt, wenn Kosten und Self-Hosting wichtig sind.

Step 5 Preview im Vergleich zu DeepSeek Flash

Step 5 liegt beim Index um fünf Punkte vorn, aber DeepSeek ist mehr als doppelt so schnell, kostet pro Aufgabe deutlich weniger und ist bereits als Open-Weight-Modell verfügbar. Wählen Sie Step 5 nur, wenn sein Reasoning genug zusätzliche akzeptierte Arbeit liefert, um langsamere und teurere Durchläufe zu rechtfertigen.

GPT Proto bietet derzeit sowohl GLM 5.3 Flash als auch DeepSeek Flash an. Einen ausführlicheren Vergleich dieser verfügbaren Optionen finden Sie unter GLM 5.3 Flash im Vergleich zu DeepSeek V4 Flash.

Wie können Sie auf Step 5 Preview zugreifen?

Entwickler können StepFuns Endpunkt POST /v1/chat/completions mit der Modell-ID step-5-preview aufrufen. Das Anfrageformat entspricht dem OpenAI-Stil für Chat-Completions. Dieses Beispiel richtet sich direkt an StepFun; es ist kein GPT Proto-Endpunkt.

curl https://api.stepfun.ai/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $STEP_API_KEY" \
  -d '{
    "model": "step-5-preview",
    "messages": [
      {
        "role": "user",
        "content": "Review this repository migration plan and list the three highest-risk assumptions."
      }
    ],
    "reasoning_effort": "medium",
    "max_tokens": 1200
  }'

Vor dem Einsatz in der Produktion sollten Sie in der offiziellen API-Referenz die aktuellen Parameter, Fehlermeldungen, Ratenlimits und multimodalen Anfrageformate prüfen.

Wenn Sie einen einzigen Kontostand und eine einheitliche Oberfläche für viele Modelle bevorzugen: GPT Proto plant, Step 5 Preview später hinzuzufügen. Solange das Modell nicht im aktuellen Katalog erscheint, sollten Sie nicht davon ausgehen, dass ein ähnlicher Name, ein Drittanbieter-Mirror oder eine inoffizielle Route die GPT Proto-Integration ist.

Lohnt es sich, Step 5 Preview auszuprobieren?

Step 5 Preview sollte für lange Dokumente, Coding-Agenten, multimodale Forschung oder nachvollziehbare Finanz-Workflows kontrolliert evaluiert werden. Der unabhängige Intelligence-Index-Wert ist stark, und der Kontext mit 1M Tokens ist nützlich.

Es ist nicht die Standardwahl. GLM ist günstiger und als Open-Weight-Modell verfügbar; DeepSeek ist deutlich schneller; und Step 5 ist weiterhin ausführlich, in der Preview-Phase und bei GPT Proto nicht verfügbar.

Die beste Entscheidungsgrundlage ist die erledigte und geprüfte Arbeit – nicht die Parameterzahl oder ein einzelner Benchmark. Führen Sie dieselben repräsentativen Aufgaben mit jedem Kandidaten aus, erfassen Sie Korrektheit, Eingriffsrate, Latenz und Gesamtkosten für Tokens und wählen Sie dann das Modell, das die niedrigsten Kosten pro akzeptiertem Ergebnis erzielt.

Häufig gestellte Fragen

Was ist Step 5 Preview?

Step 5 Preview ist StepFuns Reasoning-Modell mit insgesamt 600B Parametern und 27B aktiven Parametern, das eine Sparse-MoE-Architektur nutzt. Es ist auf agentisches Programmieren, professionelle Arbeit, Finanzen und multimodale Analysen ausgelegt. Es unterstützt einen Kontext von 1M Tokens sowie Text-, Bild- und Videoeingaben.

Wann wurde Step 5 Preview veröffentlicht?

Step 5 Preview wurde im September 2026 über eine API verfügbar. Artificial Analysis gibt den 18. September an, während StepFuns öffentliche Ankündigung zum Start etwa am 20. September erschien. StepFun zufolge ist die Veröffentlichung offener Gewichte für den 15. Oktober 2026 geplant.

Wie viel kostet Step 5 Preview?

StepFun berechnet $1.00 pro 1M nicht zwischengespeicherte Eingabe-Tokens, $0.05 pro 1M zwischengespeicherte Eingabe-Tokens und $2.70 pro 1M Ausgabe-Tokens. Reasoning-Tokens sind in der Abrechnung der Ausgabe enthalten.

Ist Step 5 Preview Open Source?

Noch nicht. StepFun zufolge ist die Veröffentlichung offener Gewichte für den 15. Oktober 2026 geplant. Die Lizenz und die endgültigen Veröffentlichungsdetails sollten geprüft werden, sobald die Gewichte tatsächlich verfügbar sind.

Unterstützt Step 5 Preview Video?

Ja. In der offiziellen Dokumentation von StepFun werden Text-, Bild- und Videoeingaben sowie Textausgaben aufgeführt. Einige unabhängige Modelldatenbanken listen nur die von ihnen getesteten Modalitäten. Daher werden dort möglicherweise nur Text und Bild angezeigt.

Eignet sich Step 5 Preview gut zum Programmieren?

Benchmarks des Anbieters deuten auf starke Leistungen beim Programmieren auf Repository-Ebene und beim agentischen Verhalten hin. Die Ergebnisse unterscheiden sich jedoch je nach Test, und StepFun räumt ein, dass bei den schwierigsten, lang andauernden Aufgaben noch Verbesserungsbedarf besteht. Testen Sie das Modell mit Ihren eigenen Repositories, bevor Sie eine Entscheidung für den Produktionseinsatz treffen.

Ist Step 5 Preview besser als GLM 5.3 Flash?

Im aktuellen Intelligence Index von Artificial Analysis erzielt das Modell mit 44 Punkten einen etwas höheren Wert als GLM 5.3 Flash mit 42 Punkten. GLM 5.3 Flash ist deutlich günstiger und bereits mit offenen Gewichten verfügbar; die gemessenen Ausgabegeschwindigkeiten sind ähnlich.

Verwandte Artikel

Weitere Blogbeiträge
Was ist Jev? Das System-One-Modell von TypeSafe AI erklärt

Was ist Jev? Das System-One-Modell von TypeSafe AI erklärt

TL;DR Jev ist das erste System-One-Modell von TypeSafe AI: ein Modell, das Text oder textähnliche Anwendungszustände in vordefinierte, typisierte Entscheidungen mit Wahrscheinlichkeitsangaben umwandelt. Anders als ein herkömmliches großes Sprachmodell soll Jev keine Antwort Token für Token verfassen. Es bewertet klar abgegrenzte Fragen und gibt parallel strukturierte Ergebnisse zurück. Das macht es interessant für Klassifizierung, Weiterleitung, Bewertung, Validierung und die Auswahl von Agentenaktionen – aber nicht für freies Schreiben, Programmieren oder mehrstufiges Schlussfolgern. Am besten versteht man Jev nicht als „schnelleren Chatbot“, sondern als probabilistische Entscheidungskomponente, die Software aufrufen kann, wenn herkömmliche Regeln zu starr sind, aber keine freie Textgenerierung benötigt wird. Jev Latest auf GPTProto testen Aktualisierung – 23. September 2026: Jev Latest ist jetzt über GPTProto verfügbar. Auf der API-Modellseite von Jev Latest findest du die aktuellen Preise und das aktuelle Anfrageformat für Choice-, Score- und Noul-Entscheidungen.

Michael Johnson | 2026-09-20

5 beste APIs für Tech-Start-ups 2026: Ein schlanker MVP-Stack

5 beste APIs für Tech-Start-ups 2026: Ein schlanker MVP-Stack

Ein Startup verliert seinen ersten Monat selten, weil es sich für die „falsche“ Datenbankmarke entschieden hat. Es verliert ihn an den Schnittstellen: durch nicht zusammenpassende Berechtigungen, Zahlungsereignisse, die Abonnements nicht aktualisieren, durchgesickerte KI-Schlüssel oder fehlende Transaktions-E-Mails. Dies ist daher ein praxisorientierter API-Stack für ein abonnementbasiertes Webprodukt – insbesondere ein KI-SaaS-MVP – und kein Verzeichnis zusammenhangloser Tools. Meine Standardempfehlung ist GPTProto für KI-Inferenz, Supabase für Daten und Backend-Dienste, Stripe für Zahlungen und Resend für Transaktions-E-Mails . Clerk ist die fünfte Option, aber ein Upgrade statt einer Voraussetzung, da Supabase bereits Authentifizierung umfasst. Der Stack kann bei den Nicht-KI-Diensten ohne feste monatliche Plattformgebühren starten. Modellaufrufe, erfolgreiche Zahlungen und eine übermäßige Nutzung verursachen jedoch weiterhin variable Kosten. Ein Schlüssel für dein Team Die Preise und Tariflimits in diesem Leitfaden wurden am 18. September 2026 überprüft. Prüfe die verlinkten Produktseiten, bevor du ein Produktionsbudget festlegst.

Schuyler Stacy | 2026-09-18

Was ist GPT-6 Sol? Funktionen, Preise, API-Zugang und Tests

Was ist GPT-6 Sol? Funktionen, Preise, API-Zugang und Tests

GPT-6 Sol ist ein OpenAI-GPT-6-Modell für komplexe Programmieraufgaben und agentische Workflows , das günstiger ist als GPT-6 Astra. OpenAI hat es am 22. September 2026 veröffentlicht , unter der öffentlichen Modell-ID gpt-6-sol . Du kannst GPT-6 Sol jetzt auf GPTProto verwenden . Wenn bei deinem Workload Durchsatz und Kosten wichtiger sind als maximale Programmierfähigkeiten, ist GPT-6 Luna ebenfalls auf GPTProto verfügbar . Zuletzt geprüft: 23. September 2026. Dieser Leitfaden berücksichtigt jetzt die offizielle Veröffentlichung, die Modellspezifikationen, die Listenpreise von OpenAI und die Verfügbarkeit auf GPTProto. Preise und Zugriff können sich ändern. Prüfe daher die aktuelle Modellseite, bevor du Produktionsdatenverkehr umstellst. Frage Verifizierte Antwort Ist GPT-6 Sol veröffentlicht? Ja – am 22. September 2026 Öffentliche Modell-ID gpt-6-sol Wofür wurde es entwickelt? Komplexe Programmieraufgaben und agentische Workflows Kontextfenster 1,050,000 Tokens Maximale Ausgabe 128,000 Tokens Wissensstand bis 20. April 2026 Offizieller Standard-API-Preis $2 / 1 Mio. Eingabe-Tokens; $10 / 1 Mio. Ausgabe-Tokens Eingabe und Ausgabe Text- und Bildeingabe; Textausgabe Kann man es über GPTProto nutzen? Ja – öffne die GPT-6-Sol-Modellseite GPT-6-SOL-API-Schlüssel entdecken

Michael Johnson | 2026-09-17

6 erschwingliche LLM-APIs für KI-Agenten im Jahr 2026

6 erschwingliche LLM-APIs für KI-Agenten im Jahr 2026

Eine erschwingliche LLM-API für einen KI-Agenten ist nicht unbedingt das Modell mit dem niedrigsten Preis pro Eingabe-Token. Ein Agent kann ein Tool auswählen, Argumente erstellen, das Ergebnis lesen, seinen Plan überarbeiten und ein weiteres Tool aufrufen, bevor er eine brauchbare Antwort liefert. Ein günstiges Modell, das ungültige Aufrufe tätigt oder mehrere Wiederholungsversuche benötigt, kann daher mehr kosten als ein etwas teureres Modell, das die Aufgabe auf Anhieb erledigt. Dieser Leitfaden vergleicht sechs agententaugliche Modelle, die über GPTProto verfügbar sind. Die Rangliste berücksichtigt API-Preise, Tool-Nutzung, unabhängige Leistungsnachweise, Geschwindigkeit, Kontextlimits sowie das praktische Risiko, für unnötige Agent-Schleifen zu bezahlen. Es handelt sich um einen Vergleich öffentlicher Benchmarks und Preise – nicht um die Behauptung, dass wir einen privaten direkten Vergleichstest durchgeführt haben. Ein Schlüssel für Ihr Team Kurz gesagt: GLM-5.3 Flash ist für die meisten kostenbewussten Agenten die beste Standardwahl. DeepSeek Flash ist die schnellere Alternative mit offenen Gewichten, während GPT-5.6 Luna für leichte Aufgaben mit hohem Volumen vielversprechend ist, sobald der Preis für die Live-Route bestätigt ist. MiniMax M3 eignet sich für lange Dokumentensitzungen, Gemini 3.8 Flash ist bei der multimodalen Geschwindigkeit führend, und Grok 4.6 sollte eher als Eskalationsmodell für schwierigere Aufgaben betrachtet werden.

Michael Johnson | 2026-09-15