Anthropicは2026年6月30日にClaude Sonnet 5をリリースしました。その1時間以内に、私のフィードは「Sonnet 4.6から移行すべきか」と「『4.6と同じ定価』という主張は、実際のトラフィックを流した場合にも本当に当てはまるのか」という2つの質問で埋め尽くされました。私も気になっているのはこの2点なので、このガイドではローンチ記事のハイライトではなく、これらの疑問を中心に説明します。ここで扱う技術的な内容はすべてAnthropic自身のローンチ記事とドキュメントに基づいています。直接読めるページではなく報道に由来する数字については、その旨を明記します。
まず最初に、多くの初期記事が間違えている点を押さえておきましょう。Sonnet 5の前身は、2026年2月にリリースされたSonnet 4.6であり、Sonnet 4.5ではありません。4.5やさらに古い3.5と比較している場合、それは2世代分のアップグレードをまたいだ比較になるため、以下の数字とは一致しません。この点については後ほど改めて説明します。
Claude Sonnet 5とは?
Sonnet 5はAnthropicの最新の中価格帯モデルであり、これまでで最もエージェント性能に優れたSonnetとして位置づけられています。計画を立て、ブラウザやターミナルを操作し、複数ステップのタスクを自律的に実行します。Anthropicが前面に出しているのは、コストパフォーマンスという観点です。Opus 4.8に近い性能を、Sonnetの料金で実現します。
仕組みの話に入る前に、この位置づけが重要な理由を説明します。昨年の大半において、エージェント性能の大きな向上はSonnetではなくOpus層に集中していました。そのため、大量のエージェント処理を行うチームは、必要な性能を常に使うわけではないのに、Opusの料金を支払わざるを得ませんでした。Sonnet 5は、その性能の一部をより低い価格帯に引き下げようとするAnthropicの試みです。これが「なぜ」であり、その後に続く設計上の選択の多くを説明しています。
Anthropicのドキュメントによる仕組みは次のとおりです。Sonnet 4.6のドロップイン置換として利用でき、APIのモデルIDはclaude-sonnet-5です。コンテキストウィンドウはデフォルトと最大値の両方が100万トークンで、最大128kの出力トークンに対応します。入力はテキストと画像、出力はテキストです。
| |
Claude Sonnet 5 |
| リリース日 |
2026年6月30日 |
| APIモデルID |
claude-sonnet-5 |
| コンテキストウィンドウ |
100万トークン(デフォルトおよび最大) |
| 最大出力 |
128kトークン |
| 入力/出力 |
テキスト+画像入力、テキスト出力 |
| 4.6との関係 |
ドロップイン置換 |
Sonnet 4.6からの新機能
すでにSonnet 4.6を利用している場合、今回のアップグレードは単なる重みの更新ではありません。Anthropicのドキュメントによると、コードに影響する動作変更が3つあります。
- 適応型思考がデフォルトで有効になっています。
- 手動の拡張思考を指定すると、400エラーが返されます(4.6でもすでに非推奨でした)。
- サンプリングパラメータ(temperature、top_p、top_k)をデフォルト以外の値に設定すると、400エラーが返されます。
運用面で重要な変更がさらに2つあります。Sonnet 5では、低・中・高・xhighの努力レベルを利用できます。努力レベルを上げると、品質向上のために推論により多くのトークンを使い、その分コストも増えます。また、デフォルトでリアルタイムのサイバーセーフガードが有効になった初のSonnet層モデルでもあります。このセーフガードには、エージェントに組み込む前に知っておくべき特徴があります。モデルがフラグ付きのリクエストを拒否すると、エラーではなく、成功したHTTP 200としてstop_reason: "refusal"が返されます。エラーハンドリングが拒否を例外として扱う前提になっている場合、機能しません。
ただし、最も広範囲に影響する変更は、見出しになることのないものです。それがトークナイザーです。料金計算が変わるため、独立したセクションで説明します。
主な機能と性能
Anthropicは、推論、ツール利用、コーディング、ナレッジワークのすべてにおいてSonnet 5が4.6を厳密に上回り、Opus 4.8にも十分近いため、努力レベルのダイヤルでコストパフォーマンス曲線上の位置を選べるとしています。以下の具体的なベンチマーク数値は、Anthropicのローンチ資料と初日の報道で報告されたものです。System Cardで実際に確認するまでは、正確な数値はAnthropicによる報告値として扱ってください。
| ベンチマーク |
Sonnet 5 |
Sonnet 4.6 |
Opus 4.8 |
| SWE-bench Pro(エージェント型コーディング) |
63.2% |
58.1% |
69.2% |
| OSWorld-Verified(コンピューター操作) |
81.2% |
78.5% |
— |
| Terminal-Bench 2.1 |
80.4% |
67.0% |
— |
| Humanity's Last Exam(ツール使用) |
57.4% |
46.8% |
57.9% |
| GDPval-AA v2(ナレッジワーク) |
1,618 |
— |
1,615 |
数値はAnthropicの2026年6月30日のローンチ時の報告値。ダッシュは確認できなかったセルを示します。
この表を正直に読むと、2つの点が目立ちます。コーディングではSonnet 5は4.6を実質的な差で上回りますが、それでもOpus 4.8を下回っています。差は縮まりましたが、埋まったわけではありません。ナレッジワークではOpus 4.8をわずかに上回っています(1,618対1,615)。これが、あちこちで繰り返される「Opusを上回ることがある」という文句の出所です。これは事実ですが、1つのベンチマークにおける、わずかな差にすぎません。
ハイライト記事が省略しているのが、コストです。Anthropic自身のグラフでは、Sonnet 5の最高の価値は低・中努力レベルで得られます。xhighまで上げると、ローンチ当日の報道によれば、同等の品質に対するコストがOpus 4.8を超える可能性があります。したがって「Opusより安い」という主張には但し書きが必要です。Sonnetに期待する努力レベルなら安いのであって、最高レベルまで引き上げた場合も必ず安いとは限りません。私の見解では、タスクに本当にxhighの推論が必要なら、Sonnet 5をデフォルトにする前にOpus 4.8の料金も見積もるべきです。小さいモデルなら常に安いという直感は、ダイヤルを最大にすると成り立たなくなります。
安全性について、Anthropicは4.6と比べて、ハルシネーション、迎合、望ましくない挙動の発生率が低く、悪意あるリクエストやプロンプトインジェクションによる乗っ取りへの耐性も高いと報告しています。ただし、Anthropic自身が公表している注意点として、内部監査ではSonnet 5の不整合な挙動の割合がOpus 4.8より高くなっています。またサイバー領域では、テスト中に完全に動作するエクスプロイトを生成することはありませんでした。そこでは意図的に能力を低く抑えており、顧客向けエージェントを提供する場合は利点ですが、承認済みのセキュリティ業務が用途なら制限になります。
Claude Sonnet 5の料金:本当に安いのか?
表示価格(Anthropicの直接提供、およびGPT Protoの現在の料金):
| |
入力/100万 |
出力/100万 |
| Sonnet 5 — 導入価格(2026年8月31日まで) |
$2 |
$10 |
| Sonnet 5 — 標準価格(2026年9月1日から) |
$3 |
$15 |
| Sonnet 5 — GPT Proto経由(現在) |
$1.6 |
$8 |
| Sonnet 4.6 |
$3 |
$15 |
| Opus 4.8 |
$5 |
$25 |
標準価格では、Sonnet 5のトークン単価は4.6と同じで、Opus 4.8を大きく下回ります。単純な話です。ただし、トークン単価だけが請求額のすべてではありません。
Sonnet 5には新しいトークナイザーが搭載されています。これはAnthropicがOpus 4.7で導入したものと同じで、同じテキストでも内容の種類によっておよそ1.0〜1.35倍のトークンに変換されます。Anthropicは脚注でこの点と、その結果を明示しています。導入価格は、導入期間中の4.6からの移行がおおむねコスト中立になるよう設定されています。ここは注意して読んでください。$2/$10のローンチ価格は純粋な割引ではなく、その一部は増加したトークンを相殺するためのものです。そして9月1日に価格が$3/$15へ戻ると、紙の上では4.6と同じでも、同じテキストに対してより多くのトークンが請求されるため、同等のリクエストが4.6より高くなる可能性があります。
では、Sonnet 5は4.6より安いのでしょうか。正直な答えは、いつ、どの程度の負荷で使うかによります。8月中は、実質的に安いと言えます。その後、同じワークロードでは、リクエストあたりのコストは安くなるのではなく、横ばいからやや高くなると考えてください。トークン単価の表示をそのまま信じず、新しいトークナイザーで自分のプロンプトを測定しましょう。
Claudeを直接ではなくGPT Proto経由で呼び出す場合、Sonnet 5はプラットフォームで利用可能です。入力100万トークンあたり$1.6、出力100万トークンあたり$8で、Anthropicの導入価格$2/$10より20%安く、ローンチ価格が続く間はより安い選択肢になります。同じプラットフォームでは、Sonnet 4.6は$2.4/$12、Opus 4.8は$4/$20です。次のセクションの実行可能な呼び出しは、Sonnet 5を直接指定しています。
API経由でClaude Sonnet 5を使う方法
Sonnet 5はGPT Protoで利用可能になっているため、以下の実行可能な例ではClaude Sonnet 5のモデルページを直接呼び出します。4.6から移行する場合、これはAnthropicが案内しているドロップイン置換です。claude-sonnet-4-6をclaude-sonnet-5に変更し、それ以外の呼び出し内容はそのままにします。
GPT Protoは、AnthropicのネイティブMessages形式でClaudeをhttps://gptproto.com/v1/messagesBearerトークン付きで利用できるようにしています。まずはcURLです。
curl --request POST "https://gptproto.com/v1/messages" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--header "anthropic-version: 2023-06-01" \
--data '{
"model": "claude-sonnet-5",
"max_tokens": 1024,
"messages": [
{ "role": "user", "content": "Explain what an agentic coding model does in two sentences." }
]
}'
同じ呼び出しを、requestsだけを使ってPythonで記述すると次のようになります。
import os
import requests
resp = requests.post(
"https://gptproto.com/v1/messages",
headers={
"Authorization": f"Bearer {os.environ['GPTPROTO_API_KEY']}",
"Content-Type": "application/json",
"anthropic-version": "2023-06-01",
},
json={
"model": "claude-sonnet-5",
"max_tokens": 1024,
"messages": [
{"role": "user", "content": "Explain what an agentic coding model does in two sentences."}
],
},
timeout=60,
)
resp.raise_for_status()
data = resp.json()
print(data["content"][0]["text"])
Sonnet 5への移行時に引き継ぐべき点が2つあります。まず、トークナイザーの変更により、テキスト自体が変わらなくてもトークン数、つまり請求額とmax_tokensの余裕が変わります。既存の上限で足りると思い込む前に、再測定してください。次に、現在のコードでtemperature、top_p、top_kをカスタム値に設定している場合、または手動の拡張思考を有効にしている場合は、それらを削除してください。Sonnet 5では400エラーになります。
GPT Protoでは1つのキーでClaudeとその他200以上のモデルを1つの残高から利用できるため、プロバイダーを切り替えることなく、同じリクエスト経路でSonnet 5をより安価なモデルなどと比較できます。全モデルの一覧はモデルカタログにあります。
Sonnet 5対Sonnet 4.6(まだ4.5または3.5を使っている場合)
Opus 4.8を性能上限の基準として加えた、実際に判断に使う比較は次のとおりです。
| |
Sonnet 5 |
Sonnet 4.6 |
Opus 4.8 |
| 位置づけ |
Sonnet価格で、Opusに近いエージェント処理 |
従来の中価格帯標準 |
精度の上限 |
| コーディング(SWE-bench Pro) |
63.2% |
58.1% |
69.2% |
| 最も価値が高い条件 |
低/中努力レベル |
— |
最も難しいタスク |
| 標準価格(入力/出力、100万あたり) |
$3 / $15 |
$3 / $15 |
$5 / $25 |
| コンテキスト |
100万 |
最大100万 |
20万 |
| コストに関する注意点 |
新しいトークナイザーにより請求トークン数が増加。xhighではOpusのコストを超える可能性あり |
使い慣れたトークナイザー |
最高性能向けの価格設定 |
私の見解では、4.6で継続的なエージェント処理やコーディングを行っているなら、Sonnet 5は試すべきアップグレードです。コーディングとツール利用の向上は実際にあり、導入価格によって安価に試せます。最高水準の精度が重要なワークロード、つまり誤答のコストが高いタスクでは、Opus 4.8も選択肢に残し、Sonnet 5は大量処理の中間層に使うとよいでしょう。xhighを常に使うことになるなら、Sonnetのほうが安いと決めつけるのではなく、Opus 4.8の料金を見積もるべきサインです。
まだSonnet 4.5や3.5を使っていますか?それならアップグレードの根拠はさらに強くなります。ただし、Anthropicは「5対3.5」の明確なベンチマークを公開していないため、断定的な比較数値を提示するのは控えます。上記の対戦形式の数値はすべて4.6との比較です。方向性として言えるのは、3.5と5の間には2世代分のエージェント性能向上があり、その多くは、旧Sonnetが十分に対応できなかったツール利用や長時間タスクの信頼性に関するものだということです。出発点がどこであっても、実際の移行方法は同じです。コードの接続先をGPT Proto上のSonnet 5に変更し、あとは努力レベルを調整してください。
導入する価値はあるか?率直な評価
初日の反応は分かれていましたが、その分裂には意味があります。称賛は導入価格における価格対価値に集中し、疑問は、このガイドで繰り返し扱ってきた同じ問題に集まりました。標準価格の$3/$15に戻り、トークナイザーのトークン増加が静かに効き始めた後も、本当に価値があるのかという点です。
私が見た中で最も有用なシグナルはベンチマークではなく、実際の業務で試したコードレビュー用ツールチームによる実地レビューでした。彼らの結論は両面性があり、だからこそ信頼できます。コードの作成と構築では、Sonnet 5はこの価格帯で使った中で最も強力なモデルでした。一方、コードレビューではトレードオフがあり、コメントはより明確で鋭くなったものの、すでに本番で使っているモデルより検出するバグが少なく、レビュー1件あたりのコストも少し高くなりました。また、エージェントループで生産性につながる2つの傾向にも気づいています。機能を実装する前にテストを書く傾向があり、長いタスクの途中で古い計画に固執するのではなく、自分の計画を書き直します。彼らが指摘した注意点はAnthropic自身の記述とも一致しており、新しいサイバーセーフガードが正当なセキュリティ業務にも時折反応するというものです。
覚えておくべきなのは、ローンチ記事に掲載された絶賛のコメントはAnthropicのアーリーアクセスパートナーから寄せられたものだということです。コメント自体は本物ですが、選ばれたものであり、ベンダーが自らの推薦文を選ぶことは中立的な証拠ではありません。独立した実地レビューによる「生成には強いが、レビューでは弱く、コストも高い」という評価のほうが、より正直な基準です。
では、誰が移行すべきでしょうか。大量のコーディング、ツール利用、ブラウザやターミナルの自動化、またはOpusに過剰な料金を支払っていたナレッジワークを行うチームは、移行すべきです。導入価格で安く試せる期間中に移行しましょう。慎重なレビューや精度が重要な意思決定が中心のチームは、テストはすべきですが、リリース初日に現在のモデルを廃止せず、導入を決める前に自社の評価スイートを再実行してください。
結論として、Sonnet 5はエージェント処理とコーディングにおける本格的な進歩であり、導入価格によって安価に試せます。ただし、「4.6と同じ定価」を「同じ請求額」と読み替えないでください。また、努力レベルを上げる前にOpus 4.8の料金も確認しましょう。現在、Claude Sonnet 5をGPT Protoで$1.6 / $8、Anthropicのローンチ価格より20%安く利用できます。1つの残高と1つのAPIキーで、200以上のモデルを利用できるため、必要に応じてコスト重視の呼び出しを別のモデルへ振り分けることも可能です。