Anthropic 於 2026 年 6 月 30 日推出 Claude Sonnet 5,不到一小時,我的資訊流就被同樣的兩個問題淹沒:我是否應該從 Sonnet 4.6 遷移過來,以及「與 4.6 相同的標準價格」這項說法,在實際流量通過後是否真的成立?這也是我關心的問題,因此本指南將圍繞這些問題展開,而不是重複發布文章中的亮點。本文所有技術內容都可追溯至 Anthropic 自家的發布文章與文件;若某個數字來自媒體報導,而不是我能直接閱讀的頁面,我也會說明。
先說明一點,因為許多早期文章都弄錯了:Sonnet 5 的前代產品是 Sonnet 4.6(於 2026 年 2 月發布),而不是 Sonnet 4.5。如果你是拿它與 4.5,或甚至更早的 3.5 比較,那麼你其實是在跨越兩次升級進行比較,下面的數字也不會對得上。我稍後會再談到這點。
什麼是 Claude Sonnet 5?
Sonnet 5 是 Anthropic 最新的中階模型,被定位為目前最具代理能力的 Sonnet:它能規劃、操作瀏覽器與終端機,並自行執行多步驟任務。Anthropic 主打的核心概念是成本效能 — 以 Sonnet 的價格,提供接近 Opus 4.8 的效能。
在討論運作機制之前,這個定位之所以重要,是因為過去一年大部分代理能力的重大提升都集中在 Opus 產品線,而不是 Sonnet。因此,執行大量代理工作流的團隊,只能為其大部分時間才需要的能力支付 Opus 價格。Sonnet 5 是 Anthropic 嘗試將其中一部分能力下放到較低價格層級的產品。這就是「為什麼」,也解釋了接下來大多數的設計選擇。
根據 Anthropic 的文件,其運作機制如下:它是 Sonnet 4.6 的即插即用替代品,使用 API 模型 ID claude-sonnet-5,預設與上限皆提供 100 萬 token 的上下文視窗,並支援最多 128k 個輸出 token。輸入為文字與影像,輸出為文字。
| |
Claude Sonnet 5 |
| 發布日期 |
2026 年 6 月 30 日 |
| API 模型 ID |
claude-sonnet-5 |
| 上下文視窗 |
100 萬 token(預設與上限) |
| 最大輸出 |
128k token |
| 輸入/輸出 |
輸入為文字與影像,輸出為文字 |
| 與 4.6 的關係 |
即插即用替代品 |
相較 Sonnet 4.6 有哪些新功能
如果你已經在使用 Sonnet 4.6,這次升級不只是權重更新。根據 Anthropic 的文件,有三項行為變更會影響你的程式碼:
- 自適應思考預設為開啟。
- 手動延伸思考現在會回傳 400 錯誤(在 4.6 上它就已經被棄用)。
- 將取樣參數 — temperature、top_p、top_k — 設定為非預設值時,會回傳 400 錯誤。
另外兩項變更在營運上也很重要。Sonnet 5 提供 effort 等級(low、medium、high 與 xhigh);較高的 effort 會花費更多 token 進行推理,以換取更高品質 — 以及更高成本。此外,它也是首個預設啟用即時網路安全防護的 Sonnet 層級模型。在將它接入代理之前,有個防護機制的特性值得了解:當模型拒絕一項被標記的請求時,拒絕內容會以成功的 HTTP 200 搭配 stop_reason: "refusal" 回傳,而不是以錯誤形式回傳。如果你的錯誤處理邏輯假設拒絕會拋出錯誤,就不會正常運作。
不過,影響範圍最廣的變更,是沒有人會放在標題中的一項:tokenizer。我會為它另闢一節,因為它會改變價格計算方式。
主要功能與效能
Anthropic 將 Sonnet 5 定位為在推理、工具使用、程式設計與知識工作方面全面優於 4.6,並且與 Opus 4.8 足夠接近,讓你可以透過 effort 旋鈕選擇成本效能曲線上的位置。以下具體的基準測試數據,來自 Anthropic 的發布資料與發布首日的報導;在你親自閱讀 System Card 前,請將確切數字視為 Anthropic 提供的數據。
| 基準測試 |
Sonnet 5 |
Sonnet 4.6 |
Opus 4.8 |
| SWE-bench Pro(代理程式設計) |
63.2% |
58.1% |
69.2% |
| OSWorld-Verified(電腦使用) |
81.2% |
78.5% |
— |
| Terminal-Bench 2.1 |
80.4% |
67.0% |
— |
| Humanity's Last Exam(搭配工具) |
57.4% |
46.8% |
57.9% |
| GDPval-AA v2(知識工作) |
1,618 |
— |
1,615 |
數據來自 Anthropic 於 2026 年 6 月 30 日發布的資料;破折號表示我無法確認的儲存格。
誠實解讀這張表格後,有兩點特別突出。在程式設計方面,Sonnet 5 以實質差距超越 4.6,但仍低於 Opus 4.8 —它縮小了差距,但沒有消除差距。在知識工作方面,它以些微差距領先 Opus 4.8(1,618 對 1,615),這就是你到處都會看到「有時勝過 Opus」這句話的來源;這句話沒錯,但只是在一項基準測試中以些微差距勝出。
以下是那些亮點文章忽略的成本。Anthropic 自己的圖表顯示,Sonnet 5 在 low 與 medium effort 下的價值最高。將 effort 推到 xhigh 後,發布當日的報導指出,成本可能超過 Opus 4.8,品質卻相近。因此,「比 Opus 便宜」這項說法需要加上星號:它是在你實際會選用 Sonnet 的 effort 等級下較便宜,而不一定是在你把它推到最高等級時較便宜。我的看法是:如果任務確實需要 xhigh 推理,先替 Opus 4.8 做價格估算,再決定是否預設使用 Sonnet 5 —「較小的模型總是比較便宜」這種直覺,在旋鈕頂端並不成立。
在安全性方面,Anthropic 報告稱,相較 4.6,Sonnet 5 的幻覺、諂媚與不良行為發生率較低,也更能抵抗惡意請求與提示注入劫持。他們自己發布的注意事項是:在內部稽核中,Sonnet 5 的不對齊行為發生率仍高於 Opus 4.8。至於網路安全,它在測試中從未產生完整可運作的漏洞利用程式 — 這代表它在該領域的能力刻意維持較低;若你要推出面向客戶的代理,這是優點,但若你的使用情境是經授權的安全工作,則是限制。
Claude Sonnet 5 定價:真的更便宜嗎?
標示價格 — Anthropic 直供,以及 GPT Proto 目前的價格:
| |
輸入/100 萬 |
輸出/100 萬 |
| Sonnet 5 — 入門價格(截至 2026 年 8 月 31 日) |
$2 |
$10 |
| Sonnet 5 — 標準價格(自 2026 年 9 月 1 日起) |
$3 |
$15 |
| Sonnet 5 — 透過 GPT Proto(目前) |
$1.6 |
$8 |
| Sonnet 4.6 |
$3 |
$15 |
| Opus 4.8 |
$5 |
$25 |
按照標準價格計算,Sonnet 5 每個 token 的費用與 4.6 相同,且遠低於 Opus 4.8。很簡單。只是,每個 token 的價格並不是全部帳單。
Sonnet 5 採用新的 tokenizer — 也就是 Anthropic 隨 Opus 4.7 引入的同一套 tokenizer — 相同文字會依內容類型對應到約 1.0 至 1.35 倍的 token。Anthropic 在註腳中坦率說明了這一點,也說明了後果:入門價格的設定,是為了讓從 4.6 遷移過來的成本在入門期間大致維持中性。請仔細理解這段話。這表示 $2/$10 的發布價格並非純粹的折扣;其中一部分是在抵銷額外 token 的成本。也表示 9 月 1 日價格恢復至 $3/$15 後 — 在紙面上與 4.6 相同 — 相同請求可能比 4.6 更昂貴,因為相同文字會被計算更多 token。
所以,Sonnet 5 比 4.6 便宜嗎?誠實的答案是:取決於時間,以及你的使用強度。在 8 月底以前,實際上是的。之後,對相同工作負載而言,請預期每次請求的成本持平或小幅上升,而不是下降 — 請使用新 tokenizer 重新測量自己的提示,而不要只相信每 token 價格。
如果你是透過 GPT Proto 而不是直接呼叫 Claude,Sonnet 5 已在平台上線,輸入價格為每 100 萬 $1.6,輸出價格為每 100 萬 $8 — 比 Anthropic 的 $2/$10 入門價格低 20%,因此在發布價格有效期間,這是更便宜的途徑。作為同一平台上的比較,Sonnet 4.6 的價格為 $2.4/$12,而 Opus 4.8 為 $4/$20。下一節中的可執行呼叫會直接指向 Sonnet 5。
如何透過 API 使用 Claude Sonnet 5
Sonnet 5 現已在 GPT Proto 上線,因此下面的可執行範例會直接呼叫 Claude Sonnet 5 模型頁面上的模型。如果你是從 4.6 遷移,這就是 Anthropic 所宣傳的即插即用替換方式 — 將 claude-sonnet-4-6 改為 claude-sonnet-5,其餘呼叫內容維持不變。
GPT Proto 以 Anthropic 原生的 Messages 格式提供 Claude,網址為 https://gptproto.com/v1/messages,並使用 Bearer token。先看 cURL:
curl --request POST "https://gptproto.com/v1/messages" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--header "anthropic-version: 2023-06-01" \
--data '{
"model": "claude-sonnet-5",
"max_tokens": 1024,
"messages": [
{ "role": "user", "content": "Explain what an agentic coding model does in two sentences." }
]
}'
使用 Python 的相同呼叫,只使用 requests:
import os
import requests
resp = requests.post(
"https://gptproto.com/v1/messages",
headers={
"Authorization": f"Bearer {os.environ['GPTPROTO_API_KEY']}",
"Content-Type": "application/json",
"anthropic-version": "2023-06-01",
},
json={
"model": "claude-sonnet-5",
"max_tokens": 1024,
"messages": [
{"role": "user", "content": "Explain what an agentic coding model does in two sentences."}
],
},
timeout=60,
)
resp.raise_for_status()
data = resp.json()
print(data["content"][0]["text"])
遷移至 Sonnet 5 時,有兩點需要延續注意。第一,tokenizer 的變更表示即使文字沒有改變,你的 token 數量 — 因此帳單與 max_tokens 預留空間 — 也會變動;在假設現有限制仍然足夠之前,請重新測量。第二,如果目前的程式碼將 temperature、top_p 或 top_k 設為自訂值,或啟用手動延伸思考,請將這些設定移除:在 Sonnet 5 上它們會回傳 400。
GPT Proto 的一把金鑰即可使用 Claude 以及其他 200 多個模型,共用單一餘額,因此你可以在相同請求路徑上,將 Sonnet 5 與較便宜的模型進行基準測試,而不必切換供應商。完整清單位於模型目錄。
Sonnet 5 對 Sonnet 4.6(以及仍在使用 4.5 或 3.5 的你)
以下是我實際會用來做決策的正面比較,並保留 Opus 4.8 作為參考上限:
| |
Sonnet 5 |
Sonnet 4.6 |
Opus 4.8 |
| 定位 |
以 Sonnet 價格提供接近 Opus 的代理工作能力 |
先前的中階標準 |
準確度上限 |
| 程式設計(SWE-bench Pro) |
63.2% |
58.1% |
69.2% |
| 最佳價值所在 |
Low/medium effort |
— |
最艱難的任務 |
| 標準價格(每 100 萬輸入/輸出) |
$3 / $15 |
$3 / $15 |
$5 / $25 |
| 上下文 |
100 萬 |
最多 100 萬 |
20 萬 |
| 成本注意事項 |
新的 tokenizer 會計算更多 token;xhigh 的成本可能超過 Opus |
熟悉的 tokenizer |
針對最高端需求定價 |
我的看法是:如果你正在使用 4.6,並執行持續性的代理或程式設計工作,Sonnet 5 值得升級 — 程式設計與工具使用方面的提升是真實的,而入門價格也讓試用成本很低。如果你的工作負載要求最高層級的準確度 — 也就是答案錯誤會造成高昂代價的任務 — 請保留 Opus 4.8,並將 Sonnet 5 用於大量的中階工作。如果你發現自己經常使用 xhigh effort,那是應該為 Opus 4.8 估算價格的訊號,而不是假設 Sonnet 比較便宜的理由。
還在使用 Sonnet 4.5 或 3.5?那麼升級的理由更充分,但我不會直接引用一個簡潔的「5 對 3.5」基準測試,因為 Anthropic 並未發布這樣的測試 — 上述所有正面比較數據都是以 4.6 為對象。我能提供的是方向性的判斷:3.5 與 5 之間隔著兩代代理能力提升,而其中大部分正好體現在工具使用與長任務可靠性上,這些都是舊版 Sonnet 未能完全做到的地方。無論你目前從哪個版本開始,實際做法都一樣:將程式碼指向GPT Proto 上的 Sonnet 5,剩下的交給 effort 旋鈕。
值得升級嗎?誠實看法
發布首日的反應分歧,而這種分歧很有參考價值。讚賞集中在入門價格下的價格效益。質疑則集中在本指南一直反覆探討的同一個問題:標準 $3/$15 價格恢復後,加上 tokenizer 的 token 膨脹悄悄發揮作用,它是否仍然經得起考驗。
我看到最有用的訊號不是基準測試,而是一個程式碼審查工具團隊在實際工作中進行的實測評測。他們的發現有利有弊,這也是我信任它的原因:在撰寫與建置程式碼方面,Sonnet 5 是他們在這個層級用過的最強模型。在程式碼審查方面,它是一種取捨 — 評論更乾淨、更精準,但比他們已在生產環境使用的模型找出更少錯誤,而且每次審查的成本略高。他們也注意到兩種會在代理循環中轉化為生產力的習慣:它傾向於在實作功能前先撰寫測試,而且在長任務進行到一半時會重寫自己的計畫,而不是沿著過時的計畫一路走向失敗。他們指出的問題與 Anthropic 自己的說明一致 — 新的網路安全防護偶爾會對合法的安全工作觸發。
值得記住的是:發布文章中的熱烈引述來自 Anthropic 的早期存取合作夥伴。它們確實是真實評價,但經過挑選,而供應商自行挑選推薦語並不是中立證據。獨立實測的結論 — 生成能力強,但審查能力較弱且更昂貴 — 才是更誠實的基準。
那麼誰應該切換?執行大量程式設計、工具使用、瀏覽器與終端機自動化,或因使用 Opus 而支付過高費用的知識工作團隊 — 應該切換,並在入門期間試用,因為此時成本很低。核心工作流程是謹慎審查或準確度關鍵決策的團隊 — 可以測試,但不要在發布日就停用目前的模型,並在做出承諾前重新執行自己的評測套件。
總結:Sonnet 5 是代理與程式設計工作真正的一大進步,而入門價格也讓它值得低成本試用 — 只是不要把「與 4.6 相同的標準價格」理解成「相同的帳單」,並在將 effort 旋鈕調到最高前先估算 Opus 4.8 的價格。今天,你可以在Claude Sonnet 5上透過GPT Proto呼叫模型,價格為 $1.6 / $8 — 比 Anthropic 的發布價格低 20% — 使用單一餘額與單一 API 金鑰;如果你希望將對成本敏感的呼叫轉送到其他地方,還可以使用200 多個模型。