Claude Opus 5 為 Anthropic 自家的模型陣容帶來了一個尷尬的問題。這款新模型每個 token 的費用正好是 Claude Fable 5 的一半,但在多項獨立的程式設計與知識工作評估中,卻以些微優勢領先 Fable。Anthropic 仍將 Fable 5 描述為其目前廣泛發布的最高能力模型,同時告訴不確定從何開始的開發者選擇 Opus 5。
這不只是命名問題,而是採購決策。
我的判斷很直接:對大多數開發者、Claude Code 使用者和生產環境中的知識工作應用而言,Claude Opus 5 是更好的預設選擇。 Fable 5 仍應保留在路由表中,用於最困難的規劃、研究和持續多日的代理任務——尤其是在錯誤的架構決策成本高於模型費用時。
簡而言之:Opus 5 比 Fable 5 更好嗎?
對大多數實際工作負載而言,是的。Opus 5 以官方輸入與輸出 token 價格的一半,提供大致相當於 Fable 的能力,具有較低的相對延遲,並讓開發者能更靈活地控制推理投入程度。獨立測試中,Opus 5 在 Artificial Analysis Intelligence Index 上獲得 61 分,Fable 5 為 60 分——實際上可視為平手——但 Opus 在代理式知識工作上的領先更為明顯。
Fable 5 仍有三項站得住腳的優勢:Anthropic 持續將其定位為能力最高的公開 Claude 模型;在現有的獨立測試中,它在事實知識方面仍保有優勢;早期 Claude Code 報告也顯示,在模糊的規劃與除錯情境中,它可能更加謹慎。
實際建議:
-
日常 Claude Code 工作、功能開發、重構、程式碼審查、自動化及大多數企業分析,請選擇 Opus 5。
-
對於持續多日的自主工作、艱難的架構決策,或一個錯誤前提就可能使整個專案偏離方向的研究,請選擇 Fable 5。
-
當 token 成本和立即可用的 GPTProto 比留在 Claude 家族中更重要時,請考慮 Kimi K3。
Claude Opus 5 與 Fable 5 一覽
| 類別 |
Claude Opus 5 |
Claude Fable 5 |
| 發布日期 |
2026 年 7 月 24 日 |
2026 年 6 月 9 日 |
| 官方 API 價格 |
輸入每百萬 $5,輸出每百萬 $25 |
輸入每百萬 $10,輸出每百萬 $50 |
| GPT Proto 可用性 |
發布時尚未提供 |
可用,輸入每百萬 $8,輸出每百萬 $40 |
| 上下文視窗 |
100 萬 tokens |
100 萬 tokens |
| 最大輸出 |
128K tokens |
128K tokens |
| 輸入與輸出 |
輸入文字與圖片;輸出文字 |
輸入文字與圖片;輸出文字 |
| 推理 |
自適應思考;可調整投入程度 |
始終開啟自適應思考;可調整投入程度 |
| 相對延遲 |
中等 |
較慢 |
| 可靠知識截止日期 |
2026 年 5 月 |
2026 年 1 月 |
| 模型 ID |
claude-opus-5 |
claude-fable-5 |
| 最適用途 |
複雜程式設計與企業工作 |
最高難度、長時間執行的代理工作 |
| 主要缺點 |
高投入程度下可能使用多得多的 tokens |
官方 token 價格是兩倍,安全防護更嚴格 |
這些規格來自 Anthropic 的 目前模型比較。表格揭示了為何這不是一場普通的「高階模型對上平價模型」競賽:上下文大小、最大輸出和支援的模態都相同。Fable 的優勢在於判斷力和長期可靠性,而不是更大的上下文視窗或 Opus 無法使用的功能。
基準測試實際說了什麼
發布時的標題是正確的,但需要加上一個詞:Opus 5 的能力大致相當於 Fable 5,價格卻只有一半。它並非在所有方面都更好。
Artificial Analysis 將最高投入程度的 Opus 5 評為 61 分,較 Fable 5 的 60 分高一分。這一分的領先應視為實際上的平手,而不是較便宜的模型能在每項任務中勝出的證明。更有趣的結果出現在代理式工作中:
| 獨立評估 |
Opus 5 結果 |
Fable 5 比較 |
| Artificial Analysis Intelligence Index |
最高投入程度 61 分 |
60 分 |
| GDPval-AA v2 |
最高投入程度 1,861 Elo |
Opus 領先 114 Elo |
| AA-Briefcase |
最高投入程度 1,720 Elo |
Fable 得分 1,574 |
| Terminal-Bench v2.1 |
最高投入程度 89% |
Opus 接近整體領先者 |
| 人類最後的考試 |
53% |
大致與 Fable 持平 |
AA-Briefcase 特別有用,因為它測試代理處理涉及數千個檔案及報告、簡報和試算表等交付成果的私人真實任務。Opus 5 並非只是在最高投入程度下勉強勝過 Fable。它的高投入設定取得 1,606 Elo,比 Fable 高 32 分;每項任務平均成本為 $10.41,而 Fable 為 $22.30。Artificial Analysis 表示最高投入程度的 Opus 每項任務成本為 $17.79,仍然超越 Fable 的分數。
這也有代價。Opus 投入程度最高的三個等級,在每項 AA-Briefcase 任務上平均花費超過 25 分鐘。最高投入程度平均耗時 36.2 分鐘、進行 103 個回合。換句話說,Opus 可以透過更長時間工作和採取更多步驟來達到更高上限。便宜的 tokens 不會讓高投入代理瞬間完成工作。
Fable 在事實知識方面仍保有可測量的優勢。在 AA-Omniscience 上,Opus 的準確率比 Opus 4.8 提高,但在不確定時更常作答,導致該特定測試的幻覺率達到 50%。這不代表 Opus 5 所有回答中有一半是幻覺,而是表示在 AA-Omniscience 的測試方法下,它願意回答缺乏依據的問題,因此錯誤率高於 Fable。
還有一項重要但需要注意的限制:Artificial Analysis 在評估 Opus 和 Fable 時啟用了 Opus 4.8 備援。這衡量的是可部署的系統配置,但也使結果不完全是純粹的模型比較。
結論比發布宣傳更狹義:Opus 5 目前提供更好的能力與成本曲線。當事實克制和困難的長期判斷比平均基準表現更重要時,Fable 仍是更安全的候選模型。
Claude Opus 5 與 Fable 5 的程式設計比較
「哪個模型寫出的程式更好?」是錯誤的問題。程式設計代理必須理解儲存庫、診斷問題、選擇方向、撰寫修補程式、執行測試,並在第一個理論出錯時察覺這一點。模型可以產生乾淨的程式碼,卻仍將專案帶往錯誤方向。
診斷與規劃
早期社群證據正是在這裡出現分歧。
在一項發布當日的 生產環境除錯比較中,一名開發者以先前已解決的問題為基礎,向多個 Claude 模型提供相同的一次性提示。Opus 5 是唯一找出包含根本原因之確切元件的模型;Fable 找到了正確的一般類別,但不夠具體。作者明確表示這只是一次樣本數為一的測試。
另一名開發者回報了幾乎相反的經驗。在一個 使用 Opus 5 和 Fable 5 測試的一年前專案中,Opus 寫出了可靠的程式碼,但反覆對一個設定旗標形成錯誤結論。Fable 後來找出了 Opus 推理中的其他問題。該開發者提出的工作流程很有啟發性:使用 Fable 進行規劃與協調,再使用 Opus 執行受限的實作。
兩篇文章都不是受控基準測試。它們比泛泛的讚美更有用,因為揭示了實際的失敗邊界。Opus 似乎能進行更精準的一次性診斷,但也可能過快認定某個理論。Fable 的價值不在於程式碼更漂亮,而在於可能減少昂貴的錯誤方向。
撰寫與重構程式碼
Opus 5 在這裡是更強的預設選擇。Anthropic 將其定位為複雜的代理式程式設計模型,而獨立測試將搭配 Claude Code 的 Opus 列為 Artificial Analysis Coding Index 的並列最高分。Anthropic 也報告了一些困難案例:模型找出根本原因而非修補症狀;在沒有即時資料流時建立自己的驗證套件;並在交付工作前檢查瀏覽器輸出。這些是供應商挑選的範例,因此應視為能力展示,而不是預期成功率。不過,它們描述了值得測試的正確行為。
對於有明確範圍的工作——實作這項功能、重構這些檔案、修復這些失敗測試——Opus 較低的價格讓重複執行和審查更容易合理化。Fable 也能完成相同工作,但只有在它能大幅減少回合數、返工或人工介入,足以抵銷差價時,支付兩倍 token 費率才有意義。
驗證最終實作
不要讓任一模型審查自己的工作。
為兩個模型提供相同的固定提交、任務、工具、時間限制和完成定義,然後評分通過檢查後仍然成立的結果:
| 測試階段 |
提供給兩個模型 |
衡量項目 |
| 診斷 |
唯讀儲存庫、日誌、已知事件 |
正確根本原因、無依據的主張、引用的檔案 |
| 實作 |
相同問題、可寫入工具、相同測試 |
通過的測試、回歸、重試次數、變更的檔案 |
| 驗證 |
隱藏的邊界案例與驗收標準 |
遺漏的失敗、錯誤的「完成」宣稱、人工修正 |
對於高價值的遷移,合理的工作流程是由 Fable 制定初始計畫、由 Opus 執行實作,再由另一個模型或人工審查者進行驗證。這比只執行一次 Opus 成本更高,但仍可能比核准錯誤架構便宜。
Opus 5 與 Fable 5 的定價及實際任務成本
按照官方 API 牌價,Opus 5 的輸入每百萬 tokens 為 $5,輸出每百萬 tokens 為 $25。Fable 5 的價格為 $10 和 $50。比例完全相同:Fable 每個 token 的費用是兩倍。Anthropic 的 Opus 5 公告和 Fable 5 整合指南都記載了這些費率。
對於使用 1,000 萬個輸入 tokens 和 200 萬個輸出 tokens 的工作負載:
| 路由 |
輸入成本 |
輸出成本 |
總計 |
| 官方牌價的 Opus 5 |
$50 |
$50 |
$100 |
| 官方牌價的 Fable 5 |
$100 |
$100 |
$200 |
| GPT Proto 上的 Fable 5 |
$80 |
$80 |
$160 |
GPT Proto 的 Fable 5 API 頁面目前列出的價格為輸入每百萬 tokens $8、輸出每百萬 tokens $40。上述範例排除了快取、批次折扣、重試、備援行為和工具產生的上下文,以便讓比較保持易讀。
Token 價格只是帳單的第一行。Opus 5 提供五種投入程度——low、medium、high、xhigh 和 max——Artificial Analysis 在 GDPval-AA v2 中觀察到,從 low 到 max 的輸出 token 使用量約相差八倍。若團隊將每次自動完成、擷取和小型程式碼編輯都交給 max 投入程度,可能會抵銷部分預期節省。
更好的指標是每項成功任務的成本:
每項成功任務成本 =
模型總支出
+ 重試與備援支出
+ 人工審查時間
÷ 已接受的任務數
在 AA-Briefcase 上,Opus 的高投入程度擊敗 Fable,而且每項任務成本不到 Fable 的一半。這是支持 Opus 的有力證據,但不能保證適用於你的儲存庫。如果 Fable 能阻止一次 Opus 原本會核准的失敗遷移,那麼較昂貴的模型反而可能是較便宜的決策。
Fable 5 仍然是更好模型的情況
當任務漫長、模糊且重新開始的成本高昂時,Fable 5 仍值得付費使用。
首先,Anthropic 仍稱 Fable 5 是其廣泛發布的最高能力模型,並建議將其用於需要最高可用能力的工作負載。Opus 是推薦的起點;Fable 則是升級路徑。這種區分是有意的。
其次,Fable 更謹慎的行為可能有助於規劃、事實研究和陌生系統。現有的獨立事實知識結果偏向 Fable,而對 Opus 不利的社群報告正好描述了基準表格可能掩蓋的失敗類型:建立在錯誤結論上的看似正確程式碼。
第三,Fable 是為長時間執行的代理而設計。Anthropic 將其定位於要求嚴苛的推理、多日專案,以及跨越許多階段的自主工作。一小時的程式設計任務可能無法顯示其優勢,但三天、涉及數百項決策的遷移可能會。
已記載的整合取捨相當可觀:
-
Fable 的官方輸入與輸出 token 價格是 Opus 5 的兩倍。
-
Anthropic 將 Fable 的相對延遲分類為較慢。
-
Fable 的自適應思考始終啟用,但仍可調整投入程度。
-
Fable 要求保留資料 30 天,且不提供零資料保留選項。
-
其安全分類器可能在 HTTP 200 回應中傳回 stop_reason: "refusal",因此生產環境整合需要處理拒絕回應和備援邏輯。
Fable 不是「預算不重要時就更好的模型」。它是專門模型:當規劃品質、事實克制或長期一致性值得支付可衡量的溢價時使用。
基準測試表格忽略的開發者差異
| 整合細節 |
Opus 5 |
Fable 5 |
重要原因 |
| 投入程度控制 |
Low、medium、high、xhigh、max |
自適應思考始終開啟;支援投入程度控制 |
投入程度會改變延遲和 token 使用量 |
| 知識截止日期 |
2026 年 5 月 |
2026 年 1 月 |
Opus 可能掌握較新的函式庫和 API |
| 安全分類器 |
比 Fable 的限制少 |
限制較嚴格,尤其是在網路安全和生物學方面 |
無害的安全性或除錯請求可能需要備援 |
| 拒絕處理 |
可使用備援 |
HTTP 200 可能包含 stop_reason: "refusal" |
成功的 HTTP 狀態不一定代表任務已完成 |
| 資料保留 |
一般存取沒有針對模型的資料保留要求 |
要求保留 30 天 |
對受監管或敏感工作負載很重要 |
| 相對延遲 |
中等 |
較慢 |
代理迴圈會在多個回合中放大延遲 |
| 快速模式 |
約為預設速度的 2.5 倍,基本 token 價格則為兩倍 |
未列出相應的發布選項 |
適合延遲比成本更重要的情況 |
Anthropic 表示,Opus 5 的網路安全分類器介入的頻率應比 Fable 5 低約 85%。這使 Opus 成為許多合法程式碼安全與除錯工作流程中更實用的 Claude 模型,但它仍會阻擋高風險類別。同一份發布文件表示,Opus 5 在一般存取下沒有針對模型的資料保留要求,而 Fable 的整合指南則規定保留 30 天。
遷移也不只是更改模型 ID。Opus 5 預設啟用思考功能,若成本或延遲很重要,應由應用程式明確設定投入程度。Fable 始終進行推理,且可能以已完成的 HTTP 回應形式返回拒絕。若切換模型時不更新解析器、備援規則、token 預算和評估門檻,就可能造成無聲失敗。
Claude Opus 5 與 Kimi K3 怎麼比較?
Kimi K3 不是 Claude 的直接替代品,但當決策由成本和長上下文代理工作驅動時,它是最相關的第三種選擇。
Moonshot 的 Kimi K3 擁有 100 萬 token 的上下文視窗,接受文字、圖片和影片輸入,並使用始終開啟的推理功能。其官方牌價為輸入每百萬 tokens $3、輸出每百萬 tokens $15。GPT Proto 上的 Kimi K3 API目前列價為 $2.70 和 $13.50——低於兩個 Claude 模型。
但這不代表 Kimi 自動成為成本贏家。長期推理可能產生更多回合、保留的推理歷史和輸出 tokens。請衡量完成任務的成本,而不是價格卡上的數字。
在發布時可取得的廣泛獨立比較中,其能力也仍然較低:Artificial Analysis 給予 Kimi K3 57 分,而 Opus 5 為 61 分、Fable 5 為 60 分。不過,若多模態代理工作流程需要影片輸入或較低的 token 費率,Kimi 仍值得列入候選名單。
有一項狀態細節需要謹慎處理。Moonshot 表示 Kimi K3 的完整權重將於 2026 年 7 月 27 日發布。截至 7 月 25 日,準確描述應是「預定開放權重發布」,而不是「已可下載且完全開源」。
當你需要可用且價格較低的多模態模型,並願意驗證其代理行為時,請選擇 Kimi K3。想要目前最佳的預設選擇時,請選擇 Opus。當任務值得升級至 Anthropic 最高能力的公開級別時,請選擇 Fable。
你應該選擇哪個模型?
| 你的工作負載 |
目前最佳選擇 |
原因 |
| 日常 Claude Code、重構和功能工作 |
Opus 5 |
最佳能力與成本平衡 |
| 具有已知、可驗證結果的困難除錯 |
先用 Opus 5;再比較 Fable |
Opus 顯示出強大的根因分析潛力,但請驗證結論 |
| 多日自主專案 |
Fable 5 |
專為長期工作打造並定位於此 |
| 失敗成本高昂的架構規劃 |
Fable 5 |
在判斷力與克制方面,更能合理化其溢價 |
| 對模型特定資料保留敏感的受監管工作流程 |
Opus 5 |
Fable 要求保留 30 天 |
| 合法的網路安全除錯 |
Opus 5 |
分類器的限制少於 Fable |
| 需要影片輸入且重視成本的多模態代理 |
Kimi K3 |
較低費率及已記載的影片理解能力 |
| 現在需要可透過 GPT Proto 使用的模型 |
Fable 5 或 Kimi K3 |
發布時 Opus 5 尚未列出 |
如果今天只能選擇一個模型,請選擇 Opus 5。如果應用程式能依任務進行路由,請將 Opus 作為預設,只把最困難的規劃或長時間執行的工作交給 Fable。如此可讓 Fable 的溢價用於真正可能受益的工作。
在 GPT Proto 上測試 Fable 5 和 Kimi K3
發布時 GPT Proto 尚未提供 Opus 5,因此不應將其呈現為可用選項。你現在已可使用一個 GPT Proto 帳戶和共用餘額測試 Fable 5 與 Kimi K3,再以相同任務和驗收標準比較兩者的回答。
透過 Messages 端點呼叫 Fable 5:
curl --request POST "https://gptproto.com/v1/messages" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"model": "claude-fable-5",
"max_tokens": 2048,
"messages": [
{
"role": "user",
"content": "Review this migration plan. Identify unsupported assumptions, missing rollback steps, and the tests required before production."
}
]
}'
透過 OpenAI 相容的 Chat Completions 端點呼叫 Kimi K3:
curl "https://gptproto.com/v1/chat/completions" \
--header "Content-Type: application/json" \
--header "Authorization: $GPTPROTO_API_KEY" \
--data '{
"model": "kimi-k3",
"messages": [
{
"role": "user",
"content": "Review this migration plan. Identify unsupported assumptions, missing rollback steps, and the tests required before production."
}
]
}'
使用相同的提示、檔案、工具權限和評分標準。記錄輸入與輸出 tokens、實際耗時、無依據的主張、重試次數,以及接受前所需的人工修正次數。勝出的模型是能完成你任務的模型,而不是第一個回答最有自信的模型。
你可以從 GPT Proto 統一 AI API開始,或瀏覽 AI 模型庫,在同一個帳戶下比較其他程式設計與推理模型。
最終判定
Claude Opus 5 是更好的預設模型。在多項重要的獨立評估中,它與 Fable 5 持平或勝出,按照官方費率每個 token 的成本少一半,具有較低的相對延遲,並為開發者提供更寬廣的實際投入程度設定範圍。
Fable 5 並未過時。現在更容易將它合理化為專門模型而非預設模型:用於最困難的長時間代理、高風險規劃,以及一次錯誤結論的代價可能高於全部 API 費用的工作。
更直白地說:Opus 5 是大多數團隊應該開始使用的模型;Fable 5 則是他們應該升級使用的模型。