Tiffany Layne2026-04-17

Opus 4.7:自主程式設計的新王者

Opus 4.7 重新定義自主程式設計與高解析度視覺任務。了解它如何在真實世界基準測試中擊敗 GPT-5.4。立即在 GPTProto 試用全新模型!

Opus 4.7:自主程式設計的新王者

重點摘要

Anthropic 的 opus 4.7 代表從被動協助轉向真正自主的一次重大變革,專為處理最繁重的軟體工程工作項目,以及高密度視覺資料擷取而設計。

許多人原本預期這只是一次小幅調整,但此版本帶來了最先進的效能,在可投入生產的任務中超越 GPT-5.4。憑藉更高的視覺解析度與更可靠的思考鏈,它不再像聊天機器人,更像一位資深架構師。

我們看到的是一個終於不再提供佔位內容,而是開始完成實作的模型。新推出的 effort 參數與改良後的安全防護措施相互配合,樹立了難以忽視的專業基準。

目錄

Opus 4.7 帶來的真實世界程式設計飛躍

Anthropic 剛推出 opus 4.7,而它不只是又一次漸進式更新。如果你一直受困於這類 AI 模型:面對複雜的 pull request,做到一半就失去方向,那麼這次更新十分重要。它是前一版 4.6 的直接升級,專門針對最棘手的軟體工程任務。

事情是這樣的:我們一直在等待一個不需要持續看管的模型。4.6 的表現不錯,但 opus 4.7 引入了全新的自主程度,改變了我們處理長期任務的方式。它不只是提出程式碼建議,而是開始像一位真正理解架構的資深工程師一樣行動。

GitHub 和 Cursor 等團隊的早期回饋顯示,可靠性大幅提升。事實上,許多使用者回報,標準 opus 4.7 模型能解決連上一代最強大的模型都無法處理的任務。重點在於它能持續處理問題數小時,而不會半途放棄。

我們也來談談數據,因為它們實在難以忽視。這裡看到的不是 2% 或 3% 的提升,而是在實際生產環境中,各方面都有兩位數百分比的改善。這不只是通過合成基準測試,而是在真實儲存庫中解決真實工作項目。

Opus 4.7 如何解決自主程式設計挑戰

AI 程式設計最大的痛點之一,一直是「懶惰模型」症候群。你知道這種情況:模型給你一個樣板包裝器,然後叫你「把剩下的部分填完」。使用 opus 4.7 後,這種行為大幅減少。它會撰寫實際的實作,而不只是搭建腳手架。

在 Rakuten 的內部測試中,opus 4.7 解決的生產任務數量是上一版本的三倍,也就是效用提升 300%。這在低 effort 與高 effort 情境之間尤其明顯。現在,opus 4.7 以低 effort 執行時,就能達到舊模型過去需要中 effort 才能達到的效果。

  • 長期一致性:在持續數小時的工作階段中,仍能保持連貫。
  • 工具錯誤減少:Notion 回報,工具呼叫錯誤降至三分之一。
  • 自主修正:模型能識別自己的錯誤,並在處理過程中修正。
  • 理解隱含需求:它是第一個通過 Notion「隱藏需求」測試的模型。
「Opus 4.7 不只是撰寫程式碼;它還會思考這些程式碼在更大型且持續變動的系統中所帶來的影響。」

即使是推出 Devin 的 Cognition 團隊也指出,opus 4.7 不會在遇到難題時卡住並放棄,而是會持續迭代。如果你正在建構需要模型瀏覽檔案系統並執行終端機指令的代理工作流程,opus 4.7 就是你的新基準。

Opus 4.7 的視覺與安全概念

雖然程式設計能力的飛躍是最大亮點,但 opus 4.7 的視覺升級對日常工作而言可能更加令人印象深刻。現在,模型能處理長邊最高達 2,576 像素的圖片,解析度超過先前 Claude 模型的三倍。

這不只是「看得」更清楚,而是能擷取高密度資料。如果你曾嘗試將密集的財務圖表或複雜的建築藍圖提供給 AI,就知道它們通常會捏造細節。使用 opus 4.7 後,這些像素會被實際處理,而不會被縮減取樣成模糊不清的內容。

除了視覺能力,我們也必須關注安全性。Anthropic 正將 opus 4.7 作為新型網路安全防護措施的首個公開測試平台。這是 Glasswing 計畫的一部分,該計畫由 AWS、Apple 和 Google 參與的大型合作專案,旨在防止 AI 成為自動化駭客攻擊的工具。

這是一種微妙的矛盾。內部的 Mythos Preview 模型非常擅長尋找零日漏洞,以至於 Anthropic 必須刻意削弱 opus 4.7 的部分能力。他們希望打造一個仍能協助研究人員、但不會讓腳本小子癱瘓電網的「安全」模型。

使用 Opus 4.7 管理高解析度輸入

若要充分發揮 opus 4.7 檔案分析功能,你需要了解它如何處理高解析度上傳內容。沒有可用來啟用此功能的 API 開關;模型本身的層級已重新訓練,以接受更大的尺寸。你只需要傳送原始圖片即可。

不過,請留意你的 token。計算方式大致為(寬度 × 高度)/ 750。一張 1 百萬像素的圖片約會消耗 1,334 個 token。如果你透過網頁介面上傳 20 張圖片,或透過 API 上傳 600 張,使用 opus 4.7 時成本很快就會累積。

功能 舊版 Claude(4.6) 新版 Opus 4.7
最高解析度 約 1.1 MP 約 3.75 MP
最長邊 約 1,568 px 2,576 px
視覺基準測試 54.5%(XBOW) 98.5%(XBOW)
Token 成本 每個 token 相同 每個 token 相同

這項解析度提升對電腦操作代理而言是重大突破。如果你希望 opus 4.7 查看 4K 螢幕的截圖並點選特定的 16x16 像素圖示,它現在真的能「看見」該圖示了。先前的模型基本上只能瞇著眼看模糊的 JPEG。

Opus 4.7 遷移逐步指南

準備好遷移你的技術堆疊了嗎?好消息是:opus 4.7 可直接替換使用。模型 ID 為 claude-opus-4-7。它已經在 Amazon Bedrock、Google Vertex AI 和 Microsoft Foundry 上線。不過,不要只是切換開關後就離開;還有幾個技術障礙需要排除。

首先,檢查你的提示。opus 4.7 最令人驚訝的特點之一,是它強大的指令遵循能力。現在它更加遵循字面意思。如果你為較舊模型撰寫了較「寬鬆」的提示,為模型留下創意發揮空間,opus 4.7 可能會過於嚴格地遵循,導致輸出僵化。

其次,來談談 API。如果你仍在使用舊版 beta 標頭來支援延伸思考或工具串流,是時候整理一下了。這些功能大多已原生整合至 opus 4.7。你也應該改用自適應思考模式,而不是硬編碼的預算 token。

給重度使用者的一項建議:GPT Proto 提供統一 API,讓你能同時存取 opus 4.7 以及 OpenAI 和 Google 的模型。這不僅能簡化程式碼,還經常可以將主流 AI API 成本降低最多 70%。這是管理多模型架構的更聰明方式。

整合 Opus 4.7 思考模型

如果你的應用程式依賴深度推理,就應特別探索 opus 4.7 思考模型整合。這不只是產生文字,而是關於輸出前發生的「思考鏈」。在 opus 4.7 中,這個過程更加精 refined,較不容易陷入循環。

要有效使用這項功能,你應該捨棄已淘汰的 thinking: {type: "enabled"}語法,改用 thinking: {type: "adaptive"},並搭配新的 effort 參數。這能讓模型根據特定請求的難度,自行決定要投入多少「腦力」。

  1. 將模型字串更新為 claude-opus-4-7
  2. 移除舊版 beta 標頭,例如 effort-2025-11-24
  3. 設定 effort 等級(程式設計可先從 high 開始)。
  4. 測試現有提示是否存在字面解讀偏差。
  5. 使用新的 tokenizer 監控 token 用量。

如果你使用 Claude Code,也別忘了新的 /ultrareview 指令。這是一個專門設計的工作階段,用來捕捉標準 opus 4.7 首次處理時可能忽略的錯誤。這是有效利用 Pro 或 Max 額度的絕佳方式。

Opus 4.7 的常見錯誤與陷阱

人們使用 opus 4.7 時最大的陷阱,就是忽略 tokenizer 的變更。Anthropic 更新了 tokenizer,使其更有效率地處理邏輯,但副作用是相同的文字區塊現在會產生更多 token。對於相同輸入,預期 token 數量會增加 1.0 倍至 1.35 倍。

另一個錯誤?以為「更好」總是代表「更容易」。由於 opus 4.7 思考得更多——尤其是在代理工作流程中——它會產生更多輸出 token。如果不小心設定限制,即使每百萬 token 的價格仍維持在 $5/$25,你的 API 帳單也可能逐漸增加。

我也看過開發人員使用 opus 4.7 檔案分析,卻沒有考慮新的解析度。他們傳送大型檔案,結果產生高額 token 費用,因為沒意識到模型現在能「看見」三倍以上的細節。如果不需要這些細節,你可能反而應該手動降低圖片取樣率。

最後是安全防護措施的問題。由於 opus 4.7 經過訓練,對網路安全採取更謹慎的態度,因此當合法請求看起來太像「駭客攻擊」時,它偶爾可能會拒絕。如果你是白帽研究人員,需要申請 Cyber Verification Program 才能解除這些限制。

避免 Opus 4.7 遷移期間的提示失效

其中一個特定陷阱是「指令膨脹」。由於 opus 4.7 非常嚴格地遵循指令,如果你的提示冗長散漫且目標互相衝突,模型可能會優先處理錯誤的部分。在舊模型中,「氛圍」通常會勝出;在 opus 4.7 中,字面文字才是主導。

但這也有另一面。現在你可以在提示中使用更複雜的邏輯,而不用擔心模型感到困惑。關鍵是要明確。如果你想要特定格式,就精確定義它。不要依賴模型從範例中自行「理解大意」。

  • 檢查系統提示:確保內容精簡,且沒有互相矛盾的指令。
  • 測試邊界案例:比較模型與 4.6 處理模糊請求的方式。
  • 使用 effort 參數:簡單任務不要使用 max effort,這是在浪費 token。
  • 驗證工具呼叫:模型呼叫工具的能力更好,但仍要確保你的 schema 已更新。

那麼,那些奇怪的拒絕回應該怎麼辦?如果你要求 opus 4.7 分析一段有緩衝區溢位問題的舊版 C++ 程式碼,而它將請求標記為「有害」,不要感到沮喪。這是新的安全層在發揮作用。重新措辭提示,強調防禦性或教育性的背景,通常會有所幫助。

Opus 4.7 的專家技巧與最佳實務

如果你想成為進階使用者,就需要掌握新的 effort 等級。Anthropic 在 highmax 之間新增了 xhigh 層級。對程式設計而言,highxhigh 應該是預設起點。max 則保留給那些「我完全不知道為什麼它不能運作」的時刻。

另一項進階功能是 Task Budgets。這是一項公開 beta API 功能,讓你可以為單一長時間執行的任務設定 token 上限。它能讓 opus 4.7 管理自己的優先順序:在困難邏輯上花費更多 token,並在簡單部分保持精簡,以符合你的預算。

對於管理大規模工作負載的人,請考慮透過 GPT Proto 的智慧排程使用 opus 4.7 網路搜尋工具。其平台可以在「效能優先」(所有內容都使用 opus 4.7)與「成本優先」模式之間自動切換,將較簡單的查詢分流至更便宜的模型,而不需要重新編寫邏輯。

此外,也要注意記憶功能。Anthropic 的內部測試顯示,opus 4.7 更擅長使用基於檔案系統的記憶。它能記住不同工作階段和任務回合中的筆記。這表示你在後續提示中可以提供較少的上下文,長期下來節省一些輸入 token。

在 Opus 4.7 中使用 Xhigh Effort 與 Task Budgets

對大多數複雜工程任務而言,xhigh effort 等級是最佳平衡點。它比 high 顯著提升推理深度,又不會像 max 那樣消耗大量 token。事實上,Claude Code 現在將預設 effort 設為 xhigh,因為它為開發人員提供了最佳平衡。

當你將 xhighopus 4.7 思考搭配網路搜尋結合時,就能得到一個可以研究函式庫、思考實作方式,然後撰寫程式碼的模型,同時維持在嚴格的預算內。這是目前建構代理工具最有效率的方式。

「設定任務預算不只是為了省錢;更是為了迫使模型在推理週期中採取更具策略性的方式。」

再來看看數據。在 Rakuten-SWE-Bench 中,低 effort 的 opus 4.7 表現與中 effort 的 4.6 一樣好。這表示你實際上可以為許多任務降低 effort 等級,仍取得比上個月更好的結果。這就是最佳化投資報酬率的方法。

因此,我的建議是:檢視目前的工作負載。任何在 4.6 中表現勉強的任務,都應先以 medium effort 移轉至 opus 4.7。你可能會發現,根本不需要高階設定,就能獲得大幅效能提升。

Opus 4.7 的競爭效能

opus 4.7 與頂尖模型相比表現如何?在最新的 GDPval-AA 基準測試中——該測試評估建立試算表和簡報等真實世界的經濟價值——opus 4.7 現已達到業界最先進水準,擊敗 GPT-5.4 xhigh 與 Gemini 3.1 Pro,登上首位。

需要注意的是,雖然 opus 4.7 非常強大,但仍不及 Anthropic 內部的 Mythos Preview。然而 Mythos 的成本是其五倍。以每百萬輸入 token $5 的價格來看,opus 4.7 很容易成為市場上高階推理領域性價比最佳的模型。

在財務分析任務中,opus 4.7 展現出更緊密的任務間一致性。它從製作試算表轉向撰寫摘要報告時,不會忘記先前採用的假設。這種一致性正是玩具與專業工具的差別,也是許多企業將生產流程移轉至此模型的原因。

如果你想探索所有可用的 AI 模型,opus 4.7 應該名列清單首位。你可以在 GPT Proto 儀表板上瀏覽所有 Claude 模型及其他頂尖 AI 模型,即時比較延遲與吞吐量。這是了解理論基準如何轉化為你實際所在區域效能的最佳方式。

Opus 4.7 與競爭對手的真實世界經濟價值

最令人印象深刻的成果之一,是 opus 4.7 處理「長期一致性」的能力。在 Imbue 的一項基準測試中,模型從零開始建立了完整的 Rust TTS 引擎,內容包括神經模型、SIMD 核心和瀏覽器示範。接著,它使用語音辨識器驗證自己的成果。這種多步驟邏輯能力,是 GPT-5.4 在沒有人工介入的情況下難以完成的。

我們來看看經濟面的現實。如果工程師每小時成本為 $150,而 opus 4.7 能自動化一項原本需要三小時的任務,即使計入 token 成本,投資報酬率仍極其可觀。由於 opus 4.7 的工具呼叫錯誤更少,你可以少花時間除錯代理,多花時間推出功能。

指標 GPT-5.4 xhigh Opus 4.7 Max Gemini 3.1 Pro
GDPval ELO 分數 1677 1698 1642
程式設計(SWE-bench) 非常高 業界最先進
API 成本(輸入/輸出) $15/$75 $5/$25 $1.25/$5
視覺清晰度 卓越 優異 良好

別忘了隨用隨付的彈性。你可以管理 API 計費,在大量開發週期中擴大規模,或在維護期間縮減規模。相較於 Mythos 等模型,opus 4.7 具備 3 至 5 倍的價格優勢,是新創公司擴展規模時的實用選擇。

工作的未來不只是「使用 AI」,而是為正確的任務使用正確的 AI。目前,對於任何涉及程式碼、視覺或複雜文件的工作,opus 4.7 都是明顯的贏家。它不只是一次更新,更是工作專業模型應有樣貌的新黃金標準。

撰寫者:GPT Proto

「使用 GPT Proto 的統一 API 平台,解鎖全球領先的 AI 模型。」

創意工作室

使用生產級 API 生成圖像、影片及更多內容。

開始創作
創意工作室
相關模型
全部模型
Claude
20% OFF
Claude
20% OFF
Claude
20% OFF
Google
40% OFF