Kimi K3 與 Claude Opus 5 一覽
| 類別 |
Kimi K3 |
Claude Opus 5 |
| 開發商 |
Moonshot AI |
Anthropic |
| 發布日期 |
2026 年 7 月 16 日 |
2026 年 7 月 24 日 |
| 官方 API 價格 |
每 100 萬 token:輸入 $3/輸出 $15 |
每 100 萬 token:輸入 $5/輸出 $25 |
| GPT Proto 價格 |
輸入 $2.70/輸出 $13.50 |
輸入 $4/輸出 $20 |
| 上下文視窗 |
1,048,576 個 token |
1,000,000 個 token |
| 最大輸出 |
預設 131,072;可設定至剩餘上下文限制 |
128,000 個 token |
| 輸入內容 |
文字、圖片與影片 |
文字與圖片 |
| 推理控制 |
始終啟用;low、high 或 max |
自適應;low、medium、high、xhigh 或 max |
| 模型可用性 |
依據自訂 Kimi K3 License 提供開放權重 |
專有 API |
| Intelligence Index |
57 |
高推理強度下為 59 |
| 測得輸出速度 |
每秒 32.0 個 token |
高推理強度下每秒 56.2 個 token |
| 測得首個 token 時間 |
98.27 秒 |
高推理強度下 18.28 秒 |
| 最適合的情境 |
重視成本的程式設計、多模態代理、私有部署 |
困難除錯、生產環境程式設計代理、需要大量判斷的工作 |
上下文大小的些微差異不應左右這項比較。兩個模型都能處理約一百萬個 token。更重要的差異在於任務完成率、回應時間、輸入格式、部署控制權,以及取得可接受結果的成本。
開發者可以透過 GPT Proto 的 Kimi K3 API 與 Claude Opus 5 API 使用這兩個模型。
什麼是 Kimi K3?
Kimi K3 是 Moonshot AI 面向長時間程式設計與知識工作的旗艦推理模型。它是 Mixture-of-Experts 模型,總參數量達 2.8 兆,但推理時只啟用 1,040 億個參數。其架構會為每個 token 從 896 個專家中選出 16 個,讓 Moonshot 能在不一次啟用所有參數的情況下提升總容量。
這個規模很引人注目,但更實用的特色是 1,048,576 token 上下文視窗與原生視覺輸入。透過託管的 Kimi API,K3 可以處理文字、圖片與影片。Moonshot 特別將它定位為適合大型程式碼庫、終端機工程、根據螢幕截圖回饋進行前端開發,以及結合視覺推理與軟體開發的其他任務。官方 Kimi K3 文件也支援工具呼叫、結構化 JSON 輸出、上下文快取與可設定的推理強度。
K3 始終會進行推理。開發者可以將推理層級降低至 low,但無法完全停用思考。多輪應用也必須回傳完整的 assistant 訊息——包括推理與工具呼叫欄位——而不能只保留可見答案。這項實作細節很重要。若把 K3 當成單純替換模型字串,可能會破壞長時間工具迴圈或降低其穩定性。
Moonshot 於 7 月 27 日依據自訂授權釋出模型權重。因此,稱為「開放權重」比稱為不受限制的開源軟體更精確。該授權允許使用、修改、散布、微調與商業部署,但對大型模型即服務企業,以及超過指定營收或使用者門檻的產品設有額外條件。計畫商業自託管的開發者應閱讀 Kimi K3 License,不要假定它採用標準 Apache 或 MIT 授權。
另一項成本是基礎架構。2.8 兆參數的模型——即使採用稀疏啟用與低精度權重——也不是可以隨意在單一 GPU 上部署的模型。開放權重帶來控制權,但不代表託管毫不費力。
什麼是 Claude Opus 5?
Claude Opus 5 是 Anthropic 於 2026 年 7 月推出、面向複雜代理式程式設計與企業工作的模型。它取代 Opus 4.8,成為實際上的 Opus 等級預設模型;維持官方每 100 萬 token 輸入 $5、輸出 $25 的價格,同時改善程式設計、驗證、視覺輸出與長任務表現。
Anthropic 強調,Opus 5 往往會在宣告任務完成前檢查自己的成果。發布範例包括在沒有即時資料來源時建立測試基礎架構、交付工作前檢查分支與 PR 要求,以及在困難除錯任務中找出根本原因。這些是供應商回報的範例,不是中立證據,但說明了 Opus 5 對生產程式設計具有吸引力的行為:較少過早完成,並更重視結果是否真正可用。請參閱 Anthropic Opus 5 公告。
模型支援一百萬 token 上下文視窗、最多 128,000 個輸出 token、文字與圖片輸入、工具使用、提示快取、PDF 處理及自適應思考。其推理強度從 low 到 max,API 預設為 high。不同於 K3,在 high 或更低強度下可以停用思考,但 Anthropic 不允許在 xhigh 與 max 強度下採用這項設定。Claude 模型文件列出的固定 API 模型 ID 是 claude-opus-5。
取捨很直接。Opus 5 是專有模型,價格也高於 Kimi K3。你可以獲得更快速度,以及在困難代理工作上更強的目前成績,但會失去可下載權重與原生影片輸入。
Kimi K3 與 Claude Opus 5:正面比較
整體智慧與推理能力
Artificial Analysis 目前給予 Claude Opus 5 High 的 Intelligence Index 分數 59,Kimi K3 則為 57。該指標結合九項評估,涵蓋科學程式設計、困難知識問答、終端機工作、銀行代理、長上下文推理與抗幻覺能力。
兩分的領先具有意義,但不能解讀為普遍高出 3.5% 的品質優勢。綜合分數結合了可能與你的應用幾乎毫無相似之處的任務。模型可能在整體排名落後,卻在前端生成、影片理解、特定程式語言或精心設計的擷取流程中勝出。
較安全的結論是:Claude Opus 5 目前擁有更強的整體獨立測試結果,但 Kimi K3 的差距仍然足夠小,價格與工作流程適配性可能改變最終選擇。
在發布永久性的分數聲明前,請查看即時的 Artificial Analysis 比較,因為兩個模型都很新,排行榜結果可能改變。
勝者:Claude Opus 5,小幅領先。
程式設計代理與儲存庫工作
程式設計代理的表現不等同於在聊天中回答程式設計問題。模型必須檢查檔案、制定計畫、編輯多個元件、執行命令、解讀錯誤、修正變更,並在儲存庫通過驗收檢查後才停止。
Claude Opus 5 是這類工作的較安全選擇。它目前在除錯、根本原因分析、驗證,以及下一步行動不明確的任務上優勢最明顯。若較昂貴的請求能避免失敗的實作、不必要的重寫或 30 分鐘的人工作業檢查,便可能仍然更經濟。
Kimi K3 並未落後太多。Moonshot 是為長期程式設計、大型儲存庫、終端機工具與視覺回饋而設計它。對於長時間執行代理、難以合理化 Opus 等級輸出價格的團隊來說,它尤其值得關注。
有一項重要的複雜因素:模型只是程式設計系統的一部分。Claude Code、Kimi Code CLI、Cursor 與自訂代理提供不同的工具、提示、上下文管理規則及重試行為。Moonshot 自己的 K3 評估說明顯示,有些模型使用 Kimi Code 測試,有些使用 Claude Code,另一些則使用 Codex。某一套環境的分數不會自動適用於另一套環境。
若是儲存庫遷移或困難的除錯工單,我會從 Claude Opus 5 開始。若是低風險實作佇列、重複性維護工作或大量程式設計任務,則應直接測試 Kimi K3 的每次完成成本。
勝者:困難儲存庫工作選 Claude Opus 5;重視成本的程式設計量則選 Kimi K3。
前端程式設計與視覺化應用建立
前端比較變化得很快。
Kimi K3 比 Claude Opus 5 早八天推出,並因網站生成、遊戲、介面設計及根據螢幕截圖進行程式設計而立即受到關注。早期社群貼文反覆提到,Kimi 在前端工作上仍領先 Opus。
最新公開排行榜呈現了不同但仍屬暫定的結果。截至 7 月 27 日,WebDev Arena 將 claude-opus-5-max 以 1725 分列為第一,將 kimi-k3-max 以 1682 分列為第二。兩項結果都標示為初步結果。該排行榜依據使用者對前端與全端生成結果的偏好,而非針對你的設計系統或生產儲存庫進行受控測試。請查看目前的 WebDev Arena 排行榜。
一則關於早期排名的 Reddit 討論也揭示了快速變動的社群結論存在的問題:參與者質疑模型是否使用了等同的推理強度設定。這項批評是合理的。high 與 max、不同代理環境及不同日期,都可能改變表面上的勝者。
目前,Claude Opus 5 在公開前端排名中較強。Kimi K3 仍然接近且成本較低,因此在產生多個設計方向、再將最佳候選交由更嚴格的審查時,可能仍是更經濟的模型。
勝者:最新初步排行榜為 Claude Opus 5;低成本迭代則為 Kimi K3。
上下文、視覺與影片理解
Kimi K3 支援總計 1,048,576 個 token,Claude Opus 5 則支援一百萬個。48,576 個 token 的差異很少具有決定性。上下文品質、檢索策略及無關資料的數量,通常比最後幾個百分點的容量更重要。
Kimi 擁有更明顯的多模態優勢。其託管 API 除了圖片與文字,也接受影片。因此,它更適合下列工作流程:
-
檢視螢幕錄影並找出造成 UI 缺陷的程式碼
-
分析遊戲影片,再修改遊戲邏輯
-
比較生成的動畫與其前端實作
-
從長篇影片示範中擷取需求
Claude Opus 5 接受文字與圖片,但不支援原生影片輸入。Claude 工作流程仍可先擷取影格與逐字稿來處理影片,不過這會增加前處理,也可能遺失時間資訊。
Kimi 也允許將 max_completion_tokens 提高到超過預設的 131,072 個 token,前提是提示與輸出的總和仍在總上下文視窗內。這很有彈性,但巨量輸出成本高且難以驗證。不應將理論上限變成一般請求大小。
勝者:Kimi K3。
速度與延遲
這是測得差異最大的項目之一。
Artificial Analysis 回報 Claude Opus 5 High 的輸出速度為每秒 56.2 個 token,Kimi K3 則為 32.0 個。測得的首個 token 時間,Opus 5 為 18.28 秒,K3 為 98.27 秒。
這些數字是特定評估環境中的觀察結果,不是保證的 API 服務等級。供應商負載、提示大小、推理層級、快取與路由都可能改變數據。不過,差距大到不能忽略。
若是通宵執行的儲存庫任務,等待超過一分鐘才取得第一個 token 或許可以接受。但在互動式 IDE、面向客戶的代理,或每次模型回應都會阻塞下一個工具動作的多步驟工作流程中,就難以接受。長時間代理迴圈會累積延遲。
Kimi 較低的 token 價格並不能補償所有使用情境。如果開發者整天都在等待模型,時間也會成為帳單的一部分。
勝者:Claude Opus 5。
開放權重、隱私與部署控制
如果可下載權重、私有基礎架構、微調或模型層級修改是必要條件,Kimi K3 是此處唯一的選項。
但這不會自動讓它成為更簡單的隱私方案。團隊仍必須保護推理伺服器、日誌、模型輸入、儲存空間與存取控制,也需要足夠的基礎架構來服務總參數量達 2.8 兆的模型。託管 API 則將許多營運負擔轉移給供應商。
Claude Opus 5 是封閉且僅提供 API 的模型。這降低了部署控制權,但也免除了管理模型服務堆疊的需求。對多數小型團隊而言,託管方案會更快投入運作;對具有嚴格地端需求的受監管企業而言,這可能使它不合格。
勝者:控制權選 Kimi K3;較低營運負擔選 Claude Opus 5。
Kimi K3 與 Claude Opus 5 的價格
依官方牌價,Kimi K3 每百萬輸入 token $3、每百萬輸出 token $15;Claude Opus 5 則為 $5 與 $25。Kimi 在輸入與輸出兩方面都便宜 40%。
GPT Proto 目前提供低於兩者基礎價格的費率:
| 模型 |
GPT Proto 輸入 |
GPT Proto 輸出 |
相較官方基礎價格的折扣 |
| Kimi K3 |
每 100 萬 token $2.70 |
每 100 萬 token $13.50 |
10% |
| Claude Opus 5 |
每 100 萬 token $4 |
每 100 萬 token $20 |
20% |
假設一項長時間程式設計工作在工具歷史中消耗一百萬個輸入 token,並產生 100,000 個輸出 token。按照顯示的 GPT Proto 費率:
Kimi 在這組 token 組合上節省 $1.95,即 32.5%。
但每 token 價格只是第一項計算。更實用的生產指標是:
每個已接受任務的成本 = 包含重試在內的模型總支出,除以通過審查的結果數量。
如果較便宜的模型需要更多重試、更長的人工作業檢查或重複工具呼叫,其 token 優勢就會部分消失。不要假定一定如此,請實際測量。反過來也可能成立:Kimi 可能同樣可靠地完成你的工作負載,同時保留全部節省。
勝者:token 價格為 Kimi K3。完成任務成本的勝者需要由你自行評估。
開發者與社群實際看到的結果
關於 Kimi K3 與 Claude Opus 5 的社群討論很有用,但前提是日期與測試設定都保留。
有三種模式特別值得注意。
第一,Kimi 因前端工作與價格獲得了真正的關注。它不只是被討論為較便宜的文字模型,開發者也對其視覺程式設計、長上下文、代理工作與可下載權重感興趣。
第二,Opus 5 上線後改變了比較結果。目前的獨立智慧測試、速度與初步前端結果都偏向 Opus。7 月 24 日以前撰寫,或發布後最初數小時內根據結果撰寫的貼文,可能已不再代表即時排名。
第三,許多比較混合了基礎模型與其周邊產品。成熟的 Claude Code 結果不能證明原始模型在另一個代理中會有相同表現,Kimi Code CLI 也是如此。工具權限、上下文壓縮、系統指示、推理強度、重試政策與瀏覽器存取,都會影響最終應用程式。
社群報告最適合用來找出值得執行的測試,不應取代這些測試。
Kimi K3 與 Claude Opus 5 的公平程式設計測試
以下是建議的評估方式,不是聲稱 GPT Proto 的測試結果:
使用提供的參考截圖建立回應式分析儀表板。
需求:
1. 重現桌面版版面、間距、色彩、字體、圖表與卡片層級。
2. 在 768px 以下加入可運作的行動版導覽選單。
3. 加入會更新顯示指標的日期範圍篩選器。
4. 使用可重複使用的元件,並保留現有專案結構。
5. 執行現有測試,並為篩選器互動加入測試。
6. 在瀏覽器中開啟結果,檢查桌面版與行動版版面。
7. 完成前修正可見的版面錯誤、主控台錯誤與失敗測試。
8. 回傳變更檔案、執行測試及任何剩餘限制的簡短摘要。
為了讓比較有意義,請給兩個模型:
-
相同的儲存庫 commit 與參考截圖
-
相同的系統指示與工具權限
-
等同的推理強度
-
相同的時間與 token 限制
-
相同的「完成」定義
-
若預算允許,至少進行三次嘗試
記錄首次成功率、測試結果、視覺準確度、行動版行為、有效工具呼叫、完成時間、總 token 數、重試次數、人工作業修正及最終成本。
不要依據哪個模型產生更漂亮的第一張截圖來評分。產生吸引人頁面卻留下損壞的導覽、主控台錯誤或失敗測試的程式設計代理,並未完成任務。
你應該使用哪個模型?
| 使用情境 |
較佳選擇 |
原因 |
| 困難除錯與根本原因分析 |
Claude Opus 5 |
目前更強的代理結果與驗證行為 |
| 失敗代價高昂的大型儲存庫實作 |
Claude Opus 5 |
需要大量判斷之工作的較佳預設選擇 |
| 低延遲互動式程式設計 |
Claude Opus 5 |
測得速度更高,取得第一個 token 的時間更短 |
| 預算敏感的程式設計佇列 |
Kimi K3 |
輸入與輸出費率較低 |
| 前端原型與多個視覺方向 |
Kimi K3 |
以較低成本迭代,同時維持具競爭力的前端表現 |
| 高風險前端交付 |
Claude Opus 5 |
目前 WebDev Arena 領先者,但結果仍屬初步 |
| 影片輔助程式設計或 UI 分析 |
Kimi K3 |
原生影片輸入 |
| 私有部署或模型客製化 |
Kimi K3 |
可下載權重 |
| 企業知識工作 |
Claude Opus 5 |
目前更強的整體與代理結果 |
| 簡單分類或短篇轉換 |
預設情況下兩者皆非 |
較小的模型通常更經濟 |
最後一列很重要。對許多例行 API 工作負載而言,兩個模型都過於強大。如果任務只是短標籤、改寫或結構化擷取,而較小模型已能可靠處理,為一百萬 token 上下文與深度推理付費就沒有太大意義。
如何在 GPT Proto 上比較 Kimi K3 與 Claude Opus 5
GPT Proto 以一組 API 金鑰與共用餘額提供兩個模型。請使用目前模型頁面顯示的模型字串 kimi-k3 與 claude-opus-5。
以下腳本是依據目前 GPT Proto 快速入門格式建立的 API 層級冒煙測試。它可以協助記錄回應時間與 token 使用量,但不能取代上述儲存庫評估。
import os
import time
import requests
API_URL = "https://gptproto.com/v1/chat/completions"
API_KEY = os.environ["GPTPROTO_API_KEY"]
PROMPT = """
Create a TypeScript function that parses a comma-separated list of integer
ranges such as "1-3,7,10-12". Return the unique integers in ascending order.
Requirements:
- Reject reversed ranges such as "5-2".
- Reject invalid or empty segments.
- Support negative integers.
- Include unit tests.
- Explain the edge cases you handled.
"""
models = [
{
"model": "kimi-k3",
"reasoning_effort": "high",
},
{
"model": "claude-opus-5",
"effort": "high",
},
]
headers = {
"Content-Type": "application/json",
"Authorization": API_KEY,
}
for config in models:
payload = {
"model": config["model"],
"messages": [{"role": "user", "content": PROMPT}],
"max_tokens": 8000,
}
if "reasoning_effort" in config:
payload["reasoning_effort"] = config["reasoning_effort"]
if "effort" in config:
payload["effort"] = config["effort"]
started = time.perf_counter()
response = requests.post(
API_URL,
headers=headers,
json=payload,
timeout=600,
)
response.raise_for_status()
elapsed = time.perf_counter() - started
result = response.json()
print(f"\nModel: {config['model']}")
print(f"Elapsed time: {elapsed:.2f} seconds")
print(f"Usage: {result.get('usage', {})}")
print(result["choices"][0]["message"]["content"])
正式投入生產前請查看目前文件,特別是模型專用的思考欄位、工具呼叫、圖片或影片上傳,以及多輪訊息歷史。Kimi K3 要求在持續推理與工具迴圈期間保留完整的 assistant 訊息;生產整合不應只保留可見的 content。
最終結論
Claude Opus 5 在這項比較中勝出,是更強的通用推薦。它速度更快,目前在獨立智慧測試中分數更高,也更適合錯誤會造成昂貴返工的困難程式設計任務。
Kimi K3 則在另一場競賽中勝出。它成本更低、接受影片、提供可下載權重,而且在目前評估中的差距仍小到足以成為認真的生產候選,而不只是預算替代品。
當失敗代價高昂時,選擇 Claude Opus 5;當 token 成本、部署控制權或多模態彈性是不可忽略的限制時,選擇 Kimi K3。