Kimi K3 是什麼?
Kimi K3 是 Moonshot AI 推出的全新旗艦多模態推理模型,專為可能涉及數小時程式設計、研究、工具使用與反覆修改的工作而打造—而不只是回答單一聊天提示。
模型於 2026 年 7 月 16 日在 Kimi.com、Kimi Work、Kimi Code 和 Kimi API 上線。它共有 2.8 兆個參數,支援一百萬 token 的上下文視窗,以及文字、圖片和影片輸入。輸出仍然是文字。
在底層架構方面,K3 使用包含 896 個專家的混合專家架構,每次啟用其中 16 個。Moonshot 也推出 Kimi Delta Attention、Attention Residuals 和 Stable LatentMoE,以改善資訊在長序列與深層模型層之間的傳遞。Moonshot 宣稱,這些改動帶來的擴展效率約為 Kimi K2 的 2.5 倍,但這項數據來自開發者,而非獨立測試。Moonshot 的 Kimi K3 技術部落格提供目前的架構細節;更完整的技術報告仍待發布。
| 規格 |
Kimi K3 |
| 開發者 |
Moonshot AI |
| 公開發布 |
2026 年 7 月 16 日 |
| 參數總數/啟用數 |
2.8T / 104B |
| 架構 |
混合專家 |
| 專家數量 |
總計 896 個,啟用 16 個 |
| 上下文視窗 |
一百萬 token |
| 輸入 |
文字、圖片與影片 |
| 輸出 |
文字 |
| API 模型字串 |
kimi-k3 |
| 思考模式 |
始終啟用 |
| 權重可用性 |
完整權重已發布於 `moonshotai/Kimi-K3 |
這使 K3 成為目前已公布的最大型 AI 模型之一。然而,規模本身並不是重點。真正的問題在於,Moonshot 是否成功將這些參數轉化為更好的任務完成能力。
此次發布也消除了早期發布報導中的一項不確定性:技術報告現已公開。但這並不代表不再需要獨立評估,也不會讓 2.8T 模型變成容易自行託管的專案。
Kimi K3 真的接近 GPT-5.6 和 Claude Fable 5 嗎?
若論整體智慧,還不完全是;但在多項代理與長時間跨度任務中,答案是肯定的。
Moonshot 自己的公告比由此產生的許多新聞標題更加克制。該公司表示,K3 的整體表現仍落後於 Claude Fable 5 和 GPT-5.6 Sol,但同時也報告了其在程式設計、知識工作與推理方面達到前沿級的結果。
其中一個例子是 GPU 核心最佳化。Moonshot 將每個模型放在相同的沙盒中,給予最多 24 小時來最佳化四項 GPU 任務。K3 在這項測試中與 Fable 5 競爭力相當,並擊敗 GPT-5.6 Sol、GPT-5.5 和 Opus 4.8。對低階效能工程而言,這是一項重要成果,但不能證明 K3 在所有方面都更聰明。
獨立測試讓我們看到更完整的情況。Artificial Analysis 在其 Intelligence Index 中給予 Kimi K3 57 分,表現接近 GPT-5.5 和 Claude Opus 4.8,但落後於 Fable 5 和 GPT-5.6 Sol。它最強的結果出現在代理執行與自動化,而不是每一種智慧類別。Artificial Analysis 於 7 月 16 日發布了 K3 的測試結果.
| 評估 |
Kimi K3 結果 |
這告訴我們什麼 |
| AA Intelligence Index |
57 |
接近 GPT-5.5 和 Opus 4.8;落後於 GPT-5.6 Sol 和 Fable 5 |
| GDPval-AA v2 |
1,668 Elo |
在真實世界代理任務中執行力強 |
| AutomationBench-AA |
53%,排名第一 |
特別擅長 SaaS 工作流程自動化 |
| AA-Briefcase |
1,547 Elo,排名第二 |
長時間跨度知識工作能力強 |
| 全知準確率 |
46% |
高於 K2.6 的 33% |
| 幻覺率 |
51% |
比 K2.6 的 39% 更差 |
最後一列是讓我停下來思考的地方。K3 的能力有所提升,但 Artificial Analysis 測得的幻覺也更多。它正確回答了更多問題,卻同時產生了更高比例的缺乏依據的說法。
這種取捨在生產環境中很重要。一個完成長時間代理工作流程、卻悄悄引入錯誤假設的模型,驗證成本可能高於一個速度較慢但事實表現更穩定的模型。
為什麼單一排行榜無法決定比較結果
K3 已經在至少一個前端生成排行榜上名列前茅,也在 GPU 最佳化、SaaS 自動化和長時間跨度知識工作方面表現良好。但這些結果測量的並不是同一種能力。
前端競技場測量的是使用者對生成介面的偏好;AutomationBench 測量的是代理能否操作軟體工作流程;GPU 核心最佳化測試的是低階系統工程能力。沒有任何一項能單獨回答 K3 是否更擅長研究、事實回憶、除錯、簡報設計或一般推理。
較站得住腳的結論是:Kimi K3 已進入代理工作的前沿模型群組,但 GPT-5.6 Sol 和 Fable 5 在更廣泛的比較中仍然領先。想使用目前閉源模型能力上限的開發者,可以查看 GPT-5.6 Sol API;而 Claude Opus 4.8仍是複雜程式設計與研究工作流程中更成熟的選項。
開放權重問題已解決;部署問題仍未解決
發布週的問題是 Moonshot 是否真的會公開權重。答案是肯定的。官方的 moonshotai/Kimi-K3儲存庫現在包含完整檢查點、模型卡、技術報告、推論程式碼和 Kimi K3 License。
精確的措辭仍然重要。Kimi K3 是開放權重模型,而不是毫無限制的「完全開源」發布。其自訂授權允許廣泛使用、修改、微調、部署與再分發,但對大型 Model-as-a-Service 業務和超大型商業產品增加了條件。訓練資料並未公開。
可取得性也不等於可用性。儲存庫約 1.56 TB,Moonshot 建議使用配備 64 個以上加速器的超級節點部署。因此,K3 與雲端及企業基礎設施團隊相關,而不是一般工作站上的例行下載。
這次發布仍然意義重大。組織現在可以檢查模型檢查點、自訂推論、微調衍生模型,並在不完全依賴單一託管端點的情況下運行模型。代價則是硬體、服務工程與授權審查。
從 Kimi K2.7 到 Kimi K3 有哪些變化?
K3 並不是只替 Kimi K2.7 加上一個更大的版本號。
Kimi K2.7 Code 是以 K2.6 為基礎、專注於程式設計的代理模型。其模型卡強調真實世界軟體工程、長時間程式設計工作階段、工具使用,以及較低的推理 token 消耗。K3 則將這個角色擴展為涵蓋程式設計、視覺推理、研究與端到端知識工作的通用旗艦模型。
上下文視窗從 256K 增加至一百萬 token。總參數量從一兆提升至 2.8 兆,專家數量則從 384 增加至 896。價格也隨之上升。
| 功能 |
Kimi K3 |
Kimi K2.7 Code |
| 定位 |
通用旗艦模型 |
專注於程式設計的模型 |
| 參數總數 |
2.8T |
1T |
| 專家數量 |
896 個,啟用 16 個 |
384 個,啟用 8 個 |
| 上下文視窗 |
1M |
256K |
| 標準輸入 |
$3.00/MTok |
$0.95/MTok |
| 輸出 |
$15.00/MTok |
$4.00/MTok |
| 快取輸入 |
$0.30/MTok |
$0.19/MTok |
| 模型權重 |
可依 Kimi K3 License 取得 |
可用 |
因此,K3 的價值主張並不是「幾乎免費的前沿智慧」。它提供的是接近前沿的代理效能,以及兩種部署途徑:可立即使用的計量 API,以及供準備自行負責基礎設施的團隊使用的已發布權重。
其中的 官方 K2.7 Code 模型卡包含其架構、基準測試方法與部署指南。
Kimi K3 如何處理一百萬 token 的上下文
一百萬 token 的上下文視窗讓 K3 能在單次請求中接收大型程式碼庫、技術文件集合、長時間代理歷史和中間工具結果。
這對長時間運行的代理尤其重要。程式設計模型可能需要在數十個步驟中保留初始規格、儲存庫結構、終端輸出、測試失敗、先前修改和審查者回饋。若在任務進行到一半時遺失其中一項限制,代理看似有生產力卻無法完成任務,這是常見原因。
K3 也會自動進行上下文快取。開發者不需要建立快取 ID,也不需要設定獨立的存留時間值。如果長前綴在請求之間保持不變,系統會自動嘗試命中快取。快取輸入每百萬 token 收費 0.30 美元,而非 3.00 美元。
但上下文容量不等於完美的上下文使用。向模型提供一百萬 token 並不能保證它會正確判斷每一行的重要性。較長的輸入也可能增加成本、處理時間,以及無關資料造成的干擾。
合理的方法仍然是先擷取最相關的檔案,將穩定的參考內容放在開頭以利快取,並避免僅因為限制允許就傳送整個知識庫。Kimi 的 API 指南說明了一百萬 token 的上下文和自動快取行為。
Kimi K3 API 定價不再是低價方案
Moonshot 官方的 Kimi K3 API 採用固定的隨用隨付定價。當請求跨越更大的上下文級別時,費率不會改變。
| Token 類型 |
每 1M token 的價格 |
| 快取輸入 |
$0.30 |
| 標準輸入 |
$3.00 |
| 輸出 |
$15.00 |
以使用 100,000 個未快取輸入 token 並產生 20,000 個輸出的較短代理任務為例,估計模型成本為:
(0.1 × $3) + (0.02 × $15) = $0.60
現在考慮一個重複的長上下文工作流程,其中包含 800,000 個快取 token、50,000 個新輸入 token,以及 50,000 個輸出 token:
(0.8 × $0.30) + (0.05 × $3) + (0.05 × $15) = $1.14
快取讓第二個例子的成本仍可控,但 K3 顯然不符合過去「中國模型等於極其便宜的 API」這個公式。
Artificial Analysis 測得 K3 在 Intelligence Index 任務上的平均成本為 0.94 美元,接近 GPT-5.6 Sol 的 1.04 美元,約為 Opus 4.8 1.80 美元的一半。GLM-5.2 完成相同評估工作量的成本低得多。
比較結果也會因使用模型的管道不同而改變。目前,GPT Proto 上的 Kimi K3 API每百萬個輸入 token 收費 2.70 美元,每百萬個輸出 token 收費 13.50 美元,比 Moonshot 的 $3/$15 列表價格低 10%。GPT Proto 也透過同一組 API 金鑰和共用餘額提供 GPT-5.6 Sol與 GLM-5.2,讓使用者無需分別註冊供應商帳戶,即可更容易進行任務層級比較。
因此,K3 的價值主張並不是「幾乎免費的前沿智慧」。它提供的是接近前沿的代理效能,以及兩種部署途徑:可立即使用的計量 API,以及供準備自行負責基礎設施的團隊使用的已發布權重。
Kimi K3 API 與開放權重:應該使用哪一種?
Kimi K3 現在讓開發者擁有真正的部署選擇。兩種途徑吸引人的都是模型能力,但運作模式完全不同。
| 託管 Kimi K3 API |
Kimi K3 開放權重 |
| 按 token 付費 |
購買或租用加速器容量 |
| 供應商負責擴展、快取、更新與故障 |
你的團隊負責服務、擴展、監控、升級與故障 |
| 最快完成評估並投入生產 |
對資料、推論與模型修改擁有最高控制權 |
| 託管服務文件說明支援文字、圖片與影片輸入 |
目前公開儲存庫的中繼資料主要集中於文字和圖片;在承諾支援影片前,請先確認影片路徑是否一致 |
| 無需下載 1.56 TB |
96 個權重分片,總容量約 1.56 TB |
| 無需進行叢集部署專案 |
Moonshot 建議使用 64 個以上加速器 |
如果你仍在驗證產品市場契合度、流量不穩定,或團隊尚未運營大型模型基礎設施,請先使用 API。GPT Proto Kimi K3 API也能讓你更輕鬆地在同一組金鑰與餘額下比較 K3、GPT-5.6 Sol、GLM-5.2 和其他模型。
當私有部署、微調、自訂推論或供應商獨立性能帶來足夠商業價值、值得投入叢集時,再使用模型權重。在商業部署前,請檢閱 Kimi K3 License,不要假設「開放」就代表 MIT。
Kimi K3 對比 GLM-5.2、GPT-5.6 與 Opus 4.8
基準測試的勝出者不一定是正確的生產模型。實際選擇取決於可能發生什麼故障、工作流程持續多久,以及擁有模型權重是否重要。
| 模型 |
適合在何時選用 |
| Kimi K3 |
你需要長時間的多模態代理工作流程,並希望立即使用託管 API,或依 Kimi K3 License 採用開放權重部署 |
| GPT-5.6 Sol |
整體推理品質與可靠的生產效能比模型所有權更重要 |
| Claude Fable 5 |
你希望擁有測得最高的代理知識工作能力上限,且能夠使用該模型 |
| Claude Opus 4.8 |
你已經依賴 Claude 工作流程處理複雜程式設計、研究和嚴謹的指令遵循 |
| GLM-5.2 |
你需要較低成本的代理程式設計,且模型權重已可取得 |
| Kimi K2.7 Code |
你的工作負載主要是程式設計,而 K3 較高的價格難以合理化 |
當三個條件同時出現時,K3 的適用理由最明確:長時間任務、多模態輸入,以及需要控制模型部署的原因。若沒有這些需求,它的規模可能只是用昂貴方案回答較小的問題。
當整體智慧與可靠性優先時,GPT-5.6 Sol 仍是更強的選擇。對於擁有成熟 Claude 程式設計或研究工作流程的團隊,Opus 4.8 很合適。GLM-5.2 已提供一百萬 token 上下文和較低任務成本的開放權重,因此在經濟性方面是更難應付的競爭者。
我目前的經驗法則很簡單:需要開放權重和長時間多模態代理時選 K3;可靠性比模型所有權更重要時選 GPT-5.6 或 Opus;成本是無法妥協的限制時選 GLM-5.2。
現在可以透過 GPT Proto 使用 Kimi K3 嗎?
可以。Kimi K3 現已透過 GPT Proto Kimi K3 API提供。
目前 GPT Proto 的費率為每百萬個輸入 token 2.70 美元、每百萬個輸出 token 13.50 美元,比 Moonshot 目前 $3/$15 的列表價格低 10%。使用模型字串 kimi-k3搭配 GPT Proto API 金鑰,即可使用 K3 的長上下文程式設計、多模態分析、工具呼叫與結構化輸出能力。
同一組金鑰與共用餘額也涵蓋 GPT-5.6 Sol、GLM-5.2、Claude Opus 4.8,以及 200 多個文字、圖片、影片和音訊模型。這讓你可以在同一個儲存庫或代理工作流程中,先將 K3 與其他選項進行測試,再變更生產流量。
你可以在 GPT Proto 上試用 Kimi K3,或瀏覽完整的GPT Proto AI 模型庫。模型權重和技術報告現已公開,但隨著獨立部署測試、量化版本、吞吐量資料和框架支援逐漸成熟,仍應重新檢視本文。
最終結論:足夠接近,但基準測試仍然重要
Kimi K3 不只是因參數量龐大而受到關注的中國模型。獨立測試支持更重要的結論:它在自動化、長時間跨度知識工作和代理執行方面,具備與前沿系統競爭的能力。
但這並不代表它整體上優於 GPT-5.6 Sol 或 Claude Fable 5,也無法抹去測得的幻覺率上升。7 月 28 日的變化在於部署:承諾的權重、授權、模型卡和技術報告現已公開。
因此,K3 是同類模型中能力最強的開放權重選項之一,但這句話需要兩個註腳:其授權是自訂授權而非 MIT,且 1.56 TB 的儲存庫加上 64 個以上加速器的建議,讓自行託管超出一般開發團隊的能力範圍。
我的結論是:先使用 API,確認 K3 是否確實能改善你的任務;只有當控制權、自訂能力或資料邊界足以證明自行成為基礎設施供應商是合理的時候,才轉向使用模型權重。