Michael Johnson2026-07-28

Kimi K3 是什麼?真的接近 GPT-5.6 與 Fable 5 嗎?

Kimi K3 是開源模型嗎?它真的接近 GPT-5.6 和 Fable 5 嗎?探索其 1M 上下文、API 定價、獨立基準測試與 Reddit 反應。

Kimi K3 是什麼?真的接近 GPT-5.6 與 Fable 5 嗎?

TL;DR

Kimi K3 是 Moonshot AI 推出的 2.8 兆參數多模態模型,專為長時間跨度的程式設計、知識工作、推理與代理工作流程打造。獨立測試顯示,它整體表現接近 Claude Opus 4.8 與 GPT-5.5,但 GPT-5.6 Sol 和 Claude Fable 5 仍然領先。K3 在代理基準測試中更加接近頂尖模型,並在部分自動化測試中取得領先,但其測得的幻覺率較 K2.6 上升。
 Kimi K3 現已開放權重。Moonshot AI 已發布完整模型檢查點、模型卡、技術報告與自訂 Kimi K3 License。官方 Hugging Face 儲存庫由 96 個 safetensors 分片組成,容量約 1.56 TB;Moonshot 建議使用配備 64 個以上加速器的超級節點部署。開放權重解決了所有權問題,但並不代表 K3 成為一般的本地模型。
對大多數開發者而言,託管 API 仍是最實際的起點。目前,GPTProto 上的 Kimi K3 API列出的價格為每百萬個輸入 token 2.70 美元,以及每百萬個輸出 token 13.50 美元。當資料控管、自訂推論或模型修改的價值足以抵銷基礎設施成本與授權審查時,再選擇模型權重。
簡而言之,Kimi K3 已足夠接近 GPT-5.6 和 Fable 5,足以加入同一場討論—而如今開放權重的發布,也讓開發者擁有一個這兩個閉源模型都不提供的部署選項。

目錄

Kimi K3 是什麼?

Kimi K3 是 Moonshot AI 推出的全新旗艦多模態推理模型,專為可能涉及數小時程式設計、研究、工具使用與反覆修改的工作而打造—而不只是回答單一聊天提示。

模型於 2026 年 7 月 16 日在 Kimi.com、Kimi Work、Kimi Code 和 Kimi API 上線。它共有 2.8 兆個參數,支援一百萬 token 的上下文視窗,以及文字、圖片和影片輸入。輸出仍然是文字。

在底層架構方面,K3 使用包含 896 個專家的混合專家架構,每次啟用其中 16 個。Moonshot 也推出 Kimi Delta Attention、Attention Residuals 和 Stable LatentMoE,以改善資訊在長序列與深層模型層之間的傳遞。Moonshot 宣稱,這些改動帶來的擴展效率約為 Kimi K2 的 2.5 倍,但這項數據來自開發者,而非獨立測試。Moonshot 的 Kimi K3 技術部落格提供目前的架構細節;更完整的技術報告仍待發布。

規格 Kimi K3
開發者 Moonshot AI
公開發布 2026 年 7 月 16 日
參數總數/啟用數 2.8T / 104B
架構 混合專家
專家數量 總計 896 個,啟用 16 個
上下文視窗 一百萬 token
輸入 文字、圖片與影片
輸出 文字
API 模型字串 kimi-k3
思考模式 始終啟用
權重可用性 完整權重已發布於 `moonshotai/Kimi-K3

這使 K3 成為目前已公布的最大型 AI 模型之一。然而,規模本身並不是重點。真正的問題在於,Moonshot 是否成功將這些參數轉化為更好的任務完成能力。

此次發布也消除了早期發布報導中的一項不確定性:技術報告現已公開。但這並不代表不再需要獨立評估,也不會讓 2.8T 模型變成容易自行託管的專案。

Kimi K3 真的接近 GPT-5.6 和 Claude Fable 5 嗎?

若論整體智慧,還不完全是;但在多項代理與長時間跨度任務中,答案是肯定的。

Moonshot 自己的公告比由此產生的許多新聞標題更加克制。該公司表示,K3 的整體表現仍落後於 Claude Fable 5 和 GPT-5.6 Sol,但同時也報告了其在程式設計、知識工作與推理方面達到前沿級的結果。

其中一個例子是 GPU 核心最佳化。Moonshot 將每個模型放在相同的沙盒中,給予最多 24 小時來最佳化四項 GPU 任務。K3 在這項測試中與 Fable 5 競爭力相當,並擊敗 GPT-5.6 Sol、GPT-5.5 和 Opus 4.8。對低階效能工程而言,這是一項重要成果,但不能證明 K3 在所有方面都更聰明。

獨立測試讓我們看到更完整的情況。Artificial Analysis 在其 Intelligence Index 中給予 Kimi K3 57 分,表現接近 GPT-5.5 和 Claude Opus 4.8,但落後於 Fable 5 和 GPT-5.6 Sol。它最強的結果出現在代理執行與自動化,而不是每一種智慧類別。Artificial Analysis 於 7 月 16 日發布了 K3 的測試結果.

評估 Kimi K3 結果 這告訴我們什麼
AA Intelligence Index 57 接近 GPT-5.5 和 Opus 4.8;落後於 GPT-5.6 Sol 和 Fable 5
GDPval-AA v2 1,668 Elo 在真實世界代理任務中執行力強
AutomationBench-AA 53%,排名第一 特別擅長 SaaS 工作流程自動化
AA-Briefcase 1,547 Elo,排名第二 長時間跨度知識工作能力強
全知準確率 46% 高於 K2.6 的 33%
幻覺率 51% 比 K2.6 的 39% 更差

最後一列是讓我停下來思考的地方。K3 的能力有所提升,但 Artificial Analysis 測得的幻覺也更多。它正確回答了更多問題,卻同時產生了更高比例的缺乏依據的說法。

這種取捨在生產環境中很重要。一個完成長時間代理工作流程、卻悄悄引入錯誤假設的模型,驗證成本可能高於一個速度較慢但事實表現更穩定的模型。

為什麼單一排行榜無法決定比較結果

K3 已經在至少一個前端生成排行榜上名列前茅,也在 GPU 最佳化、SaaS 自動化和長時間跨度知識工作方面表現良好。但這些結果測量的並不是同一種能力。

前端競技場測量的是使用者對生成介面的偏好;AutomationBench 測量的是代理能否操作軟體工作流程;GPU 核心最佳化測試的是低階系統工程能力。沒有任何一項能單獨回答 K3 是否更擅長研究、事實回憶、除錯、簡報設計或一般推理。

較站得住腳的結論是:Kimi K3 已進入代理工作的前沿模型群組,但 GPT-5.6 Sol 和 Fable 5 在更廣泛的比較中仍然領先。想使用目前閉源模型能力上限的開發者,可以查看 GPT-5.6 Sol API;而 Claude Opus 4.8仍是複雜程式設計與研究工作流程中更成熟的選項。

開放權重問題已解決;部署問題仍未解決

發布週的問題是 Moonshot 是否真的會公開權重。答案是肯定的。官方的 moonshotai/Kimi-K3儲存庫現在包含完整檢查點、模型卡、技術報告、推論程式碼和 Kimi K3 License。

精確的措辭仍然重要。Kimi K3 是開放權重模型,而不是毫無限制的「完全開源」發布。其自訂授權允許廣泛使用、修改、微調、部署與再分發,但對大型 Model-as-a-Service 業務和超大型商業產品增加了條件。訓練資料並未公開。

可取得性也不等於可用性。儲存庫約 1.56 TB,Moonshot 建議使用配備 64 個以上加速器的超級節點部署。因此,K3 與雲端及企業基礎設施團隊相關,而不是一般工作站上的例行下載。

這次發布仍然意義重大。組織現在可以檢查模型檢查點、自訂推論、微調衍生模型,並在不完全依賴單一託管端點的情況下運行模型。代價則是硬體、服務工程與授權審查。

從 Kimi K2.7 到 Kimi K3 有哪些變化?

K3 並不是只替 Kimi K2.7 加上一個更大的版本號。

Kimi K2.7 Code 是以 K2.6 為基礎、專注於程式設計的代理模型。其模型卡強調真實世界軟體工程、長時間程式設計工作階段、工具使用,以及較低的推理 token 消耗。K3 則將這個角色擴展為涵蓋程式設計、視覺推理、研究與端到端知識工作的通用旗艦模型。

上下文視窗從 256K 增加至一百萬 token。總參數量從一兆提升至 2.8 兆,專家數量則從 384 增加至 896。價格也隨之上升。

功能 Kimi K3 Kimi K2.7 Code
定位 通用旗艦模型 專注於程式設計的模型
參數總數 2.8T 1T
專家數量 896 個,啟用 16 個 384 個,啟用 8 個
上下文視窗 1M 256K
標準輸入 $3.00/MTok $0.95/MTok
輸出 $15.00/MTok $4.00/MTok
快取輸入 $0.30/MTok $0.19/MTok
模型權重 可依 Kimi K3 License 取得 可用

因此,K3 的價值主張並不是「幾乎免費的前沿智慧」。它提供的是接近前沿的代理效能,以及兩種部署途徑:可立即使用的計量 API,以及供準備自行負責基礎設施的團隊使用的已發布權重。

其中的 官方 K2.7 Code 模型卡包含其架構、基準測試方法與部署指南。

Kimi K3 如何處理一百萬 token 的上下文

一百萬 token 的上下文視窗讓 K3 能在單次請求中接收大型程式碼庫、技術文件集合、長時間代理歷史和中間工具結果。

這對長時間運行的代理尤其重要。程式設計模型可能需要在數十個步驟中保留初始規格、儲存庫結構、終端輸出、測試失敗、先前修改和審查者回饋。若在任務進行到一半時遺失其中一項限制,代理看似有生產力卻無法完成任務,這是常見原因。

K3 也會自動進行上下文快取。開發者不需要建立快取 ID,也不需要設定獨立的存留時間值。如果長前綴在請求之間保持不變,系統會自動嘗試命中快取。快取輸入每百萬 token 收費 0.30 美元,而非 3.00 美元。

但上下文容量不等於完美的上下文使用。向模型提供一百萬 token 並不能保證它會正確判斷每一行的重要性。較長的輸入也可能增加成本、處理時間,以及無關資料造成的干擾。

合理的方法仍然是先擷取最相關的檔案,將穩定的參考內容放在開頭以利快取,並避免僅因為限制允許就傳送整個知識庫。Kimi 的 API 指南說明了一百萬 token 的上下文和自動快取行為。

Kimi K3 API 定價不再是低價方案

Moonshot 官方的 Kimi K3 API 採用固定的隨用隨付定價。當請求跨越更大的上下文級別時,費率不會改變。

Token 類型 每 1M token 的價格
快取輸入 $0.30
標準輸入 $3.00
輸出 $15.00

以使用 100,000 個未快取輸入 token 並產生 20,000 個輸出的較短代理任務為例,估計模型成本為:

(0.1 × $3) + (0.02 × $15) = $0.60

現在考慮一個重複的長上下文工作流程,其中包含 800,000 個快取 token、50,000 個新輸入 token,以及 50,000 個輸出 token:

(0.8 × $0.30) + (0.05 × $3) + (0.05 × $15) = $1.14

快取讓第二個例子的成本仍可控,但 K3 顯然不符合過去「中國模型等於極其便宜的 API」這個公式。

Artificial Analysis 測得 K3 在 Intelligence Index 任務上的平均成本為 0.94 美元,接近 GPT-5.6 Sol 的 1.04 美元,約為 Opus 4.8 1.80 美元的一半。GLM-5.2 完成相同評估工作量的成本低得多。

比較結果也會因使用模型的管道不同而改變。目前,GPT Proto 上的 Kimi K3 API每百萬個輸入 token 收費 2.70 美元,每百萬個輸出 token 收費 13.50 美元,比 Moonshot 的 $3/$15 列表價格低 10%。GPT Proto 也透過同一組 API 金鑰和共用餘額提供 GPT-5.6 SolGLM-5.2,讓使用者無需分別註冊供應商帳戶,即可更容易進行任務層級比較。

因此,K3 的價值主張並不是「幾乎免費的前沿智慧」。它提供的是接近前沿的代理效能,以及兩種部署途徑:可立即使用的計量 API,以及供準備自行負責基礎設施的團隊使用的已發布權重。

Kimi K3 API 與開放權重:應該使用哪一種?

 Kimi K3 現在讓開發者擁有真正的部署選擇。兩種途徑吸引人的都是模型能力,但運作模式完全不同。

託管 Kimi K3 API Kimi K3 開放權重
按 token 付費 購買或租用加速器容量
供應商負責擴展、快取、更新與故障 你的團隊負責服務、擴展、監控、升級與故障
最快完成評估並投入生產 對資料、推論與模型修改擁有最高控制權
託管服務文件說明支援文字、圖片與影片輸入 目前公開儲存庫的中繼資料主要集中於文字和圖片;在承諾支援影片前,請先確認影片路徑是否一致
無需下載 1.56 TB 96 個權重分片,總容量約 1.56 TB
無需進行叢集部署專案 Moonshot 建議使用 64 個以上加速器

如果你仍在驗證產品市場契合度、流量不穩定,或團隊尚未運營大型模型基礎設施,請先使用 API。GPT Proto Kimi K3 API也能讓你更輕鬆地在同一組金鑰與餘額下比較 K3、GPT-5.6 Sol、GLM-5.2 和其他模型。

當私有部署、微調、自訂推論或供應商獨立性能帶來足夠商業價值、值得投入叢集時,再使用模型權重。在商業部署前,請檢閱 Kimi K3 License,不要假設「開放」就代表 MIT。

Kimi K3 對比 GLM-5.2、GPT-5.6 與 Opus 4.8

基準測試的勝出者不一定是正確的生產模型。實際選擇取決於可能發生什麼故障、工作流程持續多久,以及擁有模型權重是否重要。

模型 適合在何時選用
Kimi K3 你需要長時間的多模態代理工作流程,並希望立即使用託管 API,或依 Kimi K3 License 採用開放權重部署
GPT-5.6 Sol 整體推理品質與可靠的生產效能比模型所有權更重要
Claude Fable 5 你希望擁有測得最高的代理知識工作能力上限,且能夠使用該模型
Claude Opus 4.8 你已經依賴 Claude 工作流程處理複雜程式設計、研究和嚴謹的指令遵循
GLM-5.2 你需要較低成本的代理程式設計,且模型權重已可取得
Kimi K2.7 Code 你的工作負載主要是程式設計,而 K3 較高的價格難以合理化

當三個條件同時出現時,K3 的適用理由最明確:長時間任務、多模態輸入,以及需要控制模型部署的原因。若沒有這些需求,它的規模可能只是用昂貴方案回答較小的問題。

當整體智慧與可靠性優先時,GPT-5.6 Sol 仍是更強的選擇。對於擁有成熟 Claude 程式設計或研究工作流程的團隊,Opus 4.8 很合適。GLM-5.2 已提供一百萬 token 上下文和較低任務成本的開放權重,因此在經濟性方面是更難應付的競爭者。

我目前的經驗法則很簡單:需要開放權重和長時間多模態代理時選 K3;可靠性比模型所有權更重要時選 GPT-5.6 或 Opus;成本是無法妥協的限制時選 GLM-5.2。

現在可以透過 GPT Proto 使用 Kimi K3 嗎?

可以。Kimi K3 現已透過 GPT Proto Kimi K3 API提供。

目前 GPT Proto 的費率為每百萬個輸入 token 2.70 美元、每百萬個輸出 token 13.50 美元,比 Moonshot 目前 $3/$15 的列表價格低 10%。使用模型字串 kimi-k3搭配 GPT Proto API 金鑰,即可使用 K3 的長上下文程式設計、多模態分析、工具呼叫與結構化輸出能力。

同一組金鑰與共用餘額也涵蓋 GPT-5.6 SolGLM-5.2Claude Opus 4.8,以及 200 多個文字、圖片、影片和音訊模型。這讓你可以在同一個儲存庫或代理工作流程中,先將 K3 與其他選項進行測試,再變更生產流量。

你可以在 GPT Proto 上試用 Kimi K3,或瀏覽完整的GPT Proto AI 模型庫。模型權重和技術報告現已公開,但隨著獨立部署測試、量化版本、吞吐量資料和框架支援逐漸成熟,仍應重新檢視本文。

最終結論:足夠接近,但基準測試仍然重要

Kimi K3 不只是因參數量龐大而受到關注的中國模型。獨立測試支持更重要的結論:它在自動化、長時間跨度知識工作和代理執行方面,具備與前沿系統競爭的能力。

但這並不代表它整體上優於 GPT-5.6 Sol 或 Claude Fable 5,也無法抹去測得的幻覺率上升。7 月 28 日的變化在於部署:承諾的權重、授權、模型卡和技術報告現已公開。
因此,K3 是同類模型中能力最強的開放權重選項之一,但這句話需要兩個註腳:其授權是自訂授權而非 MIT,且 1.56 TB 的儲存庫加上 64 個以上加速器的建議,讓自行託管超出一般開發團隊的能力範圍。
我的結論是:先使用 API,確認 K3 是否確實能改善你的任務;只有當控制權、自訂能力或資料邊界足以證明自行成為基礎設施供應商是合理的時候,才轉向使用模型權重。

創意工作室

使用生產級 API 生成圖像、影片及更多內容。

開始創作
創意工作室
相關模型
全部模型
MoonshotAI
10% OFF
OpenAI
20% OFF
Claude
20% OFF
Z-AI
by Z-AI
10% OFF

常見問題

Kimi K3 是什麼?

Kimi K3 是由 Moonshot AI 開發的 2.8 兆參數多模態 AI 模型,專為長時間跨度的程式設計、知識工作、推理、視覺理解與代理工作流程打造。

Kimi K3 何時發布?

Kimi K3 於 2026 年 7 月 16 日上線。Moonshot 表示完整模型權重將於 2026 年 7 月 27 日前發布。

Kimi K3 是開源模型嗎?

Kimi K3 是開放權重模型。Moonshot AI 已依自訂 Kimi K3 License 發布完整檢查點、模型卡、推論程式碼和技術報告。訓練資料並未公開,且授權對大型 Model-as-a-Service 業務和超大型商業產品設有條件,因此稱為「完全開源」並不精確。

Kimi K3 的上下文視窗有多大?

Kimi K3 支援一百萬 token 的上下文視窗,也為重複的長前綴提供自動上下文快取。

Kimi K3 API 的價格是多少?

官方 Kimi K3 API 的價格為每百萬個標準輸入 token 3 美元、每百萬個輸出 token 15 美元,以及每百萬個快取輸入 token 0.30 美元。

Kimi K3 比 GPT-5.6 Sol 更好嗎?

整體而言不是。Kimi K3 在部分代理與專項測試中領先或接近 GPT-5.6 Sol,但 Moonshot 和獨立測試都顯示,GPT-5.6 Sol 在更廣泛的智慧能力上領先。

Kimi K3 比 Claude Fable 5 更好嗎?

目前證據顯示不是。K3 在多項長時間跨度和代理任務中接近 Fable 5,但在發布時可取得的更廣泛獨立評估中,Fable 5 仍然領先。

Kimi K3 比 GLM-5.2 更好嗎?

Kimi K3 測得的智慧與代理效能上限更高。GLM-5.2 價格更低、規模更小,且已可作為開放權重模型使用,因此可能是更實際的選擇。

Kimi K3 可以在本地運行嗎?

你可以下載模型權重,但實際部署並非通常意義上的本地部署。官方儲存庫約 1.56 TB,Moonshot 建議使用配備 64 個以上加速器的超級節點配置。

我應該使用 Kimi K3 API 還是開放權重?

在進行評估、面對流量變化或需要託管運作時,請先從 API 開始。當私有部署、微調、自訂推論或供應商獨立性足以證明硬體、服務工作與授權審查成本合理時,再使用模型權重。

相關文章

更多部落格
2026 年開發者最佳 AI API:10 個平台比較

2026 年開發者最佳 AI API:10 個平台比較

重點摘要 最佳直接 API: OpenAI 是最安全的通用預設選擇;Anthropic Claude 最適合程式碼開發與長時間執行的代理;Gemini 適合低成本多模態原型開發;DeepSeek 則在文字 Token 價格方面領先。 最佳多模型選項: OpenRouter 是測試多種 LLM 的清晰選擇。當單一產品需要透過一個 API 金鑰和共用餘額使用文字、圖片與影片模型時,GPTProto 更為合適。 最佳基礎架構選擇: Amazon Bedrock 適合受 AWS 管理的企業部署;Replicate、fal.ai 與 Together AI 則更適合開放模型或生成式媒體推理。 沒有適用於所有情境的唯一贏家。請比較工作負載適配度、模型涵蓋範圍、實際計費單位、生產環境控制能力與切換成本。價格與可用性已於 2026 年 7 月 14 日確認;部署前請查看供應商的即時頁面。

Tiffany Layne | 2026-07-15

GPT-5.6 Sol 與 Claude Fable 5:每個 Token 更便宜,還是更值得信任?(2026)

GPT-5.6 Sol 與 Claude Fable 5:每個 Token 更便宜,還是更值得信任?(2026)

兩週前,這個比較有個無聊的答案:選 Claude Fable 5,因為你根本拿不到 GPT-5.6 Sol。Sol 當時被鎖在政府審查的預覽計畫中,僅開放給約二十家機構。這項限制已經解除。OpenAI 已於 7 月 9 日將 GPT-5.6 系列——Sol、Terra 與 Luna—— 全面開放 ,而 Fable 5 在美國商務部解除導致其暫停的出口管制後,也已自 7 月 1 日起在全球提供。因此,這個問題再次成立,而且不再是關於存取權限,而是關於你能承受哪個模型的失誤模式。 我會先說明我的結論,再展示依據。 簡而言之 對財務團隊在意的每個面向而言,Sol 都更便宜。在 GPTProto 上,它每百萬輸入/輸出 Token 的價格為 4 美元/24 美元,而 Fable 5 為 8 美元/40 美元;一旦你以完成任務而非 Token 衡量,差距還會擴大。另一方面,Fable 5 的整體設計押注於可預測的行為:被標記的提示會回退到更安全的模型,而且它沒有養成任何一種會讓把 Sol 接入無人監督流程的人感到擔憂的習慣。獨立評估機構 METR 指出,Sol 的獎勵駭取率是其測試過的所有公開模型中最高的。因此,「每個 Token 更便宜」明確是 Sol;「沒人看管時更值得信任」則是 Fable。本文大部分內容都在說明,為什麼這兩句話並不互相抵消。 兩個模型都使用同一組 GPTProto 金鑰與同一個餘額,因此你可以依任務在兩者之間路由,而不必讓整個技術堆疊押注在單一答案上。文末會再詳細說明。

Michael Johnson | 2026-07-10

MiniMax M3 程式設計:基準測試、實際定價,以及如何透過 API 呼叫(2026)

MiniMax M3 程式設計:基準測試、實際定價,以及如何透過 API 呼叫(2026)

MiniMax M3 適合程式設計嗎?簡短答案是:對代理式和多檔案工作來說適合,但有兩個注意事項,我會在你繼續讀下去前先坦白說明。大多數熱門的程式設計評分都是 MiniMax 在自家基礎架構上執行的,而所謂的「100 萬 token 上下文」在 512K 處有一道價格門檻,尤其會影響程式設計代理。只要知道這些限制,兩者都可以妥善處理。可惜大多數發布報導都沒有清楚呈現這些資訊。 我寫這篇文章,是因為圍繞 M3 的程式設計宣傳被簡化成一個數字 — SWE-Bench Pro 的 59% — 而這個數字承擔了太多未經檢視的解讀。接下來我會說明這個模型實際上是什麼、獨立測量結果落在哪裡、在真實程式設計工作負載下的成本,以及如何透過 GPTProto API 呼叫它。如果你只想知道結論:一位對所有嚴肅模型都執行相同測試組合的獨立評測者認為,M3「在實際程式設計上接近 GPT 和 Opus,但還沒有超越它們」。這也符合中立基準測試的結果。

Schuyler Stacy | 2026-07-02

GLM-5.2 與 Kimi K3 程式設計比較:2026 年哪個更適合開發者?

GLM-5.2 與 Kimi K3 程式設計比較:2026 年哪個更適合開發者?

TL;DR: 當任務困難、執行時間長或涉及視覺內容時,Kimi K3 是更強的程式設計模型。在 Moonshot 公開的程式設計比較中,它全面領先 GLM-5.2,並可透過其託管服務接受圖片與影片。對於日常的儲存庫工作,GLM-5.2 仍是更好的預設選擇:成本低得多、運行規模較小,且採用寬鬆的 MIT 授權。Kimi K3 現在也已釋出權重,但其 1.56 TB 儲存庫、建議使用 64 個以上加速器的部署要求,以及自訂授權,意味著自行託管需要投入更多資源。當能力是瓶頸時選擇 Kimi;當成本與日常運營簡易性更重要時選擇 GLM。 GLM-5.2 與 Kimi K3 程式碼比較中有趣的地方,不在於兩個模型都能撰寫 React 元件或解決簡短演算法。這個層級的模型早已具備這些能力。真正有用的問題是,當任務變得複雜時會發生什麼:儲存庫稽核、多檔案遷移、只會在螢幕截圖中出現的錯誤,或必須讓多個系統保持一致的可遊玩 Three.js 原型。 這也是價格差異開始產生影響的地方。Kimi K3 在最困難的公開測試中表現較佳,但其官方輸出價格超過 GLM-5.2 的三倍。每天執行數千次普通審查的團隊,使用 GLM 可能能以每美元完成更多工作。試圖挽救一個棘手視覺專案的開發者,則可能很樂意為 K3 買單。

Tiffany Layne | 2026-07-28