更新 — 2026 年 7 月 28 日:Moonshot AI 現已發布完整的 Kimi K3 權重、模型卡、自訂授權條款與技術報告。此次發布解決了 Kimi 方面的可用性問題,但並不代表 2.8 兆參數模型容易自行託管:官方儲存庫約為 1.56 TB,且 Moonshot 建議使用 64 個以上加速器的超級節點部署。
Qwen 3.8 Max 與 Kimi K3 看似是兩個龐大中國 AI 模型之間的直接競爭:Alibaba 的 2.4 兆參數預覽版,對上 Moonshot AI 的 2.8 兆參數旗艦模型。這些數字容易讓人得出簡單結論:更大的模型應該會勝出。
但現有證據並非如此,而且這也不是對開發者最有用的比較方式。
截至 2026 年 7 月 23 日,Qwen 3.8 Max 仍是透過 Alibaba Token Plan 提供的持續變動預覽版。Kimi K3 已具備有文件記載的 API、公開的 Token 價格、100 萬 Token 的上下文視窗,以及發布完整權重的明確時程。兩者的能力差距可能很小,但產品成熟度差距並不小。
我的判斷很直接:如果你今天需要建立並估算真正的應用程式,Kimi K3 是較安全的選擇。Qwen 3.8 Max Preview 值得在程式開發工作流程中測試,尤其 Alibaba 的促銷 Credits 讓實驗成本很低;但它尚未提供足夠穩定的資訊,無法在生產環境決策中勝出。
重點摘要:目前 Kimi K3 是較安全的生產環境選擇
如果你需要傳統 API、可預測的每 Token 成本、原生圖片與影片理解能力,或現在就能整合到面向客戶產品中的模型,請選擇 Kimi K3。如果你已使用 Alibaba 的程式開發生態系,並希望以低促銷成本測試有潛力的新模型,請選擇 Qwen 3.8 Max Preview。
截至發布時,唯一可取得的詳細配對程式開發測試給予 Kimi K3 83 分、Qwen 3.8 Max 80 分。這 3 分差距是有用的證據,但不是普遍排名。Qwen 在測試中展現更清晰的系統邊界,且工具執行完美;Kimi 則更完整地處理了修訂歷史與重新生成。兩者也都做出了需要事實修正、缺乏支持的推論。
簡單來說:Kimi 目前在部署決策上勝出。Qwen 並未輸掉能力競賽,只是現在宣布它已勝出還為時過早。
Qwen 3.8 Max 與 Kimi K3 快速比較
| 類別 |
Qwen 3.8 Max |
Kimi K3 |
| 目前狀態 |
qwen3.8-max-preview;可能在預覽期間變更,或由生產版本取代 |
已發布且具備文件記載 API 存取權的模型 |
| 回報的總參數量 |
2.4T |
2.8T |
| 架構細節 |
尚未公開啟用參數與完整 MoE 配置 |
KDA、Attention Residuals 與 Stable LatentMoE;896 個專家中啟用 16 個 |
| 上下文視窗 |
目前模型產品頁面未清楚公開 |
1,048,576 個 Token |
| 文件記載的輸入類型 |
文字與圖片 |
文字、圖片與影片 |
| 推理 |
一律開啟;低、高或極高;預設為極高 |
一律開啟;低、高或最大;預設為最大 |
| 目前存取模式 |
Alibaba Token Plan,以及支援的程式開發或代理工具 |
傳統託管 API、Kimi 產品與程式開發工具 |
| 一般每 Token 價格 |
尚未公布 |
$3/M 新輸入,Moonshot 目前列示價格為 $15/M 輸出 |
| GPT Proto 價格 |
尚未提供 |
$2.70/M 輸入與 $13.50/M 輸出 |
| 截至 7 月 28 日的開放權重狀態 |
宣布即將推出「soon」;尚無公開檢查點、日期或授權條款 |
完整權重已在自訂 Kimi K3 License 下發布於 `moonshotai/Kimi-K3` |
| 自行託管的實際情況 |
在 Alibaba 發布檢查點與部署指南前,無法評估 |
技術上可用;但 1.56 TB 儲存庫與 64 個以上加速器的建議,使其成為資料中心部署模型,而非筆電模型 |
| 目前最適合的用途 |
在支援的程式開發工作流程中進行低成本預覽測試 |
生產環境應用、多模態代理,以及可估算成本的程式開發工作負載 |
| 主要風險 |
預覽行為、存取條款與商業價格可能變更 |
一律開啟的推理可能增加延遲、輸出 Token 與長工作階段成本 |
Alibaba 自身的 Token Plan 文件指出,Qwen Preview 可能持續更新,之後也可能被移除或取代。Moonshot 的Kimi K3 公告與 API 指南,對模型及其目前介面公開了更多資訊。
為何目前還不是公平的比較
Qwen 3.8 Max 仍是持續變動的預覽版
Alibaba 將 Qwen 3.8 Max 描述為 2.4T 模型,但目前提供的託管模型明確是qwen3.8-max-preview。這個後綴很重要。Alibaba 表示其能力可能在預覽期間持續升級,且此端點之後可能被移除或由生產版本取代。
因此,目前的每項基準測試都只是特定日期的快照。有用的 Qwen 結果應記錄測試日期、端點、推理等級、代理外殼、工具權限與原始輸出。缺少這些細節時,兩個人可能以為測試的是同一模型,實際上卻取得不同的預覽行為。
存取條款也限制了開發者對低廉發布價格的解讀。Alibaba 的 Personal Token Plan 目前透過以 Credits 為基礎的訂閱提供 Qwen 3.8 Max,但其官方條款限制金鑰只能用於支援的互動式程式開發與代理工具。該方案禁止自動化腳本、自訂應用程式後端與非互動式批次呼叫。
因此,Qwen 可以呼叫,但目前還不是面向客戶應用程式的標準隨用隨付後端。
Kimi K3 已完成開放權重發布
Kimi K3 現在有兩種形式:傳統託管 API 與可下載的檢查點。Moonshot AI 已在官方 `moonshotai/Kimi-K3` 儲存庫發布完整權重,以及模型卡、部署指南、自訂授權條款與 K3 技術報告。
此次發布補充了首次發布比較時尚未提供的細節。K3 每個 Token 啟用 104B 參數,使用 MXFP4 權重與 MXFP8 啟用值,目前記載支援 vLLM、SGLang 與 TokenSpeed。儲存庫由 96 個 safetensors 分片組成,約為 1.56 TB。
這是真正的開放權重發布,但並不等同於不受限制的 MIT 發布,也不是容易在本機安裝的模型。Kimi K3 License 對大型 Model-as-a-Service 企業與超大型商業產品增加了條件,而 Moonshot 建議部署使用 64 個以上加速器的超級節點配置。
簡單來說:Kimi 已消除所有權不確定性,但沒有消除基礎設施成本。
程式開發比較:269 個檔案的測試實際顯示了什麼
目前最佳的正面比較證據,是一項配對 StackPerf 架構測試。兩個模型都收到兩個不熟悉軟體專案的相同唯讀快照,共包含 269 個檔案。它們使用 OpenCode 1.17.13、相同任務指示、相同權限、60 分鐘限制與 65,536 Token 完成上限。編輯、網路存取、外掛程式與子代理均已停用。
最終報告在評分前經過匿名化,之後另行檢查缺乏支持的主張。
| 測試結果 |
Qwen 3.8 Max |
Kimi K3 |
| 最終分數 |
80/100 |
83/100 |
| 工具呼叫 |
44 |
53 |
| 失敗或遭拒的工具呼叫 |
0 |
2 次,之後成功復原 |
| 儲存庫引用次數 |
354 |
274 |
| 驗證後缺乏支持的主張群組 |
7 |
7 |
| 最明顯的優勢 |
系統邊界與重播中繼資料 |
修訂、重新生成與生命週期狀態 |
Kimi K3 表現較佳之處
Kimi 的報告更完整地建模了編輯生命週期。它追蹤修訂、被取代的版本、重試嘗試、備援歷史、產物雜湊、失效、編輯選擇與裁切。這使其提出的契約更適合這種情境:同一場景可能被生成、拒絕、修訂並再次生成,同時不遺失歷史記錄。
Kimi 也更快完成測試路徑,且使用較少 Token。這對長時間程式開發任務而言令人鼓舞,但結果也包含模型周邊的服務系統。Kimi 透過 Kimi 訂閱端點執行,Qwen 則透過 Alibaba 國際 Token Plan 端點執行。供應商容量、快取與發布期間流量都影響了觀察結果。
我的解讀是,Kimi 贏得這項任務,是因為它更完整地理解狀態變化,而不是因為它寫出了更漂亮的程式碼,或證明自己在每項軟體任務上都更優秀。
Qwen 3.8 Max 表現較佳之處
Qwen 在兩個系統之間劃出了更清晰的界線,並建立了更強的重播記錄。它提出的中繼資料包含模型、種子、提示、參考資料、供應商請求 ID、媒體位置、持續時間與成本。當團隊需要重現輸出,或調查同一工作流程為何在供應商更新後發生變化時,這些欄位都很重要。
它的工具行為也很有紀律:44 次工具呼叫全部成功。Qwen 以較少請求產生了較長的報告,並在盲測中獲得較高的工具使用分數。
這種更清晰架構的代價,是較弱的生命週期建模。它的契約未完整涵蓋場景順序、修訂、取代、重試歷史或版本失效。清晰的邊界很有價值,但當產品狀態持續變化時,光有清晰邊界並不足夠。
這項測試無法證明什麼
一次架構分析執行無法告訴我們哪個模型能產生更好的前端程式碼、修正更多實際錯誤、通過更多測試,或在一個月開發期間需要較少人工修正。它也無法將模型智慧與端點效能分離。
最重要的警告藏在事實審查中:兩個模型都引用了真實的儲存庫位置,但也都產生了 7 組超出程式碼可證明範圍的主張。報告可以包含數百個有效引用,卻仍然得出不安全的結論。
真正的重點是:將任一模型用作工程助理,但不要把任一模型視為自己的審查者。
開發者應如何測試 Qwen 3.8 Max 與 Kimi K3
| 測試 |
提供給兩個模型 |
測量 |
| 儲存庫架構審查 |
相同的凍結提交、架構問題、唯讀工具與時間限制 |
正確的檔案引用、遺漏的相依性、缺乏支持的主張與審查時間 |
| 多檔案實作 |
相同問題、測試、可寫入檔案與工具權限 |
通過的測試、變更的檔案、重試、回歸問題與人工修正 |
| 視覺前端修復 |
相同的螢幕截圖、原始檔案、瀏覽器工具與目標行為 |
視覺匹配程度、有效程式碼、修復迴圈與最終測試結果 |
保持代理外殼與權限一致。設定固定時間限制。記錄完整模型 ID 與日期,尤其是持續變動的 Qwen Preview。接著記錄任務完成情況、實際耗時、輸入與輸出 Token、快取命中、失敗的工具呼叫、重試、人工介入,以及最終通過的測試。
不要因為答案「看起來很詳盡」就給予高分。確認修補程式是否有效,以及模型的主張是否經得起審查。
對於高價值架構決策,還有一種實用模式:獨立執行兩個模型,在審查時隱藏模型身分,並比較它們的分歧。269 個檔案的測試只有在結合 Qwen 的系統邊界與 Kimi 的生命週期模型後,才產生最強的設計。有時 Qwen 與 Kimi 的正確答案是兩者都使用,然後進行驗證。
Qwen 3.8 Max 與 Kimi K3 的價格與成本
Kimi K3 具備可預測的 Token 價格
Kimi K3 採用一般的 Token 計價。現行的 GPT Proto Kimi K3 API 頁面列示每 100 萬個輸入 Token $2.70、每 100 萬個輸出 Token $13.50,比 Moonshot 目前 $3/$15 的列示價格低 10%。
因此,在測試開始前即可進行基本成本估算:
估計成本 =(輸入 Token ÷ 1,000,000 × $2.70)+(輸出 Token ÷ 1,000,000 × $13.50)
以目前 GPT Proto 價格計算,輸入 200,000 個 Token、輸出 20,000 個 Token 的執行成本約為 $0.81:輸入 $0.54、輸出 $0.27。重試、額外回合、工具結果與保留的推理歷史都會增加總成本。
可預測不代表一定便宜。Kimi 一律進行推理,而推理內容也會計入 Token 使用量。因此,即使可見的最終答案很短,長代理歷史仍可能變得昂貴。
Qwen 3.8 Max 實驗成本較低,但更難預算
Qwen 3.8 Max Preview 目前使用訂閱與 Credits,而不是公開的每百萬 Token 價格。Alibaba 的 Personal Token Plan 為三個級別列出每月促銷價格:人民幣 39 元、139 元與 499 元。預覽期間,Qwen 呼叫可能只消耗標準 Credits 費率的 10%,另有文件記載的限時夜間折扣,適用於 UTC+8 22:00 至 08:00 的呼叫。
這對互動式測試很有吸引力,但不是清晰的成本比較。
Credits 可能因 Token 使用量、快取、推理與工具而異,因此根據目前公開資訊,無法誠實地將人民幣訂閱換算成穩定的$X per 1M tokens數值。Personal Plan 的限制也表示,其促銷經濟效益不代表在自有應用程式後端執行 Qwen 的成本。
Qwen 在低成本 Preview 存取方面勝出;Kimi 在生產環境成本透明度方面勝出。
開放權重與自行託管
Kimi K3 現在相較 Qwen 3.8 Max 具備一項具體優勢:其精確的公開檢查點今天即可下載。Moonshot AI 已發布完整的 2.8T 參數權重、模型卡、授權條款與技術報告。Alibaba 已宣布 Qwen 3.8 Max 將提供開放權重,但確切的 Max 檢查點、發布日期、授權條款與部署需求仍未確認。
「開放」一詞仍需要限定。Kimi K3 是根據自訂 Kimi K3 License 提供的開放權重模型,而不是 MIT。該授權大致允許使用、修改、部署、微調與再分發,但對超過指定營收門檻的 Model-as-a-Service 企業增加個別協議要求,並對超大型商業產品增加署名要求。
硬體是另一個界線。官方 K3 儲存庫約為 1.56 TB,Moonshot 建議使用至少 64 個加速器的超級節點部署。因此,自行託管適合資金充足的基礎設施團隊,而不是開發者工作站上 API 金鑰的替代方案。
如果你想要可預測的 Token 計費且不想管理叢集,請選擇託管的 Kimi K3 API。如果資料控制、自訂推理、微調或部署所有權值得你操作硬體並審查授權條款,請選擇權重。至於 Qwen 3.8 Max,請等 Alibaba 發布實際檢查點後再進行相同評估。
多模態輸入、推理與代理行為
| 能力 |
Qwen 3.8 Max Preview |
Kimi K3 |
| 圖片理解 |
有文件記載 |
有文件記載 |
| 影片理解 |
未清楚記載為目前模型輸入 |
有文件記載 |
| 思考模式 |
一律開啟 |
一律開啟 |
| 推理等級 |
low、high、xhigh |
low、high、max |
| 預設推理等級 |
xhigh |
max |
| 上下文視窗 |
目前產品頁面未清楚公開 |
1,048,576 個 Token |
| 結構化輸出 |
預覽能力需要持續驗證 |
已記載 JSON 模式與嚴格 JSON Schema |
| 長工具歷史 |
行為可能隨預覽版變更 |
應保留完整的助理訊息,包括推理內容 |
Qwen 有文件記載的視覺支援,使其適合以螢幕截圖為基礎的除錯。Kimi 更進一步支援影片,當輸入是螢幕錄影、動畫參考或難以逐幀描述的產品示範時,這項能力很有用。
Kimi 文件記載的更豐富介面也增加了整合工作。其 Preserved Thinking 行為意味著,多回合應用程式應傳回完整的助理訊息,包括推理內容與工具呼叫,而不只是保留可見答案。這些歷史會佔用上下文並計費。100 萬 Token 的視窗雖然很大,但並不是免費儲存空間。
兩個模型預設都使用最高推理設定。評估時請保持設定一致;生產環境則應在較簡單的任務上測試較低的推理量。對每次自動完成、分類或短轉換都使用最大推理的模型,可能不如在較低推理量下解決 99% 請求的模型便宜且快速。
你應該選擇哪個模型?
| 你的情況 |
目前較佳選擇 |
原因 |
| 現在建立面向客戶的應用程式 |
Kimi K3 |
傳統 API 與可預估的 Token 價格 |
| 執行含圖片或影片輸入的長儲存庫任務 |
Kimi K3 |
100 萬 Token 上下文與有文件記載的圖片/影片支援 |
| 在 Qwen Code、Qoder 或其他支援的 Alibaba 工具中測試 |
Qwen 3.8 Max Preview |
低促銷 Credits 消耗 |
| 需要穩定且可重複的基準測試 |
目前選 Kimi K3 |
Qwen Preview 可能在不同執行期間變更 |
| 需要最清晰的架構與重播中繼資料 |
測試 Qwen |
它在配對架構審查中展現了實際優勢 |
| 需要強大的修訂與重新生成處理能力 |
測試 Kimi |
在現有配對測試中,它的處理更完整 |
| 今天需要可下載的權重 |
Kimi K3 |
完整檢查點已公開;Qwen 3.8 Max 仍未發布權重 |
| 需要在一個帳戶後方比較多個模型系列 |
GPT Proto 上的 Kimi K3 |
一組金鑰與餘額即可存取更廣泛的模型目錄 |
如果應用程式本週上線,我會選擇 Kimi K3。它已公開足夠資訊,可估算成本、定義整合行為,並針對穩定的模型名稱重複測試。
對於內部程式開發實驗,我不會忽略 Qwen。它的 Preview 在長儲存庫分析中零次工具呼叫失敗,且在配對測試中展現比 Kimi 更佳的架構邊界。這是重要的能力訊號,但尚未構成生產環境契約。
如何透過 GPT Proto 試用 Kimi K3
Qwen 3.8 Max 尚未在 GPT Proto 上提供,因此目前的整合範例僅使用 Kimi K3。你可以透過 GPT Proto 相容 OpenAI 的 Chat Completions 端點,使用kimi-k3模型字串呼叫它:
curl https://gptproto.com/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: $GPTPROTO_API_KEY" \
-d '{
"model": "kimi-k3",
"messages": [
{
"role": "user",
"content": "請審查這份遷移計畫。找出缺乏支持的假設、遺漏的復原步驟,以及上線前所需的測試。"
}
]
}'
端點與授權結構遵循GPT Proto API 快速入門。對於多回合 Kimi 工作流程,請保留 API 傳回的完整助理訊息,包括推理與工具呼叫欄位,而不是只儲存最終可見文字。
你可以試用 Kimi K3 API、瀏覽 200 多個 AI 模型,或使用GPT Proto 統一 AI API來比較 Kimi 與其他文字、圖片、影片及音訊模型。Qwen 3.8 Max 加入後,實用的測試方式是在兩個模型端點上使用相同任務、提示、工具權限與評分方法。
最終結論
Qwen 3.8 Max 與 Kimi K3 的程式開發能力似乎接近,因此不應讓一次小型基準測試決定你下一年的架構。Qwen 更清晰的系統邊界與完美工具執行值得注意;Kimi 更強的生命週期推理與 3 分領先同樣值得注意。
產品決策現在更清楚了。Kimi K3 結合標準 API、公開 Token 價格、有文件記載的 100 萬 Token 上下文視窗、多模態輸入,以及已發布的開放權重檢查點。Qwen 3.8 Max 仍是可變動的 Preview,採用 Credits 存取方式,沒有一般生產環境價格,也沒有公開權重。
無論使用託管 API,還是具備自行管理檢查點的基礎設施,Kimi K3 都是今天較適合部署的模型。Qwen 3.8 Max 仍可能成為更強的模型,但開發者應等待其生產端點、一般價格、模型卡、授權條款與實際權重發布後,再做出這項押注。