Kimi K3 API 為開發者提供 Moonshot AI 旗艦模型的代管存取能力,適用於長期程式設計、多模態分析、工具使用,以及端到端知識工作。K3 於 2026 年 7 月 16 日發布,是一個擁有 2.8 兆參數的混合專家模型(Mixture-of-Experts)。它每個 token 啟用 896 個專家中的 16 個,並結合 Kimi Delta Attention、Attention Residuals 和 Stable LatentMoE,相較於總規模相近的稠密模型,能更有效率地處理長序列。
K3 接受文字、圖像和影片輸入,並回傳文字。其 100 萬 token 的上下文視窗適用於無法縮減為短提示的工作負載:儲存庫規模的程式設計、多文件分析、長時間工具記錄,以及視覺回饋迴圈。模型始終會進行推理。開發者可以將 reasoning_effort 設定為 low、 high 或 max,其中 max 為預設值,而不是切換思考功能的開啟與關閉。
GPTProto 在模型周圍提供不同的存取層。一組 Kimi K3 API 金鑰和餘額,也可以用於 200 多個文字、圖像、影片和音訊模型。本頁顯示的費率為每 100 萬輸入 token 2.70 美元、每 100 萬輸出 token 13.50 美元,比 Moonshot 目前的 3/15 牌價低 10%。因此,您可以更輕鬆地在 GPT-5.6 Sol、Claude Fable 5、GLM-5.2 或其他模型旁測試 K3,而不必為每個實驗開設並儲值不同供應商的帳戶。
| 規格 | Kimi K3 |
|---|---|
| 供應商 | Moonshot AI |
| 發布日期 | 2026 年 7 月 16 日 |
| 模型類別 | 2.8T 參數混合專家模型 |
| 啟用的專家 | 每個 token 為 896 個中的 16 個 |
| 架構 | Kimi Delta Attention、Attention Residuals、Stable LatentMoE |
| 輸入 | 文字、圖像和影片 |
| 輸出 | 文字 |
| 上下文視窗 | 1,048,576 tokens |
| 完成上限 | 預設為 131,072 tokens;在總上下文預算內可設定至 1,048,576 |
| 推理 | 始終開啟;推理程度為 low、 high 或 max |
| API 功能 | 串流、工具呼叫、 tool_choice、動態工具、JSON 模式、嚴格 JSON Schema,以及 Partial Mode |
Kimi K3 API 應用情境
當任務結合大型工作集與重複操作時,K3 最能發揮作用。程式設計代理可以檢查儲存庫、編輯多個檔案、執行測試、讀取日誌,並利用螢幕截圖改善前端或遊戲。研究工作流程可以將大型文件集保留在上下文中、呼叫外部工具,並回傳符合嚴格 JSON Schema 的結果。多模態 QA 系統可以將介面螢幕截圖與實作細節進行比較,而影片工作流程則可以分析上傳的影片,並回傳場景備註、摘要或結構化中繼資料。
對於短篇分類、簡單聊天,或較小模型已能達到品質門檻的大量擷取任務,模型的吸引力較低。K3 始終會進行推理,因此即使是較低的推理程度設定,也應評估其延遲與輸出 token 成本。請先從一個具代表性的工作流程開始,衡量任務完成情況,而非單一回應,並在將所有流量導向 K3 之前,先將 K3 與較小的模型進行比較。
遷移前應檢查的 API 詳細資訊
K3 支援 OpenAI SDK 和 Chat Completions 請求格式,但它具有模型專屬行為,單純替換模型名稱可能會遺漏這些行為。
首先,Preserved Thinking 始終處於啟用狀態。在多輪對話和工具迴圈中,請從先前的回應中回傳完整的助理訊息,包括 reasoning_content 和 tool_calls。只保留可見的 content 可能會中斷推理連續性,並使長時間工作階段變得不穩定。歷史推理也會消耗上下文,並按 token 使用量計費,因此請精簡已完成的工作,而不要永遠攜帶每一輪內容。
其次,請使用頂層的 reasoning_effort 欄位,而不是較舊 K2.x 的 thinking 設定。K3 支援 low、 high 和 max。其採樣值是固定的,因此應用程式不應依賴自訂 temperature 或 penalty 設定。
第三,請從最終的 content 欄位解析結構化結果,而不是從 reasoning_content 解析。K3 透過 response_format 支援 JSON 模式和嚴格 JSON Schema,這對擷取管線、工具引數和機器可讀的研究輸出都很有用。
最後,多模態請求需要結構化內容部分。Moonshot 的原生介面接受 base64 圖像或上傳的檔案參照,而不是公開圖像 URL。在部署多模態工作流程之前,請確認目前的 GPTProto 文件,以了解此端點公開的確切圖像和影片欄位。
何時應選擇 Kimi K3?
Moonshot 自己的發布文章表示,K3 的整體效能仍落後於 Claude Fable 5 和 GPT-5.6 Sol。選擇 K3 的理由並不是宣稱它在每項基準測試中都勝出。它最具優勢的情況,是結合了 100 萬 token 上下文視窗、原生影片理解、長期程式設計能力,以及大幅較低的 token 價格。
| 決策因素 | Kimi K3 | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| 官方 API 每 100 萬 token 的牌價 | 輸入 3 美元 / 輸出 15 美元 | 輸入 5 美元 / 輸出 30 美元 | 輸入 10 美元 / 輸出 50 美元 |
| 上下文視窗 | 1,048,576 | 1,050,000 | 1,000,000 |
| 最大輸出 | 上下文內最多 1,048,576;預設為 131,072 | 128,000 | 128,000 |
| 原生輸入 | 文字、圖像、影片 | 文字、圖像 | 文字、圖像 |
| 模型存取 |
代管 API;官方模型權重由 Moonshot AI 另行發布 |
封閉式 API | 封閉式 API |
| 最適合 | 重視成本的程式設計、多模態代理、大型工作集 | 最高階的程式設計、電腦使用和 OpenAI 工具工作流程 | 長時間執行的代理、複雜視覺任務和高階知識工作 |
當較低的 API 成本、原生影片輸入或 100 萬 token 上下文視窗,比在最廣泛的前沿評估中勝出更重要時,請選擇 K3。當您自己的任務層級評估顯示較高的完成率足以抵銷較高的 token 價格時,請選擇 GPT-5.6 Sol 或 Claude Fable 5。若要逐項基準測試討論,請閱讀 什麼是 Kimi K3——它真的接近 GPT-5.6 和 Fable 5 嗎?.











