推理、工具與 JSON
K3 始終進行推理,並支援低、高或最大努力程度。它也支援工具選擇、動態工具載入、JSON 模式,以及嚴格的 JSON Schema 輸出。
curl --request POST "https://gptproto.com/v1/chat/completions" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"model": "kimi-k3",
"messages": [
{
"role": "user",
"content": "Hello"
}
]
}'Chat, coding agents & document work. Priced per 1M tokens — input, cached input and output are billed separately. GPTProto is 10% below official rates.
MoonshotAI · ≈ 148M tokens/mo(48M 快取)
OpenRouter 成本含約 5.5% 儲值手續費。GPTProto 在官方價上另有模型折扣(10–30% off),贈送額度也按折扣價消耗——節省會疊加。預估假設 60% 快取命中率。
透過單一 GPTProto 金鑰執行 Moonshot AI 的 2.8 兆參數旗艦模型。在 100 萬 Token 上下文視窗中處理大型程式碼庫、多模態輸入、工具呼叫與結構化輸出。
K3 始終進行推理,並支援低、高或最大努力程度。它也支援工具選擇、動態工具載入、JSON 模式,以及嚴格的 JSON Schema 輸出。
在單一上下文視窗中分析長篇程式碼儲存庫、文件、圖片與影片。K3 結合原生視覺理解與文字推理,支援多模態代理工作流程。
瀏覽大型程式碼儲存庫、協調終端機工具、根據日誌與螢幕截圖進行除錯,並在較少人工監督下持續處理多步驟工程工作。
使用熟悉的 Chat Completions 請求格式。對於 K3,在繼續對話或完成工具迴圈時,請保留完整的 assistant 訊息,包括 reasoning_content。
Kimi K3 API 為開發者提供 Moonshot AI 旗艦模型的代管存取能力,適用於長期程式設計、多模態分析、工具使用,以及端到端知識工作。K3 於 2026 年 7 月 16 日發布,是一個擁有 2.8 兆參數的混合專家模型(Mixture-of-Experts)。它每個 token 啟用 896 個專家中的 16 個,並結合 Kimi Delta Attention、Attention Residuals 和 Stable LatentMoE,相較於總規模相近的稠密模型,能更有效率地處理長序列。
K3 接受文字、圖像和影片輸入,並回傳文字。其 100 萬 token 的上下文視窗適用於無法縮減為短提示的工作負載:儲存庫規模的程式設計、多文件分析、長時間工具記錄,以及視覺回饋迴圈。模型始終會進行推理。開發者可以將 reasoning_effort 設定為 low、 high 或 max,其中 max 為預設值,而不是切換思考功能的開啟與關閉。
GPTProto 在模型周圍提供不同的存取層。一組 Kimi K3 API 金鑰和餘額,也可以用於 200 多個文字、圖像、影片和音訊模型。本頁顯示的費率為每 100 萬輸入 token 2.70 美元、每 100 萬輸出 token 13.50 美元,比 Moonshot 目前的 3/15 牌價低 10%。因此,您可以更輕鬆地在 GPT-5.6 Sol、Claude Fable 5、GLM-5.2 或其他模型旁測試 K3,而不必為每個實驗開設並儲值不同供應商的帳戶。
| 規格 | Kimi K3 |
|---|---|
| 供應商 | Moonshot AI |
| 發布日期 | 2026 年 7 月 16 日 |
| 模型類別 | 2.8T 參數混合專家模型 |
| 啟用的專家 | 每個 token 為 896 個中的 16 個 |
| 架構 | Kimi Delta Attention、Attention Residuals、Stable LatentMoE |
| 輸入 | 文字、圖像和影片 |
| 輸出 | 文字 |
| 上下文視窗 | 1,048,576 tokens |
| 完成上限 | 預設為 131,072 tokens;在總上下文預算內可設定至 1,048,576 |
| 推理 | 始終開啟;推理程度為 low、 high 或 max |
| API 功能 | 串流、工具呼叫、 tool_choice、動態工具、JSON 模式、嚴格 JSON Schema,以及 Partial Mode |
當任務結合大型工作集與重複操作時,K3 最能發揮作用。程式設計代理可以檢查儲存庫、編輯多個檔案、執行測試、讀取日誌,並利用螢幕截圖改善前端或遊戲。研究工作流程可以將大型文件集保留在上下文中、呼叫外部工具,並回傳符合嚴格 JSON Schema 的結果。多模態 QA 系統可以將介面螢幕截圖與實作細節進行比較,而影片工作流程則可以分析上傳的影片,並回傳場景備註、摘要或結構化中繼資料。
對於短篇分類、簡單聊天,或較小模型已能達到品質門檻的大量擷取任務,模型的吸引力較低。K3 始終會進行推理,因此即使是較低的推理程度設定,也應評估其延遲與輸出 token 成本。請先從一個具代表性的工作流程開始,衡量任務完成情況,而非單一回應,並在將所有流量導向 K3 之前,先將 K3 與較小的模型進行比較。
K3 支援 OpenAI SDK 和 Chat Completions 請求格式,但它具有模型專屬行為,單純替換模型名稱可能會遺漏這些行為。
首先,Preserved Thinking 始終處於啟用狀態。在多輪對話和工具迴圈中,請從先前的回應中回傳完整的助理訊息,包括 reasoning_content 和 tool_calls。只保留可見的 content 可能會中斷推理連續性,並使長時間工作階段變得不穩定。歷史推理也會消耗上下文,並按 token 使用量計費,因此請精簡已完成的工作,而不要永遠攜帶每一輪內容。
其次,請使用頂層的 reasoning_effort 欄位,而不是較舊 K2.x 的 thinking 設定。K3 支援 low、 high 和 max。其採樣值是固定的,因此應用程式不應依賴自訂 temperature 或 penalty 設定。
第三,請從最終的 content 欄位解析結構化結果,而不是從 reasoning_content 解析。K3 透過 response_format 支援 JSON 模式和嚴格 JSON Schema,這對擷取管線、工具引數和機器可讀的研究輸出都很有用。
最後,多模態請求需要結構化內容部分。Moonshot 的原生介面接受 base64 圖像或上傳的檔案參照,而不是公開圖像 URL。在部署多模態工作流程之前,請確認目前的 GPTProto 文件,以了解此端點公開的確切圖像和影片欄位。
Moonshot 自己的發布文章表示,K3 的整體效能仍落後於 Claude Fable 5 和 GPT-5.6 Sol。選擇 K3 的理由並不是宣稱它在每項基準測試中都勝出。它最具優勢的情況,是結合了 100 萬 token 上下文視窗、原生影片理解、長期程式設計能力,以及大幅較低的 token 價格。
| 決策因素 | Kimi K3 | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| 官方 API 每 100 萬 token 的牌價 | 輸入 3 美元 / 輸出 15 美元 | 輸入 5 美元 / 輸出 30 美元 | 輸入 10 美元 / 輸出 50 美元 |
| 上下文視窗 | 1,048,576 | 1,050,000 | 1,000,000 |
| 最大輸出 | 上下文內最多 1,048,576;預設為 131,072 | 128,000 | 128,000 |
| 原生輸入 | 文字、圖像、影片 | 文字、圖像 | 文字、圖像 |
| 模型存取 |
代管 API;官方模型權重由 Moonshot AI 另行發布 |
封閉式 API | 封閉式 API |
| 最適合 | 重視成本的程式設計、多模態代理、大型工作集 | 最高階的程式設計、電腦使用和 OpenAI 工具工作流程 | 長時間執行的代理、複雜視覺任務和高階知識工作 |
當較低的 API 成本、原生影片輸入或 100 萬 token 上下文視窗,比在最廣泛的前沿評估中勝出更重要時,請選擇 K3。當您自己的任務層級評估顯示較高的完成率足以抵銷較高的 token 價格時,請選擇 GPT-5.6 Sol 或 Claude Fable 5。若要逐項基準測試討論,請閱讀 什麼是 Kimi K3——它真的接近 GPT-5.6 和 Fable 5 嗎?.
取得關於 Kimi K3 API 定價、上下文限制、多模態輸入、推理行為與模型選擇的精簡解答。
與本模型相關的指南、對比與更新。
所有文章
比較 GLM-5.2 與 Kimi K3 在程式設計、程式碼審查、遊戲開發、基準測試和 API 成本方面的表現,找出 2026 年更適合開發者的模型。

使用 Claude Code 或相容 OpenAI 的 API,將 GLM-5.2 作為程式設計代理執行。內容包括實際設定、儲存庫層級提示詞、本機需求和成本範例。

Kimi K3 是開源模型嗎?它真的接近 GPT-5.6 和 Fable 5 嗎?探索其 1M 上下文、API 定價、獨立基準測試和 Reddit 上的反應。

從實際定價、模型涵蓋範圍、延遲、SDK 和生產環境適用性等方面,比較 OpenAI、Claude、Gemini、OpenRouter、fal.ai、Replicate 和 GPTProto。