DeepSeek V4 Pro 與 Kimi K3 的比較在 2026 年 8 月 13 日發生了變化。DeepSeek 將原本由既有 API 別名提供的 V4 Pro 預覽版替換為 DeepSeek V4 Pro 0813,同時保留開發者目前使用的模型名稱。
簡短答案是:Kimi K3 在整體測得的智慧能力方面仍然領先,並支援視覺輸入。DeepSeek V4 Pro 0813 在文字型程式設計與代理工作負載上速度更快,價格也大幅降低。對大多數需要處理程式碼庫、執行程式碼審查或運行大量代理的團隊而言,DeepSeek 現在是更好的預設選擇。當多模態輸入或最高可用的推理上限比成本更重要時,Kimi 才值得其較高的價格。
有一項實作細節很容易被忽略:在 GPTProto 上,您不需要使用 0813 後綴。繼續呼叫 deepseek-v4-pro 即可,路由會自動使用目前版本。
DeepSeek V4 Pro 0813 與 Kimi K3 一覽
| 類別 |
DeepSeek V4 Pro 0813 |
Kimi K3 |
較佳選擇 |
| 目前獨立智慧指數 |
53 |
60 |
Kimi K3 |
| 輸出速度 |
83.2 tokens/s |
40.8 tokens/s |
DeepSeek V4 Pro |
| 首個 token 的等待時間 |
1.63 秒 |
2.97 秒 |
DeepSeek V4 Pro |
| 上下文視窗 |
約 1M tokens |
約 1M tokens |
平手 |
| GPT Proto 輸入價格 |
$1.044 / 1M tokens |
$2.70 / 1M tokens |
DeepSeek V4 Pro |
| GPT Proto 輸出價格 |
$2.088 / 1M tokens |
$13.50 / 1M tokens |
DeepSeek V4 Pro |
| GPT Proto 上可用的輸入 |
文字 |
文字、圖片、文件 |
Kimi K3 |
| 推理控制 |
非思考、高、最大 |
始終啟用推理,並可控制推理強度 |
取決於工作流程 |
| 開放權重授權 |
MIT |
Kimi K3 License |
DeepSeek 更適合簡單的商業自託管 |
| 最適用場景 |
大量文字型程式設計與代理 |
高難度多模態與視覺代理任務 |
取決於任務 |
上述基準測試、速度與延遲數據來自目前的 Artificial Analysis 對照評估。其智慧指數對兩個模型採用相同的評估框架,因此比將兩家供應商的啟動圖表並列比較更具參考價值。
DeepSeek V4 Pro 0813 有何變化?
DeepSeek V4 Pro 0813 是 V4 Pro 目前的正式版本,而不是獨立的 API 產品。DeepSeek 的文件指出,deepseek-v4-pro 別名現在指向 DeepSeek-V4-Pro-0813,呼叫方式維持不變。同一份文件列出了 100 萬 token 的上下文視窗、最高 384K 的輸出、思考與非思考模式、JSON 輸出以及工具呼叫功能。
這項命名決策很重要,因為帶日期的模型名稱往往會迫使開發者變更設定檔、路由規則與評估紀錄。在這裡,升級是在穩定別名背後完成的。在 GPT Proto 上,同樣的原則也適用:在請求中保留 deepseek-v4-pro。
目前的獨立結果也不同於許多 7 月比較文章中的數字。Artificial Analysis 現在給予 0813 模型在最大推理強度下 53 分的智慧指數。Kimi K3 在目前評估中為 60 分。
我不會將其描述為相較於舊有 44 分乾淨俐落地提升了 9 分。模型確實改變了,但基準測試套件與評估版本也可能改變。較為可靠的結論是:以預覽版為基礎的比較已無法描述目前提供的模型,而最新的獨立測試顯示,0813 與 Kimi K3 的差距比預覽版時期的報導所暗示的更小。
DeepSeek 並未改變模型的基本產品定位。它仍然是擁有 1.6 兆參數、每個 token 啟用 490 億參數的混合專家模型,支援文字輸入、大量輸出以及可選的推理強度。因此,0813 版本最好理解為正式環境與後訓練升級,而不是全新的多模態分支。
基準測試:Kimi K3 仍然領先,但並非全面領先
Kimi K3 在廣泛的獨立比較中以 60 比 53 領先。當工作流程結合推理、知識、程式設計與長期規劃時,這 7 分的差距確實重要。但這不代表 Kimi 在每個程式碼庫或每個提示上都會產生更好的結果。
兩個模型採取了不同的取捨。Moonshot 將 Kimi K3 描述為一款擁有 2.8 兆參數、原生多模態能力的代理模型,專為長期程式設計與知識工作而設計。其 官方模型卡 說明了上游模型對文字、圖片與影片的理解能力,以及 100 萬 token 的上下文視窗。GPT Proto 目前的 Kimi K3 路由列出文字、圖片與文件輸入。
DeepSeek V4 Pro 0813 僅支援文字,但在 Artificial Analysis 測試中可達每秒 83.2 個 token。Kimi K3 則為每秒 40.8 個 token。DeepSeek 也更快開始回應,首個 token 的等待時間為 1.63 秒,而 Kimi 為 2.97 秒。
簡單來說:Kimi 擁有較高的整體能力分數。DeepSeek 回傳文字的速度約快一倍,同時成本低得多。
這裡還有另一個基準測試陷阱。供應商的程式設計分數通常採用不同的代理設定、推理設定、程式碼庫快照或通過標準。使用 Kimi Code 得出的 Kimi 分數,不能自動與另一套評估設定得出的 DeepSeek 分數比較。選擇模型時,應使用獨立且匹配的評估作為共同基準,然後測試會影響您產品的任務。
本文並未聲稱進行過私有的相同提示程式設計測試。在沒有這類測試的情況下,宣稱任何一個模型都是通用的程式設計冠軍,都會超出證據所能支持的範圍。
哪個模型更適合程式設計與代理工作流程?
對於大量文字型程式設計,我會先從 DeepSeek V4 Pro 0813 開始。
原因並不是它在每項指標上都勝過 Kimi,事實並非如此。而是因為正式環境中的程式設計代理會反覆消耗上下文,並產生推理、修補程式、測試計畫與工具指令。輸出價格會在每個迴圈中累積。DeepSeek 可選的推理模式也讓開發者能將最大推理強度保留給困難任務,而不是每次請求都為相同的推理行為付費。
因此,DeepSeek 很適合作為以下場景的預設選擇:
閱讀程式碼庫與程式碼庫問答
Pull request 審查
錯誤定位
重構計畫
測試生成
文字型工具呼叫
大量背景代理
結構化 JSON 回應
當一次失敗嘗試的成本高於 token 費用時,Kimi K3 會更具吸引力。其較高的獨立智慧分數,使它成為 DeepSeek 無法完成長時間、困難任務時合理的升級模型。當請求包含視覺證據時,它也是明確的選擇。
因此,實用的正式環境模式不是「永遠只選一個」。將例行文字任務路由至 DeepSeek,再使用 Kimi 重試特定失敗任務或處理多模態任務。由於兩者都可透過同一個 GPT Proto API 金鑰與共用餘額使用,變更只需限於 model 欄位。
DeepSeek V4 Pro 與 Kimi K3 的前端程式設計比較
「前端程式設計」涵蓋兩種不同的工作負載,不應將它們合併成單一結論。
第一種是文字轉程式碼:根據書面規格生成 React 元件、CSS、頁面結構、無障礙修正或 TypeScript 邏輯。目前沒有足夠的匹配公開證據,宣稱 Kimi K3 或 DeepSeek V4 Pro 0813 在此類別中全面勝出。DeepSeek 的較低成本與更快輸出,使它成為更經濟的首次嘗試。
第二種是視覺前端迭代:向模型展示螢幕截圖,要求它找出間距或版面問題,並根據視覺回饋修改介面。Kimi K3 更適合此工作流程,因為它接受圖片輸入。DeepSeek V4 Pro 僅支援文字,因此開發者需要將螢幕截圖轉換為文字,或先使用獨立的視覺模型。
大規模實作文字描述的 UI 時使用 DeepSeek。模型必須看見介面時則使用 Kimi。
API 價格:DeepSeek 的優勢比標題所暗示的更大
GPT Proto 目前對 DeepSeek V4 Pro 的定價為每百萬輸入 token $1.044、每百萬輸出 token $2.088。Kimi K3 的輸入價格為 $2.70,輸出價格為 $13.50.
| GPT Proto 每 1M tokens 的價格 |
DeepSeek V4 Pro |
Kimi K3 |
Kimi 價格倍數 |
| 輸入 |
$1.044 |
$2.70 |
2.59× |
| 輸出 |
$2.088 |
$13.50 |
6.47× |
DeepSeek 的輸入成本低 61.3%,輸出成本低 84.5%。對於推理密集型代理而言,輸出差異才是關鍵,因為其內部工作與最終回應可能會變得很長。
Token 價格仍然較為抽象,因此考慮以下兩種假設工作負載。
| 工作負載 |
Token 假設 |
DeepSeek V4 Pro |
Kimi K3 |
| 大型程式碼審查 |
100K 輸入 + 20K 輸出 |
$0.146 |
$0.540 |
| 程式碼庫規模的代理任務 |
1M 輸入 + 250K 輸出 |
$1.566 |
$6.075 |
在程式碼庫規模的範例中,Kimi 的成本約為 DeepSeek 的 3.88 倍。這並不代表 Kimi 必然缺乏性價比。如果它能一次完成困難任務,而較便宜的模型需要反覆重試並由人工修正,那麼較昂貴的呼叫仍可能帶來更低的總成本。
正確的正式環境指標是已接受結果的成本,而不只是 token 成本。針對每個任務類別,記錄模型、token 數、嘗試次數、延遲、測試結果與審查者是否接受。每 token 的低價格只有在輸出通過時,才真正代表節省。
速度與延遲
Artificial Analysis 目前測得 DeepSeek V4 Pro 0813 的輸出速度為每秒 83.2 個 token,Kimi K3 則為每秒 40.8 個 token。DeepSeek 的首個 token 等待時間為 1.63 秒,Kimi 則為 2.97 秒。
這些數據使 DeepSeek 更適合互動式程式設計助理與平行代理工作者。即使兩個模型最終都能得到可接受的答案,能以兩倍速度回傳 token 的模型也能縮短使用者可感知的等待時間。
然而,供應商速度並不是權重的永久屬性。它也取決於伺服器負載、量化、批次處理、提示長度、推理強度以及請求的服務位置。應將目前測量結果視為可比較的快照,而非每次呼叫的延遲保證。
上下文、推理與部署差異
兩個模型都支援約 100 萬 token 的上下文,因此單憑上下文大小無法決定這項比較。更重要的是它們如何使用這些上下文。
DeepSeek 支援非思考與思考模式,並可控制較困難任務的推理強度。根據 目前 DeepSeek API 規格,它還支援最高 384K 的輸出。這種彈性適合路由系統:對簡單任務使用快速回應,只在需要時採用更深入的推理。
Kimi K3 採用始終啟用的可配置強度推理。其更大的 2.8T 架構與多模態設計,目標是處理涉及文件、程式碼、圖片與工具使用的長期工作。取捨是較高的輸出成本與較慢的測得生成速度。
兩個模型都有可下載的權重,但「開放權重」不代表授權條款相同。DeepSeek V4 Pro 使用 MIT 授權。Kimi K3 使用自有的 Kimi K3 License。計畫進行商業自託管的團隊應仔細審閱確切的 Kimi 條款,而不是假設它們與 MIT 相同。
硬體需求也遠超一般本機工作站的能力。對大多數開發團隊而言,即使權重可用,託管 API 評估仍是實際的起點。
如何使用一個 API 金鑰存取 DeepSeek V4 Pro 0813 與 Kimi K3
GPT Proto 透過相容 OpenAI 的聊天完成端點提供這兩個模型。將 MODEL_ID 設為 deepseek-v4-pro,即可從 DeepSeek 開始:
export GPTPROTO_API_KEY="your_api_key"
export MODEL_ID="deepseek-v4-pro"
curl --request POST "https://gptproto.com/v1/chat/completions" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data "{
\"model\": \"$MODEL_ID\",
\"messages\": [
{
\"role\": \"user\",
\"content\": \"Review this function for correctness and return the answer as concise Markdown.\"
}
]
}"
若要將相同的文字請求傳送給 Kimi K3,只需變更一行:
export MODEL_ID="kimi-k3"
然後再次執行相同的 curl 請求。您不需要額外的 Moonshot 帳戶、第二個餘額或 DeepSeek 版本後綴。
如要進行受控比較,請保持提示、上下文、推理設定與輸出限制一致。將回傳的使用量欄位與延遲、嘗試次數以及結果是否通過測試一併記錄。僅比較每個模型的一個亮眼答案,不足以做出正式環境的路由決策。
您應選擇哪個模型?
以下情況請選擇 DeepSeek V4 Pro 0813:
您的工作負載主要是文字與程式碼
輸出量使 token 成本變得重要
低延遲能改善使用者體驗
您希望在同一個模型 ID 下使用非思考與深度推理
您需要 MIT 授權的自託管方案
您正在為大量代理選擇預設模型
以下情況請選擇 Kimi K3:
模型必須檢視螢幕截圖、圖片或文件
目前最高的獨立智慧分數比價格更重要
失敗任務的成本高於一次高階 API 呼叫
您正在建構長期多模態代理
您希望在較便宜的模型失敗後,升級處理最困難的請求
對大多數開發者而言,最佳路由策略是先使用 DeepSeek,需要時再使用 Kimi。這能保留 DeepSeek 在成本與速度上的大部分優勢,同時不放棄 Kimi 的多模態能力與更高的能力上限。
最終結論
對大多數文字型程式設計與代理工作負載而言,DeepSeek V4 Pro 0813 是更好的預設選擇。它在目前 Artificial Analysis 智慧指數上落後 Kimi K3 7 分,但輸出速度約為其兩倍,且在 GPT Proto 上成本低得多,尤其適合輸出量大的代理迴圈。
Kimi K3 是更好的專業模型。當任務包含視覺輸入、最極致的推理能力比費用更重要,或 DeepSeek 已經失敗且再次嘗試比人工恢復更便宜時,請選擇 Kimi。
0813 更新並未讓 Kimi 過時,而是讓路由決策更加明確:大量處理、速度與文字任務使用 DeepSeek;多模態與更高的測得能力上限使用 Kimi。