重點摘要: 如果您的工作負載是長時間跨度的代理式工程——代理程式持續數小時在儲存庫中循環操作並交付功能——GLM-5.2 是更強的模型。如果您的工作負載是演算法、數學、STEM 推理,或任何受成本限制且需要高吞吐量的任務,DeepSeek V4 Pro 勝出,而且在價格上優勢非常明顯。在 Artificial Analysis 的獨立 Intelligence Index v4.1 中,GLM-5.2(最高努力程度)得分 51,DeepSeek V4 Pro 得分 44——但 DeepSeek 官方每 token 費率大約便宜 3 到 5 倍。關鍵在於,也是大多數比較忽略的部分:每 token 價格與每項任務成本並不是同一個數字。以下我會說明原因。
這兩個模型都位於我們平台上的 GLM-5.2 與 deepseek-v4-pro 目錄頁面中,而「我應該將請求路由到哪個模型」已成為我們最常收到的問題之一,尤其是對執行程式設計代理的開發者而言。這篇文章是我試圖好好回答這個問題的成果——在有獨立基準測試資料的地方使用該資料,在沒有的地方清楚標示供應商數據,並採用反映 DeepSeek 2026 年 7 月實際收費的定價計算,而不是 4 月的價格。
規格並列比較
| |
GLM-5.2 |
DeepSeek V4 Pro |
| 開發者 |
Z.ai(前身為 Zhipu AI) |
DeepSeek |
| 發布日期 |
2026 年 6 月 13 日 |
2026 年 4 月 24 日 |
| 參數 |
總計 753B/啟用 40B |
總計 1.6T/啟用 49B |
| 上下文視窗 |
1M tokens |
1M tokens |
| 最大輸出 |
131,072 tokens |
384K tokens |
| 授權條款 |
MIT |
MIT |
| 推理模式 |
High/Max |
Non-thinking/High/Max |
| 影像輸入 |
否 |
否 |
| API 相容性 |
相容於 Anthropic |
相容於 OpenAI 與 Anthropic |
表面上看,這兩個模型就像兄弟:都是中國模型、都是採用 MIT 授權的開放權重混合專家模型,也都具備真正的 1M token 上下文視窗。不過,它們底層的架構理念不同,而這種差異也解釋了您稍後會看到的許多基準測試模式。
為什麼架構在這裡很重要?因為只有當模型負擔得起使用 1M token 視窗時,它才真正有用。Z.ai 的答案是 IndexShare——在每四個稀疏注意力層之間重複使用相同的注意力索引器——模型卡片表示,在完整 1M 上下文下可將每 token 計算量降低 2.9 倍。DeepSeek 的答案則是混合注意力系統;根據其模型卡片,在相同長度下,它的 FLOPs 僅為前代 V3.2 的 27%,KV 快取也僅為 10%。簡單來說:GLM-5.2 將效率預算投入在超長代理軌跡中維持一致性;DeepSeek 則投入在讓長上下文的服務成本更低。老實說,這就是整個比較的縮影。
基準測試:數字實際告訴我們什麼
先從目前唯一可用的獨立、公平比較數字開始。Artificial Analysis 在所有模型上以相同條件執行 Intelligence Index v4.1——包含 GDPval-AA、Terminal-Bench v2.1、Humanity's Last Exam 與 GPQA Diamond 在內的九項評估。GLM-5.2 在最高努力程度下得分 51,是所有開放權重模型中最高的。DeepSeek V4 Pro 在最高推理努力程度下得分 44,與 MiniMax-M3 並列開放模型第二名。作為參考,Claude Opus 4.8 得分 56,GPT-5.5 得分 55,因此這兩個開放模型之間的差距確實存在,但兩者都沒有遠離專有模型的前沿水準。這是經過獨立測量的事實。
以下所有內容都是供應商報告的數據,我也會以此方式看待。
在兩家供應商自有表格重疊的項目中,GLM-5.2 領先:SWE-bench Pro 為 62.1 對 55.4、MCP-Atlas 為 77.0 對 73.6、使用工具的 Humanity's Last Exam 為 54.7 對 48.2。值得注意的是:DeepSeek 的 SWE-bench Pro 數字在 Scale 的 SEAL 排行榜上沒有獨立紀錄,因此這 6.7 分的差距完全來自供應商報告。
接著是 DeepSeek 無人競爭的領域——GLM-5.2 根本尚未發布結果的基準測試。DeepSeek V4 Pro 報告 LiveCodeBench 得分 93.5%,是所有模型(開放或封閉)中最高的。Codeforces 評分為 3206。GPQA Diamond 得分 90.1%。HMMT 得分 95.2%。SWE-bench Verified 得分 80.6%,是開放權重項目中最高的。Z.ai 完全跳過 Verified,直接挑戰更困難的 SWE-bench Pro。我的看法是,兩個實驗室都針對自身優勢進行基準測試,並對可能落敗的項目保持沉默——這正是獨立 AA 數字比任何單一供應商表格更重要的原因。
有一個我尚未看到其他比較文章指出的陷阱:流傳的 Terminal-Bench 數字不可比較。Z.ai 報告 GLM-5.2 在 Terminal-Bench 2.1 上得分 81.0。DeepSeek 的模型卡片則報告在 Terminal-Bench 2.0 上得分 67.9——這是不同版本的基準測試。如果您看到有文章將這兩個數字放在同一欄,請直接關閉分頁。
程式設計:兩種不同的大腦
坦白說,這些模型擅長不同類型的程式設計,而這種差異已經清楚到足以據此進行路由。
GLM-5.2 是為長期任務打造的。在Z.ai 報告的數據中,它在 FrontierSWE 上達到 74.4%——這項基準測試衡量持續數小時到數十小時、規模開放的工程專案——略勝 GPT-5.5(72.6%),並且與 Claude Opus 4.8 的差距在 1% 以內。它在 Terminal-Bench 2.1 上的 81.0 分,比前代 GLM-5.1 高出 19 分。所有長時間跨度評估都呈現相同模式:這個模型經過訓練,能在混亂、多步驟的軌跡中維持計畫而不致失控。
DeepSeek V4 Pro 是演算法專家。LiveCodeBench 測試競賽程式設計問題——精確、自洽,答案非對即錯——目前世界上沒有任何模型公開了更高的分數。3206 的 Codeforces 評分與 95.2% 的 HMMT 成績也說明了同一件事:在規格完整的情況下,產出正確且精簡的解決方案。
試想這兩種工作負載。「閱讀這個包含 200 個檔案的服務,理解其慣例,提出並執行重構」——這是 GLM-5.2 的主場,而且以每個檔案約 3K tokens 計算,200 個檔案就是它實際能容納的 600K tokens 上下文。「這裡有一個規格完整的問題,請給我一個正確的 200 行修補程式」——DeepSeek 可以全天候處理這類任務,而且成本只需一小部分。
Hacker News 上的社群爭論,比任何基準測試都更能捕捉這種取捨。一派認為:DeepSeek 夠便宜,也夠好,足以應付日常工作中的 95%。另一派反駁:在長時間跨度任務中,錯誤會累積——一個「95% 夠用」的模型會把多小時的代理執行變成一團混亂,因為那 5% 的錯誤會層層堆疊。兩邊都對,只是在描述不同的工作。

定價:標價與實際帳單
這是大多數比較悄悄出錯的地方,因為 DeepSeek 今年調整了兩次價格,而搜尋這個查詢時排名靠前的一半文章仍引用 4 月的數字。
先看事實。DeepSeek 在 4 月 24 日推出 V4 Pro,參考價格為每 1M tokens 輸入 $1.74/輸出 $3.48,並提供 75% 的上市折扣。5 月 31 日,該折扣成為永久官方價格:$0.435 輸入/每 1M tokens 輸出 $0.87,快取命中輸入價格為每 1M $0.0036(DeepSeek 官方定價頁面)。這個快取價格的重要性超出表面看來的程度——DeepSeek 會自動快取重複的前綴,因此代理程式每次傳送相同的儲存庫上下文與系統提示時,這些 tokens 的費用約為未命中快取費率的 1%。對於大量使用快取的代理工作負載,有效輸入帳單甚至可能遠低於標示價格 $0.435。
GLM-5.2 在 Z.ai 獨立 API 上的牌價為每 1M tokens 輸入 $1.40/輸出 $4.40。(透過我們的 GLM-5.2 端點則為 $1.26/$3.96——比牌價低 10%。)
因此,按 token 計算,DeepSeek V4 Pro 的輸入價格大約便宜 3 倍,輸出價格便宜 5 倍。結案了嗎?沒那麼快——這正是標題式價格表忽略的部分。
當兩個模型花費不同程度的思考來完成同一項工作時,每 token 價格與每項任務成本就會出現差異。GLM-5.2 是深度思考型模型:Artificial Analysis 的 token 消耗資料顯示,在最高努力程度下,它每項 Intelligence Index 任務約使用 42,000 個輸出 tokens,比 GPT-5.5 在最高設定下使用的還多。計算一下:以 GLM 的牌價 $4.40 計算,42K 輸出 tokens 每項任務約為 $0.18。DeepSeek 使用相同的 42K tokens、價格為 $0.87 時,成本不到 $0.04——但 DeepSeek 實際每項任務的 token 消耗尚未以可比較的形式發布,因此任何每項任務成本比例都應視為估算,而非測量結果。即使無法確定確切倍數,方向仍很清楚:GLM 每項完成任務的實際成本溢價,是 token 價格差距乘以它對推理 tokens 的需求量。請依帳單而非標價進行預算。
就我個人判斷而言:如果成本是您的主要限制,這一節已經替您做出決定,那就是 DeepSeek。文章其餘部分是寫給限制在於能力的讀者。
哪個適合您的專案?
您正在打造儲存庫規模的程式設計代理。 選擇 GLM-5.2。獨立智慧評分的領先優勢(51 對 44)、長時間跨度基準測試模式,以及它特別受訓以一致使用的 1M 上下文,都指向同一個結論。代價是:每項任務的費用會高出數倍,而對於快速且規格明確的工作,您支付了不需要的深度。
您的工作負載是演算法、數學或 STEM 推理。 選擇 DeepSeek V4 Pro。它的 LiveCodeBench 與 Codeforces 結果是目前公開數據中最好的,而且輸出每 1M 僅需 $0.87。代價是:在開放式、多小時的工程任務中,其較低的長時間跨度分數暗示錯誤可能會持續累積——正是 HN 懷疑者所描述的失敗模式。
您受成本限制且需要高吞吐量。 DeepSeek,幾乎沒有爭議——並使用穩定前綴組織提示,讓 $0.0036 的快取命中率發揮最大效益。代價是:您接受的是整體智慧排名第二的開放模型;對於分類、擷取與例行程式設計,您很可能永遠不會察覺這點。
透過單一 API 存取兩者
將兩者並列執行的實際優勢在於:它們都能透過同一個端點、使用同一組金鑰存取,因此在實際工作負載上進行 A/B 測試只需改一行程式碼。兩者都使用相容於 OpenAI 的聊天完成格式。
import requests
import json
url = "https://gptproto.com/v1/chat/completions"
def ask(model: str, prompt: str) -> str:
payload = json.dumps({
"model": model,
"messages": [{"role": "user", "content": prompt}],
"stream": False
})
headers = {
"Authorization": "GPTPROTO_API_KEY",
"Content-Type": "application/json"
}
response = requests.post(url, headers=headers, data=payload)
return response.json()["choices"][0]["message"]["content"]
task = "重構此函式,使其具備冪等性:..."
# 相同請求,使用兩個模型——在您自己的工作負載上比較
print(ask("glm-5.2", task))
print(ask("deepseek-v4-pro", task))
或使用 cURL:
curl --location 'https://gptproto.com/v1/chat/completions' \
--header 'Authorization: GPTPROTO_API_KEY' \
--header 'Content-Type: application/json' \
--data '{
"model": "glm-5.2",
"messages": [{"role": "user", "content": "Who are you?"}],
"stream": false
}'
將 "glm-5.2" 替換為 "deepseek-v4-pro",相同的呼叫就會連接到另一個模型。完整目錄位於 gptproto.com/model.