Schuyler Stacy2026-07-06

GLM-5.2 與 DeepSeek V4 Pro:基準測試、定價,以及實際該使用哪一個(2026)

GLM-5.2 與 DeepSeek V4 Pro:獨立基準測試(51 對 44)、DeepSeek 降價 75% 後 2026 年 7 月的實際價格,以及哪個模型適合您的工作負載。

GLM-5.2 與 DeepSeek V4 Pro:基準測試、定價,以及實際該使用哪一個(2026)

重點摘要: 如果您的工作負載是長時間跨度的代理式工程——代理程式持續數小時在儲存庫中循環操作並交付功能——GLM-5.2 是更強的模型。如果您的工作負載是演算法、數學、STEM 推理,或任何受成本限制且需要高吞吐量的任務,DeepSeek V4 Pro 勝出,而且在價格上優勢非常明顯。在 Artificial Analysis 的獨立 Intelligence Index v4.1 中,GLM-5.2(最高努力程度)得分 51,DeepSeek V4 Pro 得分 44——但 DeepSeek 官方每 token 費率大約便宜 3 到 5 倍。關鍵在於,也是大多數比較忽略的部分:每 token 價格與每項任務成本並不是同一個數字。以下我會說明原因。

 

這兩個模型都位於我們平台上的 GLM-5.2deepseek-v4-pro 目錄頁面中,而「我應該將請求路由到哪個模型」已成為我們最常收到的問題之一,尤其是對執行程式設計代理的開發者而言。這篇文章是我試圖好好回答這個問題的成果——在有獨立基準測試資料的地方使用該資料,在沒有的地方清楚標示供應商數據,並採用反映 DeepSeek 2026 年 7 月實際收費的定價計算,而不是 4 月的價格。

目錄

規格並列比較

  GLM-5.2 DeepSeek V4 Pro
開發者 Z.ai(前身為 Zhipu AI) DeepSeek
發布日期 2026 年 6 月 13 日 2026 年 4 月 24 日
參數 總計 753B/啟用 40B 總計 1.6T/啟用 49B
上下文視窗 1M tokens 1M tokens
最大輸出 131,072 tokens 384K tokens
授權條款 MIT MIT
推理模式 High/Max Non-thinking/High/Max
影像輸入
API 相容性 相容於 Anthropic 相容於 OpenAI 與 Anthropic

表面上看,這兩個模型就像兄弟:都是中國模型、都是採用 MIT 授權的開放權重混合專家模型,也都具備真正的 1M token 上下文視窗。不過,它們底層的架構理念不同,而這種差異也解釋了您稍後會看到的許多基準測試模式。

為什麼架構在這裡很重要?因為只有當模型負擔得起使用 1M token 視窗時,它才真正有用。Z.ai 的答案是 IndexShare——在每四個稀疏注意力層之間重複使用相同的注意力索引器——模型卡片表示,在完整 1M 上下文下可將每 token 計算量降低 2.9 倍。DeepSeek 的答案則是混合注意力系統;根據其模型卡片,在相同長度下,它的 FLOPs 僅為前代 V3.2 的 27%,KV 快取也僅為 10%。簡單來說:GLM-5.2 將效率預算投入在超長代理軌跡中維持一致性;DeepSeek 則投入在讓長上下文的服務成本更低。老實說,這就是整個比較的縮影。

基準測試:數字實際告訴我們什麼

先從目前唯一可用的獨立、公平比較數字開始。Artificial Analysis 在所有模型上以相同條件執行 Intelligence Index v4.1——包含 GDPval-AA、Terminal-Bench v2.1、Humanity's Last Exam 與 GPQA Diamond 在內的九項評估。GLM-5.2 在最高努力程度下得分 51,是所有開放權重模型中最高的。DeepSeek V4 Pro 在最高推理努力程度下得分 44,與 MiniMax-M3 並列開放模型第二名。作為參考,Claude Opus 4.8 得分 56,GPT-5.5 得分 55,因此這兩個開放模型之間的差距確實存在,但兩者都沒有遠離專有模型的前沿水準。這是經過獨立測量的事實。

以下所有內容都是供應商報告的數據,我也會以此方式看待。

在兩家供應商自有表格重疊的項目中,GLM-5.2 領先:SWE-bench Pro 為 62.1 對 55.4、MCP-Atlas 為 77.0 對 73.6、使用工具的 Humanity's Last Exam 為 54.7 對 48.2。值得注意的是:DeepSeek 的 SWE-bench Pro 數字在 Scale 的 SEAL 排行榜上沒有獨立紀錄,因此這 6.7 分的差距完全來自供應商報告。

接著是 DeepSeek 無人競爭的領域——GLM-5.2 根本尚未發布結果的基準測試。DeepSeek V4 Pro 報告 LiveCodeBench 得分 93.5%,是所有模型(開放或封閉)中最高的。Codeforces 評分為 3206。GPQA Diamond 得分 90.1%。HMMT 得分 95.2%。SWE-bench Verified 得分 80.6%,是開放權重項目中最高的。Z.ai 完全跳過 Verified,直接挑戰更困難的 SWE-bench Pro。我的看法是,兩個實驗室都針對自身優勢進行基準測試,並對可能落敗的項目保持沉默——這正是獨立 AA 數字比任何單一供應商表格更重要的原因。

有一個我尚未看到其他比較文章指出的陷阱:流傳的 Terminal-Bench 數字不可比較。Z.ai 報告 GLM-5.2 在 Terminal-Bench 2.1 上得分 81.0。DeepSeek 的模型卡片則報告在 Terminal-Bench 2.0 上得分 67.9——這是不同版本的基準測試。如果您看到有文章將這兩個數字放在同一欄,請直接關閉分頁。

程式設計:兩種不同的大腦

坦白說,這些模型擅長不同類型的程式設計,而這種差異已經清楚到足以據此進行路由。

GLM-5.2 是為長期任務打造的。在Z.ai 報告的數據中,它在 FrontierSWE 上達到 74.4%——這項基準測試衡量持續數小時到數十小時、規模開放的工程專案——略勝 GPT-5.5(72.6%),並且與 Claude Opus 4.8 的差距在 1% 以內。它在 Terminal-Bench 2.1 上的 81.0 分,比前代 GLM-5.1 高出 19 分。所有長時間跨度評估都呈現相同模式:這個模型經過訓練,能在混亂、多步驟的軌跡中維持計畫而不致失控。

DeepSeek V4 Pro 是演算法專家。LiveCodeBench 測試競賽程式設計問題——精確、自洽,答案非對即錯——目前世界上沒有任何模型公開了更高的分數。3206 的 Codeforces 評分與 95.2% 的 HMMT 成績也說明了同一件事:在規格完整的情況下,產出正確且精簡的解決方案。

試想這兩種工作負載。「閱讀這個包含 200 個檔案的服務,理解其慣例,提出並執行重構」——這是 GLM-5.2 的主場,而且以每個檔案約 3K tokens 計算,200 個檔案就是它實際能容納的 600K tokens 上下文。「這裡有一個規格完整的問題,請給我一個正確的 200 行修補程式」——DeepSeek 可以全天候處理這類任務,而且成本只需一小部分。

Hacker News 上的社群爭論,比任何基準測試都更能捕捉這種取捨。一派認為:DeepSeek 夠便宜,也夠好,足以應付日常工作中的 95%。另一派反駁:在長時間跨度任務中,錯誤會累積——一個「95% 夠用」的模型會把多小時的代理執行變成一團混亂,因為那 5% 的錯誤會層層堆疊。兩邊都對,只是在描述不同的工作。

定價:標價與實際帳單

這是大多數比較悄悄出錯的地方,因為 DeepSeek 今年調整了兩次價格,而搜尋這個查詢時排名靠前的一半文章仍引用 4 月的數字。

先看事實。DeepSeek 在 4 月 24 日推出 V4 Pro,參考價格為每 1M tokens 輸入 $1.74/輸出 $3.48,並提供 75% 的上市折扣。5 月 31 日,該折扣成為永久官方價格:$0.435 輸入/每 1M tokens 輸出 $0.87,快取命中輸入價格為每 1M $0.0036(DeepSeek 官方定價頁面)。這個快取價格的重要性超出表面看來的程度——DeepSeek 會自動快取重複的前綴,因此代理程式每次傳送相同的儲存庫上下文與系統提示時,這些 tokens 的費用約為未命中快取費率的 1%。對於大量使用快取的代理工作負載,有效輸入帳單甚至可能遠低於標示價格 $0.435。

GLM-5.2 在 Z.ai 獨立 API 上的牌價為每 1M tokens 輸入 $1.40/輸出 $4.40。(透過我們的 GLM-5.2 端點則為 $1.26/$3.96——比牌價低 10%。)

因此,按 token 計算,DeepSeek V4 Pro 的輸入價格大約便宜 3 倍,輸出價格便宜 5 倍。結案了嗎?沒那麼快——這正是標題式價格表忽略的部分。

當兩個模型花費不同程度的思考來完成同一項工作時,每 token 價格與每項任務成本就會出現差異。GLM-5.2 是深度思考型模型:Artificial Analysis 的 token 消耗資料顯示,在最高努力程度下,它每項 Intelligence Index 任務約使用 42,000 個輸出 tokens,比 GPT-5.5 在最高設定下使用的還多。計算一下:以 GLM 的牌價 $4.40 計算,42K 輸出 tokens 每項任務約為 $0.18。DeepSeek 使用相同的 42K tokens、價格為 $0.87 時,成本不到 $0.04——但 DeepSeek 實際每項任務的 token 消耗尚未以可比較的形式發布,因此任何每項任務成本比例都應視為估算,而非測量結果。即使無法確定確切倍數,方向仍很清楚:GLM 每項完成任務的實際成本溢價,是 token 價格差距乘以它對推理 tokens 的需求量。請依帳單而非標價進行預算。

就我個人判斷而言:如果成本是您的主要限制,這一節已經替您做出決定,那就是 DeepSeek。文章其餘部分是寫給限制在於能力的讀者。

哪個適合您的專案?

您正在打造儲存庫規模的程式設計代理。 選擇 GLM-5.2。獨立智慧評分的領先優勢(51 對 44)、長時間跨度基準測試模式,以及它特別受訓以一致使用的 1M 上下文,都指向同一個結論。代價是:每項任務的費用會高出數倍,而對於快速且規格明確的工作,您支付了不需要的深度。

您的工作負載是演算法、數學或 STEM 推理。 選擇 DeepSeek V4 Pro。它的 LiveCodeBench 與 Codeforces 結果是目前公開數據中最好的,而且輸出每 1M 僅需 $0.87。代價是:在開放式、多小時的工程任務中,其較低的長時間跨度分數暗示錯誤可能會持續累積——正是 HN 懷疑者所描述的失敗模式。

您受成本限制且需要高吞吐量。 DeepSeek,幾乎沒有爭議——並使用穩定前綴組織提示,讓 $0.0036 的快取命中率發揮最大效益。代價是:您接受的是整體智慧排名第二的開放模型;對於分類、擷取與例行程式設計,您很可能永遠不會察覺這點。

透過單一 API 存取兩者

將兩者並列執行的實際優勢在於:它們都能透過同一個端點、使用同一組金鑰存取,因此在實際工作負載上進行 A/B 測試只需改一行程式碼。兩者都使用相容於 OpenAI 的聊天完成格式。

import requests
import json
 
url = "https://gptproto.com/v1/chat/completions"
 
def ask(model: str, prompt: str) -> str:
    payload = json.dumps({
        "model": model,
        "messages": [{"role": "user", "content": prompt}],
        "stream": False
    })
    headers = {
        "Authorization": "GPTPROTO_API_KEY",
        "Content-Type": "application/json"
    }
    response = requests.post(url, headers=headers, data=payload)
    return response.json()["choices"][0]["message"]["content"]
 
task = "重構此函式,使其具備冪等性:..."
 
# 相同請求,使用兩個模型——在您自己的工作負載上比較
print(ask("glm-5.2", task))
print(ask("deepseek-v4-pro", task))

或使用 cURL:

curl --location 'https://gptproto.com/v1/chat/completions' \
--header 'Authorization: GPTPROTO_API_KEY' \
--header 'Content-Type: application/json' \
--data '{
  "model": "glm-5.2",
  "messages": [{"role": "user", "content": "Who are you?"}],
  "stream": false
}'

"glm-5.2" 替換為 "deepseek-v4-pro",相同的呼叫就會連接到另一個模型。完整目錄位於 gptproto.com/model.

 

創意工作室

使用生產級 API 生成圖像、影片及更多內容。

開始創作
創意工作室
相關模型
全部模型
Z-AI
by Z-AI
10% OFF
DeepSeek
20% OFF
Claude
20% OFF
Google
40% OFF

常見問題

GLM-5.2 比 DeepSeek V4 Pro 好嗎?

根據獨立測量,是的:GLM-5.2 在 Artificial Analysis Intelligence Index v4.1 上得分 51,而 DeepSeek V4 Pro 得分 44;在長時間跨度的代理式程式設計方面也領先。DeepSeek V4 Pro 在競賽程式設計與數學方面更強(LiveCodeBench 93.5%,供應商報告),並且每 token 便宜約 3–5 倍。

GLM-5.2 和 DeepSeek V4 Pro 哪個比較便宜?

DeepSeek V4 Pro,優勢非常明顯。2026 年 5 月 31 日永久降價後,其官方費率為每 1M tokens 輸入 $0.435/輸出 $0.87,快取命中輸入價格為 $0.0036。GLM-5.2 在 Z.ai API 上的牌價為 $1.40/$4.40。

兩個模型都支援 1M 上下文嗎?

是的。GLM-5.2 與 DeepSeek V4 Pro 都提供 1M token 上下文視窗。GLM-5.2 的輸出上限為 131,072 tokens;DeepSeek V4 Pro 最多允許 384K 輸出 tokens。

我可以在 Claude Code 中使用 GLM-5.2 或 DeepSeek V4 Pro 嗎?

是的——兩個模型都提供相容於 Anthropic 的端點,因此只要變更基礎 URL 與模型名稱,就能接入 Claude Code 或類似工具。

相關文章

更多部落格
什麼是 GLM 5.2?以六分之一的價格實現開放權重編碼

什麼是 GLM 5.2?以六分之一的價格實現開放權重編碼

一家中國實驗室發布了一個可免費下載、可在自有硬體上執行、價格約為封閉式前沿模型六分之一的模型——而且在實際編碼基準測試中,僅落後 Claude Opus 4.8 幾分。接著,他們發布了這個模型,卻沒有公布任何官方基準測試結果。這就是 GLM 5.2,而「沒有行銷數據」與「一週內躍居每個獨立排行榜前列」之間的落差,正是它值得理解的主要原因。 我寫了很多這類解說文章,而大多數新模型文章都令人難忘,因為它們只是重新敘述規格表。但這篇文章在一個對開發者真正重要的面向上有所不同:其權重採用 MIT 授權開放,因此通常的問題——「基準測試是真的,還是行銷話術?」——有了一個異常明確的答案。人們下載了它,並親自進行測試。以下將介紹 GLM 5.2 是什麼、它如何運作,以及它的優勢與限制。

Michael Johnson | 2026-07-15

glm 5.1 vs minimax 2.7:程式設計 AI 對決

glm 5.1 vs minimax 2.7:程式設計 AI 對決

簡短結論: 在 glm 5.1 與 minimax 2.7 之間做選擇,歸根究柢是一項嚴格的架構取捨:你可以支付頂尖的推理能力來梳理深層依賴關係,也可以優先選擇龐大的吞吐量與極低的 Token 成本。 開發人員經常將高階前沿模型套用在每個微小的背景流程上,導致預算迅速耗盡。這種做法很快就會變得昂貴。高階智慧非常適合從零開始建立複雜的應用程式基礎架構,但當你需要為背景代理工作流程進行數千次快速迭代時,就完全不適用了。市場需要更智慧、更審慎的任務路由方式。 仔細比較這兩個特定系統,可以揭示現代軟體開發的真實情況。其中一個模型模仿資深工程師規劃資料庫結構時謹慎、甚至有些緩慢的步調;另一個則像一名不知疲倦的初階開發人員,能立即處理重複性腳本與驗證迴圈,而且不會觸發工作階段限制警告。 我們分析了效能基準、定價層級與真實使用者的不滿,精確了解每個模型適合放在部署堆疊中的哪個位置。閱讀這些資料,開始建立真正能夠擴展而不會崩潰的混合式管線。

Schuyler Stacy | 2026-04-07

MiniMax M3 與 DeepSeek V4 Pro:價格、基準測試,以及實際該使用哪一個

MiniMax M3 與 DeepSeek V4 Pro:價格、基準測試,以及實際該使用哪一個

重點摘要 — 這是目前大家都在比較的兩款中國開放權重模型,而誠實的答案是:它們幾乎不是競爭關係。DeepSeek V4 Pro 是純文字演算法專家:它在所有開放權重模型中拿下最高的 SWE-bench Verified 分數(80.6%),而且原生 token 經濟效益很難超越,尤其是在快取命中的情況下。MiniMax M3 則是原生多模態通才:它不只能讀取文字,也能讀取圖片與影片,並且在 Artificial Analysis 的跨模型智慧指數中排名第二。如果你的工作負載是文字、程式碼和日誌,而且在意每個 token 的成本,請選擇 DeepSeek V4 Pro。 如果你的代理程式需要查看螢幕截圖、設計稿或螢幕錄影,請選擇 M3 — DeepSeek 無論價格多低都做不到這件事。兩者現在都提供開放權重,也都支援 1M token 的上下文視窗,因此這並不是大多數比較頁面所描述的「其中一方必須落敗」之戰。

Tiffany Layne | 2026-07-01

DeepSeek V4:規格、定價與發布日期

DeepSeek V4:規格、定價與發布日期

TL;DR 即將推出的 deepseek v4 預計將迎來重大躍升,具備 1 兆參數與 100 萬 token 的上下文視窗,從根本上改變開發者處理複雜推理的方式。 圍繞 DeepSeek 下一代版本的傳聞正持續升溫。開發者期待其架構不再採用彼此孤立的視覺與文字模型,而是改用統一的神經通路。這項轉變意味著文字、圖片與影片的處理速度更快、運算成本更低。您不再需要串接零散的系統,才能取得企業級效能。 將規模擴展至此等程度,會帶來嚴峻的硬體挑戰。工程團隊正積極打造 Engram 與 DeepSeek Sparse Attention 等自訂記憶體擷取系統,以避免結構崩潰。雖然社群傳聞指出可能於 2026 年 4 月發布,但在自訂晶片上完成編譯需要時間。現在準備好資料負載,可確保新端點正式上線時避免整合障礙。

Schuyler Stacy | 2026-03-31