一家中國實驗室發布了一個可免費下載、可在自有硬體上執行、價格約為封閉式前沿模型六分之一的模型——而且在實際編碼基準測試中,僅落後 Claude Opus 4.8 幾分。接著,他們發布了這個模型,卻沒有公布任何官方基準測試結果。這就是 GLM 5.2,而「沒有行銷數據」與「一週內躍居每個獨立排行榜前列」之間的落差,正是它值得理解的主要原因。
我寫了很多這類解說文章,而大多數新模型文章都令人難忘,因為它們只是重新敘述規格表。但這篇文章在一個對開發者真正重要的面向上有所不同:其權重採用 MIT 授權開放,因此通常的問題——「基準測試是真的,還是行銷話術?」——有了一個異常明確的答案。人們下載了它,並親自進行測試。以下將介紹 GLM 5.2 是什麼、它如何運作,以及它的優勢與限制。
一句話版本
GLM 5.2 是 Z.ai 的開放權重旗艦語言模型,於 2026 年 6 月 13 日發布,專為編碼、推理與工具驅動的「代理式」工作而打造——也就是模型規劃、呼叫工具、讀取結果,並在長時間工作階段中反覆修訂的多步驟任務。
Z.ai 是智譜 AI 的國際品牌。智譜 AI 是一家位於北京的研究公司,於 2019 年從清華大學知識工程實驗室分拆而出。「開放權重」是關鍵所在:模型的實際參數發布於 Hugging Face(位於 zai-org/GLM-5.2),也發布於 ModelScope 和 Ollama,採用 MIT 授權且沒有地區限制。你可以自行託管、微調,並將其部署到商業產品中,完全不必徵得任何人的許可。
為什麼開放權重編碼模型比基準測試更重要
在介紹運作機制之前,先談談動機。這次發布受到關注,並不是因為它是世界上最聰明的模型——它不是。而是因為它在免費下載且呼叫成本低廉的同時,縮小了與封閉式前沿模型的大部分差距。對開發者而言,這改變了兩個過去通常已經定案的決策。
第一個是供應商鎖定。如果你的編碼代理運行於封閉式 API,你無法離線執行它,也無法檢查它,而你的價格則取決於供應商下季的決定。開放權重一次消除了這三項限制。第二個是成本。GLM 5.2 的公開 API 價格為每百萬個輸入 token 1.40 美元、每百萬個輸出 token 4.40 美元,Z.ai 將其定位為同類前沿模型成本的約六分之一。對於大量消耗 token 的工作負載——而代理式編碼會消耗大量 token——這個比例就是全部重點。
但要注意,事情總有代價:開放權重可以安全地自行託管,但若將資料經由 Z.ai 的 cloud API 路由,資料便會通過受中國《國家情報法》管轄的基礎設施;美國國土安全部曾警告,該法律框架可能迫使中國企業交出美國人士的資料。這兩個事實同時存在——你可以在任何地方執行的免費、可檢查權重,and 一個確實存在資料管轄權問題的託管 API。哪一點適用於你,完全取決於你是自行託管還是呼叫雲端服務。稍後我會再回到這個問題。
不含模糊說法地了解其運作方式
GLM 5.2 是混合專家(Mixture-of-Experts,MoE)模型。其公布的總參數量約為 7,440 億至 7,530 億——不同來源略有差異,這本身也說明精確數字仍在確定中——但任一 token 僅約有 400 億個參數處於啟用狀態。
這種拆分是核心技巧,因此值得用一個比喻來說明。密集模型就像一位單一的通才,每個問題都必須思考所有事情。MoE 模型則更像一家大型企業:它掌握一個龐大組織的知識,但針對任何一項任務,只會喚醒相關的少數專家。你能以大約 400 億參數模型的服務成本,獲得 7,440 億參數模型的容量。與前代 GLM 4.5——總參數 355B、啟用參數 32B——相比,GLM 5 將這家公司擴大到 744B / 40B,並使用更多資料進行訓練(285,000 億 token,高於原本的 230,000 億)。
另外三個部分也很重要,而且每一項都是為了解決特定問題,而不是為了充實功能清單。
第一項是 Z.ai 稱為 IndexShare 的稀疏注意力設計。它所解決的問題是:隨著上下文視窗變長,注意力成本會痛苦地增加,而 GLM 5.2 的視窗非常長(稍後會詳述)。通常,模型會在每一層重新計算應關注哪些較早的 token。IndexShare 會在每四層注意力層中的第一層計算一次索引,並在接下來三層重複使用。Z.ai 表示,在這些重複使用的層中,這能將點積索引成本降低 75%;在完整的 100 萬 token 上下文長度下,每個 token 的計算量約降低 2.9×。簡單來說,這正是讓百萬 token 上下文真正能夠負擔得起的原因。
第二項是 雙重推理模式——兩種可選的思考力度設定,稱為 High 和 Max。Max 適用於困難的多步驟編碼任務,模型需要有足夠空間進行規劃與修訂;單一任務可能消耗接近 85,000 個輸出 token。High 僅犧牲幾分效能,卻能大約減半 token 輸出量;當延遲和成本比最後一個百分點更重要時,這就是你會選用的設定。一句話總結:正確性至上時使用 Max,日常工作使用 High。
第三項是 多 token 預測,讓模型能在一次前向傳播中預測數個 token,而非一次預測一個——這能加快推理速度,也會帶來更好的長程連貫性。
綜合而言,實際上最值得注意的是 上下文視窗:最多可輸入 1,000,000 個 token(透過 glm-5.2[1m] 識別碼),輸出最多 131,072 個 token。這大約是 GLM 5.1 約 200,000 token 上限的五倍。100 萬個 token 足以一次將中型程式碼庫完整放入上下文,而這正是整套設計所針對的使用情境。
它究竟有多好
這裡需要區分信心層次,因此我會明確說明哪些是事實,哪些是公開報告的數據。
事實是:Z.ai 發布 GLM 5.2 時,沒有官方基準測試套件。你看到的每個數字,不是供應商事後公布的,就是來自早期獨立評估,而且目前都尚未被廣泛重現。請將具體小數視為方向性參考,而非絕對真理。
有了這個前提,各來源的報告數據仍相當一致,並指向同一個方向。在 Terminal-Bench 2.1(自主終端編碼)中,GLM 5.2 據報得分 81.0,大幅高於 GLM 5.1 的 62.0,距離 Claude Opus 4.8 的 85.0 約四分。在 SWE-bench Pro(解決實際軟體工程問題)中,據報得分 62.1,高於 GPT-5.5 的 58.6 及其前代模型的 58.4,但低於 Claude Opus 4.8 的 69.2。在 Artificial Analysis 的 Intelligence Index 中,據報得分 51,為所有開放權重模型中的最高分。
相比一般供應商表格,獨立驗證更難操弄,因此讓這些數字更具可信度。在 Arena.ai 的 Code Arena 上——這是一個根據人類盲測成對投票建立的 Elo 排行榜——GLM 5.2 據報位居總排名第二。在群眾參與的 Design Arena 中,它據報以 1360 的 Elo 分數取得第一名,甚至領先 Claude Fable 5。盲測人類偏好投票比自我報告的通過率更難操弄,因此這兩項結果是我最信任的。
我的判斷如下,這是觀點而非事實:GLM 5.2 是目前最強的開放權重編碼模型,在多項編碼任務中擊敗 GPT-5.5,而在最困難的長期程工作上,依任務不同,落後 Claude Opus 4.8 約一分至十三分。它很接近,但沒有超越——價格卻只有對方的一小部分。
GLM 5.2 vs Claude Opus 4.8 vs GPT-5.5
如果要在三者之間做選擇,取捨關係很清楚。下表列出已報告的編碼基準分數,以及不會變動的資訊(價格、上下文、授權):
| |
GLM 5.2 |
Claude Opus 4.8 |
GPT-5.5 |
| 權重 |
開放(MIT) |
封閉 |
封閉 |
| 上下文視窗 |
1M token |
1M token |
1M token |
| API 價格(輸入 / 輸出,每 1M) |
1.40 美元 / 4.40 美元 |
5.00 美元 / 25.00 美元 |
5.00 美元 / 30.00 美元 |
| Terminal-Bench 2.1(已報告) |
81.0 |
85.0 |
— |
| SWE-bench Pro(已報告) |
62.1 |
69.2 |
58.6 |
| 可自行託管 |
是 |
否 |
否 |
坦白說,Claude Opus 4.8 在最困難的代理式編碼任務上仍是三者中能力最強的;如果你付費是為了長時間自主執行中的正確性,它仍是安全的預設選擇。GPT-5.5 在這些特定編碼基準測試中居中。GLM 5.2 的賣點不是「它是最好的」——而是「它距離最好的模型只差幾分、採用開放權重,而且成本僅為其一小部分」。如果你對成本敏感、希望自行託管或進行微調,這個理由非常充分。如果你運行的是關鍵任務的長期程代理,而額外幾分可靠性足以抵銷成本,Claude Opus 4.8 是更保守的選擇。Claude 方面的價格由 Anthropic 公布;GLM 的數據是 Z.ai 公布的價格。
如果你想用自己的提示詞,對兩個封閉式競爭模型進行 A/B 測試,兩者都能透過 GPT Proto 的單一 API 呼叫——Claude Opus 4.8 (thinking) 和 GPT-5.5——每百萬 token 統一收費 4 美元。(這個統一價格是 GPT Proto 的;上表中的 5.00 / 25.00 美元輸入後輸出分開計價,是 Anthropic 對 Opus 4.8 的官方定價——同一模型,兩種不同的價格結構。)將三個模型系列置於同一個金鑰之後,是自行進行比較最便宜的方式。
GLM 5.2 與今日可用的 GLM 模型相比
GLM 5.2 本身以開放權重形式發布,你可以下載並自行託管——Z.ai 的託管 API 是呼叫它的唯一第一方方式,而如上所述,這也伴隨資料管轄權問題。但 GLM 系列並非從 5.2 才開始,而與先前版本的比較,是了解實際變化最清楚的方式。
最有用的比較對象是 GLM 5.1,也就是它的直接前代。兩項差異尤其突出。上下文視窗從約 200,000 token 增加到完整的 1,000,000 token——五倍提升,是最受矚目的升級。在編碼方面,報告的進步也很大:Terminal-Bench 2.1 從 62.0 升至 81.0,SWE-bench Pro 則從 58.4 升至 62.1。換句話說,GLM 5.2 在排行榜上的大部分提升,來自相較上一個版本的改進,而不是小幅調整。
如果你今天更想透過單一 OpenAI 相容 API 呼叫託管版 GLM,而不是建立開放權重的執行環境,GPT Proto 目前提供的 GLM 模型,就是產品線中緊接在 5.2 之前的版本:
| 模型 |
GPT Proto 價格(每 1M token) |
備註 |
| GLM-5 |
0.90 美元 |
GLM 5 基礎版本 |
| GLM-5-turbo |
1.08 美元 |
針對速度與成本最佳化的版本 |
| GLM-5.1 |
1.26 美元 |
5.2 之前的直接前代版本 |
GLM-5.1 是你在這裡能呼叫到、最接近 5.2 的模型——同一系列、早一代版本,具有約 200K 而非 1M 的上下文。對許多編碼工作而言,這是你不會察覺的差異;但對於需要一次將整個程式碼庫放入上下文的儲存庫規模任務而言,這正是 5.2 所填補的差距。所有模型的完整 token 價格都列在 模型頁面。
在 Claude Code 中使用 GLM 5.2,以及可執行範例
有一項細節讓 GLM 系列特別容易整合至現有工作流程:GLM 5.2 提供 Anthropic 相容端點。為 Claude 打造的工具——Claude Code、Cline、OpenCode——都能直接指向該端點,在不重寫整合的情況下替換編碼代理背後的模型。這就是「在 Claude coding 中使用 GLM 5.2」成為實際模式,而不只是搜尋詞的原因:代理框架保持不變,只有底層模型改變。(針對 5.2,這表示使用 Z.ai 自有端點或自行託管的部署,因為開放權重是第一方路徑。)
如果你不想管理部署環境,今天最實際的做法是透過 GPT Proto 的 OpenAI 相容 API 呼叫託管版 GLM。以下以 GLM 5.1——目前最接近的同系列模型——為例,在決定 5.2 額外的上下文是否值得自行託管之前,它能提供良好的基準:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_GPTPROTO_API_KEY",
base_url="https://api.gptproto.com/v1",
)
resp = client.chat.completions.create(
model="glm-5.1",
messages=[
{
"role": "user",
"content": (
"Refactor this function for readability and explain the change:\n\n"
"def f(x):\n"
" return [i for i in x if i % 2 == 0]"
),
}
],
)
print(resp.choices[0].message.content)
以下是使用 cURL 發送相同請求的方式:
curl https://api.gptproto.com/v1/chat/completions \
-H "Authorization: Bearer $GPTPROTO_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.1",
"messages": [
{"role": "user", "content": "Write a Python function that returns the nth Fibonacci number, iteratively."}
]
}'
將 glm-5.1 替換為 glm-5 或 glm-5-turbo,即可在品質與成本之間取捨;也可以替換為 claude-opus-4-8-thinking / gpt-5.5,以執行上表中的相同比較——全部使用同一個金鑰。
你首先需要取得該金鑰:從 GPT Proto 控制台建立一組,將它填入 YOUR_GPTPROTO_API_KEY,上面的呼叫即可直接執行。如果你想在決定之前估算成本,所有模型的 token 價格都列於 模型頁面。
它的優勢與不足
它的優勢很明確:在現有排行榜上,它是頂尖的開放權重編碼模型;採用真正寬鬆的 MIT 授權;百萬 token 上下文得益於 IndexShare,確實可用且執行成本可負擔;而且其成本效能比在同級中最佳。
它的弱點同樣明確,也值得直接說明,而不是埋在文章中。它在最困難的長期程編碼任務上落後 Claude Opus 4.8——差距不大,但始終存在。Z.ai 沒有公布官方基準測試,因此在更多獨立實驗室重現結果之前,這些數字都應該打上星號。此外,雲端 API 的資料管轄權問題確實存在:如果你的資料依法或依合約不能離開特定界線,託管的 Z.ai API 就是錯誤的選擇——請改為自行託管開放權重,這正是開放權重存在的全部意義。
誰適合使用,誰不適合使用
如果你是希望以不使用前沿模型價格取得接近前沿的編碼能力、需要自行託管或微調,或者正在打造 token 支出占主導地位的成本敏感型代理產品的開發者,就適合使用 GLM 5.2。對於已經擁有 Claude 相容代理框架,並希望在其背後使用更便宜引擎的人來說,它尤其合適。
如果你運行的是關鍵任務、長期程的自主代理,而最後幾分可靠性值得支付額外費用;或者你的工作受資料駐留規範約束,託管 GLM API 無法滿足要求且你又無法自行託管,那麼應該選擇 Claude Opus 4.8。