Michael Johnson2026-07-15

什麼是 GLM 5.2?以六分之一的價格實現開放權重編碼

GLM 5.2 是 Z.ai 採用 MIT 授權的開放權重編碼模型,具備 1M token 上下文。了解其功能、與 Claude Opus 4.8 和 GPT-5.5 的基準測試比較、價格,以及如何執行。

什麼是 GLM 5.2?以六分之一的價格實現開放權重編碼

一家中國實驗室發布了一個可免費下載、可在自有硬體上執行、價格約為封閉式前沿模型六分之一的模型——而且在實際編碼基準測試中,僅落後 Claude Opus 4.8 幾分。接著,他們發布了這個模型,卻沒有公布任何官方基準測試結果。這就是 GLM 5.2,而「沒有行銷數據」與「一週內躍居每個獨立排行榜前列」之間的落差,正是它值得理解的主要原因。

我寫了很多這類解說文章,而大多數新模型文章都令人難忘,因為它們只是重新敘述規格表。但這篇文章在一個對開發者真正重要的面向上有所不同:其權重採用 MIT 授權開放,因此通常的問題——「基準測試是真的,還是行銷話術?」——有了一個異常明確的答案。人們下載了它,並親自進行測試。以下將介紹 GLM 5.2 是什麼、它如何運作,以及它的優勢與限制。

目錄

一句話版本

GLM 5.2 是 Z.ai 的開放權重旗艦語言模型,於 2026 年 6 月 13 日發布,專為編碼、推理與工具驅動的「代理式」工作而打造——也就是模型規劃、呼叫工具、讀取結果,並在長時間工作階段中反覆修訂的多步驟任務。

Z.ai 是智譜 AI 的國際品牌。智譜 AI 是一家位於北京的研究公司,於 2019 年從清華大學知識工程實驗室分拆而出。「開放權重」是關鍵所在:模型的實際參數發布於 Hugging Face(位於 zai-org/GLM-5.2),也發布於 ModelScope 和 Ollama,採用 MIT 授權且沒有地區限制。你可以自行託管、微調,並將其部署到商業產品中,完全不必徵得任何人的許可。

為什麼開放權重編碼模型比基準測試更重要

在介紹運作機制之前,先談談動機。這次發布受到關注,並不是因為它是世界上最聰明的模型——它不是。而是因為它在免費下載且呼叫成本低廉的同時,縮小了與封閉式前沿模型的大部分差距。對開發者而言,這改變了兩個過去通常已經定案的決策。

第一個是供應商鎖定。如果你的編碼代理運行於封閉式 API,你無法離線執行它,也無法檢查它,而你的價格則取決於供應商下季的決定。開放權重一次消除了這三項限制。第二個是成本。GLM 5.2 的公開 API 價格為每百萬個輸入 token 1.40 美元、每百萬個輸出 token 4.40 美元,Z.ai 將其定位為同類前沿模型成本的約六分之一。對於大量消耗 token 的工作負載——而代理式編碼會消耗大量 token——這個比例就是全部重點。

但要注意,事情總有代價:開放權重可以安全地自行託管,但若將資料經由 Z.ai 的 cloud API 路由,資料便會通過受中國《國家情報法》管轄的基礎設施;美國國土安全部曾警告,該法律框架可能迫使中國企業交出美國人士的資料。這兩個事實同時存在——你可以在任何地方執行的免費、可檢查權重,and 一個確實存在資料管轄權問題的託管 API。哪一點適用於你,完全取決於你是自行託管還是呼叫雲端服務。稍後我會再回到這個問題。

不含模糊說法地了解其運作方式

GLM 5.2 是混合專家(Mixture-of-Experts,MoE)模型。其公布的總參數量約為 7,440 億至 7,530 億——不同來源略有差異,這本身也說明精確數字仍在確定中——但任一 token 僅約有 400 億個參數處於啟用狀態。

這種拆分是核心技巧,因此值得用一個比喻來說明。密集模型就像一位單一的通才,每個問題都必須思考所有事情。MoE 模型則更像一家大型企業:它掌握一個龐大組織的知識,但針對任何一項任務,只會喚醒相關的少數專家。你能以大約 400 億參數模型的服務成本,獲得 7,440 億參數模型的容量。與前代 GLM 4.5——總參數 355B、啟用參數 32B——相比,GLM 5 將這家公司擴大到 744B / 40B,並使用更多資料進行訓練(285,000 億 token,高於原本的 230,000 億)。

另外三個部分也很重要,而且每一項都是為了解決特定問題,而不是為了充實功能清單。

第一項是 Z.ai 稱為 IndexShare 的稀疏注意力設計。它所解決的問題是:隨著上下文視窗變長,注意力成本會痛苦地增加,而 GLM 5.2 的視窗非常長(稍後會詳述)。通常,模型會在每一層重新計算應關注哪些較早的 token。IndexShare 會在每四層注意力層中的第一層計算一次索引,並在接下來三層重複使用。Z.ai 表示,在這些重複使用的層中,這能將點積索引成本降低 75%;在完整的 100 萬 token 上下文長度下,每個 token 的計算量約降低 2.9×。簡單來說,這正是讓百萬 token 上下文真正能夠負擔得起的原因。

第二項是 雙重推理模式——兩種可選的思考力度設定,稱為 High 和 Max。Max 適用於困難的多步驟編碼任務,模型需要有足夠空間進行規劃與修訂;單一任務可能消耗接近 85,000 個輸出 token。High 僅犧牲幾分效能,卻能大約減半 token 輸出量;當延遲和成本比最後一個百分點更重要時,這就是你會選用的設定。一句話總結:正確性至上時使用 Max,日常工作使用 High。

第三項是 多 token 預測,讓模型能在一次前向傳播中預測數個 token,而非一次預測一個——這能加快推理速度,也會帶來更好的長程連貫性。

綜合而言,實際上最值得注意的是 上下文視窗:最多可輸入 1,000,000 個 token(透過 glm-5.2[1m] 識別碼),輸出最多 131,072 個 token。這大約是 GLM 5.1 約 200,000 token 上限的五倍。100 萬個 token 足以一次將中型程式碼庫完整放入上下文,而這正是整套設計所針對的使用情境。

它究竟有多好

這裡需要區分信心層次,因此我會明確說明哪些是事實,哪些是公開報告的數據。

事實是:Z.ai 發布 GLM 5.2 時,沒有官方基準測試套件。你看到的每個數字,不是供應商事後公布的,就是來自早期獨立評估,而且目前都尚未被廣泛重現。請將具體小數視為方向性參考,而非絕對真理。

有了這個前提,各來源的報告數據仍相當一致,並指向同一個方向。在 Terminal-Bench 2.1(自主終端編碼)中,GLM 5.2 據報得分 81.0,大幅高於 GLM 5.1 的 62.0,距離 Claude Opus 4.8 的 85.0 約四分。在 SWE-bench Pro(解決實際軟體工程問題)中,據報得分 62.1,高於 GPT-5.5 的 58.6 及其前代模型的 58.4,但低於 Claude Opus 4.8 的 69.2。在 Artificial Analysis 的 Intelligence Index 中,據報得分 51,為所有開放權重模型中的最高分。

相比一般供應商表格,獨立驗證更難操弄,因此讓這些數字更具可信度。在 Arena.ai 的 Code Arena 上——這是一個根據人類盲測成對投票建立的 Elo 排行榜——GLM 5.2 據報位居總排名第二。在群眾參與的 Design Arena 中,它據報以 1360 的 Elo 分數取得第一名,甚至領先 Claude Fable 5。盲測人類偏好投票比自我報告的通過率更難操弄,因此這兩項結果是我最信任的。

我的判斷如下,這是觀點而非事實:GLM 5.2 是目前最強的開放權重編碼模型,在多項編碼任務中擊敗 GPT-5.5,而在最困難的長期程工作上,依任務不同,落後 Claude Opus 4.8 約一分至十三分。它很接近,但沒有超越——價格卻只有對方的一小部分。

GLM 5.2 vs Claude Opus 4.8 vs GPT-5.5

如果要在三者之間做選擇,取捨關係很清楚。下表列出已報告的編碼基準分數,以及不會變動的資訊(價格、上下文、授權):

  GLM 5.2 Claude Opus 4.8 GPT-5.5
權重 開放(MIT) 封閉 封閉
上下文視窗 1M token 1M token 1M token
API 價格(輸入 / 輸出,每 1M) 1.40 美元 / 4.40 美元 5.00 美元 / 25.00 美元 5.00 美元 / 30.00 美元
Terminal-Bench 2.1(已報告) 81.0 85.0
SWE-bench Pro(已報告) 62.1 69.2 58.6
可自行託管

坦白說,Claude Opus 4.8 在最困難的代理式編碼任務上仍是三者中能力最強的;如果你付費是為了長時間自主執行中的正確性,它仍是安全的預設選擇。GPT-5.5 在這些特定編碼基準測試中居中。GLM 5.2 的賣點不是「它是最好的」——而是「它距離最好的模型只差幾分、採用開放權重,而且成本僅為其一小部分」。如果你對成本敏感、希望自行託管或進行微調,這個理由非常充分。如果你運行的是關鍵任務的長期程代理,而額外幾分可靠性足以抵銷成本,Claude Opus 4.8 是更保守的選擇。Claude 方面的價格由 Anthropic 公布;GLM 的數據是 Z.ai 公布的價格。

如果你想用自己的提示詞,對兩個封閉式競爭模型進行 A/B 測試,兩者都能透過 GPT Proto 的單一 API 呼叫——Claude Opus 4.8 (thinking)GPT-5.5——每百萬 token 統一收費 4 美元。(這個統一價格是 GPT Proto 的;上表中的 5.00 / 25.00 美元輸入後輸出分開計價,是 Anthropic 對 Opus 4.8 的官方定價——同一模型,兩種不同的價格結構。)將三個模型系列置於同一個金鑰之後,是自行進行比較最便宜的方式。

GLM 5.2 與今日可用的 GLM 模型相比

GLM 5.2 本身以開放權重形式發布,你可以下載並自行託管——Z.ai 的託管 API 是呼叫它的唯一第一方方式,而如上所述,這也伴隨資料管轄權問題。但 GLM 系列並非從 5.2 才開始,而與先前版本的比較,是了解實際變化最清楚的方式。

最有用的比較對象是 GLM 5.1,也就是它的直接前代。兩項差異尤其突出。上下文視窗從約 200,000 token 增加到完整的 1,000,000 token——五倍提升,是最受矚目的升級。在編碼方面,報告的進步也很大:Terminal-Bench 2.1 從 62.0 升至 81.0,SWE-bench Pro 則從 58.4 升至 62.1。換句話說,GLM 5.2 在排行榜上的大部分提升,來自相較上一個版本的改進,而不是小幅調整。

如果你今天更想透過單一 OpenAI 相容 API 呼叫託管版 GLM,而不是建立開放權重的執行環境,GPT Proto 目前提供的 GLM 模型,就是產品線中緊接在 5.2 之前的版本:

模型 GPT Proto 價格(每 1M token) 備註
GLM-5 0.90 美元 GLM 5 基礎版本
GLM-5-turbo 1.08 美元 針對速度與成本最佳化的版本
GLM-5.1 1.26 美元 5.2 之前的直接前代版本

GLM-5.1 是你在這裡能呼叫到、最接近 5.2 的模型——同一系列、早一代版本,具有約 200K 而非 1M 的上下文。對許多編碼工作而言,這是你不會察覺的差異;但對於需要一次將整個程式碼庫放入上下文的儲存庫規模任務而言,這正是 5.2 所填補的差距。所有模型的完整 token 價格都列在 模型頁面

在 Claude Code 中使用 GLM 5.2,以及可執行範例

有一項細節讓 GLM 系列特別容易整合至現有工作流程:GLM 5.2 提供 Anthropic 相容端點。為 Claude 打造的工具——Claude Code、Cline、OpenCode——都能直接指向該端點,在不重寫整合的情況下替換編碼代理背後的模型。這就是「在 Claude coding 中使用 GLM 5.2」成為實際模式,而不只是搜尋詞的原因:代理框架保持不變,只有底層模型改變。(針對 5.2,這表示使用 Z.ai 自有端點或自行託管的部署,因為開放權重是第一方路徑。)

如果你不想管理部署環境,今天最實際的做法是透過 GPT Proto 的 OpenAI 相容 API 呼叫託管版 GLM。以下以 GLM 5.1——目前最接近的同系列模型——為例,在決定 5.2 額外的上下文是否值得自行託管之前,它能提供良好的基準:

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_GPTPROTO_API_KEY",
    base_url="https://api.gptproto.com/v1",
)

resp = client.chat.completions.create(
    model="glm-5.1",
    messages=[
        {
            "role": "user",
            "content": (
                "Refactor this function for readability and explain the change:\n\n"
                "def f(x):\n"
                "    return [i for i in x if i % 2 == 0]"
            ),
        }
    ],
)

print(resp.choices[0].message.content)

以下是使用 cURL 發送相同請求的方式:

curl https://api.gptproto.com/v1/chat/completions \
  -H "Authorization: Bearer $GPTPROTO_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.1",
    "messages": [
      {"role": "user", "content": "Write a Python function that returns the nth Fibonacci number, iteratively."}
    ]
  }'

glm-5.1 替換為 glm-5glm-5-turbo,即可在品質與成本之間取捨;也可以替換為 claude-opus-4-8-thinking / gpt-5.5,以執行上表中的相同比較——全部使用同一個金鑰。

你首先需要取得該金鑰:從 GPT Proto 控制台建立一組,將它填入 YOUR_GPTPROTO_API_KEY,上面的呼叫即可直接執行。如果你想在決定之前估算成本,所有模型的 token 價格都列於 模型頁面

它的優勢與不足

它的優勢很明確:在現有排行榜上,它是頂尖的開放權重編碼模型;採用真正寬鬆的 MIT 授權;百萬 token 上下文得益於 IndexShare,確實可用且執行成本可負擔;而且其成本效能比在同級中最佳。

它的弱點同樣明確,也值得直接說明,而不是埋在文章中。它在最困難的長期程編碼任務上落後 Claude Opus 4.8——差距不大,但始終存在。Z.ai 沒有公布官方基準測試,因此在更多獨立實驗室重現結果之前,這些數字都應該打上星號。此外,雲端 API 的資料管轄權問題確實存在:如果你的資料依法或依合約不能離開特定界線,託管的 Z.ai API 就是錯誤的選擇——請改為自行託管開放權重,這正是開放權重存在的全部意義。

誰適合使用,誰不適合使用

如果你是希望以不使用前沿模型價格取得接近前沿的編碼能力、需要自行託管或微調,或者正在打造 token 支出占主導地位的成本敏感型代理產品的開發者,就適合使用 GLM 5.2。對於已經擁有 Claude 相容代理框架,並希望在其背後使用更便宜引擎的人來說,它尤其合適。

如果你運行的是關鍵任務、長期程的自主代理,而最後幾分可靠性值得支付額外費用;或者你的工作受資料駐留規範約束,託管 GLM API 無法滿足要求且你又無法自行託管,那麼應該選擇 Claude Opus 4.8。

創意工作室

使用生產級 API 生成圖像、影片及更多內容。

開始創作
創意工作室
相關模型
全部模型
Z-AI
by Z-AI
10% OFF
Claude
20% OFF
OpenAI
20% OFF
Z-AI
by Z-AI
10% OFF

常見問題

用一句話說明 GLM 5.2 是什麼?

Z.ai 採用開放權重(MIT 授權)的旗艦語言模型,於 2026 年 6 月發布,專為編碼、推理與代理式工具使用打造,具備 100 萬 token 的上下文視窗。

GLM 5.2 的主要功能有哪些?

混合專家架構(約 7,440 億總參數/約 400 億啟用參數)、用於低成本長上下文推理的 IndexShare 稀疏注意力、High/Max 雙重推理模式、多 token 預測、1M token 上下文視窗,以及採用 MIT 授權的開放權重。

GLM 5.2 適合編碼嗎?

是——據報告的分數顯示,它是最強的開放權重編碼模型,在 SWE-bench Pro 中擊敗 GPT-5.5(62.1 對 58.6),並且與 Claude Opus 4.8 僅相差幾分。但請注意,這些數據是供應商公布或來自早期第三方評估,因為 Z.ai 沒有正式發布任何數據。

GLM 5.2 vs Claude Opus 4.8——哪個更適合編碼?

Claude Opus 4.8 在最困難的代理式編碼任務上仍然領先(SWE-bench Pro 為 69.2 對 62.1)。GLM 5.2 很接近、採用開放權重且便宜得多。請根據你要最佳可靠性,還是要成本與控制權來選擇。

GLM 5.2 的價格是多少?

據報告的 API 價格為每百萬個輸入 token 1.40 美元、每百萬個輸出 token 4.40 美元,快取輸入約為 0.26 美元——約為同類前沿模型的六分之一。開放權重本身可免費下載與執行。

我可以在 Claude Code 中使用 GLM 5.2 嗎?

可以。它提供 Anthropic 相容端點,因此 Claude Code、Cline、OpenCode 及類似工具都能直接指向該端點。

相關文章

更多部落格
GLM-5.2 與 DeepSeek V4 Pro:基準測試、定價,以及實際該使用哪一個(2026)

GLM-5.2 與 DeepSeek V4 Pro:基準測試、定價,以及實際該使用哪一個(2026)

重點摘要: 如果您的工作負載是長時間跨度的代理式工程——代理程式持續數小時在儲存庫中循環操作並交付功能——GLM-5.2 是更強的模型。如果您的工作負載是演算法、數學、STEM 推理,或任何受成本限制且需要高吞吐量的任務,DeepSeek V4 Pro 勝出,而且在價格上優勢非常明顯。在 Artificial Analysis 的獨立 Intelligence Index v4.1 中,GLM-5.2(最高努力程度)得分 51,DeepSeek V4 Pro 得分 44——但 DeepSeek 官方每 token 費率大約便宜 3 到 5 倍。關鍵在於,也是大多數比較忽略的部分:每 token 價格與每項任務成本並不是同一個數字。以下我會說明原因。 這兩個模型都位於我們平台上的 GLM-5.2 與 deepseek-v4-pro 目錄頁面中,而「我應該將請求路由到哪個模型」已成為我們最常收到的問題之一,尤其是對執行程式設計代理的開發者而言。這篇文章是我試圖好好回答這個問題的成果——在有獨立基準測試資料的地方使用該資料,在沒有的地方清楚標示供應商數據,並採用反映 DeepSeek 2026 年 7 月實際收費的定價計算,而不是 4 月的價格。

Schuyler Stacy | 2026-07-06

MiniMax M3 與 DeepSeek V4 Pro:價格、基準測試,以及實際該使用哪一個

MiniMax M3 與 DeepSeek V4 Pro:價格、基準測試,以及實際該使用哪一個

重點摘要 — 這是目前大家都在比較的兩款中國開放權重模型,而誠實的答案是:它們幾乎不是競爭關係。DeepSeek V4 Pro 是純文字演算法專家:它在所有開放權重模型中拿下最高的 SWE-bench Verified 分數(80.6%),而且原生 token 經濟效益很難超越,尤其是在快取命中的情況下。MiniMax M3 則是原生多模態通才:它不只能讀取文字,也能讀取圖片與影片,並且在 Artificial Analysis 的跨模型智慧指數中排名第二。如果你的工作負載是文字、程式碼和日誌,而且在意每個 token 的成本,請選擇 DeepSeek V4 Pro。 如果你的代理程式需要查看螢幕截圖、設計稿或螢幕錄影,請選擇 M3 — DeepSeek 無論價格多低都做不到這件事。兩者現在都提供開放權重,也都支援 1M token 的上下文視窗,因此這並不是大多數比較頁面所描述的「其中一方必須落敗」之戰。

Tiffany Layne | 2026-07-01

2026 年開發者最佳 AI API:10 個平台比較

2026 年開發者最佳 AI API:10 個平台比較

重點摘要 最佳直接 API: OpenAI 是最安全的通用預設選擇;Anthropic Claude 最適合程式碼開發與長時間執行的代理;Gemini 適合低成本多模態原型開發;DeepSeek 則在文字 Token 價格方面領先。 最佳多模型選項: OpenRouter 是測試多種 LLM 的清晰選擇。當單一產品需要透過一個 API 金鑰和共用餘額使用文字、圖片與影片模型時,GPTProto 更為合適。 最佳基礎架構選擇: Amazon Bedrock 適合受 AWS 管理的企業部署;Replicate、fal.ai 與 Together AI 則更適合開放模型或生成式媒體推理。 沒有適用於所有情境的唯一贏家。請比較工作負載適配度、模型涵蓋範圍、實際計費單位、生產環境控制能力與切換成本。價格與可用性已於 2026 年 7 月 14 日確認;部署前請查看供應商的即時頁面。

Tiffany Layne | 2026-07-15

2026 年 7 個 Claude Code 替代方案(附上真正能執行的設定)

2026 年 7 個 Claude Code 替代方案(附上真正能執行的設定)

在開始之前先坦白說明:大多數排名 Claude Code 替代方案的文章,都是由製作這些替代方案的公司撰寫,並且把自己排在第一名。我們經營的是 API 平台,而不是程式設計代理,因此我們的偏見方向不同 — 不論你選哪個工具,只要透過我們路由 Token,我們就能獲利。我之所以寫這篇文章,是因為「如何讓 Cline 指向你們的端點」已悄悄成為客服收件匣最常見的問題之一,而誠實的答案需要比較一些我們並不銷售的工具。 所以,我會遵守以下原則:依據工具本身的優點排名,說明各項取捨,並把我們的推廣內容留到真正適合的一個章節 — 也就是討論你要如何將內容接入那些開源工具的部分。

Michael Johnson | 2026-07-07