用三天時間就對新模型做出有信心的正式環境決策,是不明智的。在 2026 年 7 月 22 日,Qwen 3.8 Max 與 GLM 5.2 的比較正處於這種情況:一方是快速變動的預覽版本,另一方則擁有版本化 API、已發布的權重、100 萬 token 上下文視窗,以及獨立評測資料。
簡短答案是:目前若要建立正式環境的程式設計代理,請選擇 GLM-5.2。它具備更明確的部署契約、可預測的逐 token 計費、可下載且採 MIT 授權的權重,以及穩定的模型 ID。如果你重視 Qwen 早期的前端成果,且願意在 Alibaba 更新預覽版本時重新執行評測,便可測試 Qwen3.8-Max-Preview。
我目前不會將正式環境工作負載遷移至 Qwen3.8 Max。這並不是判斷 GLM-5.2 將永遠是更好的模型,而是根據目前可取得的證據所做出的判斷。
| 決策 |
目前較佳選擇 |
原因 |
| 正式環境程式設計 API |
GLM-5.2 |
版本化 API、公開價格、穩定規格 |
| 長時間執行的儲存庫任務 |
GLM-5.2 |
具備文件說明的 100 萬 token 上下文,以及長期視野訓練 |
| 自行託管 |
GLM-5.2 |
目前已有採 MIT 授權的權重 |
| 早期前端實驗 |
Qwen3.8-Max-Preview |
初步報告表現強勁,但行為仍在變動 |
| 可重現的基準測試 |
GLM-5.2 |
已有獨立的 GLM 資料;但沒有等效的 Qwen3.8 資料 |
首先,「Max」在兩者中的含義不同
Alibaba 官方模型名稱為 Qwen3.8-Max-Preview。此處的 Max 表示模型級別。Preview 後綴同樣重要:Alibaba 於 7 月 19 日宣布了此模型,表示開放權重將「很快」推出,並透過 Token Plan、Qoder 與 QoderWork 提供預覽版本。
GLM-5.2 對 Max 的使用方式不同。GLM-5.2 是模型本身;High 與 Max 則是可選擇的推理力度設定。Max 可以在困難任務上投入更多運算資源,但它並不是一個名為「GLM-5.2 Max」的獨立檢查點。
這項區別可以釐清兩個常見的搜尋結果錯誤。Qwen3.8 Max 並不是 Qwen3 Max、Qwen3.7 Max 或 Qwen3-8B。同樣地,Artificial Analysis 上針對 Qwen3 Max 的結果,也不會因為名稱相似,就成為 Qwen3.8 的基準測試結果。
Alibaba 也 確認預覽版本每天都在變動,並報告後續更新在網頁前端工作方面有所提升。因此,每一項 Qwen3.8 結果都與日期相關。若要查看發布歷史,以及 Alibaba 尚未公開的規格,請參閱我們另外撰寫的 Qwen 3.8 Max 指南。
<!-- INTERNAL LINK TODO: Link the first occurrence of “Qwen3.8-Max-Preview” to its GPT Proto model page after the model is live. -->
Qwen 3.8 Max 與 GLM 5.2 一覽
最有用的比較,應先從開發者實際能部署的內容開始。參數規模等資訊可以稍後再談。
| 類別 |
Qwen3.8-Max-Preview |
GLM-5.2 |
| 產品狀態 |
Alibaba 表示仍在持續演進的預覽版本 |
已發布的版本化模型 |
| 目前存取方式 |
Token Plan、Qoder 與 QoderWork |
API、程式設計方案與可下載權重 |
| 公開上下文限制 |
預覽版本尚無文件說明 |
1,000,000 個 token |
| 公開最大輸出量 |
預覽版本尚無文件說明 |
已發布設定中最高可達 131,072 個 token |
| 模型規模 |
Alibaba 宣稱總參數量為 2.4T;啟用參數量未公開 |
總參數量約 753B,每個 token 啟用 40B |
| 權重 |
已承諾發布,截至 7 月 22 日尚未推出 |
採 MIT 授權發布 |
| 定價模式 |
搭配 Credits 的月度訂閱 |
逐 token API 計費或自行託管 |
| 獨立評測 |
尚無完整的 Qwen3.8 評測 |
Artificial Analysis Intelligence Index:51 |
| GPT Proto 可用性 |
目前尚未上線 |
目前可用 |
Qwen 欄位的缺漏並非疏忽。預覽版本不會因為 Qwen3.7 具有這些數字,就自動繼承其上下文視窗、啟用參數量或授權,僅僅為了讓表格看起來完整。
2.4T 這個數字確實出現在 Alibaba 的公告中,但它在實際運作上的意義目前尚不明確。若不知道啟用專家數量與服務細節,總參數量無法告訴我們延遲、記憶體需求或每項完成的程式設計任務成本。
GLM-5.2 公開了更多資訊。Z.ai 的 發布報告說明了 100 萬 token 上下文、MIT 授權、High 與 Max 努力程度,以及 IndexShare 設計;在完整上下文長度下,該設計可將索引器運算量降低 2.9×。報告也指出,推測解碼的接受長度提升了 20%。這些是供應商測量的結果,但其架構與評測設定已公開到足以進行檢視。
程式設計效能:基準測試與混亂的儲存庫
在程式設計基準測試方面,GLM-5.2 有一些可以附帶條件討論的數據。Z.ai 報告其使用 Terminus-2 在 SWE-bench Pro 上取得 62.1 分,在 Terminal-Bench 2.1 上取得 81.0 分。其報告的最佳 Terminal-Bench 設定達到 82.7 分。官方模型卡也披露了這些測試所使用的執行器、token 限制、逾時設定與資源限制。
這些仍然是供應商報告的結果。我會利用它們來辨識模型優勢,而不是宣稱某個模型在所有情況下都勝出。
獨立評測的結果範圍較窄,但仍然有用。Artificial Analysis 在 Intelligence Index v4.1 中給予 GLM-5.2 Max 51 分。該比較頁面上的 Qwen 模型是 Qwen3 Max Thinking,屬於較舊的模型,而且其分數被標記為估算值。這並不能證明 GLM-5.2 以 51 比 32 的分數擊敗 Qwen3.8 Max。
Qwen 的發布宣稱更加廣泛:Alibaba 將 Qwen3.8 描述為可與領先的前沿模型相媲美,僅落後於 Fable 5。該排名沒有附上公開的基準測試表或方法論。事實是:這項宣稱來自模型製造商。我的判斷是:現在還太早,不能用它做採購決策。
7 月 22 日的一項 針對混亂且尚未完成的網頁專案所做的 36Kr 測試,提供了更具體的比較。該專案包含 Next.js 前端、Payload CMS、動畫程式碼、舊版文件、現有功能,以及交織的前後端錯誤。Qwen3.8-Max-Preview 在辨識專案目前狀態、啟動缺少的 CMS 服務,以及進行大範圍視覺更新方面排名第一。在初始專案閱讀任務中,於該特定設定下,它在不到 10 秒內完成。
GLM-5.2 在較狹窄的輪播實作任務中勝出。它保留了自動播放、拖曳控制與真正的連續循環,儘管轉場仍出現視覺跳動。Qwen 的速度較快,但刪除了拖曳行為,並以拉伸變形的循環模仿來取代;該模仿最終會跳回起點。
這項取捨比一句話的勝負判定更有參考價值。Qwen 在理解當前意圖並快速推進方面表現更好;GLM 則在功能保留與工程完整性更重要時表現較佳。單一專案無法建立普遍的速度排名,尤其是在服務路徑與模型版本不同的情況下。但它可以呈現值得測試的失敗模式。
如何公平解讀證據
這項公開的舊版程式碼測試很有用,但不是受控的基準測試。它使用同一個未完成專案與基於 OpenCode 的工作流程,因此比無關的截圖更能提供有意義的比較。測試沒有公開足夠的服務路徑、token 預算或模型修訂版本細節,因此無法讓每項結果都可重現。
這會改變測試能夠證明的內容。它可以展現特徵性的失敗模式:Qwen 移動快速,也能良好理解專案當前意圖,但同時移除了要求的互動功能,並以不完整的循環實作取代。GLM 在該任務中保留了更多必要行為,但初始分析較慢,而且曾將過時文件視為當前工作。
它無法證明 Qwen 始終更快、GLM 始終能寫出更安全的程式碼,也無法證明 Qwen 下一次預覽版本更新後,任一模型仍會有相同的行為。
我會將現有證據分為三個層級。獨立評測最具參考價值,但目前涵蓋的是 GLM-5.2,而不是 Qwen3.8 Max。其次是同一專案的公開測試,因為即使設定無法完全重現,它仍能揭露真實的工程錯誤。供應商排名與發布宣稱則排在最後,直到外部評測者加以驗證為止。
證據缺口本身也是採購決策的一部分。如果你無法執行私人比較,GLM-5.2 是風險較低的正式環境選擇,因為它的版本、價格、權重、上下文限制與獨立評分都已有文件說明。Qwen3.8 Max 仍是較高不確定性的預覽版本:值得關注,但目前的文件完整度還不足以僅憑早期報告,就取代正式環境的預設模型。
Qwen 3.8 Max 與 GLM 5.2 的價格與成本
這不是一般的逐 token 價格比較。
Qwen3.8-Max-Preview 目前包含在 Alibaba 的 Token Plan 中。目前個人方案的發布價格為 Lite 每月 $6、Standard 每月 $18,以及 Pro 每月 $68,分別約含每月 10,000、40,000 與 160,000 Credits。Credits 並不是 token。其消耗量可能會隨模型、推理、快取與工具呼叫而變化,因此沒有可靠的公開換算方式,可以將 Qwen3.8 的價格換算為每百萬 token 的費用。
GLM-5.2 採用傳統的 token 計費方式。在 GPT Proto GLM-5.2 API 頁面上,目前費率為每 100 萬個輸入 token $1.26,以及每 100 萬個輸出 token $3.96。Z.ai 的直接列價為輸入 $1.40、輸出 $4.40。由於模型價格可能變動,在發布或進行大額採購前,應再次確認兩組數據。
假設每月工作負載為 1,000 萬個輸入 token 與 200 萬個輸出 token,GPT Proto 的計算方式為:
10 × $1.26 + 2 × $3.96 = $20.52
這個數字很有用,因為單位十分明確。Qwen Lite 方案的 $6 入門價格較低,但這並不能證明相同工作負載下 Qwen 更便宜。你需要從多次執行中取得實際的 Credit 使用量。
我的成本結論是有條件的:GLM-5.2 更容易進行預算規劃與用量計量。對於工作量符合訂閱配額的個人開發者而言,Qwen3.8 可能更便宜,但公開資料不足以支持等量 token 的比較。
哪個模型更適合程式設計任務?
如果你現在就需要發布產品,請選擇 GLM-5.2。對於儲存庫代理、長時間執行的任務、需要固定版本的受監管環境,以及需要按請求計算成本的團隊,它是更好的預設選擇。它也是目前兩者中唯一適合自行託管的選擇:權重與 MIT 授權都已存在。
若要進行評測,請選擇 Qwen3.8-Max-Preview,而不要將它作為唯一的正式環境依賴。它的早期結果值得測試,尤其適合前端工作、當前狀態分析,以及快速迭代比精確可重現性更重要的任務。代價是版本漂移:Alibaba 表示預覽版本仍在變動,而開放權重版本目前尚無確認的發布日期或授權。
因此,對「Qwen 3.8 Max 與 GLM 5.2——哪個更好?」這個問題,實際答案是不對稱的。GLM-5.2 在目前的正式環境決策中勝出。Qwen3.8 Max 可能在個別任務中勝出,但尚未提供足夠穩定的證據,來贏得平台層級的決策。
如何透過 GPT Proto 執行 GLM-5.2
GPT Proto 透過相容於 OpenAI 的端點提供 GLM-5.2。建立 API 金鑰、將其加入環境,然後呼叫目前可用的 glm-5.2 模型字串。同一個餘額也可以用於 GPT Proto 模型集合中的其他模型。
首先,設定金鑰並提出 cURL 請求:
export GPTPROTO_API_KEY="your_gptproto_api_key"
curl https://gptproto.com/v1/chat/completions \
-H "Authorization: Bearer $GPTPROTO_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2",
"messages": [
{
"role": "system",
"content": "Inspect before editing. Preserve API contracts and report the tests required for every proposed change."
},
{
"role": "user",
"content": "Plan a safe fix for duplicate refresh-token requests after concurrent 401 responses. State assumptions and verification steps before proposing code."
}
]
}'
對應的 Python 呼叫使用 OpenAI SDK:
python -m pip install openai
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["GPTPROTO_API_KEY"],
base_url="https://gptproto.com/v1",
)
response = client.chat.completions.create(
model="glm-5.2",
messages=[
{
"role": "system",
"content": (
"You are a repository-level coding assistant. Inspect before "
"proposing changes. Preserve existing API contracts, do not add "
"dependencies without approval, and list the verification "
"commands required for every proposed edit."
),
},
{
"role": "user",
"content": (
"An API client occasionally sends two refresh-token requests "
"after several concurrent requests fail with 401. Identify the "
"likely race condition, list the files you would inspect, and "
"return a minimal repair plan before writing code."
),
},
],
)
print(response.choices[0].message.content)
這段程式碼刻意要求模型在修改前先提出檢查計畫。如果程式設計模型立即捏造檔案或變更 API 契約,即使回答看起來很完善,也代表它未完成任務。
Qwen3.8 Max 目前尚未在 GPT Proto 上提供,因此這裡沒有 Qwen 程式碼區塊。若使用猜測的端點加入程式碼,會讓人誤以為平台已有不存在的模型。模型上線後,請以相同提示詞替換此說明,並加入模型頁面連結。在此之前,開發者可以從 GLM-5.2 API開始,或從 GPT Proto 首頁瀏覽其他模型。