2026 年 8 月 7 日更新: Qwen3.8-Max 現已成為穩定的正式環境 API,並可透過 GPTProto 使用。先前針對預覽版部署的建議已更新。
重點摘要
當最大化託管能力、多模態輸入、前端工作、視覺分析或長期代理執行最重要時,選擇 Qwen3.8-Max。
當較低的 Token 成本、MIT 授權權重、自行託管或可重現的開放部署更重要時,選擇 GLM-5.2。
兩個模型現在都能穩定使用 API。GLM 不再是唯一的正式環境選項。
Qwen 的官方費率為輸入每百萬 Token 2 美元、輸出每百萬 Token 6 美元。GPTProto 目前列出的 GLM-5.2 費率為輸入每百萬 Token 1.26 美元、輸出每百萬 Token 3.96 美元。
Qwen 是能力優先的較強選擇;GLM 則是成本與控制優先的較強選擇。
Qwen 3.8 Max 與 GLM 5.2 一覽
| 類別 |
Qwen3.8-Max |
GLM-5.2 |
| 產品狀態 |
穩定的正式環境模型 |
穩定的版本化模型 |
| 上下文視窗 |
最多 100 萬個 Token |
最多 100 萬個 Token |
| 最大輸出 |
最多 128K Token |
最多 131,072 個 Token |
| 模型規模 |
總計 2.4T,啟用 95B |
總計約 753B,啟用 40B |
| 輸入類型 |
文字、圖片與影片 |
文字 |
| 函式呼叫 |
支援 |
支援 |
| 官方/API 價格 |
輸入每百萬 Token 2 美元,輸出每百萬 Token 6 美元 |
GPT Proto:1.26/3.96 美元 |
| 開放權重 |
已宣布;尚未發布 |
MIT 授權可用 |
| GPT Proto 可用性 |
現在即可使用 |
現在即可使用 |
| 最適合 |
頂級程式設計、視覺、研究、長期代理 |
低成本程式設計、自行託管、版本控管部署 |
程式設計效能:基準測試與混亂程式碼庫
GLM-5.2 目前擁有較清晰的公開基準測試紀錄。Z.ai 表示,使用 Terminus-2 時,其在 SWE-bench Pro 的得分為 62.1,在 Terminal-Bench 2.1 的得分為 81.0。其 官方文件也公布了評估設定的資訊,包括執行器與資源限制。
這些仍是供應商報告的結果。它們有助於了解 GLM-5.2 在程式設計與長期代理任務上的預期優勢,但無法證明它在每個程式碼庫或正式環境工作流程中都能勝過 Qwen3.8-Max。
獨立證據仍不完整。截至 2026 年 8 月 10 日,Artificial Analysis 將 GLM-5.2 Max 在其 Intelligence Index 上評為 53 分。然而,該比較頁面上的 Qwen 模型是 Qwen3 Max Thinking,這是一個較舊的模型,且其分數標記為估算值。這不能證明 GLM-5.2 的效能優於目前的 Qwen3.8-Max。
Qwen 的穩定版發布改變了部署決策,但並未自動解決基準測試問題。Alibaba 將 Qwen3.8-Max 定位為複雜程式設計、多模態工作、專業任務與長期代理的重要升級。其官方發布公告包含架構細節與延伸代理行為的範例,但沒有在 SWE-bench Pro 或 Terminal-Bench 2.1 上提供可直接比較的 GLM-5.2 對戰結果。
因此,最公平的結論不是某個模型已經獲勝。GLM-5.2 擁有較成熟的公開程式設計證據,而 Qwen3.8-Max 擁有更廣泛的能力定位,現在也已穩定到足以進行正式環境評估。
證據說明:以下配對測試使用的是穩定版 8 月發布前的 Qwen3.8-Max Preview。它仍可用於觀察不同的工程行為,但不應視為目前正式環境模型的決定性基準測試。
7 月 22 日的 36Kr 混亂半成品網頁專案測試提供了更具體的行為比較。該專案包含 Next.js 前端、Payload CMS、動畫程式碼、舊版文件、既有功能,以及相互交織的前後端錯誤。
在初始專案閱讀任務中,Qwen3.8-Max Preview 名列第一。在該特定設定中,它辨識出專案目前的狀態、啟動缺少的 CMS 服務,並在不到 10 秒內完成初步分析。
GLM-5.2 在範圍較窄的輪播實作任務上表現較佳。它保留了自動播放、拖曳控制與連續循環,但轉場仍出現視覺跳動。Qwen 的速度較快,卻移除了拖曳行為,並實作了一個延伸模擬的循環,最終會跳回開頭。
這項取捨比一句話判定勝負更有參考價值。在該測試中,Qwen 更擅長辨識目前意圖並快速推進,而當功能保留與實作完整性更重要時,GLM 更為謹慎。
然而,一個未完成的網頁專案無法確立普遍的速度或程式碼品質排名,尤其是因為測試使用 Qwen3.8-Max 的預覽版,且未完整揭露服務路由、Token 預算、延遲條件或確切的模型修訂版本。
如何公平解讀證據
公開的舊版程式碼測試很有用,但並非受控基準測試。使用相同的未完成專案與基於 OpenCode 的工作流程,比較不相關的截圖更具參考價值;然而,缺少的設定細節使得精確重現無法進行。
該測試可以揭示典型的失敗模式:
這些結果描述的是特定環境中受測版本的表現。它們無法證明 Qwen 總是更快、GLM 總是撰寫更安全的程式碼,或穩定版 Qwen3.8-Max 會重現預覽版模型的行為。
可用證據應分為四個層級解讀:
目前的獨立正面測試:穩定版 Qwen3.8-Max 與 GLM-5.2 之間的測試仍然缺失。
已發布的程式設計基準測試:GLM-5.2 較強,但最受矚目的結果主要由供應商報告。
相同專案的公開測試:有助於辨識行為差異,但現有的 36Kr 測試使用的是 Qwen3.8-Max Preview。
供應商發布聲明:有助於理解預期能力,但若沒有外部驗證,不足以宣告勝者。
證據缺口仍是採購決策的一部分,但這已不代表 Qwen 應被排除在正式環境之外。
如果無法進行私有比較,對於重視已發布程式設計結果、較低 API 成本、開放權重與可重現部署的團隊而言,GLM-5.2 仍是證據風險較低的選擇。當多模態輸入、更廣泛的任務涵蓋、前端工作或長期代理能力更重要時,Qwen3.8-Max 現在已是有效的正式環境選擇。
實務上的建議是在相同程式碼庫上測試兩個模型。比較通過的測試、功能回歸、無效工具呼叫、重試、延遲、Token 總成本與人工修正時間。選擇每個已接受任務成本較低的模型,而不是孤立基準測試或發布聲明最強的模型。
Qwen 3.8 Max 與 GLM 5.2 的價格與成本
現在這是一般的 Token 價格比較。
| 模型 |
輸入價格 |
輸出價格 |
| Qwen3.8-Max 官方費率 |
每百萬 Token 2 美元 |
每百萬 Token 6 美元 |
| GPT Proto 上的 GLM-5.2 |
每百萬 Token 1.26 美元 |
每百萬 Token 3.96 美元 |
| GLM-5.2 直接列出的費率 |
每百萬 Token 1.40 美元 |
每百萬 Token 4.40 美元 |
對於使用 1,000 萬個輸入 Token 與 200 萬個輸出 Token 的工作負載:
以列出的費率計算,GLM 的成本較低。Qwen 必須提供更高的完成率、更少的重試、更佳的多模態理解,或減少人工修正,才能合理化這項差價。
在困難的視覺或長期任務上,這是合理的可能性,但仍應透過測量而非假設來確認。
哪個更適合程式設計任務?
| 程式設計需求 |
較佳選擇 |
原因 |
| 最高能力的託管程式設計 |
Qwen 3.8 Max |
較新的旗艦模型,在長期任務與多模態定位上更強 |
| 視覺前端重建 |
Qwen 3.8 Max |
原生圖片與影片理解 |
| 對預算敏感的程式碼庫工作 |
GLM-5.2 |
較低的輸入與輸出 Token 費率 |
| 自行託管的程式設計代理 |
GLM-5.2 |
MIT 授權權重現已可用 |
| 可重現的開放部署 |
GLM-5.2 |
公開檢查點、架構與穩定版本 |
| 複雜研究或專業工作流程 |
Qwen 3.8 Max |
專為涵蓋程式設計、文件、研究與視覺輸入的多階段工作而設計 |
| 現有的 GLM 正式環境流程 |
測試完成前繼續使用 GLM |
更強的模型聲稱不能取代遷移評估 |
Qwen3.8-Max 現在勝出能力優先的決策。在成本、自行託管與開放部署是主要要求時,GLM-5.2 仍然勝出。
如何透過 GPT Proto 使用 GLM-5.2
GPT Proto 透過相容於 OpenAI 的端點提供 GLM-5.2。建立 API 金鑰、將其加入環境,然後呼叫現行的 glm-5.2 模型字串。同樣的方式也可用於 GPT Proto 模型集合中的其他模型。
首先設定金鑰並提出 cURL 請求:
export GPTPROTO_API_KEY="your_gptproto_api_key"
curl https://gptproto.com/v1/chat/completions \
-H "Authorization: Bearer $GPTPROTO_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2",
"messages": [
{
"role": "system",
"content": "Inspect before editing. Preserve API contracts and report the tests required for every proposed change."
},
{
"role": "user",
"content": "Plan a safe fix for duplicate refresh-token requests after concurrent 401 responses. State assumptions and verification steps before proposing code."
}
]
}'
相應的 Python 呼叫使用 OpenAI SDK:
python -m pip install openai
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["GPTPROTO_API_KEY"],
base_url="https://gptproto.com/v1",
)
response = client.chat.completions.create(
model="glm-5.2",
messages=[
{
"role": "system",
"content": (
"You are a repository-level coding assistant. Inspect before "
"proposing changes. Preserve existing API contracts, do not add "
"dependencies without approval, and list the verification "
"commands required for every proposed edit."
),
},
{
"role": "user",
"content": (
"An API client occasionally sends two refresh-token requests "
"after several concurrent requests fail with 401. Identify the "
"likely race condition, list the files you would inspect, and "
"return a minimal repair plan before writing code."
),
},
],
)
print(response.choices[0].message.content)
這段程式碼刻意要求模型在編輯前先提出檢查計畫。即使回答看起來很完善,若程式設計模型立即捏造檔案或變更 API 合約,也代表它未完成任務。
Qwen3.8-Max 現已可在 GPT Proto 上使用,因此開發人員可以透過同一個 API 帳戶,對兩個模型執行相同的程式設計提示。
使用 qwen3.8-max 呼叫 Qwen,使用 glm-5.2 呼叫 GLM,並保持提示、程式碼庫狀態、工具權限、推理設定與成功標準完全一致。測量通過的測試、重試、無效工具呼叫、延遲、Token 總數、人工修正次數,以及每個已接受任務的成本。
從 Qwen3.8-Max API 開始,或先與現有的 GLM-5.2 端點比較,再將正式環境流量導向其中一個模型。
最終結論
原先「GLM 用於正式環境,Qwen 僅供實驗」的結論已經過時。
Qwen3.8-Max 現在是穩定的正式環境模型,具備有文件記錄的 API、100 萬 Token 上下文、多模態輸入、標準 Token 定價,以及 GPT Proto 可用性。當能力,尤其是視覺程式設計與長期執行,是主要瓶頸時,它是更好的起點。
GLM-5.2 仍然更便宜且更容易控制。其 MIT 授權權重使它成為目前自行託管、私有部署,以及需要可重現開放檢查點之團隊的明確選項。
需要能力就選 Qwen;需要成本與所有權就選 GLM。