Michael Johnson2026-07-22

Qwen 3.8 Max 與 GLM 5.2:2026 年哪個更適合程式設計?

比較 Qwen 3.8 Max 與 GLM 5.2 的程式設計能力、API 存取、上下文、價格與開放權重,了解 2026 年哪個模型更適合正式環境。

Qwen 3.8 Max 與 GLM 5.2:2026 年哪個更適合程式設計?

TL;DR

  • 目前若要建立正式環境的程式設計代理,請選擇 GLM-5.2。它具備穩定的 API、具備文件說明的 100 萬 token 上下文視窗、可預測的逐 token 定價、獨立評測資料,以及採 MIT 授權的權重。

  • 若要進行前端工作與快速實驗,請測試 Qwen3.8-Max-Preview。早期結果相當有潛力,但 Alibaba 表示預覽版本仍在變動,最終規格、權重與標準逐 token 價格目前尚未公開。

  • 在程式設計品質方面,沒有任何一個模型能在所有任務中勝出。一項公開的舊版程式碼測試偏向 Qwen,認為它更能理解目前的專案狀態並快速修改;而在一項受限的前端任務中,GLM 更可靠地保留了需求。

  • 成本比較並非一對一:Qwen 的 Credits 方案每月 $6 起;GPTProto 對 GLM-5.2 的定價為每 100 萬個輸入 token $1.26,以及每 100 萬個輸出 token $3.96。

  • 此處的「Max」代表不同含義。它是 Qwen 模型名稱的一部分,但對 GLM-5.2 而言,則是可選擇的推理力度等級。

目錄

用三天時間就對新模型做出有信心的正式環境決策,是不明智的。在 2026 年 7 月 22 日,Qwen 3.8 Max 與 GLM 5.2 的比較正處於這種情況:一方是快速變動的預覽版本,另一方則擁有版本化 API、已發布的權重、100 萬 token 上下文視窗,以及獨立評測資料。

簡短答案是:目前若要建立正式環境的程式設計代理,請選擇 GLM-5.2。它具備更明確的部署契約、可預測的逐 token 計費、可下載且採 MIT 授權的權重,以及穩定的模型 ID。如果你重視 Qwen 早期的前端成果,且願意在 Alibaba 更新預覽版本時重新執行評測,便可測試 Qwen3.8-Max-Preview。

我目前不會將正式環境工作負載遷移至 Qwen3.8 Max。這並不是判斷 GLM-5.2 將永遠是更好的模型,而是根據目前可取得的證據所做出的判斷。

決策 目前較佳選擇 原因
正式環境程式設計 API GLM-5.2 版本化 API、公開價格、穩定規格
長時間執行的儲存庫任務 GLM-5.2 具備文件說明的 100 萬 token 上下文,以及長期視野訓練
自行託管 GLM-5.2 目前已有採 MIT 授權的權重
早期前端實驗 Qwen3.8-Max-Preview 初步報告表現強勁,但行為仍在變動
可重現的基準測試 GLM-5.2 已有獨立的 GLM 資料;但沒有等效的 Qwen3.8 資料

首先,「Max」在兩者中的含義不同

Alibaba 官方模型名稱為 Qwen3.8-Max-Preview。此處的 Max 表示模型級別。Preview 後綴同樣重要:Alibaba 於 7 月 19 日宣布了此模型,表示開放權重將「很快」推出,並透過 Token Plan、Qoder 與 QoderWork 提供預覽版本。

GLM-5.2 對 Max 的使用方式不同。GLM-5.2 是模型本身;High 與 Max 則是可選擇的推理力度設定。Max 可以在困難任務上投入更多運算資源,但它並不是一個名為「GLM-5.2 Max」的獨立檢查點。

這項區別可以釐清兩個常見的搜尋結果錯誤。Qwen3.8 Max 並不是 Qwen3 Max、Qwen3.7 Max 或 Qwen3-8B。同樣地,Artificial Analysis 上針對 Qwen3 Max 的結果,也不會因為名稱相似,就成為 Qwen3.8 的基準測試結果。

Alibaba 也 確認預覽版本每天都在變動,並報告後續更新在網頁前端工作方面有所提升。因此,每一項 Qwen3.8 結果都與日期相關。若要查看發布歷史,以及 Alibaba 尚未公開的規格,請參閱我們另外撰寫的 Qwen 3.8 Max 指南

<!-- INTERNAL LINK TODO: Link the first occurrence of “Qwen3.8-Max-Preview” to its GPT Proto model page after the model is live. -->

Qwen 3.8 Max 與 GLM 5.2 一覽

最有用的比較,應先從開發者實際能部署的內容開始。參數規模等資訊可以稍後再談。

類別 Qwen3.8-Max-Preview GLM-5.2
產品狀態 Alibaba 表示仍在持續演進的預覽版本 已發布的版本化模型
目前存取方式 Token Plan、Qoder 與 QoderWork API、程式設計方案與可下載權重
公開上下文限制 預覽版本尚無文件說明 1,000,000 個 token
公開最大輸出量 預覽版本尚無文件說明 已發布設定中最高可達 131,072 個 token
模型規模 Alibaba 宣稱總參數量為 2.4T;啟用參數量未公開 總參數量約 753B,每個 token 啟用 40B
權重 已承諾發布,截至 7 月 22 日尚未推出 採 MIT 授權發布
定價模式 搭配 Credits 的月度訂閱 逐 token API 計費或自行託管
獨立評測 尚無完整的 Qwen3.8 評測 Artificial Analysis Intelligence Index:51
GPT Proto 可用性 目前尚未上線 目前可用

Qwen 欄位的缺漏並非疏忽。預覽版本不會因為 Qwen3.7 具有這些數字,就自動繼承其上下文視窗、啟用參數量或授權,僅僅為了讓表格看起來完整。

2.4T 這個數字確實出現在 Alibaba 的公告中,但它在實際運作上的意義目前尚不明確。若不知道啟用專家數量與服務細節,總參數量無法告訴我們延遲、記憶體需求或每項完成的程式設計任務成本。

GLM-5.2 公開了更多資訊。Z.ai 的 發布報告說明了 100 萬 token 上下文、MIT 授權、High 與 Max 努力程度,以及 IndexShare 設計;在完整上下文長度下,該設計可將索引器運算量降低 2.9×。報告也指出,推測解碼的接受長度提升了 20%。這些是供應商測量的結果,但其架構與評測設定已公開到足以進行檢視。

程式設計效能:基準測試與混亂的儲存庫

在程式設計基準測試方面,GLM-5.2 有一些可以附帶條件討論的數據。Z.ai 報告其使用 Terminus-2 在 SWE-bench Pro 上取得 62.1 分,在 Terminal-Bench 2.1 上取得 81.0 分。其報告的最佳 Terminal-Bench 設定達到 82.7 分。官方模型卡也披露了這些測試所使用的執行器、token 限制、逾時設定與資源限制。

這些仍然是供應商報告的結果。我會利用它們來辨識模型優勢,而不是宣稱某個模型在所有情況下都勝出。

獨立評測的結果範圍較窄,但仍然有用。Artificial Analysis 在 Intelligence Index v4.1 中給予 GLM-5.2 Max 51 分。該比較頁面上的 Qwen 模型是 Qwen3 Max Thinking,屬於較舊的模型,而且其分數被標記為估算值。這並不能證明 GLM-5.2 以 51 比 32 的分數擊敗 Qwen3.8 Max。

Qwen 的發布宣稱更加廣泛:Alibaba 將 Qwen3.8 描述為可與領先的前沿模型相媲美,僅落後於 Fable 5。該排名沒有附上公開的基準測試表或方法論。事實是:這項宣稱來自模型製造商。我的判斷是:現在還太早,不能用它做採購決策。

7 月 22 日的一項 針對混亂且尚未完成的網頁專案所做的 36Kr 測試,提供了更具體的比較。該專案包含 Next.js 前端、Payload CMS、動畫程式碼、舊版文件、現有功能,以及交織的前後端錯誤。Qwen3.8-Max-Preview 在辨識專案目前狀態、啟動缺少的 CMS 服務,以及進行大範圍視覺更新方面排名第一。在初始專案閱讀任務中,於該特定設定下,它在不到 10 秒內完成。

GLM-5.2 在較狹窄的輪播實作任務中勝出。它保留了自動播放、拖曳控制與真正的連續循環,儘管轉場仍出現視覺跳動。Qwen 的速度較快,但刪除了拖曳行為,並以拉伸變形的循環模仿來取代;該模仿最終會跳回起點。

這項取捨比一句話的勝負判定更有參考價值。Qwen 在理解當前意圖並快速推進方面表現更好;GLM 則在功能保留與工程完整性更重要時表現較佳。單一專案無法建立普遍的速度排名,尤其是在服務路徑與模型版本不同的情況下。但它可以呈現值得測試的失敗模式。

如何公平解讀證據

這項公開的舊版程式碼測試很有用,但不是受控的基準測試。它使用同一個未完成專案與基於 OpenCode 的工作流程,因此比無關的截圖更能提供有意義的比較。測試沒有公開足夠的服務路徑、token 預算或模型修訂版本細節,因此無法讓每項結果都可重現。

這會改變測試能夠證明的內容。它可以展現特徵性的失敗模式:Qwen 移動快速,也能良好理解專案當前意圖,但同時移除了要求的互動功能,並以不完整的循環實作取代。GLM 在該任務中保留了更多必要行為,但初始分析較慢,而且曾將過時文件視為當前工作。

它無法證明 Qwen 始終更快、GLM 始終能寫出更安全的程式碼,也無法證明 Qwen 下一次預覽版本更新後,任一模型仍會有相同的行為。

我會將現有證據分為三個層級。獨立評測最具參考價值,但目前涵蓋的是 GLM-5.2,而不是 Qwen3.8 Max。其次是同一專案的公開測試,因為即使設定無法完全重現,它仍能揭露真實的工程錯誤。供應商排名與發布宣稱則排在最後,直到外部評測者加以驗證為止。

證據缺口本身也是採購決策的一部分。如果你無法執行私人比較,GLM-5.2 是風險較低的正式環境選擇,因為它的版本、價格、權重、上下文限制與獨立評分都已有文件說明。Qwen3.8 Max 仍是較高不確定性的預覽版本:值得關注,但目前的文件完整度還不足以僅憑早期報告,就取代正式環境的預設模型。

Qwen 3.8 Max 與 GLM 5.2 的價格與成本

這不是一般的逐 token 價格比較。

Qwen3.8-Max-Preview 目前包含在 Alibaba 的 Token Plan 中。目前個人方案的發布價格為 Lite 每月 $6、Standard 每月 $18,以及 Pro 每月 $68,分別約含每月 10,000、40,000 與 160,000 Credits。Credits 並不是 token。其消耗量可能會隨模型、推理、快取與工具呼叫而變化,因此沒有可靠的公開換算方式,可以將 Qwen3.8 的價格換算為每百萬 token 的費用。

GLM-5.2 採用傳統的 token 計費方式。在 GPT Proto GLM-5.2 API 頁面上,目前費率為每 100 萬個輸入 token $1.26,以及每 100 萬個輸出 token $3.96。Z.ai 的直接列價為輸入 $1.40、輸出 $4.40。由於模型價格可能變動,在發布或進行大額採購前,應再次確認兩組數據。

假設每月工作負載為 1,000 萬個輸入 token 與 200 萬個輸出 token,GPT Proto 的計算方式為:

10 × $1.26 + 2 × $3.96 = $20.52

這個數字很有用,因為單位十分明確。Qwen Lite 方案的 $6 入門價格較低,但這並不能證明相同工作負載下 Qwen 更便宜。你需要從多次執行中取得實際的 Credit 使用量。

我的成本結論是有條件的:GLM-5.2 更容易進行預算規劃與用量計量。對於工作量符合訂閱配額的個人開發者而言,Qwen3.8 可能更便宜,但公開資料不足以支持等量 token 的比較。

哪個模型更適合程式設計任務?

如果你現在就需要發布產品,請選擇 GLM-5.2。對於儲存庫代理、長時間執行的任務、需要固定版本的受監管環境,以及需要按請求計算成本的團隊,它是更好的預設選擇。它也是目前兩者中唯一適合自行託管的選擇:權重與 MIT 授權都已存在。

若要進行評測,請選擇 Qwen3.8-Max-Preview,而不要將它作為唯一的正式環境依賴。它的早期結果值得測試,尤其適合前端工作、當前狀態分析,以及快速迭代比精確可重現性更重要的任務。代價是版本漂移:Alibaba 表示預覽版本仍在變動,而開放權重版本目前尚無確認的發布日期或授權。

因此,對「Qwen 3.8 Max 與 GLM 5.2——哪個更好?」這個問題,實際答案是不對稱的。GLM-5.2 在目前的正式環境決策中勝出。Qwen3.8 Max 可能在個別任務中勝出,但尚未提供足夠穩定的證據,來贏得平台層級的決策。

如何透過 GPT Proto 執行 GLM-5.2

GPT Proto 透過相容於 OpenAI 的端點提供 GLM-5.2。建立 API 金鑰、將其加入環境,然後呼叫目前可用的 glm-5.2 模型字串。同一個餘額也可以用於 GPT Proto 模型集合中的其他模型。

首先,設定金鑰並提出 cURL 請求:

export GPTPROTO_API_KEY="your_gptproto_api_key"

curl https://gptproto.com/v1/chat/completions \
  -H "Authorization: Bearer $GPTPROTO_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.2",
    "messages": [
      {
        "role": "system",
        "content": "Inspect before editing. Preserve API contracts and report the tests required for every proposed change."
      },
      {
        "role": "user",
        "content": "Plan a safe fix for duplicate refresh-token requests after concurrent 401 responses. State assumptions and verification steps before proposing code."
      }
    ]
  }'

對應的 Python 呼叫使用 OpenAI SDK:

python -m pip install openai
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["GPTPROTO_API_KEY"],
    base_url="https://gptproto.com/v1",
)

response = client.chat.completions.create(
    model="glm-5.2",
    messages=[
        {
            "role": "system",
            "content": (
                "You are a repository-level coding assistant. Inspect before "
                "proposing changes. Preserve existing API contracts, do not add "
                "dependencies without approval, and list the verification "
                "commands required for every proposed edit."
            ),
        },
        {
            "role": "user",
            "content": (
                "An API client occasionally sends two refresh-token requests "
                "after several concurrent requests fail with 401. Identify the "
                "likely race condition, list the files you would inspect, and "
                "return a minimal repair plan before writing code."
            ),
        },
    ],
)

print(response.choices[0].message.content)

這段程式碼刻意要求模型在修改前先提出檢查計畫。如果程式設計模型立即捏造檔案或變更 API 契約,即使回答看起來很完善,也代表它未完成任務。

Qwen3.8 Max 目前尚未在 GPT Proto 上提供,因此這裡沒有 Qwen 程式碼區塊。若使用猜測的端點加入程式碼,會讓人誤以為平台已有不存在的模型。模型上線後,請以相同提示詞替換此說明,並加入模型頁面連結。在此之前,開發者可以從 GLM-5.2 API開始,或從 GPT Proto 首頁瀏覽其他模型。

創意工作室

使用生產級 API 生成圖像、影片及更多內容。

開始創作
創意工作室
相關模型
全部模型
Z-AI
by Z-AI
10% OFF
Claude
20% OFF
Google
40% OFF
Google
40% OFF

常見問題

Qwen 3.8 Max 比 GLM 5.2 好嗎?

不能做出這樣的普遍結論。在一項公開的舊版程式碼測試中,Qwen3.8-Max-Preview 在多項任務中勝出;但 GLM-5.2 擁有更強的正式環境條件:穩定的存取方式、公開規格、獨立評測、逐 token 價格與可下載權重。請針對你的工作負載測試 Qwen;若現在就需要可重現性,請選擇 GLM。

哪個模型更適合程式設計任務,Qwen 3.8 Max 還是 GLM 5.2?

GLM-5.2 是正式環境程式設計代理與長時間儲存庫任務的較佳預設選擇。Qwen3.8 Max 值得用於前端與快速迭代測試,但預覽版本仍會變動,且缺乏完整的獨立基準測試。

哪個模型比較便宜?

公開的計費單位不同。Qwen 使用月度方案與 Credits;GLM 使用逐 token 計費。Qwen 每月 $6 起,而 GPTProto 對 GLM-5.2 的收費為每 100 萬個輸入 token $1.26,以及每 100 萬個輸出 token $3.96。請比較實際任務記錄,不要在缺乏證據的情況下將 Credits 換算成 token。

Qwen 3.8 Max 有 API 嗎?

Alibaba 的 Token Plan 會為支援的程式設計工具提供基礎 URL 與 API 金鑰,預覽版本也可透過 Qoder 與 QoderWork 使用。Alibaba 尚未公布傳統的按用量付費 Qwen3.8 Max 每百萬 token 費率。GPTProto 目前尚未加入此模型。

GLM-5.2 中的 Max 是什麼意思?

Max 是 GLM-5.2 的推理力度設定,而不是獨立模型。它會為困難工作分配更多運算資源。在 Qwen3.8-Max-Preview 中,Max 是模型級別名稱的一部分。

我可以自行託管 Qwen 3.8 Max 或 GLM 5.2 嗎?

你可以自行託管 GLM-5.2,因為 Z.ai 已經以 MIT 授權發布其權重。Alibaba 表示 Qwen3.8 將成為開放權重模型,但截至 2026 年 7 月 22 日,Qwen3.8 Max 檢查點與授權仍未提供。

相關文章

更多部落格
GLM-5.2 與 DeepSeek V4 Pro:基準測試、定價,以及實際該使用哪一個(2026)

GLM-5.2 與 DeepSeek V4 Pro:基準測試、定價,以及實際該使用哪一個(2026)

重點摘要: 如果您的工作負載是長時間跨度的代理式工程——代理程式持續數小時在儲存庫中循環操作並交付功能——GLM-5.2 是更強的模型。如果您的工作負載是演算法、數學、STEM 推理,或任何受成本限制且需要高吞吐量的任務,DeepSeek V4 Pro 勝出,而且在價格上優勢非常明顯。在 Artificial Analysis 的獨立 Intelligence Index v4.1 中,GLM-5.2(最高努力程度)得分 51,DeepSeek V4 Pro 得分 44——但 DeepSeek 官方每 token 費率大約便宜 3 到 5 倍。關鍵在於,也是大多數比較忽略的部分:每 token 價格與每項任務成本並不是同一個數字。以下我會說明原因。 這兩個模型都位於我們平台上的 GLM-5.2 與 deepseek-v4-pro 目錄頁面中,而「我應該將請求路由到哪個模型」已成為我們最常收到的問題之一,尤其是對執行程式設計代理的開發者而言。這篇文章是我試圖好好回答這個問題的成果——在有獨立基準測試資料的地方使用該資料,在沒有的地方清楚標示供應商數據,並採用反映 DeepSeek 2026 年 7 月實際收費的定價計算,而不是 4 月的價格。

Schuyler Stacy | 2026-07-06

什麼是 GLM 5.2?以六分之一的價格實現開放權重編碼

什麼是 GLM 5.2?以六分之一的價格實現開放權重編碼

一家中國實驗室發布了一個可免費下載、可在自有硬體上執行、價格約為封閉式前沿模型六分之一的模型——而且在實際編碼基準測試中,僅落後 Claude Opus 4.8 幾分。接著,他們發布了這個模型,卻沒有公布任何官方基準測試結果。這就是 GLM 5.2,而「沒有行銷數據」與「一週內躍居每個獨立排行榜前列」之間的落差,正是它值得理解的主要原因。 我寫了很多這類解說文章,而大多數新模型文章都令人難忘,因為它們只是重新敘述規格表。但這篇文章在一個對開發者真正重要的面向上有所不同:其權重採用 MIT 授權開放,因此通常的問題——「基準測試是真的,還是行銷話術?」——有了一個異常明確的答案。人們下載了它,並親自進行測試。以下將介紹 GLM 5.2 是什麼、它如何運作,以及它的優勢與限制。

Michael Johnson | 2026-07-15

什麼是 Qwen 3.8 Max?發布日期、2.4T 預覽版、價格與早期基準測試

什麼是 Qwen 3.8 Max?發布日期、2.4T 預覽版、價格與早期基準測試

Qwen 3.8 Max 是阿里巴巴推出的新款 2.4 兆參數中國旗艦模型,但目前可用的版本仍稱為 qwen3.8-max-preview 。這個後綴很重要。截至 2026 年 7 月 21 日,阿里巴巴尚未發布正式版模型、技術報告、傳統的按 Token 計價 API 價格或可下載權重。 該預覽版於 7 月 19 日透過阿里巴巴的 Token Plan、Qoder 和 QoderWork 上線。在 官方 Qwen 公告 中,團隊表示 Qwen 3.8 將「很快」開放權重,並稱其能力可媲美領先的前沿模型,僅次於 Fable 5。該排名並未附帶公開的基準測試套件或測試方法。 我的簡短看法是:Qwen 3.8 Max 是一個真實且異常有趣的預覽版,而不是已完成的產品發布。開發者應該進行測試、記錄每項結果的日期,並避免根據阿里巴巴尚未公布的規格來規劃正式環境遷移。

Tiffany Layne | 2026-07-23

2026 年開發者最佳 AI API:10 個平台比較

2026 年開發者最佳 AI API:10 個平台比較

重點摘要 最佳直接 API: OpenAI 是最安全的通用預設選擇;Anthropic Claude 最適合程式碼開發與長時間執行的代理;Gemini 適合低成本多模態原型開發;DeepSeek 則在文字 Token 價格方面領先。 最佳多模型選項: OpenRouter 是測試多種 LLM 的清晰選擇。當單一產品需要透過一個 API 金鑰和共用餘額使用文字、圖片與影片模型時,GPTProto 更為合適。 最佳基礎架構選擇: Amazon Bedrock 適合受 AWS 管理的企業部署;Replicate、fal.ai 與 Together AI 則更適合開放模型或生成式媒體推理。 沒有適用於所有情境的唯一贏家。請比較工作負載適配度、模型涵蓋範圍、實際計費單位、生產環境控制能力與切換成本。價格與可用性已於 2026 年 7 月 14 日確認;部署前請查看供應商的即時頁面。

Tiffany Layne | 2026-07-15