Michael Johnson2026-07-22

Qwen 3.8 Max 與 GLM 5.2:2026 年哪個更適合程式設計?

比較 Qwen 3.8 Max 與 GLM 5.2 的程式設計能力、API 存取、上下文、價格與開放權重,了解 2026 年哪個模型更適合正式環境。

Qwen 3.8 Max 與 GLM 5.2:2026 年哪個更適合程式設計?

2026 年 8 月 7 日更新: Qwen3.8-Max 現已成為穩定的正式環境 API,並可透過 GPTProto 使用。先前針對預覽版部署的建議已更新。

重點摘要

  • 當最大化託管能力、多模態輸入、前端工作、視覺分析或長期代理執行最重要時,選擇 Qwen3.8-Max。

  • 當較低的 Token 成本、MIT 授權權重、自行託管或可重現的開放部署更重要時,選擇 GLM-5.2。

  • 兩個模型現在都能穩定使用 API。GLM 不再是唯一的正式環境選項。

  • Qwen 的官方費率為輸入每百萬 Token 2 美元、輸出每百萬 Token 6 美元。GPTProto 目前列出的 GLM-5.2 費率為輸入每百萬 Token 1.26 美元、輸出每百萬 Token 3.96 美元。

  • Qwen 是能力優先的較強選擇;GLM 則是成本與控制優先的較強選擇。

目錄

Qwen 3.8 Max 與 GLM 5.2 一覽

類別 Qwen3.8-Max GLM-5.2
產品狀態 穩定的正式環境模型 穩定的版本化模型
上下文視窗 最多 100 萬個 Token 最多 100 萬個 Token
最大輸出 最多 128K Token 最多 131,072 個 Token
模型規模 總計 2.4T,啟用 95B 總計約 753B,啟用 40B
輸入類型 文字、圖片與影片 文字
函式呼叫 支援 支援
官方/API 價格 輸入每百萬 Token 2 美元,輸出每百萬 Token 6 美元 GPT Proto:1.26/3.96 美元
開放權重 已宣布;尚未發布 MIT 授權可用
GPT Proto 可用性 現在即可使用 現在即可使用
最適合 頂級程式設計、視覺、研究、長期代理 低成本程式設計、自行託管、版本控管部署

程式設計效能:基準測試與混亂程式碼庫

GLM-5.2 目前擁有較清晰的公開基準測試紀錄。Z.ai 表示,使用 Terminus-2 時,其在 SWE-bench Pro 的得分為 62.1,在 Terminal-Bench 2.1 的得分為 81.0。其 官方文件也公布了評估設定的資訊,包括執行器與資源限制。

這些仍是供應商報告的結果。它們有助於了解 GLM-5.2 在程式設計與長期代理任務上的預期優勢,但無法證明它在每個程式碼庫或正式環境工作流程中都能勝過 Qwen3.8-Max。

獨立證據仍不完整。截至 2026 年 8 月 10 日,Artificial Analysis 將 GLM-5.2 Max 在其 Intelligence Index 上評為 53 分。然而,該比較頁面上的 Qwen 模型是 Qwen3 Max Thinking,這是一個較舊的模型,且其分數標記為估算值。這不能證明 GLM-5.2 的效能優於目前的 Qwen3.8-Max。

Qwen 的穩定版發布改變了部署決策,但並未自動解決基準測試問題。Alibaba 將 Qwen3.8-Max 定位為複雜程式設計、多模態工作、專業任務與長期代理的重要升級。其官方發布公告包含架構細節與延伸代理行為的範例,但沒有在 SWE-bench Pro 或 Terminal-Bench 2.1 上提供可直接比較的 GLM-5.2 對戰結果。

因此,最公平的結論不是某個模型已經獲勝。GLM-5.2 擁有較成熟的公開程式設計證據,而 Qwen3.8-Max 擁有更廣泛的能力定位,現在也已穩定到足以進行正式環境評估。

證據說明:以下配對測試使用的是穩定版 8 月發布前的 Qwen3.8-Max Preview。它仍可用於觀察不同的工程行為,但不應視為目前正式環境模型的決定性基準測試。

7 月 22 日的 36Kr 混亂半成品網頁專案測試提供了更具體的行為比較。該專案包含 Next.js 前端、Payload CMS、動畫程式碼、舊版文件、既有功能,以及相互交織的前後端錯誤。

在初始專案閱讀任務中,Qwen3.8-Max Preview 名列第一。在該特定設定中,它辨識出專案目前的狀態、啟動缺少的 CMS 服務,並在不到 10 秒內完成初步分析。

GLM-5.2 在範圍較窄的輪播實作任務上表現較佳。它保留了自動播放、拖曳控制與連續循環,但轉場仍出現視覺跳動。Qwen 的速度較快,卻移除了拖曳行為,並實作了一個延伸模擬的循環,最終會跳回開頭。

這項取捨比一句話判定勝負更有參考價值。在該測試中,Qwen 更擅長辨識目前意圖並快速推進,而當功能保留與實作完整性更重要時,GLM 更為謹慎。

然而,一個未完成的網頁專案無法確立普遍的速度或程式碼品質排名,尤其是因為測試使用 Qwen3.8-Max 的預覽版,且未完整揭露服務路由、Token 預算、延遲條件或確切的模型修訂版本。

如何公平解讀證據

公開的舊版程式碼測試很有用,但並非受控基準測試。使用相同的未完成專案與基於 OpenCode 的工作流程,比較不相關的截圖更具參考價值;然而,缺少的設定細節使得精確重現無法進行。

該測試可以揭示典型的失敗模式:

  • Qwen3.8-Max Preview 行動迅速並理解專案目前的意圖,但移除了要求的互動功能,改用不完整的循環實作。

  • GLM-5.2 在輪播任務中保留了更多必要行為,但初始分析較慢,且曾將過時文件誤認為目前的工作。

這些結果描述的是特定環境中受測版本的表現。它們無法證明 Qwen 總是更快、GLM 總是撰寫更安全的程式碼,或穩定版 Qwen3.8-Max 會重現預覽版模型的行為。

可用證據應分為四個層級解讀:

  1. 目前的獨立正面測試:穩定版 Qwen3.8-Max 與 GLM-5.2 之間的測試仍然缺失。

  2. 已發布的程式設計基準測試:GLM-5.2 較強,但最受矚目的結果主要由供應商報告。

  3. 相同專案的公開測試:有助於辨識行為差異,但現有的 36Kr 測試使用的是 Qwen3.8-Max Preview。

  4. 供應商發布聲明:有助於理解預期能力,但若沒有外部驗證,不足以宣告勝者。

證據缺口仍是採購決策的一部分,但這已不代表 Qwen 應被排除在正式環境之外。

如果無法進行私有比較,對於重視已發布程式設計結果、較低 API 成本、開放權重與可重現部署的團隊而言,GLM-5.2 仍是證據風險較低的選擇。當多模態輸入、更廣泛的任務涵蓋、前端工作或長期代理能力更重要時,Qwen3.8-Max 現在已是有效的正式環境選擇。

實務上的建議是在相同程式碼庫上測試兩個模型。比較通過的測試、功能回歸、無效工具呼叫、重試、延遲、Token 總成本與人工修正時間。選擇每個已接受任務成本較低的模型,而不是孤立基準測試或發布聲明最強的模型。

Qwen 3.8 Max 與 GLM 5.2 的價格與成本

現在這是一般的 Token 價格比較。

模型 輸入價格 輸出價格
Qwen3.8-Max 官方費率 每百萬 Token 2 美元 每百萬 Token 6 美元
GPT Proto 上的 GLM-5.2 每百萬 Token 1.26 美元 每百萬 Token 3.96 美元
GLM-5.2 直接列出的費率 每百萬 Token 1.40 美元 每百萬 Token 4.40 美元

對於使用 1,000 萬個輸入 Token 與 200 萬個輸出 Token 的工作負載:

  • Qwen3.8-Max 官方費率:10 × 2 美元 + 2 × 6 美元 = 32 美元

  • GPT Proto 上的 GLM-5.2:10 × 1.26 美元 + 2 × 3.96 美元 = 20.52 美元

以列出的費率計算,GLM 的成本較低。Qwen 必須提供更高的完成率、更少的重試、更佳的多模態理解,或減少人工修正,才能合理化這項差價。

在困難的視覺或長期任務上,這是合理的可能性,但仍應透過測量而非假設來確認。

哪個更適合程式設計任務?

程式設計需求 較佳選擇 原因
最高能力的託管程式設計 Qwen 3.8 Max 較新的旗艦模型,在長期任務與多模態定位上更強
視覺前端重建 Qwen 3.8 Max 原生圖片與影片理解
對預算敏感的程式碼庫工作 GLM-5.2 較低的輸入與輸出 Token 費率
自行託管的程式設計代理 GLM-5.2 MIT 授權權重現已可用
可重現的開放部署 GLM-5.2 公開檢查點、架構與穩定版本
複雜研究或專業工作流程 Qwen 3.8 Max 專為涵蓋程式設計、文件、研究與視覺輸入的多階段工作而設計
現有的 GLM 正式環境流程 測試完成前繼續使用 GLM 更強的模型聲稱不能取代遷移評估

Qwen3.8-Max 現在勝出能力優先的決策。在成本、自行託管與開放部署是主要要求時,GLM-5.2 仍然勝出。

如何透過 GPT Proto 使用 GLM-5.2

GPT Proto 透過相容於 OpenAI 的端點提供 GLM-5.2。建立 API 金鑰、將其加入環境,然後呼叫現行的 glm-5.2 模型字串。同樣的方式也可用於 GPT Proto 模型集合中的其他模型。

首先設定金鑰並提出 cURL 請求:

export GPTPROTO_API_KEY="your_gptproto_api_key"

curl https://gptproto.com/v1/chat/completions \
  -H "Authorization: Bearer $GPTPROTO_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.2",
    "messages": [
      {
        "role": "system",
        "content": "Inspect before editing. Preserve API contracts and report the tests required for every proposed change."
      },
      {
        "role": "user",
        "content": "Plan a safe fix for duplicate refresh-token requests after concurrent 401 responses. State assumptions and verification steps before proposing code."
      }
    ]
  }'

相應的 Python 呼叫使用 OpenAI SDK:

python -m pip install openai
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["GPTPROTO_API_KEY"],
    base_url="https://gptproto.com/v1",
)

response = client.chat.completions.create(
    model="glm-5.2",
    messages=[
        {
            "role": "system",
            "content": (
                "You are a repository-level coding assistant. Inspect before "
                "proposing changes. Preserve existing API contracts, do not add "
                "dependencies without approval, and list the verification "
                "commands required for every proposed edit."
            ),
        },
        {
            "role": "user",
            "content": (
                "An API client occasionally sends two refresh-token requests "
                "after several concurrent requests fail with 401. Identify the "
                "likely race condition, list the files you would inspect, and "
                "return a minimal repair plan before writing code."
            ),
        },
    ],
)

print(response.choices[0].message.content)

這段程式碼刻意要求模型在編輯前先提出檢查計畫。即使回答看起來很完善,若程式設計模型立即捏造檔案或變更 API 合約,也代表它未完成任務。

Qwen3.8-Max 現已可在 GPT Proto 上使用,因此開發人員可以透過同一個 API 帳戶,對兩個模型執行相同的程式設計提示。

使用 qwen3.8-max 呼叫 Qwen,使用 glm-5.2 呼叫 GLM,並保持提示、程式碼庫狀態、工具權限、推理設定與成功標準完全一致。測量通過的測試、重試、無效工具呼叫、延遲、Token 總數、人工修正次數,以及每個已接受任務的成本。

Qwen3.8-Max API 開始,或先與現有的 GLM-5.2 端點比較,再將正式環境流量導向其中一個模型。

最終結論

原先「GLM 用於正式環境,Qwen 僅供實驗」的結論已經過時。

Qwen3.8-Max 現在是穩定的正式環境模型,具備有文件記錄的 API、100 萬 Token 上下文、多模態輸入、標準 Token 定價,以及 GPT Proto 可用性。當能力,尤其是視覺程式設計與長期執行,是主要瓶頸時,它是更好的起點。

GLM-5.2 仍然更便宜且更容易控制。其 MIT 授權權重使它成為目前自行託管、私有部署,以及需要可重現開放檢查點之團隊的明確選項。

需要能力就選 Qwen;需要成本與所有權就選 GLM。

一組金鑰,使用更多 AI 模型

透過單一相容於 OpenAI 的 API,以實惠價格探索領先的 AI 模型。

瀏覽 API 模型
一組金鑰,使用更多 AI 模型
相關模型
全部模型
Qwen
by Qwen
10% OFF
MiniMax
30% OFF
DeepSeek
OpenAI
5% OFF

常見問題

Qwen 3.8 Max 比 GLM 5.2 好嗎?

不能做出一般性的結論。在一項公開的舊版程式碼測試中,Qwen3.8-Max-Preview 贏得了多項任務;但 GLM-5.2 擁有更強的正式環境條件:穩定存取、公開規格、獨立評估、按 Token 計價,以及可下載的權重。請針對你的工作負載測試 Qwen;若現在需要可重現性,則選擇 GLM。

Qwen 3.8 Max 和 GLM 5.2 哪個更適合程式設計任務?

GLM-5.2 是正式環境程式設計代理與長期程式碼庫任務較好的預設選擇。Qwen3.8 Max 值得用於前端與快速迭代測試,但預覽版仍會變更,且缺乏完整的獨立基準測試。

哪個模型比較便宜?

公開的計費單位不同。Qwen 使用月費方案與 Credits;GLM 使用按 Token 計費。Qwen 每月起價 6 美元,而 GPTProto 對 GLM-5.2 的收費為輸入每百萬 Token 1.26 美元、輸出每百萬 Token 3.96 美元。請比較實際任務記錄,不要在缺乏證據的情況下將 Credits 換算成 Token。

Qwen 3.8 Max 有 API 嗎?

Alibaba 的 Token Plan 為受支援的程式設計工具提供基礎 URL 與 API 金鑰,預覽版也可透過 Qoder 與 QoderWork 使用。Alibaba 尚未發布傳統的 Qwen 3.8 Max 按使用量付費的每百萬 Token 費率。GPTProto 尚未加入該模型。

GLM-5.2 中的 Max 是什麼意思?

Max 是 GLM-5.2 的推理強度設定,而不是獨立模型。它會為困難工作配置更多運算資源。在 Qwen3.8-Max-Preview 中,Max 是模型層級名稱的一部分。

我可以自行託管 Qwen 3.8 Max 或 GLM 5.2 嗎?

你可以自行託管 GLM-5.2,因為 Z.ai 已在 MIT 授權下發布其權重。Alibaba 表示 Qwen3.8 將成為開放權重模型,但截至 2026 年 7 月 22 日,Qwen3.8 Max 的檢查點與授權仍未提供。

相關文章

更多部落格
GLM-5.2 與 DeepSeek V4 Pro:基準測試、定價,以及實際該使用哪一個(2026)

GLM-5.2 與 DeepSeek V4 Pro:基準測試、定價,以及實際該使用哪一個(2026)

重點摘要: 如果您的工作負載是長時間跨度的代理式工程——代理程式持續數小時在儲存庫中循環操作並交付功能——GLM-5.2 是更強的模型。如果您的工作負載是演算法、數學、STEM 推理,或任何受成本限制且需要高吞吐量的任務,DeepSeek V4 Pro 勝出,而且在價格上優勢非常明顯。在 Artificial Analysis 的獨立 Intelligence Index v4.1 中,GLM-5.2(最高努力程度)得分 51,DeepSeek V4 Pro 得分 44——但 DeepSeek 官方每 token 費率大約便宜 3 到 5 倍。關鍵在於,也是大多數比較忽略的部分:每 token 價格與每項任務成本並不是同一個數字。以下我會說明原因。 這兩個模型都位於我們平台上的 GLM-5.2 與 deepseek-v4-pro 目錄頁面中,而「我應該將請求路由到哪個模型」已成為我們最常收到的問題之一,尤其是對執行程式設計代理的開發者而言。這篇文章是我試圖好好回答這個問題的成果——在有獨立基準測試資料的地方使用該資料,在沒有的地方清楚標示供應商數據,並採用反映 DeepSeek 2026 年 7 月實際收費的定價計算,而不是 4 月的價格。

Schuyler Stacy | 2026-07-06

什麼是 GLM 5.2?以六分之一的價格實現開放權重編碼

什麼是 GLM 5.2?以六分之一的價格實現開放權重編碼

一家中國實驗室發布了一個可免費下載、可在自有硬體上執行、價格約為封閉式前沿模型六分之一的模型——而且在實際編碼基準測試中,僅落後 Claude Opus 4.8 幾分。接著,他們發布了這個模型,卻沒有公布任何官方基準測試結果。這就是 GLM 5.2,而「沒有行銷數據」與「一週內躍居每個獨立排行榜前列」之間的落差,正是它值得理解的主要原因。 我寫了很多這類解說文章,而大多數新模型文章都令人難忘,因為它們只是重新敘述規格表。但這篇文章在一個對開發者真正重要的面向上有所不同:其權重採用 MIT 授權開放,因此通常的問題——「基準測試是真的,還是行銷話術?」——有了一個異常明確的答案。人們下載了它,並親自進行測試。以下將介紹 GLM 5.2 是什麼、它如何運作,以及它的優勢與限制。

Michael Johnson | 2026-07-15

Qwen 3.8 Max 是什麼?發布、規格、定價與開放權重

Qwen 3.8 Max 是什麼?發布、規格、定價與開放權重

更新於 2026 年 8 月 7 日: 阿里巴巴已於 8 月 3 日正式發布 Qwen3.8-Max 生產版本,取代較早的 qwen3.8-max-preview ,成為目前的旗艦 API 模型。本文已更新確認的架構、上下文視窗、定價、API 可用性與開放權重時程。 Qwen3.8-Max 是阿里巴巴迄今功能最強大的 Qwen 模型:這是一款多模態稀疏混合專家模型,總參數量達 2.4 兆,每次請求啟用 950 億參數。 穩定版模型支援文字、圖片與影片輸入,產生文字輸出,並提供最高 100 萬 tokens 的上下文視窗,以及最高 128K tokens 的輸出。它專為複雜程式設計、視覺分析、研究、專業工作與長期代理任務而設計。 此次發布也改變了開發者實際上的選擇。Qwen3.8-Max 不再受限於持續變動的預覽版或僅限 Credits 的個人方案。現在它提供標準的按用量付費 API,阿里巴巴列出的價格為每百萬輸入 tokens 2 美元、每百萬輸出 tokens 6 美元。現在也可透過 GPTProto 上的 Qwen 3.8 Max API 使用。 我的簡短看法:Qwen 3.8 Max 是一個真實且異常有趣的預覽版本,而不是已完成的產品發布。開發者應該測試它、記錄每項結果的日期,並避免根據阿里巴巴尚未公布的規格來規劃正式環境遷移。

Tiffany Layne | 2026-07-23

2026 年開發者最佳 AI API:10 個平台比較

2026 年開發者最佳 AI API:10 個平台比較

TL;DR Best direct APIs: OpenAI is the safest general-purpose default; Anthropic Claude is strongest for coding and long-running agents; Gemini suits low-cost multimodal prototyping; and DeepSeek leads on text-token price. Best multi-model options: OpenRouter is the clearest choice for testing many LLMs. GPTProto is the stronger fit when one product needs text, image, and video models under one API key and shared balance. Best infrastructure choices: Amazon Bedrock fits AWS-governed enterprise deployments, while Replicate, fal.ai, and Together AI are better suited to open-model or generative-media inference. There is no universal winner. Compare workload fit, model coverage, real billing units, production controls, and switching cost. Prices and availability were checked on July 14, 2026; verify live provider pages before deployment.

Tiffany Layne | 2026-07-15