2026年8月7日更新: Qwen3.8-Max 現在是穩定的正式 API,不再是變動中的預覽版。本比較的建議已隨之更新。
Qwen3.8-Max 現在是新的高複雜度工作負載較佳的預設選擇。它新增了原生影像與影片理解、已記錄的 2.4T MoE 架構(具 95B 啟動參數)、更強的長程任務定位,以及最多 128K 輸出。
Qwen3.7-Max 仍有一項明顯優勢:價格。在 GPTProto 上,目前每百萬輸入 tokens 成本為 $0.36,每百萬輸出 tokens 為 $1.44。這使它成為純文字程式開發、文件分析,以及不需要新模型多模態或代理改進的既有正式環境工作流程的實用選擇。
簡短回答:新的複雜程式開發、視覺工作和長時間執行的代理任務請選擇 Qwen3.8-Max;若純文字成本效率或已經過測試的正式環境基線比最高能力更重要,則繼續使用 Qwen3.7-Max。
Qwen 3.8 Max 與 Qwen 3.7 Max 一覽
| 類別 |
Qwen 3.8 Max |
Qwen 3.7 Max |
| 狀態 |
穩定正式 API |
穩定正式 API |
| 模型名稱 |
qwen3.8-max |
qwen3.7-max |
| 發布日期 |
2026年8月3日 |
2026年5月19日 |
| 架構 |
2.4T MoE,95B 啟動參數 |
未公開揭露 |
| 上下文視窗 |
最多 1M tokens |
最多 1M tokens |
| 最大輸出 |
最多 128K tokens |
目前官方清單顯示最多 128K tokens |
| 輸入 |
文字、影像與影片 |
文字 |
| 思考 |
混合思考 |
支援思考 |
| 函式呼叫 |
支援 |
支援 |
| 官方定價 |
每 1M 輸入 $2 / 輸出 $6 |
$2.50 / $7.50;限時優惠 $1.25 / $3.75 |
| GPT Proto 存取 |
現已推出 |
現已推出 |
| 最佳適用情境 |
複雜程式開發、視覺工作、研究、長代理任務 |
低成本純文字正式環境 |
| 開放權重 |
已公布;截至 2026年8月7日尚未發布 |
專有 |
3.8 的 1M 上下文數據之所以重要,是因為一些早期解說仍將其列為未知。QwenCloud 目前的 文字生成模型清單 已將兩款模型都列為 1M。這填補了一項規格缺口,但並不代表 3.8 能更準確地運用長上下文。
Qwen 3.8 Max 到底升級了什麼?
在 7月19日的公告 中,Qwen 確認了 2.4T 參數規模,並表示開放權重將隨後推出。阿里巴巴的 Qoder 發布說明 將 3.8 定位為較 3.7 在程式開發與專業生產力上的改進,尤其是全端開發、資料分析、辦公室工作及其他長程任務方面。後續的 Qwen 更新 也表示預覽版在網頁前端工作上有了明顯進展。
這些都是有用的訊號,但屬於廠商說法,而非實際對比的量測結果。目前沒有公開表格能告訴我們 3.8 在解決儲存庫問題、完成工具導向任務,或在長時間工作階段中維持需求方面到底好了多少。啟動參數數量也未公布,因此「2.4T」這個焦點數字無法讓開發者了解模型的服務成本或延遲。
因此,關於升級的誠實說法其實有限:3.8 的目標是在 3.7 原本就鎖定的工作負載上提供更好的執行表現,同時加入更大的模型與更快的發布節奏。它不是上下文視窗升級,也不是函式呼叫升級。至於它是否算品質升級,目前仍是合理的假設,而非經過驗證的結果。
還有另一項代價。Qwen 表示預覽版會持續改善。這在評估期間聽起來很有吸引力,但一個不斷變動的模型會讓回歸測試變複雜。相同的提示詞可能在未預告的更新後出現不同行為,今天通過的測試也無法保證下週會有相同結果。對正式環境團隊而言,版本穩定性本身就是一項功能。
Qwen 3.8 Max 與 Qwen 3.7 Max 的程式開發比較
Qwen3.7-Max 在儲存庫規模的程式開發上具有明確優勢。它可接受最多 1M tokens,支援思考與工具,而且已經可透過傳統 API 呼叫。當代理程式以文字形式接收原始檔、diff、日誌和工具結果時,純文字介面並不構成限制。
獨立量測也提供了基線。Artificial Analysis 在 Intelligence Index 上給予 Qwen3.7-Max 46 分。它透過阿里巴巴的 API 量測到輸出速度為每秒 202.2 tokens,首個 token 時間為 2.62 秒。這些結果會因供應商和工作負載而異,但仍比沒有方法論的排名宣稱更有參考價值。
這裡有個取捨。在 Intelligence Index 評測期間,Qwen3.7-Max 產生了 100M 輸出 tokens,而比較組模型的輸出 tokens 中位數為 63M。簡單來說:它可能比較囉嗦。快速的 token 產生並不自動代表回應較短或總帳單較低,尤其是當輸出 token 比輸入 token 更貴的時候。
Qwen3.8-Max-Preview 對於探索性前端和長時間執行的代理任務來說更有看頭。Qwen 特別提到在網頁前端有廣泛進步,Qoder 也將其定位於全端開發。我會在 UI 生成、多階段除錯,以及混合程式碼與辦公室或資料處理的任務上測試它。我不會只因模型名稱就把正式環境的程式開發代理遷移過去。
在發布當週,r/ClaudeCode 討論串 吸引了 40 多則留言。這是需求訊號,不是效能結果。社群熱度能告訴我們開發者在意哪些工作負載;但若缺乏受控的提示詞和公開輸出,就無法判斷哪個模型應承載正式環境流量。
若要進行公平的 Qwen 3.8 Max 與 Qwen 3.7 Max 程式開發測試,請保持儲存庫 commit、系統提示詞、工具、權限和成功條件完全一致。記錄工具失敗次數、通過的測試、人工修正、實際經過時間和 token 使用量。如果上述任何輸入不同,結果就只是示範,而非比較。
效能:實際量測結果 vs 廠商宣稱
阿里巴巴將 Qwen3.8-Max-Preview 描述為領先的前沿模型之一,並表示在內部評測中僅次於 Fable 5。前半段說法合理。後半段則無法獨立驗證,因為阿里巴巴尚未公布背後的基準測試名稱、分數、提示詞或評測程序。
| 證據 |
Qwen 3.8 Max |
Qwen 3.7 Max |
| 廠商定位 |
改進程式開發與 Cowork;內部排名僅次於 Fable 5 |
以代理為核心的旗艦模型,適用於程式開發、生產力與長時間自主工作 |
| 公開基準測試表格 |
未發布 |
有廠商提供的結果,加上獨立綜合測試 |
| Artificial Analysis Intelligence Index |
截至 2026年7月27日未找到結果 |
46 |
| 獨立量測的輸出速度 |
無資料 |
透過阿里巴巴 API 每秒 202.2 tokens |
| 獨立量測的 TTFT |
無資料 |
透過阿里巴巴 API 為 2.62 秒 |
| 可重現性 |
預覽版在評估期間會變動 |
已發布的端點較穩定 |
這項證據缺口並不代表 3.8 比較差。它表示「哪個比較好」有兩個答案。就預期能力而言,3.8 可能是贏家;就已展示且可重現的效能而言,3.7 目前更有說服力。
Qwen 3.8 Max 與 Qwen 3.7 Max 定價比較
Qwen3.8-Max 現在使用標準的按量付費 token 計價。先前預覽階段的 Credits 方案已不再是本次比較的相關基準。
| 價格方案 |
Qwen 3.8 Max |
Qwen 3.7 Max |
| 官方輸入價格 |
每 1M tokens 為 $2 |
每 1M tokens 為 $2.50 |
| 官方輸出價格 |
每 1M tokens 為 $6 |
每 1M tokens 為 $7.50 |
| GPT Proto 輸入價格 |
每 1M tokens 為 $1.80 |
每 1M tokens 為 $0.36 |
| GPT Proto 輸出價格 |
每 1M tokens 為 $5.40 |
每 1M tokens 為 $1.44 |
雖然 Qwen3.8-Max 的官方定價低於 Qwen3.7-Max,但 GPT Proto 目前對舊款模型提供了更深的折扣。在 GPT Proto 上,Qwen3.7-Max 的輸入成本比 Qwen3.8-Max 便宜 80%,輸出成本約便宜 73%。
例如,一個使用 1000萬輸入 tokens 和 200萬輸出 tokens 的工作負載成本為:
這讓 Qwen3.7-Max 成為高用量、純文字工作負載的明確省錢選擇。不過,Qwen3.8-Max 新增了原生影像與影片理解、結構化輸出、更高的輸出上限,以及針對複雜程式開發與長程代理任務的更強定位。
最便宜的要求不一定是最便宜的完成任務。團隊應比較首次通過成功率、重試次數、工具失敗次數、token 使用量和人工修正時間。當新功能會影響工作流程時,可先採用 Qwen3.8-Max;當較低價格能帶來更好的每個可接受結果成本時,則繼續用 Qwen3.7-Max。
為什麼這裡沒有對照輸出表格?
並排截圖看起來會很有說服力,但目前也可能造成誤導。
Qwen3.8-Max-Preview 並未在 GPT Proto 上提供,而且官方文件指出模型在預覽期間可能變動。將全新的 3.7 API 執行結果,與來自不同產品、未標日期的 3.8 截圖相比,會混雜模型版本、基礎架構、工具,甚至系統提示詞。我不會稱之為受控測試。
具發表品質的測試很簡單:在同一天對兩款模型執行相同的儲存庫任務,保留完整的提示詞和工具軌跡,並將原始輸出連同判斷標準一起公開。在這種測試出現之前,不提供範例比放上一個裝飾性的贏家徽章更誠實。
你該選擇哪一款模型?
| 你的優先考量 |
較佳選擇 |
原因 |
| 最佳整體 Qwen 能力 |
Qwen 3.8 Max |
新旗艦,具更強的程式開發、視覺、研究與長程任務定位 |
| 複雜的儲存庫或代理任務 |
Qwen 3.8 Max |
專為更長時間的自主執行與閉環工具工作流程而設計 |
| 影像、影片或視覺文件輸入 |
Qwen 3.8 Max |
3.7 Max 僅支援文字 |
| GPT Proto 最低文字 token 成本 |
Qwen 3.7 Max |
每 1M tokens 輸入 $0.36、輸出 $1.44 |
| 既有已通過回歸測試的應用程式 |
保留 3.7 直到完成驗證 |
穩定版本仍需要針對特定工作負載的遷移測試 |
| 今天才開始的新應用程式 |
從 3.8 開始 |
現在已不再因為預覽狀態而需要預設使用 3.7 |
| 目前需要自行託管 |
兩者都不 |
3.7 是專有模型;3.8 的權重已公布但尚無法下載 |
舊的建議——「先上線 3.7,只評估 3.8」——已不再符合目前的產品狀態。
對於新工作,請從 在 GPT Proto 上使用 Qwen3.8-Max 開始評估。當 Qwen3.7-Max 的低得多的 token 價格或既有已驗證基線能帶來更低的每個可接受任務成本時,就繼續使用它。
透過 GPT Proto 試用 Qwen 3.8 Max
Qwen3.8-Max 現在可透過 GPT Proto 的 OpenAI 相容 API 使用。
export GPTPROTO_API_KEY="your_api_key_here"
curl https://gptproto.com/v1/chat/completions \
-H "Authorization: Bearer $GPTPROTO_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-max",
"messages": [
{
"role": "system",
"content": "在提出修改前先檢查現有實作。保留目前的 API 契約,並列出每次修改的驗證步驟。"
},
{
"role": "user",
"content": "檢視此儲存庫架構,並找出三個風險最高的假設。"
}
]
}'
Python 版本使用官方 OpenAI 用戶端:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["GPTPROTO_API_KEY"],
base_url="https://gptproto.com/v1",
)
response = client.chat.completions.create(
model="qwen3.7-max",
messages=[
{
"role": "system",
"content": (
"你是一名資深軟體工程師。請回傳最小且安全的修補程式,"
"並說明每個變更的檔案。"
),
},
{
"role": "user",
"content": (
"請檢視這個函式是否正確,並提出經過測試的修正: "
"def divide_total(total, count): return total / count"
),
},
],
)
print(response.choices[0].message.content)
SDK 會自動加入 Bearer 授權標頭。若要切換到其他相容模型,只需變更 model 字串;請保留一組獨立的評估資料集,以免方便地切換變成未經測試的正式環境變更。
安全升級檢查清單
首先從你的真實工作負載建立 3.7 基線,而不是用一個人工合成的程式題目。保留提示詞、儲存庫狀態、工具、預期輸出、延遲和 token 使用量。然後對 3.8 Preview 執行相同的測試組合,並檢查失敗案例,而不只是最好看的答案。
在得知結果之前先設定遷移門檻。例如,要求新模型在相同測試中全部通過,且工具錯誤次數沒有增加、成本變化沒有超出可接受範圍。在重大預覽更新後重新執行評估。最後,在遷移承載正常運行時間或預算承諾的流量之前,請等待穩定的模型識別碼和已公布的價格。
這個流程不像在發布當天立刻切換那麼刺激,但這正是讓模型升級不致變成事故的方法。
最終結論
Qwen3.8-Max 現在是新的複雜工作負載下較佳的預設 Qwen 模型。穩定的 API 消除了原始比較中最大的反對理由,而多模態輸入與更強的長程任務表現則為它帶來更廣的能力上限。
Qwen3.7-Max 並沒有過時。它在 GPT Proto 上的價格使其成為一款強勁的純文字正式環境模型,尤其是當工作負載已通過測試,且無法從視覺或延長自主執行中受益時。
新的評估請從 Qwen3.8-Max 開始。在每個可接受任務成本更具優勢的地方保留 3.7——而不是單純因為它較早發布。