Qwen3.8-Max-Preview 於 2026 年 7 月 19 日推出,正好是 Qwen3.7-Max 推出兩個月後。直觀來看,這似乎代表 Alibaba 已取代先前的旗艦模型。但現有證據支持的是更謹慎的結論。
兩個模型都提供 1M token 上下文視窗、思考模式、函式呼叫與內建工具。Qwen 表示,新版預覽模型在程式設計、全端開發、資料分析與辦公室工作流程方面有所改善,但尚未公布能夠衡量改善幅度所需的基準測試表。另一方面,Qwen3.7-Max 已有獨立的智慧程度、速度與延遲結果,以及正常的按 token 計價 API。
簡短答案:當你需要穩定的 API、可預測的成本或可重現的生產環境行為時,請使用 Qwen3.7-Max。當工作負載集中於前端開發或長時間執行的代理任務,且能接受模型仍在變動時,再測試 Qwen3.8-Max-Preview。較新並不代表目前更適合安全部署。
Qwen 3.8 Max 與 Qwen 3.7 Max 一覽
最重要的差異不是參數數量,而是證據品質。Qwen3.7-Max 是已發布的 API 模型,具有獨立測量結果。Qwen3.8-Max-Preview 則是評估中的目標,其行為在預覽期間可能會改變。
| 類別 |
Qwen 3.8 Max |
Qwen 3.7 Max |
| 目前模型名稱 |
qwen3.8-max-preview |
qwen3.7-max |
| 公布日期 |
2026 年 7 月 19 日 |
2026 年 5 月 19 日 |
| 發布狀態 |
預覽版;可能會被取代或下線 |
可透過標準 API 存取 |
| 參數總數 |
2.4T |
未公開 |
| 上下文視窗 |
1M token |
1M token |
| 思考模式 |
是 |
是 |
| 函式呼叫 |
是 |
是 |
| 內建工具 |
是 |
是 |
| 公開輸入/輸出模態 |
目前的英文文件尚未完全明確說明 |
文字輸入與文字輸出 |
| 開放權重 |
承諾「即將推出」;目前尚未發布 |
否;專有模型 |
| 獨立綜合評分 |
截至 2026 年 7 月 27 日尚未找到 |
Artificial Analysis Intelligence Index 評分 46 |
| 計價模式 |
Token Plan 訂閱與 Credits;沒有獨立的按 token 價格 |
提供按 token 計價的 API |
| GPT Proto 可用性 |
不可用 |
可用,每$0.36 輸入/每 1M token $1.44 輸出 |
3.8 的 1M 上下文數值很重要,因為一些早期解說文章仍將其列為未知。QwenCloud 目前的 文字生成模型表 現在已將兩個模型都列為 1M。這填補了一項規格資訊缺口,但並未證明 3.8 能更準確地使用長上下文。
Qwen 3.8 Max 實際升級了什麼?
在 7 月 19 日的公告中,Qwen 確認了 2.4T 的參數總數,並表示開放權重將隨後推出。Alibaba 的 Qoder 發布說明將 3.8 定位為 3.7 的改進版,著重於程式設計與專業生產力,尤其是全端開發、資料分析、辦公室工作及其他長期任務。之後的 Qwen 更新表示,該預覽版在網頁前端工作方面取得了顯著進展。
這些都是有用的訊號,但它們是供應商的說法,而不是經過測量的直接對比結果。沒有公開表格告訴我們,3.8 在解決儲存庫問題、完成工具驅動任務或在長時間工作階段中維持需求方面究竟好多少。有效參數數量也尚未公開,因此 2.4T 這個標題數字無法告訴開發者模型的服務成本或延遲。
因此,誠實的升級說法很有限:3.8 的目標是在 3.7 已涵蓋的工作負載上提供更好的執行效果,同時加入更大的模型與更快的發布節奏。它不是上下文視窗升級,也不是函式呼叫升級。至於品質是否提升,目前仍是合理的假設,而非經驗證的結果。
這還帶來另一項代價。Qwen 表示,預覽版會持續改善。在評估期間這聽起來很有吸引力,但持續變動的模型會使回歸測試更加複雜。未公告的更新後,同一個提示可能產生不同的行為;今天通過的測試不代表下週仍會得到相同結果。對生產團隊而言,版本穩定性本身就是一項功能。
Qwen 3.8 Max 與 Qwen 3.7 Max 的程式設計比較
Qwen3.7-Max 在儲存庫規模的程式設計方面具有明確優勢。它接受最多 1M token,支援思考模式與工具,並且已可透過傳統 API 呼叫。當代理以文字形式接收原始碼檔案、差異、日誌與工具結果時,純文字介面並不是限制。
獨立測量也為我們提供了基準。Artificial Analysis在其 Intelligence Index 中給予 Qwen3.7-Max 46 分。透過 Alibaba 的 API 測量時,其輸出速度為每秒 202.2 token,首個 token 的時間為 2.62 秒。這些結果會因供應商與工作負載而異,但仍比沒有方法論支持的排名說法更有用。
這裡存在一項取捨。在 Intelligence Index 評估期間,Qwen3.7-Max 產生了 1 億個輸出 token,而其比較組模型的中位數為 6,300 萬個。簡單來說:它可能比較冗長。快速產生 token 不一定代表回應簡短或總帳單較低,尤其是在輸出 token 比輸入 token 更昂貴時。
Qwen3.8-Max-Preview 對探索性前端開發與長時間執行的代理工作更具吸引力。Qwen 特別指出網頁前端方面的廣泛提升,而 Qoder 則將其定位為全端開發模型。我會在 UI 生成、多階段除錯,以及結合程式碼與辦公室或資料工作的任務上進行測試。但我不會僅因模型名稱而移轉生產環境的程式設計代理。
發布週期間的一則 r/ClaudeCode 討論吸引了超過 40 則留言。這是需求訊號,而不是效能結果。社群熱度能告訴我們開發者關心哪些工作負載;但若沒有受控提示與公開輸出,就無法告訴我們哪個模型應該承擔生產流量。
若要公平地測試 Qwen 3.8 Max 與 Qwen 3.7 Max 的程式設計能力,請讓儲存庫提交版本、系統提示、工具、權限與成功標準保持一致。記錄工具失敗、通過的測試、人工修正、實際耗時與 token 使用量。若其中任何輸入不同,結果就只是展示,而不是比較。
效能:測量結果與供應商聲稱
Alibaba 將 Qwen3.8-Max-Preview 描述為領先的前沿模型之一,並表示在其內部評估中僅次於 Fable 5。前半段說法看似合理;後半段則無法獨立驗證,因為 Alibaba 尚未公布背後使用的基準測試名稱、分數、提示或評估程序。
| 證據 |
Qwen 3.8 Max |
Qwen 3.7 Max |
| 供應商定位 |
程式設計與 Cowork 改進;內部排名僅次於 Fable 5 |
專注於程式設計、生產力與長時間自主工作的旗艦代理模型 |
| 公開基準測試表 |
尚未發布 |
供應商已提供結果,另有獨立綜合測試 |
| Artificial Analysis Intelligence Index |
截至 2026 年 7 月 27 日尚未找到結果 |
46 |
| 獨立測量的輸出速度 |
不可用 |
透過 Alibaba API 為 202.2 token/秒 |
| 獨立測量的 TTFT |
不可用 |
透過 Alibaba API 為 2.62 秒 |
| 可重現性 |
預覽期間持續變更 |
更穩定的已發布端點 |
證據缺口並不能證明 3.8 較差,而是表示「哪個更好」有兩個答案。就預期能力而言,3.8 很可能勝出;就已展示且可重現的效能而言,3.7 目前的論據更有力。
Qwen 3.8 Max 與 Qwen 3.7 Max 的價格
Qwen3.7-Max 採用傳統的 token 計價。QwenCloud 列出每 1M 輸入 token $2.50、每 1M 輸出 token $7.50 的標準價格。其頁面目前顯示 $1.25 與 $3.75 的促銷價格,但促銷價格具有時效性。
在 GPT Proto 上,Qwen3.7-Max 的價格為每 1M 輸入 token $0.36、每 1M 輸出 token $1.44。對於透過 GPT Proto 部署模型的團隊而言,這是實用的數字:團隊可以直接根據 token 使用量估算支出,並透過同一個餘額路由其他模型。
Qwen3.8-Max-Preview 採用不同的商業模式。QwenCloud 的 Token Plan 文件列出每月 $6、$18 與 $68 的限時個人方案。這些方案涵蓋多個模型,並以 Credits 計量使用量。Qoder 也會在預覽期間套用臨時的 Credits 倍率。兩種方式都沒有提供 3.8 獨立的每百萬 token 美元價格。
因此無法進行乾淨的價格比較。訂閱方案對於反覆互動式使用可能很有吸引力,但它無法像 token 計費一樣,讓工程團隊看清每次請求的成本。在 3.8 公布按 token 計價之前,任何聲稱它比 3.7 更便宜或更昂貴的說法都只是猜測。
為何這裡沒有配對輸出表
並排比較的截圖看起來會很有說服力,但目前也會造成誤導。
Qwen3.8-Max-Preview 尚未在 GPT Proto 上提供,而且其官方文件表示模型可能在預覽期間持續變更。將一次全新的 3.7 API 執行結果,與來自不同產品、日期不明的 3.8 截圖相比,會混入模型版本、基礎設施、工具以及可能不同的系統提示。我不會將其標示為受控測試。
具備發表品質的測試很簡單:在同一天,使用相同的儲存庫任務測試兩個模型,保留完整提示與工具追蹤記錄,並將原始輸出與評判標準一併發布。在這項測試完成前,沒有樣本反而比裝飾性的勝者徽章更誠實。
你應該選哪個模型?
| 你的優先事項 |
較佳選擇 |
原因 |
| 目前的生產 API |
Qwen 3.7 Max |
穩定存取、已知的模型字串與可預測的 token 價格 |
| 儲存庫規模的文字程式設計 |
Qwen 3.7 Max |
1M 上下文與獨立測量的效能 |
| 實驗性前端或 Cowork 任務 |
Qwen 3.8 Max Preview |
這些是 Alibaba 表示改善幅度最大的工作負載 |
| 固定的回歸測試 |
Qwen 3.7 Max |
持續更新的預覽版會讓結果更難重現 |
| GPT Proto 最低已知成本 |
Qwen 3.7 Max |
每 1M token 輸入 $0.36、輸出 $1.44 |
| 自行託管開放權重模型 |
目前兩者皆不可用 |
3.7 是專有模型;3.8 的權重已承諾推出,但尚未發布 |
我的建議很直接:部署 3.7,評估 3.8。只有在 3.8 擁有穩定版本、獨立結果,以及能換算每項任務成本的價格後,才將生產工作負載移轉過去。
如何透過 GPT Proto 使用 Qwen 3.7 Max
GPT Proto 透過相容於 OpenAI 的 API 提供 Qwen3.7-Max。將金鑰設定於環境變數中,然後使用模型字串 qwen3.7-max發出標準的 chat-completions 請求。
export GPTPROTO_API_KEY="your_api_key_here"
curl https://gptproto.com/v1/chat/completions \
-H "Authorization: Bearer $GPTPROTO_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.7-max",
"messages": [
{
"role": "system",
"content": "You are a senior software engineer. Return the smallest safe patch and explain each changed file."
},
{
"role": "user",
"content": "Review this function for correctness and propose a tested fix: def divide_total(total, count): return total / count"
}
]
}'
Python 版本使用官方 OpenAI 用戶端:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["GPTPROTO_API_KEY"],
base_url="https://gptproto.com/v1",
)
response = client.chat.completions.create(
model="qwen3.7-max",
messages=[
{
"role": "system",
"content": (
"You are a senior software engineer. Return the smallest "
"safe patch and explain each changed file."
),
},
{
"role": "user",
"content": (
"Review this function for correctness and propose a tested fix: "
"def divide_total(total, count): return total / count"
),
},
],
)
print(response.choices[0].message.content)
SDK 會加入 Bearer 授權標頭。若要切換至其他相容模型,只需變更模型字串;請保留獨立的評估集,避免方便的模型切換變成未經測試的生產環境變更。
安全升級檢查清單
先從真實工作負載儲存 3.7 基準,而不是合成的程式設計謎題。保留提示、儲存庫狀態、工具、預期輸出、延遲與 token 使用量。接著對 3.8 Preview 執行相同套件,並檢查失敗案例,而不只是外觀最好的答案。
在查看結果前先設定移轉門檻。例如,要求新模型通過相同測試、工具錯誤不增加,且成本沒有不可接受的變化。在重大預覽更新後重新執行評估。最後,等到模型識別碼穩定且價格公開後,再移轉承載正常運作時間或預算承諾的流量。
這個流程沒有在發布日立即切換那麼令人興奮,但它也正是避免模型升級演變成事故的方法。
最終結論
Qwen3.8-Max-Preview 可能會成為更好的模型,但就目前而言,它是經過較少驗證的產品。
如果現在要部署程式設計或開發者工作流程,我會透過 GPT Proto 使用 Qwen3.7-Max,並將 3.8 保留在獨立的評估流程中。當缺少的證據出現時,這項建議可以改變;不應該只因為 3.8 的名稱中有更大的數字就改變。