TL;DR
Qwen 3.6 將媲美生產環境的速度帶到本地硬體,其中 35B A3B 變體尤其突出,是處理大型程式碼儲存庫與複雜技術工作流程的首選之一。
本地 AI 愛好者通常必須在速度與智慧之間做出選擇。這次發布有效地消除了這項取捨。無論你使用的是成熟的雙 RTX 3090 配置,還是最新的 RTX 5090,這些模型都證明了開放權重模型在專業技術任務上足以媲美大型雲端服務商。
從透過 vLLM 實現的大幅吞吐量提升,到能夠管理完整儲存庫而不偏離重點的專業程式碼邏輯,本地 AI 生態正在轉變。這不再只是愛好者的遊戲;對於需要高頻率模型互動的專業開發者而言,它已成為可行且以隱私為優先的工作空間。
現代硬體上的 Qwen 3.6 實際效能
本地 LLM 生態剛剛迎來一次巨大衝擊。隨著 Qwen 3.6,尤其是 27B 與 35B A3B 變體的發布,我們看到了真正適合日常生產工作的數據。現在不再只是討論原始基準測試結果。
如果你使用 RTX 5090,Qwen 3.6 的效能坦白說相當驚人。在上下文視窗開端,我們談的是每秒 45 個 token。即使推進到接近 100,000 個 token,速度仍維持在每秒約 35 個 token。
在處理深度技術文件時,這種穩定性非常重要。大多數模型一旦上下文逐漸累積,效能就會急劇下降。但 Qwen 3.6 架構似乎能在頂級硬體上輕鬆完成繁重工作。
Qwen 3.6 在不同 GPU 上的基準測試
讓我們看看實際數據,因為它們呈現出一個明確的故事。在使用 FP8 量化的雙 RTX 3090 配置上,你可以達到每秒 26 個 token。對於在本地執行的 27b 模型而言,這是相當令人滿意的速度。
35B A3B 變體才是許多人眼中的真正明星。它採用專家混合(MoE)方法。在同一張 RTX 5090 上使用 GPTQ-Int4 時,使用者回報速度超過每秒 200 個 token。這在效率方面似乎是最佳平衡點。
最佳化 Qwen 3.6 的吞吐量提升
標準載入器已經不錯,但 vLLM 能將一切提升到另一個層次。從 llama.cpp 切換到 vLLM 後,使用者可看到提示處理速度提升至每秒 3600 個 token。對於代理式工作流程,生成速度約可達每秒 51 個 token。
這項最佳化讓本地 LLM 的效能更接近付費雲端服務。你可以同時享有本地託管的隱私性,以及高階 API 的速度。對於需要高頻率模型互動的開發者而言,這改變了成本效益的計算方式。
Qwen 3.6 的程式碼能力與儲存庫管理
Qwen 3.6 的程式碼優勢在程式設計領域真正展現出來。它不只是用來撰寫單一函式。這款強大的程式碼模型能處理通常需要 Claude 3.5 Sonnet 這類大型雲端模型才能完成的繁重儲存庫工作。
當你將 Qwen 3.6 與 PI Coding Agent 這類代理搭配使用時,結果令人印象深刻。它能理解多個檔案的上下文。當你要求修改專案中的不同模組時,它不會失去整體脈絡。
35b 模型尤其擅長這類工作。由於它採用 MoE,在長時間除錯期間反應更加迅速。你不必坐等三分鐘才得到回覆,生成幾乎會立即開始。
使用 Qwen 3.6 35B A3B 進行軟體工程
工程師發現,這款模型在重構方面表現出色。它提出的建議帶有某種「邏輯感」,比過往版本更不那麼機械化。它能捕捉較小的 7B 或 14B 模型完全忽略的邊界情況。
如果你正在處理繁重的儲存庫工作,35B A3B 在 RTX 5090 上的速度快得不可思議。它讓你能進入心流狀態:你提出要求,它給出回答,然後你繼續前進。這正是任何本地 LLM 所應達成的目標。
Qwen 3.6 在技術任務中的效能比較
雖然程式設計是它的主打能力,但創意寫作與一般推理也相當紮實。它是一款多用途工具,不像只會 Python 的「單一技能工具」。它能以高精準度處理一般邏輯任務。
不過,有些使用者在純編輯任務上仍偏好 Gemma 4 的清晰度。Gemma 通常能提供更乾淨的結構與更好的節奏。但若論原始技術能力,Qwen 3.6 的程式碼效能目前很難被超越。
「35B A3B 目前似乎是最佳平衡點。MoE 的速度加上接近密集模型的品質,讓人很難再回到舊模型。」
在本地執行 Qwen 3.6 的硬體需求
你需要實際評估自己的設備。雖然 Qwen 3.6 效率很高,但仍需要相當可觀的 VRAM。對於 27b 模型而言,24GB VRAM 是理想的基準。這讓你能執行高品質量化版本,而不需要大量卸載。
如果你使用 16GB VRAM 顯示卡,仍然可以執行。你只需要使用較低的量化等級,或將部分層卸載到系統 RAM。這會降低 Qwen 3.6 的效能,但仍然可用。
DDR5 RAM 在這裡會有所幫助。如果你有 32GB 的高速系統 RAM,卸載造成的效能損失會較小。擁有 8GB VRAM 與 32GB RAM 的使用者回報速度為每秒 15 到 30 個 token,對基本聊天而言已經足夠。
27B 模型與 35B A3B 的最佳 VRAM
| GPU 硬體 |
VRAM 容量 |
預期效能 |
目標模型 |
| RTX 5090 |
32GB |
45+ tok/s (TG) |
35B A3B / 27B |
| RTX 4090 / 3090 |
24GB |
25-35 tok/s (TG) |
27B 模型 |
| RTX 4080 / 4070 Ti |
16GB |
10-20 tok/s (TG) |
27B(量化) |
| 筆記型電腦 GPU + DDR5 |
8GB + 32GB |
15-25 tok/s |
27B(卸載) |
系統記憶體與最佳化取捨
不要忽略 CPU 與系統 RAM。如果你希望 Qwen 3.6 基準測試達到最高效能,就需要均衡的系統配置。當 GPU 等待時,卻把所有工作交給老舊 CPU,會使吞吐量受到瓶頸限制。
快速的本地 LLM 需要快速的資料路徑。多 GPU 配置最好使用 PCIe 4.0 或 5.0 插槽。如果你使用雙 RTX 3090,請確保電源供應器能應付提示處理期間的瞬時功耗尖峰。
Qwen 3.6 配置的進階最佳化
若要充分發揮 Qwen 3.6 的程式碼體驗,你需要關注量化核心。目前在大多數測試中,FP8 核心的效能優於 NVFP4。它在速度與智慧之間提供了更好的平衡。
推測解碼是另一項技巧。透過使用更小的模型預測 token,你可以提升主要 Qwen 3.6 模型的生成速度。設定過程稍微複雜一些,但回報相當實在。
對於不想管理本地硬體的人而言,透過統一平台採用 瀏覽 Qwen 3.6 與其他模型 的方式,可以節省數小時的疑難排解時間。有時候,雲端就是比較簡單。
使用 vLLM 提升吞吐量
vLLM 對這款特定模型而言是顛覆性的工具。它在處理連續批次方面遠勝標準的 llama.cpp。如果你要向多個本地應用程式提供 Qwen API,vLLM 幾乎是必需品。
vLLM 的配置需要正確設定張量平行度。對於雙 GPU 配置,將 TP=2 可確保記憶體負載平均分配。這讓你能使用更大的上下文視窗,而不會耗盡記憶體。
FP8 量化與標準 4 位元量化
量化是將這些大型模型放入消費級硬體的方法。雖然 4 位元(GGUF 或 EXL2)很受歡迎,但 FP8 正逐漸崛起。在複雜的程式碼任務中,它似乎能保留更多模型原始的「智慧」。
如果你有多餘的 VRAM,請務必先嘗試較高的量化等級。當你要求模型解決程式碼中的困難架構問題時,Qwen 3.6 在 Q4 與 Q8 量化版本之間的效能差異是很明顯的。
Qwen 3.6 與業界領先模型的效能比較
讓我們正視房間裡的大象:它比 Claude 好嗎?大多數有經驗的使用者會說不。Claude 3.5 Sonnet 在細膩度,以及不混淆地遵循複雜多步驟指令方面,仍然保持王者地位。
但這不是本地 LLM 的重點。重點在於,Qwen 3.6 足以應付 90% 的任務,而且每個 token 的成本為零。對重視隱私的開發者而言,它是兼具成本效益與強大能力的工具。
查看 Qwen 3.6 基準測試時,你會發現它經常擊敗較舊版本的 Llama 或 Mixtral。它代表中型模型能力的一大躍進,給人的感覺是真正為實務工作者打造的工具。
社群觀感與真實使用者回饋
Reddit 社群對這次發布反應熱烈。大多數人都形容 Qwen 3.6 以其規模而言是「怪獸級」模型。尤其是 27b 模型,其創意寫作能力備受讚賞,而這過去曾是早期 Qwen 版本的弱項。
使用者對它的「風格」仍有一些爭議。有些人覺得它有點過於冗長,另一些人則喜愛它提供的詳細解釋。與其他研究機構較為刻板的模型不同,它確實是一款具有個性的模型。
統一 Qwen API 存取的優點
管理多個本地模型很麻煩。如果你發現自己不斷在模型之間切換,可能會想要 閱讀完整的 API 文件,以使用統一服務。你可以立即將 Qwen 3.6 與其他模型進行測試比較。
GPT Proto 這類平台可以彌合這個差距。你能獲得 35B A3B 的速度,卻不必承受 RTX 5090 在辦公室運作時產生的熱量與噪音。關鍵在於為眼前的特定工作找到合適工具。
最終結論:你應該使用 Qwen 3.6 嗎?
如果你有 24GB VRAM 顯示卡,就沒有理由不將 Qwen 3.6 納入你的模型選擇。它是目前最具能力的本地模型之一。光是程式碼效能,就足以讓它成為開發者必須下載的模型。
對於設備較低階的使用者而言,27b 模型仍值得花力氣進行卸載。只是要做好速度較慢的心理準備。在邏輯與遵循指令方面,它無論如何都勝過 7B 模型。
Qwen 3.6 的效能故事關乎效率。它證明了模型不需要一兆個參數也能發揮作用。有時候,一個經過良好最佳化的 35b MoE 就足以讓你有效率地完成工作。
開始設定你的本地環境
從 Hugging Face 下載 GGUF 或 EXL2 檔案。先從 Q4_K_M 這類中等量化版本開始,感受它在你的硬體上的表現。如果速度有餘裕,再升級到更高量化等級,以獲得更好的邏輯能力。
別忘了更新驅動程式。較新的模型經常依賴最新 CUDA 核心中的最佳化。保持整個技術堆疊更新,確保生成過程不會白白損失 token。
監控使用量與成本
如果你決定將工作流程移轉到託管環境,可以 管理你的 API 計費,以控制成本。本地硬體很棒,但在快速變化的領域中,彈性同樣是重要資產。
無論你選擇本地或雲端,Qwen 3.6 程式碼模型都是一個重要里程碑。它以真正實用的方式,將高階智慧帶到桌面環境。現在正是投入 AI 工作的好時機。
如果你也覺得這款模型像我們一樣實用,不妨分享這個秘密。你可以 加入 GPT Proto 推薦計畫,幫助其他人也發現這些強大工具。這個社群只會越來越壯大。
作者:GPT Proto
「使用 GPT Proto 的統一 API 平台,解鎖全球領先的 AI 模型。」