Schuyler Stacy2026-07-28

Qwen 3.8 Max 與 Kimi K3:哪個已準備好應對實際的程式開發工作?

比較 Qwen 3.8 Max 與 Kimi K3 的程式開發能力、API 定價、上下文、多模態支援與開放權重,了解哪個模型已準備好部署。

Qwen 3.8 Max 與 Kimi K3:哪個已準備好應對實際的程式開發工作?

更新 — 2026 年 7 月 28 日:Moonshot AI 現已發布完整的 Kimi K3 權重、模型卡、自訂授權條款與技術報告。此次發布解決了 Kimi 方面的可用性問題,但並不代表 2.8 兆參數模型容易自行託管:官方儲存庫約為 1.56 TB,且 Moonshot 建議使用 64 個以上加速器的超級節點部署。

 

Qwen 3.8 Max 與 Kimi K3 看似是兩個龐大中國 AI 模型之間的直接競爭:Alibaba 的 2.4 兆參數預覽版,對上 Moonshot AI 的 2.8 兆參數旗艦模型。這些數字容易讓人得出簡單結論:更大的模型應該會勝出。

但現有證據並非如此,而且這也不是對開發者最有用的比較方式。

截至 2026 年 7 月 23 日,Qwen 3.8 Max 仍是透過 Alibaba Token Plan 提供的持續變動預覽版。Kimi K3 已具備有文件記載的 API、公開的 Token 價格、100 萬 Token 的上下文視窗,以及發布完整權重的明確時程。兩者的能力差距可能很小,但產品成熟度差距並不小。

我的判斷很直接:如果你今天需要建立並估算真正的應用程式,Kimi K3 是較安全的選擇。Qwen 3.8 Max Preview 值得在程式開發工作流程中測試,尤其 Alibaba 的促銷 Credits 讓實驗成本很低;但它尚未提供足夠穩定的資訊,無法在生產環境決策中勝出。

重點摘要:目前 Kimi K3 是較安全的生產環境選擇

如果你需要傳統 API、可預測的每 Token 成本、原生圖片與影片理解能力,或現在就能整合到面向客戶產品中的模型,請選擇 Kimi K3。如果你已使用 Alibaba 的程式開發生態系,並希望以低促銷成本測試有潛力的新模型,請選擇 Qwen 3.8 Max Preview。

截至發布時,唯一可取得的詳細配對程式開發測試給予 Kimi K3 83 分、Qwen 3.8 Max 80 分。這 3 分差距是有用的證據,但不是普遍排名。Qwen 在測試中展現更清晰的系統邊界,且工具執行完美;Kimi 則更完整地處理了修訂歷史與重新生成。兩者也都做出了需要事實修正、缺乏支持的推論。

簡單來說:Kimi 目前在部署決策上勝出。Qwen 並未輸掉能力競賽,只是現在宣布它已勝出還為時過早。

目錄

Qwen 3.8 Max 與 Kimi K3 快速比較

類別 Qwen 3.8 Max Kimi K3
目前狀態 qwen3.8-max-preview;可能在預覽期間變更,或由生產版本取代 已發布且具備文件記載 API 存取權的模型
回報的總參數量 2.4T 2.8T
架構細節 尚未公開啟用參數與完整 MoE 配置 KDA、Attention Residuals 與 Stable LatentMoE;896 個專家中啟用 16 個
上下文視窗 目前模型產品頁面未清楚公開 1,048,576 個 Token
文件記載的輸入類型 文字與圖片 文字、圖片與影片
推理 一律開啟;極高;預設為極高 一律開啟;最大;預設為最大
目前存取模式 Alibaba Token Plan,以及支援的程式開發或代理工具 傳統託管 API、Kimi 產品與程式開發工具
一般每 Token 價格 尚未公布 $3/M 新輸入,Moonshot 目前列示價格為 $15/M 輸出
GPT Proto 價格 尚未提供 $2.70/M 輸入與 $13.50/M 輸出
截至 7 月 28 日的開放權重狀態 宣布即將推出「soon」;尚無公開檢查點、日期或授權條款 完整權重已在自訂 Kimi K3 License 下發布於 `moonshotai/Kimi-K3`
自行託管的實際情況 在 Alibaba 發布檢查點與部署指南前,無法評估 技術上可用;但 1.56 TB 儲存庫與 64 個以上加速器的建議,使其成為資料中心部署模型,而非筆電模型
目前最適合的用途 在支援的程式開發工作流程中進行低成本預覽測試 生產環境應用、多模態代理,以及可估算成本的程式開發工作負載
主要風險 預覽行為、存取條款與商業價格可能變更 一律開啟的推理可能增加延遲、輸出 Token 與長工作階段成本

Alibaba 自身的 Token Plan 文件指出,Qwen Preview 可能持續更新,之後也可能被移除或取代。Moonshot 的Kimi K3 公告與 API 指南,對模型及其目前介面公開了更多資訊。

為何目前還不是公平的比較

Qwen 3.8 Max 仍是持續變動的預覽版

Alibaba 將 Qwen 3.8 Max 描述為 2.4T 模型,但目前提供的託管模型明確是qwen3.8-max-preview。這個後綴很重要。Alibaba 表示其能力可能在預覽期間持續升級,且此端點之後可能被移除或由生產版本取代。

因此,目前的每項基準測試都只是特定日期的快照。有用的 Qwen 結果應記錄測試日期、端點、推理等級、代理外殼、工具權限與原始輸出。缺少這些細節時,兩個人可能以為測試的是同一模型,實際上卻取得不同的預覽行為。

存取條款也限制了開發者對低廉發布價格的解讀。Alibaba 的 Personal Token Plan 目前透過以 Credits 為基礎的訂閱提供 Qwen 3.8 Max,但其官方條款限制金鑰只能用於支援的互動式程式開發與代理工具。該方案禁止自動化腳本、自訂應用程式後端與非互動式批次呼叫。

因此,Qwen 可以呼叫,但目前還不是面向客戶應用程式的標準隨用隨付後端。

Kimi K3 已完成開放權重發布

Kimi K3 現在有兩種形式:傳統託管 API 與可下載的檢查點。Moonshot AI 已在官方 `moonshotai/Kimi-K3` 儲存庫發布完整權重,以及模型卡、部署指南、自訂授權條款與 K3 技術報告。

此次發布補充了首次發布比較時尚未提供的細節。K3 每個 Token 啟用 104B 參數,使用 MXFP4 權重與 MXFP8 啟用值,目前記載支援 vLLM、SGLang 與 TokenSpeed。儲存庫由 96 個 safetensors 分片組成,約為 1.56 TB。
這是真正的開放權重發布,但並不等同於不受限制的 MIT 發布,也不是容易在本機安裝的模型。Kimi K3 License 對大型 Model-as-a-Service 企業與超大型商業產品增加了條件,而 Moonshot 建議部署使用 64 個以上加速器的超級節點配置。
簡單來說:Kimi 已消除所有權不確定性,但沒有消除基礎設施成本。

程式開發比較:269 個檔案的測試實際顯示了什麼

目前最佳的正面比較證據,是一項配對 StackPerf 架構測試。兩個模型都收到兩個不熟悉軟體專案的相同唯讀快照,共包含 269 個檔案。它們使用 OpenCode 1.17.13、相同任務指示、相同權限、60 分鐘限制與 65,536 Token 完成上限。編輯、網路存取、外掛程式與子代理均已停用。

最終報告在評分前經過匿名化,之後另行檢查缺乏支持的主張。

測試結果 Qwen 3.8 Max Kimi K3
最終分數 80/100 83/100
工具呼叫 44 53
失敗或遭拒的工具呼叫 0 2 次,之後成功復原
儲存庫引用次數 354 274
驗證後缺乏支持的主張群組 7 7
最明顯的優勢 系統邊界與重播中繼資料 修訂、重新生成與生命週期狀態

Kimi K3 表現較佳之處

Kimi 的報告更完整地建模了編輯生命週期。它追蹤修訂、被取代的版本、重試嘗試、備援歷史、產物雜湊、失效、編輯選擇與裁切。這使其提出的契約更適合這種情境:同一場景可能被生成、拒絕、修訂並再次生成,同時不遺失歷史記錄。

Kimi 也更快完成測試路徑,且使用較少 Token。這對長時間程式開發任務而言令人鼓舞,但結果也包含模型周邊的服務系統。Kimi 透過 Kimi 訂閱端點執行,Qwen 則透過 Alibaba 國際 Token Plan 端點執行。供應商容量、快取與發布期間流量都影響了觀察結果。

我的解讀是,Kimi 贏得這項任務,是因為它更完整地理解狀態變化,而不是因為它寫出了更漂亮的程式碼,或證明自己在每項軟體任務上都更優秀。

Qwen 3.8 Max 表現較佳之處

Qwen 在兩個系統之間劃出了更清晰的界線,並建立了更強的重播記錄。它提出的中繼資料包含模型、種子、提示、參考資料、供應商請求 ID、媒體位置、持續時間與成本。當團隊需要重現輸出,或調查同一工作流程為何在供應商更新後發生變化時,這些欄位都很重要。

它的工具行為也很有紀律:44 次工具呼叫全部成功。Qwen 以較少請求產生了較長的報告,並在盲測中獲得較高的工具使用分數。

這種更清晰架構的代價,是較弱的生命週期建模。它的契約未完整涵蓋場景順序、修訂、取代、重試歷史或版本失效。清晰的邊界很有價值,但當產品狀態持續變化時,光有清晰邊界並不足夠。

這項測試無法證明什麼

一次架構分析執行無法告訴我們哪個模型能產生更好的前端程式碼、修正更多實際錯誤、通過更多測試,或在一個月開發期間需要較少人工修正。它也無法將模型智慧與端點效能分離。

最重要的警告藏在事實審查中:兩個模型都引用了真實的儲存庫位置,但也都產生了 7 組超出程式碼可證明範圍的主張。報告可以包含數百個有效引用,卻仍然得出不安全的結論。

真正的重點是:將任一模型用作工程助理,但不要把任一模型視為自己的審查者。

開發者應如何測試 Qwen 3.8 Max 與 Kimi K3

測試 提供給兩個模型 測量
儲存庫架構審查 相同的凍結提交、架構問題、唯讀工具與時間限制 正確的檔案引用、遺漏的相依性、缺乏支持的主張與審查時間
多檔案實作 相同問題、測試、可寫入檔案與工具權限 通過的測試、變更的檔案、重試、回歸問題與人工修正
視覺前端修復 相同的螢幕截圖、原始檔案、瀏覽器工具與目標行為 視覺匹配程度、有效程式碼、修復迴圈與最終測試結果

保持代理外殼與權限一致。設定固定時間限制。記錄完整模型 ID 與日期,尤其是持續變動的 Qwen Preview。接著記錄任務完成情況、實際耗時、輸入與輸出 Token、快取命中、失敗的工具呼叫、重試、人工介入,以及最終通過的測試。

不要因為答案「看起來很詳盡」就給予高分。確認修補程式是否有效,以及模型的主張是否經得起審查。

對於高價值架構決策,還有一種實用模式:獨立執行兩個模型,在審查時隱藏模型身分,並比較它們的分歧。269 個檔案的測試只有在結合 Qwen 的系統邊界與 Kimi 的生命週期模型後,才產生最強的設計。有時 Qwen 與 Kimi 的正確答案是兩者都使用,然後進行驗證。

Qwen 3.8 Max 與 Kimi K3 的價格與成本

Kimi K3 具備可預測的 Token 價格

Kimi K3 採用一般的 Token 計價。現行的 GPT Proto Kimi K3 API 頁面列示每 100 萬個輸入 Token $2.70、每 100 萬個輸出 Token $13.50,比 Moonshot 目前 $3/$15 的列示價格低 10%。

因此,在測試開始前即可進行基本成本估算:

估計成本 =(輸入 Token ÷ 1,000,000 × $2.70)+(輸出 Token ÷ 1,000,000 × $13.50)

以目前 GPT Proto 價格計算,輸入 200,000 個 Token、輸出 20,000 個 Token 的執行成本約為 $0.81:輸入 $0.54、輸出 $0.27。重試、額外回合、工具結果與保留的推理歷史都會增加總成本。

可預測不代表一定便宜。Kimi 一律進行推理,而推理內容也會計入 Token 使用量。因此,即使可見的最終答案很短,長代理歷史仍可能變得昂貴。

Qwen 3.8 Max 實驗成本較低,但更難預算

Qwen 3.8 Max Preview 目前使用訂閱與 Credits,而不是公開的每百萬 Token 價格。Alibaba 的 Personal Token Plan 為三個級別列出每月促銷價格:人民幣 39 元、139 元與 499 元。預覽期間,Qwen 呼叫可能只消耗標準 Credits 費率的 10%,另有文件記載的限時夜間折扣,適用於 UTC+8 22:00 至 08:00 的呼叫。

這對互動式測試很有吸引力,但不是清晰的成本比較。

Credits 可能因 Token 使用量、快取、推理與工具而異,因此根據目前公開資訊,無法誠實地將人民幣訂閱換算成穩定的$X per 1M tokens數值。Personal Plan 的限制也表示,其促銷經濟效益不代表在自有應用程式後端執行 Qwen 的成本。

Qwen 在低成本 Preview 存取方面勝出;Kimi 在生產環境成本透明度方面勝出。

開放權重與自行託管

Kimi K3 現在相較 Qwen 3.8 Max 具備一項具體優勢:其精確的公開檢查點今天即可下載。Moonshot AI 已發布完整的 2.8T 參數權重、模型卡、授權條款與技術報告。Alibaba 已宣布 Qwen 3.8 Max 將提供開放權重,但確切的 Max 檢查點、發布日期、授權條款與部署需求仍未確認。
「開放」一詞仍需要限定。Kimi K3 是根據自訂 Kimi K3 License 提供的開放權重模型,而不是 MIT。該授權大致允許使用、修改、部署、微調與再分發,但對超過指定營收門檻的 Model-as-a-Service 企業增加個別協議要求,並對超大型商業產品增加署名要求。
硬體是另一個界線。官方 K3 儲存庫約為 1.56 TB,Moonshot 建議使用至少 64 個加速器的超級節點部署。因此,自行託管適合資金充足的基礎設施團隊,而不是開發者工作站上 API 金鑰的替代方案。
如果你想要可預測的 Token 計費且不想管理叢集,請選擇託管的 Kimi K3 API。如果資料控制、自訂推理、微調或部署所有權值得你操作硬體並審查授權條款,請選擇權重。至於 Qwen 3.8 Max,請等 Alibaba 發布實際檢查點後再進行相同評估。

多模態輸入、推理與代理行為

能力 Qwen 3.8 Max Preview Kimi K3
圖片理解 有文件記載 有文件記載
影片理解 未清楚記載為目前模型輸入 有文件記載
思考模式 一律開啟 一律開啟
推理等級 lowhighxhigh lowhighmax
預設推理等級 xhigh max
上下文視窗 目前產品頁面未清楚公開 1,048,576 個 Token
結構化輸出 預覽能力需要持續驗證 已記載 JSON 模式與嚴格 JSON Schema
長工具歷史 行為可能隨預覽版變更 應保留完整的助理訊息,包括推理內容

Qwen 有文件記載的視覺支援,使其適合以螢幕截圖為基礎的除錯。Kimi 更進一步支援影片,當輸入是螢幕錄影、動畫參考或難以逐幀描述的產品示範時,這項能力很有用。

Kimi 文件記載的更豐富介面也增加了整合工作。其 Preserved Thinking 行為意味著,多回合應用程式應傳回完整的助理訊息,包括推理內容與工具呼叫,而不只是保留可見答案。這些歷史會佔用上下文並計費。100 萬 Token 的視窗雖然很大,但並不是免費儲存空間。

兩個模型預設都使用最高推理設定。評估時請保持設定一致;生產環境則應在較簡單的任務上測試較低的推理量。對每次自動完成、分類或短轉換都使用最大推理的模型,可能不如在較低推理量下解決 99% 請求的模型便宜且快速。

你應該選擇哪個模型?

你的情況 目前較佳選擇 原因
現在建立面向客戶的應用程式 Kimi K3 傳統 API 與可預估的 Token 價格
執行含圖片或影片輸入的長儲存庫任務 Kimi K3 100 萬 Token 上下文與有文件記載的圖片/影片支援
在 Qwen Code、Qoder 或其他支援的 Alibaba 工具中測試 Qwen 3.8 Max Preview 低促銷 Credits 消耗
需要穩定且可重複的基準測試 目前選 Kimi K3 Qwen Preview 可能在不同執行期間變更
需要最清晰的架構與重播中繼資料 測試 Qwen 它在配對架構審查中展現了實際優勢
需要強大的修訂與重新生成處理能力 測試 Kimi 在現有配對測試中,它的處理更完整
今天需要可下載的權重 Kimi K3 完整檢查點已公開;Qwen 3.8 Max 仍未發布權重
需要在一個帳戶後方比較多個模型系列 GPT Proto 上的 Kimi K3 一組金鑰與餘額即可存取更廣泛的模型目錄

如果應用程式本週上線,我會選擇 Kimi K3。它已公開足夠資訊,可估算成本、定義整合行為,並針對穩定的模型名稱重複測試。

對於內部程式開發實驗,我不會忽略 Qwen。它的 Preview 在長儲存庫分析中零次工具呼叫失敗,且在配對測試中展現比 Kimi 更佳的架構邊界。這是重要的能力訊號,但尚未構成生產環境契約。

如何透過 GPT Proto 試用 Kimi K3

Qwen 3.8 Max 尚未在 GPT Proto 上提供,因此目前的整合範例僅使用 Kimi K3。你可以透過 GPT Proto 相容 OpenAI 的 Chat Completions 端點,使用kimi-k3模型字串呼叫它:

curl https://gptproto.com/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: $GPTPROTO_API_KEY" \
  -d '{
    "model": "kimi-k3",
    "messages": [
      {
        "role": "user",
        "content": "請審查這份遷移計畫。找出缺乏支持的假設、遺漏的復原步驟,以及上線前所需的測試。"
      }
    ]
  }'

端點與授權結構遵循GPT Proto API 快速入門。對於多回合 Kimi 工作流程,請保留 API 傳回的完整助理訊息,包括推理與工具呼叫欄位,而不是只儲存最終可見文字。

你可以試用 Kimi K3 API瀏覽 200 多個 AI 模型,或使用GPT Proto 統一 AI API來比較 Kimi 與其他文字、圖片、影片及音訊模型。Qwen 3.8 Max 加入後,實用的測試方式是在兩個模型端點上使用相同任務、提示、工具權限與評分方法。

最終結論

Qwen 3.8 Max 與 Kimi K3 的程式開發能力似乎接近,因此不應讓一次小型基準測試決定你下一年的架構。Qwen 更清晰的系統邊界與完美工具執行值得注意;Kimi 更強的生命週期推理與 3 分領先同樣值得注意。

產品決策現在更清楚了。Kimi K3 結合標準 API、公開 Token 價格、有文件記載的 100 萬 Token 上下文視窗、多模態輸入,以及已發布的開放權重檢查點。Qwen 3.8 Max 仍是可變動的 Preview,採用 Credits 存取方式,沒有一般生產環境價格,也沒有公開權重。
無論使用託管 API,還是具備自行管理檢查點的基礎設施,Kimi K3 都是今天較適合部署的模型。Qwen 3.8 Max 仍可能成為更強的模型,但開發者應等待其生產端點、一般價格、模型卡、授權條款與實際權重發布後,再做出這項押注。

創意工作室

使用生產級 API 生成圖像、影片及更多內容。

開始創作
創意工作室
相關模型
全部模型
MoonshotAI
10% OFF
Claude
20% OFF
Google
40% OFF
Google
40% OFF

常見問題

Qwen 3.8 Max 在程式開發方面比 Kimi K3 更好嗎?

目前沒有足夠證據表示 Qwen 3.8 Max 整體上更優秀。在現有的 269 個檔案架構測試中,Kimi K3 得分 83,Qwen 得分 80。Qwen 產生了更清晰的系統邊界,44 次工具呼叫全部成功;Kimi 則更完整地處理修訂與重新生成。請在自己的實作與修復任務上測試兩者後再做選擇。

Qwen 3.8 Max 和 Kimi K3 哪個比較便宜?

目前透過 Alibaba Token Plan 進行促銷實驗時,Qwen 成本較低,但其 Credits 無法換算成公開的每百萬 Token 費率。Kimi 更容易進行生產環境預算。GPTProto 目前列示 Kimi K3 的價格為每 100 萬個輸入 Token $2.70、每 100 萬個輸出 Token $13.50。

Qwen 3.8 Max 與 Kimi K3 是開源模型嗎?

Kimi K3 現在以自訂 Kimi K3 License 提供開放權重。該授權允許廣泛使用與修改,但對大型 Model-as-a-Service 企業及超大型商業產品設有條件,因此不應描述為 MIT。Qwen 3.8 Max 已宣布開放權重,但尚未發布檢查點或授權條款。

Qwen 3.8 Max 可以用於生產環境 API 嗎?

目前的 Qwen 3.8 Max Preview 可透過 Alibaba Token Plan 使用,但 Personal Plan 條款禁止將其金鑰用於自動化腳本、自訂應用程式後端或非互動式批次呼叫。在圍繞它設計面向客戶的後端前,請等待有文件記載的生產環境方案與一般商業價格。

哪個模型更適合長時間程式開發任務?

Kimi K3 是目前較安全的選擇,因為它具備有文件記載的 100 萬 Token 上下文視窗、傳統 API,且在現有配對測試中以較少 Token 完成任務。Qwen 仍值得測試:它在相同的 60 分鐘儲存庫任務中完成工作,且沒有失敗的工具呼叫。長上下文能力本身無法保證任務完成,因此請測量通過的測試、重試次數與人工修正。

Kimi K3 能理解圖片與影片嗎?

可以。Moonshot 記載 Kimi K3 原生支援文字、圖片與影片理解。模型輸出文字,因此適合螢幕截圖除錯、影片分析、介面審查,以及其他多模態程式開發或知識工作任務。

Qwen 3.8 Max 或 Kimi K3 可以在本機執行嗎?

Kimi K3 權重可以下載,但實際自行託管需要資料中心基礎設施:官方儲存庫約為 1.56 TB,Moonshot 建議使用 64 個以上加速器。Qwen 3.8 Max 必須等 Alibaba 發布權重後才能自行託管。

相關文章

更多部落格
Kimi K3 是什麼?真的接近 GPT-5.6 與 Fable 5 嗎?

Kimi K3 是什麼?真的接近 GPT-5.6 與 Fable 5 嗎?

TL;DR Kimi K3 是 Moonshot AI 推出的 2.8 兆參數多模態模型,專為長時間跨度的程式設計、知識工作、推理與代理工作流程打造。獨立測試顯示,它整體表現接近 Claude Opus 4.8 與 GPT-5.5,但 GPT-5.6 Sol 和 Claude Fable 5 仍然領先。K3 在代理基準測試中更加接近頂尖模型,並在部分自動化測試中取得領先,但其測得的幻覺率較 K2.6 上升。 Kimi K3 現已開放權重。Moonshot AI 已發布完整模型檢查點、模型卡、技術報告與自訂 Kimi K3 License。官方 Hugging Face 儲存庫由 96 個 safetensors 分片組成,容量約 1.56 TB;Moonshot 建議使用配備 64 個以上加速器的超級節點部署。開放權重解決了所有權問題,但並不代表 K3 成為一般的本地模型。 對大多數開發者而言,託管 API 仍是最實際的起點。目前, GPTProto 上的 Kimi K3 API 列出的價格為每百萬個輸入 token 2.70 美元,以及每百萬個輸出 token 13.50 美元。當資料控管、自訂推論或模型修改的價值足以抵銷基礎設施成本與授權審查時,再選擇模型權重。 簡而言之,Kimi K3 已足夠接近 GPT-5.6 和 Fable 5,足以加入同一場討論—而如今開放權重的發布,也讓開發者擁有一個這兩個閉源模型都不提供的部署選項。

Michael Johnson | 2026-07-28

GLM-5.2 與 Kimi K3 程式設計比較:2026 年哪個更適合開發者?

GLM-5.2 與 Kimi K3 程式設計比較:2026 年哪個更適合開發者?

TL;DR: 當任務困難、執行時間長或涉及視覺內容時,Kimi K3 是更強的程式設計模型。在 Moonshot 公開的程式設計比較中,它全面領先 GLM-5.2,並可透過其託管服務接受圖片與影片。對於日常的儲存庫工作,GLM-5.2 仍是更好的預設選擇:成本低得多、運行規模較小,且採用寬鬆的 MIT 授權。Kimi K3 現在也已釋出權重,但其 1.56 TB 儲存庫、建議使用 64 個以上加速器的部署要求,以及自訂授權,意味著自行託管需要投入更多資源。當能力是瓶頸時選擇 Kimi;當成本與日常運營簡易性更重要時選擇 GLM。 GLM-5.2 與 Kimi K3 程式碼比較中有趣的地方,不在於兩個模型都能撰寫 React 元件或解決簡短演算法。這個層級的模型早已具備這些能力。真正有用的問題是,當任務變得複雜時會發生什麼:儲存庫稽核、多檔案遷移、只會在螢幕截圖中出現的錯誤,或必須讓多個系統保持一致的可遊玩 Three.js 原型。 這也是價格差異開始產生影響的地方。Kimi K3 在最困難的公開測試中表現較佳,但其官方輸出價格超過 GLM-5.2 的三倍。每天執行數千次普通審查的團隊,使用 GLM 可能能以每美元完成更多工作。試圖挽救一個棘手視覺專案的開發者,則可能很樂意為 K3 買單。

Tiffany Layne | 2026-07-28

Kimi K3 與 GPT-5.6 Sol:更便宜的 Token,還是更便宜的任務?

Kimi K3 與 GPT-5.6 Sol:更便宜的 Token,還是更便宜的任務?

TL;DR 更新 — 2026 年 7 月 28 日 :Kimi K3 的完整權重現已公開。Moonshot AI 已在其官方儲存庫中發布 2.8T checkpoint、技術報告與 Kimi K3 License。此次發布強化了 K3 相較於 GPT-5.6 Sol 在控制權與部署方面的優勢,但不會改變獨立基準測試結果,也不代表自行運行 K3 的成本變低。 Kimi K3 的每個 Token 成本較低。GPT-5.6 Sol 是高風險生產代理程式中更強的預設選擇。這兩個說法可以同時成立。 價格卡所呈現的差距比實際情況更大。在 Artificial Analysis 的測試中,GPT-5.6 Sol max 的 Intelligence Index 得分為 59,而 Kimi K3 為 57。然而,實測每項任務的成本分別約為 Sol 的 1.04 美元與 K3 的 0.95 美元,並不是官方輸出價格所暗示的兩倍差距。 簡短答案是:當整體可靠性、程式設計代理效能,以及 OpenAI 的託管工具堆疊最重要時,選擇 GPT-5.6 Sol 。當影片輸入、長上下文工作、較低的牌價,或已發布的開放權重會影響決策時,選擇 Kimi K3 。

Schuyler Stacy | 2026-07-28

什麼是 Qwen 3.8 Max?發布日期、2.4T 預覽版、價格與早期基準測試

什麼是 Qwen 3.8 Max?發布日期、2.4T 預覽版、價格與早期基準測試

Qwen 3.8 Max 是阿里巴巴推出的新款 2.4 兆參數中國旗艦模型,但目前可用的版本仍稱為 qwen3.8-max-preview 。這個後綴很重要。截至 2026 年 7 月 21 日,阿里巴巴尚未發布正式版模型、技術報告、傳統的按 Token 計價 API 價格或可下載權重。 該預覽版於 7 月 19 日透過阿里巴巴的 Token Plan、Qoder 和 QoderWork 上線。在 官方 Qwen 公告 中,團隊表示 Qwen 3.8 將「很快」開放權重,並稱其能力可媲美領先的前沿模型,僅次於 Fable 5。該排名並未附帶公開的基準測試套件或測試方法。 我的簡短看法是:Qwen 3.8 Max 是一個真實且異常有趣的預覽版,而不是已完成的產品發布。開發者應該進行測試、記錄每項結果的日期,並避免根據阿里巴巴尚未公布的規格來規劃正式環境遷移。

Tiffany Layne | 2026-07-23