重點摘要
MiniMax M3 Pro 尚未發布——這只是據報的計畫,不是產品,目前沒有任何 API 提供商能提供它。
關於它的所有說法都源自一篇獨家報導(The Information,2026 年 7 月 8 日):約 2.7 兆參數、目前僅為內部代號,開源發布目標為 2026 年第三季「最早」。MiniMax 尚未發布任何資訊。
參數數量不是值得關注的重點。真正決定 M3 Pro 是否實用的是啟用參數數量與授權條款,而這兩者都尚未公布。 MiniMax 最近兩款「開放」模型都採用附帶商業限制的自訂社群授權,而不是 Apache 2.0 或 MIT。
即使是 2.7T,幾乎所有人也無法自行託管——目前的 428B 模型已需要八張 GPU 的 B200 級伺服器。對大多數團隊而言,不論是否開放權重,使用這款模型的途徑都是 API。
現在該怎麼做:不要等待。MiniMax M3 已於 2026 年 6 月 1 日發布,在 Artificial Analysis 的 Intelligence Index(55,推理版本)中領先開放權重模型,目前即可呼叫。為 M3 Pro 做準備所需的正確做法只有一行程式碼——將模型 ID 移至設定檔。
大家反覆提到的數字是 2.7 兆。真正決定 MiniMax M3 Pro 是否對你的團隊重要的,卻是尚未有人讀過的 LICENSE 檔中的一項條款,因為它至今尚未發布。
我上週尋找 M3 Pro 的技術分析時,找到了約二十篇文章,卻全都是同一則獨家消息的轉載。沒有一篇回答開發者唯一真正關心的問題:那我星期一該做什麼?這篇文章就是我試圖給出的答案。
開始前先說明一點,因為這裡比平常更重要。全文會標示三種說法:已被報導的內容(來源有限,請謹慎看待)、我認為的內容(我的解讀,歡迎指正),以及推測(我會明確說明)。目前幾乎所有關於 M3 Pro 的文章都把三者混成一種自信的口吻,謠言就這樣變成了路線圖。
什麼是 MiniMax M3 Pro?(目前實際確認的資訊)
MiniMax M3 Pro 是一款尚不存在的大型語言模型——至少目前尚未公開。
據報版本如下:M 系列背後的上海實驗室 MiniMax 正在開發一款約 2.7 兆參數的模型。參與專案的員工在內部稱其為 M3 Pro,但正式名稱可能在發布前變更。公司計畫將其開源,最早可能於 2026 年第三季發布。如果按描述問世,它將成為中國實驗室發布過的最大開放模型。
接著是來源,而這正是轉載文章常略過的部分。上述資訊全部源自 The Information 2026 年 7 月 8 日的一篇獨家報導,消息來自兩名知悉計畫的人士。後續所有報導都由此延伸。MiniMax 自身沒有說過任何事情。我在撰寫當天查閱了公司網站、研究部落格、API 文件及 Hugging Face 組織頁面,這些地方都沒有提到 M3 Pro。
| |
狀態 |
| 總參數 2.7T |
據報(單一來源) |
| 名稱為「M3 Pro」 |
據報——內部代號,可能變更 |
| 開源發布 |
據報為開發計畫 |
| 2026 年第三季時間表 |
據報為「最早」——並非承諾 |
| 啟用參數數量 |
未知 |
| 授權條款 |
未知 |
| 上下文視窗 |
未知 |
| 基準測試結果 |
不存在 |
| 任何 API 均可使用 |
否 |
這張表就是目前誠實的認知狀態。你現在讀到的其他所有 M3 Pro 資訊,包括下文內容,都是建立在這些資料上的推論。
MiniMax M3 Pro 與 MiniMax M3:6 倍躍升實際帶來什麼?
要理解 2.7T 模型為何有趣,必須先了解 MiniMax 已經發布了什麼。
MiniMax M3 於 2026 年 6 月 1 日推出。它是 Mixture-of-Experts 模型,總參數約 4280 億,每個 token 約啟用 230 億。其核心技術是 MSA——MiniMax Sparse Attention,會選取重要的鍵值區塊,而不是對視窗中的每個 token 做注意力運算。這使百萬 token 上下文成為真正可用的功能,而不是規格表上的炫耀:在 1M 上下文下,MSA 將每 token 的計算量降至上一代約二十分之一,prefill 約快 9 倍,decode 約快 15 倍。技術報告位於 arXiv(2606.13392),權重則發布於 Hugging Face。
因此,若據報為 2.7T,M3 Pro 的總參數約為 M3 的 6.3 倍。聽起來很有決定性,但其實不然,原因如下。
| |
MiniMax M3(已發布) |
M3 Pro(據報) |
| 總參數 |
約 428B |
約 2.7T |
| 每 token 的啟用參數 |
約 23B |
未知 |
| 架構 |
MoE + MSA 稀疏注意力 |
未知 |
| 上下文視窗 |
1M(保證最低 512K) |
未知 |
| 發布 |
2026 年 6 月 1 日 |
目標為 2026 年第三季 |
| 權重 |
已發布 |
計畫中 |
在 Mixture-of-Experts 模型中,總參數數量告訴你需要擁有多少記憶體;啟用參數數量則告訴你每個 token 的成本。M3 從 428B 中啟用 23B,約 5%。若 M3 Pro 維持相同比例,啟用參數約為 135B,成本級距將截然不同。若啟用更少,儲存成本高但服務成本低;若啟用更多,則相反。
沒有人報導這個數字。因此,對任何準備依此模型編列預算的人來說,最重要的數字,正是尚未洩漏的數字。
簡單說:總參數告訴你需要購買多少硬體;啟用參數告訴你帳單會是多少。目前只有前者被報導,而且它反而較不實用。
「開源」一詞在這裡承擔了太多意義
這裡我想放慢腳步,因為我認為媒體報導明顯誤解了這一部分。
每個標題都寫著「開源」。這個詞暗示你可以下載模型、以它建立產品並發布。但對 MiniMax 最近的模型而言,這個暗示並不成立。
看看 M3 實際發生了什麼。它的權重以標記為minimax-community的授權發布於 Hugging Face。不是 Apache 2.0,也不是 MIT,而是附帶條件的自訂授權。這些條件在實務上有多大約束力?NVIDIA 發布了自己的 NVFP4 量化版 M3,而其模型卡明確表示,該 checkpoint 僅可供非商業使用,適用條款回指 MiniMax Community License,並要求顯示「Built with MiniMax M3」。
這是 NVIDIA——擁有大型法務部門的公司——閱讀授權後選擇的措辭。
而 M3 的授權還是較寬鬆的版本。前一個版本 M2.7 的條款禁止任何商業用途,除非事先取得 MiniMax 的書面授權。若你喜歡看社群與法務團隊公開協商,值得閱讀該版本在 Hugging Face 上的討論串。MiniMax 因應 M3 放寬了條款,但並未讓它變成真正寬 permissive 的授權。
我不會引用 M3 授權中的具體營收門檻,因為找到的二手來源互相矛盾,而這種細節大致正確反而比保持沉默更糟。在以它建立任何商業產品前,請自行閱讀 LICENSE 檔。這不是免責聲明,而是實際建議。
以下是我的判斷。如果 M3 Pro 採用同一系列授權,「有史以來發布的最大開源模型」對研究人員是頭條新聞,對發布產品的人卻只是一則註腳。可下載權重讓你能審查並自行託管,但不會自動賦予你建立商業的權利。這是兩件不同的事,接下來六個月,許多團隊都可能在這個落差上受到傷害。
即使發布了,你可能也無法執行
假設授權結果很好,假設是 Apache 2.0、所有人都歡呼,仍然有一道高牆。
M3——這款 428B 模型——不是工作站能執行的模型。已記錄的全精度部署需要八張 GPU 的 NVIDIA B200 級系統。這就是目前的模型,也是人們已稱為「大家伙」的模型。
M3 Pro 將大六倍以上。
可下載與可執行是不同的概念。我認為對絕大多數團隊,包括資金充足的團隊而言,M3 Pro 的開放權重會是你讀到的消息,而不是你能託管的東西。量化會有所幫助,但沒有資料中心,無法填補 6 倍的差距。
這就導向一個有些尷尬但我認為正確的結論:對多數開發者而言,M3 Pro 開源或閉源幾乎不會改變決策。無論哪種情況,你都會透過 API 使用它。開放權重對研究人員、國家 AI 策略及進行基準測試的實驗室非常重要;但對下季要發布 coding agent 的人來說,它是新聞標題,不是計畫。
如果你無論如何都會透過 HTTP 呼叫模型,那麼有用的問題就變成:哪些模型能透過一個金鑰和一個餘額存取——這正是完整模型目錄的問題,而不是開放權重問題。
第三季時間表有一項尚未被計入的風險
現在談談我尚未看到任何人連結起來的部分,也要謹慎說明我對它的信心程度。
2026 年 7 月 7 日,Reuters 報導中國商務部曾與國內主要 AI 業者會面,包括 Alibaba、ByteDance 及Z.ai,討論限制海外存取中國最先進 AI 模型。據報討論涵蓋開源及閉源模型、分級授權制度,以及模型蒸餾相關更嚴格的刑事處罰。
The Information 在 2026 年 7 月 8 日發布 M3 Pro 報導,也就是隔天。
這是推測,我特別標示出來:我會把「第三季、開源」視為天氣變化前提交的計畫,而不是可以用來制定路線圖的承諾。一款 2.7 兆參數的前沿開放模型,正是那些商務部討論似乎針對的類別。我沒有任何消息顯示有人要求 MiniMax 放慢腳步;我只是指出兩則報導相隔不到二十四小時,而我讀過的二十篇文章沒有一篇同時提及兩者。
公平地說,這項觀察並不代表中國模型是不好的選擇。M3 現在已上線,經獨立第三方測試,並承載生產流量。更狹義的重點是,把架構押在一款尚未發布的模型上,除了通常的排程風險,還附帶政策風險。任何實驗室都可能如此,只是在這裡更加明顯。
今天實際能建立什麼:透過 API 使用 MiniMax M3
所以,等待 M3 Pro 是個糟糕的計畫。一方面是上述所有原因,另一方面則是 M3 已經非常優秀。
在 Artificial Analysis 的 Intelligence Index(v4.1)上——這項獨立綜合指標涵蓋 GDPval-AA、Terminal-Bench、SciCode、Humanity's Last Exam、GPQA Diamond 等測試——M3 推理版本得分為 55,位居開放權重模型之首,與 GPT-5.5 同級,落後於 Claude Opus 4.8。其分項成績包括 Humanity's Last Exam 37% 及 GPQA Diamond 93%。請注意版本差異:Artificial Analysis 為非推理設定列出較低數值,因此引用比較結果前務必確認所指的是哪個版本。
MiniMax 自行公布的數據——SWE-Bench Pro 59.0%、Terminal-Bench 2.1 66.0%、BrowseComp 83.5——由供應商報告,並在實驗室自己的基礎設施上執行。可將其視為方向性參考,但尚未經獨立驗證。
在 GPT Proto 上呼叫 M3 時,端點遵循 OpenAI chat 格式。有一個忽略後會浪費你二十分鐘的陷阱:API 金鑰要直接放入Authorization標頭,直接傳入,不要加上Bearer前綴。大多數 SDK 會自動加入該前綴。
第一次呼叫,cURL:
curl 程式碼範例https://gptproto.com/v1/chat/completions
Python 使用requests,讓驗證標頭清楚明確:
Python 程式碼範例https://gptproto.com/v1/chat/completions
如果偏好 OpenAI SDK,請將base_url指向https://gptproto.com/v1,並覆寫標頭,而不要將金鑰傳給api_key,否則用戶端會替你加上Bearer前綴。
價格方面,MiniMax M3 模型頁面列出的價格是每 100 萬輸入 token 0.48 美元、每 100 萬輸出 token 0.96 美元。這就是數字;我刻意不把它轉成節省百分比,因為真正的比較取決於輸入與輸出比例,某些設定下結果可能完全相反。
真正可能讓你意外的成本細節不是每 token 費率,而是上下文斷層。M3 的視窗為 1M token,但保證最低值是 512K——在 MiniMax 第一方定價中,輸入超過 512K 後,整個請求會以標準費率的兩倍計價,不只是超出的部分。600K token 請求不是比 500K 稍貴,而是所有 token 都大約以兩倍單價計算。
這對 agent 循環尤其重要,因為上下文會逐輪累積而沒有被裁剪。到第十五輪時,你可能不是因為單一步驟需要一百萬 token,而是因為從未清理上下文,才開始支付長上下文費率。請裁剪上下文;這對帳單的影響比你選哪個模型更大。(如果你正在評估 M3 的 coding 工作負載,我們在另一篇文章中深入探討了基準測試與定價計算。)
如果 M3 Pro 發布,對你有什麼改變?
如果現在正確設定,影響會比你想像中小。
在聚合層,切換模型只需修改字串:
設定檔中的模型 ID
假設請求格式維持 OpenAI 相容,這就是完整的遷移方式——截至目前,每個 M 系列版本都是如此。
因此,坦白說明這項建議的代價:不要為一款沒有公布規格、授權、基準測試及確定發布日期的模型重新設計架構。為 M3 Pro 做的正確準備只有一行——將模型 ID 移至設定檔,不要硬編碼。除此之外都是圍繞謠言規劃。
一句話總結:M3 Pro 是值得關注但不值得等待的據報計畫;M3 則是已發布、位居開放權重排行榜前列、今天即可呼叫的模型。