重點摘要 — 這是目前大家都在比較的兩款中國開放權重模型,而誠實的答案是:它們幾乎不是競爭關係。DeepSeek V4 Pro 是純文字演算法專家:它在所有開放權重模型中拿下最高的 SWE-bench Verified 分數(80.6%),而且原生 token 經濟效益很難超越,尤其是在快取命中的情況下。MiniMax M3 則是原生多模態通才:它不只能讀取文字,也能讀取圖片與影片,並且在 Artificial Analysis 的跨模型智慧指數中排名第二。如果你的工作負載是文字、程式碼和日誌,而且在意每個 token 的成本,請選擇 DeepSeek V4 Pro。
如果你的代理程式需要查看螢幕截圖、設計稿或螢幕錄影,請選擇 M3 — DeepSeek 無論價格多低都做不到這件事。兩者現在都提供開放權重,也都支援 1M token 的上下文視窗,因此這並不是大多數比較頁面所描述的「其中一方必須落敗」之戰。
兩款模型,兩種理念
大多數正面比較文章會把這兩款模型並列,彷彿它們只是價格不同的同一種產品。事實並非如此。DeepSeek 在 2026 年 4 月 24 日以 MIT 授權發布 V4 Pro,它是更深入的 專家模型 — 一款純文字混合專家模型,專門針對代理式程式設計與 STEM 推理進行最佳化。MiniMax 則在 2026 年 6 月 1 日發布 M3,它是更廣泛的 通才模型 — 第一款將前沿程式設計、百萬 token 上下文,以及原生圖片與影片輸入整合到單一系統中的開放權重模型。
這個單一差異 — 多模態與純文字的差別 — 比任何基準測試更能決定選擇。因此,在數字出現前,有必要先直白說明:你不是在選擇「更好的模型」,而是在選擇哪種模型形態最適合這項工作。本篇比較的其餘部分,將協助你根據真實資料做出決定,而不是看著排行榜截圖下結論。
並列比較:規格與價格
以下是紙面上的實際情況,採用 GPT Proto 真實的每百萬 token 費率,而不是某篇發布文章中的醒目數字。
| |
MiniMax M3 |
DeepSeek V4 Pro |
| 發布日期 |
2026 年 6 月 1 日 |
2026 年 4 月 24 日 |
| 架構 |
MoE,總計 428B/啟用 23B |
MoE,總計 1.6T/啟用 49B |
| 注意力設計 |
MiniMax 稀疏注意力(MSA) |
DeepSeek 稀疏注意力(DSA) |
| 上下文視窗 |
1M tokens |
1M tokens(最大輸出 384K) |
| 輸入模態 |
文字、圖片、影片 |
僅文字 |
| 輸出 |
文字 |
文字 |
| 授權/權重 |
開放權重(Hugging Face) |
MIT,開放權重(Hugging Face) |
| GPT Proto 輸入價格 |
$0.48/1M tokens |
$1.3914/1M tokens |
| GPT Proto 輸出價格 |
$0.96/1M tokens |
$2.7838/1M tokens |
表格中有兩件事比其他內容更重要。M3 能接受圖片與影片輸入;DeepSeek 則不能。此外,DeepSeek 每個 token 啟用的參數約為兩倍(49B 對 23B),而總參數池則大近四倍 — 這是一款更厚重、更密集的模型,每個 token 執行更多計算,這會反映在其深度推理分數,以及大多數主機上的價格中。
程式設計與代理式效能
這正是比較通常出錯的地方,因此請仔細閱讀這些數字。
DeepSeek V4 Pro 在最高推理模式下,SWE-bench Verified 得分 80.6% — 在所有開放權重模型中最高,與 Gemini 3.1 Pro 並列。它在 LiveCodeBench 也取得 93.5 分,Codeforces 評分為 3206。這些都是演算法與競賽程式設計方面的優勢,而且 DeepSeek 的分數已被獨立重新測試,這對可信度很重要。
MiniMax M3 的官方程式設計數據包括:SWE-Bench Pro 為 59.0%、Terminal-Bench 2.1 為 66.0%、SWE-fficiency 為 34.8%、KernelBench Hard 為 28.8%,以及 MCP Atlas 為 74.2%。在 Artificial Analysis 的獨立 Intelligence Index 上 — 這是跨模型分數,而非供應商基準測試 — M3 得分 44,在其追蹤的同類模型群組中排名第二,而該類別的中位數約為 25。
現在來看陷阱。你會看到十幾個頁面把 M3 的「59%」與 DeepSeek 的「80.6%」並列,然後宣稱 DeepSeek 是壓倒性的程式設計贏家。這種比較無效。SWE-bench Pro 與 SWE-bench Verified 是兩種不同的基準測試,使用不同的問題集,難度也不同 — Pro 是更困難、更新的版本。將 Pro 分數與 Verified 分數比較,無法告訴你哪個模型更好;這是把單位錯誤打扮成結論。兩個實驗室只是公布了不同的基準測試,而且都沒有在同一項測試上發布乾淨的正面比較。我的看法是:在獨立測量的一般智慧方面,兩者相近;在已發布的深度推理與競賽程式設計分數方面,DeepSeek 更高且驗證更充分;而在任何涉及 查看 事物的任務上,比較根本無從開始,因為只有 M3 做得到。
唯一沒有平手的能力
DeepSeek V4 Pro 僅支援文字。MiniMax M3 從第一個訓練步驟起便以多模態為設計核心,能在同一個端點中接收圖片與影片以及文字。這不是規格表上的附註 — 而是類別上的差異。
如果你正在建構一個能根據螢幕截圖進行除錯、將 Figma 設計稿轉換為元件、讀取圖表,或觀看重現問題的螢幕錄影以找出錯誤的代理程式,M3 可以做到,而 DeepSeek 不行。沒有任何提示、價格或微調能讓純文字模型長出眼睛。因此,對於模型是使用者所見與互動內容一部分的工作流程 — UI 工作、視覺 QA、含圖表文件解析 — 你在查看任何基準測試前就已經做出選擇。反過來說,如果你的管線中從來沒有圖片,你就是在為永遠不會使用的能力付費,而 DeepSeek 的文字專業化會是更精準的選擇。
成本,坦白說
在 GPT Proto 上,兩款模型共用同一筆餘額時,MiniMax M3 便宜一些 — 每百萬 token 的輸入與輸出價格分別為 $0.48 和 $0.96,而 DeepSeek V4 Pro 則為 $1.3914 和 $2.7838。按照 GPT Proto 的費率,M3 在輸入與輸出兩個方向的每個 token 成本約為 V4 Pro 的三分之一。
但如果就此打住,我就會誤導你,因為「哪個比較便宜」很大程度取決於你在哪裡執行每個模型。DeepSeek V4 Pro 的原生經濟效益非常激進,而這種優勢在其他地方託管時不一定能保留:在 DeepSeek 的第一方 API 上,該模型的價格約為每百萬 token 輸入 $0.435、輸出 $0.87,而 — 真正影響帳單的部分 — 快取命中每百萬 token 約 $0.003625,比快取未命中便宜超過一百倍。代理式程式設計迴圈會在每一輪重新傳送相同的系統提示與檔案上下文,因此大部分輸入都會命中快取。如果你要處理大量純文字,並願意原生執行 DeepSeek,這種快取價格確實很難超越,也是 V4 Pro 最有力的單一優勢。
因此,對成本的誠實解讀有兩個層次。透過 GPT Proto 使用一個整合金鑰時,M3 的每 token 價格較低。對於會圍繞 DeepSeek 原生快取費率進行最佳化的大量純文字吞吐量,V4 Pro 的經濟效益則更勝一籌。而在兩者之下還有一點:每 token 價格不等於每任務價格。一款每 token 成本較低、卻需要三次嘗試才能產出可運作修補程式的模型,並不是便宜選項 — 它只是把成本轉移到你的除錯時間。請先在自己的任務上測試兩者,再讓價格表替你做決定。
上下文與效率
兩款模型都支援 1M token 的上下文視窗,而且都透過以稀疏設計取代標準密集注意力來實現 — 但採用的路徑不同,這種差異是真實的,而非表面上的。
DeepSeek 的 DSA 仰賴大量壓縮:在 1M token 設定下,V4 Pro 只需要其前代 V3.2 約 27% 的單 token 推理計算量,以及 10% 的 KV 快取。MiniMax 的 MSA 則對未壓縮的 key-value 進行區塊級選擇;MiniMax 認為,這能避免壓縮式方案在長距離上下文中付出的精度成本;在 1M 上下文下,它將每 token 計算量降低到先前 M2 模型的約 1/20,預填充速度提升超過 9×,解碼速度提升超過 15×。這是我會提醒你雙方說法都帶有供應商框架的地方 — 每個實驗室都將自己的方法描述為沒有取捨的方案。可以確定的是,兩者都是專為長上下文工作而設計,而且在長上下文下每 token 的成本都低到足以讓完整程式碼庫或長文件工作負載變得實用,而不是只停留在理想層面。
社群實際上正在審視什麼
如果你去搜尋人們對這兩款模型的反應 — 許多人在決定採用前都會搜尋「MiniMax M3 vs DeepSeek V4 Pro reddit」— 會發現兩個主題比任何基準測試爭論更常出現,而且都值得認真看待。
第一個是驗證。M3 的發布分數是在 MiniMax 自有基礎設施上,使用其自有代理程式框架測得的;這對發布來說很正常,但開發者在獨立數據出現前,確實會對這類結果打折扣。現在這些數據已開始出現:M3 的開放權重於 6 月 7 日在 Hugging Face 上發布,而 Artificial Analysis 的獨立指數如今也證實,它確實是頂級模型,而不只是基準測試當天的偶然結果。DeepSeek 在這方面一開始就具備優勢 — 其分數很早便由獨立評估者重新測試,而且採 MIT 授權的權重從第一天起就提供給任何人檢查。如果獨立驗證的效能是硬性要求,DeepSeek 仍擁有更長的紀錄,儘管 M3 現在已經縮小了大部分差距。
第二個是「每 token 最便宜」與「完成工作最便宜」是兩個不同的數字。一款寫出看似合理的程式碼、卻漏掉失敗測試的模型並不低成本;它只是把成本推遲到你的審查流程中。這也是為什麼實務工作者的共識不斷落在同一項建議上:根據能力是否適合以及在 你的 工作負載上的可靠性來選擇,讓 token 價格作為平手時的決勝因素,而不是用來做決策。
用同一個金鑰執行任一模型
透過 GPT Proto 呼叫兩款模型的實際優勢,在於切換模型只需修改一行 — 相同金鑰、相同的 OpenAI 相容請求格式,只需更換模型字串。以下是針對 M3 的聊天完成請求,並附上切換至 V4 Pro 的註解:
from openai import OpenAI
client = OpenAI(
api_key="sk-your-key-here", # 一個金鑰即可連接兩款模型
base_url="https://gptproto.com/v1", # OpenAI 相容閘道
)
def ask(model, prompt):
resp = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": prompt}],
)
return resp.choices[0].message.content
# 純文字推理 — 兩款模型都能處理。
print(ask("deepseek-v4-pro", "請重構這個函式,使其更易讀:\n<貼上程式碼>"))
# 圖片輸入 — 只有 M3 能接收圖片;DeepSeek 僅支援文字。
def ask_with_image(image_url, prompt):
resp = client.chat.completions.create(
model="MiniMax-M3",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": prompt},
{"type": "image_url", "image_url": {"url": image_url}},
],
}],
)
return resp.choices[0].message.content
print(ask_with_image(
"https://example.com/ui-bug-screenshot.png",
"這個畫面在行動裝置上顯示錯誤。可能的 CSS 原因是什麼?",
))
使用 cURL 發送相同的第一個請求:
curl https://gptproto.com/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer sk-your-key-here" \
-d '{
"model": "deepseek-v4-pro",
"messages": [
{"role": "user", "content": "請重構這個函式,使其更易讀。"}
]
}'
要將文字工作從一款模型移至另一款模型,只需變更一個字串 — MiniMax-M3 或 deepseek-v4-pro — 同一個金鑰即可連接兩款模型,以及同一筆餘額中的 200 多款其他模型。如果你還沒有金鑰,請從 GPT Proto 控制面板 建立一個,並在執行批次前查看 價格頁面,確認每款模型目前的確切費率。
你應該使用哪一個?
如果你的工作負載是文字、程式碼、日誌和結構化輸出 — 後端代理程式、大量資料擷取、競賽級演算法問題 — 請使用 DeepSeek V4 Pro。它擁有更高且經驗證的深度推理分數、更深厚的獨立評測紀錄,以及透過快取價格獎勵大量文字處理的原生經濟效益。
如果你的管線中有任何圖片或影片 — UI 除錯、設計轉程式碼、視覺 QA、圖表密集型文件 — 請使用 MiniMax M3,因為它是兩者中唯一能夠「看見」內容的模型,而且在 GPT Proto 上也是每 token 成本較低的選項。
如果你正在建構真正的產品,答案通常是兩者都用:將文字與純推理請求導向 V4 Pro,將視覺請求交給 M3,並讓兩者共用一個金鑰,這樣就不需要維護第二套整合。「MiniMax M3 或 DeepSeek V4 Pro」對大多數團隊來說是錯誤的框架 — 它們各自專精於不同領域,而最強的配置會在各自擅長之處使用它們。