Tiffany Layne2026-07-01

MiniMax M3 與 DeepSeek V4 Pro:價格、基準測試,以及實際該使用哪一個

比較 MiniMax M3 與 DeepSeek V4 Pro 的價格、基準測試與多模態能力。實際該使用哪款中國開放權重模型,以及大多數指南都搞錯的 SWE-bench 陷阱。

MiniMax M3 與 DeepSeek V4 Pro:價格、基準測試,以及實際該使用哪一個

重點摘要 — 這是目前大家都在比較的兩款中國開放權重模型,而誠實的答案是:它們幾乎不是競爭關係。DeepSeek V4 Pro 是純文字演算法專家:它在所有開放權重模型中拿下最高的 SWE-bench Verified 分數(80.6%),而且原生 token 經濟效益很難超越,尤其是在快取命中的情況下。MiniMax M3 則是原生多模態通才:它不只能讀取文字,也能讀取圖片與影片,並且在 Artificial Analysis 的跨模型智慧指數中排名第二。如果你的工作負載是文字、程式碼和日誌,而且在意每個 token 的成本,請選擇 DeepSeek V4 Pro。

如果你的代理程式需要查看螢幕截圖、設計稿或螢幕錄影,請選擇 M3 — DeepSeek 無論價格多低都做不到這件事。兩者現在都提供開放權重,也都支援 1M token 的上下文視窗,因此這並不是大多數比較頁面所描述的「其中一方必須落敗」之戰。

 

目錄

兩款模型,兩種理念

大多數正面比較文章會把這兩款模型並列,彷彿它們只是價格不同的同一種產品。事實並非如此。DeepSeek 在 2026 年 4 月 24 日以 MIT 授權發布 V4 Pro,它是更深入的 專家模型 — 一款純文字混合專家模型,專門針對代理式程式設計與 STEM 推理進行最佳化。MiniMax 則在 2026 年 6 月 1 日發布 M3,它是更廣泛的 通才模型 — 第一款將前沿程式設計、百萬 token 上下文,以及原生圖片與影片輸入整合到單一系統中的開放權重模型。

這個單一差異 — 多模態與純文字的差別 — 比任何基準測試更能決定選擇。因此,在數字出現前,有必要先直白說明:你不是在選擇「更好的模型」,而是在選擇哪種模型形態最適合這項工作。本篇比較的其餘部分,將協助你根據真實資料做出決定,而不是看著排行榜截圖下結論。

並列比較:規格與價格

以下是紙面上的實際情況,採用 GPT Proto 真實的每百萬 token 費率,而不是某篇發布文章中的醒目數字。

  MiniMax M3 DeepSeek V4 Pro
發布日期 2026 年 6 月 1 日 2026 年 4 月 24 日
架構 MoE,總計 428B/啟用 23B MoE,總計 1.6T/啟用 49B
注意力設計 MiniMax 稀疏注意力(MSA) DeepSeek 稀疏注意力(DSA)
上下文視窗 1M tokens 1M tokens(最大輸出 384K)
輸入模態 文字、圖片、影片 僅文字
輸出 文字 文字
授權/權重 開放權重(Hugging Face) MIT,開放權重(Hugging Face)
GPT Proto 輸入價格 $0.48/1M tokens $1.3914/1M tokens
GPT Proto 輸出價格 $0.96/1M tokens $2.7838/1M tokens

表格中有兩件事比其他內容更重要。M3 能接受圖片與影片輸入;DeepSeek 則不能。此外,DeepSeek 每個 token 啟用的參數約為兩倍(49B 對 23B),而總參數池則大近四倍 — 這是一款更厚重、更密集的模型,每個 token 執行更多計算,這會反映在其深度推理分數,以及大多數主機上的價格中。

程式設計與代理式效能

這正是比較通常出錯的地方,因此請仔細閱讀這些數字。

DeepSeek V4 Pro 在最高推理模式下,SWE-bench Verified 得分 80.6% — 在所有開放權重模型中最高,與 Gemini 3.1 Pro 並列。它在 LiveCodeBench 也取得 93.5 分,Codeforces 評分為 3206。這些都是演算法與競賽程式設計方面的優勢,而且 DeepSeek 的分數已被獨立重新測試,這對可信度很重要。

MiniMax M3 的官方程式設計數據包括:SWE-Bench Pro 為 59.0%、Terminal-Bench 2.1 為 66.0%、SWE-fficiency 為 34.8%、KernelBench Hard 為 28.8%,以及 MCP Atlas 為 74.2%。在 Artificial Analysis 的獨立 Intelligence Index 上 — 這是跨模型分數,而非供應商基準測試 — M3 得分 44,在其追蹤的同類模型群組中排名第二,而該類別的中位數約為 25。

現在來看陷阱。你會看到十幾個頁面把 M3 的「59%」與 DeepSeek 的「80.6%」並列,然後宣稱 DeepSeek 是壓倒性的程式設計贏家。這種比較無效。SWE-bench Pro 與 SWE-bench Verified 是兩種不同的基準測試,使用不同的問題集,難度也不同 — Pro 是更困難、更新的版本。將 Pro 分數與 Verified 分數比較,無法告訴你哪個模型更好;這是把單位錯誤打扮成結論。兩個實驗室只是公布了不同的基準測試,而且都沒有在同一項測試上發布乾淨的正面比較。我的看法是:在獨立測量的一般智慧方面,兩者相近;在已發布的深度推理與競賽程式設計分數方面,DeepSeek 更高且驗證更充分;而在任何涉及 查看 事物的任務上,比較根本無從開始,因為只有 M3 做得到。

唯一沒有平手的能力

DeepSeek V4 Pro 僅支援文字。MiniMax M3 從第一個訓練步驟起便以多模態為設計核心,能在同一個端點中接收圖片與影片以及文字。這不是規格表上的附註 — 而是類別上的差異。

如果你正在建構一個能根據螢幕截圖進行除錯、將 Figma 設計稿轉換為元件、讀取圖表,或觀看重現問題的螢幕錄影以找出錯誤的代理程式,M3 可以做到,而 DeepSeek 不行。沒有任何提示、價格或微調能讓純文字模型長出眼睛。因此,對於模型是使用者所見與互動內容一部分的工作流程 — UI 工作、視覺 QA、含圖表文件解析 — 你在查看任何基準測試前就已經做出選擇。反過來說,如果你的管線中從來沒有圖片,你就是在為永遠不會使用的能力付費,而 DeepSeek 的文字專業化會是更精準的選擇。

成本,坦白說

在 GPT Proto 上,兩款模型共用同一筆餘額時,MiniMax M3 便宜一些 — 每百萬 token 的輸入與輸出價格分別為 $0.48 和 $0.96,而 DeepSeek V4 Pro 則為 $1.3914 和 $2.7838。按照 GPT Proto 的費率,M3 在輸入與輸出兩個方向的每個 token 成本約為 V4 Pro 的三分之一。

但如果就此打住,我就會誤導你,因為「哪個比較便宜」很大程度取決於你在哪裡執行每個模型。DeepSeek V4 Pro 的原生經濟效益非常激進,而這種優勢在其他地方託管時不一定能保留:在 DeepSeek 的第一方 API 上,該模型的價格約為每百萬 token 輸入 $0.435、輸出 $0.87,而 — 真正影響帳單的部分 — 快取命中每百萬 token 約 $0.003625,比快取未命中便宜超過一百倍。代理式程式設計迴圈會在每一輪重新傳送相同的系統提示與檔案上下文,因此大部分輸入都會命中快取。如果你要處理大量純文字,並願意原生執行 DeepSeek,這種快取價格確實很難超越,也是 V4 Pro 最有力的單一優勢。

因此,對成本的誠實解讀有兩個層次。透過 GPT Proto 使用一個整合金鑰時,M3 的每 token 價格較低。對於會圍繞 DeepSeek 原生快取費率進行最佳化的大量純文字吞吐量,V4 Pro 的經濟效益則更勝一籌。而在兩者之下還有一點:每 token 價格不等於每任務價格。一款每 token 成本較低、卻需要三次嘗試才能產出可運作修補程式的模型,並不是便宜選項 — 它只是把成本轉移到你的除錯時間。請先在自己的任務上測試兩者,再讓價格表替你做決定。

上下文與效率

兩款模型都支援 1M token 的上下文視窗,而且都透過以稀疏設計取代標準密集注意力來實現 — 但採用的路徑不同,這種差異是真實的,而非表面上的。

DeepSeek 的 DSA 仰賴大量壓縮:在 1M token 設定下,V4 Pro 只需要其前代 V3.2 約 27% 的單 token 推理計算量,以及 10% 的 KV 快取。MiniMax 的 MSA 則對未壓縮的 key-value 進行區塊級選擇;MiniMax 認為,這能避免壓縮式方案在長距離上下文中付出的精度成本;在 1M 上下文下,它將每 token 計算量降低到先前 M2 模型的約 1/20,預填充速度提升超過 9×,解碼速度提升超過 15×。這是我會提醒你雙方說法都帶有供應商框架的地方 — 每個實驗室都將自己的方法描述為沒有取捨的方案。可以確定的是,兩者都是專為長上下文工作而設計,而且在長上下文下每 token 的成本都低到足以讓完整程式碼庫或長文件工作負載變得實用,而不是只停留在理想層面。

社群實際上正在審視什麼

如果你去搜尋人們對這兩款模型的反應 — 許多人在決定採用前都會搜尋「MiniMax M3 vs DeepSeek V4 Pro reddit」— 會發現兩個主題比任何基準測試爭論更常出現,而且都值得認真看待。

第一個是驗證。M3 的發布分數是在 MiniMax 自有基礎設施上,使用其自有代理程式框架測得的;這對發布來說很正常,但開發者在獨立數據出現前,確實會對這類結果打折扣。現在這些數據已開始出現:M3 的開放權重於 6 月 7 日在 Hugging Face 上發布,而 Artificial Analysis 的獨立指數如今也證實,它確實是頂級模型,而不只是基準測試當天的偶然結果。DeepSeek 在這方面一開始就具備優勢 — 其分數很早便由獨立評估者重新測試,而且採 MIT 授權的權重從第一天起就提供給任何人檢查。如果獨立驗證的效能是硬性要求,DeepSeek 仍擁有更長的紀錄,儘管 M3 現在已經縮小了大部分差距。

第二個是「每 token 最便宜」與「完成工作最便宜」是兩個不同的數字。一款寫出看似合理的程式碼、卻漏掉失敗測試的模型並不低成本;它只是把成本推遲到你的審查流程中。這也是為什麼實務工作者的共識不斷落在同一項建議上:根據能力是否適合以及在 你的 工作負載上的可靠性來選擇,讓 token 價格作為平手時的決勝因素,而不是用來做決策。

用同一個金鑰執行任一模型

透過 GPT Proto 呼叫兩款模型的實際優勢,在於切換模型只需修改一行 — 相同金鑰、相同的 OpenAI 相容請求格式,只需更換模型字串。以下是針對 M3 的聊天完成請求,並附上切換至 V4 Pro 的註解:

from openai import OpenAI

client = OpenAI(
    api_key="sk-your-key-here",           # 一個金鑰即可連接兩款模型
    base_url="https://gptproto.com/v1",   # OpenAI 相容閘道
)

def ask(model, prompt):
    resp = client.chat.completions.create(
        model=model,
        messages=[{"role": "user", "content": prompt}],
    )
    return resp.choices[0].message.content

# 純文字推理 — 兩款模型都能處理。
print(ask("deepseek-v4-pro", "請重構這個函式,使其更易讀:\n<貼上程式碼>"))

# 圖片輸入 — 只有 M3 能接收圖片;DeepSeek 僅支援文字。
def ask_with_image(image_url, prompt):
    resp = client.chat.completions.create(
        model="MiniMax-M3",
        messages=[{
            "role": "user",
            "content": [
                {"type": "text", "text": prompt},
                {"type": "image_url", "image_url": {"url": image_url}},
            ],
        }],
    )
    return resp.choices[0].message.content

print(ask_with_image(
    "https://example.com/ui-bug-screenshot.png",
    "這個畫面在行動裝置上顯示錯誤。可能的 CSS 原因是什麼?",
))

使用 cURL 發送相同的第一個請求:

curl https://gptproto.com/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer sk-your-key-here" \
  -d '{
    "model": "deepseek-v4-pro",
    "messages": [
      {"role": "user", "content": "請重構這個函式,使其更易讀。"}
    ]
  }'

要將文字工作從一款模型移至另一款模型,只需變更一個字串 — MiniMax-M3deepseek-v4-pro — 同一個金鑰即可連接兩款模型,以及同一筆餘額中的 200 多款其他模型。如果你還沒有金鑰,請從 GPT Proto 控制面板 建立一個,並在執行批次前查看 價格頁面,確認每款模型目前的確切費率。

你應該使用哪一個?

如果你的工作負載是文字、程式碼、日誌和結構化輸出 — 後端代理程式、大量資料擷取、競賽級演算法問題 — 請使用 DeepSeek V4 Pro。它擁有更高且經驗證的深度推理分數、更深厚的獨立評測紀錄,以及透過快取價格獎勵大量文字處理的原生經濟效益。

如果你的管線中有任何圖片或影片 — UI 除錯、設計轉程式碼、視覺 QA、圖表密集型文件 — 請使用 MiniMax M3,因為它是兩者中唯一能夠「看見」內容的模型,而且在 GPT Proto 上也是每 token 成本較低的選項。

如果你正在建構真正的產品,答案通常是兩者都用:將文字與純推理請求導向 V4 Pro,將視覺請求交給 M3,並讓兩者共用一個金鑰,這樣就不需要維護第二套整合。「MiniMax M3 DeepSeek V4 Pro」對大多數團隊來說是錯誤的框架 — 它們各自專精於不同領域,而最強的配置會在各自擅長之處使用它們。

 

創意工作室

使用生產級 API 生成圖像、影片及更多內容。

開始創作
創意工作室
相關模型
全部模型
MiniMax
20% OFF
DeepSeek
20% OFF
Claude
20% OFF
Google
40% OFF

常見問題

MiniMax M3 與 DeepSeek V4 Pro 的主要差異是什麼?

能力形態。M3 原生支援多模態 — 可接收文字、圖片與影片 — 而 DeepSeek V4 Pro 僅支援文字,但更專精於演算法與推理。兩者都是支援 1M token 上下文視窗的中國開放權重 MoE 模型。

DeepSeek V4 Pro 比 MiniMax M3 更適合程式設計嗎?

在 SWE-bench Verified(80.6%)與 LiveCodeBench(93.5)等已發布且經獨立驗證的分數上,DeepSeek V4 Pro 在文字與演算法程式設計方面領先。但廣泛流傳的 M3 SWE-bench Pro 59% 與 DeepSeek Verified 80.6% 比較是無效的 — 那是不同的基準測試。對於涉及螢幕截圖或 UI 的程式設計,M3 預設勝出,因為 DeepSeek 無法處理圖片。

哪一個比較便宜?

在 GPTProto 上,MiniMax M3(每 1M token 輸入 $0.48/輸出 $0.96)比 DeepSeek V4 Pro($1.3914/$2.7838)便宜。在 DeepSeek 自有的原生 API 上,V4 Pro 的牌價與快取命中價格更低,有利於大量純文字使用。每 token 價格不等於每任務成本 — 請在自己的工作負載上測試兩者。

這些中國模型與 GPT-5.5 或 Claude Opus 等封閉模型相比如何?

兩者都被定位為開放權重替代方案,token 成本僅為封閉模型的一小部分。DeepSeek V4 Pro 的 SWE-bench Verified 分數與頂級模型中的 Gemini 3.1 Pro 並列,而 MiniMax M3 在 Artificial Analysis 的同類模型獨立智慧指數中排名第二。開放權重與較低價格,是相對於封閉模型更廣泛生態系支援所需付出的取捨。

我可以不使用不同帳戶就執行兩款模型嗎?

可以。透過 GPTProto,只需一個 API 金鑰與一個 OpenAI 相容端點,即可在同一筆餘額上連接 MiniMax M3 與 DeepSeek V4 Pro — 切換模型只需修改一行。

相關文章

更多部落格
Doubao API:2026 完整指南 — 該呼叫哪個模型,以及如何呼叫

Doubao API:2026 完整指南 — 該呼叫哪個模型,以及如何呼叫

搜尋「doubao api」後,你很快就會碰壁。官方主控台是火山引擎,頁面預設為中文,而註冊流程要求身分驗證,多數中國境外的開發者無法在一個下午內完成。接著是命名問題:Doubao、Dola、Cici、Seed、Seedream、Seedance、Volcengine——全都屬於 ByteDance,但沒有任何一個名稱能讓人一眼確定它就是你在搜尋框中輸入的東西。 我為 GPTProto 撰寫整合指南,而 Doubao 是我最常被問到的模型家族。因此,這就是我一直希望存在的指南:每個 Doubao 模型適合什麼工作、實際費用是多少,以及如何透過單一端點,以可直接複製貼上的程式碼呼叫文字、圖片和影片模型,過程中不需要中國手機號碼。 以下是 Seedance 2.0 影片模型根據文字提示產生的畫面,呼叫方式與下方程式碼完全相同。我們會逐步說明整個流程。

Schuyler Stacy | 2026-06-23

如何使用 Kling 3.0 Motion Control:開發者指南(Web + API)

如何使用 Kling 3.0 Motion Control:開發者指南(Web + API)

Kling 3.0 Motion Control animates a static character image with the movement from a reference video. You give it two inputs — a picture of your character and a video of someone moving — and it returns a new clip where your character performs that exact choreography while keeping their own face, outfit, and look. This is motion transfer, not text-to-motion. Instead of describing an action in a prompt and hoping the model interprets it, you show it the action frame by frame. That makes it far more reliable for repeatable character animation, dance, and gesture work. This guide covers both paths: the Kling web app for one-off clips, and the GPTProto API for wiring Motion Control into a pipeline. We'll cover inputs and limits, the `pro` vs `std` tiers, prompt technique, full runnable code, pricing, and the failure modes worth knowing before you spend credits.

Michael Johnson | 2026-06-30

什麼是 GLM 5.2?以六分之一的價格實現開放權重編碼

什麼是 GLM 5.2?以六分之一的價格實現開放權重編碼

一家中國實驗室發布了一個可免費下載、可在自有硬體上執行、價格約為封閉式前沿模型六分之一的模型——而且在實際編碼基準測試中,僅落後 Claude Opus 4.8 幾分。接著,他們發布了這個模型,卻沒有公布任何官方基準測試結果。這就是 GLM 5.2,而「沒有行銷數據」與「一週內躍居每個獨立排行榜前列」之間的落差,正是它值得理解的主要原因。 我寫了很多這類解說文章,而大多數新模型文章都令人難忘,因為它們只是重新敘述規格表。但這篇文章在一個對開發者真正重要的面向上有所不同:其權重採用 MIT 授權開放,因此通常的問題——「基準測試是真的,還是行銷話術?」——有了一個異常明確的答案。人們下載了它,並親自進行測試。以下將介紹 GLM 5.2 是什麼、它如何運作,以及它的優勢與限制。

Michael Johnson | 2026-07-15

Claude Fable 5:完整指南與誠實評測(2026)

Claude Fable 5:完整指南與誠實評測(2026)

Anthropic 花了數月警告,其最強大的模型已變得過於危險,不適合廣泛發布。接著,2026 年 6 月 9 日,它還是發布了一個——某種程度上。Claude Fable 5 是 Anthropic 頂級「Mythos」級別中,第一個公眾實際可以呼叫的模型,而且整整高於 Opus 系列一個層級。問題在於一項不尋常的設計:面對一部分敏感問題時,你付費使用的版本會悄悄將請求交給另一個較弱的模型,再由它回答。這個單一的設計決策,已經說明了 Fable 5 大部分的不同之處,因此本指南就從這裡開始。 這是一份供實際工作的開發者使用的指南,而不是發布日回顧。我們從 Anthropic 自身的文件、獨立基準測試,以及發布後出現的第一批實機測試中整理規格與行為——無法驗證的數字則沒有納入。

Schuyler Stacy | 2026-06-11