Две модели, две философии
В большинстве сравнительных обзоров эти две модели ставят рядом, будто это один и тот же продукт с разными ценами. Это не так. DeepSeek выпустила V4 Pro 24 апреля 2026 года по лицензии MIT, и это более глубокий специалист — текстовая модель типа mixture-of-experts, тщательно настроенная для агентного программирования и рассуждений в области STEM. MiniMax выпустила M3 1 июня 2026 года, и это более широкая универсальная модель — первая модель с открытыми весами, объединившая передовое программирование, контекст в миллион токенов и нативный ввод изображений и видео в одной системе.
Именно это различие — мультимодальность против работы только с текстом — определяет выбор сильнее любого бенчмарка. Поэтому стоит сказать прямо ещё до того, как мы перейдём к цифрам: вы выбираете не «лучшую модель». Вы выбираете модель, форма которой подходит для конкретной задачи. Остаток этого сравнения посвящён тому, как принять решение на основе реальных данных, а не скриншота таблицы лидеров.
Сравнение: характеристики и цена
Ниже приведены фактические характеристики на бумаге с использованием реальных тарифов GPT Proto за миллион токенов, а не показательной цифры из чьего-то анонса.
| |
MiniMax M3 |
DeepSeek V4 Pro |
| Дата выпуска |
1 июня 2026 года |
24 апреля 2026 года |
| Архитектура |
MoE, всего 428B / активно 23B |
MoE, всего 1.6T / активно 49B |
| Архитектура внимания |
MiniMax Sparse Attention (MSA) |
DeepSeek Sparse Attention (DSA) |
| Контекстное окно |
1 млн токенов |
1 млн токенов (максимум 384K на выходе) |
| Модальности ввода |
текст, изображения, видео |
только текст |
| Вывод |
текст |
текст |
| Лицензия / веса |
Открытые веса (Hugging Face) |
MIT, открытые веса (Hugging Face) |
| Цена ввода GPT Proto |
$0.48 / 1 млн токенов |
$1.3914 / 1 млн токенов |
| Цена вывода GPT Proto |
$0.96 / 1 млн токенов |
$2.7838 / 1 млн токенов |
В этой таблице важнее всего два пункта. M3 принимает изображения и видео; DeepSeek — нет. Кроме того, DeepSeek активирует примерно вдвое больше параметров на токен (49B против 23B) из общего пула, почти в четыре раза большего, — это более тяжёлая и плотная модель, выполняющая больше вычислений для каждого токена. Это отражается на её результатах глубокого рассуждения и, у большинства хостинг-провайдеров, на цене.
Производительность в программировании и агентных задачах
Именно здесь сравнение обычно оказывается некорректным, поэтому внимательно изучите цифры.
DeepSeek V4 Pro в максимальном режиме рассуждений набирает 80,6% в SWE-bench Verified — это лучший результат среди всех моделей с открытыми весами, наравне с Gemini 3.1 Pro. Кроме того, она получает 93,5 балла в LiveCodeBench и рейтинг 3206 на Codeforces. Это сильные стороны в алгоритмах и соревновательном программировании, а результаты DeepSeek были подтверждены независимыми повторными запусками, что важно для доверия к ним.
Официальные результаты MiniMax M3 в программировании составляют 59,0% в SWE-Bench Pro, 66,0% в Terminal-Bench 2.1, 34,8% в SWE-fficiency, 28,8% в KernelBench Hard и 74,2% в MCP Atlas. В независимом индексе интеллекта Artificial Analysis — межмодельной оценке, а не бенчмарке поставщика — M3 получает 44 балла и занимает второе место в отслеживаемой группе аналогичных моделей, при медиане категории около 25.
А теперь ловушка. Вы увидите множество страниц, где рядом стоят «59%» M3 и «80,6%» DeepSeek, после чего DeepSeek объявляют безоговорочным победителем в программировании. Такое сравнение некорректно. SWE-bench Pro и SWE-bench Verified — это два разных бенчмарка с разными наборами задач и уровнем сложности; Pro — более сложная и новая версия. Сравнение результата Pro с результатом Verified ничего не говорит о том, какая модель лучше: это ошибка в единицах измерения, выданная за вывод. Две лаборатории просто сообщили результаты разных бенчмарков, и ни одна из них не опубликовала чистое очное сравнение на одном и том же тесте. Мой вывод таков: по независимо измеренному общему интеллекту модели близки; по опубликованным результатам глубокого рассуждения и соревновательного программирования результаты DeepSeek выше и лучше подтверждены; в любой задаче, где нужно что-то видеть, сравнение даже не начинается, потому что M3 — единственная модель, которая на это способна.
Одна способность, в которой равенства нет
DeepSeek V4 Pro работает только с текстом. MiniMax M3 создавалась мультимодальной с самого первого этапа обучения и принимает изображения и видео наряду с текстом через одну и ту же конечную точку. Это не сноска в таблице характеристик, а различие между категориями.
Если вы создаёте агента, который отлаживает код по скриншоту, превращает макет Figma в компонент, читает диаграмму или просматривает запись экрана с воспроизведением ошибки, M3 справится с этим, а DeepSeek — нет. Никакой промпт, цена или дообучение не дадут зрение текстовой модели. Поэтому для любого процесса, где модель является частью того, что пользователь видит и с чем взаимодействует, — работы с UI, визуального контроля качества, разбора документов с диаграммами — выбор сделан ещё до просмотра первого бенчмарка. И наоборот: если в вашем конвейере никогда не встречаются изображения, вы платите за способность, которой не воспользуетесь, а специализация DeepSeek на тексте становится более целевой покупкой.
Честно о стоимости
В GPT Proto обе модели работают с одного баланса, и MiniMax M3 дешевле: $0.48 за ввод и $0.96 за вывод на миллион токенов против $1.3914 и $2.7838 у DeepSeek V4 Pro. По тарифам GPT Proto M3 стоит примерно треть от стоимости V4 Pro за токен в обоих направлениях.
Но было бы неправильно остановиться на этом, потому что ответ на вопрос «что дешевле» сильно зависит от того, где вы запускаете каждую модель. Собственная нативная экономика DeepSeek для V4 Pro крайне привлекательна, но это преимущество не всегда сохраняется при размещении модели у другого провайдера: в официальном API DeepSeek модель стоит около $0.435 за ввод и $0.87 за вывод на миллион токенов, а — что действительно влияет на счета — попадание в кэш стоит примерно $0.003625 за миллион, то есть более чем в сто раз дешевле промаха кэша. Агентные циклы программирования повторно отправляют один и тот же системный промпт и контекст файлов на каждом шаге, поэтому большая часть ввода попадает в кэш. Если вы обрабатываете большие объёмы чистого текста и готовы запускать DeepSeek через нативный API, такую цену кэширования действительно сложно превзойти, и это самый сильный аргумент в пользу V4 Pro.
Поэтому честный вывод о стоимости состоит из двух частей. При использовании одного агрегированного ключа через GPT Proto M3 имеет более низкую цену за токен. При большом объёме чистого текста, когда вы оптимизируете работу под нативную стоимость попаданий DeepSeek в кэш, экономика V4 Pro оказывается выгоднее. И главное: цена токена — это не цена задачи. Модель, которая стоит меньше за токен, но требует трёх попыток для создания рабочего патча, не является дешёвым вариантом — она просто перенесла стоимость во время отладки. Протестируйте обе модели на собственных задачах, прежде чем позволять таблице цен принимать решение.
Контекст и эффективность
Обе модели используют контекстное окно в 1 млн токенов и достигли этого, отказавшись от стандартного плотного внимания в пользу разреженной архитектуры, — но разными способами, и разница здесь реальна, а не косметична.
DSA DeepSeek опирается на сильное сжатие: в режиме контекста на 1 млн токенов V4 Pro требует лишь около 27% вычислений для инференса одного токена и 10% KV-кэша своего предшественника V3.2. MSA MiniMax вместо этого выполняет выбор на уровне блоков по несжатым key-value, что, по утверждению MiniMax, позволяет избежать потерь точности, которые схемы на основе сжатия платят на большой дистанции; при контексте в 1 млн токенов она сокращает вычисления на токен примерно до 1/20 от предыдущей модели M2, ускоряя предварительное заполнение более чем в 9× и декодирование более чем в 15×. Здесь я бы отметил, что заявления обеих сторон сформулированы поставщиками: каждая лаборатория описывает собственный подход как лишённый компромиссов. Что можно считать надёжным фактом: обе модели специально разработаны для работы с длинным контекстом, и обе достаточно дёшевы за токен при такой длине, чтобы обработка целого репозитория или длинного документа была практичной, а не теоретической.
Что на самом деле изучает сообщество
Если вы ищете реакции на эти две модели — например, по запросу «MiniMax M3 vs DeepSeek V4 Pro reddit», который многие используют перед выбором, — чаще всего всплывают две темы, и обе заслуживают внимания больше, чем очередной спор о бенчмарках.
Первая — проверка результатов. Результаты запуска M3 были получены на собственной инфраструктуре MiniMax с использованием собственного агентного окружения. Для запуска это нормально, но разработчики именно такие данные обычно не принимают всерьёз, пока не появляются независимые цифры. Они уже начали появляться: открытые веса M3 были опубликованы на Hugging Face 7 июня, а независимый индекс Artificial Analysis теперь подтверждает, что это действительно первоклассная модель, а не артефакт одного дня бенчмарка. В этом отношении у DeepSeek было преимущество: её результаты рано перепроверили независимые оценщики, а веса под лицензией MIT были доступны всем желающим с первого дня. Если независимая проверка производительности является обязательным требованием, у DeepSeek по-прежнему более длинная история, хотя M3 уже сократила большую часть разрыва.
Вторая тема — то, что «минимальная цена токена» и «минимальная стоимость завершения задачи» — разные показатели. Модель, которая пишет правдоподобный код, но пропускает падающий тест, не является дешёвой: она перенесла стоимость на вашу проверку. Поэтому практики снова и снова приходят к одному совету: выбирайте по соответствию возможностей и надёжности вашей рабочей нагрузке, а цену токена используйте для разрешения ничьей, а не как главный критерий.
Запускайте любую модель с одним ключом
Практическое преимущество вызова обеих моделей через GPT Proto заключается в том, что переключение выполняется изменением одной строки — тот же ключ, тот же формат запроса, совместимый с OpenAI, и другая строка модели. Ниже приведён запрос chat completion к M3 с закомментированным переключением на V4 Pro:
from openai import OpenAI
client = OpenAI(
api_key="sk-your-key-here", # один ключ обеспечивает доступ к обеим моделям
base_url="https://gptproto.com/v1", # шлюз, совместимый с OpenAI
)
def ask(model, prompt):
resp = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": prompt}],
)
return resp.choices[0].message.content
# Рассуждения только с текстом — с этим справится любая модель.
print(ask("deepseek-v4-pro", "Оптимизируйте эту функцию для повышения читаемости:\n<вставьте код>"))
# Ввод изображения — только M3 может его принять; DeepSeek работает только с текстом.
def ask_with_image(image_url, prompt):
resp = client.chat.completions.create(
model="MiniMax-M3",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": prompt},
{"type": "image_url", "image_url": {"url": image_url}},
],
}],
)
return resp.choices[0].message.content
print(ask_with_image(
"https://example.com/ui-bug-screenshot.png",
"Этот экран неправильно отображается на мобильном устройстве. Какова вероятная причина в CSS?",
))
Тот же первый вызов через cURL:
curl https://gptproto.com/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer sk-your-key-here" \
-d '{
"model": "deepseek-v4-pro",
"messages": [
{"role": "user", "content": "Оптимизируйте эту функцию для повышения читаемости."}
]
}'
Чтобы перенести текстовую задачу с одной модели на другую, достаточно изменить одну строку — MiniMax-M3 или deepseek-v4-pro — и тот же ключ обеспечит доступ к обеим моделям, а также ещё более чем 200 моделям с одного баланса. Если у вас ещё нет ключа, создайте его в панели GPT Proto и перед запуском пакетной обработки проверьте страницу с тарифами, чтобы узнать точную текущую стоимость каждой модели.
Какую модель выбрать?
Если ваша рабочая нагрузка состоит из текста, кода, логов и структурированного вывода — бэкенд-агенты, массовое извлечение данных, алгоритмические задачи соревновательного уровня — используйте DeepSeek V4 Pro. У неё выше подтверждённые результаты глубокого рассуждения, более продолжительная независимая история проверки и нативная экономика, выгодная для больших объёмов текста благодаря кэшированию.
Если в вашем конвейере встречается изображение или видео — отладка UI, преобразование дизайна в код, визуальный контроль качества, документы с большим количеством диаграмм — используйте MiniMax M3, потому что только она из этих двух моделей умеет видеть, а в GPT Proto она также дешевле за токен.
А если вы создаёте что-то настоящее, ответом часто будут обе модели: направляйте текстовые задачи и этапы чистого рассуждения в V4 Pro, визуальные этапы передавайте M3 и запускайте их с одного ключа, чтобы не поддерживать вторую интеграцию. Формулировка «MiniMax M3 или DeepSeek V4 Pro» неверна для большинства команд: это специалисты в разных областях, и самая сильная конфигурация использует каждую там, где она лучше всего справляется.