Хорош ли MiniMax M3 для программирования? Короткий ответ: да, для агентской работы и задач с несколькими файлами, но есть два нюанса, о которых я сразу скажу, прежде чем вы прочитаете дальше. Большинство громких результатов в тестах программирования были получены MiniMax на собственной инфраструктуре, а заявленный «контекст в 1 миллион токенов» имеет резкий ценовой порог на уровне 512K, который особенно важен для программных агентов. Оба момента легко учитывать, если знать о них заранее. При этом в большинстве публикаций о запуске они освещены недостаточно ясно.
Я пишу это потому, что презентация M3 для программирования свелась к одному числу — 59% в SWE-Bench Pro, — и это число выполняет слишком много непроверенной работы. Ниже я разберу, чем на самом деле является модель, к каким результатам приходят независимые измерения, сколько она стоит при реальной нагрузке программного агента и как вызывать её через API GPTProto. Если вам нужен только вердикт: независимый обозреватель, который прогоняет один и тот же набор тестов на всех серьёзных моделях, поставил M3 «рядом с GPT и Opus в реальном программировании, но ещё не выше них». Это также соответствует результатам нейтральных бенчмарков.
Что такое MiniMax M3 с точки зрения программирования
M3 была запущена 1 июня 2026 года. Это модель Mixture-of-Experts — согласно данным общественных трекеров, изучавших опубликованный чекпойнт, всего в ней примерно 428 млрд параметров, из которых около 23 млрд активны для каждого токена. Однако MiniMax не публиковала собственную полную разбивку параметров, поэтому относитесь к точным цифрам как ко второстепенной информации. Модель изначально мультимодальна (на вход принимает текст, изображения и видео, на выходе выдаёт текст) и поддерживает режим рассуждений, который можно включать для каждого запроса.
Но сначала о мотивации: почему длина контекста вообще важна для модели программирования? Потому что реальная инженерная работа — это не один файл. Это репозиторий, трассировка стека, вывод тестов и три файла, которые нужно изменить для исправления проблемы, — всё это должно достаточно долго находиться в одном месте, чтобы модель могла рассуждать между ними. Ответ M3 — контекстное окно на 1 млн токенов с гарантированно доступным минимумом в 512K токенов. В основе лежит MiniMax Sparse Attention (MSA), которая выбирает блоки key-value-кэша вместо обработки каждой пары токенов. MiniMax сообщает, что при 1 млн токенов это сокращает вычисления на токен примерно до одной двадцатой по сравнению с предыдущим поколением, а предварительное заполнение контекста выполняется примерно в 9 раз быстрее, а декодирование — в 15 раз быстрее. Это данные поставщика об архитектуре, а не независимые измерения, но направление соответствует тому, что должна обеспечивать разреженная attention.
Есть и собственная среда программирования — MiniMax Code, их агент, построенный на этой модели. Полезно знать о её существовании, но эта статья не о ней: вы здесь, чтобы вызывать модель из собственного кода.
Главное: M3 создана для продолжительной многоэтапной работы с большим контекстом, а не для одноразовых фрагментов кода. Эта особенность объясняет почти все описанные ниже компромиссы.
Бенчмарки программирования: что сообщает MiniMax и что измерено независимо
Вот различие, которое большинство обзоров упускает. Слева — заявленные самой MiniMax результаты в программировании и агентских задачах. Справа — измерения нейтральной третьей стороны.
| Источник |
Метрика |
Результат |
| MiniMax (тестирование поставщиком, собственная инфраструктура, обвязка Claude Code) |
SWE-Bench Pro |
59.0% |
| MiniMax |
SWE-Bench Verified |
80.5% |
| MiniMax |
Terminal-Bench 2.1 |
66.0% |
| MiniMax |
SWE-fficiency |
34.8% |
| MiniMax |
KernelBench Hard |
28.8% |
| MiniMax |
MCP Atlas (оркестрация инструментов) |
74.2% |
| Artificial Analysis (независимый источник) |
Intelligence Index (составной индекс) |
55 — №1 в своём классе моделей с открытыми весами |
Есть две вещи, о которых таблица поставщика не расскажет. Во-первых, тот факт, что тестирование проводилось поставщиком, здесь важнее обычного: результат SWE-Bench Pro был получен на собственной конфигурации MiniMax с использованием Claude Code в качестве обвязки, а независимое воспроизведение ещё продолжается. Воспринимайте 59% как сильный сигнал об уровне, на котором конкурирует M3, а не как окончательно установленный результат. Во-вторых — и это деталь, которую я не встретил ни в одной статье, посвящённой программированию, — когда Artificial Analysis сравнил M3 с предшественницей, большинство оценок улучшилось (Humanity's Last Exam 28→37, GPQA Diamond 87→93, рассуждения в длинном контексте 69→74), но SciCode, программная оценка в этом наборе, немного снизилась: с 47 до 45. Это небольшая регрессия, и я бы не стал придавать ей чрезмерное значение. Но это единственная точка данных, которая усложняет красивую историю о «намного лучшем программировании», и показательно, что о ней нигде не упомянули.
Мой вывод: M3 действительно близка к передовому уровню в прикладной разработке ПО — написании патчей, изменениях в нескольких файлах и работе в терминале, — а подтверждение независимым индексом (55, первое место в своём классе) реально, а не является маркетингом. При этом по всем направлениям программирования она не стала качественным скачком по сравнению с предыдущим поколением, и разрыв в абстрактном рассуждении существует (об этом ниже). Вывод: доверяйте уровню, но проверяйте точное число на собственных задачах.
Сколько это на самом деле стоит при нагрузке программирования
Сначала цена, указанная в тарифе, потому что честное сравнение выглядит не так, как в большинстве публикаций. На странице модели GPT Proto M3 стоит $0.48 за миллион входных токенов и $0.96 за миллион выходных токенов на стандартном тарифе.
Для сравнения: собственная эффективная ставка MiniMax — после постоянной скидки 50% от цены в списке — составляет около $0.30 за входные и $1.20 за выходные токены. Поэтому сравнивайте точно, а не просто говорите о «более низкой цене»: при маршрутизации через GPT Proto входные токены стоят дороже, чем при прямом вызове MiniMax, а выходные — дешевле. Какая схема выгоднее, полностью зависит от соотношения чтения и записи в вашей нагрузке. Агент программирования, который загружает большой репозиторий и выдаёт небольшой diff, активно использует входные токены, поэтому именно их ставка определяет стоимость; задача с большим объёмом генерации даёт обратный результат. Причина направлять M3 через агрегатор — не рекламная скидка, а удобство: один ключ и единый OpenAI-совместимый интерфейс для M3 и остального каталога, вместо отдельной учётной записи MiniMax, региональной конечной точки и ключа подписки.
Теперь о том, что действительно определяет счета за программирование, и почему к контексту «1M» нужно добавить звёздочку. Цена остаётся фиксированной только до 512K входных токенов. После этого весь запрос — входные, выходные токены и чтения из кэша — тарифицируется с коэффициентом 2×. Это ступенька, а не плавный градиент. Рассмотрим обычный цикл агента: вы начинаете с 400K входных и 100K выходных токенов, то есть уверенно укладываетесь в порог. Но циклы агента накапливают контекст. К десятому или пятнадцатому шагу ничего не было удалено, и один из шагов незаметно пересекает 512K — после чего весь этот шаг оплачивается в двойном размере, целиком, а не только токены выше порога. Увеличение входного контекста на 20% может более чем вдвое увеличить стоимость вызова.
Рычаг, работающий в обратную сторону, — кэширование: повторно используемый ввод (системный промпт и стабильные части кодовой базы) читается за небольшую долю стандартной цены. В циклах агента значительная часть входных данных может быть кэширована, поэтому стоит подключить это заранее. Вывод: для M3 стоимость программирования определяется объёмом переносимого контекста и качеством его кэширования, а не числом за токен на карточке тарифа. Планируйте бюджет нагрузки, а не ориентируйтесь на цену в списке.
Как вызывать M3 через API GPT Proto
Конечная точка — OpenAI-совместимый интерфейс чата. Аутентификация выполняется с помощью обычного API-ключа в заголовке Authorization — без префикса Bearer, что часто вызывает ошибки у пользователей, привыкших к другим провайдерам. Замените строку модели на MiniMax-M3 — и можно запускать.
import requests, json, glob
# Собираем несколько исходных файлов в один промпт с длинным контекстом.
# Минимум M3 составляет 512K токенов, поэтому десяток файлов помещается без перехода через ценовой порог.
files = glob.glob("src/**/*.py", recursive=True)[:20]
codebase = "\n\n".join(f"# ---- {p} ----\n{open(p).read()}" for p in files)
prompt = (
"Вот часть сервиса на Python. Найдите все места, где соединение с базой данных "
"может остаться открытым при возникновении исключения, и верните исправление в виде unified diff.\n\n"
+ codebase
)
resp = requests.post(
"https://gptproto.com/v1/chat/completions",
headers={
"Authorization": "sk-your-gptproto-key", # обычный ключ, БЕЗ префикса "Bearer"
"Content-Type": "application/json",
},
data=json.dumps({
"model": "MiniMax-M3",
"messages": [{"role": "user", "content": prompt}],
"temperature": 0.2, # по умолчанию 0.95 — уменьшите для детерминированных изменений кода
"stream": False,
}),
timeout=120,
)
print(resp.json()["choices"][0]["message"]["content"])
Два практических замечания. Значение temperature по умолчанию на этом интерфейсе равно 0.95, что много для кода; я бы снизил его до 0.2 или ещё ниже, если вам нужны воспроизводимые diff, а не творческая вариативность. И раскрытие информации: эта конечная точка и схема аутентификации с обычным ключом подтверждены актуальной документацией GPT Proto по моделям MiniMax, при этом строка модели заменена на MiniMax-M3; я лично не тестировал именно этот вызов с M3, поэтому выполните один реальный запрос и проверьте форму ответа, прежде чем подключать его к CI.
«Поддерживает 1M» не означает «следует запускать на 1M»
Важно разделять два утверждения, которые часто смешивают. M3 поддерживает окно в 1 млн токенов. Нужно ли вам заполнять его — другой вопрос, и для программирования ответ обычно отрицательный. У моделей с длинным контекстом есть документированная склонность хорошо учитывать начало и конец промпта, но терять информацию, погребённую в середине; MiniMax утверждает, что M3 специально обучалась для решения этой проблемы, а первые отчёты показывают, что поиск информации сохраняет качество на большей части окна. Однако формулировка «на большей части» здесь действительно важна, и я бы проверил поведение на крайнем объёме на собственных задачах, чувствительных к извлечению информации. Если учесть ценовой порог 512K, рекомендация очевидна: используйте длинный контекст осознанно — для анализа всего репозитория, когда действительно нужно понимание связей между файлами, — а не как свалку по умолчанию для всех имеющихся файлов.
M3 против DeepSeek V4 Pro для программирования
Если вы выбираете между двумя китайскими моделями с открытыми весами передового уровня для программирования, различие довольно ясное. M3 предлагает нативную мультимодальность и окно в 1M — она может принять скриншот сломанного интерфейса вместе с кодом. DeepSeek V4 Pro работает только с текстом, стоит дешевле и показывает сильные результаты в проверенных наборах тестов по разработке ПО. Моя приблизительная формулировка такова: выбирайте M3, когда мультимодальный ввод или очень длинный контекст действительно оправдывают затраты, а DeepSeek — когда вам нужен самый дешёвый способный инструмент для программирования с текстом и не требуется работа с изображениями. Подробное прямое сравнение заслуживает отдельного материала, поэтому здесь я ограничился ключевым критерием и вынес детальный разбор в статью MiniMax M3 против DeepSeek V4 Pro.
Кому стоит использовать M3 для программирования, а кому — нет
Используйте её, если ваша работа агентская и связана с несколькими файлами: патчи в кодовой базе, задачи через терминал, длительные сеансы отладки, где важна история, или процессы, в которых действительно полезно передавать модели скриншот интерфейса. Именно для такого профиля обучалась M3, и это заметно.
Откажитесь от неё или хотя бы тщательно протестируйте в трёх случаях. Если вам нужен абсолютно самый дешёвый инструмент для программирования только с текстом и вы никогда не работаете с изображениями или огромным контекстом, более компактная текстовая модель будет дешевле за токен. Если задача требует настоящего нового абстрактного рассуждения, а не грамотного выполнения — независимый обозреватель, положительно оценивший прикладные навыки M3 в программировании, также отметил её отставание в бенчмарках абстрактного рассуждения, — M3 не раскрывает здесь свою сильную сторону. И если вы планируете самостоятельно размещать веса для коммерческого использования, изучите лицензию до принятия решения: M3 распространяется по MiniMax Community License, которая более ограничительна, чем условия MIT или Apache у некоторых конкурентов, а статус модели с открытыми весами менялся с момента запуска. При использовании API через страницу модели эти лицензионные ограничения не применяются — вы арендуете доступ, а не распространяете веса.