Schuyler Stacy2026-07-02

MiniMax M3 для программирования: бенчмарки, реальные цены и вызов через API (2026)

Хорош ли MiniMax M3 для программирования? Независимые бенчмарки против заявлений поставщика, реальная стоимость API с объяснением ценового порога 512K и готовый к запуску код GPTProto.

MiniMax M3 для программирования: бенчмарки, реальные цены и вызов через API (2026)

Хорош ли MiniMax M3 для программирования? Короткий ответ: да, для агентской работы и задач с несколькими файлами, но есть два нюанса, о которых я сразу скажу, прежде чем вы прочитаете дальше. Большинство громких результатов в тестах программирования были получены MiniMax на собственной инфраструктуре, а заявленный «контекст в 1 миллион токенов» имеет резкий ценовой порог на уровне 512K, который особенно важен для программных агентов. Оба момента легко учитывать, если знать о них заранее. При этом в большинстве публикаций о запуске они освещены недостаточно ясно.

Я пишу это потому, что презентация M3 для программирования свелась к одному числу — 59% в SWE-Bench Pro, — и это число выполняет слишком много непроверенной работы. Ниже я разберу, чем на самом деле является модель, к каким результатам приходят независимые измерения, сколько она стоит при реальной нагрузке программного агента и как вызывать её через API GPTProto. Если вам нужен только вердикт: независимый обозреватель, который прогоняет один и тот же набор тестов на всех серьёзных моделях, поставил M3 «рядом с GPT и Opus в реальном программировании, но ещё не выше них». Это также соответствует результатам нейтральных бенчмарков.

Содержание

Что такое MiniMax M3 с точки зрения программирования

M3 была запущена 1 июня 2026 года. Это модель Mixture-of-Experts — согласно данным общественных трекеров, изучавших опубликованный чекпойнт, всего в ней примерно 428 млрд параметров, из которых около 23 млрд активны для каждого токена. Однако MiniMax не публиковала собственную полную разбивку параметров, поэтому относитесь к точным цифрам как ко второстепенной информации. Модель изначально мультимодальна (на вход принимает текст, изображения и видео, на выходе выдаёт текст) и поддерживает режим рассуждений, который можно включать для каждого запроса.

Но сначала о мотивации: почему длина контекста вообще важна для модели программирования? Потому что реальная инженерная работа — это не один файл. Это репозиторий, трассировка стека, вывод тестов и три файла, которые нужно изменить для исправления проблемы, — всё это должно достаточно долго находиться в одном месте, чтобы модель могла рассуждать между ними. Ответ M3 — контекстное окно на 1 млн токенов с гарантированно доступным минимумом в 512K токенов. В основе лежит MiniMax Sparse Attention (MSA), которая выбирает блоки key-value-кэша вместо обработки каждой пары токенов. MiniMax сообщает, что при 1 млн токенов это сокращает вычисления на токен примерно до одной двадцатой по сравнению с предыдущим поколением, а предварительное заполнение контекста выполняется примерно в 9 раз быстрее, а декодирование — в 15 раз быстрее. Это данные поставщика об архитектуре, а не независимые измерения, но направление соответствует тому, что должна обеспечивать разреженная attention.

Есть и собственная среда программирования — MiniMax Code, их агент, построенный на этой модели. Полезно знать о её существовании, но эта статья не о ней: вы здесь, чтобы вызывать модель из собственного кода.

Главное: M3 создана для продолжительной многоэтапной работы с большим контекстом, а не для одноразовых фрагментов кода. Эта особенность объясняет почти все описанные ниже компромиссы.

Бенчмарки программирования: что сообщает MiniMax и что измерено независимо

Вот различие, которое большинство обзоров упускает. Слева — заявленные самой MiniMax результаты в программировании и агентских задачах. Справа — измерения нейтральной третьей стороны.

Источник Метрика Результат
MiniMax (тестирование поставщиком, собственная инфраструктура, обвязка Claude Code) SWE-Bench Pro 59.0%
MiniMax SWE-Bench Verified 80.5%
MiniMax Terminal-Bench 2.1 66.0%
MiniMax SWE-fficiency 34.8%
MiniMax KernelBench Hard 28.8%
MiniMax MCP Atlas (оркестрация инструментов) 74.2%
Artificial Analysis (независимый источник) Intelligence Index (составной индекс) 55 — №1 в своём классе моделей с открытыми весами

Есть две вещи, о которых таблица поставщика не расскажет. Во-первых, тот факт, что тестирование проводилось поставщиком, здесь важнее обычного: результат SWE-Bench Pro был получен на собственной конфигурации MiniMax с использованием Claude Code в качестве обвязки, а независимое воспроизведение ещё продолжается. Воспринимайте 59% как сильный сигнал об уровне, на котором конкурирует M3, а не как окончательно установленный результат. Во-вторых — и это деталь, которую я не встретил ни в одной статье, посвящённой программированию, — когда Artificial Analysis сравнил M3 с предшественницей, большинство оценок улучшилось (Humanity's Last Exam 28→37, GPQA Diamond 87→93, рассуждения в длинном контексте 69→74), но SciCode, программная оценка в этом наборе, немного снизилась: с 47 до 45. Это небольшая регрессия, и я бы не стал придавать ей чрезмерное значение. Но это единственная точка данных, которая усложняет красивую историю о «намного лучшем программировании», и показательно, что о ней нигде не упомянули.

Мой вывод: M3 действительно близка к передовому уровню в прикладной разработке ПО — написании патчей, изменениях в нескольких файлах и работе в терминале, — а подтверждение независимым индексом (55, первое место в своём классе) реально, а не является маркетингом. При этом по всем направлениям программирования она не стала качественным скачком по сравнению с предыдущим поколением, и разрыв в абстрактном рассуждении существует (об этом ниже). Вывод: доверяйте уровню, но проверяйте точное число на собственных задачах.

Сколько это на самом деле стоит при нагрузке программирования

Сначала цена, указанная в тарифе, потому что честное сравнение выглядит не так, как в большинстве публикаций. На странице модели GPT Proto M3 стоит $0.48 за миллион входных токенов и $0.96 за миллион выходных токенов на стандартном тарифе.

Для сравнения: собственная эффективная ставка MiniMax — после постоянной скидки 50% от цены в списке — составляет около $0.30 за входные и $1.20 за выходные токены. Поэтому сравнивайте точно, а не просто говорите о «более низкой цене»: при маршрутизации через GPT Proto входные токены стоят дороже, чем при прямом вызове MiniMax, а выходные — дешевле. Какая схема выгоднее, полностью зависит от соотношения чтения и записи в вашей нагрузке. Агент программирования, который загружает большой репозиторий и выдаёт небольшой diff, активно использует входные токены, поэтому именно их ставка определяет стоимость; задача с большим объёмом генерации даёт обратный результат. Причина направлять M3 через агрегатор — не рекламная скидка, а удобство: один ключ и единый OpenAI-совместимый интерфейс для M3 и остального каталога, вместо отдельной учётной записи MiniMax, региональной конечной точки и ключа подписки.

Теперь о том, что действительно определяет счета за программирование, и почему к контексту «1M» нужно добавить звёздочку. Цена остаётся фиксированной только до 512K входных токенов. После этого весь запрос — входные, выходные токены и чтения из кэша — тарифицируется с коэффициентом 2×. Это ступенька, а не плавный градиент. Рассмотрим обычный цикл агента: вы начинаете с 400K входных и 100K выходных токенов, то есть уверенно укладываетесь в порог. Но циклы агента накапливают контекст. К десятому или пятнадцатому шагу ничего не было удалено, и один из шагов незаметно пересекает 512K — после чего весь этот шаг оплачивается в двойном размере, целиком, а не только токены выше порога. Увеличение входного контекста на 20% может более чем вдвое увеличить стоимость вызова.

Рычаг, работающий в обратную сторону, — кэширование: повторно используемый ввод (системный промпт и стабильные части кодовой базы) читается за небольшую долю стандартной цены. В циклах агента значительная часть входных данных может быть кэширована, поэтому стоит подключить это заранее. Вывод: для M3 стоимость программирования определяется объёмом переносимого контекста и качеством его кэширования, а не числом за токен на карточке тарифа. Планируйте бюджет нагрузки, а не ориентируйтесь на цену в списке.

Как вызывать M3 через API GPT Proto

Конечная точка — OpenAI-совместимый интерфейс чата. Аутентификация выполняется с помощью обычного API-ключа в заголовке Authorization — без префикса Bearer, что часто вызывает ошибки у пользователей, привыкших к другим провайдерам. Замените строку модели на MiniMax-M3 — и можно запускать.

import requests, json, glob
 
# Собираем несколько исходных файлов в один промпт с длинным контекстом.
# Минимум M3 составляет 512K токенов, поэтому десяток файлов помещается без перехода через ценовой порог.
files = glob.glob("src/**/*.py", recursive=True)[:20]
codebase = "\n\n".join(f"# ---- {p} ----\n{open(p).read()}" for p in files)
 
prompt = (
    "Вот часть сервиса на Python. Найдите все места, где соединение с базой данных "
    "может остаться открытым при возникновении исключения, и верните исправление в виде unified diff.\n\n"
    + codebase
)
 
resp = requests.post(
    "https://gptproto.com/v1/chat/completions",
    headers={
        "Authorization": "sk-your-gptproto-key",  # обычный ключ, БЕЗ префикса "Bearer"
        "Content-Type": "application/json",
    },
    data=json.dumps({
        "model": "MiniMax-M3",
        "messages": [{"role": "user", "content": prompt}],
        "temperature": 0.2,   # по умолчанию 0.95 — уменьшите для детерминированных изменений кода
        "stream": False,
    }),
    timeout=120,
)
 
print(resp.json()["choices"][0]["message"]["content"])

Два практических замечания. Значение temperature по умолчанию на этом интерфейсе равно 0.95, что много для кода; я бы снизил его до 0.2 или ещё ниже, если вам нужны воспроизводимые diff, а не творческая вариативность. И раскрытие информации: эта конечная точка и схема аутентификации с обычным ключом подтверждены актуальной документацией GPT Proto по моделям MiniMax, при этом строка модели заменена на MiniMax-M3; я лично не тестировал именно этот вызов с M3, поэтому выполните один реальный запрос и проверьте форму ответа, прежде чем подключать его к CI.

«Поддерживает 1M» не означает «следует запускать на 1M»

Важно разделять два утверждения, которые часто смешивают. M3 поддерживает окно в 1 млн токенов. Нужно ли вам заполнять его — другой вопрос, и для программирования ответ обычно отрицательный. У моделей с длинным контекстом есть документированная склонность хорошо учитывать начало и конец промпта, но терять информацию, погребённую в середине; MiniMax утверждает, что M3 специально обучалась для решения этой проблемы, а первые отчёты показывают, что поиск информации сохраняет качество на большей части окна. Однако формулировка «на большей части» здесь действительно важна, и я бы проверил поведение на крайнем объёме на собственных задачах, чувствительных к извлечению информации. Если учесть ценовой порог 512K, рекомендация очевидна: используйте длинный контекст осознанно — для анализа всего репозитория, когда действительно нужно понимание связей между файлами, — а не как свалку по умолчанию для всех имеющихся файлов.

M3 против DeepSeek V4 Pro для программирования

Если вы выбираете между двумя китайскими моделями с открытыми весами передового уровня для программирования, различие довольно ясное. M3 предлагает нативную мультимодальность и окно в 1M — она может принять скриншот сломанного интерфейса вместе с кодом. DeepSeek V4 Pro работает только с текстом, стоит дешевле и показывает сильные результаты в проверенных наборах тестов по разработке ПО. Моя приблизительная формулировка такова: выбирайте M3, когда мультимодальный ввод или очень длинный контекст действительно оправдывают затраты, а DeepSeek — когда вам нужен самый дешёвый способный инструмент для программирования с текстом и не требуется работа с изображениями. Подробное прямое сравнение заслуживает отдельного материала, поэтому здесь я ограничился ключевым критерием и вынес детальный разбор в статью MiniMax M3 против DeepSeek V4 Pro.

Кому стоит использовать M3 для программирования, а кому — нет

Используйте её, если ваша работа агентская и связана с несколькими файлами: патчи в кодовой базе, задачи через терминал, длительные сеансы отладки, где важна история, или процессы, в которых действительно полезно передавать модели скриншот интерфейса. Именно для такого профиля обучалась M3, и это заметно.

Откажитесь от неё или хотя бы тщательно протестируйте в трёх случаях. Если вам нужен абсолютно самый дешёвый инструмент для программирования только с текстом и вы никогда не работаете с изображениями или огромным контекстом, более компактная текстовая модель будет дешевле за токен. Если задача требует настоящего нового абстрактного рассуждения, а не грамотного выполнения — независимый обозреватель, положительно оценивший прикладные навыки M3 в программировании, также отметил её отставание в бенчмарках абстрактного рассуждения, — M3 не раскрывает здесь свою сильную сторону. И если вы планируете самостоятельно размещать веса для коммерческого использования, изучите лицензию до принятия решения: M3 распространяется по MiniMax Community License, которая более ограничительна, чем условия MIT или Apache у некоторых конкурентов, а статус модели с открытыми весами менялся с момента запуска. При использовании API через страницу модели эти лицензионные ограничения не применяются — вы арендуете доступ, а не распространяете веса.

Универсальная творческая студия

Создавайте здесь изображения и видео. API GPTProto обеспечивает быстрые обновления моделей и самые низкие цены.

Начать создание
Универсальная творческая студия
Похожие модели
Все модели
MiniMax
20% OFF
DeepSeek
20% OFF
Claude
20% OFF
Google
40% OFF

Часто задаваемые вопросы

Хорош ли MiniMax M3 для программирования?

Для агентского программирования, задач с несколькими файлами и длинным контекстом — да: в независимом индексе Artificial Analysis она занимает первое место среди моделей с открытыми весами и близка к передовым закрытым моделям в прикладных задачах разработки ПО. Для задач на абстрактное рассуждение и самых дешёвых текстовых сценариев она подходит хуже.

Сколько стоит M3 при использовании через API?

Через GPTProto — $0.48 за миллион входных токенов и $0.96 за миллион выходных токенов на стандартном тарифе. Следите за порогом 512K: запросы выше него тарифицируются с коэффициентом 2× целиком. Актуальные ставки смотрите на странице модели.

Есть ли бесплатный способ попробовать M3?

MiniMax предлагала пробные кредиты напрямую; доступность и рекламные условия часто меняются, поэтому проверяйте актуальные условия у выбранного провайдера, а не доверяйте цифре из статьи в блоге.

Есть ли у MiniMax M3 открытые веса?

MiniMax объявила об открытых весах при запуске и выпустила их по MiniMax Community License, но сторонние трекеры не всегда указывали веса как общедоступные, а ситуация менялась с июня. Если вы планируете самостоятельное размещение, перед началом разработки напрямую проверьте текущую доступность весов и условия лицензии.

M3 или DeepSeek V4 Pro для программирования?

 M3 — для мультимодального ввода и очень длинного контекста; DeepSeek — для самого дешёвого способного программирования только с текстом. Полное сравнение: MiniMax M3 против DeepSeek V4 Pro.

Похожие статьи

Ещё блоги
MiniMax M3 против DeepSeek V4 Pro: цена, бенчмарки и какую модель действительно использовать

MiniMax M3 против DeepSeek V4 Pro: цена, бенчмарки и какую модель действительно использовать

Кратко — это две китайские модели с открытыми весами, которые сейчас сравнивают все, и честный ответ заключается в том, что они едва ли конкурируют. DeepSeek V4 Pro — специализированная алгоритмическая модель для работы исключительно с текстом: она показывает самый высокий результат SWE-bench Verified среди всех моделей с открытыми весами (80,6%), а её нативная экономика токенов особенно выгодна при попаданиях в кэш. MiniMax M3 — нативно мультимодальная универсальная модель: она работает не только с текстом, но также читает изображения и видео, а в индексе интеллекта Artificial Analysis занимает второе место среди разных моделей. Если ваша рабочая нагрузка — это текст, код и логи, а вас волнует стоимость токенов, выбирайте DeepSeek V4 Pro. Если вашему агенту нужно просмотреть скриншот, дизайн-макет или запись экрана, выбирайте M3 — DeepSeek не умеет этого ни за какую цену. Обе модели теперь поставляются с открытыми весами и поддерживают контекстное окно в 1 млн токенов, поэтому это не противостояние в духе «кто-то должен проиграть», каким его обычно представляют на страницах сравнений.

Tiffany Layne | 2026-07-01

Что такое GLM 5.2? Кодинг с открытыми весами за 1/6 цены

Что такое GLM 5.2? Кодинг с открытыми весами за 1/6 цены

Китайская лаборатория выпустила модель, которую можно бесплатно скачать, запустить на собственном оборудовании и использовать примерно за одну шестую стоимости закрытых передовых моделей — при этом на реальных тестах программирования она отстаёт от Claude Opus 4.8 всего на несколько пунктов. А затем выпустила её, не опубликовав ни одного собственного официального бенчмарка. Это GLM 5.2, и разрыв между «никаких маркетинговых цифр» и «почти вершина каждого независимого рейтинга уже через неделю» — именно то, что делает её достойной изучения. Я много пишу подобных объясняющих материалов, и большинство статей о новых моделях быстро забываются, потому что просто пересказывают спецификацию. Эта отличается по одному действительно важному для разработчиков параметру: веса открыты по лицензии MIT, поэтому на обычный вопрос — «бенчмарк настоящий или это маркетинг?» — здесь есть необычно чёткий ответ. Люди скачали модель и протестировали её самостоятельно. Ниже — что такое GLM 5.2, как она работает и где находятся её границы.

Michael Johnson | 2026-07-15

Claude Fable 5: полное руководство и честный обзор (2026)

Claude Fable 5: полное руководство и честный обзор (2026)

Anthropic месяцами предупреждала, что её самые мощные модели становятся слишком опасными для широкого выпуска. А затем 9 июня 2026 года всё же выпустила одну из них — в некотором смысле. Claude Fable 5 — первая модель Anthropic из высшего уровня «Mythos», к которой действительно может обращаться публика, и она стоит на целый уровень выше семейства Opus. Но есть необычный нюанс: для части чувствительных вопросов версия, за которую вы платите, незаметно передаст запрос другой, более слабой модели и получит ответ от неё. Одно это проектное решение многое говорит о том, чем Fable 5 отличается от других моделей, поэтому с него мы и начнём это руководство. Это практическое руководство для разработчиков, а не пересказ запуска в день релиза. Мы собрали характеристики и сведения о поведении модели из собственной документации Anthropic, независимых бенчмарков и первых практических тестов, появившихся после запуска, — и исключили все цифры, которые не смогли проверить.

Schuyler Stacy | 2026-06-11

Claude Sonnet 5: что нового, сколько стоит и чем отличается от Sonnet 4.6 (руководство на 2026 год)

Claude Sonnet 5: что нового, сколько стоит и чем отличается от Sonnet 4.6 (руководство на 2026 год)

Anthropic выпустила Claude Sonnet 5 30 июня 2026 года, и уже через час мои ленты заполнили одни и те же два вопроса: стоит ли переходить с Sonnet 4.6 и действительно ли утверждение о «той же цене, что у 4.6» соответствует действительности, если пропустить через него реальный трафик? Меня интересуют те же вопросы, поэтому это руководство посвящено им, а не подборке ярких моментов из публикации о запуске. Вся техническая информация здесь основана на собственной публикации Anthropic о запуске и документации; если какая-либо цифра взята из сообщений прессы, а не со страницы, которую я мог прочитать напрямую, я это отмечаю. Сразу отмечу, поскольку многие ранние обзоры допускают здесь ошибку: предшественник Sonnet 5 — Sonnet 4.6 (выпущен в феврале 2026 года), а не Sonnet 4.5. Если вы сравниваете его с 4.5 или ещё более старой версией 3.5, вы сравниваете сразу два обновления, поэтому приведённые ниже цифры не будут совпадать. Я ещё вернусь к этому вопросу.

Schuyler Stacy | 2026-07-01