Schuyler Stacy2026-07-06

GLM-5.2 и DeepSeek V4 Pro: бенчмарки, цены и какую модель действительно использовать (2026)

GLM-5.2 и DeepSeek V4 Pro: независимые бенчмарки (51 против 44), реальные цены июля 2026 года после снижения стоимости DeepSeek на 75% и модель, подходящая именно вашей рабочей нагрузке.

GLM-5.2 и DeepSeek V4 Pro: бенчмарки, цены и какую модель действительно использовать (2026)

Кратко: Если ваша рабочая нагрузка связана с агентной разработкой с длинным горизонтом — агент часами работает с репозиторием и выпускает готовую функцию, — GLM-5.2 будет более сильной моделью. Если же вам нужны алгоритмы, математика, STEM-рассуждения или высокая пропускная способность при ограниченном бюджете, DeepSeek V4 Pro выигрывает, причём с большим отрывом по цене. В независимом индексе Intelligence Index v4.1 от Artificial Analysis GLM-5.2 (максимальное усилие) набирает 51 балл против 44 у DeepSeek V4 Pro, однако официальная ставка DeepSeek за токен примерно в 3–5 раз ниже. Но есть нюанс, который упускает большинство сравнений: цена за токен и стоимость задачи — не одно и то же. Ниже я покажу почему.

 

Обе эти модели представлены на страницах каталога GLM-5.2 и deepseek-v4-pro на нашей платформе, а вопрос «к какой модели мне направлять запросы» стал одним из самых частых среди разработчиков, запускающих агентов для программирования. В этой статье я постараюсь ответить на него обстоятельно — используя независимые данные бенчмарков там, где они доступны, чётко помечая данные поставщиков там, где их нет, и приводя расчёты стоимости, отражающие реальные расценки DeepSeek в июле 2026 года, а не цены апреля.

Содержание

Сравнение характеристик

  GLM-5.2 DeepSeek V4 Pro
Разработчик Z.ai (ранее Zhipu AI) DeepSeek
Дата выпуска 13 июня 2026 г. 24 апреля 2026 г.
Параметры 753 млрд всего / 40 млрд активных 1,6 трлн всего / 49 млрд активных
Контекстное окно 1 млн токенов 1 млн токенов
Максимальный вывод 131 072 токена 384 тыс. токенов
Лицензия MIT MIT
Режимы рассуждения Высокий / Максимальный Без рассуждений / Высокий / Максимальный
Ввод изображений Нет Нет
Совместимость с API Совместимость с Anthropic Совместимость с OpenAI и Anthropic

На бумаге эти две модели выглядят как близкие родственники: обе китайские, обе — модели Mixture-of-Experts с открытыми весами и лицензией MIT, обе имеют полноценное контекстное окно на 1 млн токенов. Однако лежащие в их основе архитектурные подходы различаются, и это многое объясняет в картине бенчмарков, которую вы увидите далее.

Почему архитектура здесь важна? Потому что окно на 1 млн токенов полезно только в том случае, если модель может позволить себе его использовать. Ответ Z.ai — IndexShare: повторное использование одного и того же индексатора внимания в каждом наборе из четырёх разреженных слоёв внимания. Согласно карточке модели, это снижает вычисления на токен в 2,9× при полном контексте в 1 млн токенов. Ответ DeepSeek — гибридная система внимания, которая, согласно карточке модели, использует 27% FLOPs и 10% KV-кэша своего предшественника V3.2 при той же длине контекста. Проще говоря: GLM-5.2 потратила свой бюджет эффективности на сохранение связности в очень длинных траекториях агента, а DeepSeek — на удешевление обслуживания длинного контекста. Честно говоря, в миниатюре это и есть всё сравнение.

Бенчмарки: что на самом деле говорят цифры

Начнём с единственного доступного независимого показателя, полученного в сопоставимых условиях. Artificial Analysis рассчитывает свой Intelligence Index v4.1 — девять оценок, включая GDPval-AA, Terminal-Bench v2.1, Humanity's Last Exam и GPQA Diamond, — в одинаковых условиях для разных моделей. GLM-5.2 в режиме максимального усилия набирает 51 балл — это самый высокий результат среди моделей с открытыми весами. DeepSeek V4 Pro в режиме максимального усилия рассуждения набирает 44 балла и делит второе место среди открытых моделей с MiniMax-M3. Для сравнения: Claude Opus 4.8 получает 56, а GPT-5.5 — 55. Таким образом, разрыв между этими двумя открытыми моделями реален, но ни одна из них не слишком далека от передовых проприетарных моделей. Это факт, подтверждённый независимым измерением.

Всё ниже этой строки основано на данных поставщиков, и я буду относиться к ним соответственно.

В тех тестах, где таблицы двух поставщиков пересекаются, GLM-5.2 лидирует: SWE-bench Pro — 62,1 против 55,4, MCP-Atlas — 77,0 против 73,6, Humanity's Last Exam с инструментами — 54,7 против 48,2. Важно знать: показатель DeepSeek в SWE-bench Pro не имеет независимой записи в рейтинге Scale SEAL, поэтому разрыв в 6,7 балла полностью основан на данных поставщиков.

Но у DeepSeek есть и бесспорная территория — бенчмарки, результаты по которым GLM-5.2 просто не публиковала. DeepSeek V4 Pro заявляет результат 93,5% в LiveCodeBench — это самый высокий показатель среди всех моделей, открытых и закрытых. Рейтинг Codeforces — 3206. В GPQA Diamond — 90,1%. В HMMT — 95,2%. И 80,6% в SWE-bench Verified — лучший результат среди моделей с открытыми весами. Z.ai полностью пропустила Verified и сразу перешла к более сложному SWE-bench Pro. Моё мнение таково: обе лаборатории проводили тестирование в своих сильных областях и умалчивали о результатах там, где проигрывали, — именно поэтому независимый показатель AA важнее любой отдельной таблицы поставщика.

Есть один нюанс, на который, как мне кажется, не указало ни одно другое сравнение: встречающиеся в сети показатели Terminal-Bench несопоставимы. Z.ai сообщает для GLM-5.2 результат 81,0 в Terminal-Bench 2.1. В карточке модели DeepSeek указано 67,9 в Terminal-Bench 2.0 — это другая версия бенчмарка. Если вы видите статью, где эти два числа стоят в одном столбце, закрывайте вкладку.

Программирование: два разных типа мышления

Честный вывод заключается в том, что эти модели хорошо справляются с разными видами программирования, и различие достаточно чёткое, чтобы выбирать модель на его основе.

GLM-5.2 создана для долгой работы. Согласно данным Z.ai, она набирает 74,4% в FrontierSWE — бенчмарке, измеряющем выполнение открытых инженерных проектов продолжительностью от нескольких часов до десятков часов, — немного опережая GPT-5.5 (72,6%) и отставая менее чем на 1% от Claude Opus 4.8. Её результат 81,0 в Terminal-Bench 2.1 на 19 пунктов выше результата её предшественницы GLM-5.1. Общая картина во всех тестах с длинным горизонтом одинакова: модель обучали удерживать план на протяжении сложной многоэтапной траектории, не теряя нить.

DeepSeek V4 Pro — специалист по алгоритмам. LiveCodeBench проверяет задачи соревновательного программирования — точные, самодостаточные задачи, где результат либо корректен, либо нет, — и ни одна модель в мире не публиковала более высокий результат. Рейтинг Codeforces 3206 и результат 95,2% в HMMT рассказывают ту же историю: если дать полное техническое задание, модель выдаст корректное и компактное решение.

Теперь представим две рабочие нагрузки. «Прочитай этот сервис из 200 файлов, пойми соглашения проекта, предложи и выполни рефакторинг» — это родная стихия GLM-5.2: примерно по 3 тыс. токенов на файл, то есть 200 файлов — это 600 тыс. токенов контекста, которые она действительно может удерживать. «Вот полностью описанная задача, дай мне корректный патч на 200 строк» — DeepSeek выполняет такие задачи весь день за малую долю стоимости.

Обсуждение в сообществе на Hacker News лучше любого бенчмарка отражает этот компромисс. Одна сторона говорит: DeepSeek достаточно дёшев и достаточно хорош для 95% повседневной работы. Возражение другой стороны: в задачах с длинным горизонтом ошибки накапливаются — модель, которая «достаточно хороша в 95% случаев», превращает многочасовой запуск агента в хаос, потому что ошибки в оставшихся 5% складываются. Правы обе стороны. Просто они описывают разные задачи.

Цены: заявленная стоимость против реального счёта

Именно здесь большинство сравнений тихо ошибается, потому что в этом году цены DeepSeek менялись дважды, а в половине статей, которые находятся по этому запросу, до сих пор указаны апрельские расценки.

Сначала — факты. DeepSeek выпустила V4 Pro 24 апреля по базовой цене $1,74 за вход / $3,48 за выход на 1 млн токенов, предоставив скидку 75% на момент запуска. 31 мая эта скидка стала постоянной официальной ценой: $0,435 за вход / $0,87 за выход на 1 млн токенов, а вход с попаданием в кэш стоит $0,0036 за 1 млн токенов (согласно официальной странице цен DeepSeek). Эта ставка особенно важна: DeepSeek автоматически кэширует повторяющиеся префиксы, поэтому агент, повторно отправляющий один и тот же контекст репозитория и системный промпт на каждом шаге, платит за эти токены примерно 1% от ставки без попадания в кэш. Для рабочих нагрузок агентов с активным использованием кэша эффективная стоимость входных данных может оказаться значительно ниже даже заявленных $0,435.

Тариф GLM-5.2 в отдельном API Z.ai составляет $1,40 за вход / $4,40 за выход на 1 млн токенов. (Через наш эндпоинт GLM-5.2 стоимость составляет $1,26 / $3,96 — на 10% ниже базового тарифа.)

Итак, за токен DeepSeek V4 Pro примерно в 3× дешевле на входе и в 5× дешевле на выходе. Дело закрыто? Не совсем — и именно это упускают таблицы с броскими ценами.

Цена за токен и стоимость задачи расходятся, когда две модели тратят разное количество рассуждений на выполнение одной и той же работы. GLM-5.2 много рассуждает: согласно данным Artificial Analysis о потреблении токенов, в режиме максимального усилия на одну задачу Intelligence Index она использует около 42 000 выходных токенов — больше, чем GPT-5.5 в своём максимальном режиме. Посчитаем: 42 тыс. выходных токенов по базовой ставке GLM $4,40 — это примерно $0,18 за выходные данные на задачу. Те же 42 тыс. токенов у DeepSeek по ставке $0,87 стоили бы менее $0,04, однако фактическое потребление токенов DeepSeek на задачу не опубликовано в сопоставимом формате. Поэтому любое соотношение стоимости задачи следует считать оценкой, а не измерением. Направление очевидно, даже если точный коэффициент неизвестен: реальная премия GLM за выполненную задачу — это разница в цене токена, умноженная на её потребность в токенах рассуждений. Планируйте бюджет по счёту, а не по заявленной цене.

Моё мнение, если оно имеет значение: если ограничивающим фактором является стоимость, этот раздел уже помог вам принять решение — и это DeepSeek. Остальная часть статьи предназначена для тех, кого ограничивают возможности модели.

Какая модель подходит вашему проекту?

Вы создаёте агента для программирования на уровне репозитория. Выбирайте GLM-5.2. Независимое лидерство по интеллекту (51 против 44), результаты тестов с длинным горизонтом и контекст в 1 млн токенов, которым модель специально обучали пользоваться связно, указывают в одном направлении. Цена: за задачу вы будете платить в несколько раз больше, а в быстрых и хорошо сформулированных задачах переплачивать за глубину, которая вам не нужна.

Ваша рабочая нагрузка — алгоритмы, математика или STEM-рассуждения. Выбирайте DeepSeek V4 Pro. Её результаты в LiveCodeBench и Codeforces — лучшие из опубликованных, а стоимость составляет $0,87 за 1 млн выходных токенов. Цена: в открытых многочасовых инженерных задачах более низкие результаты на тестах с длинным горизонтом указывают на большее накопление ошибок — именно тот сценарий сбоя, который описывают скептики на HN.

У вас ограниченный бюджет и высокая пропускная способность. DeepSeek, практически без сомнений, — и формулируйте промпты со стабильными префиксами, чтобы ставка $0,0036 за попадание в кэш работала на полную. Цена: вы выбираете открытую модель №2 по общему интеллекту, но в классификации, извлечении данных и стандартном программировании, скорее всего, никогда этого не заметите.

Как получить доступ к обеим моделям через один API

Практический смысл запускать их параллельно заключается в следующем: обе доступны через один эндпоинт с одним ключом, поэтому A/B-тестирование на вашей реальной рабочей нагрузке сводится к изменению одной строки. Обе используют формат чат-комплишенов, совместимый с OpenAI.

import requests
import json
 
url = "https://gptproto.com/v1/chat/completions"
 
def ask(model: str, prompt: str) -> str:
    payload = json.dumps({
        "model": model,
        "messages": [{"role": "user", "content": prompt}],
        "stream": False
    })
    headers = {
        "Authorization": "GPTPROTO_API_KEY",
        "Content-Type": "application/json"
    }
    response = requests.post(url, headers=headers, data=payload)
    return response.json()["choices"][0]["message"]["content"]
 
task = "Сделайте эту функцию идемпотентной: ..."
 
# Один и тот же запрос, две модели — сравните их на своей рабочей нагрузке
print(ask("glm-5.2", task))
print(ask("deepseek-v4-pro", task))

Или с помощью cURL:

curl --location 'https://gptproto.com/v1/chat/completions' \
--header 'Authorization: GPTPROTO_API_KEY' \
--header 'Content-Type: application/json' \
--data '{
  "model": "glm-5.2",
  "messages": [{"role": "user", "content": "Who are you?"}],
  "stream": false
}'

Замените "glm-5.2" на "deepseek-v4-pro", и тот же вызов обратится к другой модели. Полный каталог доступен по адресу gptproto.com/model.

 

Универсальная творческая студия

Создавайте здесь изображения и видео. API GPTProto обеспечивает быстрые обновления моделей и самые низкие цены.

Начать создание
Универсальная творческая студия
Похожие модели
Все модели
Z-AI
by Z-AI
10% OFF
DeepSeek
20% OFF
Claude
20% OFF
Google
40% OFF

FAQ

GLM-5.2 лучше DeepSeek V4 Pro?

Согласно независимым измерениям — да: GLM-5.2 набирает 51 балл в Artificial Analysis Intelligence Index v4.1 против 44 у DeepSeek V4 Pro и лидирует в агентном программировании с длинным горизонтом. DeepSeek V4 Pro сильнее в соревновательном программировании и математике (93,5% в LiveCodeBench, по данным поставщика) и примерно в 3–5 раз дешевле за токен.

Что дешевле: GLM-5.2 или DeepSeek V4 Pro?

DeepSeek V4 Pro, однозначно. Её официальная ставка составляет $0,435 за вход / $0,87 за выход на 1 млн токенов после постоянного снижения цены 31 мая 2026 года, а вход с попаданием в кэш стоит $0,0036. В API Z.ai для GLM-5.2 указаны цены $1,40 / $4,40.

Обе модели поддерживают контекст в 1 млн токенов?

Да. И GLM-5.2, и DeepSeek V4 Pro имеют контекстное окно на 1 млн токенов. GLM-5.2 ограничивает вывод 131 072 токенами, а DeepSeek V4 Pro поддерживает до 384 тыс. выходных токенов.

Можно ли использовать GLM-5.2 или DeepSeek V4 Pro с Claude Code?

Да — обе модели предоставляют эндпоинты, совместимые с Anthropic, поэтому любую из них можно подключить к Claude Code или аналогичным инструментам, изменив базовый URL и название модели.

Похожие статьи

Ещё блоги
Что такое GLM 5.2? Кодинг с открытыми весами за 1/6 цены

Что такое GLM 5.2? Кодинг с открытыми весами за 1/6 цены

Китайская лаборатория выпустила модель, которую можно бесплатно скачать, запустить на собственном оборудовании и использовать примерно за одну шестую стоимости закрытых передовых моделей — при этом на реальных тестах программирования она отстаёт от Claude Opus 4.8 всего на несколько пунктов. А затем выпустила её, не опубликовав ни одного собственного официального бенчмарка. Это GLM 5.2, и разрыв между «никаких маркетинговых цифр» и «почти вершина каждого независимого рейтинга уже через неделю» — именно то, что делает её достойной изучения. Я много пишу подобных объясняющих материалов, и большинство статей о новых моделях быстро забываются, потому что просто пересказывают спецификацию. Эта отличается по одному действительно важному для разработчиков параметру: веса открыты по лицензии MIT, поэтому на обычный вопрос — «бенчмарк настоящий или это маркетинг?» — здесь есть необычно чёткий ответ. Люди скачали модель и протестировали её самостоятельно. Ниже — что такое GLM 5.2, как она работает и где находятся её границы.

Michael Johnson | 2026-07-15

glm 5.1 vs minimax 2.7: Сравнение ИИ для программирования

glm 5.1 vs minimax 2.7: Сравнение ИИ для программирования

Кратко Выбор между glm 5.1 и minimax 2.7 сводится к строгому архитектурному компромиссу: либо вы платите за передовые возможности рассуждения для построения карты глубоких зависимостей, либо отдаёте приоритет огромной пропускной способности при минимальной стоимости токенов. Разработчики регулярно расходуют бюджеты, используя премиальные передовые модели для каждого второстепенного фонового процесса. Такая привычка быстро становится дорогой. Высокий интеллект отлично подходит для создания сложной инфраструктуры приложений с нуля, но совершенно неэффективен, когда нужны тысячи быстрых итераций в рабочем процессе фонового агента. Рынок требует более разумного и продуманного подхода к маршрутизации задач. Внимательный анализ этих двух конкретных систем показывает реальное положение дел в современной разработке ПО. Одна модель имитирует осторожный, порой медленный темп старшего инженера, планирующего схему базы данных. Другая действует как неутомимый младший разработчик, мгновенно обрабатывая повторяющиеся скрипты и циклы проверки без появления предупреждений об ограничениях сессии. Мы проанализировали результаты тестов производительности, тарифные уровни и реальные проблемы пользователей, чтобы точно определить место каждой модели в вашем стеке развертывания. Изучите данные и начните создавать гибридный конвейер, который действительно масштабируется без сбоев.

Schuyler Stacy | 2026-04-07

MiniMax M3 против DeepSeek V4 Pro: цена, бенчмарки и какую модель действительно использовать

MiniMax M3 против DeepSeek V4 Pro: цена, бенчмарки и какую модель действительно использовать

Кратко — это две китайские модели с открытыми весами, которые сейчас сравнивают все, и честный ответ заключается в том, что они едва ли конкурируют. DeepSeek V4 Pro — специализированная алгоритмическая модель для работы исключительно с текстом: она показывает самый высокий результат SWE-bench Verified среди всех моделей с открытыми весами (80,6%), а её нативная экономика токенов особенно выгодна при попаданиях в кэш. MiniMax M3 — нативно мультимодальная универсальная модель: она работает не только с текстом, но также читает изображения и видео, а в индексе интеллекта Artificial Analysis занимает второе место среди разных моделей. Если ваша рабочая нагрузка — это текст, код и логи, а вас волнует стоимость токенов, выбирайте DeepSeek V4 Pro. Если вашему агенту нужно просмотреть скриншот, дизайн-макет или запись экрана, выбирайте M3 — DeepSeek не умеет этого ни за какую цену. Обе модели теперь поставляются с открытыми весами и поддерживают контекстное окно в 1 млн токенов, поэтому это не противостояние в духе «кто-то должен проиграть», каким его обычно представляют на страницах сравнений.

Tiffany Layne | 2026-07-01

DeepSeek V4: характеристики, цены и дата выхода

DeepSeek V4: характеристики, цены и дата выхода

Кратко Предстоящий выпуск deepseek v4 обещает колоссальный скачок до 1 триллиона параметров и контекстного окна в 1 миллион токенов, что фундаментально изменит подход разработчиков к решению сложных задач. Слухи о следующей версии DeepSeek достигли апогея. Разработчики ожидают архитектуру, которая откажется от изолированных моделей для зрения и текста в пользу единого нейронного пути. Это изменение означает более быструю обработку и меньшие вычислительные затраты для текста, изображений и видео. Вам больше не придется объединять разрозненные системы, чтобы получить производительность корпоративного уровня. Масштабирование до таких размеров создает серьезные аппаратные проблемы. Инженерная команда активно разрабатывает собственные системы извлечения памяти, такие как Engram и DeepSeek Sparse Attention, чтобы предотвратить структурный коллапс. Хотя слухи сообщества указывают на запуск в апреле 2026 года, компиляция под специализированное оборудование требует времени. Подготовка полезных нагрузок данных уже сейчас поможет избежать проблем с интеграцией, когда новые конечные точки наконец станут доступны.

Schuyler Stacy | 2026-03-31