Сравнение характеристик
| |
GLM-5.2 |
DeepSeek V4 Pro |
| Разработчик |
Z.ai (ранее Zhipu AI) |
DeepSeek |
| Дата выпуска |
13 июня 2026 г. |
24 апреля 2026 г. |
| Параметры |
753 млрд всего / 40 млрд активных |
1,6 трлн всего / 49 млрд активных |
| Контекстное окно |
1 млн токенов |
1 млн токенов |
| Максимальный вывод |
131 072 токена |
384 тыс. токенов |
| Лицензия |
MIT |
MIT |
| Режимы рассуждения |
Высокий / Максимальный |
Без рассуждений / Высокий / Максимальный |
| Ввод изображений |
Нет |
Нет |
| Совместимость с API |
Совместимость с Anthropic |
Совместимость с OpenAI и Anthropic |
На бумаге эти две модели выглядят как близкие родственники: обе китайские, обе — модели Mixture-of-Experts с открытыми весами и лицензией MIT, обе имеют полноценное контекстное окно на 1 млн токенов. Однако лежащие в их основе архитектурные подходы различаются, и это многое объясняет в картине бенчмарков, которую вы увидите далее.
Почему архитектура здесь важна? Потому что окно на 1 млн токенов полезно только в том случае, если модель может позволить себе его использовать. Ответ Z.ai — IndexShare: повторное использование одного и того же индексатора внимания в каждом наборе из четырёх разреженных слоёв внимания. Согласно карточке модели, это снижает вычисления на токен в 2,9× при полном контексте в 1 млн токенов. Ответ DeepSeek — гибридная система внимания, которая, согласно карточке модели, использует 27% FLOPs и 10% KV-кэша своего предшественника V3.2 при той же длине контекста. Проще говоря: GLM-5.2 потратила свой бюджет эффективности на сохранение связности в очень длинных траекториях агента, а DeepSeek — на удешевление обслуживания длинного контекста. Честно говоря, в миниатюре это и есть всё сравнение.
Бенчмарки: что на самом деле говорят цифры
Начнём с единственного доступного независимого показателя, полученного в сопоставимых условиях. Artificial Analysis рассчитывает свой Intelligence Index v4.1 — девять оценок, включая GDPval-AA, Terminal-Bench v2.1, Humanity's Last Exam и GPQA Diamond, — в одинаковых условиях для разных моделей. GLM-5.2 в режиме максимального усилия набирает 51 балл — это самый высокий результат среди моделей с открытыми весами. DeepSeek V4 Pro в режиме максимального усилия рассуждения набирает 44 балла и делит второе место среди открытых моделей с MiniMax-M3. Для сравнения: Claude Opus 4.8 получает 56, а GPT-5.5 — 55. Таким образом, разрыв между этими двумя открытыми моделями реален, но ни одна из них не слишком далека от передовых проприетарных моделей. Это факт, подтверждённый независимым измерением.
Всё ниже этой строки основано на данных поставщиков, и я буду относиться к ним соответственно.
В тех тестах, где таблицы двух поставщиков пересекаются, GLM-5.2 лидирует: SWE-bench Pro — 62,1 против 55,4, MCP-Atlas — 77,0 против 73,6, Humanity's Last Exam с инструментами — 54,7 против 48,2. Важно знать: показатель DeepSeek в SWE-bench Pro не имеет независимой записи в рейтинге Scale SEAL, поэтому разрыв в 6,7 балла полностью основан на данных поставщиков.
Но у DeepSeek есть и бесспорная территория — бенчмарки, результаты по которым GLM-5.2 просто не публиковала. DeepSeek V4 Pro заявляет результат 93,5% в LiveCodeBench — это самый высокий показатель среди всех моделей, открытых и закрытых. Рейтинг Codeforces — 3206. В GPQA Diamond — 90,1%. В HMMT — 95,2%. И 80,6% в SWE-bench Verified — лучший результат среди моделей с открытыми весами. Z.ai полностью пропустила Verified и сразу перешла к более сложному SWE-bench Pro. Моё мнение таково: обе лаборатории проводили тестирование в своих сильных областях и умалчивали о результатах там, где проигрывали, — именно поэтому независимый показатель AA важнее любой отдельной таблицы поставщика.
Есть один нюанс, на который, как мне кажется, не указало ни одно другое сравнение: встречающиеся в сети показатели Terminal-Bench несопоставимы. Z.ai сообщает для GLM-5.2 результат 81,0 в Terminal-Bench 2.1. В карточке модели DeepSeek указано 67,9 в Terminal-Bench 2.0 — это другая версия бенчмарка. Если вы видите статью, где эти два числа стоят в одном столбце, закрывайте вкладку.
Программирование: два разных типа мышления
Честный вывод заключается в том, что эти модели хорошо справляются с разными видами программирования, и различие достаточно чёткое, чтобы выбирать модель на его основе.
GLM-5.2 создана для долгой работы. Согласно данным Z.ai, она набирает 74,4% в FrontierSWE — бенчмарке, измеряющем выполнение открытых инженерных проектов продолжительностью от нескольких часов до десятков часов, — немного опережая GPT-5.5 (72,6%) и отставая менее чем на 1% от Claude Opus 4.8. Её результат 81,0 в Terminal-Bench 2.1 на 19 пунктов выше результата её предшественницы GLM-5.1. Общая картина во всех тестах с длинным горизонтом одинакова: модель обучали удерживать план на протяжении сложной многоэтапной траектории, не теряя нить.
DeepSeek V4 Pro — специалист по алгоритмам. LiveCodeBench проверяет задачи соревновательного программирования — точные, самодостаточные задачи, где результат либо корректен, либо нет, — и ни одна модель в мире не публиковала более высокий результат. Рейтинг Codeforces 3206 и результат 95,2% в HMMT рассказывают ту же историю: если дать полное техническое задание, модель выдаст корректное и компактное решение.
Теперь представим две рабочие нагрузки. «Прочитай этот сервис из 200 файлов, пойми соглашения проекта, предложи и выполни рефакторинг» — это родная стихия GLM-5.2: примерно по 3 тыс. токенов на файл, то есть 200 файлов — это 600 тыс. токенов контекста, которые она действительно может удерживать. «Вот полностью описанная задача, дай мне корректный патч на 200 строк» — DeepSeek выполняет такие задачи весь день за малую долю стоимости.
Обсуждение в сообществе на Hacker News лучше любого бенчмарка отражает этот компромисс. Одна сторона говорит: DeepSeek достаточно дёшев и достаточно хорош для 95% повседневной работы. Возражение другой стороны: в задачах с длинным горизонтом ошибки накапливаются — модель, которая «достаточно хороша в 95% случаев», превращает многочасовой запуск агента в хаос, потому что ошибки в оставшихся 5% складываются. Правы обе стороны. Просто они описывают разные задачи.

Цены: заявленная стоимость против реального счёта
Именно здесь большинство сравнений тихо ошибается, потому что в этом году цены DeepSeek менялись дважды, а в половине статей, которые находятся по этому запросу, до сих пор указаны апрельские расценки.
Сначала — факты. DeepSeek выпустила V4 Pro 24 апреля по базовой цене $1,74 за вход / $3,48 за выход на 1 млн токенов, предоставив скидку 75% на момент запуска. 31 мая эта скидка стала постоянной официальной ценой: $0,435 за вход / $0,87 за выход на 1 млн токенов, а вход с попаданием в кэш стоит $0,0036 за 1 млн токенов (согласно официальной странице цен DeepSeek). Эта ставка особенно важна: DeepSeek автоматически кэширует повторяющиеся префиксы, поэтому агент, повторно отправляющий один и тот же контекст репозитория и системный промпт на каждом шаге, платит за эти токены примерно 1% от ставки без попадания в кэш. Для рабочих нагрузок агентов с активным использованием кэша эффективная стоимость входных данных может оказаться значительно ниже даже заявленных $0,435.
Тариф GLM-5.2 в отдельном API Z.ai составляет $1,40 за вход / $4,40 за выход на 1 млн токенов. (Через наш эндпоинт GLM-5.2 стоимость составляет $1,26 / $3,96 — на 10% ниже базового тарифа.)
Итак, за токен DeepSeek V4 Pro примерно в 3× дешевле на входе и в 5× дешевле на выходе. Дело закрыто? Не совсем — и именно это упускают таблицы с броскими ценами.
Цена за токен и стоимость задачи расходятся, когда две модели тратят разное количество рассуждений на выполнение одной и той же работы. GLM-5.2 много рассуждает: согласно данным Artificial Analysis о потреблении токенов, в режиме максимального усилия на одну задачу Intelligence Index она использует около 42 000 выходных токенов — больше, чем GPT-5.5 в своём максимальном режиме. Посчитаем: 42 тыс. выходных токенов по базовой ставке GLM $4,40 — это примерно $0,18 за выходные данные на задачу. Те же 42 тыс. токенов у DeepSeek по ставке $0,87 стоили бы менее $0,04, однако фактическое потребление токенов DeepSeek на задачу не опубликовано в сопоставимом формате. Поэтому любое соотношение стоимости задачи следует считать оценкой, а не измерением. Направление очевидно, даже если точный коэффициент неизвестен: реальная премия GLM за выполненную задачу — это разница в цене токена, умноженная на её потребность в токенах рассуждений. Планируйте бюджет по счёту, а не по заявленной цене.
Моё мнение, если оно имеет значение: если ограничивающим фактором является стоимость, этот раздел уже помог вам принять решение — и это DeepSeek. Остальная часть статьи предназначена для тех, кого ограничивают возможности модели.
Какая модель подходит вашему проекту?
Вы создаёте агента для программирования на уровне репозитория. Выбирайте GLM-5.2. Независимое лидерство по интеллекту (51 против 44), результаты тестов с длинным горизонтом и контекст в 1 млн токенов, которым модель специально обучали пользоваться связно, указывают в одном направлении. Цена: за задачу вы будете платить в несколько раз больше, а в быстрых и хорошо сформулированных задачах переплачивать за глубину, которая вам не нужна.
Ваша рабочая нагрузка — алгоритмы, математика или STEM-рассуждения. Выбирайте DeepSeek V4 Pro. Её результаты в LiveCodeBench и Codeforces — лучшие из опубликованных, а стоимость составляет $0,87 за 1 млн выходных токенов. Цена: в открытых многочасовых инженерных задачах более низкие результаты на тестах с длинным горизонтом указывают на большее накопление ошибок — именно тот сценарий сбоя, который описывают скептики на HN.
У вас ограниченный бюджет и высокая пропускная способность. DeepSeek, практически без сомнений, — и формулируйте промпты со стабильными префиксами, чтобы ставка $0,0036 за попадание в кэш работала на полную. Цена: вы выбираете открытую модель №2 по общему интеллекту, но в классификации, извлечении данных и стандартном программировании, скорее всего, никогда этого не заметите.
Как получить доступ к обеим моделям через один API
Практический смысл запускать их параллельно заключается в следующем: обе доступны через один эндпоинт с одним ключом, поэтому A/B-тестирование на вашей реальной рабочей нагрузке сводится к изменению одной строки. Обе используют формат чат-комплишенов, совместимый с OpenAI.
import requests
import json
url = "https://gptproto.com/v1/chat/completions"
def ask(model: str, prompt: str) -> str:
payload = json.dumps({
"model": model,
"messages": [{"role": "user", "content": prompt}],
"stream": False
})
headers = {
"Authorization": "GPTPROTO_API_KEY",
"Content-Type": "application/json"
}
response = requests.post(url, headers=headers, data=payload)
return response.json()["choices"][0]["message"]["content"]
task = "Сделайте эту функцию идемпотентной: ..."
# Один и тот же запрос, две модели — сравните их на своей рабочей нагрузке
print(ask("glm-5.2", task))
print(ask("deepseek-v4-pro", task))
Или с помощью cURL:
curl --location 'https://gptproto.com/v1/chat/completions' \
--header 'Authorization: GPTPROTO_API_KEY' \
--header 'Content-Type: application/json' \
--data '{
"model": "glm-5.2",
"messages": [{"role": "user", "content": "Who are you?"}],
"stream": false
}'
Замените "glm-5.2" на "deepseek-v4-pro", и тот же вызов обратится к другой модели. Полный каталог доступен по адресу gptproto.com/model.