В одном предложении
GLM 5.2 — флагманская языковая модель Z.ai с открытыми весами, выпущенная 13 июня 2026 года и созданная специально для программирования, рассуждений и работы с инструментами в «агентном» режиме — для многоэтапных задач, в которых модель планирует действия, вызывает инструменты, анализирует результаты и пересматривает решения в течение долгой сессии.
Z.ai — международный бренд Zhipu AI, пекинской исследовательской компании, выделившейся из Группы инженерии знаний Университета Цинхуа в 2019 году. Ключевое здесь — «открытые веса»: фактические параметры модели опубликованы на Hugging Face (под именем zai-org/GLM-5.2), а также на ModelScope и Ollama, по лицензии MIT и без региональных ограничений. Вы можете самостоятельно разместить модель, дообучить её и выпустить коммерческий продукт без чьего-либо разрешения.
Почему модель для программирования с открытыми весами важнее самих бенчмарков
Сначала — мотивация, а уже потом механизм. Причина интереса к этому релизу не в том, что это самая умная модель в мире — это не так. Дело в том, что она закрыла большую часть разрыва с закрытыми передовыми моделями, оставаясь бесплатной для скачивания и дешёвой в использовании. Для разработчика это меняет расчёты в двух вопросах, которые раньше считались решёнными.
Первый — зависимость от поставщика. Если ваш программный агент работает через закрытый API, вы не можете запускать его офлайн, не можете изучить его и вынуждены платить по цене, которую поставщик установит в следующем квартале. Открытые веса устраняют все три ограничения одновременно. Второй — стоимость. Согласно опубликованным данным, API GLM 5.2 стоит $1.40 за миллион входных токенов и $4.40 за миллион выходных токенов; Z.ai позиционирует это как примерно одну шестую стоимости сопоставимых передовых моделей. Для задачи, которая расходует токены — а агентное программирование расходует их много, — это соотношение решает всё.
Но есть нюанс, и он бывает всегда: открытые веса безопасны для самостоятельного размещения, однако при передаче данных через облачный API Z.ai они проходят через инфраструктуру, подпадающую под действие китайского Закона о национальной разведке, а Министерство внутренней безопасности США предупреждало, что этот закон может обязать китайские компании передавать данные о гражданах США. Эти два факта сосуществуют — бесплатные, доступные для изучения веса, которые можно запускать где угодно, и размещённый API с реальным вопросом о юрисдикции данных. Что актуально именно для вас, полностью зависит от того, размещаете ли вы модель самостоятельно или обращаетесь к облаку. Я ещё вернусь к этому вопросу.
Как это работает — без упрощений
GLM 5.2 — модель типа Mixture-of-Experts (MoE). Согласно опубликованным данным, общий размер составляет примерно от 744 до 753 миллиардов параметров — источники немного расходятся, что само по себе показывает: точное число ещё уточняется, — при этом для каждого отдельного токена активны лишь около 40 миллиардов параметров.
Это разделение — центральный трюк, поэтому стоит привести аналогию. Плотная модель похожа на одного универсального специалиста, которому приходится обдумывать всё при каждом вопросе. MoE-модель больше похожа на крупную фирму: она содержит знания очень большой организации, но для каждой конкретной задачи активирует только нескольких подходящих специалистов. Вы получаете ёмкость модели с 744 миллиардами параметров примерно по стоимости обслуживания модели с 40 миллиардами. По сравнению с предшественницей GLM 4.5 — 355B общих и 32B активных параметров — GLM 5 увеличила масштаб фирмы (до 744B / 40B) и обучалась на большем объёме данных (28,5 триллиона токенов против 23 триллионов).
Важны ещё три компонента, и каждый решает конкретную проблему, а не просто дополняет список функций.
Первый — разреженное внимание, которое Z.ai называет IndexShare. Оно решает следующую проблему: стоимость внимания болезненно растёт по мере увеличения контекстного окна, а окно GLM 5.2 очень велико (подробнее ниже). Обычно модель на каждом слое заново вычисляет, к каким предыдущим токенам обращаться. IndexShare вычисляет этот индекс на первом из каждых четырёх слоёв внимания и повторно использует его на следующих трёх. По данным Z.ai, это сокращает стоимость индексации скалярного произведения на 75% в повторно используемых слоях, а вычисления на токен — примерно в 2,9 раза — при полном контексте в миллион токенов. Проще говоря, именно это позволяет действительно запускать контекст на миллион токенов.
Второй компонент — двойные режимы рассуждения: два выбираемых уровня усилий мышления под названиями High и Max. Max предназначен для сложного многоэтапного программирования, где модели нужно пространство для планирования и пересмотра решений; в рамках одной задачи он может генерировать почти 85 000 выходных токенов. High жертвует лишь несколькими пунктами производительности, примерно вдвое сокращая объём вывода токенов. Это подходящий режим, когда задержка и стоимость важнее последнего процентного пункта качества. Краткий вывод: Max — когда правильность превыше всего, High — для повседневной работы.
Третий — предсказание нескольких токенов, позволяющее модели предсказывать несколько токенов за один прямой проход вместо последовательного предсказания по одному. Это ускоряет вывод и одновременно улучшает связность на длинных отрезках.
Вместе эти компоненты формируют главный практический вывод — контекстное окно: до 1 000 000 входных токенов (через идентификатор glm-5.2[1m]) и до 131 072 выходных токенов. Это примерно в пять раз больше лимита GLM 5.1, составляющего около 200 000 токенов. Миллиона токенов достаточно, чтобы одновременно удерживать в контексте кодовую базу среднего размера — именно на такой сценарий и нацелена вся архитектура.
Насколько она хороша на самом деле
Здесь важно разделять уровни уверенности, поэтому я прямо укажу, где факт, а где опубликованный результат.
Факт: Z.ai выпустила GLM 5.2 без официального набора бенчмарков. Каждая распространяемая цифра либо опубликована поставщиком постфактум, либо получена в ранних независимых оценках; пока ни одна из них широко не воспроизведена. Относитесь к конкретным десятичным значениям как к ориентиру, а не как к абсолютной истине.
С этой оговоркой опубликованные результаты согласуются между источниками и указывают в одном направлении. В Terminal-Bench 2.1 (автономное программирование через терминал) GLM 5.2, по сообщениям, набрала 81,0 — значительный рост по сравнению с 62,0 у GLM 5.1 и примерно на четыре пункта меньше 85,0 у Claude Opus 4.8. В SWE-bench Pro (решение реальных задач программной инженерии) заявлен результат 62,1 — выше, чем 58,6 у GPT-5.5 и 58,4 у предшественницы, но ниже, чем 69,2 у Claude Opus 4.8. В Intelligence Index от Artificial Analysis она, согласно сообщениям, получила 51 — это самый высокий показатель среди всех моделей с открытыми весами.
Этим цифрам придаёт больший вес, чем обычной таблице поставщика, независимое подтверждение, которым сложнее манипулировать. В Code Arena на платформе Arena.ai — рейтинге Elo, построенном на слепом попарном голосовании людей, — GLM 5.2, по сообщениям, заняла второе место в общем зачёте. А в краудсорсинговом Design Arena она, согласно данным, заняла первое место с рейтингом Elo 1360, опередив даже Claude Fable 5. Слепыми предпочтениями людей манипулировать гораздо сложнее, чем самостоятельно заявленным показателем успешного прохождения, поэтому именно этим двум результатам я доверял бы больше всего.
Мой вывод, выраженный как суждение, а не факт: GLM 5.2 — самая сильная доступная сейчас модель для программирования с открытыми весами; в нескольких задачах программирования она превосходит GPT-5.5, а в самых сложных задачах с длинной цепочкой действий отстаёт от Claude Opus 4.8 на величину от одного до примерно тринадцати пунктов в зависимости от задачи. Близко, но не впереди — за небольшую долю цены.
GLM 5.2 против Claude Opus 4.8 и GPT-5.5
Для тех, кто выбирает между этими тремя моделями, компромиссы выглядят достаточно ясно. В таблице приведены заявленные результаты бенчмарков программирования и неизменные характеристики — стоимость, контекст и лицензирование:
| |
GLM 5.2 |
Claude Opus 4.8 |
GPT-5.5 |
| Веса |
Открытые (MIT) |
Закрытые |
Закрытые |
| Контекстное окно |
1M токенов |
1M токенов |
1M токенов |
| Цена API (вход / выход, за 1M) |
$1.40 / $4.40 |
$5.00 / $25.00 |
$5.00 / $30.00 |
| Terminal-Bench 2.1 (заявленный) |
81.0 |
85.0 |
— |
| SWE-bench Pro (заявленный) |
62.1 |
69.2 |
58.6 |
| Можно разместить самостоятельно |
Да |
Нет |
Нет |
Честный вывод: Claude Opus 4.8 по-прежнему наиболее способна из трёх в самых сложных сценариях агентного программирования и остаётся безопасным выбором по умолчанию, если вы платите за максимальную точность в длительных автономных запусках. GPT-5.5 занимает промежуточное положение по этим конкретным бенчмаркам программирования. Сильная сторона GLM 5.2 не в том, что «она лучшая», а в том, что «она отстаёт от лучшей всего на несколько пунктов, имеет открытые веса и стоит лишь небольшую долю её цены». Если для вас важны стоимость, самостоятельное размещение или дообучение, это весомый аргумент. Если вы запускаете критически важные долгосрочные агенты, где несколько пунктов надёжности окупают цену, Claude Opus 4.8 — более консервативный выбор. Стоимость Claude опубликована Anthropic; показатели GLM — это заявленные тарифы Z.ai.
Если вы хотите сравнить двух закрытых соперников на собственных запросах, оба доступны через один API в GPT Proto — Claude Opus 4.8 (thinking) и GPT-5.5 — по единой цене $4 за миллион токенов каждый. (Эта единая ставка установлена GPT Proto; разделение $5.00 / $25.00 между входными и выходными токенами в таблице выше — собственная розничная цена Anthropic для Opus 4.8. Та же модель, две разные структуры цен.) Единый ключ для всех трёх семейств — самый дешёвый способ провести сравнение самостоятельно.
GLM 5.2 против моделей GLM, доступных сегодня
GLM 5.2 поставляется как открытые веса, которые вы скачиваете и размещаете самостоятельно. Размещённый API Z.ai — единственный официальный способ обращаться к ней через API, и, как уже отмечалось, это связано с вопросом о юрисдикции данных. Но линейка GLM началась не с версии 5.2, и сравнение с предыдущими версиями лучше всего показывает, что именно изменилось.
Самое полезное сравнение — с GLM 5.1, непосредственной предшественницей. Особенно заметны два различия. Контекстное окно выросло примерно с 200 000 токенов до полного 1 000 000 — пятикратный скачок, ставший главным обновлением. И показатели программирования заметно улучшились: Terminal-Bench 2.1 вырос с 62,0 до 81,0, а SWE-bench Pro — с 58,4 до 62,1. Иными словами, большая часть позиции GLM 5.2 в рейтингах — результат улучшения по сравнению с предыдущим релизом, а не небольшой доработки.
Если вы предпочитаете уже сегодня вызывать размещённую GLM через единый OpenAI-совместимый API, а не разворачивать открытые веса, то GPT Proto предлагает модели GLM, которые стоят непосредственно перед версией 5.2 в линейке:
| Модель |
Цена GPT Proto (за 1M токенов) |
Примечания |
| GLM-5 |
$0.90 |
Базовый релиз GLM 5 |
| GLM-5-turbo |
$1.08 |
Вариант, оптимизированный по скорости и стоимости |
| GLM-5.1 |
$1.26 |
Версия, непосредственно предшествующая 5.2 |
GLM-5.1 — наиболее близкая к 5.2 модель, которую здесь можно вызвать: то же семейство, поколением раньше, с контекстом около 200K вместо 1M. Для многих задач программирования это различие будет незаметно; для задач на уровне репозитория, которым требуется одновременно видеть всю кодовую базу, именно этот разрыв закрывает 5.2. Полные тарифы за токены для всех моделей указаны на странице моделей.
Использование GLM 5.2 в Claude Code и запускаемый пример
Одна особенность делает линейку GLM необычно простой для интеграции в существующие рабочие процессы: GLM 5.2 предоставляет Anthropic-совместимую конечную точку. Инструменты, созданные для работы с Claude — Claude Code, Cline, OpenCode, — могут обращаться к ней напрямую, заменяя модель внутри программного агента без переписывания интеграции. Поэтому «GLM 5.2 в Claude coding» — это реальный сценарий, а не просто поисковая фраза: оболочка агента остаётся прежней, меняется только модель под ней. (Для версии 5.2 это означает собственную конечную точку Z.ai или самостоятельное размещение, поскольку открытые веса — официальный способ её запуска.)
Если вы не хотите самостоятельно управлять развёртыванием, практичный вариант сегодня — вызывать размещённую GLM через OpenAI-совместимый API GPT Proto. Ниже показан пример с GLM 5.1 — ближайшей доступной моделью того же семейства, — который можно использовать как базовую точку, прежде чем решать, стоит ли размещать 5.2 ради дополнительного контекста:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_GPTPROTO_API_KEY",
base_url="https://api.gptproto.com/v1",
)
resp = client.chat.completions.create(
model="glm-5.1",
messages=[
{
"role": "user",
"content": (
"Refactor this function for readability and explain the change:\n\n"
"def f(x):\n"
" return [i for i in x if i % 2 == 0]"
),
}
],
)
print(resp.choices[0].message.content)
Тот же запрос с помощью cURL:
curl https://api.gptproto.com/v1/chat/completions \
-H "Authorization: Bearer $GPTPROTO_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.1",
"messages": [
{"role": "user", "content": "Write a Python function that returns the nth Fibonacci number, iteratively."}
]
}'
Замените glm-5.1 на glm-5 или glm-5-turbo, чтобы обменять качество на стоимость, либо на claude-opus-4-8-thinking / gpt-5.5, чтобы провести точное сравнение из таблицы выше — всё через один ключ.
Сначала вам понадобится этот ключ: создайте его в панели GPT Proto, вставьте в YOUR_GPTPROTO_API_KEY, и приведённый выше вызов заработает без изменений. Тарифы за токены для всех моделей находятся на странице моделей, если вы хотите рассчитать стоимость до начала работы.
Где она сильна, а где нет
Преимущества конкретны: это лучшая модель для программирования с открытыми весами среди представленных в существующих рейтингах, она распространяется по действительно либеральной лицензии MIT, миллион токенов контекста реален и доступен по стоимости благодаря IndexShare, а соотношение цены и производительности лучшее в своём классе.
Недостатки столь же конкретны, и о них стоит сказать прямо. В самых сложных задачах программирования с длинной цепочкой действий она отстаёт от Claude Opus 4.8 — разрыв невелик, но стабилен. Z.ai не опубликовала официальных бенчмарков, поэтому к цифрам следует относиться с оговоркой, пока их не воспроизведут независимые лаборатории. Наконец, вопрос юрисдикции данных в облачном API реален: если ваши данные не могут законно или по договору покидать определённую границу, размещённый API Z.ai — неправильный выбор — вместо него используйте открытые веса самостоятельно, ведь именно для этого они и открыты.
Кому стоит использовать эту модель, а кому нет
Используйте GLM 5.2, если вы разработчик и хотите получить возможности программирования, близкие к передовым моделям, без соответствующей цены; если вам нужно самостоятельное размещение или дообучение; либо если вы создаёте агентный продукт с ограниченным бюджетом, где основную часть расходов составляют токены. Это особенно удачный вариант для тех, у кого уже есть совместимая с Claude оболочка агента и кто хочет использовать за ней более дешёвый движок.
Выбирайте Claude Opus 4.8, если запускаете критически важные долгосрочные автономные агенты, где последние несколько пунктов надёжности оправдывают премиальную цену, либо если ваша работа связана с правилами хранения данных, которым размещённый API GLM не соответствует, а самостоятельное размещение невозможно.