Michael Johnson2026-07-15

Что такое GLM 5.2? Кодинг с открытыми весами за 1/6 цены

GLM 5.2 — модель Z.ai для программирования с открытыми весами, лицензией MIT и контекстом на 1M токенов. Узнайте о её функциях, бенчмарках против Claude Opus 4.8 и GPT-5.5, ценах и способах запуска.

Что такое GLM 5.2? Кодинг с открытыми весами за 1/6 цены

Китайская лаборатория выпустила модель, которую можно бесплатно скачать, запустить на собственном оборудовании и использовать примерно за одну шестую стоимости закрытых передовых моделей — при этом на реальных тестах программирования она отстаёт от Claude Opus 4.8 всего на несколько пунктов. А затем выпустила её, не опубликовав ни одного собственного официального бенчмарка. Это GLM 5.2, и разрыв между «никаких маркетинговых цифр» и «почти вершина каждого независимого рейтинга уже через неделю» — именно то, что делает её достойной изучения.

Я много пишу подобных объясняющих материалов, и большинство статей о новых моделях быстро забываются, потому что просто пересказывают спецификацию. Эта отличается по одному действительно важному для разработчиков параметру: веса открыты по лицензии MIT, поэтому на обычный вопрос — «бенчмарк настоящий или это маркетинг?» — здесь есть необычно чёткий ответ. Люди скачали модель и протестировали её самостоятельно. Ниже — что такое GLM 5.2, как она работает и где находятся её границы.

Содержание

В одном предложении

GLM 5.2 — флагманская языковая модель Z.ai с открытыми весами, выпущенная 13 июня 2026 года и созданная специально для программирования, рассуждений и работы с инструментами в «агентном» режиме — для многоэтапных задач, в которых модель планирует действия, вызывает инструменты, анализирует результаты и пересматривает решения в течение долгой сессии.

Z.ai — международный бренд Zhipu AI, пекинской исследовательской компании, выделившейся из Группы инженерии знаний Университета Цинхуа в 2019 году. Ключевое здесь — «открытые веса»: фактические параметры модели опубликованы на Hugging Face (под именем zai-org/GLM-5.2), а также на ModelScope и Ollama, по лицензии MIT и без региональных ограничений. Вы можете самостоятельно разместить модель, дообучить её и выпустить коммерческий продукт без чьего-либо разрешения.

Почему модель для программирования с открытыми весами важнее самих бенчмарков

Сначала — мотивация, а уже потом механизм. Причина интереса к этому релизу не в том, что это самая умная модель в мире — это не так. Дело в том, что она закрыла большую часть разрыва с закрытыми передовыми моделями, оставаясь бесплатной для скачивания и дешёвой в использовании. Для разработчика это меняет расчёты в двух вопросах, которые раньше считались решёнными.

Первый — зависимость от поставщика. Если ваш программный агент работает через закрытый API, вы не можете запускать его офлайн, не можете изучить его и вынуждены платить по цене, которую поставщик установит в следующем квартале. Открытые веса устраняют все три ограничения одновременно. Второй — стоимость. Согласно опубликованным данным, API GLM 5.2 стоит $1.40 за миллион входных токенов и $4.40 за миллион выходных токенов; Z.ai позиционирует это как примерно одну шестую стоимости сопоставимых передовых моделей. Для задачи, которая расходует токены — а агентное программирование расходует их много, — это соотношение решает всё.

Но есть нюанс, и он бывает всегда: открытые веса безопасны для самостоятельного размещения, однако при передаче данных через облачный API Z.ai они проходят через инфраструктуру, подпадающую под действие китайского Закона о национальной разведке, а Министерство внутренней безопасности США предупреждало, что этот закон может обязать китайские компании передавать данные о гражданах США. Эти два факта сосуществуют — бесплатные, доступные для изучения веса, которые можно запускать где угодно, и размещённый API с реальным вопросом о юрисдикции данных. Что актуально именно для вас, полностью зависит от того, размещаете ли вы модель самостоятельно или обращаетесь к облаку. Я ещё вернусь к этому вопросу.

Как это работает — без упрощений

GLM 5.2 — модель типа Mixture-of-Experts (MoE). Согласно опубликованным данным, общий размер составляет примерно от 744 до 753 миллиардов параметров — источники немного расходятся, что само по себе показывает: точное число ещё уточняется, — при этом для каждого отдельного токена активны лишь около 40 миллиардов параметров.

Это разделение — центральный трюк, поэтому стоит привести аналогию. Плотная модель похожа на одного универсального специалиста, которому приходится обдумывать всё при каждом вопросе. MoE-модель больше похожа на крупную фирму: она содержит знания очень большой организации, но для каждой конкретной задачи активирует только нескольких подходящих специалистов. Вы получаете ёмкость модели с 744 миллиардами параметров примерно по стоимости обслуживания модели с 40 миллиардами. По сравнению с предшественницей GLM 4.5 — 355B общих и 32B активных параметров — GLM 5 увеличила масштаб фирмы (до 744B / 40B) и обучалась на большем объёме данных (28,5 триллиона токенов против 23 триллионов).

Важны ещё три компонента, и каждый решает конкретную проблему, а не просто дополняет список функций.

Первый — разреженное внимание, которое Z.ai называет IndexShare. Оно решает следующую проблему: стоимость внимания болезненно растёт по мере увеличения контекстного окна, а окно GLM 5.2 очень велико (подробнее ниже). Обычно модель на каждом слое заново вычисляет, к каким предыдущим токенам обращаться. IndexShare вычисляет этот индекс на первом из каждых четырёх слоёв внимания и повторно использует его на следующих трёх. По данным Z.ai, это сокращает стоимость индексации скалярного произведения на 75% в повторно используемых слоях, а вычисления на токен — примерно в 2,9 раза — при полном контексте в миллион токенов. Проще говоря, именно это позволяет действительно запускать контекст на миллион токенов.

Второй компонент — двойные режимы рассуждения: два выбираемых уровня усилий мышления под названиями High и Max. Max предназначен для сложного многоэтапного программирования, где модели нужно пространство для планирования и пересмотра решений; в рамках одной задачи он может генерировать почти 85 000 выходных токенов. High жертвует лишь несколькими пунктами производительности, примерно вдвое сокращая объём вывода токенов. Это подходящий режим, когда задержка и стоимость важнее последнего процентного пункта качества. Краткий вывод: Max — когда правильность превыше всего, High — для повседневной работы.

Третий — предсказание нескольких токенов, позволяющее модели предсказывать несколько токенов за один прямой проход вместо последовательного предсказания по одному. Это ускоряет вывод и одновременно улучшает связность на длинных отрезках.

Вместе эти компоненты формируют главный практический вывод — контекстное окно: до 1 000 000 входных токенов (через идентификатор glm-5.2[1m]) и до 131 072 выходных токенов. Это примерно в пять раз больше лимита GLM 5.1, составляющего около 200 000 токенов. Миллиона токенов достаточно, чтобы одновременно удерживать в контексте кодовую базу среднего размера — именно на такой сценарий и нацелена вся архитектура.

Насколько она хороша на самом деле

Здесь важно разделять уровни уверенности, поэтому я прямо укажу, где факт, а где опубликованный результат.

Факт: Z.ai выпустила GLM 5.2 без официального набора бенчмарков. Каждая распространяемая цифра либо опубликована поставщиком постфактум, либо получена в ранних независимых оценках; пока ни одна из них широко не воспроизведена. Относитесь к конкретным десятичным значениям как к ориентиру, а не как к абсолютной истине.

С этой оговоркой опубликованные результаты согласуются между источниками и указывают в одном направлении. В Terminal-Bench 2.1 (автономное программирование через терминал) GLM 5.2, по сообщениям, набрала 81,0 — значительный рост по сравнению с 62,0 у GLM 5.1 и примерно на четыре пункта меньше 85,0 у Claude Opus 4.8. В SWE-bench Pro (решение реальных задач программной инженерии) заявлен результат 62,1 — выше, чем 58,6 у GPT-5.5 и 58,4 у предшественницы, но ниже, чем 69,2 у Claude Opus 4.8. В Intelligence Index от Artificial Analysis она, согласно сообщениям, получила 51 — это самый высокий показатель среди всех моделей с открытыми весами.

Этим цифрам придаёт больший вес, чем обычной таблице поставщика, независимое подтверждение, которым сложнее манипулировать. В Code Arena на платформе Arena.ai — рейтинге Elo, построенном на слепом попарном голосовании людей, — GLM 5.2, по сообщениям, заняла второе место в общем зачёте. А в краудсорсинговом Design Arena она, согласно данным, заняла первое место с рейтингом Elo 1360, опередив даже Claude Fable 5. Слепыми предпочтениями людей манипулировать гораздо сложнее, чем самостоятельно заявленным показателем успешного прохождения, поэтому именно этим двум результатам я доверял бы больше всего.

Мой вывод, выраженный как суждение, а не факт: GLM 5.2 — самая сильная доступная сейчас модель для программирования с открытыми весами; в нескольких задачах программирования она превосходит GPT-5.5, а в самых сложных задачах с длинной цепочкой действий отстаёт от Claude Opus 4.8 на величину от одного до примерно тринадцати пунктов в зависимости от задачи. Близко, но не впереди — за небольшую долю цены.

GLM 5.2 против Claude Opus 4.8 и GPT-5.5

Для тех, кто выбирает между этими тремя моделями, компромиссы выглядят достаточно ясно. В таблице приведены заявленные результаты бенчмарков программирования и неизменные характеристики — стоимость, контекст и лицензирование:

  GLM 5.2 Claude Opus 4.8 GPT-5.5
Веса Открытые (MIT) Закрытые Закрытые
Контекстное окно 1M токенов 1M токенов 1M токенов
Цена API (вход / выход, за 1M) $1.40 / $4.40 $5.00 / $25.00 $5.00 / $30.00
Terminal-Bench 2.1 (заявленный) 81.0 85.0
SWE-bench Pro (заявленный) 62.1 69.2 58.6
Можно разместить самостоятельно Да Нет Нет

Честный вывод: Claude Opus 4.8 по-прежнему наиболее способна из трёх в самых сложных сценариях агентного программирования и остаётся безопасным выбором по умолчанию, если вы платите за максимальную точность в длительных автономных запусках. GPT-5.5 занимает промежуточное положение по этим конкретным бенчмаркам программирования. Сильная сторона GLM 5.2 не в том, что «она лучшая», а в том, что «она отстаёт от лучшей всего на несколько пунктов, имеет открытые веса и стоит лишь небольшую долю её цены». Если для вас важны стоимость, самостоятельное размещение или дообучение, это весомый аргумент. Если вы запускаете критически важные долгосрочные агенты, где несколько пунктов надёжности окупают цену, Claude Opus 4.8 — более консервативный выбор. Стоимость Claude опубликована Anthropic; показатели GLM — это заявленные тарифы Z.ai.

Если вы хотите сравнить двух закрытых соперников на собственных запросах, оба доступны через один API в GPT Proto — Claude Opus 4.8 (thinking) и GPT-5.5 — по единой цене $4 за миллион токенов каждый. (Эта единая ставка установлена GPT Proto; разделение $5.00 / $25.00 между входными и выходными токенами в таблице выше — собственная розничная цена Anthropic для Opus 4.8. Та же модель, две разные структуры цен.) Единый ключ для всех трёх семейств — самый дешёвый способ провести сравнение самостоятельно.

GLM 5.2 против моделей GLM, доступных сегодня

GLM 5.2 поставляется как открытые веса, которые вы скачиваете и размещаете самостоятельно. Размещённый API Z.ai — единственный официальный способ обращаться к ней через API, и, как уже отмечалось, это связано с вопросом о юрисдикции данных. Но линейка GLM началась не с версии 5.2, и сравнение с предыдущими версиями лучше всего показывает, что именно изменилось.

Самое полезное сравнение — с GLM 5.1, непосредственной предшественницей. Особенно заметны два различия. Контекстное окно выросло примерно с 200 000 токенов до полного 1 000 000 — пятикратный скачок, ставший главным обновлением. И показатели программирования заметно улучшились: Terminal-Bench 2.1 вырос с 62,0 до 81,0, а SWE-bench Pro — с 58,4 до 62,1. Иными словами, большая часть позиции GLM 5.2 в рейтингах — результат улучшения по сравнению с предыдущим релизом, а не небольшой доработки.

Если вы предпочитаете уже сегодня вызывать размещённую GLM через единый OpenAI-совместимый API, а не разворачивать открытые веса, то GPT Proto предлагает модели GLM, которые стоят непосредственно перед версией 5.2 в линейке:

Модель Цена GPT Proto (за 1M токенов) Примечания
GLM-5 $0.90 Базовый релиз GLM 5
GLM-5-turbo $1.08 Вариант, оптимизированный по скорости и стоимости
GLM-5.1 $1.26 Версия, непосредственно предшествующая 5.2

GLM-5.1 — наиболее близкая к 5.2 модель, которую здесь можно вызвать: то же семейство, поколением раньше, с контекстом около 200K вместо 1M. Для многих задач программирования это различие будет незаметно; для задач на уровне репозитория, которым требуется одновременно видеть всю кодовую базу, именно этот разрыв закрывает 5.2. Полные тарифы за токены для всех моделей указаны на странице моделей.

Использование GLM 5.2 в Claude Code и запускаемый пример

Одна особенность делает линейку GLM необычно простой для интеграции в существующие рабочие процессы: GLM 5.2 предоставляет Anthropic-совместимую конечную точку. Инструменты, созданные для работы с Claude — Claude Code, Cline, OpenCode, — могут обращаться к ней напрямую, заменяя модель внутри программного агента без переписывания интеграции. Поэтому «GLM 5.2 в Claude coding» — это реальный сценарий, а не просто поисковая фраза: оболочка агента остаётся прежней, меняется только модель под ней. (Для версии 5.2 это означает собственную конечную точку Z.ai или самостоятельное размещение, поскольку открытые веса — официальный способ её запуска.)

Если вы не хотите самостоятельно управлять развёртыванием, практичный вариант сегодня — вызывать размещённую GLM через OpenAI-совместимый API GPT Proto. Ниже показан пример с GLM 5.1 — ближайшей доступной моделью того же семейства, — который можно использовать как базовую точку, прежде чем решать, стоит ли размещать 5.2 ради дополнительного контекста:

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_GPTPROTO_API_KEY",
    base_url="https://api.gptproto.com/v1",
)

resp = client.chat.completions.create(
    model="glm-5.1",
    messages=[
        {
            "role": "user",
            "content": (
                "Refactor this function for readability and explain the change:\n\n"
                "def f(x):\n"
                "    return [i for i in x if i % 2 == 0]"
            ),
        }
    ],
)

print(resp.choices[0].message.content)

Тот же запрос с помощью cURL:

curl https://api.gptproto.com/v1/chat/completions \
  -H "Authorization: Bearer $GPTPROTO_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.1",
    "messages": [
      {"role": "user", "content": "Write a Python function that returns the nth Fibonacci number, iteratively."}
    ]
  }'

Замените glm-5.1 на glm-5 или glm-5-turbo, чтобы обменять качество на стоимость, либо на claude-opus-4-8-thinking / gpt-5.5, чтобы провести точное сравнение из таблицы выше — всё через один ключ.

Сначала вам понадобится этот ключ: создайте его в панели GPT Proto, вставьте в YOUR_GPTPROTO_API_KEY, и приведённый выше вызов заработает без изменений. Тарифы за токены для всех моделей находятся на странице моделей, если вы хотите рассчитать стоимость до начала работы.

Где она сильна, а где нет

Преимущества конкретны: это лучшая модель для программирования с открытыми весами среди представленных в существующих рейтингах, она распространяется по действительно либеральной лицензии MIT, миллион токенов контекста реален и доступен по стоимости благодаря IndexShare, а соотношение цены и производительности лучшее в своём классе.

Недостатки столь же конкретны, и о них стоит сказать прямо. В самых сложных задачах программирования с длинной цепочкой действий она отстаёт от Claude Opus 4.8 — разрыв невелик, но стабилен. Z.ai не опубликовала официальных бенчмарков, поэтому к цифрам следует относиться с оговоркой, пока их не воспроизведут независимые лаборатории. Наконец, вопрос юрисдикции данных в облачном API реален: если ваши данные не могут законно или по договору покидать определённую границу, размещённый API Z.ai — неправильный выбор — вместо него используйте открытые веса самостоятельно, ведь именно для этого они и открыты.

Кому стоит использовать эту модель, а кому нет

Используйте GLM 5.2, если вы разработчик и хотите получить возможности программирования, близкие к передовым моделям, без соответствующей цены; если вам нужно самостоятельное размещение или дообучение; либо если вы создаёте агентный продукт с ограниченным бюджетом, где основную часть расходов составляют токены. Это особенно удачный вариант для тех, у кого уже есть совместимая с Claude оболочка агента и кто хочет использовать за ней более дешёвый движок.

Выбирайте Claude Opus 4.8, если запускаете критически важные долгосрочные автономные агенты, где последние несколько пунктов надёжности оправдывают премиальную цену, либо если ваша работа связана с правилами хранения данных, которым размещённый API GLM не соответствует, а самостоятельное размещение невозможно.

Универсальная творческая студия

Создавайте здесь изображения и видео. API GPTProto обеспечивает быстрые обновления моделей и самые низкие цены.

Начать создание
Универсальная творческая студия
Похожие модели
Все модели
Z-AI
by Z-AI
10% OFF
Claude
20% OFF
OpenAI
20% OFF
Z-AI
by Z-AI
10% OFF

Часто задаваемые вопросы

Что такое GLM 5.2 в одном предложении?

Флагманская языковая модель Z.ai с открытыми весами (лицензия MIT), выпущенная в июне 2026 года для программирования, рассуждений и использования инструментов в агентном режиме, с контекстным окном на миллион токенов.

Каковы основные функции GLM 5.2?

Архитектура Mixture-of-Experts (~744B общих / ~40B активных параметров), разреженное внимание IndexShare для недорогого вывода с длинным контекстом, два режима рассуждения High/Max, предсказание нескольких токенов, контекстное окно на 1M токенов и открытые веса по лицензии MIT.

Хороша ли GLM 5.2 для программирования?

Да — опубликованные результаты показывают, что это сильнейшая модель для программирования с открытыми весами: она превосходит GPT-5.5 в SWE-bench Pro (62.1 против 58.6) и отстаёт от Claude Opus 4.8 всего на несколько пунктов. Однако учитывайте, что эти цифры опубликованы поставщиком или получены на ранних сторонних тестах, поскольку Z.ai официальных результатов не публиковала.

GLM 5.2 против Claude Opus 4.8 — какая модель лучше для программирования?

Claude Opus 4.8 по-прежнему лидирует в самых сложных сценариях агентного программирования (69.2 против 62.1 в SWE-bench Pro). GLM 5.2 близка по результатам, имеет открытые веса и стоит значительно дешевле. Выбирайте в зависимости от того, что для вас важнее: максимальная надёжность или стоимость и контроль.

Сколько стоит GLM 5.2?

Заявленная цена API составляет $1.40 за миллион входных токенов и $4.40 за миллион выходных токенов, а кэшированные входные токены стоят около $0.26 — примерно одну шестую стоимости сопоставимых передовых моделей. Сами открытые веса можно бесплатно скачивать и запускать.

Можно ли использовать GLM 5.2 с Claude Code?

Да. Модель предоставляет Anthropic-совместимую конечную точку, поэтому Claude Code, Cline, OpenCode и похожие инструменты могут обращаться к ней напрямую.

Похожие статьи

Ещё блоги
GLM-5.2 и DeepSeek V4 Pro: бенчмарки, цены и какую модель действительно использовать (2026)

GLM-5.2 и DeepSeek V4 Pro: бенчмарки, цены и какую модель действительно использовать (2026)

Кратко: Если ваша рабочая нагрузка связана с агентной разработкой с длинным горизонтом — агент часами работает с репозиторием и выпускает готовую функцию, — GLM-5.2 будет более сильной моделью. Если же вам нужны алгоритмы, математика, STEM-рассуждения или высокая пропускная способность при ограниченном бюджете, DeepSeek V4 Pro выигрывает, причём с большим отрывом по цене. В независимом индексе Intelligence Index v4.1 от Artificial Analysis GLM-5.2 (максимальное усилие) набирает 51 балл против 44 у DeepSeek V4 Pro, однако официальная ставка DeepSeek за токен примерно в 3–5 раз ниже. Но есть нюанс, который упускает большинство сравнений: цена за токен и стоимость задачи — не одно и то же. Ниже я покажу почему. Обе эти модели представлены на страницах каталога GLM-5.2 и deepseek-v4-pro на нашей платформе, а вопрос «к какой модели мне направлять запросы» стал одним из самых частых среди разработчиков, запускающих агентов для программирования. В этой статье я постараюсь ответить на него обстоятельно — используя независимые данные бенчмарков там, где они доступны, чётко помечая данные поставщиков там, где их нет, и приводя расчёты стоимости, отражающие реальные расценки DeepSeek в июле 2026 года, а не цены апреля.

Schuyler Stacy | 2026-07-06

MiniMax M3 против DeepSeek V4 Pro: цена, бенчмарки и какую модель действительно использовать

MiniMax M3 против DeepSeek V4 Pro: цена, бенчмарки и какую модель действительно использовать

Кратко — это две китайские модели с открытыми весами, которые сейчас сравнивают все, и честный ответ заключается в том, что они едва ли конкурируют. DeepSeek V4 Pro — специализированная алгоритмическая модель для работы исключительно с текстом: она показывает самый высокий результат SWE-bench Verified среди всех моделей с открытыми весами (80,6%), а её нативная экономика токенов особенно выгодна при попаданиях в кэш. MiniMax M3 — нативно мультимодальная универсальная модель: она работает не только с текстом, но также читает изображения и видео, а в индексе интеллекта Artificial Analysis занимает второе место среди разных моделей. Если ваша рабочая нагрузка — это текст, код и логи, а вас волнует стоимость токенов, выбирайте DeepSeek V4 Pro. Если вашему агенту нужно просмотреть скриншот, дизайн-макет или запись экрана, выбирайте M3 — DeepSeek не умеет этого ни за какую цену. Обе модели теперь поставляются с открытыми весами и поддерживают контекстное окно в 1 млн токенов, поэтому это не противостояние в духе «кто-то должен проиграть», каким его обычно представляют на страницах сравнений.

Tiffany Layne | 2026-07-01

Лучший AI API для разработчиков в 2026 году: сравнение 10 платформ

Лучший AI API для разработчиков в 2026 году: сравнение 10 платформ

Кратко Лучшие прямые API: OpenAI — самый безопасный универсальный вариант по умолчанию; Anthropic Claude лучше всего подходит для программирования и длительно работающих агентов; Gemini удобен для недорогого мультимодального прототипирования; DeepSeek лидирует по цене текстовых токенов. Лучшие мультимодельные варианты: OpenRouter — наиболее очевидный выбор для тестирования множества LLM. GPTProto лучше подходит, когда одному продукту нужны текстовые, графические и видео-модели с единым API-ключом и общим балансом. Лучшие инфраструктурные решения: Amazon Bedrock подходит для корпоративных развертываний под управлением AWS, а Replicate, fal.ai и Together AI лучше подходят для инференса открытых моделей или генеративных медиа. Универсального победителя не существует. Сравнивайте соответствие рабочей нагрузке, покрытие моделями, реальные единицы тарификации, средства управления продакшеном и стоимость перехода. Цены и доступность проверены 14 июля 2026 года; перед развертыванием проверьте актуальные страницы провайдеров.

Tiffany Layne | 2026-07-15

7 альтернатив Claude Code в 2026 году (с действительно рабочими конфигурациями)

7 альтернатив Claude Code в 2026 году (с действительно рабочими конфигурациями)

Сначала полная откровенность: большинство статей о лучших альтернативах Claude Code написаны компаниями, которые создают эти альтернативы, и ставят свои продукты на первое место. Мы запускаем API-платформу, а не агента для программирования, поэтому наша предвзятость направлена в другую сторону — мы зарабатываем, когда вы направляете через нас токены, какой бы инструмент вы ни выбрали. Я пишу это потому, что вопрос «как направить Cline на ваш endpoint» незаметно стал одним из самых частых в нашем ящике поддержки, а честный ответ требует сравнить инструменты, которые мы не продаём. Итак, вот принцип, которого я буду придерживаться: ранжировать инструменты по их достоинствам, называть компромиссы и оставить нашу презентацию для единственного раздела, где ей действительно место — для части о том, что подключать к инструментам с открытым исходным кодом.

Michael Johnson | 2026-07-07