GLM 5.2 против Opus 5: краткий вердикт
| Выбирайте GLM-5.2, когда… |
Выбирайте Claude Opus 5, когда… |
| Основное ограничение — расходы на API |
Неудачные попытки и проверка человеком обходятся дорого |
| У задачи есть чёткая спецификация |
Задача расплывчата или меняется по мере работы агента |
| Вам нужны открытые веса или локальное развёртывание |
Вам нужен ввод изображений или отладка по скриншотам |
| Вы создаёте компоненты, тесты или первые черновики в большом объёме |
Вы отслеживаете ошибки или изменяете несколько зависимых систем |
| Каждый результат проверяет человек или вторая модель |
Модель должна проверить свою работу перед передачей результата |
Фактически Opus 5 набирает больше баллов в текущем Intelligence Index от Artificial Analysis. GLM-5.2 гораздо дешевле на GPT Proto, имеет открытые веса и показала более высокую скорость в том же независимом сравнении. По моему мнению, универсального победителя нет: решающим фактором является стоимость получения принятого результата.
Две модели, созданные с учётом разных компромиссов
GLM-5.2 — это модель Z.ai с открытыми весами для долгосрочного программирования и работы агентов. В материалах о запуске в июне Z.ai описывает контекстное окно на 1 млн токенов, режимы рассуждений High и Max, а также лицензию MIT. Её веса также опубликованы на Hugging Face, поэтому команды могут запускать или адаптировать модель за пределами размещённого API.
Такая открытость — реальная инженерная возможность, но не бесплатная. При самостоятельном размещении расходы на токены заменяются расходами на GPU, программное обеспечение для инференса, наблюдаемость, масштабирование и специалистов, поддерживающих работоспособность сервиса. Для многих команд управляемая конечная точка GLM-5.2 останется дешевле самостоятельной эксплуатации весов.
Claude Opus 5 — это проприетарная модель Anthropic для сложного агентного программирования и профессиональной работы. Согласно документации Anthropic по модели, она поддерживает контекст на 1 млн токенов, максимальный вывод в 128 тыс. токенов, адаптивное мышление, а также ввод текста и изображений. Модель выпущена 24 июля 2026 года как преемник Opus 4.8.
Поддержку изображений в Opus 5 легко принять за незначительную деталь таблицы характеристик. Но это не так. Модель программирования, способная анализировать отрендеренную страницу, может сравнить реализацию с эталонным скриншотом, заметить, что кнопка находится за пределами экрана на мобильном устройстве, и повторить итерацию на основе визуальных данных. GLM-5.2 работает только с текстом. Ей всё ещё можно передавать логи браузера, вывод DOM, CSS и структурированные результаты тестов, но сначала другой инструмент должен преобразовать визуальное состояние в текст.
Характеристики и актуальные цены GPT Proto
У обеих моделей практически одинаковая заявленная ёмкость контекста. Существенные различия находятся в других областях.
| Фактор |
GLM-5.2 |
Claude Opus 5 |
| Публичный релиз |
Июнь 2026 года |
24 июля 2026 года |
| Контекстное окно |
1 млн токенов |
1 млн токенов |
| Максимальный вывод |
131 072 токена |
128 тыс. токенов |
| Входные данные |
Текст |
Текст и изображения |
| Управление рассуждениями |
High, Max |
Адаптивное; от низкой до максимальной интенсивности |
| Веса |
MIT, доступны |
Проприетарные |
| Цена входных данных GPT Proto |
$1,26 за 1 млн токенов |
$4 за 1 млн токенов |
| Цена вывода GPT Proto |
$3,96 за 1 млн токенов |
$20 за 1 млн токенов |
| ID модели GPT Proto |
glm-5.2 |
claude-opus-5 |
Указанные выше цены — это тарифы GPT Proto, отображавшиеся 30 июля 2026 года. Разница в лимите вывода — 131 072 против 128 000 токенов — не будет определяющей для обычной задачи программирования. Более важны модальность, надёжность выполнения задач, задержка и разница в $16,04 на миллион выходных токенов.
Производительность в программировании и агентной работе
Наиболее чистое актуальное очное сравнение опубликовано Artificial Analysis. В Intelligence Index v4.1 Claude Opus 5 при высокой интенсивности получил 59 баллов, а GLM-5.2 при максимальной — 51. Этот индекс объединяет девять оценок, охватывающих агентную работу, использование терминала, научное программирование, рассуждения в длинном контексте, знания и склонность к галлюцинациям.
Отрыв в восемь баллов значителен, но агрегированный индекс не показывает, как каждая модель будет работать с вашим репозиторием. Набор бенчмарков может придавать задачам другой вес, чем ваш бэклог, а настройки интенсивности не являются идентичными продуктами. Воспринимайте этот результат как свидетельство более высокого общего потолка возможностей Opus 5, а не как доказательство лучшей отдачи от каждого запроса на программирование.
Z.ai сообщает для GLM-5.2 результаты 62,1 на SWE-bench Pro, 81,0 на Terminal-Bench 2.1 и 74,4 на FrontierSWE. Это результаты, заявленные поставщиком, причём в сравнительной таблице публикации Z.ai о запуске используется Opus 4.8, а не Opus 5. Они подтверждают, что GLM-5.2 заслуживает серьёзной оценки в программировании, но не решают вопрос этого сравнения.
Anthropic сообщает, что Opus 5 более чем вдвое превосходит Opus 4.8 в тестировании Frontier-Bench при меньшей стоимости задачи, а также отстаёт менее чем на 0,5% от максимального результата Fable 5 в CursorBench при вдвое меньшей стоимости задачи. И снова это материалы поставщика. Более полезна поведенческая деталь: примеры запуска Anthropic подчёркивают анализ первопричин, самостоятельную проверку, проверки в браузере и продолжение работы до прохождения результата, а не остановку на правдоподобном патче.
Отсюда следует практическое разделение. GLM-5.2 привлекательна для ограниченных задач: сгенерировать типизированный клиент, добавить тесты для известных случаев, преобразовать компонент или реализовать функцию по точной спецификации. Более высокая цена Opus 5 оправдана, когда модели сначала нужно понять, в чём на самом деле заключается задача.
Какая модель лучше для программирования интерфейсов?
Для создания основы интерфейса GLM-5.2 — более экономичный вариант. Запрос, в котором указаны иерархия компонентов, структура данных, фреймворк, контрольные точки, цвета и состояния взаимодействия, оставляет меньше места для архитектурных решений. Именно здесь имеет смысл быстрая модель с низкой стоимостью вывода. Хорошими кандидатами являются каркасы дашбордов, внутренние формы, варианты Storybook и повторяющиеся миграции страниц.
Преимущество в цене не наделяет GLM визуальным чутьём, которого у неё нет. Если в запросе сказано «сделай красиво», но отсутствуют измеримые требования к дизайну, модели приходится выводить эстетические предпочтения из текста. Она может создать функциональную страницу, которая всё равно будет выглядеть шаблонно, неправильно оценить отступы или не заметить проблему мобильной вёрстки, очевидную в браузере.
У Opus 5 более убедительные преимущества, если рабочий процесс включает скриншоты, браузер, анимацию, Three.js, рендеринг canvas или сложное состояние на стороне клиента. В ранних отчётах Anthropic о доступе к модели описывается оценка интерфейса, в рамках которой модель открывала страницы на десктопной и мобильной ширине, находила контент ниже мобильной границы прокрутки и элемент оформления заказа за пределами экрана, а затем исправляла обе проблемы. Это пример от поставщика, а не независимый тест, но он показывает, почему ввод изображений меняет рабочий процесс.
Поэтому моя рекомендация frontend-разработчикам условна. Используйте GLM-5.2 для создания первой реализации, если дизайн уже подробно описан. Используйте Opus 5, когда модель должна выступать одновременно разработчиком и специалистом по визуальному контролю качества.
Как провести честный тест с одним и тем же запросом
Одного эффектного скриншота недостаточно, чтобы решить, какая модель лучше в сравнении GLM 5.2 и Opus 5. Результаты во frontend могут значительно меняться в зависимости от детализации запроса, контекста репозитория, доступных инструментов, настроек рассуждений и возможности модели анализировать отрендеренную страницу.
Честное сравнение должно предоставить обеим моделям один и тот же репозиторий, инструкции, бюджет вывода, доступ к инструментам и критерии приёмки. В ходе оценки следует фиксировать, собирается ли проект, работают ли взаимодействия, проходит ли мобильная вёрстка, сколько запросов на исправление требуется, общий расход токенов, затраченное время и итоговую стоимость API.
Качество кода также важно. Проверяйте каждый результат на проблемы доступности, дублирование логики, ненужные зависимости, мёртвый код и изменения за пределами запрошенной области. Самый дешёвый первый ответ не обязательно означает самую дешёвую принятую реализацию.
Это сравнение не объявляет универсального победителя во frontend на основе одной генерации дашборда. Согласно доступным сейчас данным, Claude Opus 5 имеет более высокий независимый результат по возможностям и поддерживает ввод изображений, тогда как GLM-5.2 предлагает значительно более низкие цены API, более высокую измеренную скорость вывода и открытые веса. Какая модель лучше справится с конкретным frontend-проектом, по-прежнему зависит от репозитория, запроса и процесса проверки.
Цены: стоимость токена против стоимости принятой задачи
На GPT Proto GLM-5.2 сейчас стоит $1,26 за миллион входных токенов и $3,96 за миллион выходных. Claude Opus 5 стоит соответственно $4 и $20. Для наглядного примера с использованием трёх миллионов входных токенов и одного миллиона выходных арифметика выглядит так:
| Модель |
Стоимость ввода |
Стоимость вывода |
Итого |
| GLM-5.2 |
$3,78 |
$3,96 |
$7,74 |
| Claude Opus 5 |
$12 |
$20 |
$32 |
Разница составляет $24,26 при одинаковом наборе токенов. При таком упрощённом допущении GLM-5.2 может использовать примерно в четыре раза больше токенов, прежде чем её счёт достигнет итоговой стоимости Opus 5.
Но это допущение существенно влияет на результат. Агенты программирования многократно читают файлы, записывают патчи, запускают инструменты, анализируют ошибки и пробуют снова. Модель, допустившая раннюю архитектурную ошибку, может потратить миллионы дешёвых токенов на развитие неправильной реализации. Более дорогая модель может оказаться дешевле, если достигнет приемлемого патча за меньшее число итераций.
Один эксперимент сообщества с 50 реальными pull request’ами на Go и Rustпоказывает, почему важны эти дополнительные измерения. В нём оценивались соответствие патчу человека, качество кода, количество итераций агента, расход токенов и изменения патча, а не только успешное прохождение тестов. В тесте GLM-5.2 сравнивалась с Opus 4.8, а комментаторы оспорили некоторые элементы методологии настройки интенсивности, поэтому его победителя не следует переносить в это сравнение. Однако дизайн оценки остаётся полезным: успешная компиляция — не то же самое, что код, которым сопровождающий хочет владеть.
В рабочей среде отслеживайте стоимость принятой задачи. Учитывайте повторы, вызовы инструментов, кэшированный ввод, время исправлений человеком и неудачные запуски. Таблица стоимости токенов — это отправная точка, а не окончательный вердикт.
Скорость и опыт разработчика
Artificial Analysis зафиксировала для GLM-5.2 при максимальной интенсивности 149 выходных токенов в секунду, а для Opus 5 при высокой интенсивности — 53 токена в секунду. Время до первого токена составило 1,39 секунды для GLM-5.2 и 12,83 секунды для Opus 5.
Эти измерения относятся к поставщикам и конфигурациям, протестированным Artificial Analysis; они не являются гарантией задержки GPT Proto. Тем не менее они показывают реальный компромисс. GLM-5.2 лучше подходит для интерактивных циклов, когда разработчик хочет быстро получить ответ, оценить его и отправить следующую инструкцию. Opus 5 требует больше ожидания в обмен на более высокий результат по возможностям.
Скорость вывода — не то же самое, что скорость завершения. Если задача заключается в том, чтобы «переименовать это поле в двенадцати файлах», более быстрые токены, вероятно, означают более быструю работу. Если задача — «найти, почему оформление заказа не работает только после частичного возврата», модель, которая за один запуск определит правильный переход состояния, может завершить работу раньше, даже если её текст поступает медленнее.
Открытые веса, конфиденциальность и развёртывание
Лицензия MIT для GLM-5.2 открывает сценарий использования, с которым Opus 5 не может сравниться: контролируемое развёртывание. Команда может разместить веса в собственной среде, дообучать адаптеры, выбрать стек инференса и самостоятельно решать, как хранить запросы и логи.
Цена этого решения — операционная ответственность. Контекст на 1 млн токенов при полезной степени параллелизма предъявляет серьёзные требования к памяти, управлению кэшем и инфраструктуре обслуживания. В собственной публикации о запуске Z.ai уделяет значительное место инженерии инференса длинного контекста, поскольку принять один миллион токенов и экономично обслуживать их — разные задачи.
Opus 5 — более простой управляемый вариант. Поставщик занимается обслуживанием и обновлением модели, а разработчики получают ввод изображений и экосистему инструментов Claude. Компромисс заключается в зависимости от проприетарного сервиса и его правил использования. Для регулируемых или изолированных от сети рабочих нагрузок GLM-5.2 может победить ещё до рассмотрения бенчмарка. Для небольшой команды, которая не хочет эксплуатировать инфраструктуру моделей, «открытые веса» могут добавить работы, а не устранить её.
Какую модель выбрать разработчикам?
| Проект |
Лучший вариант для начала |
Почему |
| Генерация компонентов в большом объёме |
GLM-5.2 |
Низкая стоимость вывода и более быстрая генерация |
| Отладка интерфейса по скриншотам |
Opus 5 |
Нативный ввод изображений и более надёжная проверка |
| Неоднозначный рефакторинг репозитория |
Opus 5 |
Более высокий текущий показатель интеллектуальных возможностей и более сильное планирование |
| Генерация тестов или структурированные преобразования |
GLM-5.2 |
Ограниченную работу проще проверять автоматически |
| Локальное или пользовательское развёртывание |
GLM-5.2 |
Открытые веса MIT |
| Автономный агент программирования, чувствительный к сбоям |
Opus 5 |
Стоимость ошибочного запуска может превысить премию за API |
| Маршрутизатор для производства с контролем затрат |
Сначала GLM, затем повышение до Opus |
Платите за премиум только тогда, когда этого требует задача или этап проверки |
Если бы мне пришлось выбрать один вариант по умолчанию для небольшой инженерной команды, я бы выбрал Opus 5, когда сбои агента могут попасть в продакшен или потребовать времени старших специалистов на ревью. Я бы выбрал GLM-5.2, когда у команды уже есть тесты, этапы проверки и логика маршрутизации, способные ограничить последствия более слабой первой попытки.
Это также ответ на вопрос «GLM 5.2 против Opus 5 — какая модель выгоднее?». GLM-5.2 выигрывает по счёту за токены. Opus 5 может выиграть по стоимости завершённой задачи. Именно ваш процесс приёмки определяет, какое число имеет значение.
Как сравнить обе модели через GPT Proto
GPT Proto предоставляет отдельные страницы для GLM-5.2 и Claude Opus 5. Перед началом проверьте на каждой странице текущую цену, ID модели, поддерживаемые параметры и модальности ввода, поскольку детали маршрутизации могут измениться.
Для полезного сравнения выберите одну задачу из реального бэклога, а не используйте общий запрос «создай мне приложение». Передайте обеим моделям одни и те же исходные файлы, спецификацию, бюджет вывода и автоматические проверки. Настройки рассуждений каждой модели должны соответствовать задокументированным для неё режимам — не следует предполагать, что названия параметров одного поставщика подойдут другому.
Затем сравнивайте принятые результаты, а не только первые ответы. Фиксируйте стоимость API, затраченное время, статус сборки и тестов, количество исправлений, время проверки человеком и любые регрессии, внесённые патчем. Для frontend-задач проверяйте результат на десктопной и мобильной ширине, а также тестируйте взаимодействие с клавиатурой. Такой процесс покажет, что ценнее для вашего рабочего процесса: более низкая стоимость токенов GLM-5.2 или более высокий потолок возможностей Opus 5.