Schuyler Stacy2026-07-17

Как использовать GLM-5.2 для coding-агента без лишних затрат на контекст в 1M

Запустите GLM-5.2 в качестве coding-агента с Claude Code или OpenAI-совместимым API. Реальные инструкции по настройке, запросы для задач на уровне репозитория, требования для локального запуска и примеры стоимости.

Как использовать GLM-5.2 для coding-агента без лишних затрат на контекст в 1M

Подключение GLM-5.2 к coding-агенту занимает несколько минут. Гораздо сложнее предоставить ему достаточно контекста для исправления репозитория и не позволить ему сбиться с пути.

Это различие важно. Модель может написать аккуратную функцию в окне чата и при этом провалить реальную инженерную задачу: изменить не тот слой, нарушить API-контракт, пропустить тесты или потратить половину контекста на чтение сгенерированных файлов. GLM-5.2 разработана для продолжительной работы с кодом и инструментами, но модели по-прежнему нужен продуманный рабочий процесс агента.

В этом руководстве рассматриваются три практических варианта: использование GLM-5.2 с Claude Code, вызов API GLM-5.2 на GPTProto из агента, совместимого с OpenAI, и локальный запуск модели с открытыми весами. Затем показано, как ограничить задачу на уровне репозитория, управлять контекстом в 1M токенов, проверять изменения и оценивать фактическую стоимость токенов.

Кратко

  • Используйте Claude Code с Anthropic-совместимой конечной точкой Z.ai, если уже работаете с этим терминальным агентом.
  • Используйте OpenAI-совместимую конечную точку GPTProto для Cline, OpenCode, собственного агента или приложения, которое уже использует OpenAI SDK.
  • Не отправляйте весь монорепозиторий по умолчанию только потому, что GLM-5.2 принимает до 1M токенов. Начните с карты репозитория, релевантных файлов, ограничений и команд для запуска тестов.
  • Используйте высокий уровень рассуждений для обычного исследования, а максимальный — для неоднозначных задач с несколькими файлами, где ошибочный план будет дорогостоящим.
  • Считайте изменения агента непроверенными, пока они не пройдут сборку, линтер, проверки типов и тесты репозитория.
  • Запускайте модель локально только тогда, когда конфиденциальность, контроль или постоянная нагрузка оправдывают серьезную инфраструктуру. «Открытые веса» не означают «размером с ноутбук».
Содержание

Что нужно подготовить

GLM-5.2 — это модель, а не полноценный coding-агент. Окружающий инструмент по-прежнему должен читать и изменять файлы, запускать команды, сохранять состояние и решать, когда остановиться.

Перед подключением подготовьте:

  1. Интерфейс coding-агента. Claude Code, Cline, OpenCode или собственный цикл инструментов могут выполнять эту роль.
  2. Доступ к API или локальный инференс. Облачный доступ — самый быстрый способ оценить модель. Локальный инференс дает больше контроля, но требует значительно более мощного оборудования и серьезной операционной работы.
  3. Репозиторий, способный проверять себя. До запроса на изменение кода вы должны знать точные команды сборки, линтинга, проверки типов и тестирования.
  4. Изолированную рабочую ветку. Не начинайте длительную автономную задачу в рабочей ветке с незакоммиченными изменениями.
  5. Четкие границы. Заранее решите, может ли агент устанавливать зависимости, обращаться к сети, изменять схемы, запускать миграции или создавать коммиты.

Два последних пункта — не формальность ради безопасности. Coding-агент с доступом к shell может внести технически корректное изменение, которое полностью не подходит вашему процессу выпуска.

Выберите подходящий способ запуска GLM-5.2

Есть три разумных варианта. Лучший выбор зависит скорее от имеющихся инструментов и правил работы с данными, чем от качества модели.

ВариантЛучше всего подходит дляГлавное преимуществоГлавный компромисс
Claude Code с Z.aiРазработчиков, уже использующих Claude CodeПрямая Anthropic-совместимая настройкаТребуются отдельные ключ и тарифный план Z.ai
GPT Proto APIOpenAI-совместимых агентов и собственных приложенийОплата по мере использования и один ключ для 200+ моделейВсе равно нужны интерфейс агента или цикл инструментов
Локальное развертываниеРаботы с приватным кодом, собственного сервинга и постоянных нагрузокПолный контроль над весами и инфраструктуройБольшие требования к хранилищу, памяти, GPU и сервингу

Для первой оценки используйте облачный доступ. Так вы поймете, подходит ли GLM-5.2 вашим репозиториям, прежде чем покупать или резервировать оборудование для инференса. Если вы уже направляете несколько текстовых, графических или видеомоделей через одно приложение, каталог моделей GPT Proto также позволяет протестировать GLM-5.2 без создания отдельной изолированной интеграции.

Как использовать GLM-5.2 с Claude Code

Z.ai предоставляет Anthropic-совместимую конечную точку специально для таких инструментов, как Claude Code и Goose. В текущей документации используется:

https://api.z.ai/api/anthropic

Вам понадобятся Node.js 18 или новее, Claude Code, API-ключ Z.ai и активный план, включающий GLM-5.2. Официальная команда установки:

npm install -g @anthropic-ai/claude-code

Откройте ~/.claude/settings.json в macOS, Linux или WSL. В обычной Windows используйте %USERPROFILE%\.claude\settings.json. Добавьте следующие параметры окружения, не удаляя уже имеющиеся несвязанные поля:

{
  "env": {
    "ANTHROPIC_AUTH_TOKEN": "your_zai_api_key",
    "ANTHROPIC_BASE_URL": "https://api.z.ai/api/anthropic",
    "ANTHROPIC_DEFAULT_HAIKU_MODEL": "glm-4.5-air",
    "ANTHROPIC_DEFAULT_SONNET_MODEL": "glm-5.2[1m]",
    "ANTHROPIC_DEFAULT_OPUS_MODEL": "glm-5.2[1m]",
    "CLAUDE_CODE_AUTO_COMPACT_WINDOW": "1000000",
    "CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": 1,
    "API_TIMEOUT_MS": "3000000"
  }
}

Суффикс [1m] включает вариант с контекстом 1M в Claude Code. Z.ai также рекомендует использовать свежую версию Claude Code, если это имя модели не распознается. Приведенная выше конфигурация соответствует текущему руководству Z.ai по Claude Code и руководству по переключению моделей GLM-5.2.

Запустите Claude Code из репозитория, к которому он должен получить доступ:

cd path/to/your-project
claude

Затем выполните:

/status

Убедитесь, что источником настроек является измененный вами файл, а выбранная модель — glm-5.2 или glm-5.2[1m]. Если отображается другая модель, закройте все сеансы Claude Code, откройте новый терминал, проверьте JSON и убедитесь, что используется правильный путь к файлу.

Осознанно выбирайте уровень High или Max

GLM-5.2 предоставляет уровни рассуждений High и Max. В Claude Code Z.ai сопоставляет low, medium и high с режимом GLM-5.2 High; xhigh, max и ultra — с режимом Max. Изменить настройку можно с помощью /effort.

Начинайте с High для объяснения кода, небольших расследований ошибок, генерации тестов и четко ограниченных изменений. Используйте Max, когда агенту нужно проследить сбой через несколько подсистем, спланировать крупную миграцию или разобраться в неоднозначной ошибке с несколькими возможными причинами. Max может улучшить план, но обычно создает больше токенов рассуждений и отвечает медленнее. Это должно быть решение для конкретной задачи, а не постоянная настройка по умолчанию.

Как вызывать API GLM-5.2 на GPT Proto

Claude Code — лишь один из интерфейсов. Если ваш coding-агент поддерживает провайдера, совместимого с OpenAI, укажите GPT Proto и используйте строку модели glm-5.2.

Установите актуальный клиент OpenAI для Python:

python -m pip install openai

Храните ключ в переменной окружения, а не вставляйте его в исходный код:

export GPTPROTO_API_KEY="your_gptproto_api_key"

Следующий запрос можно выполнить без изменений после добавления действительного ключа:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["GPTPROTO_API_KEY"],
    base_url="https://gptproto.com/v1",
)

response = client.chat.completions.create(
    model="glm-5.2",
    messages=[
        {
            "role": "system",
            "content": (
                "You are a repository-level coding assistant. Inspect before "
                "proposing changes. Preserve existing API contracts, do not add "
                "dependencies without approval, and list the verification "
                "commands required for every proposed edit."
            ),
        },
        {
            "role": "user",
            "content": (
                "An API client occasionally sends two refresh-token requests "
                "after several requests fail with 401. Identify the likely race "
                "condition, describe the files you would inspect, and return a "
                "minimal repair plan before writing code."
            ),
        },
    ],
)

print(response.choices[0].message.content)

Эквивалентный запрос cURL:

curl https://gptproto.com/v1/chat/completions \
  -H "Authorization: Bearer $GPTPROTO_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.2",
    "messages": [
      {
        "role": "system",
        "content": "Inspect before editing. Preserve API contracts and report the tests required for every proposed change."
      },
      {
        "role": "user",
        "content": "Plan a safe fix for duplicate refresh-token requests after concurrent 401 responses."
      }
    ]
  }'

Это настоящий API-вызов, но пока не автономный coding-агент. Чтобы превратить его в агента, приложение должно предоставить контролируемые инструменты для чтения файлов, поиска по репозиторию, применения патчей и запуска тестов. Затем оно должно возвращать результаты инструментов модели, пока задача не достигнет определенного условия остановки.

В учебных материалах это различие легко упустить. Chat completion может предложить патч. Агент — это система, которая решает, какие файлы изучить, выполняет изменение, анализирует результат и при необходимости повторяет попытку.

Сейчас GPT Proto указывает для GLM-5.2 цену $1.26 за 1M входных токенов и $3.96 за 1M выходных токенов. Текущую ставку и сведения о модели можно проверить на странице API GLM-5.2, а общая информация о биллинге аккаунта доступна на странице моделей GPT Proto.

Используйте задачу на уровне репозитория, а не короткий запрос

Фраза «исправь ошибку авторизации» задает цель, но не определяет границы, способ проверки или критерии готовности. Лучше явно сформулировать инженерный контракт.

Используйте этот шаблон:

Goal
Fix the duplicate refresh-token request that occurs when several API calls
receive 401 responses at the same time.

Relevant context
- The frontend is TypeScript.
- Authentication state is managed in src/auth/.
- HTTP requests pass through src/api/client.ts.
- Existing public API contracts must not change.

Constraints
- Do not add dependencies.
- Do not change backend endpoints or token formats.
- Do not create a commit.
- Ask before modifying files outside src/auth/ and src/api/.

Required process
1. Read the relevant files and map the current refresh flow.
2. State the most likely cause and any assumptions.
3. Propose the smallest safe change before editing.
4. Implement only after the plan is clear.
5. Run npm run typecheck, npm run lint, and the authentication tests.

Definition of done
- Concurrent 401 responses share one refresh request.
- Queued requests retry once after refresh succeeds.
- Failed refresh clears authentication state without an infinite retry loop.
- Existing tests pass and a regression test covers the concurrent case.

Stop conditions
- Stop and ask if the fix requires a new package, backend change, migration,
  secret, or destructive command.

Final report
List changed files, explain the behavior change, show verification results,
and identify any remaining risk.

Этот запрос длиннее, чем «исправь ошибку», но обычно сокращает число бесполезных шагов агента. Он сообщает модели, чего не следует касаться, и делает пропущенную проверку заметной.

Три примера coding-агента GLM-5.2, которые стоит попробовать

Небольшие тесты генерации кода мало говорят о модели агента. GLM-5.2 ориентирована на длительную работу, поэтому оценивайте ее на задачах, включающих навигацию, планирование, инструменты и проверку. Z.ai сообщает о контекстном окне 1M и существенном превосходстве над GLM-5.1 в SWE-bench Pro и Terminal-Bench 2.1, однако результаты бенчмарков не гарантируют успех в вашем репозитории. Важнее показатель выполнения собственных задач, чем общий балл. Условия проведенных оценок описаны в официальной документации модели GLM-5.2.

1. Найдите и исправьте ошибку в нескольких файлах

Предоставьте агенту отчет об ошибке, релевантные логи, команду запуска тестов и разрешение изучить репозиторий. Попросите его сначала описать цепочку вызовов. Так вы проверите, способен ли он удерживать гипотезу через middleware, сервисы и управление состоянием, а не исправлять первую подозрительную функцию.

Требуйте регрессионный тест. Без него правдоподобный патч может выглядеть завершенным, хотя состояние гонки останется.

2. Обновите зависимость без изменения поведения

Попросите агента изучить прямое и транзитивное использование, прочитать предоставленные заметки о миграции, изменить минимально необходимую область и запустить полный релевантный набор тестов. Отдельно укажите, что нельзя скрывать ошибки типов широкими приведениями или отключать правила линтинга.

Так проверяется соблюдение ограничений. Сложность не в изменении строки с версией, а в сохранении поведения при изменении интерфейсов под кодом.

3. Изучите незнакомый репозиторий до реализации

Предоставьте запрос на функцию и попросите составить карту репозитория, указать вероятные точки интеграции, затронутые тесты и нерешенные вопросы. На первом этапе не разрешайте изменять файлы.

Это полезный и малорисковый способ оценки: вы можете проверить, понял ли модель архитектуру, прежде чем предоставить ей доступ на запись. Если карта неверна, уточните контекст, а не оплачивайте несколько неудачных циклов реализации.

Как использовать контекст 1M, не оплачивая чтение всего репозитория

Окно в 1M токенов — это верхний предел, а не цель. Самая дорогая ошибка — считать, что большее количество файлов автоматически дает лучший ответ.

Начните с карты репозитория. Включите дерево каталогов верхнего уровня, манифесты пакетов, команды сборки и тестирования, архитектурные заметки и файлы, расположенные ближе всего к проблемному поведению. Пусть агент запрашивает дополнительные файлы по мере развития гипотезы.

Исключите очевидный шум:

  • Сгенерированные результаты сборки
  • Каталоги зависимостей и vendor
  • Минифицированные ресурсы
  • Большие снапшоты, не связанные с задачей
  • Исторические логи, не имеющие отношения к сбою
  • Секреты и локальные файлы окружения

Для длительных задач попросите агента поддерживать короткую контрольную точку с текущей целью, измененными файлами, принятыми решениями, результатами тестов и открытыми рисками. Контрольную точку дешевле и проще проверять, чем постоянно повторно передавать весь предыдущий диалог.

Помните, что биллинг API обычно учитывает токены, обработанные в каждом запросе, а не только уникальный текст. Если агент десять раз отправляет один и тот же контекст репозитория размером 300K токенов, оплаченный объем входных данных может приблизиться к 3M токенов еще до учета новых сообщений — в зависимости от кэширования и поведения запросов провайдера. Большое окно решает проблему вместимости, но не отменяет необходимость управлять контекстом.

Сколько стоит coding-агент GLM-5.2?

При текущих тарифах GPT Proto базовый расчет выглядит так:

cost = input_tokens / 1,000,000 × $1.26
     + output_tokens / 1,000,000 × $3.96

Вот три примерных итога:

Накопленное использование за одну задачуСтоимость входных данныхСтоимость выходных данныхИтого
50K входных + 5K выходных$0.0630$0.0198$0.0828
300K входных + 30K выходных$0.3780$0.1188$0.4968
1M входных + 100K выходных$1.2600$0.3960$1.6560

Это примеры стоимости токенов, а не гарантированная цена задачи. Coding-агент может выполнять множество вызовов модели при чтении файлов, планировании, применении изменений, интерпретации ошибок тестов и повторных попытках. Важен совокупный объем оплаченных входных и выходных токенов за весь запуск.

Три меры помогают контролировать расходы:

  1. Установите максимальное число шагов агента.
  2. Требуйте подтверждения, прежде чем задача перейдет в новые каталоги или другую область.
  3. Учитывайте токены и стоимость по задачам, а не только по календарному месяцу.

Третья мера помогает честно сравнивать модели. Более дешевый токен может привести к более дорогому исправлению, если модели потребуется вдвое больше повторных попыток.

Можно ли запускать GLM-5.2 локально?

Да, но слово «локально» требует уточнения.

GLM-5.2 выпущена под лицензией MIT, а ее официальная карточка модели на Hugging Face перечисляет варианты развертывания для vLLM, SGLang, Transformers, KTransformers, Unsloth, Ascend NPU и квантованных сред выполнения. Таким образом, самостоятельный запуск технически возможен.

При этом полная модель содержит примерно 753B параметров, из которых около 40B активны для каждого токена. Активное число параметров может уменьшать вычисления при инференсе, однако все веса экспертов необходимо хранить и предоставлять системе. Приблизительный расчет только для хранения весов показывает, что 753B параметров требуют около 1.5TB при 16-битной точности или около 376GB при 4-битной — еще до учета накладных расходов среды выполнения, KV-кэша, памяти для длинного контекста и запаса для сервинга. Точные требования зависят от квантования, фреймворка, конфигурации оборудования и длины контекста.

Поэтому утверждение, что GLM-5.2 «работает локально», может быть верным и при этом совершенно неактуальным для пользователя ноутбука. Сильно квантованные сборки сообщества могут снизить порог входа, но одновременно изменить скорость, качество ответов, поддерживаемый контекст или все это сразу.

Выбирайте локальное развертывание, если:

  • Исходный код не может покидать контролируемую вами инфраструктуру.
  • Вам нужно изменять или дообучать веса.
  • Постоянная нагрузка делает собственную инфраструктуру экономически оправданной.
  • Ваша команда умеет обслуживать много-GPU инференс и следить за ним.

Выбирайте облачный API, если:

  • Вы все еще оцениваете соответствие модели вашим задачам.
  • Использование нерегулярно или трудно прогнозируется.
  • Вам важнее быстро получить рабочий доступ, чем контролировать инфраструктуру.
  • Ваша команда не хочет самостоятельно обслуживать инференс.

Где подходит GLM-5.2 и где по-прежнему важна проверка человеком

GLM-5.2 — убедительный вариант для анализа репозитория, реализации изменений в нескольких файлах, исправления тестов, исследования производительности, работы с зависимостями и технического исследования с инструментами. Большой контекст особенно полезен, когда задача действительно затрагивает множество связанных файлов.

Не путайте длинный контекст с полномочиями на действия. Сохраняйте этап согласования человеком для:

  • Миграций производственных баз данных
  • Изменений аутентификации и авторизации
  • Шифрования, управления ключами и средств безопасности
  • Разрушающих команд shell
  • Решений о лицензировании зависимостей
  • Автоматических коммитов, слияний и развертываний
  • Изменений, которые нельзя отменить из системы контроля версий или резервных копий

Для таких задач агент может провести исследование, подготовить план, создать патч и выполнить безопасные проверки. Но действие, меняющее границы системы, по-прежнему должен одобрить человек.

Практический чек-лист coding-агента GLM-5.2

Перед запуском:

  • Создайте изолированную ветку или worktree.
  • Проверьте выбранную модель и конечную точку.
  • Удалите секреты из доступного контекста.
  • Определите разрешенные каталоги и инструменты.
  • Укажите точные команды сборки и тестирования.
  • Сообщите, разрешено ли добавлять новые зависимости.
  • Установите ограничения по числу шагов, времени и стоимости.

Перед принятием результата:

  • Изучите diff, а не только резюме агента.
  • Убедитесь, что публичные API и схемы изменены только по запросу.
  • При существенном риске самостоятельно запустите тесты.
  • Проверьте отключенные правила, скрытые ошибки, широкие приведения типов и пропущенные тесты.
  • Зафиксируйте нерешенные риски и дальнейшую работу.

Настройка подключает GLM-5.2 к вашему терминалу или приложению. Именно этот чек-лист превращает подключение в пригодный для работы инженерный процесс.

Итог

Лучший способ использовать GLM-5.2 в coding-агенте — не передавать ему максимально большой контекст и ждать результата. Подключите модель через интерфейс, подходящий вашему стеку, начните с карты репозитория и узкого описания задачи, требуйте план до внесения изменений и сделайте проверку частью критериев готовности.

Используйте Claude Code, если вам нужен готовый рабочий процесс в терминале. Используйте API GLM-5.2, если лучше подходит OpenAI-совместимый агент или собственное приложение. Рассматривайте самостоятельный хостинг только после того, как конфиденциальность, контроль или постоянный объем нагрузки оправдают оборудование, а не заранее.

С GPT Proto один API-ключ и баланс также открывают доступ к более широкому каталогу AI-моделей, поэтому вы можете сравнивать GLM-5.2 с другими моделями для программирования, не перестраивая интеграцию под каждого провайдера.

Универсальная творческая студия

Создавайте здесь изображения и видео. API GPTProto обеспечивает быстрые обновления моделей и самые низкие цены.

Начать создание
Универсальная творческая студия
Похожие модели
Все модели
Z-AI
by Z-AI
10% OFF
Claude
20% OFF
Google
40% OFF
Google
40% OFF

Часто задаваемые вопросы

Хорошо ли GLM-5.2 подходит для coding-агентов?

Да, особенно для длительных задач с несколькими файлами, которые включают навигацию по репозиторию, использование инструментов, планирование и повторную проверку. Официальные результаты показывают существенное превосходство над GLM-5.1 в оценках программирования и длительных задач. Считайте эти результаты основанием протестировать модель, а не заменой оценки на собственных репозиториях.

Можно ли использовать GLM-5.2 с Claude Code?

Да. Z.ai предоставляет Anthropic-совместимую конечную точку для Claude Code: https://api.z.ai/api/anthropic. Установите значения моделей Sonnet и Opus по умолчанию в glm-5.2[1m], добавьте окно автосжатия 1M, запустите Claude Code и проверьте активную модель с помощью /status.

Можно ли использовать API GLM-5.2 на GPTProto для coding-агента?

Да. GPTProto предоставляет glm-5.2 через OpenAI-совместимый API, поэтому модель можно использовать с совместимыми инструментами агента или собственным циклом инструментов. Базовый API-вызов генерирует ответ, но за доступ к файлам, выполнение команд, состояние, разрешения и условия остановки по-прежнему отвечает ваш фреймворк агента.

Какие требования предъявляются к GLM-5.2?

Для облачного использования нужны API-ключ, совместимый клиент или coding-агент и репозиторий с известными командами проверки. Полное локальное развертывание требует серверной инфраструктуры, поскольку GLM-5.2 содержит примерно 753B параметров. Требования к памяти сильно зависят от точности, квантования, контекста и фреймворка сервинга.

Можно ли запускать GLM-5.2 локально с Ollama или llama.cpp?

Квантованные сборки можно использовать с совместимыми локальными средами выполнения, а на официальной странице модели перечислены доступные варианты квантования. Перед загрузкой проверьте требования конкретной сборки к памяти, контексту и архитектуре. Не считайте сам факт наличия среды доказательством того, что на вашем компьютере доступны полный контекст 1M или приемлемая скорость.

Следует ли использовать уровень рассуждений High или Max?

Используйте High для обычного исследования и хорошо ограниченных изменений. Используйте Max для неоднозначных сбоев, рефакторинга всего репозитория и задач, где агенту нужно сравнить несколько планов до начала работы. Max может улучшить результат сложной работы, но обычно требует больше времени и токенов рассуждений.

Сколько стоит coding-агент GLM-5.2?

Сейчас GPTProto указывает $1.26 за 1M входных токенов и $3.96 за 1M выходных токенов. Задача с совокупными 300K входных и 30K выходных токенов будет стоить около $0.50 по этим тарифам. Фактические запуски агентов различаются, поскольку чтение каждого файла, повторная попытка, результат теста и повторная передача контекста могут добавлять токены.

Поддерживает ли GLM-5.2 вызов инструментов?

Да. GLM-5.2 поддерживает рабочие процессы агентов с инструментами. Модель может решить, когда запросить доступный инструмент, но окружающее приложение должно определить схему инструмента, выполнить одобренные действия, вернуть результаты и обеспечить соблюдение разрешений.

Похожие статьи

Ещё блоги
Что такое GLM 5.2? Кодинг с открытыми весами за 1/6 цены

Что такое GLM 5.2? Кодинг с открытыми весами за 1/6 цены

Китайская лаборатория выпустила модель, которую можно бесплатно скачать, запустить на собственном оборудовании и использовать примерно за одну шестую стоимости закрытых передовых моделей — при этом на реальных тестах программирования она отстаёт от Claude Opus 4.8 всего на несколько пунктов. А затем выпустила её, не опубликовав ни одного собственного официального бенчмарка. Это GLM 5.2, и разрыв между «никаких маркетинговых цифр» и «почти вершина каждого независимого рейтинга уже через неделю» — именно то, что делает её достойной изучения. Я много пишу подобных объясняющих материалов, и большинство статей о новых моделях быстро забываются, потому что просто пересказывают спецификацию. Эта отличается по одному действительно важному для разработчиков параметру: веса открыты по лицензии MIT, поэтому на обычный вопрос — «бенчмарк настоящий или это маркетинг?» — здесь есть необычно чёткий ответ. Люди скачали модель и протестировали её самостоятельно. Ниже — что такое GLM 5.2, как она работает и где находятся её границы.

Michael Johnson | 2026-07-15

GLM-5.2 и DeepSeek V4 Pro: бенчмарки, цены и какую модель действительно использовать (2026)

GLM-5.2 и DeepSeek V4 Pro: бенчмарки, цены и какую модель действительно использовать (2026)

Кратко: Если ваша рабочая нагрузка связана с агентной разработкой с длинным горизонтом — агент часами работает с репозиторием и выпускает готовую функцию, — GLM-5.2 будет более сильной моделью. Если же вам нужны алгоритмы, математика, STEM-рассуждения или высокая пропускная способность при ограниченном бюджете, DeepSeek V4 Pro выигрывает, причём с большим отрывом по цене. В независимом индексе Intelligence Index v4.1 от Artificial Analysis GLM-5.2 (максимальное усилие) набирает 51 балл против 44 у DeepSeek V4 Pro, однако официальная ставка DeepSeek за токен примерно в 3–5 раз ниже. Но есть нюанс, который упускает большинство сравнений: цена за токен и стоимость задачи — не одно и то же. Ниже я покажу почему. Обе эти модели представлены на страницах каталога GLM-5.2 и deepseek-v4-pro на нашей платформе, а вопрос «к какой модели мне направлять запросы» стал одним из самых частых среди разработчиков, запускающих агентов для программирования. В этой статье я постараюсь ответить на него обстоятельно — используя независимые данные бенчмарков там, где они доступны, чётко помечая данные поставщиков там, где их нет, и приводя расчёты стоимости, отражающие реальные расценки DeepSeek в июле 2026 года, а не цены апреля.

Schuyler Stacy | 2026-07-06

MiniMax M3 для программирования: бенчмарки, реальные цены и вызов через API (2026)

MiniMax M3 для программирования: бенчмарки, реальные цены и вызов через API (2026)

Хорош ли MiniMax M3 для программирования? Короткий ответ: да, для агентской работы и задач с несколькими файлами, но есть два нюанса, о которых я сразу скажу, прежде чем вы прочитаете дальше. Большинство громких результатов в тестах программирования были получены MiniMax на собственной инфраструктуре, а заявленный «контекст в 1 миллион токенов» имеет резкий ценовой порог на уровне 512K, который особенно важен для программных агентов. Оба момента легко учитывать, если знать о них заранее. При этом в большинстве публикаций о запуске они освещены недостаточно ясно. Я пишу это потому, что презентация M3 для программирования свелась к одному числу — 59% в SWE-Bench Pro, — и это число выполняет слишком много непроверенной работы. Ниже я разберу, чем на самом деле является модель, к каким результатам приходят независимые измерения, сколько она стоит при реальной нагрузке программного агента и как вызывать её через API GPTProto. Если вам нужен только вердикт: независимый обозреватель, который прогоняет один и тот же набор тестов на всех серьёзных моделях, поставил M3 «рядом с GPT и Opus в реальном программировании, но ещё не выше них». Это также соответствует результатам нейтральных бенчмарков.

Schuyler Stacy | 2026-07-02

Что такое Kimi K3 — и действительно ли он близок к GPT-5.6 и Fable 5?

Что такое Kimi K3 — и действительно ли он близок к GPT-5.6 и Fable 5?

Кратко Kimi K3 — мультимодальная модель Moonshot AI с 2,8 триллиона параметров, предназначенная для долгосрочного программирования, интеллектуальной работы, рассуждений и агентских процессов. Независимое тестирование ставит её в целом рядом с Claude Opus 4.8 и GPT-5.5, тогда как GPT-5.6 Sol и Claude Fable 5 остаются впереди. K3 сокращает отставание в агентских бенчмарках и лидирует в некоторых тестах автоматизации, однако измеренный уровень галлюцинаций вырос по сравнению с K2.6. Kimi K3 теперь доступна с открытыми весами. Moonshot AI опубликовала полный чекпойнт, карточку модели, технический отчёт и собственную лицензию Kimi K3. Официальный репозиторий на Hugging Face занимает около 1,56 ТБ и включает 96 шардов safetensors, а Moonshot рекомендует развёртывание на суперузлах с 64 или более ускорителями. Открытые веса решают вопрос доступности модели. Но это не превращает K3 в обычную локальную модель. Для большинства разработчиков размещённый API остаётся практичной отправной точкой. API Kimi K3 на GPTProto сейчас предлагает цену $2.70 за миллион входных токенов и $13.50 за миллион выходных токенов. Выбирайте веса, если контроль над данными, собственный инференс или модификация модели оправдывают затраты на инфраструктуру и проверку лицензии. Короче говоря, Kimi K3 достаточно близка к GPT-5.6 и Fable 5, чтобы участвовать с ними в одном сравнении, а выпуск открытых весов теперь даёт разработчикам вариант развёртывания, которого нет ни у одной из закрытых моделей.

Michael Johnson | 2026-07-28