GLM-5.2 и Kimi K3: краткое сравнение
| Категория |
GLM-5.2 |
Kimi K3 |
Практический победитель |
| Архитектура |
MoE с 753 млрд параметров, около 40 млрд активных на токен |
MoE с 2,8 трлн параметров, активируются 16 из 896 экспертов |
Kimi K3 по масштабу; один лишь размер не доказывает качество |
| Окно контекста |
1 млн токенов |
1 млн токенов |
Ничья |
| Максимальный вывод |
128 тыс. токенов |
До 1 млн токенов при явной настройке |
Kimi K3 |
| Ввод |
Текст |
Текст, изображения и видео |
Kimi K3 |
| Управление рассуждением |
Несколько режимов; High и Max в GPT Proto |
Постоянное рассуждение с низким, высоким и максимальным уровнем усилий; по умолчанию — максимальный |
Зависит от конечной точки и задачи |
| Функции для разработчиков |
Вызов функций, JSON, кэширование, MCP |
Вызов функций, JSON, кэширование, динамическая загрузка инструментов, компьютерное зрение |
Kimi K3 для мультимодальных агентов; в остальном модели близки |
| Открытые веса |
Доступны сейчас по лицензии MIT |
Доступны по собственной лицензии Kimi K3 |
GLM — для разрешительной лицензии и меньшего размера; Kimi — для более высокого предела возможностей |
| Официальная цена API за 1 млн токенов |
$1,40 за ввод, $0,26 за кэшированный ввод, $4,40 за вывод |
$3 за ввод, $0,30 за кэшированный ввод, $15 за вывод |
GLM-5.2 |
| Лучше всего подходит для |
Рутинной проверки кода, рефакторинга репозиториев, автоматизации в больших объёмах, самостоятельного хостинга |
Сложных агентных задач, визуальной отладки, фронтенда, 3D- и игровой разработки |
Зависит от задачи |
| Требования для самостоятельного хостинга |
753 млрд всего / около 40 млрд активных |
2,8 трлн всего / 104 млрд активных; около 1,56 ТБ; рекомендуется 64 и более ускорителей |
GLM-5.2 для большинства частных развёртываний |
Спецификации взяты из документации и карточки модели GLM-5.2, а также из опубликованных карточки модели Kimi K3, лицензии и технического отчёта. Теперь обе модели публикуют веса. Практическая разница больше не заключается в выборе между открытой и закрытой моделью; речь идёт о лицензии MIT против собственной лицензии, а также о модели на 753 млрд параметров против модели на 2,8 трлн параметров с гораздо более крупными требованиями к развёртыванию.
Бенчмарки программирования говорят в пользу Kimi K3, но учитывайте примечания
Опубликованное Moonshot сравнение даёт Kimi K3 уверенное преимущество в наиболее важных для агентов тестах программирования:
| Бенчмарк |
Kimi K3 |
GLM-5.2 |
Разница |
| DeepSWE |
67.5 |
46.2 |
+21.3 K3 |
| Terminal-Bench 2.1 |
88.3 |
82.7 |
+5.6 K3 |
| Program Bench |
77.8 |
63.7 |
+14.1 K3 |
| FrontierSWE |
81.2 |
67.3 |
+13.9 K3 |
| SWE-Marathon |
42.0 |
13.0 |
+29.0 K3 |
| Kimi Code Bench 2.0 |
72.9 |
64.2 |
+8.7 K3 |
Эти числа опубликованы поставщиком, а не получены независимой лабораторией в контролируемом очном сравнении. В собственных примечаниях к бенчмарку Moonshot указывает, что модели иногда работали в разных агентных фреймворках, включая Kimi Code, Claude Code и Codex. Результаты FrontierSWE также были пересчитаны на основе исходных данных. Это не делает результаты бесполезными, но означает, что разрыв в 10 пунктов нельзя приписывать одной лишь базовой модели.
Независимые данные указывают в том же направлении, но позволяют сделать более сдержанный и правдоподобный вывод. Artificial Analysis оценивает Kimi K3 в 57 баллов по своему индексу интеллекта против 51 у GLM-5.2 Max. Также сервис оценивает совокупную цену в $2,31 за миллион токенов для K3 и $0,90 для GLM, используя соотношение 7:2:1 для кэшированного ввода, нового ввода и вывода.
Мой вывод: Kimi K3 — победитель по возможностям. Доказательства недостаточно чисты, чтобы утверждать, что она всегда лучше, но они достаточно последовательны, чтобы я первым попробовал K3 на необычно сложной задаче программирования. Контраргумент в пользу GLM-5.2 экономический, а не академический.
Настоящий тест с 3D-игрой делает разницу заметной
Оценки в тестах программирования абстрактны. 3D-сцена — нет. Она показывает, может ли модель согласовать компоновку, поведение камеры, освещение, взаимодействие, состояние и визуальную итерацию, а не просто создать синтаксически корректные файлы.
Публичное сравнение на X дало Kimi K3, GLM-5.2 и Claude Opus 4.8 одинаковое задание по созданию 3D-мира и показало результаты для слепой оценки. Это качественная демонстрация, а не бенчмарк: один запрос, один запуск и агентная конфигурация, которая может повлиять на результат. Её ценность в том, что читатель может изучить реальные миры, а не полагаться на оценку.

У K3 есть структурное преимущество для такой работы. Она нативно принимает изображения и видео, поэтому агент может отрендерить сцену, передать модели скриншот и попросить исправить обрезание, интервалы, контраст или кадрирование камеры. Moonshot называет это процессом с замкнутым визуальным контуром в техническом блоге K3. GLM-5.2 работает только с текстом. Внешний браузерный инструмент может описывать скриншоты или предоставлять журналы, но это добавляет ещё один компонент и ещё одно место, где может потеряться информация.
Однако GLM не следует считать неподходящей для разработки игр. В одном случае из сообщества на Reddit разработчик начал с пустой папки и попросил GLM-5.2, работающую через режим планирования Claude Code, создать игру в стиле Animal Crossing на HTML, JavaScript и Three.js. Результат содержал около 2800 строк и объединял перемещение, диалоги NPC, рыбалку, экономику, магазин, музей, жильё, мебель и LocalStorage. По имеющимся данным, запуск использовал около 11,7 млн входных токенов и 138 000 выходных токенов, 29 минут 43 секунды времени API и 1 час 21 минуту реального времени.
Автор также сообщил об ошибках и проблемах с балансировкой. И это хорошо. Такая неотшлифованность делает пример полезнее рекламного ролика поставщика. Он показывает, что GLM-5.2 может собрать цельный прототип; он не показывает, что код готов к промышленной эксплуатации или превосходит K3.

Для игрового кода, интерактивного 3D или фронтенд-разработки на основе скриншотов я бы выбрал Kimi K3. Для игрового цикла, заданного текстом, когда стоимость важнее визуальной итерации, GLM-5.2 остаётся достойным вариантом.
Какая модель лучше для проверки кода и исправления ошибок?
Прямых публичных A/B-тестов GLM-5.2 и Kimi K3 для проверки кода пока мало. Об этом стоит сказать прямо. Таблицы бенчмарков проверяют решение проблем и выполнение задач агентом, но не сообщают, обнаружит ли какая-либо модель ошибку авторизации в вашем pull request, не заполнив ревью множеством замечаний о стиле.
Для исправления сложных ошибок у K3 более убедительные доказательства. Её преимущество в DeepSWE, Program Bench и SWE-Marathon указывает на более высокую эффективность, когда модели нужно изучить кодовую базу, составить план, изменить файлы, запустить инструменты и восстановиться после неудачных попыток. Нативное зрение также важно, когда сбой виден в браузере, на экране мобильного устройства, на графике или в CAD-окне.
Для повседневного ревью я бы начал с GLM-5.2. Z.ai прямо рекомендует её для аудита проектов, долгосрочного рефакторинга, миграции API и работы, ограниченной правилами линтера, сборки, тестов и зависимостей. В её официальном руководстве разработчикам рекомендуется указывать ограничения, например “не добавлять зависимости” и “не изменять контракты API”, а затем требовать проверки сборки, линтинга и тестов. Это близко к реальному процессу ревью.
Стоимость усиливает этот аргумент. Большинство pull request не являются задачами уровня SWE-Marathon. Переплата за вывод K3 ради переименования метода, добавления тестов или проверки обычного CRUD-изменения с трудом оправдана. Направляйте обычные ревью в GLM, а к K3 обращайтесь только при неоднозначных сбоях, визуальных дефектах или упорных проблемах в нескольких файлах.
Цены API: стоит ли Kimi K3 больше, чем GLM-5.2?
По официальным тарифам GLM-5.2 стоит $1,40 за миллион новых входных токенов, $0,26 за кэшированный ввод и $4,40 за вывод. Kimi K3 стоит соответственно $3, $0,30 и $15. Новый ввод Kimi примерно в 2,1 раза дороже, а вывод — примерно в 3,4 раза.
Рассмотрим совокупную задачу программирования, которая в рамках агентного цикла использует 1 млн новых входных токенов и 100 000 выходных токенов:
| Рабочая нагрузка |
GLM-5.2 |
Kimi K3 |
| 1 млн новых входных + 100 тыс. выходных |
$1,84 |
$4,50 |
| 1 млн кэшированных входных + 100 тыс. выходных |
$0,70 |
$1,80 |
Эти оценки не учитывают повторные попытки, оплату внешних инструментов и налоги. Они также предполагают, что провайдер распознаёт повторяющийся префикс как пригодный для кэширования. Moonshot сообщает о показателях попадания в кэш выше 90% в рабочих нагрузках программирования, но ваш результат зависит от стабильности запросов и сохранённой истории разговора.
Стоит ли K3 этой разницы? Для одной сложной задачи, где неудачная попытка обходится инженеру в два часа, — да. Для непрерывной проверки кода или массового обслуживания репозитория — обычно нет. Преимущество в 6 пунктов по независимому индексу интеллекта автоматически не оправдывает цену токенов, более чем в 2,6 раза превышающую стоимость.
Функции API, которые разработчики действительно заметят
Обе модели предлагают контекстное окно на 1 млн токенов, вызов функций, потоковую передачу, структурированный вывод и кэширование контекста. Обе могут работать через клиент, совместимый с OpenAI. Различия проявляются в эксплуатации.
Kimi K3 принимает текст, изображения и видео через собственный хостинг, поддерживает динамическую загрузку инструментов и может возвращать очень длинные ответы. Она всегда выполняет рассуждение, но в текущей карточке модели теперь документированы уровни усилий `low`, `high` и `max`, причём по умолчанию используется `max`. Агенты по-прежнему должны сохранять полное сообщение ассистента, включая историю рассуждений, между ходами; переключение другой модели на K3 в середине сеанса может сделать вывод нестабильным.
K3 также может быть слишком инициативной. Moonshot рекомендует более строгие системные инструкции или файл AGENTS.md, если модель не должна принимать решения за пределами заданных границ. Это предупреждение важно для промышленной эксплуатации. Модель, которая без разрешения исправляет смежные проблемы, может выглядеть усердной в демонстрации, но стать источником риска в регулируемом репозитории.
GLM-5.2 проще планировать с точки зрения бюджета. Разработчики могут выбирать режимы рассуждения, вместо того чтобы платить за максимальное обдумывание каждого запроса. Модель поддерживает MCP и уже распространяется по лицензии MIT, поэтому команды могут изучать, дообучать или самостоятельно размещать веса уже сегодня. Компромисс — мультимодальность: базовая модель принимает только текст. Если ваш цикл программирования зависит от скриншотов, понадобится другой компонент компьютерного зрения или K3.
Развёртывание открытых весов: MIT против лицензии Kimi K3
Теперь обе модели можно скачать, но условия их развёртывания различаются.
GLM-5.2 использует лицензию MIT. Kimi K3 использует собственную лицензию, которая разрешает широкое использование, изменение, дообучение, развёртывание и распространение, но добавляет условия для крупных Model-as-a-Service компаний и очень больших коммерческих продуктов. Стартап, создающий внутреннего помощника для программирования, и высокодоходная платформа инференса не сталкиваются с одинаковым анализом лицензии K3.
Разрыв в требованиях к оборудованию не менее важен. GLM-5.2 имеет 753 млрд параметров всего, из них около 40 млрд активны на токен. У Kimi K3 всего 2,8 трлн параметров, 104 млрд активных параметров и официальный репозиторий размером около 1,56 ТБ. Moonshot рекомендует 64 или более ускорителей. K3 предлагает более высокий предел возможностей; GLM — более практичный проект самостоятельного хостинга для большинства команд.
Это меняет итог, но не политику маршрутизации. Используйте GLM для рутинных, чувствительных к стоимости или приватных задач программирования. Переключайтесь на K3, когда визуальное рассуждение или сложность задачи оправдывают более высокий счёт за API или требования к инфраструктуре.
Сравнение API для программирования GLM-5.2 и Kimi K3 на GPT Proto
GPT Proto предоставляет обе модели через одну конечную точку, совместимую с OpenAI. Вы можете открыть страницу модели GLM-5.2, страницу модели Kimi K3 или просмотреть полный каталог моделей. Практическая выгода заключается не в новом агенте для программирования, а в возможности отправить один и тот же запрос двум моделям с одним ключом и сравнить результаты до того, как вы закрепите правила маршрутизации.
Установите актуальный OpenAI Python SDK, экспортируйте ключ и запустите этот скрипт:
python3 -m pip install --upgrade "openai>=1.0"
export GPTPROTO_API_KEY="your-key-here"
import os
from pathlib import Path
from openai import OpenAI
client = OpenAI(
api_key=os.environ["GPTPROTO_API_KEY"],
base_url="https://api.gptproto.com/v1",
)
task = """Review this Python function for correctness and security.
Return: (1) confirmed bugs, (2) a corrected implementation, and
(3) three pytest tests. Do not report style-only issues.
from pathlib import Path
def read_user_file(root: str, filename: str) -> str:
path = Path(root) / filename
return path.read_text(encoding="utf-8")
"""
models = ["glm-5.2", "kimi-k3.0"]
for model in models:
response = client.chat.completions.create(
model=model,
messages=[
{
"role": "system",
"content": (
"You are a senior application-security reviewer. "
"State uncertainty and avoid speculative findings."
),
},
{"role": "user", "content": task},
],
)
output = response.choices[0].message.content or ""
Path(f"review-{model}.md").write_text(output, encoding="utf-8")
print(f"Saved review-{model}.md")
Пример можно запустить после установки GPTPROTO_API_KEY. Он просит обе модели найти риск обхода пути и создать тесты, а затем сохраняет отдельные обзоры в формате Markdown. Если идентификатор модели изменится во время поэтапного выпуска, скопируйте текущий идентификатор со страницы модели GPT Proto.
Для промышленного использования не выбирайте победителя по одному запросу. Составьте набор из 20–50 задач из собственных репозиториев, удалите секреты и оценивайте подтверждённые находки, ложные срабатывания, долю пройденных тестов, общее количество токенов и реальное время выполнения. Главная страница GPT Proto — отправная точка для создания общего API-ключа.
Что выбрать?
Выбирайте Kimi K3, если задача объединяет программирование со скриншотами или видео, если вы создаёте фронтенд или 3D-приложение либо если одна сложная многоэтапная ошибка обходится дороже дополнительных токенов. Выбирайте её веса только в том случае, если ваша команда может поддерживать необходимую инфраструктуру и изучила лицензию Kimi K3.
Выбирайте GLM-5.2 для обычной проверки кода, аудита репозиториев, рефакторинга, миграций и автоматизации программирования в больших объёмах. Она остаётся более сильным вариантом по умолчанию для самостоятельного хостинга, когда лицензия MIT, меньший размер и предсказуемая стоимость важнее более высокого предела возможностей K3.
Для смешанной рабочей нагрузки используйте маршрутизацию, а не приверженность одной модели: сначала GLM-5.2, а Kimi K3 — при эскалации. Выпуск весов K3 даёт больше контроля над развёртыванием, но не отменяет экономических и эксплуатационных преимуществ GLM.