Kimi K3 и Claude Opus 5: краткое сравнение
| Категория |
Kimi K3 |
Claude Opus 5 |
| Разработчик |
Moonshot AI |
Anthropic |
| Дата выпуска |
16 июля 2026 г. |
24 июля 2026 г. |
| Официальная цена API |
$3 за ввод / $15 за вывод на 1 млн токенов |
$5 за ввод / $25 за вывод на 1 млн токенов |
| Цена GPT Proto |
$2.70 за ввод / $13.50 за вывод |
$4 за ввод / $20 за вывод |
| Контекстное окно |
1,048,576 токенов |
1,000,000 токенов |
| Максимальный вывод |
131,072 по умолчанию; настраивается до оставшегося лимита контекста |
128,000 токенов |
| Входные данные |
Текст, изображения и видео |
Текст и изображения |
| Управление рассуждением |
Всегда включено; low, high или max |
Адаптивное; low, medium, high, xhigh или max |
| Доступность модели |
Открытые веса по специальной лицензии Kimi K3 |
Проприетарный API |
| Intelligence Index |
57 |
59 при высоком уровне усилий |
| Измеренная скорость вывода |
32,0 токена/с |
56,2 токена/с при высоком уровне усилий |
| Измеренное время до первого токена |
98,27 секунды |
18,28 секунды при высоком уровне усилий |
| Лучше всего подходит для |
Программирования с учетом стоимости, мультимодальных агентов, частного развертывания |
Сложной отладки, производственных агентов программирования, задач, требующих тщательного анализа |
Небольшая разница в размере контекста не должна определять выбор. Обе модели обрабатывают примерно миллион токенов. Гораздо важнее различия в выполнении задач, скорости ответа, форматах входных данных, контроле развертывания и стоимости получения принятого результата.
Разработчики могут получить доступ к обеим моделям через API Kimi K3 и API Claude Opus 5 на GPT Proto.
Что такое Kimi K3?
Kimi K3 — флагманская модель рассуждения Moonshot AI для длительных задач программирования и работы со знаниями. Это модель Mixture-of-Experts с 2,8 триллиона параметров в общей сложности, из которых во время вывода активируются только 104 миллиарда. Ее архитектура выбирает 16 из 896 экспертов для каждого токена — именно так Moonshot увеличивает общую емкость, не активируя все параметры одновременно.
Масштаб впечатляет, но на практике важнее контекстное окно на 1 048 576 токенов и встроенный визуальный ввод. Через размещенный API Kimi K3 может обрабатывать текст, изображения и видео. Moonshot позиционирует ее для работы с крупными кодовыми базами, инженерных задач в терминале, разработки интерфейсов с обратной связью по скриншотам и других процессов, сочетающих визуальное мышление с разработкой ПО. В официальной документации Kimi K3 также заявлены вызовы инструментов, структурированный вывод JSON, кэширование контекста и настраиваемый уровень рассуждения.
K3 рассуждает всегда. Разработчики могут снизить уровень рассуждения до low, но не могут полностью отключить мышление. Многошаговые приложения также должны возвращать полное сообщение ассистента — включая поля рассуждения и вызовов инструментов — вместо сохранения только видимого ответа. Эта деталь реализации важна. Если обращаться с K3 как с простой заменой строки модели, длинные циклы работы с инструментами могут перестать работать или стать менее стабильными.
Moonshot выпустила веса модели 27 июля по специальной лицензии. Поэтому термин «модель с открытыми весами» точнее, чем называть Kimi K3 полностью открытым исходным кодом. Лицензия разрешает использование, изменение, распространение, дообучение и коммерческое развертывание, но содержит дополнительные условия для крупных сервисов, предоставляющих модель как услугу, а также продуктов, превышающих определенные пороги выручки или числа пользователей. Разработчикам, планирующим коммерческое самостоятельное размещение, следует изучить лицензию Kimi K3, а не считать ее стандартной лицензией Apache или MIT.
Есть и еще одна статья расходов: инфраструктура. Модель с 2,8 триллиона параметров — даже использующая разреженную активацию и веса низкой точности — не предназначена для беззаботного развертывания на одном GPU. Открытые веса дают контроль, но не обеспечивают простого хостинга.
Что такое Claude Opus 5?
Claude Opus 5 — модель Anthropic, выпущенная в июле 2026 года для сложного агентного программирования и корпоративной работы. Она заменяет Opus 4.8 в качестве практического варианта уровня Opus по умолчанию, сохраняя прежнюю официальную цену $5 за ввод и $25 за вывод, но улучшая программирование, проверку, визуальный вывод и выполнение длительных задач.
Anthropic подчеркивает склонность Opus 5 проверять собственную работу перед тем, как объявить задачу завершенной. Среди примеров запуска — создание тестовой инфраструктуры при отсутствии доступного источника актуальных данных, проверка веток и требований к PR перед передачей работы и поиск первопричин в сложных задачах отладки. Это примеры, предоставленные поставщиком, а не нейтральное доказательство, но они описывают поведение, благодаря которому Opus 5 привлекателен для производственного программирования: меньше преждевременных завершений и больше внимания к тому, действительно ли результат работает. См. анонс Anthropic Opus 5.
Модель поддерживает контекстное окно на миллион токенов, до 128 000 выходных токенов, ввод текста и изображений, использование инструментов, кэширование промптов, обработку PDF и адаптивное мышление. Диапазон уровней усилий простирается от low до max, а high используется в API по умолчанию. В отличие от K3, мышление можно отключить при уровне усилий high или ниже, хотя Anthropic отклоняет такую конфигурацию на уровнях xhigh и max. В документации моделей Claude указано, что claude-opus-5 — фиксированный идентификатор модели API.
Компромисс очевиден. Opus 5 является проприетарной моделью и стоит дороже Kimi K3. Вы получаете скорость и более сильные текущие результаты в сложной агентной работе, но отказываетесь от загружаемых весов и встроенного ввода видео.
Kimi K3 против Claude Opus 5: сравнение лицом к лицу
Общий интеллект и рассуждение
Artificial Analysis сейчас оценивает Claude Opus 5 High в 59 баллов Intelligence Index, а Kimi K3 — в 57. Индекс объединяет девять оценок, охватывающих научное программирование, сложные вопросы на знание, работу в терминале, банковских агентов, рассуждение в длинном контексте и устойчивость к галлюцинациям.
Преимущество в два балла важно, но не означает универсального преимущества в качестве на 3,5%. Сводная оценка объединяет задачи, которые могут мало походить на ваше приложение. Модель может уступать в общем рейтинге и при этом превосходить другую в генерации интерфейсов, понимании видео, конкретном языке программирования или тщательно организованном конвейере извлечения данных.
Более осторожный вывод таков: сейчас Claude Opus 5 демонстрирует более сильный общий независимый результат, но Kimi K3 достаточно близка, чтобы цена и соответствие рабочему процессу могли изменить решение.
Перед публикацией постоянных утверждений о результатах посмотрите актуальное сравнение Artificial Analysis, поскольку обе модели новые, а результаты таблиц лидеров могут меняться.
Победитель: Claude Opus 5, с небольшим преимуществом.
Агенты программирования и работа с репозиториями
Производительность агента программирования — это не то же самое, что ответ на вопрос о программировании в чате. Модель должна изучить файлы, составить план, изменить несколько компонентов, выполнить команды, интерпретировать ошибки, исправить изменения и остановиться только после того, как репозиторий пройдет проверки приемки.
Claude Opus 5 — более безопасный выбор для такой работы. Его текущие преимущества особенно заметны в отладке, анализе первопричин, проверке и задачах, где правильное следующее действие неочевидно. Более дорогой запрос все равно может оказаться экономичным, если он предотвращает неудачную реализацию, ненужную переработку или 30 минут ручной проверки.
Kimi K3 отстает незначительно. Moonshot создавала ее для долгосрочного программирования, крупных репозиториев, терминальных инструментов и визуальной обратной связи. Она особенно интересна командам, запускающим длительные сессии агентов, когда стоимость вывода уровня Opus становится трудно оправдать.
Есть важное усложнение: модель — лишь одна часть системы программирования. Claude Code, Kimi Code CLI, Cursor и пользовательские агенты используют разные инструменты, промпты, правила управления контекстом и поведение при повторных попытках. В собственных заметках об оценке K3 Moonshot указывает, что некоторые модели тестировались с Kimi Code, некоторые — с Claude Code, а другие — с Codex. Результат одной конфигурации автоматически не переносится на другую.
Для миграции репозитория или сложной задачи отладки я бы начал с Claude Opus 5. Для реализации с низким риском, повторяющихся задач сопровождения или больших партий задач программирования стоит напрямую проверить Kimi K3 по стоимости завершения.
Победитель: Claude Opus 5 для сложной работы с репозиториями; Kimi K3 для программирования в больших объемах с учетом стоимости.
Frontend-разработка и создание визуальных приложений
Сравнение фронтенд-возможностей быстро изменилось.
Kimi K3 вышла на восемь дней раньше Claude Opus 5 и сразу привлекла внимание генерацией сайтов, игр, дизайном интерфейсов и программированием по скриншотам. В первых публикациях сообщества повторялась мысль, что Kimi по-прежнему опережает Opus в работе с интерфейсами.
Последняя публичная таблица лидеров рассказывает другую — но пока предварительную — историю. По состоянию на 27 июля WebDev Arena ставит claude-opus-5-max на первое место с результатом 1725, а kimi-k3-max — на второе с 1682. Оба результата отмечены как предварительные. Таблица основана на предпочтениях пользователей при генерации фронтенда и full-stack-приложений, а не на контролируемом тесте вашей дизайн-системы или производственного репозитория. См. актуальную таблицу лидеров WebDev Arena.
Обсуждение более раннего рейтинга на Reddit также показывает проблему быстрых выводов сообщества: участники задавались вопросом, сравнивались ли модели при одинаковых уровнях усилий. Эта критика обоснованна. high против max, разные агентные среды и разные даты могут изменить кажущегося победителя.
Сегодня Claude Opus 5 занимает более сильную позицию в публичном сравнении фронтенд-возможностей. Kimi K3 остается близко и стоит дешевле, поэтому может быть более экономичной моделью для генерации нескольких вариантов дизайна перед отправкой лучшего кандидата на более строгую проверку.
Победитель: Claude Opus 5 в последней предварительной таблице лидеров; Kimi K3 для итераций с меньшими затратами.
Контекст, зрение и понимание видео
Kimi K3 поддерживает 1 048 576 токенов, а Claude Opus 5 — миллион. Разница в 48 576 токенов редко бывает решающей. Качество контекста, стратегия извлечения данных и объем нерелевантного материала обычно важнее последних нескольких процентов емкости.
У Kimi явное преимущество в мультимодальности. Ее размещенный API принимает видео, а также изображения и текст. Это делает ее лучшим кандидатом для таких процессов, как:
-
Проверка записи экрана и определение кода, ответственного за дефект интерфейса
-
Анализ игрового видео перед изменением игровой логики
-
Сравнение сгенерированной анимации с ее фронтенд-реализацией
-
Извлечение требований из длинных видеодемонстраций
Claude Opus 5 принимает текст и изображения, но не поддерживает нативный ввод видео. Рабочий процесс Claude все же может обрабатывать видео, предварительно извлекая кадры и расшифровки, однако это добавляет этап предварительной обработки и может привести к потере информации о временной последовательности.
Kimi также позволяет увеличить max_completion_tokens сверх значения по умолчанию 131 072 токена, если совокупный промпт и вывод остаются в пределах общего контекстного окна. Это гибко, но огромные ответы дороги и сложны для проверки. Теоретический предел не должен превращаться в обычный размер запроса.
Победитель: Kimi K3.
Скорость и задержка
Это одно из самых значительных измеренных различий.
Artificial Analysis сообщает о скорости вывода 56,2 токена в секунду для Claude Opus 5 High и 32,0 для Kimi K3. Измеренное время до первого токена составляет 18,28 секунды для Opus 5 и 98,27 секунды для K3.
Эти числа отражают наблюдения в конкретной конфигурации оценки, а не гарантированные уровни обслуживания API. Нагрузка поставщика, размер промпта, уровень рассуждения, кэширование и маршрутизация могут их изменить. Тем не менее разрыв слишком велик, чтобы его игнорировать.
Ожидание первого токена более минуты может быть приемлемым для ночной задачи работы с репозиторием. Но его гораздо сложнее принять в интерактивной IDE, пользовательском агенте или многошаговом процессе, где каждый ответ модели блокирует следующее действие инструмента. Задержка накапливается в длинном цикле агента.
Более низкая цена токенов Kimi компенсирует это не во всех сценариях. Если разработчики весь день ждут модель, время становится частью счета.
Победитель: Claude Opus 5.
Открытые веса, конфиденциальность и контроль развертывания
Kimi K3 — единственный вариант в этом сравнении, если требуются загружаемые веса, частная инфраструктура, дообучение или модификация самой модели.
Это не означает автоматически, что она является более простым решением для конфиденциальности. Командам по-прежнему необходимо защищать серверы вывода, журналы, входные данные модели, хранилища и средства контроля доступа. Также потребуется достаточно инфраструктуры для обслуживания модели с 2,8 триллиона параметров. Управляемые API передают значительную часть операционной нагрузки поставщику.
Claude Opus 5 закрыта и доступна только через API. Это уменьшает контроль над развертыванием, но также избавляет от необходимости управлять стеком обслуживания модели. Для большинства небольших команд управляемый вариант будет быстрее в эксплуатации. Для регулируемых предприятий со строгими требованиями к локальному развертыванию он может быть неприемлем.
Победитель: Kimi K3 по уровню контроля; Claude Opus 5 по меньшей операционной нагрузке.
Цены Kimi K3 и Claude Opus 5
По официальным тарифам Kimi K3 стоит $3 за миллион входных токенов и $15 за миллион выходных токенов. Claude Opus 5 стоит $5 и $25 соответственно. Kimi на 40% дешевле по обоим направлениям.
GPT Proto сейчас предлагает обе модели по цене ниже базовых тарифов:
| Модель |
Ввод GPT Proto |
Вывод GPT Proto |
Скидка от официального базового тарифа |
| Kimi K3 |
$2.70 / 1 млн токенов |
$13.50 / 1 млн токенов |
10% |
| Claude Opus 5 |
$4 / 1 млн токенов |
$20 / 1 млн токенов |
20% |
Предположим, что длительная задача программирования использует один миллион входных токенов в истории инструментов и генерирует 100 000 выходных токенов. По указанным тарифам GPT Proto:
Kimi экономит $1.95, или 32,5%, при таком соотношении токенов.
Но цена за токен — лишь первый расчет. Более полезный производственный показатель:
Стоимость принятой задачи = общие расходы на модель, включая повторные попытки, разделенные на количество результатов, прошедших проверку.
Если более дешевая модель требует больше повторных попыток, длительной ручной проверки или повторных вызовов инструментов, часть ее преимущества по токенам исчезает. Не предполагайте, что это произойдет; измерьте. Возможен и обратный результат: Kimi может выполнять вашу нагрузку с такой же надежностью и сохранять всю экономию.
Победитель: Kimi K3 по цене токенов. Победитель по стоимости завершенной задачи определяется только вашей собственной оценкой.
Что на самом деле видят разработчики и сообщество
Обсуждение Kimi K3 и Claude Opus 5 в сообществе полезно, но только если учитывать даты и настройки тестов.
Особенно заметны три закономерности.
Во-первых, Kimi действительно привлекла внимание работой с интерфейсами и ценой. Ее обсуждали не только как более дешевую текстовую модель. Разработчиков интересовали визуальное программирование, длинный контекст, агентная работа и загружаемые веса.
Во-вторых, после запуска Opus 5 сравнение изменилось. Текущие независимые оценки интеллекта, скорости и предварительные результаты по фронтенду говорят в пользу Opus. Публикации, написанные до 24 июля — или основанные на первых часах после релиза, — могут больше не отражать актуальные рейтинги.
В-третьих, многие сравнения смешивают базовую модель с окружающим ее продуктом. Успешный результат Claude Code не доказывает, что исходная модель вела бы себя так же в другом агенте. То же относится к Kimi Code CLI. Разрешения инструментов, сжатие контекста, системные инструкции, уровень усилий, политика повторных попыток и доступ к браузеру влияют на итоговое приложение.
Отчеты сообщества лучше всего использовать для определения тестов, которые стоит провести. Они не должны заменять эти тесты.
Честный тест программирования для Kimi K3 и Claude Opus 5
Ниже приведена рекомендуемая оценка, а не заявленный результат тестирования GPT Proto:
Build a responsive analytics dashboard from the supplied reference screenshot.
Requirements:
1. Reproduce the desktop layout, spacing, colors, typography, charts, and card hierarchy.
2. Add a mobile navigation menu that works below 768px.
3. Add a date-range filter that updates the displayed metrics.
4. Use reusable components and preserve the existing project structure.
5. Run the existing tests and add tests for the filter interaction.
6. Open the result in a browser and inspect both desktop and mobile layouts.
7. Fix visible layout errors, console errors, and failing tests before finishing.
8. Return a short summary of the files changed, tests run, and any remaining limitations.
Чтобы сравнение было полезным, предоставьте обеим моделям:
-
Один и тот же коммит репозитория и эталонный скриншот
-
Одинаковые системные инструкции и разрешения инструментов
-
Эквивалентный уровень рассуждения
-
Одинаковые ограничения по времени и токенам
-
Одинаковое определение слова «завершено»
-
Не менее трех попыток, если позволяет бюджет
Фиксируйте успех с первой попытки, результаты тестов, визуальную точность, поведение на мобильных устройствах, корректные вызовы инструментов, время выполнения, общее число токенов, повторные попытки, исправления человека и итоговую стоимость.
Не оценивайте модели по тому, какая из них создает более красивый первый скриншот. Агент программирования, который генерирует привлекательную страницу, но оставляет сломанную навигацию, ошибки в консоли или неудачные тесты, не завершил задачу.
Какую модель выбрать?
| Сценарий использования |
Лучший выбор |
Почему |
| Сложная отладка и анализ первопричин |
Claude Opus 5 |
Более сильные текущие результаты в работе агентов и проверке |
| Реализация на уровне репозитория, где ошибка дорого обходится |
Claude Opus 5 |
Лучший вариант по умолчанию для задач, требующих тщательного анализа |
| Интерактивное программирование с низкой задержкой |
Claude Opus 5 |
Более высокая измеренная скорость и меньшее время до первого токена |
| Очереди программирования с ограниченным бюджетом |
Kimi K3 |
Более низкие тарифы на ввод и вывод |
| Фронтенд-прототипы и несколько визуальных направлений |
Kimi K3 |
Итерации с меньшими затратами при конкурентной производительности во фронтенде |
| Разработка критически важного фронтенда |
Claude Opus 5 |
Текущий лидер WebDev Arena, хотя результаты остаются предварительными |
| Программирование или анализ интерфейсов с помощью видео |
Kimi K3 |
Нативный ввод видео |
| Частное развертывание или настройка модели |
Kimi K3 |
Загружаемые веса |
| Корпоративная работа со знаниями |
Claude Opus 5 |
Более сильные текущие общие и агентные результаты |
| Простая классификация или короткие преобразования |
Ни одна по умолчанию |
Меньшая модель обычно будет экономичнее |
Последняя строка важна. Обе модели избыточны для многих стандартных API-задач. Нет смысла платить за контекст на миллион токенов и глубокое рассуждение, если задача сводится к короткой метке, перефразированию или структурированному извлечению, с которыми надежно справляется меньшая модель.
Как сравнить Kimi K3 и Claude Opus 5 на GPT Proto
GPT Proto предоставляет обе модели с одним API-ключом и общим балансом. Используйте kimi-k3 и claude-opus-5 в качестве строк моделей, указанных на их актуальных страницах.
Приведенный ниже скрипт — это проверка на уровне API, основанная на текущем формате быстрого старта GPT Proto. Он поможет зафиксировать время ответа и использование токенов, но не заменяет приведенную выше оценку репозитория.
import os
import time
import requests
API_URL = "https://gptproto.com/v1/chat/completions"
API_KEY = os.environ["GPTPROTO_API_KEY"]
PROMPT = """
Create a TypeScript function that parses a comma-separated list of integer
ranges such as "1-3,7,10-12". Return the unique integers in ascending order.
Requirements:
- Reject reversed ranges such as "5-2".
- Reject invalid or empty segments.
- Support negative integers.
- Include unit tests.
- Explain the edge cases you handled.
"""
models = [
{
"model": "kimi-k3",
"reasoning_effort": "high",
},
{
"model": "claude-opus-5",
"effort": "high",
},
]
headers = {
"Content-Type": "application/json",
"Authorization": API_KEY,
}
for config in models:
payload = {
"model": config["model"],
"messages": [{"role": "user", "content": PROMPT}],
"max_tokens": 8000,
}
if "reasoning_effort" in config:
payload["reasoning_effort"] = config["reasoning_effort"]
if "effort" in config:
payload["effort"] = config["effort"]
started = time.perf_counter()
response = requests.post(
API_URL,
headers=headers,
json=payload,
timeout=600,
)
response.raise_for_status()
elapsed = time.perf_counter() - started
result = response.json()
print(f"\nModel: {config['model']}")
print(f"Elapsed time: {elapsed:.2f} seconds")
print(f"Usage: {result.get('usage', {})}")
print(result["choices"][0]["message"]["content"])
Перед использованием в продакшене изучите актуальную документацию, особенно сведения о специфичных для модели полях мышления, вызовах инструментов, загрузке изображений или видео и истории многошаговых сообщений. Kimi K3 требует сохранять полное сообщение ассистента при продолжении рассуждения и циклах работы с инструментами; производственная интеграция не должна сохранять только видимое content.
Итоговый вердикт
В этом сравнении Claude Opus 5 побеждает как более сильная универсальная рекомендация. Она быстрее, сейчас получает более высокие результаты в независимых тестах интеллекта и лучше подходит для сложных задач программирования, где неправильный ответ приводит к дорогостоящей переработке.
Kimi K3 выигрывает в другой категории. Она дешевле, принимает видео, предлагает загружаемые веса и остается достаточно близкой по текущим оценкам, чтобы быть серьезным кандидатом для продакшена, а не просто бюджетной заменой.
Выбирайте Claude Opus 5, когда ошибка обходится дорого. Выбирайте Kimi K3, когда стоимость токенов, контроль развертывания или мультимодальная гибкость — это ограничение, которым нельзя пренебречь.