Что такое Kimi K3?
Kimi K3 — новая флагманская мультимодальная модель Moonshot AI для рассуждений. Она создана для задач, которые могут включать часы программирования, исследований, использования инструментов и доработок, а не только для ответа на один запрос в чате.
Модель была запущена 16 июля 2026 года на Kimi.com, Kimi Work, Kimi Code и в Kimi API. Она имеет 2,8 триллиона общих параметров, контекстное окно на один миллион токенов и встроенную поддержку текстовых, графических и видеофайлов на входе. Результат по-прежнему выдаётся в текстовом формате.
В основе K3 лежит архитектура Mixture-of-Experts с 896 экспертами, 16 из которых активируются одновременно. Moonshot также представила Kimi Delta Attention, Attention Residuals и Stable LatentMoE, чтобы улучшить передачу информации через длинные последовательности и глубокие слои модели. Moonshot утверждает, что эти изменения обеспечивают примерно в 2,5 раза более высокую эффективность масштабирования по сравнению с Kimi K2, хотя эта цифра предоставлена разработчиком, а не получена в независимом тесте. Технический блог Moonshot о Kimi K3 содержит актуальные сведения об архитектуре; более полный технический отчёт всё ещё ожидается.
| Спецификация |
Kimi K3 |
| Разработчик |
Moonshot AI |
| Публичный запуск |
16 июля 2026 года |
| Общие / активируемые параметры |
2.8T / 104B |
| Архитектура |
Mixture-of-Experts |
| Эксперты |
896 всего, 16 активных |
| Контекстное окно |
1 миллион токенов |
| Входные данные |
Текст, изображения и видео |
| Выходные данные |
Текст |
| Строка модели API |
kimi-k3 |
| Режим рассуждений |
Всегда включён |
| Доступность весов |
Полные веса опубликованы в `moonshotai/Kimi-K3 |
Это делает K3 одной из крупнейших из представленных на сегодняшний день моделей ИИ. Однако сам по себе размер не является главным преимуществом. Реальный вопрос заключается в том, превратила ли Moonshot эти параметры в более эффективное выполнение задач.
Релиз также устраняет одну неопределённость, оставшуюся после первоначального освещения запуска: технический отчёт теперь опубликован. Это не отменяет необходимости независимой оценки и не превращает модель на 2,8 триллиона параметров в простой проект для самостоятельного размещения.
Действительно ли Kimi K3 близка к GPT-5.6 и Claude Fable 5?
Если говорить об общем интеллекте — пока нет. В ряде агентских задач и задач с длинным горизонтом — да.
Собственное объявление Moonshot выглядит более сдержанно, чем многие заголовки, появившиеся после него. Компания говорит, что общая производительность K3 всё ещё уступает Claude Fable 5 и GPT-5.6 Sol. Тем не менее она сообщает о результатах уровня передовых моделей в программировании, интеллектуальной работе и рассуждениях.
Один из примеров — оптимизация ядер GPU. Moonshot поместила каждую модель в одинаковую песочницу и дала ей до 24 часов на оптимизацию четырёх задач для GPU. K3 показала конкурентный результат по сравнению с Fable 5 и обошла GPT-5.6 Sol, GPT-5.5 и Opus 4.8 в этом тесте. Это значительный результат для низкоуровневой оптимизации производительности. Но он не доказывает, что K3 в целом умнее.
Независимое тестирование даёт более полную картину. Artificial Analysis оценила Kimi K3 в 57 баллов по своему Intelligence Index, поместив её примерно на уровень GPT-5.5 и Claude Opus 4.8, но ниже Fable 5 и GPT-5.6 Sol. Лучшие результаты она показала в агентском выполнении и автоматизации, а не во всех категориях интеллекта. Artificial Analysis опубликовала результаты тестирования K3 16 июля.
| Оценка |
Результат Kimi K3 |
Что это показывает |
| AA Intelligence Index |
57 |
Близка к GPT-5.5 и Opus 4.8; уступает GPT-5.6 Sol и Fable 5 |
| GDPval-AA v2 |
1,668 Elo |
Сильное выполнение реальных агентских задач |
| AutomationBench-AA |
53%, первое место |
Особенно эффективна для автоматизации процессов SaaS |
| AA-Briefcase |
1,547 Elo, второе место |
Сильная работа с долгосрочными интеллектуальными задачами |
| Точность Omniscience |
46% |
Выше 33% у K2.6 |
| Уровень галлюцинаций |
51% |
Хуже, чем 39% у K2.6 |
Последняя строка особенно привлекла моё внимание. K3 стала более способной, но Artificial Analysis также зафиксировала больше галлюцинаций. Она правильно ответила на большее количество вопросов, одновременно увеличив долю неподтверждённых утверждений.
Такой компромисс важен в производственной среде. Модель, которая завершает длинный агентский процесс, но незаметно вводит неверное предположение, может потребовать больше затрат на проверку, чем более медленная модель с устойчивым фактическим поведением.
Почему одна таблица лидеров не может окончательно решить вопрос сравнения
K3 уже вышла на первое место как минимум в одном бенчмарке генерации интерфейсов. Она также хорошо показывает себя в оптимизации GPU, автоматизации SaaS и долгосрочной интеллектуальной работе. Но эти результаты не измеряют одну и ту же способность.
Арена фронтенда измеряет предпочтения пользователей в отношении сгенерированных интерфейсов. AutomationBench проверяет, способен ли агент выполнять рабочие процессы в программном обеспечении. Оптимизация ядер GPU тестирует низкоуровневую системную инженерию. Ни один из этих тестов сам по себе не отвечает на вопрос, лучше ли K3 справляется с исследованиями, фактическим воспроизведением информации, отладкой, дизайном презентаций или общими рассуждениями.
Обоснованный вывод более узок: Kimi K3 вошла в число передовых моделей для агентской работы, но GPT-5.6 Sol и Fable 5 по-прежнему лидируют в более широком сравнении. Разработчики, которым нужен текущий максимум среди закрытых моделей, могут изучить API GPT-5.6 Sol, а Claude Opus 4.8 остаётся более проверенным вариантом для сложных процессов программирования и исследований.
Вопрос об открытых весах решён, но вопрос развёртывания — нет
Вопросом в первую неделю после запуска было то, опубликует ли Moonshot веса на самом деле. Опубликовала. Официальный репозиторий moonshotai/Kimi-K3 теперь содержит полный чекпойнт, карточку модели, технический отчёт, код инференса и лицензию Kimi K3.
Точная формулировка по-прежнему важна. Kimi K3 имеет открытые веса, но это не безоговорочно «полностью открытый исходный код». Её собственная лицензия разрешает широкое использование, модификацию, дообучение, развёртывание и распространение, но устанавливает дополнительные условия для крупных компаний Model-as-a-Service и очень больших коммерческих продуктов. Данные обучения не опубликованы.
Доступность также не равна удобству использования. Репозиторий занимает около 1,56 ТБ, а Moonshot рекомендует развёртывание на суперузлах с 64 или более ускорителями. Поэтому K3 представляет интерес для команд, занимающихся облачной и корпоративной инфраструктурой, но не является обычной загрузкой для рабочей станции.
Тем не менее релиз важен. Теперь у организаций есть реальный путь для изучения чекпойнта, настройки инференса, дообучения производных моделей и эксплуатации модели без полной зависимости от одной размещённой конечной точки. Цена этого — аппаратное обеспечение, инженерия сервинга и проверка лицензии.
Что изменилось по сравнению с Kimi K2.7 в Kimi K3?
K3 — это не просто Kimi K2.7 с увеличенным номером версии.
Kimi K2.7 Code — агентская модель, ориентированная на программирование и основанная на K2.6. В её карточке модели основное внимание уделяется реальной разработке программного обеспечения, длительным сессиям программирования, использованию инструментов и снижению расхода токенов рассуждений. K3 расширяет эту роль до универсальной флагманской модели для программирования, визуальных рассуждений, исследований и комплексной интеллектуальной работы.
Контекстное окно увеличилось с 256K до одного миллиона токенов. Общее число параметров выросло с одного триллиона до 2,8 триллиона, а количество экспертов — с 384 до 896. Вместе с этим выросла и цена.
| Характеристика |
Kimi K3 |
Kimi K2.7 Code |
| Позиционирование |
Универсальная флагманская модель |
Модель, ориентированная на программирование |
| Общее число параметров |
2.8T |
1T |
| Эксперты |
896, 16 активных |
384, 8 активных |
| Контекстное окно |
1M |
256K |
| Стандартный ввод |
$3.00/MTok |
$0.95/MTok |
| Выходные данные |
$15.00/MTok |
$4.00/MTok |
| Кэшированный ввод |
$0.30/MTok |
$0.19/MTok |
| Веса |
Доступны по лицензии Kimi K3 |
Доступны |
Таким образом, ценность K3 заключается не в «интеллекте передовых моделей почти бесплатно». Это близкая к передовым моделям агентская производительность с двумя вариантами развёртывания: тарифицируемым API для немедленного использования и опубликованными весами для команд, готовых взять инфраструктуру на себя.
Официальная карточка модели K2.7 Code содержит сведения о её архитектуре, методологии бенчмарков и рекомендациях по развёртыванию.
Как Kimi K3 работает с контекстом на 1 млн токенов
Контекстное окно на один миллион токенов позволяет K3 принимать большие кодовые базы, коллекции технических документов, длинные истории работы агентов и промежуточные результаты использования инструментов в одном запросе.
Это особенно важно для длительно работающих агентов. Модели для программирования может потребоваться сохранять исходную спецификацию, структуру репозитория, вывод терминала, ошибки тестов, предыдущие изменения и отзывы проверяющего на протяжении десятков шагов. Потеря одного из этих ограничений в середине задачи — частая причина, по которой агент выглядит продуктивным, но не доводит работу до конца.
K3 также поддерживает автоматическое кэширование контекста. Разработчикам не нужно создавать идентификатор кэша или задавать отдельное значение времени жизни. Если длинный префикс не меняется между запросами, система автоматически пытается использовать кэш. Кэшированный ввод стоит $0.30 за миллион токенов вместо $3.00.
Но объём контекста — не то же самое, что идеальная работа с ним. Передача модели одного миллиона токенов не гарантирует, что она правильно определит важность каждой строки. Более длинные входные данные также могут увеличить стоимость, время обработки и отвлечь внимание от нерелевантной информации.
Разумный подход по-прежнему заключается в том, чтобы сначала извлекать наиболее релевантные файлы, размещать стабильный справочный контент в начале для кэширования и не отправлять всю базу знаний только потому, что это позволяет лимит. В руководстве Kimi по API объясняется работа контекста на один миллион токенов и автоматического кэширования.
Цены на API Kimi K3 больше нельзя назвать бюджетными
Официальный API Kimi K3 от Moonshot использует фиксированную модель оплаты по мере использования. Ставка не меняется при переходе запроса на более крупный уровень контекста.
| Тип токенов |
Цена за 1 млн токенов |
| Кэшированный ввод |
$0.30 |
| Стандартный ввод |
$3.00 |
| Выходные данные |
$15.00 |
Для короткой агентской задачи со 100 000 некэшированных входных токенов и 20 000 выходных токенов расчётная стоимость модели составит:
(0.1 × $3) + (0.02 × $15) = $0.60
Теперь рассмотрим повторяющийся процесс с длинным контекстом, включающий 800 000 кэшированных токенов, 50 000 новых входных токенов и 50 000 выходных токенов:
(0.8 × $0.30) + (0.05 × $3) + (0.05 × $15) = $1.14
Кэширование делает второй пример приемлемым по стоимости, но K3 явно больше не соответствует старой формуле «китайская модель означает чрезвычайно дешёвый API».
Artificial Analysis измерила среднюю стоимость задачи Intelligence Index для K3 на уровне $0.94, что близко к $1.04 у GPT-5.6 Sol и примерно вдвое ниже $1.80 у Opus 4.8. GLM-5.2 выполнила тот же объём оценки значительно дешевле.
Сравнение также меняется в зависимости от того, где вы получаете доступ к моделям. API Kimi K3 на GPT Proto сейчас стоит $2.70 за миллион входных токенов и $13.50 за миллион выходных токенов — на 10% ниже опубликованной цены Moonshot $3/$15. GPT Proto также предлагает GPT-5.6 Sol и GLM-5.2 через тот же API-ключ и общий баланс, что упрощает сравнение задач без отдельных аккаунтов у провайдеров.
Таким образом, ценность K3 заключается не в «интеллекте передовых моделей почти бесплатно». Это близкая к передовым моделям агентская производительность с двумя вариантами развёртывания: тарифицируемым API для немедленного использования и опубликованными весами для команд, готовых взять инфраструктуру на себя.
API Kimi K3 или открытые веса: что выбрать?
Теперь Kimi K3 действительно даёт разработчикам выбор способа развёртывания. Возможности модели привлекательны в обоих случаях, но операционная модель полностью различается.
| Размещённый API Kimi K3 |
Открытые веса Kimi K3 |
| Оплата за токены |
Покупка или аренда ускорителей |
| Провайдер управляет масштабированием, кэшированием, обновлениями и сбоями |
Ваша команда управляет сервингом, масштабированием, мониторингом, обновлениями и сбоями |
| Самый быстрый путь к оценке и запуску в производство |
Максимальный контроль над данными, инференсом и модификацией модели |
| Документация размещённого сервиса предусматривает текстовые, графические и видеофайлы на входе |
Текущие метаданные публичного репозитория сосредоточены на тексте и изображениях; проверьте соответствие поддержки видео, прежде чем обещать её |
| Не требуется загрузка 1,56 ТБ |
Около 1,56 ТБ в 96 шардах весов |
| Не требуется проект развёртывания кластера |
Moonshot рекомендует 64+ ускорителей |
Сначала используйте API, если вы ещё проверяете соответствие продукта рынку, трафик нестабилен или команда не управляет инфраструктурой для больших моделей. API Kimi K3 от GPT Proto также упрощает сравнение K3 с GPT-5.6 Sol, GLM-5.2 и другими моделями с помощью одного ключа и баланса.
Используйте веса, если частное развёртывание, дообучение, собственный инференс или независимость от провайдера имеют достаточную бизнес-ценность, чтобы оправдать использование кластера. Перед коммерческим развёртыванием изучите лицензию Kimi K3, не предполагая, что «открытая» означает MIT.
Kimi K3 против GLM-5.2, GPT-5.6 и Opus 4.8
Победитель бенчмарка не всегда является подходящей производственной моделью. Полезный выбор зависит от того, что может пойти не так, насколько долго длится процесс и важно ли владение весами.
| Модель |
Выбирайте её, когда |
| Kimi K3 |
Вам нужны длительные мультимодальные агентские процессы и вы хотите использовать размещённый API уже сейчас или развернуть модель с открытыми весами по лицензии Kimi K3 |
| GPT-5.6 Sol |
Качество общих рассуждений и стабильная производительность в продакшене важнее владения моделью |
| Claude Fable 5 |
Вам нужен самый высокий измеренный потолок агентской интеллектуальной работы и у вас есть к нему доступ |
| Claude Opus 4.8 |
Вы уже полагаетесь на процессы Claude для сложного программирования, исследований и точного следования инструкциям |
| GLM-5.2 |
Вам нужно более дешёвое агентское программирование с уже доступными весами |
| Kimi K2.7 Code |
Ваша рабочая нагрузка в основном связана с программированием, а более высокую цену K3 трудно оправдать |
Наиболее убедительный случай для K3 возникает при одновременном наличии трёх условий: длительной задачи, мультимодальных входных данных и причины контролировать развёртывание модели. Без этих требований её масштаб может оказаться дорогим решением небольшой проблемы.
GPT-5.6 Sol остаётся более сильным выбором, когда на первом месте стоят широкий интеллект и надёжность. Opus 4.8 подходит командам со зрелыми процессами программирования или исследований на базе Claude. GLM-5.2 является более сложным конкурентом с точки зрения экономики, поскольку уже предлагает контекст на один миллион токенов и открытые веса при меньшей стоимости задачи.
Моё текущее практическое правило простое: выбирайте K3, когда важны открытые веса и длительные мультимодальные агенты. Выбирайте GPT-5.6 или Opus, когда надёжность важнее владения моделью. Выбирайте GLM-5.2, когда стоимость — ограничение, с которым нельзя договориться.
Можно ли уже использовать Kimi K3 через GPT Proto?
Да. Kimi K3 теперь доступна через API Kimi K3 от GPT Proto.
Текущая цена GPT Proto составляет $2.70 за миллион входных токенов и $13.50 за миллион выходных токенов — на 10% ниже текущей опубликованной цены Moonshot $3/$15. Используйте строку модели kimi-k3 со своим API-ключом GPT Proto, чтобы получить доступ к программированию с длинным контекстом, мультимодальному анализу, вызову инструментов и возможностям структурированного вывода K3.
Тот же ключ и общий баланс также распространяются на GPT-5.6 Sol, GLM-5.2, Claude Opus 4.8 и более 200 текстовых, графических, видео- и аудиомоделей. Благодаря этому удобно тестировать K3 в сравнении с альтернативами на одном репозитории или агентском процессе, прежде чем менять производственный трафик.
Вы можете попробовать Kimi K3 на GPT Proto или просмотреть полную галерею моделей ИИ GPT Proto. Веса и технический отчёт модели теперь опубликованы, но к статье следует вернуться после того, как независимые тесты развёртывания, квантование, данные о пропускной способности и поддержка фреймворков станут более зрелыми.
Итог: близка, но бенчмарк по-прежнему важен
Kimi K3 — не просто большая китайская модель, привлекающая внимание количеством параметров. Независимое тестирование подтверждает более существенный вывод: она конкурентоспособна с передовыми системами в автоматизации, долгосрочной интеллектуальной работе и агентском выполнении.
Это не делает её в целом лучше GPT-5.6 Sol или Claude Fable 5. Это также не отменяет зафиксированного роста числа галлюцинаций. Изменение, произошедшее 28 июля, связано с развёртыванием: обещанные веса, лицензия, карточка модели и технический отчёт теперь опубликованы.
Таким образом, K3 — один из наиболее способных вариантов с открытыми весами в своём классе, но к этой формулировке нужно добавить две оговорки. Её лицензия является собственной, а не MIT, а репозиторий объёмом 1,56 ТБ и рекомендация использовать 64+ ускорителей делают самостоятельное размещение недоступным для обычной команды разработчиков.
Мой вывод: используйте API, чтобы проверить, действительно ли K3 улучшает выполнение ваших задач. Переходите к весам только тогда, когда контроль, кастомизация или границы доступа к данным оправдывают то, чтобы самостоятельно стать поставщиком инфраструктуры.