API Kimi K3 предоставляет разработчикам доступ к флагманской модели Moonshot AI для длительных задач программирования, мультимодального анализа, использования инструментов и комплексной работы со знаниями. Выпущенная 16 июля 2026 года, K3 представляет собой модель Mixture-of-Experts с 2,8 триллиона параметров. Для каждого токена она активирует 16 из 896 экспертов и сочетает Kimi Delta Attention, Attention Residuals и Stable LatentMoE, чтобы эффективнее обрабатывать длинные последовательности, чем плотная модель сопоставимого общего размера.
K3 принимает текст, изображения и видео, а возвращает текст. Контекстное окно на 1M токенов предназначено для задач, которые невозможно свести к короткому промпту: программирование на уровне репозитория, анализ нескольких документов, длинные истории взаимодействия с инструментами и циклы визуальной обратной связи. Модель всегда рассуждает. Разработчики могут задавать reasoning_effort значение low, high или max, где max используется по умолчанию, вместо включения и выключения режима рассуждений.
GPTProto предоставляет другой уровень доступа к модели. Один API-ключ Kimi K3 и один баланс можно также использовать с более чем 200 текстовыми, графическими, видео- и аудиомоделями. Указанная на этой странице ставка составляет $2.70 за 1M входных токенов и $13.50 за 1M выходных токенов — на 10% ниже текущей цены Moonshot 3/15. Благодаря этому K3 проще тестировать наряду с GPT-5.6 Sol, Claude Fable 5, GLM-5.2 и другими моделями, не открывая и не пополняя отдельный аккаунт у каждого провайдера для каждого эксперимента.
| Спецификация | Kimi K3 |
|---|---|
| Провайдер | Moonshot AI |
| Дата выпуска | 16 июля 2026 года |
| Класс модели | Mixture-of-Experts с 2,8T параметров |
| Активные эксперты | 16 из 896 на токен |
| Архитектура | Kimi Delta Attention, Attention Residuals, Stable LatentMoE |
| Входные данные | Текст, изображения и видео |
| Выходные данные | Текст |
| Контекстное окно | 1 048 576 токенов |
| Лимит генерации | 131 072 токена по умолчанию; можно настроить до 1 048 576 в пределах общего бюджета контекста |
| Рассуждения | Всегда включены; уровень low, high или max |
| Возможности API | Потоковая передача, вызовы инструментов, tool_choice, динамические инструменты, режим JSON, строгая JSON Schema и Partial Mode |
Применение API Kimi K3
K3 особенно полезна, когда задача объединяет большой рабочий набор данных с повторяющимися действиями. Агент для программирования может изучить репозиторий, изменить несколько файлов, запустить тесты, прочитать журналы и использовать скриншоты для улучшения интерфейса или игры. Исследовательский процесс может сохранять большой корпус документов в контексте, вызывать внешние инструменты и возвращать результат в соответствии со строгой JSON Schema. Мультимодальная система контроля качества может сравнивать скриншоты интерфейса с деталями реализации, а рабочий процесс обработки видео — анализировать загруженные записи и возвращать заметки о сценах, сводки или структурированные метаданные.
Модель менее убедительна для короткой классификации, простого чата или высокообъёмного извлечения данных, где меньшая модель уже обеспечивает необходимое качество. K3 всегда рассуждает, поэтому даже её низкий уровень усилий следует оценивать с точки зрения задержки и стоимости выходных токенов. Начните с одного показательного рабочего процесса, измеряйте выполнение задачи, а не отдельного ответа, и сравните K3 с меньшей моделью, прежде чем направлять на неё весь трафик.
Детали API, которые следует проверить перед миграцией
K3 работает с OpenAI SDK и форматом запроса Chat Completions, но имеет особенности поведения, специфичные для модели, которые могут быть упущены при простой замене имени модели.
Во-первых, Preserved Thinking всегда включён. В многошаговых диалогах и циклах работы с инструментами возвращайте полное сообщение ассистента из предыдущего ответа, включая reasoning_content и tool_calls. Если сохранять только видимое content, это может нарушить непрерывность рассуждений и сделать длительные сессии нестабильными. Исторические рассуждения также занимают контекст и тарифицируются как использование токенов, поэтому сжимайте завершённую работу вместо того, чтобы бесконечно сохранять каждый ход.
Во-вторых, используйте поле верхнего уровня reasoning_effort, а не устаревшую конфигурацию thinking из K2.x. K3 поддерживает low, high и max. Значения сэмплирования фиксированы, поэтому приложениям не следует рассчитывать на пользовательские настройки temperature или penalty.
В-третьих, разбирайте структурированные результаты из итогового поля content, а не из reasoning_content. K3 поддерживает режим JSON и строгую JSON Schema через response_format, что полезно для конвейеров извлечения данных, аргументов инструментов и машиночитаемых результатов исследований.
Наконец, мультимодальные запросы требуют структурированных частей контента. Нативный интерфейс Moonshot принимает изображения в формате base64 или ссылки на загруженные файлы, а не общедоступные URL изображений. Перед выпуском мультимодального рабочего процесса уточните в актуальной документации GPTProto точные поля изображений и видео, доступные этой конечной точке.
Когда стоит выбрать Kimi K3?
В собственной публикации о запуске Moonshot сообщает, что K3 всё ещё уступает Claude Fable 5 и GPT-5.6 Sol по общей производительности. Причина выбрать K3 — не утверждение, что она выигрывает в каждом бенчмарке. Её главное преимущество — сочетание контекстного окна на 1M токенов, нативного понимания видео, программирования на длинном горизонте и значительно более низкой цены токенов.
| Фактор выбора | Kimi K3 | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Официальная цена API за 1M токенов | $3 за входные / $15 за выходные | $5 за входные / $30 за выходные | $10 за входные / $50 за выходные |
| Контекстное окно | 1 048 576 | 1 050 000 | 1 000 000 |
| Максимальный объём вывода | До 1 048 576 в пределах контекста; 131 072 по умолчанию | 128 000 | 128 000 |
| Нативные входные данные | Текст, изображения, видео | Текст, изображения | Текст, изображения |
| Доступ к модели |
Размещённый API; официальные веса модели выпущены Moonshot AI отдельно |
Закрытый API | Закрытый API |
| Оптимальный сценарий | Экономичное программирование, мультимодальные агенты, большие рабочие наборы данных | Программирование высшего уровня, работа с компьютером и рабочие процессы с инструментами OpenAI | Длительно работающие агенты, сложное компьютерное зрение и премиальная работа со знаниями |
Выбирайте K3, если более низкая стоимость API, нативный ввод видео или контекстное окно на 1M токенов важнее победы в максимально широком наборе передовых оценок. Выбирайте GPT-5.6 Sol или Claude Fable 5, если собственная оценка на уровне задач показывает, что более высокий процент успешного выполнения компенсирует их более высокую цену токенов. Обсуждение по отдельным бенчмаркам читайте в статье Что такое Kimi K3—и действительно ли она близка к GPT-5.6 и Fable 5?.











