Обновление — 28 июля 2026 г.: Moonshot AI опубликовал полные веса Kimi K3, карточку модели, собственную лицензию и технический отчет. Этот релиз снимает вопрос о доступности со стороны Kimi. Но он не делает модель на 2,8 трлн параметров простой для самостоятельного размещения: официальный репозиторий занимает около 1,56 ТБ, и Moonshot рекомендует развертывания суперноды с 64 и более ускорителями.
Противостояние Qwen 3.8 Max и Kimi K3 выглядит как чистое соревнование двух гигантских китайских ИИ-моделей: превью Alibaba с 2,4 трлн параметров против флагмана Moonshot AI с 2,8 трлн параметров. Цифры подталкивают к простому выводу: модель побольше должна победить.
Но доступные данные этого не показывают, и для разработчиков это не самое полезное сравнение.
По состоянию на 23 июля 2026 года Qwen 3.8 Max все еще является движущимся превью, распространяемым через Token Plan от Alibaba. Kimi K3 уже имеет документированный API, опубликованные цены за токены, окно контекста на 1 млн токенов и датированный план выпуска полных весов. Разрыв в возможностях может быть небольшим. Разрыв в готовности к продукту — нет.
Мое суждение простое: Kimi K3 — более безопасный выбор, если вам нужно сегодня создавать и бюджетировать реальное приложение. Qwen 3.8 Max Preview стоит тестировать в рабочем процессе кодинга, особенно пока промо-кредиты Alibaba делают эксперименты недорогими, но он пока не дал достаточно стабильной информации, чтобы победить в производственном решении.
Коротко: Kimi K3 сегодня — более безопасный выбор для продакшена.
Выбирайте Kimi K3, если вам нужен обычный API, предсказуемые затраты на токены, нативное понимание изображений и видео или модель, которую можно поставить за клиентский продукт уже сейчас. Выбирайте Qwen 3.8 Max Preview, если вы уже пользуетесь экосистемой кодинга Alibaba и хотите протестировать перспективную новую модель по низкой промо-цене.
Единственный детальный парный тест на кодинг, доступный на момент публикации, дал Kimi K3 оценку 83, а Qwen 3.8 Max — 80. Эта разница в три балла — полезное свидетельство, а не универсальный рейтинг. Qwen показал более чистые границы системы и безупречное выполнение инструментов в тесте; Kimi более полно обработал историю ревизий и регенерацию. Обе модели также делали необоснованные выводы, которые требовали фактической правки.
Проще говоря: Kimi сейчас выигрывает решение о развертывании. Qwen не проиграл соревнование возможностей; просто слишком рано объявлять его победителем.
Qwen 3.8 Max против Kimi K3: краткий обзор
| Категория | Qwen 3.8 Max | Kimi K3 |
|---|
| Статус продукта | Стабильный продакшен-API | Стабильный продакшен-API |
| Всего параметров | 2.4T | 2.8T |
| Активные параметры | 95B | 104B |
| Контекстное окно | До 1M токенов | 1 048 576 токенов |
| Входные данные | Текст, изображения и видео | Текст, изображения и видео |
| Официальная цена API | $2/1M вход, $6/1M выход | $3/1M вход, $15/1M выход |
| Доступ GPT Proto | Доступно сейчас | Доступно сейчас |
| Открытые веса | Анонсировано; пока нельзя скачать | Выпущено |
| Лучший для размещенного API | Экономичный мультимодальный кодинг и длительные агенты | Агенты с интенсивными правками и рабочие процессы, специфичные для Kimi |
| Лучший для самостоятельного размещения | Дождитесь чекпоинта и лицензии | Kimi K3 с аппаратурой уровня дата-центра |
Теперь сравнение более равное — но развертывание все еще отличается
Qwen3.8-Max и Kimi K3 теперь обе являются жизнеспособными продакшен-моделями API. Главное различие больше не в том, что «превью против продакшена». Теперь это ценность размещенного API против немедленного владения открытыми весами.
Qwen 3.8 Max теперь — стабильный продакшен API
Alibaba выпустила стабильную модель qwen3.8-max 3 августа 2026 года, заменив прежнее позиционирование эпохи Preview обычным доступом к API с оплатой по мере использования.
В релизе продакшена описана разреженная архитектура Mixture-of-Experts на 2,4 триллиона параметров с примерно 95 миллиардами активных параметров на запрос. Она поддерживает окно контекста до 1 миллиона токенов, до 128K выходных токенов, а также ввод текста, изображений и видео.
Это меняет практическое сравнение. Qwen3.8-Max теперь можно оценивать для клиентских приложений, агентов кодинга, мультимодального анализа и других продакшен-нагрузок, не полагаясь на прежний Personal Token Plan на основе кредитов.
Его официальная цена также ниже, чем у Kimi K3:
| Модель | Цена входа | Цена выхода |
|---|
| Qwen3.8-Max | $2 за 1M токенов | $6 за 1M токенов |
| Kimi K3 | $3 за 1M токенов | $15 за 1M токенов |
Для команд, использующих размещенный API, Qwen3.8-Max на GPT Proto теперь является серьезным продакшен-вариантом, а не экспериментальным endpoint.
Однако анонсированный чекпоинт Alibaba с открытыми весами пока не выпущен. Разработчикам не следует предполагать, что финальные веса, лицензия или условия самостоятельного размещения доступны, пока они не опубликованы официально.
Kimi K3 выпустил загружаемые веса
Kimi K3 доступен как через размещенный API, так и в виде загружаемого чекпоинта. Moonshot AI опубликовал веса модели, карточку модели, технический отчет, руководство по развертыванию и собственную лицензию.
Kimi K3 имеет 2,8 триллиона параметров и активирует примерно 104 миллиарда параметров на токен. В документации по развертыванию описаны такие фреймворки, как vLLM, SGLang и TokenSpeed, что дает командам более понятный путь к контролируемой или частной инфраструктуре.
Это делает Kimi K3 более практичным выбором, когда загружаемые веса, владение развертыванием или немедленное самостоятельное размещение являются жестким требованием.
Открытые веса не делают Kimi K3 простым или недорогим в локальном запуске. Это по-прежнему модель с многотриллионными параметрами, требующая хранилищ, памяти, сетей и ускорителей масштаба дата-центра. Его собственная лицензия также может накладывать условия на очень крупные коммерческие продукты или развертывания Model-as-a-Service.
Что означает разница в развертывании
| Потребность в развертывании | Лучшая отправная точка | Почему |
|---|
| Размещенный продакшен API | Qwen 3.8 Max | Стабильный API со значительно более низкой официальной ценой выходных токенов |
| Мультимодальный кодинг и визуальный анализ | Qwen 3.8 Max | Нативный ввод текста, изображений и видео |
| Загружаемые веса уже сейчас | Kimi K3 | Его чекпоинт и лицензия уже публичны |
| Частное или контролируемое развертывание | Kimi K3 | Команды могут развернуть выпущенную модель в собственной инфраструктуре |
| Простая локальная установка | Ни одна | Обе модели требуют серьезной инфраструктуры для самостоятельного размещения |
| Прямое сравнение API | Тестируйте обе | Сравнивайте принятые задачи, повторы, сбои инструментов, задержку и общую стоимость |
Таким образом, сравнение больше не является неравным из-за того, что Qwen «всего лишь превью». Обе модели могут работать с продакшен-нагрузками API. Оставшееся различие проще: Qwen3.8-Max в настоящее время предлагает более сильное сочетание стоимости и возможностей в размещенном API, а Kimi K3 дает немедленный доступ к выпущенным весам и больший контроль над развертыванием.
Как разработчикам тестировать Qwen 3.8 Max и Kimi K3
| Тест | Дайте обеим моделям | Измеряйте |
|---|
| Анализ архитектуры репозитория | Один и тот же зафиксированный коммит, вопрос об архитектуре, инструменты только для чтения и ограничение по времени | Правильные цитаты файлов, пропущенные зависимости, необоснованные утверждения и время ревью |
| Реализация с несколькими файлами | Одна и та же задача, тесты, файлы для записи и права инструментов | Пройденные тесты, измененные файлы, повторы, регрессии и человеческие правки |
| Исправление визуального фронтенда | Один и тот же скриншот, исходные файлы, браузерные инструменты и целевое поведение | Визуальное соответствие, валидный код, циклы исправлений и итоговый результат теста |
Сохраняйте оболочку агента и права доступа одинаковыми. Установите фиксированное ограничение времени. Запишите полный ID модели и дату, особенно для изменяющегося превью Qwen. Затем фиксируйте выполнение задачи, реальное время, входные и выходные токены, попадания в кэш, неудачные вызовы инструментов, повторы, вмешательства человека и пройденные итоговые тесты.
Не оценивайте ответ только потому, что он «выглядит основательным». Проверяйте, работает ли патч и выдерживают ли утверждения модели проверку.
Для важных архитектурных решений есть еще один полезный подход: запустите обе модели независимо, скройте их личности при ревью и сравните их разногласия. Тест на 269 файлах дал наиболее сильный дизайн только после объединения системных границ Qwen и жизненного цикла Kimi. Иногда правильный ответ на вопрос «Qwen против Kimi» — использовать обе, а затем проверить.
Qwen 3.8 Max против Kimi K3: цены
| Модель | Официальная цена входа | Официальная цена выхода |
|---|
| Qwen3.8-Max | $2 за 1M токенов | $6 за 1M токенов |
| Kimi K3 | $3 за 1M токенов | $15 за 1M токенов |
Kimi K3 на GPT Proto | $2,70 за 1M токенов | $13,50 за 1M токенов |
По официальной цене выходные токены Qwen стоят на 60% дешевле, чем у Kimi K3. Эта разница важна для агентов кодинга с интенсивными рассуждениями, которые создают длинные планы, трассировки инструментов, объяснения и патчи.
Цена токена — это не вся стоимость. Измеряйте повторы, неудачные вызовы инструментов, человеческие правки, задержку и принятое выполнение задач. Kimi все еще может быть дешевле в конкретном процессе, если его более сильная обработка правок и жизненного цикла предотвращает дорогие циклы исправлений.
Проверьте актуальную страницу API Qwen3.8-Max на текущую цену GPT Proto перед расчетом производственного бюджета.
Какую модель выбрать?
| Ситуация | Лучший выбор | Почему |
|---|
| Размещенный продакшен API | Qwen 3.8 Max | Стабильный доступ и значительно более низкая официальная цена выходных токенов |
| Сложный мультимодальный кодинг | Qwen 3.8 Max | Ввод текста, изображений и видео с сильным позиционированием во фронтенде и визуальных агентах |
| Границы архитектуры и дисциплина инструментов | Сначала тестируйте Qwen | Превью выполнило 44 из 44 вызовов инструментов в парном тесте |
| История правок и регенерации | Сначала тестируйте Kimi | Kimi более полно обработал состояние жизненного цикла в парном тесте |
| Загружаемые веса уже сейчас | Kimi K3 | Полный чекпоинт и лицензия уже публичны |
| Наименьшая сложность самостоятельного размещения | Ни одна | Обе — модели с многотриллионными параметрами, требующие серьезной инфраструктуры |
| Один аккаунт для прямого сравнения | Обе через GPT Proto | Запустите одну и ту же задачу, инструменты, настройки рассуждений и критерии оценки |
Мультимодальные входы, рассуждения и поведение агентов
| Возможность | Qwen 3.8 Max Preview | Kimi K3 |
|---|
| Понимание изображений | Документировано | Документировано |
| Понимание видео | Нет четкой документации в качестве текущего входа модели | Документировано |
| Режим мышления | Всегда включен | Всегда включен |
| Уровни рассуждений | low, high, xhigh | low, high, max |
| Уровень рассуждений по умолчанию | xhigh | max |
| Контекстное окно | Четко не указано на текущей странице продукта | 1 048 576 токенов |
| Структурированный вывод | Возможности превью требуют дальнейшей проверки | Документированы JSON-режим и строгая JSON Schema |
| Длинные истории инструментов | Поведение может меняться в зависимости от превью | Полные сообщения ассистента, включая содержимое рассуждений, должны сохраняться |
Документированная поддержка зрения у Qwen делает его актуальным для отладки по скриншотам. Kimi идет дальше, принимая видео, что полезно, когда входные данные — это запись экрана, ссылка на анимацию или демонстрация продукта, которую сложно описать покадрово.
Более богатый документированный интерфейс Kimi также добавляет работы по интеграции. Его поведение Preserved Thinking означает, что многоходовое приложение должно возвращать полное сообщение ассистента, включая содержимое рассуждений и вызовы инструментов, а не только видимый ответ. Эта история занимает контекст и тарифицируется. Окно на 1M токенов большое, но это не бесплатное хранилище.
Обе модели по умолчанию используют максимальный уровень рассуждений. Для оценки сохраняйте эти настройки одинаковыми. Для продакшена тестируйте более низкие усилия на простых задачах. Модель, которая решает 99% запросов с меньшими усилиями, может быть дешевле и быстрее, чем та, что остается на максимальных рассуждениях для каждого автодополнения, классификации или короткого преобразования.
Какую модель выбрать?
| Ваша ситуация | Лучший текущий выбор | Почему |
|---|
| Создание клиентского приложения прямо сейчас | Kimi K3 | Обычный API и прогнозируемая цена токенов |
| Выполнение длительной задачи по репозиторию с вводом изображений или видео | Kimi K3 | Контекст на 1M и документированная поддержка изображений/видео |
| Тестирование внутри Qwen Code, Qoder или другого поддерживаемого инструмента Alibaba | Qwen 3.8 Max Preview | Низкий расход промо-кредитов |
| Нужны стабильные воспроизводимые бенчмарки | Kimi K3, пока что | Превью Qwen может меняться между запусками |
| Нужна самая чистая архитектура и метаданные воспроизведения | Тестируйте Qwen | Он показал реальное преимущество в парном архитектурном ревью |
| Нужна надежная обработка правок и регенерации | Тестируйте Kimi | Он был более полным в доступном парном тесте |
| Нужны загружаемые веса уже сейчас | Kimi K3 | Полный чекпоинт публичен; Qwen 3.8 Max все еще не выпустил веса |
| Нужно сравнить несколько семейств моделей в одном аккаунте | Kimi K3 через GPT Proto | Один ключ и баланс дают доступ к более широкому каталогу моделей |
Для приложения, которое выходит в продакшен на этой неделе, я бы выбрал Kimi K3. У него достаточно опубликованной информации, чтобы оценить стоимость, определить поведение интеграции и повторить тест со стабильным именем модели.
Для внутреннего эксперимента по кодингу я бы не игнорировал Qwen. Его превью справилось с длительным анализом репозитория без единого неудачного вызова инструментов и показало более четкие границы архитектуры, чем Kimi, в парном тесте. Это серьезный сигнал о возможностях. Но это еще не производственный контракт.
Как попробовать Kimi K3 через GPT Proto
Qwen 3.8 Max пока недоступен на GPT Proto, поэтому текущий пример интеграции использует только Kimi K3. Вы можете вызвать его через совместимую с OpenAI конечную точку Chat Completions GPT Proto с строкой модели kimi-k3:
curl https://gptproto.com/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: $GPTPROTO_API_KEY" \
-d '{
"model": "kimi-k3",
"messages": [
{
"role": "user",
"content": "Review this migration plan. Identify unsupported assumptions, missing rollback steps, and the tests required before production."
}
]
}'
Структура конечной точки и авторизации следует краткому руководству по GPT Proto API. Для многоходовых рабочих процессов Kimi сохраняйте полное сообщение ассистента, возвращаемое API, включая поля рассуждений и вызовов инструментов, а не только итоговый видимый текст.
Вы можете попробовать API Kimi K3, просмотреть более 200 ИИ-моделей или использовать единый ИИ API GPT Proto, чтобы сравнить Kimi с другими текстовыми, графическими, видео- и аудиомоделями. Когда Qwen 3.8 Max будет добавлен, полезным тестом станет одна и та же задача, промпт, права инструментов и метод оценки на обоих эндпоинтах моделей.
Итоговый вердикт
Kimi K3 больше не выигрывает просто потому, что Qwen — это превью. Qwen3.8-Max теперь имеет стабильный API, обычные тарифы на токены, документированные спецификации и прямую доступность через GPT Proto.
Для большинства команд, выбирающих размещенную модель, Qwen3.8-Max является более сильной отправной точкой, потому что его официальный тариф $2/$6 значительно ниже, чем у Kimi K3 — $3/$15, особенно в задачах агентов с большим объемом выходных данных.
Kimi K3 остается лучшим выбором, когда загружаемые веса и владение развертыванием не подлежат обсуждению. Его более сильная обработка правок и регенерации в доступном парном тесте также делает его заслуживающим оценки для творческих и инженерных процессов с интенсивным состоянием.
Теперь ответ прост: Qwen — для стоимости размещенного API и широких мультимодальных возможностей; Kimi — для выпущенных весов и задач с интенсивным жизненным циклом.