Кратко
Обновление — 28 июля 2026 года: полные веса Kimi K3 теперь опубликованы. Moonshot AI выпустила чекпойнт объёмом 2.8T, технический отчёт и лицензию Kimi K3 в своих официальных репозиториях. Этот релиз усиливает аргументы в пользу контроля и развёртывания K3 по сравнению с GPT-5.6 Sol, но не меняет результаты независимых тестов и не делает самостоятельную эксплуатацию K3 дешёвой.
Kimi K3 дешевле за токен. GPT-5.6 Sol является более надёжным выбором по умолчанию для производственных агентов, работающих в критически важных сценариях. Оба утверждения могут быть верными.
Разрыв меньше, чем показывают ценовые карточки. В тестах Artificial Analysis GPT-5.6 Sol max набирает 59 баллов по индексу Intelligence Index против 57 у Kimi K3. Однако измеренная стоимость задачи составляет около $1.04 для Sol и $0.95 для K3—это не двукратная разница, которую предполагают их официальные цены на вывод.
Мой краткий ответ: выбирайте GPT-5.6 Sol , когда важнее всего общая надёжность, производительность программного агента и размещаемый набор инструментов OpenAI. Выбирайте Kimi K3, когда решение определяют обработка видео, работа с длинным контекстом, более низкая цена или доступ к опубликованным открытым весам.
Kimi K3 против GPT-5.6 Sol: краткий вердикт
| Если для вас важнее всего… |
Выбирайте |
Почему |
| Широкий интеллект и производственные агенты |
GPT-5.6 Sol |
Лидирует в независимых индексах Intelligence, Coding и Agentic |
| Научное программирование или рассуждения с длинным контекстом |
Протестируйте Kimi K3 |
K3 лидирует в SciCode и немного опережает Sol в AA-LCR |
| Самая низкая цена токенов среди этих двух моделей |
Kimi K3 |
Официально $3/$15 за 1 млн токенов против $5/$30 у Sol |
| Самая низкая измеренная стоимость задачи |
Kimi K3, с небольшим отрывом |
Около $0.95 против $1.04 в текущем сравнении AA |
| Более быстрое появление первого результата |
Kimi K3 |
Измеренное время до первого токена — 4.23 секунды против 136.8 секунды у Sol max |
| Более быстрая генерация после начала вывода |
GPT-5.6 Sol |
63 выходных токена/с против 39 токенов/с у K3 |
| Нативное понимание видео |
Kimi K3 |
K3 принимает текст, изображения и видео; Sol — текст и изображения |
| Зрелые размещаемые инструменты и работа с компьютером |
GPT-5.6 Sol |
OpenAI документирует веб-поиск, поиск по файлам, интерпретатор кода, работу с компьютером, MCP и многое другое |
| Более дешёвая повседневная модель |
GPT-5.6 Terra |
На GPT Proto Terra дешевле K3 и по входным, и по выходным токенам |
| Большой объём трафика с жёсткими требованиями к стоимости |
GPT-5.6 Luna |
Самая дешёвая модель в этой выборке из четырёх моделей |
Это текущие результаты, а не постоянный рейтинг. K3 была выпущена 16 июля 2026 года, и оба провайдера всё ещё меняют поведение обслуживания и параметры рассуждений.
Характеристики и цены API
| |
|
|
| Характеристика |
Kimi K3 |
GPT-5.6 Sol |
| Провайдер |
Moonshot AI |
OpenAI |
| Размер контекстного окна |
1,048,576 токенов |
1,050,000 токенов |
| Максимальный вывод |
131,072 по умолчанию; больше — в пределах общего бюджета контекста |
128,000 токенов |
| Нативный ввод |
Текст, изображения, видео |
Текст, изображения |
| Вывод |
Текст |
Текст |
| Официальная цена входных токенов / 1 млн |
$3.00 |
$5.00 |
| Официальная цена кэшированных входных токенов / 1 млн |
$0.30 |
$0.50 |
| Официальная цена выходных токенов / 1 млн |
$15.00 |
$30.00 |
| Цена входных токенов GPT Proto / 1 млн |
$2.70 |
$4.00 |
| Цена выходных токенов GPT Proto / 1 млн |
$13.50 |
$24.00 |
| Строка модели |
kimi-k3 |
gpt-5.6-sol |
| Доступность весов на 28 июля 2026 года |
Полный чекпойнт 2.8T выпущен по лицензии Kimi K3 |
Нет |
| Требования для самостоятельного размещения |
Около 1.56 ТБ; Moonshot рекомендует 64+ ускорителей |
Не применимо |
Ограничения контекста практически одинаковы. Существенные различия заключаются в том, как каждая модель использует этот контекст, какие типы входных данных принимает и каких требований требует инфраструктура обслуживания.
OpenAI также взимает дополнительную плату за длинный контекст в своём прямом API: запросы с более чем 272K входных токенов тарифицируются по ставке 2x для входных и 1.5x для выходных токенов целиком. Опубликованные тарифы Moonshot для K3 не предусматривают отдельный уровень для большего контекста. Если ваш агент регулярно отправляет запросы объёмом 500K токенов, эта деталь ценообразования может иметь большее значение, чем заявленный размер контекста.
Подробнее об архитектуре и выпуске K3 см. в статье Что такое Kimi K3?. Это сравнение посвящено решению о покупке и развёртывании.
Бенчмарки: Sol лидирует в целом, но у K3 есть реальные преимущества
Сейчас Artificial Analysis оценивает общий профиль GPT-5.6 Sol max выше. Однако разрыв не столь велик:
| |
|
|
|
| Независимая оценка |
Kimi K3 |
GPT-5.6 Sol max |
Победитель |
| Индекс Intelligence |
57 |
59 |
Sol |
| Индекс Coding |
76.2 |
77.4 |
Sol |
| Индекс Agentic |
50.1 |
54.0 |
Sol |
| Terminal-Bench v2.1 |
85% |
88% |
Sol |
| SciCode |
59% |
56% |
K3 |
| Humanity’s Last Exam |
44% |
47% |
Sol |
| GPQA Diamond |
94% |
94% |
Ничья |
| Рассуждения с длинным контекстом AA-LCR |
75% |
74% |
K3 |
| AA-Briefcase |
1,543 Elo |
1,496 Elo |
K3 |
| Визуальные рассуждения MMMU-Pro |
81% |
83% |
Sol |
Обоснованный вывод — не «Sol выигрывает всё». Это не так. Sol лидирует в более широких индексах и терминальной работе, тогда как K3 демонстрирует убедительные результаты в научном программировании, рассуждениях с длинным контекстом и задачах, связанных с подготовкой рабочих материалов.
Средства проведения оценки по-прежнему имеют значение. В собственной таблице бенчмарков Moonshot использует KimiCode, Claude Code или Codex в зависимости от задачи. Поэтому таблицы поставщика являются полезным свидетельством, но не дают чистого лабораторного сравнения. В продакшене окончательным судьёй должны быть ваш агент, ваши инструменты и ваши условия отказа.
Цены: более дешёвые токены не гарантируют намного более дешёвую задачу
По официальной цене из списка вывод K3 стоит вдвое дешевле Sol: $15 против $30 за миллион токенов. На GPT Proto соответствующие ставки составляют $13.50 и $24.
Для одинакового запроса со 100K входных и 20K выходных токенов расчёт стоимости токенов в GPT Proto прост:
Kimi K3: (0.10 × $2.70) + (0.02 × $13.50) = $0.54
GPT-5.6 Sol: (0.10 × $4.00) + (0.02 × $24.00) = $0.88
K3 на 39% дешевле при одинаковом использовании токенов. Но модели рассуждений редко используют одинаковое количество токенов. Если K3 выдаёт 40K выходных токенов для той же задачи, её стоимость возрастает до $0.81 — почти до $0.88 Sol.
Именно поэтому текущий показатель стоимости задачи от Artificial Analysis полезнее ценовой карточки. Взвешенное сравнение оценивает K3 примерно в $0.95 за задачу Intelligence Index, а Sol max — в $1.04. K3 остаётся дешевле, но лишь примерно на 9% в этом типе нагрузки.
Раннее обсуждение на Reddit пришло к тому же спору с менее однозначной стороны. Некоторые пользователи утверждали, что длинные рассуждения K3 делали успешные запуски в два или три раза дороже в их тестах; другие отмечали, что на скриншотах смешивались настройки рассуждений или сравнивалась общая стоимость бенчмарка вместо стоимости задачи. Оба возражения полезны. Ни одно из них не является универсальным бенчмарком.
Практическое правило: записывайте общее количество входных токенов, кэшированных входных токенов, выходных токенов рассуждений, выходных токенов ответа, повторных попыток и время выполнения. «Цена за миллион токенов» — лишь один из столбцов.
Скорость: K3 начинает раньше, Sol пишет быстрее
Artificial Analysis измерила время до первого токена для K3 в 4.23 секунды, а для Sol max — в 136.8 секунды. После начала генерации порядок изменился: Sol выдавал 63 токена в секунду против 39 у K3.
Так какая модель кажется быстрее?
-
В потоковом чате или интерактивном помощнике по программированию более ранний первый токен K3 может восприниматься как более высокая отзывчивость.
-
Для длинного отчёта или трассировки агента более высокая скорость вывода Sol может частично компенсировать медленный старт.
-
Для фонового агента ни один из этих показателей не так важен, как общее время выполнения задачи и её завершение без повторной попытки.
Рассматривайте эти цифры как измеренный снимок, а не как SLA. Ёмкость провайдера, кэширование запросов, интенсивность рассуждений и региональная маршрутизация могут их изменить.
Опыт разработчика: скрытое различие
K3 не является универсальной заменой для каждого существующего цикла рассуждений. Moonshot сообщает, что модель чувствительна к сохранённой истории размышлений. Система, которая не возвращает полное предыдущее состояние рассуждений или переключается на K3 в середине сессии, может выдавать нестабильные результаты. Moonshot рекомендует проверенную совместимую конфигурацию и предупреждает о переключении моделей в середине сессии.
Такое поведение имеет инфраструктурные последствия. Один из первых тестировщиков из сообщества сообщил, что рассуждения K3 занимали 73–83% вывода в его рабочей нагрузке, а некоторые визуальные задачи выполнялись 50–60 минут. Тому же тестировщику потребовались более долгоживущие потоковые соединения и увеличенные бюджеты токенов. Это рабочая нагрузка одного человека, а не общее утверждение о задержке. Тем не менее это хороший пункт для проверки перед миграцией.
Sol предлагает более простой вариант, если вы уже используете OpenAI Responses API. На странице модели Sol OpenAI документирует структурированные ответы, вызов функций, веб-поиск и поиск по файлам, интерпретатор кода, размещаемую оболочку, работу с компьютером, MCP и другие инструменты. Компромисс — более высокая цена и отсутствие возможности загрузить веса.
У K3 есть два преимущества для разработчиков, с которыми Sol сегодня не может сравниться: нативный ввод видео через размещаемый продукт и опубликованные веса модели. Второе преимущество теперь стало конкретным. Moonshot AI опубликовала полный чекпойнт, технический отчёт и инструкции по развёртыванию для vLLM, SGLang и TokenSpeed.
Контроль сопровождается двумя издержками. Во-первых, лицензия Kimi K3 является нестандартной, а не MIT, и добавляет условия для крупных компаний Model-as-a-Service и очень больших коммерческих продуктов. Во-вторых, официальный репозиторий занимает около 1.56 ТБ, а Moonshot рекомендует развёртывание на суперузлах с 64 или более ускорителями. Открытые веса делают самостоятельное размещение возможным, но не делают его экономичным вариантом по умолчанию.
Таким образом, Sol сохраняет более простую историю размещаемой платформы. K3 теперь предлагает более сильный сценарий с возможностью выбора способа развёртывания: начать с API, а затем перейти к самостоятельному выводу, если контроль данных, кастомизация или экономика инфраструктуры оправдывают эту работу.
API Kimi K3 против открытых весов
Размещаемый API Kimi K3 и выпуск с открытыми весами решают разные задачи. API превращает K3 в сервис с оплатой по использованию: вы отправляете запрос, платите за токены, а провайдер управляет кэшированием, маршрутизацией, масштабированием и сбоями. Веса превращают K3 в инфраструктуру, которой ваша команда должна владеть.
| Выбирайте размещаемый API, когда... |
Выбирайте открытые веса, когда... |
| Вы хотите оценить K3 на этой неделе |
Данные должны оставаться в вашей среде |
| Оплата токенов проще, чем покупка и эксплуатация кластера |
Вам нужен контроль над выводом, дообучением или развёртыванием |
| Вам нужны управляемые масштабирование, кэширование и доступность |
Использование достаточно велико и стабильно, чтобы оправдать выделенную инфраструктуру |
| Вам нужен документированный путь размещаемого ввода видео |
Ваши юридическая и инфраструктурная команды проверили функциональное соответствие чекпойнта и лицензию |
Мой вывод: большинству команд следует начать с API. Чекпойнт объёмом 1.56 ТБ и рекомендация использовать 64+ ускорителей задают высокий порог окупаемости. Веса важны потому, что создают путь отказа от размещаемого провайдера, а не потому, что их загрузка автоматически дешевле оплаты за токены.
Kimi K3 против GPT-5.6 Sol, Terra и Luna
Наиболее полезное сравнение — не только Kimi K3 против GPT-5.6 Sol. K3 конкурирует с Sol по возможностям, но цена её API ближе к Terra.
| |
|
|
| Модель на GPT Proto |
Вход / выход за 1 млн |
Оптимальная начальная роль |
| GPT-5.6 Sol |
$4 / $24 |
Максимальное качество, сложное программирование, длительные запуски агентов |
| Kimi K3 |
$2.70 / $13.50 |
Длинные мультимодальные агенты, ввод видео и рабочие нагрузки, для которых позднее может потребоваться развёртывание с открытыми весами |
| GPT-5.6 Terra |
$2 / $12 |
Сбалансированный производственный трафик |
| GPT-5.6 Luna |
$0.80 / $4.80 |
Задачи большого объёма, успешно проходящие оценку на небольшой модели |
Моя рекомендация по маршрутизации проста. Установите верхнюю планку качества с помощью Sol. Протестируйте K3, если важны видео, поведение при длинном контексте или перспектива использования весов. Затем проверьте, сохраняет ли Terra достаточное качество при более низкой цене. Если задача связана с классификацией, извлечением данных, маршрутизацией или краткой помощью в программировании, протестируйте Luna, прежде чем платить по тарифам передовой модели.
Все четыре модели доступны в коллекции моделей GPT Proto с одним ключом и единым балансом.
Запустите один и тот же запрос через обе модели
Следующий скрипт Python использует документированный GPT Proto эндпоинт Chat Completions и меняет только строку модели. Это тест подключения и изучения вывода, а не честный бенчмарк; настройки по умолчанию и параметры рассуждений моделей могут различаться.
import json
import os
import time
import requests
API_URL = "https://gptproto.com/v1/chat/completions"
API_KEY = os.environ["GPTPROTO_API_KEY"]
HEADERS = {
"Authorization": API_KEY,
"Content-Type": "application/json",
}
PROMPT = """Вы проверяете рабочий сервис Python.
Определите три наиболее рискованных режима отказа в коде, предоставленном пользователем,
предложите минимальное исправление и верните краткий план проверки.
Если данных недостаточно, укажите, что именно вы проверили бы, вместо того чтобы выдумывать ответ."""
def run(model: str) -> dict:
payload = {
"model": model,
"messages": [{"role": "user", "content": PROMPT}],
"stream": False,
}
started = time.perf_counter()
response = requests.post(
API_URL,
headers=HEADERS,
json=payload,
timeout=900,
)
response.raise_for_status()
data = response.json()
data["client_wall_time_seconds"] = round(
time.perf_counter() - started,
2,
)
return data
for model_name in ("kimi-k3", "gpt-5.6-sol"):
result = run(model_name)
print(f"\n=== {model_name} ===")
print("wall time:", result["client_wall_time_seconds"])
print("usage:", json.dumps(result.get("usage", {}), indent=2))
print(result["choices"][0]["message"]["content"])
Установите зависимость с помощью pip install requests, задайте GPTPROTO_API_KEY и используйте частную задачу, с которой ни одна из моделей, скорее всего, не сталкивалась. Для полноценной оценки запустите не менее 20 типичных задач и оцените завершение, регрессии, повторные попытки, общую стоимость и время проверки.
Итоговый вердикт
GPT-5.6 Sol выигрывает это сравнение как более безопасная общая рекомендация. Она лидирует в независимых общих, программных и агентских индексах, быстрее генерирует после первого токена и естественно вписывается в экосистему инструментов OpenAI.
Kimi K3 — более интересный условный выбор. Она достаточно близка, чтобы превзойти Sol в некоторых тестах программирования и работы с длинным контекстом, стоит дешевле за токен, принимает видео через размещаемый сервис и теперь предоставляет опубликованный чекпойнт с открытыми весами. Издержки — более тяжёлое поведение при рассуждениях, нестандартная лицензия и требования к самостоятельному размещению, рассчитанные на крупные кластеры ускорителей, а не на обычное оборудование разработчика.
Если вы выбираете модель для реального приложения, не ограничивайтесь сравнением Kimi K3 и GPT-5.6 Sol. Также протестируйте Terra и Luna. Лучшая производственная модель — это самая дешёвая модель, которая проходит вашу проверку принятия на уровне задачи, а не модель с самой громкой диаграммой запуска.