Schuyler Stacy2026-07-23

Gemini 3.6 Flash и Gemini 3.5 Flash-Lite: объяснение — какую модель выбрать?

Сравните цены, скорость, результаты бенчмарков и сценарии использования Gemini 3.6 Flash и Gemini 3.5 Flash-Lite. Узнайте, какая новая модель Google подходит для вашей AI-нагрузки.

Gemini 3.6 Flash и Gemini 3.5 Flash-Lite: объяснение — какую модель выбрать?

Кратко

  • Google выпустила Gemini 3.6 Flash и Gemini 3.5 Flash-Lite 21 июля 2026 года. Обе модели доступны для общего использования, а не находятся в статусе экспериментального предварительного просмотра.
  • Gemini 3.6 Flash — более мощная универсальная модель для программирования, мультимодального анализа, интеллектуальной работы и сложных агентных сценариев.
  • Gemini 3.5 Flash-Lite — более быстрая и недорогая модель для извлечения данных из документов, перевода, классификации, поиска и высокообъёмных задач субагентов.
  • Обе модели поддерживают контекстное окно на 1 млн токенов, до 64K выходных токенов, мультимодальный ввод, рассуждения, вызов функций, структурированный вывод и заземление через поиск.
  • Gemini 3.6 Flash не демонстрирует значительно более высокий уровень интеллекта, чем Gemini 3.5 Flash, на каждом бенчмарке. Её главные преимущества — меньше выходных токенов, меньше вызовов инструментов, более короткое время выполнения задач и более низкая цена вывода.
  • Возможно, самый интересный способ использовать эти модели — не выбирать одну из них, а использовать Gemini 3.6 Flash в качестве основного агента, а Gemini 3.5 Flash-Lite — в качестве слоя выполнения.
  • Обе модели теперь доступны через GPTProto со скидкой 40% от тарифов Google. Вы можете использовать Gemini 3.6 Flash API или Gemini 3.5 Flash-Lite API с одним API-ключом GPTProto и совместимой с OpenAI конечной точкой.

Google выпустила две новые готовые к эксплуатации производственные Flash-модели, однако их названия не сразу объясняют, чем они отличаются.

Gemini 3.5 Flash-Lite — это просто уменьшенная версия Gemini 3.6 Flash? Обозначение “GA” указывает на отдельную модель? Gemini 3.6 Flash действительно лучше Gemini 3.5 Flash или она просто дешевле?

Короткий ответ заключается в том, что Google создала две модели для разных уровней AI-системы. Gemini 3.6 Flash предназначена для принятия более сложных решений и координации комплексных рабочих процессов. Gemini 3.5 Flash-Lite предназначена для быстрого и экономичного выполнения большого количества небольших задач.

В этом руководстве рассматривается всё, что нужно знать о Gemini 3.6 Flash и Gemini 3.5 Flash-Lite: даты выпуска, цены, характеристики, варианты использования, требования к миграции, а также сравнение Gemini 3.6 Flash с Gemini 3.5 Flash и Kimi K3.

Содержание

Gemini 3.6 Flash и Gemini 3.5 Flash-Lite вкратце

Google выпустила обе модели 21 июля 2026 года. В отличие от многих недавних запусков Gemini, ни одна из моделей не появилась в API в качестве временной предварительной версии. Google указывает обе модели как стабильные и доступные для общего использования в производственных средах.

Характеристика Gemini 3.6 Flash Gemini 3.5 Flash-Lite
Дата выпуска 21 июля 2026 года 21 июля 2026 года
Доступность GA / стабильная GA / стабильная
Идентификатор модели gemini-3.6-flash gemini-3.5-flash-lite
Основная роль Универсальная рабочая модель Модель для высокопроизводительного выполнения задач
Уровень рассуждений по умолчанию Средний Минимальный
Ограничение входного контекста 1 048 576 токенов 1 048 576 токенов
Максимальный вывод 65 536 токенов 65 536 токенов
Типы входных данных Текст, изображения, видео, аудио, PDF Текст, изображения, видео, аудио, PDF
Тип вывода Текст Текст
Стандартная цена входных данных Google $1.50 за 1 млн токенов $0.30 за 1 млн токенов
Стандартная цена вывода Google $7.50 за 1 млн токенов $2.50 за 1 млн токенов
Цена входных данных GPT Proto $0.90 за 1 млн токенов $0.18 за 1 млн токенов
Цена вывода GPT Proto $4.50 за 1 млн токенов $1.50 за 1 млн токенов
Скидка GPT Proto Скидка 40% Скидка 40%
Лучше всего подходит для Программирования, сложных агентов, интеллектуальной работы, пространственных и мультимодальных рассуждений Извлечения данных, классификации, перевода, поиска, обработки данных и субагентов

Согласно официальным карточкам моделей, у обеих моделей дата отсечения знаний — март 2026 года. Для получения более свежей информации разработчикам необходимо использовать заземление через поиск или передавать актуальные данные в запросе.

Что такое Gemini 3.6 Flash?

Gemini 3.6 Flash — последняя универсальная Flash-модель Google для программирования, интеллектуальной работы, мультимодального анализа и многоэтапного агентного выполнения задач.

Она основана на Gemini 3.5 Flash, а не представляет собой полностью отдельное поколение архитектуры Gemini. Основная цель обновления — сделать Flash эффективнее во время реальной работы: сократить количество ненужных выходных токенов, шагов рассуждения, вызовов инструментов и повторных циклов выполнения.

Это различие важно. Gemini 3.6 Flash не просто стремится набрать больше баллов на каждом тесте интеллекта. Её цель — выполнять ту же или более качественную работу, используя меньше вычислительных ресурсов и сокращая время ожидания.

Согласно анонсу Google, Gemini 3.6 Flash использует примерно на 17% меньше выходных токенов, чем Gemini 3.5 Flash, в Artificial Analysis Index. Google также сообщает, что для выполнения многоэтапных рабочих процессов модели требуется меньше ходов и вызовов инструментов.

Официальные оценки показывают улучшения в нескольких практических областях:

  • DeepSWE вырос с 37% до 49%, что указывает на меньшее количество неправильных изменений кода и циклов выполнения.
  • MLE-Bench вырос с 49,7% до 63,9% в задачах исследования машинного обучения.
  • OSWorld-Verified вырос с 78,4% до 83% в задачах взаимодействия с компьютером.
  • GDPval-AA v2 вырос с 1349 до 1421 в оценке эффективности интеллектуальной работы.

Это результаты, предоставленные поставщиком, поэтому их не следует воспринимать как универсальные гарантии. Однако они подтверждают позиционирование Gemini 3.6 Flash как более надёжной модели для миграции кода, технической диагностики, анализа документов, интерпретации графиков и агентов, использующих инструменты.

Модель принимает текст, изображения, видео, аудио и PDF-файлы, но генерирует только текст. Она не создаёт изображения, видео или речь напрямую.

Что такое Gemini 3.5 Flash-Lite и что означает GA?

Gemini 3.5 Flash-Lite — самая быстрая и недорогая модель Google в семействе Gemini 3.5. Она оптимизирована для задач с низкой задержкой и большим объёмом, где пропускная способность и стоимость API важнее максимального качества рассуждений.

Обозначение “GA” в Flash-Lite GA означает Generally Available («доступна для общего использования»). Это статус доступности, а не часть названия модели. Модель со статусом GA предназначена для стабильного использования в производственной среде, а не для краткосрочного тестирования в предварительном режиме.

Gemini 3.5 Flash-Lite основана на Gemini 3.1 Flash-Lite, а не на Gemini 3.6 Flash. Поэтому её не следует воспринимать как сжатую версию новой модели 3.6. Эти два релиза происходят из разных ветвей обновления:

  • Gemini 3.5 Flash → Gemini 3.6 Flash
  • Gemini 3.1 Flash-Lite → Gemini 3.5 Flash-Lite

Google позиционирует Flash-Lite для таких сценариев, как:

  • Классификация документов и структурированное извлечение
  • Обработка чеков и счетов
  • Извлечение характеристик товаров
  • Перевод и локализация
  • Обработка результатов поиска
  • Маршрутизация большого потока обращений в службу поддержки
  • Обработка табличных данных
  • Повторяющиеся вызовы инструментов
  • Параллельное выполнение задач субагентами

В независимом тестировании, на которое ссылается Google в своём анонсе, Gemini 3.5 Flash-Lite показала скорость около 350 выходных токенов в секунду. Фактическая производительность API зависит от длины запроса, уровня рассуждений, нагрузки на сервер, инструментов и региона, но этот результат демонстрирует ориентацию модели на высокую пропускную способность.

Flash-Lite также значительно превосходит предшественницу по возможностям. Google сообщает об улучшении результатов с 31% до 54% на Terminal-Bench 2.1 и с 60,1% до 72,2% в своей оценке длинного контекста.

Для более сложных задач модель может использовать более высокие уровни рассуждений, однако это меняет её профиль стоимости и задержки. Если каждому запросу требуется глубокое рассуждение, Flash-Lite может частично потерять экономическое преимущество, ради которого её выбирают.

Что означают «Flash» и «Flash-Lite» в Gemini?

«Flash» не является официальной аббревиатурой. Это название продукта Google для моделей Gemini, ориентированных на скорость, эффективность и масштабируемый вывод.

На практике Flash означает:

  • Более высокую скорость по сравнению с тяжёлыми флагманскими моделями
  • Меньшую стоимость запуска в масштабе
  • Пригодность для интерактивных приложений
  • Сохранение способности к рассуждениям, программированию и мультимодальному пониманию

Flash-Lite ещё сильнее смещена в сторону эффективности. Она предназначена для рабочих нагрузок с большим числом относительно ограниченных задач — например, для извлечения полей из тысяч документов или перевода миллионов коротких элементов контента.

«Lite» не означает, что модель не умеет рассуждать или обрабатывать мультимодальные данные. Gemini 3.5 Flash-Lite по-прежнему поддерживает рассуждения, вызов функций, структурированный вывод, заземление через поиск и контекстное окно на 1 млн токенов.

Разница заключается в том, как Google предполагает использовать каждую модель:

  • Flash: выбирайте её, когда модели нужно понять сложную цель и решить, что делать.
  • Flash-Lite: выбирайте её, когда задача уже определена и должна быть быстро выполнена в большом масштабе.

Gemini 3.6 Flash против Gemini 3.5 Flash: что действительно улучшилось?

Gemini 3.6 Flash — прямой преемник Gemini 3.5 Flash, однако слово «преемник» не означает, что каждый показатель интеллекта вырос.

Наиболее значимые улучшения касаются эффективности, надёжности программирования, использования инструментов и общего времени выполнения задачи.

Сравнение Gemini 3.6 Flash Gemini 3.5 Flash
Стандартная цена входных данных $1.50/M $1.50/M
Стандартная цена вывода $7.50/M $9/M
Уровень рассуждений по умолчанию Средний Средний
Контекстное окно 1M 1M
Максимальный вывод 64K 64K
Artificial Analysis Intelligence Index 50 50
Среднее время выполнения задачи в тестах при запуске 1,3 минуты 2,7 минуты
Главное преимущество Меньший расход токенов и более быстрое выполнение задач Проверенная производственная база

В тестировании Artificial Analysis обе модели получили 50 баллов в Intelligence Index. Поэтому сложно утверждать, что Gemini 3.6 Flash демонстрирует значительный рост общего интеллекта.

Однако Gemini 3.6 Flash выполнила тестовые задачи менее чем за половину среднего времени. Её цена вывода также примерно на 16,7% ниже, а в большинстве агентных рабочих нагрузок модель использует меньше выходных токенов.

Для пользователей в производственной среде это может быть ценнее небольшого роста результатов бенчмарков. Модель, которая получает аналогичный ответ с меньшим количеством токенов, неудачных вызовов инструментов и циклов исправления, снижает как инфраструктурные расходы, так и время ожидания пользователей.

Начинать новое развертывание на Gemini 3.5 Flash практически невыгодно: у Gemini 3.6 Flash такая же стандартная цена входных данных и более низкая цена вывода. Тем не менее существующим приложениям следует проверить совместимость миграции, а не менять идентификатор модели без анализа.

Разработчики, не готовые к миграции, могут продолжить тестировать Gemini 3.5 Flash на GPT Proto, прежде чем сравнить реальное качество вывода, задержку и расход токенов с Gemini 3.6 Flash.

Цены на Gemini 3.6 Flash и Gemini 3.5 Flash-Lite

Ниже приведены тарифы платного Gemini API от Google за один миллион токенов на момент запуска.

Модель Стандартный ввод Стандартный вывод Пакетный ввод Пакетный вывод
Gemini 3.6 Flash $1.50 $7.50 $0.75 $3.75
Gemini 3.5 Flash $1.50 $9.00 $0.75 $4.50
Gemini 3.5 Flash-Lite $0.30 $2.50 $0.15 $1.25
Gemini 3.1 Flash-Lite* $0.25 $1.50 $0.125 $0.75

*Gemini 3.1 Flash-Lite использует более высокий тариф для входных аудиоданных. Перед развертыванием производственной нагрузки ознакомьтесь с актуальной страницей цен Gemini API.

Простой пример расчёта стоимости

Предположим, рабочая нагрузка использует 100 млн входных токенов и генерирует 20 млн выходных токенов.

Без учёта расходов на кэширование, заземление и хранение стандартная стоимость Google API составит:

  • Gemini 3.6 Flash: $150 за ввод + $150 за вывод = $300
  • Gemini 3.5 Flash: $150 за ввод + $180 за вывод = $330
  • Gemini 3.5 Flash-Lite: $30 за ввод + $50 за вывод = $80

Это демонстрирует существенную разницу в заявленной цене между Flash и Flash-Lite. Однако расчёт по фиксированному числу токенов не отражает всей картины.

Более дешёвая модель может оказаться дорогой, если ей требуется больше повторных попыток, она создаёт более длинные цепочки рассуждений или не справляется с задачей. Аналогично, модель с более высокой стоимостью токенов может иметь меньшую цену успешно выполненной задачи, если использует меньше ходов и инструментов.

Именно поэтому важна токенная эффективность Gemini 3.6 Flash. Если она генерирует примерно на 17% меньше выходных токенов и при этом берёт на 16,7% меньше за каждый выходной токен, экономия на выводе в некоторых рабочих нагрузках может быть значительно выше, чем предполагает одна только таблица цен.

Gemini 3.5 Flash-Lite показывает обратную сторону этой ситуации. Это самая недорогая модель в семействе 3.5, но она не дешевле 3.1 Flash-Lite по каждому типу токенов. Цена текстовых, графических и видеовходов выросла с $0.25 до $0.30 за миллион токенов, а цена вывода — с $1.50 до $2.50.

Разработчики платят больше, чем за 3.1 Flash-Lite, но получают значительно более качественные рассуждения, агентные возможности и пропускную способность.

Цены GPT Proto: доступ к обеим моделям со скидкой 40%

Обе модели также доступны через GPT Proto на 40% дешевле стандартных тарифов Google.

Модель Ввод Google Ввод GPT Proto Вывод Google Вывод GPT Proto
Gemini 3.6 Flash $1.50/M $0.90/M $7.50/M $4.50/M
Gemini 3.5 Flash-Lite $0.30/M $0.18/M $2.50/M $1.50/M

По этим тарифам та же рабочая нагрузка — 100 млн входных токенов и 20 млн выходных — будет стоить примерно:

  • Gemini 3.6 Flash на GPT Proto: $90 за ввод + $90 за вывод = $180
  • Gemini 3.5 Flash-Lite на GPT Proto: $18 за ввод + $30 за вывод = $48

Та же рабочая нагрузка обошлась бы примерно в $300 и $80 соответственно по стандартным тарифам Google.

GPT Proto использует оплату по факту использования, поэтому разработчикам не нужна отдельная подписка для каждой модели. Один API-ключ и баланс аккаунта можно использовать для более чем 200 текстовых, графических, видео- и аудиомоделей GPT Proto.

Актуальные тарифы можно проверить на страницах Gemini 3.6 Flash API и Gemini 3.5 Flash-Lite API.

Какую модель Gemini Flash выбрать?

Выбор модели зависит от того, что является узким местом вашей системы: сложность задач или их объём.

Рабочая нагрузка Рекомендуемая модель Почему
Изменения в большой кодовой базе Gemini 3.6 Flash Лучшее планирование и меньше нежелательных изменений
Многоэтапный агент программирования Gemini 3.6 Flash Более эффективное использование инструментов и циклов выполнения
Анализ графиков и документов Gemini 3.6 Flash Более сильные мультимодальные и пространственные рассуждения
Сложное бизнес-исследование Gemini 3.6 Flash Более высокая эффективность в интеллектуальной работе
Классификация документов Gemini 3.5 Flash-Lite Меньшая стоимость и более высокая пропускная способность
Извлечение данных из чеков и счетов Gemini 3.5 Flash-Lite Предназначена для структурированной обработки документов
Масштабный перевод Gemini 3.5 Flash-Lite Быстрая, мультимодальная и недорогая
Обработка результатов поиска Gemini 3.5 Flash-Lite Подходит для параллельного выполнения большого объёма задач
Простые задачи субагентов Gemini 3.5 Flash-Lite Недорогое выполнение с регулируемым уровнем рассуждений
Оркестрация агентов Обе Flash планирует, Flash-Lite выполняет

Более интересный ответ: используйте обе модели

Представим платформу электронной коммерции, которой нужно извлечь информацию о товарах из тысяч объявлений, PDF-файлов, изображений и документов поставщиков.

Gemini 3.6 Flash могла бы:

  1. Изучить несколько показательных документов.
  2. Спроектировать схему извлечения.
  3. Решить, какие источники надёжны.
  4. Выявить неоднозначную или противоречивую информацию о товарах.
  5. Проверить исключения, требующие более глубокого рассуждения.

Затем Gemini 3.5 Flash-Lite могла бы параллельно:

  1. Прочитать каждый документ о товаре.
  2. Извлечь бренд, материал, размер, цену и наличие.
  3. Перевести описания товаров.
  4. Вернуть структурированный JSON.
  5. Пометить необычные записи для основного агента.

Такая архитектура позволяет не платить по тарифам 3.6 Flash за каждую повторяющуюся операцию извлечения и при этом использовать более мощную модель там, где важны её рассуждения.

Gemini 3.6 Flash против Kimi K3

Gemini 3.6 Flash и Kimi K3 были выпущены с разницей в несколько дней, но оптимизированы для разных задач.

Kimi K3 — флагманская модель Moonshot AI с 2,8 трлн параметров, предназначенная для долгосрочного программирования, рассуждений и комплексной интеллектуальной работы. Gemini 3.6 Flash делает акцент на скорости, токенной эффективности, мультимодальных рабочих процессах и интеграции с инструментами Google.

Следующие показатели взяты из одного и того же сравнения Artificial Analysis, поэтому они полезнее, чем сопоставление таблиц бенчмарков разных поставщиков.

Сравнение Gemini 3.6 Flash Kimi K3
Intelligence Index 50 57
Наблюдаемая скорость вывода Примерно 275 токенов/с Примерно 36 токенов/с
Цена входных данных $1.50/M $3/M
Цена вывода $7.50/M $15/M
Контекстное окно Примерно 1M Примерно 1M
Тип модели Проприетарная Объявлен выпуск с открытыми весами
Лучше всего подходит для Быстрых и экономичных агентов Работы, требующей более высокого интеллекта и длительного горизонта

Kimi K3 получила более высокий общий балл Intelligence Index. Она лучше подходит, когда максимальное качество рассуждений и продолжительная интеллектуальная работа важнее скорости ответа.

Заявленные цены Gemini 3.6 Flash на входные и выходные токены примерно вдвое ниже, а наблюдаемая скорость генерации в несколько раз выше. Это делает её более привлекательной для интерактивных инструментов, циклов программирования, анализа документов и приложений с большим числом одновременных пользователей.

Есть и различие в открытости, хотя здесь важна дата. Moonshot назвала Kimi K3 моделью с открытым исходным кодом, однако в её официальной документации запуска говорилось, что полные веса будут выпущены к 27 июля 2026 года. На момент обновления этой статьи 23 июля они ещё не были полностью доступны.

Практический вывод:

  • Выбирайте Gemini 3.6 Flash ради скорости, более низкой стоимости API, мультимодального ввода и инструментов Google.
  • Выбирайте Kimi K3 ради более высокого общего интеллекта, продолжительной интеллектуальной работы и потенциальной возможности самостоятельного размещения в будущем.
  • Тестируйте обе модели на реальном рабочем процессе, прежде чем предполагать, что более высокий результат бенчмарка обеспечит меньшую стоимость успешно выполненной задачи.

Вы также можете попробовать Kimi K3 на GPT Proto, чтобы сравнить её поведение с другими актуальными моделями.

Где можно получить доступ к Gemini 3.6 Flash и Gemini 3.5 Flash-Lite?

Google предоставляет прямой доступ к обеим моделям через Google AI Studio, Gemini API, приложение Gemini и корпоративные продукты. Gemini 3.6 Flash также доступна через Google Antigravity.

Разработчики, которым нужен один ключ для нескольких AI-провайдеров, теперь могут получить доступ к обеим моделям через GPT Proto:

GPT Proto предоставляет совместимый с OpenAI интерфейс API. Вместо поддержки отдельных аккаунтов Google, Kimi, OpenAI, DeepSeek и других провайдеров разработчики могут использовать один API-ключ, один баланс и один базовый URL для более чем 200 моделей.

Строки моделей GPT Proto:

gemini-3.6-flash
gemini-3.5-flash-lite

Это также упрощает A/B-тестирование. Приложение может направлять сложные запросы в Gemini 3.6 Flash, а задачи высокообъёмного извлечения или классификации — в Gemini 3.5 Flash-Lite, не перестраивая интеграцию с API.

Как использовать Gemini 3.6 Flash и Gemini 3.5 Flash-Lite API на GPT Proto

GPT Proto поддерживает совместимую с OpenAI конечную точку Chat Completions, поэтому разработчики, уже использующие OpenAI SDK, могут получить доступ к двум моделям Gemini, изменив API-ключ, базовый URL и название модели.

Шаг 1: создайте API-ключ GPT Proto

Создайте аккаунт GPT Proto или войдите в него, добавьте кредиты и откройте раздел API Keys в панели управления.

Сгенерируйте новый API-ключ и храните его в безопасном месте. Не вставляйте ключ напрямую в публичные репозитории, клиентский код или общие документы.

В macOS или Linux сохраните его как переменную окружения:

export GPTPROTO_API_KEY="sk-your-gptproto-api-key"

Шаг 2: установите Python SDK OpenAI

Установите или обновите OpenAI SDK:

python -m pip install openai

GPT Proto использует следующий совместимый с OpenAI базовый URL:

https://gptproto.com/v1

Шаг 3: вызовите Gemini 3.6 Flash API

Используйте Gemini 3.6 Flash, когда запрос связан с программированием, планированием, мультимодальным анализом, интеллектуальной работой или сложной последовательностью решений.

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["GPTPROTO_API_KEY"],
    base_url="https://gptproto.com/v1",
)

response = client.chat.completions.create(
    model="gemini-3.6-flash",
    messages=[
        {
            "role": "system",
            "content": (
                "You are a careful software engineering assistant. "
                "Inspect the problem before proposing changes and explain "
                "how each recommendation should be verified."
            ),
        },
        {
            "role": "user",
            "content": (
                "Review this API migration plan and identify compatibility, "
                "security, and performance risks."
            ),
        },
    ],
    max_completion_tokens=2048,
)

print(response.choices[0].message.content)

Этот запрос отправляется на унифицированную конечную точку GPT Proto с использованием gemini-3.6-flash в качестве идентификатора модели.

Шаг 4: переключитесь на Gemini 3.5 Flash-Lite

Чтобы использовать Flash-Lite, оставьте тот же клиент, API-ключ и базовый URL. Измените только строку модели:

response = client.chat.completions.create(
    model="gemini-3.5-flash-lite",
    messages=[
        {
            "role": "user",
            "content": (
                "Extract the merchant, invoice date, currency, subtotal, tax, "
                "and total from the following invoice text. Return valid JSON."
            ),
        }
    ],
    max_completion_tokens=1024,
)

print(response.choices[0].message.content)

Gemini 3.5 Flash-Lite лучше подходит для больших партий задач извлечения, перевода, классификации, маршрутизации и других чётко определённых операций.

Шаг 5: распределяйте задачи между двумя моделями

Производственное приложение не обязано отправлять каждый запрос в одну и ту же модель. Простое правило маршрутизации может использовать:

  • gemini-3.6-flash для планирования, программирования, обработки исключений и сложного мультимодального анализа.
  • gemini-3.5-flash-lite для повторяющегося выполнения, структурированного извлечения, перевода и обработки больших объёмов данных.

Поскольку обе модели используют одну конечную точку GPT Proto и баланс аккаунта, для переключения между ними достаточно изменить идентификатор модели.

Не добавляйте в новые интеграции устаревшие параметры сэмплирования Gemini, такие как temperature, top_p и top_k. Google объявила эти параметры устаревшими для Gemini 3.6 Flash и Gemini 3.5 Flash-Lite.

Примечания по миграции: не рассматривайте её как простую замену идентификатора модели

Gemini 3.6 Flash может показаться очевидной заменой Gemini 3.5 Flash, однако Google внесла изменения в поведение API, которые могут повлиять на существующие приложения.

Начиная с Gemini 3.6 Flash и Gemini 3.5 Flash-Lite:

  • temperature объявлен устаревшим.
  • top_p объявлен устаревшим.
  • top_k объявлен устаревшим.
  • Предзаполненные ходы модели больше не поддерживаются.
  • В будущих реализациях запрос, последний непустой ход которого принадлежит модели, может вернуть ошибку HTTP 400.

Google сообщает, что в настоящее время устаревшие параметры сэмплирования игнорируются, однако будущие поколения моделей могут их отклонять. Разработчикам следует удалить эти параметры, а не рассчитывать на то, что API продолжит игнорировать их значения.

Перед переносом производственного трафика протестируйте:

  • Структурированный вывод JSON
  • Вызовы функций и инструментов
  • Историю многоходовых сообщений
  • Запросы, ранее зависевшие от temperature
  • Точность работы с длинными документами
  • Поведение уровня рассуждений
  • Расход токенов и стоимость успешно выполненной задачи
  • Обработку повторных попыток и тайм-аутов

Это особенно важно для агентных приложений, где небольшое изменение в выборе инструмента или длине рассуждений может существенно повлиять на общую стоимость.

Ограничения, которые нужно учитывать перед переходом

Обе новые модели обладают широкими возможностями, но у них остаются важные ограничения.

Они генерируют только текст

Gemini 3.6 Flash и Gemini 3.5 Flash-Lite могут анализировать изображения, видео, аудио и PDF, но не создают мультимедийный контент напрямую. Для генерации изображений, видео, речи и музыки нужны отдельные модели.

Контекстное окно на 1 млн токенов не гарантирует идеальное запоминание

Лимит контекста показывает, какой объём содержимого может принять API, но не гарантирует, что каждому факту будет уделено одинаковое внимание. Важные инструкции и свидетельства всё равно следует чётко структурировать, особенно в очень длинных запросах.

Токены рассуждений учитываются в оплате вывода

Повышение уровня рассуждений может улучшить выполнение сложных задач, но также увеличивает расход выходных токенов и задержку. Flash-Lite с высоким уровнем рассуждений может вести себя совсем иначе, чем в минимальном режиме по умолчанию.

Статус GA не устраняет галлюцинации

В карточках обеих официальных моделей галлюцинации, периодическое снижение скорости и тайм-ауты указаны среди известных ограничений. Результаты для критически важных задач по-прежнему требуют заземления, проверки или участия человека.

Документация по использованию компьютера сейчас противоречива

В руководстве Google по запуску указано, что новые модели поддерживают встроенный набор инструментов, включая Computer Use. Однако на отдельной странице модели Gemini 3.5 Flash-Lite в настоящее время указано, что Computer Use не поддерживается, тогда как в материалах запуска эта возможность описана как доступная.

Разработчикам, планирующим автоматизацию браузера или интерфейса с помощью Flash-Lite, следует проверить последнюю документацию о возможностях API перед развёртыванием в производственной среде.

Итоговый вывод

Gemini 3.6 Flash и Gemini 3.5 Flash-Lite — не дублирующие друг друга релизы.

Gemini 3.6 Flash — лучший вариант по умолчанию, когда задача требует программирования, планирования, сложных рассуждений, мультимодальной интерпретации или нескольких вызовов инструментов. Её главное преимущество перед Gemini 3.5 Flash — не резкий рост общего интеллекта, а более удачное сочетание скорости, токенной эффективности, надёжности программирования и цены вывода.

Gemini 3.5 Flash-Lite лучше выбирать, когда задача чётко определена и должна повторяться тысячи или миллионы раз. В нескольких категориях цен она дороже предыдущего поколения Flash-Lite, но обеспечивает значительное улучшение рассуждений, надёжности работы с инструментами и пропускной способности.

Для многих производственных систем лучшим решением будет использовать обе модели: Gemini 3.6 Flash как планировщик, а Gemini 3.5 Flash-Lite — как масштабируемый слой выполнения.

Обе модели теперь доступны на GPT Proto со скидкой 40% от стандартных тарифов Google. Разработчики могут использовать Gemini 3.6 Flash API для сложного программирования и агентных рабочих процессов, переключаться на Gemini 3.5 Flash-Lite API для высокообъёмного выполнения задач или просматривать полный каталог AI-моделей GPT Proto, чтобы сравнить более 200 моделей через одну API-платформу.

Универсальная творческая студия

Создавайте здесь изображения и видео. API GPTProto обеспечивает быстрые обновления моделей и самые низкие цены.

Начать создание
Универсальная творческая студия
Похожие модели
Все модели
Google
40% OFF
Google
40% OFF
Google
40% OFF
MoonshotAI
10% OFF

Часто задаваемые вопросы

Когда были выпущены Gemini 3.6 Flash и Gemini 3.5 Flash-Lite?

Google выпустила обе модели 21 июля 2026 года. В тот же день они стали доступны через Gemini API, Google AI Studio, приложение Gemini и корпоративные продукты.

Доступна ли Gemini 3.6 Flash для общего использования?

Да. Gemini 3.6 Flash доступна для общего использования и указана как стабильная производственная модель. Её идентификатор API — gemini-3.6-flash.

Что означает GA в Gemini 3.5 Flash-Lite GA?

GA означает Generally Available — «доступна для общего использования». Это означает, что Gemini 3.5 Flash-Lite готова к использованию в производственной среде, а не является временной предварительной версией. «GA» — это статус доступности, а не часть названия модели.

Сколько стоят Gemini 3.6 Flash и Gemini 3.5 Flash-Lite?

Gemini 3.6 Flash стоит $1.50 за миллион входных токенов и $7.50 за миллион выходных токенов по стандартному тарифу платного API. Gemini 3.5 Flash-Lite стоит $0.30 за миллион входных токенов и $2.50 за миллион выходных токенов. Пакетная обработка предлагает примерно на 50% более низкие тарифы на токены.

Gemini 3.6 Flash лучше Gemini 3.5 Flash?

Gemini 3.6 Flash в целом является лучшим выбором для производственной среды: у неё ниже цена вывода, она использует меньше выходных токенов, быстрее выполняет задачи и показывает лучшие результаты в нескольких программных и агентных бенчмарках. Однако обе модели получили одинаковый результат 50 в Artificial Analysis Intelligence Index, поэтому версия 3.6 — скорее обновление эффективности и выполнения задач, чем универсальный скачок интеллекта.

В чём разница между Flash и Flash-Lite?

Flash предназначена для баланса между интеллектом, скоростью и стоимостью при выполнении сложных реальных задач. Flash-Lite делает приоритетом меньшую задержку, более низкую стоимость API и высокую пропускную способность для повторяющихся или ограниченных задач, таких как извлечение данных, перевод, классификация и выполнение задач субагентами.

Обе модели поддерживают контекстное окно на 1 млн токенов?

Да. Gemini 3.6 Flash и Gemini 3.5 Flash-Lite поддерживают до 1 048 576 входных токенов и до 65 536 выходных токенов.

Может ли Gemini 3.5 Flash-Lite обрабатывать изображения и видео?

Да. Она принимает на вход текст, изображения, видео, аудио и PDF-файлы. Однако её вывод ограничен текстом.

Gemini 3.6 Flash и Flash-Lite бесплатны?

Google предоставляет ограниченный бесплатный уровень Gemini API для подходящих сценариев использования. Производственным приложениям, которым нужны более высокие лимиты, кэширование, доступ к Batch API или расширенные элементы управления, обычно требуется платный уровень. Бесплатные квоты и региональная доступность могут изменяться.

Следует ли разработчикам немедленно переходить с Gemini 3.5 Flash?

У Gemini 3.6 Flash есть весомые преимущества по цене и эффективности, однако разработчикам следует сначала протестировать свои запросы и рабочие процессы с инструментами. Такие параметры сэмплирования, как temperature, top_p и top_k, объявлены устаревшими, а предзаполненные ходы модели больше не поддерживаются.

Можно ли использовать Gemini 3.6 Flash и Gemini 3.5 Flash-Lite на GPTProto?

Да. Обе модели доступны через совместимый с OpenAI API GPTProto. Используйте `gemini-3.6-flash` или `gemini-3.5-flash-lite` в качестве идентификатора модели с базовым URL `https://gptproto.com/v1`. Один и тот же API-ключ и баланс аккаунта работают с другими моделями, доступными на GPTProto.

Сколько стоят новые модели Gemini на GPTProto?

GPTProto предоставляет обе модели со скидкой 40% от стандартных тарифов Google. Gemini 3.6 Flash стоит $0.90 за миллион входных токенов и $4.50 за миллион выходных токенов. Gemini 3.5 Flash-Lite стоит $0.18 за миллион входных токенов и $1.50 за миллион выходных токенов. Перед расчётом производственных расходов проверьте актуальные тарифы на странице каждой модели.

Похожие статьи

Ещё блоги
GLM-5.2 и Kimi K3 для программирования: что лучше для разработчиков в 2026 году?

GLM-5.2 и Kimi K3 для программирования: что лучше для разработчиков в 2026 году?

Кратко: Kimi K3 — более сильная модель для программирования, когда задача сложная, длительная или связана с визуальными данными. Она превосходит GLM-5.2 в опубликованном Moonshot сравнении моделей для программирования и принимает изображения и видео через собственный хостинг. GLM-5.2 остаётся лучшим выбором по умолчанию для рутинной работы с репозиториями: она значительно дешевле, меньше по размеру и распространяется по разрешительной лицензии MIT. У Kimi K3 теперь тоже доступны веса, но её репозиторий размером 1,56 ТБ, рекомендуемое развёртывание на 64 и более ускорителях и собственная лицензия делают самостоятельный хостинг существенно более сложным обязательством. Выбирайте Kimi, когда ограничением является функциональность; выбирайте GLM, когда ежедневно важны стоимость и простота эксплуатации. Интересная часть сравнения GLM-5.2 и Kimi K3 для программирования заключается не в том, что обе модели могут написать React-компонент или решить короткую алгоритмическую задачу. Модели такого уровня уже справляются с этим. Полезнее спросить, что происходит, когда задание становится запутанным: аудит репозитория, миграция нескольких файлов, ошибка, проявляющаяся только на скриншоте, или рабочий прототип на Three.js, в котором нужно согласовать несколько систем. Именно здесь начинает иметь значение разница в цене. Kimi K3 выглядит лучше в самых сложных публичных тестах, но её официальная цена за вывод более чем втрое выше, чем у GLM-5.2. Команда, выполняющая тысячи обычных проверок, может сделать больше работы на каждый доллар с GLM. Разработчик, пытающийся спасти один сложный визуальный проект, вполне может предпочесть заплатить за K3.

Tiffany Layne | 2026-07-28

Kimi K3 против GPT-5.6 Sol: более дешёвые токены или более дешёвые задачи?

Kimi K3 против GPT-5.6 Sol: более дешёвые токены или более дешёвые задачи?

Кратко Обновление — 28 июля 2026 года : полные веса Kimi K3 теперь опубликованы. Moonshot AI выпустила чекпойнт объёмом 2.8T, технический отчёт и лицензию Kimi K3 в своих официальных репозиториях. Этот релиз усиливает аргументы в пользу контроля и развёртывания K3 по сравнению с GPT-5.6 Sol, но не меняет результаты независимых тестов и не делает самостоятельную эксплуатацию K3 дешёвой. Kimi K3 дешевле за токен. GPT-5.6 Sol является более надёжным выбором по умолчанию для производственных агентов, работающих в критически важных сценариях. Оба утверждения могут быть верными. Разрыв меньше, чем показывают ценовые карточки. В тестах Artificial Analysis GPT-5.6 Sol max набирает 59 баллов по индексу Intelligence Index против 57 у Kimi K3. Однако измеренная стоимость задачи составляет около $1.04 для Sol и $0.95 для K3—это не двукратная разница, которую предполагают их официальные цены на вывод. Мой краткий ответ: выбирайте GPT-5.6 Sol , когда важнее всего общая надёжность, производительность программного агента и размещаемый набор инструментов OpenAI. Выбирайте Kimi K3 , когда решение определяют обработка видео, работа с длинным контекстом, более низкая цена или доступ к опубликованным открытым весам.

Schuyler Stacy | 2026-07-28

Что такое Kimi K3 — и действительно ли он близок к GPT-5.6 и Fable 5?

Что такое Kimi K3 — и действительно ли он близок к GPT-5.6 и Fable 5?

Кратко Kimi K3 — мультимодальная модель Moonshot AI с 2,8 триллиона параметров, предназначенная для долгосрочного программирования, интеллектуальной работы, рассуждений и агентских процессов. Независимое тестирование ставит её в целом рядом с Claude Opus 4.8 и GPT-5.5, тогда как GPT-5.6 Sol и Claude Fable 5 остаются впереди. K3 сокращает отставание в агентских бенчмарках и лидирует в некоторых тестах автоматизации, однако измеренный уровень галлюцинаций вырос по сравнению с K2.6. Kimi K3 теперь доступна с открытыми весами. Moonshot AI опубликовала полный чекпойнт, карточку модели, технический отчёт и собственную лицензию Kimi K3. Официальный репозиторий на Hugging Face занимает около 1,56 ТБ и включает 96 шардов safetensors, а Moonshot рекомендует развёртывание на суперузлах с 64 или более ускорителями. Открытые веса решают вопрос доступности модели. Но это не превращает K3 в обычную локальную модель. Для большинства разработчиков размещённый API остаётся практичной отправной точкой. API Kimi K3 на GPTProto сейчас предлагает цену $2.70 за миллион входных токенов и $13.50 за миллион выходных токенов. Выбирайте веса, если контроль над данными, собственный инференс или модификация модели оправдывают затраты на инфраструктуру и проверку лицензии. Короче говоря, Kimi K3 достаточно близка к GPT-5.6 и Fable 5, чтобы участвовать с ними в одном сравнении, а выпуск открытых весов теперь даёт разработчикам вариант развёртывания, которого нет ни у одной из закрытых моделей.

Michael Johnson | 2026-07-28

Лучший AI API для разработчиков в 2026 году: сравнение 10 платформ

Лучший AI API для разработчиков в 2026 году: сравнение 10 платформ

Кратко Лучшие прямые API: OpenAI — самый безопасный универсальный вариант по умолчанию; Anthropic Claude лучше всего подходит для программирования и длительно работающих агентов; Gemini удобен для недорогого мультимодального прототипирования; DeepSeek лидирует по цене текстовых токенов. Лучшие мультимодельные варианты: OpenRouter — наиболее очевидный выбор для тестирования множества LLM. GPTProto лучше подходит, когда одному продукту нужны текстовые, графические и видео-модели с единым API-ключом и общим балансом. Лучшие инфраструктурные решения: Amazon Bedrock подходит для корпоративных развертываний под управлением AWS, а Replicate, fal.ai и Together AI лучше подходят для инференса открытых моделей или генеративных медиа. Универсального победителя не существует. Сравнивайте соответствие рабочей нагрузке, покрытие моделями, реальные единицы тарификации, средства управления продакшеном и стоимость перехода. Цены и доступность проверены 14 июля 2026 года; перед развертыванием проверьте актуальные страницы провайдеров.

Tiffany Layne | 2026-07-15