Gemini 3.6 Flash и Gemini 3.5 Flash-Lite вкратце
Google выпустила обе модели 21 июля 2026 года. В отличие от многих недавних запусков Gemini, ни одна из моделей не появилась в API в качестве временной предварительной версии. Google указывает обе модели как стабильные и доступные для общего использования в производственных средах.
| Характеристика |
Gemini 3.6 Flash |
Gemini 3.5 Flash-Lite |
| Дата выпуска |
21 июля 2026 года |
21 июля 2026 года |
| Доступность |
GA / стабильная |
GA / стабильная |
| Идентификатор модели |
gemini-3.6-flash |
gemini-3.5-flash-lite |
| Основная роль |
Универсальная рабочая модель |
Модель для высокопроизводительного выполнения задач |
| Уровень рассуждений по умолчанию |
Средний |
Минимальный |
| Ограничение входного контекста |
1 048 576 токенов |
1 048 576 токенов |
| Максимальный вывод |
65 536 токенов |
65 536 токенов |
| Типы входных данных |
Текст, изображения, видео, аудио, PDF |
Текст, изображения, видео, аудио, PDF |
| Тип вывода |
Текст |
Текст |
| Стандартная цена входных данных Google |
$1.50 за 1 млн токенов |
$0.30 за 1 млн токенов |
| Стандартная цена вывода Google |
$7.50 за 1 млн токенов |
$2.50 за 1 млн токенов |
| Цена входных данных GPT Proto |
$0.90 за 1 млн токенов |
$0.18 за 1 млн токенов |
| Цена вывода GPT Proto |
$4.50 за 1 млн токенов |
$1.50 за 1 млн токенов |
| Скидка GPT Proto |
Скидка 40% |
Скидка 40% |
| Лучше всего подходит для |
Программирования, сложных агентов, интеллектуальной работы, пространственных и мультимодальных рассуждений |
Извлечения данных, классификации, перевода, поиска, обработки данных и субагентов |
Согласно официальным карточкам моделей, у обеих моделей дата отсечения знаний — март 2026 года. Для получения более свежей информации разработчикам необходимо использовать заземление через поиск или передавать актуальные данные в запросе.
Что такое Gemini 3.6 Flash?
Gemini 3.6 Flash — последняя универсальная Flash-модель Google для программирования, интеллектуальной работы, мультимодального анализа и многоэтапного агентного выполнения задач.
Она основана на Gemini 3.5 Flash, а не представляет собой полностью отдельное поколение архитектуры Gemini. Основная цель обновления — сделать Flash эффективнее во время реальной работы: сократить количество ненужных выходных токенов, шагов рассуждения, вызовов инструментов и повторных циклов выполнения.
Это различие важно. Gemini 3.6 Flash не просто стремится набрать больше баллов на каждом тесте интеллекта. Её цель — выполнять ту же или более качественную работу, используя меньше вычислительных ресурсов и сокращая время ожидания.
Согласно анонсу Google, Gemini 3.6 Flash использует примерно на 17% меньше выходных токенов, чем Gemini 3.5 Flash, в Artificial Analysis Index. Google также сообщает, что для выполнения многоэтапных рабочих процессов модели требуется меньше ходов и вызовов инструментов.
Официальные оценки показывают улучшения в нескольких практических областях:
- DeepSWE вырос с 37% до 49%, что указывает на меньшее количество неправильных изменений кода и циклов выполнения.
- MLE-Bench вырос с 49,7% до 63,9% в задачах исследования машинного обучения.
- OSWorld-Verified вырос с 78,4% до 83% в задачах взаимодействия с компьютером.
- GDPval-AA v2 вырос с 1349 до 1421 в оценке эффективности интеллектуальной работы.
Это результаты, предоставленные поставщиком, поэтому их не следует воспринимать как универсальные гарантии. Однако они подтверждают позиционирование Gemini 3.6 Flash как более надёжной модели для миграции кода, технической диагностики, анализа документов, интерпретации графиков и агентов, использующих инструменты.
Модель принимает текст, изображения, видео, аудио и PDF-файлы, но генерирует только текст. Она не создаёт изображения, видео или речь напрямую.
Что такое Gemini 3.5 Flash-Lite и что означает GA?
Gemini 3.5 Flash-Lite — самая быстрая и недорогая модель Google в семействе Gemini 3.5. Она оптимизирована для задач с низкой задержкой и большим объёмом, где пропускная способность и стоимость API важнее максимального качества рассуждений.
Обозначение “GA” в Flash-Lite GA означает Generally Available («доступна для общего использования»). Это статус доступности, а не часть названия модели. Модель со статусом GA предназначена для стабильного использования в производственной среде, а не для краткосрочного тестирования в предварительном режиме.
Gemini 3.5 Flash-Lite основана на Gemini 3.1 Flash-Lite, а не на Gemini 3.6 Flash. Поэтому её не следует воспринимать как сжатую версию новой модели 3.6. Эти два релиза происходят из разных ветвей обновления:
- Gemini 3.5 Flash → Gemini 3.6 Flash
- Gemini 3.1 Flash-Lite → Gemini 3.5 Flash-Lite
Google позиционирует Flash-Lite для таких сценариев, как:
- Классификация документов и структурированное извлечение
- Обработка чеков и счетов
- Извлечение характеристик товаров
- Перевод и локализация
- Обработка результатов поиска
- Маршрутизация большого потока обращений в службу поддержки
- Обработка табличных данных
- Повторяющиеся вызовы инструментов
- Параллельное выполнение задач субагентами
В независимом тестировании, на которое ссылается Google в своём анонсе, Gemini 3.5 Flash-Lite показала скорость около 350 выходных токенов в секунду. Фактическая производительность API зависит от длины запроса, уровня рассуждений, нагрузки на сервер, инструментов и региона, но этот результат демонстрирует ориентацию модели на высокую пропускную способность.
Flash-Lite также значительно превосходит предшественницу по возможностям. Google сообщает об улучшении результатов с 31% до 54% на Terminal-Bench 2.1 и с 60,1% до 72,2% в своей оценке длинного контекста.
Для более сложных задач модель может использовать более высокие уровни рассуждений, однако это меняет её профиль стоимости и задержки. Если каждому запросу требуется глубокое рассуждение, Flash-Lite может частично потерять экономическое преимущество, ради которого её выбирают.
Что означают «Flash» и «Flash-Lite» в Gemini?
«Flash» не является официальной аббревиатурой. Это название продукта Google для моделей Gemini, ориентированных на скорость, эффективность и масштабируемый вывод.
На практике Flash означает:
- Более высокую скорость по сравнению с тяжёлыми флагманскими моделями
- Меньшую стоимость запуска в масштабе
- Пригодность для интерактивных приложений
- Сохранение способности к рассуждениям, программированию и мультимодальному пониманию
Flash-Lite ещё сильнее смещена в сторону эффективности. Она предназначена для рабочих нагрузок с большим числом относительно ограниченных задач — например, для извлечения полей из тысяч документов или перевода миллионов коротких элементов контента.
«Lite» не означает, что модель не умеет рассуждать или обрабатывать мультимодальные данные. Gemini 3.5 Flash-Lite по-прежнему поддерживает рассуждения, вызов функций, структурированный вывод, заземление через поиск и контекстное окно на 1 млн токенов.
Разница заключается в том, как Google предполагает использовать каждую модель:
- Flash: выбирайте её, когда модели нужно понять сложную цель и решить, что делать.
- Flash-Lite: выбирайте её, когда задача уже определена и должна быть быстро выполнена в большом масштабе.
Gemini 3.6 Flash против Gemini 3.5 Flash: что действительно улучшилось?
Gemini 3.6 Flash — прямой преемник Gemini 3.5 Flash, однако слово «преемник» не означает, что каждый показатель интеллекта вырос.
Наиболее значимые улучшения касаются эффективности, надёжности программирования, использования инструментов и общего времени выполнения задачи.
| Сравнение |
Gemini 3.6 Flash |
Gemini 3.5 Flash |
| Стандартная цена входных данных |
$1.50/M |
$1.50/M |
| Стандартная цена вывода |
$7.50/M |
$9/M |
| Уровень рассуждений по умолчанию |
Средний |
Средний |
| Контекстное окно |
1M |
1M |
| Максимальный вывод |
64K |
64K |
| Artificial Analysis Intelligence Index |
50 |
50 |
| Среднее время выполнения задачи в тестах при запуске |
1,3 минуты |
2,7 минуты |
| Главное преимущество |
Меньший расход токенов и более быстрое выполнение задач |
Проверенная производственная база |
В тестировании Artificial Analysis обе модели получили 50 баллов в Intelligence Index. Поэтому сложно утверждать, что Gemini 3.6 Flash демонстрирует значительный рост общего интеллекта.
Однако Gemini 3.6 Flash выполнила тестовые задачи менее чем за половину среднего времени. Её цена вывода также примерно на 16,7% ниже, а в большинстве агентных рабочих нагрузок модель использует меньше выходных токенов.
Для пользователей в производственной среде это может быть ценнее небольшого роста результатов бенчмарков. Модель, которая получает аналогичный ответ с меньшим количеством токенов, неудачных вызовов инструментов и циклов исправления, снижает как инфраструктурные расходы, так и время ожидания пользователей.
Начинать новое развертывание на Gemini 3.5 Flash практически невыгодно: у Gemini 3.6 Flash такая же стандартная цена входных данных и более низкая цена вывода. Тем не менее существующим приложениям следует проверить совместимость миграции, а не менять идентификатор модели без анализа.
Разработчики, не готовые к миграции, могут продолжить тестировать Gemini 3.5 Flash на GPT Proto, прежде чем сравнить реальное качество вывода, задержку и расход токенов с Gemini 3.6 Flash.
Цены на Gemini 3.6 Flash и Gemini 3.5 Flash-Lite
Ниже приведены тарифы платного Gemini API от Google за один миллион токенов на момент запуска.
| Модель |
Стандартный ввод |
Стандартный вывод |
Пакетный ввод |
Пакетный вывод |
| Gemini 3.6 Flash |
$1.50 |
$7.50 |
$0.75 |
$3.75 |
| Gemini 3.5 Flash |
$1.50 |
$9.00 |
$0.75 |
$4.50 |
| Gemini 3.5 Flash-Lite |
$0.30 |
$2.50 |
$0.15 |
$1.25 |
| Gemini 3.1 Flash-Lite* |
$0.25 |
$1.50 |
$0.125 |
$0.75 |
*Gemini 3.1 Flash-Lite использует более высокий тариф для входных аудиоданных. Перед развертыванием производственной нагрузки ознакомьтесь с актуальной страницей цен Gemini API.
Простой пример расчёта стоимости
Предположим, рабочая нагрузка использует 100 млн входных токенов и генерирует 20 млн выходных токенов.
Без учёта расходов на кэширование, заземление и хранение стандартная стоимость Google API составит:
- Gemini 3.6 Flash: $150 за ввод + $150 за вывод = $300
- Gemini 3.5 Flash: $150 за ввод + $180 за вывод = $330
- Gemini 3.5 Flash-Lite: $30 за ввод + $50 за вывод = $80
Это демонстрирует существенную разницу в заявленной цене между Flash и Flash-Lite. Однако расчёт по фиксированному числу токенов не отражает всей картины.
Более дешёвая модель может оказаться дорогой, если ей требуется больше повторных попыток, она создаёт более длинные цепочки рассуждений или не справляется с задачей. Аналогично, модель с более высокой стоимостью токенов может иметь меньшую цену успешно выполненной задачи, если использует меньше ходов и инструментов.
Именно поэтому важна токенная эффективность Gemini 3.6 Flash. Если она генерирует примерно на 17% меньше выходных токенов и при этом берёт на 16,7% меньше за каждый выходной токен, экономия на выводе в некоторых рабочих нагрузках может быть значительно выше, чем предполагает одна только таблица цен.
Gemini 3.5 Flash-Lite показывает обратную сторону этой ситуации. Это самая недорогая модель в семействе 3.5, но она не дешевле 3.1 Flash-Lite по каждому типу токенов. Цена текстовых, графических и видеовходов выросла с $0.25 до $0.30 за миллион токенов, а цена вывода — с $1.50 до $2.50.
Разработчики платят больше, чем за 3.1 Flash-Lite, но получают значительно более качественные рассуждения, агентные возможности и пропускную способность.
Цены GPT Proto: доступ к обеим моделям со скидкой 40%
Обе модели также доступны через GPT Proto на 40% дешевле стандартных тарифов Google.
| Модель |
Ввод Google |
Ввод GPT Proto |
Вывод Google |
Вывод GPT Proto |
| Gemini 3.6 Flash |
$1.50/M |
$0.90/M |
$7.50/M |
$4.50/M |
| Gemini 3.5 Flash-Lite |
$0.30/M |
$0.18/M |
$2.50/M |
$1.50/M |
По этим тарифам та же рабочая нагрузка — 100 млн входных токенов и 20 млн выходных — будет стоить примерно:
- Gemini 3.6 Flash на GPT Proto: $90 за ввод + $90 за вывод = $180
- Gemini 3.5 Flash-Lite на GPT Proto: $18 за ввод + $30 за вывод = $48
Та же рабочая нагрузка обошлась бы примерно в $300 и $80 соответственно по стандартным тарифам Google.
GPT Proto использует оплату по факту использования, поэтому разработчикам не нужна отдельная подписка для каждой модели. Один API-ключ и баланс аккаунта можно использовать для более чем 200 текстовых, графических, видео- и аудиомоделей GPT Proto.
Актуальные тарифы можно проверить на страницах Gemini 3.6 Flash API и Gemini 3.5 Flash-Lite API.
Какую модель Gemini Flash выбрать?
Выбор модели зависит от того, что является узким местом вашей системы: сложность задач или их объём.
| Рабочая нагрузка |
Рекомендуемая модель |
Почему |
| Изменения в большой кодовой базе |
Gemini 3.6 Flash |
Лучшее планирование и меньше нежелательных изменений |
| Многоэтапный агент программирования |
Gemini 3.6 Flash |
Более эффективное использование инструментов и циклов выполнения |
| Анализ графиков и документов |
Gemini 3.6 Flash |
Более сильные мультимодальные и пространственные рассуждения |
| Сложное бизнес-исследование |
Gemini 3.6 Flash |
Более высокая эффективность в интеллектуальной работе |
| Классификация документов |
Gemini 3.5 Flash-Lite |
Меньшая стоимость и более высокая пропускная способность |
| Извлечение данных из чеков и счетов |
Gemini 3.5 Flash-Lite |
Предназначена для структурированной обработки документов |
| Масштабный перевод |
Gemini 3.5 Flash-Lite |
Быстрая, мультимодальная и недорогая |
| Обработка результатов поиска |
Gemini 3.5 Flash-Lite |
Подходит для параллельного выполнения большого объёма задач |
| Простые задачи субагентов |
Gemini 3.5 Flash-Lite |
Недорогое выполнение с регулируемым уровнем рассуждений |
| Оркестрация агентов |
Обе |
Flash планирует, Flash-Lite выполняет |
Более интересный ответ: используйте обе модели
Представим платформу электронной коммерции, которой нужно извлечь информацию о товарах из тысяч объявлений, PDF-файлов, изображений и документов поставщиков.
Gemini 3.6 Flash могла бы:
- Изучить несколько показательных документов.
- Спроектировать схему извлечения.
- Решить, какие источники надёжны.
- Выявить неоднозначную или противоречивую информацию о товарах.
- Проверить исключения, требующие более глубокого рассуждения.
Затем Gemini 3.5 Flash-Lite могла бы параллельно:
- Прочитать каждый документ о товаре.
- Извлечь бренд, материал, размер, цену и наличие.
- Перевести описания товаров.
- Вернуть структурированный JSON.
- Пометить необычные записи для основного агента.
Такая архитектура позволяет не платить по тарифам 3.6 Flash за каждую повторяющуюся операцию извлечения и при этом использовать более мощную модель там, где важны её рассуждения.
Gemini 3.6 Flash против Kimi K3
Gemini 3.6 Flash и Kimi K3 были выпущены с разницей в несколько дней, но оптимизированы для разных задач.
Kimi K3 — флагманская модель Moonshot AI с 2,8 трлн параметров, предназначенная для долгосрочного программирования, рассуждений и комплексной интеллектуальной работы. Gemini 3.6 Flash делает акцент на скорости, токенной эффективности, мультимодальных рабочих процессах и интеграции с инструментами Google.
Следующие показатели взяты из одного и того же сравнения Artificial Analysis, поэтому они полезнее, чем сопоставление таблиц бенчмарков разных поставщиков.
| Сравнение |
Gemini 3.6 Flash |
Kimi K3 |
| Intelligence Index |
50 |
57 |
| Наблюдаемая скорость вывода |
Примерно 275 токенов/с |
Примерно 36 токенов/с |
| Цена входных данных |
$1.50/M |
$3/M |
| Цена вывода |
$7.50/M |
$15/M |
| Контекстное окно |
Примерно 1M |
Примерно 1M |
| Тип модели |
Проприетарная |
Объявлен выпуск с открытыми весами |
| Лучше всего подходит для |
Быстрых и экономичных агентов |
Работы, требующей более высокого интеллекта и длительного горизонта |
Kimi K3 получила более высокий общий балл Intelligence Index. Она лучше подходит, когда максимальное качество рассуждений и продолжительная интеллектуальная работа важнее скорости ответа.
Заявленные цены Gemini 3.6 Flash на входные и выходные токены примерно вдвое ниже, а наблюдаемая скорость генерации в несколько раз выше. Это делает её более привлекательной для интерактивных инструментов, циклов программирования, анализа документов и приложений с большим числом одновременных пользователей.
Есть и различие в открытости, хотя здесь важна дата. Moonshot назвала Kimi K3 моделью с открытым исходным кодом, однако в её официальной документации запуска говорилось, что полные веса будут выпущены к 27 июля 2026 года. На момент обновления этой статьи 23 июля они ещё не были полностью доступны.
Практический вывод:
- Выбирайте Gemini 3.6 Flash ради скорости, более низкой стоимости API, мультимодального ввода и инструментов Google.
- Выбирайте Kimi K3 ради более высокого общего интеллекта, продолжительной интеллектуальной работы и потенциальной возможности самостоятельного размещения в будущем.
- Тестируйте обе модели на реальном рабочем процессе, прежде чем предполагать, что более высокий результат бенчмарка обеспечит меньшую стоимость успешно выполненной задачи.
Вы также можете попробовать Kimi K3 на GPT Proto, чтобы сравнить её поведение с другими актуальными моделями.
Где можно получить доступ к Gemini 3.6 Flash и Gemini 3.5 Flash-Lite?
Google предоставляет прямой доступ к обеим моделям через Google AI Studio, Gemini API, приложение Gemini и корпоративные продукты. Gemini 3.6 Flash также доступна через Google Antigravity.
Разработчики, которым нужен один ключ для нескольких AI-провайдеров, теперь могут получить доступ к обеим моделям через GPT Proto:
GPT Proto предоставляет совместимый с OpenAI интерфейс API. Вместо поддержки отдельных аккаунтов Google, Kimi, OpenAI, DeepSeek и других провайдеров разработчики могут использовать один API-ключ, один баланс и один базовый URL для более чем 200 моделей.
Строки моделей GPT Proto:
gemini-3.6-flash
gemini-3.5-flash-lite
Это также упрощает A/B-тестирование. Приложение может направлять сложные запросы в Gemini 3.6 Flash, а задачи высокообъёмного извлечения или классификации — в Gemini 3.5 Flash-Lite, не перестраивая интеграцию с API.
Как использовать Gemini 3.6 Flash и Gemini 3.5 Flash-Lite API на GPT Proto
GPT Proto поддерживает совместимую с OpenAI конечную точку Chat Completions, поэтому разработчики, уже использующие OpenAI SDK, могут получить доступ к двум моделям Gemini, изменив API-ключ, базовый URL и название модели.
Шаг 1: создайте API-ключ GPT Proto
Создайте аккаунт GPT Proto или войдите в него, добавьте кредиты и откройте раздел API Keys в панели управления.
Сгенерируйте новый API-ключ и храните его в безопасном месте. Не вставляйте ключ напрямую в публичные репозитории, клиентский код или общие документы.
В macOS или Linux сохраните его как переменную окружения:
export GPTPROTO_API_KEY="sk-your-gptproto-api-key"
Шаг 2: установите Python SDK OpenAI
Установите или обновите OpenAI SDK:
python -m pip install openai
GPT Proto использует следующий совместимый с OpenAI базовый URL:
https://gptproto.com/v1
Шаг 3: вызовите Gemini 3.6 Flash API
Используйте Gemini 3.6 Flash, когда запрос связан с программированием, планированием, мультимодальным анализом, интеллектуальной работой или сложной последовательностью решений.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["GPTPROTO_API_KEY"],
base_url="https://gptproto.com/v1",
)
response = client.chat.completions.create(
model="gemini-3.6-flash",
messages=[
{
"role": "system",
"content": (
"You are a careful software engineering assistant. "
"Inspect the problem before proposing changes and explain "
"how each recommendation should be verified."
),
},
{
"role": "user",
"content": (
"Review this API migration plan and identify compatibility, "
"security, and performance risks."
),
},
],
max_completion_tokens=2048,
)
print(response.choices[0].message.content)
Этот запрос отправляется на унифицированную конечную точку GPT Proto с использованием gemini-3.6-flash в качестве идентификатора модели.
Шаг 4: переключитесь на Gemini 3.5 Flash-Lite
Чтобы использовать Flash-Lite, оставьте тот же клиент, API-ключ и базовый URL. Измените только строку модели:
response = client.chat.completions.create(
model="gemini-3.5-flash-lite",
messages=[
{
"role": "user",
"content": (
"Extract the merchant, invoice date, currency, subtotal, tax, "
"and total from the following invoice text. Return valid JSON."
),
}
],
max_completion_tokens=1024,
)
print(response.choices[0].message.content)
Gemini 3.5 Flash-Lite лучше подходит для больших партий задач извлечения, перевода, классификации, маршрутизации и других чётко определённых операций.
Шаг 5: распределяйте задачи между двумя моделями
Производственное приложение не обязано отправлять каждый запрос в одну и ту же модель. Простое правило маршрутизации может использовать:
gemini-3.6-flash для планирования, программирования, обработки исключений и сложного мультимодального анализа.
gemini-3.5-flash-lite для повторяющегося выполнения, структурированного извлечения, перевода и обработки больших объёмов данных.
Поскольку обе модели используют одну конечную точку GPT Proto и баланс аккаунта, для переключения между ними достаточно изменить идентификатор модели.
Не добавляйте в новые интеграции устаревшие параметры сэмплирования Gemini, такие как temperature, top_p и top_k. Google объявила эти параметры устаревшими для Gemini 3.6 Flash и Gemini 3.5 Flash-Lite.
Примечания по миграции: не рассматривайте её как простую замену идентификатора модели
Gemini 3.6 Flash может показаться очевидной заменой Gemini 3.5 Flash, однако Google внесла изменения в поведение API, которые могут повлиять на существующие приложения.
Начиная с Gemini 3.6 Flash и Gemini 3.5 Flash-Lite:
temperature объявлен устаревшим.
top_p объявлен устаревшим.
top_k объявлен устаревшим.
- Предзаполненные ходы модели больше не поддерживаются.
- В будущих реализациях запрос, последний непустой ход которого принадлежит модели, может вернуть ошибку HTTP 400.
Google сообщает, что в настоящее время устаревшие параметры сэмплирования игнорируются, однако будущие поколения моделей могут их отклонять. Разработчикам следует удалить эти параметры, а не рассчитывать на то, что API продолжит игнорировать их значения.
Перед переносом производственного трафика протестируйте:
- Структурированный вывод JSON
- Вызовы функций и инструментов
- Историю многоходовых сообщений
- Запросы, ранее зависевшие от temperature
- Точность работы с длинными документами
- Поведение уровня рассуждений
- Расход токенов и стоимость успешно выполненной задачи
- Обработку повторных попыток и тайм-аутов
Это особенно важно для агентных приложений, где небольшое изменение в выборе инструмента или длине рассуждений может существенно повлиять на общую стоимость.
Ограничения, которые нужно учитывать перед переходом
Обе новые модели обладают широкими возможностями, но у них остаются важные ограничения.
Они генерируют только текст
Gemini 3.6 Flash и Gemini 3.5 Flash-Lite могут анализировать изображения, видео, аудио и PDF, но не создают мультимедийный контент напрямую. Для генерации изображений, видео, речи и музыки нужны отдельные модели.
Контекстное окно на 1 млн токенов не гарантирует идеальное запоминание
Лимит контекста показывает, какой объём содержимого может принять API, но не гарантирует, что каждому факту будет уделено одинаковое внимание. Важные инструкции и свидетельства всё равно следует чётко структурировать, особенно в очень длинных запросах.
Токены рассуждений учитываются в оплате вывода
Повышение уровня рассуждений может улучшить выполнение сложных задач, но также увеличивает расход выходных токенов и задержку. Flash-Lite с высоким уровнем рассуждений может вести себя совсем иначе, чем в минимальном режиме по умолчанию.
Статус GA не устраняет галлюцинации
В карточках обеих официальных моделей галлюцинации, периодическое снижение скорости и тайм-ауты указаны среди известных ограничений. Результаты для критически важных задач по-прежнему требуют заземления, проверки или участия человека.
Документация по использованию компьютера сейчас противоречива
В руководстве Google по запуску указано, что новые модели поддерживают встроенный набор инструментов, включая Computer Use. Однако на отдельной странице модели Gemini 3.5 Flash-Lite в настоящее время указано, что Computer Use не поддерживается, тогда как в материалах запуска эта возможность описана как доступная.
Разработчикам, планирующим автоматизацию браузера или интерфейса с помощью Flash-Lite, следует проверить последнюю документацию о возможностях API перед развёртыванием в производственной среде.
Итоговый вывод
Gemini 3.6 Flash и Gemini 3.5 Flash-Lite — не дублирующие друг друга релизы.
Gemini 3.6 Flash — лучший вариант по умолчанию, когда задача требует программирования, планирования, сложных рассуждений, мультимодальной интерпретации или нескольких вызовов инструментов. Её главное преимущество перед Gemini 3.5 Flash — не резкий рост общего интеллекта, а более удачное сочетание скорости, токенной эффективности, надёжности программирования и цены вывода.
Gemini 3.5 Flash-Lite лучше выбирать, когда задача чётко определена и должна повторяться тысячи или миллионы раз. В нескольких категориях цен она дороже предыдущего поколения Flash-Lite, но обеспечивает значительное улучшение рассуждений, надёжности работы с инструментами и пропускной способности.
Для многих производственных систем лучшим решением будет использовать обе модели: Gemini 3.6 Flash как планировщик, а Gemini 3.5 Flash-Lite — как масштабируемый слой выполнения.
Обе модели теперь доступны на GPT Proto со скидкой 40% от стандартных тарифов Google. Разработчики могут использовать Gemini 3.6 Flash API для сложного программирования и агентных рабочих процессов, переключаться на Gemini 3.5 Flash-Lite API для высокообъёмного выполнения задач или просматривать полный каталог AI-моделей GPT Proto, чтобы сравнить более 200 моделей через одну API-платформу.