Gemini 3.5 Flash-Lite — это общедоступная высокоэффективная модель от Google, предназначенная для выполнения агентских задач в больших объемах, перевода, обработки документов, классификации и структурированного извлечения данных. Выпущенная 21 июля 2026 года, она является самой быстрой моделью в серии Gemini 3.5 и предназначена для приложений, где задержка, пропускная способность и стоимость API являются более критическими ограничениями, чем максимальная глубина рассуждений.
API Google Gemini 3.5 Flash-Lite принимает текст, изображения, видео, аудио и PDF-файлы в рамках окна ввода на 1 048 576 токенов. Модель генерирует текстовые ответы объемом до 65 536 токенов и поддерживает функции мышления (thinking), структурированные выходные данные, вызов функций, кэширование, выполнение кода, поиск по файлам, контекст URL и обоснование поиска (grounding) в нативном API Google. Она не генерирует изображения или аудио и не поддерживает Live API. Доступность специфических инструментов провайдера может отличаться при использовании шлюза, совместимого с OpenAI, поэтому ознакомьтесь с документацией GPTProto, прежде чем полагаться на расширение, специфичное для Google.
| Характеристика | Gemini 3.5 Flash-Lite |
| Провайдер | |
| Стабильный ID модели | gemini-3.5-flash-lite |
| Стадия выпуска | Общая доступность |
| Дата выпуска | 21 июля 2026 г. |
| Лимит ввода | 1 048 576 токенов |
| Максимальный вывод | 65 536 токенов |
| Принимаемые типы данных | Текст, изображения, видео, аудио, PDF |
| Вывод | Текст |
| Основные возможности | Мышление, структурированные выходные данные, вызов функций, кэширование |
| Не поддерживается | Генерация изображений, генерация аудио, Live API, дообучение (tuning) |
Лучшие сценарии использования Gemini 3.5 Flash-Lite
Flash-Lite наиболее полезна, когда приложение многократно выполняет узкоспециализированные задачи в больших объемах. Она может выступать в качестве более дешевой рабочей модели под управлением более мощного оркестратора или обрабатывать полные рабочие процессы, решения в которых просты и легко поддаются проверке.
-
Классификация и маршрутизация: Маркировка тикетов поддержки, определение намерений, распределение документов или выбор следующего инструмента без оплаты услуг передовой модели для каждого запроса.
-
Парсинг документов и извлечение JSON: Чтение PDF-файлов, счетов, квитанций, отчетов и записей о продуктах с последующим возвратом полей, соответствующих заданной схеме.
-
Перевод и суммаризация: Обработка больших очередей многоязычного текста, транскриптов встреч, отзывов или контента каталогов, где стоимость единицы обработки влияет на общие операционные расходы.
-
Мультимодальный обзор: Извлечение текста и фактов из изображений, записанного аудио, видео и PDF-файлов с сохранением вывода в текстовом рабочем процессе.
-
Специализированные субагенты: Делегирование поиска, извлечения данных, редактирования кода, проверки и вызовов инструментов специализированным исполнителям, при этом оставляя более мощную модель для планирования или финальной проверки.
Модель менее подходит для случаев, когда сложный запрос требует максимально возможной точности кодирования, долгосрочного планирования или многократного исправления ошибок инструментов. Для таких рабочих нагрузок протестируйте Gemini 3.5 Flash или Gemini 3.6 Flash на том же наборе данных, прежде чем выбирать модель только по цене за токен.
Выбор уровня мышления в зависимости от сложности задачи
Gemini 3.5 Flash-Lite поддерживает настраиваемое мышление в нативном API Google. Google рекомендует MINIMAL для классификации, маршрутизации и извлечения JSON, чувствительных к задержкам. Эта настройка является стандартной и ограничивает использование лишних токенов рассуждения в предсказуемых задачах.
Используйте MEDIUM или HIGH для субагентов, которые пишут код, выполняют команды терминала, вызывают несколько API или должны восстанавливаться после промежуточных ошибок. Более глубокое мышление может улучшить выполнение многошаговых задач, но также увеличивает использование выходных токенов и время ответа. Если вы вызываете модель через конечную точку GPTProto, совместимую с OpenAI, проверьте текущую документацию на предмет параметров мышления перед отправкой специфических для провайдера полей.
Gemini 3.5 Flash-Lite против Gemini 3.5 Flash
Gemini 3.5 Flash-Lite и Gemini 3.5 Flash имеют общее контекстное окно на 1 048 576 токенов и максимальный вывод в 65 536 токенов, но они разработаны для разных экономических моделей нагрузки. Flash-Lite отдает приоритет пропускной способности и низкой стоимости единицы обработки; Flash ориентирована на более сложное кодирование, агентское планирование и интеллектуальную работу.
| Сравнение | Gemini 3.5 Flash-Lite | Gemini 3.5 Flash |
| Лучшее применение | Масштабируемые субагенты, извлечение данных, перевод, парсинг документов | Сложное кодирование, агентское планирование, глубокая интеллектуальная работа |
| Позиционирование модели | Самая быстрая и дешевая модель в серии 3.5 | Более мощная модель уровня Flash |
| Контекст ввода | 1 048 576 токенов | 1 048 576 токенов |
| Максимальный вывод | 65 536 токенов | 65 536 токенов |
| Стандартная цена Google (ввод) | $0.30 за 1 млн токенов | $1.50 за 1 млн токенов |
| Стандартная цена Google (вывод) | $2.50 за 1 млн токенов | $9.00 за 1 млн токенов |
| Цена GPTProto Flash-Lite | $0.18 ввод / $1.50 вывод за 1 млн токенов | См. страницу модели Gemini 3.5 Flash |
По стандартным тарифам Google, Flash-Lite стоит на 80% дешевле для ввода и примерно на 72% дешевле для вывода, чем Gemini 3.5 Flash. Выбирайте её, когда объем запросов и время ответа важнее стоимости редких повторных попыток. Выбирайте Flash, когда небольшое количество сложных задач делает качество с первого раза важнее, чем минимальная цена за токен.
Использование Gemini 3.5 Flash-Lite через GPTProto
GPTProto предоставляет доступ к API Gemini 3.5 Flash-Lite через ту же учетную запись, API-ключ и баланс, которые используются для более чем 200 моделей. Это снижает фрагментацию аккаунтов и биллинга, когда приложение направляет простое извлечение данных в Flash-Lite, сложное рассуждение в Gemini 3.5 Flash или Gemini 3.6 Flash, а работу с медиа — в отдельные модели для изображений, видео или аудио.
Для существующего приложения, совместимого с OpenAI, сохраните структуру клиента и используйте конечную точку, метод аутентификации и строку модели, указанные в документации GPTProto. Не предполагайте, что каждое поле, специфичное для Google, имеет прямое соответствие. Протестируйте элементы управления мышлением, кэширование, обоснование, обработку файлов, схемы инструментов и поведение потоковой передачи перед запуском в продакшн.
Примечания по миграции для существующих рабочих нагрузок Gemini
Google документирует несколько различий в совместимости, которые могут повлиять на миграцию со старых моделей Gemini. Пользовательские значения temperature, top-K и top-P могут игнорироваться. Пользовательские штрафы за частоту (frequency penalty) и присутствие (presence penalty) могут возвращать ошибку. Запросы, в которых последний ход диалога имеет роль model, также не поддерживаются.
Перед переключением высоконагруженного рабочего процесса повторно запустите репрезентативный тестовый набор и проверьте соответствие JSON-схеме, завершение вызовов инструментов, использование токенов, задержку и частоту повторных попыток. Экономически эффективное развертывание API Gemini 3.5 Flash-Lite следует оценивать по стоимости успешной задачи, а не только по стоимости токена. Это особенно важно для многошаговых агентов, где слишком низкая настройка мышления может остановить последовательность инструментов слишком рано.











