Gemini 3.5 Flash-Lite es el modelo de eficiencia de disponibilidad general de Google para tareas agénticas de alto volumen, traducción, procesamiento de documentos, clasificación y extracción estructurada. Lanzado el 21 de julio de 2026, es el modelo más rápido de la serie Gemini 3.5 y está orientado a aplicaciones en las que la latencia, el rendimiento y el costo de la API son restricciones más estrictas que la máxima profundidad de razonamiento.
La API de Google Gemini 3.5 Flash-Lite acepta texto, imágenes, video, audio y archivos PDF dentro de una ventana de entrada de 1,048,576 tokens. Produce respuestas de texto de hasta 65,536 tokens y admite razonamiento, salidas estructuradas, llamadas a funciones, almacenamiento en caché, ejecución de código, búsqueda de archivos, contexto de URL y fundamentación mediante búsquedas en la API nativa de Google. No genera imágenes ni audio y no admite la Live API. La disponibilidad de las herramientas específicas del proveedor puede variar a través de una puerta de enlace compatible con OpenAI, así que consulta la documentación de GPTProto antes de depender de una extensión nativa de Google.
| Especificación | Gemini 3.5 Flash-Lite |
| Proveedor | |
| ID de modelo estable | gemini-3.5-flash-lite |
| Etapa de lanzamiento | Disponibilidad general |
| Fecha de lanzamiento | 21 de julio de 2026 |
| Límite de entrada | 1,048,576 tokens |
| Salida máxima | 65,536 tokens |
| Entradas aceptadas | Texto, imagen, video, audio, PDF |
| Salida | Texto |
| Capacidades principales | Razonamiento, salidas estructuradas, llamadas a funciones, almacenamiento en caché |
| No compatible | Generación de imágenes, generación de audio, Live API, ajuste |
Mejores usos de Gemini 3.5 Flash-Lite
Flash-Lite es más útil cuando una aplicación repite tareas específicas a gran escala. Puede funcionar como un modelo trabajador de menor costo bajo la coordinación de un orquestador más capaz, o encargarse de flujos de trabajo completos cuyas decisiones sean limitadas y fáciles de validar.
-
Clasificación y enrutamiento: Etiquetar tickets de soporte, detectar intenciones, asignar documentos o elegir la siguiente herramienta sin pagar por un modelo de vanguardia en cada solicitud.
-
Análisis de documentos y extracción a JSON: Leer PDF, facturas, recibos, informes y registros de productos, y devolver campos que coincidan con un esquema definido.
-
Traducción y resumen: Procesar grandes colas de texto multilingüe, transcripciones de reuniones, reseñas o contenido de catálogos cuando el costo unitario afecta el gasto operativo total.
-
Revisión multimodal: Extraer texto y datos de imágenes, audio grabado, video y PDF, manteniendo la salida en un flujo de trabajo posterior basado en texto.
-
Subagentes especializados: Delegar búsquedas, recuperación, ediciones de código, verificación y llamadas a herramientas a trabajadores especializados, reservando un modelo más potente para la planificación o la revisión final.
El modelo es menos adecuado cuando una solicitud difícil requiere la máxima precisión posible al programar, planificación a largo plazo o recuperación repetida ante errores de herramientas. Para esas cargas de trabajo, prueba Gemini 3.5 Flash o Gemini 3.6 Flash con el mismo conjunto de evaluación antes de elegir basándote únicamente en el precio por token.
Elige un nivel de razonamiento según la complejidad de la tarea
Gemini 3.5 Flash-Lite admite razonamiento configurable en la API nativa de Google. Google recomienda MINIMAL para clasificación, enrutamiento y extracción de JSON sensibles a la latencia. Esta configuración es la predeterminada y limita los tokens de razonamiento innecesarios en tareas predecibles.
Usa MEDIUM o HIGH para subagentes que escriban código, ejecuten comandos de terminal, llamen a varias API o deban recuperarse de errores intermedios. Un mayor razonamiento puede mejorar la ejecución en varios pasos, pero también aumenta el uso de tokens de salida y el tiempo de respuesta. Si llamas al modelo mediante el endpoint compatible con OpenAI de GPTProto, consulta la documentación actual para conocer el parámetro de razonamiento asignado antes de enviar campos específicos del proveedor.
Gemini 3.5 Flash-Lite frente a Gemini 3.5 Flash
Gemini 3.5 Flash-Lite y Gemini 3.5 Flash comparten una ventana de contexto de 1,048,576 tokens y una salida máxima de 65,536 tokens, pero están diseñados para economías de carga de trabajo diferentes. Flash-Lite prioriza el rendimiento y el bajo costo unitario; Flash está orientado a programación más compleja, planificación agéntica y trabajo de conocimiento.
| Comparación | Gemini 3.5 Flash-Lite | Gemini 3.5 Flash |
| Más adecuado para | Subagentes de alto volumen, extracción, traducción y análisis de documentos | Programación compleja, planificación de agentes y trabajo de conocimiento más profundo |
| Posicionamiento del modelo | El modelo más rápido y de menor costo de la serie 3.5 | Modelo Flash más capaz |
| Contexto de entrada | 1,048,576 tokens | 1,048,576 tokens |
| Salida máxima | 65,536 tokens | 65,536 tokens |
| Precio estándar de entrada de Google | $0.30 por 1M de tokens | $1.50 por 1M de tokens |
| Precio estándar de salida de Google | $2.50 por 1M de tokens | $9.00 por 1M de tokens |
| Precio de GPTProto Flash-Lite | $0.18 de entrada / $1.50 de salida por 1M de tokens | Consulta la página del modelo Gemini 3.5 Flash |
A las tarifas estándar de Google, Flash-Lite cuesta un 80 % menos en la entrada y aproximadamente un 72 % menos en la salida que Gemini 3.5 Flash. Elígelo cuando el volumen de solicitudes y el tiempo de respuesta dominen el costo de los reintentos ocasionales. Elige Flash cuando un número menor de tareas más difíciles haga que la calidad en el primer intento sea más importante que la tarifa de tokens más baja.
Uso de Gemini 3.5 Flash-Lite a través de GPTProto
GPTProto proporciona acceso a la API de Gemini 3.5 Flash-Lite mediante la misma cuenta, clave de API y saldo utilizados para más de 200 modelos. Esto reduce la fragmentación de cuentas y facturación cuando una aplicación dirige la extracción simple a Flash-Lite, el razonamiento complejo a Gemini 3.5 Flash o Gemini 3.6 Flash, y el trabajo multimedia a modelos independientes de imágenes, video o audio.
Para una aplicación existente compatible con OpenAI, conserva la estructura del cliente circundante y usa el endpoint, el método de autenticación y la cadena del modelo que se muestran en la documentación de GPTProto. No asumas que todos los campos nativos de Google se asignan uno a uno. Prueba los controles de razonamiento, el almacenamiento en caché, la fundamentación, la gestión de archivos, los esquemas de herramientas y el comportamiento de streaming antes de transferir tráfico de producción.
Notas de migración para cargas de trabajo existentes de Gemini
Google documenta varias diferencias de compatibilidad que pueden afectar las migraciones desde modelos Gemini anteriores. Los valores personalizados de temperature, top-K y top-P pueden ignorarse. Las penalizaciones personalizadas de frecuencia y presencia pueden devolver un error. Las solicitudes cuyo último turno de conversación tenga el rol model tampoco son compatibles.
Antes de cambiar un flujo de trabajo de alto volumen, vuelve a ejecutar un conjunto de pruebas representativo y comprueba el cumplimiento del esquema JSON, la finalización de las llamadas a herramientas, el uso de tokens, la latencia y la frecuencia de reintentos. Una implementación rentable de la API de Gemini 3.5 Flash-Lite debe evaluarse por el costo por tarea exitosa, no solo por el costo por token. Esto es especialmente importante para agentes de varios pasos, donde una configuración de razonamiento demasiado baja puede detener una secuencia de herramientas demasiado pronto.











