La API de Gemini 3.6 Flash proporciona a los desarrolladores acceso programático al modelo Flash de Google, disponible de forma general, para agentes de programación, análisis multimodal, trabajo con conocimientos en contextos extensos y automatización basada en herramientas. Google lanzó el modelo estable gemini-3.6-flash el 21 de julio de 2026. A diferencia del anterior gemini-3-flash-preview, este es un ID de modelo estable destinado al uso continuo en aplicaciones.
Gemini 3.6 Flash acepta texto, imágenes, vídeo, audio y archivos PDF, pero solo devuelve texto. Su ventana de entrada de 1.048.576 tokens puede contener repositorios grandes, conjuntos extensos de documentos o entradas multimedia prolongadas, mientras que el límite de salida de 65.536 tokens permite generar informes detallados, código y respuestas estructuradas. Google enumera el almacenamiento en caché, la salida estructurada, las llamadas a funciones, la ejecución de código, la búsqueda de archivos, el contexto de URL, la fundamentación mediante Search, la fundamentación mediante Maps y el pensamiento configurable entre las capacidades del modelo subyacente.
Los límites de capacidad son importantes. Gemini 3.6 Flash no genera imágenes ni audio, y no admite la API Live. El uso del ordenador está disponible como función preliminar, no como capacidad totalmente estable. Cuando una integración dependa de una herramienta nativa de Google, confirma que la capa de compatibilidad de GPTProto la exponga antes de migrar. Si tu producto requiere interacción de voz a voz, generación nativa de imágenes o estabilidad estricta para la automatización de escritorio, dirige esa parte de la carga de trabajo a otro modelo.
| Especificación | Gemini 3.6 Flash |
|---|---|
| Proveedor | |
| Estado | Disponible de forma general |
| ID de modelo estable | gemini-3.6-flash |
| Tipos de entrada | Texto, imagen, vídeo, audio, PDF |
| Tipo de salida | Texto |
| Límite de tokens de entrada | 1,048,576 |
| Límite de tokens de salida | 65,536 |
| Niveles de pensamiento | minimal, low, medium, high |
| Nivel de pensamiento predeterminado | medium |
| Herramientas enumeradas por Google | Llamadas a funciones, ejecución de código, búsqueda de archivos, Search, Maps, contexto de URL |
| Uso del ordenador | Compatible en versión preliminar |
| No compatible | Generación de imágenes, generación de audio, API Live |
Dónde encaja mejor Gemini 3.6 Flash
Gemini 3.6 Flash resulta más útil cuando una tarea necesita tanto un contexto de trabajo amplio como llamadas repetidas a herramientas. No es automáticamente la opción más económica para cada solicitud breve, y su nivel de pensamiento medio predeterminado puede gastar más tokens que un modelo sin razonamiento en tareas sencillas de clasificación. Adapta el nivel de pensamiento y la ruta del modelo al trabajo real.
| Carga de trabajo | Por qué encaja | Nota de implementación |
|---|---|---|
| Agentes de programación para repositorios | Menos ediciones no deseadas y bucles de ejecución que Gemini 3.5 Flash en las pruebas de Google | Usa el nivel de pensamiento medium o high y valida los cambios con pruebas |
| Análisis multimodal de documentos | Lee PDF, imágenes, gráficos, audio y vídeo en la misma solicitud | Solicita una salida estructurada cuando los sistemas posteriores necesiten campos estables |
| Investigación con contexto extenso | 1M de tokens de entrada y almacenamiento en caché de contexto compatible | Almacena en caché los corpus repetidos en lugar de volver a enviar archivos sin cambios |
| Automatización del navegador o del escritorio | Herramientas nativas de uso del ordenador y un 83,0 % en OSWorld-Verified en la evaluación de Google | Trata el uso del ordenador como una función preliminar y conserva controles de aprobación para acciones de consecuencias importantes |
| Asistentes fundamentados | El modelo subyacente es compatible con Search, Maps, la búsqueda de archivos y el contexto de URL | Activa solo las herramientas que necesite cada solicitud y realiza un seguimiento del uso de tokens resultante |
Gemini 3.6 Flash frente a Gemini 3.5 Flash
Gemini 3.6 Flash es una mejora directa de eficiencia respecto a Gemini 3.5 Flash, no un reemplazo con un contexto más amplio. Ambos modelos mantienen la misma clase de contexto de 1M y el nivel de pensamiento medio predeterminado. La diferencia está en la eficiencia de las tareas: Google informa de un 17 % menos de tokens de salida en las cargas de trabajo de Artificial Analysis, menos turnos de razonamiento y llamadas a herramientas, y mejores resultados en programación, ingeniería de aprendizaje automático, uso del ordenador y recuperación en contextos extensos.
La tarifa oficial de entrada se mantiene en 1,50 $ por cada millón de tokens, mientras que la tarifa oficial de salida baja de 9,00 $ a 7,50 $. En GPTProto, Gemini 3.6 Flash cuesta 0,90 $ por cada millón de tokens de entrada y 4,50 $ por cada millón de tokens de salida; Gemini 3.5 Flash cuesta actualmente 0,90 $ y 5,40 $. Para sistemas agénticos o multimodales nuevos, 3.6 Flash es la mejor opción predeterminada. Conserva 3.5 Flash solo si ya has validado su comportamiento y necesitas tiempo para probar la migración mediante regresiones.
| Métrica | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|
| Ventana de contexto | 1,048,576 | 1,048,576 |
| Salida máxima | 65,536 | 65,536 |
| Pensamiento predeterminado | Medio | Medio |
| Entrada/salida estándar de Google por cada millón | $1.50 / $7.50 | $1.50 / $9.00 |
| Entrada/salida de GPTProto por cada millón | $0.90 / $4.50 | $0.90 / $5.40 |
| DeepSWE v1.1 | 49.0% | 37.0% |
| MLE-Bench | 63.9% | 49.7% |
| OSWorld-Verified | 83.0% | 78.4% |
| GDM-MRCR v2 a 1M | 54.0% | 26.6% |
Las cifras de las pruebas comparativas han sido comunicadas por los proveedores. Úsalas para elegir candidatos y, después, ejecuta ambos modelos con tus propias solicitudes, herramientas y criterios de éxito antes de trasladar el tráfico de producción.
Cambios de la API que debes comprobar antes de migrar
No consideres la migración a 3.6 Flash como un simple reemplazo del nombre del modelo si tu aplicación utiliza la API Interactions nativa de Google. Google ha cambiado varios campos de generación y conversación para los modelos más recientes:
- Cambia el ID del modelo a
gemini-3.6-flash. - Elimina
temperature,top_pytop_kde la configuración de generación. - Sustituye
thinking_budgetporthinking_level; los valores compatibles sonminimal,low,mediumyhigh. - Elimina
candidate_count, que Gemini 3.x no admite. - No envíes turnos de modelo precompletados. Para sesiones de varios turnos de la API Interactions, utiliza
previous_interaction_iddel lado del servidor. - Prueba mediante regresiones los esquemas de herramientas, las salidas estructuradas y el manejo de archivos antes de transferir todo el tráfico.
Si utilizas el formato de solicitud compatible con OpenAI de GPTProto, sigue la guía de inicio rápido y la documentación de GPTProto de esta página en lugar de copiar directamente los campos nativos de Google. La ventaja práctica es que una sola clave de API y saldo de GPTProto también pueden llamar a Gemini 3.5 Flash, GPT-5.6 Luna, Claude Opus 4.8, Kimi K3 y más de 200 modelos, para que puedas ejecutar el mismo conjunto de evaluación sin abrir cuentas independientes con cada proveedor.







