Grok 4.6 es un modelo de razonamiento con salida de texto lanzado por SpaceXAI, anteriormente conocida como xAI, el 12 de agosto de 2026. Se basa en Grok 4.5 con entrenamiento adicional para agentes de larga duración, ingeniería de software, investigación técnica, desarrollo de aplicaciones interactivas, diseño asistido por computadora y trabajo de conocimiento más amplio.
El modelo acepta entradas de texto e imagen. Los desarrolladores pueden combinar código fuente, documentación, capturas de pantalla, diagramas, gráficos e instrucciones escritas en una sola solicitud. El soporte de imágenes está pensado para la comprensión visual; Grok 4.6 no reemplaza directamente a los modelos independientes Grok Imagine que se usan para la generación de imágenes o videos.
Su ventana de contexto de 500,000 tokens es adecuada para repositorios grandes, conversaciones extensas, investigación con múltiples documentos y agentes que deben conservar un historial sustancial de tareas. SpaceXAI no publica un límite máximo de salida de texto por separado, aunque las solicitudes siguen sujetas al contexto total del modelo y a los límites operativos de la API.
Grok 4.6 también admite llamada a funciones y salidas estructuradas. Los desarrolladores pueden conectarlo a bases de datos, APIs internas, sistemas de búsqueda, entornos de ejecución de código y otras herramientas de aplicación, y luego solicitar JSON que siga un esquema definido.
| Especificación |
Grok 4.6 |
| Proveedor |
SpaceXAI / xAI |
| Fecha de lanzamiento |
12 de agosto de 2026 |
| Nombre del modelo del proveedor |
grok-4.6 |
| Modalidades de entrada |
Texto e imagen |
| Modalidad de salida |
Texto |
| Ventana de contexto |
500,000 tokens |
| Límite de salida de texto publicado |
No se publica un límite separado |
| Fecha de corte de conocimiento |
1 de febrero de 2026 |
| Esfuerzo de razonamiento |
low, medium, high por defecto, o xhigh |
| Comportamiento de razonamiento |
Siempre habilitado |
| Formatos de API |
Responses API y Chat Completions |
| Capacidades principales |
Llamada a funciones, salidas estructuradas y razonamiento |
| Más adecuado para |
Agentes de codificación, trabajo con aplicaciones visuales, investigación y tareas de conocimiento de varios pasos |
En las evaluaciones publicadas por SpaceXAI, Grok 4.6 High obtuvo 61 en el Artificial Analysis Intelligence Index, frente a 56 de Grok 4.5 High. También mejoró del 54% al 65.9% en DeepSWE v1.1 y del 47.1% al 57.5% en APEX-Agents. Estos resultados indican una mejora significativa para el trabajo con agentes, aunque las puntuaciones de los benchmarks deben validarse con tu propio repositorio y configuración de herramientas.
Aplicaciones de la API de Grok 4.6
Grok 4.6 es más útil cuando una tarea requiere más que una sola respuesta. Su principal ventaja es mantener el trabajo a lo largo de la investigación, la planificación, las llamadas a herramientas, la implementación, las pruebas y la revisión.
Codificación a escala de repositorio: Proporciona al modelo archivos fuente, descripciones de problemas, registros, capturas de pantalla y notas de arquitectura. Puede rastrear el comportamiento entre componentes, proponer ediciones, explicar dependencias y ayudar a verificar si una corrección resuelve el fallo original.
Agentes de codificación de larga duración: Usa la llamada a funciones para conectar herramientas de terminal, ejecutores de pruebas, sistemas de archivos, bases de datos o comprobaciones de despliegue. Un nivel de razonamiento más bajo puede encargarse de la selección rutinaria de herramientas, mientras que los niveles high o xhigh se reservan mejor para depuración compleja y decisiones arquitectónicas.
Prototipado de aplicaciones interactivas: Grok 4.6 está diseñado para convertir ideas de producto amplias en primeras versiones sustanciales. Es especialmente relevante para paneles, simulaciones, herramientas basadas en navegador e interfaces donde el diseño, la lógica de interacción y el refinamiento iterativo deben manejarse en conjunto.
Depuración visual y control de calidad: Proporciona capturas de pantalla de la interfaz junto con el código y los requisitos de implementación. El modelo puede identificar diferencias entre la interfaz renderizada y el diseño previsto y, a continuación, devolver instrucciones de texto, cambios de código o informes de defectos estructurados.
Investigación y trabajo de conocimiento: Combina informes extensos, archivos PDF, tablas, imágenes y preguntas escritas en un único contexto de trabajo. Los agentes con herramientas pueden recopilar información, comparar fuentes, organizar hallazgos y devolver resultados en un esquema que los sistemas posteriores puedan procesar.
El modelo es menos atractivo para solicitudes cortas y de gran volumen en las que un modelo de menor costo ya cumple el umbral de aceptación. Para esas cargas de trabajo, dirige las tareas simples de clasificación, extracción o reescritura a un modelo más pequeño y reserva Grok 4.6 para los casos que requieran razonamiento sostenido.
Detalles de la API que debes revisar antes de migrar
Grok 4.6 admite patrones de solicitud familiares al estilo de OpenAI, pero reemplazar el nombre de un modelo sin revisar el comportamiento de las solicitudes puede seguir generando errores.
Primero, el razonamiento no se puede desactivar. El ajuste predeterminado es high, que puede usar más tokens de razonamiento y producir una latencia mayor de lo esperado. Usa low para la selección sencilla de herramientas o agentes sensibles al tiempo, medium para análisis y xhigh solo cuando la mayor profundidad de razonamiento justifique el costo y el tiempo de espera.
Segundo, los modelos de razonamiento no aceptan todos los parámetros de muestreo estándar. SpaceXAI documenta que presence_penalty, frequency_penalty y stop no se pueden usar con Grok 4.6. Las solicitudes que contengan estos parámetros devuelven un error, así que elimínalos de las configuraciones de modelo compartidas antes de cambiar el tráfico.
Tercero, no calcules una solicitud de 500K tokens basándote únicamente en el precio de referencia de contexto corto. SpaceXAI aplica tarifas directas más altas cuando una solicitud alcanza los 200,000 tokens. Consulta el panel de precios en vivo de GPTProto antes de ejecutar trabajos de contexto grande, especialmente cuando un agente envía repetidamente el historial completo de la conversación o del repositorio.
Cuarto, la entrada de imágenes no significa salida de imágenes. Grok 4.6 puede inspeccionar capturas de pantalla, diagramas, gráficos y otras referencias visuales, pero la generación de imágenes y videos utiliza modelos Grok Imagine independientes.
Por último, confirma qué herramientas alojadas por el proveedor expone la ruta que elijas. La llamada a funciones estándar y las salidas estructuradas son patrones de aplicación portables, mientras que la búsqueda web integrada, la búsqueda en X o la ejecución de código pueden depender del soporte del endpoint.
Grok 4.6 frente a Grok 4.5
Grok 4.6 no es una ampliación de la ventana de contexto ni un sustituto más económico de Grok 4.5. Ambos modelos tienen una ventana de contexto de 500K y los mismos precios directos estándar de entrada y salida. La actualización se centra principalmente en el rendimiento de los agentes, la persistencia extendida de tareas, el trabajo visual e interactivo y la nueva opción de razonamiento xhigh.
| Factor de decisión |
Grok 4.6 |
Grok 4.5 |
Diferencia práctica |
| Ventana de contexto |
500K |
500K |
Sin aumento de capacidad |
| Entrada y salida |
Texto/imagen → texto |
Texto/imagen → texto |
Mismo perfil de modalidad |
| Niveles de razonamiento |
Low, medium, high, xhigh |
Low, medium, high |
Grok 4.6 añade razonamiento xhigh real |
| Precio directo estándar |
$2 de entrada / $6 de salida por 1M |
$2 de entrada / $6 de salida por 1M |
Sin reducción del precio estándar |
| Entrada en caché por debajo de 200K |
$0.50 por 1M |
$0.30 por 1M |
Grok 4.5 es más económico para cargas de trabajo con mucho uso de caché |
| AA Intelligence Index |
61 |
56 |
Grok 4.6 mejora en 5 puntos |
| CursorBench v3.2 |
69.9% |
66.7% |
Mejor rendimiento reportado en agentes de codificación |
| DeepSWE v1.1 |
65.9% |
54.0% |
Mayor mejora en tareas de ingeniería de software |
| FrontierCode v1.1 Extended |
61.3% |
56.6% |
Mejor resultado reportado en codificación de formato largo |
| APEX-Agents |
57.5% |
47.1% |
Mayor rendimiento reportado de agentes |
| Mejor ajuste |
Agentes de larga duración, aplicaciones interactivas y codificación difícil |
Pipelines de codificación existentes y tareas con mucho uso de caché |
Actualiza según la carga de trabajo, no solo según el número del modelo |
Las cifras de los benchmarks anteriores provienen de la evaluación de lanzamiento de Grok 4.6 realizada por SpaceXAI y usan el ajuste de razonamiento High. Son evidencia direccional útil, no una garantía para cada base de código.
Elige Grok 4.6 cuando el agente deba seguir siendo eficaz a lo largo de muchos pasos, revisar su propio trabajo, interpretar referencias visuales o producir una aplicación interactiva sustancial a partir de una especificación amplia.
Mantén Grok 4.5 cuando tu evaluación actual ya pase, los prompts en caché representen una parte significativa del uso o el cambio no proporcione una mejora medible en la tasa de aceptación. Ejecuta ambos modelos en las mismas tareas del repositorio antes de mover todo el tráfico.
¿Cuándo deberías elegir Grok 4.6?
Elige este modelo cuando el costo de un resultado incompleto o incorrecto sea mayor que la latencia adicional de razonamiento. Buenos candidatos incluyen la depuración en todo el repositorio, la implementación de funcionalidades, la investigación impulsada por herramientas, el trabajo con interfaces visuales y los agentes que deben probar y revisar su propia salida.
Para codificación, Grok 4.6 es especialmente relevante cuando una tarea combina varias actividades: leer código desconocido, decidir qué archivos modificar, llamar a herramientas, interpretar los fallos de las pruebas y continuar hasta que el resultado cumpla una condición de aceptación definida.
Para resúmenes simples, clasificación, traducción o extracción corta de JSON, un modelo menos costoso puede ofrecer un mejor costo por resultado aceptado. La clave de API compartida de GPTProto facilita esta estrategia de enrutamiento porque la aplicación puede probar Grok 4.6 junto con otros modelos compatibles sin mantener saldos separados de proveedores.