Dos lanzamientos de vanguardia llegaron con cuatro semanas de diferencia, ambos dirigidos directamente al mismo comprador: el desarrollador que ejecuta agentes, no chatbots. Moonshot AI lanzó Kimi K3 el 16 de julio de 2026. xAI respondió el 12 de agosto con Grok 4.6. Si hoy buscas "Grok 4.6 vs Kimi K3", obtienes cobertura del lanzamiento de cada bando, más un montón de fichas técnicas, pero casi nadie ha puesto a los dos cara a cara desde la perspectiva de un desarrollador. Ese es el vacío que cubre este artículo.
Esta es la versión corta, porque viniste por una decisión, no por un resumen.
Grok 4.6 gana en eficiencia de turnos agénticos y hosting sin intervención. Termina tareas largas y de varios pasos en menos iteraciones y menos tokens, y nunca tocas la infraestructura. Kimi K3 gana en contexto, video nativo y control — una ventana de 1M de tokens, entrada de imágenes y video, y pesos abiertos descargables si necesitas autoalojamiento o aislamiento. En la única cifra que todos citan, casi empatan: Artificial Analysis sitúa el costo por tarea de ambos en aproximadamente $0.84. Así que la diferencia de un solo punto en el índice de inteligencia no es tu factor decisivo. Los dos modelos toman caminos opuestos hacia el mismo costo, y eso es la encrucijada que realmente tienes que elegir.
Si ejecutas flujos de trabajo de agentes de alto volumen y sensibles al costo, y quieres un endpoint gestionado, Grok 4.6. Si necesitas meter un repositorio completo o un video en una sola ventana de contexto — o tienes una razón de cumplimiento para conservar los pesos tú mismo — Kimi K3. El resto de este artículo muestra el trabajo detrás de esa decisión.
Especificaciones y precios, cara a cara
Algunas notas antes de la tabla. Las cifras de referencia publicadas en el lanzamiento provienen de los materiales de cada proveedor; trátalas como 🟡 reportadas por el proveedor hasta que ejecuciones independientes las confirmen. Las cifras de Artificial Analysis (índice de inteligencia, costo por tarea) son lo más parecido a un cara a cara neutral y están marcadas como tal. La tarifa de GPT Proto es lo que realmente pagas para probar ambos con una sola clave; la lista oficial es el precio del propio proveedor.
|
Grok 4.6 |
Kimi K3 |
| Proveedor |
xAI |
Moonshot AI |
| Lanzamiento |
12 de agosto de 2026 |
16 de julio de 2026 |
| Arquitectura |
Familia Grok 4.5, entrenamiento suplementario ampliado + RL agéntico |
MoE de 2.8T de parámetros, 16 de 896 expertos activos por token |
| Acceso al modelo |
Solo API alojada (sin pesos descargables) |
Pesos abiertos (pesos lanzados el 27 de julio de 2026, bajo una licencia personalizada de Kimi K3) |
| Ventana de contexto |
500,000 tokens |
1,048,576 tokens |
| Entradas |
Texto, imagen |
Texto, imagen, video |
| Salida |
Texto (sin límite fijo de salida) |
Texto; hasta 1,048,576 dentro del presupuesto de contexto, 131,072 por defecto |
| Índice de Inteligencia AA 🟡 |
61 |
~57 (Artificial Analysis); los gráficos del proveedor lo sitúan justo por debajo de Grok |
| Costo por tarea (Artificial Analysis) |
~$0.84 |
~$0.84 |
| Precio oficial de lista /1M de tokens |
$2 entrada / $6 salida (contexto corto) |
$3 entrada / $15 salida |
| Precio GPT Proto /1M de tokens |
3.60 salida (40 % de descuento) |
13.50 salida (10 % de descuento) |
Las filas de precios merecen un segundo vistazo, porque el titular "Grok es más barato" es cierto pero incompleto. La tarifa de lista de $2/$6 de Grok 4.6 solo se mantiene por debajo de 200K tokens. Si cruzas esa línea — algo que un agente con una base de código grande hace a diario — la tarifa se duplica a $4/$12, aplicada a la solicitud completa, no solo al excedente. Kimi K3 cobra más por token de salida, pero su contexto completo de 1M no tiene recargo. Así que el modelo más barato cambia según la duración de tus prompts. Las llamadas cortas y de alta frecuencia favorecen a Grok; el trabajo con documentos largos o a escala de repositorio reduce la diferencia y puede invertirla.
Inteligencia y trabajo de conocimiento
En el Índice de Inteligencia compuesto de Artificial Analysis — nueve benchmarks comprimidos en una sola cifra — Grok 4.6 obtiene 61 y Kimi K3 se sitúa unos puntos por debajo. Señalaría dos cosas sobre esa brecha. Primero, el número exacto de Kimi varía según la fuente: Artificial Analysis reporta 57, algunas coberturas de lanzamiento citan 60, y el propio gráfico de xAI solo dice "más alto que Kimi". Me anclo a la cifra de Artificial Analysis porque es la única ejecución neutral, pero una diferencia de uno a cuatro puntos en un compuesto de nueve benchmarks está dentro del ruido de cómo ponderas los componentes. Segundo — y esto importa más — una puntuación compuesta mide la calidad de una respuesta. Apenas mide si un modelo puede mantener un objetivo a lo largo de cuarenta llamadas a herramientas sin perder el hilo. Ese modo de fallo es el que realmente mata los despliegues de agentes, y el número de índice de ninguno de los dos proveedores lo predice.
Donde realmente divergen es en la eficiencia agéntica. En la carga de trabajo privada AA-Briefcase de Artificial Analysis, Grok 4.6 termina en unos 53 turnos y aproximadamente 0.5 mil millones de tokens de entrada. Para que te hagas una idea: Claude Opus 5 necesita alrededor de 103 turnos y 2.0 mil millones de tokens en la misma tarea. Ese es el beneficio concreto del "autoevaluación en trayectorias largas" de xAI — el modelo comprueba su propio trabajo antes de dar el siguiente paso, por lo que itera menos. Kimi K3 es competitivo en el resultado del trabajo de conocimiento largo (aterriza en el nivel Fable 5 en el Elo de AA-Briefcase, ~1548), pero no anuncia la misma disciplina de conteo de turnos. Si tu factura crece con las llamadas a herramientas — y en agentes de producción, así es — esta es una diferencia real y medible, no una línea de marketing.
La conclusión en palabras simples: están más o menos igualados en lo inteligentes que son las respuestas, pero Grok 4.6 llega allí en menos pasos.
Programación: depende de qué tipo de programación
Aquí es donde un ganador único se desmorona, así que estos son los detalles. Kimi K3 lidera en varios conjuntos de programación: SWE Marathon (42.0 frente a puntuaciones de referencia de frontera de 35–40), Program Bench (77.8, superando por poco los 77.6 de GPT-5.6 Sol), y se sitúa a menos de medio punto de la cima en Terminal-Bench 2.1 con 88.3 (seguido en el Índice de Agentes de Codificación de Artificial Analysis). En el benchmark de navegación web BrowseComp encabeza el campo con 91.2. Grok 4.6, por su parte, registró 88.4% en Terminal-Bench v2.1 y un Elo de 1753 en GDPval-AA v2 — y sus mejoras más pronunciadas sobre Grok 4.5 aparecen en CursorBench 3.2 (69.9% frente a 66.7%) y Terminal-Bench v3.0 (26% frente a 15.7%).
Más allá de los números, emerge un patrón. La fortaleza de programación de Kimi K3 es amplia y con forma de repositorio: navega por bases de código grandes, depura a partir de logs y capturas de pantalla, y su ventana de 1M le permite mantener un proyecto completo en contexto. La fortaleza de programación de Grok 4.6 tiene forma de trayectoria: se ajustó dentro de Cursor y Grok Build con sesiones reales de desarrolladores, por lo que destaca en mantener una tarea de programación — convertir una idea vaga en una primera versión funcional y refinarla a lo largo de muchos pasos. El costo, y aquí todo modelo tiene uno: la ventana de 500K de Grok limita cuánto de un monorepo puede ver de una vez, y no puede admitir retroalimentación en video. La ventaja de Kimi en benchmarks de programación puros viene acompañada de una factura más alta de tokens de salida y, según la propia nota de lanzamiento de Moonshot, de una tasa de alucinación que aumentó junto con las ganancias de precisión.
Para trabajo de frontend e interactivo en particular — una variante común de esta búsqueda — Kimi K3 encabezó el Frontend Code Arena de LMArena en su lanzamiento, mientras que Grok 4.6 aterrizó cerca de GPT-5.6 Sol y Claude Fable en las tareas de desarrollo web de Code Arena. Ambos son sólidos; Kimi tiene hoy la señal independiente más clara en frontend.
Contexto, multimodalidad y despliegue
Aquí los dos modelos no compiten en un espectro — están construidos de manera diferente. Kimi K3 te ofrece una ventana de contexto de 1,048,576 tokens y entrada nativa para texto, imágenes, y video, desde una única arquitectura. Esa combinación es la razón para elegirlo: un agente de programación que lee capturas de pantalla para refinar una interfaz, un flujo de investigación que mantiene residente un corpus de documentos completo, un sistema de control de calidad que compara el video de la interfaz con la implementación. Grok 4.6 ofrece 500K tokens y entrada de texto más imagen. Suficiente para la mayoría del trabajo, pero si tu tarea es "analiza esta grabación de pantalla de 40 minutos" o "mantén estos 300 archivos en un solo prompt", Grok no es la herramienta.
Luego está la cuestión de la propiedad, que es binaria. Grok 4.6 es solo alojado; no hay nada que descargar, y xAI puede modificar o deprecar el endpoint bajo tus pies. Kimi K3 viene con pesos abiertos bajo una licencia personalizada Kimi K3 — puedes autoalojarlos, ajustarlos y cuantizarlos. Para equipos con reglas de residencia de datos, requisitos de aislamiento (air-gap) o una política contra la dependencia del proveedor, eso es decisivo. La advertencia honesta: con precisión nativa de 4 bits, los pesos necesitan aproximadamente 1.4 TB residentes antes de cualquier caché KV, lo que supera un nodo único de 8 GPUs. "Abierto" aquí significa legal y técnicamente disponible para quienes tienen hardware serio, no "corre en tu portátil". Para todos los demás, el camino práctico hacia Kimi K3 es igualmente una API alojada.
Cuándo elegir cada uno
Sin términos medios. Esta es la decisión según la carga de trabajo.
Elige Kimi K3 si alguna de estas situaciones te describe: necesitas introducir un repositorio completo, un conjunto largo de documentos o video en una sola ventana de contexto; estás haciendo programación frontend o interactiva donde se nota su ventaja en LMArena; tienes una razón de cumplimiento o de dependencia para conservar los pesos; o quieres multimodalidad nativa sin añadir un modelo de visión separado. Pagarás más por token de salida — presupuesta eso en generación de texto de alto volumen.
Elige Grok 4.6 si: ejecutas agentes autónomos de largo horizonte y te importa terminar en menos turnos y con menos tokens; tus prompts se mantienen por debajo de 200K para obtener la tarifa limpia de $2/$6 (lista); quieres un endpoint gestionado con cero infraestructura; o eres sensible al costo en escenarios de alta frecuencia. Ojo con el nivel de contexto largo: si superas los 200K, toda la solicitud se factura al doble.
El empate en el costo por tarea es el punto. No estás eligiendo un modelo más barato. Estás eligiendo entre eficiencia de turnos alojada y multimodalidad abierta de contexto largo. Adecúa eso a tu carga de trabajo, no a la diferencia de un punto en el índice.
Ejecuta ambos con una sola clave en GPT Proto
La forma más rápida de resolver un argumento de "cuál es mejor para mi tarea" es ejecutar tu propia tarea en ambos. GPT Proto expone Kimi K3 y Grok 4.6 a través de un único endpoint compatible con OpenAI y un solo saldo, para que puedas compararlos A/B sin financiar dos cuentas. Ten en cuenta el encabezado de autenticación: la superficie /v1/ de GPT Proto acepta la clave cruda sin ningún prefijo Bearer.
Python:
import openai
client = openai.OpenAI(
api_key="YOUR_GPTPROTO_API_KEY",
base_url="https://gptproto.com/v1",
)
prompt = "Refactor this function for readability and explain each change:\n\n<paste code>"
for model in ["kimi-k3", "grok-4.6"]:
resp = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": prompt}],
)
print(f"=== {model} ===")
print(resp.choices[0].message.content)
print("tokens:", resp.usage.total_tokens)
cURL, primera llamada:
curl https://gptproto.com/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: YOUR_GPTPROTO_API_KEY" \
-d '{
"model": "kimi-k3",
"messages": [
{"role": "user", "content": "Summarize the tradeoffs between MoE and dense LLMs in 3 bullets."}
]
}'
Dos cosas específicas de Kimi K3 que un simple cambio de nombre de modelo pasará por alto. Siempre razona — establece reasoning_effort en low, high o max (por defecto max) en el nivel superior, no en la configuración anterior thinking. Y en bucles de varios turnos o de herramientas, devuelve el mensaje completo del asistente anterior, incluyendo reasoning_content, o romperás la continuidad del razonamiento en sesiones largas. Extrae tu respuesta final desde content, nunca desde reasoning_content.
Detalles completos del modelo y precios actuales: Kimi K3 en GPT Proto y Grok 4.6 en GPT Proto.