¿Qué es Kimi K3?
Kimi K3 es el nuevo modelo insignia multimodal de razonamiento de Moonshot AI. Está diseñado para trabajos que pueden requerir horas de programación, investigación, uso de herramientas y revisión, no solo para responder a una pregunta de chat.
El modelo se lanzó el 16 de julio de 2026 en Kimi.com, Kimi Work, Kimi Code y la API de Kimi. Cuenta con 2,8 billones de parámetros totales, una ventana de contexto de un millón de tokens y compatibilidad nativa con entradas de texto, imagen y vídeo. Su salida sigue siendo texto.
En su interior, K3 utiliza una arquitectura de mezcla de expertos con 896 expertos, de los cuales 16 se activan simultáneamente. Moonshot también introdujo Kimi Delta Attention, Attention Residuals y Stable LatentMoE para mejorar el movimiento de la información a través de secuencias largas y capas profundas del modelo. Moonshot afirma que estos cambios producen aproximadamente 2,5 veces la eficiencia de escalado de Kimi K2, aunque esa cifra procede del desarrollador y no de una prueba independiente. El blog técnico de Kimi K3 de Moonshot proporciona los detalles actuales de la arquitectura; todavía está pendiente un informe técnico más completo.
| Especificación |
Kimi K3 |
| Desarrollador |
Moonshot AI |
| Lanzamiento público |
16 de julio de 2026 |
| Parámetros totales / activados |
2,8T / 104B |
| Arquitectura |
Mezcla de expertos |
| Expertos |
896 en total, 16 activos |
| Ventana de contexto |
1 millón de tokens |
| Entradas |
Texto, imagen y vídeo |
| Salida |
Texto |
| Cadena del modelo de API |
kimi-k3 |
| Modo de razonamiento |
Siempre activado |
| Disponibilidad de los pesos |
Pesos completos publicados en `moonshotai/Kimi-K3 |
Esto convierte a K3 en uno de los mayores modelos de IA anunciados hasta la fecha. Sin embargo, el tamaño por sí solo no es lo más útil. La verdadera pregunta es si Moonshot ha convertido esos parámetros en una mejor finalización de tareas.
El lanzamiento también elimina una incertidumbre de la cobertura inicial: el informe técnico ya es público. Esto no elimina la necesidad de una evaluación independiente ni convierte un modelo de 2,8T en un proyecto sencillo de alojar por cuenta propia.
¿Está Kimi K3 realmente cerca de GPT-5.6 y Claude Fable 5?
En inteligencia general, no del todo. En varias tareas agénticas y de largo recorrido, sí.
El anuncio de Moonshot es más moderado que muchos de los titulares que generó. La empresa afirma que el rendimiento general de K3 todavía está por detrás de Claude Fable 5 y GPT-5.6 Sol. Aun así, informa de resultados de nivel frontera en programación, trabajo del conocimiento y razonamiento.
Un ejemplo es la optimización de kernels de GPU. Moonshot colocó cada modelo en un sandbox idéntico y le concedió hasta 24 horas para optimizar cuatro tareas de GPU. K3 compitió con Fable 5 y superó a GPT-5.6 Sol, GPT-5.5 y Opus 4.8 en esta prueba. Es un resultado importante para la ingeniería de rendimiento de bajo nivel, pero no demuestra que K3 sea universalmente más inteligente.
Las pruebas independientes ofrecen una perspectiva más amplia. Artificial Analysis puntuó a Kimi K3 con 57 en su Intelligence Index, situándolo cerca de GPT-5.5 y Claude Opus 4.8, pero por detrás de Fable 5 y GPT-5.6 Sol. Sus mejores resultados aparecieron en ejecución agéntica y automatización, no en todas las categorías de inteligencia. Artificial Analysis publicó sus resultados sobre K3 el 16 de julio.
| Evaluación |
Resultado de Kimi K3 |
Qué nos indica |
| Índice de inteligencia de AA |
57 |
Cerca de GPT-5.5 y Opus 4.8; por detrás de GPT-5.6 Sol y Fable 5 |
| GDPval-AA v2 |
1.668 Elo |
Ejecución sólida en tareas agénticas del mundo real |
| AutomationBench-AA |
53 %, primer puesto |
Especialmente eficaz en la automatización de flujos de trabajo SaaS |
| AA-Briefcase |
1.547 Elo, segundo puesto |
Sólido trabajo del conocimiento de largo recorrido |
| Precisión de omnisciencia |
46 % |
Por encima del 33 % de K2.6 |
| Tasa de alucinaciones |
51 % |
Peor que el 39 % de K2.6 |
La última fila fue la que me hizo detenerme. K3 se volvió más capaz, pero Artificial Analysis también midió más alucinaciones. Respondió correctamente a más preguntas, aunque produjo una proporción mayor de afirmaciones sin respaldo.
Ese equilibrio importa en producción. Un modelo que completa un flujo de trabajo agéntico largo, pero introduce silenciosamente una suposición incorrecta, puede costar más de verificar que un modelo más lento con un comportamiento factual más estable.
Por qué un solo ranking no puede resolver la comparación
K3 ya ha alcanzado la parte superior de al menos un ranking de generación de interfaces. También funciona bien en optimización de GPU, automatización SaaS y trabajo del conocimiento de largo recorrido. Esos resultados no miden la misma capacidad.
Un arena de frontend mide qué interfaces generadas prefieren los usuarios. AutomationBench mide si un agente puede operar flujos de software. La optimización de kernels de GPU prueba la ingeniería de sistemas de bajo nivel. Ninguna de estas pruebas puede responder por sí sola si K3 es mejor en investigación, recuperación factual, depuración, diseño de presentaciones o razonamiento general.
La conclusión defendible es más limitada: Kimi K3 ha entrado en el grupo frontera para el trabajo agéntico, pero GPT-5.6 Sol y Fable 5 siguen liderando la comparación general. Los desarrolladores que busquen el techo actual de los modelos cerrados pueden examinar la API de GPT-5.6 Sol, mientras que Claude Opus 4.8 sigue siendo una opción más consolidada para flujos complejos de programación e investigación.
La cuestión de los pesos abiertos está resuelta; la cuestión de la implementación, no
La pregunta durante la semana del lanzamiento era si Moonshot publicaría realmente los pesos. Lo ha hecho. El repositorio oficial moonshotai/Kimi-K3 contiene ahora el checkpoint completo, la ficha del modelo, el informe técnico, el código de inferencia y la licencia Kimi K3.
La formulación exacta sigue siendo importante. Kimi K3 tiene pesos abiertos, no es un lanzamiento sin matices de «código completamente abierto». Su licencia personalizada permite un uso, modificación, ajuste fino, implementación y redistribución amplios, pero añade condiciones para grandes empresas Model-as-a-Service y productos comerciales de gran escala. Los datos de entrenamiento no son públicos.
La disponibilidad tampoco equivale a usabilidad. El repositorio ocupa aproximadamente 1,56 TB y Moonshot recomienda implementaciones en supernodos con 64 aceleradores o más. Esto hace que K3 sea relevante para equipos de infraestructura cloud y empresarial, no una descarga habitual para una estación de trabajo.
El lanzamiento sigue siendo importante. Las organizaciones ahora tienen una vía real para inspeccionar el checkpoint, personalizar la inferencia, ajustar derivados y operar el modelo sin depender completamente de un único endpoint alojado. El precio es hardware, ingeniería de servicio y revisión de la licencia.
¿Qué cambió de Kimi K2.7 a Kimi K3?
K3 no es simplemente Kimi K2.7 con un número de versión mayor.
Kimi K2.7 Code es un modelo agéntico centrado en programación y basado en K2.6. Su ficha destaca la ingeniería de software del mundo real, las sesiones largas de programación, el uso de herramientas y un menor consumo de tokens de razonamiento. K3 amplía ese papel para convertirse en un modelo insignia general que cubre programación, razonamiento visual, investigación y trabajo del conocimiento de principio a fin.
La ventana de contexto crece de 256K a un millón de tokens. Los parámetros totales aumentan de un billón a 2,8 billones, mientras que el número de expertos pasa de 384 a 896. El precio también aumenta.
| Característica |
Kimi K3 |
Kimi K2.7 Code |
| Posicionamiento |
Modelo insignia general |
Modelo centrado en programación |
| Parámetros totales |
2,8T |
1T |
| Expertos |
896, 16 activos |
384, 8 activos |
| Ventana de contexto |
1M |
256K |
| Entrada estándar |
$3.00/MTok |
$0.95/MTok |
| Salida |
$15.00/MTok |
$4.00/MTok |
| Entrada almacenada en caché |
$0.30/MTok |
$0.19/MTok |
| Pesos |
Disponibles bajo la licencia Kimi K3 |
Disponibles |
Por tanto, la propuesta de valor de K3 no es «inteligencia de frontera por casi nada». Es un rendimiento agéntico cercano a la frontera con dos vías de implementación: una API de pago por uso inmediato y pesos publicados para equipos preparados para asumir la infraestructura.
La ficha oficial del modelo K2.7 Code contiene su arquitectura, metodología de benchmarks y orientación para la implementación.
Cómo gestiona Kimi K3 un contexto de 1 millón de tokens
Una ventana de contexto de un millón de tokens permite a K3 aceptar bases de código grandes, colecciones de documentos técnicos, historiales de agentes extensos y resultados intermedios de herramientas en una sola solicitud.
Esto es especialmente relevante para los agentes de larga duración. Un modelo de programación puede necesitar conservar una especificación inicial, la estructura del repositorio, la salida del terminal, los fallos de las pruebas, ediciones anteriores y comentarios de los revisores durante decenas de pasos. Perder una de esas restricciones a mitad de la tarea es una razón habitual por la que un agente parece productivo, pero no consigue terminar.
K3 también aplica almacenamiento automático del contexto en caché. Los desarrolladores no necesitan crear un ID de caché ni establecer un valor independiente de tiempo de vida. Si un prefijo largo permanece sin cambios entre solicitudes, el sistema intenta automáticamente encontrar una coincidencia en caché. La entrada almacenada en caché cuesta 0,30 $ por millón de tokens en lugar de 3,00 $.
Pero la capacidad de contexto no equivale a un uso perfecto del contexto. Introducir un millón de tokens no garantiza que el modelo asigne la importancia correcta a cada línea. Las entradas más largas también pueden aumentar el coste, el tiempo de procesamiento y la distracción causada por material irrelevante.
El enfoque sensato sigue siendo recuperar primero los archivos más relevantes, mantener al principio el contenido de referencia estable para aprovechar la caché y evitar enviar toda la base de conocimientos solo porque el límite lo permite. La guía de API de Kimi explica su contexto de un millón de tokens y el comportamiento de almacenamiento automático en caché.
El precio de la API de Kimi K3 ya no es económico
La API oficial de Kimi K3 de Moonshot utiliza precios fijos de pago por uso. La tarifa no cambia cuando una solicitud cruza un nivel de contexto mayor.
| Tipo de token |
Precio por 1 millón de tokens |
| Entrada almacenada en caché |
$0.30 |
| Entrada estándar |
$3.00 |
| Salida |
$15.00 |
Para una tarea agéntica corta que utilice 100.000 tokens de entrada sin caché y produzca 20.000 tokens de salida, el coste estimado del modelo es:
(0.1 × $3) + (0.02 × $15) = $0.60
Ahora considera un flujo de trabajo repetido con contexto largo, 800.000 tokens almacenados en caché, 50.000 tokens nuevos de entrada y 50.000 tokens de salida:
(0.8 × $0.30) + (0.05 × $3) + (0.05 × $15) = $1.14
La caché mantiene manejable el segundo ejemplo, pero K3 claramente ya no sigue la antigua fórmula de «modelo chino equivale a API extremadamente barata».
Artificial Analysis midió un coste medio por tarea del Intelligence Index de 0,94 $ para K3, cercano a los 1,04 $ de GPT-5.6 Sol y aproximadamente la mitad de los 1,80 $ de Opus 4.8. GLM-5.2 completó la misma carga de evaluación por bastante menos.
La comparación también cambia según dónde se acceda a los modelos. La API de Kimi K3 en GPT Proto cuesta actualmente 2,70 $ por millón de tokens de entrada y 13,50 $ por millón de tokens de salida, un 10 % menos que la tarifa publicada de 3/15 $ de Moonshot. GPT Proto también ofrece GPT-5.6 Sol y GLM-5.2 mediante la misma clave de API y saldo compartido, lo que facilita las comparaciones por tarea sin cuentas separadas de proveedores.
La propuesta de valor de K3 no es, por tanto, «inteligencia de frontera por casi nada». Es un rendimiento agéntico cercano a la frontera con dos vías de implementación: una API de pago por uso inmediato y pesos publicados para equipos preparados para asumir la infraestructura.
API de Kimi K3 frente a pesos abiertos: ¿cuál deberías usar?
Kimi K3 ofrece ahora a los desarrolladores una verdadera elección de implementación. La capacidad del modelo es el atractivo en ambas vías; el modelo operativo es completamente distinto.
| API de Kimi K3 alojada |
Pesos abiertos de Kimi K3 |
| Paga por token |
Compra o alquila capacidad de aceleración |
| El proveedor gestiona el escalado, la caché, las actualizaciones y los fallos |
Tu equipo gestiona el servicio, el escalado, la supervisión, las actualizaciones y los fallos |
| La vía más rápida para evaluar y poner en producción |
El mayor control sobre los datos, la inferencia y la modificación del modelo |
| El servicio alojado documenta entradas de texto, imagen y vídeo |
Los metadatos actuales del repositorio público se centran en texto e imagen; verifica la paridad de la vía de vídeo antes de prometerla |
| Sin descarga de 1,56 TB |
Aproximadamente 1,56 TB en 96 fragmentos de pesos |
| Sin proyecto de implementación en clúster |
Moonshot recomienda más de 64 aceleradores |
Usa primero la API si todavía estás validando el ajuste producto-mercado, el tráfico es variable o el equipo aún no opera infraestructura de modelos grandes. La API de Kimi K3 de GPT Proto también facilita comparar K3 con GPT-5.6 Sol, GLM-5.2 y otros modelos usando una sola clave y saldo.
Usa los pesos cuando la implementación privada, el ajuste fino, la inferencia personalizada o la independencia del proveedor tengan suficiente valor empresarial para justificar el clúster. Antes de una implementación comercial, revisa la licencia Kimi K3 en lugar de asumir que «abierto» significa MIT.
Kimi K3 frente a GLM-5.2, GPT-5.6 y Opus 4.8
El ganador del benchmark no es automáticamente el modelo de producción adecuado. La elección útil depende de lo que pueda fallar, de la duración del flujo de trabajo y de si importa poseer los pesos.
| Modelo |
Elígelo cuando |
| Kimi K3 |
Necesitas flujos agénticos multimodales de largo recorrido y quieres una API alojada ahora o una vía de implementación con pesos abiertos bajo la licencia Kimi K3 |
| GPT-5.6 Sol |
La calidad del razonamiento general y un rendimiento fiable en producción importan más que la propiedad |
| Claude Fable 5 |
Buscas el techo medido más alto en trabajo del conocimiento agéntico y tienes acceso a él |
| Claude Opus 4.8 |
Ya dependes de flujos de Claude para programación compleja, investigación y seguimiento cuidadoso de instrucciones |
| GLM-5.2 |
Necesitas programación agéntica de menor coste con pesos ya disponibles |
| Kimi K2.7 Code |
Tu carga de trabajo es principalmente de programación y el precio más alto de K3 es difícil de justificar |
K3 presenta el caso más claro cuando coinciden tres condiciones: una tarea de larga duración, entradas multimodales y una razón para controlar la implementación del modelo. Sin esos requisitos, su escala puede convertirse en una respuesta costosa para un problema menor.
GPT-5.6 Sol sigue siendo la opción más sólida cuando la inteligencia general y la fiabilidad son prioritarias. Opus 4.8 tiene sentido para equipos con flujos maduros de programación o investigación basados en Claude. GLM-5.2 es el competidor más difícil en términos económicos porque ya ofrece un contexto de un millón de tokens y pesos abiertos con un coste por tarea inferior.
Mi regla general actual es sencilla: elige K3 cuando importen los pesos abiertos y los agentes multimodales de largo recorrido. Elige GPT-5.6 u Opus cuando la fiabilidad importe más que la propiedad del modelo. Elige GLM-5.2 cuando el coste sea la restricción que no puedes negociar.
¿Ya puedes usar Kimi K3 a través de GPT Proto?
Sí. Kimi K3 ya está disponible mediante la API de Kimi K3 de GPT Proto.
La tarifa actual de GPT Proto es de 2,70 $ por millón de tokens de entrada y 13,50 $ por millón de tokens de salida, un 10 % menos que el precio publicado actual de 3/15 $ de Moonshot. Usa la cadena de modelo kimi-k3 con tu clave de API de GPT Proto para acceder a las capacidades de programación con contexto largo, análisis multimodal, llamadas a herramientas y salida estructurada de K3.
La misma clave y el mismo saldo compartido también cubren GPT-5.6 Sol, GLM-5.2, Claude Opus 4.8 y más de 200 modelos de texto, imagen, vídeo y audio. Esto facilita probar K3 frente a alternativas en el mismo repositorio o flujo de trabajo agéntico antes de cambiar el tráfico de producción.
Puedes probar Kimi K3 en GPT Proto o explorar la galería completa de modelos de IA de GPT Proto. Los pesos y el informe técnico del modelo ya son públicos, pero el artículo debería revisarse de nuevo a medida que maduren las pruebas independientes de implementación, las cuantizaciones, los datos de rendimiento y la compatibilidad con frameworks.
Veredicto final: está cerca, pero el benchmark sigue importando
Kimi K3 no es simplemente un gran modelo chino que atrae atención por su número de parámetros. Las pruebas independientes respaldan una conclusión más importante: compite con los sistemas frontera en automatización, trabajo del conocimiento de largo recorrido y ejecución agéntica.
Eso no lo hace mejor que GPT-5.6 Sol o Claude Fable 5 en general. Tampoco elimina el aumento medido de las alucinaciones. Lo que cambió el 28 de julio fue la implementación: los pesos prometidos, la licencia, la ficha del modelo y el informe técnico ya son públicos.
K3 es, por tanto, una de las opciones con pesos abiertos más capaces de su clase, pero la frase necesita dos notas al pie. Su licencia es personalizada, no MIT, y su repositorio de 1,56 TB, junto con la recomendación de más de 64 aceleradores, sitúa el alojamiento propio fuera del alcance de un equipo de desarrollo convencional.
Mi veredicto: usa la API para averiguar si K3 mejora realmente tus tareas. Pásate a los pesos solo cuando el control, la personalización o los límites de los datos justifiquen convertirte tú mismo en el proveedor de infraestructura.