La API de Kimi K3 ofrece a los desarrolladores acceso alojado al modelo insignia de Moonshot AI para programación de largo alcance, análisis multimodal, uso de herramientas y trabajo de conocimiento de principio a fin. Lanzado el 16 de julio de 2026, K3 es un modelo Mixture-of-Experts de 2,8 billones de parámetros. Activa 16 de 896 expertos por token y combina Kimi Delta Attention, Attention Residuals y Stable LatentMoE para procesar secuencias largas de forma más eficiente que un modelo denso de tamaño total similar.
K3 acepta entradas de texto, imagen y vídeo, y devuelve texto. Su ventana de contexto de 1M de tokens está pensada para cargas de trabajo que no pueden reducirse a un prompt corto: programación a escala de repositorio, análisis de varios documentos, historiales extensos de uso de herramientas y ciclos de retroalimentación visual. El modelo siempre razona. Los desarrolladores pueden establecer reasoning_effort en low, high o max, siendo max la opción predeterminada, en lugar de activar y desactivar el razonamiento.
GPTProto añade una capa de acceso diferente alrededor del modelo. Una clave de API y un saldo de Kimi K3 también pueden utilizarse en más de 200 modelos de texto, imagen, vídeo y audio. La tarifa que se muestra en esta página es de 2,70 $ por 1M de tokens de entrada y 13,50 $ por 1M de tokens de salida, un 10 % inferior al precio de lista actual de Moonshot 3/15. Esto facilita probar K3 junto a GPT-5.6 Sol, Claude Fable 5, GLM-5.2 u otros modelos sin abrir y financiar una cuenta de proveedor independiente para cada experimento.
| Especificación | Kimi K3 |
|---|---|
| Proveedor | Moonshot AI |
| Fecha de lanzamiento | 16 de julio de 2026 |
| Clase de modelo | Mixture-of-Experts de 2,8T parámetros |
| Expertos activos | 16 de 896 por token |
| Arquitectura | Kimi Delta Attention, Attention Residuals, Stable LatentMoE |
| Entrada | Texto, imagen y vídeo |
| Salida | Texto |
| Ventana de contexto | 1.048.576 tokens |
| Límite de finalización | 131.072 tokens de forma predeterminada; configurable hasta 1.048.576 dentro del presupuesto de contexto total |
| Razonamiento | Siempre activado; low, high o max como nivel de esfuerzo |
| Funciones de la API | Streaming, llamadas a herramientas, tool_choice, herramientas dinámicas, modo JSON, JSON Schema estricto y Partial Mode |
Aplicaciones de la API de Kimi K3
K3 resulta más útil cuando una tarea combina un gran conjunto de trabajo con acciones repetidas. Un agente de programación puede inspeccionar un repositorio, editar varios archivos, ejecutar pruebas, leer registros y utilizar capturas de pantalla para perfeccionar un frontend o un juego. Un flujo de investigación puede mantener un corpus documental extenso en el contexto, llamar a herramientas externas y devolver un resultado que siga un JSON Schema estricto. Un sistema de control de calidad multimodal puede comparar capturas de pantalla de una interfaz con los detalles de implementación, mientras que un flujo de vídeo puede analizar material subido y devolver notas de escenas, resúmenes o metadatos estructurados.
El modelo resulta menos convincente para clasificaciones breves, chats sencillos o extracciones de gran volumen en las que un modelo más pequeño ya alcanza el umbral de calidad. K3 siempre razona, por lo que incluso su nivel de esfuerzo más bajo debe evaluarse en cuanto a latencia y coste de tokens de salida. Empieza con un flujo de trabajo representativo, mide la finalización de la tarea en lugar de una sola respuesta y compara K3 con un modelo más pequeño antes de dirigirle todo el tráfico.
Detalles de la API que debes comprobar antes de migrar
K3 funciona con el SDK de OpenAI y el formato de solicitud de Chat Completions, pero tiene comportamientos específicos del modelo que un simple cambio de nombre puede pasar por alto.
En primer lugar, el razonamiento preservado siempre está activado. En conversaciones de varios turnos y ciclos de herramientas, devuelve el mensaje completo del asistente de la respuesta anterior, incluido reasoning_content y tool_calls. Conservar únicamente el content visible puede interrumpir la continuidad del razonamiento y desestabilizar las sesiones largas. El razonamiento histórico también consume contexto y se factura como uso de tokens, así que compacta el trabajo completado en lugar de conservar cada turno indefinidamente.
En segundo lugar, utiliza el campo de nivel superior reasoning_effort en lugar de la configuración thinking anterior de K2.x. K3 admite low, high y max. Sus valores de muestreo son fijos, por lo que las aplicaciones no deben depender de ajustes personalizados de temperatura o penalización.
En tercer lugar, analiza los resultados estructurados desde el campo content final, no desde reasoning_content. K3 admite el modo JSON y JSON Schema estricto mediante response_format, lo que resulta útil para canalizaciones de extracción, argumentos de herramientas y resultados de investigación legibles por máquinas.
Por último, las solicitudes multimodales necesitan partes de contenido estructuradas. La interfaz nativa de Moonshot acepta imágenes en base64 o referencias a archivos subidos, en lugar de URL públicas de imágenes. Confirma la documentación actual de GPTProto para conocer los campos exactos de imagen y vídeo que expone este endpoint antes de implementar un flujo multimodal.
¿Cuándo deberías elegir Kimi K3?
La propia publicación de lanzamiento de Moonshot afirma que K3 todavía está por detrás de Claude Fable 5 y GPT-5.6 Sol en rendimiento general. El motivo para elegir K3 no es afirmar que gane en todos los benchmarks. Su argumento más sólido es la combinación de una ventana de contexto de 1M, comprensión nativa de vídeo, programación de largo alcance y un precio por token considerablemente inferior.
| Factor de decisión | Kimi K3 | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Precio oficial de lista de la API por 1M de tokens | 3 $ de entrada / 15 $ de salida | 5 $ de entrada / 30 $ de salida | 10 $ de entrada / 50 $ de salida |
| Ventana de contexto | 1.048.576 | 1.050.000 | 1.000.000 |
| Salida máxima | Hasta 1.048.576 dentro del contexto; 131.072 de forma predeterminada | 128.000 | 128.000 |
| Entradas nativas | Texto, imagen, vídeo | Texto, imagen | Texto, imagen |
| Acceso al modelo |
API alojada; los pesos oficiales del modelo se publican por separado a través de Moonshot AI |
API cerrada | API cerrada |
| Mejor opción para | Programación con atención a los costes, agentes multimodales y grandes conjuntos de trabajo | Programación de máximo nivel, uso del ordenador y flujos de trabajo con herramientas de OpenAI | Agentes de larga ejecución, visión compleja y trabajo de conocimiento premium |
Elige K3 cuando su menor coste de API, su entrada de vídeo nativa o su ventana de contexto de 1M de tokens sean más importantes que ganar en el conjunto más amplio de evaluaciones de vanguardia. Elige GPT-5.6 Sol o Claude Fable 5 cuando tu propia evaluación a nivel de tarea demuestre que la mayor tasa de finalización compensa su precio por token más elevado. Para consultar una comparación benchmark por benchmark, lee Qué es Kimi K3—y ¿realmente está cerca de GPT-5.6 y Fable 5?.











