Actualización — 28 de julio de 2026: Moonshot AI ya ha publicado los pesos completos de Kimi K3, la tarjeta del modelo, la licencia personalizada y el informe técnico. El lanzamiento resuelve la cuestión de disponibilidad por parte de Kimi. Sin embargo, no hace que un modelo de 2,8 billones de parámetros sea fácil de alojar por cuenta propia: el repositorio oficial ocupa aproximadamente 1,56 TB y Moonshot recomienda implementaciones en supernodos con 64 aceleradores o más.
Qwen 3.8 Max frente a Kimi K3 parece un enfrentamiento claro entre dos enormes modelos de IA chinos: la versión preliminar de 2,4 billones de parámetros de Alibaba frente al modelo insignia de 2,8 billones de parámetros de Moonshot AI. Las cifras invitan a una conclusión sencilla. El modelo más grande debería ganar.
Eso no es lo que muestran las pruebas disponibles, ni es la comparación más útil para los desarrolladores.
A 23 de julio de 2026, Qwen 3.8 Max sigue siendo una versión preliminar en evolución distribuida mediante el Token Plan de Alibaba. Kimi K3 ya cuenta con una API documentada, precios de tokens publicados, una ventana de contexto de 1 millón de tokens y un plan fechado para publicar sus pesos completos. La diferencia de capacidades puede ser estrecha. La diferencia en preparación del producto no lo es.
Mi conclusión es directa: Kimi K3 es la opción más segura si necesitas crear y presupuestar una aplicación real hoy. Qwen 3.8 Max Preview merece la pena probarlo dentro de un flujo de trabajo de programación, especialmente mientras los Credits promocionales de Alibaba hacen que experimentar sea económico, pero todavía no ha proporcionado suficiente información estable para ganar una decisión de producción.
En resumen: Kimi K3 es la opción de producción más segura hoy
Elige Kimi K3 si necesitas una API convencional, costes predecibles por token, comprensión nativa de imágenes y vídeo, o un modelo que puedas incorporar ahora a un producto orientado al cliente. Elige Qwen 3.8 Max Preview si ya utilizas el ecosistema de programación de Alibaba y quieres probar un modelo nuevo y prometedor a un bajo coste promocional.
La única prueba detallada de programación comparativa disponible en el momento de la publicación dio a Kimi K3 una puntuación de 83 y a Qwen 3.8 Max una puntuación de 80. Esa diferencia de tres puntos es una evidencia útil, no una clasificación universal. Qwen mostró límites de sistema más claros y una ejecución impecable de las herramientas en la prueba; Kimi gestionó de forma más completa el historial de revisiones y la regeneración. Ambos también realizaron inferencias no respaldadas que requirieron correcciones fácticas.
En términos sencillos: Kimi gana actualmente la decisión de implementación. Qwen no ha perdido el concurso de capacidades; simplemente es demasiado pronto para declarar que ha ganado.
Qwen 3.8 Max frente a Kimi K3 de un vistazo
| Categoría |
Qwen 3.8 Max |
Kimi K3 |
| Estado del producto |
API de producción estable |
API de producción estable |
| Parámetros totales |
2.4T |
2.8T |
| Parámetros activos |
95B |
104B |
| Ventana de contexto |
Hasta 1 millón de tokens |
1.048.576 tokens |
| Entradas |
Texto, imágenes y vídeo |
Texto, imágenes y vídeo |
| Precio oficial de la API |
$2/M de entrada, $6/M de salida |
$3/M de entrada, $15/M de salida |
| Acceso mediante GPT Proto |
Disponible ahora |
Disponible ahora |
| Pesos abiertos |
Anunciados; todavía no se pueden descargar |
Publicados |
| Mejor opción para API alojada |
Programación multimodal sensible al coste y agentes de larga duración |
Agentes con muchas revisiones y flujos de trabajo específicos de Kimi |
| Mejor opción para alojamiento propio |
Esperar al checkpoint y la licencia |
Kimi K3, con hardware a escala de centro de datos |
La comparación ahora es más equilibrada, pero la implementación sigue siendo diferente
Qwen3.8-Max y Kimi K3 son ahora modelos de API de producción viables. La principal diferencia ya no es «Preview frente a producción». Ahora es valor de la API alojada frente a propiedad inmediata de los pesos abiertos.
Qwen 3.8 Max es ahora una API de producción estable
Alibaba publicó el modelo estable qwen3.8-max el 3 de agosto de 2026, sustituyendo el posicionamiento anterior de la etapa Preview por un acceso normal a la API con pago por uso.
El lanzamiento de producción documenta una arquitectura Sparse Mixture-of-Experts de 2,4 billones de parámetros, con aproximadamente 95.000 millones de parámetros activos por solicitud. Admite una ventana de contexto de hasta 1 millón de tokens, hasta 128.000 tokens de salida y entradas de texto, imagen y vídeo.
Esto cambia la comparación práctica. Qwen3.8-Max ya puede evaluarse para aplicaciones orientadas al cliente, agentes de programación, análisis multimodal y otras cargas de trabajo de producción sin depender del anterior Personal Token Plan basado en Credits.
Su precio oficial también es inferior al de Kimi K3:
| Modelo |
Precio de entrada |
Precio de salida |
| Qwen3.8-Max |
$2 por cada millón de tokens |
$6 por cada millón de tokens |
| Kimi K3 |
$3 por cada millón de tokens |
$15 por cada millón de tokens |
Para los equipos que utilizan una API alojada, Qwen3.8-Max en GPT Proto es ahora una opción de producción seria en lugar de un endpoint experimental.
Sin embargo, el checkpoint de pesos abiertos anunciado por Alibaba todavía no se ha publicado. Los desarrolladores no deben asumir que los pesos finales, la licencia o las condiciones de alojamiento propio están disponibles hasta que se publiquen oficialmente.
Kimi K3 ha publicado pesos descargables
Kimi K3 está disponible tanto mediante una API alojada como mediante un checkpoint descargable. Moonshot AI ha publicado los pesos del modelo, la tarjeta del modelo, el informe técnico, las instrucciones de implementación y la licencia personalizada.
Kimi K3 tiene 2,8 billones de parámetros totales y activa aproximadamente 104.000 millones de parámetros por token. Su documentación de implementación cubre frameworks como vLLM, SGLang y TokenSpeed, lo que proporciona a los equipos una ruta más clara hacia una infraestructura controlada o privada.
Esto convierte a Kimi K3 en la opción más práctica cuando los pesos descargables, el control de la implementación o el alojamiento propio inmediato son requisitos firmes.
Los pesos abiertos no hacen que Kimi K3 sea fácil ni barato de ejecutar localmente. Sigue siendo un modelo de varios billones de parámetros que requiere almacenamiento, memoria, redes y capacidad de aceleración a escala de centro de datos. Su licencia personalizada también puede imponer condiciones a productos comerciales muy grandes o implementaciones Model-as-a-Service.
Qué significa la diferencia de implementación
| Necesidad de implementación |
Mejor punto de partida |
Por qué |
| API de producción alojada |
Qwen 3.8 Max |
API estable con un precio oficial de tokens de salida considerablemente menor |
| Programación multimodal y análisis visual |
Qwen 3.8 Max |
Entradas nativas de texto, imagen y vídeo |
| Pesos descargables hoy |
Kimi K3 |
Su checkpoint y su licencia ya son públicos |
| Implementación privada o controlada |
Kimi K3 |
Los equipos pueden implementar el modelo publicado en su propia infraestructura |
| Instalación local sencilla |
Ninguno |
Ambos modelos requieren una infraestructura considerable para alojarlos por cuenta propia |
| Pruebas de API comparativas |
Probar ambos |
Comparar tareas aceptadas, reintentos, fallos de herramientas, latencia y coste total |
Por tanto, la comparación ya no es desigual porque Qwen sea «solo una Preview». Ambos modelos pueden atender cargas de trabajo de API de producción. La diferencia restante es más sencilla: Qwen3.8-Max ofrece actualmente una propuesta más sólida de coste y capacidades en API alojada, mientras que Kimi K3 ofrece acceso inmediato a pesos publicados y mayor control de implementación.
Cómo deberían probar los desarrolladores Qwen 3.8 Max frente a Kimi K3
| Prueba |
Proporcionar a ambos modelos |
Medir |
| Revisión de la arquitectura del repositorio |
El mismo commit congelado, pregunta de arquitectura, herramientas de solo lectura y límite de tiempo |
Citas correctas de archivos, dependencias omitidas, afirmaciones no respaldadas y tiempo de revisión |
| Implementación en varios archivos |
El mismo problema, pruebas, archivos modificables y permisos de herramientas |
Pruebas superadas, archivos modificados, reintentos, regresiones y correcciones humanas |
| Reparación visual del frontend |
La misma captura de pantalla, archivos fuente, herramientas del navegador y comportamiento objetivo |
Coincidencia visual, código válido, ciclos de reparación y resultado final de las pruebas |
Mantén idénticos el shell y los permisos del agente. Establece un límite de tiempo fijo. Registra el ID completo y la fecha del modelo, especialmente para la Preview cambiante de Qwen. Después, captura la finalización de la tarea, el tiempo real transcurrido, los tokens de entrada y salida, los aciertos de caché, las llamadas fallidas a herramientas, los reintentos, las intervenciones humanas y las pruebas finales superadas.
No puntúes una respuesta porque «parezca exhaustiva». Comprueba si el parche funciona y si las afirmaciones del modelo superan la revisión.
Para decisiones de arquitectura de gran valor, existe otro patrón útil: ejecuta ambos modelos de forma independiente, oculta sus identidades durante la revisión y compara sus desacuerdos. La prueba de 269 archivos produjo su diseño más sólido solo después de combinar los límites de sistema de Qwen con el modelo de ciclo de vida de Kimi. A veces, la respuesta correcta a Qwen frente a Kimi es ambos, seguida de verificación.
Precios de Qwen 3.8 Max frente a Kimi K3
| Modelo |
Precio oficial de entrada |
Precio oficial de salida |
| Qwen3.8-Max |
$2 por cada millón de tokens |
$6 por cada millón de tokens |
| Kimi K3 |
$3 por cada millón de tokens |
$15 por cada millón de tokens |
| Kimi K3 en GPT Proto |
$2,70 por cada millón de tokens |
$13,50 por cada millón de tokens |
Al precio oficial de lista, los tokens de salida de Qwen cuestan un 60 % menos que los de Kimi K3. Esa diferencia importa para los agentes de programación centrados en el razonamiento que generan planes extensos, trazas de herramientas, explicaciones y parches.
El precio de los tokens no representa el coste total. Mide los reintentos, las llamadas fallidas a herramientas, las correcciones humanas, la latencia y la finalización de tareas aceptada. Kimi aún puede ser más barato en un flujo de trabajo concreto si su mejor gestión de revisiones y ciclos de vida evita bucles de reparación costosos.
Consulta la página de la API de Qwen3.8-Max para conocer el precio actual de GPT Proto antes de calcular un presupuesto de producción.
¿Qué modelo deberías elegir?
| Situación |
Mejor opción |
Por qué |
| API de producción alojada |
Qwen 3.8 Max |
Acceso estable y un precio oficial de salida considerablemente menor |
| Programación multimodal compleja |
Qwen 3.8 Max |
Entradas de texto, imagen y vídeo, con un sólido posicionamiento para frontend y agentes visuales |
| Límites de arquitectura y disciplina con las herramientas |
Probar Qwen primero |
La Preview completó las 44 llamadas a herramientas de la prueba comparativa |
| Historial de revisiones y regeneraciones |
Probar Kimi primero |
Kimi gestionó de forma más completa el estado del ciclo de vida en la prueba comparativa |
| Pesos descargables hoy |
Kimi K3 |
El checkpoint completo y la licencia ya son públicos |
| Menor complejidad para alojar por cuenta propia |
Ninguno |
Ambos son modelos de varios billones de parámetros que requieren una infraestructura considerable |
| Una cuenta para pruebas comparativas |
Ambos mediante GPT Proto |
Ejecuta la misma tarea, con las mismas herramientas, configuración de razonamiento y criterios de evaluación |
Entradas multimodales, razonamiento y comportamiento de los agentes
| Capacidad |
Qwen 3.8 Max Preview |
Kimi K3 |
| Comprensión de imágenes |
Documentada |
Documentada |
| Comprensión de vídeo |
No está claramente documentada como entrada actual del modelo |
Documentada |
| Modo de razonamiento |
Siempre activado |
Siempre activado |
| Niveles de razonamiento |
low, high, xhigh |
low, high, max |
| Nivel de razonamiento predeterminado |
xhigh |
max |
| Ventana de contexto |
No se divulga claramente en la página actual del producto |
1.048.576 tokens |
| Salida estructurada |
Las capacidades de la Preview requieren verificación continua |
Modo JSON y JSON Schema estricto documentados |
| Historiales extensos de herramientas |
El comportamiento puede cambiar con la Preview |
Deben conservarse los mensajes completos del asistente, incluido el contenido del razonamiento |
La compatibilidad de visión documentada de Qwen lo hace relevante para la depuración basada en capturas de pantalla. Kimi va más allá al aceptar vídeo, algo útil cuando la entrada es una grabación de pantalla, una referencia de animación o una demostración de producto difícil de describir fotograma a fotograma.
La interfaz documentada más completa de Kimi también añade trabajo de integración. Su comportamiento Preserved Thinking implica que una aplicación con varios turnos debe devolver el mensaje completo del asistente, incluido el contenido del razonamiento y las llamadas a herramientas, en lugar de conservar únicamente la respuesta visible. Ese historial ocupa contexto y se factura. La ventana de 1 millón de tokens es grande, pero no es almacenamiento gratuito.
Ambos modelos utilizan de forma predeterminada su nivel de razonamiento más alto. Para la evaluación, mantén coherentes esas configuraciones. En producción, prueba un menor esfuerzo en tareas sencillas. Un modelo que resuelve el 99 % de las solicitudes con menor esfuerzo puede ser más barato y rápido que uno que utiliza el razonamiento máximo para cada autocompletado, clasificación o transformación breve.
¿Qué modelo deberías elegir?
| Tu situación |
Mejor opción actual |
Por qué |
| Crear ahora una aplicación orientada al cliente |
Kimi K3 |
API convencional y precio de tokens predecible |
| Ejecutar una tarea extensa de repositorio con entradas de imagen o vídeo |
Kimi K3 |
Contexto de 1 millón de tokens y compatibilidad documentada con imagen y vídeo |
| Probar dentro de Qwen Code, Qoder u otra herramienta compatible de Alibaba |
Qwen 3.8 Max Preview |
Bajo consumo promocional de Credits |
| Necesitar benchmarks estables y repetibles |
Kimi K3, por ahora |
La Preview de Qwen puede cambiar entre ejecuciones |
| Necesitar la arquitectura más limpia y metadatos de reproducción |
Probar Qwen |
Mostró una ventaja real en la revisión comparativa de arquitectura |
| Necesitar una gestión sólida de revisiones y regeneraciones |
Probar Kimi |
Fue más completo en la prueba comparativa disponible |
| Necesitar pesos descargables hoy |
Kimi K3 |
El checkpoint completo es público; Qwen 3.8 Max todavía no tiene pesos publicados |
| Necesitar comparar varias familias de modelos con una sola cuenta |
Kimi K3 en GPT Proto |
Una clave y un saldo permiten acceder a un catálogo de modelos más amplio |
Para una aplicación que vaya a ponerse en producción esta semana, elegiría Kimi K3. Tiene suficiente información publicada para estimar el coste, definir el comportamiento de la integración y repetir una prueba contra un nombre de modelo estable.
Para un experimento interno de programación, no ignoraría Qwen. Su Preview analizó un repositorio extenso sin llamadas fallidas a herramientas y mostró mejores límites arquitectónicos que Kimi en la prueba comparativa. Es una señal seria de capacidad. Todavía no es un contrato de producción.
Cómo probar Kimi K3 mediante GPT Proto
Qwen 3.8 Max todavía no está disponible en GPT Proto, por lo que el ejemplo de integración actual utiliza únicamente Kimi K3. Puedes llamarlo mediante el endpoint Chat Completions compatible con OpenAI de GPT Proto, usando la cadena de modelo kimi-k3:
curl https://gptproto.com/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: $GPTPROTO_API_KEY" \
-d '{
"model": "kimi-k3",
"messages": [
{
"role": "user",
"content": "Revisa este plan de migración. Identifica supuestos no respaldados, pasos de reversión ausentes y las pruebas necesarias antes de pasar a producción."
}
]
}'
El endpoint y la estructura de autorización siguen la guía de inicio rápido de la API de GPT Proto. En los flujos de trabajo de Kimi con varios turnos, conserva el mensaje completo del asistente devuelto por la API, incluidos los campos de razonamiento y llamadas a herramientas, en lugar de almacenar solo el texto visible final.
Puedes probar la API de Kimi K3, explorar más de 200 modelos de IA o utilizar la API de IA unificada de GPT Proto para comparar Kimi con otros modelos de texto, imagen, vídeo y audio. Cuando se añada Qwen 3.8 Max, la prueba útil será ejecutar la misma tarea, con el mismo prompt, permisos de herramientas y método de puntuación en ambos endpoints de modelo.
Veredicto final
Kimi K3 ya no gana simplemente porque Qwen sea una Preview. Qwen3.8-Max tiene ahora una API estable, facturación normal por tokens, especificaciones documentadas y disponibilidad directa mediante GPT Proto.
Para la mayoría de los equipos que eligen un modelo alojado, Qwen3.8-Max es el punto de partida más sólido porque su tarifa oficial de $2/$6 está muy por debajo de la tarifa de $3/$15 de Kimi K3, especialmente en tareas de agentes con mucho contenido de salida.
Kimi K3 sigue siendo la mejor opción cuando los pesos descargables y el control de la implementación son innegociables. Su mejor gestión de revisiones y regeneraciones en la prueba comparativa disponible también hace que merezca la pena evaluarlo para flujos de trabajo creativos y de ingeniería con mucho estado.
La respuesta clara ahora es: Qwen para el coste alojado y una amplia capacidad multimodal; Kimi para los pesos publicados y las tareas con gran carga de ciclo de vida.