Actualización — 28 de julio de 2026: Moonshot AI ya ha publicado los pesos completos de Kimi K3, la ficha del modelo, la licencia personalizada y el informe técnico. El lanzamiento resuelve la cuestión de disponibilidad por parte de Kimi. No hace que un modelo de 2,8 billones de parámetros sea fácil de alojar por cuenta propia: el repositorio oficial ocupa aproximadamente 1,56 TB, y Moonshot recomienda implementaciones en supernodos con 64 aceleradores o más.
Qwen 3.8 Max vs Kimi K3 parece un enfrentamiento directo entre dos gigantescos modelos de IA chinos: el modelo preliminar de 2,4 billones de parámetros de Alibaba frente al modelo insignia de 2,8 billones de parámetros de Moonshot AI. Las cifras invitan a una conclusión sencilla. El modelo más grande debería ganar.
Eso no es lo que muestran las pruebas disponibles, ni es la comparación más útil para los desarrolladores.
Al 23 de julio de 2026, Qwen 3.8 Max sigue siendo una versión preliminar cambiante distribuida mediante el Token Plan de Alibaba. Kimi K3 ya cuenta con una API documentada, precios por token publicados, una ventana de contexto de 1 millón de tokens y un plan fechado para publicar sus pesos completos. La diferencia de capacidad puede ser estrecha. La diferencia de preparación del producto no lo es.
Mi opinión es clara: Kimi K3 es la opción más segura si necesitas crear y presupuestar una aplicación real hoy. Qwen 3.8 Max Preview merece probarse dentro de un flujo de trabajo de programación, especialmente mientras los Credits promocionales de Alibaba hacen que experimentar sea económico, pero todavía no ha proporcionado suficiente información estable para imponerse en una decisión de producción.
En resumen: Kimi K3 es la opción de producción más segura hoy
Elige Kimi K3 si necesitas una API convencional, costes predecibles por token, comprensión nativa de imágenes y vídeo, o un modelo que puedas incorporar ahora a un producto orientado al cliente. Elige Qwen 3.8 Max Preview si ya utilizas el ecosistema de programación de Alibaba y quieres probar un modelo nuevo y prometedor a bajo coste promocional.
La única prueba detallada de programación comparativa disponible en el momento de publicación otorgó a Kimi K3 una puntuación de 83 y a Qwen 3.8 Max una puntuación de 80. Esa diferencia de tres puntos es una evidencia útil, no una clasificación universal. Qwen mostró límites de sistema más claros y una ejecución de herramientas impecable en la prueba; Kimi gestionó de forma más completa el historial de revisiones y la regeneración. Ambos también realizaron inferencias no respaldadas que requirieron correcciones fácticas.
En términos sencillos: Kimi gana actualmente la decisión de implementación. Qwen no ha perdido el concurso de capacidades; simplemente es demasiado pronto para declarar que ha ganado.
Qwen 3.8 Max vs Kimi K3 de un vistazo
| Categoría |
Qwen 3.8 Max |
Kimi K3 |
| Estado actual |
qwen3.8-max-preview; puede cambiar durante la Preview o ser reemplazado por una versión de producción |
Modelo publicado con acceso a API documentado |
| Parámetros totales declarados |
2.4T |
2.8T |
| Detalles de arquitectura |
Los parámetros activos y la configuración MoE completa aún no se han divulgado |
KDA, Attention Residuals y Stable LatentMoE; 16 de 896 expertos activados |
| Ventana de contexto |
No se ha divulgado claramente en la página actual del producto |
1.048.576 tokens |
| Entradas documentadas |
Texto e imágenes |
Texto, imágenes y vídeo |
| Razonamiento |
Siempre activado; low, high o xhigh; predeterminado: xhigh |
Siempre activado; low, high o max; predeterminado: max |
| Modelo de acceso actual |
Alibaba Token Plan y herramientas de programación o agentes compatibles |
API alojada convencional, productos Kimi y herramientas de programación |
| Precio ordinario por token |
No publicado |
$3/M de entrada nueva y $15/M de salida según la tarifa vigente de Moonshot |
| Precio de GPT Proto |
Todavía no disponible |
$2.70/M de entrada y $13.50/M de salida |
| Estado de pesos abiertos al 28 de julio |
Anunciado como próximo (“soon”); todavía no hay punto de control público, fecha ni licencia |
Pesos completos publicados en `moonshotai/Kimi-K3` bajo la Kimi K3 License personalizada |
| Realidad del alojamiento propio |
No se puede evaluar hasta que Alibaba publique el punto de control y las instrucciones de implementación |
Disponible técnicamente; el repositorio de 1,56 TB y la recomendación de más de 64 aceleradores lo convierten en una implementación de centro de datos, no en un modelo para portátil |
| Mejor uso actual |
Pruebas de bajo coste de la Preview en flujos de programación compatibles |
Aplicaciones de producción, agentes multimodales y cargas de programación con costes calculados |
| Riesgo principal |
El comportamiento de la Preview, las condiciones de acceso y los precios comerciales pueden cambiar |
El razonamiento siempre activado puede aumentar la latencia, los tokens de salida y el coste de sesiones largas |
La propia documentación del Token Plan de Alibaba indica que Qwen Preview puede actualizarse continuamente y eliminarse o reemplazarse más adelante. El anuncio de Kimi K3 de Moonshot y su guía de API divulgan muchos más detalles sobre el modelo y su interfaz actual.
Por qué todavía no es una comparación equitativa
Qwen 3.8 Max sigue siendo una Preview cambiante
Alibaba describe Qwen 3.8 Max como un modelo de 2,4T, pero el modelo alojado disponible hoy es específicamente qwen3.8-max-preview. Ese sufijo importa. Alibaba afirma que sus capacidades pueden actualizarse durante toda la Preview y que el endpoint podría eliminarse o reemplazarse posteriormente por una versión de producción.
Esto convierte cada benchmark actual en una instantánea fechada. Un resultado útil de Qwen debería registrar la fecha de la prueba, el endpoint, el nivel de razonamiento, el entorno del agente, los permisos de herramientas y la salida sin procesar. Sin esos detalles, dos personas pueden creer que probaron el mismo modelo cuando en realidad recibieron comportamientos distintos de la Preview.
Las condiciones de acceso también limitan lo que los desarrolladores pueden concluir del bajo precio de lanzamiento. El Personal Token Plan de Alibaba ofrece actualmente Qwen 3.8 Max mediante una suscripción basada en Credits, pero sus condiciones oficiales restringen la clave a herramientas interactivas de programación y agentes compatibles. Los scripts de automatización, los backends de aplicaciones personalizadas y las llamadas por lotes no interactivas están prohibidos en ese plan.
Por tanto, Qwen se puede invocar. Pero todavía no es un backend normal de pago por uso para una aplicación orientada al cliente.
Kimi K3 ha completado su lanzamiento de pesos abiertos
Kimi K3 ya está disponible de dos formas: una API alojada convencional y un punto de control descargable. Moonshot AI ha publicado los pesos completos en el repositorio oficial `moonshotai/Kimi-K3`, junto con una ficha del modelo, instrucciones de implementación, una licencia personalizada y el informe técnico de K3.
El lanzamiento añade detalles que no estaban disponibles cuando se publicó por primera vez esta comparación. K3 tiene 104B de parámetros activados por token, utiliza pesos MXFP4 con activaciones MXFP8 y actualmente está documentado para vLLM, SGLang y TokenSpeed. El repositorio ocupa aproximadamente 1,56 TB en 96 fragmentos safetensors.
Eso es un lanzamiento real de pesos abiertos. No equivale a un lanzamiento MIT sin restricciones ni a una instalación local sencilla. La Kimi K3 License añade condiciones para grandes empresas de Model-as-a-Service y productos comerciales muy grandes, mientras que Moonshot recomienda configuraciones de supernodos con 64 aceleradores o más para la implementación.
En términos sencillos: Kimi ha eliminado la incertidumbre sobre la propiedad. No ha eliminado el coste de infraestructura.
Comparación de programación: qué muestra realmente la prueba de 269 archivos
La mejor evidencia comparativa actual es una prueba de arquitectura emparejada de StackPerf. Ambos modelos recibieron la misma instantánea de solo lectura de dos proyectos de software desconocidos que contenían 269 archivos. Utilizaron OpenCode 1.17.13, instrucciones idénticas, los mismos permisos, un límite de 60 minutos y un máximo de 65.536 tokens de finalización. La edición, el acceso web, los plugins y los subagentes estaban desactivados.
Los informes finales se anonimizaron antes de la puntuación y después se comprobaron por separado para detectar afirmaciones no respaldadas.
| Resultado de la prueba |
Qwen 3.8 Max |
Kimi K3 |
| Puntuación final |
80/100 |
83/100 |
| Llamadas a herramientas |
44 |
53 |
| Llamadas fallidas o denegadas |
0 |
2, seguidas de una recuperación correcta |
| Ocurrencias de citas del repositorio |
354 |
274 |
| Grupos de afirmaciones no respaldadas tras la verificación |
7 |
7 |
| Punto fuerte más claro |
Límites del sistema y metadatos de reproducción |
Revisión, regeneración y estado del ciclo de vida |
Dónde obtuvo mejores resultados Kimi K3
El informe de Kimi modeló de forma más completa el ciclo de edición. Registró revisiones, intentos reemplazados, reintentos, historial de alternativas, hashes de artefactos, invalidación, selección editorial y recorte. Esto hizo que su contrato propuesto fuera más adecuado para un sistema en el que una escena puede generarse, rechazarse, revisarse y generarse de nuevo sin perder su historial.
Kimi también terminó antes y utilizó menos tokens en la ruta probada. Es un resultado alentador para tareas de programación largas, pero incluye el sistema de servicio que rodea al modelo. Kimi se ejecutó mediante un endpoint de suscripción de Kimi, mientras que Qwen lo hizo mediante el endpoint internacional Token Plan de Alibaba. La capacidad del proveedor, el almacenamiento en caché y el tráfico del periodo de lanzamiento afectaron al resultado observado.
Mi interpretación es que Kimi ganó esta tarea porque comprendió más completamente el estado cambiante, no porque escribiera código más elegante ni demostrara ser mejor en cualquier tarea de software.
Dónde obtuvo mejores resultados Qwen 3.8 Max
Qwen trazó un límite más claro entre los dos sistemas y creó un registro de reproducción más sólido. Sus metadatos propuestos incluían el modelo, la semilla, el prompt, las referencias, el ID de solicitud al proveedor, la ubicación del contenido multimedia, la duración y el coste. Estos campos son importantes cuando un equipo necesita reproducir un resultado o investigar por qué el mismo flujo de trabajo cambió después de una actualización del proveedor.
Su comportamiento con las herramientas también fue disciplinado: 44 llamadas, todas correctas. Qwen produjo el informe más largo con menos solicitudes y obtuvo una puntuación superior en uso de herramientas durante la revisión ciega.
El coste de esa arquitectura más limpia fue un modelado más débil del ciclo de vida. Su contrato no cubría por completo el orden de las escenas, las revisiones, la sustitución, el historial de reintentos ni la invalidación de tomas. Los límites claros son valiosos. No bastan cuando el estado del producto sigue cambiando.
Lo que esta prueba no puede demostrar
Una sola ejecución de análisis arquitectónico no puede decirnos qué modelo produce mejor código frontend, corrige más errores reales, supera más pruebas o necesita menos correcciones humanas durante un mes de desarrollo. Tampoco puede separar la inteligencia del modelo del rendimiento del endpoint.
La advertencia más importante está oculta en la revisión factual: ambos modelos citaron ubicaciones reales del repositorio, pero ambos produjeron siete grupos de afirmaciones que iban más allá de lo que demostraba el código. Un informe puede contener cientos de citas válidas y aun así llegar a una conclusión insegura.
Esa es la conclusión real. Utiliza cualquiera de los dos modelos como asistente de ingeniería. No trates a ninguno como su propio revisor.
Cómo deberían probar los desarrolladores Qwen 3.8 Max frente a Kimi K3
| Prueba |
Proporcionar a ambos modelos |
Medir |
| Revisión de arquitectura del repositorio |
El mismo commit congelado, pregunta de arquitectura, herramientas de solo lectura y límite de tiempo |
Citas correctas de archivos, dependencias omitidas, afirmaciones no respaldadas y tiempo de revisión |
| Implementación en varios archivos |
El mismo problema, pruebas, archivos modificables y permisos de herramientas |
Pruebas superadas, archivos modificados, reintentos, regresiones y correcciones humanas |
| Reparación visual del frontend |
La misma captura de pantalla, archivos fuente, herramientas del navegador y comportamiento objetivo |
Coincidencia visual, código válido, ciclos de reparación y resultado de la prueba final |
Mantén idénticos el entorno del agente y los permisos. Establece un límite de tiempo fijo. Registra el ID completo del modelo y la fecha, especialmente para la Preview cambiante de Qwen. Después captura la finalización de la tarea, el tiempo de reloj, los tokens de entrada y salida, los aciertos de caché, las llamadas fallidas a herramientas, los reintentos, las intervenciones humanas y las pruebas finales superadas.
No puntúes una respuesta porque “parece exhaustiva”. Comprueba si el parche funciona y si las afirmaciones del modelo resisten la revisión.
Para decisiones arquitectónicas de alto valor, existe otro patrón útil: ejecuta ambos modelos de forma independiente, oculta sus identidades durante la revisión y compara sus desacuerdos. La prueba de 269 archivos produjo su diseño más sólido solo después de combinar los límites de sistema de Qwen con el modelo de ciclo de vida de Kimi. A veces, la respuesta correcta a Qwen frente a Kimi es ambos, seguida de verificación.
Precios y costes de Qwen 3.8 Max frente a Kimi K3
Kimi K3 tiene precios de token predecibles
Kimi K3 tiene un precio ordinario basado en tokens. La actual página de la API GPT Proto Kimi K3 indica $2.70 por 1 millón de tokens de entrada y $13.50 por 1 millón de tokens de salida, un 10 % por debajo de la tarifa vigente de Moonshot de $3/$15.
Esto permite calcular una estimación básica del coste antes de comenzar una prueba:
coste estimado = (tokens de entrada ÷ 1.000.000 × $2.70) + (tokens de salida ÷ 1.000.000 × $13.50)
Una ejecución con 200.000 tokens de entrada y 20.000 tokens de salida costaría aproximadamente $0.81 con la tarifa actual de GPT Proto: $0.54 por la entrada y $0.27 por la salida. Los reintentos, turnos adicionales, resultados de herramientas y el historial de razonamiento conservado aumentarían el total.
Predecible no significa automáticamente barato. Kimi siempre razona, y el contenido del razonamiento cuenta para el uso de tokens. Por tanto, los historiales largos de agentes pueden resultar caros incluso cuando la respuesta final visible es breve.
Qwen 3.8 Max es más barato para experimentar, pero más difícil de presupuestar
Qwen 3.8 Max Preview utiliza actualmente suscripciones y Credits en lugar de un precio divulgado por millón de tokens. El Personal Token Plan de Alibaba muestra precios promocionales mensuales de 39 CNY, 139 CNY y 499 CNY para sus tres niveles. Durante la Preview, las llamadas de Qwen pueden consumir tan solo el 10 % de la tarifa estándar de Credits, con un descuento nocturno adicional y limitado para llamadas entre las 22:00 y las 08:00 UTC+8.
Es atractivo para pruebas interactivas. No es una comparación de costes limpia.
Los Credits pueden variar según el uso de tokens, la caché, el razonamiento y las herramientas, por lo que una suscripción en CNY no puede convertirse honestamente en una cifra estable de $X por 1 millón de tokens con la información publicada actualmente. La restricción del Personal Plan también significa que su economía promocional no representa el coste de ejecutar Qwen detrás de tu propia aplicación.
Qwen gana en acceso económico a la Preview. Kimi gana en visibilidad de costes de producción.
Pesos abiertos y alojamiento propio
Kimi K3 tiene ahora una ventaja concreta sobre Qwen 3.8 Max: su punto de control público exacto puede descargarse hoy. Moonshot AI ha publicado los pesos completos de 2,8T parámetros, la ficha del modelo, la licencia y el informe técnico. Alibaba ha anunciado pesos abiertos para Qwen 3.8 Max, pero el punto de control exacto de Max, la fecha de lanzamiento, la licencia y los requisitos de implementación siguen sin confirmarse.
La palabra “abierto” todavía necesita matices. Kimi K3 tiene pesos abiertos bajo la Kimi K3 License personalizada, no MIT. La licencia permite ampliamente el uso, la modificación, la implementación, el ajuste fino y la redistribución, pero añade un requisito de acuerdo independiente para empresas de Model-as-a-Service por encima del umbral de ingresos indicado y un requisito de atribución para productos comerciales muy grandes.
El hardware es el otro límite. El repositorio oficial de K3 ocupa aproximadamente 1,56 TB, y Moonshot recomienda implementaciones en supernodos con al menos 64 aceleradores. Esto hace que el alojamiento propio sea viable para equipos de infraestructura con buena financiación, no un sustituto de una clave de API en la estación de trabajo de un desarrollador.
Elige la API alojada de Kimi K3 cuando quieras una facturación predecible por token y no operar clústeres. Elige los pesos cuando el control de datos, la inferencia personalizada, el ajuste fino o la propiedad de la implementación justifiquen operar el hardware y revisar la licencia. Para Qwen 3.8 Max, espera a que Alibaba publique el punto de control real antes de hacer el mismo cálculo.
Entradas multimodales, razonamiento y comportamiento de agentes
| Capacidad |
Qwen 3.8 Max Preview |
Kimi K3 |
| Comprensión de imágenes |
Documentada |
Documentada |
| Comprensión de vídeo |
No está claramente documentada como entrada actual del modelo |
Documentada |
| Modo de razonamiento |
Siempre activado |
Siempre activado |
| Niveles de razonamiento |
low, high, xhigh |
low, high, max |
| Nivel de razonamiento predeterminado |
xhigh |
max |
| Ventana de contexto |
No se ha divulgado claramente en la página actual del producto |
1.048.576 tokens |
| Salida estructurada |
Las capacidades de la Preview requieren verificación continua |
Modo JSON y JSON Schema estricto documentados |
| Historiales largos de herramientas |
El comportamiento puede cambiar con la Preview |
Deben conservarse los mensajes completos del asistente, incluido el contenido del razonamiento |
El soporte de visión documentado de Qwen lo hace relevante para la depuración basada en capturas de pantalla. Kimi va más allá al aceptar vídeo, algo útil cuando la entrada es una grabación de pantalla, una referencia de animación o una demostración de producto difícil de describir fotograma a fotograma.
La interfaz documentada más completa de Kimi también añade trabajo de integración. Su comportamiento Preserved Thinking significa que una aplicación multturno debe devolver el mensaje completo del asistente, incluido el contenido del razonamiento y las llamadas a herramientas, en lugar de conservar solo la respuesta visible. Ese historial ocupa contexto y se factura. La ventana de 1 millón de tokens es grande, pero no es almacenamiento gratuito.
Ambos modelos utilizan de forma predeterminada su configuración de razonamiento más alta. Para la evaluación, mantén constantes esas configuraciones. En producción, prueba un esfuerzo menor en tareas sencillas. Un modelo que resuelve el 99 % de las solicitudes con menor esfuerzo puede ser más barato y rápido que uno configurado al máximo para cada autocompletado, clasificación o transformación breve.
¿Qué modelo deberías elegir?
| Tu situación |
Mejor opción actual |
Motivo |
| Crear ahora una aplicación orientada al cliente |
Kimi K3 |
API convencional y precio por token previsible |
| Ejecutar una tarea larga en un repositorio con entradas de imagen o vídeo |
Kimi K3 |
Contexto de 1M y soporte documentado para imágenes y vídeo |
| Probar dentro de Qwen Code, Qoder u otra herramienta compatible de Alibaba |
Qwen 3.8 Max Preview |
Bajo consumo promocional de Credits |
| Necesitar benchmarks estables y repetibles |
Kimi K3, por ahora |
La Preview de Qwen puede cambiar entre ejecuciones |
| Necesitar la arquitectura más limpia y metadatos de reproducción |
Probar Qwen |
Mostró una ventaja real en la revisión arquitectónica comparativa |
| Necesitar una gestión sólida de revisiones y regeneraciones |
Probar Kimi |
Fue más completo en la prueba comparativa disponible |
| Necesitar pesos descargables hoy |
Kimi K3 |
El punto de control completo es público; Qwen 3.8 Max todavía no tiene pesos publicados |
| Necesitar comparar varias familias de modelos con una sola cuenta |
Kimi K3 en GPT Proto |
Una clave y saldo permiten acceder al catálogo más amplio de modelos |
Para una aplicación que se lance esta semana, elegiría Kimi K3. Tiene suficiente información publicada para estimar el coste, definir el comportamiento de integración y repetir una prueba contra un nombre de modelo estable.
Para un experimento interno de programación, no ignoraría Qwen. Su Preview gestionó un análisis largo de repositorio sin llamadas fallidas a herramientas y mostró mejores límites arquitectónicos que Kimi en la prueba comparativa. Es una señal seria de capacidad. Todavía no es un contrato de producción.
Cómo probar Kimi K3 mediante GPT Proto
Qwen 3.8 Max todavía no está disponible en GPT Proto, por lo que el ejemplo de integración actual utiliza únicamente Kimi K3. Puedes invocarlo mediante el endpoint de Chat Completions compatible con OpenAI de GPT Proto, usando la cadena de modelo kimi-k3:
curl https://gptproto.com/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: $GPTPROTO_API_KEY" \
-d '{
"model": "kimi-k3",
"messages": [
{
"role": "user",
"content": "Revisa este plan de migración. Identifica suposiciones no respaldadas, pasos de reversión ausentes y las pruebas necesarias antes de pasar a producción."
}
]
}'
El endpoint y la estructura de autorización siguen la guía rápida de la API de GPT Proto. Para flujos multturno con Kimi, conserva el mensaje completo del asistente devuelto por la API, incluidos los campos de razonamiento y llamadas a herramientas, en lugar de guardar únicamente el texto final visible.
Puedes probar la API de Kimi K3, explorar más de 200 modelos de IA o utilizar la API de IA unificada de GPT Proto para comparar Kimi con otros modelos de texto, imagen, vídeo y audio. Cuando se añada Qwen 3.8 Max, la prueba útil será la misma tarea, el mismo prompt, los mismos permisos de herramientas y el mismo método de puntuación en ambos endpoints.
Veredicto final
Qwen 3.8 Max y Kimi K3 parecen suficientemente cercanos en capacidad de programación como para que un benchmark pequeño no decida la arquitectura del próximo año. Los límites de sistema más limpios y la ejecución impecable de herramientas de Qwen merecen atención. El razonamiento más sólido sobre el ciclo de vida y la ventaja de tres puntos de Kimi también.
La decisión sobre el producto ahora es más clara. Kimi K3 combina una API estándar, precios públicos por token, una ventana de contexto documentada de 1M, entrada multimodal y un punto de control de pesos abiertos publicado. Qwen 3.8 Max sigue siendo una Preview cambiante con acceso basado en Credits, sin precio de producción ordinario y sin pesos públicos.
Kimi K3 es el mejor modelo para implementar hoy, tanto si comienzas con su API alojada como si tienes la infraestructura necesaria para gestionar el punto de control por tu cuenta. Qwen 3.8 Max todavía podría convertirse en el modelo más potente, pero los desarrolladores deberían esperar a su endpoint de producción, precios ordinarios, ficha del modelo, licencia y lanzamiento real de pesos antes de apostar por él.