Los mejores modelos LLM chinos de un vistazo
| Clasificación |
Modelo |
Mejor para |
Puntuación de inteligencia independiente |
Contexto |
Entradas |
Estado de los pesos |
Precio de GPT Proto por 1M de tokens |
| 1 |
Kimi K3 |
Inteligencia general, programación frontend y visual |
57 |
1M |
Texto, imagen y vídeo mediante el servicio alojado |
Pesos abiertos, licencia personalizada de Kimi K3; aproximadamente 1,56 TB |
$2.70 de entrada / $13.50 de salida |
| 2 |
GLM-5.2 |
Agentes de programación de larga duración y autoalojamiento comercial |
51 |
1M |
Texto |
Pesos abiertos, MIT |
$1.26 / $3.96 |
| 3 |
Qwen3.7 Max |
Razonamiento y programación alojados de forma rápida |
46 |
1M |
Texto |
Propietario |
$0.36 / $1.44 |
| 4 |
MiniMax M3 |
Desarrollo multimodal de bajo coste |
44 |
1M |
Texto, imagen y vídeo |
Pesos abiertos, licencia comunitaria de MiniMax |
$0.48 / $0.96 |
| 5 |
DeepSeek V4 Pro |
Razonamiento backend, STEM e implementación privada |
44 |
1M |
Texto |
Pesos abiertos, MIT |
$1.39 / $2.78 |
Las puntuaciones independientes proceden del índice de inteligencia de Artificial Analysis, que combina nueve evaluaciones sobre programación, trabajo en terminal, conocimientos, matemáticas y razonamiento. Es más amplio que una tabla de clasificación centrada únicamente en programación, por lo que debe considerarse una señal más y no un veredicto definitivo. Consulta la metodología de Artificial Analysis y los resultados actuales de los modelos.
Los precios son las tarifas de GPT Proto comprobadas el 20 de julio de 2026. Pueden cambiar.
Cómo clasificamos los modelos LLM chinos
Una clasificación del “mejor modelo LLM chino” basada únicamente en el número total de parámetros colocaría a Kimi K3 en primer lugar y daría por terminada la discusión. Eso no ayudaría a un desarrollador a elegir un modelo.
En su lugar, consideramos cinco preguntas:
- ¿Cómo funciona el modelo en evaluaciones independientes, en lugar de basarnos solo en las pruebas de su desarrollador?
- ¿Puede mantener una programación a escala de repositorio y utilizar herramientas repetidamente?
- ¿Qué velocidad y coste tiene al acceder a él mediante una API?
- ¿Acepta capturas de pantalla, diagramas u otras entradas visuales?
- ¿Puede una empresa descargar, modificar e implementar comercialmente sus pesos?
La última distinción es importante. “Abierto”, “de pesos abiertos” y “de código abierto” no siempre otorgan los mismos derechos. GLM-5.2 y DeepSeek V4 Pro utilizan la permisiva licencia MIT. MiniMax M3 publica sus pesos bajo su licencia comunitaria. Qwen3.7 Max es propietario. Kimi K3 publica ahora sus pesos completos bajo la licencia personalizada de Kimi K3, que permite un uso y una modificación amplios, pero añade condiciones para grandes empresas de Model-as-a-Service y productos comerciales muy grandes.
1. Kimi K3: el mejor LLM chino en general
Moonshot AI creó Kimi K3 para programación, trabajo con conocimientos y tareas de razonamiento que pueden continuar a través de muchas llamadas a herramientas. Su especificación principal es difícil de ignorar: 2,8 billones de parámetros totales, una ventana de contexto de 1M de tokens y comprensión nativa de texto, imágenes y vídeo.
La arquitectura es más interesante que el tamaño bruto. Kimi K3 utiliza Kimi Delta Attention y Attention Residuals, activando 16 de sus 896 expertos para cada token. Esto permite a Moonshot ampliar el modelo sin pagar el coste computacional completo de un modelo denso de 2,8T de parámetros en cada paso. La guía de Kimi K3 de Moonshot explica la arquitectura y la ventana de contexto.
Kimi K3 obtiene actualmente 57 en el índice de inteligencia de Artificial Analysis, por delante de los otros cuatro modelos de esta lista. También es el único modelo de aquí que combina ese nivel de razonamiento general con entrada visual nativa. Esto lo hace especialmente relevante para:
- Depurar un frontend a partir de capturas de pantalla y registros de ejecución
- Reconstruir una interfaz a partir de una referencia visual
- Navegar por un repositorio grande durante una sesión prolongada del agente
- Combinar documentos técnicos, diagramas y código
- Probar y revisar una aplicación repetidamente
Hay tres desventajas importantes.
Primero, el precio. En GPT Proto, la salida cuesta $13.50 por millón de tokens. Es más de tres veces la tarifa de salida de GLM-5.2 y más de catorce veces la de MiniMax M3. Un agente de larga duración puede generar muchos tokens mientras planifica, edita, revisa los resultados de las pruebas y vuelve a intentarlo.
Segundo, la infraestructura. Los pesos completos de K3 son ahora públicos, pero el repositorio ocupa aproximadamente 1,56 TB. Moonshot recomienda implementaciones en supernodos con 64 aceleradores o más. Es un modelo de pesos abiertos para equipos de infraestructura, no una descarga para un portátil.
Tercero, la licencia. Kimi K3 no utiliza MIT. Su licencia personalizada permite ampliamente el uso, la modificación, el ajuste fino y la implementación, pero añade condiciones para grandes empresas de Model-as-a-Service y productos comerciales muy grandes. La revisión legal debe formar parte del plan de implementación.
Veredicto: Elige Kimi K3 cuando la tarea sea lo bastante difícil como para justificar una factura de API más alta o cuando sea importante acceder a un modelo de frontera con pesos abiertos. Mantén GLM-5.2 como la opción predeterminada de pesos abiertos más sencilla para los agentes de programación habituales.
2. GLM-5.2: el mejor modelo chino para agentes de programación de larga duración
GLM-5.2 es el modelo con el que empezaría para un agente de programación serio.
Z.ai lo entrenó específicamente para tareas de largo alcance, en lugar de tratar la programación como otra capacidad conversacional. Es un modelo de mezcla de expertos de 753B parámetros, con aproximadamente 40B parámetros activos por token, una ventana de contexto de 1M de tokens, llamadas nativas a herramientas y pesos con licencia MIT. El anuncio de GLM-5.2 de Z.ai describe su enfoque de largo alcance.
En el índice de inteligencia de Artificial Analysis, GLM-5.2 obtiene 51. Más importante para el desarrollo interactivo, las mediciones independientes sitúan su velocidad de salida cerca de 200 tokens por segundo. Es considerablemente más rápido que MiniMax M3 y DeepSeek V4 Pro en el mismo conjunto de datos.
Esta combinación es adecuada para trabajos como:
- Refactorización de todo el repositorio
- Depuración de varios archivos
- Bucles prolongados de terminal y pruebas
- Trabajos de migración que abarcan código, configuración y documentación
- Autoalojamiento comercial o ajuste fino
La licencia MIT es una ventaja real. Un equipo puede inspeccionar los pesos, alojar el modelo en su propio entorno y adaptarlo sin negociar un acuerdo propietario por puesto.
El coste es que GLM-5.2 solo admite texto. No puede inspeccionar una captura de pantalla de un diseño defectuoso ni razonar directamente sobre una referencia de diseño. Las pruebas independientes también lo consideran relativamente verboso. La generación rápida ayuda, pero las salidas innecesarias siguen aumentando la factura.
A $1.26 por millón de tokens de entrada y $3.96 por millón de tokens de salida en GPT Proto, GLM-5.2 no es el modelo más barato de esta lista. Es el modelo abierto más equilibrado para un agente de programación.
Veredicto: Usa GLM-5.2 como opción predeterminada cuando necesites que un agente mantenga el rumbo en un repositorio grande. Cambia a otro modelo cuando la entrada visual o el menor coste posible por token sean más importantes.
3. Qwen3.7 Max: el mejor para cargas de programación alojadas y rápidas
Qwen3.7 Max es el modelo de agentes propietario de Alibaba. Ofrece una ventana de contexto de 1M de tokens, hasta 65.536 tokens de salida y razonamiento ampliado para programación y ejecución prolongada. A diferencia de Qwen3.7 Plus, Max solo admite texto. El anuncio de Qwen3.7 de Alibaba presenta Max como un modelo base para agentes.
Su ventaja más útil es la velocidad.
Artificial Analysis mide actualmente Qwen3.7 Max en aproximadamente 204 tokens de salida por segundo, frente a unos 65 de DeepSeek V4 Pro. También obtiene 46 en el índice de inteligencia, ligeramente por delante de MiniMax M3 y DeepSeek V4 Pro.
La tarifa de GPT Proto hace que el modelo sea aún más interesante: $0.36 por millón de tokens de entrada y $1.44 por millón de tokens de salida. Esto lo sitúa cerca de MiniMax M3 en una tarea de programación realista, pero con mejores resultados independientes de inteligencia general.
Qwen3.7 Max es adecuado para:
- Revisiones rápidas de código
- Refactorización de texto en varios archivos
- Tareas de agentes donde el tiempo de respuesta afecta a la experiencia del usuario
- Cargas alojadas de gran volumen
- Equipos que quieren un modelo de API sólido sin gestionar los pesos
La desventaja es el control. Qwen3.7 Max tiene pesos cerrados, por lo que no puedes implementarlo en un clúster privado ni ajustar tú mismo sus pesos base. Tampoco dispone de las entradas visuales de Kimi K3 y MiniMax M3.
También existe un problema de actualidad. Alibaba ya ha anunciado Qwen3.8 Max. Hasta que ese modelo más reciente tenga documentación, precios y resultados independientes estables, sustituir una integración funcional de Qwen3.7 sería prematuro.
Veredicto: Qwen3.7 Max es la mejor opción aquí cuando la velocidad alojada y el bajo coste de la API importan más que el autoalojamiento o la entrada multimodal.
4. MiniMax M3: el mejor LLM chino por su relación calidad-precio para el desarrollo multimodal
Es fácil subestimar MiniMax M3 si solo observas su puntuación de 44.
El modelo tiene aproximadamente 428B de parámetros totales y 23B de parámetros activos, pero admite un contexto de 1M de tokens y entradas nativas de texto, imagen y vídeo. MiniMax Sparse Attention reduce el cálculo de atención en la longitud de contexto completa a aproximadamente una vigésima parte del de la generación anterior. MiniMax informa de una generación inicial nueve veces más rápida y una decodificación quince veces más rápida que M2 con un contexto de 1M. La ficha oficial del modelo MiniMax M3 contiene las cifras de arquitectura y velocidad.
Esto convierte a MiniMax M3 en una opción práctica para:
- Leer diagramas de repositorios y capturas de interfaces junto con el código
- Análisis de documentos y código extensos
- Clasificación multimodal de errores
- Subtareas de programación de gran volumen
- Agentes que necesitan un contexto amplio sin el precio de salida de Kimi K3
En GPT Proto, el modelo cuesta $0.48 por millón de tokens de entrada y $0.96 por millón de tokens de salida. Es el modelo de salida más barato de esta comparación.
Los pesos se pueden descargar, pero conviene conservar una distinción legal: MiniMax M3 utiliza la licencia comunitaria de MiniMax, no MIT. Los pesos abiertos no significan automáticamente un uso comercial sin restricciones. Una empresa que planee redistribuir, ajustar o autoalojar el modelo debería revisar la licencia en lugar de confiar en la palabra “abierto”.
En GPT Proto, las llamadas de texto utilizan el endpoint principal de MiniMax M3. Las entradas de imágenes y archivos están disponibles a través de su ruta específica de imagen a texto bajo la misma cuenta.
Veredicto: MiniMax M3 es la opción con mejor relación entre coste y capacidad de la lista. Elígelo cuando necesites entrada multimodal o esperes ejecutar un gran número de subtareas de agentes.
5. DeepSeek V4 Pro: el mejor modelo MIT para el razonamiento backend
DeepSeek ya no es la respuesta automática a “¿Cuál es el mejor modelo chino para programar?”. La competencia ha avanzado.
DeepSeek V4 Pro sigue siendo una opción seria. Es un modelo de mezcla de expertos de 1,6T de parámetros, con 49B parámetros activos, una ventana de contexto de 1M de tokens y pesos con licencia MIT. Admite modos sin pensamiento, de razonamiento alto y de razonamiento máximo dentro de una misma familia de modelos. DeepSeek anunció V4 Pro y V4 Flash en abril de 2026.
Su puntuación en el índice de inteligencia de Artificial Analysis es 44, al nivel de MiniMax M3, pero por debajo de Qwen3.7 Max, GLM-5.2 y Kimi K3. Su velocidad de salida también es inferior, de aproximadamente 65 tokens por segundo.
¿Por qué mantenerlo entre los cinco primeros?
DeepSeek V4 Pro sigue siendo adecuado para trabajos backend centrados en texto:
- Problemas de algoritmos y estructuras de datos
- Razonamiento STEM
- Regresiones backend
- Generación y reparación de pruebas
- Implementaciones privadas que requieren una licencia permisiva
- Flujos de trabajo de agentes con muchas salidas, donde es más barato que GLM-5.2
En GPT Proto, cuesta aproximadamente $1.39 por millón de tokens de entrada y $2.78 por millón de tokens de salida. GLM-5.2 tiene una entrada ligeramente más barata, pero DeepSeek es más barato en la salida.
Veredicto: DeepSeek V4 Pro ya no es el ganador general, pero sigue siendo una de las mejores opciones para el razonamiento backend cuando importan la implementación con licencia MIT y un coste de salida predecible.
Una tarea de programación real, cinco opciones diferentes
Considera una tarea más realista que pedir a cada modelo que cree una aplicación de tareas:
Una aplicación SaaS de TypeScript empieza a fallar intermitentemente durante su callback de OAuth después de actualizar una biblioteca de autenticación. El agente de programación debe inspeccionar el repositorio, rastrear el flujo del callback y de la sesión, identificar la regresión, modificar la implementación, añadir una prueba fallida, ejecutar el conjunto de pruebas y preparar un resumen de la solicitud de cambios.
Una instrucción inicial útil podría ser la siguiente:
Investiga la regresión del callback de OAuth en este repositorio.
Antes de editar:
1. Mapea las rutas del callback, la sesión y la actualización de tokens.
2. Identifica la actualización de la biblioteca que cambió el comportamiento.
3. Reproduce el fallo con una prueba.
4. Propón el parche seguro más pequeño.
Después de editar:
1. Ejecuta las pruebas unitarias y de integración relevantes.
2. Informa de cada archivo modificado.
3. Explica los riesgos restantes.
4. No afirmes que el trabajo se completó correctamente a menos que las pruebas pasen.
El mejor modelo cambia según las pruebas y el entorno:
| Etapa |
Modelo recomendado |
Motivo |
| Leer un monorepo grande y mantener un bucle prolongado de herramientas |
GLM-5.2 |
Programación sólida de largo alcance, generación rápida y contexto de 1M |
| Inspeccionar capturas, estado del navegador y código conjuntamente |
Kimi K3 |
La puntuación general más alta y entrada visual nativa |
| Realizar una primera revisión de código rápida |
Qwen3.7 Max |
Alta velocidad de salida y bajo precio de alojamiento |
| Procesar capturas y subtareas repetidas con un presupuesto limitado |
MiniMax M3 |
Multimodalidad nativa con la tarifa de salida más baja |
| Analizar la lógica backend en un entorno privado |
DeepSeek V4 Pro |
Pesos MIT, razonamiento seleccionable y sólida orientación STEM |
Por eso no dirigiría cada paso a un único modelo. Un agente práctico puede utilizar Qwen3.7 Max o MiniMax M3 para la clasificación inicial, escalar una corrección difícil que afecte a todo el repositorio a GLM-5.2 y reservar Kimi K3 para las tareas que necesiten razonamiento visual.
¿Cuánto costaría la misma tarea de programación?
Supongamos que la tarea de OAuth consume:
- 100.000 tokens de entrada sin caché
- 20.000 tokens de salida
Usando las tarifas de GPT Proto indicadas, el coste del modelo en la primera pasada sería:
| Modelo |
Coste aproximado |
| Kimi K3 |
$0.54 |
| GLM-5.2 |
$0.21 |
| Qwen3.7 Max |
$0.06 |
| MiniMax M3 |
$0.07 |
| DeepSeek V4 Pro |
$0.19 |
Por ejemplo, el cálculo de Kimi K3 es:
(0.1 × $2.70) + (0.02 × $13.50) = $0.54
Esto no significa que Qwen o MiniMax vayan a resolver la tarea por seis centavos. Es aritmética de tokens de la primera pasada. Si un modelo más barato produce un parche incorrecto y necesita tres reintentos, su coste real y el tiempo de finalización aumentan. La caché, los modos de razonamiento, la salida de las herramientas y el número de turnos del agente también modifican la factura final.
La métrica útil no es el precio por token. Es el coste por corrección aceptada.
Por qué el ganador de las pruebas comparativas puede no ser el mejor agente de programación
Un modelo de programación no inspecciona archivos, ejecuta comandos ni combina un parche por sí solo. El agente que lo rodea controla:
- Qué archivos del repositorio entran en el contexto
- Cómo se presentan los resultados de búsqueda y la salida de la terminal
- Si las ediciones utilizan parches exactos o archivos reescritos
- Cuándo se ejecutan las pruebas
- Qué ocurre después de un comando fallido
- Si el modelo puede verificar su propio trabajo
- Cuánto contexto se conserva entre turnos
Coloca el mismo modelo en dos sistemas de agentes diferentes y puedes obtener resultados muy distintos.
El contexto de 1M de tokens compartido por los cinco modelos crea otra trampa. Un millón de tokens es capacidad, no una recomendación para pegar todo el repositorio en cada solicitud. Los archivos generados irrelevantes, el código de dependencias y los registros antiguos pueden distraer al modelo mientras aumentan la latencia y el coste.
Un agente de programación mejor recupera primero los archivos relevantes, mantiene las instrucciones estables cerca del principio, resume las salidas antiguas de las herramientas y amplía el contexto solo cuando la investigación lo requiere.
En una frase: elige el modelo y el agente conjuntamente.
¿Qué modelo chino para programar deberías utilizar?
Elige Kimi K3 si quieres la mayor capacidad general actual, la tarea incluye pruebas visuales o razonamiento prolongado y prefieres una API alojada o puedes mantener una implementación de pesos abiertos de 1,56 TB. Revisa la licencia personalizada antes de crear un producto comercial de Model-as-a-Service basado en él.
Elige GLM-5.2 si estás creando un agente de programación de larga duración y quieres el mejor equilibrio entre capacidad, velocidad, contexto, coste e implementación permisiva. Su licencia MIT y su menor tamaño siguen convirtiéndolo en mi recomendación predeterminada para el autoalojamiento.
Elige Qwen3.7 Max si quieres un modelo alojado rápido y económico y no necesitas pesos descargables ni entrada de imágenes.
Elige MiniMax M3 si el coste y la multimodalidad son importantes. Es especialmente atractivo para flujos de desarrollo de gran volumen que combinan capturas de pantalla, archivos y código.
Elige DeepSeek V4 Pro si el trabajo se centra en el backend y quieres un modelo con licencia MIT que pueda ejecutarse en tu propia infraestructura.
No existe un ganador permanente. Los lanzamientos de modelos avanzan demasiado rápido para eso. Lo que sí puedes crear es una capa de enrutamiento que permita cambiar de ganador sin obligar a reescribir una aplicación.
Cómo llamar a estos modelos LLM chinos mediante una única API
GPT Proto expone los cinco modelos mediante el mismo endpoint de chat compatible con OpenAI. Esta es una solicitud cURL que utiliza GLM-5.2:
curl --location 'https://gptproto.com/v1/chat/completions' \
--header 'Authorization: YOUR_GPTPROTO_API_KEY' \
--header 'Content-Type: application/json' \
--data '{
"model": "glm-5.2",
"messages": [
{
"role": "system",
"content": "You are a senior software engineer. Separate confirmed evidence from hypotheses and never claim a test passed unless you saw its output."
},
{
"role": "user",
"content": "An OAuth callback began failing after an authentication-library upgrade. Return a JSON object with diagnosis_questions, files_to_inspect, likely_failure_modes, and test_plan."
}
],
"stream": false
}'
Para probar otro modelo, cambia el valor de model:
| Modelo |
Cadena del modelo |
| Kimi K3 |
kimi-k3 |
| GLM-5.2 |
glm-5.2 |
| Qwen3.7 Max |
qwen3.7-max |
| MiniMax M3 |
MiniMax-M3 |
| DeepSeek V4 Pro |
deepseek-v4-pro |
La capitalización es importante para MiniMax-M3.
Puedes comparar la colección más amplia de modelos de GPT Proto o consultar los precios actuales de pago por uso antes de dirigir tráfico de producción.