Tres días es demasiado poco tiempo para tomar una decisión de producción segura sobre un modelo nuevo. Esa es exactamente la situación de la comparación entre Qwen 3.8 Max y GLM 5.2 el 22 de julio de 2026: un lado es una versión preliminar que cambia rápidamente, mientras que el otro tiene una API versionada, pesos publicados, una ventana de contexto de 1 millón de tokens y datos de evaluación independientes.
La respuesta breve: elige GLM-5.2 para un agente de programación en producción hoy. Tiene un contrato de implementación más claro, facturación predecible por token, pesos descargables con licencia MIT y un ID de modelo estable. Prueba Qwen3.8-Max-Preview si te interesan sus primeros resultados en frontend y estás dispuesto a repetir la evaluación cada vez que Alibaba actualice la versión preliminar.
Todavía no migraría una carga de trabajo de producción a Qwen3.8 Max. Esto no significa que GLM-5.2 vaya a seguir siendo el mejor modelo. Es una valoración de las pruebas disponibles en este momento.
| Decisión |
Mejor opción hoy |
Por qué |
| API de programación para producción |
GLM-5.2 |
API versionada, precios publicados y especificaciones estables |
| Tareas con repositorios grandes |
GLM-5.2 |
Contexto documentado de 1 millón y entrenamiento para tareas de larga duración |
| Autoalojamiento |
GLM-5.2 |
Los pesos con licencia MIT están disponibles ahora |
| Experimentación inicial en frontend |
Qwen3.8-Max-Preview |
Primeros informes sólidos, pero el comportamiento todavía está cambiando |
| Evaluación reproducible |
GLM-5.2 |
Hay datos independientes sobre GLM; no existe información equivalente sobre Qwen3.8 |
Primero: «Max» no significa lo mismo
El nombre oficial del modelo de Alibaba es Qwen3.8-Max-Preview. Aquí, Max identifica la categoría del modelo. El sufijo Preview es igual de importante: Alibaba anunció el modelo el 19 de julio, afirmó que los pesos abiertos llegarían «pronto» y puso la versión preliminar a disposición mediante Token Plan, Qoder y QoderWork.
GLM-5.2 utiliza Max de otra forma. GLM-5.2 es el modelo; High y Max son ajustes seleccionables del esfuerzo de razonamiento. Max puede dedicar más computación a una tarea difícil, pero no es un punto de control independiente llamado «GLM-5.2 Max».
Esta distinción corrige dos errores habituales en los resultados de búsqueda. Qwen3.8 Max no es Qwen3 Max, Qwen3.7 Max ni Qwen3-8B. Del mismo modo, un resultado de Artificial Analysis para Qwen3 Max no se convierte en un benchmark de Qwen3.8 porque los nombres se parecen.
Alibaba también confirmó que la versión preliminar cambiaba a diario y comunicó una actualización posterior con mejoras en trabajos de frontend web. Esto hace que todos los resultados de Qwen3.8 dependan de la fecha. Para consultar el historial de lanzamientos y las especificaciones que Alibaba no ha publicado, visita nuestra guía independiente de Qwen 3.8 Max.
<!-- INTERNAL LINK TODO: Link the first occurrence of “Qwen3.8-Max-Preview” to its GPT Proto model page after the model is live. -->
Qwen 3.8 Max y GLM 5.2 de un vistazo
La comparación más útil empieza por lo que un desarrollador puede implementar realmente. Las cifras de parámetros vienen después.
| Categoría |
Qwen3.8-Max-Preview |
GLM-5.2 |
| Estado del producto |
Versión preliminar que Alibaba afirma que sigue evolucionando |
Modelo publicado y versionado |
| Acceso actual |
Token Plan, Qoder y QoderWork |
API, planes de programación y pesos descargables |
| Límite de contexto público |
No documentado para la versión preliminar |
1.000.000 de tokens |
| Salida máxima pública |
No documentada para la versión preliminar |
Hasta 131.072 tokens en las configuraciones publicadas |
| Tamaño del modelo |
2,4 T de parámetros totales declarados por Alibaba; cantidad activa no divulgada |
Aproximadamente 753.000 millones en total y 40.000 millones activos por token |
| Pesos |
Prometidos, pero no publicados a 22 de julio |
Publicados bajo la licencia MIT |
| Modelo de precios |
Suscripción mensual con Credits |
Facturación de API por token o autoalojamiento |
| Evaluación independiente |
Todavía no existe una evaluación completa de Qwen3.8 |
Artificial Analysis Intelligence Index: 51 |
| Disponibilidad en GPT Proto |
Todavía no está disponible |
Disponible ahora |
Las celdas de Qwen que faltan no son descuidos. Una versión preliminar no hereda una ventana de contexto, una cantidad de parámetros activos ni una licencia de Qwen3.7 solo porque esas cifras harían que la tabla pareciera completa.
La cifra de 2,4 T aparece realmente en un anuncio de Alibaba. Su significado operativo aún no está claro. Sin conocer la cantidad de expertos activos ni los detalles de servicio, el total de parámetros no nos indica la latencia, los requisitos de memoria ni el coste por tarea de programación completada.
GLM-5.2 muestra más información. El informe de lanzamiento de Z.ai documenta el contexto de 1 millón, la licencia MIT, los niveles de esfuerzo High y Max y un diseño IndexShare que reduce la computación del indexador 2,9× con la longitud de contexto completa. También informa de un aumento del 20 % en la longitud de aceptación de la decodificación especulativa. Son mediciones del proveedor, pero la arquitectura y la configuración de evaluación son lo bastante públicas como para inspeccionarlas.
Rendimiento de programación: benchmarks frente a un repositorio desordenado
En los benchmarks de programación, GLM-5.2 tiene cifras que pueden analizarse con ciertas salvedades. Z.ai informa de 62,1 en SWE-bench Pro y 81,0 en Terminal-Bench 2.1 usando Terminus-2. Su mejor configuración comunicada para Terminal-Bench alcanza 82,7. La tarjeta oficial del modelo también revela el ejecutor, los límites de tokens, los tiempos de espera y las restricciones de recursos utilizados en estas pruebas.
Siguen siendo resultados comunicados por el proveedor. Los utilizaría para identificar fortalezas, no para declarar un ganador universal.
La perspectiva independiente es más limitada, pero útil. Artificial Analysis asigna a GLM-5.2 Max una puntuación de 51 en Intelligence Index v4.1. El modelo Qwen de esa página comparativa es Qwen3 Max Thinking, un modelo anterior, y su puntuación aparece marcada como estimada. No demuestra que GLM-5.2 supere a Qwen3.8 Max por 51 a 32.
La afirmación de lanzamiento de Qwen es mucho más amplia: Alibaba describió Qwen3.8 como comparable con los principales modelos de frontera y solo por detrás de Fable 5. No se publicó ninguna tabla de benchmarks ni metodología junto con esa clasificación. Hecho: la afirmación procedía del fabricante del modelo. Mi valoración: es demasiado pronto para utilizarla en una decisión de compra.
Una prueba de 36Kr del 22 de julio sobre un proyecto web desordenado y a medio terminar nos ofrece una comparación más concreta. El proyecto contenía un frontend de Next.js, Payload CMS, código de animación, documentación antigua, funciones existentes y errores entrelazados de frontend y backend. Qwen3.8-Max-Preview quedó primero al identificar el estado actual del proyecto, iniciar el servicio CMS que faltaba y aplicar una actualización visual amplia. En la tarea inicial de lectura del proyecto, terminó en menos de 10 segundos en esa configuración concreta.
GLM-5.2 ganó una tarea más limitada de implementación de un carrusel. Conservó la reproducción automática, el control de arrastre y un bucle continuo real, aunque la transición todavía mostraba un salto visual. Qwen avanzó más rápido, pero eliminó el comportamiento de arrastre e implementó una imitación alargada de un bucle que finalmente volvería al inicio de forma abrupta.
Ese intercambio resulta más informativo que declarar un ganador en una sola línea. Qwen pareció mejor para comprender la intención actual y avanzar rápidamente. GLM pareció mejor cuando importaban la conservación de funciones y la integridad de la ingeniería. Un solo proyecto no puede establecer una clasificación general de velocidad, especialmente cuando difieren la ruta de servicio y la versión del modelo. Sí puede mostrar los modos de fallo que conviene probar.
Cómo interpretar las pruebas de forma justa
La prueba pública de código heredado es útil, pero no es un benchmark controlado. Utilizó el mismo proyecto sin terminar y un flujo de trabajo basado en OpenCode, lo que hace que la comparación sea más informativa que unas capturas de pantalla sin relación. No publicó suficientes detalles sobre las rutas de servicio, los presupuestos de tokens o las revisiones del modelo como para que todos los resultados sean reproducibles.
Esto cambia lo que la prueba puede demostrar. Puede mostrar modos de fallo característicos: Qwen avanzó rápidamente y entendió bien la intención actual del proyecto, pero también eliminó una interacción solicitada y la sustituyó por una implementación incompleta del bucle. GLM conservó más comportamiento requerido en esa tarea, aunque fue más lento en el análisis inicial y en una ocasión trató documentación obsoleta como trabajo actual.
No puede demostrar que Qwen sea siempre más rápido, que GLM escriba siempre código más seguro o que cualquiera de los dos modelos se comporte igual después de la próxima actualización preliminar de Qwen.
Clasificaría las pruebas disponibles en tres niveles. Las evaluaciones independientes tienen más peso, pero hoy cubren GLM-5.2 y no Qwen3.8 Max. Después viene una prueba pública sobre el mismo proyecto porque muestra errores reales de ingeniería, aunque la configuración no sea totalmente reproducible. Las clasificaciones y afirmaciones de lanzamiento de los proveedores quedan en último lugar hasta que un evaluador externo las confirme.
Esta brecha de evidencia forma parte de la decisión de compra. Si no puedes ejecutar una comparación privada, GLM-5.2 es la opción de producción de menor riesgo porque su versión, precios, pesos, límite de contexto y puntuación independiente ya están documentados. Qwen3.8 Max sigue siendo una versión preliminar con mayor incertidumbre: suficientemente interesante para observarla, pero no suficientemente documentada para sustituir por sí sola un valor predeterminado de producción basándose únicamente en los primeros informes.
Precios y costes de Qwen 3.8 Max frente a GLM 5.2
Esta no es una comparación normal de precios por token.
Qwen3.8-Max-Preview se encuentra actualmente dentro del Token Plan de Alibaba. Los precios actuales de lanzamiento para particulares son de 6 $ al mes para Lite, 18 $ para Standard y 68 $ para Pro, con aproximadamente 10.000, 40.000 y 160.000 Credits mensuales, respectivamente. Los Credits no son tokens. Su consumo puede variar según el modelo, el razonamiento, la caché y las llamadas a herramientas, por lo que no existe una conversión pública defendible a un precio de Qwen3.8 por millón de tokens.
GLM-5.2 utiliza una facturación convencional por token. En la página de la API de GPT Proto para GLM-5.2, la tarifa actual es de 1,26 $ por 1 millón de tokens de entrada y 3,96 $ por 1 millón de tokens de salida. La tarifa directa publicada por Z.ai es de 1,40 $ para la entrada y 4,40 $ para la salida. Ambas cifras deben comprobarse de nuevo antes de publicar o realizar una compra importante, ya que los precios de los modelos cambian.
Para una carga de trabajo mensual con 10 millones de tokens de entrada y 2 millones de tokens de salida, el cálculo de GPT Proto es:
10 × $1.26 + 2 × $3.96 = $20.52
Esta cifra es útil porque la unidad está clara. El plan Qwen Lite de 6 $ tiene un precio inicial inferior, pero eso no demuestra que Qwen sea más barato para la misma carga de trabajo. Haría falta conocer el consumo real de Credits tras varias ejecuciones.
Mi conclusión sobre el coste es condicional: GLM-5.2 es más fácil de presupuestar y medir. Qwen3.8 podría ser más barato para un desarrollador individual cuyo trabajo se ajuste a la cuota de la suscripción, pero los datos públicos no respaldan una afirmación equivalente por número de tokens.
¿Cuál es mejor para las tareas de programación?
Elige GLM-5.2 si necesitas lanzar el producto ahora. Es la mejor opción predeterminada para agentes que trabajan con repositorios, tareas de larga duración, entornos regulados que requieren fijar versiones y equipos que necesitan contabilizar el coste de cada solicitud. También es la única opción actual de las dos para el autoalojamiento: los pesos y la licencia MIT ya existen.
Elige Qwen3.8-Max-Preview para una línea de evaluación, no como tu única dependencia de producción. Sus primeros resultados hacen que valga la pena probarlo para trabajos de frontend, análisis del estado actual y tareas en las que la iteración rápida importa más que la reproducibilidad exacta. El coste es la deriva de versiones: Alibaba afirma que la versión preliminar sigue cambiando, y el lanzamiento de pesos abiertos todavía no tiene una fecha ni una licencia confirmadas.
Por tanto, la respuesta práctica a «Qwen 3.8 Max frente a GLM 5.2: ¿cuál es mejor?» es asimétrica. GLM-5.2 gana la decisión de producción hoy. Qwen3.8 Max puede ganar tareas individuales, pero todavía no ha aportado pruebas estables suficientes para ganar la decisión sobre la plataforma.
Cómo ejecutar GLM-5.2 mediante GPT Proto
GPT Proto ofrece GLM-5.2 mediante un endpoint compatible con OpenAI. Crea una clave de API, añádela a tu entorno y llama a la cadena de modelo disponible glm-5.2. El mismo saldo también puede utilizarse en la colección de modelos de GPT Proto.
Primero, configura la clave y realiza una solicitud cURL:
export GPTPROTO_API_KEY="your_gptproto_api_key"
curl https://gptproto.com/v1/chat/completions \
-H "Authorization: Bearer $GPTPROTO_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2",
"messages": [
{
"role": "system",
"content": "Inspect before editing. Preserve API contracts and report the tests required for every proposed change."
},
{
"role": "user",
"content": "Plan a safe fix for duplicate refresh-token requests after concurrent 401 responses. State assumptions and verification steps before proposing code."
}
]
}'
La llamada equivalente en Python utiliza el SDK de OpenAI:
python -m pip install openai
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["GPTPROTO_API_KEY"],
base_url="https://gptproto.com/v1",
)
response = client.chat.completions.create(
model="glm-5.2",
messages=[
{
"role": "system",
"content": (
"You are a repository-level coding assistant. Inspect before "
"proposing changes. Preserve existing API contracts, do not add "
"dependencies without approval, and list the verification "
"commands required for every proposed edit."
),
},
{
"role": "user",
"content": (
"An API client occasionally sends two refresh-token requests "
"after several concurrent requests fail with 401. Identify the "
"likely race condition, list the files you would inspect, and "
"return a minimal repair plan before writing code."
),
},
],
)
print(response.choices[0].message.content)
Este código solicita intencionadamente un plan de inspección antes de realizar una edición. Un modelo de programación que inventa archivos o cambia inmediatamente un contrato de API ha fallado la tarea, aunque su respuesta parezca pulida.
Qwen3.8 Max no está disponible actualmente en GPT Proto, por lo que aquí no hay ningún bloque de código de Qwen. Añadir uno con un endpoint inventado daría a entender que existe una disponibilidad que no existe. Cuando el modelo esté disponible, sustituye esta nota por una solicitud equivalente usando el mismo prompt y añade el enlace a la página del modelo. Hasta entonces, los desarrolladores pueden empezar con la API de GLM-5.2 o explorar otros modelos desde la página de inicio de GPT Proto.