Especificaciones comparadas
| |
GLM-5.2 |
DeepSeek V4 Pro |
| Desarrollador |
Z.ai (anteriormente Zhipu AI) |
DeepSeek |
| Lanzamiento |
13 de junio de 2026 |
24 de abril de 2026 |
| Parámetros |
753B en total / 40B activos |
1,6T en total / 49B activos |
| Ventana de contexto |
1M de tokens |
1M de tokens |
| Salida máxima |
131.072 tokens |
384K tokens |
| Licencia |
MIT |
MIT |
| Modos de razonamiento |
Alto / Máximo |
Sin razonamiento / Alto / Máximo |
| Entrada de imágenes |
No |
No |
| Compatibilidad con API |
Compatible con Anthropic |
Compatible con OpenAI y Anthropic |
Sobre el papel, estos dos modelos parecen hermanos: ambos son chinos, ambos son modelos de pesos abiertos con arquitectura Mixture-of-Experts y licencia MIT, y ambos cuentan con una auténtica ventana de contexto de 1M de tokens. Sin embargo, sus filosofías arquitectónicas subyacentes son diferentes, y esa diferencia explica buena parte del patrón de benchmarks que veremos a continuación.
¿Por qué importa aquí la arquitectura? Porque una ventana de 1M de tokens solo resulta útil si el modelo puede permitirse utilizarla. La respuesta de Z.ai es IndexShare —reutilizar el mismo indexador de atención en cada cuatro capas de atención dispersa—, lo que, según la tarjeta del modelo, reduce el cálculo por token 2,9× con un contexto completo de 1M. La respuesta de DeepSeek es un sistema de atención híbrido que, según su tarjeta del modelo, funciona con el 27 % de los FLOP y el 10 % de la caché KV de su predecesor V3.2 con la misma longitud. En términos sencillos: GLM-5.2 invirtió su presupuesto de eficiencia en mantener la coherencia a lo largo de trayectorias agénticas muy extensas; DeepSeek lo invirtió en hacer que el contexto largo sea barato de servir. Sinceramente, toda la comparación se resume en esto.
Benchmarks: lo que realmente dicen las cifras
Empecemos por la única cifra independiente y comparable disponible. Artificial Analysis ejecuta su Intelligence Index v4.1 —nueve evaluaciones que incluyen GDPval-AA, Terminal-Bench v2.1, Humanity's Last Exam y GPQA Diamond— en condiciones idénticas para todos los modelos. GLM-5.2 con esfuerzo máximo obtiene 51 puntos, la puntuación más alta de cualquier modelo de pesos abiertos. DeepSeek V4 Pro con el máximo esfuerzo de razonamiento obtiene 44, empatado con MiniMax-M3 en el segundo puesto entre los modelos abiertos. Como referencia, Claude Opus 4.8 se sitúa en 56 y GPT-5.5 en 55, así que la diferencia entre estos dos modelos abiertos es real, pero ninguno está lejos de la frontera propietaria. Ese es un hecho medido de forma independiente.
Todo lo que aparece por debajo de esta línea procede de los proveedores, y lo trataré como tal.
Cuando se solapan las tablas de ambos proveedores, GLM-5.2 lidera: 62,1 frente a 55,4 en SWE-bench Pro, 77,0 frente a 73,6 en MCP-Atlas y 54,7 frente a 48,2 en Humanity's Last Exam con herramientas. Conviene saberlo: la cifra de DeepSeek en SWE-bench Pro no tiene una entrada independiente en la clasificación SEAL de Scale, por lo que esa diferencia de 6,7 puntos se basa completamente en los informes del proveedor.
Después está el territorio indiscutible de DeepSeek: benchmarks que GLM-5.2 simplemente no ha publicado. DeepSeek V4 Pro informa de un 93,5 % en LiveCodeBench, la puntuación más alta de cualquier modelo, abierto o cerrado. Una puntuación de 3206 en Codeforces. Un 90,1 % en GPQA Diamond. Un 95,2 % en HMMT. Y un 80,6 % en SWE-bench Verified, la puntuación más alta entre los modelos de pesos abiertos. Z.ai omitió Verified por completo y pasó directamente al SWE-bench Pro, más difícil. Mi lectura es que ambos laboratorios eligieron benchmarks que favorecen sus puntos fuertes y guardaron silencio allí donde perderían, precisamente por eso la cifra independiente de AA importa más que cualquier tabla individual de un proveedor.
Hay una trampa que no he visto señalar en ninguna otra comparación: las cifras de Terminal-Bench que circulan por ahí no son comparables. Z.ai informa de que GLM-5.2 obtiene 81,0 en Terminal-Bench 2.1. La tarjeta del modelo de DeepSeek informa de 67,9 en Terminal-Bench 2.0, una versión diferente del benchmark. Si ves un artículo que coloca esas dos cifras en la misma columna, cierra la pestaña.
Programación: dos cerebros diferentes
El resumen honesto es que estos modelos destacan en tipos de programación diferentes, y la división es lo bastante clara como para elegir el modelo según la tarea.
GLM-5.2 está diseñado para el largo recorrido. Según las cifras comunicadas por Z.ai, alcanza un 74,4 % en FrontierSWE —un benchmark que mide proyectos de ingeniería abiertos a escala de horas o decenas de horas—, superando ligeramente a GPT-5.5 (72,6 %) y quedándose a menos de un 1 % de Claude Opus 4.8. Su puntuación de 81,0 en Terminal-Bench 2.1 supone un salto de 19 puntos respecto a su predecesor, GLM-5.1. El patrón se repite en todas las evaluaciones de largo recorrido: este modelo se entrenó para mantener un plan a lo largo de una trayectoria compleja y de múltiples pasos sin desmoronarse.
DeepSeek V4 Pro es el especialista algorítmico. LiveCodeBench evalúa problemas de programación competitiva —precisos, autosuficientes y en los que la corrección es lo único que importa—, y ningún modelo del mundo ha publicado una puntuación superior. La puntuación de 3206 en Codeforces y el 95,2 % en HMMT cuentan la misma historia: dada una especificación completa, produce una solución correcta y ajustada.
Imaginemos las dos cargas de trabajo. «Lee este servicio de 200 archivos, entiende las convenciones, propone y ejecuta una refactorización»: ese es el terreno de GLM-5.2 y, con aproximadamente 3K tokens por archivo, 200 archivos suponen 600K tokens de contexto que realmente puede contener. «Aquí tienes un problema completamente especificado; dame un parche correcto de 200 líneas»: DeepSeek hace eso todo el día por una fracción del coste.
El debate de la comunidad en Hacker News capta el equilibrio mejor que cualquier benchmark. Un grupo afirma que DeepSeek es lo bastante barato y bueno para el 95 % del trabajo diario. La réplica del otro grupo: en tareas de largo recorrido, los fallos se acumulan; un modelo que es «suficiente para el 95 %» convierte una ejecución agéntica de varias horas en un desastre, porque los errores del 5 % se van sumando. Ambos tienen razón. Simplemente están describiendo trabajos diferentes.

Precios: precio anunciado frente a factura real
Aquí es donde la mayoría de las comparaciones se equivocan discretamente, porque los precios de DeepSeek cambiaron dos veces este año y la mitad de los artículos que aparecen para esta consulta todavía citan las cifras de abril.
Primero, los hechos. DeepSeek lanzó V4 Pro el 24 de abril con un precio de referencia de 1,74 $ por 1M de tokens de entrada / 3,48 $ por 1M de tokens de salida, junto con un descuento de lanzamiento del 75 %. El 31 de mayo, ese descuento se convirtió en el precio oficial permanente: 0,435 $ de entrada / 0,87 $ de salida por 1M de tokens, con la entrada de aciertos de caché a 0,0036 $ por 1M (según la página oficial de precios de DeepSeek). Esa tarifa de caché importa más de lo que parece: DeepSeek almacena automáticamente en caché los prefijos repetidos, por lo que un agente que reenvía el mismo contexto del repositorio y el mismo prompt del sistema en cada turno paga aproximadamente el 1 % de la tarifa de ausencia de caché por esos tokens. En cargas de trabajo agénticas con mucho uso de caché, la factura efectiva de entrada puede quedar muy por debajo incluso de los 0,435 $ anunciados.
La tarifa publicada de GLM-5.2 en la API independiente de Z.ai es de 1,40 $ de entrada / 4,40 $ de salida por 1M de tokens. (A través de nuestro endpoint de GLM-5.2 es de 1,26 $ / 3,96 $, un 10 % por debajo de la tarifa publicada).
Por token, DeepSeek V4 Pro es aproximadamente 3× más barato en entrada y 5× más barato en salida. ¿Asunto zanjado? No del todo, y esta es la parte que omiten las tablas de precios de los titulares.
El precio por token y el coste por tarea divergen cuando dos modelos utilizan cantidades distintas de razonamiento para completar el mismo trabajo. GLM-5.2 es un modelo que razona intensamente: los datos de consumo de tokens de Artificial Analysis lo sitúan en torno a 42.000 tokens de salida por tarea del Intelligence Index con esfuerzo máximo, más que los que utiliza GPT-5.5 en su configuración más alta. Hagamos las cuentas: 42K tokens de salida a la tarifa publicada de GLM, 4,40 $, suponen unos 0,18 $ de salida por tarea. Los mismos 42K a 0,87 $ de DeepSeek serían menos de 0,04 $, pero el consumo real de tokens por tarea de DeepSeek no se ha publicado en un formato comparable, así que cualquier proporción de coste por tarea debe tratarse como una estimación, no como una medición. La dirección está clara aunque no lo esté el múltiplo exacto: la prima de coste real de GLM por tarea completada es la diferencia de precio por token multiplicada por su apetito de tokens de razonamiento. Presupuesta la factura, no el precio anunciado.
Mi opinión, por si sirve de algo: si el coste es tu limitación principal, esta sección ya ha tomado la decisión por ti: DeepSeek. El resto del artículo es para quienes tienen la capacidad como limitación.
¿Cuál encaja con tu proyecto?
Estás creando un agente de programación para repositorios a gran escala. Elige GLM-5.2. La ventaja independiente en inteligencia (51 frente a 44), el patrón de benchmarks de largo recorrido y el contexto de 1M que fue entrenado específicamente para utilizar de forma coherente apuntan todos en la misma dirección. El coste: pagarás varias veces más por tarea y, en trabajos rápidos y bien especificados, estarás pagando por una profundidad que no necesitas.
Tu carga de trabajo son algoritmos, matemáticas o razonamiento STEM. Elige DeepSeek V4 Pro. Sus resultados en LiveCodeBench y Codeforces son los mejores publicados en cualquier lugar, y los obtienes por 0,87 $/1M de salida. El coste: en tareas de ingeniería abiertas de varias horas, sus puntuaciones inferiores en tareas de largo recorrido sugieren más fallos acumulativos, exactamente el modo de fallo que describen los escépticos de HN.
Tu prioridad es el coste y un alto rendimiento. DeepSeek, sin demasiadas dudas, y estructura tus prompts con prefijos estables para que la tarifa de 0,0036 $ por acierto de caché haga el trabajo pesado. El coste: aceptas el modelo abierto n.º 2 en inteligencia general, algo que probablemente nunca notarás en clasificación, extracción y programación rutinaria.
Cómo acceder a ambos mediante una sola API
El argumento práctico para ejecutar ambos en paralelo: los dos están disponibles mediante un único endpoint y una única clave, por lo que probarlos con pruebas A/B en tu carga de trabajo real solo requiere cambiar una línea. Ambos utilizan el formato de finalización de chat compatible con OpenAI.
import requests
import json
url = "https://gptproto.com/v1/chat/completions"
def ask(model: str, prompt: str) -> str:
payload = json.dumps({
"model": model,
"messages": [{"role": "user", "content": prompt}],
"stream": False
})
headers = {
"Authorization": "GPTPROTO_API_KEY",
"Content-Type": "application/json"
}
response = requests.post(url, headers=headers, data=payload)
return response.json()["choices"][0]["message"]["content"]
task = "Refactor this function to be idempotent: ..."
# Same request, two models — compare on your own workload
print(ask("glm-5.2", task))
print(ask("deepseek-v4-pro", task))
O con cURL:
curl --location 'https://gptproto.com/v1/chat/completions' \
--header 'Authorization: GPTPROTO_API_KEY' \
--header 'Content-Type: application/json' \
--data '{
"model": "glm-5.2",
"messages": [{"role": "user", "content": "Who are you?"}],
"stream": false
}'
Sustituye "glm-5.2" por "deepseek-v4-pro" y la misma llamada accederá al otro modelo. El catálogo completo está en gptproto.com/model.