¿Qué es GLM-5.3?
GLM-5.3 es el modelo más reciente orientado a la programación disponible mediante el plan GLM Coding Plan de Z.ai, basado en una suscripción. Z.ai, anteriormente conocida como Zhipu AI, desarrolla la familia china GLM de modelos de lenguaje, visión, imagen, vídeo y agentes.
La documentación oficial actual presenta GLM-5.3 como un modelo para agentes de programación, no para el chat habitual en el navegador. Los desarrolladores pueden seleccionarlo en herramientas compatibles con modelos personalizados, como Claude Code, Goose, Codex y Cline. Z.ai también afirma que las solicitudes del Coding Plan realizadas mediante las rutas anteriores glm-5.2 y glm-5.1 ahora se envían automáticamente a GLM-5.3.
Esto es lo que se puede verificar actualmente:
| Elemento |
Estado confirmado de GLM-5.3 |
| Desarrollador |
Z.ai, anteriormente Zhipu AI |
| Disponibilidad actual |
Disponible en el plan GLM Coding Plan de Z.ai |
| ID del modelo |
glm-5.3 |
| ID de contexto ampliado |
glm-5.3[1m] |
| Opción de contexto |
Hasta 1 millón de tokens mediante la configuración [1m] |
| Esfuerzo de razonamiento |
Bajo, alto y máximo; máximo es el valor predeterminado |
| Entrada directa de imágenes |
Desactivada en la configuración actual de Cline |
| Precio estándar de API |
No publicado |
| Pesos abiertos y licencia |
No publicados |
| Benchmarks oficiales o independientes |
No publicados |
| Disponibilidad en GPT Proto |
Actualmente no disponible |
Esta tabla es deliberadamente más breve que las fichas de especificaciones especulativas de GLM-5.3 que circulan por internet. La arquitectura, el número de parámetros, las puntuaciones de benchmarks y la licencia de pesos abiertos siguen siendo desconocidos. Copiar esos datos de GLM-5.2 haría que la tabla pareciera más impresionante, pero también la volvería incorrecta.
¿Se ha lanzado GLM-5.3? Fecha de lanzamiento y estado de vista previa
GLM-5.3 se ha lanzado dentro de un producto: el GLM Coding Plan. La guía de cambio de modelo de Z.ai ahora muestra “GLM-5.3 Now Live” e indica que los suscriptores Lite, Pro y Max pueden cambiar a él.
Todavía no existe una fecha exacta de lanzamiento de GLM-5.3. Las notas generales de lanzamiento de modelos de Z.ai aún no contienen una entrada fechada para GLM-5.3, mientras que sus páginas estándar de descripción de modelos y precios por token siguen destacando GLM-5.2. Por ello, la descripción más segura es la de un lanzamiento discreto dentro del Coding Plan, no la de una implementación pública completa.
Esto también cambia cómo debe entenderse el término “vista previa de GLM-5.3”. Antes de la actualización de la documentación, GLM-5.3 era, en la práctica, una palabra clave seguida por la comunidad a la espera de noticias. Ahora es un modelo del Coding Plan al que se puede llamar y que tiene un ID oficial. Lo que sigue incompleto es la documentación sobre el modelo, no su existencia dentro del plan.
Para los equipos de producción, esta brecha es importante. Una ruta puede estar disponible antes de que se conozcan su arquitectura, facturación fuera de una suscripción, límites de capacidad, calidad independiente y condiciones de autoalojamiento. La disponibilidad responde a “¿Puedo probarlo?”. Todavía no responde a “¿Debería sustituir con él un modelo de producción?”.
¿Qué funciones de GLM-5.3 están confirmadas?
Un contexto opcional de 1 millón de tokens
Z.ai documenta glm-5.3[1m] para desarrolladores que necesitan un contexto de 1 millón de tokens. En Claude Code, la configuración también requiere que CLAUDE_CODE_AUTO_COMPACT_WINDOW se establezca en 1000000.
El sufijo es importante. Los desarrolladores no deben asumir que todas las solicitudes que utilizan la cadena glm-5.3 sin más reciben automáticamente la misma configuración de contexto. La ventana amplia es relevante para repositorios grandes, historiales extensos de agentes, planes de migración y tareas de depuración en varios archivos. El coste es un mayor consumo de contexto y ciclos de razonamiento potencialmente más largos.
Un millón de tokens tampoco garantiza que el modelo recuerde igual de bien todas las dependencias. La capacidad de contexto mide cuánto se puede enviar. La precisión de recuperación, la retención de restricciones y la estabilidad del ciclo de herramientas aún deben probarse a nivel de tarea.
Esfuerzo de razonamiento bajo, alto y máximo
El Coding Plan de GLM-5.3 asigna diferentes configuraciones de herramientas a tres niveles reales de esfuerzo:
| Configuración solicitada |
Esfuerzo utilizado por GLM-5.3 |
minimal, light o low |
Bajo |
medium o high |
Alto |
xhigh, max o ultra |
Máximo |
| Configuración ausente o desconocida |
Máximo de forma predeterminada |
El esfuerzo bajo es un punto de partida sensato para pequeñas ediciones y preguntas sencillas. Alto es el punto intermedio. Máximo está pensado para programación compleja y trabajo con agentes, donde un razonamiento más profundo importa más que el coste o la latencia de la respuesta.
Actualmente no existe ningún benchmark oficial de GLM-5.3 que mida la diferencia entre estas configuraciones. Considera el esfuerzo una variable de prueba, no una garantía de calidad. La métrica de producción más útil es el coste por tarea aceptada después de los reintentos, no si todas las solicitudes se ejecutaron al máximo.
Compatibilidad con agentes de programación
La guía oficial de cambio enumera tres patrones de acceso:
Claude Code y Goose utilizan el endpoint compatible con Anthropic.
Codex utiliza el endpoint /api/v1 de Z.ai.
Cline y otras herramientas compatibles pueden utilizar el endpoint de programación con estilo OpenAI.
Esta es la señal más clara sobre el propósito actual de GLM-5.3. Se distribuye como un modelo para generación de código, depuración, preguntas sobre repositorios y tareas prolongadas con agentes, no como un nuevo asistente de consumo multimodal.
Acceso centrado en texto, con la visión separada
Z.ai indica a los usuarios de Cline que desactiven “Compatibilidad con imágenes” al configurar glm-5.3. Su Coding Plan ofrece por separado Vision Understanding mediante un servicio MCP de visión.
En términos sencillos: la ruta directa actual de GLM-5.3 debe tratarse como una entrada de texto y código. Una captura de pantalla todavía puede entrar en un flujo de trabajo más amplio de Z.ai a través de otro servicio, pero eso no demuestra que el modelo glm-5.3 subyacente acepte imágenes de forma nativa.
Esta es una de las mayores lagunas en la cobertura inicial de GLM-5.3. La demanda comunitaria de visión es real. Sin embargo, una solicitud de función no equivale a una modalidad disponible.
GLM-5.3 frente a GLM-5.2: ¿qué se actualizó realmente?
La mejora confirmada más visible es el enrutamiento: GLM-5.3 es ahora el modelo actual predeterminado dentro del Coding Plan, y las solicitudes anteriores a GLM-5.2/5.1 se enrutan automáticamente hacia él. Z.ai aún no ha publicado suficientes pruebas técnicas para cuantificar la mejora de calidad subyacente.
| Área |
GLM-5.2 |
GLM-5.3 |
| Posición en el Coding Plan |
Modelo anterior |
Modelo actual |
| ID del modelo |
glm-5.2 |
glm-5.3 |
| Contexto |
1M documentado |
Opción de 1M documentada |
| Configuración de razonamiento |
Esfuerzo flexible |
Bajo, alto y máximo documentados |
| Arquitectura |
744B en total, 40B activos MoE |
No divulgada |
| Pesos abiertos |
Disponibles bajo MIT en Hugging Face |
No publicados |
| Precio estándar de la API de Z.ai |
$1.40 de entrada / $4.40 de salida por cada millón de tokens |
No publicado |
| Resultados de programación publicados |
Disponibles de Z.ai |
Ninguno publicado para 5.3 |
| Configuración directa de imágenes |
Centrada en texto |
Compatibilidad con imágenes desactivada en la configuración actual |
El repositorio GLM-5 de Z.ai informa que GLM-5.2 obtuvo 81,0 en Terminal-Bench 2.1 y 62,1 en SWE-bench Pro. También informa que IndexShare redujo los FLOP por token 2,9 veces con un contexto de 1 millón de tokens y que los cambios en la decodificación especulativa aumentaron la longitud de aceptación hasta un 20 %.
Esos son resultados de GLM-5.2 informados por el proveedor. Ofrecen una referencia, no pruebas sobre GLM-5.3. Aún no sabemos si 5.3 cambia la arquitectura, incorpora nuevos datos de entrenamiento, mejora el uso de herramientas, acorta las trazas de razonamiento o simplemente representa una revisión posterior al entrenamiento servida a través de la misma familia.
También conviene corregir otro dato: algunos artículos iniciales llaman a GLM-5.2 un modelo de 753 mil millones de parámetros. El repositorio y la tabla de descargas actuales de Z.ai lo enumeran como 744B-A40B. La cifra oficial es la opción más segura para una comparación con su predecesor.
Los desarrolladores que necesiten un miembro documentado y actualmente accesible de la misma familia pueden utilizar la API de GLM-5.2 en GPT Proto mientras esperan una ruta verificada de GLM-5.3.
Precios de GLM-5.3: ¿cuánto cuesta?
Hay dos respuestas distintas sobre el precio de GLM-5.3, dependiendo de si “precio” significa la suscripción al Coding Plan o una API estándar de pago por token.
Suscripción al GLM Coding Plan
La documentación del plan de Z.ai indica que el acceso mediante suscripción comienza en 18 $ al mes. Al comprobarlo, su página pública de suscripción mostraba precios promocionales de 12,60 $ para Lite, 56 $ para Pro y 117,60 $ para Max, frente a precios de lista de 18 $, 80 $ y 168 $. Las promociones pueden cambiar, por lo que los equipos deben confirmar el precio de pago antes de elaborar su presupuesto.
| Plan |
Créditos de cinco horas |
Créditos semanales |
| Lite |
2,000 |
10,000 |
| Pro |
12,000 |
60,000 |
| Max |
28,000 |
140,000 |
Los tres planes admiten GLM-5.3. Max no compra un modelo diferente llamado “GLM-5.3 Max”; compra una asignación de uso mayor.
Consumo de créditos de GLM-5.3
La descripción general del Coding Plan asigna a GLM-5.3 estos multiplicadores de créditos:
| Tipo de uso |
Multiplicador de créditos |
| Tokens de entrada |
6.9 |
| Tokens de entrada en caché |
1.7 |
| Tokens de salida |
24 |
Z.ai cobra la mitad de la tarifa estándar de créditos durante sus periodos de menor demanda documentados. Esto puede cambiar considerablemente cuánto trabajo admite una suscripción, pero los créditos no son dólares. Convertir estos multiplicadores en un precio inventado por millón de tokens mezclaría dos sistemas de facturación.
Precio estándar por token de API
Z.ai no ha incluido GLM-5.3 en su página de precios estándar de la API. Actualmente, la página ofrece GLM-5.2 a 1,40 $ por millón de tokens de entrada, 0,26 $ por millón de tokens de entrada en caché y 4,40 $ por millón de tokens de salida.
No apliques esos precios a GLM-5.3. Solo sirven como referencia de su predecesor.
¿Es “GLM-5.3 Max” un modelo independiente?
Actualmente ninguna fuente oficial identifica un modelo independiente llamado GLM-5.3 Max.
La palabra “Max” aparece en dos lugares diferentes. Primero, Max es el nivel de suscripción más alto del GLM Coding Plan, con 28.000 créditos por periodo de cinco horas y 140.000 créditos por semana. Segundo, max es la configuración de esfuerzo de razonamiento más profunda documentada para glm-5.3.
Por tanto, una búsqueda como “GLM-5.3 Max frente a GLM-5.2 Max” normalmente significa comparar ambas versiones con el máximo esfuerzo de razonamiento. No demuestra la existencia de dos modelos independientes con la marca Max.
Esta comparación todavía no puede completarse de forma fiable. GLM-5.2 cuenta con resultados publicados por el proveedor e independientes; GLM-5.3 no. Una prueba justa necesitaría la misma configuración de agente, conjunto de tareas, contexto, nivel de esfuerzo, política de reintentos y criterios de aceptación. Comparar una demostración pulida de 5.3 con un benchmark antiguo de 5.2 aportaría muy poca información.
GLM-5.3 frente a Kimi K3 y Claude Fable 5
GLM-5.3 ya se debate junto a Kimi K3 y Claude Fable 5 porque los tres están orientados a tareas exigentes de programación o de contexto largo. Las pruebas disponibles para cada uno no son equivalentes.
Por eso, las búsquedas de “GLM-5.3 frente a Kimi K3” o “GLM-5.3 frente a Fable 5” todavía no tienen un ganador basado en pruebas.
| Modelo |
Estado de lanzamiento |
Contexto |
Entrada de imágenes |
Precio estándar por 1 millón de tokens |
Resultados públicos independientes |
| GLM-5.3 |
Disponible dentro del Coding Plan; detalles del lanzamiento completo incompletos |
Opción de 1M |
Desactivada en la configuración directa actual |
No publicado |
Todavía no disponibles |
| GLM-5.2 |
Lanzamiento completo con pesos abiertos |
1M |
No |
$1.40 de entrada / $4.40 de salida |
Disponibles |
| Kimi K3 |
Lanzamiento completo |
1M |
Sí |
$3 de entrada / $15 de salida |
Disponibles |
| Claude Fable 5 |
Lanzamiento completo, propietario |
1M |
Sí |
$10 de entrada / $50 de salida |
Disponibles |
Las pruebas independientes otorgan actualmente a Kimi K3 una puntuación de 60 en el Artificial Analysis Intelligence Index. La misma fuente registra entrada de texto e imagen, un contexto de 1 millón de tokens y una arquitectura MoE de 2,8 billones de parámetros, con 104.000 millones de parámetros activos. La documentación oficial de Anthropic indica un precio de Claude Fable 5 de 10 $ por millón de tokens de entrada y 50 $ por millón de tokens de salida, con un contexto de 1 millón de tokens.
La clasificación de código de LMArena actual también incluye Kimi K3 y Fable 5. GLM-5.3 todavía no se ha añadido. Hasta que aparezca en evaluaciones reproducibles, las afirmaciones de que GLM-5.3 supera a cualquiera de los dos modelos son predicciones, no comparaciones.
Para los desarrolladores que deben elegir hoy:
Elige GLM-5.2 cuando lo más importante sean los pesos abiertos y un coste por token documentado más bajo.
Elige Kimi K3 cuando necesites un contexto de 1M, entrada de imágenes y un sólido rendimiento de programación medido de forma independiente.
Elige Fable 5 cuando el nivel más alto documentado de Anthropic importe más que el coste por token.
Prueba GLM-5.3 si ya tienes un Coding Plan de Z.ai, pero conserva una alternativa hasta comprobar que su comportamiento y facturación se ajustan a tu carga de trabajo.
GPT Proto ofrece actualmente acceso a la API de Kimi K3 por 2,70 $ de entrada y 13,50 $ de salida por millón de tokens. Claude Fable 5 también está disponible por 8 $ de entrada y 40 $ de salida por millón de tokens. Son alternativas implementables mientras GLM-5.3 aún no está en el catálogo de GPT Proto.
¿Puedes acceder a GLM-5.3 en GPT Proto?
No. Actualmente GLM-5.3 no está disponible en GPT Proto.
No envíes glm-5.3 al endpoint de GPT Proto ni describas GPT Proto como proveedor de GLM-5.3. Los desarrolladores que necesiten una ruta GLM hoy pueden llamar a GLM-5.2. La siguiente solicitud utiliza la API existente de GPT Proto, compatible con OpenAI, y el ID real del modelo glm-5.2:
curl "https://gptproto.com/v1/chat/completions" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"model": "glm-5.2",
"messages": [
{
"role": "user",
"content": "Review this implementation plan and identify the three highest-risk dependencies."
}
]
}'
Cuando GLM-5.3 esté disponible, su página de modelo activa, no una publicación basada en rumores, deberá ser la fuente de verdad para la cadena del modelo, las modalidades, el contexto y el precio en GPT Proto.
También puedes explorar la Galería de modelos de IA de GPT Proto para comparar rutas de texto, razonamiento, imagen, vídeo y multimodales disponibles actualmente usando una sola clave de API y un solo saldo.
¿Deberían los desarrolladores cambiar a GLM-5.3 ahora?
Si ya estás suscrito al Coding Plan de Z.ai, vale la pena probar GLM-5.3 ahora. El enrutamiento automático significa que quizá ya lo estés recibiendo al solicitar GLM-5.2 o GLM-5.1 mediante ese producto. Registra el modelo resuelto, el nivel de esfuerzo, la configuración de contexto, el uso de tokens, la latencia, los reintentos y si el resultado superó la revisión.
No consideres la actualización del enrutamiento como una prueba de que todas las cargas de trabajo han mejorado. Un modelo de programación más reciente puede seguir mejor las instrucciones y consumir más créditos de salida. Puede terminar tareas más difíciles y responder más lentamente con el esfuerzo máximo. La pregunta útil no es “¿Aumentó el número de versión?”, sino “¿El trabajo aceptado se volvió más barato o fiable?”.
Espera antes de convertir GLM-5.3 en una dependencia de producción si necesitas alguno de los siguientes elementos:
Un precio estable de API por token
Límites de frecuencia públicos y garantías de capacidad
Pesos descargables y una licencia confirmada
Entrada de imágenes nativa en la misma ruta del modelo
Resultados independientes de programación, agentes, latencia y rendimiento
Una página y un endpoint de modelo verificados de GPT Proto
Para un proyecto que deba publicarse hoy, utiliza un modelo documentado y haz configurable el ID del modelo. Así podrás evaluar GLM-5.3 más adelante sin reescribir el resto de la aplicación.
Veredicto final
GLM-5.3 es real y se puede invocar, pero su lanzamiento es más limitado de lo que su nombre sugiere. Actualmente es el modelo más reciente dentro del GLM Coding Plan de Z.ai, con una opción de contexto de 1M documentada, controles de esfuerzo bajo/alto/máximo y compatibilidad con varios agentes de programación.
Lo que no tenemos es igual de importante: ninguna publicación de lanzamiento fechada, ninguna ficha técnica de GLM-5.3, ningún precio estándar por token, ningún peso abierto y ningún informe de benchmarks. Esto convierte a GLM-5.3 en un candidato creíble para evaluación, pero todavía no en un modelo que pueda clasificarse honestamente frente a Kimi K3, Fable 5 o incluso GLM-5.2 según el coste por tarea completada con éxito.
Si ya pagas por el Coding Plan, pruébalo. Si necesitas ahora una ruta de API documentada, empieza con GLM-5.2, Kimi K3 o Claude Fable 5, y mantén el modelo intercambiable.