O que é o GLM-5.3?
O GLM-5.3 é o mais recente modelo focado em programação disponível por meio do GLM Coding Plan, baseado em assinatura, da Z.ai. A Z.ai, anteriormente conhecida como Zhipu AI, desenvolve a família chinesa GLM de modelos de linguagem, visão, imagem, vídeo e agentes.
A documentação oficial atual posiciona o GLM-5.3 para agentes de programação, e não para conversas comuns no navegador. Os desenvolvedores podem selecioná-lo em ferramentas compatíveis com modelos personalizados, incluindo Claude Code, Goose, Codex e Cline. A Z.ai também afirma que as solicitações do Coding Plan feitas pelas rotas anteriores glm-5.2 e glm-5.1 agora são enviadas automaticamente ao GLM-5.3.
Veja o que pode ser verificado hoje:
| Item |
Status confirmado do GLM-5.3 |
| Desenvolvedor |
Z.ai, anteriormente Zhipu AI |
| Disponibilidade atual |
Disponível no GLM Coding Plan da Z.ai |
| ID do modelo |
glm-5.3 |
| ID de contexto estendido |
glm-5.3[1m] |
| Opção de contexto |
Até 1 milhão de tokens por meio da configuração [1m] |
| Esforço de raciocínio |
Baixo, alto e máximo; máximo é o padrão |
| Entrada direta de imagem |
Desativada na configuração atual do Cline |
| Preço padrão da API |
Não publicado |
| Pesos abertos e licença |
Não publicado |
| Benchmarks oficiais ou independentes |
Não publicados |
| Disponibilidade no GPT Proto |
Atualmente indisponível |
Esta tabela é deliberadamente mais curta do que as fichas especulativas de especificações do GLM-5.3 que circulam online. A arquitetura, a contagem de parâmetros, as pontuações de benchmarks e uma licença para pesos abertos continuam desconhecidas. Copiar esses detalhes do GLM-5.2 criaria uma tabela mais impressionante, mas também tornaria a tabela incorreta.
O GLM-5.3 foi lançado? Data de lançamento e status de prévia
O GLM-5.3 foi lançado dentro de um produto: o GLM Coding Plan. O guia de troca de modelos da Z.ai agora exibe “GLM-5.3 Now Live” e afirma que assinantes Lite, Pro e Max podem mudar para ele.
Ainda não existe uma data exata de lançamento do GLM-5.3. As notas de lançamento de modelos gerais da Z.ai ainda não contêm uma entrada datada do GLM-5.3, enquanto suas páginas padrão de visão geral de modelos e preços por token continuam destacando o GLM-5.2. Portanto, a descrição mais segura é a de um lançamento silencioso no Coding Plan, e não de uma implementação pública completa.
Isso também muda a forma como o termo “prévia do GLM-5.3” deve ser entendido. Antes da atualização da documentação, o GLM-5.3 era efetivamente uma palavra-chave monitorada pela comunidade. Agora é um modelo do Coding Plan que pode ser chamado e possui um ID oficial. O que continua incompleto é a documentação sobre o modelo — não sua existência dentro do plano.
Para equipes de produção, essa lacuna é importante. Uma rota pode ser chamada antes que sua arquitetura, cobrança fora de uma assinatura, limites de capacidade, qualidade independente e termos de hospedagem própria sejam conhecidos. A disponibilidade responde a “Posso testá-lo?”. Ela ainda não responde a “Devo substituí-lo por um modelo de produção?”.
Quais recursos do GLM-5.3 estão confirmados?
Um contexto opcional de 1 milhão de tokens
A Z.ai documenta glm-5.3[1m] para desenvolvedores que precisam de um contexto de 1 milhão de tokens. No Claude Code, a configuração também exige que CLAUDE_CODE_AUTO_COMPACT_WINDOW seja definida como 1000000.
O sufixo é importante. Os desenvolvedores não devem presumir que toda solicitação que usa a string simples glm-5.3 recebe automaticamente a mesma configuração de contexto. A janela ampla é relevante para grandes repositórios, históricos longos de agentes, planos de migração e tarefas de depuração em vários arquivos. O custo é um maior consumo de contexto e ciclos de raciocínio potencialmente mais longos.
Um milhão de tokens também não garante que um modelo se lembrará igualmente bem de todas as dependências. A capacidade de contexto mede quanto pode ser enviado. A precisão da recuperação, a retenção de restrições e a estabilidade dos ciclos de ferramentas ainda precisam ser testadas no nível da tarefa.
Esforço de raciocínio baixo, alto e máximo
O GLM-5.3 Coding Plan mapeia diferentes configurações de ferramentas para três níveis reais de esforço:
| Configuração solicitada |
Esforço usado pelo GLM-5.3 |
minimal, light, ou low |
Baixo |
medium ou high |
Alto |
xhigh, max, ou ultra |
Máximo |
| Configuração ausente ou desconhecida |
Máximo por padrão |
O esforço baixo é o ponto de partida adequado para pequenas edições e perguntas simples. Alto é o meio-termo. Máximo destina-se a programação complexa e trabalho com agentes, nos quais um raciocínio mais profundo importa mais do que o custo ou a latência da resposta.
Nenhum benchmark oficial do GLM-5.3 mede atualmente a diferença entre essas configurações. Trate o esforço como uma variável de teste, não como garantia de qualidade. A métrica de produção mais útil é o custo por tarefa aceita após novas tentativas — não se cada solicitação foi executada no nível máximo.
Compatibilidade com agentes de programação
O guia oficial de troca lista três padrões de acesso:
Claude Code e Goose usam o endpoint compatível com Anthropic.
O Codex usa o endpoint /api/v1 da Z.ai.
Cline e outras ferramentas compatíveis podem usar o endpoint de programação no estilo OpenAI.
Este é o sinal mais claro sobre o propósito atual do GLM-5.3. Ele está sendo distribuído como um modelo para geração de código, depuração, perguntas sobre repositórios e tarefas prolongadas com agentes — não como um novo assistente multimodal para consumidores.
Acesso prioritariamente textual, com visão separada
A Z.ai orienta os usuários do Cline a desativar “Suporte a imagens” ao configurar glm-5.3. O Coding Plan oferece separadamente o recurso Vision Understanding por meio de um serviço MCP de visão.
Em linguagem simples: a rota direta atual do GLM-5.3 deve ser tratada como entrada de texto e código. Uma captura de tela ainda pode entrar em um fluxo de trabalho mais amplo da Z.ai por meio de outro serviço, mas isso não prova que o modelo glm-5.3 aceite imagens nativamente.
Essa é uma das maiores lacunas na cobertura inicial do GLM-5.3. A demanda da comunidade por visão é real. No entanto, uma solicitação de recurso não é uma modalidade disponibilizada.
GLM-5.3 vs. GLM-5.2: o que foi realmente atualizado?
A atualização confirmada mais visível é o roteamento: o GLM-5.3 agora é o modelo atual padrão dentro do Coding Plan, e as solicitações anteriores ao GLM-5.2/5.1 são automaticamente encaminhadas para ele. A Z.ai ainda não publicou evidências técnicas suficientes para quantificar a melhoria de qualidade subjacente.
| Área |
GLM-5.2 |
GLM-5.3 |
| Posição no Coding Plan |
Modelo anterior |
Modelo atual |
| ID do modelo |
glm-5.2 |
glm-5.3 |
| Contexto |
1M documentado |
Opção de 1M documentada |
| Configuração de raciocínio |
Esforço flexível |
Baixo, alto e máximo documentados |
| Arquitetura |
744B no total, 40B ativos em MoE |
Não divulgada |
| Pesos abertos |
Disponíveis sob MIT no Hugging Face |
Não publicados |
| Preço padrão da API da Z.ai |
$1,40 de entrada / $4,40 de saída por 1 milhão de tokens |
Não publicado |
| Resultados de programação publicados |
Disponíveis pela Z.ai |
Nenhum publicado para o 5.3 |
| Configuração direta de imagem |
Prioritariamente textual |
Suporte a imagens desativado na configuração atual |
O repositório GLM-5 da Z.ai informa que o GLM-5.2 obteve 81,0 no Terminal-Bench 2.1 e 62,1 no SWE-bench Pro. Também informa que o IndexShare reduziu os FLOPs por token em 2,9 vezes em um contexto de 1 milhão de tokens e que mudanças na decodificação especulativa aumentaram o comprimento de aceitação em até 20%.
Esses são resultados do GLM-5.2 divulgados pelo fornecedor. Eles fornecem uma linha de base, não evidências sobre o GLM-5.3. Ainda não sabemos se o 5.3 altera a arquitetura, adiciona novos dados de treinamento, melhora o uso de ferramentas, reduz os rastros de raciocínio ou simplesmente representa uma revisão mais recente do pós-treinamento disponibilizada pela mesma família.
Outra correção merece ser feita: alguns artigos iniciais chamam o GLM-5.2 de modelo com 753 bilhões de parâmetros. O repositório e a tabela de download atuais da Z.ai o listam como 744B-A40B. O número oficial é o mais seguro para uma comparação com o predecessor.
Desenvolvedores que precisam de um membro documentado e atualmente acessível da mesma família podem usar a API do GLM-5.2 no GPT Proto enquanto aguardam uma rota GLM-5.3 verificada.
Preços do GLM-5.3: quanto custa?
Há duas respostas diferentes para o preço do GLM-5.3, dependendo de “preço” significar a assinatura do Coding Plan ou uma API padrão paga por token.
Assinatura do GLM Coding Plan
A documentação do plano da Z.ai lista acesso por assinatura a partir de US$ 18 por mês. No momento da verificação, sua página pública de assinatura exibia preços promocionais de US$ 12,60 para o Lite, US$ 56 para o Pro e US$ 117,60 para o Max, em comparação com os preços de tabela de US$ 18, US$ 80 e US$ 168. As promoções podem mudar, portanto as equipes devem confirmar o preço no checkout antes de elaborar o orçamento.
| Plano |
Créditos de cinco horas |
Créditos semanais |
| Lite |
2.000 |
10.000 |
| Pro |
12.000 |
60.000 |
| Max |
28.000 |
140.000 |
Os três planos oferecem suporte ao GLM-5.3. O Max não compra um modelo diferente chamado “GLM-5.3 Max”; ele compra uma franquia de uso maior.
Consumo de créditos do GLM-5.3
A visão geral do Coding Plan apresenta estes multiplicadores de crédito para o GLM-5.3:
| Tipo de uso |
Multiplicador de créditos |
| Tokens de entrada |
6,9 |
| Tokens de entrada em cache |
1,7 |
| Tokens de saída |
24 |
A Z.ai cobra metade da taxa padrão de créditos durante os períodos de menor demanda documentados. Isso pode alterar significativamente quanto trabalho uma assinatura comporta, mas créditos não são dólares. Converter esses multiplicadores em um preço inventado por milhão de tokens misturaria dois sistemas de cobrança.
Preço padrão por token da API
A Z.ai não listou o GLM-5.3 em sua página de preços padrão da API. Atualmente, a página informa o preço do GLM-5.2 em US$ 1,40 por milhão de tokens de entrada, US$ 0,26 por milhão de tokens de entrada em cache e US$ 4,40 por milhão de tokens de saída.
Não aplique esses preços ao GLM-5.3. Eles são úteis apenas como referência do predecessor.
O “GLM-5.3 Max” é um modelo separado?
Nenhuma fonte oficial identifica atualmente um modelo separado chamado GLM-5.3 Max.
A palavra “Max” aparece em dois lugares diferentes. Primeiro, Max é o nível mais alto de assinatura do GLM Coding Plan, com 28.000 créditos por período de cinco horas e 140.000 créditos por semana. Segundo, max é a configuração documentada de maior esforço de raciocínio para glm-5.3.
Portanto, uma pesquisa como “GLM-5.3 Max vs. GLM-5.2 Max” geralmente significa comparar ambas as versões no esforço máximo de raciocínio. Ela não estabelece a existência de dois modelos distintos com a marca Max.
Essa comparação ainda não pode ser concluída de forma confiável. O GLM-5.2 tem resultados publicados pelo fornecedor e por fontes independentes; o GLM-5.3 não. Um teste justo exigiria a mesma configuração de agente, conjunto de tarefas, contexto, nível de esforço, política de novas tentativas e critérios de aceitação. Comparar uma demonstração refinada do 5.3 com um benchmark antigo do 5.2 diria muito pouco.
GLM-5.3 vs. Kimi K3 vs. Claude Fable 5
O GLM-5.3 já é discutido ao lado do Kimi K3 e do Claude Fable 5 porque os três visam tarefas exigentes de programação ou de contexto longo. As evidências disponíveis para eles não são equivalentes.
É também por isso que as pesquisas por “GLM-5.3 vs. Kimi K3” ou “GLM-5.3 vs. Fable 5” ainda não têm um vencedor baseado em evidências.
| Modelo |
Status de lançamento |
Contexto |
Entrada de imagem |
Preço padrão por 1M de tokens |
Resultados públicos independentes |
| GLM-5.3 |
Disponível no Coding Plan; detalhes do lançamento completo incompletos |
Opção de 1M |
Desativada na configuração direta atual |
Não publicado |
Ainda não disponível |
| GLM-5.2 |
Lançado integralmente com pesos abertos |
1M |
Não |
$1,40 de entrada / $4,40 de saída |
Disponível |
| Kimi K3 |
Lançado integralmente |
1M |
Sim |
$3 de entrada / $15 de saída |
Disponível |
| Claude Fable 5 |
Lançado integralmente, proprietário |
1M |
Sim |
$10 de entrada / $50 de saída |
Disponível |
Os testes independentes atualmente dão ao Kimi K3 uma pontuação de 60 no Artificial Analysis Intelligence Index. A mesma fonte registra entrada de texto e imagem, contexto de 1 milhão de tokens e uma arquitetura MoE com 2,8 trilhões de parâmetros, dos quais 104 bilhões são ativos. A documentação oficial da Anthropic lista o preço do Claude Fable 5 em US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída, com um contexto de 1 milhão de tokens.
A atual classificação de programação da LMArena também inclui o Kimi K3 e o Fable 5. O GLM-5.3 ainda não foi adicionado. Até que apareça em avaliações reproduzíveis, as afirmações de que o GLM-5.3 supera qualquer um dos modelos são previsões, não comparações.
Para desenvolvedores que precisam escolher hoje:
Escolha o GLM-5.2 quando pesos abertos e menor custo documentado por token forem as prioridades.
Escolha o Kimi K3 quando precisar de um contexto de 1M, entrada de imagens e forte desempenho de programação medido de forma independente.
Escolha o Fable 5 quando o nível mais alto documentado da Anthropic for mais importante do que o custo por token.
Teste o GLM-5.3 se já tiver um Coding Plan da Z.ai, mas mantenha uma alternativa até que seu comportamento e sua cobrança sejam adequados à sua carga de trabalho.
O GPT Proto oferece atualmente acesso à API do Kimi K3 por US$ 2,70 de entrada e US$ 13,50 de saída por milhão de tokens. O Claude Fable 5 também está disponível por US$ 8 de entrada e US$ 40 de saída por milhão de tokens. Essas são alternativas implementáveis enquanto o GLM-5.3 ainda não está no catálogo do GPT Proto.
É possível acessar o GLM-5.3 no GPT Proto?
Não. O GLM-5.3 não está disponível atualmente no GPT Proto.
Não envie glm-5.3 ao endpoint do GPT Proto nem descreva o GPT Proto como provedor do GLM-5.3. Desenvolvedores que precisam de uma rota GLM hoje podem chamar o GLM-5.2. A solicitação a seguir usa a API compatível com OpenAI existente do GPT Proto e o ID real do modelo glm-5.2:
curl "https://gptproto.com/v1/chat/completions" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"model": "glm-5.2",
"messages": [
{
"role": "user",
"content": "Review this implementation plan and identify the three highest-risk dependencies."
}
]
}'
Quando o GLM-5.3 estiver disponível, sua página de modelo ativa — e não uma publicação baseada em rumores — deverá ser a fonte de verdade para a string do modelo, as modalidades, o contexto e o preço no GPT Proto.
Você também pode navegar pela Galeria de modelos de IA do GPT Proto para comparar rotas de texto, raciocínio, imagem, vídeo e multimodais atualmente disponíveis usando uma única chave de API e um único saldo.
Os desenvolvedores devem mudar para o GLM-5.3 agora?
Se você já assina o Coding Plan da Z.ai, vale a pena testar o GLM-5.3 agora. O roteamento automático significa que você talvez já esteja recebendo-o ao solicitar o GLM-5.2 ou o GLM-5.1 por esse produto. Registre o modelo resolvido, o nível de esforço, a configuração de contexto, o uso de tokens, a latência, as novas tentativas e se o resultado passou pela revisão.
Não trate a atualização do roteamento como prova de que toda carga de trabalho melhorou. Um modelo de programação mais recente pode seguir instruções melhor e consumir mais créditos de saída. Pode concluir tarefas mais difíceis, mas responder mais lentamente no esforço máximo. A pergunta útil não é “O número da versão aumentou?”. É “O trabalho aceito ficou mais barato ou mais confiável?”.
Aguarde antes de transformar o GLM-5.3 em uma dependência de produção se você precisar de qualquer um dos seguintes itens:
Um preço estável de API por token
Limites públicos de taxa e garantias de capacidade
Pesos baixáveis e uma licença confirmada
Entrada nativa de imagens na mesma rota do modelo
Resultados independentes de programação, agentes, latência e processamento
Uma página e um endpoint de modelo verificados do GPT Proto
Para um projeto que precisa ser lançado hoje, use um modelo documentado e torne o ID do modelo configurável. Isso permitirá avaliar o GLM-5.3 posteriormente sem reescrever o restante da aplicação.
Veredito final
O GLM-5.3 é real e pode ser chamado, mas seu lançamento é mais restrito do que o nome do modelo sugere. Atualmente, ele é o modelo mais recente dentro do GLM Coding Plan da Z.ai, com uma opção de contexto documentada de 1M, controles de esforço baixo/alto/máximo e compatibilidade com vários agentes de programação.
O que não temos é igualmente importante: nenhuma publicação de lançamento datada, nenhum model card do GLM-5.3, nenhum preço padrão por token, nenhum peso aberto e nenhum relatório de benchmark. Isso torna o GLM-5.3 um candidato plausível para avaliação — mas ainda não um modelo que possa ser comparado honestamente ao Kimi K3, ao Fable 5 ou mesmo ao GLM-5.2 em custo por tarefa bem-sucedida.
Se você já paga pelo Coding Plan, teste-o. Se precisa agora de uma rota de API documentada, comece com GLM-5.2, Kimi K3 ou Claude Fable 5 e mantenha o modelo alternável.