A versão em uma frase
GLM 5.2 é o principal modelo de linguagem com pesos abertos da Z.ai, lançado em 13 de junho de 2026, desenvolvido especificamente para codificação, raciocínio e trabalho "agêntico" orientado por ferramentas — o tipo de tarefa com várias etapas em que um modelo planeja, chama ferramentas, lê resultados e revisa o trabalho ao longo de uma sessão extensa.
A Z.ai é a marca internacional da Zhipu AI, uma empresa de pesquisa de Pequim que se separou do Knowledge Engineering Group da Universidade Tsinghua em 2019. "Pesos abertos" é a expressão fundamental: os parâmetros reais do modelo são publicados no Hugging Face (em zai-org/GLM-5.2) e no ModelScope e Ollama, sob uma licença MIT e sem restrições regionais. Você pode hospedá-lo por conta própria, ajustá-lo e lançá-lo em um produto comercial sem pedir autorização a ninguém.
Por que um modelo de codificação com pesos abertos é mais importante do que os benchmarks
Antes do mecanismo, a motivação. O motivo pelo qual esse lançamento chamou atenção não é ser o modelo mais inteligente do mundo — não é. É ter fechado a maior parte da distância para os modelos de fronteira fechados, sendo gratuito para baixar e barato para usar. Para um desenvolvedor, isso muda a matemática de duas decisões que antes pareciam resolvidas.
A primeira é a dependência do fornecedor. Se seu agente de codificação roda em uma API fechada, você não pode executá-lo offline, não pode inspecioná-lo e seu preço será o que o fornecedor decidir no próximo trimestre. Os pesos abertos removem as três restrições de uma só vez. A segunda é o custo. O preço de API divulgado para o GLM 5.2 é de US$ 1,40 por milhão de tokens de entrada e US$ 4,40 por milhão de tokens de saída, o que a Z.ai posiciona como aproximadamente um sexto do custo de modelos de fronteira comparáveis. Para uma carga de trabalho que consome tokens — e a codificação agêntica consome muitos — essa proporção é o ponto principal.
A ressalva, porque sempre existe uma: os pesos abertos podem ser hospedados com segurança por você, mas encaminhar seus dados pela API de nuvem da Z.ai significa que eles passam por uma infraestrutura sujeita à Lei de Inteligência Nacional da China, e o Departamento de Segurança Interna dos EUA alertou que essa estrutura pode obrigar empresas chinesas a entregar dados sobre pessoas nos EUA. Os dois fatos coexistem — pesos gratuitos e inspecionáveis que você pode executar em qualquer lugar, e uma API hospedada com uma questão real de jurisdição de dados. Qual deles se aplica a você depende inteiramente de hospedar o modelo por conta própria ou chamar a nuvem. Voltarei a esse ponto.
Como ele funciona, sem simplificações vagas
O GLM 5.2 é um modelo Mixture-of-Experts (MoE). O tamanho divulgado é de aproximadamente 744 a 753 bilhões de parâmetros totais — as fontes divergem um pouco, o que por si só indica que o número preciso ainda está sendo definido — com apenas cerca de 40 bilhões ativos para cada token.
Essa divisão é o truque central, então vale uma analogia. Um modelo denso é como um generalista que precisa pensar em tudo para cada pergunta. Um modelo MoE é mais parecido com uma grande empresa: ele contém o conhecimento de uma organização muito grande, mas, para cada tarefa, acorda apenas os poucos especialistas relevantes. Você obtém a capacidade de um modelo com 744 bilhões de parâmetros pelo custo de execução aproximado de um modelo de 40 bilhões. Comparado ao antecessor GLM 4.5 — 355B no total, 32B ativos — o GLM 5 ampliou a empresa (para 744B / 40B) e foi treinado com mais dados (28,5 trilhões de tokens, contra 23 trilhões).
Outros três elementos são importantes, e cada um existe para resolver um problema específico, não para inflar uma lista de recursos.
O primeiro é um design de atenção esparsa que a Z.ai chama de IndexShare. O problema que ele resolve é o crescimento doloroso do custo da atenção à medida que a janela de contexto fica longa — e a janela do GLM 5.2 é muito longa (falaremos mais sobre isso abaixo). Normalmente, um modelo recalcula a quais tokens anteriores deve dar atenção em cada camada. O IndexShare calcula esse índice uma vez na primeira de cada quatro camadas de atenção e o reutiliza nas três seguintes. A Z.ai afirma que isso reduz em 75% o custo de indexação do produto escalar nessas camadas reutilizadas e em cerca de 2,9× a computação por token no contexto completo de um milhão de tokens. Em termos simples: é o que torna viável executar um contexto de um milhão de tokens.
O segundo são os modos duplos de raciocínio — duas configurações selecionáveis de esforço de pensamento chamadas High e Max. Max é para codificação difícil e com várias etapas, quando o modelo precisa de espaço para planejar e revisar; ele pode consumir quase 85.000 tokens de saída em uma única tarefa. High abre mão de apenas alguns pontos de desempenho, reduzindo aproximadamente pela metade a saída de tokens, e é a opção quando latência e custo importam mais do que o último ponto percentual. A conclusão em uma frase: use Max quando a correção for essencial e High no trabalho cotidiano.
O terceiro é a predição de múltiplos tokens, que permite ao modelo prever vários tokens em uma única passagem direta, em vez de um por vez — inferência mais rápida e, como efeito colateral, melhor coerência de longo alcance.
Juntos, esses elementos levam ao principal destaque prático: a janela de contexto: até 1.000.000 de tokens de entrada (por meio do identificador glm-5.2[1m]), com saída de até 131.072 tokens. Isso equivale a aproximadamente cinco vezes o limite de ~200.000 tokens do GLM 5.1. Um milhão de tokens é suficiente para manter uma base de código de tamanho médio inteira no contexto ao mesmo tempo — exatamente o caso de uso para o qual todo o design foi direcionado.
Quão bom ele é, de verdade
Aqui, é importante separar os níveis de confiança, então vou deixar explícito o que é fato e o que é um número divulgado.
O fato: a Z.ai lançou o GLM 5.2 sem nenhum conjunto de benchmarks oficial. Todo número que você viu circulando foi divulgado pelo fornecedor posteriormente ou vem de avaliações independentes iniciais, e nada disso foi amplamente reproduzido ainda. Considere os decimais específicos como indicativos, não como verdade absoluta.
Com essa ressalva, os números divulgados são consistentes entre as fontes e apontam na mesma direção. No Terminal-Bench 2.1 (codificação autônoma baseada em terminal), o GLM 5.2 teria obtido 81,0 — um grande salto em relação aos 62,0 do GLM 5.1 e a cerca de quatro pontos dos 85,0 do Claude Opus 4.8. No SWE-bench Pro (resolução de problemas reais de engenharia de software), teria obtido 62,1, à frente do GPT-5.5, com 58,6, e do próprio antecessor, com 58,4, mas atrás do Claude Opus 4.8, com 69,2. No Intelligence Index da Artificial Analysis, teria obtido 51 — a maior pontuação de qualquer modelo com pesos abertos.
O que dá mais peso a esses números do que à tabela habitual de um fornecedor é a confirmação independente, mais difícil de manipular. Na Arena.ai, na Code Arena — uma tabela Elo baseada em votos humanos pareados e cegos — o GLM 5.2 teria ficado em segundo lugar geral. Já na Design Arena, baseada na contribuição da comunidade, teria ficado em primeiro lugar, com Elo de 1360, à frente até do Claude Fable 5. Votos cegos de preferência humana são muito mais difíceis de manipular do que uma taxa de aprovação autodeclarada, então esses são os dois resultados em que eu mais confiaria.
Minha leitura, apresentada como opinião e não como fato: o GLM 5.2 é o modelo de codificação com pesos abertos mais forte disponível atualmente, supera o GPT-5.5 em várias tarefas de codificação e fica atrás do Claude Opus 4.8 no trabalho mais difícil e de longo horizonte por algo entre um e aproximadamente treze pontos, dependendo da tarefa. É próximo, não superior — por uma fração do preço.
GLM 5.2 vs Claude Opus 4.8 vs GPT-5.5
Para quem está escolhendo entre os três, as compensações são claras. A tabela reúne pontuações divulgadas em benchmarks de codificação e os fatos que não mudam (preço, contexto e licença):
| |
GLM 5.2 |
Claude Opus 4.8 |
GPT-5.5 |
| Pesos |
Abertos (MIT) |
Fechados |
Fechados |
| Janela de contexto |
1M tokens |
1M tokens |
1M tokens |
| Preço da API (entrada / saída, por 1M) |
US$ 1,40 / US$ 4,40 |
US$ 5,00 / US$ 25,00 |
US$ 5,00 / US$ 30,00 |
| Terminal-Bench 2.1 (divulgado) |
81,0 |
85,0 |
— |
| SWE-bench Pro (divulgado) |
62,1 |
69,2 |
58,6 |
| Hospedável por conta própria |
Sim |
Não |
Não |
O resumo honesto: o Claude Opus 4.8 ainda é o mais capaz dos três na codificação agêntica mais difícil, e é a opção padrão segura quando você está pagando pela correção em execuções autônomas longas. O GPT-5.5 fica no meio nesses benchmarks específicos de codificação. O argumento a favor do GLM 5.2 não é "ele é o melhor" — é "ele está a poucos pontos do melhor, é aberto e custa uma fração do preço". Se você é sensível a custos, quer hospedar o modelo por conta própria ou deseja ajustá-lo, esse argumento é forte. Se você executa agentes de missão crítica e longo horizonte, nos quais alguns pontos de confiabilidade compensam o investimento, o Claude Opus 4.8 é a escolha mais conservadora. O preço do Claude é publicado pela Anthropic; os valores do GLM são as tarifas divulgadas pela Z.ai.
Se quiser fazer um teste A/B dos dois concorrentes fechados usando seus próprios prompts, ambos podem ser acessados por uma única API no GPT Proto — Claude Opus 4.8 (thinking) e GPT-5.5 — por uma tarifa fixa de US$ 4 por milhão de tokens cada. (Essa tarifa fixa é do GPT Proto; a divisão de US$ 5,00 / US$ 25,00 entre entrada e saída na tabela acima é o preço de lista da própria Anthropic para o Opus 4.8 — o mesmo modelo, duas estruturas de preço diferentes.) Colocar as três famílias atrás de uma única chave é a maneira mais barata de fazer a comparação por conta própria.
GLM 5.2 vs os modelos GLM que você pode usar hoje
O próprio GLM 5.2 é distribuído como pesos abertos que você baixa e hospeda — a API hospedada da Z.ai é a única maneira oficial de chamá-lo, e, como mencionado acima, isso envolve uma questão de jurisdição de dados. Mas a linha GLM não começou no 5.2, e o salto em relação às versões anteriores é a maneira mais clara de ver o que realmente mudou.
A comparação mais útil é com o GLM 5.1, o antecessor imediato. Duas diferenças se destacam. A janela de contexto passou de aproximadamente 200.000 tokens para 1.000.000 — um salto de cinco vezes que é a principal atualização. E, na codificação, os ganhos divulgados são grandes: o Terminal-Bench 2.1 subiu de 62,0 para 81,0, e o SWE-bench Pro, de 58,4 para 62,1. Em outras palavras, a posição do GLM 5.2 nas tabelas de classificação é, em grande parte, resultado da melhoria em relação ao próprio lançamento anterior, não de um pequeno ajuste.
Se preferir chamar hoje um GLM hospedado por meio de uma única API compatível com OpenAI, em vez de configurar os pesos abertos, os modelos GLM atualmente disponíveis no GPT Proto são os que vêm logo antes do 5.2 na linhagem:
| Modelo |
Preço do GPT Proto (por 1M tokens) |
Observações |
| GLM-5 |
US$ 0,90 |
A versão base do GLM 5 |
| GLM-5-turbo |
US$ 1,08 |
Variante otimizada para velocidade e custo |
| GLM-5.1 |
US$ 1,26 |
A versão imediatamente anterior ao 5.2 |
O GLM-5.1 é o modelo mais próximo do 5.2 que você pode chamar aqui — mesma família, uma geração anterior, com contexto de ~200 mil tokens em vez de 1M. Para muitos trabalhos de codificação, essa é uma diferença que você não notará; para tarefas em escala de repositório que precisam manter toda a base de código no contexto ao mesmo tempo, é a lacuna que o 5.2 fecha. As tarifas completas por token de todos os modelos estão na página de modelos.
Usando o GLM 5.2 no Claude Code e um exemplo executável
Um detalhe torna a linha GLM especialmente fácil de integrar a fluxos de trabalho existentes: o GLM 5.2 oferece um endpoint compatível com Anthropic. Ferramentas desenvolvidas para conversar com o Claude — Claude Code, Cline e OpenCode — podem apontar diretamente para ele, trocando o modelo por trás de um agente de codificação sem reescrever a integração. É por isso que "GLM 5.2 no Claude coding" é um padrão real, e não apenas uma frase de pesquisa: a estrutura do agente permanece igual; apenas o modelo subjacente muda. (Para o 5.2 especificamente, isso significa usar o endpoint da própria Z.ai ou uma implantação hospedada por você, já que os pesos abertos são a rota oficial.)
Se preferir não gerenciar uma implantação, a opção prática hoje é chamar um GLM hospedado por meio da API compatível com OpenAI do GPT Proto. Veja o exemplo com o GLM 5.1 — o modelo irmão mais próximo disponível — que serve como uma boa referência antes de decidir se o contexto adicional do 5.2 vale a pena para hospedagem própria:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_GPTPROTO_API_KEY",
base_url="https://api.gptproto.com/v1",
)
resp = client.chat.completions.create(
model="glm-5.1",
messages=[
{
"role": "user",
"content": (
"Refactor this function for readability and explain the change:\n\n"
"def f(x):\n"
" return [i for i in x if i % 2 == 0]"
),
}
],
)
print(resp.choices[0].message.content)
A mesma solicitação com cURL:
curl https://api.gptproto.com/v1/chat/completions \
-H "Authorization: Bearer $GPTPROTO_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.1",
"messages": [
{"role": "user", "content": "Write a Python function that returns the nth Fibonacci number, iteratively."}
]
}'
Troque glm-5.1 por glm-5 ou glm-5-turbo para trocar qualidade por custo, ou por claude-opus-4-8-thinking / gpt-5.5 para executar a comparação exata da tabela acima — tudo usando a mesma chave.
Você precisará da chave primeiro: crie uma no painel do GPT Proto, insira-a em YOUR_GPTPROTO_API_KEY e a chamada acima funcionará sem alterações. As tarifas por token de todos os modelos estão na página de modelos caso queira calcular os custos antes de se comprometer.
Onde ele se destaca e onde não se destaca
Os pontos fortes são concretos: ele é o principal modelo de codificação com pesos abertos nas tabelas de classificação existentes, é distribuído sob uma licença MIT genuinamente permissiva, o contexto de um milhão de tokens é real e acessível de executar graças ao IndexShare, e a relação custo-desempenho é a melhor da categoria.
As fraquezas são igualmente concretas e vale a pena declará-las claramente, em vez de escondê-las. Ele fica atrás do Claude Opus 4.8 na codificação mais difícil e de longo horizonte — a diferença é pequena, mas consistente. A Z.ai não publicou benchmarks oficiais, então os números carregam um asterisco até que mais laboratórios independentes os reproduzam. E a questão da jurisdição dos dados da API na nuvem é legítima: se seus dados não podem deixar legal ou contratualmente determinado território, a API hospedada da Z.ai é a porta errada — hospede você mesmo os pesos abertos, que é justamente o motivo pelo qual eles são abertos.
Quem deve usá-lo e quem não deve
Use o GLM 5.2 se você é um desenvolvedor que quer capacidade de codificação próxima à de fronteira sem os preços de fronteira, se precisa hospedar ou ajustar o modelo por conta própria, ou se está desenvolvendo um produto agêntico sensível a custos, no qual o gasto com tokens domina. Ele é especialmente adequado para quem já tem uma estrutura de agente compatível com Claude e quer colocar um mecanismo mais barato por trás dela.
Prefira o Claude Opus 4.8 se estiver executando agentes autônomos de missão crítica e longo horizonte, nos quais os últimos pontos de confiabilidade justificam o preço adicional, ou se seu trabalho estiver sujeito a regras de residência de dados que a API hospedada do GLM não consegue atender e você não puder hospedar o modelo por conta própria.