Preços+7% bônus
Schuyler Stacy2026-07-17

Como usar o GLM-5.2 para seu agente de programação sem desperdiçar o contexto de 1M

Execute o GLM-5.2 como um agente de programação com o Claude Code ou uma API compatível com OpenAI. Inclui configuração real, prompts no nível do repositório, requisitos locais e exemplos de custo.

Como usar o GLM-5.2 para seu agente de programação sem desperdiçar o contexto de 1M

Conectar o GLM-5.2 a um agente de programação leva alguns minutos. Dar a ele contexto suficiente para corrigir um repositório sem deixá-lo se perder é a parte mais difícil.

Essa distinção é importante. Um modelo pode escrever uma função limpa em uma janela de chat e ainda assim falhar em uma tarefa real de engenharia porque edita a camada errada, quebra um contrato de API, ignora a suíte de testes ou passa metade do contexto lendo arquivos gerados. O GLM-5.2 foi projetado para trabalhos de programação mais longos e orientados por ferramentas, mas o modelo ainda precisa de um fluxo de trabalho disciplinado ao seu redor.

Este guia aborda três caminhos práticos: usar o GLM-5.2 com o Claude Code, chamar a API do GLM-5.2 no GPTProto a partir de um agente compatível com OpenAI e executar os pesos abertos localmente. Em seguida, mostra como delimitar uma tarefa no nível do repositório, gerenciar o contexto de 1M de tokens, verificar alterações e estimar o custo real de tokens.

Resumo

  • Use o Claude Code com o endpoint compatível com Anthropic da Z.ai se você já trabalha com esse agente no terminal.
  • Use o endpoint compatível com OpenAI do GPTProto para Cline, OpenCode, um agente personalizado ou uma aplicação que já use o SDK da OpenAI.
  • Por padrão, não envie um monorepo inteiro só porque o GLM-5.2 aceita até 1M de tokens. Comece com um mapa do repositório, os arquivos relevantes, as restrições e os comandos de teste.
  • Use o raciocínio High para investigações rotineiras e Max para trabalhos ambíguos com vários arquivos, nos quais um plano errado seria caro.
  • Considere a alteração do agente não confiável até que ela passe pelo build, lint, verificações de tipos e testes do repositório.
  • Execute localmente apenas quando privacidade, controle ou uso contínuo justificarem uma infraestrutura robusta. “Pesos abertos” não significa “do tamanho de um laptop”.
Índice

O que você precisa antes de começar

GLM-5.2 é o modelo, não o agente de programação completo. A ferramenta ao redor ainda precisa ler arquivos, editá-los, executar comandos, preservar o estado e decidir quando parar.

Antes de conectá-lo, prepare:

  1. Uma interface de agente de programação. Claude Code, Cline, OpenCode ou seu próprio ciclo de ferramentas podem cumprir esse papel.
  2. Acesso à API ou inferência local. O acesso hospedado é a maneira mais rápida de avaliar o modelo. A inferência local oferece mais controle, mas exige muito mais hardware e trabalho operacional.
  3. Um repositório capaz de se verificar. Você deve conhecer os comandos exatos de build, lint, verificação de tipos e testes antes de pedir a um agente para alterar o código.
  4. Uma branch de trabalho isolada. Não inicie uma tarefa autônoma longa em uma branch de produção com alterações pendentes.
  5. Limites explícitos. Decida se o agente pode instalar dependências, acessar a rede, alterar esquemas, executar migrações ou criar commits.

Os dois últimos itens não são apenas uma encenação opcional de segurança. Um agente de programação com acesso ao shell pode fazer uma alteração tecnicamente válida que esteja completamente errada para o seu processo de lançamento.

Escolha a maneira certa de executar o GLM-5.2

Há três caminhos sensatos. O melhor depende mais das suas ferramentas existentes e das regras de dados do que da qualidade do modelo.

Caminho Ideal para Principal vantagem Principal desvantagem
Claude Code com Z.ai Desenvolvedores que já usam o Claude Code Configuração direta compatível com Anthropic Usa uma chave e um plano separados da Z.ai
API do GPT Proto Agentes compatíveis com OpenAI e aplicações personalizadas Acesso pré-pago com uma chave para mais de 200 modelos Você ainda precisa de uma interface de agente ou ciclo de ferramentas
Implantação local Código privado, serving personalizado e cargas de trabalho contínuas Controle total sobre os pesos e a infraestrutura Grandes requisitos de armazenamento, memória, GPU e serving

Para uma primeira avaliação, use o acesso hospedado. Você poderá descobrir se o GLM-5.2 atende aos seus repositórios antes de comprar ou reservar hardware de inferência. Se você já direciona vários modelos de texto, imagem ou vídeo por meio de uma única aplicação, a coleção de modelos do GPT Proto também permite testar o GLM-5.2 sem criar outra integração isolada.

Como usar o GLM-5.2 com o Claude Code

A Z.ai fornece um endpoint compatível com Anthropic especificamente para ferramentas como Claude Code e Goose. A documentação atual usa:

https://api.z.ai/api/anthropic

Você precisa do Node.js 18 ou mais recente, Claude Code, uma chave de API da Z.ai e um plano ativo que inclua o GLM-5.2. O comando oficial de instalação é:

npm install -g @anthropic-ai/claude-code

Abra ~/.claude/settings.json no macOS, Linux ou WSL. No Windows nativo, use %USERPROFILE%\.claude\settings.json. Adicione as configurações de ambiente a seguir sem excluir campos não relacionados que já estejam no arquivo:

{
  "env": {
    "ANTHROPIC_AUTH_TOKEN": "your_zai_api_key",
    "ANTHROPIC_BASE_URL": "https://api.z.ai/api/anthropic",
    "ANTHROPIC_DEFAULT_HAIKU_MODEL": "glm-4.5-air",
    "ANTHROPIC_DEFAULT_SONNET_MODEL": "glm-5.2[1m]",
    "ANTHROPIC_DEFAULT_OPUS_MODEL": "glm-5.2[1m]",
    "CLAUDE_CODE_AUTO_COMPACT_WINDOW": "1000000",
    "CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": 1,
    "API_TIMEOUT_MS": "3000000"
  }
}

O sufixo [1m] habilita a variante com contexto de 1M no Claude Code. A Z.ai também recomenda usar uma versão recente do Claude Code caso esse nome de modelo não seja reconhecido. A configuração acima segue o guia do Claude Code da Z.ai e o guia de troca de modelos do GLM-5.2.

Inicie o Claude Code no repositório ao qual você quer que ele tenha acesso:

cd path/to/your-project
claude

Em seguida, execute:

/status

Confirme que a fonte das configurações é o arquivo editado e que o modelo selecionado é glm-5.2 ou glm-5.2[1m]. Se ainda mostrar outro modelo, feche todas as sessões do Claude Code, abra um novo terminal, valide o JSON e verifique o caminho do arquivo usado por essa instalação.

Escolha deliberadamente o esforço High ou Max

O GLM-5.2 oferece os níveis de raciocínio High e Max. No Claude Code, a Z.ai mapeia low, medium e high para o GLM-5.2 High; xhigh, max e ultra são mapeados para o modo Max. Você pode alterar a configuração com /effort.

Comece com High para explicações de código, pequenas investigações de bugs, geração de testes e edições bem delimitadas. Use Max quando o agente precisar rastrear uma falha em vários subsistemas, planejar uma migração grande ou lidar com uma falha ambígua com várias causas possíveis. Max pode melhorar o plano, mas também tende a produzir mais tokens de raciocínio e uma resposta mais lenta. Deve ser uma decisão no nível da tarefa, e não um padrão permanente.

Como chamar a API do GLM-5.2 no GPT Proto

O Claude Code é apenas uma interface. Se o seu agente de programação aceitar um provedor compatível com OpenAI, aponte-o para o GPT Proto e use a string de modelo glm-5.2.

Instale o cliente Python atual da OpenAI:

python -m pip install openai

Armazene a chave como uma variável de ambiente em vez de colá-la no código-fonte:

export GPTPROTO_API_KEY="your_gptproto_api_key"

A solicitação a seguir pode ser executada exatamente como está depois que você adicionar uma chave válida:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["GPTPROTO_API_KEY"],
    base_url="https://gptproto.com/v1",
)

response = client.chat.completions.create(
    model="glm-5.2",
    messages=[
        {
            "role": "system",
            "content": (
                "You are a repository-level coding assistant. Inspect before "
                "proposing changes. Preserve existing API contracts, do not add "
                "dependencies without approval, and list the verification "
                "commands required for every proposed edit."
            ),
        },
        {
            "role": "user",
            "content": (
                "An API client occasionally sends two refresh-token requests "
                "after several requests fail with 401. Identify the likely race "
                "condition, describe the files you would inspect, and return a "
                "minimal repair plan before writing code."
            ),
        },
    ],
)

print(response.choices[0].message.content)

A solicitação equivalente em cURL é:

curl https://gptproto.com/v1/chat/completions \
  -H "Authorization: Bearer $GPTPROTO_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.2",
    "messages": [
      {
        "role": "system",
        "content": "Inspect before editing. Preserve API contracts and report the tests required for every proposed change."
      },
      {
        "role": "user",
        "content": "Plan a safe fix for duplicate refresh-token requests after concurrent 401 responses."
      }
    ]
  }'

Esta é uma chamada de API real, mas ainda não é um agente de programação autônomo. Para transformá-la em um, sua aplicação deve disponibilizar ferramentas controladas para ações como ler um arquivo, pesquisar o repositório, aplicar um patch e executar testes. Em seguida, deve retornar os resultados das ferramentas ao modelo até que a tarefa alcance uma condição de parada definida.

Essa distinção é fácil de confundir em tutoriais. Uma conclusão de chat pode propor um patch. Um agente é o sistema que decide quais arquivos inspecionar, executa a alteração, observa o resultado e tenta novamente.

O GPT Proto atualmente lista o GLM-5.2 a US$ 1,26 por 1M de tokens de entrada e US$ 3,96 por 1M de tokens de saída. Você pode consultar a tarifa atual e os detalhes do modelo na página da API do GLM-5.2, enquanto o faturamento de toda a conta está disponível na página de modelos do GPT Proto.

Use uma tarefa no nível do repositório em vez de um prompt de chat

“Corrija o bug de autenticação” dá ao agente um objetivo, mas nenhum limite, método de verificação ou definição de conclusão. Uma solicitação melhor torna o contrato de engenharia explícito.

Use este modelo:

Objetivo
Corrigir a solicitação duplicada de token de atualização que ocorre quando várias chamadas de API
recebem respostas 401 ao mesmo tempo.

Contexto relevante
- O frontend é TypeScript.
- O estado de autenticação é gerenciado em src/auth/.
- As solicitações HTTP passam por src/api/client.ts.
- Os contratos de API públicos existentes não devem mudar.

Restrições
- Não adicione dependências.
- Não altere endpoints de backend nem formatos de token.
- Não crie um commit.
- Pergunte antes de modificar arquivos fora de src/auth/ e src/api/.

Processo obrigatório
1. Leia os arquivos relevantes e mapeie o fluxo atual de atualização.
2. Declare a causa mais provável e quaisquer suposições.
3. Proponha a menor alteração segura antes de editar.
4. Implemente somente depois que o plano estiver claro.
5. Execute npm run typecheck, npm run lint e os testes de autenticação.

Definição de concluído
- Respostas 401 simultâneas compartilham uma única solicitação de atualização.
- Solicitações enfileiradas são repetidas uma vez após a atualização bem-sucedida.
- Uma atualização malsucedida limpa o estado de autenticação sem um ciclo infinito de tentativas.
- Os testes existentes passam e um teste de regressão cobre o caso simultâneo.

Condições de parada
- Pare e pergunte se a correção exigir um novo pacote, alteração no backend, migração,
  segredo ou comando destrutivo.

Relatório final
Liste os arquivos alterados, explique a mudança de comportamento, mostre os resultados da verificação
e identifique qualquer risco restante.

O prompt é mais longo do que “corrija o bug”, mas geralmente reduz as etapas desperdiçadas do agente. Ele informa ao modelo o que não deve ser alterado e torna visível qualquer verificação ignorada.

Três exemplos de agentes de programação com GLM-5.2 que vale a pena testar

Pequenos testes de geração de código revelam muito pouco sobre um modelo de agente. O foco declarado do GLM-5.2 é o trabalho de longo horizonte, portanto avalie-o em tarefas que envolvam navegação, planejamento, ferramentas e verificação. A Z.ai informa uma janela de contexto de 1M e ganhos substanciais em relação ao GLM-5.1 no SWE-bench Pro e no Terminal-Bench 2.1, mas esses resultados de benchmark não garantem sucesso no seu repositório. Sua própria taxa de conclusão de tarefas importa mais do que uma pontuação geral. Consulte a documentação oficial do modelo GLM-5.2 para conhecer a configuração de avaliação informada.

1. Rastreie e corrija um bug em vários arquivos

Forneça ao agente um relatório de erro, logs relevantes, o comando de teste e permissão para inspecionar o repositório. Peça que ele mapeie o caminho da chamada antes de editar. Isso testa se ele consegue manter uma hipótese entre middleware, serviços e gerenciamento de estado, em vez de corrigir a primeira função suspeita.

Exija um teste de regressão. Sem ele, um patch plausível pode parecer completo enquanto deixa a condição de corrida intacta.

2. Atualize uma dependência sem alterar o comportamento

Peça ao agente para inventariar o uso direto e transitivo, ler as notas de migração fornecidas, atualizar a menor superfície possível e executar a suíte completa de testes relevantes. Diga para não silenciar erros de tipo com conversões amplas nem desativar regras de lint.

Isso testa a adesão às restrições. O desafio não é alterar uma string de versão; é preservar o comportamento enquanto as interfaces mudam sob o código.

3. Audite um repositório desconhecido antes da implementação

Forneça uma solicitação de recurso e peça um mapa do repositório, pontos prováveis de integração, testes afetados e questões não resolvidas. Não permita edições na primeira etapa.

Esta é uma avaliação de baixo risco útil, pois você pode julgar se o modelo entendeu a arquitetura antes de conceder acesso de escrita. Se o mapa estiver errado, corrija o contexto em vez de pagar por vários ciclos de implementação malsucedidos.

Como usar o contexto de 1M sem pagar para ler tudo

Uma janela de 1M de tokens é um limite máximo, não uma meta. O erro mais caro é presumir que mais arquivos automaticamente produzem uma resposta melhor.

Comece com um mapa do repositório. Inclua a árvore de diretórios de nível superior, manifestos de pacotes, comandos de build e teste, notas arquiteturais e os arquivos mais próximos do comportamento que falhou. Permita que o agente solicite arquivos adicionais à medida que sua hipótese se desenvolve.

Exclua ruídos óbvios:

  • Saída de build gerada
  • Diretórios de dependências e fornecedores
  • Recursos minificados
  • Snapshots grandes sem relação com a tarefa
  • Logs históricos sem conexão com a falha
  • Segredos e arquivos de ambiente local

Para tarefas longas, peça ao agente que mantenha um checkpoint curto contendo o objetivo atual, os arquivos alterados, as decisões tomadas, os resultados dos testes e os riscos em aberto. Um checkpoint é mais barato e fácil de inspecionar do que repetir toda a conversa anterior.

Lembre-se de que o faturamento da API normalmente contabiliza os tokens processados em cada solicitação, não apenas o texto exclusivo. Se um agente enviar repetidamente o mesmo contexto de 300 mil tokens de um repositório em dez etapas, a entrada faturada pode chegar a quase 3 milhões de tokens antes de considerar novas mensagens, dependendo do cache e do comportamento das solicitações do provedor. Uma janela grande resolve a capacidade; não elimina a necessidade de gerenciar o contexto.

Quanto custa um agente de programação com GLM-5.2?

Nas tarifas atualmente listadas pelo GPT Proto, o cálculo básico é:

cost = input_tokens / 1,000,000 × $1.26
     + output_tokens / 1,000,000 × $3.96

Veja três totais ilustrativos:

Uso cumulativo de uma tarefa Custo de entrada Custo de saída Total
50K de entrada + 5K de saída $0.0630 $0.0198 $0.0828
300K de entrada + 30K de saída $0.3780 $0.1188 $0.4968
1M de entrada + 100K de saída $1.2600 $0.3960 $1.6560

Estes são exemplos de custo de tokens, não preços garantidos por tarefa. Um agente de programação pode fazer muitas chamadas ao modelo enquanto lê arquivos, planeja, aplica alterações, interpreta falhas de testes e tenta novamente. O que importa é o total cumulativo de entrada e saída faturado durante toda a execução.

Três controles mantêm esse custo compreensível:

  1. Defina um número máximo de etapas do agente.
  2. Exija aprovação antes que a tarefa se expanda para novos diretórios ou para um problema diferente.
  3. Registre tokens e custos por tarefa, não apenas por mês do calendário.

O terceiro controle ajuda a comparar modelos de forma justa. Um token mais barato ainda pode produzir uma correção mais cara se forem necessárias duas vezes mais tentativas.

É possível executar o GLM-5.2 localmente?

Sim, mas “localmente” precisa ser qualificado.

O GLM-5.2 é distribuído sob a licença MIT, e seu cartão oficial do modelo no Hugging Face lista caminhos de implantação para vLLM, SGLang, Transformers, KTransformers, Unsloth, NPUs Ascend e runtimes quantizados. Isso torna o self-hosting tecnicamente possível.

O modelo completo ainda possui aproximadamente 753 bilhões de parâmetros no total, com cerca de 40 bilhões ativos para cada token. A quantidade de parâmetros ativos pode reduzir o custo computacional da inferência, mas todos os pesos dos especialistas ainda precisam ser armazenados e disponibilizados. Como estimativa aproximada apenas dos pesos, 753 bilhões de parâmetros exigem cerca de 1,5 TB em precisão de 16 bits ou aproximadamente 376 GB em precisão de 4 bits, antes da sobrecarga do runtime, do cache KV, da memória de contexto longo e da margem para serving. O requisito exato depende da quantização, do framework, da topologia de hardware e do tamanho do contexto.

Por isso, a afirmação de que o GLM-5.2 “funciona localmente” pode ser verdadeira e ainda assim irrelevante para um usuário de laptop. Builds comunitários fortemente quantizados podem reduzir o ponto de entrada, mas também alteram a velocidade, a qualidade da saída, o contexto compatível ou todos os três.

Escolha a implantação local quando:

  • O código-fonte não puder sair da infraestrutura sob seu controle.
  • Você precisar modificar ou ajustar os pesos.
  • O uso contínuo tornar a infraestrutura própria econômica.
  • Sua equipe puder operar inferência em várias GPUs e monitorá-la.

Escolha a API hospedada quando:

  • Você ainda estiver avaliando a adequação do modelo.
  • O uso for intermitente ou difícil de prever.
  • Você precisar mais de acesso funcional do que de controle da infraestrutura.
  • Sua equipe não quiser assumir as operações de inferência.

Onde o GLM-5.2 se encaixa e onde a revisão humana ainda importa

O GLM-5.2 é uma escolha confiável para análise de repositórios, implementação em vários arquivos, correção de testes, investigação de desempenho, trabalho com dependências e pesquisa técnica orientada por ferramentas. Seu contexto amplo é especialmente útil quando uma tarefa realmente atravessa muitos arquivos relacionados.

Não confunda contexto longo com autoridade para agir. Mantenha uma etapa de aprovação humana para:

  • Migrações de bancos de dados de produção
  • Alterações de autenticação e autorização
  • Criptografia, gerenciamento de chaves e controles de segurança
  • Comandos destrutivos do shell
  • Decisões sobre licenciamento de dependências
  • Commits, merges e implantações automáticos
  • Alterações que não possam ser revertidas pelo controle de versão ou por backups

Para essas tarefas, o agente pode investigar, elaborar um plano, preparar um patch e executar verificações seguras. Uma pessoa ainda deve aprovar a ação que altera os limites.

Checklist prático para um agente de programação com GLM-5.2

Antes da execução:

  • Crie uma branch ou worktree isolada.
  • Confirme o modelo e o endpoint selecionados.
  • Remova segredos do contexto acessível.
  • Defina os diretórios e as ferramentas permitidos.
  • Forneça os comandos exatos de build e teste.
  • Informe se novas dependências são permitidas.
  • Defina limites de etapas, tempo e custo.

Antes de aceitar o resultado:

  • Leia o diff, não apenas o resumo do agente.
  • Confirme que APIs públicas e esquemas só foram alterados quando solicitado.
  • Execute os testes de forma independente quando o risco for relevante.
  • Verifique regras desativadas, erros ignorados, conversões amplas de tipos e testes ignorados.
  • Registre riscos não resolvidos e trabalhos de acompanhamento.

A configuração coloca o GLM-5.2 no seu terminal ou aplicação. Este checklist é o que transforma a conexão em um processo de engenharia utilizável.

Conclusão

A melhor maneira de usar o GLM-5.2 para um agente de programação não é fornecer o maior contexto possível e esperar. Conecte-o pela interface adequada à sua stack, comece com um mapa do repositório e um contrato de tarefa restrito, exija um plano antes das edições e faça da verificação parte da definição de concluído.

Use o Claude Code quando quiser um fluxo de trabalho de terminal estabelecido. Use a API do GLM-5.2 quando um agente compatível com OpenAI ou uma aplicação personalizada for mais adequado. Considere o self-hosting quando privacidade, controle ou volume contínuo fizerem o hardware valer a pena—não antes.

Com o GPT Proto, a mesma chave de API e o mesmo saldo também podem acessar a ampla galeria de modelos de IA, permitindo comparar o GLM-5.2 com outros modelos de programação sem reconstruir a integração para cada provedor.

Creative Studio

Gere imagem, vídeo e mais com APIs de produção.

Começar a criar
Creative Studio
Modelos relacionados
Todos os modelos
Z-AI
by Z-AI
10% OFF
OpenAI
20% OFF
Claude
10% OFF
OpenAI
20% OFF

Perguntas frequentes

O GLM-5.2 é bom para agentes de programação?

Sim, especialmente para tarefas longas com vários arquivos que envolvam navegação no repositório, uso de ferramentas, planejamento e verificação repetida. Os resultados oficiais mostram uma melhoria substancial em relação ao GLM-5.1 em avaliações de programação e de longo horizonte. Considere esses resultados como evidências para testar o modelo, não como substituto da avaliação nos seus próprios repositórios.

Posso usar o GLM-5.2 com o Claude Code?

Sim. A Z.ai fornece um endpoint compatível com Anthropic para o Claude Code em https://api.z.ai/api/anthropic. Defina os valores padrão dos modelos Sonnet e Opus como glm-5.2[1m], adicione a janela de compactação automática de 1M, inicie o Claude Code e verifique o modelo ativo com /status.

Posso usar a API do GLM-5.2 no GPTProto para um agente de programação?

Sim. O GPTProto disponibiliza o glm-5.2 por meio de uma API compatível com OpenAI, portanto ele pode ser usado com ferramentas de agentes compatíveis ou com um ciclo de ferramentas personalizado. Uma chamada básica à API gera uma resposta; seu framework de agente ainda é responsável pelo acesso a arquivos, execução de comandos, estado, permissões e condições de parada.

Quais são os requisitos do GLM-5.2?

O uso hospedado exige uma chave de API, um cliente ou agente de programação compatível e um repositório com comandos de verificação conhecidos. A implantação local completa é uma carga de trabalho de classe de servidor, pois o GLM-5.2 possui aproximadamente 753 bilhões de parâmetros no total. As necessidades de memória variam bastante conforme a precisão, a quantização, o contexto e o framework de serving.

Posso executar o GLM-5.2 localmente com Ollama ou llama.cpp?

Builds quantizados podem ser usados com runtimes locais compatíveis, e a página oficial do modelo contém links para as quantizações disponíveis. Verifique o suporte exato de memória, contexto e arquitetura do build antes de baixá-lo. Não presuma que a listagem de um runtime significa que todo o contexto de 1M ou uma velocidade utilizável estará disponível na sua máquina.

Devo usar o esforço de raciocínio High ou Max?

Use High para investigações rotineiras e alterações bem delimitadas. Use Max para falhas ambíguas, refatorações em todo o repositório e tarefas nas quais o agente precise comparar vários planos antes de agir. Max pode melhorar trabalhos difíceis, mas normalmente custa mais tempo e tokens de raciocínio.

Quanto custa um agente de programação com GLM-5.2?

O GPTProto atualmente lista US$ 1,26 por 1M de tokens de entrada e US$ 3,96 por 1M de tokens de saída. Uma tarefa com 300 mil tokens de entrada acumulados e 30 mil de saída custaria cerca de US$ 0,50 nessas tarifas. As execuções reais de agentes variam porque cada leitura de arquivo, nova tentativa, resultado de teste e contexto repetido pode adicionar tokens.

O GLM-5.2 oferece suporte a chamadas de ferramentas?

Sim. O GLM-5.2 oferece suporte a fluxos de trabalho de agentes orientados por ferramentas. O modelo pode decidir quando solicitar uma ferramenta disponível, mas a aplicação ao redor deve definir o esquema da ferramenta, executar ações aprovadas, retornar resultados e aplicar as permissões.

Artigos relacionados

Mais blogs
O que é o GLM 5.2? Codificação com pesos abertos por 1/6 do preço

O que é o GLM 5.2? Codificação com pesos abertos por 1/6 do preço

Um laboratório chinês lançou um modelo que você pode baixar gratuitamente, executar no seu próprio hardware e usar por aproximadamente um sexto do que os modelos de fronteira fechados cobram — e que fica alguns pontos atrás do Claude Opus 4.8 em benchmarks reais de codificação. Depois, lançou o modelo sem publicar um único benchmark oficial próprio. Esse é o GLM 5.2, e a distância entre "nenhum número de marketing" e "perto do topo de todas as tabelas de classificação independentes em uma semana" é justamente o que torna esse modelo tão interessante de entender. Escrevo muitos desses artigos explicativos, e a maioria das publicações sobre novos modelos é esquecível porque apenas repete uma ficha técnica. Este é diferente em um aspecto que realmente importa para desenvolvedores: os pesos são abertos sob uma licença MIT, então a pergunta habitual — "o benchmark é real ou é marketing?" — tem uma resposta particularmente clara. As pessoas baixaram o modelo e o testaram por conta própria. Veja o que é o GLM 5.2, como ele funciona e quais são seus limites.

Michael Johnson | 2026-07-15

GLM-5.2 vs DeepSeek V4 Pro: Benchmarks, Preços e Qual realmente usar (2026)

GLM-5.2 vs DeepSeek V4 Pro: Benchmarks, Preços e Qual realmente usar (2026)

TL;DR: Se sua carga de trabalho envolve engenharia agentiva de longo horizonte — um agente que percorre um repositório durante horas e entrega uma funcionalidade — o GLM-5.2 é o modelo mais forte. Se sua carga de trabalho envolve algoritmos, matemática, raciocínio STEM ou qualquer tarefa limitada por custo e de alto throughput, o DeepSeek V4 Pro vence, e vence por uma grande margem no preço. No Intelligence Index v4.1 da Artificial Analysis, uma avaliação independente, o GLM-5.2 (esforço máximo) marca 51, contra 44 do DeepSeek V4 Pro — mas a tarifa oficial por token do DeepSeek é aproximadamente 3 a 5 vezes mais barata. O ponto importante, que a maioria das comparações ignora: o preço por token e o custo por tarefa não são o mesmo número. Vou mostrar o motivo abaixo. Ambos os modelos estão nas páginas de catálogo de GLM-5.2 e deepseek-v4-pro em nossa plataforma, e “para qual deles devo encaminhar?” tornou-se uma das perguntas mais comuns que recebemos de desenvolvedores que executam agentes de programação. Este artigo é minha tentativa de responder adequadamente — com dados de benchmarks independentes quando disponíveis, números dos fornecedores claramente identificados quando não estão, e uma matemática de preços que reflete o que o DeepSeek realmente cobra em julho de 2026, não o que cobrava em abril.

Schuyler Stacy | 2026-07-06

MiniMax M3 para Programação: Benchmarks, Preços Reais e Como Chamá-lo via API (2026)

MiniMax M3 para Programação: Benchmarks, Preços Reais e Como Chamá-lo via API (2026)

O MiniMax M3 é bom para programação? A resposta curta: sim, para trabalho agêntico e com vários arquivos, com duas ressalvas que vou apresentar antes que você leia mais uma palavra. A maioria das pontuações de programação mais divulgadas foi obtida pela MiniMax em sua própria infraestrutura, e o "contexto de 1 milhão de tokens" tem um salto de preço em 512K que afeta especialmente os agentes de programação. Ambos os pontos são administráveis quando você sabe que existem. Nenhum deles aparece claramente na maioria da cobertura do lançamento. Estou escrevendo isto porque a proposta de programação em torno do M3 foi reduzida a um único número — 59% no SWE-Bench Pro — e esse número está sendo usado sem muita análise. A seguir, explico o que o modelo realmente é, onde chegam as medições independentes, quanto ele custa em uma carga de trabalho de programação real e como chamá-lo pela API do GPTProto. Se você quer apenas uma conclusão: um avaliador independente que executa a mesma bateria em todos os modelos relevantes colocou o M3 "próximo do GPT e do Opus em programação real, mas ainda não acima deles". Isso também corresponde à posição dos benchmarks neutros.

Schuyler Stacy | 2026-07-02

O que é o Kimi K3 — e ele está realmente próximo do GPT-5.6 e do Fable 5?

O que é o Kimi K3 — e ele está realmente próximo do GPT-5.6 e do Fable 5?

Resumo O Kimi K3 é um modelo multimodal da Moonshot AI com 2,8 trilhões de parâmetros, desenvolvido para programação de longa duração, trabalho de conhecimento, raciocínio e fluxos de trabalho com agentes. Testes independentes o colocam próximo do Claude Opus 4.8 e do GPT-5.5 no geral, enquanto o GPT-5.6 Sol e o Claude Fable 5 continuam à frente. O K3 se aproxima nos benchmarks de agentes e lidera alguns testes de automação, mas sua taxa medida de alucinação aumentou em relação ao K2.6. O Kimi K3 agora está disponível com pesos abertos. A Moonshot AI publicou o checkpoint completo, o model card, o relatório técnico e a licença personalizada Kimi K3. O repositório oficial no Hugging Face ocupa cerca de 1,56 TB em 96 fragmentos safetensors, e a Moonshot recomenda implantações em supernodes com 64 ou mais aceleradores. Os pesos abertos resolvem a questão da propriedade. Eles não transformam o K3 em um modelo local comum. Para a maioria dos desenvolvedores, a API hospedada continua sendo o ponto de partida mais prático. A API do Kimi K3 na GPTProto atualmente lista US$ 2,70 por milhão de tokens de entrada e US$ 13,50 por milhão de tokens de saída. Escolha os pesos quando o controle dos dados, a inferência personalizada ou a modificação do modelo justificarem a infraestrutura e a análise da licença. Em resumo, o Kimi K3 está próximo o suficiente do GPT-5.6 e do Fable 5 para fazer parte da mesma conversa—e seu lançamento com pesos abertos agora oferece aos desenvolvedores uma opção de implantação que nenhum dos dois modelos fechados oferece.

Michael Johnson | 2026-07-28