Qwen 3.8 Max e GLM 5.2 em resumo
| Categoria |
Qwen3.8-Max |
GLM-5.2 |
| Estado do produto |
Modelo de produção estável |
Modelo estável com versão definida |
| Janela de contexto |
Até 1 milhão de tokens |
Até 1 milhão de tokens |
| Saída máxima |
Até 128 mil tokens |
Até 131.072 tokens |
| Tamanho do modelo |
2,4T no total, 95B ativos |
Cerca de 753B no total, 40B ativos |
| Entradas |
Texto, imagens e vídeo |
Texto |
| Chamadas de função |
Compatível |
Compatível |
| Preço oficial/API |
US$ 2/M para entrada, US$ 6/M para saída |
US$ 1,26/US$ 3,96 no GPT Proto |
| Pesos abertos |
Anunciados; ainda não lançados |
Disponíveis sob a licença MIT |
| Disponibilidade no GPT Proto |
Disponível agora |
Disponível agora |
| Mais adequado para |
Programação de alto nível, visão, pesquisa e agentes de longa duração |
Programação de menor custo, hospedagem própria e implantação com controle de versão |
Desempenho em programação: benchmarks versus um repositório desorganizado
Atualmente, o GLM-5.2 tem o registro público de benchmarks mais claro. A Z.ai relata pontuações de 62,1 no SWE-bench Pro e 81,0 no Terminal-Bench 2.1 usando o Terminus-2. Sua documentação oficial também publica informações sobre a configuração da avaliação, incluindo o executor e as restrições de recursos.
Esses resultados continuam sendo relatados pelo fornecedor. Eles são úteis para identificar os pontos fortes pretendidos do GLM-5.2 em programação e tarefas de agentes de longa duração, mas não comprovam que ele superará o Qwen3.8-Max em todos os repositórios ou fluxos de produção.
As evidências independentes ainda são incompletas. Em 10 de agosto de 2026, o Artificial Analysis atribui ao GLM-5.2 Max uma pontuação de 53 em seu Intelligence Index. No entanto, o modelo Qwen nessa página de comparação é o Qwen3 Max Thinking, um modelo mais antigo cuja pontuação está marcada como estimada. Isso não é evidência de que o GLM-5.2 supere o Qwen3.8-Max atual.
O lançamento estável do Qwen muda a decisão de implantação, mas não resolve automaticamente a questão dos benchmarks. A Alibaba posiciona o Qwen3.8-Max como uma grande atualização para programação complexa, trabalho multimodal, tarefas profissionais e agentes de longa duração. Seu anúncio oficial de lançamento inclui detalhes da arquitetura e exemplos de comportamento prolongado de agentes, mas não fornece um resultado diretamente comparável entre GLM-5.2 e Qwen no SWE-bench Pro ou no Terminal-Bench 2.1.
Portanto, a conclusão mais justa não é que um dos modelos já venceu. O GLM-5.2 tem evidências públicas de programação mais consolidadas, enquanto o Qwen3.8-Max oferece uma proposta de capacidade mais ampla e agora é estável o suficiente para avaliação em produção.
Nota sobre as evidências: O teste correspondente a seguir usou o Qwen3.8-Max Preview antes do lançamento estável de agosto. Ele continua sendo útil para observar diferentes comportamentos de engenharia, mas não deve ser tratado como um benchmark definitivo do modelo de produção atual.
Um teste da 36Kr, realizado em 22 de julho, com um projeto web desorganizado e inacabado oferece uma comparação comportamental mais concreta. O projeto continha um frontend Next.js, Payload CMS, código de animação, documentação legada, funcionalidades existentes e bugs interligados no frontend e no backend.
Na tarefa inicial de leitura do projeto, o Qwen3.8-Max Preview ficou em primeiro lugar. Ele identificou o estado atual do projeto, iniciou o serviço CMS ausente e concluiu a análise inicial em menos de 10 segundos naquela configuração específica.
O GLM-5.2 teve um desempenho melhor em uma tarefa mais restrita de implementação de carrossel. Ele preservou a reprodução automática, o controle de arraste e um loop contínuo, embora a transição ainda apresentasse um salto visual. O Qwen foi mais rápido, mas removeu o comportamento de arraste e implementou uma imitação prolongada de um loop que eventualmente voltaria ao início.
Essa troca é mais informativa do que declarar um vencedor em uma única frase. Nesse teste, o Qwen foi melhor em reconhecer a intenção atual e avançar rapidamente, enquanto o GLM foi mais cuidadoso quando a preservação de funcionalidades e a completude da implementação eram importantes.
No entanto, um único projeto web inacabado não pode estabelecer uma classificação universal de velocidade ou qualidade de programação — especialmente porque o teste usou a versão Preview do Qwen3.8-Max e não divulgou completamente as rotas de atendimento, os orçamentos de tokens, as condições de latência ou as revisões exatas dos modelos.
Como interpretar as evidências de forma justa
O teste público com código legado é útil, mas não é um benchmark controlado. Usar o mesmo projeto inacabado e um fluxo de trabalho baseado no OpenCode torna a comparação mais informativa do que capturas de tela não relacionadas, mas os detalhes de configuração ausentes impedem a reprodução exata.
O teste pode revelar padrões característicos de falha:
O Qwen3.8-Max Preview avançou rapidamente e entendeu a intenção atual do projeto, mas removeu uma interação solicitada e substituiu-a por uma implementação de loop incompleta.
O GLM-5.2 preservou mais do comportamento exigido na tarefa do carrossel, mas foi mais lento durante a análise inicial e, em determinado momento, tratou documentação desatualizada como trabalho atual.
Esses resultados descrevem as versões testadas naquele ambiente específico. Eles não provam que o Qwen é sempre mais rápido, que o GLM sempre escreve código mais seguro ou que o Qwen3.8-Max estável reproduzirá o comportamento do modelo Preview.
As evidências disponíveis devem ser interpretadas em quatro níveis:
Testes independentes atuais frente a frente: Ainda ausentes para o Qwen3.8-Max estável versus o GLM-5.2.
Benchmarks de programação publicados: Mais fortes para o GLM-5.2, embora os resultados mais importantes sejam relatados pelo fornecedor.
Teste público no mesmo projeto: Útil para identificar diferenças comportamentais, mas o teste disponível da 36Kr usou o Qwen3.8-Max Preview.
Afirmações de lançamento do fornecedor: Úteis para entender as capacidades pretendidas, mas insuficientes para declarar um vencedor sem validação externa.
Essa lacuna de evidências ainda faz parte da decisão de compra, mas já não significa que o Qwen deva ser excluído da produção.
Se você não puder realizar uma comparação privada, o GLM-5.2 continua sendo a opção com menor risco de evidências para equipes que priorizam resultados de programação publicados, menor custo de API, pesos abertos e implantação reproduzível. O Qwen3.8-Max agora é uma opção de produção válida quando entrada multimodal, cobertura mais ampla de tarefas, desenvolvimento frontend ou capacidade de agentes de longa duração forem mais importantes.
A recomendação prática é testar os dois modelos no mesmo repositório. Compare testes aprovados, regressões de funcionalidades, chamadas inválidas de ferramentas, novas tentativas, latência, custo total de tokens e tempo de correção humana. Escolha o modelo com menor custo por tarefa aceita — não o modelo com o benchmark isolado ou a afirmação de lançamento mais impressionante.
Preços e custos do Qwen 3.8 Max versus GLM 5.2
Esta agora é uma comparação normal de preços por token.
| Modelo |
Preço de entrada |
Preço de saída |
| Preço oficial do Qwen3.8-Max |
US$ 2 por 1M |
US$ 6 por 1M |
| GLM-5.2 no GPT Proto |
US$ 1,26 por 1M |
US$ 3,96 por 1M |
| Preço direto de tabela do GLM-5.2 |
US$ 1,40 por 1M |
US$ 4,40 por 1M |
Para uma carga de trabalho que use 10 milhões de tokens de entrada e 2 milhões de tokens de saída:
Preço oficial do Qwen3.8-Max: 10 × US$ 2 + 2 × US$ 6 = US$ 32
GLM-5.2 no GPT Proto: 10 × US$ 1,26 + 2 × US$ 3,96 = US$ 20,52
O GLM custa menos com esses preços listados. Para justificar a diferença, o Qwen precisa oferecer uma taxa de conclusão maior, menos novas tentativas, melhor compreensão multimodal ou menos correções humanas.
Isso é plausível em tarefas visuais difíceis ou de longa duração. Ainda assim, deve ser medido, não presumido.
Qual é melhor para tarefas de programação?
| Necessidade de programação |
Melhor escolha |
Por quê |
| Programação hospedada com máxima capacidade |
Qwen 3.8 Max |
Novo modelo topo de linha, com posicionamento mais forte para tarefas multimodais e de longa duração |
| Reconstrução visual de frontend |
Qwen 3.8 Max |
Compreensão nativa de imagens e vídeos |
| Trabalho em repositórios com orçamento limitado |
GLM-5.2 |
Menores preços por token de entrada e saída |
| Agente de programação hospedado localmente |
GLM-5.2 |
Pesos licenciados sob MIT disponíveis agora |
| Implantação aberta reproduzível |
GLM-5.2 |
Checkpoint público, arquitetura e versão estável |
| Fluxo de trabalho profissional ou de pesquisa complexa |
Qwen 3.8 Max |
Projetado para tarefas em várias etapas envolvendo programação, documentos, pesquisa e entradas visuais |
| Pipeline de produção GLM existente |
Mantenha o GLM até realizar os testes |
Uma afirmação de modelo mais forte não substitui a avaliação de migração |
O Qwen3.8-Max agora vence na decisão orientada à capacidade. O GLM-5.2 continua vencendo quando custo, hospedagem própria e implantação aberta são os requisitos determinantes.
Como executar o GLM-5.2 por meio do GPT Proto
O GPT Proto disponibiliza o GLM-5.2 por meio de um endpoint compatível com a OpenAI. Crie uma chave de API, adicione-a ao seu ambiente e chame a string de modelo ativa glm-5.2. O mesmo equilíbrio também pode ser usado em toda a coleção de modelos do GPT Proto.
Primeiro, defina a chave e faça uma solicitação cURL:
export GPTPROTO_API_KEY="your_gptproto_api_key"
curl https://gptproto.com/v1/chat/completions \
-H "Authorization: Bearer $GPTPROTO_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2",
"messages": [
{
"role": "system",
"content": "Inspect before editing. Preserve API contracts and report the tests required for every proposed change."
},
{
"role": "user",
"content": "Plan a safe fix for duplicate refresh-token requests after concurrent 401 responses. State assumptions and verification steps before proposing code."
}
]
}'
A chamada equivalente em Python usa o SDK da OpenAI:
python -m pip install openai
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["GPTPROTO_API_KEY"],
base_url="https://gptproto.com/v1",
)
response = client.chat.completions.create(
model="glm-5.2",
messages=[
{
"role": "system",
"content": (
"You are a repository-level coding assistant. Inspect before "
"proposing changes. Preserve existing API contracts, do not add "
"dependencies without approval, and list the verification "
"commands required for every proposed edit."
),
},
{
"role": "user",
"content": (
"An API client occasionally sends two refresh-token requests "
"after several concurrent requests fail with 401. Identify the "
"likely race condition, list the files you would inspect, and "
"return a minimal repair plan before writing code."
),
},
],
)
print(response.choices[0].message.content)
Este código solicita intencionalmente um plano de análise antes de uma edição. Um modelo de programação que inventa imediatamente arquivos ou altera um contrato de API falhou na tarefa, mesmo que a resposta pareça bem elaborada.
O Qwen3.8-Max agora está disponível no GPT Proto, portanto os desenvolvedores podem executar o mesmo prompt de programação nos dois modelos usando uma única conta de API.
Use qwen3.8-max para o Qwen e glm-5.2 para o GLM, mantendo o prompt, o estado do repositório, as permissões das ferramentas, as configurações de raciocínio e os critérios de sucesso idênticos. Meça testes aprovados, novas tentativas, chamadas inválidas de ferramentas, latência, total de tokens, correções humanas e custo por tarefa aceita.
Comece pela API do Qwen3.8-Max, ou compare-a com o endpoint GLM-5.2 existente antes de direcionar tráfego de produção.
Veredito final
A conclusão original de “GLM para produção, Qwen apenas para experimentação” está obsoleta.
O Qwen3.8-Max agora é um modelo de produção estável, com uma API documentada, contexto de 1 milhão de tokens, entrada multimodal, preços padrão por token e disponibilidade no GPT Proto. É o melhor ponto de partida quando a capacidade — especialmente programação visual e execução de longa duração — é o principal gargalo.
O GLM-5.2 continua sendo mais barato e fácil de controlar. Seus pesos licenciados sob MIT fazem dele a opção mais clara para hospedagem própria, implantação privada e equipes que precisam hoje de um checkpoint aberto e reproduzível.
Escolha o Qwen pela capacidade. Escolha o GLM pelo custo e pela propriedade.