Atualizado em 7 de agosto de 2026: A Alibaba lançou oficialmente a versão de produção do Qwen3.8-Max em 3 de agosto, substituindo o anterior qwen3.8-max-preview como o atual modelo de API principal. Este artigo foi atualizado com a arquitetura confirmada, a janela de contexto, os preços, a disponibilidade da API e o cronograma dos pesos abertos.
O Qwen3.8-Max é o modelo Qwen mais avançado da Alibaba até o momento: um modelo multimodal Sparse Mixture-of-Experts com 2,4 trilhões de parâmetros totais e 95 bilhões de parâmetros ativos por solicitação.
O modelo estável aceita entradas de texto, imagem e vídeo, produz texto como saída e oferece uma janela de contexto de até 1 milhão de tokens, com até 128 mil tokens de saída. Ele foi projetado para programação complexa, análise visual, pesquisa, trabalho profissional e tarefas de agentes de longa duração.
O lançamento também muda a resposta prática para desenvolvedores. O Qwen3.8-Max não está mais limitado a uma versão de prévia sujeita a alterações nem a um plano pessoal exclusivo de Créditos. Agora ele conta com uma API normal de pagamento conforme o uso, com a Alibaba anunciando US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de tokens de saída. Ele também está disponível por meio da API do Qwen 3.8 Max no GPTProto.
Minha opinião resumida: o Qwen 3.8 Max é uma prévia real e excepcionalmente interessante, não um lançamento de produto concluído. Os desenvolvedores devem testá-lo, registrar a data de cada resultado e evitar planejar migrações para produção com base em especificações que a Alibaba ainda não publicou.
Qwen 3.8 Max em resumo
| Especificação |
Detalhes confirmados do Qwen3.8-Max |
| Desenvolvedor |
Alibaba Qwen |
| Nome do modelo estável |
qwen3.8-max |
| Lançamento da prévia |
19 de julho de 2026 |
| Lançamento da produção |
3 de agosto de 2026 |
| Arquitetura |
Sparse Mixture-of-Experts com atenção híbrida |
| Parâmetros totais |
2,4 trilhões |
| Parâmetros ativos |
95 bilhões |
| Janela de contexto |
Até 1 milhão de tokens |
| Saída máxima |
Até 128 mil tokens |
| Entradas |
Texto, imagens e vídeo |
| Saída |
Texto |
| Modo de raciocínio |
Raciocínio híbrido com esforço de raciocínio ajustável |
| Chamada de funções |
Compatível |
| Saída estruturada |
Compatível |
| Pesquisa na Web |
Compatível |
| Armazenamento em cache do contexto |
Compatível |
| Inferência em lote |
Atualmente não compatível |
| Ajuste fino |
Atualmente não compatível |
| Preço da API oficial |
US$ 2/M tokens de entrada e US$ 6/M tokens de saída |
| Disponibilidade no GPT Proto |
Disponível agora |
| Pesos abertos |
Anunciados, mas não disponíveis para download em 7 de agosto de 2026 |
Essa lista é mais curta do que as tabelas de especificações que aparecem em algumas coberturas iniciais do Qwen 3.8 Max. E há uma razão para isso. Um modelo de prévia não ganha uma janela de contexto de 1 milhão, um layout específico de Mixture-of-Experts ou uma licença de lançamento apenas porque esses detalhes pareceriam plausíveis ao lado de outros modelos principais de 2026.
O Qwen 3.8 Max foi lançado?
Sim. O Qwen3.8-Max recebeu seu lançamento de produção em 3 de agosto de 2026.
A Alibaba disponibilizou inicialmente o qwen3.8-max-preview em 19 de julho. Essa prévia podia mudar entre chamadas e não tinha preços comuns de pagamento conforme o uso. O lançamento estável do qwen3.8-max substitui essa situação da semana de lançamento por um modelo de API documentado, especificações publicadas e cobrança padrão por token.
Os desenvolvedores agora podem chamar o modelo pelo Alibaba Cloud Model Studio ou usar a API do Qwen3.8-Max no GPT Proto junto com outros modelos de texto, imagem e vídeo na mesma conta.
O que significa a contagem de 2,4T parâmetros?
O Qwen3.8-Max contém 2,4 trilhões de parâmetros totais, mas sua arquitetura Sparse Mixture-of-Experts ativa aproximadamente 95 bilhões de parâmetros para cada solicitação.
Essa distinção é importante. A contagem total de parâmetros representa a capacidade total do modelo, enquanto a contagem ativa afeta mais diretamente o processamento da inferência. Cerca de 4% dos parâmetros totais ficam ativos por vez, permitindo que a Alibaba amplie a capacidade do modelo sem pagar o custo computacional de ativar todos os 2,4 trilhões de parâmetros para cada token.
A contagem de parâmetros, por si só, ainda não prova que um modelo seja mais rápido, barato ou preciso. A infraestrutura de serviço, a eficiência dos tokens, a duração do raciocínio, o armazenamento em cache e o número de novas tentativas também afetam o custo real de uma tarefa concluída.
O Qwen 3.8 Max é de código aberto?
Ainda não, em 7 de agosto de 2026.
A Alibaba confirmou que os pesos do Qwen3.8-2.4T-A95B serão lançados, tornando este o primeiro modelo da classe Qwen Max programado para um lançamento com pesos abertos. A página de lançamento do ModelScope aponta atualmente para 12 de agosto de 2026.
Até que o checkpoint e a licença sejam efetivamente publicados, o Qwen3.8-Max deve ser descrito como um modelo de API com lançamento de pesos abertos anunciado — não como um modelo de código aberto já disponível para download.
Mesmo depois da chegada dos pesos, um checkpoint com 2,4 trilhões de parâmetros exigirá infraestrutura significativa de armazenamento, memória, rede e inferência. Para a maioria dos desenvolvedores, a API hospedada continuará sendo consideravelmente mais fácil do que a hospedagem própria.
Preços da API do Qwen 3.8 Max
A tarifa publicada pela Alibaba para pagamento conforme o uso é:
| Item de cobrança |
Preço oficial de tabela |
| Tokens de entrada |
US$ 2 por 1 milhão de tokens |
| Tokens de saída |
US$ 6 por 1 milhão de tokens |
| Janela de contexto |
Até 1 milhão de tokens |
| Saída máxima |
Até 128 mil tokens |
Isso torna o Qwen3.8-Max mais barato, no preço oficial de tabela, do que a tarifa de US$ 3/US$ 15 para entrada e saída do Kimi K3, embora continue mais caro do que alguns modelos menores somente de texto.
Os preços do GPT Proto podem ser diferentes do preço de tabela direto da Alibaba. Consulte a página ativa da API do Qwen 3.8 Max antes de estimar uma carga de trabalho de produção grande.
O que mostram os primeiros benchmarks do Qwen 3.8 Max?
As evidências são mais fortes do que eram durante a prévia de julho, mas ainda precisam de contexto.
No lançamento, a Alibaba informou que o Qwen3.8-Max ficou em quinto lugar na Text Arena, segundo na Vision Arena e quarto na Frontend Code Arena. A Alibaba também publicou exemplos de programação de longa duração, reconstrução de aplicações visuais, análise de documentos profissionais e uso autônomo de ferramentas.
Esses resultados estabelecem o Qwen3.8-Max como um modelo de fronteira sério. Eles não garantem que ele superará todas as alternativas em um repositório ou fluxo de trabalho específico de agente.
A comparação anterior do StackPerf com 269 arquivos continua útil, mas testou a versão de pré-lançamento Qwen3.8-Max Preview. O Kimi K3 marcou 83/100 e a prévia do Qwen marcou 80/100, enquanto o Qwen concluiu com sucesso todas as 44 chamadas de ferramentas e recebeu a maior pontuação de uso de ferramentas. Considere esse resultado um sinal comportamental datado — não uma classificação final do lançamento estável de agosto.
Um teste inicial útil vem de uma comparação equivalente do StackPerf com o Kimi K3. Os dois modelos inspecionaram cópias congeladas de 269 arquivos e tiveram 60 minutos para produzir um projeto de integração no nível do repositório, com citações, etapas de migração, testes e um registro de evidências. Os relatórios foram anonimizados antes da avaliação.
O Kimi K3 marcou 83/100 após penalidades factuais; o Qwen 3.8 Max Preview marcou 80/100. O Qwen recebeu 9/10 pelo uso de ferramentas contra 8/10 do Kimi, concluiu com sucesso todas as 44 chamadas de ferramentas e produziu o relatório mais longo com menos solicitações. O Kimi terminou mais rápido, usou menos tokens em seu percurso testado e lidou de forma mais completa com revisões e regenerações.
Isso é uma evidência confiável para um tipo de trabalho de arquitetura de software com contexto longo. Não prova que o Kimi K3 seja geralmente melhor, nem que o Qwen seja geralmente melhor. Os modelos passaram por provedores diferentes, e a latência da rota, o armazenamento em cache, o tráfego do lançamento e as configurações de raciocínio afetaram o resultado.
O cenário inicial da comunidade é igualmente misto. Na principal discussão de lançamento no Hacker News, um testador relatou que uma tarefa com SVG animado levou mais de 10 minutos de raciocínio, enquanto outro desenvolvedor disse que a prévia funcionava bem para programação, mas ainda era nova demais para ser avaliada. São relatos, não benchmarks. Eles destacam duas coisas que vale a pena medir em seus próprios testes: tempo até uma resposta utilizável e conclusão da tarefa por token.
Qwen 3.8 Max vs Qwen 3.7 Max
O Qwen 3.8 Max parece uma evolução no escopo de capacidades, mas o Qwen 3.7 Max continua sendo a opção de API mais segura hoje.
| Dimensão |
Qwen 3.8 Max Preview |
Qwen 3.7 Max |
| Status |
Prévia atualizada continuamente |
Modelo de API existente |
| Parâmetros publicados |
2,4T no total |
Não é o principal argumento público de venda |
| Visão |
A Alibaba afirma que sim |
Somente texto |
| Contexto |
Não publicado |
1 milhão de tokens |
| Saída máxima |
Não publicada |
65.536 tokens |
| Pesos |
Prometidos, não lançados |
Pesos fechados |
| Preços |
Créditos do Token Plan; sem tarifa normal por token |
Preço do GPT Proto: US$ 0,36 de entrada / US$ 1,44 de saída por 1 milhão |
| Uso do backend em produção |
O plano individual proíbe o uso automatizado em backend |
Acesso convencional à API com medição |
Eu não faria uma atualização cega da string do modelo do Qwen 3.7 Max para a prévia 3.8. Primeiro, verifique a estabilidade das respostas, os esquemas de ferramentas, a latência, o uso de tokens de raciocínio e se o modelo final de produção preserva o comportamento da prévia.
Se você precisa de uma API Qwen para uma aplicação agora, o endpoint existente do Qwen 3.7 Max é a ponte prática:
curl "https://gptproto.com/v1/chat/completions" \
-H "Authorization: Bearer $GPTPROTO_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.7-max",
"messages": [
{
"role": "user",
"content": "Review this architecture and list the three highest-risk assumptions."
}
]
}'
Isso chama o Qwen 3.7 Max, não o Qwen 3.8 Max. Essa distinção evita uma falha comum na semana de lançamento: publicar código para um endpoint que a plataforma não oferece.
Qwen 3.8 Max vs Kimi K3, GLM-5.2 e Fable 5
A comparação honesta é assimétrica porque faltam várias especificações públicas do Qwen 3.8 Max.
| Modelo |
Melhor motivo atual para testá-lo |
Principal desvantagem |
| Qwen 3.8 Max Preview |
Novo modelo principal Qwen de 2,4T, com visão e resultados iniciais fortes em agentes |
Prévia em mudança, contexto e preço por token desconhecidos, sem pesos até o momento |
| Kimi K3 |
Arquitetura MoE publicada de 2,8T, contexto multimodal de 1 milhão e acesso convencional à API |
O raciocínio sempre ativado pode aumentar a latência e o custo da saída |
| GLM-5.2 |
Pesos abertos com licença MIT, parâmetros ativos conhecidos, contexto de 1 milhão e programação de agentes de menor custo |
Somente texto; a capacidade total pode ficar atrás das prévias fechadas mais recentes em algumas tarefas |
| Fable 5 |
O ponto de referência citado na própria afirmação de lançamento do Qwen para trabalhos de longa duração |
Preço mais alto, e o Qwen não publicou evidências para validar sua afirmação de comparação |
Na comparação entre Qwen 3.8 Max e Kimi K3, o melhor teste público equivalente atualmente dá ao Kimi uma vantagem de três pontos, mas dá ao Qwen a maior pontuação de uso de ferramentas. Entre Qwen 3.8 Max e GLM-5.2, a decisão depende menos de uma classificação de qualidade não verificada e mais da implantação: o GLM tem pesos disponíveis para download com licença MIT hoje; o Qwen não. Entre Qwen 3.8 Max e Fable 5, não há evidências públicas suficientes para validar a classificação da Alibaba.
Veja a comparação completa entre Qwen 3.8 Max e Kimi K3
Os desenvolvedores devem usar o Qwen 3.8 Max agora?
Sim, se a carga de trabalho se beneficiar de programação complexa, compreensão visual, contexto longo ou execução de agentes em várias etapas.
A API de produção, o preço publicado por token, a janela de contexto de 1 milhão de tokens e o nome estável do modelo eliminam a maioria das objeções de implantação que se aplicavam à prévia de julho. Os desenvolvedores agora podem avaliá-lo como um modelo hospedado normal, em vez de um endpoint experimental exclusivo para assinantes.
Ainda há limites:
A inferência em lote e o ajuste fino não são compatíveis atualmente.
Seu limite de saída de 128 mil pode gerar respostas caras quando um alto esforço de raciocínio é usado indiscriminadamente.
Os pesos disponíveis para download e a licença final ainda não estavam disponíveis em 7 de agosto.
Os exemplos mais longos de trabalho autônomo da Alibaba são demonstrações executadas pelo fornecedor, não garantias para todas as aplicações.
Para uso hospedado em produção, comece pela API do Qwen3.8-Max no GPT Proto. Para hospedagem própria, aguarde até que o checkpoint e a licença anunciados sejam efetivamente publicados.