Preços+7% bônus
Tiffany Layne2026-07-23

O que é o Qwen 3.8 Max? Lançamento, especificações, preços e pesos abertos

O Qwen3.8-Max é o modelo multimodal principal de 2,4T da Alibaba. Veja seu contexto de 1 milhão, 95B de parâmetros ativos, preço da API, capacidades, benchmarks e status dos pesos abertos.

O que é o Qwen 3.8 Max? Lançamento, especificações, preços e pesos abertos

Atualizado em 7 de agosto de 2026: A Alibaba lançou oficialmente a versão de produção do Qwen3.8-Max em 3 de agosto, substituindo o anterior qwen3.8-max-preview como o atual modelo de API principal. Este artigo foi atualizado com a arquitetura confirmada, a janela de contexto, os preços, a disponibilidade da API e o cronograma dos pesos abertos.

O Qwen3.8-Max é o modelo Qwen mais avançado da Alibaba até o momento: um modelo multimodal Sparse Mixture-of-Experts com 2,4 trilhões de parâmetros totais e 95 bilhões de parâmetros ativos por solicitação.

O modelo estável aceita entradas de texto, imagem e vídeo, produz texto como saída e oferece uma janela de contexto de até 1 milhão de tokens, com até 128 mil tokens de saída. Ele foi projetado para programação complexa, análise visual, pesquisa, trabalho profissional e tarefas de agentes de longa duração.

O lançamento também muda a resposta prática para desenvolvedores. O Qwen3.8-Max não está mais limitado a uma versão de prévia sujeita a alterações nem a um plano pessoal exclusivo de Créditos. Agora ele conta com uma API normal de pagamento conforme o uso, com a Alibaba anunciando US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de tokens de saída. Ele também está disponível por meio da API do Qwen 3.8 Max no GPTProto.

Minha opinião resumida: o Qwen 3.8 Max é uma prévia real e excepcionalmente interessante, não um lançamento de produto concluído. Os desenvolvedores devem testá-lo, registrar a data de cada resultado e evitar planejar migrações para produção com base em especificações que a Alibaba ainda não publicou.

Índice

Qwen 3.8 Max em resumo

Especificação Detalhes confirmados do Qwen3.8-Max
Desenvolvedor Alibaba Qwen
Nome do modelo estável qwen3.8-max
Lançamento da prévia 19 de julho de 2026
Lançamento da produção 3 de agosto de 2026
Arquitetura Sparse Mixture-of-Experts com atenção híbrida
Parâmetros totais 2,4 trilhões
Parâmetros ativos 95 bilhões
Janela de contexto Até 1 milhão de tokens
Saída máxima Até 128 mil tokens
Entradas Texto, imagens e vídeo
Saída Texto
Modo de raciocínio Raciocínio híbrido com esforço de raciocínio ajustável
Chamada de funções Compatível
Saída estruturada Compatível
Pesquisa na Web Compatível
Armazenamento em cache do contexto Compatível
Inferência em lote Atualmente não compatível
Ajuste fino Atualmente não compatível
Preço da API oficial US$ 2/M tokens de entrada e US$ 6/M tokens de saída
Disponibilidade no GPT Proto Disponível agora
Pesos abertos Anunciados, mas não disponíveis para download em 7 de agosto de 2026

Essa lista é mais curta do que as tabelas de especificações que aparecem em algumas coberturas iniciais do Qwen 3.8 Max. E há uma razão para isso. Um modelo de prévia não ganha uma janela de contexto de 1 milhão, um layout específico de Mixture-of-Experts ou uma licença de lançamento apenas porque esses detalhes pareceriam plausíveis ao lado de outros modelos principais de 2026.

O Qwen 3.8 Max foi lançado?

Sim. O Qwen3.8-Max recebeu seu lançamento de produção em 3 de agosto de 2026.

A Alibaba disponibilizou inicialmente o qwen3.8-max-preview em 19 de julho. Essa prévia podia mudar entre chamadas e não tinha preços comuns de pagamento conforme o uso. O lançamento estável do qwen3.8-max substitui essa situação da semana de lançamento por um modelo de API documentado, especificações publicadas e cobrança padrão por token.

Os desenvolvedores agora podem chamar o modelo pelo Alibaba Cloud Model Studio ou usar a API do Qwen3.8-Max no GPT Proto junto com outros modelos de texto, imagem e vídeo na mesma conta.

O que significa a contagem de 2,4T parâmetros?

O Qwen3.8-Max contém 2,4 trilhões de parâmetros totais, mas sua arquitetura Sparse Mixture-of-Experts ativa aproximadamente 95 bilhões de parâmetros para cada solicitação.

Essa distinção é importante. A contagem total de parâmetros representa a capacidade total do modelo, enquanto a contagem ativa afeta mais diretamente o processamento da inferência. Cerca de 4% dos parâmetros totais ficam ativos por vez, permitindo que a Alibaba amplie a capacidade do modelo sem pagar o custo computacional de ativar todos os 2,4 trilhões de parâmetros para cada token.

A contagem de parâmetros, por si só, ainda não prova que um modelo seja mais rápido, barato ou preciso. A infraestrutura de serviço, a eficiência dos tokens, a duração do raciocínio, o armazenamento em cache e o número de novas tentativas também afetam o custo real de uma tarefa concluída.

O Qwen 3.8 Max é de código aberto?

Ainda não, em 7 de agosto de 2026.

A Alibaba confirmou que os pesos do Qwen3.8-2.4T-A95B serão lançados, tornando este o primeiro modelo da classe Qwen Max programado para um lançamento com pesos abertos. A página de lançamento do ModelScope aponta atualmente para 12 de agosto de 2026.

Até que o checkpoint e a licença sejam efetivamente publicados, o Qwen3.8-Max deve ser descrito como um modelo de API com lançamento de pesos abertos anunciado — não como um modelo de código aberto já disponível para download.

Mesmo depois da chegada dos pesos, um checkpoint com 2,4 trilhões de parâmetros exigirá infraestrutura significativa de armazenamento, memória, rede e inferência. Para a maioria dos desenvolvedores, a API hospedada continuará sendo consideravelmente mais fácil do que a hospedagem própria.

Preços da API do Qwen 3.8 Max

A tarifa publicada pela Alibaba para pagamento conforme o uso é:

Item de cobrança Preço oficial de tabela
Tokens de entrada US$ 2 por 1 milhão de tokens
Tokens de saída US$ 6 por 1 milhão de tokens
Janela de contexto Até 1 milhão de tokens
Saída máxima Até 128 mil tokens

Isso torna o Qwen3.8-Max mais barato, no preço oficial de tabela, do que a tarifa de US$ 3/US$ 15 para entrada e saída do Kimi K3, embora continue mais caro do que alguns modelos menores somente de texto.

Os preços do GPT Proto podem ser diferentes do preço de tabela direto da Alibaba. Consulte a página ativa da API do Qwen 3.8 Max antes de estimar uma carga de trabalho de produção grande.

O que mostram os primeiros benchmarks do Qwen 3.8 Max?

As evidências são mais fortes do que eram durante a prévia de julho, mas ainda precisam de contexto.

No lançamento, a Alibaba informou que o Qwen3.8-Max ficou em quinto lugar na Text Arena, segundo na Vision Arena e quarto na Frontend Code Arena. A Alibaba também publicou exemplos de programação de longa duração, reconstrução de aplicações visuais, análise de documentos profissionais e uso autônomo de ferramentas.

Esses resultados estabelecem o Qwen3.8-Max como um modelo de fronteira sério. Eles não garantem que ele superará todas as alternativas em um repositório ou fluxo de trabalho específico de agente.

A comparação anterior do StackPerf com 269 arquivos continua útil, mas testou a versão de pré-lançamento Qwen3.8-Max Preview. O Kimi K3 marcou 83/100 e a prévia do Qwen marcou 80/100, enquanto o Qwen concluiu com sucesso todas as 44 chamadas de ferramentas e recebeu a maior pontuação de uso de ferramentas. Considere esse resultado um sinal comportamental datado — não uma classificação final do lançamento estável de agosto.

Um teste inicial útil vem de uma comparação equivalente do StackPerf com o Kimi K3. Os dois modelos inspecionaram cópias congeladas de 269 arquivos e tiveram 60 minutos para produzir um projeto de integração no nível do repositório, com citações, etapas de migração, testes e um registro de evidências. Os relatórios foram anonimizados antes da avaliação.

O Kimi K3 marcou 83/100 após penalidades factuais; o Qwen 3.8 Max Preview marcou 80/100. O Qwen recebeu 9/10 pelo uso de ferramentas contra 8/10 do Kimi, concluiu com sucesso todas as 44 chamadas de ferramentas e produziu o relatório mais longo com menos solicitações. O Kimi terminou mais rápido, usou menos tokens em seu percurso testado e lidou de forma mais completa com revisões e regenerações.

Isso é uma evidência confiável para um tipo de trabalho de arquitetura de software com contexto longo. Não prova que o Kimi K3 seja geralmente melhor, nem que o Qwen seja geralmente melhor. Os modelos passaram por provedores diferentes, e a latência da rota, o armazenamento em cache, o tráfego do lançamento e as configurações de raciocínio afetaram o resultado.

O cenário inicial da comunidade é igualmente misto. Na principal discussão de lançamento no Hacker News, um testador relatou que uma tarefa com SVG animado levou mais de 10 minutos de raciocínio, enquanto outro desenvolvedor disse que a prévia funcionava bem para programação, mas ainda era nova demais para ser avaliada. São relatos, não benchmarks. Eles destacam duas coisas que vale a pena medir em seus próprios testes: tempo até uma resposta utilizável e conclusão da tarefa por token.

Qwen 3.8 Max vs Qwen 3.7 Max

O Qwen 3.8 Max parece uma evolução no escopo de capacidades, mas o Qwen 3.7 Max continua sendo a opção de API mais segura hoje.

Dimensão Qwen 3.8 Max Preview Qwen 3.7 Max
Status Prévia atualizada continuamente Modelo de API existente
Parâmetros publicados 2,4T no total Não é o principal argumento público de venda
Visão A Alibaba afirma que sim Somente texto
Contexto Não publicado 1 milhão de tokens
Saída máxima Não publicada 65.536 tokens
Pesos Prometidos, não lançados Pesos fechados
Preços Créditos do Token Plan; sem tarifa normal por token Preço do GPT Proto: US$ 0,36 de entrada / US$ 1,44 de saída por 1 milhão
Uso do backend em produção O plano individual proíbe o uso automatizado em backend Acesso convencional à API com medição

Eu não faria uma atualização cega da string do modelo do Qwen 3.7 Max para a prévia 3.8. Primeiro, verifique a estabilidade das respostas, os esquemas de ferramentas, a latência, o uso de tokens de raciocínio e se o modelo final de produção preserva o comportamento da prévia.

Se você precisa de uma API Qwen para uma aplicação agora, o endpoint existente do Qwen 3.7 Max é a ponte prática:

curl "https://gptproto.com/v1/chat/completions" \
  -H "Authorization: Bearer $GPTPROTO_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.7-max",
    "messages": [
      {
        "role": "user",
        "content": "Review this architecture and list the three highest-risk assumptions."
      }
    ]
  }'

Isso chama o Qwen 3.7 Max, não o Qwen 3.8 Max. Essa distinção evita uma falha comum na semana de lançamento: publicar código para um endpoint que a plataforma não oferece.

Qwen 3.8 Max vs Kimi K3, GLM-5.2 e Fable 5

A comparação honesta é assimétrica porque faltam várias especificações públicas do Qwen 3.8 Max.

Modelo Melhor motivo atual para testá-lo Principal desvantagem
Qwen 3.8 Max Preview Novo modelo principal Qwen de 2,4T, com visão e resultados iniciais fortes em agentes Prévia em mudança, contexto e preço por token desconhecidos, sem pesos até o momento
Kimi K3 Arquitetura MoE publicada de 2,8T, contexto multimodal de 1 milhão e acesso convencional à API O raciocínio sempre ativado pode aumentar a latência e o custo da saída
GLM-5.2 Pesos abertos com licença MIT, parâmetros ativos conhecidos, contexto de 1 milhão e programação de agentes de menor custo Somente texto; a capacidade total pode ficar atrás das prévias fechadas mais recentes em algumas tarefas
Fable 5 O ponto de referência citado na própria afirmação de lançamento do Qwen para trabalhos de longa duração Preço mais alto, e o Qwen não publicou evidências para validar sua afirmação de comparação

Na comparação entre Qwen 3.8 Max e Kimi K3, o melhor teste público equivalente atualmente dá ao Kimi uma vantagem de três pontos, mas dá ao Qwen a maior pontuação de uso de ferramentas. Entre Qwen 3.8 Max e GLM-5.2, a decisão depende menos de uma classificação de qualidade não verificada e mais da implantação: o GLM tem pesos disponíveis para download com licença MIT hoje; o Qwen não. Entre Qwen 3.8 Max e Fable 5, não há evidências públicas suficientes para validar a classificação da Alibaba.

Veja a comparação completa entre Qwen 3.8 Max e Kimi K3

Os desenvolvedores devem usar o Qwen 3.8 Max agora?

Sim, se a carga de trabalho se beneficiar de programação complexa, compreensão visual, contexto longo ou execução de agentes em várias etapas.

A API de produção, o preço publicado por token, a janela de contexto de 1 milhão de tokens e o nome estável do modelo eliminam a maioria das objeções de implantação que se aplicavam à prévia de julho. Os desenvolvedores agora podem avaliá-lo como um modelo hospedado normal, em vez de um endpoint experimental exclusivo para assinantes.

Ainda há limites:

  • A inferência em lote e o ajuste fino não são compatíveis atualmente.

  • Seu limite de saída de 128 mil pode gerar respostas caras quando um alto esforço de raciocínio é usado indiscriminadamente.

  • Os pesos disponíveis para download e a licença final ainda não estavam disponíveis em 7 de agosto.

  • Os exemplos mais longos de trabalho autônomo da Alibaba são demonstrações executadas pelo fornecedor, não garantias para todas as aplicações.

Para uso hospedado em produção, comece pela API do Qwen3.8-Max no GPT Proto. Para hospedagem própria, aguarde até que o checkpoint e a licença anunciados sejam efetivamente publicados.

Perguntas frequentes

Qual é a data de lançamento do Qwen 3.8 Max?

O Qwen3.8-Max-Preview foi lançado em 19 de julho de 2026. A Alibaba ainda não anunciou a data de lançamento da produção nem a data do checkpoint com pesos abertos.

Qual é o tamanho do Qwen 3.8 Max?

O Qwen3.8-Max tem 2,4 trilhões de parâmetros totais e ativa aproximadamente 95 bilhões de parâmetros por solicitação por meio de sua arquitetura Sparse Mixture-of-Experts.

O Qwen 3.8 Max tem uma janela de contexto de 1 milhão?

Sim. O modelo estável oferece uma janela de contexto de até 1 milhão de tokens e uma saída máxima de até 128 mil tokens.

Quanto custa a API do Qwen 3.8 Max?

A Alibaba lista o Qwen3.8-Max a US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de tokens de saída. Consulte a página do Qwen3.8-Max no GPTProto para ver a tarifa atual do GPTProto.

O Qwen 3.8 Max é de código aberto?

Ainda não, em 7 de agosto de 2026. A Alibaba anunciou um lançamento de pesos abertos para `Qwen3.8-2.4T-A95B`, mas os desenvolvedores devem aguardar o checkpoint e a licença antes de presumir condições de hospedagem própria ou uso comercial.

Posso usar o Qwen 3.8 Max no backend de uma aplicação?

Sim. O modelo estável agora oferece acesso à API com pagamento conforme o uso e está disponível pelo GPTProto. Isso é diferente das restrições anteriores do Personal Token Plan que se aplicavam à rota de acesso à prévia.

Quais entradas o Qwen 3.8 Max aceita?

O modelo oficial aceita entradas de texto, imagem e vídeo e produz texto como saída. Chamada de funções, saída estruturada, pesquisa na Web e armazenamento em cache do contexto também são compatíveis.

Artigos relacionados

Mais blogs
O que é o Kimi K3 — e ele está realmente próximo do GPT-5.6 e do Fable 5?

O que é o Kimi K3 — e ele está realmente próximo do GPT-5.6 e do Fable 5?

Resumo O Kimi K3 é um modelo multimodal da Moonshot AI com 2,8 trilhões de parâmetros, desenvolvido para programação de longa duração, trabalho de conhecimento, raciocínio e fluxos de trabalho com agentes. Testes independentes o colocam próximo do Claude Opus 4.8 e do GPT-5.5 no geral, enquanto o GPT-5.6 Sol e o Claude Fable 5 continuam à frente. O K3 se aproxima nos benchmarks de agentes e lidera alguns testes de automação, mas sua taxa medida de alucinação aumentou em relação ao K2.6. O Kimi K3 agora está disponível com pesos abertos. A Moonshot AI publicou o checkpoint completo, o model card, o relatório técnico e a licença personalizada Kimi K3. O repositório oficial no Hugging Face ocupa cerca de 1,56 TB em 96 fragmentos safetensors, e a Moonshot recomenda implantações em supernodes com 64 ou mais aceleradores. Os pesos abertos resolvem a questão da propriedade. Eles não transformam o K3 em um modelo local comum. Para a maioria dos desenvolvedores, a API hospedada continua sendo o ponto de partida mais prático. A API do Kimi K3 na GPTProto atualmente lista US$ 2,70 por milhão de tokens de entrada e US$ 13,50 por milhão de tokens de saída. Escolha os pesos quando o controle dos dados, a inferência personalizada ou a modificação do modelo justificarem a infraestrutura e a análise da licença. Em resumo, o Kimi K3 está próximo o suficiente do GPT-5.6 e do Fable 5 para fazer parte da mesma conversa—e seu lançamento com pesos abertos agora oferece aos desenvolvedores uma opção de implantação que nenhum dos dois modelos fechados oferece.

Michael Johnson | 2026-07-28

GLM-5.2 vs Kimi K3 para programação: qual é melhor para desenvolvedores em 2026?

GLM-5.2 vs Kimi K3 para programação: qual é melhor para desenvolvedores em 2026?

TL;DR: Kimi K3 é o modelo de programação mais forte quando a tarefa é difícil, longa ou visual. Ele supera o GLM-5.2 na comparação de programação publicada pela Moonshot e aceita imagens e vídeos por meio de seu serviço hospedado. O GLM-5.2 continua sendo a melhor opção padrão para o trabalho rotineiro em repositórios: custa muito menos, é menor para operar e usa a licença permissiva MIT. O Kimi K3 também passou a disponibilizar seus pesos, mas seu repositório de 1,56 TB, a implantação recomendada com mais de 64 aceleradores e a licença personalizada tornam a hospedagem própria um compromisso consideravelmente maior. Escolha o Kimi quando a capacidade for o gargalo; escolha o GLM quando o custo e a simplicidade operacional forem importantes todos os dias. A parte interessante da comparação de código entre GLM-5.2 e Kimi K3 não é que ambos os modelos conseguem escrever um componente React ou resolver um algoritmo curto. Modelos desse nível já superam esse requisito. A pergunta útil é o que acontece quando a tarefa fica complicada: uma auditoria de repositório, uma migração com vários arquivos, um bug que só aparece em uma captura de tela ou um protótipo jogável em Three.js que precisa manter vários sistemas coerentes. É também nesse ponto que a diferença de preço começa a importar. O Kimi K3 parece melhor nos testes públicos mais difíceis, mas seu preço oficial de saída é mais de três vezes maior que o do GLM-5.2. Uma equipe que executa milhares de revisões comuns pode realizar mais trabalho por dólar com o GLM. Um desenvolvedor tentando salvar um projeto visual difícil pode pagar pelo K3 sem hesitar.

Tiffany Layne | 2026-07-28

Melhor API de IA para Desenvolvedores em 2026: 10 Plataformas Comparadas

Melhor API de IA para Desenvolvedores em 2026: 10 Plataformas Comparadas

TL;DR Melhores APIs diretas: OpenAI é a opção padrão mais segura para uso geral; Anthropic Claude é a mais forte para programação e agentes de longa duração; Gemini é adequada para prototipagem multimodal de baixo custo; e DeepSeek lidera em preço por token de texto. Melhores opções multimodelo: OpenRouter é a escolha mais clara para testar vários LLMs. GPTProto é mais indicada quando um produto precisa de modelos de texto, imagem e vídeo sob uma única chave de API e um saldo compartilhado. Melhores opções de infraestrutura: Amazon Bedrock é adequada para implantações empresariais regidas pela AWS, enquanto Replicate, fal.ai e Together AI são mais indicadas para inferência de modelos abertos ou de mídia generativa. Não existe um vencedor universal. Compare a adequação à carga de trabalho, a cobertura de modelos, as unidades reais de cobrança, os controles de produção e o custo de migração. Os preços e a disponibilidade foram verificados em 14 de julho de 2026; confirme as páginas atuais dos provedores antes da implantação.

Tiffany Layne | 2026-07-15

MiniMax M3 para Programação: Benchmarks, Preços Reais e Como Chamá-lo via API (2026)

MiniMax M3 para Programação: Benchmarks, Preços Reais e Como Chamá-lo via API (2026)

O MiniMax M3 é bom para programação? A resposta curta: sim, para trabalho agêntico e com vários arquivos, com duas ressalvas que vou apresentar antes que você leia mais uma palavra. A maioria das pontuações de programação mais divulgadas foi obtida pela MiniMax em sua própria infraestrutura, e o "contexto de 1 milhão de tokens" tem um salto de preço em 512K que afeta especialmente os agentes de programação. Ambos os pontos são administráveis quando você sabe que existem. Nenhum deles aparece claramente na maioria da cobertura do lançamento. Estou escrevendo isto porque a proposta de programação em torno do M3 foi reduzida a um único número — 59% no SWE-Bench Pro — e esse número está sendo usado sem muita análise. A seguir, explico o que o modelo realmente é, onde chegam as medições independentes, quanto ele custa em uma carga de trabalho de programação real e como chamá-lo pela API do GPTProto. Se você quer apenas uma conclusão: um avaliador independente que executa a mesma bateria em todos os modelos relevantes colocou o M3 "próximo do GPT e do Opus em programação real, mas ainda não acima deles". Isso também corresponde à posição dos benchmarks neutros.

Schuyler Stacy | 2026-07-02