Atualização de Codificação e Cowork
O pós-treinamento adicional tem como foco engenharia de software complexa, pesquisa científica, trabalho profissional e tarefas de várias etapas que devem continuar do planejamento até a entrega.
curl --request POST "https://gptproto.com/v1/chat/completions" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"model": "qwen3.8-max-0902",
"messages": [
{
"role": "user",
"content": "Hello"
}
]
}'Chat, agentes de programação e trabalho com documentos. Preço por 1M de tokens — entrada, entrada em cache e saída são cobradas separadamente. GPTProto está 10% abaixo das tarifas oficiais.
| Cenário | Lista de Qwen | OpenRouter | GPTProto | Economia / mês |
|---|---|---|---|---|
| Pessoal10M tokens / mês (4.8M cache) | $19.60 | $20.68 | $17.64 | −$1.96≈ $23.52 / ano |
| Equipe100M tokens / mês (48M cache) | $196.00 | $206.78 | $176.40 | −$19.60≈ $235.20 / ano |
| Empresarial500M tokens / mês (240M cache) | $980.00 | $1033.90 | $882.00 | −$98.00≈ $1176.00 / ano |
Use o Qwen3.8-Max-0902 para codificação em escala de repositório, pesquisa científica, trabalho profissional de conhecimento e agentes de longo horizonte. A revisão mantém o contexto de 1M tokens e a entrada multimodal da família Qwen3.8-Max, ao mesmo tempo que adiciona pós-treinamento adicional para tarefas de codificação e cowork.
Atualização de Codificação e Cowork
O pós-treinamento adicional tem como foco engenharia de software complexa, pesquisa científica, trabalho profissional e tarefas de várias etapas que devem continuar do planejamento até a entrega.
Contexto de 1M e Saída de 131K
Processe grandes repositórios, documentos longos, histórico de ferramentas e materiais de origem variados dentro de uma janela de contexto de 1,000,000 tokens, com até 131,072 tokens de saída.
Entrada Multimodal, Saída de Texto
Combine texto, imagens e vídeo para revisão de interfaces, análise de documentos, raciocínio sobre gráficos e inspeção de fluxos de trabalho gravados. O modelo retorna texto em vez de mídia gerada.
Ferramentas, JSON e Cache de Contexto
Conecte funções externas, solicite saída restrita por esquema, transmita respostas em streaming e reutilize contexto em cache em fluxos de trabalho de agentes. A disponibilidade de ferramentas gerenciadas pelo provedor pode variar por endpoint.
O Qwen3.8-Max-0902 é a revisão de 2 de setembro de 2026 do Qwen3.8-Max feita pela Alibaba Qwen. Não é uma arquitetura recém-anunciada nem um sucessor maior. A Qwen o descreve como o modelo existente de mistura de especialistas com 2,4 trilhões de parâmetros após pós-treinamento adicional para codificação e cowork, com o objetivo de melhorar tarefas empresariais complexas, pesquisa científica e fluxos de trabalho de longo horizonte.
O modelo hospedado mantém o envelope operacional documentado da família Qwen3.8-Max: entrada de texto, imagem e vídeo; saída de texto; chamada de funções; saídas estruturadas; cache de contexto; e operação com ou sem pensamento. A Alibaba lista uma janela de contexto nominal de 1.000.000 de tokens, com até 991.808 tokens de entrada no modo padrão, 983.616 tokens de entrada no modo de pensamento e 131.072 tokens de saída.
O nome da página e o identificador da solicitação exigem uma distinção cuidadosa. A Qwen anunciou a revisão como Qwen3.8-Max-0902, enquanto a documentação pública do Model Studio da Alibaba ainda lista o ID geral do modelo de API como qwen3.8-max. Um provedor de API pode expor a atualização por meio do alias padrão ou de um snapshot datado. Para chamadas ao GPTProto, use a string de modelo exata exibida no Quick Start em vez de construir uma a partir do título da página.
| Especificação | Detalhe Confirmado |
|---|---|
| Provedor | Alibaba Qwen |
| Data da revisão | 2 de setembro de 2026 |
| Tipo de atualização | Pós-treinamento adicional para codificação e cowork |
| Tamanho publicado da família | 2,4T de parâmetros totais, arquitetura de mistura de especialistas |
| Modalidades de entrada | Texto, imagem e vídeo |
| Modalidade de saída | Texto |
| Janela de contexto | 1.000.000 de tokens |
| Entrada padrão máxima | 991.808 tokens |
| Entrada máxima no modo de pensamento | 983.616 tokens |
| Saída máxima | 131.072 tokens |
| Chamada de funções | Suportado |
| Saídas estruturadas | Suportado |
| Cache de contexto | Suportado |
| Ajuste fino | Atualmente não suportado |
| Status de pesos abertos | Nenhum checkpoint separadamente rotulado como 0902 foi identificado |
A versão 0902 é uma melhoria comportamental, não uma redefinição de especificações. A contagem de parâmetros, a janela de contexto de 1M, o teto de saída e as modalidades de entrada suportadas permanecem dentro do envelope publicado da família Qwen3.8-Max. A principal mudança é o pós-treinamento adicional voltado para melhor codificação, cowork, uso de ferramentas e conclusão sustentada de tarefas.
| Fator de Decisão | Qwen3.8-Max Original | Qwen3.8-Max-0902 |
|---|---|---|
| Base do modelo | Carro-chefe MoE de 2,4T | Mesma base publicada da família |
| Contexto e saída | Contexto de 1M; até 131.072 tokens de saída | Limites publicados inalterados |
| Foco de treinamento | Codificação, trabalho profissional, pesquisa e agentes | Pós-treinamento adicional para codificação e cowork |
| Code Arena: WebDev | 1.669 na comparação reportada pela Qwen | 1.691 no lançamento, um aumento de 22 pontos |
| Nomenclatura pública da API | A Alibaba documenta qwen3.8-max |
Use o alias ou snapshot ID exibido pelo provedor |
| Pesos abertos | Existem checkpoints separados da família Qwen3.8 | Nenhum checkpoint separado rotulado como 0902 confirmado |
O resultado do Code Arena é um sinal útil para codificação frontend e agêntica, mas não prova que todos os repositórios ou fluxos de trabalho com ferramentas irão melhorar. Teste as rotas antiga e nova com os mesmos prompts, estado do repositório, permissões de ferramentas, configurações de raciocínio e critérios de aceitação antes de migrar o tráfego de produção.
Inspecione limites de módulos, conecte requisitos ao código existente, planeje alterações em vários arquivos, chame ferramentas de desenvolvimento e revise a saída de testes. O contexto de 1M pode conter código-fonte, configuração, documentação e histórico do agente, mas testes executáveis e checkpoints ainda são necessários.
Use o Qwen3.8-Max-0902 para agentes de migração, investigações técnicas, pipelines de análise de dados e assistentes internos que consultam várias ferramentas antes de retornar resultados estruturados. Valide os argumentos das ferramentas e restrinja permissões na camada de aplicação.
Combine artigos, relatórios, tabelas, diagramas e descobertas anteriores em uma única tarefa. Exija identificadores de origem e uma separação clara entre fatos extraídos e inferência. Use recuperação quando o conjunto de fontes exceder o limite de contexto ou mudar com frequência.
Analise capturas de tela, gráficos, documentos visuais e fluxos de trabalho gravados por meio de entrada de texto, imagem e vídeo. O endpoint retorna texto, então a criação de mídia ainda exige um modelo dedicado de imagem ou vídeo.
Compare o custo por resultado aceito, incluindo tokens de raciocínio, tentativas repetidas, chamadas de ferramenta com falha e correção humana — não apenas o preço dos tokens.
| Modelo | Comece Aqui Quando | Valide Antes de Encaminhar Mais Tráfego |
|---|---|---|
| Qwen3.8-Max-0902 | A tarefa combina codificação difícil, contexto longo, evidências multimodais e muitas etapas com ferramentas | Comportamento de regressão, latência e total de tokens no seu próprio fluxo de trabalho |
| GPT-5.6 | Seu aplicativo já depende de codificação e comportamento de agente orientados ao GPT | O nível exato do modelo, compatibilidade com ferramentas, latência e custo |
| Gemini 3.7 Flash | Trabalho multimodal de alto volume torna velocidade e custo de tokens o primeiro filtro | Precisão em repositórios complexos e comprimento de saída exigido |
| Kimi K3 | Tarefas longas de codificação ou pesquisa precisam de outra rota de fronteira para testes A/B | Conclusão na primeira passagem, precisão de chamadas de ferramentas e uso de tokens |
| GLM-5.3 Flash | Tráfego de codificação e agentes sensível a orçamento precisa de uma primeira rota de menor custo | As tarefas mais difíceis de várias etapas e em escala de repositório |
Para roteamento sensível a custo, comece com um modelo da classe Flash, como GLM-5.3 Flash, depois envie tarefas difíceis ou que falham repetidamente para o Qwen3.8-Max-0902.
Antes de mover o tráfego do Qwen3.8 Max original, registre a string de modelo, o prompt, as configurações de raciocínio, os esquemas de ferramentas, a latência, o uso de tokens e o resultado. Execute a mesma avaliação contra o 0902.
Copie o ID exato do modelo do Quick Start do GPTProto; não presuma que o título da página seja a string de solicitação.
Teste novamente esquemas de funções, JSON estruturado, streaming e recuperação de erros.
Verifique a formatação de entrada de imagem e vídeo se o fluxo de trabalho for multimodal.
Meça conclusão na primeira passagem, tentativas repetidas, tokens de saída, latência ponta a ponta e correções humanas.
Mantenha a rota anterior disponível até que a nova revisão passe nos testes de regressão.
Uma taxa de token mais baixa não é automaticamente mais acessível quando tentativas repetidas ou reparo manual aumentam. Meça o custo por resultado aceito.
Escolha o Qwen3.8-Max-0902 para grandes repositórios, evidências multimodais, saídas longas, uso estruturado de ferramentas ou trabalho sustentado em muitas etapas. Ele se adequa a agentes de codificação, assistentes de pesquisa e sistemas empresariais que devem produzir um entregável verificável.
Use um modelo menor ou da classe Flash para tarefas curtas e sensíveis à latência. A chave e o saldo compartilhados do GPTProto permitem que desenvolvedores comparem o catálogo de modelos sem contas separadas de provedores. Verifique preços ao vivo e resultados de avaliação antes de definir um padrão.
Guias, comparações e atualizações relacionadas a este modelo.
Todos os artigos
Claude Fable 5.1 e Mythos 5.1 compartilham um modelo, mas diferem no acesso. Veja preços, recursos, benchmarks, salvaguardas e mudanças na migração da API.

Meta Descrição: Compare GLM 5.3 Flash vs DeepSeek V4 Flash para programação, trabalho de frontend, agentes, velocidade, contexto e preços de API para escolher o melhor modelo.

Qwen3.8-Flash-Next vs GLM-5.3 Flash comparados para programação, agentes, trabalho de frontend, velocidade, preços, contexto, licenças e uso em produção.

Compare os 7 melhores gateways de IA para desenvolvedores em 2026 por preços, roteamento, controles de custos, implantação e trade-offs de produção.