Contexto de 1M Tokens
Processe grandes bases de código, especificações longas e contexto de vários documentos dentro da janela de 1M tokens do modelo, ao mesmo tempo que orçamenta tokens de prompt e gerados em conjunto.
curl --request POST "https://gptproto.com/v1/chat/completions" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"model": "hy4-preview",
"messages": [
{
"role": "user",
"content": "Hello"
}
]
}'Chat, agentes de programação e trabalho com documentos. Preço por 1M de tokens — entrada, entrada em cache e saída são cobradas separadamente. GPTProto está 5% abaixo das tarifas oficiais.
| Cenário | Lista de Hunyuan | OpenRouter | GPTProto | Economia / mês |
|---|---|---|---|---|
| Pessoal10M tokens / mês (4.8M cache) | $7.87 | $8.31 | $7.48 | −$0.39≈ $4.72 / ano |
| Equipe100M tokens / mês (48M cache) | $78.72 | $83.05 | $74.79 | −$3.94≈ $47.22 / ano |
| Empresarial500M tokens / mês (240M cache) | $393.62 | $415.27 | $373.94 | −$19.68≈ $236.11 / ano |
Crie com o modelo Mixture-of-Experts de 770B e pesos abertos da Tencent por meio de uma API hospedada. O Hy4 preview ativa 49B parâmetros por token, oferece suporte a uma janela de contexto de 1M tokens e tem como alvo engenharia de software, trabalho de produtividade complexo, raciocínio científico e tarefas sustentadas de várias etapas.
Contexto de 1M Tokens
Processe grandes bases de código, especificações longas e contexto de vários documentos dentro da janela de 1M tokens do modelo, ao mesmo tempo que orçamenta tokens de prompt e gerados em conjunto.
770B MoE, 49B Ativos
O Hy4 preview usa uma base MoE de 770B parâmetros, mas ativa 49B parâmetros por token, combinando grande capacidade de modelo com computação esparsa.
Criado para Fluxos de Trabalho Reais
A Tencent treinou o preview para engenharia de software, análise de escritório, desenvolvimento de jogos e pesquisa científica, com ênfase em planejamento, depuração, validação e trabalho prolongado.
Acesso Hospedado a Pesos Abertos
Acesse o modelo Apache 2.0 por meio do GPTProto sem provisionar a substancial infraestrutura multi-GPU necessária para servir seus checkpoints BF16 ou FP8 por conta própria.
O Hy4 preview é um modelo carro-chefe de texto para texto lançado pela Equipe Tencent Hy em 28 de agosto de 2026. Ele também é pesquisado como Tencent Hy4, Tencent Hunyuan 4, API Hunyuan4 e API Hy4-preview, mas o checkpoint público oficial é chamado Hy4 preview. A GPTProto oferece acesso de API hospedada ao modelo, enquanto a Tencent publica separadamente pesos para download para equipes que desejam operar seu próprio stack de inferência.
O modelo usa uma arquitetura Mixture-of-Experts com 770 bilhões de parâmetros de backbone e 49 bilhões ativados por token. Seu backbone de 78 camadas contém uma camada feed-forward densa seguida por 77 camadas MoE. Cada camada MoE tem 256 especialistas roteados e um especialista compartilhado, com oito especialistas roteados selecionados por token. Uma camada MTP nativa separada oferece suporte à decodificação especulativa.
O model card da Tencent lista um comprimento de contexto de 1M de tokens e descreve Gated DeepSeek Sparse Attention com IndexCache para reutilização de índices esparsos. Este checkpoint de preview aceita texto e retorna texto; ele não aceita nativamente imagens, áudio ou vídeo.
| Especificação | Hy4 preview |
|---|---|
| Provedor | Equipe Tencent Hy |
| Data de lançamento | 28 de agosto de 2026 |
| Entrada / saída | Texto / texto |
| Arquitetura | Mixture-of-Experts (MoE), 78 camadas |
| Parâmetros do backbone | 770B no total; 49B ativados por token |
| Roteamento de especialistas | 256 especialistas roteados + 1 especialista compartilhado; top 8 especialistas roteados ativados |
| Comprimento do contexto | 1M tokens |
| Atenção | Gated DSA com IndexCache |
| Camada de decodificação adicional | MTP nativo: 10B no total; 0.7B ativados |
| Licença de pesos abertos | Apache License 2.0 |
Codificação em escala de repositório: Dê a um agente de codificação contexto suficiente para inspecionar arquitetura, interfaces, testes, logs e arquivos relacionados antes de propor um patch. A Tencent destaca especificamente melhorias em planejamento, depuração, verificação e qualidade de implementação de front-end.
Fluxos de trabalho de agentes de longo horizonte: Use o modelo para tarefas que exigem planejamento, execução, inspeção e revisão repetidos. O aplicativo de agente ao redor ainda deve controlar ferramentas, permissões, timeouts, tentativas e verificações de aceitação, em vez de tratar a saída do modelo como verificada automaticamente.
Trabalho com documentos e dados: Analise informações distribuídas em documentos longos, produza resumos estruturados e ofereça suporte a fluxos de trabalho que criam documentos, planilhas, apresentações, equações ou análises financeiras.
Desenvolvimento de jogos e pesquisa: Crie protótipos de lógica de jogo por meio de iteração multiturno ou auxilie em problemas de pesquisa difíceis em áreas como desenvolvimento de IA, dinâmica molecular, física da matéria condensada e matemática. As saídas devem ser revisadas com base em evidências do domínio antes do uso.
A Tencent descreve o Hy4 preview como uma grande mudança de geração impulsionada por aumentos no tamanho do modelo, comprimento de contexto, dados de treinamento e pós-treinamento. A empresa também co-projetou o modelo com produtos como CodeBuddy e WorkBuddy, dando ao lançamento um foco maior em produtividade ponta a ponta, em vez de prompts de benchmark curtos e isolados.
A palavra preview importa. A Tencent relata que este checkpoint inicial pode raciocinar por mais tempo que o necessário em tarefas difíceis e pode verificar demais seu próprio trabalho. Para solicitações curtas de classificação, extração ou formatação, compare latência e uso de tokens com um modelo menor. Para longas execuções de codificação ou agentes, teste conclusão de tarefa, validade de chamadas de ferramentas, volume de tokens gerados e recuperação de etapas com falha antes de enviar tráfego de produção.
A Tencent realizou uma avaliação interna cega na qual 163 especialistas revisaram saídas para 203 tarefas de engenharia. O Hy4 preview recebeu uma pontuação média de 2.99/4.00, em comparação com 2.92 para GLM-5.3 e 2.94 para Kimi K3.
| Comparador | Média do Hy4 preview | Média do comparador | Vitória / empate / derrota do Hy4 preview |
|---|---|---|---|
| GLM-5.3 | 2.99 | 2.92 | 46.8% / 12.8% / 40.4% |
| Kimi K3 | 2.99 | 2.94 | 51.2% / 7.9% / 40.9% |
Esses números foram relatados pela Tencent e não foram reproduzidos de forma independente pela GPTProto. Eles sugerem que o Hy4 é competitivo no conjunto de tarefas de engenharia da Tencent, não que ele vence todas as cargas de trabalho de codificação. Uma comparação justa de API deve reutilizar o mesmo snapshot de repositório, prompt de sistema, definições de ferramentas, orçamento de tokens e verificações de aprovação/reprovação entre os modelos.
| Rota de acesso | Melhor para | Principal trade-off |
|---|---|---|
| API hospedada da GPTProto | Desenvolvedores que desejam acesso imediato, cobrança por uso e um saldo compartilhado com outros modelos | Menos controle de infraestrutura do que operar os pesos diretamente |
| Pesos BF16 ou FP8 auto-hospedados | Equipes que precisam de controle de implantação, serviço personalizado ou experimentação no nível do modelo | Exige um stack substancial de serviço multi-GPU, além de planejamento de capacidade, monitoramento e upgrades |
Pesos abertos não tornam a inferência operacionalmente gratuita. A implantação de referência da Tencent usa configurações especializadas de vLLM ou SGLang para atenção esparsa, decodificação especulativa MTP, análise de raciocínio e análise de chamadas de ferramentas. O acesso hospedado elimina esse trabalho de serviço, enquanto a auto-hospedagem continua sendo a melhor opção quando o controle de infraestrutura é mais importante que o tempo de configuração.
Escolha o Hy4 preview quando seu aplicativo se beneficia de compreensão de código com grande contexto, análise entre documentos, planejamento sustentado ou acesso a um carro-chefe de pesos abertos Apache 2.0 sem executar o checkpoint você mesmo. É especialmente relevante para desenvolvedores que avaliam modelos de fronteira chineses para cargas de trabalho de codificação e agentes por meio de uma conta de API compartilhada.
Use um modelo menor ou mais maduro quando as solicitações forem curtas, sensíveis à latência ou altamente repetitivas. Como este é um lançamento de preview com comportamento conhecido de raciocínio excessivo e verificação excessiva, valide custo, tempo de resposta, sucesso da tarefa e consistência da saída em sua própria carga de trabalho antes de torná-lo o modelo padrão.
Guias, comparações e atualizações relacionadas a este modelo.
Todos os artigos
O que é o Tencent Hy4 Preview? Veja seu status de lançamento, design MoE de 770B, contexto de 1M, preços de API, benchmarks, limites e comparações de modelos.

Compare os 7 melhores gateways de IA para desenvolvedores em 2026 por preço, roteamento, controles de custo, implantação e trade-offs de produção.

Compare 7 LLMs acessíveis para programação por preço de API, benchmarks, contexto e custo estimado por tarefa — incluindo DeepSeek V4 Flash, GPT-5.6 Luna, Qwen3.8 Max e Kimi K3.

Compare GLM-5.3, Kimi K3, Qwen3.8 Max, DeepSeek V4 Pro e MiniMax M3 para programação, agentes, preços de API, velocidade, entrada multimodal e pesos abertos.