Contexte de 1M de tokens
Traitez de grandes bases de code, de longues spécifications et un contexte multi-document dans la fenêtre de 1M de tokens du modèle, tout en gérant conjointement le budget des tokens de prompt et générés.
curl --request POST "https://gptproto.com/v1/chat/completions" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"model": "hy4-preview",
"messages": [
{
"role": "user",
"content": "Hello"
}
]
}'Chat, agents de codage et travail documentaire. Facturé par million de tokens — l'entrée, l'entrée en cache et la sortie sont facturées séparément. GPTProto est 5 % en dessous des tarifs officiels.
| Scénario | Liste Hunyuan | OpenRouter | GPTProto | Économies / mois |
|---|---|---|---|---|
| Personnel10M tokens / mois (4.8M en cache) | $7.87 | $8.31 | $7.48 | −$0.39≈ $4.72 / an |
| Équipe100M tokens / mois (48M en cache) | $78.72 | $83.05 | $74.79 | −$3.94≈ $47.22 / an |
| Entreprise500M tokens / mois (240M en cache) | $393.62 | $415.27 | $373.94 | −$19.68≈ $236.11 / an |
Développez avec le modèle Mixture-of-Experts à poids ouverts de 770B de Tencent via une API hébergée. Hy4 preview active 49B paramètres par token, prend en charge une fenêtre de contexte de 1M de tokens et cible l'ingénierie logicielle, les tâches de productivité complexes, le raisonnement scientifique et les tâches multi-étapes soutenues.
Contexte de 1M de tokens
Traitez de grandes bases de code, de longues spécifications et un contexte multi-document dans la fenêtre de 1M de tokens du modèle, tout en gérant conjointement le budget des tokens de prompt et générés.
MoE 770B, 49B actifs
Hy4 preview utilise une base MoE de 770B de paramètres mais active 49B paramètres par token, combinant une grande capacité de modèle avec un calcul épars.
Conçu pour les workflows réels
Tencent a entraîné la preview pour l'ingénierie logicielle, l'analyse bureautique, le développement de jeux et la recherche scientifique, en mettant l'accent sur la planification, le débogage, la validation et le travail prolongé.
Accès hébergé aux modèles à poids ouverts
Appelez le modèle Apache 2.0 via GPTProto sans provisionner l'importante infrastructure multi-GPU nécessaire pour servir vous-même ses checkpoints BF16 ou FP8.
Hy4 preview est un modèle phare texte-à-texte publié par le Tencent Hy Team le 28 août 2026. Il est aussi recherché sous les noms Tencent Hy4, Tencent Hunyuan 4, Hunyuan4 API et Hy4-preview API, mais le checkpoint public officiel s'appelle Hy4 preview. GPTProto fournit un accès API hébergé au modèle, tandis que Tencent publie séparément des poids téléchargeables pour les équipes qui veulent exploiter leur propre pile d'inférence.
Le modèle utilise une architecture Mixture-of-Experts avec 770 milliards de paramètres de backbone et 49 milliards activés pour chaque token. Son backbone de 78 couches contient une couche feed-forward dense suivie de 77 couches MoE. Chaque couche MoE possède 256 experts routés et un expert partagé, avec huit experts routés sélectionnés par token. Une couche MTP native distincte prend en charge le décodage spéculatif.
La fiche modèle de Tencent indique une longueur de contexte de 1M de tokens et décrit Gated DeepSeek Sparse Attention avec IndexCache pour la réutilisation d'index sparse. Ce checkpoint preview accepte du texte et renvoie du texte ; il n'accepte pas nativement les images, l'audio ou la vidéo.
| Spécification | Hy4 preview |
|---|---|
| Fournisseur | Tencent Hy Team |
| Date de sortie | 28 août 2026 |
| Entrée / sortie | Texte / texte |
| Architecture | Mixture-of-Experts (MoE), 78 couches |
| Paramètres du backbone | 770B au total ; 49B activés par token |
| Routage des experts | 256 experts routés + 1 expert partagé ; les 8 principaux experts routés activés |
| Longueur du contexte | 1M de tokens |
| Attention | Gated DSA avec IndexCache |
| Couche de décodage supplémentaire | MTP natif : 10B au total ; 0.7B activés |
| Licence open-weight | Apache License 2.0 |
Codage à l'échelle d'un dépôt : Donnez à un agent de codage suffisamment de contexte pour inspecter l'architecture, les interfaces, les tests, les journaux et les fichiers associés avant de proposer un correctif. Tencent met particulièrement en avant des améliorations en matière de planification, de débogage, de vérification et de qualité de mise en œuvre front-end.
Flux de travail d'agents à long horizon : Utilisez le modèle pour des tâches qui exigent une planification, une exécution, une inspection et une révision répétées. L'application d'agent environnante doit toujours contrôler les outils, les autorisations, les délais d'attente, les tentatives et les contrôles d'acceptation, plutôt que de considérer la sortie du modèle comme automatiquement vérifiée.
Travail sur documents et données : Analysez des informations réparties sur de longs documents, produisez des résumés structurés et prenez en charge des flux de travail qui créent des documents, des feuilles de calcul, des présentations, des équations ou des analyses financières.
Développement de jeux et recherche : Prototypez la logique de jeu par itération multitour ou aidez à résoudre des problèmes de recherche difficiles dans des domaines tels que le développement de l'IA, la dynamique moléculaire, la physique de la matière condensée et les mathématiques. Les sorties doivent être examinées par rapport aux preuves du domaine avant utilisation.
Tencent décrit Hy4 preview comme un changement de génération majeur entraîné par des augmentations de taille du modèle, de longueur de contexte, de données d'entraînement et de post-entraînement. L'entreprise a également co-conçu le modèle avec des produits tels que CodeBuddy et WorkBuddy, ce qui donne à cette version une orientation plus forte vers la productivité de bout en bout plutôt que vers des invites d'évaluation courtes et isolées.
Le mot preview compte. Tencent indique que ce checkpoint précoce peut raisonner plus longtemps que nécessaire sur des tâches difficiles et peut sur-vérifier son propre travail. Pour les demandes courtes de classification, d'extraction ou de formatage, comparez la latence et l'utilisation de tokens avec un modèle plus petit. Pour les longs cycles de codage ou d'agent, testez l'achèvement des tâches, la validité des appels d'outils, le volume de tokens générés et la récupération après des étapes échouées avant d'envoyer du trafic de production.
Tencent a mené une évaluation interne en aveugle dans laquelle 163 experts ont examiné les sorties de 203 tâches d'ingénierie. Hy4 preview a reçu une note moyenne de 2.99/4.00, contre 2.92 pour GLM-5.3 et 2.94 pour Kimi K3.
| Comparateur | Moyenne de Hy4 preview | Moyenne du comparateur | Victoires / égalités / défaites de Hy4 preview |
|---|---|---|---|
| GLM-5.3 | 2.99 | 2.92 | 46.8% / 12.8% / 40.4% |
| Kimi K3 | 2.99 | 2.94 | 51.2% / 7.9% / 40.9% |
Ces chiffres ont été rapportés par Tencent et n'ont pas été reproduits indépendamment par GPTProto. Ils suggèrent que Hy4 est compétitif sur l'ensemble des tâches d'ingénierie de Tencent, et non qu'il remporte toutes les charges de travail de codage. Une comparaison API équitable doit réutiliser le même instantané de dépôt, invite système, définitions d'outils, budget de tokens et contrôles réussite/échec pour tous les modèles.
| Voie d'accès | Idéal pour | Principal compromis |
|---|---|---|
| API hébergée GPTProto | Développeurs qui veulent un accès immédiat, une facturation à l'usage et un solde unique partagé avec d'autres modèles | Moins de contrôle sur l'infrastructure que l'exploitation directe des poids |
| Poids BF16 ou FP8 auto-hébergés | Équipes qui ont besoin de contrôle du déploiement, de service personnalisé ou d'expérimentation au niveau du modèle | Nécessite une pile de service multi-GPU substantielle, ainsi qu'une planification de capacité, une surveillance et des mises à niveau |
Les poids ouverts ne rendent pas l'inférence gratuite sur le plan opérationnel. Le déploiement de référence de Tencent utilise des configurations spécialisées vLLM ou SGLang pour l'attention sparse, le décodage spéculatif MTP, l'analyse du raisonnement et l'analyse des appels d'outils. L'accès hébergé supprime ce travail de service, tandis que l'auto-hébergement reste la meilleure option lorsque le contrôle de l'infrastructure importe plus que le temps de mise en place.
Choisissez Hy4 preview lorsque votre application bénéficie d'une compréhension de code à grand contexte, d'une analyse inter-documents, d'une planification soutenue ou d'un accès à un modèle phare à poids ouverts sous Apache 2.0 sans exécuter vous-même le checkpoint. Il est particulièrement pertinent pour les développeurs qui évaluent des modèles frontières chinois pour des charges de travail de codage et d'agents via un compte API partagé.
Utilisez un modèle plus petit ou plus mature lorsque les requêtes sont courtes, sensibles à la latence ou très répétitives. Comme il s'agit d'une version preview avec des comportements connus de sur-raisonnement et de sur-vérification, validez le coût, le temps de réponse, la réussite des tâches et la cohérence des sorties sur votre propre charge de travail avant d'en faire le modèle par défaut.
Guides, comparaisons et mises à jour liés à ce modèle.
Tous les articles
Qu'est-ce que Tencent Hy4 Preview ? Découvrez son statut de sortie, son architecture MoE 770B, son contexte de 1M, sa tarification API, ses benchmarks, ses limites et ses comparaisons de modèles.

Comparez les 7 meilleures passerelles IA pour les développeurs en 2026 selon la tarification, le routage, le contrôle des coûts, le déploiement et les compromis de production.

Comparez 7 LLM de codage abordables selon le prix de l'API, les benchmarks, le contexte et le coût estimé des tâches, notamment DeepSeek V4 Flash, GPT-5.6 Luna, Qwen3.8 Max et Kimi K3.

Comparez GLM-5.3, Kimi K3, Qwen3.8 Max, DeepSeek V4 Pro et MiniMax M3 pour le codage, les agents, la tarification de l'API, la vitesse, l'entrée multimodale et les poids ouverts.