100 萬 Token 上下文
在模型 100 萬 token 的視窗內處理大型程式碼庫、長篇規格與多文件上下文,同時一併估算提示詞與生成 token 的用量。
Estimate a request with real work scenarios. GPTProto token pricing is 5% below official rates.
儲值 $100 你將獲得:
儲值額度永久有效。你總共會收到 $100.00。
額外 5% 模型折扣,相較官方 Hunyuan API 可節省 $5.2607。
透過託管 API,使用騰訊開放權重的 7,700 億參數混合專家模型進行開發。Hy4 preview 每個 token 啟用 490 億參數,支援 100 萬 token 上下文視窗,並鎖定軟體工程、複雜生產力工作、科學推理與持續性多步驟任務。
在模型 100 萬 token 的視窗內處理大型程式碼庫、長篇規格與多文件上下文,同時一併估算提示詞與生成 token 的用量。
Hy4 preview 採用 7,700 億參數的 MoE 主幹,但每個 token 僅啟用 490 億參數,兼顧大模型容量與稀疏運算。
騰訊針對軟體工程、辦公分析、遊戲開發與科學研究訓練此預覽版本,並強調規劃、除錯、驗證與長時間作業。
透過 GPTProto 呼叫這個 Apache 2.0 模型,無須自行建置服務 BF16 或 FP8 檢查點所需的大量多 GPU 基礎設施。
Hy4 preview 是騰訊 Hy 團隊於 2026 年 8 月 28 日釋出的文字轉文字旗艦模型。它也常被搜尋為 Tencent Hy4、Tencent Hunyuan 4、Hunyuan4 API 與 Hy4-preview API,但官方公開檢查點的名稱是 Hy4 preview。GPTProto 提供該模型的託管 API 存取,而騰訊另外為想自行維運推論堆疊的團隊發布可下載權重。
此模型採用混合專家(MoE)架構,主幹參數達 7,700 億,每個 token 啟用 490 億。其 78 層主幹包含 1 層稠密前饋層,後接 77 層 MoE 層。每個 MoE 層有 256 個路由專家與 1 個共享專家,每個 token 選取 8 個路由專家。另有獨立的原生 MTP 層支援推測解碼。
騰訊的模型卡列出 100 萬 token 的上下文長度,並描述用於稀疏索引複用的 Gated DeepSeek Sparse Attention 搭配 IndexCache。此預覽檢查點接受文字並回傳文字,原生不支援圖片、音訊或影片。
| 規格 | Hy4 preview |
|---|---|
| 提供者 | 騰訊 Hy 團隊 |
| 發布日期 | 2026 年 8 月 28 日 |
| 輸入 / 輸出 | 文字 / 文字 |
| 架構 | 混合專家(MoE),78 層 |
| 主幹參數 | 總計 770B;每 token 啟用 49B |
| 專家路由 | 256 個路由專家 + 1 個共享專家;啟用前 8 個路由專家 |
| 上下文長度 | 100 萬 token |
| 注意力機制 | Gated DSA 搭配 IndexCache |
| 額外解碼層 | 原生 MTP:總計 10B;啟用 0.7B |
| 開放權重授權 | Apache License 2.0 |
儲存庫層級的程式開發:讓程式開發代理在提出修補前,有足夠上下文檢視架構、介面、測試、記錄與相關檔案。騰訊特別強調其在規劃、除錯、驗證與前端實作品質上的提升。
長週期代理工作流程:適用於需要反覆規劃、執行、檢查與修訂的任務。周邊的代理應用仍應掌控工具、權限、逾時、重試與驗收檢查,而不是把模型輸出視為已自動驗證。
文件與資料處理:分析分散在長文件中的資訊、產生結構化摘要,並支援建立文件、試算表、簡報、方程式或財務分析的工作流程。
遊戲開發與研究:透過多輪迭代建立遊戲邏輯雛型,或協助解決 AI 開發、分子動力學、凝聚態物理與數學等領域的困難研究問題。輸出在使用前應對照領域證據加以檢視。
騰訊將 Hy4 preview 描述為一次重大世代升級,源於模型規模、上下文長度、訓練資料與後訓練的全面提升。該公司也與 CodeBuddy、WorkBuddy 等產品共同設計此模型,讓本次發布更聚焦於端到端生產力,而非短暫、孤立的基準提示詞。
preview 這個字值得注意。騰訊指出,這個早期檢查點在高難度任務上可能推理得比必要更久,並可能過度驗證自己的工作。對於簡短的分類、擷取或格式化請求,請與較小的模型比較延遲與 token 用量。對於長時間的程式開發或代理執行,請在導入正式流量前,先測試任務完成度、工具呼叫有效性、生成 token 量,以及從失敗步驟中恢復的能力。
騰訊進行了一項盲測內部評測,由 163 位專家檢視 203 項工程任務的輸出。Hy4 preview 平均得分 2.99/4.00,GLM-5.3 為 2.92,Kimi K3 為 2.94。
| 比較對象 | Hy4 preview 平均 | 比較對象平均 | Hy4 preview 勝 / 平 / 負 |
|---|---|---|---|
| GLM-5.3 | 2.99 | 2.92 | 46.8% / 12.8% / 40.4% |
| Kimi K3 | 2.99 | 2.94 | 51.2% / 7.9% / 40.9% |
這些數據由騰訊提供,GPTProto 並未獨立重現。它們說明 Hy4 在騰訊的工程任務集上具有競爭力,並不代表它在所有程式開發工作負載中都勝出。公平的 API 比較應在不同模型間重複使用相同的儲存庫快照、系統提示詞、工具定義、token 預算與通過/失敗檢查。
| 存取途徑 | 適合對象 | 主要取捨 |
|---|---|---|
| GPTProto 託管 API | 希望立即取用、按需計費,並與其他模型共用單一餘額的開發者 | 基礎設施掌控度低於直接營運權重 |
| 自行部署 BF16 或 FP8 權重 | 需要部署掌控、自訂服務或模型層級實驗的團隊 | 需要龐大的多 GPU 服務堆疊,並負責容量規劃、監控與升級 |
開放權重不代表推論在營運上免費。騰訊的參考部署針對稀疏注意力、MTP 推測解碼、推理解析與工具呼叫解析,使用專門的 vLLM 或 SGLang 設定。託管存取省去了這些服務工作;而當基礎設施掌控比建置時間更重要時,自行部署仍是較佳選擇。
當你的應用受惠於大上下文程式碼理解、跨文件分析、持續性規劃,或是想在不必自行運行檢查點的情況下取用 Apache 2.0 開放權重旗艦模型時,請選擇 Hy4 preview。對於透過共用 API 帳號評估中國前沿模型在程式開發與代理工作負載表現的開發者,它尤其值得一試。
當請求簡短、對延遲敏感或高度重複時,請改用較小或更成熟的模型。由於這是預覽版本,且已知存在過度推理與過度驗證的行為,請在自己的工作負載上驗證成本、回應時間、任務成功率與輸出一致性,再將它設為預設模型。
與本模型相關的指南、對比與更新。
所有文章
什麼是騰訊 Hy4 Preview?查看其發布狀態、770B MoE 設計、100 萬上下文、API 定價、基準測試、限制與模型比較。

從定價、路由、成本控制、部署與正式環境取捨,比較 2026 年最適合開發者的 7 個 AI 閘道。

從 API 定價、基準測試、上下文與預估任務成本,比較 7 個高性價比的程式開發 LLM,包含 DeepSeek V4 Flash、GPT-5.6 Luna、Qwen3.8 Max 與 Kimi K3。

從程式開發、代理、API 定價、速度、多模態輸入與開放權重,比較 GLM-5.3、Kimi K3、Qwen3.8 Max、DeepSeek V4 Pro 與 MiniMax M3。