MiniMax Speech 2.6 API — 40% 折扣的 HD 文字轉語音
這個 MiniMax Speech 2.6 API 可將文字轉換為涵蓋 40 種語言的 HD 音訊,單次請求最多可輸入 10,000 個字元,並內建七種情緒。在 GPTProto 上,您可以使用 speech-2.6-hd 模型,每 1M 個輸出 token 收費 $60,輸入 token 免費 — 比牌價低 40%;只需一組 API 金鑰和一個可在 200 多個模型間共用的餘額。無需另外註冊 MiniMax 帳戶,也沒有受地區限制的註冊流程。瀏覽所有模型,查看還有哪些模型可使用同一組金鑰。
MiniMax Speech 2.6 HD 模型的功能
speech-2.6-hd 是 MiniMax Speech 2.6 系列中的高保真版本,針對旁白、有聲書和品牌配音進行調校,適合重視音色細節與韻律的場景。與 MiniMax Speech 02 相比,它提升了多語言相似度、節奏和語音複製準確度,並支援 40 種語言及方言處理。「HD」路線以高保真度為目標;同系列的 Turbo 路線則以最低延遲為目標。在 GPTProto 上,您可透過 MiniMax Speech 2.6 API 使用 HD 模型,而不必直接管理 MiniMax 帳戶。
長篇旁白與有聲書
對出版和數位學習而言,speech-2.6-hd 每次請求最多接受 10,000 個字元(超過 3,000 個字元時建議使用串流輸出),並能在長篇內容中維持一致的聲音。它支援 40 種語言及每次請求的情緒控制(開心、悲傷、憤怒、恐懼、厭惡、驚訝、中性),讓同一套流程即可產製多語言有聲書、課程內容和朗讀無障礙音軌。長篇腳本應分段並以串流方式傳送,而非一次傳送為單一區塊。
語音代理與客服腳本
Speech 2.6 能以語音代理所需的方式朗讀動態文字:URL、電子郵件地址、電話號碼、日期和貨幣金額都能正確轉為語音,無需預先處理(例如 $1,234.56 →「一千兩百三十四美元五十六美分」)。speech-2.6-hd 支援串流 PCM 輸出,實現即時播放。如果您的首要需求是盡可能低的延遲,GPTProto 也在同一組金鑰下提供 speech-2.5-turbo-preview;HD 路線以些微速度換取更高保真度。
為什麼透過 GPTProto 呼叫 MiniMax Speech 2.6
直接使用 MiniMax 意味著需要另外註冊帳戶、按字元計費,且註冊受地區限制。GPTProto 讓您透過一組 API 金鑰和一個可在 200 多個文字、圖片、影片及音訊模型間共用的預付餘額,使用相同的 speech-2.6-hd 模型。您只需充值一次,即可在任何地方使用;在單一儀表板中監控用量,日後遷移時也能維持相同的模型字串。您取得的是存取價值,而不是重寫模型。
什麼是 MiniMax Speech 2.6?
MiniMax Speech 2.6 是一系列文字轉語音(TTS/文字轉音訊)模型,於 2025 年 10 月 30 日宣布推出,專為語音代理、多語言旁白,以及正確朗讀非標準文字而打造。它提供兩種路線:HD(注重保真度)和 Turbo(低延遲)。GPTProto 透過 MiniMax Speech 2.6 text-to-speech API 提供 HD 路線,模型名稱為 speech-2.6-hd。下表是 speech-2.6-hd 的實際規格。
| 規格 | speech-2.6-hd |
|---|---|
| 模型字串 | speech-2.6-hd |
| 模態 | 文字 → 音訊(TTS/T2A) |
| 版本 | HD(高保真度);Turbo 是低延遲版本 |
| 語言 | 40 種語言+方言 |
| 最大輸入 | 每次請求少於 10,000 個字元(超過 3,000 個字元時使用串流) |
| 情緒 | 7 種 — 開心、悲傷、憤怒、恐懼、厭惡、驚訝、中性 |
| 語音控制 | 速度 [0.5–2.0]、音量 (0–10]、音高 [-12–+12] |
| 取樣率 | 22,050/24,000/44,100/48,000 Hz |
| 位元率 | 64k–320k bps(MP3/OGG) |
| 輸出格式 | MP3、WAV、OGG、FLAC;串流 PCM |
| 語音複製 | 支援 — 10 秒參考音訊;Fluent LoRA 可提升複製語音的流暢度 |
| 文字正規化 | 自動朗讀 URL、電子郵件、電話號碼、日期和貨幣 |
| GPTProto 價格 | $0/1M 輸入 token · $60/1M 輸出 token(比牌價低 40%) |
| GPTProto 模型存取 | 一組 API 金鑰,200 多個模型共用餘額 |
MiniMax Speech 2.6 HD 與 2.5 HD、2.5 Turbo 比較
三者都能在 GPTProto 上使用同一組金鑰執行,因此您可以使用自己的腳本進行 A/B 測試。Speech 2.6 相較於 2.5 系列提升了多語言相似度、節奏和非標準文字處理能力;2.5 Turbo 路線仍是速度最快的選項。
speech-2.6-hd |
speech-2.5-hd-preview |
speech-2.5-turbo-preview |
|
|---|---|---|---|
| 優先考量 | HD 保真度 | HD 保真度(前一代) | 延遲+成本 |
| 語言 | 40 | 40 | 40 |
| 文字正規化(URL/日期/金額) | 改良 | 基本 | 基本 |
| 語音複製 | 是(Fluent LoRA) | 是 | 是 |
| 最適合 | 旁白、有聲書、品牌配音 | 現有的 2.5 HD 工作流程 | 即時代理、IVR |
| GPTProto 價格(每 1M token) | $0 輸入/$60 輸出 | $0 輸入/$60 輸出 | $0 輸入/$36 輸出 |
簡而言之:若要獲得最自然的旁白和對混亂文字的正確朗讀,請選擇 2.6 HD;只有在工作流程已針對 2.5 HD 完成調校時才繼續使用它 — 其輸出費率同樣為 $60,因此 2.6 HD 是預設選擇;當對話輪替速度和成本比保真度更重要時,請以 $36/1M 輸出 token 的價格使用 2.5 Turbo。
語音、情緒與語言涵蓋範圍
speech-2.6-hd 透過 voice_id 提供系統語音和複製語音,並可在每次請求中控制語音表現:
- 情緒 — 七種情緒之一:開心、悲傷、憤怒、恐懼、厭惡、驚訝、中性。
- 速度 —
0.5–2.0(預設為1.0)。 - 音量 —
>0–10(預設為1.0)。 - 音高 —
-12–+12,以整數步進(預設為0,保持原始音色)。 - 停頓 — 在詞語之間插入
<#x#>,設定x秒的靜音(0.01–99.99)。 - 文字正規化 — 自動朗讀 URL、電子郵件地址、電話號碼、日期和金額。
模型支援 40 種語言,可在混合語言文字中進行內嵌切換;當輸入混合不同文字系統時,language_boost 可強化主要語言。語音複製需要約 10 秒的參考音訊;即使來源帶有口音或不流暢,Fluent LoRA 仍能維持複製語音的流暢度。
從官方 MiniMax 切換至 GPTProto
如果您目前已呼叫 MiniMax 的 /v1/t2a_v2 路線,轉移至 GPTProto 是存取方式的變更,而非模型變更 — 模型字串仍為 speech-2.6-hd。您只需將基礎 URL 和驗證方式替換為 GPTProto(確切的端點和請求格式請參閱上方的快速入門),之後便可從共用的 GPTProto 餘額扣款,而非使用 MiniMax 帳戶。您將獲得:
- 一組金鑰、一個餘額,可使用 200 多個模型 — 無需為每個供應商分別註冊帳戶。
- 無受地區限制的註冊流程 — 如果 MiniMax 的平台註冊在您的市場中造成阻礙,這點尤其重要。
- 輸入 token 免費,輸出每 1M 個 token 收費 $60 — 比模型卡上顯示的牌價低 40%。
語音 ID、情緒和音訊設定對應至相同的請求欄位;在將正式流量切換過來前,請先參閱快速入門,確認任何供應商特有的欄位名稱。








