MiniMax Speech 2.6 API — HDテキスト読み上げが定価から40%オフ
The MiniMax Speech 2.6 API は、40言語に対応し、1リクエストあたり最大10,000文字の入力と7種類の内蔵感情を備え、テキストをHD音声に変換します。GPTProtoでは、speech-2.6-hdモデルを、入力トークン無料、出力100万トークンあたり$60(定価から40%オフ)で利用できます。1つのAPIキーと、200以上のモデルで共有できる1つの残高だけで運用できます。MiniMaxの個別アカウントも、地域による登録制限もありません。すべてのモデルを見ることで、同じキーで利用できる他のモデルも確認できます。
MiniMax Speech 2.6 HDモデルの機能
speech-2.6-hd は、MiniMax Speech 2.6ファミリーの高忠実度バリアントで、音色の細部やプロソディが重要なナレーション、オーディオブック、ブランドボイスオーバー向けに調整されています。MiniMax Speech 02と比較して、多言語間の類似性、リズム、音声クローニングの精度が向上し、方言にも対応した40言語をカバーします。同じファミリーの「HD」ルートは忠実度を重視し、Turboルートは最低レイテンシを重視します。 GPTProto では、MiniMax Speech 2.6 APIを通じてHDモデルを利用でき、MiniMaxのアカウントを直接管理する必要はありません。
長文ナレーションとオーディオブック
出版やeラーニング向けに、speech-2.6-hdは、1リクエストあたり最大10,000文字(3,000文字を超える場合はストリーミング出力を推奨)を受け付け、長い文章全体で一貫した音声を維持します。40言語への対応と、リクエスト単位の感情制御(happy、sad、angry、fearful、disgusted、surprised、neutral)により、1つのパイプラインで多言語オーディオブック、教材、読み上げアクセシビリティトラックを生成できます。長いスクリプトは、1つのブロックとして送信するのではなく、分割してストリーミングしてください。
音声エージェントとサポートスクリプト
Speech 2.6は、エージェントに必要な方法で動的テキストを読み上げます。URL、メールアドレス、電話番号、日付、通貨金額を前処理なしで正しく発音します(例:$1,234.56 → 「one thousand two hundred thirty-four dollars and fifty-six cents」)。speech-2.6-hdは、応答性の高い再生を実現するストリーミングPCM出力に対応しています。可能な限り低いレイテンシが優先される場合、GPTProtoでは同じキーでspeech-2.5-turbo-previewも利用できます。HDルートは、より高い忠実度のために速度を少し犠牲にしています。
GPTProto経由でMiniMax Speech 2.6を利用する理由
MiniMaxを直接利用すると、個別アカウント、文字単位の課金、地域による登録制限が必要です。GPTProtoでは、200以上のテキスト、画像、動画、音声モデルで共有できる1つのAPIキーと前払い残高の背後で、同じspeech-2.6-hdモデルを利用できます。1回チャージすればどこでも利用でき、使用量を1つのダッシュボードで監視でき、後で移行する場合もモデル文字列を同一に保てます。モデルを書き換えるのではなく、アクセスの価値を得られます。
MiniMax Speech 2.6とは?
MiniMax Speech 2.6は、2025年10月30日に発表されたテキスト読み上げ(TTS / text-to-audio)モデルファミリーで、音声エージェント、多言語ナレーション、非標準テキストの正確な読み上げ向けに構築されています。2つのルートがあり、HD(忠実度重視)とTurbo(低レイテンシ)を提供します。GPTProtoでは、MiniMax Speech 2.6 text-to-speech APIを通じて、HDルートをspeech-2.6-hdとして利用できます。以下の表は、speech-2.6-hdの実用仕様です。
| 仕様 | speech-2.6-hd |
|---|---|
| モデル文字列 | speech-2.6-hd |
| モダリティ | テキスト → 音声(TTS / T2A) |
| バリアント | HD(忠実度重視);Turboは低レイテンシの同系モデル |
| 言語 | 40言語+方言 |
| 最大入力 | 1リクエストあたり10,000文字未満(3,000文字超ではストリーミング) |
| 感情 | 7種類 — happy、sad、angry、fearful、disgusted、surprised、neutral |
| 音声制御 | 速度 [0.5–2.0]、音量 (0–10]、ピッチ [-12–+12] |
| サンプルレート | 22,050 / 24,000 / 44,100 / 48,000 Hz |
| ビットレート | 64k–320k bps(MP3 / OGG) |
| 出力形式 | MP3、WAV、OGG、FLAC;ストリーミングPCM |
| 音声クローニング | 対応 — 10秒のリファレンス;クローン音声の流暢さにはFluent LoRAを使用 |
| テキスト正規化 | URL、メール、電話番号、日付、通貨を自動的に読み上げ |
| GPTProtoの価格 | $0 / 入力100万トークン · $60 / 出力100万トークン(定価から40%オフ) |
| GPTProtoのモデルアクセス | 1つのAPIキー、200以上のモデルで共有できる残高 |
MiniMax Speech 2.6 HD vs 2.5 HD vs 2.5 Turbo
3つすべてが同じキーでGPTProto上で動作するため、自分のスクリプトでA/Bテストを実施できます。Speech 2.6は、2.5シリーズと比べて多言語間の類似性、リズム、非標準テキストの処理が向上しています。2.5 Turboルートは最速の選択肢です。
speech-2.6-hd |
speech-2.5-hd-preview |
speech-2.5-turbo-preview |
|
|---|---|---|---|
| 優先事項 | HDの忠実度 | HDの忠実度(前世代) | レイテンシ+コスト |
| 言語 | 40 | 40 | 40 |
| テキスト正規化(URL / 日付 / 金額) | 改善済み | 基本 | 基本 |
| 音声クローニング | はい(Fluent LoRA) | はい | はい |
| 最適な用途 | ナレーション、オーディオブック、ブランドVO | 既存の2.5 HDワークフロー | リアルタイムエージェント、IVR |
| GPTProtoの価格(100万トークンあたり) | $0 in / $60 out | $0 in / $60 out | $0 in / $36 out |
要約:最も自然なナレーションと、複雑なテキストの正確な読み上げを求めるなら2.6 HDを選んでください。すでにワークフローが調整済みの場合のみ2.5 HDを使い続ければよく、出力料金は同じ$60なので、2.6 HDがデフォルトの選択肢です。忠実度よりも会話の切り替え速度とコストを重視する場合は、2.5 Turboを$36 / 出力100万トークンで利用してください。
音声、感情、言語カバレッジ
speech-2.6-hdは、voice_idを介してシステム音声とクローン音声を提供し、さらにリクエスト単位で発話を制御できます。
- 感情 — 7種類のうち1つ:happy、sad、angry、fearful、disgusted、surprised、neutral。
- 速度 —
0.5–2.0(デフォルト1.0)。 - 音量 —
>0–10(デフォルト1.0)。 - ピッチ — 整数単位で
-12–+12(デフォルト0、元の音色)。 - ポーズ — 単語間に
<#x#>を挿入すると、x秒(0.01–99.99)の無音を設定できます。 - テキスト正規化 — URL、メールアドレス、電話番号、日付、金額を自動的に読み上げます。
このモデルは40言語をカバーし、混在言語テキスト内でのインライン切り替えに対応しています。language_boostは、入力に複数の文字体系が混在する場合に主要言語を優先します。音声クローニングには約10秒のリファレンスを使用し、Fluent LoRAによって、アクセントのあるサンプルや流暢でないサンプルからでもクローン音声の流暢さを維持します。
公式MiniMaxからGPTProtoへの切り替え
すでにMiniMaxの/v1/t2a_v2ルートを呼び出している場合、GPTProtoへの移行はモデルの変更ではなくアクセス方法の変更です。モデル文字列はspeech-2.6-hdのままです。ベースURLと認証をGPTProtoに切り替え(正確なエンドポイントとリクエスト形式については上記のクイックスタートを参照)、MiniMaxアカウントではなく共有GPTProto残高から課金します。得られるメリットは次のとおりです。
- 1つのキー、1つの残高で200以上のモデルを利用可能 — プロバイダーごとのアカウントは不要です。
- 地域による登録制限なし — MiniMaxのプラットフォーム登録が市場によって難しい場合に有用です。
- 入力トークン無料、出力は100万トークンあたり$60 — モデルカードに表示されている定価から40%オフです。
音声ID、感情、音声設定は同じリクエストフィールドに対応します。本番トラフィックを切り替える前に、クイックスタートでプロバイダー固有のフィールド名を確認してください。








