原生情感韻律
模型會自動解析文字語境,加入自然停頓、嘆息與情感深度,無需手動使用 SSML 標籤。
curl --request POST "https://gptproto.com/api/v3/minimax/speech-2.5-hd-preview/text-to-audio" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"text": "A tiny origami fox sailing a teacup across a moonlit puddle",
"voice_id": "Wise_Woman",
"speed": 1,
"volume": 1,
"pitch": 0,
"emotion": "happy",
"english_normalization": false,
"sample_rate": 8000,
"bitrate": 32000,
"channel": 1,
"format": "mp3",
"language_boost": "English",
"enable_base64_output": false,
"enable_sync_mode": false
}'Chat, coding agents & document work. Priced per 1M tokens — input, cached input and output are billed separately. GPTProto is 40% below official rates.
MiniMax · ≈ 100M tokens/mo(0M 快取)
GPTProto 在官方價基礎上提供模型折扣(約 10–30% off),再疊加儲值贈送額度——每單位都比直連更划算。
讓 2.5 HD 預覽模型在合成語音技術領域領先的技術亮點。
模型會自動解析文字語境,加入自然停頓、嘆息與情感深度,無需手動使用 SSML 標籤。
僅使用 5 秒的語音樣本,即可以 94% 的相似度複製任何目標聲音,並支援跨語言合成。
專為廣播設計的高畫質輸出,相較於 24kHz 標準模型,提供更卓越的清晰度。
最佳化的處理管線確保快速 TTFB,成為對話式 AI 應用程式的最快選擇。
關於將 text speech 2.5 整合至應用程式,以進行高品質音訊製作的常見問題。
與本模型相關的指南、對比與更新。
所有文章輸入
輸出