GPT-4o-mini-TTS 是 OpenAI 的文字轉語音模型,適用於已有文字內容並需要可控語音的應用程式。它僅接受文字輸入,並僅輸出音訊。不同於通用聊天模型,它並非設計用來分析影像、轉錄傳入的語音、維持較長的對話歷史,或返回文字答案。
此模型相較於舊式預設風格 TTS 工作流程的主要優勢,在於其 instructions 欄位。開發人員不再只能選擇語音和速度,而是可以用一般語言描述所需的表達方式:沉穩或興奮、對話式或正式、輕聲細語或充滿活力,並提供口音、節奏、語調和重音方面的指引。這使 OpenAI GPT-4o-mini-TTS API 適用於旁白、產品導覽、無障礙音訊、遊戲對話,以及由應用程式文字輸出所產生的語音回應。
| 規格 | GPT-4o-mini-TTS |
| 模型字串 | gpt-4o-mini-tts |
| 輸入模態 | 文字 |
| 輸出模態 | 音訊 |
| 最大輸入量 | 每次請求 2,000 個輸入 token |
| 內建語音 | 13 |
| 輸出格式 | MP3、Opus、AAC、FLAC、WAV、PCM |
| 傳遞方式 | 完整音訊回應或串流音訊 |
| 可調整速度 | 0.25 至 4.0;預設為 1.0 |
| GPTProto 定價 | 每 1M token 的文字輸入 $0.42/音訊輸出 $8.40 |
選擇合適的語音和音訊格式
GPT-4o-mini-TTS 目前記載的內建語音包括 alloy、ash、ballad、coral、echo、fable、nova、onyx、sage、shimmer、verse、marin 和 cedar。OpenAI 建議首先試用 marin 或 cedar,以獲得重視品質的輸出。這些語音可以生成多種語言的語音,但針對英文進行了最佳化,因此在發布前,請使用實際腳本測試姓名、縮寫、數字和當地發音。
語音和格式解決的是不同問題。語音決定基本音色;指令控制表達方式;回應格式則決定音訊如何融入產品。
| 格式 | 最適用途 |
| MP3 | 一般網頁播放、下載和小型檔案 |
| Opus | 網際網路串流和通訊應用程式 |
| AAC | 行動應用程式和影片發布工作流程 |
| FLAC | 無損儲存、編輯和封存 |
| WAV | 低延遲播放,以及不需解碼壓縮音訊的音訊編輯 |
| PCM | 適用於自訂播放管線的原始 24 kHz、16 位元 little-endian 音訊 |
MP3 是實用的預設選擇。頻寬有限時選擇 Opus;需要無損儲存時選擇 FLAC;若避免解碼負擔比檔案大小更重要,則選擇 WAV 或 PCM。
如何撰寫 GPT-4o-mini-TTS 提示
實用的 GPT-4o-mini-TTS 提示會描述四件事:說話者的角色、聽眾、情緒意圖和表達方式。將要朗讀的腳本放在 input 欄位,並將語音指示放在 instructions 欄位。這種分離方式讓提示更容易重複使用和測試。
| 應用程式 | 範例 instructions 提示 |
| 客戶支援 | 以沉穩且令人安心的方式說話。使用溫暖的對話語氣、中等速度,並溫和地強調下一個步驟。不要聽起來過度愉快。 |
| 產品導覽 | 聽起來友善、清晰且有自信。保持快速節奏,在每個操作後短暫停頓,並強調按鈕名稱,但不要聽起來像廣告。 |
| 短篇旁白 | 採用親密的紀錄片風格,並控制活力程度。開頭輕柔,在中段逐步引發好奇,最後一句放慢速度。 |
| 無障礙朗讀 | 以適中的速度清楚朗讀。清晰地發音每個數字和縮寫,避免戲劇化情緒,並在標題與內文之間停頓。 |
測試 GPT-4o-mini-TTS API 語音時,一次只更改一個變數。先選擇基本語音,再調整語氣和節奏,最後測試發音。這樣更容易判斷問題究竟來自語音選擇、指令還是來源文字。
常見的 GPT-4o-mini-TTS API 應用
-
旁白和配音: 將文章、產品影片、課程和短篇腳本轉換為一致的語音。
-
應用程式導引: 朗讀導覽步驟、警示、導覽提示或生成的摘要。
-
語音代理輸出: 將助理的文字回應轉換為串流語音。如果產品需要完整的雙向語音對語音互動,則改用 Realtime API 工作流程。
-
無障礙: 為偏好或需要音訊的使用者,新增訊息、文件和介面內容的語音版本。
-
多語言傳遞: 從受支援語言的文字生成語音,同時測試每種目標語言,因為內建語音針對英文進行了最佳化。
傳送請求前先規劃長篇腳本
每次請求的最大輸入量為 2,000 個 token,而不是 128K 的上下文視窗。請在句子或段落邊界切分較長的內容。每個片段都使用相同的語音、指令、速度和回應格式,並避免將句子、數字或專有名稱拆分到兩個請求中。生成後,請聆聽銜接處是否有重複停頓、不一致的重音或發音變化。
對於互動式播放,請要求串流,讓應用程式能在生成完成前開始播放音訊。對於預錄旁白,請生成完整檔案,並在發布前進行品質檢查。無論採用哪種方式,都應清楚告知終端使用者該語音是由 AI 生成,而非真人語音。











