GPT Proto

GPTProto

  • 儀表板
  • LLM

    • claude
      Claude Opus 5新功能
    • google
      Gemini 3.6 Flash
    • google
      Gemini 3.5 Flash Lite
    • moonshotai
      Kimi K3
    • openai
      GPT 5.6 Luna

    影像

    • bytedance
      Dola Seedream 5.0 Pro 260628新功能
    • google
      Gemini 3.1 Flash Lite Image
    • google
      Gemini 3.1 Flash Image
    • openai
      GPT Image 2
    • google
      Gemini 3.1 Flash Image Preview

    影片

    • kling
      Kling v3.0 4k新功能
    • bytedance
      Dreamina Seedance 2.0 Mini 260615
    • kling
      Kling v3 Omni 4k
    • bytedance
      Dreamina Seedance 2.0 Fast 260128
    • bytedance
      Dreamina Seedance 2.0 260128
    探索 214+ 種模型 >
  • 生成器

    • 建立圖片
    • 建立影片
    • 在畫布中編輯

    功能

    • 動漫轉真人 AI新功能
    • 動漫 AI 藝術生成器
    • AI 物件移除器
    • AI 圖片編輯器
    • 無限制 AI 圖像生成器
    • AI 動作轉移
    • AI 衣物移除器
    • AI 浮水印移除工具
    • 線上 AI 圖片增強器
    • 線上背景移除工具
    探索全部 >

    提示詞

    • Seedance 2.0 提示詞新功能
    • GPT Image 2 提示詞
    • Nano Banana Pro 提示詞
    • Seedream 5.0 Pro 提示詞
  • AI 部落格

    • GLM 5.2 與 MiniMax M3:哪個更適合程式設計與前端工作?
    • 如何使用 API 建立自己的 AI 角色——無需撰寫程式碼
    • Kimi K3 與 Claude Opus 5:哪個更適合程式設計與 AI 代理?
    • 20 個免費 Seedream 5.0 Pro 產品與電子商務包裝設計提示詞
    • GLM-5.2 與 Kimi K3 程式設計比較:2026 年哪個更適合開發者?
    探索全部 >

    AI 洞察

    • 什麼是 Emochi AI?以及它為什麼成長得這麼快?(2026)
    • Kimi K3 是什麼?真的接近 GPT-5.6 與 Fable 5 嗎?
    • 2026 年 YouTube、TikTok、文字與圖片適用的 12 款最佳 AI 影片生成工具
    • 什麼是 Qwen 3.8 Max?發布日期、2.4T 預覽版、價格與早期基準測試
    • Gemini 3.6 Flash 與 Gemini 3.5 Flash-Lite 詳解:您應該使用哪一個?
    探索全部 >

    AI 文件

    • gpt-image-2
    • gpt-5.4
    • kimi-k2.5
    • claude-opus-4-6
    • kling-v3.0-pro
    探索全部 >

    AI 技能

    • browser-use
    • claude-to-im
    • competitive-ads-extractor
    • content-creator
    • data-storytelling
    探索全部 >
定價
English繁體中文한국어日本語EspañolРусский
立即開始
  1. 首頁
  2. /模型
  3. /OpenAI
  4. /gpt-4o-mini-tts
OpenAI
gpt-4o-mini-tts
說明文件
說明文件
將最多 2,000 個輸入 token 轉換為可調整的語音音訊,提供 13 種內建語音,以及 MP3、Opus、AAC、FLAC、WAV 或 PCM 輸出格式。在 GPTProto 上使用 gpt-4o-mini-tts,每 100 萬個文字輸入 token 價格為 $0.42,每 100 萬個音訊輸出 token 價格為 $8.40,比 OpenAI 列出的價格低 30%。

$ 0.42
$ 0.6

$ 8.4
$ 12

text

audio

$ 0.42
$ 0.6

text

$ 8.4
$ 12

audio

相關模型
所有模型
Google
Google
gemini-2.5-flash-preview-tts
$ 6
$ 10
MiniMax
MiniMax
speech-2.6-hd
$ 60
$ 100
Google
Google
gemini-2.5-pro-preview-tts
$ 12
$ 20
MiniMax
MiniMax
speech-2.5-turbo-preview
$ 36
$ 60
MiniMax
MiniMax
speech-2.5-turbo-preview-voice-clone
$ 0.5003
$ 0.8338
MiniMax
MiniMax
speech-02-turbo
$ 0.002
$ 0.0034

GPT-4o-mini-TTS API

以自然語言控制口音、情感、語調、語速、聲線與耳語效果,生成自然逼真的語音。GPTProto 上價格實惠的 GPT-4o-mini-TTS API 使用同一組 API 金鑰,並與其他 200 多種 AI 模型共用帳戶餘額。

可控的語音表達

以自然語言描述一句話應有的語氣。透過模型的 instructions 欄位,指定口音、情感範圍、語調、語速、聲線或耳語效果。

gpt tts 情感

內建 13 種語音

從 13 種文件列出的語音中選擇,包括 alloy、coral、marin 和 cedar。若優先考量輸出品質,OpenAI 目前建議使用 marin 或 cedar。

gpt api 低延遲

串流與六種格式

輸出 MP3、Opus、AAC、FLAC、WAV 或 PCM 音訊。串流功能可在完整檔案可用之前開始播放;WAV 和 PCM 則能在對延遲敏感的工作流程中避免解碼負擔。

gpt 4o mini 成本

API 費率低 30%

GPTProto 的文字輸入費率為每 100 萬 tokens $0.42,音訊輸出費率為 $8.40,較 OpenAI 公布的 $0.60 與 $12.00 費率低 30%。

gpt 4o mini tts api

什麼是 GPT-4o-mini-TTS?

GPT-4o-mini-TTS 是 OpenAI 的文字轉語音模型,適用於已有文字內容並需要可控語音的應用程式。它僅接受文字輸入,並僅輸出音訊。不同於通用聊天模型,它並非設計用來分析影像、轉錄傳入的語音、維持較長的對話歷史,或返回文字答案。

此模型相較於舊式預設風格 TTS 工作流程的主要優勢,在於其 instructions 欄位。開發人員不再只能選擇語音和速度,而是可以用一般語言描述所需的表達方式:沉穩或興奮、對話式或正式、輕聲細語或充滿活力,並提供口音、節奏、語調和重音方面的指引。這使 OpenAI GPT-4o-mini-TTS API 適用於旁白、產品導覽、無障礙音訊、遊戲對話,以及由應用程式文字輸出所產生的語音回應。

規格 GPT-4o-mini-TTS
模型字串 gpt-4o-mini-tts
輸入模態 文字
輸出模態 音訊
最大輸入量 每次請求 2,000 個輸入 token
內建語音 13
輸出格式 MP3、Opus、AAC、FLAC、WAV、PCM
傳遞方式 完整音訊回應或串流音訊
可調整速度 0.25 至 4.0;預設為 1.0
GPTProto 定價 每 1M token 的文字輸入 $0.42/音訊輸出 $8.40

選擇合適的語音和音訊格式

GPT-4o-mini-TTS 目前記載的內建語音包括 alloy、ash、ballad、coral、echo、fable、nova、onyx、sage、shimmer、verse、marin 和 cedar。OpenAI 建議首先試用 marin 或 cedar,以獲得重視品質的輸出。這些語音可以生成多種語言的語音,但針對英文進行了最佳化,因此在發布前,請使用實際腳本測試姓名、縮寫、數字和當地發音。

語音和格式解決的是不同問題。語音決定基本音色;指令控制表達方式;回應格式則決定音訊如何融入產品。

格式 最適用途
MP3 一般網頁播放、下載和小型檔案
Opus 網際網路串流和通訊應用程式
AAC 行動應用程式和影片發布工作流程
FLAC 無損儲存、編輯和封存
WAV 低延遲播放,以及不需解碼壓縮音訊的音訊編輯
PCM 適用於自訂播放管線的原始 24 kHz、16 位元 little-endian 音訊

MP3 是實用的預設選擇。頻寬有限時選擇 Opus;需要無損儲存時選擇 FLAC;若避免解碼負擔比檔案大小更重要,則選擇 WAV 或 PCM。

如何撰寫 GPT-4o-mini-TTS 提示

實用的 GPT-4o-mini-TTS 提示會描述四件事:說話者的角色、聽眾、情緒意圖和表達方式。將要朗讀的腳本放在 input 欄位,並將語音指示放在 instructions 欄位。這種分離方式讓提示更容易重複使用和測試。

應用程式 範例 instructions 提示
客戶支援 以沉穩且令人安心的方式說話。使用溫暖的對話語氣、中等速度,並溫和地強調下一個步驟。不要聽起來過度愉快。
產品導覽 聽起來友善、清晰且有自信。保持快速節奏,在每個操作後短暫停頓,並強調按鈕名稱,但不要聽起來像廣告。
短篇旁白 採用親密的紀錄片風格,並控制活力程度。開頭輕柔,在中段逐步引發好奇,最後一句放慢速度。
無障礙朗讀 以適中的速度清楚朗讀。清晰地發音每個數字和縮寫,避免戲劇化情緒,並在標題與內文之間停頓。

測試 GPT-4o-mini-TTS API 語音時,一次只更改一個變數。先選擇基本語音,再調整語氣和節奏,最後測試發音。這樣更容易判斷問題究竟來自語音選擇、指令還是來源文字。

常見的 GPT-4o-mini-TTS API 應用

  • 旁白和配音: 將文章、產品影片、課程和短篇腳本轉換為一致的語音。

  • 應用程式導引: 朗讀導覽步驟、警示、導覽提示或生成的摘要。

  • 語音代理輸出: 將助理的文字回應轉換為串流語音。如果產品需要完整的雙向語音對語音互動,則改用 Realtime API 工作流程。

  • 無障礙: 為偏好或需要音訊的使用者,新增訊息、文件和介面內容的語音版本。

  • 多語言傳遞: 從受支援語言的文字生成語音,同時測試每種目標語言,因為內建語音針對英文進行了最佳化。

傳送請求前先規劃長篇腳本

每次請求的最大輸入量為 2,000 個 token,而不是 128K 的上下文視窗。請在句子或段落邊界切分較長的內容。每個片段都使用相同的語音、指令、速度和回應格式,並避免將句子、數字或專有名稱拆分到兩個請求中。生成後,請聆聽銜接處是否有重複停頓、不一致的重音或發音變化。

對於互動式播放,請要求串流,讓應用程式能在生成完成前開始播放音訊。對於預錄旁白,請生成完整檔案,並在發布前進行品質檢查。無論採用哪種方式,都應清楚告知終端使用者該語音是由 AI 生成,而非真人語音。

如何取得 gpt-4o-mini-tts API 金鑰

取得 gpt-4o-mini-tts API 金鑰只需四個步驟,僅需幾分鐘。建立免費的 GPTProto 帳號、儲值、產生金鑰,並進行第一次呼叫 — 在 $0.42 / $8.4 這裡能以比直連更划算的價格取得 gpt-4o-mini-tts API 金鑰,且單一金鑰即可在平台上所有模型通用。完整 gpt-4o-mini-tts 說明文件 請參閱說明文件。

註冊

註冊

建立您的免費 GPT Proto 帳號即可開始。您可以隨時為您的團隊設定組織。

儲值

儲值

您的餘額可用於平台上的所有模型,包括 gpt-4o-mini-tts,讓您能靈活地進行實驗並隨需求擴充。

產生您的 API 金鑰

產生您的 API 金鑰

在您的儀表板中建立 API 金鑰 — 進行 gpt-4o-mini-tts 請求時,您將需要它來進行驗證。

進行第一次 API 呼叫

進行第一次 API 呼叫

使用您的 API 金鑰搭配我們的範例程式碼,透過 GPT Proto 向 gpt-4o-mini-tts 發送請求,並立即查看 AI 生成的結果。

取得 API 金鑰

常見問題

GPT-4o-mini-TTS API 在 GPTProto 上的費用是多少?

GPTProto 列出的 GPT-4o-mini-TTS API 價格為每 1M 個文字輸入 token $0.42,以及每 1M 個音訊輸出 token $8.40。OpenAI 目前列出的價格分別為 $0.60 和 $12.00,因此 GPTProto 的兩項費率都低 30%。價格可能會變動;請以即時價格面板作為最終計費依據。

GPT-4o-mini-TTS 的輸入上限是多少?

該模型每次請求最多接受 2,000 個輸入 token。它不具備 128K 的上下文視窗。請在自然的句子或段落邊界切分較長的腳本,並在各個區段中保持相同的聲音和指示。

我可以使用提示詞控制 GPT-4o-mini-TTS 的聲音嗎?

可以。您可以使用自然語言指示來控制口音、情緒範圍、語調、速度、語氣和耳語效果。請將要朗讀的文字放在輸入內容中,並將表演指示放在 instructions 中,讓各部分可以獨立編輯。

有哪些可用的聲音和音訊格式?

OpenAI 記錄了 13 種內建聲音:alloy、ash、ballad、coral、echo、fable、nova、onyx、sage、shimmer、verse、marin 和 cedar。支援的格式包括 MP3、Opus、AAC、FLAC、WAV 和 PCM。

GPT-4o-mini-TTS API 支援串流嗎?

該模型的 Speech API 支援串流音訊,因此可以在完整輸出完成前開始播放。OpenAI 記錄了直接音訊串流和 SSE 串流格式。在 GPTProto 發布 SSE 說明前,請先確認目前的 GPTProto 端點是否提供 stream_format: "sse"。

GPT-4o-mini-TTS 支援自訂聲音複製嗎?

OpenAI 現在僅向符合資格的客戶提供自訂聲音,並要求取得同意及提供錄音樣本。這項可用性不會自動延伸至第三方 API 路由。除非 GPTProto 已驗證支援自訂 voice-ID,否則請在此頁面將 13 種內建聲音列為支援選項。

GPT-4o-mini-TTS 可以生成英文以外語言的語音嗎?

可以。TTS 指南列出許多支援的語言,包括中文、日文、韓文、西班牙文、法文、德文、葡萄牙文、阿拉伯文和印地文。OpenAI 指出,其聲音針對英文進行了最佳化,因此請使用每種目標語言的代表性文字測試發音和自然度。

相關文章

更多部落格
2026 年 TikTok 與 YouTube 適用的 7 款最佳 AI 文字轉語音工具

2026 年 TikTok 與 YouTube 適用的 7 款最佳 AI 文字轉語音工具

比較最優秀的 TikTok 與 YouTube AI 文字轉語音工具,涵蓋免費選項、語音品質、商業授權、影片工作流程與 API 自動化。

Gemini 3.6 Flash 與 Gemini 3.5 Flash-Lite 詳解:你該使用哪一款?

Gemini 3.6 Flash 與 Gemini 3.5 Flash-Lite 詳解:你該使用哪一款?

比較 Gemini 3.6 Flash 與 Gemini 3.5 Flash-Lite 的價格、速度、基準測試與使用情境,了解哪個全新的 Google 模型最適合你的 AI 工作負載。

2026 年哪個文字轉語音 AI API 真正最好用?

2026 年哪個文字轉語音 AI API 真正最好用?

比較最優秀的文字轉語音 AI API,評估語音品質、即時代理、多語言音訊、價格、免費方案、語音複製與正式環境使用。

2026 年 5 款最佳中國 LLM 模型:哪一款最適合程式設計?

2026 年 5 款最佳中國 LLM 模型:哪一款最適合程式設計?

比較 Kimi K3、GLM 5.2、Qwen3.7 Max、MiniMax M3 與 DeepSeek V4 Pro 在程式設計、成本、速度、100 萬上下文與開放權重存取方面的表現。

GPT Proto

以全球規模與穩定性,賦能 AI 創新:

透過我們的旗艦產品 GPT Proto,我們提供統一的介面,讓您能存取並整合全球頂尖 AI 供應商的 API,涵蓋文字、視覺、語音等領域。我們協助開發者與企業簡化整合流程,並無限制地加速創新。

全球基礎設施,在地合規:

To ensure enterprise-grade reliability and compliance, Talent Tech Global Limited operates specifically as our global Billing and Contracting Entity. Meanwhile, our core technical infrastructure and R&D teams are strategically distributed across global innovation hubs, including Silicon Valley, Singapore, and Hong Kong.

為擴展而生:

我們深知穩定性至關重要。我們的平台建立在強大的去中心化架構之上,支援動態自動擴展。無論您是進行試點專案還是處理數百萬次併發請求,我們的系統都能即時擴展以滿足需求,確保您的業務永遠不會受限於基礎設施。

導覽

  • 儀表板
  • 模型
  • 建立圖片
  • AI 圖片放大
  • AI 背景移除
  • 建立影片
  • 在畫布中編輯
  • 功能
  • 定價
  • AI 文件
  • AI 部落格
  • AI 洞察
  • AI 技能

功能

  • 動漫轉真人 AI
  • 動漫 AI 藝術生成器
  • AI 物件移除器
  • AI 圖片編輯器
  • 無限制 AI 圖像生成器
  • AI 動作轉移
  • AI 衣物移除器
  • AI 浮水印移除工具
  • 線上 AI 圖片增強器
  • 線上背景移除工具
  • AI 臉部交換圖片
  • AI 護照照片製作器
  • MS Paint AI 生成器
Explore all features >

LLM

  • Claude Opus 5
  • Gemini 3.6 Flash
  • Gemini 3.5 Flash Lite
  • Kimi K3
  • GPT 5.6 Luna
  • GPT 5.6 Terra
  • GPT 5.6 Sol
  • Grok 4.5
  • Claude Sonnet 5
  • Minimax M3
  • GLM 5.2
  • GPT 5.1 Chat Latest
  • Claude Fable 5
  • Qwen3.7 Max
  • Claude Opus 4.8 Thinking
  • Claude Opus 4.8
  • Gemini 3.5 Flash
  • DeepSeek v4 Flash
  • DeepSeek v4 Pro
  • Grok 4.3
探索所有模型 >

影像

  • Dola Seedream 5.0 Pro 260628
  • Gemini 3.1 Flash Lite Image
  • Gemini 3.1 Flash Image
  • GPT Image 2
  • Gemini 3.1 Flash Image Preview
  • Seedream 5.0 260128
  • Doubao Seedream 5.0 260128
  • Vidu Q2
  • Grok Imagine Image
  • Kling Image O1
  • GPT Image 1.5
  • Seedream 4.5 251128
  • Doubao Seedream 4.5 251128
  • Grok Imagine 0.9
  • Gemini 3 Pro Image Preview
  • Qwen Image Lora
  • Qwen Image Plus Lora
  • Qwen Image Plus
  • Grok 4 Image
  • GPT Image 1 Mini
探索所有模型 >

影片

  • Kling v3.0 4k
  • Dreamina Seedance 2.0 Mini 260615
  • Kling v3 Omni 4k
  • Dreamina Seedance 2.0 Fast 260128
  • Dreamina Seedance 2.0 260128
  • Vidu 2.0
  • Doubao Seedance 2.0 260128
  • Doubao Seedance 2.0 Fast 260128
  • Kling v3 Omni Pro
  • Kling v3 Omni Std
  • Vidu Q3 Turbo
  • Kling v3.0 Pro
  • Kling v3.0 Std
  • Vidu Q3 Pro
  • Kling v2.6 Std
  • Vidu Q2 Pro
  • Vidu Q2 Turbo
  • Vidu Q2 Pro Fast
  • Vidu Q2
  • Kling Video O1 Pro
探索所有模型 >

© 2026 Talent Tech Global Limited (Hong Kong) / Talent Tech Global LLC (US). 保留所有權利。

  • 關於我們
  • 隱私權政策
  • 服務條款
  • 網站地圖