GPT Proto

GPTProto

  • 儀表板
  • LLM

    • deepseek
      DeepSeek Flash新功能
    • z-ai
      GLM 5.3
    • claude
      Claude Fable 5
    • deepseek
      DeepSeek v4 Pro
    • google
      Gemini 3.7 Flash
    • grok
      Grok 4.6
    探索模型 >

    影像

    • openai
      GPT Image 2.5 Sunburst新功能
    • openai
      GPT Image 2
    • google
      Nano Banana Pro (Gemini 3 Pro Image)
    • google
      Nano Banana 2 (Gemini 3.1 Flash Image)
    • midjourney
      Midjourney
    • openai
      GPT Image 2.5 Flare
    探索模型 >

    影片

    • minimax
      Minimax H3新功能
    • bytedance
      Seedance 2.5 (Build 260628)
    • bytedance
      Seedance 2.0 (Build 260128)
    • bytedance
      Seedance 2.0 Mini (Build 260615)
    • kling
      Kling v3.0 4k
    • vidu
      Vidu Q3 Turbo
    探索模型 >
    探索 232+ 種模型 >
  • 生成器

    • 建立圖片
    • 建立影片
    • 在畫布中編輯
    • 聊天

    功能

    • AI 貓跳舞影片生成器新功能
    • 無限制 AI 影片生成器
    • AI 包裝設計生成器
    • 動漫 AI 藝術生成器
    • AI 物件移除器
    • AI 圖片編輯器
    • AI 動作轉移
    • AI 浮水印移除工具
    • 線上 AI 圖片增強器
    • 線上背景移除工具
    探索全部 >

    提示詞

    • Seedance 2.0 提示詞新功能
    • GPT Image 2 提示詞
    • Nano Banana Pro 提示詞
    • Seedream 5.0 Pro 提示詞
    • Midjourney 提示詞
  • AI 部落格

    • OpenRouter 與 GPTProto:定價、模型、路由,以及 2026 年哪個 API 更好?
    • AI 產品廣告工作流程:從洗衣精圖片到 25 秒廣告片
    • DeepSeek V4 Pro 與 GLM 5.2:2026 年哪個更好?
    • 2026 年 7 款最佳影像編輯 AI 模型:API、批次編輯與產品照片
    • DeepSeek V4 Pro 與 Kimi K3:0813 更新後有何變化?
    探索全部 >

    AI 洞察

    • DeepSeek 尖峰定價已上線:API 何時費用更高?
    • 什麼是 GLM-5.3?Z.ai 悄然推出的程式設計方案、價格與已確認的升級
    • 什麼是 OpenAI 最新的 Astra 模型?發布日期、基準測試與比較(2026)
    • MiniMax H3 正式登場:其影片編輯升級實際帶來哪些改變
    • 什麼是 Emochi AI?以及它為什麼成長得這麼快?(2026)
    探索全部 >

    AI 文件

    • gpt-image-2
    • gpt-5.4
    • kimi-k2.5
    • claude-opus-4-6
    • kling-v3.0-pro
    探索全部 >

    AI 技能

    • browser-use
    • claude-to-im
    • competitive-ads-extractor
    • content-creator
    • data-storytelling
    探索全部 >
定價+7% 贈送
English繁體中文한국어日本語EspañolРусский
立即開始
  1. 首頁
  2. /模型
  3. /OpenAI
  4. /gpt-4o-mini-tts
OpenAI
GPT 4o Mini Tts
$ 
將最多 2,000 個輸入 token 轉換為可調整的語音音訊,提供 13 種內建語音,以及 MP3、Opus、AAC、FLAC、WAV 或 PCM 輸出格式。在 GPTProto 上使用 gpt-4o-mini-tts,每 100 萬個文字輸入 token 價格為 $0.42,每 100 萬個音訊輸出 token 價格為 $8.40,比 OpenAI 列出的價格低 30%。

模態

輸入: 文字
輸出: 音訊

/
GPT 4o Mini Tts pricing

Chat, coding agents & document work. Priced per 1M tokens — input, cached input and output are billed separately. GPTProto is 30% below official rates.

你的用量

OpenAI · ≈ 100M tokens/mo(0M 快取)

OpenRouter
牌價 + 5.5% 儲值手續費
$303.84
每月
輸入(未快取)$50.64
輸出$253.20
OpenAI
直接向 OpenAI 購買(牌價)
$288
每月
輸入(未快取)$48
輸出$240
最划算
GPTProto
官方價 30% off
$201.60
每月
折扣後$201.60
實際成本$201.60
各來源月成本
OpenRouter
$303.84
OpenAI
$288
GPTProto
$201.60
每月節省 $86.40
在 GPTProto 相較 OpenAI(−30%)
年省約 $1036.80 · 隨用隨付

GPTProto 在官方價基礎上提供模型折扣(約 10–30% off),再疊加儲值贈送額度——每單位都比直連更划算。

GPT-4o-mini-TTS API

以自然語言控制口音、情感、語調、語速、聲線與耳語效果,生成自然逼真的語音。GPTProto 上價格實惠的 GPT-4o-mini-TTS API 使用同一組 API 金鑰,並與其他 200 多種 AI 模型共用帳戶餘額。

API 費率低 30%

GPTProto 的文字輸入費率為每 100 萬 tokens $0.42,音訊輸出費率為 $8.40,較 OpenAI 公布的 $0.60 與 $12.00 費率低 30%。

可控的語音表達

以自然語言描述一句話應有的語氣。透過模型的 instructions 欄位,指定口音、情感範圍、語調、語速、聲線或耳語效果。

內建 13 種語音

從 13 種文件列出的語音中選擇,包括 alloy、coral、marin 和 cedar。若優先考量輸出品質,OpenAI 目前建議使用 marin 或 cedar。

串流與六種格式

輸出 MP3、Opus、AAC、FLAC、WAV 或 PCM 音訊。串流功能可在完整檔案可用之前開始播放;WAV 和 PCM 則能在對延遲敏感的工作流程中避免解碼負擔。

什麼是 GPT-4o-mini-TTS?

GPT-4o-mini-TTS 是 OpenAI 的文字轉語音模型,適用於已有文字內容並需要可控語音的應用程式。它僅接受文字輸入,並僅輸出音訊。不同於通用聊天模型,它並非設計用來分析影像、轉錄傳入的語音、維持較長的對話歷史,或返回文字答案。

此模型相較於舊式預設風格 TTS 工作流程的主要優勢,在於其 instructions 欄位。開發人員不再只能選擇語音和速度,而是可以用一般語言描述所需的表達方式:沉穩或興奮、對話式或正式、輕聲細語或充滿活力,並提供口音、節奏、語調和重音方面的指引。這使 OpenAI GPT-4o-mini-TTS API 適用於旁白、產品導覽、無障礙音訊、遊戲對話,以及由應用程式文字輸出所產生的語音回應。

規格 GPT-4o-mini-TTS
模型字串 gpt-4o-mini-tts
輸入模態 文字
輸出模態 音訊
最大輸入量 每次請求 2,000 個輸入 token
內建語音 13
輸出格式 MP3、Opus、AAC、FLAC、WAV、PCM
傳遞方式 完整音訊回應或串流音訊
可調整速度 0.25 至 4.0;預設為 1.0
GPTProto 定價 每 1M token 的文字輸入 $0.42/音訊輸出 $8.40

選擇合適的語音和音訊格式

GPT-4o-mini-TTS 目前記載的內建語音包括 alloy、ash、ballad、coral、echo、fable、nova、onyx、sage、shimmer、verse、marin 和 cedar。OpenAI 建議首先試用 marin 或 cedar,以獲得重視品質的輸出。這些語音可以生成多種語言的語音,但針對英文進行了最佳化,因此在發布前,請使用實際腳本測試姓名、縮寫、數字和當地發音。

語音和格式解決的是不同問題。語音決定基本音色;指令控制表達方式;回應格式則決定音訊如何融入產品。

格式 最適用途
MP3 一般網頁播放、下載和小型檔案
Opus 網際網路串流和通訊應用程式
AAC 行動應用程式和影片發布工作流程
FLAC 無損儲存、編輯和封存
WAV 低延遲播放,以及不需解碼壓縮音訊的音訊編輯
PCM 適用於自訂播放管線的原始 24 kHz、16 位元 little-endian 音訊

MP3 是實用的預設選擇。頻寬有限時選擇 Opus;需要無損儲存時選擇 FLAC;若避免解碼負擔比檔案大小更重要,則選擇 WAV 或 PCM。

如何撰寫 GPT-4o-mini-TTS 提示

實用的 GPT-4o-mini-TTS 提示會描述四件事:說話者的角色、聽眾、情緒意圖和表達方式。將要朗讀的腳本放在 input 欄位,並將語音指示放在 instructions 欄位。這種分離方式讓提示更容易重複使用和測試。

應用程式 範例 instructions 提示
客戶支援 以沉穩且令人安心的方式說話。使用溫暖的對話語氣、中等速度,並溫和地強調下一個步驟。不要聽起來過度愉快。
產品導覽 聽起來友善、清晰且有自信。保持快速節奏,在每個操作後短暫停頓,並強調按鈕名稱,但不要聽起來像廣告。
短篇旁白 採用親密的紀錄片風格,並控制活力程度。開頭輕柔,在中段逐步引發好奇,最後一句放慢速度。
無障礙朗讀 以適中的速度清楚朗讀。清晰地發音每個數字和縮寫,避免戲劇化情緒,並在標題與內文之間停頓。

測試 GPT-4o-mini-TTS API 語音時,一次只更改一個變數。先選擇基本語音,再調整語氣和節奏,最後測試發音。這樣更容易判斷問題究竟來自語音選擇、指令還是來源文字。

常見的 GPT-4o-mini-TTS API 應用

  • 旁白和配音: 將文章、產品影片、課程和短篇腳本轉換為一致的語音。

  • 應用程式導引: 朗讀導覽步驟、警示、導覽提示或生成的摘要。

  • 語音代理輸出: 將助理的文字回應轉換為串流語音。如果產品需要完整的雙向語音對語音互動,則改用 Realtime API 工作流程。

  • 無障礙: 為偏好或需要音訊的使用者,新增訊息、文件和介面內容的語音版本。

  • 多語言傳遞: 從受支援語言的文字生成語音,同時測試每種目標語言,因為內建語音針對英文進行了最佳化。

傳送請求前先規劃長篇腳本

每次請求的最大輸入量為 2,000 個 token,而不是 128K 的上下文視窗。請在句子或段落邊界切分較長的內容。每個片段都使用相同的語音、指令、速度和回應格式,並避免將句子、數字或專有名稱拆分到兩個請求中。生成後,請聆聽銜接處是否有重複停頓、不一致的重音或發音變化。

對於互動式播放,請要求串流,讓應用程式能在生成完成前開始播放音訊。對於預錄旁白,請生成完整檔案,並在發布前進行品質檢查。無論採用哪種方式,都應清楚告知終端使用者該語音是由 AI 生成,而非真人語音。

常見問題

GPT-4o-mini-TTS API 在 GPTProto 上的費用是多少?

GPTProto 列出的 GPT-4o-mini-TTS API 價格為每 1M 個文字輸入 token $0.42,以及每 1M 個音訊輸出 token $8.40。OpenAI 目前列出的價格分別為 $0.60 和 $12.00,因此 GPTProto 的兩項費率都低 30%。價格可能會變動;請以即時價格面板作為最終計費依據。

GPT-4o-mini-TTS 的輸入上限是多少?

該模型每次請求最多接受 2,000 個輸入 token。它不具備 128K 的上下文視窗。請在自然的句子或段落邊界切分較長的腳本,並在各個區段中保持相同的聲音和指示。

我可以使用提示詞控制 GPT-4o-mini-TTS 的聲音嗎?

可以。您可以使用自然語言指示來控制口音、情緒範圍、語調、速度、語氣和耳語效果。請將要朗讀的文字放在輸入內容中,並將表演指示放在 instructions 中,讓各部分可以獨立編輯。

有哪些可用的聲音和音訊格式?

OpenAI 記錄了 13 種內建聲音:alloy、ash、ballad、coral、echo、fable、nova、onyx、sage、shimmer、verse、marin 和 cedar。支援的格式包括 MP3、Opus、AAC、FLAC、WAV 和 PCM。

GPT-4o-mini-TTS API 支援串流嗎?

該模型的 Speech API 支援串流音訊,因此可以在完整輸出完成前開始播放。OpenAI 記錄了直接音訊串流和 SSE 串流格式。在 GPTProto 發布 SSE 說明前,請先確認目前的 GPTProto 端點是否提供 stream_format: "sse"。

GPT-4o-mini-TTS 支援自訂聲音複製嗎?

OpenAI 現在僅向符合資格的客戶提供自訂聲音,並要求取得同意及提供錄音樣本。這項可用性不會自動延伸至第三方 API 路由。除非 GPTProto 已驗證支援自訂 voice-ID,否則請在此頁面將 13 種內建聲音列為支援選項。

GPT-4o-mini-TTS 可以生成英文以外語言的語音嗎?

可以。TTS 指南列出許多支援的語言,包括中文、日文、韓文、西班牙文、法文、德文、葡萄牙文、阿拉伯文和印地文。OpenAI 指出,其聲音針對英文進行了最佳化,因此請使用每種目標語言的代表性文字測試發音和自然度。

相關文章

與本模型相關的指南、對比與更新。

所有文章
2026 年 TikTok 與 YouTube 適用的 7 款最佳 AI 文字轉語音工具

2026 年 TikTok 與 YouTube 適用的 7 款最佳 AI 文字轉語音工具

比較最優秀的 TikTok 與 YouTube AI 文字轉語音工具,涵蓋免費選項、語音品質、商業授權、影片工作流程與 API 自動化。

Gemini 3.6 Flash 與 Gemini 3.5 Flash-Lite 詳解:你該使用哪一款?

Gemini 3.6 Flash 與 Gemini 3.5 Flash-Lite 詳解:你該使用哪一款?

比較 Gemini 3.6 Flash 與 Gemini 3.5 Flash-Lite 的價格、速度、基準測試與使用情境,了解哪個全新的 Google 模型最適合你的 AI 工作負載。

2026 年哪個文字轉語音 AI API 真正最好用?

2026 年哪個文字轉語音 AI API 真正最好用?

比較最優秀的文字轉語音 AI API,評估語音品質、即時代理、多語言音訊、價格、免費方案、語音複製與正式環境使用。

2026 年 5 款最佳中國 LLM 模型:哪一款最適合程式設計?

2026 年 5 款最佳中國 LLM 模型:哪一款最適合程式設計?

比較 Kimi K3、GLM 5.2、Qwen3.7 Max、MiniMax M3 與 DeepSeek V4 Pro 在程式設計、成本、速度、100 萬上下文與開放權重存取方面的表現。

GPT Proto

以全球規模與穩定性,賦能 AI 創新:

透過我們的旗艦產品 GPT Proto,我們提供統一的介面,讓您能存取並整合全球頂尖 AI 供應商的 API,涵蓋文字、視覺、語音等領域。我們協助開發者與企業簡化整合流程,並無限制地加速創新。

全球基礎設施,在地合規:

To ensure enterprise-grade reliability and compliance, Talent Tech Global Limited operates specifically as our global Billing and Contracting Entity. Meanwhile, our core technical infrastructure and R&D teams are strategically distributed across global innovation hubs, including Silicon Valley, Singapore, and Hong Kong.

為擴展而生:

我們深知穩定性至關重要。我們的平台建立在強大的去中心化架構之上,支援動態自動擴展。無論您是進行試點專案還是處理數百萬次併發請求,我們的系統都能即時擴展以滿足需求,確保您的業務永遠不會受限於基礎設施。

導覽

  • 儀表板
  • 模型
  • 建立圖片
  • AI 圖片放大
  • AI 背景移除
  • 建立影片
  • 在畫布中編輯
  • 聊天
  • 功能
  • 定價
  • AI 文件
  • AI 部落格
  • AI 洞察
  • AI 技能

功能

  • AI 貓跳舞影片生成器
  • 無限制 AI 影片生成器
  • AI 包裝設計生成器
  • 動漫 AI 藝術生成器
  • AI 物件移除器
  • AI 圖片編輯器
  • AI 動作轉移
  • AI 浮水印移除工具
  • 線上 AI 圖片增強器
  • 線上背景移除工具
  • AI 臉部交換圖片
  • AI 護照照片製作器
  • MS Paint AI 生成器
  • AI 衣物移除器
  • 無限制AI圖片生成器
  • AI 法式接吻生成器
  • AI 電影海報產生器
  • Artlist IO 工作室
  • 線上魔術橡皮擦
  • Luma Dream Machine
Explore all features >

LLM

  • DeepSeek Flash
  • GLM 5.3
  • Claude Fable 5
  • DeepSeek v4 Pro
  • Gemini 3.7 Flash
  • Grok 4.6
  • Hy4 Preview
  • GPT 6 Astra
  • Gemini 3.8 Flash
  • Claude Fable 5.1
  • Qwen3.8 Max 0902
  • GLM 5.3 Flash
  • DeepSeek v4 Flash Vision Exp
  • Qwen3.8 Max
  • Claude Opus 5
  • Gemini 3.6 Flash
  • Gemini 3.5 Flash Lite
  • Kimi K3
  • GPT 5.6 Luna
  • GPT 5.6 Terra
探索所有模型 >

影像

  • GPT Image 2.5 Sunburst
  • GPT Image 2
  • Nano Banana Pro (Gemini 3 Pro Image)
  • Nano Banana 2 (Gemini 3.1 Flash Image)
  • Midjourney
  • GPT Image 2.5 Flare
  • Grok Imagine Image 2.0
  • Seedream 5.0 Pro (Build 260628)
  • Nano Banana 2 Lite (Gemini 3.1 Flash-Lite Image)
  • Nano Banana 2 (Gemini 3.1 Flash Image)
  • Seedream 5.0 (Build 260128)
  • Doubao Seedream 5.0 (Build 260128)
  • Vidu Q2
  • Grok Imagine Image
  • Kling Image O1
  • GPT Image 1.5
  • Seedream 4.5 (Build 251128)
  • Doubao Seedream 4.5 (Build 251128)
  • Grok Imagine 0.9
  • Qwen Image Lora
探索所有模型 >

影片

  • Minimax H3
  • Seedance 2.5 (Build 260628)
  • Seedance 2.0 (Build 260128)
  • Seedance 2.0 Mini (Build 260615)
  • Kling v3.0 4k
  • Vidu Q3 Turbo
  • Wan 3.0
  • Kling v3 Omni 4k
  • Seedance 2.0 Fast (Build 260128)
  • Vidu 2.0
  • Doubao Seedance 2.0 (Build 260128)
  • Doubao Seedance 2.0 Fast (Build 260128)
  • Kling v3 Omni Pro
  • Kling v3 Omni Std
  • Kling v3.0 Pro
  • Kling v3.0 Std
  • Vidu Q3 Pro
  • Kling v2.6 Std
  • Vidu Q2 Pro
  • Vidu Q2 Turbo
探索所有模型 >

聯絡我們

有任何問題或回饋嗎?歡迎透過以下管道與我們聯繫。

TelegramWhatsApp

© 2026 Talent Tech Global Limited (Hong Kong). 保留所有權利。

註冊地址: Unit 1022a, Beverley Commercial Centre, 87-105 Chatham Road South, Tsim Sha Tsui, Hong Kong商業登記證號碼: 79462435-000-12-25-0
  • 關於我們
  • 隱私權政策
  • 服務條款
  • 網站地圖
友情連結logoto.videotopostudio.cc