GPT-4o-mini-TTS — это модель OpenAI для преобразования текста в речь, предназначенная для приложений, у которых уже есть готовый текст и которым требуется управляемое озвучивание. Она принимает только текст и возвращает только аудио. В отличие от универсальных чат-моделей, она не предназначена для анализа изображений, транскрипции входящей речи, поддержания долгой истории диалога или возврата текстовых ответов.
Главное преимущество этой модели по сравнению со старыми пресетами TTS — поле instructions. Вместо того чтобы выбирать только голос и скорость, разработчики могут описать желаемую манеру подачи на обычном языке: спокойную или воодушевленную, разговорную или официальную, мягкую или энергичную, с указанием акцента, темпа, интонации и логических ударений. Это делает API OpenAI GPT-4o-mini-TTS полезным для озвучивания, онбординга продуктов, аудио для людей с ограниченными возможностями, диалогов в играх и голосовых ответов, генерируемых на основе текстового вывода приложения.
| Спецификация | GPT-4o-mini-TTS |
| Идентификатор модели | gpt-4o-mini-tts |
| Входная модальность | Текст |
| Выходная модальность | Аудио |
| Максимальный ввод | 2 000 входных токенов на запрос |
| Встроенные голоса | 13 |
| Форматы вывода | MP3, Opus, AAC, FLAC, WAV, PCM |
| Доставка | Полный аудиоответ или потоковое аудио |
| Регулируемая скорость | от 0.25 до 4.0; по умолчанию 1.0 |
| Цены GPTProto | $0.42 за текстовый ввод / $8.40 за аудиовывод на 1M токенов |
Выбор правильного голоса и аудиоформата
В документации GPT-4o-mini-TTS в настоящее время указаны следующие встроенные голоса: alloy, ash, ballad, coral, echo, fable, nova, onyx, sage, shimmer, verse, marin и cedar. OpenAI рекомендует сначала попробовать marin или cedar для получения наилучшего качества. Голоса могут генерировать речь на разных языках, но они оптимизированы для английского, поэтому перед релизом обязательно тестируйте имена, аббревиатуры, числа и местное произношение на реальных сценариях.
Голос и формат решают разные задачи. Голос определяет базовое звучание; инструкции управляют подачей; а формат ответа определяет, как аудио встраивается в продукт.
| Формат | Оптимальное применение |
| MP3 | Общее воспроизведение в веб, скачивание и компактные файлы |
| Opus | Интернет-трансляции и коммуникационные приложения |
| AAC | Мобильные приложения и рабочие процессы видеопубликации |
| FLAC | Хранение без потерь, редактирование и архивация |
| WAV | Воспроизведение с низким уровнем задержки и редактирование аудио без декодирования сжатого звука |
| PCM | Несжатый звук 24 кГц, 16-бит little-endian для пользовательских пайплайнов воспроизведения |
Используйте MP3 в качестве практичного варианта по умолчанию. Выбирайте Opus, когда важна пропускная способность, FLAC — когда важно хранение без потерь, а WAV или PCM — когда избежание накладных расходов на декодирование важнее размера файла.
Как написать промпт для GPT-4o-mini-TTS
Полезный промпт для GPT-4o-mini-TTS описывает четыре вещи: роль спикера, слушателя, эмоциональный настрой и манеру подачи. Храните озвучиваемый текст в поле input, а инструкции по озвучке помещайте в поле instructions. Такое разделение упрощает повторное использование и тестирование промптов.
| Приложение | Пример промпта для instructions |
| Поддержка клиентов | Говори спокойно и успокаивающе. Используй теплый разговорный тон, умеренный темп и мягкий акцент на следующем шаге. Не звучи чрезмерно жизнерадостно. |
| Онбординг продукта | Звучи дружелюбно, четко и уверенно. Держи бодрый темп, делай небольшую паузу после каждого действия и выделяй названия кнопок голосом, не создавая впечатления рекламы. |
| Короткое повествование | Используй интимный документальный стиль с контролируемой энергией. Начинай мягко, разжигай любопытство к середине и замедляйся к последнему предложению. |
| Чтение для доступности | Читай четко в размеренном темпе. Отчетливо произноси каждое число и аббревиатуру, избегай драматических эмоций и делай паузы между заголовками и основным текстом. |
Меняйте по одной переменной за раз при тестировании голоса API GPT-4o-mini-TTS. Сначала выберите базовый голос, затем отточите тон и темп и, наконец, протестируйте произношение. Это позволит легче определить, связана ли проблема с выбором голоса, инструкцией или исходным текстом.
Популярные варианты применения API GPT-4o-mini-TTS
-
Озвучивание и закадровый голос: Превращайте статьи, продуктовые видео, уроки и короткие сценарии в стабильное аудио.
-
Подсказки в приложениях: Зачитывайте вслух шаги онбординга, оповещения, навигационные подсказки или сгенерированные сводки.
-
Вывод голосового агента: Превращайте текстовый ответ ассистента в потоковую речь. Используйте рабочий процесс Realtime API, когда продукту требуется полноценное двустороннее голосовое взаимодействие.
-
Доступность (Accessibility): Добавляйте озвученные версии сообщений, документов и интерфейсного контента для пользователей, которые предпочитают или нуждаются в аудио.
-
Многоязычная доставка: Генерируйте речь из текста на поддерживаемых языках, предварительно тестируя каждый целевой язык, поскольку встроенные голоса оптимизированы для английского.
Планируйте длинные тексты перед отправкой запросов
Максимальный объем ввода составляет 2 000 токенов за запрос, а не контекстное окно в 128K. Разбивайте длинные материалы на границах предложений или абзацев. Используйте одинаковый голос, инструкции, скорость и формат ответа для каждого сегмента и избегайте разрыва предложения, числа или собственного имени между двумя запросами. После генерации прослушайте места стыковки на предмет повторяющихся пауз, несогласованных ударений или изменений произношения.
Для интерактивного воспроизведения запрашивайте потоковую передачу, чтобы приложение могло начать воспроизведение аудио до завершения генерации. Для предварительно записанного озвучивания генерируйте файлы целиком и проводите проверку качества перед публикацией. В любом случае четко сообщайте конечным пользователям, что голос создан искусственным интеллектом, а не человеком.











