GPT-4o-mini-TTS es el modelo de texto a voz de OpenAI para aplicaciones que ya tienen texto escrito y necesitan audio hablado controlable. Acepta solo texto y devuelve solo audio. A diferencia de un modelo de chat general, no está diseñado para analizar imágenes, transcribir voz entrante, mantener un historial de conversación extenso ni devolver una respuesta de texto.
La principal ventaja del modelo frente a los flujos de trabajo TTS más antiguos basados en ajustes preestablecidos es su campo instructions. En lugar de seleccionar únicamente una voz y una velocidad, los desarrolladores pueden describir la forma de interpretación deseada en lenguaje cotidiano: tranquila o entusiasta, conversacional o formal, en voz baja o enérgica, con indicaciones sobre el acento, el ritmo, la entonación y el énfasis. Esto hace que la API OpenAI GPT-4o-mini-TTS sea útil para narraciones, incorporación de productos, audio de accesibilidad, diálogos de juegos y respuestas habladas generadas a partir del texto de salida de una aplicación.
| Especificación | GPT-4o-mini-TTS |
| Cadena del modelo | gpt-4o-mini-tts |
| Modalidad de entrada | Texto |
| Modalidad de salida | Audio |
| Entrada máxima | 2,000 tokens de entrada por solicitud |
| Voces integradas | 13 |
| Formatos de salida | MP3, Opus, AAC, FLAC, WAV, PCM |
| Entrega | Respuesta de audio completa o audio transmitido en streaming |
| Velocidad ajustable | 0.25 a 4.0; predeterminada 1.0 |
| Precios de GPTProto | $0.42 de entrada de texto / $8.40 de salida de audio por cada 1 millón de tokens |
Elige la voz y el formato de audio adecuados
GPT-4o-mini-TTS documenta actualmente las voces integradas alloy, ash, ballad, coral, echo, fable, nova, onyx, sage, shimmer, verse, marin y cedar. OpenAI recomienda probar primero marin o cedar para obtener resultados centrados en la calidad. Las voces pueden generar habla en varios idiomas, pero están optimizadas para el inglés, así que prueba nombres, acrónimos, números y pronunciación local con guiones reales antes del lanzamiento.
La voz y el formato resuelven problemas diferentes. La voz determina el sonido base; la instrucción controla la interpretación; el formato de respuesta determina cómo encaja el audio en el producto.
| Formato | Mejor uso |
| MP3 | Reproducción web general, descargas y archivos compactos |
| Opus | Streaming por Internet y aplicaciones de comunicación |
| AAC | Aplicaciones móviles y flujos de trabajo de publicación de videos |
| FLAC | Almacenamiento, edición y archivado sin pérdidas |
| WAV | Reproducción de baja latencia y edición de audio sin decodificación de audio comprimido |
| PCM | Audio sin procesar de 24 kHz y 16 bits en formato little-endian para flujos de reproducción personalizados |
Usa MP3 como opción predeterminada práctica. Elige Opus cuando el ancho de banda sea importante, FLAC cuando importe el almacenamiento sin pérdidas y WAV o PCM cuando evitar la sobrecarga de decodificación sea más importante que el tamaño del archivo.
Cómo escribir un prompt para GPT-4o-mini-TTS
Un prompt útil para GPT-4o-mini-TTS describe cuatro aspectos: el papel del hablante, el oyente, la intención emocional y la forma de interpretación. Mantén el guion hablado en el campo input y coloca las indicaciones de voz en el campo instructions. Esta separación facilita reutilizar y probar los prompts.
| Aplicación | Ejemplo de prompt de instructions |
| Atención al cliente | Habla con calma y transmite tranquilidad. Usa un tono conversacional y cálido, un ritmo moderado y un énfasis suave en el siguiente paso. No suenes excesivamente alegre. |
| Incorporación de productos | Suena amable, claro y seguro. Mantén un ritmo ágil, haz una breve pausa después de cada acción y enfatiza los nombres de los botones sin sonar como un anuncio. |
| Narración breve | Usa un estilo documental íntimo con energía controlada. Comienza suavemente, despierta la curiosidad en la parte central y ralentiza el ritmo para la frase final. |
| Lectura de accesibilidad | Lee con claridad y a un ritmo medido. Pronuncia cada número y abreviatura de forma diferenciada, evita la emoción dramática y haz una pausa entre los encabezados y el texto principal. |
Cambia una variable a la vez al probar una voz de la API GPT-4o-mini-TTS. Primero selecciona la voz base, después ajusta el tono y el ritmo y, por último, prueba la pronunciación. Esto facilita identificar si un problema proviene de la elección de voz, la instrucción o el texto de origen.
Aplicaciones comunes de la API GPT-4o-mini-TTS
-
Narración y voces en off: Convierte artículos, videos de productos, lecciones y guiones breves en audio hablado coherente.
-
Guía dentro de la aplicación: Lee en voz alta pasos de incorporación, alertas, indicaciones de navegación o resúmenes generados.
-
Salida de agentes de voz: Convierte la respuesta de texto de un asistente en voz transmitida en streaming. Usa un flujo de trabajo de la API Realtime cuando el producto necesite una interacción bidireccional completa de voz a voz.
-
Accesibilidad: Añade versiones habladas de mensajes, documentos y contenido de la interfaz para usuarios que prefieren o necesitan audio.
-
Entrega multilingüe: Genera voz a partir de texto en idiomas compatibles, probando cada idioma de destino porque las voces integradas están optimizadas para el inglés.
Planifica los guiones largos antes de enviar solicitudes
La entrada máxima es de 2,000 tokens por solicitud, no una ventana de contexto de 128K. Divide el material más largo en los límites de las oraciones o los párrafos. Reutiliza la misma voz, instrucción, velocidad y formato de respuesta para cada segmento, y evita cortar una oración, un número o un nombre propio entre dos solicitudes. Después de la generación, escucha las uniones para detectar pausas repetidas, énfasis incoherente o cambios de pronunciación.
Para la reproducción interactiva, solicita streaming para que la aplicación pueda comenzar a reproducir el audio antes de que termine la generación. Para narraciones pregrabadas, genera archivos completos y realiza una comprobación de calidad antes de publicarlos. En ambos casos, informa claramente a los usuarios finales de que la voz es generada por IA y no humana.











