Tarifas de API un 30% más bajas
GPTProto establece el precio de la entrada de texto en 0,42 $ y de la salida de audio en 8,40 $ por cada millón de tokens: un 30 % menos que las tarifas publicadas de OpenAI de 0,60 $ y 12,00 $.
Chat, coding agents & document work. Priced per 1M tokens — input, cached input and output are billed separately. GPTProto is 30% below official rates.
OpenAI · ≈ 100M tokens/mo (0M cached)
GPTProto aplica un descuento por modelo (10–30% off oficial) más créditos bonus: cada unidad cuesta menos que ir directo.
Genera voz con un sonido natural y controla en lenguaje sencillo el acento, la emoción, la entonación, el ritmo, el tono y los susurros. La asequible API GPT-4o-mini-TTS de GPTProto utiliza una sola clave de API y el mismo saldo de cuenta que otros más de 200 modelos de IA.
GPTProto establece el precio de la entrada de texto en 0,42 $ y de la salida de audio en 8,40 $ por cada millón de tokens: un 30 % menos que las tarifas publicadas de OpenAI de 0,60 $ y 12,00 $.
Describe en lenguaje natural cómo debe sonar una frase. Dirige el acento, el rango emocional, la entonación, el ritmo, el tono o el susurro mediante el campo de instrucciones del modelo.
Elige entre 13 voces documentadas, incluidas alloy, coral, marin y cedar. Actualmente, OpenAI recomienda marin o cedar cuando la prioridad es la calidad de salida.
Devuelve audio en formato MP3, Opus, AAC, FLAC, WAV o PCM. El streaming permite comenzar la reproducción antes de que el archivo completo esté disponible; WAV y PCM evitan la sobrecarga de decodificación en flujos de trabajo sensibles a la latencia.
GPT-4o-mini-TTS es el modelo de texto a voz de OpenAI para aplicaciones que ya tienen texto escrito y necesitan audio hablado controlable. Acepta solo texto y devuelve solo audio. A diferencia de un modelo de chat general, no está diseñado para analizar imágenes, transcribir voz entrante, mantener un historial de conversación extenso ni devolver una respuesta de texto.
La principal ventaja del modelo frente a los flujos de trabajo TTS más antiguos basados en ajustes preestablecidos es su campo instructions. En lugar de seleccionar únicamente una voz y una velocidad, los desarrolladores pueden describir la forma de interpretación deseada en lenguaje cotidiano: tranquila o entusiasta, conversacional o formal, en voz baja o enérgica, con indicaciones sobre el acento, el ritmo, la entonación y el énfasis. Esto hace que la API OpenAI GPT-4o-mini-TTS sea útil para narraciones, incorporación de productos, audio de accesibilidad, diálogos de juegos y respuestas habladas generadas a partir del texto de salida de una aplicación.
| Especificación | GPT-4o-mini-TTS |
| Cadena del modelo | gpt-4o-mini-tts |
| Modalidad de entrada | Texto |
| Modalidad de salida | Audio |
| Entrada máxima | 2,000 tokens de entrada por solicitud |
| Voces integradas | 13 |
| Formatos de salida | MP3, Opus, AAC, FLAC, WAV, PCM |
| Entrega | Respuesta de audio completa o audio transmitido en streaming |
| Velocidad ajustable | 0.25 a 4.0; predeterminada 1.0 |
| Precios de GPTProto | $0.42 de entrada de texto / $8.40 de salida de audio por cada 1 millón de tokens |
GPT-4o-mini-TTS documenta actualmente las voces integradas alloy, ash, ballad, coral, echo, fable, nova, onyx, sage, shimmer, verse, marin y cedar. OpenAI recomienda probar primero marin o cedar para obtener resultados centrados en la calidad. Las voces pueden generar habla en varios idiomas, pero están optimizadas para el inglés, así que prueba nombres, acrónimos, números y pronunciación local con guiones reales antes del lanzamiento.
La voz y el formato resuelven problemas diferentes. La voz determina el sonido base; la instrucción controla la interpretación; el formato de respuesta determina cómo encaja el audio en el producto.
| Formato | Mejor uso |
| MP3 | Reproducción web general, descargas y archivos compactos |
| Opus | Streaming por Internet y aplicaciones de comunicación |
| AAC | Aplicaciones móviles y flujos de trabajo de publicación de videos |
| FLAC | Almacenamiento, edición y archivado sin pérdidas |
| WAV | Reproducción de baja latencia y edición de audio sin decodificación de audio comprimido |
| PCM | Audio sin procesar de 24 kHz y 16 bits en formato little-endian para flujos de reproducción personalizados |
Usa MP3 como opción predeterminada práctica. Elige Opus cuando el ancho de banda sea importante, FLAC cuando importe el almacenamiento sin pérdidas y WAV o PCM cuando evitar la sobrecarga de decodificación sea más importante que el tamaño del archivo.
Un prompt útil para GPT-4o-mini-TTS describe cuatro aspectos: el papel del hablante, el oyente, la intención emocional y la forma de interpretación. Mantén el guion hablado en el campo input y coloca las indicaciones de voz en el campo instructions. Esta separación facilita reutilizar y probar los prompts.
| Aplicación | Ejemplo de prompt de instructions |
| Atención al cliente | Habla con calma y transmite tranquilidad. Usa un tono conversacional y cálido, un ritmo moderado y un énfasis suave en el siguiente paso. No suenes excesivamente alegre. |
| Incorporación de productos | Suena amable, claro y seguro. Mantén un ritmo ágil, haz una breve pausa después de cada acción y enfatiza los nombres de los botones sin sonar como un anuncio. |
| Narración breve | Usa un estilo documental íntimo con energía controlada. Comienza suavemente, despierta la curiosidad en la parte central y ralentiza el ritmo para la frase final. |
| Lectura de accesibilidad | Lee con claridad y a un ritmo medido. Pronuncia cada número y abreviatura de forma diferenciada, evita la emoción dramática y haz una pausa entre los encabezados y el texto principal. |
Cambia una variable a la vez al probar una voz de la API GPT-4o-mini-TTS. Primero selecciona la voz base, después ajusta el tono y el ritmo y, por último, prueba la pronunciación. Esto facilita identificar si un problema proviene de la elección de voz, la instrucción o el texto de origen.
Narración y voces en off: Convierte artículos, videos de productos, lecciones y guiones breves en audio hablado coherente.
Guía dentro de la aplicación: Lee en voz alta pasos de incorporación, alertas, indicaciones de navegación o resúmenes generados.
Salida de agentes de voz: Convierte la respuesta de texto de un asistente en voz transmitida en streaming. Usa un flujo de trabajo de la API Realtime cuando el producto necesite una interacción bidireccional completa de voz a voz.
Accesibilidad: Añade versiones habladas de mensajes, documentos y contenido de la interfaz para usuarios que prefieren o necesitan audio.
Entrega multilingüe: Genera voz a partir de texto en idiomas compatibles, probando cada idioma de destino porque las voces integradas están optimizadas para el inglés.
La entrada máxima es de 2,000 tokens por solicitud, no una ventana de contexto de 128K. Divide el material más largo en los límites de las oraciones o los párrafos. Reutiliza la misma voz, instrucción, velocidad y formato de respuesta para cada segmento, y evita cortar una oración, un número o un nombre propio entre dos solicitudes. Después de la generación, escucha las uniones para detectar pausas repetidas, énfasis incoherente o cambios de pronunciación.
Para la reproducción interactiva, solicita streaming para que la aplicación pueda comenzar a reproducir el audio antes de que termine la generación. Para narraciones pregrabadas, genera archivos completos y realiza una comprobación de calidad antes de publicarlos. En ambos casos, informa claramente a los usuarios finales de que la voz es generada por IA y no humana.
Guías, comparativas y novedades relacionadas con este modelo.
Todos los artículos
Compara las mejores herramientas de IA de texto a voz para TikTok y YouTube, incluidas opciones gratuitas, calidad de voz, derechos comerciales, flujos de trabajo de video y automatización mediante API.

Compara los precios, la velocidad, los benchmarks y los casos de uso de Gemini 3.6 Flash y Gemini 3.5 Flash-Lite. Descubre qué nuevo modelo de Google se adapta mejor a tu carga de trabajo de IA.

Compara las mejores API de IA de texto a voz en cuanto a calidad de voz, agentes en tiempo real, audio multilingüe, precios, niveles gratuitos, clonación de voz y uso en producción.

Compara Kimi K3, GLM 5.2, Qwen3.7 Max, MiniMax M3 y DeepSeek V4 Pro para programación, costo, velocidad, contexto de 1M y acceso a pesos abiertos.