MiniMax Speech 2.6 API — Texto a voz HD con un 40 % de descuento sobre el precio de lista
La API MiniMax Speech 2.6 convierte texto en audio HD en 40 idiomas, con una entrada de hasta 10.000 caracteres por solicitud y siete emociones integradas. En GPTProto puedes llamar al modelo speech-2.6-hd por $60 por cada 1 millón de tokens de salida, con los tokens de entrada gratis — un 40 % de descuento sobre el precio de lista, usando una sola clave de API y un saldo compartido entre más de 200 modelos. No necesitas una cuenta de MiniMax ni registrarte en una región restringida. Explora todos los modelos para ver qué más funciona con la misma clave.
Qué hace el modelo MiniMax Speech 2.6 HD
speech-2.6-hd es la variante de alta fidelidad de la familia MiniMax Speech 2.6, optimizada para narraciones, audiolibros y locuciones de marca donde importan el detalle del timbre y la prosodia. Frente a MiniMax Speech 02, mejora la similitud multilingüe, el ritmo y la precisión de la clonación de voz, y admite 40 idiomas con gestión de dialectos. La ruta «HD» prioriza la fidelidad; la ruta Turbo de la misma familia prioriza la latencia mínima. En GPTProto accedes al modelo HD mediante la API MiniMax Speech 2.6 sin gestionar directamente una cuenta de MiniMax.
Narraciones extensas y audiolibros
Para publicaciones y aprendizaje electrónico, speech-2.6-hd acepta hasta 10.000 caracteres por solicitud (se recomienda transmitir la salida por encima de 3.000 caracteres) y mantiene una voz coherente en pasajes largos. Su cobertura de 40 idiomas y el control de emociones por solicitud (feliz, triste, enfadado, temeroso, disgustado, sorprendido, neutral) permiten que una sola canalización produzca audiolibros multilingües, materiales de cursos y pistas de accesibilidad de lectura en voz alta. Los guiones largos deben segmentarse y transmitirse en lugar de enviarse como un único bloque.
Agentes de voz y guiones de soporte
Speech 2.6 lee texto dinámico como lo necesita un agente: las URL, direcciones de correo electrónico, números de teléfono, fechas y cantidades monetarias se verbalizan correctamente sin procesamiento previo (por ejemplo, $1,234.56 → «mil doscientos treinta y cuatro dólares y cincuenta y seis centavos»). speech-2.6-hd admite salida PCM en streaming para una reproducción ágil. Si tu prioridad es la latencia más baja posible, GPTProto también ofrece speech-2.5-turbo-preview con la misma clave — la ruta HD sacrifica un poco de velocidad a cambio de una mayor fidelidad.
Por qué llamar a MiniMax Speech 2.6 a través de GPTProto
Contratar directamente con MiniMax implica una cuenta separada, facturación por carácter y un registro restringido por región. GPTProto te ofrece el mismo modelo speech-2.6-hd con una sola clave de API y un saldo prepago compartido entre más de 200 modelos de texto, imagen, vídeo y audio. Recarga una vez y gasta el saldo donde quieras, supervisa el uso en un único panel y conserva idéntico el nombre del modelo si más adelante migras. Obtén valor de acceso, no una reescritura del modelo.
¿Qué es MiniMax Speech 2.6?
MiniMax Speech 2.6 es una familia de modelos de texto a voz (TTS / texto a audio) anunciada el 30 de octubre de 2025, creada para agentes de voz, narraciones multilingües y lectura correcta de texto no convencional. Se ofrece en dos rutas: HD (centrada en la fidelidad) y Turbo (de baja latencia). GPTProto expone la ruta HD como speech-2.6-hd mediante la API de texto a voz MiniMax Speech 2.6. La siguiente tabla contiene las especificaciones operativas de speech-2.6-hd.
| Especificación | speech-2.6-hd |
|---|---|
| Nombre del modelo | speech-2.6-hd |
| Modalidad | Texto → Audio (TTS / T2A) |
| Variante | HD (fidelidad); Turbo es la variante hermana de baja latencia |
| Idiomas | 40 idiomas + dialectos |
| Entrada máxima | Menos de 10.000 caracteres por solicitud (transmitir por encima de 3.000) |
| Emociones | 7 — feliz, triste, enfadado, temeroso, disgustado, sorprendido, neutral |
| Controles de voz | velocidad [0.5–2.0], volumen (0–10], tono [-12–+12] |
| Frecuencias de muestreo | 22,050 / 24,000 / 44,100 / 48,000 Hz |
| Velocidades de bits | 64k–320k bps (MP3 / OGG) |
| Formatos de salida | MP3, WAV, OGG, FLAC; PCM en streaming |
| Clonación de voz | Compatible — referencia de 10 segundos; Fluent LoRA para la fluidez de la voz clonada |
| Normalización de texto | Lee automáticamente URL, correos electrónicos, números de teléfono, fechas y divisas |
| Precio de GPTProto | $0 / 1 millón de tokens de entrada · $60 / 1 millón de tokens de salida (40 % de descuento sobre el precio de lista) |
| Acceso al modelo de GPTProto | Una clave de API, saldo compartido entre más de 200 modelos |
MiniMax Speech 2.6 HD frente a 2.5 HD y 2.5 Turbo
Los tres funcionan en GPTProto con la misma clave, por lo que puedes probarlos con tus propios guiones. Speech 2.6 mejora la similitud multilingüe, el ritmo y la gestión de texto no convencional respecto a la línea 2.5; la ruta 2.5 Turbo sigue siendo la opción más rápida.
speech-2.6-hd |
speech-2.5-hd-preview |
speech-2.5-turbo-preview |
|
|---|---|---|---|
| Prioridad | Fidelidad HD | Fidelidad HD (generación anterior) | Latencia + coste |
| Idiomas | 40 | 40 | 40 |
| Normalización de texto (URL / fechas / cantidades) | Mejorada | Básica | Básica |
| Clonación de voz | Sí (Fluent LoRA) | Sí | Sí |
| Ideal para | Narraciones, audiolibros, locuciones de marca | Flujos de trabajo existentes con 2.5 HD | Agentes en tiempo real, IVR |
| Precio de GPTProto (por 1 millón de tokens) | $0 de entrada / $60 de salida | $0 de entrada / $60 de salida | $0 de entrada / $36 de salida |
En resumen: elige 2.6 HD para obtener la narración más natural y la lectura correcta de texto desordenado; conserva 2.5 HD solo si ya tienes un flujo de trabajo ajustado a él — tiene la misma tarifa de salida de $60, por lo que 2.6 HD es la opción predeterminada; utiliza 2.5 Turbo a $36 por cada 1 millón de tokens de salida cuando la velocidad de los turnos y el coste importen más que la fidelidad.
Voces, emociones y cobertura lingüística
speech-2.6-hd ofrece voces del sistema y voces clonadas mediante voice_id, además de control por solicitud sobre la interpretación:
- Emoción — una de siete: feliz, triste, enfadado, temeroso, disgustado, sorprendido, neutral.
- Velocidad —
0.5–2.0(predeterminada:1.0). - Volumen —
>0–10(predeterminado:1.0). - Tono —
-12–+12en pasos enteros (predeterminado:0, timbre original). - Pausas — inserta
<#x#>entre palabras para establecer un silencio dexsegundos (0.01–99.99). - Normalización de texto — lee automáticamente URL, direcciones de correo electrónico, números de teléfono, fechas y dinero.
El modelo admite 40 idiomas con cambio integrado en textos multilingües, y language_boost prioriza un idioma principal cuando la entrada mezcla alfabetos. La clonación de voz utiliza una referencia de unos 10 segundos; Fluent LoRA mantiene la fluidez de las voces clonadas incluso a partir de muestras con acento o disfluencias.
Cómo pasar de MiniMax oficial a GPTProto
Si ya llamas a la ruta /v1/t2a_v2 de MiniMax, pasar a GPTProto es un cambio de acceso, no de modelo — el nombre del modelo sigue siendo speech-2.6-hd. Cambia la URL base y la autenticación a GPTProto (consulta el inicio rápido anterior para conocer el endpoint y la estructura exactos de la solicitud) y factura desde tu saldo compartido de GPTProto en lugar de una cuenta de MiniMax. Lo que obtienes:
- Una clave, un saldo para más de 200 modelos — sin cuentas por proveedor.
- Sin registro restringido por región — relevante si el registro en la plataforma de MiniMax resulta complicado en tu mercado.
- Tokens de entrada gratis, salida a $60 / 1 millón — un 40 % de descuento sobre la tarifa de lista mostrada en la ficha del modelo.
Los identificadores de voz, las emociones y la configuración de audio se asignan a los mismos campos de solicitud; confirma los nombres de los campos específicos del proveedor en el inicio rápido antes de transferir el tráfico de producción.








