curl --request POST "https://gptproto.com/api/v3/minimax/speech-2.6-hd/text-to-audio" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"text": "A tiny origami fox sailing a teacup across a moonlit puddle",
"voice_id": "Wise_Woman",
"speed": 1,
"volume": 1,
"pitch": 0,
"emotion": "happy",
"english_normalization": false,
"language_boost": "Chinese",
"enable_base64_output": false,
"enable_sync_mode": false
}'Chat, agentes de programação e trabalho com documentos. Preço por 1M de tokens — entrada, entrada em cache e saída são cobradas separadamente. GPTProto está 40% abaixo das tarifas oficiais.
| Cenário | Lista de MiniMax | OpenRouter | GPTProto | Economia / mês |
|---|---|---|---|---|
| Pessoal10M tokens / mês | $200.00 | $211.00 | $120.00 | −$80.00≈ $960.00 / ano |
| Equipe100M tokens / mês | $2000.00 | $2110.00 | $1200.00 | −$800.00≈ $9600.00 / ano |
| Empresarial500M tokens / mês | $10000.00 | $10550.00 | $6000.00 | −$4000.00≈ $48000.00 / ano |
MiniMax Speech 2.6 API — Texto para fala HD com 40% de desconto sobre o preço de tabela
A MiniMax Speech 2.6 API transforma texto em áudio HD em 40 idiomas, com entrada de até 10.000 caracteres por solicitação e sete emoções integradas. No GPTProto, você chama o modelo speech-2.6-hd por $60 por 1M de tokens de saída, com tokens de entrada gratuitos — 40% de desconto sobre o preço de tabela, usando uma chave de API e um saldo compartilhado entre mais de 200 modelos. Não é necessária uma conta MiniMax nem uma inscrição restrita por região. Veja todos os modelos para descobrir o que mais funciona com a mesma chave.
O que o modelo MiniMax Speech 2.6 HD faz
speech-2.6-hd é a variante de alta fidelidade da família MiniMax Speech 2.6, ajustada para narração, audiolivros e locuções de marca em que os detalhes do timbre e a prosódia são importantes. Em comparação com o MiniMax Speech 02, ele melhora a similaridade multilíngue, o ritmo e a precisão da clonagem de voz, além de abranger 40 idiomas com suporte a dialetos. A rota "HD" prioriza a fidelidade; a rota Turbo da mesma família prioriza a menor latência. No GPTProto você acessa o modelo HD por meio da MiniMax Speech 2.6 API sem gerenciar diretamente uma conta MiniMax.
Narração longa e audiolivros
Para publicação e educação on-line, speech-2.6-hd aceita até 10.000 caracteres por solicitação (a saída em streaming é recomendada acima de 3.000 caracteres) e mantém uma voz consistente em trechos longos. A cobertura de 40 idiomas e o controle de emoção por solicitação (feliz, triste, irritado, com medo, enojado, surpreso, neutro) permitem que um único pipeline produza audiolivros multilíngues, materiais didáticos e faixas de acessibilidade para leitura em voz alta. Scripts longos devem ser segmentados e transmitidos em streaming, em vez de enviados como um único bloco.
Agentes de voz e scripts de suporte
O Speech 2.6 lê texto dinâmico da forma que um agente precisa: URLs, endereços de e-mail, números de telefone, datas e valores monetários são verbalizados corretamente sem pré-processamento (por exemplo, $1,234.56 → "mil duzentos e trinta e quatro dólares e cinquenta e seis centavos"). speech-2.6-hd oferece suporte à saída PCM em streaming para uma reprodução responsiva. Se sua prioridade for a menor latência possível, o GPTProto também disponibiliza speech-2.5-turbo-preview com a mesma chave — a rota HD troca um pouco de velocidade por maior fidelidade.
Por que chamar o MiniMax Speech 2.6 pelo GPTProto
Usar diretamente o MiniMax significa ter uma conta separada, cobrança por caractere e uma inscrição restrita por região. O GPTProto oferece o mesmo modelo speech-2.6-hd com uma única chave de API e um único saldo pré-pago compartilhado entre mais de 200 modelos de texto, imagem, vídeo e áudio. Você recarrega uma vez e gasta em qualquer lugar, monitora o uso em um único painel e mantém a string do modelo idêntica caso migre posteriormente. Obtenha acesso, não uma reescrita do modelo.
O que é o MiniMax Speech 2.6?
O MiniMax Speech 2.6 é uma família de modelos de conversão de texto em fala (TTS / texto para áudio) anunciada em 30 de outubro de 2025, criada para agentes de voz, narração multilíngue e leitura correta de textos não padronizados. Ela é oferecida em duas rotas: HD (com foco em fidelidade) e Turbo (baixa latência). O GPTProto disponibiliza a rota HD como speech-2.6-hd por meio da MiniMax Speech 2.6 text-to-speech API. A tabela abaixo é a especificação de trabalho do speech-2.6-hd.
| Especificação | speech-2.6-hd |
|---|---|
| String do modelo | speech-2.6-hd |
| Modalidade | Texto → Áudio (TTS / T2A) |
| Variante | HD (fidelidade); Turbo é o equivalente de baixa latência |
| Idiomas | 40 idiomas + dialetos |
| Entrada máxima | Menos de 10.000 caracteres por solicitação (streaming acima de 3.000) |
| Emoções | 7 — feliz, triste, irritado, com medo, enojado, surpreso, neutro |
| Controles de voz | velocidade [0.5–2.0], volume (0–10], tom [-12–+12] |
| Taxas de amostragem | 22,050 / 24,000 / 44,100 / 48,000 Hz |
| Taxas de bits | 64k–320k bps (MP3 / OGG) |
| Formatos de saída | MP3, WAV, OGG, FLAC; PCM em streaming |
| Clonagem de voz | Compatível — referência de 10 segundos; Fluent LoRA para fluência da voz clonada |
| Normalização de texto | Lê automaticamente URLs, e-mails, números de telefone, datas e valores monetários |
| Preço do GPTProto | $0 / 1M de tokens de entrada · $60 / 1M de tokens de saída (40% de desconto sobre o preço de tabela) |
| Acesso ao modelo pelo GPTProto | Uma chave de API, saldo compartilhado entre mais de 200 modelos |
MiniMax Speech 2.6 HD vs. 2.5 HD vs. 2.5 Turbo
Os três funcionam no GPTProto com a mesma chave, para que você possa testá-los em seus próprios scripts. O Speech 2.6 melhora a similaridade multilíngue, o ritmo e o tratamento de texto não padronizado em relação à linha 2.5; a rota 2.5 Turbo continua sendo a opção mais rápida.
speech-2.6-hd |
speech-2.5-hd-preview |
speech-2.5-turbo-preview |
|
|---|---|---|---|
| Prioridade | Fidelidade HD | Fidelidade HD (geração anterior) | Latência + custo |
| Idiomas | 40 | 40 | 40 |
| Normalização de texto (URLs / datas / valores) | Aprimorada | Básica | Básica |
| Clonagem de voz | Sim (Fluent LoRA) | Sim | Sim |
| Ideal para | Narração, audiolivros, locução de marca | Fluxos de trabalho existentes com 2.5 HD | Agentes em tempo real, IVR |
| Preço do GPTProto (por 1M de tokens) | $0 de entrada / $60 de saída | $0 de entrada / $60 de saída | $0 de entrada / $36 de saída |
Versão resumida: escolha o 2.6 HD para a narração mais natural e a leitura correta de textos confusos; mantenha o 2.5 HD apenas se um fluxo de trabalho já estiver ajustado para ele — a taxa de saída é os mesmos $60, portanto o 2.6 HD é o padrão; use o 2.5 Turbo por $36 / 1M de tokens de saída quando a velocidade das interações e o custo forem mais importantes que a fidelidade.
Vozes, emoções e cobertura de idiomas
speech-2.6-hd oferece vozes do sistema e vozes clonadas por meio de voice_id, além de controle por solicitação sobre a forma de entrega:
- Emoção — uma de sete: feliz, triste, irritado, com medo, enojado, surpreso, neutro.
- Velocidade —
0.5–2.0(padrão1.0). - Volume —
>0–10(padrão1.0). - Tom —
-12–+12em etapas inteiras (padrão0, timbre original). - Pausas — insira
<#x#>entre as palavras para definir um silêncio dexsegundos (0.01–99.99). - Normalização de texto — lê automaticamente URLs, endereços de e-mail, números de telefone, datas e valores monetários.
O modelo abrange 40 idiomas com alternância embutida em textos multilíngues, e language_boost prioriza um idioma principal quando a entrada mistura alfabetos. A clonagem de voz usa uma referência de aproximadamente 10 segundos; o Fluent LoRA mantém a fluência de vozes clonadas mesmo com amostras acentuadas ou com disfluências.
Migração do MiniMax oficial para o GPTProto
Se você já chama a rota /v1/t2a_v2 do MiniMax, migrar para o GPTProto é uma mudança de acesso, não de modelo — a string do modelo continua sendo speech-2.6-hd. Você troca a URL base e a autenticação pelo GPTProto (consulte o Quick Start acima para ver o endpoint exato e o formato da solicitação) e passa a cobrar do seu saldo compartilhado do GPTProto, em vez de uma conta MiniMax. O que você ganha:
- Uma chave, um saldo compartilhado entre mais de 200 modelos — sem contas por provedor.
- Sem inscrição restrita por região — relevante se a inscrição na plataforma MiniMax for difícil no seu mercado.
- Tokens de entrada gratuitos, saída a $60 / 1M — 40% de desconto sobre a tarifa de tabela exibida no cartão do modelo.
Os IDs de voz, a emoção e as configurações de áudio correspondem aos mesmos campos da solicitação; confirme os nomes de campos específicos do provedor no Quick Start antes de transferir o tráfego de produção.
Perguntas frequentes
Perguntas comuns sobre o modelo de IA speech-2.6-hd/text-to-audio
Como obtenho uma chave de API do MiniMax Speech 2.6?
Quanto custa a API do MiniMax Speech 2.6?
MiniMax Speech 2.6 HD vs. 2.5 HD — o que mudou?
MiniMax Speech 2.6 HD vs. 2.5 Turbo — qual devo usar?
Quantos idiomas e caracteres o Speech 2.6 suporta?
Preciso de uma conta separada da MiniMax para usar o Speech 2.6 no GPTProto?
Posso usar comercialmente o resultado do MiniMax Speech 2.6?
Artigos relacionados
Guias, comparações e atualizações relacionadas a este modelo.
Todos os artigos
Os 7 geradores de vídeo com IA mais acessíveis em 2026 (classificados pelo custo real por vídeo)
Compare os geradores de vídeo com IA mais baratos de 2026 pelo custo real por clipe. O Vidu Q3 Pro custa US$ 0,04 por vídeo, além do Kling, Sora 2, Veo e das melhores ferramentas gratuitas.

Como usar o Kling 3.0 Motion Control: um guia para desenvolvedores (Web + API)
Um guia para desenvolvedores sobre o Kling 3.0 Motion Control — pro vs. std, limites de entrada, dicas de prompts e código de API executável (Python + cURL) via GPTProto.

Melhores APIs de texto para imagem em 2026: 7 modelos classificados por qualidade e preço
As 7 melhores APIs de texto para imagem em 2026, classificadas pelo Elo do Arena e pelo preço real — GPT Image 2, Nano Banana, Seedream 5.0. Use todas com uma única chave de API.

O que é o Wan 2.7? Guia do modelo de modo de raciocínio da Alibaba (2026)
A maioria dos guias afirma que o Wan 2.7 é de código aberto. As evidências da fonte oficial dizem o contrário. O que o modelo da Alibaba lançado em abril de 2026 realmente oferece — e como executá-lo.