MiniMax Speech 2.6 API — HD 텍스트 음성 변환, 정가 대비 40% 할인
MiniMax Speech 2.6 API는 텍스트를 40개 언어로 HD 오디오로 변환하며, 요청당 최대 10,000자 입력과 7가지 기본 감정을 지원합니다. GPTProto에서는 speech-2.6-hd 모델을 출력 토큰 100만 개당 $60, 입력 토큰 무료 — 정가 대비 40% 할인의 조건으로 호출할 수 있으며, 하나의 API 키와 200개 이상 모델에서 공유되는 단일 잔액을 사용합니다. 별도의 MiniMax 계정이나 지역 제한 가입이 필요 없습니다. 모든 모델 보기에서 같은 키로 실행할 수 있는 다른 모델도 확인하세요.
MiniMax Speech 2.6 HD 모델이 하는 일
speech-2.6-hd는 MiniMax Speech 2.6 제품군의 고충실도 변형으로, 음색 디테일과 운율이 중요한 내레이션, 오디오북, 브랜드 보이스오버에 맞게 조정되었습니다. MiniMax Speech 02와 비교해 다국어 유사도, 리듬, 음성 복제 정확도가 개선되었으며, 방언 처리를 포함한 40개 언어를 지원합니다. HD 방식은 충실도에, 같은 제품군의 Turbo 방식은 최저 지연 시간에 초점을 맞춥니다. GPTProto에서는 MiniMax 계정을 직접 관리하지 않고도 MiniMax Speech 2.6 API를 통해 HD 모델에 액세스할 수 있습니다.
장문 내레이션 및 오디오북
출판과 e-러닝 분야에서 speech-2.6-hd는 요청당 최대 10,000자를 지원하며(3,000자 초과 시 스트리밍 출력 권장), 긴 구간에서도 일관된 음성을 유지합니다. 40개 언어 지원과 요청별 감정 제어(기쁨, 슬픔, 분노, 두려움, 혐오, 놀람, 중립)를 통해 하나의 파이프라인으로 다국어 오디오북, 교육 콘텐츠, 읽어주기 접근성 트랙을 제작할 수 있습니다. 긴 스크립트는 단일 블록으로 보내지 말고 분할하여 스트리밍해야 합니다.
음성 에이전트 및 지원 스크립트
Speech 2.6은 에이전트가 필요로 하는 방식으로 동적 텍스트를 읽습니다. URL, 이메일 주소, 전화번호, 날짜, 통화 금액을 전처리 없이 정확히 읽습니다(예: $1,234.56 → 'one thousand two hundred thirty-four dollars and fifty-six cents'). speech-2.6-hd는 응답 재생을 위한 스트리밍 PCM 출력을 지원합니다. 가능한 가장 낮은 지연 시간이 우선이라면 GPTProto에서도 같은 키로 speech-2.5-turbo-preview를 사용할 수 있습니다 — HD 방식은 속도를 조금 희생하는 대신 더 높은 충실도를 제공합니다.
GPTProto에서 MiniMax Speech 2.6을 호출해야 하는 이유
MiniMax에 직접 연결하려면 별도 계정, 문자별 과금, 지역 제한 가입이 필요합니다. GPTProto는 동일한 speech-2.6-hd 모델을 하나의 API 키와 200개 이상의 텍스트, 이미지, 비디오, 오디오 모델이 공유하는 선불 잔액으로 제공합니다. 한 번 충전하면 어디서든 사용하고, 하나의 대시보드에서 사용량을 모니터링하며, 나중에 마이그레이션하더라도 모델 문자열을 동일하게 유지할 수 있습니다. 이는 모델을 다시 구현하는 것이 아니라 액세스 가치를 제공하는 것입니다.
MiniMax Speech 2.6이란?
MiniMax Speech 2.6은 2025년 10월 30일에 발표된 텍스트 음성 변환(TTS / text-to-audio) 모델 제품군으로, 음성 에이전트, 다국어 내레이션, 비정형 텍스트의 정확한 읽기를 위해 설계되었습니다. HD(고충실도)와 Turbo(저지연) 두 가지 방식으로 제공됩니다. GPTProto는 HD 방식을 speech-2.6-hd로, MiniMax Speech 2.6 텍스트 음성 변환 API를 통해 노출합니다. 아래 표는 speech-2.6-hd의 실제 사양입니다.
| 사양 | speech-2.6-hd |
|---|---|
| 모델 문자열 | speech-2.6-hd |
| 유형 | 텍스트 → 오디오 (TTS / T2A) |
| 변형 | HD(고충실도), Turbo는 저지연 버전 |
| 지원 언어 | 40개 언어 + 방언 |
| 최대 입력 | 요청당 10,000자 미만 (3,000자 초과 시 스트리밍) |
| 감정 | 7가지 — 기쁨, 슬픔, 분노, 두려움, 혐오, 놀람, 중립 |
| 음성 제어 | 속도 [0.5–2.0], 볼륨 (0–10], 피치 [-12–+12] |
| 샘플 레이트 | 22,050 / 24,000 / 44,100 / 48,000 Hz |
| 비트레이트 | 64k–320k bps (MP3 / OGG) |
| 출력 형식 | MP3, WAV, OGG, FLAC; 스트리밍 PCM |
| 음성 복제 | 지원 — 10초 기준 음성, 복제 음성 유창성을 위한 Fluent LoRA |
| 텍스트 정규화 | URL, 이메일, 전화번호, 날짜, 통화 자동 읽기 |
| GPTProto 가격 | 입력 토큰 100만 개당 $0 · 출력 토큰 100만 개당 $60 (정가 대비 40% 할인) |
| GPTProto 모델 액세스 | 하나의 API 키, 200개 이상 모델에서 공유되는 잔액 |
MiniMax Speech 2.6 HD vs 2.5 HD vs 2.5 Turbo
세 모델 모두 GPTProto에서 동일한 키로 실행되므로 자체 스크립트로 A/B 테스트할 수 있습니다. Speech 2.6은 2.5 계열보다 다국어 유사도, 리듬, 비정형 텍스트 처리가 개선되었으며, 2.5 Turbo 방식은 가장 빠른 옵션으로 유지됩니다.
speech-2.6-hd |
speech-2.5-hd-preview |
speech-2.5-turbo-preview |
|
|---|---|---|---|
| 우선순위 | HD 고충실도 | HD 고충실도 (이전 세대) | 지연 시간 + 비용 |
| 지원 언어 | 40 | 40 | 40 |
| 텍스트 정규화 (URL / 날짜 / 금액) | 개선됨 | 기본 | 기본 |
| 음성 복제 | 지원 (Fluent LoRA) | 지원 | 지원 |
| 적합한 용도 | 내레이션, 오디오북, 브랜드 VO | 기존 2.5 HD 워크플로 | 실시간 에이전트, IVR |
| GPTProto 가격 (토큰 100만 개당) | $0 입력 / $60 출력 | $0 입력 / $60 출력 | $0 입력 / $36 출력 |
요약: 가장 자연스러운 내레이션과 비정형 텍스트의 정확한 읽기가 필요하면 2.6 HD를 선택하세요. 2.5 HD는 이미 해당 워크플로에 맞춰진 경우에만 유지하세요 — 출력 요금이 동일한 $60이므로 2.6 HD가 기본입니다. 응답 속도와 비용이 충실도보다 중요할 때는 2.5 Turbo를 출력 토큰 100만 개당 $36에 사용하세요.
음성, 감정, 언어 지원 범위
speech-2.6-hd는 voice_id를 통해 시스템 음성과 복제 음성을 제공하며, 요청별 전달 제어도 지원합니다:
- 감정 — 7가지 중 하나: 기쁨, 슬픔, 분노, 두려움, 혐오, 놀람, 중립.
- 속도 —
0.5–2.0(기본값1.0). - 볼륨 —
>0–10(기본값1.0). - 피치 —
-12–+12, 정수 단계 (기본값0, 원래 음색). - 일시정지 — 단어 사이에
<#x#>를 삽입하여x초의 무음을 설정합니다 (0.01–99.99). - 텍스트 정규화 — URL, 이메일 주소, 전화번호, 날짜, 금액을 자동으로 읽습니다.
이 모델은 혼합 언어 텍스트에서 인라인 전환과 함께 40개 언어를 지원하며, language_boost는 스크립트가 혼합된 입력에서 기본 언어에 가중치를 부여합니다. 음성 복제에는 약 10초의 기준 음성이 필요하며, Fluent LoRA는 악센트가 있거나 유창하지 않은 샘플에서도 복제 음성의 유창함을 유지합니다.
공식 MiniMax에서 GPTProto로 전환
이미 MiniMax의 /v1/t2a_v2 경로를 호출하고 있다면 GPTProto로의 전환은 모델 변경이 아니라 액세스 변경입니다 — 모델 문자열은 speech-2.6-hd로 유지됩니다. 기본 URL과 인증을 GPTProto로 교체하고(정확한 엔드포인트와 요청 형태는 위 Quick Start 참조), MiniMax 계정 대신 공유 GPTProto 잔액으로 결제하면 됩니다. 얻을 수 있는 이점은 다음과 같습니다:
- 하나의 키, 하나의 잔액 — 200개 이상 모델에서 사용 가능, 제공업체별 계정 불필요.
- 지역 제한 없는 가입 — MiniMax 플랫폼 가입이 해당 지역에서 불편할 때 유용합니다.
- 입력 토큰 무료, 출력은 100만 개당 $60 — 모델 카드에 표시된 정가 대비 40% 할인.
음성 ID, 감정, 오디오 설정은 동일한 요청 필드에 매핑됩니다. 프로덕션 트래픽을 전환하기 전에 Quick Start에서 제공업체별 필드 이름을 확인하세요.








