GPT-4o-mini-TTS는 OpenAI의 텍스트 음성 변환 모델로, 이미 작성된 텍스트를 보유하고 있고 제어 가능한 음성 오디오가 필요한 애플리케이션을 위한 것입니다. 텍스트만 입력받고 오디오만 반환합니다. 일반 채팅 모델과 달리 이미지 분석, 들어오는 음성 전사, 긴 대화 기록 유지, 텍스트 답변 반환을 수행하도록 설계되지 않았습니다.
이 모델이 기존의 사전 설정 방식 TTS 워크플로보다 나은 가장 큰 점은 instructions 필드입니다. 개발자는 음성과 속도만 선택하는 대신, 차분하게 또는 흥분해서, 대화체 또는 격식체, 부드럽게 또는 힘차게처럼 원하는 전달 방식을 일상 언어로 설명할 수 있으며, 억양, 말하기 속도, 운율, 강세에 대한 지침도 포함할 수 있습니다. 이 덕분에 OpenAI GPT-4o-mini-TTS API는 내레이션, 제품 온보딩, 접근성 오디오, 게임 대사, 애플리케이션의 텍스트 출력에서 생성된 음성 응답에 유용합니다.
| 사양 | GPT-4o-mini-TTS |
| 모델 문자열 | gpt-4o-mini-tts |
| 입력 모달리티 | 텍스트 |
| 출력 모달리티 | 오디오 |
| 최대 입력 | 요청당 입력 토큰 2,000개 |
| 내장 음성 | 13 |
| 출력 형식 | MP3, Opus, AAC, FLAC, WAV, PCM |
| 전송 방식 | 전체 오디오 응답 또는 스트리밍 오디오 |
| 속도 조절 | 0.25~4.0, 기본값 1.0 |
| GPTProto 요금 | $0.42 텍스트 입력 / $8.40 오디오 출력 (1M 토큰당) |
올바른 음성 및 오디오 형식 선택
GPT-4o-mini-TTS는 현재 내장 음성으로 alloy, ash, ballad, coral, echo, fable, nova, onyx, sage, shimmer, verse, marin, cedar를 제공합니다. OpenAI는 품질 중심 출력을 위해 marin 또는 cedar를 먼저 시도할 것을 권장합니다. 이 음성들은 여러 언어로 음성을 생성할 수 있지만 영어에 최적화되어 있으므로, 릴리스 전에 실제 스크립트로 이름, 약어, 숫자, 현지 발음을 테스트하세요.
음성과 형식은 서로 다른 문제를 해결합니다. 음성은 기본 사운드를 결정하고, 지침은 전달을 제어하며, 응답 형식은 오디오가 제품에 어떻게 맞는지 결정합니다.
| 형식 | 최적 용도 |
| MP3 | 일반 웹 재생, 다운로드 및 작은 파일 용도 |
| Opus | 인터넷 스트리밍 및 통신 애플리케이션 |
| AAC | 모바일 앱 및 동영상 게시 워크플로 |
| FLAC | 무손실 저장, 편집 및 보관 |
| WAV | 압축 오디오 디코딩 없이 지연 시간이 낮은 재생 및 오디오 편집 |
| PCM | 사용자 지정 재생 파이프라인을 위한 원시 24kHz, 16비트 리틀엔디언 오디오 |
실용적인 기본값으로는 MP3를 사용하세요. 대역폭이 중요하면 Opus, 무손실 저장이 중요하면 FLAC, 파일 크기보다 디코딩 오버헤드를 피하는 것이 더 중요하면 WAV나 PCM을 선택하세요.
GPT-4o-mini-TTS 프롬프트 작성 방법
유용한 GPT-4o-mini-TTS 프롬프트는 화자의 역할, 청취자, 감정적 의도, 전달 방식의 네 가지를 설명합니다. 음성 스크립트는 input 필드에 두고, 음성 연출은 instructions 필드에 넣으세요. 이렇게 구분하면 프롬프트를 더 쉽게 재사용하고 테스트할 수 있습니다.
| 사용 사례 | 예시 instructions 프롬프트 |
| 고객 지원 | 차분하고 안심되는 말투로 말하세요. 따뜻한 대화체, 적당한 속도, 다음 단계에 대한 부드러운 강세를 사용하세요. 지나치게 밝은 톤은 피하세요. |
| 제품 온보딩 | 친근하고 명확하며 자신감 있는 톤으로 말하세요. 빠르고 간결한 속도를 유지하고, 각 동작 후에 잠시 멈추며, 광고처럼 들리지 않게 버튼 이름을 강조하세요. |
| 짧은 내레이션 | 절제된 에너지로 친밀한 다큐멘터리 스타일을 사용하세요. 부드럽게 시작하고 중반부에서 호기심을 키우며 마지막 문장에서는 속도를 늦추세요. |
| 접근성 낭독 | 일정한 속도로 또렷하게 읽으세요. 모든 숫자와 약어를 정확히 발음하고, 과도한 감정 표현을 피하며, 제목과 본문 사이에 멈춤을 두세요. |
GPT-4o-mini-TTS API 음성을 테스트할 때는 한 번에 하나의 변수만 변경하세요. 먼저 기본 음성을 선택한 다음 톤과 속도를 다듬고, 마지막으로 발음을 테스트하세요. 이렇게 하면 문제가 음성 선택, 지침, 원문 중 어디에서 발생했는지 더 쉽게 파악할 수 있습니다.
일반적인 GPT-4o-mini-TTS API 사용 사례
-
내레이션 및 음성 해설: 기사, 제품 동영상, 강의, 짧은 스크립트를 일관된 음성 오디오로 변환합니다.
-
앱 안내: 온보딩 단계, 알림, 탐색 안내 또는 생성된 요약을 소리 내어 읽어 줍니다.
-
음성 에이전트 출력: 어시스턴트의 텍스트 응답을 스트리밍 음성으로 변환합니다. 제품에 완전한 양방향 음성 대화가 필요하면 Realtime API 워크플로를 대신 사용하세요.
-
접근성: 오디오를 선호하거나 필요로 하는 사용자를 위해 메시지, 문서, 인터페이스 콘텐츠의 음성 버전을 추가합니다.
-
다국어 전달: 지원되는 언어 텍스트로 음성을 생성하되, 내장 음성이 영어에 최적화되어 있으므로 각 대상 언어를 테스트하세요.
긴 스크립트는 요청 전에 계획하세요
최대 입력은 128K 컨텍스트 창이 아니라 요청당 2,000 토큰입니다. 긴 자료는 문장 또는 문단 경계에서 나누세요. 모든 구간에 동일한 음성, 지침, 속도, 응답 형식을 사용하고, 문장, 숫자, 고유명사가 두 요청에 걸쳐 잘리지 않도록 하세요. 생성 후에는 이음새에서 반복되는 멈춤, 일관되지 않은 강세, 발음 변화가 있는지 들어보세요.
대화형 재생의 경우 스트리밍을 요청하여 생성이 끝나기 전에 애플리케이션이 오디오 재생을 시작할 수 있게 하세요. 사전 녹음 내레이션의 경우 완전한 파일을 생성하고 게시 전에 품질 검사를 수행하세요. 어떤 경우든 최종 사용자에게 이 음성이 사람이 아닌 AI로 생성된 것임을 명확히 고지하세요.











