Wan 2.5란?
Wan 2.5는 2025년 9월에 출시된 알리바바(통이 / Wan 팀)의 비디오 생성 모델입니다. 텍스트 프롬프트 — 또는 정지 이미지 —를 최대 10초, 최대 1080p(24fps)의 클립으로 변환하며, 같은 패스에서 오디오(립싱크가 적용된 대화, 주변 음향 효과, 음악)도 생성합니다. 이 단일 패스 시청각 출력이 이전 Wan 릴리스와 대부분의 오픈 비디오 모델(무성 비디오만 생성)과 차별화되는 이유입니다.
Wan 2.5는 API 전용 프리뷰로 제공되며 — 가중치는 공개적으로 다운로드할 수 없습니다. (Wan 2.1과 2.2는 직접 호스팅할 수 있는 오픈 가중치 Apache-2.0 버전이고, 2.5와 2.6은 API 전용입니다.) GPTProto에서는 모델 문자열 wan-2.5로 호출하며, 해상도와 길이에 따라 생성 1회당 과금되고 200개 이상의 다른 모델과 동일한 잔액이 사용됩니다.
| 사양 | 값 |
|---|---|
| 제공자 | 알리바바 (통이 / Wan) |
| 모달리티 | 텍스트-투-비디오(이 페이지), 이미지-투-비디오 |
| 오디오 | 네이티브 동기화 — 음성 + 립싱크 + SFX + 음악, 단일 패스 |
| 해상도 | 480p / 720p / 1080p (24fps) |
| 최대 길이 | ~10초 |
| 언어 | 다국어(중국어에 강함) |
| 가중치 | API 전용 프리뷰(오픈소스 아님) |
| 모델 문자열 | wan-2.5 |
| 엔드포인트 | https://gptproto.com/api/v3/alibaba/wan-2.5/text-to-video |
Wan 2.5 API로 만들 수 있는 것
숏폼 소셜 및 광고 — 음성 해설과 사운드가 내장된 5–10초 세로 또는 가로 클립이라 별도의 오디오 편집이 필요 없습니다. 720p/5초 실행당 $0.45로, 광고 변형 12개를 A/B 테스트해도 저렴합니다.
대규모 현지화 비디오 — Wan 2.5는 다국어 프롬프트를 처리하고 립싱크 음성을 생성하므로, 하나의 스토리보드를 다시 촬영하거나 다시 더빙하지 않고도 여러 언어 버전으로 만들 수 있습니다. 중국어 지원이 특히 강력합니다.
스토리텔링 및 설명 영상 — 대화, 주변음, 음악이 함께 생성되어 클립 전체에서 내레이션과 영상이 정렬된 상태를 유지합니다. YouTube 인트로, 제품 설명 영상, 교육용 세그먼트에 유용합니다.
정지 이미지 애니메이션화 — 단일 이미지를 첫 프레임으로 제공하고 모션 프롬프트를 입력해 애니메이션을 만들 수 있습니다.
Wan 2.5가 비디오와 오디오를 함께 생성하는 방식
대부분의 비디오 모델은 무성 프레임을 출력하며, 사운드는 나중에 덧붙이는 별도의 작업입니다. Wan 2.5는 그 반대 방식으로 설계되었습니다. 생성 단계에서 시각적 프레임과 일치하는 오디오 트랙을 함께 만들기 때문에, 대사가 올바른 입 움직임에 맞춰지고 발소리가 걸음에 맞으며, 음악은 아무것도 편집하지 않아도 컷에 맞게 깔립니다. 실제로 이는 두 가지 도구(비디오 모델 + TTS/폴리)로 이루어지던 파이프라인을 하나의 API 호출로 줄여줍니다.
이로부터 두 가지가 뒤따릅니다. 첫째, 프롬프트는 사운드뿐 아니라 움직임도 설명해야 합니다 — 대사 내용, 주변음, 음악 포함 여부를 지정하세요(§6 참조). 둘째, 오디오와 비디오가 한 패스에서 나오므로 단일 실행이 곧 하나의 과금 단위이며, 두 번 지불하거나 트랙을 이어붙일 필요가 없습니다. 대신 자체 음악이나 음성 해설을 제공해야 한다면 audio 매개변수로 전달할 수 있고, 모델이 이에 맞춰 모션을 동기화합니다.
Wan 제품군 중에서 선택하기
GPTProto는 하나의 잔액으로 여러 Wan 모델을 제공합니다. 버전 번호가 아니라 작업 요구 사항에 따라 선택하세요:
- Wan 2.5 — 텍스트-투-비디오(이 페이지): 1080p, 최대 10초, 네이티브 오디오. 사운드가 포함된 프롬프트-클립 생성의 기본 선택입니다.
- Wan 2.5 — 이미지-투-비디오: 정지 이미지를 첫 프레임으로 시작해 애니메이션화합니다("wan 2.5 animate" 사례).
- Wan 2.2 (
wan-2.2-plus): 무음, 720p, ~5초 — 하지만 오픈 가중치이므로 직접 호스팅해야 할 때 선택합니다. - Wan 2.6 (
wan-2.6): 1080p, 최대 15초, 멀티 샷 장면 계획과 참조 기반 인물 정체성 유지 기능까지 갖췄습니다 — 더 길거나 멀티 컷 내러티브가 필요할 때 업그레이드하세요.
이런 안내는 경쟁사들이 빠뜨리는 부분입니다. 그들은 어떤 모델을 선택해야 하는지 알려주지 않고 모델만 나열합니다. 오디오가 있는 단일 샷 클립에는 2.5, 가중치가 필요하면 2.2, 길고 멀티 샷이 필요하면 2.6을 사용하세요.
Wan 2.5 vs Sora 2
둘 다 텍스트나 이미지에서 동기화된 오디오가 포함된 비디오를 생성합니다. 실질적인 차이점은 다음과 같습니다:
| Wan 2.5 | Sora 2 | |
| 오디오 | 네이티브 동기화(음성 / SFX / 음악) | 네이티브 동기화 |
| 해상도 | 최대 1080p | 최대 1080p |
| 최대 길이 | ~10초 | 더 김 — 최대 ~25초(Pro) |
| 언어 | 다국어, 중국어에 강함 | 다국어 |
| 콘텐츠 / IP 규칙 | 덜 엄격함 | 더 엄격함 — 일부 호스트에서 IP & 실사 초상 재현을 차단 |
| 오픈 가중치 | 아니요(API 전용) | 아니요 |
| GPTProto 가격 | $0.225–$1.35 / 실행(해상도 × 길이 기준) | $0.4 / 실행 |
솔직한 평가: Sora 2는 실행당 정액 $0.4이고 더 긴 클립(Pro 기준 최대 ~25초)을 지원하므로, 길이가 중요할 때 선택하세요. Wan 2.5는 실행당 $0.225(480p/5초)로 더 낮은 가격에서 시작하며, 해상도와 비용을 맞바꿀 수 있고 다국어 음성 지원이 뛰어나며 콘텐츠 제한이 더 적습니다. 둘 다 하나의 GPTProto 잔액으로 사용할 수 있습니다.
관련: Sora 2 → · Wan 2.6 → · Wan 2.2 →
Wan 2.5 프롬프트 레시피
Wan 2.5는 비디오와 함께 오디오를 생성하므로, 좋은 프롬프트는 사운드뿐 아니라 움직임도 설명해야 합니다. 플랫폼 자체 예시에서는 Sound: 큐를 사용해 오디오를 인라인으로 넣습니다 — 이 관례를 따르세요. 구조: 주어 + 동작 + 카메라 무빙 + 조명 + Sound: 큐 + 스타일. 복사해서 조정하세요.
1. 대화 + 립싱크(오디오 엔진 시연)
새벽, 나무 보트 위의 나이 든 어부를 미디엄 클로즈업으로 촬영합니다. 부드러운 황금빛
빛, 잔잔히 출렁이는 물. 그는 카메라를 보며 따뜻하게 말합니다. "바다는 항상
약속을 지킵니다." 느린 푸시인. 사운드: 잔잔한 파도, 먼 갈매기 소리, 차분한
대사, 음악 없음.
2. 주변음 / SFX, 대화 없음
네온이 빛나는 도쿄의 밤 골목에 비가 내리고, 고양이가 차양 아래로 재빨리 뛰어듭니다. 젖은
도로에 반사된 빛이 반짝입니다. 고정 와이드 샷, 시네마틱. 사운드: 꾸준한 빗소리, 먼
교통 소음, 음악 없음, 대사 없음.
3. 제품 / 마케팅
대리석 카운터 위 아이스 커피 클로즈업, 물방울이 맺히고 아침
주방 조명이 비칩니다. 숟가락이 얼음을 젓습니다. 잔 주위를 느리게 180도 공전합니다.
사운드: 잔잔한 얼음 부딪히는 소리, 조용한 주방 주변음, 은은한 배경 음악.
4. 모션 / 트래킹
노을 진 빈 콘크리트 광장을 스케이트보더가 가로지르며, 낮은 앵글의 트래킹
샷이 나란히 따라가고 은은한 렌즈 플레어가 있습니다. 사운드: 바퀴가 도로 위를 굴러가는 소리, 바람
주변음, 대화 없음.
팁: 대사는 클립 길이에 맞게 충분히 짧게 유지하세요(5초마다 대사 약 1줄). 카메라 무빙을 명시적으로 적고, 주변음만 원한다면 "no music"이라고 지정하세요. 또는 audio 매개변수로 직접 트랙을 전달할 수 있습니다.









