Wan 2.6이란 무엇인가요?
Wan 2.6은 알리바바(통이 / Wan 팀)의 멀티모달 비디오 생성 모델로, 2025년 12월에 출시되었습니다. 텍스트 프롬프트(또는 이미지, 참조 비디오, 오디오)를 최대 15초, 최대 1080p(24fps) 클립으로 바꿔 주며, 같은 패스에서 오디오도 함께 생성합니다. 립싱크가 적용된 대화, 효과음, 음악까지 포함합니다.
Wan 2.5 대비 실제 프로덕션에 중요한 세 가지가 추가되었습니다. 멀티샷 내러티브 계획: 하나의 프롬프트로 여러 컷(와이드 → 클로즈업 → 리액션)을 구성하고, 모델이 이를 순서대로 배열하므로 별도 클립을 생성하고 이어 붙일 필요가 없습니다. 참조 기반 생성: 참조 이미지나 참조 비디오를 제공하면 모델이 여러 컷에 걸쳐 캐릭터의 정체성과 외형을 유지합니다. 더 높은 모션 충실도: 더 긴 15초 런타임에서도 더 부드럽고 안정적인 움직임을 제공합니다. 하나의 워크플로에서 텍스트, 이미지, 참조 비디오, 오디오 입력을 모두 지원합니다.
Wan 2.6은 API 전용 모델입니다. 가중치는 공개적으로 다운로드할 수 없습니다. Wan 2.1과 2.2는 오픈 가중치(Apache-2.0) 버전이고, 2.5와 2.6은 API 전용입니다. GPTProto에서는 모델 문자열 wan-2.6로 호출하며, 해상도와 길이에 따라 실행당 요금이 부과됩니다.
| 스펙 | 값 |
|---|---|
| 제공자 | 알리바바(통이 / Wan) · 2025년 12월 출시 |
| 모달리티 | 텍스트→비디오(이 페이지), 이미지→비디오, 참조→비디오도 지원 |
| 입력 | 텍스트, 이미지, 참조 비디오, 오디오 |
| 오디오 | 네이티브 동기화 — 음성 + 립싱크 + 효과음 + 음악, 단일 패스 |
| 멀티샷 | 예 — 멀티샷 계획 + 아이덴티티 유지 |
| 해상도 | 최대 1080p(24fps), 가로 / 세로 / 정사각형 |
| 재생 시간 | 5 / 10 / 15초 |
| 가중치 | API 전용(오픈소스 아님) |
| 모델 문자열 | wan-2.6 |
| 엔드포인트 | https://gptproto.com/api/v3/alibaba/wan-2.6/text-to-video |
멀티샷과 동기화된 오디오의 작동 방식
Wan 2.6을 정의하는 두 가지 기능이 있으며, 둘 다 프롬프트 작성 방식을 바꿉니다.
단일 패스로 동기화된 오디오. 생성 단계에서 프레임과 일치하는 오디오 트랙을 함께 생성하므로, 별도 편집 없이 음성이 정확한 입 모양에 맞고 배경 소리와 음악이 컷 아래에 깔립니다. 프롬프트에 Sound: 큐로 사운드를 설명하거나 audio 매개변수로 자신의 트랙을 전달하면 모델이 그에 맞춰 움직임을 동기화합니다.
한 번의 실행으로 멀티샷. 하나의 연속 샷을 렌더링하는 대신, Wan 2.6은 단일 클립 안에서 여러 비트를 순서대로 구성할 수 있습니다. 프롬프트를 시간 구간([0-5s] … [5-10s] … [10-15s] …)으로 나누면 모델이 각 구간을 하나의 샷으로 처리하고, 컷을 넘나들며 캐릭터와 배경 설정을 유지합니다. shot_type 매개변수로 단일 연속 샷을 할지, 멀티샷 구성을 할지 제어합니다. 일관성을 위해서는 8–12초 클립이 가장 안정적이며, 더 긴 길이가 필요할 때 15초를 사용할 수 있습니다.
Wan 제품군에서 선택하기
GPTProto는 Wan 모델을 하나의 잔액으로 제공합니다. 작업에 따라 선택하세요:
- Wan 2.6 — 텍스트→비디오(이 페이지): 1080p, 최대 15초, 멀티샷, 네이티브 오디오를 지원합니다. 프롬프트 하나로 더 길거나 여러 컷으로 구성된 내러티브를 만들 때 사용하세요.
- Wan 2.6 — 이미지→비디오 / 참조→비디오: 정지 이미지를 애니메이션으로 만들거나, 참조 클립 / 여러 장의 참조 이미지로 장면을 가이드해 아이덴티티를 유지합니다.
- Wan 2.5 (
wan-2.5): 1080p, 최대 10초, 네이티브 오디오, 단일 샷 — 더 저렴한 일상 작업용 모델로, 실행당 $0.225부터. - Wan 2.2 (
wan-2.2-plus): 무음, 720p, 약 5초 — 하지만 오픈 가중치 모델로, 직접 호스팅해야 할 때 선택합니다.
경쟁사들은 선택 기준 없이 이 모델들을 나열합니다. 요약하면: 2.6은 길이 + 멀티샷 + 아이덴티티, 2.5는 오디오가 포함된 저렴한 단일 샷 클립, 2.2는 오픈 가중치용입니다.
Wan 2.6 vs Wan 2.5 vs Wan 2.2
| Wan 2.6 | Wan 2.5 | Wan 2.2 | |
|---|---|---|---|
| 오디오 | 네이티브 동기화 | 네이티브 동기화 | 없음(비디오 전용) |
| 최대 길이 | 15초 | 10초 | 약 5초 |
| 해상도 | 최대 1080p | 최대 1080p | 720p |
| 멀티샷 / 참조 | 예 | 아니요 | 아니요 |
| 오픈 가중치 | 아니요(API 전용) | 아니요(API 전용) | 예(Apache 2.0) |
| GPTProto 가격 | $0.45–$2.025 / 실행 | $0.225–$1.35 / 실행 | $0.09 / 실행 |
솔직한 평가: Wan 2.6은 실행당 비용이 더 높지만, 15초 길이, 멀티샷 장면, 컷 간 캐릭터 일관성이 필요할 때 사용할 모델입니다. Wan 2.5는 오디오가 포함된 10초 이하 단일 샷 클립을 더 저렴하게 만들 수 있는 일상 작업용 모델입니다. Wan 2.2는 자체 호스팅을 위해 오픈 가중치가 필요할 때만 선택합니다.
관련: Wan 2.5 → · Wan 2.2 → · Sora 2 →
Wan 2.6 API로 무엇을 만들 수 있나요?
멀티샷 단편 영화 및 광고 — 하나의 프롬프트로 여러 컷에 걸쳐 일관된 캐릭터와 오디오를 구성해, 수동 이어 붙이기 없이 15초 내러티브 광고를 만들 수 있습니다. 720p/5초로 20가지 변형을 테스트하면 약 $9.00입니다.
대규모 현지화 비디오 — 다국어 프롬프트와 립싱크 음성이 하나의 스토리보드를 재촬영 없이 여러 언어로 바꿔 줍니다. 중국어 지원이 특히 강력합니다.
모든 화면 비율, 동일한 가격 — 정사각형(960×960, 1440×1440), 세로(720×1280, 1080×1920), 가로 모두 같은 티어에서 동일하게 책정되므로 플랫폼별로 형식을 자유롭게 선택할 수 있습니다.
이미지 / 참조→비디오 — 함께 제공되는 엔드포인트에서 정지 이미지를 애니메이션으로 만들거나 참조 클립으로 장면을 가이드할 수 있습니다.
Wan 2.6 프롬프트 레시피
Wan 2.6은 오디오를 생성하고 여러 샷을 계획할 수 있으므로, 프롬프트는 샷, 모션, 사운드를 함께 설명할 때 가장 효과적입니다. 플랫폼의 자체 예시는 프롬프트를 시간별로 구분합니다. 멀티샷에는 그 방식을 사용하세요. 각 비트는 샷 + 피사체 + 동작 + 카메라 + 조명 + Sound: 큐로 구성하세요.
1. 멀티샷 내러티브(15초 + 샷 계획)
[0-5s] 와이드 샷: 새벽에 안개 낀 산등성이에 도착한 외로운 등산객, 느린 푸시인.
[5-10s] 미디엄 샷: 그녀가 카메라를 들어 올리고 미소를 짓는다. Sound: 바람, 먼 새소리.
[10-15s] 클로즈업: 태양이 봉우리 위로 떠오르며 빛이 프레임을 가득 채운다. Sound: 은은하게 흘러나오는 앰비언트 음악, 대사 없음.
2. 대화 + 립싱크(단일 샷)
나무 카운터 뒤에 있는 바리스타의 미디엄 클로즈업, 따뜻한 아침 햇살. 그녀는 카메라를
보며 “평소처럼 드릴까요? 바로 나옵니다.”라고 말한다. 컵에서 김이 올라온다. Sound:
말하는 대사, 에스프레소 머신의 쉿 소리, 조용한 카페 분위기.
3. 제품/프로모션, 정사각형 프레임
정사각형 프레임. 매트 받침대 위에서 운동화가 천천히 회전하고, 스튜디오 조명이
스치듯 비추며 은은한 반사가 생긴다. Sound: 낮은 신스 펄스, 조명 스윕에 맞는 부드러운
바람 소리, 대사 없음.
작동 팁: 멀티샷의 경우 각 비트에 시간 범위를 표시하고 대사는 비트 길이에 맞게 짧게 유지하세요. 단일 샷인지 멀티샷인지는 shot_type으로 설정합니다. 8–12초가 일관성을 위한 최적의 길이이고, 더 긴 길이가 필요하면 15초를 사용하세요. negative_prompt로 아티팩트를 제외하세요(예: “no text, no watermark”). prompt_extend: true는 짧은 프롬프트를 모델이 확장하게 하며, 정확한 제어가 필요하면 끄세요. 결과를 재현하려면 seed를 고정하세요.






