"wan 2.7"을 검색하면 서로 양립할 수 없는 두 가지 답변이 나옵니다. 한쪽 가이드는 가중치를 다운로드해 자신의 GPU에서 실행하라고 하고, 다른 쪽은 API를 통해서만 이용할 수 있다고 합니다. 어느 쪽이 맞는지 알아본 이유는, 그 답에 따라 이 모델을 직접 호스팅할 수 있는지가 결정되기 때문입니다 — 간단히 말해 대부분의 자신만만한 "오픈 소스" 게시물은 사실이 아니라 관행을 반복하고 있습니다. Wan 2.7이 실제로 무엇인지, Alibaba가 무엇을 출시했고 무엇을 출시하지 않았는지, 그리고 오늘날 Wan 모델을 프로덕션에 도입하는 방법을 알아보겠습니다.
Wan 2.7이란? Alibaba의 사고 모드 모델 가이드 (2026)
대부분의 가이드는 Wan 2.7이 오픈 소스라고 말합니다. 하지만 퍼스트파티 증거는 그렇지 않음을 보여줍니다. Alibaba의 2026년 4월 모델이 실제로 제공하는 것과 이를 실행하는 방법을 알아보세요.

Wan 2.7의 실체
Wan 2.7은 단일 모델이 아닙니다. 2026년 4월 초 Alibaba의 Tongyi Lab이 출시한 릴리스 웨이브로, 두 가지 미디어를 동시에 아우릅니다. 이미지 부문에는 Wan2.7-Image와 별도의 Wan2.7-Image Pro가 있으며, 출시 자료에서는 출시일을 4월 1일 전후로 안내합니다 — 비디오 부문에는 텍스트-비디오, 이미지-비디오, 참조-비디오, 지시 기반 비디오 편집을 아우르는 4개 모델 제품군이 있으며 이후 며칠에 걸쳐 출시되었습니다. 바로 이 이중 범위 때문에 SERP에서는 Wan 2.7이 "이미지 모델"인지 "비디오 모델"인지에 대해 의견이 엇갈립니다. 둘 다이며, 하나의 버전 번호 아래 함께 출시된 것입니다.
이름 자체도 짚고 넘어갈 필요가 있습니다. 많은 사람이 여기서 혼동하기 때문입니다. "Wan"은 Alibaba의 크리에이티브 AI 제품군인 Tongyi Wanxiang(通义万相)을 국제적으로 줄여 부르는 이름입니다. 같은 기업 산하의 Qwen 언어 모델과 나란히 있지만, 서로 다른 제품군입니다. 따라서 호스팅 플랫폼이 Wan을 qwen 경로에 등록했다면, 이는 카탈로그 분류 방식일 뿐 Wan이 Qwen 모델이라는 의미가 아닙니다.
한 줄 요약: Wan 2.7은 Alibaba가 2026년 4월 출시한 이미지 및 비디오 생성 웨이브이며, Thinking Mode라는 기능을 대표 특징으로 내세웁니다.
Thinking Mode의 작동 방식
메커니즘에 앞서, 이 기능이 존재하는 이유부터 살펴보겠습니다. 일반적인 비디오 모델은 프롬프트를 곧바로 프레임으로 변환합니다. 요청 내용을 잠시 멈춰 생각하는 과정은 없습니다 — 텍스트를 읽고, 잠재 공간에서 경로를 선택한 뒤 디코딩합니다. 단일하고 깔끔한 장면이라면 충분합니다. 하지만 구조가 있는 것을 요청하는 순간 취약해집니다. 여러 장면으로 구성된 시퀀스, 세 번째 장면에서도 첫 번째 장면과 동일하게 보여야 하는 캐릭터, 특정 박자에 맞춰 마무리되어야 하는 카메라 움직임 등이 그렇습니다. 모델이 요청을 서둘러 처리하면 그 이음새가 드러납니다.
Alibaba의 설명에 따르면 Thinking Mode는 생성 전에 계획 단계를 삽입합니다. 모델은 먼저 구성 계획을 세웁니다 — 프롬프트의 의도를 어떻게 해석할지, 요소들이 시간과 공간에서 어떻게 관계를 맺는지, 장면의 논리는 무엇이어야 하는지 등을 정한 다음 생성합니다. 그 결과 아티팩트가 줄고 시퀀스 전체의 일관성이 향상된다는 것이 핵심 주장입니다.
이 효과의 크기는 확정된 수치라기보다 아직 열린 질문으로 보는 편이 좋으며, 그 이유는 잠시 후 다시 설명하겠습니다. 하지만 설계 아이디어 자체는 타당하고, 여기서 진정으로 새로운 요소이기도 합니다. 핵심은 다음과 같습니다. Thinking Mode는 계획 단계를 위해 속도를 조금 희생하며, 프롬프트에 움직이는 요소가 하나 이상 포함된 경우에 가장 큰 의미가 있습니다.
주요 기능 — 그리고 각 수치를 얼마나 신뢰할 것인가
여기서는 신뢰도 계층화가 중요합니다. Wan 2.7의 기능 목록은 거의 전적으로 Alibaba 자체 출시 자료에서 나온 것이며, 공급업체가 제시하는 수치에는 그 출처를 표시해야 하기 때문입니다.
Alibaba가 제시하는 기능은 다음과 같습니다. 하나의 클립 안에서 얼굴을 유지할 수 있을 만큼 강력한 캐릭터 일관성(이른바 "AI 동일 얼굴" 문제에 대한 해결책), HEX 값과 팔레트를 지원하는 정밀한 색상 제어, 표와 수식을 포함해 12개 언어로 3,000개 이상의 토큰을 프레임에 렌더링하는 장문 텍스트 렌더링, 멀티샷 내러티브 제어, 첫 프레임과 마지막 프레임 안내, 최대 9개의 참조 이미지를 지원하는 참조-비디오, 그리고 동일한 패스에서 생성되는 네이티브 오디오입니다. 이는 공급업체의 주장으로 제시된 공급업체의 주장입니다. 중립적인 테스트를 통해 검증하지는 못했습니다.
세부 사양은 대부분의 게시물이 인정하는 것보다 더 불분명합니다. 출력 해상도는 실행 환경에 따라 720p 또는 1080p로 안내되고, 클립 길이는 2~15초 범위 어딘가에 있으며, 4K 수치는 이미지 모델에 해당합니다. 이러한 값은 호스트에 따라 달라지므로, 특정 수치를 보더라도 "모델의 고정 사양"이 아니라 "해당 플랫폼에서의 사실"로 받아들여야 합니다. 생성도 즉시 완료되지 않습니다 — 초기 사용 후기에서는 더 가벼운 비디오 모델보다 눈에 띄게 느리다고 설명하며, 계획 단계의 조용한 비용인 만큼 대량 렌더링을 할 때 예산에 반영할 필요가 있습니다.
그리고 솔직히 말해 아직 남아 있는 공백도 있습니다. 이 글을 작성하는 시점에 중립적인 리더보드에서 Wan 2.7을 찾을 수 없었습니다 — Artificial Analysis Video Arena 항목도 없고, 이 버전에 대한 공개 VBench 점수도 없습니다. 이것이 성능이 나쁘다는 뜻은 아닙니다. 현재 유통되는 품질 주장이 여전히 공급업체가 보고한 것이라는 뜻일 뿐입니다. 가장 가까운 검증 가능한 근거는 계보입니다. Wan 2.1은 2025년 2월 출시 당시 VBench에서 1위를 차지했지만, 이는 이전 모델의 실제 결과이지 2.7을 대신하는 결과가 아닙니다.
| 주장 유형 | 예시 | 얼마나 신뢰할 것인가 |
|---|---|---|
| 현재 검증 가능 | 2.1/2.2는 오픈 웨이트이며, 2.1은 출시 당시 VBench에서 1위를 차지함 | 공식 퍼스트파티 저장소와 벤치마크에서 확인됨 |
| 공급업체 보고 | Thinking Mode의 향상, 색상/텍스트/일관성 사양 | Alibaba의 설명이며, 아직 중립 테스트는 없음 |
| 호스트에 따라 다름 | 720p/1080p, 2–15초, 4K(이미지) | 플랫폼에 따라 달라지며, 고정된 모델 사양이 아님 |
Wan 2.7은 오픈 소스인가?
먼저 짧게 답하면, Wan 시리즈가 사람들에게 익숙하게 만든 방식으로는 아닙니다.
사실은 다음과 같습니다. Wan 2.1(2025년 2월)과 Wan 2.2(2025년 7월)는 Apache 2.0 라이선스의 오픈 웨이트로 출시되었습니다 — 다운로드, 자체 호스팅, 파인튜닝이 가능하고 상업적 제한도 없습니다. Hugging Face의 Wan-AI 조직과 GitHub의 Wan-Video 조직에서 직접 확인할 수 있습니다. 이러한 오픈 웨이트 이력은 실제이며, 많은 가이드가 2.7도 오픈되어 있다고 가정하는 이유입니다.
두 번째 사실은 이렇습니다. 동일한 공식 채널 — GitHub 조직, Hugging Face 조직, Alibaba 자체 ModelScope — 어디에도 Wan 2.7 가중치는 등록되어 있지 않습니다. 현재 퍼스트파티 경로에서 확인되는 최신 오픈 웨이트 릴리스는 여전히 Wan 2.2 제품군입니다(A14B 텍스트-비디오 및 이미지-비디오 모델, 5B TI2V, 이후 출시된 S2V 및 Animate 변형). 해당 저장소의 공식 뉴스 로그도 2.7 항목이 나오기 훨씬 전에 멈춰 있습니다.
따라서 어떤 페이지에서 Wan 2.7이 "Apache 2.0 라이선스의 오픈 웨이트"라고 한다면, 실제 퍼스트파티 가중치 저장소로 연결되는지 확인해야 합니다. 제가 추적한 모든 사례에서는 그런 연결이 없었습니다 — 해당 주장은 시리즈의 명성에 기대고 있었고, 널리 인용된 출처 중 하나 이상은 자체 페이지 간에도 서로 모순되었습니다. 제 판단으로는 Wan 2.7은 2.1과 2.2의 오픈 경로가 아니라, Alibaba가 Wan 2.5와 2.6에서 이미 취한 API 전용 경로를 따릅니다. 물론 이는 확정된 사실이 아니라 판단으로 봐야 합니다 — Alibaba가 다음 주에 가중치를 업로드한다면 바뀔 수 있습니다 — 하지만 오늘 확인 가능한 증거는 한 방향을 가리킵니다.
실제로는 명확한 선택이 가능합니다. 프로젝트에 가중치가 꼭 필요하다면 — 로컬 추론, 파인튜닝, 인프라 밖으로 내보낼 수 없는 데이터 등 — Wan 2.7은 현재 그 요구를 충족하지 못하며, 실제 오픈 옵션은 여전히 Wan 2.2입니다. API를 사용할 수 있다면 2.5, 2.6, 2.7은 모두 그런 방식으로 이용할 수 있습니다. 존재하지 않는 다운로드를 기대하며 2.7을 선택하지 마세요.
실제로 어떤 Wan을 사용해야 할까?
"최신"을 "나에게 가장 적합한 것"으로 여기지 않으면 제품군은 명확하게 나뉩니다.
| 버전 | 접근 방식 | 해상도 / 길이 | 주요 특징 | 이럴 때 선택 |
|---|---|---|---|---|
| Wan 2.2 | 오픈 웨이트(Apache 2.0) | 720p, 약 5초 | MoE, 4090에서 실행 가능 | 직접 호스팅하거나 파인튜닝해야 할 때 |
| Wan 2.5 | API 전용 | 1080p, 약 10초 | 네이티브 오디오 | 직접 호스팅 없이 오디오를 원할 때 |
| Wan 2.6 | API 전용 | 1080p, 최대 15초 | 멀티샷, 캐릭터 정체성 | 더 길고 여러 장면으로 구성된 클립이 필요할 때 |
| Wan 2.7 | API 전용 | 720p/1080p, 2–15초 | Thinking Mode, 첫/마지막 프레임, 이미지+비디오 | API를 통한 계획 및 참조 제어가 필요할 때 |
Wan 2.7은 Wan이 아닌 모델과 비교했을 때 어느 위치에 있을까요? 오픈 소스 비디오에서 Wan 제품군은 2.1 이후 기준점 역할을 해왔으며, 그 계보가 실질적인 강점입니다. 폐쇄형 API 모델 가운데 2.7의 차별점은 다른 최신 API 모델보다 검증된 품질 우위가 아니라 Thinking Mode와 이미지 및 비디오를 공유하는 스택입니다. 중립 벤치마크가 아직 어느 쪽도 뒷받침하지 못하기 때문에 여기서 Wan 2.7과 Seedance 또는 Kling을 비교하는 표에 수치를 넣지 않겠습니다. 근거 없는 수치를 만들어내고 싶지 않습니다. 실제 일대일 비교를 원한다면 설명 글의 한 줄짜리 행이 아니라 별도로 테스트한 비교가 필요합니다.
오늘 API로 Wan 모델을 사용하는 방법
솔직히 말하면, 이 글을 GPT Proto에서 읽고 있다면 2.7 자체는 카탈로그에 없다는 점을 알아두세요 — 동일한 프로필(1080p, 멀티샷, 네이티브 오디오)을 가진 가장 가까운 호스팅 제품은 Wan 2.6이며, 실행당 $0.45입니다. 실제로 실행되는 요청 예시는 다음과 같습니다.
붙여넣기 전에 알아둘 만한 몇 가지 주의점이 있습니다. 이 때문에 많은 사람이 시간을 낭비했습니다. 첫째, 인증에는 Bearer 토큰을 사용합니다 — Wan 엔드포인트는 /api/v3/alibaba/ 경로에 있으며, 일반 키가 아니라 Authorization: Bearer $KEY를 요구합니다. 둘째, 웹사이트 URL에서는 모델이 /qwen/ 아래에 등록되어 있지만 API 경로에서는 alibaba를 사용합니다 — 세그먼트는 다르지만 같은 모델입니다. 셋째, 비동기 호출을 두 단계로 진행합니다. POST로 제출해 ID를 받은 다음 GET으로 결과 엔드포인트를 폴링합니다. 넷째, 모델마다 매개변수가 다릅니다 — 2.6은 audio와 shot_type을 받지만, 2.2 이상 및 2.5는 enable_prompt_expansion을 사용하며 해당 매개변수를 사용하지 않습니다.
# 1. 작업 제출
curl --request POST "https://gptproto.com/api/v3/alibaba/wan-2.6/text-to-video" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"prompt": "밝은 출구를 향해 축축한 돌 터널을 미끄러지듯 통과하는 1인칭 시점. [0-3초] 빠르게 앞으로 이동하며 끝의 빛이 점점 커진다. [3-5초] 햇빛이 비치는 숲으로 나가고 오른쪽에 폭포가 있다. 사운드: 거친 숨소리, 이어서 새소리.",
"negative_prompt": "",
"size": "1920*1080",
"duration": 5,
"prompt_extend": true,
"audio": "",
"shot_type": "",
"seed": 1
}'
# -> prediction id 반환
# 2. 결과 폴링
curl --request GET "https://gptproto.com/api/v3/predictions/$RESULT_ID/result" \
--header "Authorization: Bearer $GPTPROTO_API_KEY"
폴링 루프를 풀어 작성한 Python의 동일한 흐름은 다음과 같습니다:
import os, time, requests
KEY = os.environ["GPTPROTO_API_KEY"]
HEADERS = {"Authorization": f"Bearer {KEY}", "Content-Type": "application/json"}
BASE = "https://gptproto.com/api/v3"
payload = {
"prompt": (
"밝은 출구를 향해 축축한 돌 터널을 미끄러지듯 통과하는 1인칭 시점. "
"[0-3초] 빠르게 앞으로 이동하며 끝의 빛이 점점 커진다. "
"[3-5초] 햇빛이 비치는 숲으로 나가고 오른쪽에 폭포가 있다. "
"사운드: 거친 숨소리, 이어서 새소리."
),
"negative_prompt": "",
"size": "1920*1080",
"duration": 5,
"prompt_extend": True,
"audio": "",
"shot_type": "",
"seed": 1,
}
submit = requests.post(f"{BASE}/alibaba/wan-2.6/text-to-video",
headers=HEADERS, json=payload).json()
result_id = submit["id"]
while True:
r = requests.get(f"{BASE}/predictions/{result_id}/result", headers=HEADERS).json()
if r.get("status") in ("succeeded", "failed"):
print(r)
break
time.sleep(5)
과금은 클립당 고정 요금이 아니라 구성에 따라 달라집니다 — 해상도, 길이, 오디오가 모두 금액에 영향을 미치므로 1080p/10초 미리보기 요금이 $0.45 기본 요금보다 높습니다. 각 호스팅 Wan 모델은 자체 모델 페이지에 현재 요금을 표시하며, 모두 나머지 카탈로그와 하나의 잔액을 공유합니다. 따라서 2.5와 2.6을 테스트하기 위해 별도 계정을 관리할 필요가 없습니다.
Thinking Mode를 위한 프롬프트 작성
2.7은 렌더링 전에 계획을 세우므로 가장 효과적인 프롬프트는 키워드를 나열하기보다 기획서에 가깝게 작성하는 편이 좋습니다. 의도와 구조를 제시하세요. 타임스탬프가 포함된 비트 시트 — [0-3초] … [3-5초] … —는 계획 단계가 구성할 구체적인 기준을 제공하며, 위의 작동 코드에서도 같은 패턴을 사용합니다. 오디오도 같은 프롬프트의 일부입니다. 짧은 Sound: 지시("거친 숨소리, 이어서 새소리")가 별도 호출 없이 네이티브 오디오 트랙을 생성합니다. 또한 negative_prompt를 사용해 예상되는 실패를 제한하세요 — 비워두는 대신 "빛나는 식물 없음, 일그러진 손 없음"처럼 작성하면 됩니다. 특별한 기법은 아닙니다. 생성 전에 전체 기획서를 읽는 모델에 맞춰 작성하는 것뿐입니다.
누가 사용해야 하고, 누가 사용하지 말아야 하는가
오픈 웨이트가 필요하다면 — 자체 호스팅, 파인튜닝, 외부로 반출할 수 없는 데이터 등 — Wan 2.7은 오늘날 잘못된 선택이며 Wan 2.2가 적합합니다. API를 통해 제어 가능한 이미지 및 비디오 생성을 원하고 폐쇄형 모델과 느린 렌더링을 감수할 수 있다면, 2.7은 합리적인 선택입니다. 다만 품질 우위는 아직 측정된 결과가 아니라 Alibaba의 주장이라는 점을 솔직히 인정해야 합니다. 예산을 아끼며 프로토타입을 제작 중이라면, 더 저렴한 호스팅 Wan 요금제로 실행당 몇 센트에 시작한 뒤 본격적으로 투자할 수 있습니다. 버전 번호가 아니라 제약 조건에 맞춰 모델을 선택하세요.
자주 묻는 질문
Wan 2.7은 오픈 소스인가요?
Wan 2.7은 언제 출시되었나요?
Wan 2.7은 이미지 모델인가요, 비디오 모델인가요?
Wan 2.7과 Wan 2.2의 차이점은 무엇인가요?
Wan 2.7은 다른 비디오 모델보다 뛰어난가요?
Wan 2.7을 로컬에서 실행할 수 있나요?
API로 사용하면 비용이 얼마인가요?
관련 글
블로그 더 보기
wan.2.2: 생성형 비디오의 표준
TL;DR The wan.2.2 model prioritizes visual integrity and strict prompt adherence over raw generation speed. It requires substantial hardware but rewards creators with reliable, artifact-free AI video output. Generative video models often prioritize speed at the expense of visual coherence. You type a detailed scene description, wait a few minutes, and receive a clip filled with warped faces and unnatural motion. The creators behind wan.2.2 took a different approach. They built a system that respects the aesthetic details of your source material and carefully calculates motion vectors to prevent pixel drift. Running this architecture natively requires serious computing power. You will need a top-tier GPU to process the parameters efficiently, which is why many professionals offload the heavy lifting to robust APIs. By stepping away from local hardware limits, you can integrate tools like ComfyUI, SVI Pro, and PainterI2V to force the model to behave exactly how you envision. Achieving cinematic results means looking past the initial five-second output constraint. Chaining clips together and utilizing native frame interpolation allows you to construct cohesive, high-resolution sequences that actually match your initial text prompts.
Schuyler Stacy | 2026-03-02

Wan 2.5: 4K AI 영상 생성의 미래
비디오 제작에 거대한 지각변동이 일어나고 있으며, 그 중심에 Wan 2.5 가 있습니다. 고품질 시각 콘텐츠에 대한 수요가 급증하면서 크리에이터들은 할리우드급 예산 없이도 영화 같은 결과물을 제공할 도구를 필요로 합니다. Wan 2.5 는 고급 AI를 활용해 텍스트와 이미지를 놀라운 4K 비디오 시퀀스로 변환함으로써 이 요구에 부응합니다. 이 모델은 이전 세대의 한계를 극복하도록 개발되었으며, 사실적인 모션, 확장된 클립 길이, 그리고 이중 모드 유연성을 제공합니다. 이 종합 리뷰에서 우리는 Wan 2.5 가 AI 비디오 생성의 지형을 어떻게 재정의하고 있는지 깊이 있게 살펴봅니다.
Michael Johnson | 2026-03-02

WAN 2.5 가이드: 최신 AI 비디오 모델과 그 기능에 대한 심층 분석
TL;DR : WAN 2.5는 AI 비디오 환경의 중요한 전환점을 나타내며, 프로페셔널급 1080p 기능과 Sora 같은 주요 경쟁사에 도전하는 합리적인 가격대를 겸비하고 있습니다. WAN 2.5의 등장은 오픈소스 개발과 클로즈드소스 확장의 미래에 관한 중요한 논쟁을 촉발했습니다. 오픈 웨이트에서의 전환에 실망한 개발자들도 있지만, 이 모델은 일관된 모션과 고충실도 비디오 합성을 찾는 크리에이터에게 여전히 강력한 도구입니다. 기술적으로 WAN 2.5는 오디오와 비주얼 간의 인상적인 동기화와 함께 감독에게 더 많은 제어권을 주는 고급 키프레임 지원을 제공합니다. 이러한 기능을 비용 효율적인 워크플로에 통합함으로써, 현대 마케팅 및 게임 산업을 위한 실용적인 솔루션으로 자리매김하고 있습니다.
Tiffany Layne | 2026-03-17

Wan Video: 오픈소스 생성 마스터하기
TL;DR The generative artificial intelligence market usually forces creators into expensive, proprietary subscriptions to access top-tier features. Alibaba's wan video breaks that cycle by offering an open-source model capable of rendering highly fluid text-to-video and image-to-video sequences. You no longer have to guess what happens inside the algorithmic black box. Because the weights are publicly available, developers and digital artists can run the software on consumer-grade graphics cards or scale it through robust API pipelines. This level of access drastically lowers the barrier to entry for cinematic storytelling. Getting good results still requires technical intent. Success depends heavily on how you structure your prompts, describe camera movements, and manage hardware constraints to maintain temporal consistency across every frame.
Schuyler Stacy | 2026-03-17
