Pesquise por "wan 2.7" e você encontrará duas respostas que não podem ser verdadeiras ao mesmo tempo. Um conjunto de guias diz para baixar os pesos e executá-lo na sua própria GPU. Outro afirma que só é possível acessá-lo por meio de uma API. Fui investigar qual deles está certo, porque a resposta determina se você pode hospedar esse modelo por conta própria — e a versão curta é que a maioria das publicações confiantes de que "é open source" está repetindo um hábito, não um fato. Veja o que o Wan 2.7 realmente é, o que a Alibaba disponibilizou e o que não disponibilizou, e como colocar um modelo Wan em produção hoje.
O que é o Wan 2.7? Guia do modelo de modo de raciocínio da Alibaba (2026)
A maioria dos guias diz que o Wan 2.7 é open source. As evidências oficiais mostram o contrário. O que o modelo de abril de 2026 da Alibaba realmente oferece — e como executá-lo.

O que o Wan 2.7 realmente é
O Wan 2.7 não é um único modelo. É uma onda de lançamentos do Tongyi Lab, da Alibaba, que chegou no início de abril de 2026 e abrange duas mídias ao mesmo tempo. Há um lado de imagens — Wan2.7-Image e um Wan2.7-Image Pro separado, que os materiais de lançamento datam de aproximadamente 1º de abril — e um lado de vídeos: uma suíte de quatro modelos que cobre texto para vídeo, imagem para vídeo, referência para vídeo e edição de vídeo baseada em instruções, lançada nos dias seguintes. Esse escopo duplo é exatamente o motivo pelo qual a SERP discorda sobre o Wan 2.7 ser um "modelo de imagem" ou um "modelo de vídeo". Ele é ambos, lançados juntos sob um único número de versão.
O próprio nome merece ser esclarecido, porque confunde as pessoas. "Wan" é a abreviação internacional de Tongyi Wanxiang (通义万相), a linha de IA criativa da Alibaba. Ela fica ao lado dos modelos de linguagem Qwen sob o mesmo grupo corporativo, mas é uma família de produtos diferente. Portanto, quando uma plataforma de hospedagem coloca o Wan em um caminho qwen, isso é uma escolha de catalogação, não uma afirmação de que o Wan é um modelo Qwen.
Versão em uma linha: o Wan 2.7 é a onda de geração de imagens e vídeos da Alibaba de abril de 2026, cujo destaque é um recurso chamado Modo de raciocínio.
Como funciona o Modo de raciocínio
Antes do mecanismo, o motivo pelo qual ele existe. Um modelo de vídeo padrão transforma seu prompt diretamente em quadros. Não há uma pausa para raciocinar sobre o que você pediu — ele lê o texto, escolhe um caminho pelo espaço latente e decodifica. Isso funciona bem para uma única tomada simples. Mas fica frágil assim que você pede algo com estrutura: uma sequência com várias tomadas, um personagem que precisa ter a mesma aparência na terceira tomada e na primeira, ou um movimento de câmera que precisa terminar em um momento específico. O modelo se apressa para cumprir o briefing, e as emendas ficam visíveis.
O Modo de raciocínio, conforme descrito pela Alibaba, insere uma etapa de planejamento antes da geração. Primeiro, o modelo cria um plano composicional — como interpretar a intenção do prompt, como os elementos se relacionam no espaço e no tempo e qual deve ser a lógica da tomada — e só então gera o conteúdo. A promessa é de menos artefatos e melhor coerência ao longo de uma sequência.
Eu trataria o tamanho desse ganho como uma questão em aberto, e não como um número definido; voltarei ao motivo daqui a pouco. Mas a ideia de design é sólida e é a única novidade realmente genuína aqui. Conclusão: o Modo de raciocínio troca um pouco de velocidade por uma etapa de planejamento, algo mais importante quando seu prompt tem mais de um elemento em movimento.
Principais recursos — e quanto confiar em cada número
É aqui que a camada de confiança importa, porque a lista de recursos do Wan 2.7 vem quase inteiramente das próprias notas de lançamento da Alibaba, e números fornecidos por um fornecedor merecem ser identificados como tal.
A Alibaba relata o seguinte: consistência de personagens suficiente para manter um rosto ao longo de um clipe (sua solução para o problema do "mesmo rosto de IA"), controle preciso de cores que aceita valores HEX e paletas, renderização de textos longos com mais de 3.000 tokens em 12 idiomas, incluindo tabelas e fórmulas desenhadas nos quadros, controle narrativo de várias tomadas, orientação pelo primeiro e pelo último quadro, referência para vídeo com suporte a até nove imagens de referência e áudio nativo gerado na mesma etapa. Essas são alegações do fornecedor, apresentadas como alegações do fornecedor. Não consegui verificá-las em um teste neutro.
Quanto às especificações técnicas, o cenário é mais nebuloso do que a maioria das publicações admite. A resolução de saída é indicada como 720p ou 1080p, dependendo de onde você o executa; a duração dos clipes fica em algum ponto entre 2 e 15 segundos; e o modelo de imagem é a parte que traz a especificação de 4K. Esses valores variam conforme o provedor, então trate qualquer número isolado que encontrar como "verdadeiro naquela plataforma", e não como "verdadeiro para o modelo". A geração também não é instantânea — os primeiros relatos práticos a descrevem como significativamente mais lenta que modelos de vídeo mais leves, um custo silencioso da etapa de planejamento que deve ser considerado se você estiver renderizando em volume.
E há a lacuna honesta: até o momento da redação, não encontrei o Wan 2.7 em nenhum ranking neutro — não há entrada no Artificial Analysis Video Arena nem pontuação VBench publicada para esta versão. Isso não significa que ele seja ruim. Significa que as alegações de qualidade continuam sendo relatadas pelo fornecedor, ponto final. O ponto de referência verificável mais próximo é a linhagem: o Wan 2.1 liderou o VBench em seu lançamento, em fevereiro de 2025, um resultado real de um modelo anterior, não um substituto para o 2.7.
| Tipo de alegação | Exemplos | Quanto confiar |
|---|---|---|
| Verificável agora | 2.1/2.2 têm pesos abertos; o 2.1 liderou o VBench no lançamento | Confirmado nos repositórios oficiais e no benchmark |
| Relatado pelo fornecedor | Ganhos do Modo de raciocínio, especificações de cor/texto/consistência | Palavra da Alibaba; ainda não há teste neutro |
| Varia conforme o provedor | 720p/1080p, 2–15s, 4K (imagem) | Depende da plataforma, não é uma especificação fixa do modelo |
O Wan 2.7 é open source?
Resposta curta: não da forma como a série Wan treinou todos a esperar.
Aqui está o fato. O Wan 2.1 (fevereiro de 2025) e o Wan 2.2 (julho de 2025) foram lançados com pesos abertos sob a licença Apache 2.0 — baixáveis, auto-hospedáveis e ajustáveis, sem restrições comerciais. Você pode confirmar isso por conta própria na organização Wan-AI no Hugging Face e na organização Wan-Video no GitHub. Esse histórico de pesos abertos é real e é o motivo pelo qual tantos guias presumem que o 2.7 também seja aberto.
Aqui está o segundo fato. Esses mesmos canais oficiais — a organização no GitHub, a organização no Hugging Face e o ModelScope da Alibaba — não listam os pesos do Wan 2.7. Até o momento da redação, o lançamento mais recente de pesos abertos no rastro oficial continua sendo a família Wan 2.2 (os modelos A14B de texto para vídeo e imagem para vídeo, o 5B TI2V, além das variantes S2V e Animate posteriores). O registro oficial de notícias desse repositório termina bem antes de qualquer entrada do 2.7.
Portanto, quando uma página disser que o Wan 2.7 tem "pesos abertos sob a Apache 2.0", verifique se ela aponta para um repositório de pesos oficial real. Em todos os casos que rastreei, não apontava — a alegação se apoiava na reputação da série, e pelo menos uma fonte amplamente citada se contradizia em suas próprias páginas. Minha leitura é que o Wan 2.7 segue o caminho somente por API que a Alibaba já adotou com o Wan 2.5 e o 2.6, e não o caminho aberto do 2.1 e do 2.2. Eu trataria isso como uma avaliação, não como verdade absoluta — se a Alibaba enviar os pesos na próxima semana, isso mudará — mas hoje as evidências verificáveis apontam em uma direção.
Na prática, isso leva a uma decisão clara. Se o seu projeto realmente precisa dos pesos — inferência local, ajuste fino ou dados que não podem sair da sua infraestrutura — o Wan 2.7 não oferece isso hoje, e sua opção aberta real continua sendo o Wan 2.2. Se você pode trabalhar por meio de uma API, o 2.5, o 2.6 e o 2.7 estão disponíveis dessa forma. Não escolha o 2.7 esperando um download que não existe.
Qual Wan você deve usar?
A família se divide claramente quando você deixa de tratar "mais recente" como "melhor para você".
| Versão | Acesso | Resolução / duração | Destaque | Escolha quando |
|---|---|---|---|---|
| Pesos abertos (Apache 2.0) | 720p, ~5s | MoE, executa em uma 4090 | Você precisa hospedar ou ajustar o modelo por conta própria | |
| Somente API | 1080p, ~10s | Áudio nativo | Você quer áudio sem hospedar o modelo por conta própria | |
| Somente API | 1080p, até 15s | Várias tomadas, identidade do personagem | Você precisa de clipes mais longos e com várias tomadas | |
| Wan 2.7 | Somente API | 720p/1080p, 2–15s | Modo de raciocínio, primeiro/último quadro, imagem+vídeo | Você quer planejamento + controle por referência via API |
Como o Wan 2.7 se compara a modelos que não são da família Wan? No vídeo open source, a linha Wan tem sido o ponto de referência desde o 2.1 — essa linhagem é sua verdadeira reivindicação. Entre os modelos fechados acessíveis por API, o diferencial do 2.7 é o Modo de raciocínio combinado com a pilha compartilhada de imagem e vídeo, e não uma liderança de qualidade comprovada sobre os demais players atuais de API. Deliberadamente não incluo números em uma tabela de comparação entre o Wan 2.7 e o Seedance ou o Kling, porque ainda não existe um benchmark neutro que sustente isso e não vou inventar um. Se você quiser uma comparação direta real, ela merece seu próprio teste, em vez de uma linha descartável em um texto explicativo.
Como usar um modelo Wan por API hoje
Falando diretamente: se você está lendo isto no GPT Proto, observe que o 2.7 em si não está no catálogo — o irmão hospedado mais próximo, com o mesmo perfil (1080p, várias tomadas, áudio nativo), é o Wan 2.6, por US$ 0,45 por execução. Veja abaixo uma solicitação que realmente funciona com ele.
Há algumas armadilhas que vale destacar antes de colar qualquer coisa, porque elas já fizeram pessoas perderem tempo. Primeiro, a autenticação usa um token Bearer — esses endpoints Wan ficam no caminho /api/v3/alibaba/ e esperam Authorization: Bearer $KEY, não uma chave simples. Segundo, o URL do site registra o modelo em /qwen/, mas o caminho da API usa alibaba — segmentos diferentes, mesmo modelo. Terceiro, é uma chamada assíncrona em duas etapas: você faz um POST para enviar a solicitação e recebe um ID; depois faz GET no endpoint de resultados para consultar o status. Quarto, os parâmetros variam entre os modelos — o 2.6 aceita audio e shot_type, enquanto o 2.2-plus e o 2.5 usam enable_prompt_expansion e não aceitam esses parâmetros.
# 1. Enviar o trabalho
curl --request POST "https://gptproto.com/api/v3/alibaba/wan-2.6/text-to-video" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"prompt": "Uma tomada em primeira pessoa deslizando por um túnel de pedra úmido em direção a uma saída brilhante. [0-3s] movimento rápido para a frente, com a luz no fim aumentando. [3-5s] sair em uma floresta ensolarada, com uma cachoeira à direita. Som: respiração pesada, seguida de canto de pássaros.",
"negative_prompt": "",
"size": "1920*1080",
"duration": 5,
"prompt_extend": true,
"audio": "",
"shot_type": "",
"seed": 1
}'
# -> retorna um ID de previsão
# 2. Consultar o resultado
curl --request GET "https://gptproto.com/api/v3/predictions/$RESULT_ID/result" \
--header "Authorization: Bearer $GPTPROTO_API_KEY"
O mesmo fluxo em Python, com o loop de consulta escrito por extenso:
import os, time, requests
KEY = os.environ["GPTPROTO_API_KEY"]
HEADERS = {"Authorization": f"Bearer {KEY}", "Content-Type": "application/json"}
BASE = "https://gptproto.com/api/v3"
payload = {
"prompt": (
"Uma tomada em primeira pessoa deslizando por um túnel de pedra úmido em direção a uma saída brilhante. "
"[0-3s] movimento rápido para a frente, com a luz no fim aumentando. "
"[3-5s] sair em uma floresta ensolarada, com uma cachoeira à direita. "
"Som: respiração pesada, seguida de canto de pássaros."
),
"negative_prompt": "",
"size": "1920*1080",
"duration": 5,
"prompt_extend": True,
"audio": "",
"shot_type": "",
"seed": 1,
}
submit = requests.post(f"{BASE}/alibaba/wan-2.6/text-to-video",
headers=HEADERS, json=payload).json()
result_id = submit["id"]
while True:
r = requests.get(f"{BASE}/predictions/{result_id}/result", headers=HEADERS).json()
if r.get("status") in ("succeeded", "failed"):
print(r)
break
time.sleep(5)
A cobrança aumenta conforme a configuração, e não segue uma tarifa fixa por clipe — resolução, duração e áudio alteram o valor, motivo pelo qual a prévia em 1080p/10s custa mais que a base de US$ 0,45. Cada modelo Wan hospedado mostra sua tarifa atual na própria página do modelo, e todos compartilham um único saldo com o restante do catálogo, para que você não precise gerenciar contas separadas ao testar o 2.5 em comparação com o 2.6.
Como criar prompts para o Modo de raciocínio
Como o 2.7 planeja antes de renderizar, os prompts que funcionam melhor se parecem menos com uma pilha de palavras-chave e mais com um briefing. Dê a ele intenção e estrutura. Um roteiro de cenas com marcação de tempo — [0-3s] … [3-5s] … — fornece à etapa de planejamento algo concreto para organizar, seguindo o mesmo padrão usado no código funcional acima. O áudio faz parte do mesmo prompt: uma breve indicação Sound: ("respiração pesada, seguida de canto de pássaros") orienta a faixa de áudio nativa, sem precisar de uma chamada separada. Use também negative_prompt para evitar a falha que você realmente espera — "sem plantas brilhantes, sem mãos deformadas" — em vez de deixá-lo em branco. Nada disso é exótico; é apenas escrever para um modelo que lê todo o briefing antes de começar.
Quem deve usá-lo — e quem não deve
Se você precisa de pesos abertos — hospedagem própria, ajuste fino ou dados que permaneçam dentro da sua infraestrutura — o Wan 2.7 é a escolha errada hoje, e o Wan 2.2 é a escolha certa. Se você quer geração controlável de imagens e vídeos por meio de uma API e consegue conviver com um modelo fechado e uma renderização mais lenta, o 2.7 é uma opção razoável, com a ressalva honesta de que sua liderança em qualidade é, até agora, uma alegação da Alibaba, não algo medido. E, se você estiver criando um protótipo com orçamento limitado, os níveis hospedados mais baratos do Wan permitirão começar por alguns centavos por execução antes de assumir um compromisso. Escolha o modelo de acordo com a restrição, não com o número da versão.
Perguntas frequentes
O Wan 2.7 é open source?
Quando o Wan 2.7 foi lançado?
O Wan 2.7 é um modelo de imagem ou de vídeo?
Wan 2.7 vs Wan 2.2 — qual é a diferença?
O Wan 2.7 é melhor que outros modelos de vídeo?
Posso executar o Wan 2.7 localmente?
Quanto custa usá-lo por API?
Artigos relacionados
Mais blogs
wan.2.2: O padrão para vídeo generativo
TL;DR O modelo wan.2.2 prioriza a integridade visual e a adesão rigorosa aos prompts em vez da velocidade bruta de geração. Ele exige hardware robusto, mas recompensa os criadores com resultados de vídeo gerados por IA confiáveis e livres de artefatos. Os modelos de vídeo generativo frequentemente priorizam a velocidade em detrimento da coerência visual. Você digita uma descrição detalhada da cena, espera alguns minutos e recebe um clipe cheio de rostos deformados e movimentos pouco naturais. Os criadores do wan.2.2 seguiram uma abordagem diferente. Eles desenvolveram um sistema que respeita os detalhes estéticos do seu material de origem e calcula cuidadosamente os vetores de movimento para evitar o deslocamento dos pixels. Executar essa arquitetura nativamente exige um poder computacional significativo. Você precisará de uma GPU de alto nível para processar os parâmetros com eficiência, por isso muitos profissionais transferem essa tarefa para APIs robustas. Ao deixar de lado as limitações do hardware local, você pode integrar ferramentas como ComfyUI, SVI Pro e PainterI2V para fazer o modelo se comportar exatamente como você imagina. Alcançar resultados cinematográficos significa ir além da limitação inicial de cinco segundos de saída. Encadeando clipes e utilizando a interpolação de quadros nativa, você pode construir sequências coesas e de alta resolução que realmente correspondem aos seus prompts de texto iniciais.
Schuyler Stacy | 2026-03-02

Wan 2.5: O Futuro da Geração de Vídeo 4K com IA
Video production is undergoing a seismic shift, and Wan 2.5 is at the epicenter of this transformation. As the demand for high-quality visual content skyrockets, creators need tools that deliver cinematic results without Hollywood budgets. Wan 2.5 answers this call by utilizing advanced AI to convert text and images into stunning 4K video sequences. Developed to overcome the limitations of previous generations, this model offers realistic motion, extended clip durations, and dual-mode flexibility. In this comprehensive review, we dive deep into how Wan 2.5 is redefining the landscape of AI video generation.
Michael Johnson | 2026-03-02

Guia do WAN 2.5: Análise aprofundada do mais novo modelo de vídeo com IA e seus recursos
TL;DR : o WAN 2.5 representa um grande ponto de virada no cenário de vídeos com IA, equilibrando recursos profissionais em 1080p com um preço acessível que desafia grandes concorrentes como o Sora. O surgimento do WAN 2.5 gerou um debate significativo sobre o futuro do desenvolvimento de código aberto versus a escala de código fechado. Embora o afastamento dos pesos abertos tenha frustrado alguns desenvolvedores, o modelo continua sendo uma ferramenta poderosa para criadores que buscam movimento consistente e síntese de vídeo de alta fidelidade. Tecnicamente, o WAN 2.5 oferece uma sincronização impressionante entre áudio e visual, além de suporte avançado a quadros-chave que dá mais controle aos diretores. Ao integrar esses recursos a um fluxo de trabalho econômico, ele se posiciona como uma solução prática para as indústrias modernas de marketing e de jogos.
Tiffany Layne | 2026-03-17

Wan Video: Dominando a Geração de Código Aberto
Resumo O mercado de inteligência artificial generativa geralmente obriga os criadores a contratar assinaturas proprietárias caras para ter acesso a recursos de alto nível. O wan video da Alibaba rompe esse ciclo ao oferecer um modelo de código aberto capaz de renderizar sequências extremamente fluidas de texto para vídeo e imagem para vídeo. Você não precisa mais tentar adivinhar o que acontece dentro da caixa-preta algorítmica. Como os pesos estão disponíveis publicamente, desenvolvedores e artistas digitais podem executar o software em placas gráficas comuns ou expandi-lo por meio de pipelines de API robustos. Esse nível de acesso reduz drasticamente a barreira de entrada para a criação de narrativas cinematográficas. Obter bons resultados ainda exige intenção técnica. O sucesso depende muito de como você estrutura seus prompts, descreve os movimentos da câmera e gerencia as limitações de hardware para manter a consistência temporal em todos os quadros.
Schuyler Stacy | 2026-03-17
