Wan 2.6
curl --request POST "https://gptproto.com/api/v3/alibaba/wan-2.6/text-to-video" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"prompt": "A tiny origami fox sailing a teacup across a moonlit puddle",
"negative_prompt": "",
"size": "1920*1080",
"duration": 5,
"prompt_extend": true,
"audio": "",
"shot_type": "",
"seed": 1
}'Comece pelo custo de uma única amostra e escolha um orçamento de teste. As tarifas da GPTProto são 10% abaixo do preço de tabela.
| Cenário | Lista de Qwen | OpenRouter | GPTProto | Economia / mês |
|---|---|---|---|---|
| Anúncios curtos de produto30 × 5s / mês | $22.50 | $23.74 | $20.25 | −$2.25≈ $27.00 / ano |
| Clipes sociais60 × 5s / mês | $45.00 | $47.47 | $40.50 | −$4.50≈ $54.00 / ano |
| Geração em massa100 × 5s / mês | $75.00 | $79.13 | $67.50 | −$7.50≈ $90.00 / ano |
O que é o Wan 2.6?
O Wan 2.6 é o modelo multimodal de geração de vídeo da Alibaba (equipe Tongyi / Wan), lançado em dezembro de 2025. Ele transforma um prompt de texto — ou imagens, um vídeo de referência e áudio — em um clipe de até 15 segundos, com resolução de até 1080p (24fps), e áudio gerado na mesma passada: diálogo com sincronia labial, efeitos sonoros e música.
Em relação ao Wan 2.5, ele adiciona três recursos que importam para a produção real. Planejamento de narrativa multi-shot: um único prompt pode definir vários cortes (aberto → close-up → reação) e o modelo os sequencia, em vez de você gerar e unir clipes separados. Geração com base em referência: forneça imagens de referência ou um vídeo de referência e o modelo mantém a identidade e a aparência de um personagem entre os planos. Maior fidelidade de movimento: movimento mais suave e estável ao longo dos 15s de duração. Ele aceita entradas de texto, imagem, vídeo de referência e áudio em um único fluxo de trabalho.
O Wan 2.6 é um modelo somente via API — os pesos não estão disponíveis para download público. Wan 2.1 e 2.2 são as versões de pesos abertos (Apache-2.0); 2.5 e 2.6 são somente via API. No GPTProto, você o chama com a string de modelo wan-2.6, cobrada por execução conforme resolução e duração.
| Especificação | Valor |
|---|---|
| Provedor | Alibaba (Tongyi / Wan) · lançado em dez. de 2025 |
| Modalidades | Texto para vídeo (nesta página); também imagem para vídeo, referência para vídeo |
| Entradas | Texto, imagem, vídeo de referência, áudio |
| Áudio | Sincronizado nativamente — voz + sincronia labial + efeitos sonoros + música, em uma única passada |
| Multi-shot | Sim — planejamento multi-shot + retenção de identidade |
| Resolução | até 1080p (24fps); paisagem / retrato / quadrado |
| Duração | 5 / 10 / 15s |
| Pesos | Somente via API (sem código aberto) |
| String do modelo | wan-2.6 |
| Endpoint | https://gptproto.com/api/v3/alibaba/wan-2.6/text-to-video |
Como funcionam o multi-shot e o áudio sincronizado
Duas capacidades definem o Wan 2.6, e ambas mudam a forma como você cria prompts.
Áudio sincronizado em uma única passada. A etapa de geração produz frames e uma trilha de áudio correspondente juntos, de modo que a fala se ajusta aos movimentos labiais corretos e o som ambiente e a música ficam sob o corte sem edição separada. Descreva o som no prompt com uma dica Sound:, ou envie sua própria trilha pelo parâmetro audio e o modelo sincroniza o movimento com ela.
Multi-shot em uma única execução. Em vez de renderizar um plano contínuo, o Wan 2.6 pode sequenciar vários momentos dentro de um único clipe. Divida o prompt por tempo ([0-5s] … [5-10s] … [10-15s] …) e o modelo trata cada trecho como um plano, mantendo personagens e cenário entre os cortes. O parâmetro shot_type controla se você obtém um único plano contínuo ou uma composição multi-shot. Para coerência, clipes de 8–12s tendem a ser os mais estáveis; 15s está disponível quando você precisa de mais duração.
Escolhendo dentro da família Wan
A GPTProto disponibiliza os modelos Wan em um único saldo. Escolha de acordo com a tarefa:
- Wan 2.6 — texto para vídeo (nesta página): 1080p, até 15s, multi-shot, áudio nativo. Use para narrativas mais longas ou com vários cortes a partir de um prompt.
- Wan 2.6 — imagem para vídeo / referência para vídeo: anime uma imagem estática ou oriente uma cena com um clipe de referência / até várias imagens de referência para identidade.
- Wan 2.5 (
wan-2.5): 1080p, até 10s, áudio nativo, single-shot — a opção diária mais barata, a partir de US$ 0,225/execução. - Wan 2.2 (
wan-2.2-plus): sem áudio, 720p, ~5s — mas com pesos abertos, a escolha quando você precisa hospedar por conta própria.
Os concorrentes listam esses modelos sem um mapa de seleção. Resumindo: 2.6 para duração + multi-shot + identidade, 2.5 para clipes single-shot mais baratos com áudio, 2.2 para pesos abertos.
Wan 2.6 vs Wan 2.5 vs Wan 2.2
| Wan 2.6 | Wan 2.5 | Wan 2.2 | |
|---|---|---|---|
| Áudio | Sincronizado nativamente | Sincronizado nativamente | Nenhum (somente vídeo) |
| Duração máxima | 15s | 10s | ~5s |
| Resolução | até 1080p | até 1080p | 720p |
| Multi-shot / referência | Sim | Não | Não |
| Pesos abertos | Não (somente API) | Não (somente API) | Sim (Apache 2.0) |
| Preço no GPTProto | US$ 0,45–US$ 2,025 / execução | US$ 0,225–US$ 1,35 / execução | US$ 0,09 / execução |
Análise honesta: O Wan 2.6 custa mais por execução, mas é o ideal quando você precisa de 15s, cenas multi-shot ou consistência de personagem entre cortes. O Wan 2.5 é a opção diária mais barata para clipes single-shot de até 10s com áudio. O Wan 2.2 só vale a pena se você precisar de pesos abertos para hospedar por conta própria.
Relacionados: Wan 2.5 → · Wan 2.2 → · Sora 2 →
O que você pode criar com a API do Wan 2.6
Curtas-metragens e anúncios multi-shot — Um único prompt define vários planos com personagens consistentes e áudio entre cortes — um anúncio narrativo de 15s sem emenda manual. Um teste com 20 variantes em 720p/5s ≈ US$ 9,00.
Vídeo localizado em escala — Prompts multilíngues e fala com sincronia labial transformam um storyboard em vários idiomas sem refilmagens. Ótimo suporte para chinês.
Qualquer proporção de tela, mesmo preço — Quadrado (960×960, 1440×1440), retrato (720×1280, 1080×1920) e paisagem têm o mesmo preço dentro de um nível, então o formato é uma escolha livre por plataforma.
Imagem / referência para vídeo — Anime uma imagem estática ou oriente uma cena com um clipe de referência nos endpoints relacionados.
Receitas de prompts para Wan 2.6
O Wan 2.6 gera áudio e pode planejar vários planos, então os prompts funcionam melhor quando descrevem planos, movimento e som juntos. O exemplo da própria plataforma segmenta o prompt por tempo — use isso para multi-shot. Estruture cada momento: plano + assunto + ação + câmera + iluminação + dica Sound:.
1. Narrativa multi-shot (15s + planejamento de planos)
[0-5s] Plano aberto: uma trilheira solitária chega a uma crista de montanha enevoada ao amanhecer, aproximação lenta.
[5-10s] Plano médio: ela ergue a câmera e sorri. Sound: vento, pássaros distantes.
[10-15s] Close-up: o sol surge sobre os picos, a luz preenche o quadro. Sound: um
crescendo suave de música ambiente, sem diálogo.
2. Diálogo + sincronia labial (single shot)
Close-up médio de uma barista atrás de um balcão de madeira, luz quente da manhã. Ela olha
para a câmera e diz: "O de sempre? Já está saindo." O vapor sobe da xícara. Sound:
fala, chiado da máquina de espresso, ambiente tranquilo de café.
3. Produto/promoção, formato quadrado
Formato quadrado. Um tênis gira lentamente sobre um pedestal fosco, a luz de estúdio varre
a superfície, reflexos sutis. Sound: um pulso grave de sintetizador, um whoosh suave na varredura,
sem fala.
Dicas de uso: para multi-shot, rotule cada momento com seu intervalo de tempo e mantenha o diálogo curto o suficiente para o momento; defina shot_type para single-shot ou multi-shot; 8–12s é o ponto ideal para coerência, 15s quando você precisa de mais duração; use negative_prompt para excluir artefatos (ex.: "sem texto, sem marca d'água"); prompt_extend: true permite que o modelo expanda um prompt curto — desative para controle exato; fixe seed para reproduzir um resultado.
Perguntas Frequentes
Perguntas comuns sobre o modelo wan-2.6/text-to-video
O que é wan-2.6/text-to-video?
O Wan 2.6 é de código aberto?
Wan 2.6 vs Wan 2.5 — o que mudou?
Wan 2.2 vs Wan 2.6?
Posso fazer image-to-video com o Wan 2.6?
O Wan 2.6 gera áudio?
Quanto custa o Wan 2.6?
O Wan 2.6 é sem censura / permite conteúdo NSFW?
Como faço para chamá-lo via API?
Como eu pago pelo wan-2.6/text-to-video no GPT Proto?
Artigos Relacionados
Guias, comparações e atualizações relacionadas a este modelo.
Todos os artigos
Wan 2.5: O Futuro da Geração de Vídeos 4K com IA
Descubra como o Wan 2.5 transforma imagens em vídeos cinematográficos 4K com IA. Conheça recursos, preços e opções de API do GPT Proto.

wan2.2-animate: Qualidade Acima de Velocidade em IA
Enquanto outros modelos apressam a saída, o wan2.2-animate foca na fidelidade visual cinematográfica e na aderência ao prompt. Aprenda como otimizar seu fluxo de trabalho de vídeo hoje.

Wan Video: Dominando a Geração de Código Aberto
O wan video da Alibaba é uma alternativa de código aberto para modelos de IA caros. Descubra como criar melhores prompts e animar suas ideias criativas hoje.

Wan 2.5: O Futuro da Geração de Vídeos 4K com IA
Descubra como o Wan 2.5 transforma imagens em vídeos cinematográficos 4K com IA. Conheça recursos, preços e opções de API do GPT Proto.