Entrada Multimodal, Um Modelo
Comece a partir de texto, um quadro inicial, quadros inicial e final, até 10 imagens de referência, cinco vídeos de referência, cinco clipes de áudio, um documento ou uma página da web pública.
curl --request POST "https://gptproto.com/api/v3/alibaba/wan-3.0/text-to-video" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"prompt": "A tiny origami fox sailing a teacup across a moonlit puddle",
"negative_prompt": "",
"resolution": "720P",
"ratio": "adaptive",
"duration": 5,
"generate_audio": true,
"audio": "",
"shot_type": "single",
"watermark": false,
"seed": 1
}'Comece pelo custo de uma única amostra e escolha um orçamento de teste. As tarifas da GPTProto são 10% abaixo do preço de tabela.
| Cenário | Lista de Qwen | OpenRouter | GPTProto | Economia / mês |
|---|---|---|---|---|
| Anúncios curtos de produto30 × 5s / mês | $30.00 | $31.65 | $27.00 | −$3.00≈ $36.00 / ano |
| Clipes sociais60 × 5s / mês | $60.00 | $63.30 | $54.00 | −$6.00≈ $72.00 / ano |
| Geração em massa100 × 5s / mês | $100.00 | $105.50 | $90.00 | −$10.00≈ $120.00 / ano |
Acesse a API Wan3.0 da Alibaba pelo GPTProto e use um único saldo de conta em Wan e outros modelos de vídeo. Crie fluxos de trabalho apenas com prompt, de primeiro quadro, de primeiro e último quadros, guiados por referência, de documento para vídeo e de página da web para vídeo sem manter uma conta separada de provedor para cada modelo no seu pipeline.
Entrada Multimodal, Um Modelo
Comece a partir de texto, um quadro inicial, quadros inicial e final, até 10 imagens de referência, cinco vídeos de referência, cinco clipes de áudio, um documento ou uma página da web pública.
Até 30 Segundos em 1080P
Gere vídeos de 2 a 30 segundos em 480P, 720P ou 1080P e 30 fps. Use duração inteligente quando o modelo deve escolher a duração do clipe com base no seu prompt e nas referências.
Consistência Guiada por Referências
Guie personagens, produtos, locais, adereços e estilo visual com referências ordenadas. O Wan3.0 foi projetado para manter detalhes reconhecíveis entre cenas para vídeos de marca e orientados por histórias.
Revisão de Áudio e Vídeo
Gere áudio por padrão ou desative-o sem alterar o preço da geração. Revise visuais, enredo e diálogo por meio do fluxo de edição do Wan3.0, em vez de reconstruir toda a sequência.
O Wan3.0 é o modelo de geração de vídeo tudo-em-um em prévia da Alibaba. Em vez de expor um modelo separado para cada caminho de criação, o endpoint oficial wan3.0-video oferece suporte a texto para vídeo, imagem para vídeo com primeiro quadro, vídeo com primeiro e último quadro, referência multimodal para vídeo, entrada de documento ou página web e fluxos de trabalho de revisão de vídeo.
O modelo pode retornar de 2 a 30 segundos de vídeo em uma única geração. Você pode solicitar saída em 480P, 720P ou 1080P a 30 fps, selecionar uma proporção padrão ou deixar o modelo adaptar a proporção à mídia fornecida. O áudio é habilitado por padrão, enquanto a duração inteligente e a extensão de prompt podem ajudar a transformar um briefing curto em uma sequência mais completa.
O Wan3.0 é especialmente relevante quando um vídeo precisa preservar mais do que um clima geral. Referências ordenadas podem definir um personagem, produto, local, linguagem de câmera, voz ou direção musical. Entradas de arquivo e link público também permitem que equipes transformem um deck de produto, relatório, artigo ou documento de treinamento em um briefing de vídeo estruturado.
| Especificações | Detalhes da API do Wan3.0 |
|---|---|
| Provedor | Alibaba Cloud Model Studio |
| Status oficial | Prévia |
| ID oficial do modelo | wan3.0-video |
| String de modelo do GPTProto | wan-3.0 |
| Modos de geração | Texto para vídeo, primeiro quadro, primeiro e último quadro, referência para vídeo, arquivo para vídeo, página web para vídeo |
| Duração da saída | 2–30 segundos; -1 habilita duração inteligente |
| Resolução da saída | 480P, 720P ou 1080P |
| Taxa de quadros | 30 fps |
| Proporções de tela | Adaptável, 16:9, 4:3, 1:1, 3:4 ou 9:16 |
| Limites de referência | Até 10 imagens, 5 clipes de vídeo e 5 clipes de áudio; a duração total de vídeo e áudio de referência é limitada separadamente a 15 segundos |
| Entrada de arquivo | Um arquivo DOC/DOCX, XLS/XLSX, PPT/PPTX, PDF, TXT, KEY, Pages, Numbers ou Markdown; até 100 MB e 50 páginas |
| Entrada de página web pública | Uma página HTTP ou HTTPS acessível publicamente que não exija login |
| Limite de prompt | 20.000 caracteres; chinês e inglês suportados |
| Áudio | Habilitado por padrão; pode ser desabilitado sem alterar a taxa oficial de geração |
| Parâmetro de marca d'água | Desabilitado por padrão na API da Alibaba; verifique a implementação ativa do GPTProto antes de fazer uma afirmação genérica sobre a política de saída |
Escolher o modo correto é importante porque entradas de controle de quadro e entradas de referência avançadas são mutuamente exclusivas na API oficial. Não combine first_frame nem last_frame com imagens de referência, vídeos de referência, áudio de referência, um arquivo ou uma página web na mesma solicitação.
| Modo de entrada | Use quando | Exemplo prático |
|---|---|---|
| Texto para vídeo | Você quer uma nova cena sem um recurso visual fixo | Gerar vários conceitos de campanha a partir de prompts estruturados de cena |
| Vídeo com primeiro quadro | A composição de abertura ou a imagem do produto já foi aprovada | Animar uma imagem de destaque do catálogo preservando seu enquadramento inicial |
| Vídeo com primeiro e último quadro | Ambos os pontos finais do movimento ou da transformação importam | Passar de uma embalagem fechada para a revelação de um produto totalmente montado |
| Referência para vídeo | Identidade, movimento, voz, música, cenário ou estilo devem vir de recursos de origem | Manter o mesmo produto, porta-voz, local e direção de áudio em um clipe de marca |
| Arquivo ou página web para vídeo | A ideia de origem está em um deck, relatório, página de produto, artigo ou documento de treinamento | Transformar um PPT de produto em um vídeo de lançamento ou um artigo público em um resumo visual narrado |
O Wan3.0 pode reduzir a distância entre um recurso de comércio aprovado e uma variação de vídeo utilizável. Para um único SKU, comece com uma imagem de destaque aprovada quando a composição exata de abertura for importante. Use o modo de referência quando o produto precisar permanecer reconhecível em vários planos, ou forneça uma apresentação de produto quando recursos, posicionamento e ordem das cenas já existirem em um documento.
Para geração de vídeo em lote, crie um modelo para dados de produto, referências, proporção, duração, câmera, áudio e CTA final. Envie cada variação de forma assíncrona, armazene seu ID de tarefa e trate o status separadamente do envio para reduzir jobs duplicados. Um conjunto de origem aprovado pode alimentar versões 9:16 para redes sociais, 1:1 para marketplace e 16:9 para página de produto. Salve as saídas bem-sucedidas em seu próprio armazenamento.
Esses modelos se sobrepõem, mas seus casos de uso mais fortes são diferentes. A melhor escolha depende da duração necessária, volume de referências, resolução de saída, entrada de documento, controles de edição e do custo de um clipe final utilizável — não apenas do preço anunciado por segundo.
| Fator de decisão | Wan3.0 | Seedance 2.5 | MiniMax H3 |
|---|---|---|---|
| Geração única máxima | Até 30 segundos | Até 30 segundos | Até 15 segundos |
| Capacidade de referência publicada | Até 10 imagens, 5 vídeos e 5 clipes de áudio | Até 30 imagens, 10 vídeos e 10 clipes de áudio | Até 9 imagens, 3 vídeos e 3 clipes de áudio; 12 arquivos mistos no total |
| Maior resolução documentada da API | 1080P | Verifique a resolução exposta pelo endpoint selecionado | 2K |
| Entrada de documento ou página web pública | Sim | Não listado como entrada principal na visão geral oficial de lançamento da ByteDance | Não listado na tabela atual de entradas da API da MiniMax |
| Áudio | Saída de áudio opcional | Geração conjunta de áudio e vídeo | Áudio estéreo nativo |
| Ênfase em edição | Revisão visual, de enredo e de diálogo; extensão de vídeo | Edição audiovisual em nível de timestamp, tela verde, perspectiva de câmera e extensão em várias rodadas | Geração com referência multimodal, edição e transferência de movimento |
| Melhor indicação | Vídeos longos multimodais ou guiados por documento com um caminho de API 1080P claramente documentado | Narrativa de 30 segundos com muitas referências que precisa do maior conjunto de recursos publicado | Clipes 2K mais curtos, som estéreo nativo e fluxos de trabalho que valorizam um ecossistema aberto de modelos |
Escolha o Wan3.0 em vez do Seedance 2.5 quando entrada de documento ou página web pública e uma escada documentada de 480P a 1080P importarem mais do que o volume máximo de referências. Escolha o MiniMax H3 quando um teto de 15 segundos for suficiente e saída 2K ou áudio estéreo nativo importar mais. Compare custos usando o mesmo prompt, recursos, duração, proporção e critérios de aceitação, incluindo novas tentativas e gerações rejeitadas.
Use uma estrutura de prompt que separe o assunto da linha do tempo e da direção de câmera:
Fórmula do prompt: assunto e referências de origem + objetivo da cena + ações cronometradas ou pontos da história + movimento de câmera + iluminação e estilo visual + direção de áudio + detalhes a preservar + detalhes a evitar + quadro final ou CTA
Use a Imagem 1 como referência do produto e a Imagem 2 como referência de iluminação. Crie um vídeo vertical de lançamento de 12 segundos para uma caixa de som sem fio preta fosca. Comece com um plano macro da grade, afaste-se enquanto a caixa de som gira, depois mostre vibrações de graves movendo gotículas próximas. Preserve o logotipo, os controles, as proporções e o acabamento. Iluminação de borda fria, movimento de câmera contido, ambiência eletrônica baixa, sem texto extra ou deformação.
Transforme a apresentação de produto fornecida em um filme de lançamento de 20 segundos em 16:9. Organize seus três principais benefícios como problema, demonstração do recurso e declaração final de valor. Preserve cores e materiais documentados. Use iluminação de estúdio limpa, movimentos de câmera comedidos, narração concisa e nenhuma alegação não verificada. Termine com o produto centralizado sobre o fundo da marca.
A Alibaba afirma que a textura do áudio e a precisão da renderização de texto na tela ainda estão melhorando. Para uma saída segura para a marca, adicione títulos, textos jurídicos, preços e rótulos pequenos na pós-produção em vez de pedir ao modelo que os renderize perfeitamente dentro da cena. Revise diálogos e músicas de perto antes de publicar, especialmente quando o recurso final será veiculado como anúncio pago.
Jobs com primeiro quadro e com primeiro e último quadro não podem ser misturados com entradas de referência, arquivo ou página web. Valide mídias avançadas antes do envio, salve os IDs de tarefa, torne novas tentativas idempotentes e armazene os arquivos concluídos prontamente.
Guias, comparações e atualizações relacionadas a este modelo.
Todos os artigos
Aprenda como transformar uma imagem de anime em um vídeo de transformação realista com o primeiro e o último quadro correspondentes, prompts, som e dicas de edição.

Veja Seedance 2.0 vs 2.5 no mesmo teste de storyboard de 15 segundos. Compare qualidade cinematográfica, emoção, preços, casos de uso de ecommerce e recursos de API.

Aprenda a criar prompts para expressões faciais emocionais realistas no Seedance 2.5 com microexpressões cronometradas, técnicas cinematográficas e dois exemplos completos de vídeo.

Compare os melhores modelos chineses de vídeo com IA de 2026, incluindo Seedance, MiniMax H3, Wan 3.0, Kling e Vidu, para texto, imagem e vídeo de referência.
Entrada
Saída