GPT Proto

GPTProto

  • Panel
  • LLM

    • claude
      Claude Opus 5Nuevo
    • google
      Gemini 3.6 Flash
    • google
      Gemini 3.5 Flash Lite
    • moonshotai
      Kimi K3
    • openai
      GPT 5.6 Luna

    Imagen IA

    • bytedance
      Dola Seedream 5.0 Pro 260628Nuevo
    • google
      Gemini 3.1 Flash Lite Image
    • google
      Gemini 3.1 Flash Image
    • openai
      GPT Image 2
    • google
      Gemini 3.1 Flash Image Preview

    Vídeo IA

    • kling
      Kling v3.0 4kNuevo
    • bytedance
      Dreamina Seedance 2.0 Mini 260615
    • kling
      Kling v3 Omni 4k
    • bytedance
      Dreamina Seedance 2.0 Fast 260128
    • bytedance
      Dreamina Seedance 2.0 260128
    Explorar más de 214 modelos >
  • Generador

    • Generador de imágenes IA
    • Generador de vídeo IA
    • AI Canvas

    Funciones

    • IA de anime a la vida realNuevo
    • Generador de Arte Anime con IA
    • Eliminador de objetos con IA
    • Editor de imágenes con IA
    • Generador de imágenes con IA sin restricciones
    • Transferencia de movimiento con IA
    • Removedor de ropa con IA
    • Eliminador de marcas de agua con IA
    • Mejorador de imágenes con IA en línea
    • Herramienta online para eliminar fondos
    Explorar todo >

    Prompts

    • Prompts de Seedance 2.0Nuevo
    • Prompts de GPT Image 2
    • Prompts de Nano Banana Pro
    • Prompts de Seedream 5.0 Pro
  • Blog IA

    • GLM 5.2 frente a MiniMax M3: ¿Cuál es mejor para programación y trabajo frontend?
    • Cómo crear tu propio personaje de IA con una API: sin necesidad de programar
    • Kimi K3 frente a Claude Opus 5: ¿Cuál es mejor para programación y agentes de IA?
    • 20 prompts gratuitos de diseño de packaging con Seedream 5.0 Pro para productos y comercio electrónico
    • GLM-5.2 vs Kimi K3 para programar: ¿cuál es mejor para los desarrolladores en 2026?
    Explorar todo >

    Perspectivas IA

    • ¿Qué es Emochi AI y por qué está creciendo tan rápido? (2026)
    • ¿Qué es Kimi K3 y está realmente cerca de GPT-5.6 y Fable 5?
    • Las 12 mejores herramientas de generación de videos con IA en 2026 para YouTube, TikTok, texto e imágenes
    • ¿Qué es Qwen 3.8 Max? Fecha de lanzamiento, vista previa de 2,4T, precios y primeras pruebas de rendimiento
    • Gemini 3.6 Flash y Gemini 3.5 Flash-Lite explicados: ¿cuál deberías usar?
    Explorar todo >

    Documentación IA

    • gpt-image-2
    • gpt-5.4
    • kimi-k2.5
    • claude-opus-4-6
    • kling-v3.0-pro
    Explorar todo >

    Habilidades IA

    • browser-use
    • claude-to-im
    • competitive-ads-extractor
    • content-creator
    • data-storytelling
    Explorar todo >
Precios
English繁體中文한국어日本語EspañolРусский
Comience ahora
  1. Inicio
  2. /Modelo
  3. /Qwen
  4. /wan-2.6
Qwen
wan-2.6
Documentación
Documentación
Wan 2.6 es el modelo de texto a video de Alibaba: un prompt se convierte en un clip de hasta 15 segundos y hasta 1080p, con audio sincronizado —voz, sonido ambiente y música— en una sola pasada. Planifica escenas con múltiples tomas y mantiene la identidad de los personajes entre cortes. Llámalo desde GPTProto por $0.45 por ejecución, con un único saldo compartido entre más de 200 modelos.

$ 0.45
$ 0.5

text

video

$ 0.45
$ 0.5

text

video

Patio de juegos
JSON
API

Aporte

Your browser does not support the video tag.
Su solicitud tendrá un costo$0por carrera, para$100puedes ejecutar este modelo aproximadamente0veces
Modelos relacionados
Todos los modelos
Kling
Kling
kling-v3.0-4k
$ 1.008
$ 1.26
Bytedance
Bytedance
dreamina-seedance-2-0-mini-260615
$ 0.2365
Vidu
Vidu
viduq3-turbo
$ 0.032
$ 0.04
Google
Google
veo-3.1-fast-generate-preview
$ 1.2
MiniMax
MiniMax
hailuo-2.3-pro
$ 0.441
$ 0.49
Qwen
Qwen
wan-2.2-plus
$ 0.09
$ 0.1
Ejemplos
A highly cinematic 10-second shot.[0–3 seconds]
A first-person POV camera rapidly pushes forward, gliding through a cold, dark stone tunnel, racing toward a bright exit ahead. The environment feels damp and shadowy. In the background audio, the sound of a woman’s heavy breathing while running can be heard.

[3–5 seconds]
The camera transitions smoothly and seamlessly into a breathtaking, fresh, lush natural forest. A crystal-clear waterfall cascades down rocky cliffs. The meadow is covered with vibrant wildflowers, and several elegant deer graze calmly on the grass. Warm golden sunlight filters through the tree canopy, illuminating soft green grass below.

[Final 5 seconds]
The shot cuts to a medium full-body shot of a young woman. Her face is filled with awe and wonder, her mouth slightly open, deeply overwhelmed by the beauty before her, almost breathless. The camera then rapidly and fluidly rotates 360 degrees around her, revealing the vast, sunlit forest in all its grandeur.
Ultra-realistic, 8K resolution, natural lighting, no glowing plants, natural color palette, cinematic masterpiece.
glowing blue fox runs across a bioluminescent forest at night. Mushrooms pulse with soft light as particles float in the air. The camera follows close behind the fox, weaving between trees. Magical atmosphere, vibrant colors, fantasy cinematic style, sense of wonder and discovery
Extremely fast paced cinematic FPV flying through a post apocalyptic world reclaimed by nature, showcasing collapsed megastructures, overgrown skyscrapers, rusted bridges, abandoned vehicles, flooded streets, broken highways, and ruined industrial zones, with dynamic low altitude fly throughs, sharp turns, dives, and accelerations, ultra realistic lighting, natural dust, fog, and atmospheric haze, cinematic depth of field, high contrast color grading, dramatic sunrays breaking through clouds, realistic decay textures, epic scale destruction, immersive motion, smooth camera stabilization, and a powerful cinematic aesthetic
In the snow-covered children's park during winter, many play equipment were in use, and several children were playing. Sunlight shone on the gleaming ice slide, making it sparkle and reflect light, surrounded by a thick blanket of white snow. The camera focused on a young British boy, dressed in a blue down jacket, red scarf, snow boots, and woolen gloves, excitedly sliding down the ice slide. He laughed and shouted, "Wow! This slide is super slippery!" He leaned forward slightly and slid down the ice slide quickly, the soft crunch of the ice and the reflection of the snow highlighting his movements. Reaching the bottom, he crouched down, patted the snow he had slid down, and exclaimed excitedly, "So fun!"

What is Wan 2.6?

Wan 2.6 is Alibaba's (Tongyi / Wan team) multimodal video generation model, released December 2025. It turns a text prompt — or images, a reference video, and audio — into a clip up to 15 seconds long at up to 1080p (24fps), with audio generated in the same pass: dialogue with lip-sync, sound effects, and music.

 

Over Wan 2.5 it adds three things that matter for real production. Multi-shot narrative planning: one prompt can lay out several cuts (wide → close-up → reaction) and the model sequences them, instead of you generating and stitching separate clips. Reference-based generation: supply reference images or a reference video and the model holds a character's identity and look across shots. Higher motion fidelity: smoother, more stable motion across the longer 15s runtime. It accepts text, image, reference-video, and audio inputs in one workflow.

 

Wan 2.6 is an API-only model — weights are not publicly downloadable. Wan 2.1 and 2.2 are the open-weight (Apache-2.0) versions; 2.5 and 2.6 are API-only. On GPTProto you call it with the model string wan-2.6, billed per run by resolution and duration.

Spec Value
Provider Alibaba (Tongyi / Wan) · released Dec 2025
Modalities Text-to-video (this page); also image-to-video, reference-to-video
Inputs Text, image, reference video, audio
Audio Native synchronized — voice + lip-sync + SFX + music, one pass
Multi-shot Yes — multi-shot planning + identity retention
Resolution up to 1080p (24fps); landscape / portrait / square
Duration 5 / 10 / 15s
Weights API-only (not open-source)
Model string wan-2.6
Endpoint https://gptproto.com/api/v3/alibaba/wan-2.6/text-to-video

 

How multi-shot and synced audio work

Two capabilities define Wan 2.6, and both change how you prompt.

Synced audio in one pass. The generation step produces frames and a matching audio track together, so speech lands on the right lip movements and ambient sound and music sit under the cut without separate editing. Describe the sound in your prompt with a Sound: cue, or pass your own track via the audio parameter and the model syncs motion to it.

Multi-shot in one run. Rather than rendering one continuous shot, Wan 2.6 can sequence several beats inside a single clip. Segment the prompt by time ([0-5s] … [5-10s] … [10-15s] …) and the model treats each as a shot, carrying characters and setting across the cuts. The shot_type parameter controls whether you get a single continuous shot or a multi-shot composition. For coherence, 8–12s clips tend to be the most stable; 15s is available when you need the length.

 

Choosing inside the Wan family

GPTProto carries the Wan models on one balance. Pick by the job:

  • Wan 2.6 — text-to-video (this page): 1080p, up to 15s, multi-shot, native audio. Use it for longer or multi-cut narratives from a prompt.
  • Wan 2.6 — image-to-video / reference-to-video: animate a still, or guide a scene with a reference clip / up to several reference images for identity. 
  • Wan 2.5 (wan-2.5): 1080p, up to 10s, native audio, single-shot — the cheaper daily driver, from $0.225/run.
  • Wan 2.2 (wan-2.2-plus): silent, 720p, ~5s — but open-weight, the pick when you must self-host.

Competitors list these models without a selection map. The short version: 2.6 for length + multi-shot + identity, 2.5 for cheaper single-shot clips with audio, 2.2 for open weights.

 

Wan 2.6 vs Wan 2.5 vs Wan 2.2

  Wan 2.6 Wan 2.5 Wan 2.2
Audio Native synced Native synced None (video only)
Max duration 15s 10s ~5s
Resolution up to 1080p up to 1080p 720p
Multi-shot / reference Yes No No
Open weights No (API only) No (API only) Yes (Apache 2.0)
GPTProto price $0.45–$2.025 / run $0.225–$1.35 / run $0.09 / run

Honest take: Wan 2.6 costs more per run, but it's the one to use when you need 15s, multi-shot scenes, or character consistency across cuts. Wan 2.5 is the cheaper daily driver for single-shot clips up to 10s with audio. Wan 2.2 is the pick only if you need open weights to self-host.

Related: Wan 2.5 → · Wan 2.2 → · Sora 2 →

 

What you can build with the Wan 2.6 API

Multi-shot short films and ads — One prompt lays out several shots with consistent characters and audio across cuts — a 15s narrative ad without manual stitching. A 20-variant test at 720p/5s ≈ $9.00.

Localized video at scale — Multilingual prompts and lip-synced speech turn one storyboard into several languages without re-shooting. Strong Chinese support.

Any aspect ratio, same price — Square (960×960, 1440×1440), portrait (720×1280, 1080×1920), and landscape are priced identically within a tier, so format is a free choice per platform.

Image / reference-to-video — Animate a still or guide a scene with a reference clip on the sibling endpoints. 

 

Wan 2.6 prompt recipes

Wan 2.6 generates audio and can plan multiple shots, so prompts work best when they describe shots, motion, and sound together. The platform's own example segments the prompt by time — use that for multi-shot. Structure each beat: shot + subject + action + camera + lighting + Sound: cue.

1. Multi-shot narrative (15s + shot planning)

[0-5s] Wide shot: a lone hiker reaches a misty mountain ridge at dawn, slow push-in.
[5-10s] Medium shot: she lifts her camera and smiles. Sound: wind, distant birds.
[10-15s] Close-up: the sun breaks over the peaks, light fills the frame. Sound: a
soft swell of ambient music, no dialogue.

2. Dialogue + lip-sync (single shot)

Medium close-up of a barista behind a wooden counter, warm morning light. She looks
to camera and says, "Your usual? Coming right up." Steam rises from the cup. Sound:
spoken line, espresso machine hiss, quiet cafe ambience.

3. Product/promo, square frame

Square frame. A sneaker rotates slowly on a matte pedestal, studio light sweeps
across it, subtle reflections. Sound: a low synth pulse, soft whoosh on the sweep,
no speech.

Working tips: for multi-shot, label each beat with its time range and keep dialogue short enough for the beat; set shot_type for single vs multi-shot; 8–12s is the sweet spot for coherence, 15s when you need length; use negative_prompt to exclude artifacts (e.g. "no text, no watermark"); prompt_extend: true lets the model expand a short prompt — turn it off for exact control; fix seed to reproduce a result.

 

Cómo obtener una clave API de wan-2.6

Obtener una clave API de wan-2.6 lleva cuatro pasos y unos minutos. Crea una cuenta gratuita en GPTProto, añade créditos, genera tu clave y haz tu primera llamada — a $0.45 es una clave API de wan-2.6 más barata que ir directo, y una sola clave funciona con todos los modelos de la plataforma. La Documentación de wan-2.6 completa está en la documentación.

Inscribirse

Inscribirse

Cree su cuenta GPT Proto gratuita para comenzar. Puedes configurar una organización para tu equipo en cualquier momento.

Completar

Completar

Su balanza se puede utilizar en todos los modelos de la plataforma, incluido wan-2.6, lo que le brinda la flexibilidad de experimentar y escalar según sea necesario.

Genera tu clave API

Genera tu clave API

En su panel de control, cree una clave API; la necesitará para autenticarse al realizar solicitudes a wan-2.6.

Haz tu primera llamada API

Haz tu primera llamada API

Utilice su clave API con nuestro código de muestra para enviar una solicitud a wan-2.6 a través de GPT Proto y ver resultados instantáneos impulsados ​​por IA.

Obtener API Key

Preguntas frecuentes

Preguntas frecuentes sobre el modelo wan-2.6/text-to-video

¿Qué es wan-2.6/text-to-video?

El modelo de video de Alibaba que convierte un prompt de texto en un clip de hasta 15 segundos y hasta 1080p, con audio sincronizado y planificación de escenas en múltiples tomas, en una sola pasada.

¿Wan 2.6 es de código abierto?

No: solo está disponible mediante API y los pesos no se pueden descargar. Wan 2.1 y 2.2 son las versiones con pesos abiertos (Apache-2.0); 2.5 y 2.6 solo están disponibles mediante API.

Wan 2.6 frente a Wan 2.5: ¿qué cambió?

La versión 2.6 amplía los clips a 15 s (la 2.5 está limitada a 10 s), añade planificación de múltiples tomas y retención de identidad basada en referencias, y mejora la fidelidad del movimiento. Ambas generan audio sincronizado de forma nativa hasta 1080p; la 2.5 es más económica por ejecución.

¿Wan 2.2 frente a Wan 2.6?

La versión 2.6 añade audio sincronizado nativo, 1080p, 15 s y múltiples tomas; la 2.2 es silenciosa, alcanza 720p y dura aproximadamente 5 s. La 2.2 es la única de las dos que tiene pesos abiertos.

¿Puedo hacer imagen a video con Wan 2.6?

Sí, mediante el endpoint de imagen a video (animar una imagen fija) o de referencia a video (guiar con un clip).

¿Wan 2.6 genera audio?

Sí: voz con sincronización labial, efectos de sonido y música en una sola pasada. Pasa tu propia pista mediante audio o describe el sonido en línea con una indicación Sound:.

¿Cuánto cuesta Wan 2.6?

Desde 0,45 $ (720p/5 s) hasta 2,025 $ (1080p/15 s) por ejecución; consulta la matriz anterior.

¿Wan 2.6 no tiene censura o permite contenido NSFW?

La política de contenido real de GPTProto; solo la capa de cumplimiento de «acceso a la API sin filtros».

¿Cómo lo llamo mediante la API?

Envía una solicitud POST al endpoint anterior y luego consulta /predictions/{id}/result. Consulta la Guía de inicio rápido.

¿Cómo pago wan-2.6/text-to-video en GPT Proto?

En GPT Proto, las opciones de pago para wan-2.6/text-to-video incluyen el uso basado en créditos, planes prepagados y suscripciones empresariales. Los usuarios se registran, obtienen acceso al modelo y seleccionan un plan que se adapte a su producción prevista. El uso se registra según la duración o la cantidad de videos generados, y las facturas reflejan el consumo real. La facturación basada en API se integra con pasarelas de pago populares para facilitar la gestión de la cuenta. Las limitaciones del nivel gratuito y los complementos premium se detallan claramente en el panel de GPT Proto. Para proyectos que requieren producción de video a gran escala, hay acuerdos empresariales con SLA y soporte personalizados disponibles.

Más herramientas de IA de GPTProto relacionadas

Generador de videos con IA de Picsart

Transforma tus ideas en contenido viral con un generador de IA avanzado que lleva tu flujo de trabajo en Picsart al siguiente nivel. Accede a modelos premium para una animación fluida.

Generador de videos con IA de Pollo

Transforma simples indicaciones en un impresionante contenido visual que detiene el desplazamiento usando el avanzado motor de texto a video de Pollo AI.

Generador de videos con IA de Pika Labs

Aprovecha el poder de Pika Labs para transformar tus ideas en contenido hiperrealista. Nuestros modelos de IA dan vida a historias dinámicas.

IA de imagen a video

Transforma contenido multimedia estático en secuencias dinámicas usando nuestra innovadora IA de imagen a video. Crea hoy tu propia API online para convertir fotos en videos.

Artículos relacionados

Más blogs
Wan 2.5: El futuro de la generación de videos 4K con IA

Wan 2.5: El futuro de la generación de videos 4K con IA

Descubre cómo Wan 2.5 transforma imágenes en videos cinematográficos 4K con IA. Conoce sus funciones, precios y las opciones de la API de GPT Proto.

wan2.2-animate: Calidad por encima de la velocidad en IA

wan2.2-animate: Calidad por encima de la velocidad en IA

Mientras otros modelos se apresuran a generar resultados, wan2.2-animate se centra en la fidelidad visual cinematográfica y el cumplimiento de las instrucciones. Descubre hoy cómo optimizar tu flujo de trabajo de video.

Wan Video: Domina la generación de código abierto

Wan Video: Domina la generación de código abierto

El video de wan de Alibaba es una alternativa de código abierto a los costosos modelos de IA. Descubre hoy cómo crear mejores prompts y dar vida a tus ideas creativas.

Wan 2.5: El futuro de la generación de videos 4K con IA

Wan 2.5: El futuro de la generación de videos 4K con IA

Descubre cómo Wan 2.5 transforma imágenes en videos cinematográficos 4K con IA. Conoce sus funciones, precios y las opciones de la API de GPT Proto.

GPT Proto

Potenciar la innovación en IA con escala y estabilidad globales:

Con nuestro producto estrella, GPT Proto, ofrecemos una interfaz unificada para acceder y combinar API de los principales proveedores de IA del mundo, que abarcan texto, visión, voz y más. Capacitamos a los desarrolladores y empresas para que simplifiquen la integración y aceleren la innovación sin límites.

Infraestructura global, cumplimiento local:

Para garantizar la confiabilidad y el cumplimiento de nivel empresarial, Talent Tech Global Limited opera específicamente como nuestra entidad global de facturación y contratación. Mientras tanto, nuestra infraestructura técnica central y nuestros equipos de I+D están distribuidos estratégicamente en centros de innovación globales, incluidos Silicon Valley, Singapur y Hong Kong.

Construido a escala:

Entendemos que la estabilidad es primordial. Nuestra plataforma se basa en una arquitectura robusta y descentralizada que admite el escalado automático dinámico. Ya sea que esté ejecutando una prueba piloto o manejando millones de solicitudes simultáneas, nuestro sistema se expande instantáneamente para satisfacer la demanda, garantizando que su negocio nunca supere nuestra infraestructura.

Navegación

  • Panel
  • Modelo
  • Generador de imágenes IA
  • Escalado de imagen IA
  • Eliminador de fondo IA
  • Generador de vídeo IA
  • AI Canvas
  • Funciones
  • Precios
  • Documentación IA
  • Blog IA
  • Perspectivas IA
  • Habilidades IA

Funciones

  • IA de anime a la vida real
  • Generador de Arte Anime con IA
  • Eliminador de objetos con IA
  • Editor de imágenes con IA
  • Generador de imágenes con IA sin restricciones
  • Transferencia de movimiento con IA
  • Removedor de ropa con IA
  • Eliminador de marcas de agua con IA
  • Mejorador de imágenes con IA en línea
  • Herramienta online para eliminar fondos
  • Imagen de intercambio de rostros con IA
  • Creador de fotos de pasaporte con IA
  • Generador de IA de MS Paint
Explore all features >

LLM

  • Claude Opus 5
  • Gemini 3.6 Flash
  • Gemini 3.5 Flash Lite
  • Kimi K3
  • GPT 5.6 Luna
  • GPT 5.6 Terra
  • GPT 5.6 Sol
  • Grok 4.5
  • Claude Sonnet 5
  • Minimax M3
  • GLM 5.2
  • GPT 5.1 Chat Latest
  • Claude Fable 5
  • Qwen3.7 Max
  • Claude Opus 4.8 Thinking
  • Claude Opus 4.8
  • Gemini 3.5 Flash
  • DeepSeek v4 Flash
  • DeepSeek v4 Pro
  • Grok 4.3
Más modelo

Imagen IA

  • Dola Seedream 5.0 Pro 260628
  • Gemini 3.1 Flash Lite Image
  • Gemini 3.1 Flash Image
  • GPT Image 2
  • Gemini 3.1 Flash Image Preview
  • Seedream 5.0 260128
  • Doubao Seedream 5.0 260128
  • Vidu Q2
  • Grok Imagine Image
  • Kling Image O1
  • GPT Image 1.5
  • Seedream 4.5 251128
  • Doubao Seedream 4.5 251128
  • Grok Imagine 0.9
  • Gemini 3 Pro Image Preview
  • Qwen Image Lora
  • Qwen Image Plus Lora
  • Qwen Image Plus
  • Grok 4 Image
  • GPT Image 1 Mini
Más modelo

Vídeo IA

  • Kling v3.0 4k
  • Dreamina Seedance 2.0 Mini 260615
  • Kling v3 Omni 4k
  • Dreamina Seedance 2.0 Fast 260128
  • Dreamina Seedance 2.0 260128
  • Vidu 2.0
  • Doubao Seedance 2.0 260128
  • Doubao Seedance 2.0 Fast 260128
  • Kling v3 Omni Pro
  • Kling v3 Omni Std
  • Vidu Q3 Turbo
  • Kling v3.0 Pro
  • Kling v3.0 Std
  • Vidu Q3 Pro
  • Kling v2.6 Std
  • Vidu Q2 Pro
  • Vidu Q2 Turbo
  • Vidu Q2 Pro Fast
  • Vidu Q2
  • Kling Video O1 Pro
Más modelo

© 2026 Talent Tech Global Limited (Hong Kong) / Talent Tech Global LLC (US). Todos los derechos reservados.

  • Sobre nosotros
  • política de privacidad
  • Términos de servicio
  • Mapa del sitio