GPT Proto

GPTProto

  • Panel
  • LLM

    • claude
      Claude Opus 5Nuevo
    • google
      Gemini 3.6 Flash
    • google
      Gemini 3.5 Flash Lite
    • moonshotai
      Kimi K3
    • openai
      GPT 5.6 Luna

    Imagen IA

    • bytedance
      Dola Seedream 5.0 Pro 260628Nuevo
    • google
      Gemini 3.1 Flash Lite Image
    • google
      Gemini 3.1 Flash Image
    • openai
      GPT Image 2
    • google
      Gemini 3.1 Flash Image Preview

    Vídeo IA

    • kling
      Kling v3.0 4kNuevo
    • bytedance
      Dreamina Seedance 2.0 Mini 260615
    • kling
      Kling v3 Omni 4k
    • bytedance
      Dreamina Seedance 2.0 Fast 260128
    • bytedance
      Dreamina Seedance 2.0 260128
    Explorar más de 214 modelos >
  • Generador

    • Generador de imágenes IA
    • Generador de vídeo IA
    • AI Canvas

    Funciones

    • IA de anime a la vida realNuevo
    • Generador de Arte Anime con IA
    • Eliminador de objetos con IA
    • Editor de imágenes con IA
    • Generador de imágenes con IA sin restricciones
    • Transferencia de movimiento con IA
    • Removedor de ropa con IA
    • Eliminador de marcas de agua con IA
    • Mejorador de imágenes con IA en línea
    • Herramienta online para eliminar fondos
    Explorar todo >

    Prompts

    • Prompts de Seedance 2.0Nuevo
    • Prompts de GPT Image 2
    • Prompts de Nano Banana Pro
    • Prompts de Seedream 5.0 Pro
  • Blog IA

    • GLM 5.2 frente a MiniMax M3: ¿Cuál es mejor para programación y trabajo frontend?
    • Cómo crear tu propio personaje de IA con una API: sin necesidad de programar
    • Kimi K3 frente a Claude Opus 5: ¿Cuál es mejor para programación y agentes de IA?
    • 20 prompts gratuitos de diseño de packaging con Seedream 5.0 Pro para productos y comercio electrónico
    • GLM-5.2 vs Kimi K3 para programar: ¿cuál es mejor para los desarrolladores en 2026?
    Explorar todo >

    Perspectivas IA

    • ¿Qué es Emochi AI y por qué está creciendo tan rápido? (2026)
    • ¿Qué es Kimi K3 y está realmente cerca de GPT-5.6 y Fable 5?
    • Las 12 mejores herramientas de generación de videos con IA en 2026 para YouTube, TikTok, texto e imágenes
    • ¿Qué es Qwen 3.8 Max? Fecha de lanzamiento, vista previa de 2,4T, precios y primeras pruebas de rendimiento
    • Gemini 3.6 Flash y Gemini 3.5 Flash-Lite explicados: ¿cuál deberías usar?
    Explorar todo >

    Documentación IA

    • gpt-image-2
    • gpt-5.4
    • kimi-k2.5
    • claude-opus-4-6
    • kling-v3.0-pro
    Explorar todo >

    Habilidades IA

    • browser-use
    • claude-to-im
    • competitive-ads-extractor
    • content-creator
    • data-storytelling
    Explorar todo >
Precios
English繁體中文한국어日本語EspañolРусский
Comience ahora
  1. Inicio
  2. /Modelo
  3. /Qwen
  4. /wan-2.5 / text-to-video
Qwen
wan-2.5 / text-to-video
Documentación
Documentación
Wan 2.5 Text to Video crea videos cinematográficos de hasta 10 segundos de duración en 1080p a partir de descripciones textuales, con movimiento e iluminación realistas y abundantes detalles temporales. También genera audio sincronizado, incluidas voces y sonidos ambientales, ideal para contar historias y marketing. Úsalo en GPTProto con un único saldo para más de 200 modelos, desde $0.225 por ejecución.

$ 0.027
$ 0.03

text

video

$ 0.027
$ 0.03

text

video

Patio de juegos
JSON
API

Aporte

Your browser does not support the video tag.
Su solicitud tendrá un costo$0por carrera, para$100puedes ejecutar este modelo aproximadamente0veces
Modelos relacionados
Todos los modelos
Kling
Kling
kling-v3.0-4k
$ 1.008
$ 1.26
Bytedance
Bytedance
dreamina-seedance-2-0-mini-260615
$ 0.2365
Vidu
Vidu
viduq3-turbo
$ 0.032
$ 0.04
Qwen
Qwen
wan-2.6
$ 0.45
$ 0.5
Google
Google
veo-3.1-fast-generate-preview
$ 1.2
MiniMax
MiniMax
hailuo-2.3-pro
$ 0.441
$ 0.49
Ejemplos
Studio Ghibli anime style, a bustling ancient Chinese market, streets are crowded with people, vendors are shouting their wares, and children are chasing each other playfully. The background features traditional architecture and waving banners. The camera moves through the crowd in a first-person perspective. Sound: A cacophony of human voices, including vendor calls, customer haggling, and children's laughter. In the background, there are sounds of gongs, distant opera music, and the general din of footsteps and objects. The background music is a lively and festive traditional Chinese folk tune.
A handsome, muscular man with well-defined abs is catching his breath after an intense workout. Sweat drips down his torso. He is shirtless, wearing only black athletic shorts, and is leaning against gym equipment. The lighting comes from the upper side, highlighting the contours of his chest and arms. The scene is filled with a raw, masculine energy, hyper-realistic, high-contrast lighting.
A middle-aged man sitting at a wooden desk in a cozy study room, surrounded by bookshelves and a warm lamp glow. He opens an old book and reads aloud with a calm, deep voice: 'History teaches us more than just facts… it shows us who we are.' The room has subtle background sounds: pages turning, the faint ticking of a clock, and distant rain against the window.
A vibrant young woman in her early 20s runs toward the camera in Times Square at night, ecstatic and wide-eyed, shouting passionately into a black microphone. She wears a neon green windbreaker and black headphones around her neck. She yells: “Yo, Wan2.5 just dropped on WaveSpeedAI — sound and texture are next level, try it right now!” Wet reflective streets, glowing blue-white-magenta billboards, blurred pedestrians, dynamic handheld follow-shot, sharp face focus, shallow depth of field. 4K UHD, saturated colors, viral UGC style.

What is Wan 2.5?

Wan 2.5 is Alibaba's (Tongyi / Wan team) video generation model, released in September 2025. It turns a text prompt — or a still image — into a clip up to 10 seconds long at up to 1080p (24fps), and generates the audio in the same pass: dialogue with lip-sync, ambient sound effects, and music. That one-pass audio-visual output is what separates it from earlier Wan releases and from most open video models, which produce silent video only.

Wan 2.5 ships as an API-only preview — its weights are not publicly downloadable. (Wan 2.1 and 2.2 are the open-weight, Apache-2.0 versions you can self-host; 2.5 and 2.6 are API-only.) On GPTProto, you call it with the model string wan-2.5, billed per generation by resolution and duration, on the same balance as 200+ other models.

Spec Value
Provider Alibaba (Tongyi / Wan)
Modalities Text-to-video (this page), image-to-video
Audio Native synchronized — voice + lip-sync + SFX + music, one pass
Resolution 480p / 720p / 1080p (24fps)
Max duration ~10s
Languages Multilingual (strong Chinese)
Weights API-only preview (not open-source)
Model string wan-2.5
Endpoint https://gptproto.com/api/v3/alibaba/wan-2.5/text-to-video

What you can build with the Wan 2.5 API

Short-form social and ads — 5–10s vertical or landscape clips with built-in voiceover and sound, no separate audio editing. At $0.45 per 720p/5s run, A/B-testing a dozen ad variants stays cheap.

Localized video at scale — Wan 2.5 handles multilingual prompts and generates lip-synced speech, so one storyboard becomes versions in several languages without re-shooting or re-dubbing. Strong Chinese support.

Storytelling and explainers — Dialogue, ambient sound, and music generated together keep narration and visuals aligned across the clip — useful for YouTube intros, product explainers, and training segments.

Animating a still image — Feed a single image as the first frame and a motion prompt to animate it.

 

How Wan 2.5 generates video and audio together

Most video models output silent frames; sound is a separate job you bolt on later. Wan 2.5 was built the other way around. Its generation step produces the visual frames and a matching audio track jointly, so speech lands on the right lip movements, footsteps line up with steps, and music sits under the cut without you editing anything. In practice this collapses a two-tool pipeline (video model + TTS/foley) into one API call.

Two things follow from that. First, your prompt should describe sound as well as motion — name the dialogue line, the ambient bed, and whether you want music (see §6). Second, because audio and video come from one pass, a single run is one billable unit; you are not paying twice or stitching tracks. If you need to supply your own music or voiceover instead, the audio parameter accepts it and the model syncs motion to it.

 

Choosing inside the Wan family

GPTProto carries several Wan models on one balance. Pick by what the job needs, not by version number:

  • Wan 2.5 — text-to-video (this page): 1080p, up to 10s, native audio. The default for a prompt-to-clip with sound.
  • Wan 2.5 — image-to-video: start from a still image as the first frame and animate it (the "wan 2.5 animate" case). 
  • Wan 2.2 (wan-2.2-plus): silent, 720p, ~5s — but open-weight, so it's the pick when you must self-host.
  • Wan 2.6 (wan-2.6): 1080p, up to 15s, plus multi-shot scene planning and reference-based identity retention — step up when you need longer or multi-cut narratives.

This map is the kind of thing competitors leave out: they list models without telling you which to reach for. Use 2.5 for single-shot clips with audio, 2.2 if you need weights, 2.6 for length and multi-shot.

 

Wan 2.5 vs Sora 2

Both generate video with synchronized audio from text or an image. The practical differences:

  Wan 2.5 Sora 2
Audio Native synced (voice / SFX / music) Native synced
Resolution up to 1080p up to 1080p
Max duration ~10s longer — up to ~25s (Pro)
Languages Multilingual, strong Chinese Multilingual
Content / IP rules Lighter Heavier — blocks IP & photorealistic likeness on some hosts
Open weights No (API-only) No
GPTProto price $0.225–$1.35 / run (by res × duration) $0.4 / run

Honest take: Sora 2 is a flat $0.4/run and supports longer clips (up to ~25s on Pro) — reach for it when duration matters. Wan 2.5 starts lower at $0.225/run (480p/5s) and lets you trade resolution for cost, with strong multilingual speech and fewer content restrictions. Both run on one GPTProto balance.

Related: Sora 2 → · Wan 2.6 → · Wan 2.2 →

Wan 2.5 prompt recipes

Wan 2.5 generates audio with the video, so good prompts describe sound as well as motion. The platform's own examples put audio inline with a Sound: cue — follow that convention. Structure: subject + action + camera move + lighting + Sound: cue + style. Paste and adjust.

1. Dialogue + lip-sync (shows the audio engine)

Medium close-up of an elderly fisherman on a wooden boat at dawn, soft golden
light, gentle water lapping. He looks to camera and says warmly, "The sea always
keeps its promises." Slow push-in. Sound: soft waves, distant seagulls, a calm
spoken line, no music.

2. Ambient / SFX, no dialogue

Rain on a neon-lit Tokyo alley at night, a cat darts under an awning, reflections
shimmer on wet pavement. Static wide shot, cinematic. Sound: steady rain, distant
traffic, no music, no speech.

3. Product / marketing

Close-up of an iced coffee on a marble counter, condensation beading, morning
kitchen light. A spoon stirs the ice. Slow 180-degree orbit around the glass.
Sound: soft clink of ice, quiet ambient kitchen tone, light background music.

4. Motion / tracking

A skateboarder rolls across an empty concrete plaza at sunset, low-angle tracking
shot alongside, subtle lens flare. Sound: wheels rumbling on pavement, wind
ambience, no dialogue.

Tips: keep dialogue short enough for the clip length (about one spoken line per 5s); name the camera move explicitly; state "no music" if you only want ambient sound; or pass your own track via the audio parameter.

Cómo obtener una clave API de wan-2.5

Obtener una clave API de wan-2.5 lleva cuatro pasos y unos minutos. Crea una cuenta gratuita en GPTProto, añade créditos, genera tu clave y haz tu primera llamada — a $0.027 es una clave API de wan-2.5 más barata que ir directo, y una sola clave funciona con todos los modelos de la plataforma. La Documentación de wan-2.5 completa está en la documentación.

Inscribirse

Inscribirse

Cree su cuenta GPT Proto gratuita para comenzar. Puedes configurar una organización para tu equipo en cualquier momento.

Completar

Completar

Su balanza se puede utilizar en todos los modelos de la plataforma, incluido wan-2.5, lo que le brinda la flexibilidad de experimentar y escalar según sea necesario.

Genera tu clave API

Genera tu clave API

En su panel de control, cree una clave API; la necesitará para autenticarse al realizar solicitudes a wan-2.5.

Haz tu primera llamada API

Haz tu primera llamada API

Utilice su clave API con nuestro código de muestra para enviar una solicitud a wan-2.5 a través de GPT Proto y ver resultados instantáneos impulsados ​​por IA.

Obtener API Key

Preguntas frecuentes sobre wan-2.5/text-to-video

Preguntas y respuestas frecuentes de desarrolladores sobre las funciones, el uso y el rendimiento del modelo wan-2.5/text-to-video.

¿Qué es wan-2.5/text-to-video?

El modelo de video de Alibaba que convierte un prompt de texto en un clip de hasta 10 segundos a un máximo de 1080p, con audio sincronizado (voz, efectos de sonido y música) generado en la misma pasada.

¿Wan 2.5 es de código abierto?

No. Wan 2.5 se ofrece como una vista previa exclusiva para API y sus pesos no se pueden descargar públicamente. Wan 2.1 y 2.2 son las versiones con pesos abiertos (Apache-2.0) que puedes alojar por tu cuenta; 2.5 y 2.6 son exclusivas para API.

Wan 2.5 frente a Wan 2.2: ¿qué ha cambiado?

Wan 2.5 añade audio sincronizado nativo, eleva la resolución estándar a 1080p (2.2 alcanza un máximo de 720p) y amplía los clips a unos 10 s (2.2 ≈ 5 s). Wan 2.2 sigue siendo la opción adecuada si necesitas pesos abiertos para una implementación local.

¿Wan 2.5 frente a Sora 2?

Ambos generan video con audio sincronizado. Sora 2 (0,4 $/ejecución) admite clips más largos (hasta aproximadamente 25 s en Pro), pero tiene restricciones de contenido y propiedad intelectual más estrictas; Wan 2.5 comienza en 0,225 $/ejecución, es multilingüe y utiliza el mismo saldo.

¿Wan 2.5 genera audio?

Sí: la voz con sincronización labial, los efectos de sonido y la música se generan junto con el video en una sola pasada. También puedes proporcionar tu propia pista mediante el parámetro de audio o describir el sonido directamente con una indicación Sound: en el prompt.

¿Puedo animar una imagen fija con Wan 2.5?

Sí, mediante image-to-video: proporciona una imagen como primer fotograma junto con un prompt de movimiento.

¿Wan 2.5 no tiene censura o permite contenido NSFW?

wan-2.5/text-to-video destaca por su fidelidad creativa y la consistencia de los resultados. Su comprensión multimodal permite obtener detalles de video refinados, una narración precisa y transiciones fluidas. La calidad de salida es adecuada para uso profesional y admite una variedad de estilos visuales y técnicas narrativas.

¿Cuánto cuesta la API de Wan 2.5 en GPTProto?

Desde 0,225 $ (480p/5 s) hasta 1,35 $ (1080p/10 s) por ejecución; consulta la matriz de precios anterior. Se factura por generación con un único saldo.

¿Cómo llamo a Wan 2.5 mediante la API?

Envía una solicitud POST a https://gptproto.com/api/v3/alibaba/wan-2.5/text-to-video con tu prompt y configuración; después, consulta /api/v3/predictions/{id}/result para obtener el video terminado. Consulta la guía de inicio rápido anterior.

¿wan-2.5/text-to-video admite entradas multimodales, como imágenes o audio?

wan-2.5/text-to-video está diseñado para ofrecer una sólida conversión de texto a video y puede admitir ciertas extensiones de entrada multimodal. El flujo de trabajo principal se basa en entradas de texto, pero los desarrolladores avanzados pueden explorar prompts de imagen o audio, según la evolución de la documentación oficial.

¿Existen riesgos de derechos de autor al utilizar contenido generado por wan-2.5/text-to-video?

wan-2.5/text-to-video genera videos originales basados en los prompts de los usuarios. El uso habitual no supone un riesgo de derechos de autor si aportas ideas únicas. Sin embargo, los usuarios comerciales deben evitar prompts que repliquen directamente obras protegidas conocidas. Comprueba siempre las leyes locales de derechos de autor antes de distribuir el contenido públicamente.

Más herramientas de IA relacionadas de GPTProto

Generador de videos con Wan AI

Generador de videos con Wan AI

Transforma simples indicaciones de texto en historias dinámicas en movimiento con Wan AI. Disfruta de sincronización labial fluida, audio sincronizado y movimientos de cámara realistas en cuestión de segundos.

InVideo AI

InVideo AI

Transforma texto en imágenes sorprendentes al instante con nuestro avanzado creador de invideo AI.

Generador de videos con Picsart AI

Transforma tus ideas en contenido viral con un generador de IA avanzado que lleva tu flujo de trabajo en Picsart al siguiente nivel. Accede a modelos premium para disfrutar de una animación fluida.

IA de imagen a video

Transforma contenido multimedia estático en secuencias dinámicas con nuestra avanzada IA de imagen a video. Crea hoy tu propia API online para convertir fotos en videos.

Artículos relacionados

Más blogs
Wan 2.5: El futuro de la generación de videos 4K con IA

Wan 2.5: El futuro de la generación de videos 4K con IA

Descubre cómo Wan 2.5 transforma imágenes en videos cinematográficos 4K con IA. Conoce sus funciones, precios y opciones de API de GPT Proto.

Los mejores modelos de generación de videos con IA de 2025: los 5 principales

Los mejores modelos de generación de videos con IA de 2025: los 5 principales

Descubre los mejores modelos de generación de videos con IA de 2025. Compara precios, explora API gratuitas y encuentra el mejor generador de videos con IA para tus necesidades con nuestra guía.

wan2.2-animate: calidad por encima de la velocidad en la IA

wan2.2-animate: calidad por encima de la velocidad en la IA

Mientras otros modelos se apresuran a generar resultados, wan2.2-animate se centra en la fidelidad visual cinematográfica y el cumplimiento de las indicaciones. Aprende hoy a optimizar tu flujo de trabajo de video.

Wan 2.2 Animate: conversión real de imagen a video

Wan 2.2 Animate: conversión real de imagen a video

Deja de lidiar con el parpadeo en los videos generados con IA. Aprende a configurar wan 2.2 animate para lograr una consistencia precisa de los personajes y un movimiento fluido. Lee la guía completa.

GPT Proto

Potenciar la innovación en IA con escala y estabilidad globales:

Con nuestro producto estrella, GPT Proto, ofrecemos una interfaz unificada para acceder y combinar API de los principales proveedores de IA del mundo, que abarcan texto, visión, voz y más. Capacitamos a los desarrolladores y empresas para que simplifiquen la integración y aceleren la innovación sin límites.

Infraestructura global, cumplimiento local:

Para garantizar la confiabilidad y el cumplimiento de nivel empresarial, Talent Tech Global Limited opera específicamente como nuestra entidad global de facturación y contratación. Mientras tanto, nuestra infraestructura técnica central y nuestros equipos de I+D están distribuidos estratégicamente en centros de innovación globales, incluidos Silicon Valley, Singapur y Hong Kong.

Construido a escala:

Entendemos que la estabilidad es primordial. Nuestra plataforma se basa en una arquitectura robusta y descentralizada que admite el escalado automático dinámico. Ya sea que esté ejecutando una prueba piloto o manejando millones de solicitudes simultáneas, nuestro sistema se expande instantáneamente para satisfacer la demanda, garantizando que su negocio nunca supere nuestra infraestructura.

Navegación

  • Panel
  • Modelo
  • Generador de imágenes IA
  • Escalado de imagen IA
  • Eliminador de fondo IA
  • Generador de vídeo IA
  • AI Canvas
  • Funciones
  • Precios
  • Documentación IA
  • Blog IA
  • Perspectivas IA
  • Habilidades IA

Funciones

  • IA de anime a la vida real
  • Generador de Arte Anime con IA
  • Eliminador de objetos con IA
  • Editor de imágenes con IA
  • Generador de imágenes con IA sin restricciones
  • Transferencia de movimiento con IA
  • Removedor de ropa con IA
  • Eliminador de marcas de agua con IA
  • Mejorador de imágenes con IA en línea
  • Herramienta online para eliminar fondos
  • Imagen de intercambio de rostros con IA
  • Creador de fotos de pasaporte con IA
  • Generador de IA de MS Paint
Explore all features >

LLM

  • Claude Opus 5
  • Gemini 3.6 Flash
  • Gemini 3.5 Flash Lite
  • Kimi K3
  • GPT 5.6 Luna
  • GPT 5.6 Terra
  • GPT 5.6 Sol
  • Grok 4.5
  • Claude Sonnet 5
  • Minimax M3
  • GLM 5.2
  • GPT 5.1 Chat Latest
  • Claude Fable 5
  • Qwen3.7 Max
  • Claude Opus 4.8 Thinking
  • Claude Opus 4.8
  • Gemini 3.5 Flash
  • DeepSeek v4 Flash
  • DeepSeek v4 Pro
  • Grok 4.3
Más modelo

Imagen IA

  • Dola Seedream 5.0 Pro 260628
  • Gemini 3.1 Flash Lite Image
  • Gemini 3.1 Flash Image
  • GPT Image 2
  • Gemini 3.1 Flash Image Preview
  • Seedream 5.0 260128
  • Doubao Seedream 5.0 260128
  • Vidu Q2
  • Grok Imagine Image
  • Kling Image O1
  • GPT Image 1.5
  • Seedream 4.5 251128
  • Doubao Seedream 4.5 251128
  • Grok Imagine 0.9
  • Gemini 3 Pro Image Preview
  • Qwen Image Lora
  • Qwen Image Plus Lora
  • Qwen Image Plus
  • Grok 4 Image
  • GPT Image 1 Mini
Más modelo

Vídeo IA

  • Kling v3.0 4k
  • Dreamina Seedance 2.0 Mini 260615
  • Kling v3 Omni 4k
  • Dreamina Seedance 2.0 Fast 260128
  • Dreamina Seedance 2.0 260128
  • Vidu 2.0
  • Doubao Seedance 2.0 260128
  • Doubao Seedance 2.0 Fast 260128
  • Kling v3 Omni Pro
  • Kling v3 Omni Std
  • Vidu Q3 Turbo
  • Kling v3.0 Pro
  • Kling v3.0 Std
  • Vidu Q3 Pro
  • Kling v2.6 Std
  • Vidu Q2 Pro
  • Vidu Q2 Turbo
  • Vidu Q2 Pro Fast
  • Vidu Q2
  • Kling Video O1 Pro
Más modelo

© 2026 Talent Tech Global Limited (Hong Kong) / Talent Tech Global LLC (US). Todos los derechos reservados.

  • Sobre nosotros
  • política de privacidad
  • Términos de servicio
  • Mapa del sitio