Schuyler Stacy2026-06-24

¿Qué es Wan 2.7? Guía del modelo con modo de razonamiento de Alibaba (2026)

La mayoría de las guías dicen que Wan 2.7 es de código abierto. Las pruebas oficiales indican lo contrario. Qué incluye realmente el modelo de Alibaba de abril de 2026 y cómo ejecutarlo.

¿Qué es Wan 2.7? Guía del modelo con modo de razonamiento de Alibaba (2026)

Busca "wan 2.7" y obtendrás dos respuestas que no pueden ser ciertas al mismo tiempo. Un grupo de guías te dice que descargues los pesos y lo ejecutes en tu propia GPU. Otro afirma que solo puedes acceder a él mediante una API. Me puse a investigar cuál de las dos es correcta, porque la respuesta determina si puedes alojar este modelo por tu cuenta —y la versión corta es que la mayoría de las publicaciones categóricas que dicen que "es de código abierto" están repitiendo una costumbre, no un hecho. Esto es lo que realmente es Wan 2.7, lo que Alibaba ha publicado y lo que no, y cómo poner hoy un modelo Wan en producción.

Tabla de contenido

Qué es realmente Wan 2.7

Wan 2.7 no es un único modelo. Es una oleada de lanzamientos de Tongyi Lab, de Alibaba, que llegó a principios de abril de 2026 y abarca dos medios a la vez. Está la vertiente de imagen —Wan2.7-Image y un Wan2.7-Image Pro independiente, que los materiales de lanzamiento sitúan alrededor del 1 de abril— y la vertiente de vídeo, una suite de cuatro modelos que cubre texto a vídeo, imagen a vídeo, referencia a vídeo y edición de vídeo basada en instrucciones, cuyo lanzamiento se produjo durante los días siguientes. Ese alcance doble explica exactamente por qué la SERP se contradice sobre si Wan 2.7 es un "modelo de imagen" o un "modelo de vídeo". Es ambas cosas, publicadas juntas bajo un mismo número de versión.

Vale la pena precisar el propio nombre, porque suele causar confusión. "Wan" es la abreviatura internacional de Tongyi Wanxiang (通义万相), la línea de IA creativa de Alibaba. Está junto a los modelos de lenguaje Qwen bajo el mismo techo corporativo, pero es una familia de productos diferente. Por eso, cuando una plataforma de alojamiento clasifica Wan bajo una ruta qwen, se trata de una decisión de catalogación, no de una afirmación de que Wan sea un modelo Qwen.

En una línea: Wan 2.7 es la oleada de generación de imágenes y vídeo de Alibaba de abril de 2026, encabezada por una función que denomina Modo de razonamiento.

Cómo funciona el Modo de razonamiento

Antes del mecanismo, veamos por qué existe. Un modelo de vídeo estándar transforma directamente tu solicitud en fotogramas. No hace una pausa para razonar sobre lo que le has pedido: lee el texto, elige un recorrido por su espacio latente y decodifica. Eso funciona bien para una toma limpia y única. Se vuelve frágil en cuanto pides algo con estructura: una secuencia de varias tomas, un personaje que tenga que verse igual en la toma tres que en la uno, o un movimiento de cámara que deba resolverse en un momento concreto. El modelo se precipita con el encargo y las uniones quedan a la vista.

El Modo de razonamiento, tal como lo describe Alibaba, inserta una etapa de planificación antes de la generación. Primero, el modelo crea un plan compositivo —cómo interpretar la intención de la solicitud, cómo se relacionan los elementos en el espacio y el tiempo, cuál debe ser la lógica de la toma— y solo después genera. La propuesta es obtener menos artefactos y una mejor coherencia a lo largo de una secuencia.

Yo consideraría el tamaño de esa mejora una cuestión abierta y no una cifra establecida; volveré a explicar por qué dentro de un momento. Pero la idea de diseño es sólida y es lo verdaderamente nuevo aquí. La conclusión: el Modo de razonamiento intercambia algo de velocidad por una fase de planificación, algo que importa sobre todo cuando tu solicitud tiene más de un elemento en movimiento.

Capacidades principales y cuánto confiar en cada cifra

Aquí es importante distinguir los niveles de confianza, porque la lista de capacidades de Wan 2.7 procede casi por completo de las propias notas de lanzamiento de Alibaba, y las cifras de los proveedores merecen una etiqueta.

Alibaba afirma lo siguiente: consistencia de personajes suficiente para mantener un rostro a lo largo de un clip (su solución al problema de la "misma cara de la IA"), control preciso del color que acepta valores HEX y paletas, renderizado de textos largos de más de 3.000 tokens en 12 idiomas, incluidas tablas y fórmulas dibujadas en los fotogramas, control narrativo de varias tomas, orientación mediante el primer y el último fotograma, referencia a vídeo con hasta nueve imágenes de referencia y audio nativo generado en la misma pasada. Esas son afirmaciones del proveedor, presentadas como tales. No he podido verificarlas con una prueba neutral.

En cuanto a las especificaciones técnicas, la imagen es más difusa de lo que admiten la mayoría de las publicaciones. La resolución de salida se cita como 720p o 1080p según dónde lo ejecutes, la duración de los clips se sitúa entre 2 y 15 segundos, y el modelo de imagen es la parte que incluye la cifra de 4K. Estos valores varían según el proveedor de alojamiento, así que considera cualquier cifra aislada como "cierta en esa plataforma" y no como "cierta para el modelo". La generación tampoco es instantánea: los primeros informes prácticos la describen como notablemente más lenta que los modelos de vídeo ligeros, un coste silencioso de la fase de planificación que conviene presupuestar si vas a renderizar a gran escala.

Y está la carencia honesta: mientras escribo esto, no he encontrado Wan 2.7 en ninguna clasificación neutral; no hay una entrada en Artificial Analysis Video Arena ni una puntuación VBench publicada para esta versión. Eso no significa que sea malo. Significa que las afirmaciones sobre su calidad siguen siendo exclusivamente informes del proveedor. El punto de referencia verificable más cercano es su linaje: Wan 2.1 encabezó VBench en su lanzamiento de febrero de 2025, un resultado real de un modelo anterior, no un sustituto de 2.7.

Tipo de afirmación Ejemplos Cuánto confiar en ella
Verificable ahora 2.1/2.2 tienen pesos abiertos; 2.1 encabezó VBench en su lanzamiento Confirmado en repositorios oficiales y en el benchmark
Informado por el proveedor Mejoras del Modo de razonamiento, especificaciones de color/texto/consistencia Palabra de Alibaba; todavía no hay una prueba neutral
Varía según el proveedor 720p/1080p, 2–15 s, 4K (imagen) Depende de la plataforma, no es una especificación fija del modelo

¿Wan 2.7 es de código abierto?

Respuesta corta: no de la forma en que la serie Wan ha acostumbrado a esperarlo a todo el mundo.

Este es el hecho. Wan 2.1 (febrero de 2025) y Wan 2.2 (julio de 2025) se publicaron con pesos abiertos bajo Apache 2.0: descargables, autoalojables y ajustables, sin restricciones comerciales. Puedes confirmarlo tú mismo en la organización Wan-AI en Hugging Face y en la organización Wan-Video en GitHub. Ese historial de pesos abiertos es real y explica por qué tantas guías dan por hecho que 2.7 también es abierto.

Este es el segundo hecho. Esos mismos canales oficiales —la organización de GitHub, la organización de Hugging Face y el propio ModelScope de Alibaba— no ofrecen los pesos de Wan 2.7. Mientras escribo esto, el lanzamiento más reciente con pesos abiertos en el recorrido oficial sigue siendo la familia Wan 2.2 (los modelos de texto a vídeo e imagen a vídeo A14B, el TI2V 5B, además de las variantes S2V y Animate posteriores). El registro oficial de noticias de ese repositorio se detiene mucho antes de cualquier entrada de 2.7.

Así que, cuando una página te diga que Wan 2.7 tiene "pesos abiertos bajo Apache 2.0", comprueba si enlaza a un repositorio real de pesos oficiales. En todos los casos que he rastreado, no lo hacía: la afirmación se apoyaba en la reputación de la serie, y al menos una fuente muy citada se contradecía en sus propias páginas. Mi lectura es que Wan 2.7 sigue la ruta exclusiva de API que Alibaba ya adoptó con Wan 2.5 y 2.6, no la ruta abierta de 2.1 y 2.2. Lo consideraría una conclusión, no un dogma: si Alibaba sube los pesos la semana que viene, esto cambiará; pero hoy las pruebas verificables apuntan en una dirección.

En la práctica, esto conduce a una decisión clara. Si tu proyecto necesita realmente los pesos —inferencia local, ajuste fino o datos que no pueden salir de tu infraestructura— Wan 2.7 no te los ofrece hoy, y tu verdadera opción abierta sigue siendo Wan 2.2. Si puedes trabajar mediante una API, 2.5, 2.6 y 2.7 están disponibles de esa manera. No elijas 2.7 esperando una descarga que no existe.

¿Qué modelo Wan deberías usar realmente?

La familia se divide claramente cuando dejas de tratar "el más reciente" como "el mejor para ti".

Versión Acceso Resolución / duración Aspecto destacado Elígelo cuando
Wan 2.2 Pesos abiertos (Apache 2.0) 720p, ~5 s MoE, funciona en una 4090 Necesitas autoalojarlo o ajustarlo
Wan 2.5 Solo API 1080p, ~10 s Audio nativo Quieres audio sin autoalojamiento
Wan 2.6 Solo API 1080p, hasta 15 s Varias tomas, identidad del personaje Necesitas clips más largos y con varias tomas
Wan 2.7 Solo API 720p/1080p, 2–15 s Modo de razonamiento, primer/último fotograma, imagen+vídeo Quieres planificación + control de referencias mediante API

¿Dónde se sitúa Wan 2.7 frente a modelos que no son de Wan? En el vídeo de código abierto, la línea Wan ha sido el punto de referencia desde 2.1; ese linaje es su verdadera baza. Entre los modelos de API cerrados, el diferenciador de 2.7 es el Modo de razonamiento junto con la pila compartida de imagen y vídeo, no una ventaja de calidad demostrada frente a los demás modelos de API actuales. Deliberadamente no incluyo cifras en una tabla de Wan 2.7 frente a Seedance o Kling, porque todavía no existe un benchmark neutral que respalde una comparación y no voy a inventarla. Si quieres una comparación directa real, merece su propio análisis probado, no una fila improvisada en un artículo explicativo.

Cómo usar hoy un modelo Wan mediante API

Hablemos claro: si estás leyendo esto en GPT Proto, ten en cuenta que 2.7 no está incluido en el catálogo; el modelo alojado más cercano con el mismo perfil (1080p, varias tomas y audio nativo) es Wan 2.6, a 0,45 $ por ejecución. Esta es una solicitud que realmente funciona con él.

Hay varios detalles importantes que conviene señalar antes de pegar nada, porque han hecho perder tiempo a algunas personas. Primero, la autenticación utiliza un token Bearer: estos endpoints de Wan se encuentran en la ruta /api/v3/alibaba/ y esperan Authorization: Bearer $KEY, no una clave sin más. Segundo, la URL del sitio web clasifica el modelo bajo /qwen/, pero la ruta de la API utiliza alibaba: es un segmento diferente para el mismo modelo. Tercero, es una llamada asíncrona en dos pasos: haces POST para enviar el trabajo y recibes un id; después haces GET al endpoint de resultados para consultar su estado. Cuarto, los parámetros varían entre modelos: 2.6 acepta audio y shot_type, mientras que 2.2-plus y 2.5 utilizan enable_prompt_expansion y no aceptan aquellos.

# 1. Submit the job
curl --request POST "https://gptproto.com/api/v3/alibaba/wan-2.6/text-to-video" \
  --header "Authorization: Bearer $GPTPROTO_API_KEY" \
  --header "Content-Type: application/json" \
  --data '{
    "prompt": "A first-person POV gliding through a damp stone tunnel toward a bright exit. [0-3s] fast forward motion, light at the end growing. [3-5s] emerge into a sunlit forest, a waterfall on the right. Sound: heavy breathing, then birdsong.",
    "negative_prompt": "",
    "size": "1920*1080",
    "duration": 5,
    "prompt_extend": true,
    "audio": "",
    "shot_type": "",
    "seed": 1
  }'
# -> returns a prediction id
 
# 2. Poll for the result
curl --request GET "https://gptproto.com/api/v3/predictions/$RESULT_ID/result" \
  --header "Authorization: Bearer $GPTPROTO_API_KEY"

El mismo flujo en Python, con el bucle de consulta escrito explícitamente:

import os, time, requests
 
KEY = os.environ["GPTPROTO_API_KEY"]
HEADERS = {"Authorization": f"Bearer {KEY}", "Content-Type": "application/json"}
BASE = "https://gptproto.com/api/v3"
 
payload = {
    "prompt": (
        "A first-person POV gliding through a damp stone tunnel toward a bright exit. "
        "[0-3s] fast forward motion, light at the end growing. "
        "[3-5s] emerge into a sunlit forest, a waterfall on the right. "
        "Sound: heavy breathing, then birdsong."
    ),
    "negative_prompt": "",
    "size": "1920*1080",
    "duration": 5,
    "prompt_extend": True,
    "audio": "",
    "shot_type": "",
    "seed": 1,
}
 
submit = requests.post(f"{BASE}/alibaba/wan-2.6/text-to-video",
                       headers=HEADERS, json=payload).json()
result_id = submit["id"]
 
while True:
    r = requests.get(f"{BASE}/predictions/{result_id}/result", headers=HEADERS).json()
    if r.get("status") in ("succeeded", "failed"):
        print(r)
        break
    time.sleep(5)

La facturación aumenta según la configuración, no con una tarifa fija por clip: la resolución, la duración y el audio modifican el importe, por eso la vista previa de 1080p/10 s cuesta más que la tarifa base de 0,45 $. Cada modelo Wan alojado muestra su tarifa actual en su propia página, y todos comparten un mismo saldo con el resto del catálogo, así que no tienes que gestionar cuentas separadas para probar 2.5 frente a 2.6.

Cómo escribir prompts para el Modo de razonamiento

Como 2.7 planifica antes de renderizar, los prompts que mejor funcionan se parecen menos a una lista de palabras clave y más a un briefing. Dale intención y estructura. Un esquema de escenas con marcas de tiempo —[0-3s] … [3-5s] …— proporciona a la fase de planificación algo concreto en torno a lo que organizarse, el mismo patrón que utiliza el código funcional anterior. El audio forma parte del mismo prompt: una indicación breve de Sound: ("heavy breathing, then birdsong") activa la pista de audio nativa en lugar de requerir una llamada independiente. Y utiliza negative_prompt para evitar el fallo que realmente esperas —"no glowing plants, no warped hands"— en lugar de dejarlo vacío. Nada de esto es exótico; simplemente consiste en escribir para un modelo que lee todo el briefing antes de empezar.

Quién debería usarlo y quién no

Si necesitas pesos abiertos —autoalojamiento, ajuste fino o datos que permanezcan dentro de tu infraestructura— Wan 2.7 no es la elección correcta hoy, y Wan 2.2 sí lo es. Si quieres generación controlable de imágenes y vídeo mediante una API y puedes aceptar un modelo cerrado y un renderizado más lento, 2.7 es una opción razonable, con la salvedad honesta de que su ventaja de calidad es hasta ahora una afirmación de Alibaba, no una medición. Y si estás creando un prototipo con un presupuesto limitado, los niveles Wan alojados más económicos te permitirán empezar por unos céntimos por ejecución antes de comprometerte. Adapta el modelo a la restricción, no al número de versión.

Creative Studio

Genera imágenes, videos y más con APIs de producción.

Comenzar a crear
Creative Studio
Modelos relacionados
Todos los modelos
Qwen
by Qwen
10% OFF
Qwen
by Qwen
10% OFF
Claude
20% OFF
Google
40% OFF

Preguntas frecuentes

¿Wan 2.7 es de código abierto?

No según las pruebas disponibles. Wan 2.1 y 2.2 tienen pesos abiertos bajo Apache 2.0; los pesos de Wan 2.7 no están publicados en los canales oficiales de Alibaba en Hugging Face, GitHub o ModelScope al momento de escribir esto. Considéralo exclusivo para API hasta que aparezcan pesos oficiales.

¿Cuándo se lanzó Wan 2.7?

A principios de abril de 2026: los modelos de imagen alrededor del 1 de abril y la suite de vídeo durante los días siguientes.

¿Wan 2.7 es un modelo de imagen o de vídeo?

Ambos. El lanzamiento incluye modelos de imagen (Wan2.7-Image / Image Pro) y una suite de vídeo de cuatro modelos.

Wan 2.7 frente a Wan 2.2: ¿cuál es la diferencia?

2.2 tiene pesos abiertos, funciona a 720p y se ejecuta localmente. 2.7 solo está disponible mediante API, añade el Modo de razonamiento, control del primer y último fotograma, referencia a vídeo y generación de imágenes. Son herramientas diferentes para restricciones diferentes.

¿Wan 2.7 es mejor que otros modelos de vídeo?

No está demostrado en benchmarks neutrales. Todavía no existe una entrada en Artificial Analysis ni en VBench, así que cualquier afirmación de que es "mejor que X" es actualmente un informe del proveedor.

¿Puedo ejecutar Wan 2.7 localmente?

No hoy: no hay pesos publicados. Para una implementación local, utiliza Wan 2.2.

¿Cuánto cuesta mediante API?

Depende de la resolución, la duración y el audio. El modelo alojado más cercano, Wan 2.6, comienza en 0,45 $ por ejecución.

Artículos relacionados

Más blogs
wan.2.2: El estándar del vídeo generativo

wan.2.2: El estándar del vídeo generativo

TL;DR El modelo wan.2.2 prioriza la integridad visual y el cumplimiento estricto de las indicaciones por encima de la velocidad de generación. Requiere un hardware considerable, pero recompensa a los creadores con resultados de vídeo generativo fiables y sin artefactos. Los modelos de vídeo generativo suelen priorizar la velocidad a costa de la coherencia visual. Escribes una descripción detallada de la escena, esperas unos minutos y recibes un clip lleno de rostros deformados y movimientos poco naturales. Los creadores de wan.2.2 adoptaron un enfoque diferente. Construyeron un sistema que respeta los detalles estéticos del material de origen y calcula cuidadosamente los vectores de movimiento para evitar el desplazamiento de píxeles. Ejecutar esta arquitectura de forma nativa requiere una gran potencia de cálculo. Necesitarás una GPU de gama alta para procesar los parámetros de manera eficiente, por lo que muchos profesionales delegan el trabajo pesado en API robustas. Al dejar atrás las limitaciones del hardware local, puedes integrar herramientas como ComfyUI, SVI Pro y PainterI2V para hacer que el modelo se comporte exactamente como lo imaginas. Conseguir resultados cinematográficos implica mirar más allá de la restricción inicial de cinco segundos de salida. Al encadenar clips y utilizar la interpolación de fotogramas nativa, puedes construir secuencias coherentes y de alta resolución que realmente coincidan con tus indicaciones de texto iniciales.

Schuyler Stacy | 2026-03-02

Wan 2.5: El futuro de la generación de videos con IA en 4K

Wan 2.5: El futuro de la generación de videos con IA en 4K

La producción de video está experimentando un cambio sísmico, y Wan 2.5 se encuentra en el epicentro de esta transformación. A medida que la demanda de contenido visual de alta calidad se dispara, los creadores necesitan herramientas que ofrezcan resultados cinematográficos sin presupuestos de Hollywood. Wan 2.5 responde a esta necesidad utilizando IA avanzada para convertir texto e imágenes en impresionantes secuencias de video 4K. Desarrollado para superar las limitaciones de las generaciones anteriores, este modelo ofrece movimiento realista, clips de mayor duración y flexibilidad de doble modalidad. En esta reseña exhaustiva, analizamos en profundidad cómo Wan 2.5 está redefiniendo el panorama de la generación de videos con IA.

Michael Johnson | 2026-03-02

Guía de WAN 2.5: análisis profundo del modelo de video de IA más reciente y sus funciones

Guía de WAN 2.5: análisis profundo del modelo de video de IA más reciente y sus funciones

Resumen : WAN 2.5 representa un importante punto de inflexión en el panorama del video con IA, ya que combina funciones profesionales en 1080p con un precio asequible que desafía a grandes competidores como Sora. La aparición de WAN 2.5 ha encendido un debate importante sobre el futuro del desarrollo de código abierto frente al crecimiento a escala cerrada. Aunque el abandono de los pesos abiertos ha frustrado a algunos desarrolladores, el modelo sigue siendo una herramienta potente para creadores que buscan movimiento consistente y síntesis de video de alta fidelidad. Técnicamente, WAN 2.5 ofrece una sincronización impresionante entre audio y elementos visuales, junto con compatibilidad avanzada con fotogramas clave que brinda a los directores un mayor control. Al integrar estas capacidades en un flujo de trabajo rentable, se posiciona como una solución práctica para las industrias modernas del marketing y los videojuegos.

Tiffany Layne | 2026-03-17

Wan Video: Dominar la generación de código abierto

Wan Video: Dominar la generación de código abierto

TL;DR El mercado de la inteligencia artificial generativa suele obligar a los creadores a contratar suscripciones costosas y propietarias para acceder a funciones de primer nivel. El wan video de Alibaba rompe con ese ciclo al ofrecer un modelo de código abierto capaz de renderizar secuencias muy fluidas de texto a video y de imagen a video. Ya no tienes que adivinar qué ocurre dentro de la caja negra algorítmica. Como los pesos están disponibles públicamente, los desarrolladores y artistas digitales pueden ejecutar el software en tarjetas gráficas de consumo o escalarlo mediante sólidas canalizaciones de API. Este nivel de acceso reduce drásticamente la barrera de entrada para la narración cinematográfica. Obtener buenos resultados aún requiere una intención técnica. El éxito depende en gran medida de cómo estructures tus prompts, describas los movimientos de cámara y gestiones las limitaciones del hardware para mantener la consistencia temporal en cada fotograma.

Schuyler Stacy | 2026-03-17