Si desarrollas con API de video, probablemente hayas notado que la respuesta a «¿qué modelo gestiona mejor el movimiento humano?» suele ser un encogimiento de hombros: «depende, ambos son excelentes». Esa respuesta no sirve cuando tienes que lanzar algo. Así que aquí tienes la versión más precisa a la que llegué después de revisar las notas de lanzamiento de ambos laboratorios y los datos independientes de las arenas.
En resumen: No hay un ganador único, porque «copiar el movimiento humano» en realidad implica dos tareas diferentes, y cada modelo domina una de ellas:
- Si quieres generar movimientos humanos creíbles a partir de un prompt de texto — alguien bailando, corriendo a toda velocidad o lanzando un puñetazo, sin que las extremidades se conviertan en espagueti — elige Kling 3.0.
- Si quieres replicar una actuación específica de un clip de referencia en un personaje o escena nuevos — «haz que se muevan exactamente así» — elige Seedance 2.0.
Elige el modelo equivocado para el trabajo y lucharás contra él durante todo el proceso. Elige el correcto y, en gran medida, dejará de interponerse en tu camino. El resto de este artículo presenta las pruebas de esa división, una tabla comparativa de especificaciones, código de API ejecutable para ambos y una recomendación para cada escenario.
Primero, aclaremos qué significa «copiar movimiento»
La mayoría de las comparaciones mezclan dos capacidades que parecen similares, pero funcionan de maneras completamente distintas.
La primera es la síntesis de movimiento: describes una acción con palabras y el modelo inventa la física — los ángulos de las articulaciones, el desplazamiento del peso y la continuación del movimiento. Aquí es donde históricamente el video generado por IA se desmoronaba. La acción humana rápida es lo más difícil de falsificar, porque tu vista está entrenada para reconocerla. Un codo ligeramente incorrecto se percibe como «incorrecto» al instante, incluso para quienes no son expertos. Cuando alguien dice que un clip parece «de IA», normalmente la causa es un movimiento humano defectuoso.
La segunda es la transferencia de movimiento: entregas al modelo una referencia — una imagen, un clip, a veces una voz — y le pides que incorpore ese movimiento o identidad exactos en una nueva generación. Aquí el modelo no inventa el movimiento; lo copia y lo adapta. Es otro problema, otra arquitectura y otro ganador.
Mantén separadas estas dos capacidades y toda la comparación deja de ser confusa. Kling 3.0 está diseñado para destacar en la primera. Seedance 2.0 está diseñado para destacar en la segunda. Todo lo que sigue se deriva de esa diferencia.
Especificaciones comparadas
Ambos modelos se lanzaron con pocos días de diferencia a principios de 2026 y los dos son realmente capaces, así que la hoja de especificaciones está más igualada de lo que sugiere el marketing.
| |
Kling 3.0 |
Seedance 2.0 |
| Laboratorio |
Kuaishou |
ByteDance (Dreamina / Doubao / CapCut) |
| Lanzamiento |
5 de febrero de 2026 (Kuaishou) |
Febrero de 2026; lanzamiento en CapCut el 26 de marzo (TechCrunch) |
| Resolución máxima |
4K nativo, 3840×2160 (Kuaishou) |
1080p en el lanzamiento, 4K añadido posteriormente (BytePlus) |
| Frecuencia de fotogramas |
Hasta 60 fps (Kuaishou) |
No especificada oficialmente |
| Duración máxima |
15 s (Kuaishou) |
15 s, seis relaciones de aspecto (TechCrunch) |
| Multiplano |
Hasta 6 planos en un clip, al estilo de un director (Kuaishou) |
Creación de secuencias mediante múltiples entradas de referencia |
| Audio nativo |
Música, efectos de sonido y sincronización labial en 5 idiomas (Kuaishou) |
Diálogo, efectos de sonido y música nativos (BytePlus) |
| Entradas de referencia |
Texto / imagen / video / audio (arquitectura MVL) |
Imágenes + clips de video + audio fusionados en una sola ejecución (BytePlus) |
| Disponibilidad en EE. UU. |
Disponible |
No disponible en EE. UU. durante el lanzamiento (revisión de derechos de autor) (TechCrunch) |
Una nota sobre la fila de resolución antes de darle demasiada importancia: el 4K nativo a 60 fps de Kling es la cifra más alta sobre el papel, y Kuaishou deja claro que se renderiza en 4K, no que se escala. Pero casi nadie que genere clips cortos para redes sociales o anuncios necesita 4K/60: estás pagando tiempo y dinero de renderizado por píxeles que la propia compresión de la plataforma termina destruyendo. Considera el 4K como algo conveniente para el trabajo ocasional de emisión o pantalla grande, no como el factor que decide este enfrentamiento.
Ronda 1: generar movimiento humano a partir de un prompt — Kling 3.0
Este es el terreno de Kling y la razón por la que vale la pena plantearse la pregunta sobre el movimiento humano.
Kuaishou reconstruyó Kling 3.0 sobre lo que denomina una arquitectura de Lenguaje Visual Multimodal (MVL), que procesa texto, imagen, audio y video dentro de un mismo sistema en lugar de combinar herramientas independientes. La afirmación que me interesa — y es una afirmación del proveedor, así que valóralo en consecuencia — es que el modelo mantiene la anatomía humana coherente durante acciones rápidas y complejas. El tema recurrente en los análisis independientes de primera mano lo respalda: acciones complejas como bailar, correr y practicar artes marciales presentan muchos menos fallos de extremidades que se deforman y dedos adicionales, problemas que afectan precisamente a este escenario.
Mi lectura, tomando el consenso de los reseñadores como una pista y no como un dogma: si tu prompt es «una bailarina hace un giro completo y aterriza», Kling es la opción más segura para obtener una toma limpia en los primeros intentos. También sigue las instrucciones con precisión — movimientos de cámara, iluminación y texto en pantalla — por lo que lo que generes necesitará menos trabajo de limpieza antes de poder utilizarse.
¿El precio de ese control? Kling es más literal. Dale un prompt impreciso y ambicioso del tipo «sorpréndeme», con una escena caótica, y tenderá a seguir más la instrucción literal que la atmósfera que buscabas. Te recompensa por escribir prompts como un director y castiga los prompts vagos con resultados planos.
Ronda 2: copiar movimiento desde una referencia — Seedance 2.0
Ahora cambia el trabajo. No describes el movimiento con palabras; tienes un clip con exactamente el movimiento que quieres y necesitas transferirlo.
La característica definitoria de Seedance 2.0 es la fusión multimodal de referencias. La explicación de ByteDance es que combina imágenes, videos y audio como referencias en una sola generación, además de ofrecer edición localizada y extensión de video. La cobertura de TechCrunch añade el detalle concreto: puedes dirigir una generación a partir de un video de referencia, no solo de una imagen fija, y el modelo renderiza a partir de él texturas, movimientos e iluminación realistas. En términos sencillos: si el encargo es «imita esta actuación», esta es la herramienta diseñada específicamente para ello. Kling puede animar a partir de una imagen, pero no ofrece la misma profundidad de «bloquea esta referencia y respétala». En GPT Proto concretamente, el modo de generación basada en referencias está documentado como una capacidad exclusiva de Seedance; Kling ofrece modos dirigidos por prompts, no la misma ruta de fusión de referencias.
Ese diseño basado en referencias también explica por qué Seedance encabeza la clasificación independiente. La arena de video de Artificial Analysis, que clasifica los modelos mediante votos humanos a ciegas sobre prompts idénticos, coloca a Dreamina Seedance 2.0 en el n.º 1 de texto a video con audio (Elo de aproximadamente 1.219) y en el n.º 1 de imagen a video (aproximadamente 1.344) a mediados de 2026, por delante de Kling 3.0 Pro, que ronda los 1.105 en la clasificación de texto a video con audio. Así que, en cuanto a la calidad del resultado preferido, Seedance está claramente por delante.
Dos salvedades importantes, porque esa clasificación no cuenta toda la historia. Primero, desactiva el audio y la tabla cambia radicalmente: Seedance baja aproximadamente al n.º 4 y Kling al n.º 5, por detrás de otros modelos, lo que indica que parte de la ventaja de Seedance se debe a que la gente prefiere su sonido integrado, no únicamente sus imágenes. Segundo, y este es el punto más importante para quienes crean con API: Seedance no estaba disponible en EE. UU. durante el lanzamiento. ByteDance pausó la distribución más amplia por disputas de derechos de autor con estudios de Hollywood e incorporó medidas de protección: no genera a partir de rostros reales e incluye una marca de agua invisible. Si tu producto presta servicio directamente a usuarios estadounidenses en la web abierta, esa brecha de disponibilidad es una limitación real de planificación, no una simple nota al pie.
Ronda 3: emoción y microexpresiones
La variante de esta pregunta que más recibo trata en realidad sobre los rostros: ¿puede hacer una sonrisa creíble que llegue a los ojos, un destello de duda o una risa genuina? Aquí tengo que ser sincero con las pruebas: ninguno de los dos laboratorios publica una evaluación de «emoción facial», y Artificial Analysis mide la preferencia general, no las microexpresiones específicamente. Así que esta sección es una valoración, señalada como tal.
Lo que puedo decir tiene una base sólida. La ventaja de Seedance en las pruebas de preferencia a ciegas aparece sobre todo en pequeños comportamientos humanos creíbles, el tipo de realismo sutil y de primer plano que sostiene las escenas emocionales. La fortaleza de Kling está en el extremo opuesto: las acciones físicas, amplias y de cuerpo entero mantienen la coherencia. Para un primer plano cerrado en el que toda la toma depende de una expresión, yo probaría primero Seedance. Para un momento emocional transmitido mediante el lenguaje corporal al otro lado de una habitación, la coherencia de movimiento de Kling suele venderlo mejor. Si la actuación facial es decisiva para tu caso de uso, no confíes en ninguno de los dos: genera la misma toma con ambos y juzga con tus propios ojos. Las API hacen que esto sea económico, y ese es precisamente el objetivo de la siguiente sección.
Pruébalos tú mismo: el código
Ambos modelos funcionan detrás de un único endpoint en GPT Proto, lo que significa que puedes comparar exactamente el mismo encargo sin tener que gestionar dos proveedores, dos claves ni dos cuentas de facturación. La generación de video es asíncrona: haces un POST con la solicitud, recibes un id, y después consultas el resultado.
Este es Kling 3.0 generando movimiento humano a partir de un prompt de texto, su punto fuerte:
import requests, time
BASE = "https://gptproto.com/api/v3"
HEADERS = {"Authorization": "GPTPROTO_API_KEY", "Content-Type": "application/json"}
def generate(path, payload):
r = requests.post(f"{BASE}/{path}", headers=HEADERS, json=payload)
r.raise_for_status()
job = r.json()["data"]
get_url = job["urls"]["get"] # e.g. https://gptproto.com/api/v3/predictions/{id}/result
# poll until the job leaves the queued/running state
while True:
res = requests.get(get_url, headers=HEADERS).json()["data"]
status = res["status"]
if status in ("succeeded", "failed", "expired"):
return res
time.sleep(5)
kling = generate(
"kling/kling-v3.0-std/text-to-video",
{
"prompt": "A martial artist performs a fast spinning kick, "
"full body in frame, weight shifting naturally on landing.",
"aspect_ratio": "16:9",
"duration": 5,
"resolution": "1080p",
"generate_audio": True,
"seed": -1,
},
)
print(kling["status"], kling.get("outputs"))
Y este es Seedance 2.0 en su modo de referencia a video, copiando el movimiento de un clip de referencia en un personaje nuevo, exactamente el trabajo que domina. Mismo asistente, ruta y carga útil diferentes:
# reference-to-video: `videos` carries the motion to copy, `images` the character
seedance = generate(
"bytedance/dreamina-seedance-2-0-260128/reference-to-video",
{
"prompt": "The character performs the exact routine from the reference video, "
"matching timing and body movement, new studio background.",
"videos": ["https://your-cdn.com/motion-reference.mp4"], # motion to replicate
"images": ["https://your-cdn.com/character.png"], # up to 10 references
"aspect_ratio": "9:16",
"duration": 5,
"resolution": "1080p",
"generate_audio": True,
"seed": -1,
},
)
print(seedance["status"], seedance.get("outputs"))
Si prefieres cURL para una prueba rápida:
curl --location 'https://gptproto.com/api/v3/kling/kling-v3.0-std/text-to-video' \
--header 'Authorization: GPTPROTO_API_KEY' \
--header 'Content-Type: application/json' \
--data '{
"prompt": "A dancer completes a full spin and lands cleanly.",
"aspect_ratio": "16:9",
"duration": 5,
"resolution": "1080p"
}'
Sustituye GPTPROTO_API_KEY por tu clave real. El modo de referencia a video de Seedance acepta matrices — videos, images (hasta 10) y audios — para que puedas fijar un clip de movimiento, un personaje y una voz en una sola llamada; según la documentación de GPT Proto, ese modo de referencia es exclusivo de Seedance aquí, y esa es la razón práctica por la que domina la copia de movimiento. Kling cubre el lado de la generación a partir de prompts mediante sus modos estándar y de control de movimiento. La compatibilidad de parámetros varía según el modelo, así que comprueba los campos exactos en la página de cada modelo antes de ejecutar una tarea en producción. La cuestión es que la estructura del endpoint, la autenticación y el ciclo de consulta son idénticos, por lo que probar el mismo encargo en ambos requiere un cambio mínimo.
Entonces, ¿cuál eliges?
- Estás generando acciones humanas a partir de texto — baile, deportes, coreografías de lucha o cualquier acción rápida de cuerpo entero: Kling 3.0. Escríbele prompts como un director y te recompensará.
- Necesitas copiar una actuación específica de un clip de referencia en un personaje o escena nuevos: Seedance 2.0. La fusión de referencias es para lo que fue creado, y la arena de votos a ciegas coincide en la calidad de los resultados.
- Tu toma depende de una expresión facial en primer plano: empieza con Seedance 2.0, pero genera con ambos y juzga por ti mismo; este es el único eje que yo no decidiría basándome en una hoja de especificaciones.
- Necesitas 4K/60 para emisión o pantalla grande: Kling 3.0 es el único que actualmente ofrece 4K nativo a 60 fps.
- Lanzas tu producto para usuarios estadounidenses en la web abierta y necesitas una disponibilidad sin complicaciones: ten en cuenta que Seedance estaba restringido durante el lanzamiento por motivos de derechos de autor; acceder a él mediante una plataforma de API es la vía práctica, pero conviene confirmarlo para tu caso concreto.
Ambos están disponibles ahora mismo mediante una sola cuenta: Kling 3.0 y Seedance 2.0. Consulta la lista completa de modelos de video si también quieres compararlos con Veo o Hailuo, y en la página de precios encontrarás los costes actuales por generación.