Puesto #1 Generación de Vídeo — Hollywood en un Cuadro de Texto
ByteDance (Seed Team)

Seedance 2.5

Un modelo de vídeo que se comporta más como un plató que como una máquina tragaperras: hasta 30 segundos en una sola generación, sonido sincronizado, un máximo de 50 referencias y ediciones puntuales cuando una parte de la toma sale mal.

Actualizado 29 de agosto de 2026 30-Second VideoSynced Audio50 References
Ideal para

Un modelo de vídeo que se comporta más como un plató que como una máquina tragaperras: hasta 30 segundos en una sola generación, sonido sincronizado, un máximo de 50 referencias y ediciones puntuales cuando una parte de la toma sale mal.

Por qué gana

Seedance 2.5 sigue siendo nuestra opción #1 de vídeo cuando el flujo de producción es prioritario y exige mucha duración y referencias. Arena ya sitúa de forma independiente su endpoint 720p en 1476±14 con 2.121 votos, mientras que su lienzo de 30 segundos y su conjunto de referencias excepcionalmente amplio continúan siendo difíciles de igualar.

Ten en cuenta

Gemini Omni cuenta con pruebas más sólidas de preferencia en varias clasificaciones, un acceso más amplio y precios transparentes. Seedance aún ofrece disponibilidad desigual, carece de una entrada 2.5 en Artificial Analysis y de una especificación de 4K nativo verificada universalmente, aplica filtros estrictos y sufre los conocidos fallos con manos, objetos y movimiento de varias personas.

01

Lo que realmente es

La mayoría de las herramientas de vídeo con IA comienzan con una palanca: se escribe un prompt, se tira de ella y se espera. Si una mano se derrite, se vuelve a tirar y se vuelve a pagar. Seedance 2.5 intenta sustituir ese casino por un plató. Ofrece al creador más tiempo, más material de referencia, sonido sincronizado y formas de reparar una sección sin desechar todo lo que la rodea.

El gran titular es un lienzo de treinta segundos en una sola pasada. La duración no crea una historia por sí sola —una cámara de seguridad puede grabar durante horas sin convertirse en cine—, pero treinta segundos conectados dejan espacio para una entrada, una acción, una reacción y una conclusión. Los modelos breves pueden imitar esa estructura uniendo clips. Seedance puede intentarlo dentro de una sola toma generada, donde el personaje, la iluminación, el ritmo y el sonido parten del mismo contexto.

Su sistema de referencias es la función de producción más importante. En un trabajo pueden entrar hasta treinta imágenes, diez vídeos y diez clips de audio. Piensa en esos archivos como un pequeño equipo de rodaje. Una imagen se encarga del reparto, otra del vestuario, un clip muestra la coreografía y una muestra de audio establece la voz o el tempo. Un render 3D sencillo puede funcionar como las marcas de posición de un escenario: indica por dónde deben desplazarse el sujeto y la cámara antes de que el modelo añada los materiales, la luz y la atmósfera.

Más pruebas también pueden generar más confusión. Si dos imágenes de referencia no coinciden sobre cómo es una habitación, o si una etiqueta del storyboard se parece a un cartel que debería aparecer en la escena, el modelo debe decidir qué pista manda. Seedance puede ser lo bastante literal como para conservar la contradicción. Una buena dirección, por tanto, asigna una función a cada referencia en vez de arrojar una maleta de materiales al modelo y esperar que lea la mente del director.

El audio y el vídeo se generan juntos. Ese reloj compartido ayuda a que una línea de diálogo coincida con un rostro, un paso suene cerca del momento en que el pie toca el suelo y la música cambie con el plano. No garantiza una sincronización labial ni una física perfectas, pero elimina el problema de ensamblar por separado las imágenes de un sistema y el sonido de otro.

La evidencia ha mejorado desde nuestra reseña anterior. Arena sitúa ahora el endpoint 720p de Seedance 2.5 en 1476±14, aproximadamente quinto en la captura de texto a vídeo del 29 de agosto, con incertidumbre suficiente para colocarlo entre el tercer y el séptimo puesto. Es una señal independiente de preferencia significativa. Artificial Analysis todavía incluye Seedance 2.0, no 2.5, de modo que los dos sistemas Elo y las dos versiones del modelo deben mantenerse separados.

Gemini Omni complica la corona. La familia Omni en sentido amplio rinde de forma excepcional en comparaciones independientes a ciegas, y Omni 1.1 añade edición conversacional, fotogramas clave, borradores baratos y precios transparentes según la resolución. Si la pregunta es «¿Qué modelo debería abrir primero la mayoría de la gente?», Omni cuenta con argumentos sólidos. Mantenemos Seedance en el #1 porque esta clasificación da prioridad al control de producción: una pasada única más larga, un conjunto de referencias mucho mayor y flujos construidos alrededor de escenas dirigidas, en vez de variantes conversacionales rápidas.

Sus limitaciones son problemas cinematográficos de siempre con un extraño disfraz nuevo. Los clips más largos dejan más tiempo para que cambie la identidad, se transformen los dedos, los objetos se atraviesen o un gesto entre varias personas se vuelva ambiguo. Los filtros pueden rechazar material que otro proveedor o una versión anterior aceptan. El coste y el comportamiento de las colas varían según la plataforma. Tampoco es seguro afirmar que existe 4K nativo universal: un proveedor puede ofrecer escalado o una resolución que los materiales centrales de ByteDance no prometen en todas partes.

Elige Seedance para anuncios, interpretaciones emocionales, previsualización, escenas con diálogo y trabajos guiados por referencias en los que el control compense una iteración más lenta o cara. Elige Omni si quieres un amplio flujo de trabajo de Google, costes claros de API y revisión conversacional. Una clasificación útil debe mostrar esta bifurcación. No debería fingir que una sola cifra puede dirigir todas las películas.

02

Puntos fuertes y límites honestos

Puntos fuertes

  • Treinta segundos pueden contener una escena de verdad: Una sola generación puede incluir planteamiento, desarrollo y desenlace, en vez de estirar una idea visual de cinco segundos. Las extensiones pueden prolongar el reparto, el entorno, el ritmo y el sonido.
  • Cincuenta referencias convierten el prompting en dirección: Hasta 30 imágenes, 10 vídeos y 10 clips de audio pueden definir por separado un personaje, el vestuario, el movimiento, el lenguaje de cámara, la voz, el ritmo y el entorno.
  • Imagen y sonido comparten una sola línea temporal: El diálogo, el ambiente, la música y los efectos se generan con el vídeo. Así resulta más fácil coordinar los pasos, el movimiento de los labios y los cambios de escena que con una pasada de audio separada.
  • Ya existe evidencia independiente de preferencia: La clasificación de texto a vídeo de Arena sitúa el endpoint 720p en 1476±14, con un intervalo de rango basado en la confianza de 3–7. Eso no demuestra un liderazgo universal, pero elimina la antigua salvedad de «sin Elo independiente».

Limitaciones honestas

  • Ya no está sin medir, pero tampoco es el campeón indiscutible de la arena: Gemini Omni 1.1 y la familia Omni más amplia se encuentran por encima en los resultados actuales de preferencia de Arena. Seedance lidera esta guía porque damos más peso a la duración larga en una sola pasada y al control mediante referencias.
  • El acceso y los precios siguen siendo menos transparentes: La disponibilidad cambia entre Dreamina, Doubao, productos regionales y proveedores externos. Una función o un precio de una plataforma no debe presentarse como garantía para todo el modelo.
  • Las tomas largas crean superficies de fallo mayores: Las interacciones complejas entre varias personas, las manos, los objetos y la física pueden desviarse. Una hermosa escena de 25 segundos puede fracasar porque un gesto altera la identidad cerca del final.
  • «4K» necesita la etiqueta del endpoint: Los materiales principales de ByteDance sobre 2.5 no establecen una salida 4K nativa universal. Algunos proveedores escalan la imagen o exponen resoluciones distintas, por lo que hay que nombrar el producto y el plan.
03

Resumen de Benchmarks

Arena texto a vídeo — 1476±14

El endpoint 720p ocupa aproximadamente el puesto #5 con 2.121 votos y un intervalo de rango basado en la confianza de 3–7 en la captura del 29 de agosto. La preferencia de Arena es independiente, pero sigue siendo sensible al crecimiento de la muestra.

Artificial Analysis Seedance 2.5 — Aún no listado

Artificial Analysis evalúa actualmente Seedance 2.0, no 2.5. No hay que transferir el Elo del predecesor a esta versión.

Duración en una sola pasada — Hasta 30 segundos

La ventaja de producción es disponer de tiempo con continuidad, no afirmar que todos los resultados de treinta segundos sean impecables.

Capacidad de referencias — Hasta 50 entradas

ByteDance documenta hasta 30 imágenes, 10 clips de vídeo y 10 clips de audio, lo que crea un flujo guiado por referencias excepcionalmente controlable.

04

El Veredicto

Seedance 2.5 se mantiene en el #1 de Vídeo con un 9,2, empatado en puntuación con Gemini Omni 1.1 Flash, pero por delante debido al propósito editorial de esta guía. Omni es la mejor opción predeterminada por su acceso amplio, su economía de API transparente, la edición conversacional y la evidencia actual de preferencias a ciegas. Seedance es el mejor punto de partida cuando el trabajo exige una escena ininterrumpida más larga, un gran paquete de referencias, interpretación emocional o un control quirúrgico de la producción. Por tanto, la clasificación responde al flujo de trabajo, no afirma que Seedance gane en todos los prompts o todas las tablas.

05

Preguntas frecuentes