⏱️ Lectura: 13 min

ByteDance duplicó de un salto la duración máxima de sus videos generados por IA: Seedance 2.5, presentado el 31 de julio de 2026, genera clips de hasta 30 segundos con audio sincronizado en una sola pasada, el doble que su antecesor.

📑 En este artículo
  1. TL;DR
  2. Introducción
  3. Qué pasó con Seedance 2.5
  4. Contexto e historia
  5. Detalles técnicos y rendimiento de Seedance 2.5
  6. Cómo empezar a probarlo
  7. Impacto y análisis
  8. Qué sigue
  9. Preguntas frecuentes
    1. ¿Qué es Seedance 2.5?
    2. ¿En qué se diferencia de Seedance 2.0?
    3. ¿Cómo lo puedo probar desde Latinoamérica?
    4. ¿Es un modelo de código abierto?
    5. ¿Cuánto cuesta usarlo?
    6. ¿Qué tipo de material acepta como referencia?
  10. Referencias

El salto no es solo de duración. El modelo ahora acepta hasta 30 imágenes, 10 videos y 10 audios como referencia en una misma generación, y permite extender un clip varias veces sin perder la consistencia de personajes ni de escenario. La promesa de ByteDance es concreta: pasar de generar un clip a completar una obra.

TL;DR

  • ByteDance lanzó Seedance 2.5 el 31 de julio de 2026, su nuevo modelo de generación de video con audio.
  • El modelo genera clips de hasta 30 segundos en un solo paso, el doble que los 15 segundos de Seedance 2.0.
  • Soporta extensión multironda para producir videos de varios minutos con personajes y estilo consistentes.
  • Acepta hasta 30 imágenes, 10 clips de video y 10 clips de audio como referencia en una sola generación.
  • Suma edición con control por timestamp, pantalla verde, cambio de perspectiva de cámara y edición por referencia.
  • Ya está disponible en Jimeng AI y Doubao Pro; el acceso vía API llegará pronto por BytePlus ModelArk.
  • Es la evolución directa de la arquitectura unificada audio-video que debutó con Seedance 2.0.

Introducción

La compañía china detrás de TikTok lleva año y medio empujando la frontera de la generación de video con inteligencia artificial a través de su equipo Seed. Con Seedance 2.5, el objetivo declarado ya no es competir por el clip más espectacular de pocos segundos, sino por la narrativa completa: una escena que arranca, se desarrolla, gira y cierra sin cortes visibles.

Esto importa para cualquier desarrollador o estudio que construya productos sobre generación de video: la unidad mínima de trabajo deja de ser un plano suelto para convertirse en una secuencia narrativa, y las herramientas de edición (pantalla verde, control por timestamp, referencia multimodal) empiezan a acercarse a un flujo de producción real, no a un generador de curiosidades.

Qué pasó con Seedance 2.5

El 31 de julio de 2026, el equipo Seed de ByteDance anunció oficialmente el lanzamiento de Seedance 2.5, construido sobre la arquitectura unificada de generación conjunta audio-video que debutó con Seedance 2.0. El anuncio destaca tres ejes de mejora: generación de formato largo con extensiones múltiples, referencia multimodal ampliada y edición más precisa y estable.

En términos concretos, el modelo puede producir hasta 30 segundos de video con audio en un solo paso (frente a los 15 segundos de la generación anterior) y encadenar múltiples rondas de extensión para producir contenido de varios minutos manteniendo un mismo lenguaje audiovisual. ByteDance lo ilustra con un ejemplo propio: un plano secuencia de una cantante que se prepara en camerinos, camina por el pasillo del backstage, se encuentra con sus bailarines y sale al escenario, todo como una sola toma continua en vez de saltos entre clips independientes.

El segundo eje es la referencia multimodal: los usuarios pueden subir hasta 30 imágenes, 10 clips de video y 10 clips de audio como material de referencia en una sola generación. El modelo refuerza además capacidades específicas como referencia de clay render (renderizado tipo arcilla), de movimiento y de estilo creativo, para sostener ideas que abarcan varios sujetos, escenas y cambios de plano.

El tercer eje es edición: Seedance 2.5 ofrece control a nivel de timestamp para edición dirigida de audio y video, y mejora funciones avanzadas como pantalla verde, cambio de perspectiva de cámara y edición basada en referencias, pensadas para flujos de trabajo profesionales de cine y publicidad.

Contexto e historia

ByteDance, la empresa detrás de TikTok y Douyin, opera su ecosistema de IA generativa a través de Doubao (su asistente conversacional) y Jimeng AI (su plataforma de creación visual). El equipo Seed es el laboratorio interno responsable de los modelos fundacionales de la compañía, entre ellos la familia Seedance de generación de video.

Seedance 2.0 introdujo la arquitectura de generación conjunta de audio y video en una sola pasada del modelo, en lugar del enfoque tradicional de generar video mudo y añadir sonido después con un modelo separado. Esa decisión de diseño es la base sobre la que se construye Seedance 2.5: al no separar audio y video en dos sistemas, extender un clip implica extender ambas pistas de forma coherente, sin resincronizar nada de forma manual.

La carrera de modelos de texto a video (y ahora de referencia a video) lleva poco más de dos años de desarrollo acelerado, con laboratorios compitiendo por duración, consistencia de personajes y calidad de movimiento. El énfasis de ByteDance en una sola toma para contar una historia completa marca una diferencia de enfoque frente a modelos que priorizan clips cortos de alta fidelidad visual pero sin continuidad narrativa entre tomas.

Escena de video generada por inteligencia artificial con Seedance 2.5
Seedance 2.5 mantiene personajes y escenario consistentes entre extensiones. Foto de National Cancer Institute en Unsplash

Detalles técnicos y rendimiento de Seedance 2.5

La pieza central de Seedance 2.5 es la extensión multironda (multi-round extension): en vez de generar un clip aislado y pedirle a otro proceso que lo continúe, el propio modelo recibe el video anterior como contexto y genera la siguiente porción manteniendo personajes, entorno, estilo visual y ritmo narrativo. ByteDance documenta esto con un ejemplo de referencia a video (R2V): a partir de un primer clip de un niño corriendo con un balón en un vagón de metro, el modelo extiende la escena 30 segundos más, con el niño bajando en una parada y siendo perseguido por el protagonista hasta la calle, conservando el mismo personaje y la misma paleta visual.

El siguiente diagrama resume el flujo de una generación con extensión: los datos de entrada (texto y referencias) alimentan al modelo, que produce un clip, y ese clip puede realimentarse al mismo modelo para producir la siguiente ronda.

flowchart TD
A["Prompt de texto"] --> D["Seedance 2.5"]
B["Hasta 30 imagenes de referencia"] --> D
C["Hasta 10 videos y 10 audios de referencia"] --> D
D --> E["Clip de hasta 30s con audio"]
E --> F{"Necesita mas duracion?"}
F -- "Si" --> G["Extension R2V desde el clip anterior"]
G --> D
F -- "No" --> H["Video final exportado"]

La tabla siguiente compara los ejes principales entre la generación anterior y la actual, según lo descrito en el anuncio oficial de ByteDance:

CaracterísticaSeedance 2.0Seedance 2.5
Duración por generaciónHasta 15 segundosHasta 30 segundos, con extensión multironda
Referencia multimodalReferencia básica de imagenHasta 30 imágenes, 10 videos y 10 audios
EdiciónLimitadaControl por timestamp, pantalla verde, cambio de perspectiva
Continuidad narrativaClips independientesHistorias con planteo, desarrollo, giro y resolución

Para estructurar un prompt de generación desde cero (texto a video, sin referencias), el formato recomendado describe la toma como un movimiento de cámara continuo, no como una lista de eventos sueltos:

Prompt T2V (texto a video, toma única):

"Plano secuencia con dron: la cámara desciende sobre un mercado
de artesanías en Oaxaca al amanecer. Una tejedora trabaja un
rebozo mientras conversa con un comprador. La cámara se acerca
a sus manos tejiendo y luego se eleva para revelar el mercado
completo despertando con la luz del sol."

Ese tipo de prompt funciona porque el modelo interpreta la escena como una sola trayectoria de cámara con eventos que ocurren dentro de ella, en vez de como cortes independientes que luego habría que unir en edición.

💭 Clave: La diferencia frente a generar y luego editar es que la extensión multironda reutiliza el propio video anterior como contexto del modelo, así que el personaje, la iluminación y el audio ambiente no se recalculan desde cero en cada ronda.

Cómo empezar a probarlo

Seedance 2.5 ya está disponible, sin lista de espera, en dos productos de ByteDance:

  • Jimeng AI: entrá a la web de Jimeng, elegí la sección Video Generation y seleccioná Seedance 2.5 en el selector de modelo.
  • Doubao Pro: dentro de la app o web de Doubao Pro, andá a Video Generation y seleccioná igualmente Seedance 2.5.

El acceso programático todavía no tiene documentación pública: ByteDance anunció que el acceso vía API llegará próximamente a través de BytePlus ModelArk, su plataforma de modelos para desarrolladores externos. Hasta que eso se publique, no hay endpoints ni parámetros oficiales para integrar Seedance 2.5 en un pipeline propio, así que cualquier ejemplo de request HTTP sería especulativo.

Lo que sí se puede preparar hoy es el diseño de los prompts de extensión, ya que la sintaxis descrita en el anuncio (referenciar un video anterior por nombre y pedir continuidad de sujetos, escena y estilo) es previsible que se mantenga en la API cuando esté disponible:

Prompt R2V (extensión con referencia a video):

"Extiende el video. Continúa desde los sujetos y el entorno de
@Video 1 y genera 30 segundos adicionales, manteniendo el mismo
personaje, la misma locación, la paleta de color y el ambiente
sonoro. La tejedora termina el rebozo, se lo entrega al
comprador y ambos caminan hacia un puesto de café al fondo del
mercado."

Para confirmar que una generación efectivamente usó Seedance 2.5 y no una versión anterior, revisá el selector de modelo antes de generar: tanto Jimeng como Doubao Pro mantienen las versiones previas disponibles en paralelo, así que el nombre del modelo debe aparecer explícito en la interfaz antes de enviar el prompt.

Impacto y análisis

Para estudios pequeños y creadores independientes, la extensión multironda reduce un cuello de botella real: hoy, producir un video de varios minutos con IA generativa implica generar clips cortos por separado y después unirlos a mano, corrigiendo cortes, iluminación y continuidad de personajes en un editor tradicional. Si la consistencia entre rondas se sostiene en la práctica, ese trabajo de posproducción se reduce.

La referencia multimodal ampliada (30 imágenes, 10 videos, 10 audios) también cambia el tipo de control que tiene el usuario. En vez de describir todo en texto y esperar que el modelo interprete correctamente el tono, la paleta o el estilo de cámara, se puede anclar la generación a material concreto: el logo de una marca, la voz de un personaje ya grabada, o el estilo de un video de referencia.

Una limitación real: por ahora, Seedance 2.5 solo está disponible en dos plataformas operadas por ByteDance desde China (Jimeng AI y Doubao Pro), sin API pública todavía. Para un equipo en Latinoamérica que quiera integrarlo en un producto propio, hoy la única opción es esperar la apertura de BytePlus ModelArk; no hay SDK, ni precio por token, ni límites de tasa publicados, lo que hace imposible planificar costos de producción con este modelo por ahora.

Interfaz de creación de video con inteligencia artificial estilo Seedance
La referencia multimodal admite hasta 30 imágenes en una sola generación. Foto de Logan Gutierrez en Unsplash
⚠️ Ojo: Sin API pública ni política de precios publicada, cualquier plan de producto sobre Seedance 2.5 hoy depende de las plataformas Jimeng y Doubao Pro, con las restricciones regionales y de idioma que eso implica.

Qué sigue

El próximo hito anunciado es el acceso vía API en BytePlus ModelArk, sin fecha exacta confirmada más allá de próximamente. Ese lanzamiento es el que determinará si Seedance 2.5 se vuelve una pieza integrable en productos de terceros (edición de video, marketing, herramientas de e-learning) o si sigue siendo, por ahora, una herramienta de consumo dentro del ecosistema de ByteDance.

También queda por verse cómo responden los demás laboratorios de video generativo a la apuesta por duración y extensión multironda en lugar de solo calidad de clip corto, y qué políticas de moderación y marca de agua aplicará ByteDance cuando abra el acceso a desarrolladores externos fuera de China.

📖 Resumen en Telegram: Ver resumen

Probalo vos: entrá a Jimeng AI o Doubao Pro, seleccioná Seedance 2.5 en el selector de modelo y generá tu primer clip de 30 segundos hoy mismo.

Preguntas frecuentes

¿Qué es Seedance 2.5?

Es el modelo de generación de video con audio más reciente del equipo Seed de ByteDance, presentado el 31 de julio de 2026, capaz de producir clips de hasta 30 segundos en una sola pasada y extenderlos en múltiples rondas.

¿En qué se diferencia de Seedance 2.0?

Duplica la duración máxima por generación (de 15 a 30 segundos), suma extensión multironda para producir videos de varios minutos, amplía la referencia multimodal a 30 imágenes, 10 videos y 10 audios, y agrega edición con control por timestamp, pantalla verde y cambio de perspectiva de cámara.

¿Cómo lo puedo probar desde Latinoamérica?

Hoy solo está disponible dentro de Jimeng AI y Doubao Pro, seleccionando Seedance 2.5 en el selector de modelo dentro de la sección de generación de video. No requiere lista de espera, pero ambas plataformas están operadas desde China.

¿Es un modelo de código abierto?

No. ByteDance no publicó pesos ni código del modelo; el acceso es exclusivamente a través de sus propias plataformas, con acceso vía API anunciado para próximamente mediante BytePlus ModelArk.

¿Cuánto cuesta usarlo?

ByteDance no publicó precios ni límites de uso para Seedance 2.5 al momento del anuncio. El precio de la API dependerá de lo que se publique cuando BytePlus ModelArk abra el acceso a desarrolladores.

¿Qué tipo de material acepta como referencia?

Hasta 30 imágenes, 10 clips de video y 10 clips de audio en una sola generación, con soporte reforzado para referencias de estilo, movimiento y renderizado tipo arcilla (clay render).

Referencias

📱 ¿Te gusta este contenido? Únete a nuestro canal de Telegram @programacion donde publicamos a diario lo más relevante de tecnología, IA y desarrollo. Resúmenes rápidos, contenido fresco todos los días.

Imagen destacada: Foto de Jesus Loves Austin en Unsplash


Andrés Morales

Desarrollador e investigador en inteligencia artificial. Escribe sobre modelos de lenguaje, frameworks, herramientas para devs y lanzamientos open source. Cubre papers de ML, ecosistema de startups tech y tendencias de programación.

0 Comentarios

Deja un comentario

Marcador de posición del avatar

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.