Ya disponible en MakeFun
Seedance 2.5: video multimodal profesional con IA
El modelo de creación de video multimodal profesional de nueva generación de ByteDance. Cuatro mejoras en un mismo lanzamiento: narrativa larga, referencias sólidas, edición precisa y multilingüe. Pensado para trabajo de producción real, para que el material sea reutilizable, entregable y repetible a gran escala.
Cuatro mejoras en Seedance 2.5
Todas las cifras de abajo proceden de las notas oficiales de lanzamiento de ByteDance. El modelo ya está disponible en MakeFun, así que lo que obtengas será el resultado de tu propia generación.
Narrativa larga
Un solo plano dura ahora 30 segundos en vez de 15. Es tiempo suficiente para sostener un arco emocional completo sin unir clips en posproducción. La extensión temporal de alta fidelidad también puede alargar material corto manteniendo coherentes el personaje, la escena y la cámara.
Referencias sólidas
Hasta 50 recursos de referencia en una sola generación, frente a 12 en Seedance 2.0. Aporta a la vez un reparto, un conjunto de localizaciones, movimientos de cámara de referencia y la música de marca; el modelo lo lee todo junto y devuelve un corte que encaja con el briefing. Rostros, expresiones y vestuario se mantienen estables entre planos.
Edición precisa
Aporta un corte existente como @video1, describe el cambio en el prompt y el modelo reescribe solo esa parte mientras todo lo demás se mantiene. Sustituye un producto, cambia el estilo del material, ajusta la edad o la expresión de un actor, elimina una marca de agua o cambia la música de fondo.
Multilingüe
Más de diez idiomas de forma nativa, así que los creadores pueden describir su intención en su propio idioma sin pasar por una traducción. Un mismo rodaje puede publicarse además en varias versiones localizadas de voz: el clip de la izquierda es la misma escena en inglés, francés, japonés, español, coreano e hindi.
Qué cambia respecto a Seedance 2.0
ByteDance dice sin rodeos que 2.5 no es un salto generacional como sí lo fue 2.0 frente a 1.5. La versión 2.0 ya aportó el gran salto de capacidad; 2.5 es un refuerzo sistemático orientado al trabajo de producción real.
| Capacidad | Seedance 2.0 | Seedance 2.5 |
|---|---|---|
| Duración de un solo plano | 15 s | 30 s |
| Recursos de referencia por generación | 12 | 50 |
| — Imágenes | 9 | 30 (hasta 4K) |
| — Clips de video | 3 | 10 |
| — Clips de audio | 3 | 10 |
| Duración total de las referencias de video/audio | 15 s | 30 s |
| Referencia solo de audio | No admitido | Admitido |
| Idiomas nativos | — | Más de 10 |
Ten claro qué tarea estás ejecutando
ByteDance le dedica un apartado propio por algo: en la práctica se mezclan referencia, edición y extensión, lo que coloca mal el prompt, cita los recursos equivocados y te cuesta control y estabilidad. Elige primero la tarea y escribe el prompt para ella.
Generación por referencia
Cuándo: no tienes ningún corte previo. Construye un video nuevo desde cero usando imágenes, video o audio como referencia.
Forma del prompt: lo que quieres generar, en texto claro, más @video N @image N @audio N para citar cada recurso.
Parámetros fijados: ninguno. La relación de aspecto y la duración las eliges tú.
Edición de video
Cuándo: ya tienes un corte y quieres reescribir, sustituir, añadir o quitar una parte.
Forma del prompt: el cambio que quieres, más @video1 para el corte de origen, opcionalmente @image N o @audio N.
Parámetros fijados: La relación de aspecto sigue exactamente a la fuente, así que nada se estira ni se recorta. La duración de salida sigue a la fuente con un margen de unos 0,3 segundos. Se recomienda MOV como formato de salida. Mantén la entrada por debajo de 20 segundos.
Extensión de video
Cuándo: ya tienes un corte y quieres continuarlo con el mismo aspecto, ritmo y estilo.
Direcciones: hacia delante desde el último fotograma, hacia atrás desde el primero, o rellenando el hueco entre dos o tres clips.
Parámetros fijados: La relación de aspecto sigue a la fuente. La duración del nuevo fragmento la fijas tú: indícala en el prompt. Aquí también se recomienda MOV.
Primer fotograma y primer-último fotograma
Aporta una imagen como fotograma inicial, o dos imágenes como fotogramas inicial y final. La relación de aspecto sigue al primer fotograma; si el final tiene otra forma, se estirará para encajar, así que usa fotogramas de la misma proporción. La duración sigue bajo tu control.
Cómo escribir prompts para 2.5
La ingeniería de prompts cambió en esta versión y el modelo espera más del texto. La recomendación de ByteDance es pensar como un director y escribir un prompt estructurado en cuatro partes.
- Cita tus recursos. Numera cada imagen, video y archivo de audio en el orden en que los subes y di para qué sirve cada uno: quién aporta el parecido, cuál es la voz, cuál da el movimiento, cuál fija la localización.
- Resumen en una línea. Sujeto, lugar, acontecimiento, género o estilo, y cualquier trabajo de cámara especial.
- Detalle golpe a golpe. Recorre los planos en orden: valen tanto las marcas de tiempo como «plano N». Describe encuadre, movimiento de cámara, acción, diálogo y efectos de sonido. Escribe en positivo.
- Cierra el prompt. Añade los detalles que atraviesan toda la pieza: objetivo y posición de cámara, entorno, voz, atmósfera.
La skill oficial de ajuste de prompts
ByteDance recomienda encarecidamente su propia skill de ingeniería de prompts para Seedance 2.5. Se instala en local mediante npx y se ejecuta dentro de tu propia ventana de chat con IA, sin ningún servicio de terceros.
npx --yes skills@latest add \
"https://arkdocs.tos-cn-beijing.volces.com/skills/" \
--skill sd25-pe \
--yes
Después escribe /sd25-pe seguido de tu borrador de prompt.
El control negativo está admitido
Puedes descartar cosas igual que pedirlas. Los subtítulos y el audio tienen sus propios interruptores («sin subtítulos en pantalla», «sin música de fondo, solo ambiente y sonido de la acción») y el audio se puede dirigir por separado como efectos, música de fondo o diálogo.
Algunas cosas que fallan sin avisar
- Las marcas de tiempo se leen mejor en unidades de un segundo. No conviene indicar una frecuencia dentro de un intervalo, como «sacude la cabeza tres veces en un segundo».
- Las rejillas de storyboard funcionan hasta unas 15 viñetas. Los monigotes o el dibujo de línea van mejor que el arte acabado, y llenar las viñetas de texto perjudica.
- La previsualización en cajas grises funciona mejor cuanto más tosca: una geometría simple montada a grandes rasgos se lee con más claridad que un modelo detallado.
- Asocia explícitamente los sujetos a los recursos. Escribir un nombre solo en la imagen y usarlo luego en el prompt invita al modelo a confundir personas.
Lo que puedes ajustar en cada generación
Estos son los controles que ByteDance expone para el modelo. Lo que ofrece el formulario de generación de MakeFun es lo que se aplica realmente a tu trabajo.
- Modo — generación por referencia, primer / primer-último fotograma, edición de video o extensión de video. Elige esto primero: determina cuáles de los ajustes de abajo dejan de estar en tus manos.
- Resolución — 480p o 720p.
- Relación de aspecto — 21:9, 16:9, 4:3, 1:1, 3:4, 9:16, o deja que el modelo decida a partir de tus recursos.
- Duración — fíjala en segundos o déjasela al modelo.
- Formato de salida — se recomienda MOV para trabajos de edición y extensión, donde conserva mejor el color, el brillo y la sincronía entre imagen y audio.
- Audio — activado o desactivado.
- Tamaño del lote — hasta 8 clips de una vez.
Documentación y API
¿Quieres integrar Seedance en tu propio producto? Los endpoints, parámetros, autenticación y facturación están en la documentación para desarrolladores de MakeFun, donde también encontrarás el acceso MCP.
Cincuenta referencias y cuántas conviene usar de verdad
El tope son 50 recursos: 30 imágenes, 10 clips de video y 10 clips de audio. ByteDance deja igual de claro que llegar al tope no es el objetivo. Las proporciones de abajo salen de su propia evaluación a gran escala.
Límites estrictos
- Imágenes: hasta 30, en 4K o menos, 30 MB cada una. JPEG, PNG, WebP, BMP, TIFF, GIF, HEIC, HEIF.
- Video: hasta 10 clips, de 480p a 4K, 200 MB cada uno. MP4 o MOV. Cada clip de 2 a 30 s, 30 s en total.
- Audio: hasta 10 clips, 15 MB cada uno. MP3 o WAV. Cada clip de 2 a 30 s, 30 s en total.
- Los presupuestos de video y audio se cuentan por separado, no se suman.
Lo que funciona de verdad
- Sujeto llevado por video o audio: de 1 a 5 recursos funciona bien. De 6 a 10 merece la pena probarlo, pero la estabilidad baja y quizá necesites varios intentos.
- Esos clips rinden mejor entre 5 y 10 segundos. Dos segundos aportan demasiado poco para identificar; treinta diluyen los rasgos y añaden ruido.
- Sujeto llevado por fotos fijas: de 1 a 8 imágenes funciona bien; de 9 a 12 merece la pena probarlo.
- Hasta 5 sujetos; valen tanto las imágenes de una vista como de varias. A partir de 5, la vista única es más estable: separa los ángulos en imágenes distintas en vez de meterlos todos en una.
Un «sujeto» es cualquier elemento central que quieras mantener estable durante todo el corte: un personaje, un producto o atrezo protagonista, la localización, el estilo general. En «alguien en un bosque disparando a un conejo con un arco», la persona, el arco y el conejo son tres sujetos.
Por qué usar Seedance en MakeFun
Empieza gratis, sin suscripción
Genera sin plan mensual. Seedance 2.5 funciona con los créditos que ya tienes y no hay que activar nada extra antes de tu primer clip.
Un solo sitio para todos los modelos
Seedance, Kling, Wan, Sora, Veo, Seedream y más comparten una cuenta y un saldo. Compáralos con el mismo briefing en vez de pagar por varias herramientas.
Pensado para entregar
La sincronía labial, la clonación de voz, el cambio de rostro y de cabeza, la eliminación de subtítulos y el escalado conviven con la generación, así que un clip pasa del prompt al material final en un solo sitio.
Modelos de video con IA relacionados en MakeFun
- Wan 3.0 — el modelo todo en uno de Tongyi Wanxiang, también disponible en MakeFun. Compara ambos con el mismo briefing.
- Seedance 2.0 — la generación anterior, con audio nativo y narración en varios planos.
- Seedance 1.5 Pro — la generación anterior, todavía una opción rápida y económica.
- Kling 2.6 y Sora 2 — modelos de video alternativos para comparar con el mismo briefing.
- Sincronía labial y video a audio — herramientas de acabado para material generado.