Ya disponible · BETA
Wan 3.0: video con IA todo en uno
El modelo de video todo en uno de nueva generación de Tongyi Wanxiang, hoy disponible en MakeFun. Toma única nativa de 30 segundos, cuatro modos de generación en un mismo sitio, hasta 20 recursos de referencia y documentos o páginas web leídos directamente para el video.
Lo que entrega el modelo
Todos los clips de abajo proceden de las demos de lanzamiento de la propia Tongyi Wanxiang, así que puedes juzgar la calidad de imagen antes de gastar nada.
Cinco cosas que hace bien
Los cinco titulares y sus cifras son de la propia Tongyi Wanxiang; los clips son sus demos. Lo que obtienes en MakeFun es el resultado de tu propia generación.
Omni-creación: hasta 20 recursos a la vez
Genera con hasta 20 recursos de referencia en un solo trabajo, incluido el análisis de documentos y páginas web complejos: doc, xls, ppt, pdf y md se leen como entrada de referencia. La ficha técnica de un producto o la página de un competidor pueden convertirse en material de partida sin reescribir nada antes.
30 segundos nativos, no unidos por montaje
Una sola toma dura ahora 30 segundos de forma nativa, lo que permite narrar de forma más completa y con más libertad creativa, con un ajuste inteligente de duración que deduce la longitud de tu prompt. Un clip puede sostener un arco emocional entero, así que los movimientos de cámara continuos y los planos secuencia tienen espacio para desplegarse.
Coherencia píxel a píxel, pensada para entregar
Reproduce con exactitud los detalles de referencia, con la vista puesta en el trabajo de producción y no en el experimento: personajes, atrezo, voces, relaciones espaciales y estilo general se mantienen estables de plano a plano. Que la misma cara sobreviva a un corte es la frontera entre una demo y algo que puedes entregar.
Imagen y sonido en una sola pasada
Realismo, textura visual y diseño sonoro suben juntos y refuerzan el impacto audiovisual. La generación de audio es un interruptor en el formulario de generación, así que imagen y sonido salen a la vez: sin pasada de musicalización aparte ni sincronización posterior.
Edición precisa: cambia una cosa y conserva el resto
La edición de video es más precisa en esta versión y admite edición por instrucciones y por referencia. Di qué parte debe cambiar (la imagen, la acción, una línea de diálogo) y el resto del corte se queda como estaba en lugar de regenerarse desde cero.
Elige el modo antes que los ajustes
MakeFun abre cuatro modos para Wan 3.0. El que elijas determina qué tienes que preparar y qué ajustes te quitan de las manos tus propios recursos.
Texto a video
Solo prompt, sin subir nada. Describe la escena, qué hace el sujeto, cómo se mueve la cámara y el ambiente que buscas, y el modelo lo construye desde cero. La forma más rápida de probar una idea.
Image to Video
Sube una imagen como primer fotograma y el modelo genera lo que viene después a partir de tu prompt. También admite subir audio, así que el resultado vuelve con sonido. Si ya tienes una imagen clave o una foto de producto, este es el camino más corto.
Primer y último fotograma a video
Sube por separado un fotograma inicial y otro final, y el modelo rellena la transición entre ambos; un botón de intercambio invierte los dos. Es la opción sólida para cambios de expresión, cambios de pose y transiciones de escena: cualquier caso en el que necesites controlar con exactitud dónde empieza y acaba el plano.
Referencia a video
Sube varias imágenes, videos o clips de audio de referencia, o apunta a un documento o página web, y Wan 3.0 los leerá en conjunto para guiar el resultado. Mantén el video de referencia por debajo de 15 segundos en total: el sistema ajusta la salida para que entrada y salida sumen menos de 30 segundos.
Tres pasos hasta tu primer clip
Este es el orden real de operaciones en MakeFun. No hay que activar nada más antes.
1. Elige el modo
Decide primero si el video lo va a impulsar solo un prompt, una imagen, un primer y último fotograma o material de referencia multimodal. Los cuatro modos están descritos arriba.
2. Sube el material y escribe el prompt
Añade lo que ese modo necesite (imágenes, video, audio o un documento o página web) y describe la acción, el movimiento de cámara y la atmósfera que buscas. El campo de prompt admite hasta 5000 caracteres, y ser concreto se nota.
3. Ajusta los parámetros y genera
Elige duración y resolución y pulsa generar. El resultado aparece en My Result, desde donde puedes llevarlo al escalado, la eliminación de subtítulos y el resto de herramientas.
Lo que puedes ajustar en cada generación
Estos son los controles que Wan 3.0 ofrece hoy en MakeFun: suficientes para juzgar si supera tu listón de entrega.
| Ajuste | Lo que obtienes |
|---|---|
| Duración | 3 s, 5 s, 10 s, 15 s o 30 s. Por defecto, 5 s. En Referencia a video, el rango disponible varía según la duración del clip de referencia que hayas subido. |
| Resolución | 480P, 720P o 1080P. Más resolución cuesta más créditos: esbozar la idea en 480P y rematar en 1080P es la forma barata de trabajar. |
| Imágenes de entrada | JPG o PNG, 20 MB o menos cada una, con ancho y alto entre 240 y 7680 píxeles. |
| Prompt | Hasta 5000 caracteres. Un prompt negativo descarta cosas («borroso, baja calidad, deformado») y la expansión de prompt deja que la IA amplíe tu descripción por ti. |
| Generar audio | Activado por defecto; puedes desactivarlo. |
| Número de resultados | Varios clips a partir de un solo envío. |
| Semilla aleatoria | Solo en el plan Ultra. Reproduce el mismo resultado a partir de las mismas entradas. |
Cuatro cosas que te ahorran un reintento
Parte de buen material
Las imágenes y videos nítidos y bien compuestos dan mejores resultados; los borrosos o de baja resolución, no. La calidad de lo que entra marca el techo de lo que sale, y eso pesa más que cualquier ajuste de esta página.
Nombra la acción
Los movimientos concretos en el prompt («camina despacio», «asiente suavemente») aciertan mucho más que los adjetivos. Las palabras vagas de ambiente no le dan al modelo nada a lo que agarrarse.
Usa primer y último fotograma a propósito
Ese modo está pensado para cambios de expresión, cambios de pose y transiciones de escena: cualquier caso en que el principio y el final del plano deban ser exactos. Si ya sabes adónde va el plano, no lo dejes en manos de un prompt de texto.
Calcula la duración de la referencia
En Referencia a video, los clips de referencia deben sumar 15 segundos o menos, y el sistema recorta la salida para que entrada más salida no pase de 30 segundos. Referencias más largas te dejan una película más corta: haz esa cuenta antes de subir nada.
Documentación y API
¿Quieres integrar Wan 3.0 en tu propio producto? Los endpoints, parámetros, autenticación y facturación están en la documentación para desarrolladores de MakeFun, donde también encontrarás el acceso MCP.
Por qué usar Wan 3.0 en MakeFun
Empieza gratis, sin suscripción
Genera sin plan mensual. Wan 3.0 funciona con los créditos que ya tienes y no hay que activar nada extra antes de tu primer clip.
Un solo sitio para todos los modelos
Wan, Seedance, Kling, Sora, Veo, Seedream y más comparten una cuenta y un saldo. Pasa el mismo briefing por varios de ellos en vez de pagar por varias herramientas.
Pensado para entregar
La sincronía labial, la clonación de voz, el cambio de rostro y de cabeza, la eliminación de subtítulos y el escalado están junto a la generación, así que un clip pasa del prompt al material final sin salir del sitio.
Modelos de video con IA relacionados en MakeFun
- Seedance 2.5 — el modelo multimodal profesional de ByteDance, también disponible en MakeFun. Compara ambos con el mismo briefing.
- Wan 2.6 y Wan 2.6 Flash — la generación anterior de Wan, todavía una opción rápida y económica.
- Kling 2.6 y Sora 2 — modelos de video alternativos por los que merece la pena pasar el mismo prompt.
- Sincronía labial y video a audio — herramientas de acabado para material generado.