MakeFun: videos e imágenes con IA Descargar en iOS

Ya disponible

MiniMax H3: video con sonido nativo

El modelo de generación omnimodal de MiniMax, hoy disponible en MakeFun. H3 entiende un contexto unificado entre texto, imágenes, video y audio, y genera video con sonido estéreo nativo, de hasta 15 segundos en resolución 2K.

Lo que entrega el modelo

Todos los clips de abajo proceden de las demos de lanzamiento de MiniMax, así que puedes juzgar la calidad de imagen antes de gastar nada. Aquí se reproducen en bucle y sin sonido: el estéreo nativo se explica más abajo.

Cinco cosas que hace bien

Las afirmaciones son de MiniMax y los clips son sus demos. Lo que obtienes en MakeFun es el resultado de tu propia generación.

Comprensión y generación multimodal nativas

Acepta texto, imágenes, audio y video como entrada. Entiende personajes, movimiento, sonido, emoción, trabajo de cámara, estilo e intención, y funde varias referencias en una salida audiovisual unificada. El propio ejemplo de MiniMax es una sola frase: «Toma el movimiento de cámara de Hitchcock del Video 1, haz que el personaje de la Imagen 2 cante y que la voz coincida con el Audio 3». Tres tipos de material, cada uno con una función, en un solo prompt.

Edición y control multimodal precisos

Edita personajes, objetos, escenas, sonido y ritmo en varias dimensiones siguiendo instrucciones con gran detalle, así que puedes iterar sobre contenido existente de forma predecible. Cambiar una cosa no obliga a regenerarlo todo: di qué debe quedarse y qué debe moverse, y continúa desde el clip que ya tienes.

Contenido listo para producción en distintos usos

Pensado para cine, publicidad, branding, comercio electrónico y videojuegos: cubre textos en pantalla, recursos de marca, efectos creativos, escaparates de producto, movimiento de UI/UX, gráficos de juego y expresión estilizada. Lo que tienen en común esos trabajos es que en el encuadre hay tipografía, un logotipo o el propio producto, y ninguno sobrevive si queda emborronado.

Sonido estéreo nativo, creado junto con la imagen

H3 genera video con sonido estéreo nativo: el audio no se dobla después, sale de la misma pasada que la imagen. Escribe diálogo, música, ambiente y efectos en el prompt junto a la acción y la pista seguirá al plano, lo que elimina por completo el ciclo de renderizar, musicalizar y sincronizar.

Hasta 2K, con la letra pequeña todavía legible

Los clips llegan a 15 segundos y hasta 2K, y 2K es lo que el modelo ofrece por defecto. No es un escalador tradicional que se inventa píxeles: el resultado de menor resolución vuelve al modelo junto con el contexto multimodal original y se regenera en contexto, así que subtítulos, logotipos y elementos de interfaz se reconstruyen en vez de adivinarse. Es la misma propiedad que la «representación exacta de texto y marca», vista desde el otro lado.

Elige el modo antes que los ajustes

MakeFun abre tres modos para MiniMax H3. El que elijas determina qué tienes que preparar antes de escribir una sola palabra del prompt.

Texto a video

Describe en un solo prompt la escena, los personajes, las acciones, la cámara y el sonido para crear un clip completo con audio estéreo nativo, sin necesidad de material. La forma más rápida de poner una idea en pantalla cuando partes de cero.

Image to Video

Anima una sola imagen o sube el primer y el último fotograma para controlar con exactitud cómo empieza y acaba la secuencia. Va muy bien para carteles, escaparates de producto y demos de interfaz. Aquí, primer-y-último fotograma no es un modo aparte: vive dentro de este, así que sube ambas imágenes cuando importen tanto el principio como el final.

Referencia a video

Combina referencias de imagen, video y audio en el mismo trabajo. Usa las imágenes para la identidad, el video para el movimiento y el lenguaje de cámara, y el audio para la voz y el sonido. Decirle a cada recurso qué papel ocupa es lo que hace que este modo funcione de forma consistente.

Tres pasos hasta tu primer clip

Este es el orden real de operaciones en MakeFun. No hay que activar nada más antes.

1. Elige el modo

Elige texto a video, imagen a video con primer y último fotograma, o referencia a video con referencias mixtas. Los tres están descritos arriba; si te equivocas, después no habrá ajuste de parámetros que te deje satisfecho.

2. Escribe el prompt

Describe la escena, el movimiento y el estilo que quieres en el video. El sonido va en el mismo párrafo: el diálogo, la música y el ambiente escritos junto a la acción vuelven en la misma generación.

3. Ajusta los parámetros y genera

Selecciona duración, resolución y relación de aspecto, y pulsa generar. El resultado aparece en My Result, desde donde puedes llevarlo al escalado, la eliminación de subtítulos y el resto de herramientas.

Lo que puedes ajustar en cada generación

Estos son los controles que MiniMax H3 ofrece hoy en MakeFun: suficientes para juzgar si supera tu listón de entrega.

Ajuste Lo que obtienes
Duración Hasta 15 segundos en un clip. El arco entero tiene que caber ahí, así que escribe el ritmo en el prompt en lugar de confiar en que el modelo acierte con el final.
Resolución 2K, y 2K es el valor por defecto: no hay un nivel de alta definición aparte que haya que acordarse de activar.
Audio Estéreo nativo, generado en la misma pasada que la imagen. Nada que activar ni que sincronizar después.
Imágenes de entrada JPG, PNG o WebP, 30 MB o menos cada una, lado corto de al menos 300 píxeles y relación de aspecto entre 1:2,5 y 2,5:1.
Prompt Hasta 7000 caracteres: espacio para un guion plano a plano, no solo para una frase.
Número de resultados Un clip por envío.
Acceso Solo cuentas de pago.

Cinco cosas que te ahorran un reintento

Dale un papel a cada referencia

Indica qué controla cada recurso (identidad del personaje, aspecto del producto, movimiento, estilo o voz) para evitar conflictos entre entradas. Cuando un trabajo con referencias mixtas sale mal, suele haber dos recursos peleando por lo mismo.

Estructura las secuencias largas

Divide las ideas de varios planos en una progresión ordenada (por ejemplo [0-3 s]… [3-7 s]…) para que el ritmo aguante a lo largo del clip. Una descripción sin segmentar se suele representar entera en los tres primeros segundos.

Dirige el audio junto con la imagen

Describe diálogo, música, ambiente y efectos junto a la acción; H3 genera sonido estéreo nativo en la misma pasada. Si solo escribes la imagen, le has dejado la banda sonora al modelo.

Define el lenguaje de cámara

Especifica encuadre, movimiento, foco y comportamiento del objetivo para obtener una fotografía intencionada en vez de un movimiento genérico. «Cinematográfico» por sí solo no le da nada al modelo; un movimiento con nombre, sí.

Conserva y restringe

Enumera los rostros, el atrezo, los textos y los detalles de marca que deben mantenerse, y di qué hay que evitar (cortes bruscos, morphing, texto añadido). En un trabajo que tienes que entregar, lo que no debe aparecer importa tanto como lo que sí.

Documentación y API

¿Quieres integrar MiniMax H3 en tu propio producto? Los endpoints, parámetros, autenticación y facturación están en la documentación para desarrolladores de MakeFun, donde también encontrarás el acceso MCP.

Por qué usar MiniMax H3 en MakeFun

Funciona con la cuenta que ya tienes

H3 consume tus créditos actuales de MakeFun. Nada que instalar, ningún registro aparte y ningún segundo sitio donde llevar la cuenta de tus renders.

Un solo sitio para todos los modelos

MiniMax, Wan, Seedance, Kling, Sora, Veo, Seedream y más comparten una cuenta y un saldo. Pasa el mismo briefing por varios de ellos en vez de pagar por varias herramientas.

Pensado para entregar

La sincronía labial, la clonación de voz, el cambio de rostro y de cabeza, la eliminación de subtítulos y el escalado están junto a la generación, así que un clip pasa del prompt al material final sin salir del sitio.

Modelos de video con IA relacionados en MakeFun

  • Wan 3.0 — el modelo de video todo en uno de Tongyi Wanxiang, con una toma única nativa de 30 segundos. La otra mitad de la pareja si tu corte necesita duración en vez de referencias mixtas.
  • Seedance 2.5 — el modelo multimodal profesional de ByteDance, también disponible en MakeFun. Compara ambos con el mismo briefing.
  • Wan 2.6 y Wan 2.6 Flash — una generación anterior, todavía una opción rápida y económica.
  • Kling 2.6 y Sora 2 — modelos de video alternativos por los que merece la pena pasar el mismo prompt.
  • Sincronía labial y video a audio — herramientas de acabado para material generado.