MakeFun: vídeos e imagens com IA Baixar no iOS

Já disponível

MiniMax H3: vídeo com som nativo

O modelo de geração omnimodal da MiniMax, disponível hoje no MakeFun. O H3 entende um contexto unificado entre texto, imagens, vídeo e áudio, e gera vídeo com som estéreo nativo, com até 15 segundos em resolução 2K.

O que o modelo entrega

Todos os clipes abaixo vêm das demonstrações de lançamento da própria MiniMax, então dá para julgar a qualidade da imagem antes de gastar qualquer coisa. Aqui eles rodam em loop e sem som — o som estéreo nativo é tratado mais abaixo.

Cinco coisas que ele faz bem

As afirmações são da MiniMax e os clipes são as demonstrações deles. O que você recebe no MakeFun é o retorno da sua própria geração.

Compreensão & geração multimodais nativas

Aceita texto, imagens, áudio e vídeo como entrada. Entende personagens, movimento, som, emoção, trabalho de câmera, estilo e intenção, e funde várias referências em uma saída audiovisual unificada. O exemplo da própria MiniMax cabe em uma frase: “Use o movimento de câmera hitchcockiano do Vídeo 1, faça o personagem da Imagem 2 cantar, com a voz combinando com o Áudio 3.” Três tipos de material, cada um com uma função, em um único prompt.

Edição & controle multimodais precisos

Edita personagens, objetos, cenas, som e ritmo em várias dimensões, seguindo instruções com bastante detalhe, então dá para iterar sobre conteúdo existente de forma previsível. Mudar uma coisa não significa regerar tudo: diga o que precisa ficar e o que precisa mudar, e siga a partir do clipe que você já tem.

Conteúdo pronto para produção em diferentes usos

Feito para cinema, publicidade, branding, e-commerce e games — cobre textos na tela, materiais de marca, efeitos criativos, vitrines de produto, movimento de UI/UX, visuais de jogo e expressão estilizada. O que esses trabalhos têm em comum é que o quadro contém tipografia, um logotipo ou o próprio produto, e nada disso sobrevive borrado.

Som estéreo nativo, feito junto com a imagem

O H3 gera vídeo com som estéreo nativo — o áudio não é dublado depois, ele sai da mesma passada da imagem. Escreva diálogo, música, ambiência e efeitos no prompt junto com a ação, e a trilha acompanha o plano, o que elimina por completo o vaivém de renderizar, musicar e sincronizar.

Até 2K, com as letras pequenas ainda legíveis

Os clipes vão até 15 segundos em até 2K, e 2K é o que o modelo oferece por padrão. Não é um ampliador tradicional inventando pixels: o resultado em resolução menor volta ao modelo junto com o contexto multimodal original e é regerado em contexto, de modo que legendas, logotipos e elementos de interface são reconstruídos em vez de adivinhados. É a mesma propriedade da “renderização precisa de texto e marca”, vista pelo outro lado.

Escolha o modo antes das configurações

O MakeFun abre três modos para o MiniMax H3. O modo escolhido define o que você precisa preparar antes mesmo de escrever a primeira palavra do prompt.

Texto para vídeo

Descreva a cena, os personagens, as ações, a câmera e o som em um único prompt para criar um clipe completo com áudio estéreo nativo — sem precisar de nenhum arquivo. A forma mais rápida de colocar uma ideia na tela quando você parte do zero.

Image to Video

Anime uma única imagem ou envie o primeiro e o último quadro para controlar exatamente como a sequência começa e termina. Ótimo para cartazes, vitrines de produto e demonstrações de interface. Aqui, primeiro-e-último quadro não é um modo separado — ele vive dentro deste, então envie as duas imagens quando o começo e o fim importarem.

Referência para vídeo

Combine referências de imagem, vídeo e áudio no mesmo trabalho. Use imagens para a identidade, vídeo para movimento e linguagem de câmera, áudio para voz e som. Dizer a cada arquivo qual é a sua função é o que faz esse modo funcionar de forma consistente.

Três passos até o seu primeiro clipe

Esta é a ordem real das operações no MakeFun. Não há nada extra para ativar antes.

1. Escolha o modo

Escolha texto para vídeo, imagem para vídeo com primeiro e último quadro, ou referência para vídeo com referências mistas. Os três estão descritos acima; se errar aqui, nenhum ajuste de parâmetro depois vai parecer certo.

2. Escreva o prompt

Descreva a cena, o movimento e o estilo que você quer no vídeo. O som entra no mesmo parágrafo — diálogo, música e ambiência escritos ao lado da ação voltam na mesma geração.

3. Ajuste os parâmetros & gere

Selecione duração, resolução e proporção e clique em gerar. O resultado aparece em My Result, de onde você pode levá-lo ao aumento de resolução, à remoção de legendas e ao resto das ferramentas.

O que dá para configurar em cada geração

Estes são os controles que o MiniMax H3 oferece hoje no MakeFun — o bastante para julgar se ele atende ao seu padrão de entrega.

Configuração O que você recebe
Duração Até 15 segundos em um clipe. O arco inteiro precisa caber ali, então escreva o ritmo no prompt em vez de torcer para o modelo acertar o final.
Resolução 2K, e 2K é o padrão — não existe um nível separado de alta definição para lembrar de ativar.
Áudio Estéreo nativo, gerado na mesma passada da imagem. Nada para habilitar e nada para sincronizar depois.
Imagens de entrada JPG, PNG ou WebP, com no máximo 30 MB cada, lado menor de pelo menos 300 pixels e proporção entre 1:2,5 e 2,5:1.
Prompt Até 7.000 caracteres — espaço para um roteiro plano a plano, não só para uma frase.
Número de saídas Um clipe por envio.
Acesso Apenas contas pagas.

Cinco coisas que evitam uma segunda tentativa

Dê um papel a cada referência

Diga o que cada arquivo controla — identidade do personagem, aparência do produto, movimento, estilo ou voz — para evitar conflitos entre as entradas. Quando um trabalho com referências mistas dá errado, normalmente há dois arquivos disputando a mesma coisa.

Estruture sequências mais longas

Divida ideias com vários planos em uma progressão ordenada (por exemplo [0-3 s]… [3-7 s]…) para o ritmo se manter ao longo do clipe. Uma descrição sem segmentação tende a ser encenada toda nos três primeiros segundos.

Dirija o áudio junto com a imagem

Descreva diálogo, música, ambiência e efeitos sonoros ao lado da ação; o H3 gera som estéreo nativo na mesma passada. Se escrever só a imagem, você entregou a trilha ao modelo.

Defina a linguagem de câmera

Especifique enquadramento, movimento, foco e comportamento da lente para conseguir uma fotografia intencional em vez de movimento genérico. “Cinematográfico” sozinho não dá nada ao modelo; um movimento com nome, sim.

Preserve e restrinja

Liste rostos, objetos de cena, textos e detalhes de marca que precisam permanecer consistentes, e diga o que evitar (cortes secos, morphing, texto extra). Em um trabalho que você precisa entregar, o que não pode aparecer importa tanto quanto o que precisa aparecer.

Documentação e API

Quer integrar o MiniMax H3 ao seu próprio produto? Endpoints, parâmetros, autenticação e cobrança estão na documentação para desenvolvedores do MakeFun, onde também há acesso via MCP.

Por que rodar o MiniMax H3 no MakeFun

Funciona com a conta que você já tem

O H3 usa os créditos que você já tem no MakeFun. Nada para instalar, nenhum cadastro separado e nenhum segundo lugar para acompanhar suas renderizações.

Um só lugar para todos os modelos

MiniMax, Wan, Seedance, Kling, Sora, Veo, Seedream e outros ficam sob uma conta e um saldo. Rode o mesmo briefing em vários deles em vez de pagar por várias ferramentas.

Feito para entregar

Sincronia labial, clonagem de voz, troca de rosto e de cabeça, remoção de legendas e aumento de resolução ficam ao lado da geração, então um clipe vai do prompt ao material final sem sair do site.

Modelos de vídeo com IA relacionados no MakeFun

  • Wan 3.0 — o modelo de vídeo tudo em um da Tongyi Wanxiang, com plano-sequência nativo de 30 segundos. A outra metade da dupla se o seu corte precisa de duração em vez de referências mistas.
  • Seedance 2.5 — o modelo multimodal profissional da ByteDance, também disponível no MakeFun. Compare os dois com o mesmo briefing.
  • Wan 2.6 e Wan 2.6 Flash — uma geração anterior, ainda uma opção rápida e econômica.
  • Kling 2.6 e Sora 2 — outros modelos de vídeo que valem a pena testar com o mesmo prompt.
  • Sincronia labial e vídeo para áudio — ferramentas de finalização para o material gerado.