Já disponível
MiniMax H3: vídeo com som nativo
O modelo de geração omnimodal da MiniMax, disponível hoje no MakeFun. O H3 entende um contexto unificado entre texto, imagens, vídeo e áudio, e gera vídeo com som estéreo nativo, com até 15 segundos em resolução 2K.
O que o modelo entrega
Todos os clipes abaixo vêm das demonstrações de lançamento da própria MiniMax, então dá para julgar a qualidade da imagem antes de gastar qualquer coisa. Aqui eles rodam em loop e sem som — o som estéreo nativo é tratado mais abaixo.
Cinco coisas que ele faz bem
As afirmações são da MiniMax e os clipes são as demonstrações deles. O que você recebe no MakeFun é o retorno da sua própria geração.
Compreensão & geração multimodais nativas
Aceita texto, imagens, áudio e vídeo como entrada. Entende personagens, movimento, som, emoção, trabalho de câmera, estilo e intenção, e funde várias referências em uma saída audiovisual unificada. O exemplo da própria MiniMax cabe em uma frase: “Use o movimento de câmera hitchcockiano do Vídeo 1, faça o personagem da Imagem 2 cantar, com a voz combinando com o Áudio 3.” Três tipos de material, cada um com uma função, em um único prompt.
Edição & controle multimodais precisos
Edita personagens, objetos, cenas, som e ritmo em várias dimensões, seguindo instruções com bastante detalhe, então dá para iterar sobre conteúdo existente de forma previsível. Mudar uma coisa não significa regerar tudo: diga o que precisa ficar e o que precisa mudar, e siga a partir do clipe que você já tem.
Conteúdo pronto para produção em diferentes usos
Feito para cinema, publicidade, branding, e-commerce e games — cobre textos na tela, materiais de marca, efeitos criativos, vitrines de produto, movimento de UI/UX, visuais de jogo e expressão estilizada. O que esses trabalhos têm em comum é que o quadro contém tipografia, um logotipo ou o próprio produto, e nada disso sobrevive borrado.
Som estéreo nativo, feito junto com a imagem
O H3 gera vídeo com som estéreo nativo — o áudio não é dublado depois, ele sai da mesma passada da imagem. Escreva diálogo, música, ambiência e efeitos no prompt junto com a ação, e a trilha acompanha o plano, o que elimina por completo o vaivém de renderizar, musicar e sincronizar.
Até 2K, com as letras pequenas ainda legíveis
Os clipes vão até 15 segundos em até 2K, e 2K é o que o modelo oferece por padrão. Não é um ampliador tradicional inventando pixels: o resultado em resolução menor volta ao modelo junto com o contexto multimodal original e é regerado em contexto, de modo que legendas, logotipos e elementos de interface são reconstruídos em vez de adivinhados. É a mesma propriedade da “renderização precisa de texto e marca”, vista pelo outro lado.
Escolha o modo antes das configurações
O MakeFun abre três modos para o MiniMax H3. O modo escolhido define o que você precisa preparar antes mesmo de escrever a primeira palavra do prompt.
Texto para vídeo
Descreva a cena, os personagens, as ações, a câmera e o som em um único prompt para criar um clipe completo com áudio estéreo nativo — sem precisar de nenhum arquivo. A forma mais rápida de colocar uma ideia na tela quando você parte do zero.
Image to Video
Anime uma única imagem ou envie o primeiro e o último quadro para controlar exatamente como a sequência começa e termina. Ótimo para cartazes, vitrines de produto e demonstrações de interface. Aqui, primeiro-e-último quadro não é um modo separado — ele vive dentro deste, então envie as duas imagens quando o começo e o fim importarem.
Referência para vídeo
Combine referências de imagem, vídeo e áudio no mesmo trabalho. Use imagens para a identidade, vídeo para movimento e linguagem de câmera, áudio para voz e som. Dizer a cada arquivo qual é a sua função é o que faz esse modo funcionar de forma consistente.
Três passos até o seu primeiro clipe
Esta é a ordem real das operações no MakeFun. Não há nada extra para ativar antes.
1. Escolha o modo
Escolha texto para vídeo, imagem para vídeo com primeiro e último quadro, ou referência para vídeo com referências mistas. Os três estão descritos acima; se errar aqui, nenhum ajuste de parâmetro depois vai parecer certo.
2. Escreva o prompt
Descreva a cena, o movimento e o estilo que você quer no vídeo. O som entra no mesmo parágrafo — diálogo, música e ambiência escritos ao lado da ação voltam na mesma geração.
3. Ajuste os parâmetros & gere
Selecione duração, resolução e proporção e clique em gerar. O resultado aparece em My Result, de onde você pode levá-lo ao aumento de resolução, à remoção de legendas e ao resto das ferramentas.
O que dá para configurar em cada geração
Estes são os controles que o MiniMax H3 oferece hoje no MakeFun — o bastante para julgar se ele atende ao seu padrão de entrega.
| Configuração | O que você recebe |
|---|---|
| Duração | Até 15 segundos em um clipe. O arco inteiro precisa caber ali, então escreva o ritmo no prompt em vez de torcer para o modelo acertar o final. |
| Resolução | 2K, e 2K é o padrão — não existe um nível separado de alta definição para lembrar de ativar. |
| Áudio | Estéreo nativo, gerado na mesma passada da imagem. Nada para habilitar e nada para sincronizar depois. |
| Imagens de entrada | JPG, PNG ou WebP, com no máximo 30 MB cada, lado menor de pelo menos 300 pixels e proporção entre 1:2,5 e 2,5:1. |
| Prompt | Até 7.000 caracteres — espaço para um roteiro plano a plano, não só para uma frase. |
| Número de saídas | Um clipe por envio. |
| Acesso | Apenas contas pagas. |
Cinco coisas que evitam uma segunda tentativa
Dê um papel a cada referência
Diga o que cada arquivo controla — identidade do personagem, aparência do produto, movimento, estilo ou voz — para evitar conflitos entre as entradas. Quando um trabalho com referências mistas dá errado, normalmente há dois arquivos disputando a mesma coisa.
Estruture sequências mais longas
Divida ideias com vários planos em uma progressão ordenada (por exemplo [0-3 s]… [3-7 s]…) para o ritmo se manter ao longo do clipe. Uma descrição sem segmentação tende a ser encenada toda nos três primeiros segundos.
Dirija o áudio junto com a imagem
Descreva diálogo, música, ambiência e efeitos sonoros ao lado da ação; o H3 gera som estéreo nativo na mesma passada. Se escrever só a imagem, você entregou a trilha ao modelo.
Defina a linguagem de câmera
Especifique enquadramento, movimento, foco e comportamento da lente para conseguir uma fotografia intencional em vez de movimento genérico. “Cinematográfico” sozinho não dá nada ao modelo; um movimento com nome, sim.
Preserve e restrinja
Liste rostos, objetos de cena, textos e detalhes de marca que precisam permanecer consistentes, e diga o que evitar (cortes secos, morphing, texto extra). Em um trabalho que você precisa entregar, o que não pode aparecer importa tanto quanto o que precisa aparecer.
Documentação e API
Quer integrar o MiniMax H3 ao seu próprio produto? Endpoints, parâmetros, autenticação e cobrança estão na documentação para desenvolvedores do MakeFun, onde também há acesso via MCP.
Por que rodar o MiniMax H3 no MakeFun
Funciona com a conta que você já tem
O H3 usa os créditos que você já tem no MakeFun. Nada para instalar, nenhum cadastro separado e nenhum segundo lugar para acompanhar suas renderizações.
Um só lugar para todos os modelos
MiniMax, Wan, Seedance, Kling, Sora, Veo, Seedream e outros ficam sob uma conta e um saldo. Rode o mesmo briefing em vários deles em vez de pagar por várias ferramentas.
Feito para entregar
Sincronia labial, clonagem de voz, troca de rosto e de cabeça, remoção de legendas e aumento de resolução ficam ao lado da geração, então um clipe vai do prompt ao material final sem sair do site.
Modelos de vídeo com IA relacionados no MakeFun
- Wan 3.0 — o modelo de vídeo tudo em um da Tongyi Wanxiang, com plano-sequência nativo de 30 segundos. A outra metade da dupla se o seu corte precisa de duração em vez de referências mistas.
- Seedance 2.5 — o modelo multimodal profissional da ByteDance, também disponível no MakeFun. Compare os dois com o mesmo briefing.
- Wan 2.6 e Wan 2.6 Flash — uma geração anterior, ainda uma opção rápida e econômica.
- Kling 2.6 e Sora 2 — outros modelos de vídeo que valem a pena testar com o mesmo prompt.
- Sincronia labial e vídeo para áudio — ferramentas de finalização para o material gerado.