Tutorial: primeiros passos com a plataforma de síntese de vídeo de humanos digitais do MakeFun
Obrigado por escolher a plataforma MakeFun de síntese de vídeo com avatares. Desenvolvida desde 2021, a tecnologia de sincronia labial e clonagem de voz do MakeFun quer ser a plataforma de geração de avatares mais simples e mais poderosa. Aqui você cria seu próprio avatar de IA e sua voz e depois gera vídeos do seu duplo digital apenas digitando texto. Você também pode usar avatares e vozes prontos e criar vídeos configurando roteiros.
Entrar
-
Entre com seu Gmail ou outro e-mail em https://makefun.ai/app. Navegadores recomendados: Microsoft Edge ou Chrome no computador para a melhor experiência.
-
Se você ainda não tem conta, clique em “Register” para criar uma. Se tiver um código de convite, veja na seção de perguntas e respostas como inseri-lo.
-
No celular, acesse https://makefun.ai/app. Observação: a versão móvel tem menos recursos. Se puder, use a versão para computador.
Criando seu primeiro vídeo
Depois de entrar, experimente criar um vídeo com avatar:
-
Vá até o módulo “Create”.
-
Dê um nome ao vídeo.
-
Digite o roteiro que o avatar vai narrar.
-
Escolha o idioma e o timbre de voz adequados e clique em “Preview Audio”.
-
Quando a prévia do áudio funcionar, o botão muda para “Create Video”. Você também vai ouvir no computador a voz sintetizada do avatar.
-
O sistema mostra quantas moedas são necessárias para gerar o vídeo a partir do áudio. Se a prévia e o custo estiverem bons, clique em “Synthesize Video” para gerar.
-
A plataforma leva você à página de resultados, onde poderá baixar o vídeo após uma breve espera.
-
Para acompanhar o andamento e encontrar os vídeos prontos, vá ao módulo “My Results”.
Recursos avançados de síntese de vídeo
Escolher avatares diferentes
Você pode selecionar:
- My Avatars: veja como criar o seu próprio avatar aqui.
- Public Avatars: são oferecidos como exemplos de referência. Observação: esses avatares podem não ter garantia de direitos autorais ou de uso comercial no seu país.
Tipos de avatar: ao clicar em “My Avatars”, você verá que cada avatar tem a etiqueta ou .
- Diamante: resultado do “Continue Training”. Esses avatares são treinados para maior qualidade de sincronia labial e mais realismo. Veja como usar o “continue training” aqui.
- Raio: resultado do “Quick Preview”. Oferece qualidade básica de sincronia labial. Se você clicou em “continue training” mas o treinamento ainda não terminou, você verá também. Ou seja, só o avatar com o treinamento concluído recebe a etiqueta . Raio serve para avatares gerados a partir de uma única imagem ou para vídeos de treinamento sem sincronia entre áudio e movimento labial.
Escolher uma voz
- Escolha uma voz que combine com o roteiro. O MakeFun oferece dezenas de idiomas e centenas de timbres.
- Você também pode usar sua voz clonada na dublagem. Veja como criar sua própria voz clonada aqui.
Legenda automática
- Se quiser adicionar legendas ao vídeo, ative “Caption” abaixo do vídeo com avatar e configure fonte, cor e fundo.
- Observação: a legenda automática só está disponível em vídeos gerados por texto, não por áudio.
Mudar o fundo
- Se quiser mudar o fundo do seu vídeo com avatar, clique em “Background”. Nem todos os avatares aceitam troca de fundo. Confira a opção “Background” para saber. Se não estiver disponível, escolha outro avatar.
- Para que um avatar próprio em “My Avatars” permita a troca de fundo, configure o fundo já durante a criação do avatar.
Se o avatar escolhido aceitar troca de fundo, você poderá:
- Usar imagens fornecidas pela plataforma.
- Enviar sua própria imagem ou vídeo como fundo.
Crie seus avatares personalizados usando vídeos
O MakeFun permite criar um avatar a partir de um clipe de vídeo curto (chamado de vídeo base) ou de uma imagem. Nesta seção você vai aprender a enviar um breve vídeo base de uma pessoa real, que servirá como dado de treinamento para gerar seus vídeos personalizados com avatar de IA. O vídeo base determina a resolução, o movimento labial, os gestos, as roupas e os objetos dos vídeos seguintes. Para avatares de alta qualidade, o vídeo base precisa atender a certos requisitos. Se quiser usar API, leia esta seção para entender o significado de cada parâmetro da API. Oferecemos dois tipos de treinamento para obter “My Avatars”:
- “Quick Preview ”: o treinamento costuma terminar em menos de 1 minuto. Esse processo é gratuito (nenhum diamante é consumido). É a única opção adequada para avatares gerados a partir de uma única imagem ou para vídeos de treinamento sem sincronia entre áudio e movimento labial. O resultado receberá a etiqueta .
- “Continue Training ”: o treinamento costuma terminar em menos de 60 minutos. Esse processo custa 1 . O resultado do “continue training” costuma trazer uma sincronia labial bem melhor que a do “Quick Preview”. Ele receberá a etiqueta . Para aplicar o “continue training”, envie primeiro um vídeo base e conclua o “quick preview”; depois clique em ícone do ícone do avatar. Em seguida você verá “Continue Training ” e poderá clicar nele. Espere cerca de 60 minutos. No fim, o ícone do avatar aparecerá com a etiqueta no módulo “Create”.
Passos para criar um avatar personalizado a partir de vídeos
-
No módulo “Add Avatars”, envie um vídeo que atenda aos requisitos
- Nome: dê um nome ao seu avatar.
- Gênero: selecione conforme o vídeo. Isso influencia levemente o resultado da sincronia labial.
- Material original: escolha Video para a clonagem.
- Fundo original: se quiser remover o fundo, envie uma imagem de fundo. Veja como capturar a imagem de fundo.
-
Clique em “Quick Preview” para iniciar a clonagem no modo instantâneo.
-
Depois do treinamento, veja o avatar em “My Avatars” e use-o para criar vídeos.
-
Para melhorar a qualidade, clique no ícone do ícone do avatar e depois em “Continue Training” na janela que abrir.
Crie seus avatares personalizados usando imagens
O MakeFun permite criar um avatar a partir de um clipe de vídeo curto (chamado de vídeo base) ou de uma imagem. Nesta seção você vai aprender a usar a imagem de uma pessoa real como dado de treinamento para gerar seus vídeos personalizados com avatar de IA. No modo imagem, não é possível aplicar o “continue training”. Depois de clicar em “Quick Preview ”, o treinamento costuma terminar em menos de 1 minuto. Esse processo custa 1 . Para avatares gerados a partir de imagens, o “continue training” depois não é necessário (nem possível).
Passos para criar um avatar personalizado a partir de imagens
-
No módulo “Add Avatars”, envie um vídeo que atenda aos requisitos
- Nome: dê um nome ao seu avatar.
- Gênero: selecione conforme o vídeo. Isso influencia levemente o resultado da sincronia labial.
- Material original: escolha Image modo de clonagem.
- Fundo original: se quiser remover o fundo, envie uma imagem de fundo.
-
Clique em “Quick Preview” para iniciar a clonagem no modo instantâneo.
-
Depois do treinamento, veja o avatar em “My Avatars” e use-o para criar vídeos.
Use a sua própria voz
O MakeFun permite criar uma voz personalizada com um clipe de áudio curto. Note que nosso sistema detecta automaticamente vozes de figuras públicas e celebridades. Se o seu envio violar nossos termos de uso, a voz será desativada e sua conta poderá ser suspensa.
-
Primeiro clique em Voice Clonedepois defina o nome da voz e selecione o gênero.
-
(a) Envie um clipe de áudio e clique em Start Training. Veja como conseguir uma gravação de áudio de alta qualidade. (b) Se não tiver um clipe pronto, você pode gravar direto na nossa página. Clique em Start Recordingescolha um roteiro adequado ao seu uso e clique no ícone para começar. A gravação deve ter de 15 a 20 segundos. Ao atingir essa duração, clique em Stop para finalizar a gravação.
-
Os resultados costumam ficar prontos em menos de um minuto e aparecem no painel da direita. A voz clonada pode ser selecionada na seção Voices do módulo Create No menu suspenso, sua voz clonada aparece na seção Voice Clone correspondente.
Perguntas frequentes
P: Como conseguir um “Base Video” de alta qualidade?
Recomendações de iluminação:
- Use um esquema de iluminação de retrato em estúdio, com pelo menos uma fonte frontal e uma contraluz (para marcar o contorno).
- Se usar fundo verde, mantenha a pessoa (o modelo) a pelo menos 2 metros do fundo para obter o melhor recorte.
- Evite roupas ou objetos que reflitam a luz verde.
Recomendações sobre ruído ambiente:
- Garanta que o ruído de fundo fique abaixo de 45 dB, sem eco nem reverberação.
- Evite o ruído do ar-condicionado e das ventoinhas do computador. Recomendamos desligar o ar-condicionado da sala durante a captação.
- Sempre teste o microfone antes de gravar.
Recomendações de câmera:
- Recomendamos uma DSLR capaz de gravar a pelo menos 30 FPS. A maioria dos nossos avatares públicos foi filmada com Sony A7S3 ou A7M4.
- Resolução: 2K a 30 fps (ou mais, se precisar de alta definição). O MakeFun aceita no máximo 4K.
- Formato: sem HDR. O MakeFun decodifica vídeo HDR básico, mas não recomendamos.
- Lente: Para retrato, use uma lente de 40 mm ou 50 mm (por exemplo, uma fixa 50 mm F1.8). Abertura F1.8–F2.5, velocidade do obturador de no máximo 1/100 e ISO abaixo de 800. Ajuste conforme a luz real.
- Dependendo do seu equipamento, use outros aparelhos — computador, placa de captura, teleprompter — para atender às necessidades de gravação.
Recomendações de microfone:
- Microfones de lapela (tipo clipe). Evite deixar o microfone longe demais da pessoa.
- O microfone precisa estar conectado à câmera para a melhor sincronização.
- O vídeo gravado deve incluir o áudio captado, com sincronia precisa entre áudio e imagem.
Atuação do modelo:
- A câmera deve captar o rosto da pessoa com nitidez.
- O modelo deve falar continuamente durante a captação e pode olhar para um teleprompter. O teleprompter precisa estar alinhado com a câmera.
- A pessoa pode preparar o próprio roteiro ou usar material simples, como poemas conhecidos, números ou letras. Fale com clareza e bom volume. Erros ocasionais não são problema: não se prenda a eles, concentre-se na emoção e na expressão facial durante a fala.
- Mantenha os movimentos dentro do enquadramento e não cubra o rosto. Gestos gerais (leves movimentos de mão ou acenos de cabeça) são bem-vindos; evite gestos com significado, como aprovar ou reprovar.
- Os movimentos não devem ser exagerados nem frequentes demais, e não podem cobrir o rosto.
- Os movimentos labiais podem ser um pouco mais marcados do que na fala natural.
- Qualquer ação registrada no vídeo aparecerá no resultado gerado, na mesma ordem.
- Óculos de armação são aceitáveis
Para habilitar a troca de fundo:
- Se for necessário substituir o fundo no vídeo, grave 1–2 segundos de “cena vazia”, sem a pessoa no enquadramento. Depois, envie uma captura dessa cena vazia como Original Background durante o processo “Add Avatars”.
- A imagem de fundo não precisa ser um fundo verde. Nosso algoritmo de IA aceita qualquer tipo de fundo, desde que ele corresponda exatamente ao fundo do vídeo do avatar.
- Se você filmar o modelo com fundo verde, evite roupas verdes ou azuis para não causar problemas no recorte.
Requisitos do material:
- O vídeo captado deve ter de 30 segundos a 5 minutos.
- O vídeo precisa conter fala, perfeitamente sincronizada com o movimento dos lábios.
- O vídeo deve mostrar apenas um rosto.
- Não são permitidos ruídos do ambiente nem outros sons (além da fala da pessoa).
- Mantenha um ritmo de fala moderado.
- Um ritmo lento demais pode reduzir a precisão da sincronia labial.
- Um ritmo rápido demais pode distorcer a sincronia labial.
P: Como gravar um “Base Audio” de alta qualidade?
Duração do áudio: 15–60 segundos.
Requisitos do ambiente:
- O ruído de fundo precisa ficar abaixo de 45 dB, sem eco nem reverberação.
- Faça testes de som antes de gravar.
Requisitos de equipamento:
- Use um microfone condensador direcional (por exemplo, cardioide).
Requisitos de gravação:
- Grave com o microfone um áudio cujo timbre e clima combinem com o uso pretendido (esse tom aparecerá no áudio sintetizado).
- Evite deixar o microfone perto demais da boca, para não gerar plosivas.
- Se errar, siga para a próxima frase em vez de recomeçar.
- Certifique-se de que o reverb esteja desligado e não faça nenhum pós-processamento no arquivo de áudio original.
Parâmetros de gravação:
- Taxa de amostragem: 48 kHz
- Profundidade de bits: 16 bits
- Canal: mono
- Após a normalização, o ganho deve ficar acima de 0,4.
Software recomendado: Adobe Audition.