Já disponível no MakeFun
Seedance 2.5: vídeo multimodal profissional com IA
O modelo de criação de vídeo multimodal profissional de nova geração da ByteDance. Quatro avanços em um único lançamento — narrativa longa, referências fortes, edição precisa e multilíngue. Feito para produção de verdade, para que o material vire algo reutilizável, entregável e repetível em escala.
Quatro avanços no Seedance 2.5
Todos os números abaixo vêm das notas de lançamento oficiais da ByteDance. O modelo já está no ar no MakeFun, então o que você realmente recebe é o retorno da sua própria geração.
Narrativa longa
Um único plano agora dura 30 segundos em vez de 15. Tempo suficiente para sustentar um arco emocional completo sem emendar clipes na pós-produção. A extensão temporal de alta fidelidade também consegue alongar um material curto mantendo personagem, cenário e câmera consistentes.
Referências fortes
Até 50 arquivos de referência em uma única geração, contra 12 no Seedance 2.0. Forneça de uma vez elenco, um conjunto de locações, movimentos de câmera de referência e a música da marca; o modelo lê tudo junto e devolve um corte alinhado ao briefing. Rostos, expressões e figurino se mantêm estáveis entre os planos.
Edição precisa
Envie um corte existente como @video1, descreva a mudança no prompt e o modelo reescreve apenas aquela parte, enquanto todo o resto se mantém. Troque um produto, mude o estilo do material, ajuste a idade ou a expressão de um ator, remova uma marca d’água ou substitua a trilha de fundo.
Multilíngue
Mais de dez idiomas nativamente, então os criadores descrevem a intenção no próprio idioma, sem passar por tradução. Uma mesma gravação também pode sair em várias versões localizadas de locução — o clipe à esquerda é a mesma cena entregue em inglês, francês, japonês, espanhol, coreano e híndi.
O que muda em relação ao Seedance 2.0
A ByteDance é clara: o 2.5 não é um salto de geração como o 2.0 foi sobre o 1.5. A versão 2.0 já trouxe o grande avanço de capacidade; o 2.5 é um reforço sistemático voltado à produção de verdade.
| Capacidade | Seedance 2.0 | Seedance 2.5 |
|---|---|---|
| Duração de um único plano | 15 s | 30 s |
| Arquivos de referência por geração | 12 | 50 |
| — Imagens | 9 | 30 (até 4K) |
| — Clipes de vídeo | 3 | 10 |
| — Clipes de áudio | 3 | 10 |
| Duração total das referências de vídeo / áudio | 15 s | 30 s |
| Referência só de áudio | Não suportado | Suportado |
| Idiomas nativos | — | Mais de 10 |
Saiba qual tarefa você está executando
A ByteDance dedica uma seção só a isso por um motivo: na prática, referência, edição e extensão se misturam, o que coloca o prompt no lugar errado, cita os arquivos errados e custa controle e estabilidade. Escolha primeiro a tarefa e depois escreva o prompt para ela.
Geração por referência
Quando: você ainda não tem nenhum corte. Construa um vídeo do zero usando imagens, vídeo ou áudio como referência.
Formato do prompt: o que você quer gerar, em texto simples, mais @video N @image N @audio N para citar cada arquivo.
Parâmetros travados: nenhum. Você mesmo escolhe a proporção e a duração.
Edição de vídeo
Quando: você já tem um corte e quer reescrever, substituir, acrescentar ou remover parte dele.
Formato do prompt: a mudança que você quer, mais @video1 para o corte de origem e, opcionalmente, @image N ou @audio N.
Parâmetros travados: A proporção segue exatamente a fonte, então nada é esticado ou cortado. A duração de saída acompanha a fonte com margem de cerca de 0,3 segundo. O MOV é o formato de saída recomendado. Mantenha a entrada abaixo de 20 segundos.
Extensão de vídeo
Quando: você já tem um corte e quer continuá-lo com o mesmo visual, ritmo e estilo.
Direções: para frente a partir do último quadro, para trás a partir do primeiro, ou preenchendo o intervalo entre dois ou três clipes.
Parâmetros travados: A proporção segue a fonte. A duração do novo trecho é você quem define — informe no prompt. Aqui também recomendamos o MOV.
Primeiro quadro e primeiro-último quadro
Forneça uma imagem como quadro inicial, ou duas imagens como quadro inicial e final. A proporção segue o primeiro quadro; se o quadro final tiver outro formato, ele será esticado para encaixar, então use quadros de mesma proporção. A duração continua sob seu controle.
Como escrever prompts para o 2.5
A engenharia de prompt mudou nesta versão e o modelo agora espera mais do texto. A orientação da ByteDance é pensar como um diretor e escrever um prompt estruturado em quatro partes.
- Cite seus arquivos. Numere cada imagem, vídeo e áudio na ordem de envio e diga para que serve cada um: quem dá a aparência, qual é a voz, qual fornece o movimento, qual define o local.
- Resumo em uma linha. Sujeito, lugar, acontecimento, gênero ou estilo e qualquer trabalho de câmera especial.
- Detalhe cena a cena. Percorra os planos em ordem — tanto marcações de tempo quanto “plano N” funcionam. Descreva enquadramento, movimento de câmera, ação, diálogo e efeitos sonoros. Escreva no positivo.
- Feche o prompt. Acrescente os detalhes que atravessam a peça inteira: lente e posição de câmera, ambiente, voz, atmosfera.
A skill oficial de ajuste de prompt
A ByteDance recomenda fortemente a própria skill de engenharia de prompt para o Seedance 2.5. Ela é instalada localmente via npx e roda dentro da sua própria janela de chat com IA — nenhum serviço de terceiros envolvido.
npx --yes skills@latest add \
"https://arkdocs.tos-cn-beijing.volces.com/skills/" \
--skill sd25-pe \
--yes
Depois digite /sd25-pe seguido do seu rascunho de prompt.
O controle negativo é suportado
Você pode excluir elementos do mesmo jeito que pede outros. Legendas e áudio têm interruptores próprios — “sem legendas na tela”, “sem trilha de fundo, apenas ambiência e som da ação” — e o áudio pode ser direcionado separadamente como efeitos sonoros, música de fundo ou diálogo.
Algumas coisas que dão errado em silêncio
- As marcações de tempo são lidas melhor em unidades de um segundo. Indicar uma frequência dentro de um intervalo — “balança a cabeça três vezes em um segundo” — não é recomendado.
- Grades de storyboard funcionam até cerca de 15 quadros. Bonecos de palito ou desenho de linha rendem mais que arte acabada, e muito texto dentro do quadro atrapalha.
- A pré-visualização em caixas cinzas funciona melhor quanto mais tosca: geometria simples montada de forma grosseira se lê com mais clareza do que um modelo detalhado.
- Ligue explicitamente os sujeitos aos arquivos. Escrever um nome só na imagem e depois usá-lo no prompt convida o modelo a trocar as pessoas.
O que dá para configurar em cada geração
Estes são os controles que a ByteDance expõe para o modelo. O que o formulário de geração do MakeFun oferece é o que realmente se aplica ao seu trabalho.
- Modo — geração por referência, primeiro / primeiro-último quadro, edição de vídeo ou extensão de vídeo. Escolha isso primeiro: é o que define quais das configurações abaixo deixam de estar nas suas mãos.
- Resolução — 480p ou 720p.
- Proporção — 21:9, 16:9, 4:3, 1:1, 3:4, 9:16, ou deixe o modelo decidir a partir dos seus arquivos.
- Duração — defina em segundos ou deixe por conta do modelo.
- Formato de saída — o MOV é recomendado para trabalhos de edição e extensão, em que ele preserva melhor cor, brilho e a sincronia entre vídeo e áudio.
- Áudio — ligado ou desligado.
- Tamanho do lote — até 8 clipes de uma vez.
Documentação e API
Quer integrar o Seedance ao seu próprio produto? Endpoints, parâmetros, autenticação e cobrança estão todos na documentação para desenvolvedores do MakeFun, onde também há acesso via MCP.
Cinquenta referências e quantas usar de verdade
O teto é de 50 arquivos — 30 imagens, 10 clipes de vídeo e 10 clipes de áudio. A ByteDance é igualmente clara ao dizer que chegar ao teto não é o objetivo. As proporções abaixo vêm da avaliação em larga escala feita por eles.
Limites rígidos
- Imagens: até 30, em 4K ou menos, 30 MB cada. JPEG, PNG, WebP, BMP, TIFF, GIF, HEIC, HEIF.
- Vídeo: até 10 clipes, de 480p a 4K, 200 MB cada. MP4 ou MOV. Cada clipe de 2 a 30 s, 30 s no total.
- Áudio: até 10 clipes, 15 MB cada. MP3 ou WAV. Cada clipe de 2 a 30 s, 30 s no total.
- Os limites de vídeo e de áudio são contados separadamente, não somados.
O que funciona de verdade
- Sujeito conduzido por vídeo ou áudio: de 1 a 5 arquivos funciona bem. De 6 a 10 vale a tentativa, mas a estabilidade cai e você pode precisar de várias tentativas.
- Esses clipes rendem melhor entre 5 e 10 segundos. Dois segundos trazem pouca informação para identificar; trinta diluem as características e adicionam ruído.
- Sujeito conduzido por imagens estáticas: de 1 a 8 imagens funciona bem, de 9 a 12 vale a tentativa.
- Até 5 sujeitos; imagens de vista única ou de várias vistas servem igualmente. Acima de 5, a vista única é mais estável — separe os ângulos em imagens diferentes em vez de amontoá-los em uma só.
Um “sujeito” é qualquer elemento central que você quer manter estável no corte inteiro — um personagem, um produto ou objeto de cena principal, a locação, o estilo geral. Em “alguém numa floresta atirando em um coelho com um arco”, a pessoa, o arco e o coelho são três sujeitos.
Por que usar o Seedance no MakeFun
Comece grátis, sem assinatura
Gere sem plano mensal. O Seedance 2.5 usa os créditos que você já tem, e não há nada extra para ativar antes do primeiro clipe.
Um só lugar para todos os modelos
Seedance, Kling, Wan, Sora, Veo, Seedream e outros ficam sob uma conta e um saldo. Compare-os com o mesmo briefing em vez de pagar por várias ferramentas.
Feito para entregar
Sincronia labial, clonagem de voz, troca de rosto e de cabeça, remoção de legendas e aumento de resolução ficam ao lado da geração, então um clipe vai do prompt ao material final em um só lugar.
Modelos de vídeo com IA relacionados no MakeFun
- Wan 3.0 — o modelo tudo em um da Tongyi Wanxiang, também disponível no MakeFun. Compare os dois com o mesmo briefing.
- Seedance 2.0 — a geração anterior, com áudio nativo e narrativa em vários planos.
- Seedance 1.5 Pro — a geração anterior, ainda uma opção rápida e econômica.
- Kling 2.6 e Sora 2 — outros modelos de vídeo para comparar com o mesmo briefing.
- Sincronia labial e vídeo para áudio — ferramentas de finalização para o material gerado.