English, Chinese (中文), Japanese (日本語), German (Deutsch), French (Français), Spanish (Español), Korean (한국어), Arabic (العربية), Russian (Русский), Dutch (Nederlands), Italian (Italiano), Polish (Polski), Portuguese (Português)
Clique ou arraste o arquivo para esta área para carregar
Formato: mp3/wav/m4a/mp4/mov, Tamanho: até 500MB
Duração: mínimo 10 segundos, máximo 60 segundos
Voz personalizada reutilizável
Treine uma voz personalizada para narração, conteúdo localizado, protótipos e produção recorrente de áudio. Escolha entre os modelos de voz e idiomas disponíveis, que variam de acordo com o modelo.
English, Chinese (中文), Japanese (日本語), German (Deutsch), French (Français), Spanish (Español), Korean (한국어), Arabic (العربية), Russian (Русский), Dutch (Nederlands), Italian (Italiano), Polish (Polski), Portuguese (Português)
Chinese (中文), English, German (Deutsch), Italian (Italiano), Portuguese (Português), Spanish (Español), Japanese (日本語), Korean (한국어), French (Français), Russian (Русский)
English, Chinese (中文), French (Français), German (Deutsch), Spanish (Español), Portuguese (Português), Japanese (日本語), Hindi (हिन्दी), Italian (Italiano), Korean (한국어), Dutch (Nederlands), Polish (Polski), Russian (Русский), Swedish (Svenska), Turkish (Türkçe)
Chinese (中文), Chinese,Yue (粤语), English, Arabic (العربية), Russian (Русский), Spanish (Español), French (Français), Portuguese (Português), German (Deutsch), Turkish (Türkçe), Dutch (Nederlands), Ukrainian (Українська), Vietnamese (Tiếng Việt), Indonesian (Bahasa Indonesia), Japanese (日本語), Italian (Italiano), Korean (한국어), Thai (ไทย), Polish (Polski), Romanian (Română), Greek (Ελληνικά), Czech (Čeština), Finnish (Suomi), Hindi (हिन्दी), Bulgarian (Български), Danish (Dansk), Hebrew (עברית), Malay (Bahasa Melayu), Persian (فارسی), Slovak (Slovenčina), Swedish (Svenska), Croatian (Hrvatski), Filipino, Hungarian (Magyar), Norwegian (Norsk), Slovenian (Slovenščina), Catalan (Català), Nynorsk, Tamil (தமிழ்), Afrikaans
English (USA), Chinese (中文), English (UK), English (Australia), English (Canada), Japanese (日本語), German (Deutsch), Hindi (हिन्दी), French (France) (Français (France)), French (Canada) (Français (Canada)), Korean (한국어), Portuguese (Brazil) (Português (Brasil)), Portuguese (Portugal) (Português (Portugal)), Italian (Italiano), Spanish (Spain) (Español (España)), Spanish (Mexico) (Español (México)), Indonesian (Bahasa Indonesia), Dutch (Nederlands), Turkish (Türkçe), Filipino, Polish (Polski), Swedish (Svenska), Bulgarian (Български), Romanian (Română), Arabic (Saudi Arabia) (العربية (السعودية)), Arabic (UAE) (العربية (الإمارات)), Czech (Čeština), Greek (Ελληνικά), Finnish (Suomi), Croatian (Hrvatski), Malay (Bahasa Melayu), Slovak (Slovenčina), Danish (Dansk), Tamil (தமிழ்), Ukrainian (Українська), Russian (Русский)
Compare A2E, A2E-V2, Cartesia, MiniMax e ElevenLabs no mesmo fluxo. Cada modelo tem cobertura de idiomas e custo de treinamento próprios: escolha primeiro o modelo, depois um idioma compatível e ouça o clone antes do uso em produção.
Uma voz de IA reutilizável mantém a fala consistente quando roteiros, formatos ou idiomas de destino mudam.
Use uma gravação limpa com uma pessoa, ritmo natural, volume constante e pouco eco ou música. Evite vozes sobrepostas, compressão forte, efeitos e silêncios longos. O editor valida a duração, oferece redução de ruído e mostra os idiomas compatíveis. Sempre ouça o resultado após o treinamento.
Clone apenas sua própria voz ou uma voz que você tenha autorização para usar. Nunca apresente áudio sintético como uma declaração real de alguém que não o aprovou.
O editor de clonagem de voz atual aceita uma amostra com duração entre 10 e 60 segundos.
Você pode enviar arquivos MP3, WAV, M4A, MP4 ou MOV. O tamanho máximo atual é de 500 MiB.
Os idiomas disponíveis dependem do modelo de voz selecionado. O editor atualiza a lista de idiomas quando você troca de modelo.
Sim. Envie ou grave apenas uma voz que pertença a você ou que você tenha permissão para usar e não use uma voz clonada para se passar por alguém ou enganar outras pessoas.
O modelo analisa características como timbre, altura, ritmo, pronúncia e estilo de fala para criar uma voz reutilizável capaz de sintetizar novos textos.
O treinamento geralmente termina em cerca de dois minutos, mas o tempo pode variar conforme o modelo e a carga atual do servidor.
Grave uma pessoa em um local silencioso, com frases naturais, distância do microfone e volume constantes e pouco eco. Use a redução de ruído apenas se a fonte tiver ruído de fundo.
Sim, se o modelo escolhido aceitar o idioma de destino. Compare a cobertura dos modelos e ouça o resultado, pois pronúncia e semelhança podem variar.
Quando o treinamento terminar, ouça a voz em Meus resultados e selecione-a no fluxo de texto para fala para narrações e outros projetos de áudio autorizados.