English, Chinese (中文), Japanese (日本語), German (Deutsch), French (Français), Spanish (Español), Korean (한국어), Arabic (العربية), Russian (Русский), Dutch (Nederlands), Italian (Italiano), Polish (Polski), Portuguese (Português)
Haz clic o arrastra un archivo a esta área para cargar
Formato: mp3/wav/m4a/mp4/mov, Tamaño: hasta 500MB
Duración: 10 segundos a 60 segundos
Voz personalizada reutilizable
Entrena una voz personalizada para narraciones, contenido localizado, prototipos y producción de audio recurrente. Elige entre los modelos de voz y los idiomas disponibles, que varían según el modelo.
English, Chinese (中文), Japanese (日本語), German (Deutsch), French (Français), Spanish (Español), Korean (한국어), Arabic (العربية), Russian (Русский), Dutch (Nederlands), Italian (Italiano), Polish (Polski), Portuguese (Português)
Chinese (中文), English, German (Deutsch), Italian (Italiano), Portuguese (Português), Spanish (Español), Japanese (日本語), Korean (한국어), French (Français), Russian (Русский)
English, Chinese (中文), French (Français), German (Deutsch), Spanish (Español), Portuguese (Português), Japanese (日本語), Hindi (हिन्दी), Italian (Italiano), Korean (한국어), Dutch (Nederlands), Polish (Polski), Russian (Русский), Swedish (Svenska), Turkish (Türkçe)
Chinese (中文), Chinese,Yue (粤语), English, Arabic (العربية), Russian (Русский), Spanish (Español), French (Français), Portuguese (Português), German (Deutsch), Turkish (Türkçe), Dutch (Nederlands), Ukrainian (Українська), Vietnamese (Tiếng Việt), Indonesian (Bahasa Indonesia), Japanese (日本語), Italian (Italiano), Korean (한국어), Thai (ไทย), Polish (Polski), Romanian (Română), Greek (Ελληνικά), Czech (Čeština), Finnish (Suomi), Hindi (हिन्दी), Bulgarian (Български), Danish (Dansk), Hebrew (עברית), Malay (Bahasa Melayu), Persian (فارسی), Slovak (Slovenčina), Swedish (Svenska), Croatian (Hrvatski), Filipino, Hungarian (Magyar), Norwegian (Norsk), Slovenian (Slovenščina), Catalan (Català), Nynorsk, Tamil (தமிழ்), Afrikaans
English (USA), Chinese (中文), English (UK), English (Australia), English (Canada), Japanese (日本語), German (Deutsch), Hindi (हिन्दी), French (France) (Français (France)), French (Canada) (Français (Canada)), Korean (한국어), Portuguese (Brazil) (Português (Brasil)), Portuguese (Portugal) (Português (Portugal)), Italian (Italiano), Spanish (Spain) (Español (España)), Spanish (Mexico) (Español (México)), Indonesian (Bahasa Indonesia), Dutch (Nederlands), Turkish (Türkçe), Filipino, Polish (Polski), Swedish (Svenska), Bulgarian (Български), Romanian (Română), Arabic (Saudi Arabia) (العربية (السعودية)), Arabic (UAE) (العربية (الإمارات)), Czech (Čeština), Greek (Ελληνικά), Finnish (Suomi), Croatian (Hrvatski), Malay (Bahasa Melayu), Slovak (Slovenčina), Danish (Dansk), Tamil (தமிழ்), Ukrainian (Українська), Russian (Русский)
Compara A2E, A2E-V2, Cartesia, MiniMax y ElevenLabs en un mismo flujo. Cada modelo tiene idiomas y costes de entrenamiento distintos: elige primero el modelo, después un idioma compatible y escucha el clon antes de usarlo en producción.
Una voz de IA reutilizable mantiene un sonido uniforme cuando cambian los guiones, los formatos o los idiomas de destino.
Usa una grabación limpia con una sola persona, ritmo natural, volumen constante y poco eco o música. Evita voces superpuestas, compresión agresiva, efectos y silencios largos. El editor valida la duración, ofrece reducción de ruido y muestra los idiomas compatibles. Escucha siempre el resultado tras el entrenamiento.
Clona únicamente tu propia voz o una para la que tengas autorización. Nunca presentes audio sintético como una declaración real de alguien que no lo haya aprobado.
El editor de clonación de voz actual acepta una muestra de entre 10 y 60 segundos.
Puedes subir archivos MP3, WAV, M4A, MP4 o MOV. El tamaño máximo actual es de 500 MiB.
Los idiomas disponibles dependen del modelo de voz seleccionado. El editor actualiza la lista de idiomas al cambiar de modelo.
Sí. Sube o graba únicamente una voz que te pertenezca o que tengas permiso para usar, y no utilices una voz clonada para suplantar o engañar a otras personas.
El modelo analiza rasgos como el timbre, el tono, el ritmo, la pronunciación y el estilo de habla para crear una voz reutilizable capaz de sintetizar texto nuevo.
Normalmente termina en unos dos minutos, aunque puede variar según el modelo y la carga actual del servidor.
Graba a una sola persona en un lugar silencioso, con frases naturales, distancia de micrófono y volumen constantes y poco eco. Usa la reducción de ruido solo si la fuente contiene ruido de fondo.
Sí, si el modelo elegido admite el idioma de destino. Compara la cobertura de los modelos y escucha el resultado, ya que la pronunciación y la similitud pueden variar.
Cuando termine, escúchala en Mis resultados y selecciónala en el flujo de texto a voz para narraciones y otros proyectos de audio autorizados.