Las voces sintéticas se escuchan en cada vez más plataformas. Podcasts, videojuegos o asistentes conversacionales utilizan voces creadas de forma artificial (voces sintéticas) pero que nos suenan cada vez más naturales y humanas. En un contexto donde la tecnología avanza a pasos agigantados ¿podría una voz sintética ser indistinguible a la de un humano? ¿Es lo mismo una voz clonada que una voz generada por inteligencia artificial? ¿Se puede, con la tecnología actual, clonar mi voz y usarla sin mi permiso?
Las voces sintéticas nos ofrecen un abanico muy amplio de casos de uso, pero existen muchos mitos o falsas creencias que queremos ayudar a romper.
En este artículo te ayudamos a descubrir una forma diferente de entender el poder de la síntesis de voz.
¡Allá vamos!
#1 – ¿La voz sintética es como un asistente conversacional?
Un asistente conversacional es un software basado en Inteligencia Artificial que facilita la interacción con personas mediante lenguaje natural y de forma automática. Los asistentes tienen unas características muy particulares, como por ejemplo la de creación de respuestas automáticas. Es muy habitual que cuando estos asistentes comunican sus respuestas mediante un audio, éste sea reproducido por una voz sintética. La confusión entre la voz y el asistente es algo bastante común, y tendemos a atribuir a la voz características que son propias del asistente. La voz no es ‘inteligente’ en el sentido de ser capaz de gestionar una conversación automáticamente, sino que es la que interpreta el texto ya generado por el asistente y lo reproduce para que podamos escucharlo.
#2 – ¿Las voces sintéticas no son expresivas?
Antiguamente, solíamos asociar una voz sintética a un sonido robótico. De hecho, la forma en la que se generaba el audio de la voz sintética parecía ser construido por ‘trozos’ o segmentos de sonido concatenados. Con el desarrollo moderno de las redes neuronales, nos encontramos ante voces sintéticas mucho más naturales y expresivas. En la actualidad, gracias al aprendizaje automático de estos algoritmos de inteligencia artificial, podemos escuchar voces sintéticas capaces de imitar el sonido del habla humana a partir de unas muestras de ejemplo. Las voces sintéticas son, por tanto, tan expresivas como seamos capaces de entrenar dichos modelos y los datos de entrenamiento permitan.
#3 – ¿Una voz sintética puede leer bien cualquier tipo de texto?
Como explicamos en el anterior mito, las voces sintéticas serán capaces de expresarse dependiendo de las muestras que le demos al algoritmo de aprendizaje. De ahí que sea necesario preparar muestras específicas para cada estilo interpretativo si queremos conseguir una mejor expresividad. No es lo mismo leer una noticia deportiva que un poema. Cada tipo de texto requiere un estilo y, aunque la voz sintética puede leerlo, no tiene por qué ser idónea para ese estilo si no está entrenada para ello.
#4 – ¿Cualquier persona puede clonar mi voz con la tecnología actual?
La tecnología actual de síntesis de voz requiere de la preparación de un entorno e infraestructura que no están al alcance de cualquiera. Incluso las grandes empresas como Microsoft que ya tienen preparados grandes modelos de lenguaje (LLM en sus siglas en inglés) no están proporcionando herramientas a usuarios finales para que esto sea posible. Entendemos que ésta es una de las preocupaciones más recurrentes ya que impacta directamente sobre la identidad personal. En Fonos abogamos por el diseño de herramientas éticas y queremos pensar que en el futuro más empresas se unirán a estos valores para evitar el uso con fines maliciosos de la tecnología.
#5 – ¿Puedo clonar la voz de cualquier persona?
Tomar muestras de la voz de una persona para crear una voz sintética ya sea una clonación o una voz generada por inteligencia artificial que no existe, no es legal sin su permiso. Aunque existan audios o vídeos de esa persona disponibles en Internet u otros medios de comunicación, la voz es un dato personal y forma parte de la identidad de una persona. Para poder usar la voz de alguien debes obtener permiso explícito de esa persona.
#6 – ¿Cuantos más datos le demos al algoritmo, mejor imitará la voz original?
Por lo que hemos explicado sobre el funcionamiento del proceso de entrenamiento de una voz quizá podamos entender que cuantos más datos, mejor será la voz sintética que obtengamos. Esto no es del todo cierto. Tan importante como tener una gran variedad de muestras donde se recojan muchos fonemas y estilos comunicativos es el de que esas muestras estén grabadas con buena calidad. Ruidos de fondo, eco, interferencias o golpes repentinos que se cuelan en el audio de muestra pueden afectar al algoritmo de aprendizaje dando lugar a resultados inesperados.
#7 – ¿Todas las voces tienen que tener el mismo acento “neutro”?
Hoy en día en los medios de comunicación estamos muy habituadas a escuchar un estilo y acento particular. Suele denominarse como español estándar y la gente tiende a asociarlo a un acento «neutro». Sin embargo, cada vez vemos a más profesionales del periodismo, la interpretación y la locución mantener su acento original, viniendo éste de cualquier zona geográfica.
Las voces sintéticas tienen el poder de imitar la voz de cualquier persona que hable en un idioma en concreto, y esto nos abre las puertas a normalizar la capacidad comunicativa e interpretativa de cualquier hablante independientemente de su acento.
#8 – ¿Una voz sintética creada para hablar inglés ya podrá hablar español?
El proceso de creación de una voz sintética es dependiente del idioma ya que es necesario una asociación entre un texto y su correspondencia fonética. Por lo tanto, un modelo entrenado en un idioma, por ejemplo en inglés, que ha aprendido a interpretar las letras “qu” de la palabra ‘quick’ con el conjunto de fonemas ‘/kw/’ cuando se enfrenta a una palabra en español que empieza por “qu” como ‘quinto’, que se pronuncia con /k/sin más, éste nos sonará poco preciso.
#9 – ¿Una voz sintética y una voz clonada son lo mismo?
Las voces clonadas son voces que buscan parecerse a la voz original de una persona en particular, pero no son las únicas voces sintéticas que podemos conseguir. Existen voces sintéticas creadas por inteligencia artificial donde no se reconoce a un hablante en concreto. Tanto las voces clonadas como estas otras voces generadas por IA son tipos de voces sintéticas. Otra forma de referirnos a las voces sintéticas es como voces digitales o voces artificiales.
#10 – ¿Las voces sintéticas se crean de forma automática?
Tras la recogida de muestras de voz para la creación de una voz sintética es necesario una supervisión de las mismas que garantice la calidad del audio. Éste será usado para entrenar, ahora sí, un modelo de aprendizaje automático. Además de esta revisión de calidad manual, para la síntesis de voces nuevas o aquellas clonaciones donde sea necesario incorporar muestras de más de un hablante, hace falta decidir y diseñar qué voces se usarán para la mezcla y qué variables de cada una de ellas se incorporarán. Por lo tanto, existe un proceso manual (incluso podríamos decir artesanal) de diseño de la voz que nos permite ajustar el sonido que tendrá de acuerdo a las necesidades de cada proyecto y a las expectativas de sus escuchantes.

