Los modelos de difusión se están haciendo muy conocidos desde la aparición de DALL-E, Stable Diffusion o Midjourney. Estos modelos matemáticos permiten la generación de imágenes a partir de ‘ruido’ el cual van definiendo gradualmente en cada iteración hasta obtener una imagen de alta calidad.
Los modelos de difusión también se utilizan para la generación de voces sintéticas. Con la diferencia de que las imágenes tienen un espacio de píxeles fijo, y el texto es una secuencia de palabras determinada más o menos larga que requiere otras técnicas para generar el sonido e interpretar el audio.
Así, encontramos el modelo de difusión de VALL-E, desarrollado por Microsoft, el cual ha sido entrenado con 60 mil horas de grabaciones de audio de hasta 7 mil personas diferentes. Estos modelos tienen la capacidad, entre otras, de clonar voces con una muestra de datos muy pequeña, desde 3 segundos, con todos los pros y contras que esto puede tener.
En el lado positivo, permitimos a personas que no puedan físicamente grabar durante horas tener una voz sintética muy cercana a su identidad. Por el contrario, puede llegarse a perder la expresividad del hablante original ya que el algoritmo no sólo utiliza lo aprendido de la voz de esa persona, sino de las miles de muestras que tiene en su modelo.
En los modelos generativos que no son de difusión se necesitan más horas de muestras de audio. Para hacer una clonación “de cero” se necesitan datos de una única persona, y se recomiendan miles de muestras de audio (horas de audio) y transcripciones.
Se puede, sin embargo, utilizar menos datos (minutos de audio) y realizar un fine-tune (refinamiento) de un modelo de otro hablante ya existente. Lo bueno de estos modelos generativos es que son mucho más realistas en cuanto al estilo, acento y formas de hablar del hablante original. La limitación está en lo dependientes que son de las muestras existentes de la voz que queramos clonar.
Pero como ya hablamos en nuestro anterior artículo, no es solo la cantidad de datos, sino la calidad de los mismos. Es por eso que existen formas de optimizar este proceso para que no sean necesarias horas de grabación en ausencia de un modelo de difusión:
- Recoger una muestra menor, pero muy cercana al estilo que se desea utilizar.
- Incluir en dicha muestra tantos fonemas como sean posibles.
Además de los datos, el uso de Redes Adversarias Generativas (GAN, en inglés), como las que usamos en los modelos de voz disponibles en Fonos, permiten aprender patrones de la voz complejos de forma muy eficiente.
Su funcionamiento no es sencillo, pero podría describirse como dos grandes redes neuronales que se enfrentan la una a la otra con una misión diferente. Una de ellas trata de generar un sonido en base a una probabilidad matemática, la otra trata de evaluar y discriminar si ese sonido generado se aproxima a la voz original a clonar. De esta forma en cada iteración del proceso de aprendizaje, la red neuronal que discrimina aprenderá a imitar la voz hasta conseguir un vocoder que será capaz de generar un audio con los matices de la voz original.
Tecnología responsable
Por último, no podemos olvidarnos de que todas estas herramientas deben llevar mecanismos de control para evitar su uso fraudulento.
Al contrario que con la generación de la imágenes, las voces son parte de la identidad de las personas. Además del problema asociado a la propiedad intelectual, añadimos el riesgo de la suplantación de identidad y el uso malicioso que de la voz sintética pudiera hacerse.
Desde Fonos, siempre hemos querido dejar claro cuáles son nuestro valores y qué significan para nosotros.
Sobre estos y otros temas hablaremos también en nuestro podcast Cuando las máquinas hablen. Encuéntranos en:

