Skip to content Skip to footer

Qué son las voces sintéticas

blog reader
Voces prediseñadas por Fonos: Deneb (presentación) y Ginan (contenido).

Las voces sintéticas son voces generadas por software que, a partir de un texto, crean un audio con las características de una voz. Es por ese paso, de texto a habla, que a la tecnología que hay debajo de esas voces se le llama TTS, por sus siglas en inglés de Text to Speech

Podemos pensar en una voz sintética como en una voz digital. Las podemos dividir en dos grupos: voz clonada, si la voz digital imita las características de la voz original de la persona, y voz generada por IA, si es mezcla de las características de varias voces y no identifica a ninguna de las voces originales, como las que podemos encontrar en “Esta voz no existe”.

Escucharás voces sintéticas cuando utilices el GPS como Google Maps, Waze o el propio navegador del coche, cuando viajes y escuches cuándo llega el próximo tren o avión procedente de un destino, o incluso cuando utilices las funciones de accesibilidad de los sistemas operativos.

Estas voces nos han ayudado a no perdernos durante años, pero por la calidad de las mismas (ese toque robótico, segmentado y poco natural era limitación de la propia tecnología), no se utilizaban de manera habitual en otros contextos ni casos de uso como la lectura de artículos de noticias, excepto por cuestiones de accesibilidad.

Desde entonces, la tecnología que se utiliza para crear voces sintéticas ha evolucionado hacia voces más naturales y más escuchables gracias a los avances en Inteligencia Artificial en áreas como las redes neuronales y sus diferentes tipos de arquitecturas, que también han impactado en áreas como Machine Learning y Procesamiento del Lenguaje Natural, tan importantes en las tecnologías del habla.

Si quieres crear tu propia voz sintética, te ayudamos a conseguirla desde Fonos.

Go to Top