Modelos y plataformas de IA

StyleTTS 2: Síntesis de texto a voz de nivel humano con grandes modelos de lenguaje de habla

mm
AÃąade Unite.AI a tus fuentes preferidas en Google

Debido al aumento de enfoques de síntesis de habla natural y sintÃĐtica, uno de los principales logros que la industria de la inteligencia artificial ha alcanzado en los Últimos aÃąos es sintetizar efectivamente marcos de texto a voz con aplicaciones potenciales en diferentes industrias, incluyendo libros de audio, asistentes virtuales, narraciones de voz y mÃĄs, con algunos modelos de vanguardia que entregan un rendimiento y eficiencia de nivel humano en una amplia gama de tareas relacionadas con el habla. Sin embargo, a pesar de su fuerte rendimiento, todavía hay margen de mejora para tareas gracias a la habla expresiva y diversa, la necesidad de una gran cantidad de datos de entrenamiento para optimizar marcos de texto a voz de disparo cero, y la robustez para textos fuera de distribuciÃģn o fuera de distribuciÃģn que llevan a los desarrolladores a trabajar en un marco de texto a voz mÃĄs robusto y accesible.

En este artículo, hablaremos sobre StyleTTS-2, un marco de texto a voz robusto e innovador que se basa en los fundamentos del marco StyleTTS, y tiene como objetivo presentar el siguiente paso hacia sistemas de texto a voz de vanguardia. El marco StyleTTS2 modela los estilos de habla como variables aleatorias latentes, y utiliza un modelo de difusiÃģn probabilístico para muestrear estos estilos de habla o variables aleatorias, lo que permite al marco StyleTTS2 sintetizar habla realista de manera efectiva sin utilizar entradas de audio de referencia. Debido al enfoque, el marco StyleTTS2 puede entregar mejores resultados y muestra una alta eficiencia en comparaciÃģn con los actuales marcos de texto a voz de vanguardia, pero tambiÃĐn puede aprovechar la síntesis de habla diversa ofrecida por los marcos de modelo de difusiÃģn. Analizaremos el marco StyleTTS2 con mayor detalle y hablaremos sobre su arquitectura y metodología, así como tambiÃĐn echaremos un vistazo a los resultados logrados por el marco. Así que comencemos.

StyleTTS2 para síntesis de texto a voz: Una introducciÃģn

StyleTTS2 es un modelo de síntesis de texto a voz innovador que da el siguiente paso hacia la construcciÃģn de marcos de texto a voz de nivel humano, y se basa en StyleTTS, un modelo generativo de texto a habla basado en estilos. El marco StyleTTS2 modela los estilos de habla como variables aleatorias latentes, y utiliza un modelo de difusiÃģn probabilístico para muestrear estos estilos de habla o variables aleatorias, lo que permite al marco StyleTTS2 sintetizar habla realista de manera efectiva sin utilizar entradas de audio de referencia. Modelar los estilos como variables aleatorias latentes es lo que separa al marco StyleTTS2 de su predecesor, el marco StyleTTS, y tiene como objetivo generar el estilo de habla mÃĄs adecuado para el texto de entrada sin necesidad de una entrada de audio de referencia, y puede lograr difusiones latentes efectivas mientras aprovecha las capacidades de síntesis de habla diversa ofrecidas por los modelos de difusiÃģn. AdemÃĄs, el marco StyleTTS2 tambiÃĐn emplea un modelo de lenguaje de habla grande preentrenado como discriminador, como el marco WavLM, y lo combina con su propio enfoque de modelado de duraciÃģn diferenciable para entrenar el marco de manera integral, y en Última instancia, generar habla con naturalidad mejorada. Gracias al enfoque que sigue, el marco StyleTTS2 supera a los marcos actuales de vanguardia para tareas de generaciÃģn de habla, y es uno de los marcos mÃĄs eficientes para el preentrenamiento de modelos de habla a gran escala en configuraciÃģn de disparo cero para tareas de adaptaciÃģn de hablante.

Avanzando, para entregar síntesis de texto a voz de nivel humano, el marco StyleTTs2 incorpora los conocimientos de trabajos existentes, incluyendo modelos de difusiÃģn para síntesis de habla, y modelos de lenguaje de habla grandes. Los modelos de difusiÃģn se utilizan comÚnmente para tareas de síntesis de habla gracias a sus capacidades de control de habla de grano fino, y capacidades de muestreo de habla diversa. Sin embargo, los modelos de difusiÃģn no son tan eficientes como los marcos no iterativos basados en GAN, y una de las razones principales es la necesidad de muestrear representaciones latentes, ondas y mel-espectrogramas de manera iterativa hasta la duraciÃģn objetivo de la habla.

Por otro lado, trabajos recientes sobre modelos de lenguaje de habla grandes han indicado su capacidad para mejorar la calidad de tareas de generaciÃģn de texto a voz, y adaptarse bien al hablante. Los modelos de lenguaje de habla grandes suelen convertir la entrada de texto en representaciones cuantificadas o continuas derivadas de marcos de lenguaje de habla preentrenados para tareas de reconstrucciÃģn de habla. Sin embargo, las características de estos modelos de lenguaje de habla no estÃĄn optimizadas directamente para síntesis de habla. En contraste, el marco StyleTTS2 aprovecha el conocimiento adquirido por los marcos de lenguaje de habla grandes utilizando entrenamiento adversarial para sintetizar características de modelos de lenguaje de habla sin utilizar mapas de espacio latente, y por lo tanto, aprendiendo un espacio latente optimizado para síntesis de habla directamente.

StyleTTS2: Arquitectura y Metodología

En su nÚcleo, StyleTTS2 se basa en su predecesor, el marco StyleTTS, que es un marco de texto a voz no autoregresivo que utiliza un codificador de estilo para derivar un vector de estilo de la entrada de audio de referencia, lo que permite la generaciÃģn de habla natural y expresiva. El vector de estilo utilizado en el marco StyleTTS se incorpora directamente en el codificador, la duraciÃģn y los predictores mediante el uso de AdaIN o NormalizaciÃģn de Instancia Adaptativa, lo que permite al modelo StyleTTS generar salidas de habla con prosodia, duraciÃģn y emociones variables. El marco StyleTTS consta de 8 modelos en total que se dividen en tres categorías

  1. Modelos acÚsticos o sistema de generaciÃģn de habla con un codificador de estilo, un codificador de texto y un decodificador de habla.
  2. Un sistema de predicciÃģn de texto a voz que utiliza predictores de prosodia y duraciÃģn.
  3. Un sistema de utilidad que incluye un alineador de texto, un extractor de pitch y un discriminador para fines de entrenamiento.

Gracias a su enfoque, el marco StyleTTS entrega un rendimiento de vanguardia relacionado con la síntesis de habla controlable y diversa. Sin embargo, este rendimiento tiene sus desventajas, como la degradaciÃģn de la calidad de la muestra, limitaciones expresivas y dependencia de aplicaciones de habla en tiempo real.

Mejorando el marco StyleTTS, el modelo StyleTTS2 resulta en tareas de texto a voz expresivas mejoradas con un rendimiento fuera de distribuciÃģn mejorado, y una calidad de nivel humano. El marco StyleTTS2 utiliza un proceso de entrenamiento de extremo a extremo que optimiza los diferentes componentes con entrenamiento adversarial, y síntesis de onda directa de manera conjunta. A diferencia del marco StyleTTS, el marco StyleTTS2 modela el estilo de habla como una variable latente, y lo muestrea mediante modelos de difusiÃģn, lo que genera muestras de habla diversas sin utilizar una entrada de audio de referencia. Analicemos estos componentes con mayor detalle.

Entrenamiento de extremo a extremo para interferencia

En el marco StyleTTS2, se utiliza un enfoque de entrenamiento de extremo a extremo para optimizar los diferentes componentes de texto a voz para interferencia sin tener que depender de componentes fijos. El marco StyleTTS2 logra esto modificando el decodificador para generar la onda directamente desde el vector de estilo, las curvas de pitch y energía, y las representaciones alineadas. El marco luego elimina la Última capa de proyecciÃģn del decodificador y la reemplaza con un decodificador de onda. El marco StyleTTS2 utiliza dos codificadores: un decodificador basado en HifiGAN para generar la onda directamente, y un decodificador basado en iSTFT para producir fase y magnitud que se convierten en ondas para una interferencia y entrenamiento mÃĄs rÃĄpidos.

La figura anterior representa los modelos acÚsticos utilizados para el preentrenamiento y el entrenamiento conjunto. Para reducir el tiempo de entrenamiento, los mÃģdulos se optimizan primero en la fase de preentrenamiento, seguido de la optimizaciÃģn de todos los componentes, excepto el extractor de pitch, durante el entrenamiento conjunto. La razÃģn por la que el entrenamiento conjunto no optimiza el extractor de pitch es porque se utiliza para proporcionar la verdad de pitch para las curvas de pitch.

La figura anterior representa el entrenamiento adversarial del modelo de lenguaje de habla y la interferencia con el marco WavLM preentrenado pero no ajustado. El proceso difiere del mencionado anteriormente, ya que puede tomar textos de entrada variables, pero acumula los gradientes para actualizar los parÃĄmetros en cada lote.

DifusiÃģn de estilo

El marco StyleTTS2 tiene como objetivo modelar la habla como una distribuciÃģn condicional a travÃĐs de una variable latente que sigue la distribuciÃģn condicional, y esta variable se llama estilo de habla generalizado, y representa cualquier característica en la muestra de habla mÃĄs allÃĄ del alcance de cualquier contenido fonÃĐtico, incluyendo estrÃĐs lÃĐxico, prosodia, tasa de habla y incluso transiciones de formantes.

Discriminadores de modelo de lenguaje de habla

Los modelos de lenguaje de habla son conocidos por su capacidad general para codificar informaciÃģn valiosa sobre una amplia gama de aspectos semÃĄnticos y acÚsticos, y las representaciones de los modelos de lenguaje de habla han podido tradicionalmente imitar la percepciÃģn humana para evaluar la calidad de la habla sintetizada generada. El marco StyleTTS2 utiliza un enfoque de entrenamiento adversarial para aprovechar la capacidad de los codificadores de los modelos de lenguaje de habla para realizar tareas generativas, y emplea un marco WavLM de 12 capas como discriminador. Este enfoque permite al marco habilitar el entrenamiento en textos fuera de distribuciÃģn o fuera de distribuciÃģn que pueden ayudar a mejorar el rendimiento. AdemÃĄs, para prevenir problemas de sobreajuste, el marco muestrea textos fuera de distribuciÃģn y en distribuciÃģn con igual probabilidad.

Modelado de duraciÃģn diferenciable

Tradicionalmente, se utiliza un predictor de duraciÃģn en los marcos de texto a voz que produce duraciones de fonemas, pero los mÃĐtodos de muestreo de upsampling que estos predictores de duraciÃģn utilizan a menudo bloquean el flujo de gradientes durante el proceso de entrenamiento de extremo a extremo, y el marco NaturalSpeech emplea un upsampler basado en atenciÃģn para la conversiÃģn de texto a voz de nivel humano. Sin embargo, el marco StyleTTS2 encuentra que este enfoque es inestable durante el entrenamiento adversarial, ya que el marco StyleTTS2 se entrena utilizando upsampling diferenciable con entrenamiento adversarial sin la pÃĐrdida de tÃĐrminos adicionales debido a la desviaciÃģn en la longitud debido a las desviaciones. Aunque utilizar un enfoque de warping de tiempo dinÃĄmico suave puede ayudar a mitigar esta desviaciÃģn, utilizarlo no solo es computacionalmente costoso, sino que su estabilidad tambiÃĐn es una preocupaciÃģn al trabajar con objetivos adversarios o tareas de reconstrucciÃģn de mel.

Para abordar esta limitaciÃģn, el marco StyleTTC2 propone utilizar un nuevo enfoque de upsampling no paramÃĐtrico sin entrenamiento adicional, y capaz de dar cuenta de longitudes variables de las alineaciones. Para cada fonema, el marco StyleTTC2 modela la alineaciÃģn como una variable aleatoria, e indica el índice del marco de habla con el que el fonema se alinea.

Entrenamiento y evaluaciÃģn del modelo

El marco StyleTTC2 se entrena y se experimenta en tres conjuntos de datos: VCTK, LibriTTS y LJSpeech. El componente de un solo hablante del marco StyleTTS2 se entrena utilizando el conjunto de datos LJSpeech, que contiene aproximadamente 13,000+ muestras de audio divididas en 12,500 muestras de entrenamiento, 100 muestras de validaciÃģn y casi 500 muestras de prueba, con su tiempo de ejecuciÃģn combinado totalizando casi 24 horas. El componente de varios hablantes del marco se entrena en el conjunto de datos VCTK, que consiste en mÃĄs de 44,000 clips de audio con mÃĄs de 100 hablantes nativos con acentos variables, y se divide en 43,500 muestras de entrenamiento, 100 muestras de validaciÃģn y casi 500 muestras de prueba. Finalmente, para equipar al marco con capacidades de adaptaciÃģn de disparo cero, el marco se entrena en el conjunto de datos combinado LibriTTS, que consiste en clips de audio que totalizan alrededor de 250 horas de audio con mÃĄs de 1,150 hablantes. Para evaluar su rendimiento, el modelo emplea dos mÃĐtricas: MOS-N o PuntuaciÃģn de OpiniÃģn Media de Naturalidad, y MOS-S o PuntuaciÃģn de OpiniÃģn Media de Similitud.

Resultados

El enfoque y la metodología utilizados en el marco StyleTTS2 se muestran en su rendimiento, ya que el modelo supera a varios marcos de texto a voz de vanguardia, especialmente en el conjunto de datos NaturalSpeech, y establece un nuevo estÃĄndar para el conjunto de datos. AdemÃĄs, el marco StyleTTS2 supera al marco de vanguardia VITS en el conjunto de datos VCTK, y los resultados se demuestran en la siguiente figura.

El modelo StyleTTS2 tambiÃĐn supera a los modelos anteriores en el conjunto de datos LJSpeech, y no muestra ningÚn grado de degradaciÃģn de la calidad en textos fuera de distribuciÃģn o fuera de distribuciÃģn, como se muestra en las mismas mÃĐtricas. AdemÃĄs, en la configuraciÃģn de disparo cero, el modelo StyleTTC2 supera al marco existente Vall-E en naturalidad, aunque se queda atrÃĄs en tÃĐrminos de similitud. Sin embargo, es importante destacar que el marco StyleTTS2 puede lograr un rendimiento competitivo a pesar de entrenarse solo con 245 horas de muestras de audio, en comparaciÃģn con mÃĄs de 60k horas de entrenamiento para el marco Vall-E, lo que lo convierte en una alternativa eficiente en tÃĐrminos de datos a los mÃĐtodos de preentrenamiento existentes, como los utilizados en el marco Vall-E.

Avanzando, debido a la falta de datos de audio etiquetados con emociones, el marco StyleTTC2 utiliza el modelo GPT-4 para generar mÃĄs de 500 instancias en diferentes emociones para la visualizaciÃģn de los vectores de estilo que el marco crea mediante su proceso de difusiÃģn.

En la primera figura, los estilos emocionales en respuesta a los sentimientos del texto de entrada se ilustran mediante los vectores de estilo del modelo LJSpeech, y demuestra la capacidad del marco StyleTTC2 para sintetizar habla expresiva con emociones variables. La segunda figura muestra clusters distintos para cada uno de los cinco hablantes individuales, lo que demuestra una amplia gama de diversidad proveniente de un solo archivo de audio. La figura final muestra un cluster suelto de emociones del hablante 1, y revela que, a pesar de algunas superposiciones, los clusters de emociones son prominentes, lo que indica la posibilidad de manipular el tono emocional de un hablante independientemente de la muestra de audio de referencia y su tono de entrada. A pesar de utilizar un enfoque basado en difusiÃģn, el marco StyleTTS2 logra superar a los marcos existentes de vanguardia, incluyendo VITS, ProDiff y FastDiff.

Pensamientos finales

En este artículo, hemos hablado sobre StyleTTS2, un marco de texto a voz innovador y robusto que se basa en los fundamentos del marco StyleTTS, y tiene como objetivo presentar el siguiente paso hacia sistemas de texto a voz de vanguardia. El marco StyleTTS2 modela los estilos de habla como variables aleatorias latentes, y utiliza un modelo de difusiÃģn probabilístico para muestrear estos estilos de habla o variables aleatorias, lo que permite al marco StyleTTS2 sintetizar habla realista de manera efectiva sin utilizar entradas de audio de referencia. El marco StyleTTS2 utiliza la difusiÃģn de estilo y los discriminadores de modelo de lenguaje de habla para lograr un rendimiento de nivel humano en tareas de texto a voz, y supera a los marcos existentes de vanguardia en una amplia gama de tareas de habla.

Un ingeniero por profesiÃģn, un escritor por corazÃģn. Kunal es un escritor tÃĐcnico con un profundo amor y comprensiÃģn de la IA y el ML, dedicado a simplificar conceptos complejos en estos campos a travÃĐs de su documentaciÃģn atractiva e informativa.