Modelos y plataformas de IA

Los desarrolladores de juegos buscan la inteligencia artificial de voz para nuevas oportunidades creativas

mm
Añade Unite.AI a tus fuentes preferidas en Google

La tecnología de síntesis de sonido, particularmente la síntesis de habla, se ha vuelto mucho más sofisticada en los últimos años. Aunque la tecnología de texto a voz ha estado disponible durante décadas, la tecnología se ha vuelto mucho más natural y realista. Los algoritmos recientes pueden tomar solo unas horas de audio y sintetizar muestras de audio muy realistas. A medida que la tecnología avanza, se abren más aplicaciones, incluyendo posibilidades en medios creativos. Recientemente, según informó VentureBeat, las compañías de videojuegos han comenzado a investigar el uso de la generación de voz de IA para producir diálogos para videojuegos.

Una empresa, Leviathan Games, ha comenzado a implementar la inteligencia artificial de voz dentro de los juegos que están desarrollando actualmente. Wyeth Ridgway, el propietario de Leviathan Games, explicó que la inteligencia artificial de voz podría cambiar el diseño de juegos de manera dramática. Ridgway explicó que el uso de la inteligencia artificial de voz en el diseño de juegos es una tendencia emergente, y la comparó con cómo el software de animación 3D ha cambiado a lo largo de la última década, con empresas como Pixar creando software propietario destinado a facilitar la animación y el modelado.

Los métodos tradicionales de generación de habla operan uniendo archivos de sonido pregrabados en tiempo real, uniendo oraciones a partir de palabras y frases existentes. Este método de generación de habla requiere la grabación de cientos de horas de diálogo y la etiquetado manual de clips de sonido. También suena algo antinatural, ya que la inflexión y el énfasis tienden a cambiar a lo largo de las palabras. En comparación, la inteligencia artificial de voz de última generación suena mucho más natural y opera de una manera diferente.

La inteligencia artificial de voz se basa en redes neuronales profundas. WaveNet fue una de las primeras IA que podían generar muestras de audio convincentes y naturales. Dado que las muestras de sonido se generan desde cero, no hay necesidad de grabar cientos de horas de diálogo, siempre y cuando se disponga de datos de entrenamiento suficientes. Los modelos GAN y LSTM optimizados pueden generar audio después de ser entrenados con solo unas horas de audio etiquetado. Los resultados pueden ser extraordinariamente convincentes, como cuando el experimento Duplex de Google (GOOGL ) llamó a una peluquería para hacer una cita.

A medida que estas tecnologías se vuelven más poderosas, estandarizadas y fácilmente accesibles a través de la computación en la nube, es probable que más desarrolladores de juegos se vuelvan hacia la inteligencia artificial de voz para reducir el tiempo y los costos de producción. Algunas empresas ya están creando modelos que potencialmente pueden ser utilizados por desarrolladores de juegos. Replica Studios se especializa en tecnología de voz de IA, y algunas muestras de audio generadas por su tecnología se pueden escuchar en los enlaces aquí y aquí.

Es poco probable que los desarrolladores de juegos elijan prescindir del uso de actores de voz sobre la IA. De hecho, la inteligencia artificial de voz podría abrir más oportunidades para los actores de voz. Actualmente, muchas empresas de desarrollo de juegos a menudo omiten el diálogo hablado debido a la inversión de tiempo y los costos asociados con la creación de diálogo hablado. Los actores de voz a menudo necesitan ser llamados de nuevo para más sesiones de grabación si hay cambios en el guión o si los directores de juego desean un tipo diferente de actuación. La inteligencia artificial de voz podría ser utilizada para experimentar con/prototipar diálogo, obtener una idea de qué tipo de cambios en el guión y revisiones necesitan ser realizados antes de llamar a un actor de voz profesional para grabar el guión. Esto podría llevar a que más empresas tengan los recursos para invertir en la creación de diálogo hablado.

Los modelos de voz de IA incluso podrían ser entrenados con la voz de un actor de voz específico, y la IA utilizada para generar clips de diálogo triviales, siempre y cuando el actor sea pagado por el uso de su voz. Según informó VentureBeat, actores de voz como Simon J. Smith, son optimistas sobre el uso creciente de modelos de voz de IA y su potencial para abrir nuevas oportunidades de actuación de voz.

Más allá del uso de la inteligencia artificial de voz para prototipar guiones o crear líneas habladas para personajes menores, los desarrolladores de juegos también podrían utilizar la inteligencia artificial de voz para dar a los jugadores más opciones de personalización para juegos de rol. Actualmente, incluso los juegos que permiten a los jugadores elegir una voz para sus avatares suelen tener solo un puñado de opciones. Con el uso de la inteligencia artificial de voz, las opciones podrían ser funcionalmente ilimitadas.

Bloguero y programador con especialidades en Machine Learning y Deep Learning temas. Daniel espera ayudar a otros a utilizar el poder de la IA para el bien social.