Modelos y plataformas de IA
OpenAI Crea un Nuevo Programa de IA para Crear Música Basada en Géneros
La organización de investigación independiente OpenAI ha lanzado recientemente una nueva forma de inteligencia artificial generativa llamada Jukebox, nombrada así debido a su capacidad para generar música. El AI Jukebox puede generar sonidos basados en atributos como instrumentación y letras, y el equipo de investigación de OpenAI creó el AI entrenándolo con clips de audio comprimidos y varios fragmentos de letras.
Como informó TechCrunch, los investigadores de OpenAI entrenaron el modelo utilizando clips de audio sin procesar, lo que le dio al modelo la capacidad de producir audio. Esto se diferencia de los enfoques utilizados para crear otras aplicaciones de generación de música, que a menudo se basan en “música simbólica” (como la música MIDI) que es información sobre notas y tonos, pero no audio real. El equipo de investigadores utilizó redes neuronales convolucionales para entrenar el modelo, comprimiendo el audio y codificándolo en un formato que la red neuronal pudiera interpretar. Luego, se utilizó un transformador para generar audio comprimido, que se amplificó para convertir los datos en un formato de audio.
Al crear Jukebox, OpenAI tuvo que crear un método para lidiar con la naturaleza compleja y densa del audio. Los investigadores lidieron con la naturaleza continua del audio dividiéndolo en secciones más discretas y digeribles, dividiendo las canciones en fragmentos que son 1/128 de segundo de duración. El objetivo era crear un modelo de IA capaz de descomponer canciones en fragmentos lo suficientemente grandes como para que el problema no se vuelva inmanejable, pero lo suficientemente pequeños y precisos como para que los modelos puedan aprender el patrón de una canción y reconstruir ese patrón.
La técnica utilizada por OpenAI comparte algunas similitudes con una antigua IA de generación de música que la empresa produjo, llamada MuseNet. MuseNet se entrenó con archivos MIDI y era capaz de generar música en una variedad de estilos, aunque se centró en la melodía general de una canción y no podía producir letras. En contraste, Jukebox es capaz de escribir sus propias letras para acompañar la música. Las letras son “co-escritas” por los investigadores de OpenAI, guiando al modelo hacia la creación de letras en ciertos estilos. El sistema Jukebox se entrenó con letras extraídas de LyricWiki, con datos de entrenamiento que consisten en texto y metadatos de 1,2 millones de canciones.
En cuanto a las letras del modelo, los investigadores primero intentaron utilizar un simple heurístico que estiraba las letras para que duraran aproximadamente lo mismo que una canción, analizando el texto que correspondía con un fragmento/segmento particular de la canción. Este enfoque simple funcionó bien en general, aunque los investigadores encontraron que cuando las letras eran particularmente rápidas, se descomponían. Para solucionar este problema, se extrajeron voces de la canción y se alinearon con el texto de las letras para obtener alineaciones de palabras para las letras. Luego, se utilizó una capa de codificación para las letras junto con una capa de atención que mapeaba secciones de la música con letras utilizando pares clave-valor. El resultado fue que las letras y las voces tenían una coincidencia bastante precisa.
Los autores del artículo también señalan que hay varias limitaciones que Jukebox tiene, y que el trabajo futuro se centrará en mejorar la capacidad del AI. Como escriben los autores en un artículo del blog:
“Aunque Jukebox representa un paso adelante en la calidad musical, coherencia, longitud de la muestra de audio y capacidad de condicionamiento en artista, género y letras, hay una brecha significativa entre estas generaciones y la música creada por humanos. Por ejemplo, aunque las canciones generadas muestran coherencia musical local, siguen patrones de acordes tradicionales y pueden incluso presentar solos impresionantes, no escuchamos estructuras musicales más grandes y familiares como estrofas que se repiten”.
En este momento, el modelo es capaz de producir una canción que es reconociblemente en el estilo de un género o incluso un artista específico. Por ejemplo, puede producir canciones en el estilo de Elvis Presley, Katy Perry o Rage Against the Machine. Aunque las canciones son reconociblemente dentro de un género o tematizadas en torno al estilo de un cantante, también son bastante toscas, a menudo sonando como una parodia o una mala versión de una canción. Sin embargo, el logro técnico es impresionante. Los investigadores responsables de crear el sistema de generación de IA eligieron trabajar en un programa capaz de generar música específicamente porque la tarea era difícil, y los investigadores planean seguir perfeccionando sus técnicas. Puedes escuchar algunas de las canciones aquí.












