KI-Modelle und Plattformen

OpenAI erstellt neues KI-Programm zur Erstellung von Musik basierend auf Genres

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Die unabhängige Forschungsorganisation OpenAI hat kürzlich eine neue Form von generativer KI namens Jukebox veröffentlicht, die aufgrund ihrer Fähigkeit, Musik zu generieren, so benannt wurde. Die Jukebox-KI kann Klänge basierend auf Attributen wie Instrumentierung und sogar Texten generieren, und das OpenAI-Forschungsteam erstellte die KI, indem es sie mit komprimierten Audio-Clips und verschiedenen Text-Snippets trainierte.

Wie TechCrunch berichtete, trainierten die OpenAI-Forscher das Modell mit rohen Audio-Clips, was dem Modell die Fähigkeit gab, Audio zu produzieren. Dies steht im Gegensatz zu den Ansätzen, die zur Erstellung anderer Musik-Generierungs-Anwendungen verwendet werden, die oft auf “symbolischer Musik” (wie MIDI-Musik) basieren, die Informationen über Noten und Pitch enthält, aber kein tatsächliches Audio. Das Team der Forscher nutzte konvolutionale neuronale Netze, um das Modell zu trainieren, komprimierte Audio-Clips zu komprimieren und in ein Format zu kodieren, das das neuronale Netz interpretieren konnte. Anschließend wurde ein Transformer verwendet, um komprimiertes Audio zu generieren, das aufgeprobt wurde, um die Daten in ein Audio-Format umzuwandeln.

Bei der Erstellung von Jukebox musste OpenAI eine Methode entwickeln, um mit der komplexen, dichten Natur von Audio umzugehen. Die Forscher beschäftigten sich mit der kontinuierlichen Natur von Audio, indem sie es in diskretere, verdaulichere Abschnitte aufbrachen, Lieder in Bits aufteilten, die 1/128 Sekunde lang sind. Das Ziel war es, ein KI-Modell zu erstellen, das in der Lage ist, Lieder in Stücke zu zerlegen, die groß genug sind, um das Problem nicht unüberwindbar zu machen, aber klein und präzise genug, um das Muster eines Liedes zu lernen und dieses Muster zu rekonstruieren.

Die von OpenAI verwendete Technik teilt einige Gemeinsamkeiten mit einer älteren Musik-Generierungs-KI, die das Unternehmen produziert hat, namens MuseNet. MuseNet wurde mit MIDI-Dateien trainiert und war in der Lage, Musik in verschiedenen Stilen zu generieren, obwohl es sich auf die Gesamtmelodie eines Liedes konzentrierte und keine Texte produzieren konnte. Im Gegensatz dazu kann Jukebox eigene Texte zu begleitender Musik schreiben. Die Texte werden “ko-geschrieben” von den OpenAI-Forschern, die das Modell dazu anleiten, Texte in bestimmten Stilen zu erstellen. Das Jukebox-System wurde mit Texten trainiert, die von LyricWiki gesammelt wurden, wobei die Trainingsdaten aus Text und Metadaten von 1,2 Millionen Liedern bestanden.

Wenn es um die Texte des Modells geht, versuchten die Forscher zunächst, eine einfache Heuristik zu verwenden, die die Texte auf die Dauer eines Liedes ausdehnte, die Texte analysierte, die einem bestimmten Abschnitt/Segment des Liedes entsprachen. Dieser einfache Ansatz funktionierte im Allgemeinen gut, obwohl die Forscher feststellten, dass er bei besonders schnellen Texten zusammenbrach. Um dieses Problem zu lösen, wurden die Vocals aus dem Lied extrahiert und mit dem Text abgeglichen, um Wort- Level-Abgleichungen für die Texte zu erhalten. Anschließend wurde eine Kodierungsebene für die Texte verwendet, zusammen mit einer Aufmerksamkeitsebene, die Abschnitte der Musik auf Texte abbildete, indem sie Schlüssel-Wert-Paare verwendete. Das Ergebnis war, dass die Texte und Vocals eine ziemlich genaue Übereinstimmung hatten.

Die Autoren des Papiers weisen auch darauf hin, dass es mehrere Einschränkungen gibt, die Jukebox hat, und dass zukünftige Arbeiten darauf abzielen werden, die Fähigkeiten der KI zu verbessern. Wie die Autoren in einem Blog-Beitrag schreiben:

„Während Jukebox einen Schritt nach vorne in Bezug auf musikalische Qualität, Kohärenz, Länge des Audio-Samples und Fähigkeit zur Bedingung auf Künstler, Genre und Text darstellt, besteht ein erheblicher Abstand zwischen diesen Generationen und von Menschen erstellter Musik. Zum Beispiel zeigen die generierten Lieder lokale musikalische Kohärenz, folgen traditionellen Akkordmustern und können sogar beeindruckende Solos aufweisen, aber wir hören keine vertrauten größeren musikalischen Strukturen wie Refrains, die sich wiederholen.“

Aktuell ist das Modell in der Lage, ein Lied zu produzieren, das erkennbar im Stil eines bestimmten Genres oder sogar eines bestimmten Künstlers ist. Zum Beispiel kann es Lieder im Stil von Elvis Presley, Katy Perry oder Rage Against the Machine produzieren. Obwohl die Lieder erkennbar in einem Genre oder thematisch um einen Künstler herum sind, sind sie auch ziemlich rau, oft klingen sie wie eine Parodie oder eine schlechte Cover-Version eines Liedes. Dennoch ist die technische Leistung beeindruckend. Die Forscher, die für die Erstellung des KI-Generierungssystems verantwortlich sind, entschieden sich dafür, an einem Programm zu arbeiten, das Musik generieren kann, weil die Aufgabe schwierig war, und die Forscher planen, ihre Techniken weiter zu verfeinern. Sie können einige der Lieder hier hören.

Blogger und Programmierer mit Spezialisierungen in Machine Learning und Deep Learning Themen. Daniel hofft, anderen zu helfen, die Macht von KI für das soziale Wohl zu nutzen.