AI-modellen en platforms
OpenAI Creëert Nieuw AI-Programma Om Muziek Te Creëren Op Basis Van Genres
Het onafhankelijke onderzoeksorganisatie OpenAI heeft onlangs een nieuwe vorm van generatieve AI gelanceerd, genaamd Jukebox, vernoemd naar zijn vermogen om muziek te genereren. De Jukebox AI kan geluiden genereren op basis van attributen zoals instrumentatie en zelfs songteksten, en het OpenAI-onderzoeksteam creëerde de AI door het te trainen op gecomprimeerde audioclips en verschillende fragmenten van songteksten.
Volgens TechCrunch rapporteerde, trainden de OpenAI-onderzoekers het model met behulp van ruwe audioclips, waardoor het model de mogelijkheid kreeg om audio te produceren. Dit staat in contrast met de benaderingen die worden gebruikt om andere muziekgeneratie-toepassingen te creëren, die vaak vertrouwen op “symbolische muziek” (zoals MIDI-muziek), die informatie over noten en pitches bevat, maar geen daadwerkelijke audio. Het team van onderzoekers gebruikte convolutionele neurale netwerken om het model te trainen, de audio te comprimeren en deze te coderen in een formaat dat het neurale netwerk kon interpreteren. Vervolgens werd een transformer gebruikt om gecomprimeerde audio te genereren, die werd opgeschaald om de gegevens om te zetten in een audiiformaat.
Bij het creëren van Jukebox moest OpenAI een methode ontwikkelen om om te gaan met de complexe, dichte aard van audio. De onderzoekers gingen om met de continue aard van audio door deze op te breken in meer discrete, behapbare secties, waarbij nummers werden opgedeeld in stukken die 1/128e van een seconde lang zijn. Het doel was om een AI-model te creëren dat in staat is om nummers op te breken in stukken die groot genoeg zijn om het probleem niet onbeheersbaar te maken, maar klein en precies genoeg om de patronen van een nummer te leren en dit patroon te reconstrueren.
De techniek die door OpenAI wordt gebruikt, deelt enkele overeenkomsten met een oudere muziekgeneratie-AI die het bedrijf heeft geproduceerd, genaamd MuseNet. MuseNet was getraind op MIDI-bestanden en kon muziek genereren in een verscheidenheid aan stijlen, hoewel het zich richtte op de algemene melodie van een nummer en geen songteksten kon produceren. In tegenstelling tot Jukebox kan Jukebox zijn eigen songteksten schrijven om de muziek te begeleiden. De songteksten worden “mede-geschreven” door de OpenAI-onderzoekers, die het model leiden om songteksten in bepaalde stijlen te creëren. Het Jukebox-systeem werd getraind op songteksten die zijn gescraped van LyricWiki, met trainingsgegevens die bestaan uit tekst en metadata van 1,2 miljoen nummers.
Wat betreft de songteksten van het model, probeerden de onderzoekers eerst een eenvoudige heuristiek te gebruiken die de songteksten uitstrekte tot ongeveer de duur van een nummer, door de tekst te analyseren die overeenkwam met een bepaald deel/segment van het nummer. Deze eenvoudige benadering werkte over het algemeen goed, hoewel de onderzoekers ontdekten dat wanneer de songteksten bijzonder snel waren, het afbrak. Om dit probleem aan te pakken, werden de vocalen uit het nummer geëxtraheerd en uitgelijnd met de songtekst om woordniveau-overeenkomsten voor de songteksten te verkrijgen. Vervolgens werd een coderingslaag gebruikt voor de songteksten, samen met een aandachtlingslaag die secties van de muziek aan songteksten koppelde met behulp van sleutel-waarde-paren. Het resultaat was dat de songteksten en vocalen een vrij precieze overeenkomst hadden.
De auteurs van het artikel merken ook op dat er enkele beperkingen zijn aan Jukebox, en dat toekomstig onderzoek zal worden gericht op het verbeteren van de mogelijkheden van de AI. Zoals de auteurs schrijven in een blogpost:
“Hoewel Jukebox een stap vooruit vertegenwoordigt in muzikale kwaliteit, coherentie, lengte van audiosteekproef en mogelijkheid om te worden voorwaardelijk op artiest, genre en songteksten, is er een aanzienlijke kloof tussen deze generaties en door mensen gecreëerde muziek. Bijvoorbeeld, hoewel de gegenereerde nummers lokaal muzikaal coherent zijn, volgen traditionele akkoordpatronen en kunnen zelfs indrukwekkende solo’s hebben, horen we geen vertrouwde grotere muzikale structuren zoals refreinen die herhaald worden.”
Op dit moment kan het model een nummer produceren dat herkenbaar is in de stijl van een specifiek genre of zelfs een specifieke artiest. Bijvoorbeeld, het kan nummers produceren in de stijl van Elvis Presley, Katy Perry of Rage Against the Machine. Hoewel de nummers herkenbaar zijn binnen een genre of thematisch rond een artiestenstijl, zijn ze ook nogal ruw, vaak klinkend als een parodie of een slechte coverversie van een nummer. Niettemin is de technische prestatie indrukwekkend. De onderzoekers die verantwoordelijk zijn voor het creëren van het AI-generatiesysteem, kozen ervoor om te werken aan een programma dat in staat is om muziek te genereren, specifiek omdat de taak moeilijk was, en de onderzoekers plannen om hun technieken verder te verfijnen. U kunt naar enkele van de nummers luisteren hier.












