AI-modeller og platforme

OpenAI skaber nyt AI-program til at skabe musik baseret på genrer

mm
Føj Unite.AI til dine foretrukne kilder på Google

Den uafhængige forskningsorganisation OpenAI har nyligt frigivet en ny form for generativ AI kaldet Jukebox, opkaldt efter dets evne til at generere musik. Jukebox-AI kan generere lyde baseret på attributter som instrumentation og endda sangtekster, og OpenAI-forskningsholdet skabte AI ved at træne det på komprimerede lydklips og forskellige uddrag af sangtekster.

Som TechCrunch rapporterede, trænede OpenAI-forskerne modellen ved hjælp af rå lydklips, hvilket gav modellen evnen til at producere lyd. Dette er i modsætning til tilgangene, der anvendes til at skabe andre musikgenereringsapplikationer, som ofte afhænger af “symbolisk musik” (som MIDI-musik), der er information om noter og tonehøjder, men ingen faktisk lyd. Forskerholdet anvendte convolutionelle neurale netværk til at træne modellen, komprimere lyden og kodificere den i et format, der kan fortolkes af neurale netværk. Efterfølgende blev en transformer anvendt til at generere komprimeret lyd, som blev opskaleret for at konvertere dataene til et lydformat.

Da Jukebox blev skabt, måtte OpenAI oprette en metode til at håndtere den komplekse, tætte natur af lyd. Forskerne håndterede den kontinuerte natur af lyd ved at opdele den i mere diskrete, fordøjelige sektioner, hvor sangene blev opdelt i bidder, der er 1/128 del af en sekund lang. Målet var at skabe en AI-model, der kan bryde sangene ned i bidder, der er store nok til, at problemet ikke bliver uoverkommeligt, men små og præcise nok til, at modellerne kan lære mønsteret af en sang og genskabe dette mønster.

Den teknik, der anvendes af OpenAI, deler nogen fællestræk med en ældre musikgenererings-AI, som virksomheden tidligere producerede, kaldet MuseNet. MuseNet blev trænet på MIDI-filer og kunne generere musik i en række stilarter, selvom den fokuserede på den overordnede melodi af en sang og ikke kunne producere sangtekster. I modsætning hertil kan Jukebox selv skrive sangtekster til at ledsage musikken. Sangteksterne er “skorevet” af OpenAI-forskerne, der vejleder modellen til at skabe sangtekster i bestemte stilarter. Jukebox-systemet blev trænet på sangtekster, der blev hentet fra LyricWiki, med træningsdata, der bestod af tekst og metadata på 1,2 millioner sange.

Når det kommer til sangteksterne i modellen, prøvede forskerne først at anvende en simpel heuristik, der strakte sangteksterne ud til omtrent samme varighed som en sang, hvor de analyserede den tekst, der svarede til en bestemt bid/sekvens af sangen. Denne simple tilgang fungerede generelt godt, selvom forskerne fandt ud af, at når sangteksterne var særligt hurtige, brød den sammen. For at løse dette problem blev vokalerne trukket ud af sangen og sammenlignet med sangteksten for at opnå ordniveau-tilsvarende for sangteksterne. Efterfølgende blev en kodningslag anvendt til sangteksterne sammen med en opmærksomhedslag, der knyttede sektioner af musikken til sangtekster ved hjælp af nøgle-værdi-par. Resultatet var, at sangtekster og vokaler havde en ret præcis sammenhæng.

Forfatterne af artiklen bemærker også, at der er flere begrænsninger i Jukebox, og at fremtidig arbejde vil sigte på at forbedre AI’ens evne. Som forfatterne skriver i en blogindlæg:

“Selvom Jukebox repræsenterer et skridt fremad i musikalsk kvalitet, kohærens, længde af lydprøve og evne til at betinge på kunstner, genre og sangtekster, er der en betydelig kløft mellem disse generationer og menneskeskabt musik. For eksempel viser de genererede sange lokale musikalske kohærens, følger traditionelle akkordmønstre og kan endda have imponerende solos, men vi hører ikke velkendte større musikalske strukturer som omkvæd, der gentages.”

I øjeblikket kan modellen producere en sang, der er genkendelig i stil med en bestemt genre eller endda en bestemt kunstner. For eksempel kan den producere sange i stil med Elvis Presley, Katy Perry eller Rage Against the Machine. Selvom sangene er genkendelige inden for en genre eller tema omkring en sangers stil, er de også ret grove, ofte lydende som en parodi eller en dårlig coverversion af en sang. Alligevel er den tekniske præstation imponerende. Forskerne, der er ansvarlige for at skabe AI-genereringssystemet, valgte at arbejde på et program, der kan generere musik, specifikt fordi opgaven var svær, og forskerne planlægger at fortsætte med at forfine deres teknikker. Du kan lytte til nogle af sangene her.

Blogger og programmør med specialer i Machine Learning og Deep Learning emner. Daniel håber at hjælpe andre med at bruge AI's kraft til sociale formål.