AI-modeller og plattformer
OpenAI lager nytt AI-program for å lage musikk basert på sjangere
Den uavhengige forskningsorganisasjonen OpenAI har nylig lansert en ny form for generativ AI kalt Jukebox, oppkalt etter evnen til å generere musikk. Jukebox AI kan generere lyder basert på attributter som instrumentering og selv tekst, og OpenAI-forskningsgruppen lagde AI-en ved å trene den på komprimerte lydklipp og ulike tekstutdrag.
Som TechCrunch rapporterte, trente OpenAI-forskerne modellen ved å bruke rå lydklipp, og gav modellen evnen til å produsere lyd. Dette er i kontrast til tilnærmingene som brukes til å lage andre musikk-genereringsapplikasjoner, som ofte avhenger av “symbolisk musikk” (som MIDI-musikk), som er informasjon om noter og toner, men ingen faktisk lyd. Forskergruppen brukte konvolusjonsneurale nettverk til å trene modellen, komprimere lyden og kode den i et format neuralt nettverk kunne tolke. Deretter ble en transformer brukt til å generere komprimert lyd, som ble oppskalert for å konvertere dataene til et lydformat.
Ved å lage Jukebox, måtte OpenAI lage en metode for å håndtere den komplekse, tette naturen til lyd. Forskerne håndterte den kontinuerlige naturen til lyd ved å bryte den opp i mer diskrete, fordøyelige seksjoner, og delte sangene opp i biter som er 1/128 deler av en sekund lang. Målet var å lage en AI-modell i stand til å bryte ned sanger i biter som er store nok til at problemet ikke blir uoverkommelig, men små og presise nok til at modellene kan lære mønsteret til en sang og rekonstruere det.
Teknikken som brukes av OpenAI deler noen likheter med en eldre musikk-genererings AI som selskapet produserte, kalt MuseNet. MuseNet ble trent på MIDI-filer og var i stand til å generere musikk i en rekke stiler, selv om den fokuserte på den overordnede melodi til en sang og kunne ikke produsere tekst. I kontrast kan Jukebox skrive sin egen tekst til å akkompagnere musikken. Teksten er “sammen skrevet” av OpenAI-forskerne, som guider modellen mot å lage tekst i bestemte stiler. Jukebox-systemet ble trent på tekst hentet fra LyricWiki, med treningsdata bestående av tekst og metadata på 1,2 millioner sanger.
Når det gjelder tekstene til modellen, prøvde forskerne først å bruke en enkel heuristikk som strakk ut tekstene til omtrent varigheten til en sang, og analyserte teksten som korresponderte med en bestemt del/segment av sangen. Denne enkle tilnærmingen fungerte generelt bra, selv om forskerne fant at når tekstene var særlig rask, brøt den sammen. For å håndtere dette problemet, ble vokaler trukket ut fra sangen og justert med tekstene for å få ord-nivå-justeringer for tekstene. Deretter ble en kode-lag til tekstene sammen med en oppmerksomhetslag som kartet seksjoner av musikken til tekst ved hjelp av nøkkel-verdi-par. Resultatet var at tekstene og vokalene hadde en ganske presis sammenheng.
Forfatterne av artikkelen noterer også at det finnes flere begrensninger som Jukebox har, og at fremtidig arbeid vil være rettet mot å forbedre evnen til AI-en. Som forfatterne skriver i en bloggpost:
“ Mens Jukebox representerer et skritt fremover i musikalsk kvalitet, kohesjon, lengde på lydprøver og evne til å kondisjonere på artist, sjanger og tekst, er det et betydelig gap mellom disse genereringene og menneskeskapt musikk. For eksempel, mens de genererte sangene viser lokal musikalsk kohesjon, følger tradisjonelle akkordmønster og kan sogar inneholde imponerende solos, hører vi ikke kjente større musikalske strukturer som refrenger som gjentas.”
For tiden er modellen i stand til å produsere en sang som er gjenkjennelig i stilen til en bestemt sjanger eller selv en bestemt artist. For eksempel kan den produsere sanger i stilen til Elvis Presley, Katy Perry eller Rage Against the Machine. Selv om sangene er gjenkjennelige innen en sjanger eller tema rundt en sangers stil, er de også ganske grove, ofte lydende som en parodi eller en dårlig coverversjon av en sang. Likevel er den tekniske prestasjonen imponerende. Forskerne som er ansvarlige for å lage AI-genereringssystemet, valgte å arbeide på et program i stand til å generere musikk spesifikt fordi oppgaven var vanskelig, og forskerne planlegger å fortsette å forbedre teknikken. Du kan lytte til noen av sangene her.












