AI-modeller og plattformer
Tekst-til-musikk Generativ AI: Stability Audio, Google’s MusicLM og mer
Musikk, en kunstform som resonrerer med den menneskelige sjelen, har vært en konstant følgesvenn for oss alle. Å lage musikk ved hjelp av kunstig intelligens begynte flere tiår siden. Først var forsøkene enkle og intuitive, med grunnleggende algoritmer som skapte monotone melodier. Men når teknologien ble bedre, økte også kompleksiteten og evnene til AI-musikkgenerering, og banet vei for dypt læring og naturlig språkbehandling (NLP) å spille en avgjørende rolle i denne teknologien.
I dag utnytter plattformer som Spotify AI til å finjustere brukernes lytteropplevelser. Disse dyptlæringsalgoritmene dissekerer individuelle preferanser basert på ulike musikale elementer som tempo og humør for å skape personlige sangforeslag. De analyserer også bredere lyttermønster og søker på internettet etter sangrelaterte diskusjoner for å bygge detaljerte sangprofiler.
Illiac Suite for String Quartet i 1957 var den første bemerkelsesverdige skapelsen i denne perioden. Den brukte Monte Carlo-algoritmen, en prosess som involverer tilfeldige tall for å diktere tonehøyde og rytme innenfor rammen av tradisjonell musikteori og statistiske sannsynligheter.
Under denne perioden var en annen pioner, Iannis Xenakis, som utnyttet stokastiske prosesser, et konsept som involverer tilfeldige sannsynlighetsfordelinger, for å skape musikk. Han brukte datamaskiner og FORTRAN-språket til å koble sammen flere sannsynlighetsfunksjoner, og skapte et mønster der ulike grafiske representasjoner korresponderte med ulike lydrom.
Opphavet til AI i musikk: En reise fra algoritmisk komposisjon til generativ modellering
I de tidlige fasene av AI i musikken, som omfattet 1950- til 1970-årene, var fokuset primært på algoritmisk komposisjon. Dette var en metode der datamaskiner brukte en definert sett av regler for å skape musikk.
Kompleksiteten ved å oversette tekst til musikk
Musikk lagres i en rik og flerdimensjonal dataformat som omfatter elementer som melodi, harmoni, rytme og tempo, og gjør oppgaven med å oversette tekst til musikk svært kompleks. En standard sang representeres av nesten en million tall i en datamaskin, et tall som er betydelig høyere enn andre dataformater som bilde, tekst osv.
Feltet audio-generering er vitne til innovative tilnærminger for å overvinne utfordringene med å skape realistisk lyd. En metode innebærer å generere et spektrogram og deretter konvertere det tilbake til audio.
En annen strategi utnytter den symbolske representasjonen av musikk, som notasjon, som kan tolkes og spilles av musikere. Denne metoden er blitt digitalisert med suksess, med verktøy som Magentas Chamber Ensemble Generator som skaper musikk i MIDI-format, et protokoll som muliggjør kommunikasjon mellom datamaskiner og musikkinstrumenter.
mens disse tilnærminger har fremmet feltet, kommer de med sine egne begrensninger, og understreker den komplekse naturen til audio-generering.
Transformer-baserte autoregressive modeller og U-Net-baserte diffusjonsmodeller er i fremkant av teknologien, og produserer state-of-the-art (SOTA) resultater i å generere audio, tekst, musikk og mye mer. OpenAIs GPT-serie og nesten alle andre LLM’er er i dag drevet av transformatorer som utnytter enten encoder, decoder eller begge arkitekturer. På kunst/bilde-siden utnytter MidJourney, Stability AI og DALL-E 2 alle diffusjonsrammeverk. Disse to kjerne-teknologiene har vært avgjørende for å oppnå SOTA-resultater i audio-sektoren også. I denne artikkelen vil vi dykke ned i Google’s MusicLM og Stable Audio, som står som et vitnesbyrd om de bemerkelsesverdige evnene til disse teknologiene.
Google’s MusicLM
Google’s MusicLM ble lansert i mai i år. MusicLM kan generere høykvalitets musikkstykker som resonrerer med den eksakte sentiment beskrevet i teksten. Ved hjelp av hierarkisk sekvens-til-sekvens-modellering har MusicLM evnen til å transformere tekstbeskrivelser til musikk som resonrerer på 24 kHz over utvidede varigheter.
Modellen opererer på et flerdimensjonalt nivå, ikke bare ved å følge tekstinput, men også ved å demonstrere evnen til å være betinget av melodier. Dette betyr at den kan ta en hummet eller fløytet melodi og transformere den i henhold til stilen beskrevet i en tekst-overskrift.
Tekniske innsikter
MusicLM utnytter prinsippene til AudioLM, et rammeverk introdusert i 2022 for audio-generering. AudioLM syntetiserer audio som en språkmodellering-oppgave innenfor et diskret representasjonsrom, ved hjelp av en hierarki av grov-til-fine audio-diskerete enheter, også kjent som token. Denne tilnærmingen sikrer høykvalitets og langvarig kohens i betydelige varigheter.
For å fasilitere genereringsprosessen, utvider MusicLM evnene til AudioLM for å inkorporere tekst-betinging, en teknikk som alignerer den genererte audio med nuansene i tekst-input. Dette oppnås gjennom et delt innleggelsesrom skapt ved hjelp av MuLan, en felles musikk-tekstmodell trent for å projicere musikk og dens tilhørende tekstbeskrivelser nær hverandre i et innleggelsesrom. Denne strategien eliminerer effektivt behovet for overskrifter under trening, og lar modellen bli trent på massive audio-kun korpus.
MusicLM-modellen bruker også SoundStream som sin audio-tokenizer, som kan rekonstruere 24 kHz-musikk på 6 kbps med imponerende trofasthet, ved hjelp av residual vektor-kvantifisering (RVQ) for effektiv og høykvalitets audio-komprimering.

En illustrasjon av fortreningprosessen til MusicLM: SoundStream, w2v-BERT og Mulan | Kilde: her
Utviklerne av MusicLM har også åpnet kilden for MusicCaps, en datasett som inneholder 5,5k musikk-tekst-par, hvor hver er ledsaget av rike tekstbeskrivelser skapt av menneskelige eksperter. Du kan sjekke det ut her: MusicCaps på Hugging Face.
Klar til å skape AI-lydspor med Google’s MusicLM? Her er hvordan du kommer i gang:
- Besøk den offisielle MusicLM-nettsiden og klikk “Kom i gang.”
- Meld deg på ventelisten ved å velge “Meld din interesse.”
- Logg inn med din Google-konto.
- Når du har fått tilgang, klikk “Prøv nå” for å begynne.
Her er noen eksempel-prompter jeg eksperimenterte med:
“Meditasjonssang, rolig og beroligende, med fløyter og gitarer. Musikken er langsom, med fokus på å skape en følelse av fred og ro.”
“jazz med saksofon”
Når sammenlignet med tidligere SOTA-modeller som Riffusion og Mubert i en kvalitativ vurdering, ble MusicLM foretrukket mer enn andre, med deltakere som favoriserte kompatibiliteten av tekst-overskrifter med 10-sekunders audio-klipp.

MusicLM Performance, Kilde: her
Stability Audio
Stability AI lanserte nylig “Stable Audio” – en latent diffusjonsmodellarkitektur betinget av tekst-metadata samt audio-fil varighet og starttid. Denne tilnærmingen, som Google’s MusicLM, har kontroll over innhold og lengde på den genererte audio, og lar deg skape audio-klipp med spesifiserte lengder opp til treningsvinduet.
Tekniske innsikter
Stable Audio består av flere komponenter, inkludert en Variational Autoencoder (VAE) og en U-Net-basert betinget diffusjonsmodell, som arbeider sammen med en tekst-encoder.

Stable Audio-arkitektur, Kilde: her
VAE-en muliggjør raskere generering og trening ved å komprimere stereo-audio til en data-komprimert, støyresistent og omvendelig tap-encoding, og unngår behovet for å arbeide med rå audio-eksempler.
Tekst-encoderen, avledet fra en CLAP-modell, spiller en avgjørende rolle i å forstå de intrikate relasjonene mellom ord og lyder, og tilbyr en informativ representasjon av tokenisert tekst-input. Dette oppnås gjennom å utnytte tekst-egenskaper fra den nest siste laget i CLAP-tekst-encoderen, som deretter integreres i diffusjons-U-Net gjennom cross-attention-lag.
En viktig aspekt er inkorporeringen av tids-embeddings, som beregnes basert på to egenskaper: startsekundet for audio-klippet og den totale varigheten av den opprinnelige audio-filen. Disse verdiene, oversatt til per-sekund diskrete lært-embeddings, kombineres med prompt-token og matet inn i U-Net’s cross-attention-lag, og gir brukerne mulighet til å diktere den totale lengden av output-audio.
Stable Audio-modellen ble trent ved hjelp av en omfattende datasett på over 800 000 audio-filer, gjennom samarbeid med stock-musikk-leverandøren AudioSparx.
Stable Audio tilbyr en gratis versjon, som tillater 20 genereringer av opptil 20-sekunders spor per måned, og en $12/måned Pro-plan, som tillater 500 genereringer av opptil 90-sekunders spor.
Her er et audio-klipp som jeg skapte ved hjelp av Stable Audio.
“Kinetisk, soundtrack, rolig regn, ambient, beroligende, fjernende hunder, rolig blad-rustling, subtil vind, 40 BPM”
Anvendelsene av slike fint skapte audio-biter er endeløse. Filmmakere kan utnytte denne teknologien til å skape rike og immersive lydlandskap. I det kommersielle markedet kan annonserere utnytte disse tilpassede audio-spor. I tillegg åpner dette verktøyet opp for individuelle skapere og kunstnere å eksperimentere og innovere, og tilbyr en canvas av ubegrenset potensial til å skape lydbiter som forteller historier, vekker følelser og skaper atmosfærer med en dybde som tidligere var vanskelig å oppnå uten en betydelig budsjett eller teknisk ekspertise.
Prompting-tips
Skap det perfekte audio ved hjelp av tekst-prompter. Her er en rask guide for å komme i gang:
- Vær detaljert: Spesifiser sjangere, humør og instrumenter. For eksempel: Kinetisk, Vill Vest, Perkusjon, Spent, Atmosfærisk
- Humør-innstilling: Kombiner musikalske og emosjonelle termer for å overføre det ønskede humøret.
- Instrument-valg: Forbedre instrumentnavn med adjektiver, som “Reverberert Gitar” eller “Kraftig Kor”.
- BPM: Align tempo med sjanger for en harmonisk output, som “170 BPM” for en Drum and Bass-spor.
Avsluttende bemerkninger
I denne artikkelen har vi dykket ned i AI-generert musikk/audio, fra algoritmisk komposisjon til de sofistikerte generative AI-rammeverkene i dag, som Google’s MusicLM og Stability Audio. Disse teknologiene, som utnytter dypt læring og SOTA-komprimeringsmodeller, ikke bare forbedrer musikk-generering, men også finjusterer lytter-erfaringer.
Likevel er det et felt i konstant utvikling, med hindringer som opprettholdelse av langvarig kohens og den pågående debatten om autentisiteten til AI-skapt musikk, som utfordrer pionerene i dette feltet. For bare en uke siden var det hele snakk om en AI-skapt sang som kanaliserte stilene til Drake og The Weeknd, som hadde fanget fyr tidligere i år. Men den ble fjernet fra Grammy-nominasjonslisten, og viste den pågående debatten om legitimiteten til AI-generert musikk i industrien (kilde). Mens AI fortsatt brobygger gapet mellom musikk og lyttere, fremmer det også en økosystem hvor teknologi samexisterer med kunst, og fremmer innovasjon samtidig som det respekterer tradisjon.

















