AI-modeller og platforme
Tekst-til-Musik Generativ AI: Stability Audio, Google’s MusicLM og mere
Musik, en kunstform, der resonerer med den menneskelige sjæl, har været en konstant ledsager for os alle. At skabe musik med kunstig intelligens begyndte for flere årtier siden. I begyndelsen var forsøgene simple og intuitive, med grundlæggende algoritmer, der skabte monotone melodier. Men da teknologien udviklede sig, blev kompleksiteten og kapaciteten af AI-musikgenerering også større, og dyb læring og Natural Language Processing (NLP) spillede en afgørende rolle i denne teknologi.
I dag udnytter platforme som Spotify AI til at finjustere brugernes lytteroplevelser. Disse dyb-læringsalgoritmer dissekerer individuelle præferencer baseret på forskellige musikalske elementer som tempo og stemning for at skabe personlige sangforslag. De analyserer også bredere lyttemønstre og gennemsøger internettet for sangrelaterede diskussioner for at opbygge detaljerede sangprofiler.
AI’s oprindelse i musik: En rejse fra algorithmisk komposition til generativ modellering
I de tidlige faser af AI’s indtog i musikverdenen, der strakte sig fra 1950’erne til 1970’erne, var fokus primært på algorithmisk komposition. Dette var en metode, hvor computere brugte en defineret sæt af regler til at skabe musik. Den første bemærkelsesværdige skabelse i denne periode var Illiac Suite for String Quartet i 1957. Den brugte Monte Carlo-algoritmen, en proces, der involverede tilfældige tal til at diktere pitch og rytme inden for rammerne af traditionel musikteori og statistiske sandsynligheder.
I denne periode var en anden pioner, Iannis Xenakis, også aktiv. Han brugte stokastiske processer, en koncept, der involverer tilfældige sandsynlighedsfordelinger, til at skabe musik. Han brugte computere og FORTRAN-sproget til at kombinere multiple sandsynlighedsfunktioner, og skabte således et mønster, hvor forskellige grafiske repræsentationer svarede til forskellige lydrum.
Kompleksiteten ved at oversætte tekst til musik
Musik er gemt i en rig og multi-dimensionel dataformat, der omfatter elementer som melodi, harmoni, rytme og tempo, hvilket gør opgaven med at oversætte tekst til musik meget kompleks. En standard sang er repræsenteret af næsten en million tal i en computer, et tal, der er betydeligt højere end andre dataformater som billeder, tekst osv.
Området for lydgenerering oplever innovative tilgange for at overvinde udfordringerne ved at skabe realistisk lyd. En metode indebærer generering af et spektrogram og derefter konvertering af det tilbage til lyd.
En anden strategi udnytter den symboliske repræsentation af musik, som fx nodeskemaer, der kan fortolkes og spilles af musikere. Denne metode er blevet digitaliseret med succes, med værktøjer som Magentas Chamber Ensemble Generator, der skaber musik i MIDI-formatet, et protokol, der faciliterer kommunikation mellem computere og musikinstrumenter.
Men selvom disse tilgange har fremmet feltet, kommer de med deres egne begrænsninger, hvilket understreger den komplekse natur af lydgenerering.
Transformer-baserede autoregressive modeller og U-Net-baserede diffusionsmodeller er i fremhævet position, og producerer state-of-the-art (SOTA)-resultater i generering af lyd, tekst, musik og meget mere. OpenAIs GPT-serie og næsten alle andre LLM’er er i øjeblikket drevet af transformatorer, der anvender enten encoder, decoder eller begge arkitekturer. På kunst-/billedsiden udnytter MidJourney, Stability AI og DALL-E 2 alle diffusionsrammer. Disse to kerne-teknologier har været afgørende for at opnå SOTA-resultater i lydsektoren.
Google’s MusicLM
Google’s MusicLM blev udgivet i maj dette år. MusicLM kan generere høj-fidelity-musikstykker, der resonerer med den eksakte sentiment, der er beskrevet i teksten. Ved at bruge hierarkisk sekvens-til-sekvens-modellering har MusicLM evnen til at omdanne tekstbeskrivelser til musik, der resonerer på 24 kHz over udstrakte varigheder.
Modellen opererer på et multi-dimensionelt niveau, ikke kun ved at følge de tekstuelle input, men også ved at demonstrere evnen til at være betinget af melodier. Dette betyder, at den kan tage en humlet eller fløjtet melodi og omdanne den i overensstemmelse med den stil, der er beskrevet i en tekstbeskrivelse.
Tekniske indsighter
MusicLM udnytter principperne i AudioLM, en ramme, der blev introduceret i 2022 til lydgenerering. AudioLM syntetiserer lyd som en sprogmodellering-opgave inden for et diskret repræsentationsrum, ved at anvende en hierarki af grov-til-fine lyddiskrete enheder, også kendt som tokens. Denne tilgang sikrer høj-fidelity og langvarig koherens over betydelige varigheder.
For at facilitere genereringsprocessen udvider MusicLM AudioLM’s kapaciteter til at inkorporere tekstbetingning, en teknik, der aligner den genererede lyd med nuancerne i input-teksten. Dette opnås gennem et fælles indlejringsspace, der er oprettet ved hjælp af MuLan, en fælles musik-tekstmodel, der er trænet til at projicere musik og dens tilhørende tekstbeskrivelser tæt på hinanden i et indlejringsspace. Denne strategi eliminerer effektivt behovet for undertekster under træning, og tillader modellen at blive trænet på massive audio-korpora.
MusicLM-modellen anvender også SoundStream som sin lyd-tokenizer, der kan genskabe 24 kHz-musik på 6 kbps med imponerende fidelitet, ved at anvende residual vektor-kvantificering (RVQ) til effektiv og høj-kvalitets lydkompression.

En illustration af MusicLM’s pre-træning: SoundStream, w2v-BERT og Mulan | Kilde: her
Desuden udvider MusicLM sine kapaciteter ved at tillade melodi-betingning. Denne tilgang sikrer, at selv en simpel humlet melodi kan lægge grundlag for en majestætisk auditiv oplevelse, finjusteret til den eksakte tekstuelle stilbeskrivelse.
Udviklerne af MusicLM har også open-sourcet MusicCaps, en dataset med 5,5k musik-tekst-par, hver ledsaget af rigelige tekstbeskrivelser, skabt af menneskelige eksperter. Du kan se det her: MusicCaps på Hugging Face.
Er du klar til at skabe AI-lydspor med Google’s MusicLM? Her er, hvordan du kommer i gang:
- Besøg den officielle MusicLM-website og klik på “Kom i gang”.
- Tilmeld dig ventelisten ved at vælge “Tilmeld din interesse”.
- Log ind med din Google-konto.
- Når du har fået adgang, klik på “Prøv nu” for at begynde.
Her er nogle eksempler på prompts, jeg har eksperimenteret med:
“Mediterende sang, beroligende og afslappende, med fløjter og guitarer. Musikken er langsom, med fokus på at skabe en følelse af fred og ro.”
“jazz med saxofon”
Når det sammenlignes med tidligere SOTA-modeller som Riffusion og Mubert i en kvalitativ vurdering, blev MusicLM foretrukket mere end andre, med deltagere, der vurderede overensstemmelsen mellem tekstbeskrivelser og 10-sekunders lydklip.

MusicLM’s præstation, Kilde: her
Stability Audio
Stability AI introducerede for nylig “Stable Audio”, en latent diffusionsmodel-arkitektur, der er betinget af tekstmetadata samt lydfilens varighed og starttid. Denne tilgang, ligesom Google’s MusicLM, har kontrol over indholdet og længden af den genererede lyd, og tillader skabelsen af lydklip med specificerede længder op til træningsvinduets størrelse.
Tekniske indsighter
Stable Audio består af flere komponenter, herunder en Variational Autoencoder (VAE) og en U-Net-baseret betinget diffusionsmodel, der arbejder sammen med en tekst-encoder.

Stable Audio-arkitektur, Kilde: her
VAE’en faciliterer hurtigere generering og træning ved at komprimere stereo-lyd til en data-komprimeret, støjresistent og omvendelig tab-lyd-kodning, og omgår således behovet for at arbejde med rå lydprøver.
Tekst-encoderen, der er afledt fra en CLAP-model, spiller en afgørende rolle i at forstå de komplekse relationer mellem ord og lyde, og tilbyder en informativ repræsentation af den tokeniserede input-tekst. Dette opnås gennem anvendelsen af tekstfunktioner fra den sidste lag i CLAP-tekst-encoderen, der derefter integreres i diffusions-U-Net gennem cross-attention-lag.
En vigtig aspekt er inkorporeringen af tidsindlejring, der beregnes på basis af to egenskaber: startsekundet for lydklippet og den samlede varighed af den originale lydfil. Disse værdier, oversat til per-sekund diskrete lærende indlejring, kombineres med prompt-teksten og føres ind i U-Net’s cross-attention-lag, og giver brugerne mulighed for at diktere den samlede længde af output-lyden.
Stable Audio-modellen blev trænet ved hjælp af en omfattende dataset på over 800.000 lydfiler, gennem samarbejde med stock-musik-leverandøren AudioSparx.
Stable Audio tilbyder en gratis version, der tillader 20 genereringer af op til 20-sekunders spor per måned, og en $12/måned Pro-plan, der tillader 500 genereringer af op til 90-sekunders spor.
Her er et lydklip, jeg har skabt med Stable Audio.
“Cinematic, Soundtrack Gentle Rainfall, Ambient, Beroligende, Fjern hunde, der gør, Rolig blade-rustle, Subtil vind, 40 BPM”
Anvendelserne af sådanne fint skabte lydstykker er uendelige. Filmmagere kan udnytte denne teknologi til at skabe rige og immersive lydlandskaber. I den kommercielle sektor kan annoncører bruge disse tilpassede lydspor. Desuden åbner denne værktøj op for individuelle skabere og kunstnere til at eksperimentere og innovere, og tilbyder en canvas af uendelig potentiale til at skabe lydstykker, der fortæller historier, vækker følelser og skaber atmosfærer med en dybde, der tidligere var svær at opnå uden en betydelig budget eller teknisk ekspertise.
Prompting-tips
Skab den perfekte lyd med tekst-prompts. Her er en hurtig guide til at komme i gang:
- Vær detaljeret: Specificer genrer, stemninger og instrumenter. Fx: Cinematic, Wild West, Percussion, Spændende, Atmosfærisk
- Stemningsindstilling: Kombiner musikalske og emotionelle termer for at overføre den ønskede stemning.
- Instrumentvalg: Forbeder instrumentnavne med adjektiver, som fx “Reverbereret Guitar” eller “Kraftfuld Kor”.
- BPM: Align tempoen med genren for en harmonisk output, som fx “170 BPM” for en Drum and Bass-sang.
Afsluttende bemærkninger
I denne artikel har vi dykket ned i AI-genereret musik/lyd, fra algorithmisk komposition til de sofistikerede generative AI-rammer af i dag som Google’s MusicLM og Stability Audio. Disse teknologier, der udnytter dyb læring og SOTA-kompressionsmodeller, ikke kun forbedrer musikgenerering, men også finjusterer lytteroplevelser.
Men det er et område i konstant udvikling, med udfordringer som vedligeholdelse af langvarig koherens og den pågående debat om ægthed af AI-skabt musik, der udfordrer pionererne på dette område. For blot en uge siden var det hele snak om en AI-skabt sang, der kanaliserede stilene fra Drake og The Weeknd, der havde fået stor opmærksomhed online tidligere på året. Men den blev fjernet fra Grammy-nomineringslisten, hvilket viser den pågående debat om ægthed af AI-genereret musik i branchen (kilde). Da AI fortsætter med at brokke gab mellem musik og lyttere, fremmer det en økosystem, hvor teknologi samarbejder med kunst, og fremmer innovation samtidig med at respektere tradition.

















