AI-modeller och plattformar
Text-till-musik Generativ AI: Stability Audio, Google’s MusicLM och mer
Musik, en konstform som resoneras med den mänskliga själen, har varit en konstant följeslagare för oss alla. Att skapa musik med hjälp av artificiell intelligens började för flera decennier sedan. Initialt var försöken enkla och intuitiva, med grundläggande algoritmer som skapade monotona melodier. Men när tekniken utvecklades, ökade också komplexiteten och förmågan hos AI-musikgeneratorer, vilket banade väg för deep learning och Natural Language Processing (NLP) att spela en avgörande roll i denna teknik.
Idag använder plattformar som Spotify AI för att finjustera användarnas lyssnarupplevelser. Dessa deep learning-algoritmer analyserar individuella preferenser baserat på olika musikaliska element som tempo och stämning för att skapa personliga låtförslag. De analyserar även bredare lyssningsmönster och söker på internet efter låtrelaterade diskussioner för att skapa detaljerade låtprofiler.
Ursprunget till AI i musik: En resa från algoritmisk komposition till generativ modellering
I de tidiga stadierna av AI-mixning i musikvärlden, som sträckte sig från 1950-talet till 1970-talet, fokuserades det främst på algoritmisk komposition. Detta var en metod där datorer använde en uppsättning regler för att skapa musik. Den första noterbara skapelsen under denna period var Illiac Suite för stråkkvartett 1957. Den använde Monte Carlo-algoritmen, en process som involverade slumpmässiga tal för att bestämma tonhöjd och rytm inom ramen för traditionell musikteori och statistiska sannolikheter.
Under denna tid använde en annan pionjär, Iannis Xenakis, stokastiska processer, ett begrepp som involverar slumpmässiga sannolikhetsfördelningar, för att skapa musik. Han använde datorer och FORTRAN-språket för att koppla samman flera sannolikhetsfunktioner, vilket skapade ett mönster där olika grafiska representationer motsvarade olika ljudutrymmen.
Den komplexa uppgiften att översätta text till musik
Musik lagras i en rik och multidimensionell dataformat som omfattar element som melodi, harmoni, rytm och tempo, vilket gör uppgiften att översätta text till musik mycket komplex. En standardlåt representeras av nästan en miljon tal i en dator, en siffra som är betydligt högre än andra dataformat som bilder, text etc.
Ljudgenereringsfältet upplever innovativa tillvägagångssätt för att övervinna utmaningarna med att skapa realistiska ljud. En metod innebär att generera ett spektrogram och sedan konvertera det tillbaka till ljud.
En annan strategi utnyttjar den symboliska representationen av musik, som noter, som kan tolkas och spelas av musiker. Denna metod har digitaliserats framgångsrikt, med verktyg som Magentas Chamber Ensemble Generator som skapar musik i MIDI-format, ett protokoll som möjliggör kommunikation mellan datorer och musikinstrument.
Medan dessa tillvägagångssätt har främjat fältet, kommer de med sina egna begränsningar, vilket understryker den komplexa naturen hos ljudgenerering.
Transformer-baserade autoregressiva modeller och U-Net-baserade diffusionsmodeller är i framkant av tekniken och producerar state-of-the-art (SOTA) resultat i att generera ljud, text, musik och mycket mer. OpenAI:s GPT-serie och nästan alla andra LLM:er drivs för närvarande av transformer som använder antingen encoder, decoder eller båda arkitekturerna. På konst/bildsidan använder MidJourney, Stability AI och DALL-E 2 alla diffusionsramverk. Dessa två kärnteknologierna har varit avgörande för att uppnå SOTA-resultat i ljudsektorn också. I denna artikel kommer vi att dyka ner i Google’s MusicLM och Stable Audio, som står som ett bevis på de remarkabla förmågorna hos dessa teknologier.
Google’s MusicLM
Google’s MusicLM släpptes i maj i år. MusicLM kan generera högkvalitativa musikstycken som motsvarar den exakta känslan som beskrivs i texten. Med hjälp av hierarkisk sekvens-till-sekvens-modellering har MusicLM förmågan att omvandla textbeskrivningar till musik som resoneras vid 24 kHz under långa perioder.
Modellen fungerar på en multidimensionell nivå, inte bara genom att följa de textuella inmatningarna utan också genom att demonstrera förmågan att konditioneras på melodier. Detta innebär att den kan ta en hummad eller visslad melodi och omvandla den enligt den stil som beskrivs i en textbeskrivning.
Tekniska insikter
MusicLM utnyttjar principerna för AudioLM, ett ramverk som introducerades 2022 för ljudgenerering. AudioLM syntetiserar ljud som en språkmodellering inom ett diskret representationsutrymme, med hjälp av en hierarki av grov-till-fine ljud diskreta enheter, också kända som token. Detta tillvägagångssätt säkerställer högkvalitativa och långsiktiga sammanhängande resultat under betydande perioder.
För att underlätta genereringsprocessen utökar MusicLM förmågorna hos AudioLM för att inkorporera textkonditionering, en teknik som alignerar det genererade ljudet med nyanserna i inmatningstexten. Detta uppnås genom ett delat inbäddningsutrymme som skapats med MuLan, en gemensam musik-textmodell som tränats för att projicera musik och dess motsvarande textbeskrivningar nära varandra i ett inbäddningsutrymme. Denna strategi eliminerar effektivt behovet av rubriker under utbildning, vilket tillåter modellen att tränas på stora audio-endast korpusar.
MusicLM-modellen använder också SoundStream som sin ljudtokenisator, som kan återställa 24 kHz musik vid 6 kbps med imponerande trohet, med hjälp av residual vektor kvantifiering (RVQ) för effektiv och högkvalitativ ljudkompression.

En illustration av förträningsprocessen för MusicLM: SoundStream, w2v-BERT och MuLan | Bildkälla: här
Dessutom utökar MusicLM sina förmågor genom att tillåta melodi-konditionering. Detta tillvägagångssätt säkerställer att även en enkel hummad melodi kan lägga grunden för en magnifik auditiv upplevelse, finjusterad till den exakta textstilbeskrivningen.
Utvecklarna av MusicLM har också öppnat källkoden för MusicCaps, en dataset som innehåller 5,5k musik-textpar, var och en åtföljd av rika textbeskrivningar skapade av mänskliga experter. Du kan kolla in det här: MusicCaps på Hugging Face.
Redo att skapa AI-ljudspår med Google’s MusicLM? Här är hur du kommer igång:
- Besök den officiella MusicLM-webbplatsen och klicka på “Kom igång”.
- Gå med i väntelistan genom att välja “Registrera ditt intresse”.
- Logga in med ditt Google-konto.
- När du har fått tillgång, klicka på “Försök nu” för att börja.
Här är några exempelprompter som jag experimenterade med:
“Mediterande sång, lugn och rogivande, med flöjter och gitarrer. Musiken är långsam, med fokus på att skapa en känsla av fred och ro.”
“jazz med saxofon”
När jämfört med tidigare SOTA-modeller som Riffusion och Mubert i en kvalitativ utvärdering, föredrogs MusicLM mer än andra, med deltagare som gav positiva betyg för textbeskrivningarnas kompatibilitet med 10-sekunders ljudklipp.

MusicLM Prestanda, Bildkälla: här
Stability Audio
Stability AI introducerade nyligen “Stable Audio” – en latent diffusionsmodellarkitektur som konditionerats på textmetadata tillsammans med ljudfilens varaktighet och starttid. Detta tillvägagångssätt, liknande Google’s MusicLM, har kontroll över innehållet och längden på det genererade ljudet, vilket möjliggör skapandet av ljudklipp med specificerade längder upp till träningsfönstrets storlek.
Tekniska insikter
Stable Audio består av flera komponenter, inklusive en Variational Autoencoder (VAE) och en U-Net-baserad konditionerad diffusionsmodell, som fungerar tillsammans med en textencoder.

Stable Audio-arkitektur, Bildkälla: här
VAE möjliggör snabbare generering och utbildning genom att komprimera stereo-ljud till ett data-komprimerat, brusbeständigt och omvändbart förlorat latent inbäddningsformat, vilket undviker behovet av att arbeta med råa ljudprover.
Textencodern, som härrör från en CLAP-modell, spelar en avgörande roll i att förstå de intrikata relationerna mellan ord och ljud, och erbjuder en informativ representation av den tokeniserade inmatningstexten. Detta uppnås genom att använda textfunktioner från den sista lagret av CLAP-textencodern, som sedan integreras i diffusions-U-Net genom cross-attention-lager.
En viktig aspekt är inkorporeringen av timing-inbäddningar, som beräknas baserat på två egenskaper: ljudklippets startsekund och den totala varaktigheten för den ursprungliga ljudfilen. Dessa värden, översatta till per-sekund diskreta inlärda inbäddningar, kombineras med prompt-token och matas in i U-Net:s cross-attention-lager, vilket ger användarna möjlighet att diktera den totala längden på utmatningsljudet.
Stable Audio-modellen tränades med hjälp av en omfattande dataset på över 800 000 ljudfiler, genom samarbete med stockmusikleverantören AudioSparx.
Stable Audio erbjuder en gratisversion, som tillåter 20 genereringar av upp till 20-sekunders spår per månad, och en $12/mån Pro-plan, som tillåter 500 genereringar av upp till 90-sekunders spår.
Här är ett ljudklipp som jag skapade med hjälp av Stable Audio.
“Cinematisk, Soundtrack Gentle Rainfall, Ambient, Rogivande, Avlägsna hundar som skäller, Lugnande lövbrus, Subtil vind, 40 BPM”
Tillämpningarna av sådana fint skapade ljudstycken är oändliga. Filmmakare kan utnyttja denna teknik för att skapa rika och immersiva ljudlandskap. I den kommersiella sektorn kan annonsörer utnyttja dessa anpassade ljudspår. Dessutom öppnar detta verktyg upp vägar för enskilda skapare och artister att experimentera och innovativa, och erbjuder en palett av obegränsad potential för att skapa ljudstycken som berättar historier, framkallar känslor och skapar atmosfärer med en djup som tidigare var svår att uppnå utan en betydande budget eller teknisk expertis.
Prompt-tips
Skapa det perfekta ljudet med hjälp av textprompt. Här är en snabb guide för att komma igång:
- Var detaljerad: Specificera genrer, stämningar och instrument. Till exempel: Cinematisk, Vild Väst, Percussion, Spänd, Atmosfärisk
- Stämning: Kombinera musikaliska och emotionella termer för att förmedla den önskade stämningen.
- Instrumentval: Förbättra instrumentnamn med adjektiv, som “Reverbererad gitarr” eller “Kraftfull kör”.
- BPM: Anpassa tempot med genren för en harmonisk utdata, till exempel “170 BPM” för en Drum and Bass-låt.
Avslutande anteckningar
I denna artikel har vi dykt ner i AI-genererad musik/ljud, från algoritmisk komposition till de sofistikerade generativa AI-ramverken idag som Google’s MusicLM och Stability Audio. Dessa teknologier, som utnyttjar deep learning och SOTA-kompressionsmodeller, inte bara förbättrar musikgenerering utan också finjusterar lyssnarupplevelser.
Men det är ett område i konstant utveckling, med hinder som att upprätthålla långsiktig sammanhängande och den pågående debatten om äktheten hos AI-skapad musik, som utmanar pionjärerna inom detta område. För bara en vecka sedan var det allt om en AI-skapad låt som kanalisera stilarna hos Drake och The Weeknd, som initialt hade fått fart online tidigare i år. Men den togs bort från Grammy-nomineringslistan, vilket visar den pågående debatten om legitimiteten hos AI-genererad musik inom branschen (källa). Medan AI fortsätter att överbrygga klyftan mellan musik och lyssnare, främjar det säkert en ekosystem där teknik samexisterar med konst, främjande innovation samtidigt som tradition respekteras.

















