AI-modellen en platforms
Tekst-naar-Muziek Generatieve AI: Stabiliteit Audio, Google’s MusicLM en Meer
Muziek, een kunstvorm die resoneren met de menselijke ziel, is een constante metgezel van ons allemaal. Het creëren van muziek met behulp van kunstmatige intelligentie begon enkele decennia geleden. Aanvankelijk waren de pogingen eenvoudig en intuïtief, met basisalgoritmes die eentonige melodieën creëerden. Echter, naarmate de technologie vorderde, zo ook de complexiteit en mogelijkheden van AI-muziekgeneratoren, wat de weg vrijmaakte voor diepe leerlingen en Natural Language Processing (NLP) om een cruciale rol te spelen in deze technologie.
Vandaag de dag gebruiken platforms zoals Spotify AI om de luisterervaring van hun gebruikers te verfijnen. Deze diepe leerlingen-algoritmes ontleedden individuele voorkeuren op basis van verschillende muzikale elementen zoals tempo en stemming om gepersonaliseerde liedjesuggesties te creëren. Ze analyseren ook bredere luisterpatronen en scannen het internet voor song-gerelateerde discussies om gedetailleerde liedjesprofielen te creëren.
De Oorsprong van AI in Muziek: Een Reis van Algoritmische Compositie naar Generatieve Modellering
In de vroege stadia van AI-mixing in de muziekwereld, van de jaren 50 tot de jaren 70, lag de focus voornamelijk op algoritmische compositie. Dit was een methode waarbij computers een gedefinieerde set regels gebruikten om muziek te creëren. De eerste opvallende creatie tijdens deze periode was de Illiac Suite voor Strijkkwartet in 1957. Het gebruikte de Monte Carlo-algoritme, een proces dat willekeurige nummers gebruikte om de toonhoogte en ritme binnen de grenzen van traditionele muziektheorie en statistische waarschijnlijkheden te dicteren.
Tijdens deze periode was een andere pionier, Iannis Xenakis, die stochastische processen gebruikte, een concept dat willekeurige kansverdelingen omvat, om muziek te creëren. Hij gebruikte computers en de FORTRAN-taal om meerdere kansfuncties te verbinden, een patroon te creëren waarbij verschillende grafische voorstellingen overeenkwamen met diverse geluidsruimtes.
De Complexiteit van het Vertalen van Tekst naar Muziek
Muziek wordt opgeslagen in een rijke en multidimensionale gegevensformaat die elementen zoals melodie, harmonie, ritme en tempo omvat, waardoor de taak van het vertalen van tekst naar muziek zeer complex is. Een standaardlied wordt weergegeven door bijna een miljoen nummers in een computer, een getal dat aanzienlijk hoger is dan andere gegevensformaten zoals afbeeldingen, tekst, enz.
Het veld van audiogeneratie ziet innovatieve benaderingen om de uitdagingen van realistische geluiden te overwinnen. Een methode houdt het genereren van een spectrogram in, en vervolgens het terug converteren naar audio.
Een andere strategie maakt gebruik van de symbolische voorstelling van muziek, zoals bladmuziek, die kan worden geïnterpreteerd en gespeeld door musici. Deze methode is succesvol gedigitaliseerd, met tools zoals Magenta’s Chamber Ensemble Generator die muziek creëert in het MIDI-formaat, een protocol dat communicatie tussen computers en muziekinstrumenten mogelijk maakt.
Hoewel deze benaderingen het veld hebben gevorderd, komen ze met hun eigen set van beperkingen, waardoor de complexe aard van audiogeneratie wordt benadrukt.
Transformer-gebaseerde autoregressieve modellen en U-Net-gebaseerde diffusiemodellen, zijn aan de voorzijde van de technologie, waardoor state-of-the-art (SOTA) resultaten worden geproduceerd in het genereren van audio, tekst, muziek en veel meer. OpenAI’s GPT-serie en bijna alle andere LLM’s worden momenteel aangedreven door transformatoren die gebruikmaken van zowel encoder-, decoder- als beide architectuur. Aan de kant van kunst/afbeeldingen gebruiken MidJourney, Stability AI en DALL-E 2 allemaal diffusiekaders. Deze twee kern technologieën zijn essentieel geweest in het bereiken van SOTA-resultaten in de audiosector. In dit artikel zullen we dieper ingaan op Google’s MusicLM en Stable Audio, die getuigen van de opmerkelijke mogelijkheden van deze technologieën.
Google’s MusicLM
Google’s MusicLM werd in mei van dit jaar uitgebracht. MusicLM kan high-fidelity muziekstukken genereren die overeenkomen met de exacte sentiment beschreven in de tekst. Met behulp van hiërarchische sequentie-naar-sequentie-modellering, heeft MusicLM de mogelijkheid om tekstbeschrijvingen om te zetten in muziek die resoneren bij 24 kHz over verlengde duur.
Het model werkt op een multidimensionaal niveau, niet alleen voldoet aan de tekstuele invoer, maar toont ook de mogelijkheid om voorwaardelijk te zijn op melodieën. Dit betekent dat het een gehumde of gefloten melodie kan nemen en transformeren volgens de stijl beschreven in een tekstbijschrift.
Technische Inzichten
MusicLM maakt gebruik van de principes van AudioLM, een kader dat in 2022 is geïntroduceerd voor audiogeneratie. AudioLM synthetiseert audio als een taakmodellering in een discrete representatie-ruimte, met behulp van een hiërarchie van grof-naar-fijn audi discrete eenheden, ook wel tokens genoemd. Deze aanpak garandeert high-fidelity en langetermijncoherentie over aanzienlijke duur.
Om het generatieproces te faciliteren, breidt MusicLM de mogelijkheden van AudioLM uit om tekstvoorwaardelijkheid te incorporeren, een techniek die de gegenereerde audio aligneert met de nuances van de invoertekst. Dit wordt bereikt door een gedeelde embeddingsruimte te creëren met behulp van MuLan, een gezamenlijk muziek-tekstmodel getraind om muziek en de corresponderende tekstbeschrijvingen dicht bij elkaar in een embeddingsruimte te projecteren. Deze strategie elimineert effectief de noodzaak voor bijschriften tijdens de training, waardoor het model getraind kan worden op enorme audio-only corpora.
MusicLM-model maakt ook gebruik van SoundStream als zijn audio-tokenizer, die 24 kHz-muziek kan reconstrueren bij 6 kbps met indrukwekkende geloofwaardigheid, met behulp van residuvectorquantificatie (RVQ) voor efficiënte en high-kwaliteit audiocompressie.

Een illustratie van het pretrainingsproces van MusicLM: SoundStream, w2v-BERT en Mulan | Afbeeldingsbron: hier
Daarnaast breidt MusicLM zijn mogelijkheden uit door melodievoorwaardelijkheid toe te staan. Deze aanpak garandeert dat zelfs een eenvoudige gehumde tune de basis kan leggen voor een magnifieke auditieve ervaring, afgestemd op de exacte tekstuele stijlbeschrijvingen.
De ontwikkelaars van MusicLM hebben ook MusicCaps openbaar gemaakt, een dataset met 5,5k muziek-tekstparen, elk met rijke tekstbeschrijvingen gemaakt door menselijke experts. U kunt het hier vinden: MusicCaps op Hugging Face.
Klaar om AI-soundtracks te creëren met Google’s MusicLM? Hier is hoe u begint:
- Bezoek de officiële MusicLM-website en klik op “Get Started.”
- Sluit u aan bij de wachtlijst door “Register your interest” te selecteren.
- Log in met uw Google-account.
- Als u toegang krijgt, klikt u op “Try Now” om te beginnen.
Hieronder vindt u een paar voorbeeldprompts die ik heb geëxperimenteerd:
“Mediterend lied, kalmerend en sussend, met fluiten en gitaren. De muziek is langzaam, met een focus op het creëren van een gevoel van vrede en kalmte.”
“jazz met saxofoon”
Wanneer vergeleken met eerdere SOTA-modellen zoals Riffusion en Mubert in een kwalitatieve evaluatie, werd MusicLM meer voorkeur gegeven dan anderen, met deelnemers die de compatibiliteit van tekstbijschriften met 10-seconde audio-clips gunstig beoordeelden.

MusicLM-prestatie, Afbeeldingsbron: hier
Stabiliteit Audio
Stability AI introduceerde onlangs “Stable Audio” een latent diffusiemodelarchitectuur die voorwaardelijk is op tekstmetadata naast audiobestandsduur en starttijd. Deze aanpak, net als Google’s MusicLM, heeft controle over de inhoud en lengte van de gegenereerde audio, waardoor het mogelijk is om audioclips te creëren met gespecificeerde lengtes tot de grootte van de trainingswindow.
Technische Inzichten
Stable Audio bestaat uit verschillende componenten, waaronder een Variational Autoencoder (VAE) en een U-Net-gebaseerd voorwaardelijk diffusiemodel, die samenwerken met een tekstencoder.

Stable Audio-architectuur, Afbeeldingsbron: hier
De VAE faciliteert snellere generatie en training door stereo-audio te comprimeren in een data-compressed, ruisbestendige en omkeerbare verliesgevende latent encoding, waardoor de noodzaak om met raw-audio-monsters te werken wordt omzeild.
De tekstencoder, afgeleid van een CLAP-model, speelt een cruciale rol in het begrijpen van de intrigerende relaties tussen woorden en geluiden, waardoor een informatieve voorstelling van de getokeniseerde invoertekst wordt geboden. Dit wordt bereikt door het gebruik van tekstkenmerken uit de penultieme laag van de CLAP-tekstencoder, die vervolgens worden geïntegreerd in de diffusie U-Net via cross-attention lagen.
Een belangrijk aspect is de incorporatie van timing-embeddings, die worden berekend op basis van twee eigenschappen: de startseconde van het audioblok en de totale duur van het originele audiobestand. Deze waarden, vertaald in per-seconde discrete geleerde embeddings, worden gecombineerd met de prompt-tokens en gevoerd in de U-Net’s cross-attention lagen, waardoor gebruikers de totale lengte van de uitvoeraudio kunnen dicteren.
Het Stable Audio-model is getraind met behulp van een uitgebreide dataset van meer dan 800.000 audiobestanden, in samenwerking met stock-muziekprovider AudioSparx.
Stable Audio biedt een gratis versie, waarmee 20 generaties van maximaal 20-seconde tracks per maand mogelijk zijn, en een $12/maand Pro-plan, waarmee 500 generaties van maximaal 90-seconde tracks mogelijk zijn.
Hieronder vindt u een audioclip die ik heb gemaakt met behulp van Stable Audio.
“Cinematografisch, soundtrack zachte regenval, ambient, sussend, verre honden blaffen, kalmerend blad geruis, subtiele wind, 40 BPM”
De toepassingen van dergelijke fijn gecreëerde audiostukken zijn eindeloos. Filmmakers kunnen deze technologie gebruiken om rijke en immersieve geluidslandschappen te creëren. In de commerciële sector kunnen adverteerders deze aangepaste audiobanden gebruiken. Bovendien opent deze tool wegen voor individuele creators en artiesten om te experimenteren en te innoveren, waardoor een canvas van onbeperkt potentieel wordt geboden om geluidsstukken te creëren die verhalen vertellen, emoties opwekken en atmosferen creëren met een diepte die eerder moeilijk te bereiken was zonder een aanzienlijk budget of technische expertise.
Prompting Tips
Creëer de perfecte audio met tekstprompts. Hier is een snelle gids om u te helpen beginnen:
- Wees gedetailleerd: Specificeer genres, stemmingen en instrumenten. Bijv.: Cinematografisch, Wild West, Percussie, Gespannen, Atmosferisch
- Stemming instellen: Combineer muzikale en emotionele termen om de gewenste stemming over te brengen.
- Instrumentkeuze: Versterk instrumentnamen met bijvoeglijke naamwoorden, zoals “Reverberated Gitaar” of “Krachtig Koor”.
- BPM: Aligneer de tempo met het genre voor een harmonieuze uitvoer, zoals “170 BPM” voor een Drum en Bass-track.
Sluitende Notities
In dit artikel zijn we dieper ingegaan op AI-gegenereerde muziek/audio, van algoritmische composities tot de geavanceerde generatieve AI-kaders van vandaag zoals Google’s MusicLM en Stability Audio. Deze technologieën, die diepe leerlingen en SOTA-compressiemodellen gebruiken, verhogen niet alleen de muziekgeneratie, maar verfijnen ook de luisterervaringen.
Desondanks is het een domein in constante evolutie, met hindernissen zoals het behouden van langetermijncoherentie en de voortdurende discussie over de authenticiteit van AI-gecreëerde muziek, die de pioniers in dit veld uitdagen. Slechts een week geleden was de buzz rond een AI-gecreëerd lied dat de stijlen van Drake en The Weeknd kanaliseerde, die aanvankelijk online vuur had gevangen eerder dit jaar. Echter, het werd verwijderd van de Grammy-nominatielijst, wat de voortdurende discussie over de legitimiteit van AI-gegenereerde muziek in de industrie aantoont (bron). Terwijl AI de kloof tussen muziek en luisteraars overbrugt, bevordert het een ecosysteem waarin technologie samenleeft met kunst, innovatie bevordert en traditie respecteert.

















