AI-mallit ja alustat
Teksti-musiikki-generoiva tekoäly: Stabilitet Audio, Google MusicLM ja lisää
Musiikki, joka on ihmisen sielun kanssa resonoi, on ollut meidän kaikkien jatkuva seuralainen. Musiikin luominen tekoälyllä alkoi useita vuosikymmeniä sitten. Aluksi yritykset olivat yksinkertaisia ja intuitiivisia, ja perusalgomit loi monotonisia melodioita. Kuitenkin teknologian edetessä myös tekoälymusiikin generoijien monimutkaisuus ja kyky kasvoi, ja syväoppiminen ja luonnollisen kielen prosessointi (NLP) alkoivat näytellä tärkeää rooliaa tässä teknologiassa.
Tänään alustat kuten Spotify käyttävät tekoälyä parantaakseen käyttäjien kuuntelukokemuksia. Nämä syväoppimisalgoritmit analysoivat yksilöiden mieltymyksiä eri musiikillisten elementtien, kuten tempon ja tunnelman, perusteella ja luovat räätälöityjä lauluesityksiä. Ne analysoivat myös laajempia kuuntelumalleja ja etsivät internetistä lauluja koskevia keskusteluja luodakseen yksityiskohtaisia lauluprofiileja.
Illiac Suite for String Quartet vuonna 1957 oli ensimmäinen merkittävä tekoälymusiikin luomistyö. Se käytti Monte Carlo -algoritmia, joka perustui satunnaisiin numeroihin määrätessä sävelkorkeutta ja rytmiä perinteisen musiikinteorian ja tilastollisten todennäköisyyksien puitteissa.
Tuolloin toinen uranuurtaja, Iannis Xenakis, käytti stokastisia prosesseja, jotka perustuvat satunnaisiin todennäköisyyksiin, musiikin luomiseen. Hän käytti tietokoneita ja FORTRAN-kieltä yhdistääkseen useita todennäköisyysfunktioita, luoden mallin, jossa eri graafiset edustukset vastaavat eri äänitiloja.
Teksti-musiikin kääntämisen monimutkaisuus
Musiikki on tallennettu rikkaaseen ja moniulotteiseen dataformaattiin, joka käsittää elementtejä kuten melodia, harmonia, rytmi ja tempo, mikä tekee tekstistä musiikiksi kääntämisen hyvin monimutkaiseksi. Standardilaulu edustetaan lähes miljoonalla numerolla tietokoneessa, mikä on huomattavasti suurempi kuin muut dataformaattien kuten kuvan tai tekstin.
Äänen generoinnin alalla on kehitetty innovatiivisia lähestymistapoja haasteiden voittamiseksi realistisen äänen luomisessa. Yksi menetelmä on generoida spektrogrammi ja sitten muuttaa se takaisin ääneksi.
Toinen strategia hyödyntää musiikin symbolista edustusta, kuten nuotteja, jotka voidaan tulkita ja esittää muusikoilla. Tämä menetelmä on digitalisoitu menestyksekkäästi, ja työkalut kuten Magentan Chamber Ensemble Generator luovat musiikkia MIDI-formaatissa, joka on protokolla, joka mahdollistaa tietokoneiden ja musiikkisoittimien välisen viestinnän.
Nämä lähestymistavat ovat edistäneet alaa, mutta ne ovat myös omia rajoituksiaan, korostaen äänen generoinnin monimutkaisuutta.
Transformer-pohjaiset autoregressiiviset mallit ja U-Net-pohjaiset diffusiomallit ovat teknologian eturintamassa, tuottaen valtavirta-tason (SOTA) tuloksia äänen, tekstin, musiikin ja paljon muun generoimisessa. OpenAI:n GPT-sarja ja lähes kaikki muut LLM:t ovat nykyään transformerien voimalla, jotka käyttävät joko encoder-, decoder- tai molempia arkkitehtuureja. Taiteen/kuvin puolella MidJourney, Stability AI ja DALL-E 2 kaikki hyödyntävät diffusiorunkoja. Nämä kaksi ydinteknologiaa ovat olleet avainasemassa saavuttamassa SOTA-tuloksia äänen osalla.
Google MusicLM
Google (GOOGL ) julkaisi MusicLM:n toukokuussa. MusicLM voi generoida korkealaatuisia musiikkikappaleita, jotka vastaavat tarkalleen tekstissä kuvattua tunnelmaa. Hierarkkisen sekvenssi-sekvenssi-mallin avulla MusicLM pystyy muuttamaan tekstikuvauksia musiikiksi, joka resonoi 24 kHz:n taajuudella pitkin laajaa aikajaksoa.
Malli toimii moniulotteisella tasolla, ei ainoastaan noudattaen tekstisyötteitä, vaan myös osoittaen kykyä ehdollistaa melodioita. Tämä tarkoittaa, että se voi ottaa humatun tai viheltämän melodiansa ja muuttaa sen mukaisesti tekstikuvauksessa määritellyn tyylin mukaan.
Teknisiä näkemyksiä
MusicLM hyödyntää AudioLM:n periaatteita, joka on kehys, joka esiteltiin vuonna 2022 äänen generoimiseksi. AudioLM syntetisoi äänen kielen mallintamistehtävänä diskreetin edustusavaruuden sisällä, käyttäen hierarkkista karkeasta hienoon äänen diskreettejä yksiköitä, jotka tunnetaan myös tokeneina. Tämä lähestymistapa takaa korkealaatuisen ja pitkäaikaisen yhdenmukaisuuden merkittävien aikajaksojen yli.
Jotta generointiprosessi voidaan helpottaa, MusicLM laajentaa AudioLM:n ominaisuuksia sisällyttämällä tekstiehdollistamisen, joka on tekniikka, joka tasapainottaa generoidun äänen syötetyn tekstin nuansseja. Tämä saavutetaan jaetun upotusavaruuden avulla, joka luodaan MuLanin avulla, joka on yhteinen musiikki-teksti-malli, joka on koulutettu projisoimaan musiikkia ja sen vastaavaa tekstikuvauksia lähelle toisiaan upotusavaruudessa. Tämä strategia poistaa tehokkaasti tarpeen kuvauksille koulutuksen aikana, sallien mallin koulutuksen valtavilla ääniaineistoilla.
MusicLM-malli käyttää myös SoundStream:ia äänen tokenoijana, joka voi rekonstruoida 24 kHz:n musiikkia 6 kbps:n bittinopeudella vaikuttavalla uskollisuudella, hyödyntäen jäännösvectorigenerointia (RVQ) tehokkaan ja laadukkaan äänen pakkauksen vuoksi.

Kuva MusicLM:n esikoulutusprosessista | Kuva: täältä
Lisäksi MusicLM laajentaa kykyjään sallimalla melodioihin perustuvan ehdollistamisen. Tämä lähestymistapa takaa, että jopa yksinkertainen humatun sävelmä voi muodostaa perustan vaikuttavalle äänikokemukselle, joka on räätälöity tarkalleen tekstikuvauksen mukaan.
MusicLM:n kehittäjät ovat myös julkaisseet MusicCaps-aineiston, joka sisältää 5,5 tuhatta musiikki-teksti-paria, joista jokainen on varustettu rikkailla tekstikuvauksilla, jotka on luonut ihmisten asiantuntijat. Voit tarkastella sitä täältä: MusicCaps Hugging Facessa.
Olet valmis luomaan AI-ääniraidat Google MusicLM:llä? Tässä on aloittamisohjeet:
- Mene MusicLM:n viralliselle verkkosivulle ja valitse “Aloita.”
- Liity odotuslistalle valitsemalla “Rekisteröi mielenkiintosi.”
- Kirjaudu sisään Google-tililläsi.
- Kun pääset käyttöön, valitse “Kokeile nyt” aloittaaksesi.
Tässä on muutamia esimerkkipromptteja, joilla kokeilin:
“Meditatiivinen laulu, rauhallinen ja lohduttava, huiluilla ja kitaroilla. Musiikki on hidas, ja se keskittyy rauhan ja tyynen tunteen luomiseen.”
“jazz saksofonilla”
Kun verrataan aiempia SOTA-malleja, kuten Riffusionia ja Mubertia, laadullisessa arvioinnissa, MusicLM oli enemmän suosittu kuin muut, ja osallistujat arvioivat myönteisesti tekstikuvauksien yhdenmukaisuutta 10 sekunnin äänenklipeillä.

MusicLM-suoritusvertailu, Kuva: täältä
Stabilitet Audio
Stability AI esitteli viime viikolla “Stable Audio” -latenstiivisen diffusiomallin, joka on ehdollistettu tekstimetatiedolla sekä äänitiedoston kestolla ja aloitusaikalla. Tämä lähestymistapa, kuten Google MusicLM, antaa mahdollisuuden luoda ääniklippejä, joilla on määritetty kesto, jopa koulutusikkunan koko.
Teknisiä näkemyksiä
Stable Audio koostuu useista osista, mukaan lukien variational autoencoder (VAE) ja U-Net-pohjainen ehdollistettu diffusiomalli, jotka toimivat yhdessä tekstienkoodauksen kanssa.

Stable Audion arkkitehtuuri, Kuva: täältä
VAE mahdollistaa nopeamman generoinnin ja koulutuksen pakkaamalla stereofonisen äänen tiiviisti, vikasietoiseen ja kääntöävään latenttiin koodaukseen, ohittaen tarpeen työskennellä raakaa ääninäytteillä.
Tekstienkoodaus, joka perustuu CLAP-malliin, on tärkeässä roolissa ymmärtäessä tekstien ja äänien välisiä suhteita, tarjoten tietokannan tokenoidusta syötestekstistä. Tämä saavutetaan käyttämällä tekstiominaisuuksia CLAP-tekstienkoodauksen toiseksi viimeiseltä kerrokselta, jotka yhdistetään diffusio-U-Net:iin cross-attention-kerrosten kautta.
Tärkeä näkökohta on aikauksen upotusten sisällyttäminen, jotka lasketaan kahden ominaisuuden perusteella: äänipalikan aloituss ekunti ja alkuperäisen äänitiedoston kesto. Nämä arvot, jotka on käännetty sekuntikohtaisiksi oppimiskykyisiksi upotuksiksi, yhdistetään syötesteksteihin ja syötetään U-Net:iin cross-attention-kerrosten kautta, antaen käyttäjille mahdollisuuden määritellä tulosteen äänen kesto.
Stable Audio -malli on koulutettu laajalla äänitiedostojen aineistolla, yhteistyössä stock-musiikkitoimittaja AudioSparxin kanssa.
Stable Audio tarjoaa ilmaisen version, joka sallii 20 generointia 20 sekunnin pituisia raitoja kuukaudessa, ja 12 dollarin kuukausimaksun Pro-suunnitelman, joka sallii 500 generointia 90 sekunnin pituisia raitoja.
Tässä on ääniklippi, jonka loin Stable Audion avulla.
“Elokuvamainen, soundtrack, lempeä sade, ambient, lohduttava, etäiset koirat haukkuvat, rauhallinen lehtien kahina, hienoinen tuuli, 40 BPM”
Tällaisia äänikappaleiden soveltamismahdollisuuksia on rajattomasti. Elokuvantekijät voivat hyödyntää tätä teknologiaa luodakseen rikkaat ja immersiiviset äänimaisemat. Mainonnassa mainostajat voivat käyttää näitä räätälöityjä ääniraitoja. Lisäksi tämä työkalu avaa yksilöluojille ja taiteilijoille mahdollisuuksia kokeilla ja innovoida, tarjoten rajattoman potentiaalin luoda äänikappaleita, jotka kertovat tarinoita, herättävät tunteita ja luovat ilmapiiriä syvyydellä, jota aiemmin oli vaikea saavuttaa ilman merkittävää budjettia tai teknistä osaamista.
Ohjeita tekstipromptteihin
Luo täydellinen ääni tekstiprompttien avulla. Tässä on nopea opas aloittamiseen:
- Ole yksityiskohtainen: Määritä genre, tunnelma ja soittimet. Esim: Elokuvamainen, villi länsi, rummut, jännittävä, atmosferinen
- Tunnelman asettaminen: Yhdistä musiikillisia ja emotionaalisia termejä ilmaisemaan haluamasi tunnelma.
- Soittimien valinta: Paranna soittimien nimiä adjektiiveilla, kuten “kaikuvat rummut” tai “voimakas kuoro”.
- BPM: Tasapainota tempo genrejen mukaan harmoniselle tulokselle, kuten “170 BPM” Drum and Bass -kappaleeseen.
Päätössanat
Tässä artikkelissa olemme tutkineet tekoälyllä generoituja musiikkeja/ääniä, alkaen algoritmisten sävellysten ajoista ja jatkuen nykypäivän sofistikoituneisiin generatiivisiin tekoälymalliin, kuten Google MusicLM ja Stability Audio. Nämä teknologiat, jotka hyödyntävät syväoppimista ja SOTA-pakkausmalleja, eivät ainoastaan paranna musiikin generointia, vaan myös hienostavat kuulijoiden kokemuksia.
Kuitenkin tämä on ala, joka on jatkuvassa kehityksessä, ja haasteita, kuten pitkäaikaisen yhdenmukaisuuden ylläpitäminen ja kiista tekoälyllä luodun musiikin aitoutta, haastavat alan uranuurtajia. Viime viikolla huhut kertoivat tekoälyllä luodusta laulusta, joka kanavoitiin Draken ja The Weekndin tyyliin, ja se oli aluksi suosittu verkossa, mutta se poistettiin Grammy-ehdokaslistalta, osoittaen jatkuvaa keskustelua tekoälyllä luodun musiikin legitimitetistä teollisuudessa (lähde). Kun tekoäly jatkaa siltojen rakentamista musiikin ja kuulijoiden välille, se edistää ympäristöä, jossa teknologia elää yhdessä taiteen kanssa, edistäen innovaatioita ja kunnioittaen perinteitä.

















