AI-mallit ja alustat

SALMONN: Kohti yleisiä kuulemiskykyjä suurille kielimalleille

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Kuuleminen, joka sisältää yleisen äänitiedon havainnoinnin ja ymmärtämisen, on tärkeää tekoälyjärjestelmissä todellisissa ympäristöissä. Tämä äänitiedon sisältää kolme pääasiallista äänityyppiä: musiikki, äänitapahtumat ja puhe. Viimeaikaisissa tekstipohjaisissa suurten kielimallien (LLM) kehyksissä on saavutettu merkittäviä kykyjä, ja ne ovat saavuttaneet ihmisen tason suorituskyvyn laajassa valikoimassa luonnollisen kielen prosessointitehtävissä. Lisäksi ohjeiden säätö, koulutusmenetelmä, joka käyttää viitevastauksia ja käyttäjän ohjeita, on tullut suosituksi. Tämä lähestymistapa kouluttaa suuria kielimalleja seuraamaan avoimia käyttäjän ohjeita tehokkaammin. Kuitenkin nykyinen tutkimus on yhä enemmän keskittynyt parantamaan suuria kielimalleja monimodaalisen sisällön havainnointikyvyn kanssa.

Keskittyen samaan, tässä artikkelissa puhumme SALMONNista tai Speech Audio Language Music Open Neural Networkista, joka on ääni- ja tekstipohjainen monimodaalinen suuri kielimalli, joka on rakennettu yhdistämällä puhe- ja äänikooderit esikoulutetun tekstipohjaisen suuren kielimallin kanssa yhteen ääni-teksti-monimodaaliseksi malliksi. SALMONN-malli mahdollistaa suurten kielimallien ymmärtämisen ja prosessoinnin yleisiä äänisyöteitä suoraan, ja tarjoaa kilpailukykyisen suorituskyvyn laajassa valikoimassa ääni- ja puhetöistä, mukaan lukien äänitiedon perusteella tapahtuva kysymys-vastaus, puheentunnistus ja kääntäminen, puhujan verifiointi, tunneentunnistus, ääni- ja musiikkikuvailu, ja paljon muuta. Puhumme SALMONN-kehyksestä, sen toiminnasta, arkkitehtuurista ja tuloksista laajassa valikoimassa luonnollisen kielen prosessointitehtävissä. Joten aloitetaan.

SALMONN: Johdanto yhteen ääni-teksti-monimodaalisiin suuriin kielimalleihin

SALMONN on ääni- ja tekstipohjainen monimodaalinen suuri kielimalli, joka pystyy havainnoimaan ja ymmärtämään kolmea perusääntyyppiä, mukaan lukien puhe, äänitapahtumat ja musiikki. SALMONN-malli mahdollistaa suurten kielimallien ymmärtämisen ja prosessoinnin yleisiä äänisyöteitä suoraan, ja tarjoaa kilpailukykyisen suorituskyvyn laajassa valikoimassa ääni- ja puhetöistä.

Parantaakseen suorituskykyään sekä puhe- että ei-puheääntöistä, SALMONN-kehys käyttää kaksiääntistä kooderirakennetta, joka koostuu BEATs-äänikooderista ja puhekooderista, joka on peräisin Whisper-puhemallista. Lisäksi SALMONN-kehys käyttää myös ikkuna-tasolla olevaa Q-Formeria tai kysely-Transformeria yhtenäisyysmoduulina muuttaa muuttuvan pituisen kooderin tulostusjonon muokatuiksi äänitokeneiksi, ja lopulta saavuttaa korkean aikaresoluution ääni-teksti-kohdistamiseen. LoRA- tai matalan arvorakenteen sovittamismenetelmä käytetään ristimodaalisen sovittimen Vicuna-kehykseen kohdistamaan sen tulostusavaruuden sen muokatun syöteavaruuden kanssa pyrkien parantamaan sen suorituskykyä entisestään. SALMONN-kehyksessä ristimodaalisten tehtävien suorittamisen kyky, jota ei havaittu koulutusvaiheessa, menetetään koulutuksen aikana, ja tämä on pääsyy siihen, miksi SALMONN-kehys toteuttaa lisäksi muutaman aktivaatiotason palauttaakseen LLM-kehyksen yleiset emergentit kyvyt.

Lisäksi kehys käyttää laajaa valikoimaa äänitapahtumia, musiikkibenchmarkkejä ja puhebenchmarkkejä arvioidakseen sen kognitiivisia kuulemiskykyjä, ja jakaa benchmarkit kolmeen tasoon. Ensimmäisellä benchmark-tasolla kehys kouluttaa kahdeksan tehtävää ohjeistuksessa, mukaan lukien kääntäminen, äänikuvailu ja puheentunnistus. Kaksi muuta benchmark-tasoa ovat kouluttamattomia tehtäviä, ja toinen benchmark-taso koostuu viidestä puhepohjaisesta luonnollisen kielen prosessointitehtävästä, kuten slot-täyttäminen ja kääntäminen kouluttamattomiin kielivaihtoehtoihin, jotka perustuvat korkealaatuisiin monikielisiin kohdistuksiin tekstin ja puheen välillä. Viimeinen benchmark-taso pyrkii ymmärtämään puhe- ja ei-puheääntiedon puhe-ääni-yhteisvaikutukselle ja äänipohjaiselle kertomukselle.

Yhteenvetona SALMONN-kehys on

  1. Ensimmäinen monimodaalinen suuri kielimalli, joka pystyy ymmärtämään ja havainnoimaan yleisiä äänisyöteitä, mukaan lukien äänitapahtumat, puhe ja musiikki, sen kykyjen mukaan.
  2. Yritys analysoida ristimodaalisia emergenttejä kykyjä, jotka toteutetaan käyttämällä LoRA-skaalauksen tekijää ja käyttämällä lisäksi budjettia edullista aktivaatiotapaa koulutuksen aikana aktivoimaan kehyksen ristimodaaliset emergentit kyvyt.

SALMONN: Arkkitehtuuri ja menetelmä

Tässä osiossa tarkastelemme SALMONN-kehyksen arkkitehtuuria, koulutusmenetelmää ja kokeellista asetelmaa.

Mallin arkkitehtuuri

SALMONN-kehyksen ytimessä on kaksi äänikooderin tulosteen sychronointi ja yhdistäminen, minkä jälkeen kehys toteuttaa Q-Formerin kehyksellä yhtenäisyysmoduulina muuttaa muuttuvan pituisen kooderin tulostusjonon äänitokeneiksi, ja lopulta saavuttaa korkean aikaresoluution ääni-teksti-kohdistamiseen. Tulostusjono, joka on luotu Q-Formerilla, yhdistetään teksti-ohjeisiin ja annetaan syötteenä LoRA-sovittimelle luodakseen tarvittavan vastauksen.

Äänikooderit

SALMONN-kehys käyttää kahta äänikooderia: ei-puheääni-BEATs-äänikooderia ja puhekooderia, joka on peräisin OpenAI:n Whisper-kehyksestä. BEATs-äänikooderi on koulutettu käyttämään itseohjautuvaa iteratiivista oppimismenetelmää poistamaan ei-puheääni-korkean tason äänisemantiikkaa, kun taas puhekooderi on koulutettu suurella määrällä heikosti valvottua dataa puheentunnistus- ja puhekäännöstehtävissä, ja kooderin tulostusominaisuudet ovat soveltuvia sisältämään taustamusiikkia ja puheentiedon. Malli tokenisoi ensin syötteen äänen, ja seuraa sitä maskauksella ja ennustamisella koulutuksen aikana. Näiden kahden kooderin ääniohjaimet täydentävät toisiaan, ja ovat soveltuvia sekä puhe- että ei-puheääntiedolle.

Ikkuna-tason Q-Former

Q-Former-rakenteen toteuttaminen on yleinen lähestymistapa, jota käytetään LLM-kehyksissä muuttaa kuvakooderin tulostusta teksti-syöte-tokeneiksi, ja joitakin muutoksia tarvitaan, kun käsitellään äänitokeneita, joilla on muuttuva pituus. Tarkemmin sanottuna kehys pitää kooderin tulostusta syötteenä yhtenä istuvaan kooderin tulostusjonona, ja Q-Former käyttää kiinteää määrää koulutettavia kyselyjä muuttaa kooderin tulostusjonon teksti-tokeneiksi käyttämällä pinottuja Q-Former-lohkareita. Pinottu Q-Former-lohkari muistuttaa Transformer-dekooderilohkaria, mutta poikkeuksena on, että se poistaa casual-maskit itsehuomio-layereissa ja käyttää kiinteää määrää koulutettavia staattisia kyselyjä alkulohkareissa.

LoRA ja LLM

SALMONN-kehys käyttää myös Vicuna LLM:ää, joka on LLaMA-suuri kielimalli, joka on hienosäädetty seuraamaan ohjeita tarkemmin ja tehokkaammin. LoRA-kehys on yleinen menetelmä, jota käytetään parametrin tehokkaaseen hienosäätöön, ja sen sisällyttäminen SALMONN-kehys on arvopainomatriisien ja itsehuomion kerrosten kyselyn sovittamiseen.

Koulutusmenetelmä

SALMONN-kehys käyttää kolmevaiheista ristimodaalista koulutuslähestymistapaa. Koulutusvaihe koostuu esikoulutusvaiheesta ja ohjeistuksessa, jotka ovat mukana useimmissa visuaalisissa LLM-kehyksissä, ja lisäksi toteutetaan aktivaatiokoulutusvaihe ratkaisemaan ylikoulutusongelmia, joita havaitaan äänikuvailu- ja puheentunnistustehtävissä.

Esikoulutusvaihe

Rajoittaakseen eroa, joka havaitaan esikoulutetuissa parametreissa, mukaan lukien kooderit ja LLM, ja satunnaisesti alkuunpannuissa parametreissa, mukaan lukien sovitin ja yhtenäisyysmoduuli, SALMONN-kehys käyttää suurta määrää äänikuvailu- ja puheentunnistusdataa esikouluttaakseen LoRA- ja Q-Former-komponentteja. Nämä tehtävät sisältävät tärkeitä äänitiedon asioita äänitapahtumien avainsisällöstä, sekä puhe- että ei-puheääntiedosta, eikä niitä vaadita monimutkaisia ymmärtämistä tai päättelyä oppiakseen kohdistuksen tekstin ja äänitiedon välillä.

Ohjeistuksessa

Ohjeistuksessa, jota toteutetaan SALMONN-kehyksessä, muistuttaa sitä, jota toteutetaan NLP- ja visuaalisissa LLM-kehyksissä, käyttämällä äänitapahtumia, musiikkitehtäviä ja puheääntöjä ohjeistamaan ääni-teksti-ohjeita. Tehtävät priorisoidaan niiden tärkeyden perusteella eri testeissä, mukaan lukien puhelintunnistus, puheääntöjen tunnistus ja musiikkikuvailu. Lisäksi tekstiä, joka on pariskunnut äänidataan, muodostaa ohjeistuksen perustan.

Tehtävän ylikoulutus

Vaikka toteutetaan vain kaksi ensimmäistä koulutusvaihetta, SALMONN-kehys saavuttaa kilpailukykyisiä tuloksia ohjeistuksessa, mutta suorituskyky ei ole merkitsevä, kun suoritetaan ristimodaalisia tehtäviä, erityisesti tehtävissä, jotka vaativat ristimodaalisten yhteispäättelykykyjä. Nimenomaan malli voi rikkoa ohjeistuksia, mikä johtaa epäolennaisiin tai virheellisiin vastauksiin, ja tämä ilmiö on nimetty tehtävän ylikoulutukseksi SALMONN-kehyksessä, ja aktivaatiokoulutusvaihe toteutetaan ratkaisemaan nämä ylikoulutusongelmat.

Aktivaatiokoulutusvaihe

Tehokas lähestymistapa ratkaista ylikoulutusongelmia on säännellä intrinsic conditional kielen malleja käyttämällä pidempiä ja monipuolisempia vastauksia, kuten tarinankerrontaa tai äänitiedon perusteella kysymys-vastaus. Kehys sitten luo parin koulutusdataa näille tehtäville käyttämällä tekstiä, joka on pariskunnut ääniin, puheeseen tai musiikkikuvailuihin.

Tehtävän määritykset

Arvioidakseen SALMONN:n nollasoitteisen ristimodaalisen emergenttisen kyvyn, kehittäjät ovat sisällyttäneet 15 ääni-, musiikki- ja puheääntötehtävää, jotka on jaettu kolmeen tasoon.

Taso 1

Ensimmäisellä tasolla tehtävät ovat ohjeistuksessa, ja ne ovat helpoimmat tehtävät, joita SALMONN-kehys on suoritettava.

Taso 2

Toinen taso koostuu kouluttamattomista tehtävistä, ja niiden monimutkaisuustaso on korkeampi kuin taso 1 -tehtävissä. Tason 2 tehtävissä on luonnollisen kielen prosessointitehtäviä, kuten puheavainsanan poisto, jota käytetään arvioimaan kehyksen tarkkuutta, kun poistetaan tiettyjä avainsanoja puheesta. Muita tehtäviä ovat SQQA (puhuttu kysymys-vastaus) -tehtävä, joka arvioi yleistietämys, jonka kehys poistaa puhekysymyksistä, SF (puhepohjainen slot-täyttö) -tehtävä, joka arvioi kehyksen tarkkuutta, kun täytetään slot-arvoja, ja lopulta kaksi AST-tehtävää englannin ja saksan sekä englannin ja japanin käännöksille.

Taso 3

Tason 3 tehtävien monimutkaisuustaso on korkein verrattuna muihin kahteen tasoon, ja se sisältää SAC (puheääni-yhteispäättely) -tehtävän ja äänipohjaisen tarinankerronnan. SAC-tehtävä vaatii SALMONN-kehyksen ymmärtämään kysymyksen, joka on sisällytetty ääniin, löytämään tukevia todisteita äänitapahtumista tai musiikista, ja lopulta luomaan asianmukaisen syyn vastata kysymykseen. Äänipohjaiset tarinankerrontatehtävät vaativat mallin luomaan merkityksellisen tarinan äänitiedon perusteella yleisistä äänisyötteistä.

Tulokset

Taso 1 tehtävät

Seuraava taulukko osoittaa tulokset taso 1 tehtävistä, ja kuten voidaan havaita, SALMONN-kehys saavuttaa kilpailukykyisiä tuloksia taso 1 tehtävissä aktivaatiokoulutuksella tai ilman.

Taso 2 ja 3 tehtävät

Vaikka SALMONN-kehys saavuttaa kilpailukykyisiä tuloksia taso 1 tehtävissä ilman hienosäätöä, samaa ei voida sanoa taso 2 ja 3 tehtävistä, joissa kehys kärsii ylikoulutuksesta tehtävissä, erityisesti tehtävissä, jotka vaativat ristimodaalista yhteispäättelykykyä. Nimenomaan malli voi rikkoa ohjeistuksia, mikä johtaa epäolennaisiin tai virheellisiin vastauksiin, ja SALMONN-kehys kamppailee seuraamasta ohjeistuksia ilman aktivaatiokoulutusta. Kuitenkin aktivaatiokoulutuksen kanssa tulokset paranevat merkittävästi, ja tulokset on esitetty seuraavassa kuvassa.

LoRA-skaalauksen tekijän alentaminen

LoRA-skaalauksen tekijän alentaminen arvioi LoRA-skaalauksen tekijän ajan myötäisen alentamisen vaikutusta ylikoulutusongelmiin tehtävissä. Kuten voidaan havaita seuraavasta kuvasta, LoRA-skaalauksen tekijän laskeminen 2,0:aan korottaa kehyksen ristimodaalista päättelykykyä ASR- ja PR-tehtävissä, SQQA-tehtävissä, tarinankerronnan tehtävissä ja SAC-tehtävissä.

Tehtävän ylikoulutuksen arviointi

Korostamaan aktivaatiokoulutusta, SALMONN-kehys analysoi muutokset monimutkaisuudessa kolmen koulutusvaiheen aikana, ja kuten voidaan havaita seuraavasta kuvasta, monimutkaisuuden muutokset AAC- ja ASR-tehtävissä ovat pienet lopulliset arvot ensimmäisen koulutusvaiheen jälkeen, osoittaen mallin oppimista ristimodaalisten kohdistusten suhteen.

Lisäksi PR-tehtävän monimutkaisuus laskee ohjeistuksen jälkeen sen riippuvuuden LoRA-komponentista oppiakseen tulostus-tokenit. On myös havaittu, että vaikka ohjeistus auttaa vähentämään monimutkaisuutta tarinankerronnan ja SAC-tehtävissä, ero on edelleen tarpeeksi suuri suorittaa tehtäviä onnistuneesti, ellei lisäksi aktivaatiotapaa lisätä tai LoRA-komponenttia poisteta.

Aktivaatiokoulutus

SALMONN-kehys tarkastelee eri aktivaatiomenetelmiä, kuten kouluttamista tekstipohjaisilla kysymys-vastaus-parilla, jolla on pitkät vastaukset, tai käyttämällä äänipohjaisia pitkiä kirjoitettuja tarinoita, ja käyttämällä pitkiä puheentunnistus-transkriptioita ASR-tehtävissä. Sekä Q-Former- että LoRA-komponentit on hienosäädetty näillä kolmella menetelmällä. Lisäksi kehys jättää huomiotta ääni- ja Q-Former-syötteen ja kouluttaa LoRA- ja Vicuna-komponentit sopeutuvana tekstipohjaisena suurena kielimallina, ja tulokset on esitetty seuraavassa kuvassa, ja kuten voidaan havaita, malli ei voi aktivoitua ASR:lla (kouluttamalla ASR:ää pitkällä merkinnällä), eikä tarinalla tai tekstipohjaisella (kouluttamalla LoRA-komponenttia tekstiprompt-syöttein).

Lopputulet

Tässä artikkelissa olemme puhuneet SALMONNista eli ääni- ja tekstipohjaisesta monimodaalisesta suuresta kielimallista, joka pystyy havainnoimaan ja ymmärtämään kolmea perusääntyyppiä, mukaan lukien puhe, äänitapahtumat ja musiikki. SALMONN-malli mahdollistaa suurten kielimallien ymmärtämisen ja prosessoinnin yleisiä äänisyöteitä suoraan, ja tarjoaa kilpailukykyisen suorituskyvyn laajassa valikoimassa ääni- ja puhetöistä.

SALMONN-kehys saavuttaa kilpailukykyisen suorituskyvyn laajassa valikoimassa koulutetuissa tehtävissä, mukaan lukien äänikuvailu, puheentunnistus ja kääntäminen, ja yleistää joukkoon kouluttamattomia ymmärtämistehtäviä, mukaan lukien puheääntöjen kääntäminen avainsanojen poistamiseksi ja kouluttamattomille kielivaihtoehdoille. SALMONN-kehyksen kykyjen perusteella se voidaan pitää seuraavana askeleena parantamaan suurten kielimallien yleisiä kuulemiskykyjä.

Ammattina insinööri, sydämen vuoksi kirjailija. Kunal on tekninen kirjailija, jolla on syvä rakkaus ja ymmärrys AI: sta ja ML: stä, omistautunut yksinkertaistamaan monimutkaisia käsitteitä näissä aloissa hänen viihdyttävän ja informatiivisen dokumentaationsa kautta.