AI-modeller og plattformer
Salmonn: Mot Generic Hearing Abilities For Large Language Models
Høring, som innebærer persepsjon og forståelse av generisk auditiv informasjon, er avgjørende for AI-agenter i sanntidsmiljøer. Denne auditiv informasjonen omfatter tre primære lydtyper: musikk, lydhendelser og tale. Nylig har tekstbaserte Large Language Model (LLM)-rammeverk vist bemerkelsesverdige evner, og oppnådd menneske-nivå-ytelse i en rekke Natural Language Processing (NLP)-oppgaver. I tillegg har instruksjonstuning, en treningsmetode som bruker par av referansesvar og brukerforespørsler, blitt populær. Denne metoden trener store språkmodeller til å følge åpne brukerinstruksjoner mer effektivt. Imidlertid er nåværende forskning stadig mer fokusert på å forbedre store språkmodeller med evnen til å persevere multimodal innhold.
Fokusert på det samme, i denne artikkelen, vil vi snakke om SALMONN eller Speech Audio Language Music Open Neural Network, et state-of-the-art åpent tale-lyd-musikk neuralt nettverk bygget ved å inkorporere tale- og lyd-encoderer med en forhånds-trent tekstbasert stor språkmodell i en enkelt audio-tekst multimodal modell. SALMONN-modellen muliggjør Large Language Models å forstå og prosessere generiske lyd-inndata direkte, og levere konkurrerende ytelse på en rekke lyd- og tale-oppgaver som brukes i trening, inkludert auditiv informasjon-basert spørsmål-svar, tale-gjenkjenning og -oversettelse, tale-verifisering, emosjon-gjenkjenning, lyd- og musikk-tekst, og mye mer. Vi vil dykke dyptere inn i SALMONN-rammeverket og utforske dens arbeid, arkitektur og resultater på en rekke NLP-oppgaver. Så la oss begynne.
SALMONN : En introduksjon til Single Audio-Text Multimodal Large Language Models
SALMONN står for Speech Audio Language Music Open Neural Network, og det er et enkelt audio-tekst multimodalt stor språkmodell-rammeverk som kan persevere og forstå tre grunnleggende lyd- eller lydtyper, inkludert tale, lydhendelser og musikk. SALMONN-modellen muliggjør Large Language Models å forstå og prosessere generiske lyd-inndata direkte, og levere konkurrerende ytelse på en rekke lyd- og tale-oppgaver.
For å forbedre ytelsen på både tale- og ikke-tale lyd-oppgaver, bruker SALMONN-rammeverket en dobbel encoder-struktur bestående av en BEATs lyd-encoder og en tale-encoder hentet fra Whisper-talemodellen. I tillegg bruker SALMONN-rammeverket også en vindu-nivå Q-Former eller spørsmål-Transformer som en koblingsmodul for å konvertere en utgangssekvens av variabel lengde fra encoder til forbedrede lyd-token av en variabel mengde, og til slutt oppnå høy tids-resolusjon for audio-tekst-alignment. LoRA eller Low Rank Adaptation-tilnærmingen brukes som en cross-modalt adapter til Vicuna-rammeverket for å justere utgangsrommet med det forbedrede inngangsrommet i et forsøk på å ytterligere forbedre ytelsen. I SALMONN-rammeverket er evnen til å utføre cross-modale oppgaver som ikke er sett under treningsfasen, tapt under instruksjonstreningsfasen, som er grunnleggende cross-modale emergente evner, og det er derfor SALMONN-rammeverket implementerer en ekstra few-shot aktiveringsfasen for å gjenvinne LLM-rammeverkets generelle emergente evner.
Videre bruker rammeverket en rekke lydhendelser, musikk-benchmark og tale-benchmark for å evaluere dens kognitive høringsevner, og deler benchmarkene i tre nivåer. På det første nivået trener rammeverket åtte oppgaver i instruksjonstreningsfasen, inkludert oversettelse, lyd-tekst og tale-gjenkjenning. De to andre nivåene er ikke-trente oppgaver, og det andre nivået består av fem tale-baserte NLP-oppgaver som inkluderer nøkkelord-ekstraksjon som brukes til å evaluere rammeverkets nøyaktighet når det gjelder å trekke ut bestemte nøkkelord ved hjelp av tale. Andre oppgaver inkluderer SQQA eller Spoken Query-basert spørsmål-svar som evaluerer den vanlige forstand-evnen rammeverket trekker ut ved hjelp av tale-spørsmål, en SF eller tale-basert Slot Filling-oppgave for å evaluere nøyaktigheten av slot-verdier, og til slutt er det to AST-oppgaver for engelsk-tysk og engelsk-japansk konvertering.
For å sammenfatte, er SALMONN-rammeverket
- Det første multimodale store språkmodell-rammeverket som kan forstå og persevere generiske lyd-inndata, inkludert lydhendelser, tale og musikk, til maksimum av dens evne.
- Et forsøk på å analysere cross-modale emergente evner som tilbys ved å implementere LoRA-skaleringsfaktoren, og bruke en ekstra budsjett-vennlig aktiveringsfasen under treningsfasen for å aktivere cross-modale emergente evner i rammeverket.
SALMONN : Arkitektur og Metodologi
I denne delen, vil vi se på arkitekturen, treningsmetoden og eksperimentelle oppsettet for SALMONN-rammeverket.
Modellarkitektur
I kjernen av sin arkitektur, synkroniserer og kombinerer SALMONN-rammeverket utgangene fra to auditiv-encoderer, etterfulgt av at rammeverket implementerer en Q-Former på rammenivå som en koblingsmodul. Utgangssekvensen generert av Q-Formeren blir slått sammen med tekst-instruksjonsforespørsler og det blir deretter gitt som inndata til LoRA-tilpasningsmetoden for å generere det ønskede svaret.
Auditiv Encoder
SALMONN-rammeverket bruker to auditiv-encoderer: en ikke-tale BEATs lyd-encoder og en tale-encoder hentet fra OpenAI’s Whisper-rammeverk. BEATs lyd-encoderen er trent for å bruke den selv-superviserte iterative læringsmetoden for å trekke ut ikke-tale høynivå lyd-semantikk, mens tale-encoderen er trent på en stor mengde svakt-supervisert data for tale-gjenkjenning og tale-oversettelse-oppgaver, med utgangsfunksjonene til encoderen egnet til å inkludere bakgrunnsstøy og tale-informasjon. Modellen tokeniserer først inndata-lyden, og følger det opp med å maskere og forutsi det i treningsfasen. De resulterende auditiv-funksjonene til disse to encoderne komplementerer hverandre, og er egnet for både tale- og ikke-tale informasjon.
Vindu-nivå Q-Former
Implementering av Q-Former-strukturen er en vanlig metode brukt i LLM-rammeverk for å konvertere utgangen av en bilde-encoder til tekst-inndata-token, og noen modifikasjoner er nødvendige når det gjelder å håndtere lyd-token av varierende lengde. For å være mer spesifik, regner rammeverket encoder-utgangen av inndata-bildet som en sammenkoblet encoder-utgangssekvens, og Q-Formeren deployer en fast mengde trenbare forespørsler for å transformere encoder-utgangssekvensen til tekst-token ved hjelp av stabler av Q-Former-blokker. En stablet Q-Former-blokk ligner en Transformer-dekoder-blokk, med unntak av å fjerne casual-masker i selv-oppmerksomhetslagene og bruke en fast mengde trenbare statiske forespørsler i de første blokkene.
LoRA og LLM
SALMONN-rammeverket deployer også en Vicuna LLM, som er et LLaMA-stort språkmodell-rammeverk finjustert for å følge instruksjoner mer nøyaktig og effektivt. LoRA-rammeverket er en vanlig metode brukt for parameter-effektiv finjustering, og dens inklusjon i SALMONN-rammeverket for å verdifunksjons-vektmatriser og tilpasse forespørselen i selv-oppmerksomhetslagene.

Treningsmetode
SALMONN-rammeverket bruker en tre-stegs cross-modalt treningsmetode. Treningsfasen består av en forhånds-treningsfasen og en instruksjonstreningsfasen som er inkludert i de fleste visuelle LLM-rammeverk, og en ekstra aktiveringsfasen implementeres for å løse over-fitting-problemer møtt under lyd-tekst og tale-gjenkjenning-oppgaver.
Forhånds-treningsfasen
For å begrense gapet observert mellom forhånds-trente parametre, inkludert encoderer og LLM, og tilfeldig initialiserte parametre, inkludert adapter og koblingsmoduler, bruker SALMONN-rammeverket en stor mengde lyd-tekst og tale-gjenkjenning-data for å forhånds-trenings LoRA- og Q-Former-komponentene. Disse oppgavene inneholder viktig auditiv informasjon om nøkkel-innholdet av lydhendelser, både tale og ikke-tale, og ingen av dem krever kompleks forståelse eller resonnering for å lære alignment mellom tekst- og auditiv informasjon.
Instruksjonstreningsfasen
Instruksjonstreningsfasen implementert i SALMONN-rammeverket ligner den implementert i NLP- og visuelle LLM-rammeverk ved å bruke en liste av lydhendelser, musikk-oppgaver og tale-hendelser for å finjustere audio-tekst instruksjoner. Oppgavene prioriteres basert på deres viktighet over forskjellige tester, inkludert telefon-gjenkjenning, overlappende tale-gjenkjenning og musikk-tekst. Videre dannes tekst-informasjon parret med lyd-data grunnlaget for å generere instruksjonsforespørsler.
Oppgave-over-fitting
Selv om kun de første to treningsfasene implementeres, returnerer SALMONN-rammeverket konkurrerende resultater på instruksjonstreningsoppgaver, selv om ytelsen ikke er på merke når det gjelder å utføre cross-modale oppgaver, spesielt på oppgaver som krever cross-modale co-reasoning-evner. Spesifikt, modellen kan noen ganger bryte instruksjonsforespørsler som resulterer i generering av irrelevante eller feilaktige svar, og dette fenomenet kalles oppgave-over-fitting i SALMONN-rammeverket, og aktiveringsfasen implementeres for å løse disse over-fitting-problemene.
Aktiveringsfasen
En effektiv metode for å løse over-fitting-problemer er å regularisere intrinsiske kondisjonelle språkmodeller ved å bruke lengre og mer diverse svar, som historiefortelling eller auditiv-informasjon-basert spørsmål-svar. Rammeverket genererer deretter treningsdata-par for slike oppgaver ved å bruke tekst parret med lyd eller tale eller musikk-tekst.
Oppgave-specifikasjoner
For å evaluere SALMONN’s null-skots cross-modale emergente evner, har utviklerne inkludert 15 tale-, lyd- og musikk-oppgaver fordelt over tre nivåer.
Nivå 1
På det første nivået, brukes oppgavene for instruksjonstreningsfasen, og derfor er de enkleste oppgavene som SALMONN-rammeverket må utføre.
Nivå 2
Det andre nivået består av ikke-trente oppgaver, og kompleksitetsnivået er høyere sammenlignet med nivå 1-oppgaver. På nivå 2, er oppgavene NLP-baserte oppgaver som inkluderer tale-nøkkelord-ekstraksjon som brukes til å evaluere rammeverkets nøyaktighet når det gjelder å trekke ut bestemte nøkkelord ved hjelp av tale. Andre oppgaver inkluderer SQQA eller Spoken Query-basert spørsmål-svar som evaluerer den vanlige forstand-evnen rammeverket trekker ut ved hjelp av tale-spørsmål, en SF eller tale-basert Slot Filling-oppgave for å evaluere nøyaktigheten av slot-verdier, og til slutt er det to AST-oppgaver for engelsk-tysk og engelsk-japansk konvertering.
Nivå 3
Kompleksiteten av oppgavene på nivå 3 er maksimum sammenlignet med de to andre nivåene, og det inkluderer SAC eller tale-lyd co-reasoning, og lyd-basert historiefortelling-oppgaver. SAC-oppgaven krever at SALMONN-rammeverket forstår et spørsmål inkludert i lyd-klippet som matet til modellen, finner støttende bevis ved hjelp av lydhendelser eller musikk i bakgrunnen, og til slutt genererer en passende grunn til å svare på spørsmålet. Lyd-basert historiefortelling-oppgavene krever at modellen genererer en meningsfull historie basert på auditiv informasjon hentet fra generiske lyd-inndata.

Resultater
Nivå 1-oppgaver
Følgende tabell demonstrerer resultater på nivå 1-oppgaver, og som det kan observeres, returnerer SALMONN-rammeverket konkurrerende resultater på nivå 1-oppgaver med eller uten aktiverings-tuning.

Nivå 2 og 3-oppgaver
Selv om SALMONN-rammeverket returnerer konkurrerende resultater på nivå 1-oppgaver selv uten finjustering, kan det ikke si det samme for nivå 2 og 3-oppgaver, da uten aktiverings-tuning, lider SALMONN-rammeverket tungt under over-fitting på oppgaver. Ytelsen synker enda mer på SQQA-, SAC- og historiefortelling-oppgaver med vekt på multimodale interaksjoner, og SALMONN-rammeverket sliter med å følge instruksjoner uten aktiverings-tuning. Imidlertid, med aktiverings-tuning, forbedres resultater betydelig, og resultater er inkludert i følgende bilde.

Discounting LoRA-skaleringsfaktor
Discounting LoRA-skaleringsfaktor evaluerer innflytelsen av å bruke tid-test-discounting av LoRA-skaleringsfaktoren for å minimere over-fitting-problemer på oppgaver. Som det kan observeres i følgende figur, øker en reduksjon av LoRA-skaleringsfaktoren til 2,0 cross-modale resonans-evnen til SALMONN-rammeverket på ASR- og PR-oppgaver, SQQA-oppgaver, historiefortelling-oppgaver og SAC-oppgaver.

Evaluering av oppgave-over-fitting
For å vektlegge aktiverings-tuning, analyserer SALMONN-rammeverket endringene i forvirring under de tre treningsfasene, og som det kan sees i følgende bilde, har forvirring-endringene for AAC- og ASR-oppgaver små slutverdier etter den første treningsfasen, noe som indikerer modellens læring av cross-modale aligneringer.

Videre observeres det at forvirringen av PR-oppgaven også synker etter instruksjonstreningsfasen på grunn av dens avhengighet av LoRA-komponenten for å lære utgangs-token. Det observeres også at selv om instruksjonstreningsfasen hjelper med å redusere forvirringen på historiefortelling- og SAC-oppgaver, er gapet fortsatt stort nok til å utføre oppgavene med hell, med mindre en ekstra aktiveringsfasen legges til eller LoRA-komponenten fjernes.
Aktiverings-tuning
SALMONN-rammeverket dykker ned i ulike aktiveringsmetoder, inkludert trening av modellen på tekst-basert QA-oppgave-par med lange svar, eller ved å bruke lyd-basert lange skrevne historier, mens bruk av lange tale-transkripsjoner for ASR-oppgaver. Begge Q-Former- og LoRA-komponentene finjusteres ved hjelp av disse tre metodene. Videre ignorerer rammeverket lyd- og Q-Former-inndata for å finjustere LoRA- og Vicuna-komponentene som en adaptiv tekst-basert stor språkmodell, og resultater er demonstrert i følgende bilde, og som det kan sees, kan modellen ikke aktiveres av ASR (trening ASR med lange etiketter), eller historiefortelling eller tekst-basert ved å trene LoRA-komponenten ved hjelp av tekst-forespørsler.

Slutt-tanker
I denne artikkelen, har vi snakket om SALMONN eller Speech Audio Language Music Open Neural Network, et enkelt audio-tekst multimodalt stor språkmodell-rammeverk som kan persevere og forstå tre grunnleggende lyd- eller lydtyper, inkludert tale, lydhendelser og musikk. SALMONN-modellen muliggjør Large Language Models å forstå og prosessere generiske lyd-inndata direkte, og levere konkurrerende ytelse på en rekke lyd- og tale-oppgaver.
SALMONN-rammeverket returnerer konkurrerende resultater på en rekke trente oppgaver, inkludert lyd-tekst, tale-oversettelse og -gjenkjenning, og mer, samtidig som det generaliserer til en rekke ikke-trente forståelsesoppgaver, inkludert tale-oversettelse for nøkkelord-ekstraksjon og ikke-trente språk. På grunn av sine evner, kan SALMONN-rammeverket regnes som det neste skrittet mot å forbedre de generiske høringsevner til store språkmodeller.












