AI-modeller og plattformer

Salmonn: Mot Generic Hearing Abilities For Large Language Models

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Høring, som innebærer persepsjon og forståelse av generisk auditiv informasjon, er avgjørende for AI-agenter i sanntidsmiljøer. Denne auditiv informasjonen omfatter tre primære lydtyper: musikk, lydhendelser og tale. Nylig har tekstbaserte Large Language Model (LLM)-rammeverk vist bemerkelsesverdige evner, og oppnådd menneske-nivå-ytelse i en rekke Natural Language Processing (NLP)-oppgaver. I tillegg har instruksjonstuning, en treningsmetode som bruker par av referansesvar og brukerforespørsler, blitt populær. Denne metoden trener store språkmodeller til å følge åpne brukerinstruksjoner mer effektivt. Imidlertid er nåværende forskning stadig mer fokusert på å forbedre store språkmodeller med evnen til å persevere multimodal innhold.

Fokusert på det samme, i denne artikkelen, vil vi snakke om SALMONN eller Speech Audio Language Music Open Neural Network, et state-of-the-art åpent tale-lyd-musikk neuralt nettverk bygget ved å inkorporere tale- og lyd-encoderer med en forhånds-trent tekstbasert stor språkmodell i en enkelt audio-tekst multimodal modell. SALMONN-modellen muliggjør Large Language Models å forstå og prosessere generiske lyd-inndata direkte, og levere konkurrerende ytelse på en rekke lyd- og tale-oppgaver som brukes i trening, inkludert auditiv informasjon-basert spørsmål-svar, tale-gjenkjenning og -oversettelse, tale-verifisering, emosjon-gjenkjenning, lyd- og musikk-tekst, og mye mer. Vi vil dykke dyptere inn i SALMONN-rammeverket og utforske dens arbeid, arkitektur og resultater på en rekke NLP-oppgaver. Så la oss begynne. 

SALMONN : En introduksjon til Single Audio-Text Multimodal Large Language Models

SALMONN står for Speech Audio Language Music Open Neural Network, og det er et enkelt audio-tekst multimodalt stor språkmodell-rammeverk som kan persevere og forstå tre grunnleggende lyd- eller lydtyper, inkludert tale, lydhendelser og musikk. SALMONN-modellen muliggjør Large Language Models å forstå og prosessere generiske lyd-inndata direkte, og levere konkurrerende ytelse på en rekke lyd- og tale-oppgaver. 

For å forbedre ytelsen på både tale- og ikke-tale lyd-oppgaver, bruker SALMONN-rammeverket en dobbel encoder-struktur bestående av en BEATs lyd-encoder og en tale-encoder hentet fra Whisper-talemodellen. I tillegg bruker SALMONN-rammeverket også en vindu-nivå Q-Former eller spørsmål-Transformer som en koblingsmodul for å konvertere en utgangssekvens av variabel lengde fra encoder til forbedrede lyd-token av en variabel mengde, og til slutt oppnå høy tids-resolusjon for audio-tekst-alignment. LoRA eller Low Rank Adaptation-tilnærmingen brukes som en cross-modalt adapter til Vicuna-rammeverket for å justere utgangsrommet med det forbedrede inngangsrommet i et forsøk på å ytterligere forbedre ytelsen. I SALMONN-rammeverket er evnen til å utføre cross-modale oppgaver som ikke er sett under treningsfasen, tapt under instruksjonstreningsfasen, som er grunnleggende cross-modale emergente evner, og det er derfor SALMONN-rammeverket implementerer en ekstra few-shot aktiveringsfasen for å gjenvinne LLM-rammeverkets generelle emergente evner. 

Videre bruker rammeverket en rekke lydhendelser, musikk-benchmark og tale-benchmark for å evaluere dens kognitive høringsevner, og deler benchmarkene i tre nivåer. På det første nivået trener rammeverket åtte oppgaver i instruksjonstreningsfasen, inkludert oversettelse, lyd-tekst og tale-gjenkjenning. De to andre nivåene er ikke-trente oppgaver, og det andre nivået består av fem tale-baserte NLP-oppgaver som inkluderer nøkkelord-ekstraksjon som brukes til å evaluere rammeverkets nøyaktighet når det gjelder å trekke ut bestemte nøkkelord ved hjelp av tale. Andre oppgaver inkluderer SQQA eller Spoken Query-basert spørsmål-svar som evaluerer den vanlige forstand-evnen rammeverket trekker ut ved hjelp av tale-spørsmål, en SF eller tale-basert Slot Filling-oppgave for å evaluere nøyaktigheten av slot-verdier, og til slutt er det to AST-oppgaver for engelsk-tysk og engelsk-japansk konvertering. 

For å sammenfatte, er SALMONN-rammeverket

  1. Det første multimodale store språkmodell-rammeverket som kan forstå og persevere generiske lyd-inndata, inkludert lydhendelser, tale og musikk, til maksimum av dens evne. 
  2. Et forsøk på å analysere cross-modale emergente evner som tilbys ved å implementere LoRA-skaleringsfaktoren, og bruke en ekstra budsjett-vennlig aktiveringsfasen under treningsfasen for å aktivere cross-modale emergente evner i rammeverket. 

SALMONN : Arkitektur og Metodologi

I denne delen, vil vi se på arkitekturen, treningsmetoden og eksperimentelle oppsettet for SALMONN-rammeverket. 

Modellarkitektur

I kjernen av sin arkitektur, synkroniserer og kombinerer SALMONN-rammeverket utgangene fra to auditiv-encoderer, etterfulgt av at rammeverket implementerer en Q-Former på rammenivå som en koblingsmodul. Utgangssekvensen generert av Q-Formeren blir slått sammen med tekst-instruksjonsforespørsler og det blir deretter gitt som inndata til LoRA-tilpasningsmetoden for å generere det ønskede svaret. 

Auditiv Encoder

SALMONN-rammeverket bruker to auditiv-encoderer: en ikke-tale BEATs lyd-encoder og en tale-encoder hentet fra OpenAI’s Whisper-rammeverk. BEATs lyd-encoderen er trent for å bruke den selv-superviserte iterative læringsmetoden for å trekke ut ikke-tale høynivå lyd-semantikk, mens tale-encoderen er trent på en stor mengde svakt-supervisert data for tale-gjenkjenning og tale-oversettelse-oppgaver, med utgangsfunksjonene til encoderen egnet til å inkludere bakgrunnsstøy og tale-informasjon. Modellen tokeniserer først inndata-lyden, og følger det opp med å maskere og forutsi det i treningsfasen. De resulterende auditiv-funksjonene til disse to encoderne komplementerer hverandre, og er egnet for både tale- og ikke-tale informasjon. 

Vindu-nivå Q-Former

Implementering av Q-Former-strukturen er en vanlig metode brukt i LLM-rammeverk for å konvertere utgangen av en bilde-encoder til tekst-inndata-token, og noen modifikasjoner er nødvendige når det gjelder å håndtere lyd-token av varierende lengde. For å være mer spesifik, regner rammeverket encoder-utgangen av inndata-bildet som en sammenkoblet encoder-utgangssekvens, og Q-Formeren deployer en fast mengde trenbare forespørsler for å transformere encoder-utgangssekvensen til tekst-token ved hjelp av stabler av Q-Former-blokker. En stablet Q-Former-blokk ligner en Transformer-dekoder-blokk, med unntak av å fjerne casual-masker i selv-oppmerksomhetslagene og bruke en fast mengde trenbare statiske forespørsler i de første blokkene. 

LoRA og LLM

SALMONN-rammeverket deployer også en Vicuna LLM, som er et LLaMA-stort språkmodell-rammeverk finjustert for å følge instruksjoner mer nøyaktig og effektivt. LoRA-rammeverket er en vanlig metode brukt for parameter-effektiv finjustering, og dens inklusjon i SALMONN-rammeverket for å verdifunksjons-vektmatriser og tilpasse forespørselen i selv-oppmerksomhetslagene. 

Treningsmetode

SALMONN-rammeverket bruker en tre-stegs cross-modalt treningsmetode. Treningsfasen består av en forhånds-treningsfasen og en instruksjonstreningsfasen som er inkludert i de fleste visuelle LLM-rammeverk, og en ekstra aktiveringsfasen implementeres for å løse over-fitting-problemer møtt under lyd-tekst og tale-gjenkjenning-oppgaver. 

Forhånds-treningsfasen

For å begrense gapet observert mellom forhånds-trente parametre, inkludert encoderer og LLM, og tilfeldig initialiserte parametre, inkludert adapter og koblingsmoduler, bruker SALMONN-rammeverket en stor mengde lyd-tekst og tale-gjenkjenning-data for å forhånds-trenings LoRA- og Q-Former-komponentene. Disse oppgavene inneholder viktig auditiv informasjon om nøkkel-innholdet av lydhendelser, både tale og ikke-tale, og ingen av dem krever kompleks forståelse eller resonnering for å lære alignment mellom tekst- og auditiv informasjon. 

Instruksjonstreningsfasen

Instruksjonstreningsfasen implementert i SALMONN-rammeverket ligner den implementert i NLP- og visuelle LLM-rammeverk ved å bruke en liste av lydhendelser, musikk-oppgaver og tale-hendelser for å finjustere audio-tekst instruksjoner. Oppgavene prioriteres basert på deres viktighet over forskjellige tester, inkludert telefon-gjenkjenning, overlappende tale-gjenkjenning og musikk-tekst. Videre dannes tekst-informasjon parret med lyd-data grunnlaget for å generere instruksjonsforespørsler. 

Oppgave-over-fitting

Selv om kun de første to treningsfasene implementeres, returnerer SALMONN-rammeverket konkurrerende resultater på instruksjonstreningsoppgaver, selv om ytelsen ikke er på merke når det gjelder å utføre cross-modale oppgaver, spesielt på oppgaver som krever cross-modale co-reasoning-evner. Spesifikt, modellen kan noen ganger bryte instruksjonsforespørsler som resulterer i generering av irrelevante eller feilaktige svar, og dette fenomenet kalles oppgave-over-fitting i SALMONN-rammeverket, og aktiveringsfasen implementeres for å løse disse over-fitting-problemene. 

Aktiveringsfasen

En effektiv metode for å løse over-fitting-problemer er å regularisere intrinsiske kondisjonelle språkmodeller ved å bruke lengre og mer diverse svar, som historiefortelling eller auditiv-informasjon-basert spørsmål-svar. Rammeverket genererer deretter treningsdata-par for slike oppgaver ved å bruke tekst parret med lyd eller tale eller musikk-tekst. 

Oppgave-specifikasjoner

For å evaluere SALMONN’s null-skots cross-modale emergente evner, har utviklerne inkludert 15 tale-, lyd- og musikk-oppgaver fordelt over tre nivåer. 

Nivå 1

På det første nivået, brukes oppgavene for instruksjonstreningsfasen, og derfor er de enkleste oppgavene som SALMONN-rammeverket må utføre. 

Nivå 2

Det andre nivået består av ikke-trente oppgaver, og kompleksitetsnivået er høyere sammenlignet med nivå 1-oppgaver. På nivå 2, er oppgavene NLP-baserte oppgaver som inkluderer tale-nøkkelord-ekstraksjon som brukes til å evaluere rammeverkets nøyaktighet når det gjelder å trekke ut bestemte nøkkelord ved hjelp av tale. Andre oppgaver inkluderer SQQA eller Spoken Query-basert spørsmål-svar som evaluerer den vanlige forstand-evnen rammeverket trekker ut ved hjelp av tale-spørsmål, en SF eller tale-basert Slot Filling-oppgave for å evaluere nøyaktigheten av slot-verdier, og til slutt er det to AST-oppgaver for engelsk-tysk og engelsk-japansk konvertering. 

Nivå 3

Kompleksiteten av oppgavene på nivå 3 er maksimum sammenlignet med de to andre nivåene, og det inkluderer SAC eller tale-lyd co-reasoning, og lyd-basert historiefortelling-oppgaver. SAC-oppgaven krever at SALMONN-rammeverket forstår et spørsmål inkludert i lyd-klippet som matet til modellen, finner støttende bevis ved hjelp av lydhendelser eller musikk i bakgrunnen, og til slutt genererer en passende grunn til å svare på spørsmålet. Lyd-basert historiefortelling-oppgavene krever at modellen genererer en meningsfull historie basert på auditiv informasjon hentet fra generiske lyd-inndata.

Resultater

Nivå 1-oppgaver

Følgende tabell demonstrerer resultater på nivå 1-oppgaver, og som det kan observeres, returnerer SALMONN-rammeverket konkurrerende resultater på nivå 1-oppgaver med eller uten aktiverings-tuning. 

Nivå 2 og 3-oppgaver

Selv om SALMONN-rammeverket returnerer konkurrerende resultater på nivå 1-oppgaver selv uten finjustering, kan det ikke si det samme for nivå 2 og 3-oppgaver, da uten aktiverings-tuning, lider SALMONN-rammeverket tungt under over-fitting på oppgaver. Ytelsen synker enda mer på SQQA-, SAC- og historiefortelling-oppgaver med vekt på multimodale interaksjoner, og SALMONN-rammeverket sliter med å følge instruksjoner uten aktiverings-tuning. Imidlertid, med aktiverings-tuning, forbedres resultater betydelig, og resultater er inkludert i følgende bilde. 

Discounting LoRA-skaleringsfaktor

Discounting LoRA-skaleringsfaktor evaluerer innflytelsen av å bruke tid-test-discounting av LoRA-skaleringsfaktoren for å minimere over-fitting-problemer på oppgaver. Som det kan observeres i følgende figur, øker en reduksjon av LoRA-skaleringsfaktoren til 2,0 cross-modale resonans-evnen til SALMONN-rammeverket på ASR- og PR-oppgaver, SQQA-oppgaver, historiefortelling-oppgaver og SAC-oppgaver. 

Evaluering av oppgave-over-fitting

For å vektlegge aktiverings-tuning, analyserer SALMONN-rammeverket endringene i forvirring under de tre treningsfasene, og som det kan sees i følgende bilde, har forvirring-endringene for AAC- og ASR-oppgaver små slutverdier etter den første treningsfasen, noe som indikerer modellens læring av cross-modale aligneringer. 

Videre observeres det at forvirringen av PR-oppgaven også synker etter instruksjonstreningsfasen på grunn av dens avhengighet av LoRA-komponenten for å lære utgangs-token. Det observeres også at selv om instruksjonstreningsfasen hjelper med å redusere forvirringen på historiefortelling- og SAC-oppgaver, er gapet fortsatt stort nok til å utføre oppgavene med hell, med mindre en ekstra aktiveringsfasen legges til eller LoRA-komponenten fjernes. 

Aktiverings-tuning

SALMONN-rammeverket dykker ned i ulike aktiveringsmetoder, inkludert trening av modellen på tekst-basert QA-oppgave-par med lange svar, eller ved å bruke lyd-basert lange skrevne historier, mens bruk av lange tale-transkripsjoner for ASR-oppgaver. Begge Q-Former- og LoRA-komponentene finjusteres ved hjelp av disse tre metodene. Videre ignorerer rammeverket lyd- og Q-Former-inndata for å finjustere LoRA- og Vicuna-komponentene som en adaptiv tekst-basert stor språkmodell, og resultater er demonstrert i følgende bilde, og som det kan sees, kan modellen ikke aktiveres av ASR (trening ASR med lange etiketter), eller historiefortelling eller tekst-basert ved å trene LoRA-komponenten ved hjelp av tekst-forespørsler. 

Slutt-tanker

I denne artikkelen, har vi snakket om SALMONN eller Speech Audio Language Music Open Neural Network, et enkelt audio-tekst multimodalt stor språkmodell-rammeverk som kan persevere og forstå tre grunnleggende lyd- eller lydtyper, inkludert tale, lydhendelser og musikk. SALMONN-modellen muliggjør Large Language Models å forstå og prosessere generiske lyd-inndata direkte, og levere konkurrerende ytelse på en rekke lyd- og tale-oppgaver. 

SALMONN-rammeverket returnerer konkurrerende resultater på en rekke trente oppgaver, inkludert lyd-tekst, tale-oversettelse og -gjenkjenning, og mer, samtidig som det generaliserer til en rekke ikke-trente forståelsesoppgaver, inkludert tale-oversettelse for nøkkelord-ekstraksjon og ikke-trente språk. På grunn av sine evner, kan SALMONN-rammeverket regnes som det neste skrittet mot å forbedre de generiske høringsevner til store språkmodeller.

En ingeniør av yrke, en forfatter av hjerte. Kunal er en teknisk forfatter med en dyp kjærlighet og forståelse av AI og ML, dedikert til å forenkle komplekse konsepter i disse feltene gjennom sin engasjerende og informerende dokumentasjon.