AI-modeller og platforme

Salmonn: Mod en generisk hørelseevne for store sprogmodeller

mm
Føj Unite.AI til dine foretrukne kilder på Google

Hørelse, der indebærer perception og forståelse af generisk auditiv information, er afgørende for AI-agenter i virkelige miljøer. Denne auditiv information omfatter tre primære lydtyper: musik, lyde og tale. For nylig har tekstbaserede store sprogmodeller (LLM) vist bemærkelsesværdige evner og opnået menneske-lignende præstationer i en bred vifte af naturligsprogsbehandlingsopgaver. Derudover er instruktionsafstemning, en træningsmetode, der bruger par af reference-svar og bruger-forespørgsler, blevet populær. Denne metode træner store sprogmodeller til at følge åbne brugerinstruktioner mere effektivt. Imidlertid er nuværende forskning mere og mere fokuseret på at forbedre store sprogmodeller med evnen til at percipere multimodalt indhold.

Fokuserer på det samme, i denne artikel, vil vi tale om SALMONN eller Speech Audio Language Music Open Neural Network, en stat-af-kunst åben tale-lyd-sprog-musik neuralt netværk bygget ved at inkorporere tale- og lyd-encodere med en forudtrænet tekstbaseret stor sprogmodel i en enkelt audio-tekst multimodal model. SALMONN-modellen giver store sprogmodeller mulighed for at forstå og behandle generiske audio-indtastninger direkte og leverer konkurrencedygtig præstation på en bred vifte af audio- og tale-opgaver, der bruges i træning, herunder auditiv informationsbaseret spørgsmål-svar, tale-genkendelse og -oversættelse, tale-verifikation, følelses-genkendelse, audio- og musik-tekstning og meget mere. Vi vil dykke dybere i SALMONN-rammeværket og udforske dets arbejde, arkitektur og resultater på en bred vifte af naturligsprogsbehandlingsopgaver. Så lad os komme i gang.

SALMONN: En introduktion til enkelt audio-tekst multimodale store sprogmodeller

SALMONN står for Speech Audio Language Music Open Neural Network, og det er en enkelt audio-tekst multimodal stor sprogmodel-ramme, der kan percipere og forstå tre grundlæggende audio- eller lydtyper, herunder tale, lyde og musik. SALMONN-modellen giver store sprogmodeller mulighed for at forstå og behandle generiske audio-indtastninger direkte og leverer konkurrencedygtig præstation på en bred vifte af audio- og tale-opgaver.

For at forbedre sin præstation på både tale- og ikke-tale-lydopgaver, bruger SALMONN-rammeværket en dobbelt encoder-struktur, der består af en BEATs-lyd-encoder og en tale-encoder fra Whisper-tale-modellen. Derudover bruger SALMONN-rammeværket også en vindue-niveau Q-Former eller forespørgsels-Transformer som en forbindelsesmodul til at konvertere en output-sekvens af variabel længde encoder til forstærkede audio-tekst tokens af en variabel antal, og ultimativt opnå høj tidsmæssig opløsning for audio-tekst-alignment. LoRA eller Low Rank Adaptation-metoden bruges som en cross-modal adapter til Vicuna-rammeværket til at alignere dets output-rum med dets forstærkede input-rum i et forsøg på at yderligere forbedre sin præstation. I SALMONN-rammeværket er evnen til at udføre cross-modale opgaver, der ikke er set under træningsfasen, tabt under træning af instruktioner som cross-modale emergente evner, og det er derfor, at SALMONN-rammeværket implementerer en ekstra few-shot aktiveringsfase for at genskabe LLM-rammeværkets generelle emergente evner.

Derudover bruger rammeværket en bred vifte af lyde, musik-benchmarks og tale-benchmarks til at evaluere dets kognitive hørelse-evner og dividerer benchmarkene i tre niveauer. På det første benchmark-niveau træner rammeværket otte opgaver i instruktions-træning, herunder oversættelse, audio-tekstning og tale-genkendelse. De to andre benchmark-niveauer er u-trænede opgaver, og det andet benchmark-niveau består af fem tale-baserede naturligsprogsbehandlingsopgaver som slot-fyldning og oversættelse til u-trænede sprog, der afhænger af høj-kvalitets multilinguale alignmenter mellem tekst- og tale-tekst tokens. Det sidste niveau benchmark-opgaver forsøger at forstå tale- og ikke-tale-lydinformation til tale-lyd co-reasoning og lyd-baseret fortælling.

For at samme op, er SALMONN-rammeværket

  1. Den første multimodale stor sprogmodel, der kan forstå og percipere generiske audio-indtastninger, herunder lyde, tale og musik, til det maksimale af sin evne.
  2. Et forsøg på at analysere cross-modale emergente evner, der tilbydes ved at implementere LoRA-skala-faktoren og bruge en ekstra budget-venlig aktiveringsfase under træning til at aktivere cross-modale emergente evner i rammeværket.

SALMONN: Arkitektur og Metodologi

I denne sektion, vil vi have et kig på arkitekturen, træningsmetoden og eksperimentel opsætning for SALMONN-rammeværket.

Model Arkitektur

I kernernes arkitektur, synchroniserer og kombinerer SALMONN-rammeværket output fra to auditiv-encodere, og derefter implementerer rammeværket en Q-Former på niveauet som en forbindelsesmodul. Output-sekvensen genereret af Q-Former kombineres med tekst-instruktions-forespørgsler og derefter givet som input til LoRA-tilpasningsmetoden til at generere det nødvendige svar.

Auditiv Encodere

SALMONN-rammeværket bruger to auditiv-encodere: en ikke-tale BEATs-lyd-encoder og en tale-encoder fra OpenAI’s Whisper-rammeværk. BEATs-lyd-encoder er trænet til at bruge den selv-supervisede iterative læringsmetode til at trække ikke-tale høj-niveau lyd-semantik, mens tale-encoder er trænet på en stor mængde svagt-supervisede data til tale-genkendelse og tale-oversættelse-opgaver, og output-funktionerne af encoderen er egnet til at inkludere baggrunds-støj og tale-information. Modellen tokeniserer først input-lyden og følger det op med at maskere og forudsige det i træning. De resulterende auditiv-funktioner af disse to encodere supplerer hinanden og er egnet til både tale- og ikke-tale-information.

Vindue Niveau Q-Former

Implementering af Q-Former-strukturen er en almindelig metode, der bruges i LLM-rammeværker til at konvertere output af en billed-encoder til tekst-tekst tokens, og nogen modifikation er nødvendig, når man har med audio-tekst tokens af variabel længde at gøre. For at være mere specifik, betragter rammeværket encoder-output af input-billedet som en konkateneret encoder-output-sekvens, og Q-Former deployer en fast antal trænbar forespørgsler til at transformere encoder-output-sekvensen til tekst-tekst tokens ved hjælp af stablede Q-Former-blokke. En stable Q-Former-blok ligner en Transformer-decoder-blok med undtagelsen af at fjerne causale masker i selv-opmærksomheds-lagene og brugen af en fast antal trænbar statisk forespørgsler i de første blokke.

LoRA og LLM

SALMONN-rammeværket deployer også en Vicuna LLM, der er en LLaMA stor sprogmodel-rammeværk, der er fin-justeret til at følge instruktioner mere præcist og effektivt. LoRA-rammeværket er en almindelig metode, der bruges til parameter-effektiv fin-justering, og dens inklusion i SALMONN-rammeværket til at værdi-vægt-matricer og tilpasse forespørgslen i selv-opmærksomheds-lagene.

Træningsmetode

SALMONN-rammeværket bruger en tre-stages cross-modalt træningsmetode. Træningsstadiet består af en pre-træningsstadium og en instruktions-afstemningsstadium, der er inkluderet i de fleste visuelle LLM-rammeværker, og en ekstra aktiverings-stadium implementeres til at løse over-tilpasnings-problemer, der opstår under audio-tekstning og tale-genkendelse-opgaver.

Pre-Træningsstadium

For at begrænse gapet observeret mellem forudtrænede parametre, herunder encodere og LLM, og tilfældigt initialiserede parametre, herunder adapter og forbindelsesmoduler, bruger SALMONN-rammeværket en stor mængde audio-tekstning og tale-genkendelse-data til at pre-træne LoRA- og Q-Former-komponenterne. Disse opgaver indeholder vital auditiv information om de vigtigste indhold af audio-lyde, både tale og ikke-tale, og ingen af dem kræver kompleks forståelse eller resonnering til at lære alignment mellem tekst- og auditiv information.

Instruktions-Afstemningsstadium

Instruktions-afstemningsstadiet, der er implementeret i SALMONN-rammeværket, ligner det, der er implementeret i NLP- og visuelle LLM-rammeværker, ved at bruge en liste af audio-lyde, musik-opgaver og tale-lyde til at fin-justere audio-tekst-instruktions-forespørgsler. Opgaverne prioriteres på basis af deres vigtighed på tværs af forskellige tests, herunder telefon-genkendelse, overlappende tale-genkendelse og musik-tekstning. Derudover danner tekst-information, der er parret med audio-data, grundlaget for at generere instruktions-forespørgsler.

Opgave Over-Tilpasning

Selv når kun de to første trænings-stadier implementeres, leverer SALMONN-rammeværket konkurrencedygtige resultater på instruktions-afstemnings-opgaver, selv om præstationen ikke er op til mærket, når det kommer til at udføre cross-modale opgaver, især på opgaver, der kræver cross-modale co-reasoning-evner. Specifikt krænker modellen af og til instruktions-forespørgsler, der resulterer i generation af irrelevante eller forkerte svar, og dette fænomen kaldes opgave over-tilpasning i SALMONN-rammeværket, og aktiverings-stadiet implementeres til at løse disse over-tilpasnings-problemer.

Aktiveringsstadium

En effektiv metode til at løse over-tilpasnings-problemer er at regularisere intrinsiske betingede sprogmodeller ved hjælp af længere og mere diverse svar, som fortælling eller auditiv-informationsbaseret spørgsmål-svar. Rammeværket genererer derefter par-træningsdata for disse opgaver ved hjælp af tekst, der er parret med audio eller tale eller musik-tekstning.

Opgave Specifikationer

For at evaluere SALMONN’s zero-shot cross-modale emergente evner, har udviklerne inkluderet 15 tale-, audio- og musik-opgaver, der er fordelt på tre niveauer.

Niveau 1

På det første niveau, er opgaverne brugt til instruktions-afstemning, og derfor er de den letteste sæt af opgaver, som SALMONN-rammeværket har at udføre.

Niveau 2

Det andet niveau består af u-trænede opgaver, og kompleksitetsniveauet er højere i forhold til niveau 1-opgaver. På niveau 2, er opgaverne NLP-baserede opgaver, herunder tale-nøgleord-ekstraktion, der bruges til at evaluere rammeværkets nøjagtighed, når det kommer til at ekstrahere bestemte nøgleord ved hjælp af tale. Andre opgaver inkluderer SQQA eller Spoken Query-baseret Spørgsmål-svar, der evaluerer den almindelige viden, som rammeværket ekstraherer ved hjælp af tale-spørgsmål, en SF eller Tale-baseret Slot-fyldning-opgave til at evaluere nøjagtigheden af slot-værdier, og endelig er der to AST-opgaver for engelsk-tysk og engelsk-japansk konvertering.

Niveau 3

Kompleksiteten af opgaver på niveau 3 er den højeste i forhold til de to andre niveauer, og det inkluderer SAC eller Tale-Lyd Co-Reasoning-opgaver og Lyd-baseret Fortælling-opgaver. SAC-opgaven kræver, at SALMONN-rammeværket forstår et spørgsmål, der er inkluderet i audio-klippet, der er ført til modellen, finder støttende bevis ved hjælp af audio-lyde eller musik i baggrunden og derefter genererer en passende grund til at svare på spørgsmålet. Lyd-baseret fortælling-opgaver kræver, at modellen genererer en meningsfuld historie på basis af den auditiv information, der er hentet fra generiske audio-indtastninger.

Resultater

Niveau 1 Opgaver

Følgende tabel demonstrerer resultaterne på niveau 1-opgaver, og som det kan ses, returnerer SALMONN-rammeværket konkurrencedygtige resultater på niveau 1-opgaver med eller uden aktiverings-tilpasning.

Niveau 2 og 3 Opgaver

Selv om SALMONN-rammeværket returnerer konkurrencedygtige resultater på niveau 1-opgaver, selv uden fin-justering, kan det samme ikke siges for niveau 2 og niveau 3-opgaver, da rammeværket lider under over-tilpasning på opgaver uden aktiverings-tilpasning. Præstationen falder endda yderligere på SQQA-, SAC- og Fortælling-opgaver med fokus på multimodale interaktioner, og SALMONN-rammeværket kæmper med at følge instruktioner uden aktiverings-tilpasning. Imidlertid forbedres resultaterne betydeligt med aktiverings-tilpasning, og resultaterne er inkluderet i følgende billed.

Discounting LoRA Skala-Faktor

Discounting LoRA Skala-Faktor evaluerer indflydelsen af at bruge tid-test-discounting af LoRA-skala-faktoren til at minimere over-tilpasnings-problemer på opgaver. Som det kan ses i følgende figur, forbedrer en reduktion af LoRA-skala-faktoren til 2,0 cross-modale resonans-evnen af SALMONN-rammeværket på ASR- og PR-opgaver, SQQA-opgaver, Fortælling-opgaver og SAC-opgaver.

Evaluering af Opgave Over-Tilpasning

For at understrege aktiverings-tilpasning, analyserer SALMONN-rammeværket ændringerne i forvirring under de tre trænings-stadier, og som det kan ses i følgende billed, har forvirringen for AAC- og ASR-opgaver små slut-værdier efter det første trænings-stadium, hvilket indikerer modellens læring af cross-modale alignment.

Derudover falder forvirringen for PR-opgaven også efter instruktions-afstemning på grund af dens afhængighed af LoRA-komponenten til at lære output-tekst tokens. Det er også observeret, at selv om instruktions-afstemning hjælper med at reducere forvirringen på Fortælling- og SAC-opgaver, er gapet stadig stort nok til at udføre opgaverne succesfuldt, medmindre en ekstra aktiverings-stadium tilføjes eller LoRA-komponenten fjernes.

Aktiverings-Tilpasning

SALMONN-rammeværket dykker ned i forskellige aktiverings-metoder, herunder træning af modellen på tekst-baseret QA-opgave-par med lange svar, eller brug af audio-baseret lange skrevne historier, og brug af lange tale-transkriptioner til ASR-opgaver. Begge Q-Former- og LoRA-komponenterne fin-justeres ved hjælp af disse tre metoder. Derudover ignorerer rammeværket audio- og Q-Former-input til at fin-justere LoRA- og Vicuna-komponenterne som en adaptiv tekst-baseret stor sprogmodel, og resultaterne er demonstreret i følgende billed, og som det kan ses, kan modellen ikke aktiveres af ASR (træning af ASR med lange mærker), eller Fortælling eller Tekst-baseret ved at træne LoRA-komponenten ved hjælp af tekst-forespørgsler.

Endelige Tanker

I denne artikel, har vi talt om SALMONN eller Speech Audio Language Music Open Neural Network, en enkelt audio-tekst multimodal stor sprogmodel-ramme, der kan percipere og forstå tre grundlæggende audio- eller lydtyper, herunder tale, lyde og musik. SALMONN-modellen giver store sprogmodeller mulighed for at forstå og behandle generiske audio-indtastninger direkte og leverer konkurrencedygtig præstation på en bred vifte af audio- og tale-opgaver.

SALMONN-rammeværket leverer konkurrencedygtig præstation på en bred vifte af trænede opgaver, herunder audio-tekstning, tale-oversættelse og -genkendelse, og meget mere, og generaliserer til en række u-trænede forståelses-opgaver, herunder tale-oversættelse til nøgleord-ekstraktion og u-trænede sprog. På grund af sine evner, kan SALMONN-rammeværket betragtes som det næste skridt mod at forbedre den generiske hørelse-evne af store sprogmodeller.

En ingeniør af profession, en forfatter af hjerte. Kunal er en teknisk forfatter med en dyb kærlighed og forståelse af AI og ML, dedikeret til at forenkle komplekse koncepter inden for disse felter gennem sin engagerende og informative dokumentation.