AI-modellen en platforms

SALMONN: Een introductie tot enkelvoudige audio-tekst multimodale grote taalmodellen

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Horen, dat het omvat het waarnemen en begrijpen van generieke auditieve informatie, is cruciaal voor AI-agents in echte wereldomgevingen. Deze auditieve informatie omvat drie primaire geluidstypen: muziek, audio-evenementen en spraak. Onlangs hebben tekstgebaseerde Large Language Model (LLM)-kaders een opmerkelijke prestatie getoond, met een prestatie op menselijk niveau in een breed scala aan Natural Language Processing (NLP)-taken. Bovendien is instructieafstemming, een trainingsmethode met behulp van paren van referentieantwoorden en gebruikersprompts, populair geworden. Deze benadering traint grote taalmodellen om open-ended gebruikersinstructies effectiever te volgen. Echter, het huidige onderzoek richt zich steeds meer op het verbeteren van grote taalmodellen met de mogelijkheid om multimodale inhoud waar te nemen.

Met het oog op hetzelfde, zullen we in dit artikel praten over SALMONN of Speech Audio Language Music Open Neural Network, een state-of-the-art open speech audio language music neural network gebouwd door het integreren van spraak- en audio-encoders met een vooraf getraind tekstgebaseerd groot taalmodel in een enkelvoudig audio-tekst multimodaal model. Het SALMONN-model stelt Large Language Models in staat om generieke audio-invoer rechtstreeks te begrijpen en te verwerken, en levert concurrerende prestaties op een breed scala aan audio- en spraaktaken die tijdens de training worden gebruikt, waaronder auditieve informatie-gebaseerde vraagbeantwoording, spraakherkenning en -vertaling, sprekerverificatie, emotieherkenning, audio- en muziekcaptions en veel meer. We zullen een diepere duik nemen in het SALMONN-kader en onderzoeken hoe het werkt, de architectuur en de resultaten over een breed scala aan NLP-taken. Laten we beginnen.

SALMONN: Een introductie tot enkelvoudige audio-tekst multimodale grote taalmodellen

SALMONN staat voor Speech Audio Language Music Open Neural Network, en het is een enkelvoudig audio-tekst multimodaal groot taalmodelkader dat in staat is om drie basisauditieve of geluidstypen waar te nemen en te begrijpen, waaronder spraak, audio-evenementen en muziek. Het SALMONN-model stelt Large Language Models in staat om generieke audio-invoer rechtstreeks te begrijpen en te verwerken, en levert concurrerende prestaties op een breed scala aan audio- en spraaktaken.

Om de prestaties op zowel spraak- als niet-spraak audio-taken te verbeteren, gebruikt het SALMONN-kader een dubbele encoderstructuur bestaande uit een BEATs audio-encoder en een spraakencoder afkomstig van het Whisper-spraakmodel. Bovendien gebruikt het SALMONN-kader ook een window-level Q-Former of query Transformer als verbindingmodule om de uitvoersequentie van variabele lengte van de encoder effectief om te zetten in verlengde audio-tokens van een variabel aantal, en uiteindelijk een hoge temporale resolutie voor audio-tekstalignering te bereiken. De LoRA of Low Rank Adaptation-benadering wordt gebruikt als een cross-modale adapter voor het Vicuna-kader om de uitvoerruimte uit te lijnen met de verlengde invoerruimte in een poging om de prestaties verder te verbeteren. In het SALMONN-kader is de mogelijkheid om cross-modale taken uit te voeren die niet tijdens de trainingsfase zijn gezien, verloren gegaan tijdens de training van instructies als cross-modale emergente capaciteiten, en dit is de belangrijkste reden waarom het SALMONN-kader een extra few-shot activatiestage implementeert om de algemene emergente capaciteiten van het LLM-kader terug te winnen.

Bovendien maakt het kader gebruik van een breed scala aan audio-evenementen, muziekbenchmarks en spraakbenchmarks om de cognitieve horendecapaciteiten te evalueren, en deelt de benchmarks in drie niveaus. Op het eerste benchmarkniveau traint het kader acht taken in instructietraining, waaronder vertaling, audio-captions en spraakherkenning. De andere twee benchmarkniveaus zijn ongetrainde taken, waarbij het tweede benchmarkniveau bestaat uit vijf spraakgebaseerde NLP-taken zoals slotvulling en vertaling naar ongetrainde talen, afhankelijk van hoge kwaliteit multilinguale uitlijningen tussen tekst- en spraaktokens. De laatste benchmarktaken proberen spraak- en niet-spraak auditieve informatie te begrijpen voor spraak-audio co-redenering en audio-gebaseerde verhalenvertelling.

Om samen te vatten, het SALMONN-kader is

  1. Het eerste multimodale grote taalmodel dat in staat is om generieke audio-invoer te begrijpen en waar te nemen, waaronder audio-evenementen, spraak en muziek, tot het maximum van zijn capaciteit.
  2. Een poging om cross-modale emergente capaciteiten te analyseren die worden aangeboden door het implementeren van de LoRA-schaalfactor en het gebruik van een extra budgetvriendelijke activatiestage tijdens de training om cross-modale emergente capaciteiten van het kader te activeren.

SALMONN: Architectuur en Methodologie

In dit gedeelte zullen we een kijk nemen op de architectuur, trainingsmethode en experimentele setup voor het SALMONN-kader.

Modelarchitectuur

In de kern van zijn architectuur synchroniseert en combineert het SALMONN-kader de uitvoer van twee auditieve encoders, waarna het kader een Q-Former op frame-niveau implementeert als verbindingmodule. De uitvoersequentie gegenereerd door de Q-Former wordt samengevoegd met tekstuele instructieprompts en wordt vervolgens als invoer gegeven aan de LoRA-adaptatiebenadering om het vereiste antwoord te genereren.

Auditieve Encoders

Het SALMONN-kader maakt gebruik van twee auditieve encoders: een niet-spraak BEATs audio-encoder en een spraakencoder afkomstig van OpenAI’s Whisper-kader. De BEATs audio-encoder is getraind om de zelf-supervised iterative learning-benadering te gebruiken in een poging om niet-spraak hoge niveau audio-semantiek te extraheren, terwijl de spraakencoder is getraind op een grote hoeveelheid zwak gesuperviseerde data voor spraakherkenning en spraakvertalingstaken, waarbij de uitvoerfuncties van de encoder geschikt zijn om achtergrondruis en spraakinformatie te omvatten. Het model tokeniseert eerst de invoeraudio en volgt dit op door deze te maskeren en te voorspellen tijdens de training. De resulterende auditieve functies van deze twee encoders complementeren elkaar en zijn geschikt voor zowel spraak- als niet-spraakinformatie.

Window Level Q-Former

Het implementeren van de Q-Former-structuur is een veel voorkomende benadering die wordt gebruikt in de LLM-kaders om de uitvoer van een beeldencoder om te zetten in tekstuele invoertokens, en enige modificatie is nodig wanneer men te maken heeft met audio-tokens van variabele lengte. Om specifiek te zijn, beschouwt het kader de encoderuitvoer van de invoerbeeld als een geconcateneerde encoderuitvoersequentie, en de Q-Former implementeert een vast aantal trainable queries om de encoderuitvoersequentie om te zetten in tekstuele tokens met behulp van gestapelde Q-Former-blokken. Een gestapeld Q-Former-blok lijkt op een Transformer-decoderblok, met uitzondering van het verwijderen van causale masks in de self-attention-lagen en het gebruik van een vast aantal trainable statische queries in de initiële blokken.

LoRA en LLM

Het SALMONN-kader implementeert ook een Vicuna LLM, dat een LLaMA-groot taalmodelkader is dat is gefinetuned om instructies nauwkeuriger te volgen en effectiever te zijn. De LoRA-benadering is een veel voorkomende methode die wordt gebruikt voor parameter-efficiënte finetuning, en de inclusie ervan in het SALMONN-kader om waarde-gewichtsmatrices en de query in de self-attention-lagen aan te passen.

Trainingsmethode

Het SALMONN-kader maakt gebruik van een drie-staps cross-modale trainingsbenadering. De trainingsfase bestaat uit een pre-trainingsfase en een instructieafstemmingsfase die in de meeste visuele LLM-kaders worden opgenomen, en een extra activatiestage wordt geïmplementeerd om over-fittingproblemen op te lossen die worden aangetroffen bij audio-captions en spraakherkenningstaken.

Pre-Trainingsfase

Om de kloof te beperken die wordt waargenomen tussen vooraf getrainde parameters, waaronder encoders en LLM, en willekeurig geïnitialiseerde parameters, waaronder adapters en verbindingmodules, gebruikt het SALMONN-kader een grote hoeveelheid audio-captions en spraakherkenningdata om de LoRA- en Q-Former-componenten voor te trainen. Deze taken bevatten vitale auditieve informatie over de sleutelinhoud van audio-evenementen, zowel spraak als niet-spraak, en geen van beiden vereist complexe begrip of redenering om de uitlijning tussen tekstuele en auditieve informatie te leren.

Instructieafstemmingsfase

De instructieafstemmingsfase die in het SALMONN-kader wordt geïmplementeerd, lijkt op die welke in NLP- en visuele LLM-kaders wordt geïmplementeerd, door het gebruik van een lijst met audio-evenementen, muziektaken en spraakevenementen om audi-tekst instructies af te stemmen. De taken worden geprioriteerd op basis van hun belang over verschillende tests, waaronder telefoongesprekherkenning, overlappende spraakherkenning en muziekcaptions. Bovendien vormt tekstuele informatie die is gekoppeld aan audio-data de basis voor het genereren van instructieprompts.

Taak Over-Fitting

Zelfs wanneer alleen de eerste twee trainingsfasen worden geïmplementeerd, levert het SALMONN-kader concurrerende resultaten op instructieafstemmingstaken, hoewel de prestatie niet optimaal is bij het uitvoeren van cross-modale taken, vooral bij taken die cross-modale co-redeneringscapaciteiten vereisen. In het bijzonder voldoet het model soms niet aan instructieprompts, wat resulteert in het genereren van irrelevante of onjuiste antwoorden, en dit fenomeen wordt in het SALMONN-kader aangeduid als taakover-fitting, en de activatiestage wordt geïmplementeerd om deze over-fittingproblemen op te lossen.

Activatiestage

Een effectieve benadering om over-fittingproblemen op te lossen is om intrinsieke conditionele taalmodellen te regulariseren met behulp van langere en meer diverse antwoorden, zoals verhalenvertelling of auditieve-informatie-gebaseerde vraagbeantwoording. Het kader genereert vervolgens de paar trainingsdata voor dergelijke taken met behulp van tekst die is gekoppeld aan audio of spraak of muziekcaptions.

Taak Specificaties

Om de zero-shot cross-modale emergente capaciteiten van SALMONN te evalueren, hebben ontwikkelaars 15 spraak-, audio- en muziektaken opgenomen, die zijn verdeeld over drie niveaus.

Niveau 1

Op het eerste niveau worden taken gebruikt voor instructieafstemming en zijn daarom de eenvoudigste set taken die het SALMONN-kader moet uitvoeren.

Niveau 2

Het tweede niveau bestaat uit ongetrainde taken en het complexiteitsniveau is hoger in vergelijking met niveau 1-taken. Op niveau 2 zijn taken NLP-gebaseerde taken, waaronder spraakkeywordextractie, die wordt gebruikt om de nauwkeurigheid van het kader te evalueren bij het extraheren van bepaalde keywords met behulp van spraak. Andere taken omvatten SQQA of Spoken Query-based Question Answering, die de gemeenschappelijke zin van het kader evalueert die wordt geëxtraheerd met behulp van spraakvragen, een SF of Speech-based Slot Filling-taak om de nauwkeurigheid van slotwaarden te evalueren, en ten slotte zijn er twee AST-taken voor Engels naar Duits en Engels naar Japans-conversies.

Niveau 3

De complexiteit van taken op niveau 3 is het maximum in vergelijking met de andere twee niveaus en omvat SAC of Speech Audio Co-Reasoning en Audio-gebaseerde Storytelling-taken. De SAC-taak vereist dat het SALMONN-kader een vraag begrijpt die is opgenomen in de audio-clip die aan het model is gevoerd, ondersteunend bewijs vindt met behulp van audio-evenementen of muziek op de achtergrond en ten slotte een passend antwoord genereert. De Audio-gebaseerde verhalenvertellingstaken vereisen dat het model een zinvol verhaal genereert op basis van de auditieve informatie die is afgeleid van generieke audio-invoer.

Resultaten

Niveau 1-taken

De volgende tabel toont de resultaten op niveau 1-taken en zoals te zien is, levert het SALMONN-kader concurrerende resultaten op niveau 1-taken met of zonder activatiestemming.

Niveau 2 en 3-taken

Hoewel het SALMONN-kader concurrerende resultaten levert op niveau 1-taken, zelfs zonder finetuning, kan hetzelfde niet worden gezegd voor niveau 2 en 3-taken, aangezien het SALMONN-kader zwaar lijdt onder over-fitting op taken zonder activatiestemming. De prestatie daalt nog verder op SQQA-, SAC- en Storytelling-taken met nadruk op multimodale interacties, en het SALMONN-kader heeft moeite om instructies te volgen zonder activatiestemming. Echter, met activatiestemming verbeteren de resultaten aanzienlijk en zijn de resultaten opgenomen in de volgende afbeelding.

LoRA-schaalfactor

LoRA-schaalfactor evalueert de invloed van het gebruik van tijd-testkorting van de LoRA-schaalfactor om over-fittingproblemen op taken te minimaliseren. Zoals te zien is in de volgende figuur, verhoogt een afname van de LoRA-schaalfactor tot 2,0 de cross-modale redeneercapaciteit van het SALMONN-kader op ASR- en PR-taken, SQQA-taken, Storytelling-taken en SAC-taken.

Taak Over-Fitting

Om de nadruk te leggen op activatiestemming, analyseert het SALMONN-kader de veranderingen in perplexiteit tijdens de drie trainingsfasen en zoals te zien is, hebben de veranderingen in perplexiteit voor AAC- en ASR-taken kleine eindwaarden na de eerste trainingsfase, wat aangeeft dat het model de cross-modale uitlijning heeft geleerd.

Bovendien daalt de perplexiteit van de PR-taak ook na instructieafstemming vanwege de afhankelijkheid van de LoRA-component om de uitvoertokens te leren. Het is ook geconstateerd dat, hoewel instructieafstemming helpt bij het verminderen van de perplexiteit op Storytelling- en SAC-taken, de kloof nog steeds groot genoeg is om de taken succesvol uit te voeren, tenzij een extra activatiestage wordt toegevoegd of de LoRA-component wordt verwijderd.

Activatiestemming

Het SALMONN-kader duikt in verschillende activatiemethoden, waaronder het trainen van het model op tekstgebaseerde QA-taken met lange antwoorden, of het gebruik van audio-gebaseerde lange geschreven verhalen, of het gebruik van lange spraaktranscripties voor ASR-taken. Beide de Q-Former- en LoRA-componenten worden gefinetuned met behulp van deze drie methoden. Bovendien wordt de audio- en Q-Former-invoer genegeerd in een poging om de LoRA- en Vicuna-componenten te finetunen als een adaptieve tekstgebaseerde grote taalmodel, en de resultaten worden getoond in de volgende afbeelding, en zoals te zien is, kan het model niet worden geactiveerd door ASR (het trainen van ASR met lange labels), noch door Story of Text-gebaseerde door het trainen van de LoRA-component met tekstpromptinvoer.

Slotbeschouwing

In dit artikel hebben we het over SALMONN of Speech Audio Language Music Open Neural Network, een enkelvoudig audio-tekst multimodaal groot taalmodelkader dat in staat is om drie basisauditieve of geluidstypen waar te nemen en te begrijpen, waaronder spraak, audio-evenementen en muziek. Het SALMONN-model stelt Large Language Models in staat om generieke audio-invoer rechtstreeks te begrijpen en te verwerken, en levert concurrerende prestaties op een breed scala aan audio- en spraaktaken.

Het SALMONN-kader levert concurrerende prestaties op een breed scala aan getrainde taken, waaronder audio-captions, spraakvertaling en -herkenning, en meer, terwijl het generaliseert naar een breed scala aan ongetrainde taken, waaronder spraakvertaling voor keyword-extractie en ongetrainde talen. Vanwege zijn capaciteiten kan het SALMONN-kader worden beschouwd als de volgende stap in het verbeteren van de generieke horendecapaciteiten van grote taalmodellen.

Een ingenieur van beroep, een schrijver van hart. Kunal is een technisch schrijver met een diepe liefde en begrip voor AI en ML, toegewijd aan het vereenvoudigen van complexe concepten in deze gebieden door middel van zijn boeiende en informatieve documentatie.