Modely a platformy AI

SALMONN: Směr k obecným sluchovým schopnostem pro velké jazykové modely

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Slyšení, které zahrnuje vnímání a pochopení obecných zvukových informací, je nezbytné pro umělou inteligenci v reálném prostředí. Tyto zvukové informace zahrnují tři základní typy zvuku: hudbu, zvukové události a řeč. Nedávno prokázaly textové rámce velkých jazykových modelů (LLM) pozoruhodné schopnosti, dosahující lidské úrovně ve širokém spektru úkolů zpracování přirozeného jazyka (NLP). Kromě toho se stal populárním také instrukční ladění, metoda školení pomocí párů referenčních odpovědí a uživatelských podnětů. Tato metoda školení umožňuje velkým jazykovým modelům lépe sledovat otevřené uživatelské instrukce. Nicméně, současné výzkumy se stále více zaměřují na rozšíření velkých jazykových modelů o schopnost vnímat multimodální obsah.

Soustředěme se na totéž, v tomto článku budeme mluvit o SALMONN nebo Speech Audio Language Music Open Neural Network, který je špičkovým otevřeným sítí neuronové sítě pro řeč, zvuk a hudbu, vytvořenou začleněním kodérů řeči a zvuku do předem školeného textového velkého jazykového modelu do jediného audio-textového multimodálního modelu. Model SALMONN umožňuje velkým jazykovým modelům pochopit a zpracovat obecné audio vstupy přímo a dosáhnout konkurenceschopného výkonu v širokém spektru audio a řečových úkolů, které se používají při školení, včetně úkolů založených na zvukových informacích, jako je odpověď na otázky, rozpoznávání řeči a překlad, ověření mluvčího, rozpoznávání emocí, popisky audio a hudby a mnoho dalších. Budeme se blíže zabývat rámcem SALMONN a prozkoumáme jeho fungování, architekturu a výsledky v širokém spektru úkolů NLP. Takže pojďme začít.

SALMONN: Úvod do jednouchých audio-textových multimodálních velkých jazykových modelů

SALMONN je zkratka pro Speech Audio Language Music Open Neural Network a jedná se o jednouchý audio-textový multimodální velký jazykový model, který je schopen vnímat a rozumět třem základním typům zvuku, včetně řeči, zvukových událostí a hudby. Model SALMONN umožňuje velkým jazykovým modelům pochopit a zpracovat obecné audio vstupy přímo a dosáhnout konkurenceschopného výkonu v širokém spektru audio a řečových úkolů.

Pro zvýšení svého výkonu na úkolech řeči a neřeči, rámec SALMONN používá duální strukturu kodéru, skládající se z kodéru BEATs pro audio a kodéru řeči z modelu Whisper. Kromě toho rámec SALMONN také používá Q-Former na úrovni okna jako spojovací modul pro efektivní převod výstupní sekvence proměnné délky kodéru na zvukové tokeny proměnného počtu, a tím dosáhnout vysoké časové rozlišení pro audio-textové zarovnání. Metoda LoRA nebo nízkorozměrová adaptace se používá jako mezi-modální adaptér pro rámec Vicuna, aby se zarovnala jeho výstupní prostor se vstupním prostorem a dále zvýšila jeho výkon. V rámci SALMONN, schopnost provádět mezi-modální úkoly, které nebyly vidět během fáze školení, ztracené během školení instrukcí jako mezi-modální emergentní schopnosti, je hlavním důvodem, proč rámec SALMONN implementuje další fázi aktivačního školení, aby znovu získal obecné emergentní schopnosti rámce LLM.

Navíc, rámec využívá širokou škálu zvukových událostí, hudebních benchmarků a řečových benchmarků pro hodnocení svých kognitivních sluchových schopností a dělí benchmarky do tří úrovní. Na první úrovni benchmarku se rámec učí osm úkolů v instrukčním školení, včetně překladu, popisků audio a rozpoznávání řeči. Další dvě úrovně benchmarků jsou úkoly, které nebyly školeny, přičemž druhá úroveň benchmarku se skládá z pěti řečových úkolů zpracování přirozeného jazyka, jako je vyplňování slotů a překlad do neškolících jazyků, které spoléhají na vysoce kvalitní vícejazyčné zarovnání mezi textem a řečovými tokeny. Úkoly poslední úrovně benchmarku se pokoušejí pochopit řečové a neřečové zvukové informace pro řeč-audio ko-rezonování a audio-založené vyprávění.

Shrnutí, rámec SALMONN je

  1. První multimodální velký jazykový model, který je schopen pochopit a vnímat obecné audio vstupy, včetně zvukových událostí, řeči a hudby, do maximální míry svých schopností.
  2. Pokusem analyzovat mezi-modální emergentní schopnosti, které nabízí implementace faktoru LoRA a použití další fáze aktivačního školení během školení, aby se aktivovaly mezi-modální emergentní schopnosti rámce.

SALMONN: Architektura a metodika

V této sekci se budeme zabývat architekturou, metodikou školení a experimentálním nastavením rámce SALMONN.

Architektura modelu

V jádru své architektury rámec SALMONN synchronizuje a kombinuje výstupy ze dvou zvukových kodérů, po nichž rámec implementuje Q-Former na úrovni rámců jako spojovací modul. Výstupní sekvence generovaná Q-Formerem se slučuje s textovými instrukčními podněty a poté se podává jako vstup do metody LoRA, aby se generovala požadovaná odpověď.

Zvukové kodéry

Rámec SALMONN využívá dva zvukové kodéry: kodér BEATs pro audio a kodér řeči z modelu Whisper. Kodér BEATs je školen pomocí samo-supervizované iterativní metody učení, aby extrahoval neřečové vysoké zvukové semantiky, zatímco kodér řeči je školen na velkém množství slabě supervizovaných dat pro úkoly rozpoznávání řeči a překladu řeči, přičemž výstupní funkce kodéru jsou vhodné pro zahrnutí pozadí a informací o řeči. Model nejprve tokenizuje vstupní audio, poté maskuje a předpovídá jej během školení. Výsledné zvukové funkce těchto dvou kodérů se doplňují a jsou vhodné pro řečové i neřečové informace.

Q-Former na úrovni okna

Implementace struktury Q-Former je běžným přístupem použitým v rámcích LLM pro převod výstupu obrazového kodéru na textové tokeny, a je zapotřebí určitá modifikace, když se jedná o audio tokeny proměnné délky. Konkrétně, rámec považuje výstup kodéru vstupního obrazu za sekvenci výstupu kodéru, a Q-Former nasazuje pevný počet školených dotazů pro transformaci sekvence výstupu kodéru na textové tokeny pomocí zásobníků bloků Q-Former. Blok Q-Former se podobá dekodéru bloku Transformátoru, s výjimkou odstranění kauzálních masek ve vrstvách sebe-pozornosti a použití pevného počtu školených statických dotazů v počátečních blocích.

LoRA a LLM

Rámec SALMONN také nasazuje rámec Vicuna LLM, který je rámec LLaMA velkého jazykového modelu, jemně laděný pro sledování instrukcí přesněji a efektivněji. Rámec LoRA je běžnou metodou pro parametricky efektivní jemné ladění, a jeho zařazení do rámce SALMONN pro hodnotu hmotnostních matic a adaptaci dotazu ve vrstvách sebe-pozornosti.

Metodika školení

Rámec SALMONN využívá tří-etapový přístup školení mezi-modality. Etapa školení zahrnuje před-školení a etapu jemného ladění instrukcí, které jsou zahrnuty v meisten rámcích vizuálních LLM, a další etapa aktivačního ladění se implementuje pro řešení problémů s před-školením během úkolů popisků audio a rozpoznávání řeči.

Před-školení

Pro omezení mezery pozorované mezi předem školenými parametry, včetně kodérů a LLM, a náhodně inicializovanými parametry, včetně adaptéru a spojovacích modulů, rámec SALMONN využívá velké množství dat popisků audio a rozpoznávání řeči pro před-školení komponent LoRA a Q-Former. Tyto úkoly obsahují vitální zvukové informace o klíčovém obsahu audio událostí, både řečových i neřečových, a ani jeden z nich nevyžaduje komplexní pochopení nebo rozumění pro naučení zarovnání mezi textovými a zvukovými informacemi.

Jemné ladění instrukcí

Etapě jemného ladění instrukcí implementovaná v rámci SALMONN se podobá té, která je implementována v rámcích NLP a vizuálních LLM, pomocí seznamu audio událostí, hudebních úkolů a řečových událostí pro jemné ladění audio-textových instrukcí. Úkoly jsou prioritizovány na základě jejich důležitosti napříč různými testy, včetně rozpoznávání telefonu, rozpoznávání překrývající se řeči a popisků hudby. Kromě toho, textové informace spárované s audio daty tvoří základ pro generování instrukčních podnětů.

Úkol před-školení

I když se implementují pouze první dvě etapy školení, rámec SALMONN dosahuje konkurenceschopných výsledků na úkolech jemného ladění instrukcí, nicméně výkon není na úrovni při provádění mezi-modálních úkolů, zejména úkolů, které vyžadují mezi-modální ko-rezonování. Konkrétně, model občas porušuje instrukční podněty, což vede k generování irelevantních nebo nesprávných odpovědí, a toto jev se nazývá úkol před-školení v rámci SALMONN, a etapa aktivačního ladění se implementuje pro řešení těchto problémů s před-školením.

Aktivační ladění

Efektivní přístup k řešení problémů s před-školením je regularizace intrinsických podmíněných jazykových modelů pomocí delších a rozmanitějších odpovědí, jako je vyprávění nebo zvukově-založené odpovědi na otázky. Rámec poté generuje pár školení dat pro takové úkoly pomocí textu spárovaného s audio nebo řečovými nebo hudebními popisky.

Specifikace úkolů

Pro hodnocení mezi-modálních emergentních schopností SALMONN, vývojáři zahrnuli 15 řečových, audio a hudebních úkolů rozdělených do tří úrovní.

Úroveň 1

Na první úrovni se úkoly používají pro jemné ladění instrukcí, a proto jsou to nejjednodušší úkoly, které rámec SALMONN musí provést.

Úroveň 2

Druhá úroveň se skládá z úkolů, které nebyly školeny, a úroveň složitosti je vyšší ve srovnání s úkoly úrovně 1. Na úrovni 2 se úkoly zpracovávají přirozeného jazyka, včetně extrakce klíčových slov z řeči, které se používají pro hodnocení přesnosti rámce při extrakci určitých klíčových slov pomocí řeči. Další úkoly zahrnují SQQA nebo Spoken Query-based Question Answering, které hodnotí společný smysl znalostí, které rámec extrahuje pomocí řečových otázek, úkol SF nebo Speech-based Slot Filling pro hodnocení přesnosti hodnot slotů, a nakonec jsou zde dva úkoly AST pro anglicko-německý a anglicko-japonský překlad.

Úroveň 3

Složitost úkolů na úrovni 3 je nejvyšší ve srovnání s ostatními dvěma úrovněmi, a zahrnuje SAC nebo Speech Audio Co-Reasoning a Audio-založené vyprávění. Úkol SAC vyžaduje, aby rámec SALMONN pochopil otázku zahrnutou v audio klipu, načetl podpůrné důkazy pomocí audio událostí nebo hudby na pozadí, a poté generoval vhodnou odpověď. Úkoly Audio-založeného vyprávění vyžadují, aby model generoval smysluplný příběh na základě zvukových informací z obecných audio vstupů.

Výsledky

Úkoly úrovně 1

Následující tabulka demonstruje výsledky na úkolech úrovně 1, a jak je vidět, rámec SALMONN dosahuje konkurenceschopných výsledků na úkolech úrovně 1 s nebo bez aktivačního ladění.

Úkoly úrovně 2 a 3

Ačkoli rámec SALMONN dosahuje konkurenceschopných výsledků na úkolech úrovně 1, i bez jemného ladění, totéž nelze říci o úkolech úrovně 2 a 3, protože bez aktivačního ladění rámec SALMONN trpí silným před-školením na úkolech. Výkon klesá ještě dále na úkolech SQQA, SAC a vyprávění, s důrazem na mezi-modální interakce, a rámec SALMONN má potíže s následováním instrukcí bez aktivačního ladění. Nicméně, s aktivačním laděním, výsledky se zlepšují podstatně, a výsledky jsou zahrnuty v následující obrazové ukázce.

Snížení faktoru LoRA

Snížení faktoru LoRA hodnotí vliv použití časového faktoru LoRA pro minimalizaci problémů s před-školením na úkolech. Jak je vidět v následující obrazové ukázce, snížení faktoru LoRA na 2,0 zvyšuje mezi-modální rozumění rámce SALMONN na úkolech ASR a PR, SQQA, vyprávění a SAC.

Hodnocení úkolového před-školení

Pro zdůraznění aktivačního ladění, rámec SALMONN analyzuje změny v perplexitě během tří etap školení, a jak je vidět v následující obrazové ukázce, změny perplexity pro úkoly AAC a ASR mají malé konečné hodnoty po první etapě školení, což indikuje modelovo učení mezi-modálních zarovnání.

Navíc, perplexita úkolu PR také klesá po jemném ladění instrukcí, díky své závislosti na komponentě LoRA pro naučení výstupních tokenů. Je také pozorováno, že i když jemné ladění instrukcí pomáhá snižovat perplexitu na úkolech vyprávění a SAC, mezera je stále dostatečně velká, aby úkoly provedl úspěšně, pokud není přidána další etapa aktivačního ladění nebo není odstraněn komponent LoRA.

Aktivační ladění

Rámec SALMONN zkoumá různé metody aktivačního ladění, včetně školení modelu na textovém úkolu QA s dlouhými odpověďmi, nebo použití audio-založených dlouhých psaných příběhů, zatímco použití dlouhých přepisů řeči pro úkoly ASR. Obě komponenty Q-Former a LoRA se jemně ladí pomocí těchto tří metod. Kromě toho, rámec ignoruje audio a Q-Former vstupy, aby jemně ladil komponenty LoRA a Vicuna jako adaptivní textový velký jazykový model, a výsledky jsou zobrazeny v následující obrazové ukázce, a jak je vidět, model nemůže být aktivován pomocí ASR (školení ASR s dlouhými popisky), ani pomocí vyprávění nebo textového ladění komponenty LoRA pomocí textových vstupů.

Závěrečné myšlenky

V tomto článku jsme mluvili o SALMONN nebo Speech Audio Language Music Open Neural Network, který je jednouchý audio-textový multimodální velký jazykový model, schopný vnímat a rozumět třem základním typům zvuku, včetně řeči, zvukových událostí a hudby. Model SALMONN umožňuje velkým jazykovým modelům pochopit a zpracovat obecné audio vstupy přímo a dosáhnout konkurenceschopného výkonu v širokém spektru audio a řečových úkolů.

Rámec SALMONN dosahuje konkurenceschopného výkonu v širokém spektru školených úkolů, včetně popisků audio, překladu a rozpoznávání řeči, a mnoho dalších, zatímco generalizuje na širokou škálu neškolících úkolů, včetně překladu řeči pro extrakci klíčových slov a neškolících jazyků. Díky svým schopnostem, rámec SALMONN lze považovat za další krok směrem k vylepšení obecných sluchových schopností velkých jazykových modelů.

Inženýr z povolání, spisovatel ze srdce. Kunal je technický spisovatel s hlubokou láskou a porozuměním pro AI a ML, který se věnuje zjednodušování složitých konceptů v těchto oblastech prostřednictvím svých přitažlivých a informačních dokumentací.