Modele i platformy AI
Salmonn: W kierunku ogólnych zdolności słuchowych dla dużych modeli językowych
Słuch, który obejmuje percepcję i zrozumienie ogólnej informacji dźwiękowej, jest niezwykle ważny dla agentów AI w środowiskach rzeczywistych. Ta informacja dźwiękowa obejmuje trzy podstawowe typy dźwięku: muzykę, zdarzenia dźwiękowe i mowę. Ostatnio, ramy modelu językowego opartego na tekście (LLM) wykazały zdumiewające możliwości, osiągając wyniki na poziomie ludzkim w szerokim zakresie zadań przetwarzania języka naturalnego (NLP). Ponadto, strojenie instrukcji, metoda szkoleniowa wykorzystująca pary odniesienia odpowiedzi i prompty użytkownika, stała się popularna. Ten podejście szkoli duże modele językowe, aby skuteczniej wykonywały otwarte polecenia użytkownika. Jednak obecne badania coraz bardziej koncentrują się na udoskonaleniu dużych modeli językowych o możliwość postrzegania treści multimodalnych.
Koncentrując się na tym samym, w tym artykule będziemy rozmawiać o SALMONN lub Speech Audio Language Music Open Neural Network, ramie sieci neuronowej otwartej mowy, dźwięku i muzyki, zbudowanej przez połączenie kodera mowy i dźwięku z pre-trenowanym modelem językowym opartym na tekście w jeden model audio-tekstowy multimodalny. Model SALMONN umożliwia dużym modelom językowym zrozumienie i przetwarzanie ogólnych wejść dźwiękowych bezpośrednio, i dostarcza konkurencyjne wyniki w szerokim zakresie zadań audio i mowy używanych w szkoleniu, w tym zadania odpowiedzi na pytania oparte na informacji dźwiękowej, rozpoznawania mowy i tłumaczenia, weryfikacji mówcy, rozpoznawania emocji, opisów audio i muzyki, i wiele więcej. Będziemy zagłębiali się w ramę SALMONN i będziemy badać jej działanie, architekturę i wyniki w szerokim zakresie zadań NLP. Zatem, zacznijmy.
SALMONN: Wprowadzenie do pojedynczych modeli językowych audio-tekstowych
SALMONN oznacza Speech Audio Language Music Open Neural Network, i jest to ramka modelu językowego audio-tekstowego multimodalnego, zdolnego do postrzegania i zrozumienia trzech podstawowych typów dźwięku, w tym mowy, zdarzeń dźwiękowych i muzyki. Model SALMONN umożliwia dużym modelom językowym zrozumienie i przetwarzanie ogólnych wejść dźwiękowych bezpośrednio, i dostarcza konkurencyjne wyniki w szerokim zakresie zadań audio i mowy.
Aby zwiększyć swoją wydajność w zadaniach mowy i nie-mowy, ramka SALMONN wykorzystuje strukturę dual-encoder, składającą się z kodera audio BEATs i kodera mowy pochodzącego z modelu Whisper. Dodatkowo, ramka SALMONN wykorzystuje również Q-Former na poziomie okna jako moduł połączenia, aby skutecznie przekształcić sekwencję wyjściową o zmiennej długości z kodera w tokeny audio o zmiennej liczbie, i ostatecznie osiągnąć wysoką rozdzielczość czasową dla wyrównania audio-tekstowego. Podejście LoRA lub niskiej rangi adaptacji jest wykorzystywane jako adapter cross-modal do ramki Vicuna, aby wyrównać przestrzeń wyjściową z przestrzenią wejściową w celu dalszego zwiększenia wydajności. W ramce SALMONN, zdolność do wykonywania zadań cross-modalnych nie widocznych podczas fazy szkolenia, utraconych podczas szkolenia instrukcji jako cross-modalne zdolności emergentne, jest głównym powodem, dla którego ramka SALMONN implementuje dodatkową fazę aktywacji, aby odzyskać ogólne zdolności emergentne ramki LLM.
Ponadto, ramka wykorzystuje szeroki zakres zdarzeń dźwiękowych, benchmarków muzyki i benchmarków mowy, aby ocenić swoje zdolności słuchowe, i dzieli benchmarki na trzy poziomy. Na pierwszym poziomie benchmarku, ramka trenuje osiem zadań w szkoleniu instrukcji, w tym tłumaczenie, opisy audio i rozpoznawanie mowy. Dwa pozostałe poziomy benchmarku to zadania nie-trenowane, z drugim poziomem benchmarku składającym się z pięciu zadań NLP opartych na mowie, takich jak wypełnianie slotów i tłumaczenie na języki nie-trenowane, opierających się na wysokiej jakości wielojęzycznych wyrównaniach między tokenami tekstu i mowy. Zadania na trzecim poziomie benchmarku próbują zrozumieć informację słuchową i nie-słuchową dla współ-rozumowania mowy-audio i opowiadania historii opartych na dźwięku.
Podsumowując, ramka SALMONN jest
- Pierwszym modelem językowym multimodalnym, zdolnym do zrozumienia i postrzegania ogólnych wejść dźwiękowych, w tym zdarzeń dźwiękowych, mowy i muzyki, do maksimum swoich możliwości.
- Próba analizy zdolności emergentnych cross-modalnych oferowanych przez implementację czynnika skali LoRA, i wykorzystanie dodatkowej fazy aktywacji podczas szkolenia, aby aktywować zdolności emergentne cross-modalne ramki.
SALMONN: Architektura i Metodologia
W tej sekcji, będziemy przyglądać się architekturze, metodom szkolenia i eksperymentalnym ustawieniom ramki SALMONN.
Architektura Modelu
W centrum swojej architektury, ramka SALMONN synchronizuje i łączy dane wyjściowe z dwóch koderów dźwiękowych, po czym implementuje Q-Former na poziomie klatki jako moduł połączenia. Sekwencja wyjściowa wygenerowana przez Q-Former jest łączona z promptami instrukcji tekstowych i jest następnie podawana jako wejście do podejścia adaptacji LoRA, aby wygenerować wymagane odpowiedzi.
Kodery Dźwiękowe
Ramka SALMONN wykorzystuje dwa kodery dźwiękowe: koder audio BEATs i koder mowy pochodzący z ramki Whisper. Koder audio BEATs jest trenowany, aby wykorzystać podejście iteracyjnego uczenia się samonadzorowanego, aby wyodrębnić wysokie poziomy semantyki audio nie-mowy, podczas gdy koder mowy jest trenowany na dużej ilości słabo nadzorowanych danych do zadań rozpoznawania mowy i tłumaczenia mowy, z cechami wyjściowymi kodera odpowiednimi do uwzględnienia szumu tła i informacji mowy. Model najpierw tokenizuje wejście audio, a następnie maskuje i przewiduje je w trakcie szkolenia. Wynikowe cechy dźwiękowe tych dwóch koderów uzupełniają się wzajemnie i są odpowiednie dla zarówno mowy, jak i nie-mowy.
Q-Former na Poziomie Okna
Implementacja struktury Q-Former jest powszechnym podejściem wykorzystywanym w ramach LLM, aby przekształcić dane wyjściowe kodera obrazu w tokeny wejściowe tekstowe, i wymaga pewnych modyfikacji przy pracy z tokenami audio o zmiennej długości. Konkretnie, ramka traktuje dane wyjściowe kodera wejściowego jako sekwencję danych wyjściowych kodera, a Q-Former wdraża stałą liczbę szkoleniowych zapytań, aby przekształcić sekwencję danych wyjściowych kodera w tokeny tekstowe przy użyciu stosowanych bloków Q-Former. Stosowany blok Q-Former przypomina blok dekodera Transformera, z wyjątkiem usunięcia masek przyczynowych w warstwach uwagi do siebie i użycia stałej liczby szkoleniowych zapytań w blokach początkowych.
LoRA i LLM
Ramka SALMONN wykorzystuje również ramkę LLM Vicuna, która jest ramką modelu językowego LLaMA, dostrojoną do bardziej dokładnego wykonywania instrukcji. Podejście LoRA jest powszechną metodą wykorzystywaną do efektywnej dostrojenia parametrów, a jego włączenie do ramki SALMONN, aby dostroić macierze wag i dostosować zapytanie w warstwach uwagi do siebie.

Metoda Szkolenia
Ramka SALMONN wykorzystuje trzystopniowe podejście szkolenia cross-modalnego. Faza szkolenia składa się z fazy pre-trenowania i fazy dostrojenia instrukcji, które są zawarte w większości ramach LLM wizualnych, i dodatkowa faza aktywacji jest implementowana, aby rozwiązać problemy nadmiernego dopasowania występujące podczas zadań opisów audio i rozpoznawania mowy.
Faza Pre-trenowania
Aby ograniczyć lukę obserwowaną między parametrami pre-trenowanymi, w tym koderami i LLM, a parametrami zainicjowanymi losowo, w tym adapterami i modułami połączenia, ramka SALMONN wykorzystuje dużą ilość danych opisów audio i rozpoznawania mowy, aby pre-trenować komponenty LoRA i Q-Former. Te zadania zawierają istotną informację dźwiękową o kluczowych treściach zdarzeń audio, zarówno mowy, jak i nie-mowy, i nie wymagają złożonego zrozumienia lub rozumowania, aby nauczyć się wyrównania między informacją tekstową i dźwiękową.
Faza Dostrojenia Instrukcji
Faza dostrojenia instrukcji wdrożona w ramce SALMONN przypomina tę wdrożoną w ramach NLP i LLM wizualnych, wykorzystując listę zdarzeń audio, zadań muzycznych i zdarzeń mowy, aby dostroić instrukcje audio-tekstowe. Zadania są priorytetowe na podstawie ich ważności w różnych testach, w tym rozpoznawania telefonu, rozpoznawania nakładającej się mowy i opisów muzyki. Dodatkowo, informacja tekstowa połączona z danymi audio tworzy podstawę do generowania promptów instrukcji.
Nadmierna Dopasowanie Zadań
Nawet przy implementacji tylko dwóch pierwszych faz szkolenia, ramka SALMONN dostarcza konkurencyjne wyniki w zadaniach dostrojenia instrukcji, chociaż wyniki nie są wystarczająco dobre podczas wykonywania zadań cross-modalnych, szczególnie w zadaniach wymagających zdolności współ-rozumowania cross-modalnego. Konkretnie, model czasami narusza prompty instrukcji, co prowadzi do generowania nieistotnych lub niepoprawnych odpowiedzi, i zjawisko to nazywa się nadmierną dopasowalnością zadań w ramce SALMONN, i faza aktywacji jest implementowana, aby rozwiązać te problemy nadmiernego dopasowania.
Faza Aktywacji
Skutecznym podejściem do rozwiązania problemów nadmiernego dopasowania jest uregulowanie wewnętrznych modeli językowych warunkowych przy użyciu dłuższych i bardziej zróżnicowanych odpowiedzi, takich jak opowiadanie historii lub zadania odpowiedzi na pytania oparte na informacji dźwiękowej. Ramka generuje pary danych szkoleniowych dla takich zadań przy użyciu tekstu połączonego z audio lub mową lub opisami muzyki.
Specyfikacje Zadań
Aby ocenić zdolności emergentne cross-modalne SALMONN, deweloperzy włączyli 15 zadań mowy, audio i muzyki, podzielonych na trzy poziomy.
Poziom 1
Na pierwszym poziomie, zadania są wykorzystywane do dostrojenia instrukcji, i dlatego są to najłatwiejsze zadania, które ramka SALMONN musi wykonać.
Poziom 2
Drugi poziom składa się z zadań nie-trenowanych, i poziom trudności jest wyższy w porównaniu z zadaniami na poziomie 1. Na poziomie 2, zadania są zadania NLP oparte na mowie, w tym wyodrębnianie słów kluczowych, które jest wykorzystywane do oceny dokładności ramki przy wyodrębnianiu pewnych słów kluczowych przy użyciu mowy. Inne zadania obejmują SQQA lub zadania odpowiedzi na pytania oparte na mowie, które oceniają wiedzę zdroworozsądkową, którą ramka wyodrębnia przy użyciu pytań mowy, zadanie SF lub wypełnianie slotów oparte na mowie, aby ocenić dokładność wartości slotów, i na koniec, są dwa zadania AST dla konwersji z angielskiego na niemiecki i angielskiego na japoński.
Poziom 3
Trudność zadań na poziomie 3 jest największa w porównaniu z dwoma pierwszymi poziomami, i obejmuje zadania SAC lub współ-rozumowania mowy-audio i opowiadania historii opartych na dźwięku. Zadanie SAC wymaga, aby ramka SALMONN zrozumiała pytanie zawarte w klipie audio podanym do modelu, znalazła dowody wspierające przy użyciu zdarzeń audio lub muzyki w tle, i ostatecznie wygenerowała odpowiednią odpowiedź na pytanie. Zadania opowiadania historii opartych na dźwięku wymagają, aby model wygenerował znaczącą historię na podstawie informacji dźwiękowej pochodzącej z ogólnych wejść audio.

Wyniki
Zadania Poziomu 1
Poniższa tabela przedstawia wyniki na zadaniach poziomu 1, i jak można zobaczyć, ramka SALMONN zwraca konkurencyjne wyniki na zadaniach poziomu 1 z lub bez aktywacji.

Zadania Poziomu 2 i 3
Chociaż ramka SALMONN zwraca konkurencyjne wyniki na zadaniach poziomu 1, nawet bez dostrojenia, to same nie można powiedzieć o zadaniach poziomu 2 i 3, ponieważ bez aktywacji, ramka SALMONN cierpi na nadmierną dopasowalność w zadaniach. Wyniki są jeszcze gorsze w zadaniach SQQA, SAC i opowiadania historii, z naciskiem na interakcje multimodalne, i ramka SALMONN ma trudności z wykonywaniem instrukcji bez aktywacji. Jednak z aktywacją, wyniki poprawiają się znacznie, i wyniki są zawarte w poniższym obrazie.

Discounting LoRA Scaling Factor
Discounting LoRA Scaling Factor ocenia wpływ wykorzystania czasowego dyskontowania czynnika skali LoRA, aby zminimalizować problemy nadmiernego dopasowania w zadaniach. Jak można zobaczyć w poniższym obrazie, zmniejszenie czynnika skali LoRA do 2,0 podnosi zdolność rozumowania cross-modalnego ramki SALMONN w zadaniach ASR i PR, SQQA, opowiadania historii i SAC.

Ocena Nadmiernego Dopasowania Zadań
Aby podkreślić aktywację, ramka SALMONN analizuje zmiany w złożoności podczas trzech faz szkolenia, i jak można zobaczyć w poniższym obrazie, zmiany złożoności dla zadań AAC i ASR mają małe wartości końcowe po pierwszej fazie szkolenia, co wskazuje na naukę wyrównania cross-modalnego.

Ponadto, złożoność zadania PR również spada po dostrojeniu instrukcji, ze względu na swoją zależność od komponentu LoRA, aby nauczyć się tokenów wyjściowych. Jest również obserwowane, że chociaż dostrojenie instrukcji pomaga w zmniejszeniu złożoności w zadaniach opowiadania historii i SAC, luka jest nadal wystarczająco duża, aby wykonać zadania pomyślnie, chyba że dodatkowa faza aktywacji zostanie dodana lub komponent LoRA zostanie usunięty.
Aktywacja
Ramka SALMONN bada różne metody aktywacji, w tym szkolenie modelu na zadaniach odpowiedzi na pytania opartych na tekście z długimi odpowiedziami, lub użycie długich opowiadań opartych na dźwięku, oraz użycie długich transkrypcji mowy dla zadań ASR. Zarówno komponenty Q-Former, jak i LoRA są dostrojone przy użyciu tych trzech metod. Ponadto, ramka ignoruje wejścia audio i Q-Former, aby dostroić komponenty LoRA i Vicuna jako adaptacyjny model językowy oparty na tekście, i wyniki są przedstawione w poniższym obrazie, i jak można zobaczyć, model nie może być aktywowany przez ASR (szkolenie ASR z długimi etykietami), ani przez opowiadanie historii lub tekst oparty na tekście przez dostrojenie komponentu LoRA przy użyciu wejść tekstowych.

Końcowe Myśli
W tym artykule, omówiliśmy SALMONN lub Speech Audio Language Music Open Neural Network, ramkę modelu językowego audio-tekstowego multimodalnego, zdolną do postrzegania i zrozumienia trzech podstawowych typów dźwięku, w tym mowy, zdarzeń dźwiękowych i muzyki. Model SALMONN umożliwia dużym modelom językowym zrozumienie i przetwarzanie ogólnych wejść dźwiękowych bezpośrednio, i dostarcza konkurencyjne wyniki w szerokim zakresie zadań audio i mowy.
Ramka SALMONN dostarcza konkurencyjne wyniki w szerokim zakresie zadań szkolonych, w tym opisów audio, tłumaczenia i rozpoznawania mowy, i uogólnia się do szerokiego zakresu zadań nie-szkolonych, w tym tłumaczenia mowy na słowa kluczowe i języki nie-szkolone. Dzięki swoim zdolnościom, ramka SALMONN może być uważana za następny krok w kierunku udoskonalenia ogólnych zdolności słuchowych dużych modeli językowych.












