Modelli e piattaforme di IA
SALMONN: Verso Abilità Uditiva Generiche per Modelli di Linguaggio di Grande Scala
L’udito, che coinvolge la percezione e la comprensione di informazioni uditive generiche, è cruciale per gli agenti di intelligenza artificiale in ambienti reali. Queste informazioni uditive comprendono tre tipi di suono principali: musica, eventi audio e discorso. Recentemente, le strutture di modelli di linguaggio di grandi dimensioni basate su testo hanno mostrato capacità notevoli, raggiungendo prestazioni a livello umano in una vasta gamma di attività di elaborazione del linguaggio naturale. Inoltre, l’istruzione di tuning, un metodo di formazione che utilizza coppie di risposte di riferimento e prompt dell’utente, è diventata popolare. Questo approccio forma modelli di linguaggio di grandi dimensioni per seguire più efficacemente le istruzioni aperte dell’utente. Tuttavia, la ricerca attuale si concentra sempre più sull’arricchimento dei modelli di linguaggio di grandi dimensioni con la capacità di percepire contenuti multimodali.
Concentrandosi sullo stesso obiettivo, in questo articolo parleremo di SALMONN o Speech Audio Language Music Open Neural Network, una struttura all’avanguardia di rete neurale aperta per il linguaggio audio e la musica, costruita incorporando encoder di discorso e audio con un modello di linguaggio di grandi dimensioni pre-addestrato basato su testo in un unico modello audio-testo multimodale. Il modello SALMONN consente ai Modelli di Linguaggio di Grande Scala di comprendere e elaborare direttamente input audio generici e di offrire prestazioni competitive in una vasta gamma di attività audio e discorso utilizzate durante l’addestramento, comprese la risposta alle domande basate su informazioni uditive, il riconoscimento e la traduzione del discorso, la verifica del parlante, il riconoscimento delle emozioni, la didascalia audio e musicale e molto altro. Esploreremo più in profondità la struttura SALMONN e i suoi risultati in una vasta gamma di attività di elaborazione del linguaggio naturale. Quindi, iniziamo.
SALMONN: Introduzione ai Modelli di Linguaggio Multimodali Audio-Testo di Grande Scala
SALMONN è l’acronimo di Speech Audio Language Music Open Neural Network ed è una struttura di modello di linguaggio multimodale audio-testo di grande scala in grado di percepire e comprendere tre tipi di base di suono o audio, compresi discorso, eventi audio e musica. Il modello SALMONN consente ai Modelli di Linguaggio di Grande Scala di comprendere e elaborare direttamente input audio generici e di offrire prestazioni competitive in una vasta gamma di attività audio e discorso.
Per aumentare le sue prestazioni sia su attività di discorso che su attività di audio non discorsivo, la struttura SALMONN utilizza una struttura di doppio encoder costituita da un encoder audio BEATs e da un encoder di discorso derivato dal modello di discorso Whisper. Inoltre, la struttura SALMONN utilizza anche un Q-Former a livello di finestra come modulo di connessione per convertire efficacemente una sequenza di output di lunghezza variabile dell’encoder in token audio aumentati di un numero variabile e raggiungere infine un’elevata risoluzione temporale per l’allineamento audio-testo. L’approccio LoRA o Low Rank Adaptation viene utilizzato come adattatore cross-modale per allineare lo spazio di output del modello con il suo spazio di input aumentato nel tentativo di aumentare ulteriormente le sue prestazioni. Nella struttura SALMONN, la capacità di eseguire attività cross-modali non viste durante la fase di addestramento e perse durante l’addestramento delle istruzioni come abilità emergenti cross-modali è il motivo principale per cui la struttura SALMONN implementa una fase di attivazione aggiuntiva per riacquistare le abilità emergenti generali del framework del modello di linguaggio di grandi dimensioni.
Inoltre, la struttura utilizza una vasta gamma di eventi audio, benchmark musicali e benchmark di discorso per valutare le sue abilità uditive cognitive e divide i benchmark in tre livelli. Al primo livello di benchmark, la struttura addestra otto attività nell’addestramento delle istruzioni, comprese la traduzione, la didascalia audio e il riconoscimento del discorso. Gli altri due livelli di benchmark sono attività non addestrate, con il secondo livello di benchmark costituito da cinque attività di elaborazione del linguaggio naturale basate sul discorso, come l’estrazione di slot e la traduzione in lingue non addestrate che si basano su allineamenti multilingui di alta qualità tra token di testo e discorso. Le attività di benchmark del terzo livello tentano di comprendere informazioni uditive discorsive e non discorsive per la ragionamento discorso-audio e la narrazione basata sull’audio.
In sintesi, la struttura SALMONN è
- Il primo modello di linguaggio multimodale in grado di comprendere e percepire input audio generici, compresi eventi audio, discorso e musica, al massimo delle sue capacità.
- Un tentativo di analizzare le abilità emergenti cross-modali offerte implementando il fattore di scala LoRA e utilizzando una fase di attivazione aggiuntiva durante l’addestramento per attivare le abilità emergenti cross-modali della struttura.
SALMONN: Architettura e Metodologia
In questa sezione, esamineremo l’architettura, il metodo di addestramento e la configurazione sperimentale per la struttura SALMONN.
Architettura del Modello
Al centro della sua architettura, la struttura SALMONN sincronizza e combina i output di due encoder udibili, dopodiché la struttura implementa un Q-Former a livello di finestra come modulo di connessione. La sequenza di output generata dal Q-Former viene unita con prompt di istruzioni di testo e viene quindi fornita come input all’approccio di adattamento LoRA per generare la risposta richiesta.
Encoder Udiveli
La struttura SALMONN utilizza due encoder udibili: un encoder audio BEATs non discorsivo e un encoder di discorso derivato dal framework di discorso Whisper. L’encoder audio BEATs è stato addestrato per utilizzare l’approccio di apprendimento iterativo auto-supervisionato nel tentativo di estrarre semantica audio di alto livello non discorsivo, mentre l’encoder di discorso è stato addestrato su una grande quantità di dati debolmente supervisionati per attività di riconoscimento e traduzione del discorso, con le caratteristiche di output dell’encoder adatte a includere rumore di fondo e informazioni discorsive. Il modello prima tokenizza l’input audio e poi lo maschera e lo prevede durante l’addestramento. Le caratteristiche uditive di questi due encoder si complementano a vicenda e sono adatte sia per informazioni discorsive che non discorsive.
Q-Former a Livello di Finestra
Implementare la struttura Q-Former è un approccio comune utilizzato nei framework dei modelli di linguaggio di grandi dimensioni per convertire l’output di un encoder di immagini in token di testo e sono necessarie alcune modifiche quando si hanno a che fare con token audio di lunghezza variabile. In particolare, la struttura considera l’output dell’encoder dell’input immagine come una sequenza di output dell’encoder concatenata e il Q-Former distribuisce un numero fisso di query addestrabili per trasformare la sequenza di output dell’encoder in token di testo utilizzando blocchi impilati di Q-Former. Un blocco Q-Former impilato assomiglia a un blocco decodificatore del trasformatore con le eccezioni che consistono nell’eliminazione delle maschere casuali nei livelli di auto-attenzione e nell’utilizzo di un numero fisso di query statiche addestrabili nei blocchi iniziali.
LoRA e LLM
La struttura SALMONN utilizza anche un modello di linguaggio di grandi dimensioni Vicuna, che è un framework di modello di linguaggio di grandi dimensioni LLaMA addestrato per seguire le istruzioni in modo più preciso ed efficace. Il framework LoRA è un metodo comune utilizzato per l’addestramento efficiente dei parametri e la sua inclusione nella struttura SALMONN per valutare le matrici di peso e adattare la query nei livelli di auto-attenzione.

Metodo di Addestramento
La struttura SALMONN utilizza un approccio di addestramento cross-modale a tre fasi. La fase di addestramento comprende una fase di pre-addestramento e una fase di addestramento delle istruzioni che sono incluse nella maggior parte dei framework di modelli di linguaggio visivi, e una fase di attivazione aggiuntiva è implementata per risolvere i problemi di over-fitting incontrati durante le attività di didascalia audio e riconoscimento del discorso.
Fase di Pre-Addestramento
Per limitare il divario osservato tra parametri pre-addestrati, compresi encoder e LLM, e parametri inizializzati casualmente, compresi adattatore e moduli di connessione, la struttura SALMONN utilizza una grande quantità di dati di didascalia audio e riconoscimento del discorso per pre-addestrare i componenti LoRA e Q-Former. Queste attività contengono informazioni uditive vitali sui contenuti chiave degli eventi audio, sia discorsivi che non discorsivi, e non richiedono una comprensione o un ragionamento complesso per apprendere l’allineamento tra informazioni testuali e uditive.
Fase di Addestramento delle Istruzioni
La fase di addestramento delle istruzioni implementata nella struttura SALMONN assomiglia a quella implementata nei framework di NLP e modelli di linguaggio visivi, utilizzando un elenco di eventi audio, attività musicali e eventi discorsivi per addestrare le istruzioni audio-testo. Le attività sono priorizzate in base alla loro importanza in diversi test, compresi il riconoscimento del telefono, il riconoscimento del discorso sovrapposto e le didascalie musicali. Inoltre, le informazioni testuali abbinate con i dati audio formano la base per generare prompt di istruzioni.
Over-Fitting delle Attività
Anche quando si implementano solo le prime due fasi di addestramento, la struttura SALMONN offre risultati competitivi nelle attività di addestramento delle istruzioni, sebbene le prestazioni non siano all’altezza quando si eseguono attività cross-modali, in particolare su attività che richiedono abilità di ragionamento cross-modale. In particolare, il modello viola occasionalmente le istruzioni dei prompt, generando risposte irrilevanti o scorrette, e questo fenomeno è noto come over-fitting delle attività nella struttura SALMONN, e la fase di attivazione è implementata per risolvere questi problemi di over-fitting.
Fase di Attivazione
Un approccio efficace per risolvere i problemi di over-fitting è quello di regolarizzare i modelli di linguaggio condizionali intrinseci utilizzando risposte più lunghe e diverse, come il racconto o la risposta alle domande basate sulle informazioni uditive. La struttura genera quindi i dati di addestramento per queste attività utilizzando testo abbinato con audio o discorso o didascalie musicali.
Specifiche delle Attività
Per valutare le abilità emergenti cross-modali zero-shot della struttura SALMONN, gli sviluppatori hanno incluso 15 attività di discorso, audio e musica divise in tre livelli.
Livello 1
Al primo livello, le attività sono utilizzate per l’addestramento delle istruzioni e, pertanto, sono il set di attività più semplice che la struttura SALMONN deve eseguire.
Livello 2
Il secondo livello consiste in attività non addestrate e il livello di complessità è più alto rispetto alle attività del livello 1. Al livello 2, le attività sono attività di elaborazione del linguaggio naturale basate sul discorso, compresa l’estrazione di parole chiave del discorso utilizzata per valutare l’accuratezza della struttura nell’estrazione di parole chiave specifiche utilizzando il discorso. Altre attività includono SQQA o query di domande basate sul discorso che valutano la conoscenza del senso comune che la struttura estrae utilizzando le domande del discorso, un’attività di riempimento di slot basata sul discorso per valutare l’accuratezza dei valori dei slot e, infine, ci sono due attività AST per le conversioni da inglese a tedesco e da inglese a giapponese.
Livello 3
La complessità delle attività del livello 3 è la massima rispetto agli altri due livelli e include attività di ragionamento discorso-audio e narrazione basata sull’audio. L’attività di ragionamento discorso-audio richiede alla struttura SALMONN di comprendere una domanda inclusa nel clip audio fornito al modello, trovare prove a sostegno utilizzando eventi audio o musica in sottofondo e, infine, generare una ragione appropriata per rispondere alla domanda. Le attività di narrazione basata sull’audio richiedono al modello di generare una storia significativa in base alle informazioni uditive provenienti da input audio generici.

Risultati
Attività del Livello 1
La seguente tabella mostra i risultati sulle attività del livello 1 e, come si può osservare, la struttura SALMONN offre risultati competitivi sulle attività del livello 1 con o senza attivazione.

Attività dei Livelli 2 e 3
Sebbene la struttura SALMONN offra risultati competitivi sulle attività del livello 1 anche senza addestramento, lo stesso non può essere detto per le attività dei livelli 2 e 3, poiché senza attivazione, la struttura SALMONN soffre gravemente di over-fitting sulle attività. Le prestazioni peggiorano ulteriormente sulle attività SQQA, SAC e narrazione, con enfasi sulle interazioni multimodali, e la struttura SALMONN fatica a seguire le istruzioni senza attivazione. Tuttavia, con l’attivazione, i risultati migliorano notevolmente e i risultati sono inclusi nell’immagine seguente.

Riduzione del Fattore di Scala LoRA
La riduzione del fattore di scala LoRA valuta l’influenza dell’utilizzo del fattore di scala LoRA per ridurre i problemi di over-fitting sulle attività. Come si può osservare nella figura seguente, una riduzione del fattore di scala LoRA a 2,0 eleva la capacità di ragionamento cross-modale della struttura SALMONN sulle attività ASR e PR, SQQA, narrazione e SAC rispettivamente.

Valutazione dell’Over-Fitting delle Attività
Per enfatizzare l’attivazione, la struttura SALMONN analizza i cambiamenti nella perplessità durante le tre fasi di addestramento e, come si può vedere nell’immagine seguente, i cambiamenti nella perplessità per le attività AAC e ASR hanno valori finali piccoli dopo la prima fase di addestramento, indicando la capacità del modello di apprendere l’allineamento cross-modale.

Inoltre, la perplessità dell’attività PR scende anche dopo l’addestramento delle istruzioni a causa della sua dipendenza dal componente LoRA per apprendere i token di output. Si osserva anche che, sebbene l’addestramento delle istruzioni aiuta a ridurre la perplessità sulle attività di narrazione e SAC, il divario è ancora abbastanza grande per eseguire le attività con successo, a meno che non venga aggiunta una fase di attivazione aggiuntiva o non venga rimosso il componente LoRA.
Attivazione
La struttura SALMONN esamina diversi metodi di attivazione, compreso l’addestramento del modello su attività di risposta alle domande basate sul testo con risposte lunghe o l’utilizzo di storie scritte lunghe basate sull’audio, mentre l’utilizzo di trascrizioni lunghe del discorso per le attività ASR. Sia il componente Q-Former che il componente LoRA vengono addestrati con questi tre metodi. Inoltre, la struttura ignora gli input audio e Q-Former per addestrare il componente LoRA e Vicuna come un modello di linguaggio di grandi dimensioni adattivo basato sul testo e i risultati sono mostrati nell’immagine seguente e, come si può vedere, il modello non può essere attivato dall’ASR (addestrando l’ASR con etichette lunghe), né dalla storia o dal testo basato sull’addestramento del componente LoRA utilizzando input di prompt di testo.

Pensieri Finali
In questo articolo, abbiamo parlato di SALMONN o Speech Audio Language Music Open Neural Network, una struttura di modello di linguaggio multimodale audio-testo di grande scala in grado di percepire e comprendere tre tipi di base di suono o audio, compresi discorso, eventi audio e musica. Il modello SALMONN consente ai Modelli di Linguaggio di Grande Scala di comprendere e elaborare direttamente input audio generici e di offrire prestazioni competitive in una vasta gamma di attività audio e discorso.
La struttura SALMONN offre prestazioni competitive in una vasta gamma di attività addestrate, comprese la didascalia audio, la traduzione e il riconoscimento del discorso e altro, mentre generalizza una serie di attività di comprensione non addestrate, compresa la traduzione del discorso per l’estrazione di parole chiave e lingue non addestrate. Grazie alle sue capacità, la struttura SALMONN può essere considerata il prossimo passo verso l’aumento delle abilità uditive generiche dei modelli di linguaggio di grandi dimensioni.












