Modèles et plateformes d’IA
SALMONN : Vers une capacité d’écoute générique pour les grands modèles de langage
L’écoute, qui implique la perception et la compréhension d’informations auditives génériques, est cruciale pour les agents d’IA dans les environnements du monde réel. Ces informations auditives englobent trois types de sons principaux : la musique, les événements audio et la parole. Récemment, les cadres de modèles de langage basés sur le texte (LLM) ont montré des capacités remarquables, atteignant des performances au niveau humain dans une large gamme de tâches de traitement du langage naturel (NLP). De plus, l’ajustement des instructions, une méthode d’entraînement utilisant des paires de réponses de référence et des invites d’utilisateur, est devenu populaire. Cette approche entraîne les grands modèles de langage à suivre plus efficacement les instructions ouvertes de l’utilisateur. Cependant, la recherche actuelle se concentre de plus en plus sur l’amélioration des grands modèles de langage avec la capacité de percevoir du contenu multimodal.
En nous concentrant sur le même objectif, dans cet article, nous allons parler de SALMONN ou Speech Audio Language Music Open Neural Network, un réseau neuronal ouvert de langage audio-musical basé sur la parole, construit en intégrant des encodeurs de parole et d’audio avec un modèle de langage basé sur le texte pré-entraîné dans un seul modèle audio-texte multimodal. Le modèle SALMONN permet aux grands modèles de langage de comprendre et de traiter directement les entrées audio génériques, et offre des performances compétitives sur une large gamme de tâches audio et de parole utilisées lors de l’entraînement, y compris la réponse aux questions basées sur les informations auditives, la reconnaissance et la traduction de la parole, la vérification du locuteur, la reconnaissance des émotions, la légende audio et musicale, et bien plus encore. Nous allons plonger plus profondément dans le cadre SALMONN et explorer son fonctionnement, son architecture et ses résultats sur une large gamme de tâches NLP. Alors, commençons.
SALMONN : Introduction aux grands modèles de langage multimodaux audio-texte
SALMONN signifie Speech Audio Language Music Open Neural Network, et il s’agit d’un cadre de modèle de langage multimodal audio-texte capable de percevoir et de comprendre trois types de sons de base, y compris la parole, les événements audio et la musique. Le modèle SALMONN permet aux grands modèles de langage de comprendre et de traiter directement les entrées audio génériques, et offre des performances compétitives sur une large gamme de tâches audio et de parole.
Pour améliorer ses performances sur les tâches de parole et de non-parole, le cadre SALMONN utilise une structure d’encodeur double composée d’un encodeur audio BEATs et d’un encodeur de parole issu du modèle de parole Whisper. De plus, le cadre SALMONN utilise également un Q-Former de niveau de fenêtre ou un transformateur de requête en tant que module de connexion pour convertir efficacement une séquence de sortie de longueur variable de l’encodeur en jetons audio augmentés d’un nombre variable, et atteindre ainsi une résolution temporelle élevée pour l’alignement audio-texte. L’approche LoRA ou adaptation de bas rang est utilisée en tant qu’adaptateur cross-modal pour aligner l’espace de sortie du cadre Vicuna avec son espace d’entrée augmenté dans le but d’améliorer encore ses performances. Dans le cadre SALMONN, la capacité à effectuer des tâches cross-modales non vues pendant la phase d’entraînement est perdue pendant l’entraînement des instructions en tant que capacités émergentes cross-modales, ce qui est la principale raison pour laquelle le cadre SALMONN met en œuvre une étape d’activation supplémentaire pour retrouver les capacités émergentes générales du cadre LLM.
De plus, le cadre utilise une large gamme d’événements audio, de benchmarks musicaux et de benchmarks de parole pour évaluer ses capacités d’écoute cognitive, et divise les benchmarks en trois niveaux. Au premier niveau de benchmark, le cadre entraîne huit tâches dans l’entraînement des instructions, y compris la traduction, la légende audio et la reconnaissance de la parole. Les deux autres niveaux de benchmark sont des tâches non entraînées, avec le deuxième niveau de benchmark composé de cinq tâches de traitement du langage naturel basées sur la parole, telles que la recherche de mots clés et la traduction vers des langues non entraînées, en s’appuyant sur des alignements multilingues de haute qualité entre les jetons de texte et de parole. Les tâches de benchmark de niveau final tentent de comprendre les informations auditives de parole et de non-parole pour la co-raisonnement parole-audio et la narration basée sur l’audio.
Pour résumer, le cadre SALMONN est
- Le premier modèle de langage multimodal capable de comprendre et de percevoir les entrées audio génériques, y compris les événements audio, la parole et la musique, au maximum de ses capacités.
- Une tentative d’analyser les capacités émergentes cross-modales offertes en mettant en œuvre le facteur d’échelle LoRA, et en utilisant une étape d’activation supplémentaire et budgétaire pendant l’entraînement pour activer les capacités émergentes cross-modales du cadre.
SALMONN : Architecture et méthodologie
Dans cette section, nous allons examiner l’architecture, la méthode d’entraînement et la configuration expérimentale du cadre SALMONN.
Architecture du modèle
Au cœur de son architecture, le cadre SALMONN synchronise et combine les sorties de deux encodeurs auditifs, puis met en œuvre un Q-Former au niveau de la trame en tant que module de connexion. La séquence de sortie générée par le Q-Former est fusionnée avec les invites d’instruction de texte, puis utilisée comme entrée pour l’approche d’adaptation LoRA pour générer la réponse requise.
Encodeurs auditifs
Le cadre SALMONN utilise deux encodeurs auditifs : un encodeur audio BEATs non parole et un encodeur de parole issu du modèle de parole Whisper d’OpenAI. L’encodeur audio BEATs est entraîné pour utiliser l’approche d’apprentissage itératif auto-supervisé pour extraire les sémantiques audio de haute niveau non parole, tandis que l’encodeur de parole est entraîné sur une grande quantité de données faiblement supervisées pour les tâches de reconnaissance et de traduction de la parole, avec les fonctionnalités de sortie de l’encodeur adaptées pour inclure le bruit de fond et les informations de parole. Le modèle tokenise d’abord l’audio d’entrée, puis le masque et le prédit pendant l’entraînement. Les fonctionnalités auditives résultantes de ces deux encodeurs se complètent mutuellement et sont adaptées aux informations de parole et de non-parole.
Niveau de fenêtre Q-Former
La mise en œuvre de la structure Q-Former est une approche courante utilisée dans les cadres LLM pour convertir la sortie d’un encodeur d’image en jetons de texte, et certaines modifications sont nécessaires lorsqu’il s’agit de jetons audio de longueurs variables. Plus précisément, le cadre considère la sortie de l’encodeur de l’entrée de l’image comme une séquence de sortie de l’encodeur concaténée, et le Q-Former déploie un nombre fixe de requêtes entraînables pour transformer la séquence de sortie de l’encodeur en jetons de texte à l’aide de blocs empilés de Q-Former. Un bloc Q-Former empilé ressemble à un bloc de décodeur de transformateur, à l’exception de la suppression des masques de causalité dans les couches d’auto-attention et de l’utilisation d’un nombre fixe de requêtes statiques entraînables dans les blocs initiaux.
LoRA et LLM
Le cadre SALMONN déploie également un LLM Vicuna, qui est un cadre de modèle de langage basé sur LLaMA, affiné pour suivre les instructions plus précisément et efficacement. Le cadre LoRA est une méthode courante utilisée pour l’adaptation efficace des paramètres, et son inclusion dans le cadre SALMONN pour valoriser les matrices de poids et adapter la requête dans les couches d’auto-attention.

Méthode d’entraînement
Le cadre SALMONN utilise une approche d’entraînement cross-modal en trois étapes. L’étape d’entraînement comprend une étape de pré-entraînement et une étape d’ajustement des instructions, qui sont incluses dans la plupart des cadres LLM visuels, et une étape d’ajustement d’activation supplémentaire est mise en œuvre pour résoudre les problèmes de sur-ajustement rencontrés lors des tâches de légende audio et de reconnaissance de la parole.
Étape de pré-entraînement
Pour limiter l’écart observé entre les paramètres pré-entraînés, y compris les encodeurs et les LLM, et les paramètres initialisés aléatoirement, y compris les adaptateurs et les modules de connexion, le cadre SALMONN utilise une grande quantité de données de légende audio et de reconnaissance de la parole pour pré-entraîner les composants LoRA et Q-Former. Ces tâches contiennent des informations auditives essentielles sur les contenus clés des événements audio, tant de parole que de non-parole, et aucune d’entre elles n’exige une compréhension ou une raison complexe pour apprendre l’alignement entre les informations textuelles et auditives.
Étape d’ajustement des instructions
L’étape d’ajustement des instructions mise en œuvre dans le cadre SALMONN ressemble à celle mise en œuvre dans les cadres NLP et les cadres LLM visuels, en utilisant une liste d’événements audio, de tâches musicales et d’événements de parole pour affiner les instructions audio-texte. Les tâches sont priorisées en fonction de leur importance dans différents tests, y compris la reconnaissance de la parole, la reconnaissance de la parole chevauchante et les légendes musicales. De plus, les informations textuelles appariées avec les données audio forment la base de la génération d’invites d’instruction.
Sur-ajustement des tâches
Même en mettant en œuvre uniquement les deux premières étapes d’entraînement, le cadre SALMONN offre des résultats compétitifs sur les tâches d’ajustement des instructions, bien que les performances ne soient pas à la hauteur lors de l’exécution de tâches cross-modales, en particulier sur les tâches qui nécessitent des capacités de co-raisonnement cross-modal. Plus précisément, le modèle viole parfois les invites d’instruction, ce qui entraîne la génération de réponses non pertinentes ou incorrectes, et ce phénomène est appelé sur-ajustement des tâches dans le cadre SALMONN, et l’étape d’ajustement d’activation est mise en œuvre pour résoudre ces problèmes de sur-ajustement.
Étape d’ajustement d’activation
Une approche efficace pour résoudre les problèmes de sur-ajustement consiste à régulariser les modèles de langage conditionnels intrinsèques en utilisant des réponses plus longues et plus diversifiées, telles que la narration ou la réponse aux questions basées sur les informations auditives. Le cadre génère ensuite les données d’entraînement pour ces tâches en utilisant du texte apparié avec de l’audio ou de la parole ou des légendes musicales.
Spécifications des tâches
Pour évaluer les capacités émergentes cross-modales à zéro shot du SALMONN, les développeurs ont inclus 15 tâches de parole, d’audio et de musique réparties sur trois niveaux.
Niveau 1
Au premier niveau, les tâches sont utilisées pour l’ajustement des instructions, et sont donc les tâches les plus faciles que le cadre SALMONN doit exécuter.
Niveau 2
Le deuxième niveau est composé de tâches non entraînées, et le niveau de complexité est plus élevé par rapport aux tâches de niveau 1. Au niveau 2, les tâches sont des tâches de traitement du langage naturel basées sur la parole, y compris l’extraction de mots clés, qui est utilisée pour évaluer la précision du cadre lors de l’extraction de certains mots clés à l’aide de la parole. D’autres tâches incluent la recherche de questions basées sur la parole, qui évaluent les connaissances de sens commun que le cadre extrait à l’aide de questions de parole, une tâche de remplissage de slots basée sur la parole pour évaluer la précision des valeurs de slots, et enfin, il y a deux tâches de traduction de l’anglais vers l’allemand et de l’anglais vers le japonais.
Niveau 3
La complexité des tâches au niveau 3 est la plus élevée par rapport aux deux autres niveaux, et inclut des tâches de co-raisonnement parole-audio et de narration basée sur l’audio. La tâche de co-raisonnement parole-audio nécessite que le cadre SALMONN comprenne une question incluse dans la bande audio fournie au modèle, trouve des preuves à l’appui en utilisant des événements audio ou de la musique en arrière-plan, et génère ensuite une raison appropriée pour répondre à la question. Les tâches de narration basée sur l’audio nécessitent que le modèle génère une histoire significative en fonction des informations auditives provenant des entrées audio génériques.

Résultats
Tâches de niveau 1
Le tableau suivant montre les résultats sur les tâches de niveau 1, et comme on peut le voir, le cadre SALMONN offre des résultats compétitifs sur les tâches de niveau 1 avec ou sans ajustement d’activation.

Tâches de niveau 2 et 3
Bien que le cadre SALMONN offre des résultats compétitifs sur les tâches de niveau 1 même sans ajustement d’activation, la même chose ne peut pas être dite pour les tâches de niveau 2 et 3, car sans activation, le cadre SALMONN souffre fortement de sur-ajustement sur les tâches. Les performances chutent encore plus sur les tâches de recherche de questions basées sur la parole, de co-raisonnement parole-audio et de narration, qui mettent l’accent sur les interactions multimodales, et le cadre SALMONN a du mal à suivre les instructions sans ajustement d’activation. Cependant, avec l’ajustement d’activation, les résultats s’améliorent considérablement, et les résultats sont inclus dans l’image suivante.

Discounting LoRA Scaling Factor
L’évaluation de l’influence de l’utilisation de la réduction du facteur d’échelle LoRA pour minimiser les problèmes de sur-ajustement sur les tâches. Comme on peut le voir dans la figure suivante, une diminution du facteur d’échelle LoRA à 2,0 améliore la capacité de raisonnement cross-modal du cadre SALMONN sur les tâches de reconnaissance de la parole et de traduction.

Évaluation du sur-ajustement des tâches
Pour mettre l’accent sur l’ajustement d’activation, le cadre SALMONN analyse les changements de perplexité pendant les trois étapes d’entraînement, et comme on peut le voir dans l’image suivante, les changements de perplexité pour les tâches de légende audio et de reconnaissance de la parole ont des valeurs finales faibles après la première étape d’entraînement, indiquant que le modèle a appris les alignements cross-modaux.

De plus, la perplexité de la tâche de reconnaissance de la parole diminue également après l’ajustement des instructions en raison de sa dépendance à l’égard du composant LoRA pour apprendre les jetons de sortie. Il est également observé que même si l’ajustement des instructions aide à réduire la perplexité sur les tâches de narration et de co-raisonnement parole-audio, l’écart est encore trop grand pour exécuter les tâches avec succès, à moins qu’une étape d’activation supplémentaire ne soit ajoutée ou que le composant LoRA ne soit supprimé.
Ajustement d’activation
Le cadre SALMONN explore différentes méthodes d’activation, y compris l’entraînement du modèle sur des paires de tâches de questions-réponses basées sur le texte avec des réponses longues, ou en utilisant des histoires écrites basées sur l’audio, ou en utilisant des transcriptions de parole longues pour les tâches de reconnaissance de la parole. Les composants Q-Former et LoRA sont affinés à l’aide de ces trois méthodes. De plus, le cadre ignore les entrées audio et Q-Former pour affiner les composants LoRA et Vicuna en tant que modèle de langage basé sur le texte adaptatif, et les résultats sont présentés dans l’image suivante, et comme on peut le voir, le modèle ne peut pas être activé par la reconnaissance de la parole, ni par la narration ou le texte.

Pensées finales
Dans cet article, nous avons parlé de SALMONN ou Speech Audio Language Music Open Neural Network, un cadre de modèle de langage multimodal audio-texte capable de percevoir et de comprendre trois types de sons de base, y compris la parole, les événements audio et la musique. Le modèle SALMONN permet aux grands modèles de langage de comprendre et de traiter directement les entrées audio génériques, et offre des performances compétitives sur une large gamme de tâches audio et de parole.
Le cadre SALMONN offre des performances compétitives sur une large gamme de tâches entraînées, y compris la légende audio, la traduction et la reconnaissance de la parole, et plus encore, tout en se généralisant à un large éventail de tâches de compréhension non entraînées, y compris la traduction de la parole pour l’extraction de mots clés et les langues non entraînées. En raison de ses capacités, le cadre SALMONN peut être considéré comme l’étape suivante pour améliorer les capacités d’écoute génériques des grands modèles de langage.












