Modelos y plataformas de IA
SALMONN: Hacia habilidades genéricas de audición para modelos de lenguaje grande
La audición, que implica la percepción y comprensión de información auditiva genérica, es crucial para los agentes de inteligencia artificial en entornos del mundo real. Esta información auditiva abarca tres tipos de sonido principales: música, eventos de audio y habla. Recientemente, los marcos de modelo de lenguaje grande (LLM) basados en texto han demostrado habilidades notables, logrando un rendimiento de nivel humano en una amplia gama de tareas de procesamiento de lenguaje natural (NLP). Además, el ajuste de instrucciones, un método de entrenamiento que utiliza pares de respuestas de referencia y prompts de usuario, se ha vuelto popular. Este enfoque entrena a los modelos de lenguaje grande para seguir instrucciones de usuario de manera más efectiva. Sin embargo, la investigación actual se centra cada vez más en mejorar los modelos de lenguaje grande con la capacidad de percibir contenido multimodal.
Centrándonos en lo mismo, en este artículo, hablaremos sobre SALMONN o Red Neuronal Abierta de Lenguaje de Audio y Música de Habla, un marco de red neuronal abierta de lenguaje de audio y música de habla de última generación construido incorporando codificadores de habla y audio con un modelo de lenguaje grande preentrenado en texto en un solo modelo audio-texto multimodal. El modelo SALMONN permite que los Modelos de Lenguaje Grande comprendan y procesen entradas de audio genéricas directamente, y ofrezcan un rendimiento competitivo en una amplia variedad de tareas de audio y habla utilizadas en el entrenamiento, incluyendo la respuesta a preguntas basadas en información auditiva, el reconocimiento de habla y la traducción, la verificación del hablante, el reconocimiento de emociones, la generación de subtítulos de audio y música, y mucho más. Analizaremos a fondo el marco SALMONN y exploraremos su funcionamiento, arquitectura y resultados en una amplia variedad de tareas de NLP. Así que comencemos.
SALMONN: Una Introducción a los Modelos de Lenguaje Grande Multimodales de Audio-Texto Únicos
SALMONN significa Red Neuronal Abierta de Lenguaje de Audio y Música de Habla, y es un marco de modelo de lenguaje grande multimodal audio-texto único capaz de percibir y comprender tres tipos básicos de audio o sonido, incluyendo habla, eventos de audio y música. El modelo SALMONN permite que los Modelos de Lenguaje Grande comprendan y procesen entradas de audio genéricas directamente, y ofrezcan un rendimiento competitivo en una amplia variedad de tareas de audio y habla.
Para mejorar su rendimiento en tareas de habla y no habla, el marco SALMONN emplea una estructura de codificador dual que consiste en un codificador de audio BEATs y un codificador de habla obtenido del modelo de habla Whisper. Además, el marco SALMONN también utiliza un Q-Former a nivel de ventana como módulo de conexión para convertir efectivamente una secuencia de salida de codificador de longitud variable en tokens de audio aumentados de un número variable, y lograr así una alta resolución temporal para la alineación audio-texto. El enfoque LoRA o Adaptación de Bajo Rango se utiliza como adaptador transmodal en el marco Vicuna para alinear su espacio de salida con su espacio de entrada aumentado en un intento de mejorar aún más su rendimiento. En el marco SALMONN, la capacidad de realizar tareas transmodales no vistas durante la fase de entrenamiento se pierde durante el entrenamiento de instrucciones como habilidades emergentes transmodales, lo que es la razón principal por la que el marco SALMONN implementa una etapa de activación adicional para recuperar las habilidades emergentes generales del marco LLM.
Además, el marco hace uso de una amplia variedad de eventos de audio, benchmarks de música y benchmarks de habla para evaluar sus habilidades de audición cognitiva, y divide los benchmarks en tres niveles. En el primer nivel de benchmark, el marco entrena ocho tareas en el entrenamiento de instrucciones, incluyendo la traducción, la generación de subtítulos de audio y el reconocimiento de habla. Los otros dos niveles de benchmark son tareas no entrenadas, con el segundo nivel de benchmark que consiste en cinco tareas de procesamiento de lenguaje natural basadas en habla, como el llenado de ranuras y la traducción a lenguas no entrenadas que dependen de alineaciones multilingües de alta calidad entre tokens de texto y habla. Las tareas del benchmark del nivel final intentan comprender información auditiva de habla y no habla para la co-razonamiento habla-audio y la narración basada en audio.
En resumen, el marco SALMONN es
- El primer modelo de lenguaje grande multimodal capaz de comprender y percibir entradas de audio genéricas, incluyendo eventos de audio, habla y música, al máximo de su capacidad.
- Un intento de analizar las habilidades emergentes transmodales ofrecidas por la implementación del factor de escala LoRA y el uso de una etapa de activación adicional durante el entrenamiento para activar las habilidades emergentes transmodales del marco.
SALMONN: Arquitectura y Metodología
En esta sección, analizaremos la arquitectura, el método de entrenamiento y la configuración experimental del marco SALMONN.
Arquitectura del Modelo
En el núcleo de su arquitectura, el marco SALMONN sincroniza y combina las salidas de dos codificadores auditivos, tras lo cual el marco implementa un Q-Former a nivel de trama como módulo de conexión. La secuencia de salida generada por el Q-Former se combina con promtps de instrucción de texto y se proporciona como entrada al enfoque de adaptación LoRA para generar la respuesta requerida.
Codificadores Auditivos
El marco SALMONN utiliza dos codificadores auditivos: un codificador de audio BEATs no habla y un codificador de habla obtenido del marco de habla Whisper de OpenAI. El codificador de audio BEATs se entrena para utilizar el enfoque de aprendizaje iterativo auto-supervisado para extraer semántica de audio de alto nivel no habla, mientras que el codificador de habla se entrena en una gran cantidad de datos débilmente supervisados para tareas de reconocimiento y traducción de habla, con las características de salida del codificador adecuadas para incluir ruido de fondo y información de habla. El modelo primero tokeniza la entrada de audio y luego la mascara y predice en el entrenamiento. Las características auditivas resultantes de estos dos codificadores se complementan entre sí y son adecuadas para información de habla y no habla.
Nivel de Ventana Q-Former
Implementar la estructura Q-Former es un enfoque común utilizado en los marcos LLM para convertir la salida de un codificador de imagen en tokens de texto, y se requiere alguna modificación al tratar con tokens de audio de longitudes variables. Para ser más específicos, el marco considera la salida del codificador de la entrada de imagen como una secuencia de salida de codificador concatenada, y el Q-Former despliega un número fijo de consultas trainable para transformar la secuencia de salida del codificador en tokens de texto utilizando bloques apilados de Q-Former. Un bloque Q-Former apilado se asemeja a un bloque de decodificador de Transformer, con las excepciones de eliminar máscaras casuales en las capas de auto-atención y el uso de un número fijo de consultas trainable estáticas en los bloques iniciales.
LoRA y LLM
El marco SALMONN también despliega un LLM Vicuna, que es un marco de modelo de lenguaje grande LLaMA ajustado para seguir instrucciones de manera más precisa y efectiva. El marco LoRA es un método común utilizado para el ajuste eficiente de parámetros, y su inclusión en el marco SALMONN para valorar matrices de peso y adaptar la consulta en las capas de auto-atención.

Método de Entrenamiento
El marco SALMONN utiliza un enfoque de entrenamiento transmodal de tres etapas. La etapa de entrenamiento comprende una etapa de pre-entrenamiento y una etapa de ajuste de instrucciones que se incluyen en la mayoría de los marcos LLM visuales, y se implementa una etapa de activación adicional para resolver problemas de sobre-ajuste encontrados durante las tareas de generación de subtítulos de audio y reconocimiento de habla.
Etapa de Pre-entrenamiento
Para limitar la brecha observada entre parámetros pre-entrenados, incluyendo codificadores y LLM, y parámetros inicializados aleatoriamente, incluyendo adaptadores y módulos de conexión, el marco SALMONN utiliza una gran cantidad de datos de generación de subtítulos de audio y reconocimiento de habla para pre-entrenar los componentes LoRA y Q-Former. Estas tareas contienen información auditiva vital sobre los contenidos clave de los eventos de audio, tanto habla como no habla, y ninguna de ellas requiere comprensión o razonamiento complejo para aprender la alineación entre información textual y auditiva.
Etapa de Ajuste de Instrucciones
La etapa de ajuste de instrucciones implementada en el marco SALMONN se asemeja a la implementada en los marcos NLP y LLM visuales, utilizando una lista de eventos de audio, tareas de música y eventos de habla para ajustar las instrucciones audio-texto. Las tareas se priorizan según su importancia en diferentes pruebas, incluyendo el reconocimiento de teléfono, el reconocimiento de habla superpuesta y los subtítulos de música. Además, la información textual emparejada con los datos de audio forma la base para generar promtps de instrucción.
Sobre-ajuste de Tareas
Incluso cuando se implementan solo las dos primeras etapas de entrenamiento, el marco SALMONN ofrece resultados competitivos en las tareas de ajuste de instrucciones, aunque el rendimiento no es óptimo al realizar tareas transmodales, especialmente en tareas que requieren habilidades de co-razonamiento transmodal. En particular, el modelo ocasionalmente viola los promtps de instrucción, lo que resulta en la generación de respuestas irrelevantes o incorrectas, y este fenómeno se conoce como sobre-ajuste de tareas en el marco SALMONN, y la etapa de activación se implementa para resolver estos problemas de sobre-ajuste.
Etapa de Activación
Un enfoque efectivo para resolver problemas de sobre-ajuste es regularizar los modelos de lenguaje condicional intrínsecos utilizando respuestas más largas y diversas, como la narración o la respuesta a preguntas basadas en información auditiva. El marco luego genera los datos de entrenamiento para tales tareas utilizando texto emparejado con audio o habla o subtítulos de música.
Especificaciones de Tareas
Para evaluar las habilidades emergentes transmodales de SALMONN, los desarrolladores han incluido 15 tareas de habla, audio y música divididas en tres niveles.
Nivel 1
En el primer nivel, las tareas se utilizan para el ajuste de instrucciones, y por lo tanto, son el conjunto más fácil de tareas que el marco SALMONN debe realizar.
Nivel 2
El segundo nivel consiste en tareas no entrenadas, y el nivel de complejidad es mayor en comparación con las tareas del nivel 1. En el nivel 2, las tareas son tareas de procesamiento de lenguaje natural basadas en habla, incluyendo la extracción de palabras clave de habla que se utiliza para evaluar la precisión del marco al extraer ciertas palabras clave utilizando habla. Otras tareas incluyen SQQA o respuesta a preguntas basadas en consultas habladas que evalúan el conocimiento común que el marco extrae utilizando preguntas habladas, una tarea de llenado de ranuras basada en habla para evaluar la precisión de los valores de ranura, y finalmente, hay dos tareas de traducción de inglés a alemán y de inglés a japonés.
Nivel 3
La complejidad de las tareas en el nivel 3 es la máxima en comparación con los otros dos niveles, e incluye tareas de co-razonamiento habla-audio y narración basada en audio. La tarea de co-razonamiento habla-audio requiere que el marco SALMONN comprenda una pregunta incluida en el clip de audio alimentado al modelo, encuentre evidencia de apoyo utilizando eventos de audio o música en el fondo, y finalmente genere una razón adecuada para responder a la pregunta. Las tareas de narración basada en audio requieren que el modelo genere una historia significativa basada en la información auditiva obtenida de las entradas de audio genéricas.

Resultados
Tareas del Nivel 1
La siguiente tabla muestra los resultados en las tareas del nivel 1, y como se puede observar, el marco SALMONN devuelve resultados competitivos en las tareas del nivel 1 con o sin activación.

Tareas de los Niveles 2 y 3
Aunque el marco SALMONN devuelve resultados competitivos en las tareas del nivel 1 incluso sin ajuste, lo mismo no puede decirse de las tareas de los niveles 2 y 3, ya que sin activación, el marco SALMONN sufre mucho de sobre-ajuste en las tareas. El rendimiento disminuye aún más en las tareas de SQQA, co-razonamiento habla-audio y narración, y el marco SALMONN lucha por seguir las instrucciones sin activación. Sin embargo, con activación, los resultados mejoran considerablemente, y los resultados se incluyen en la siguiente imagen.

Descuento del Factor de Escala LoRA
El descuento del factor de escala LoRA evalúa la influencia de utilizar el descuento de tiempo en el factor de escala LoRA para minimizar los problemas de sobre-ajuste en las tareas. Como se puede observar en la siguiente figura, una disminución en el factor de escala LoRA a 2,0 eleva la capacidad de razonamiento transmodal del marco SALMONN en las tareas de reconocimiento de habla y generación de subtítulos de audio.

Evaluación del Sobre-ajuste de Tareas
Para enfatizar la activación, el marco SALMONN analiza los cambios en la perplejidad durante las tres etapas de entrenamiento, y como se puede ver en la siguiente imagen, los cambios de perplejidad para las tareas de generación de subtítulos de audio y reconocimiento de habla tienen valores finales pequeños después de la primera etapa de entrenamiento, lo que indica que el modelo ha aprendido las alineaciones transmodales.

Además, la perplejidad de la tarea de reconocimiento de habla también disminuye después del ajuste de instrucciones debido a su dependencia del componente LoRA para aprender los tokens de salida. También se observa que aunque el ajuste de instrucciones ayuda a reducir la perplejidad en las tareas de narración y co-razonamiento habla-audio, la brecha aún es lo suficientemente grande como para realizar las tareas con éxito a menos que se agregue una etapa de activación adicional o se elimine el componente LoRA.
Activación
El marco SALMONN explora diferentes métodos de activación, incluyendo el entrenamiento del modelo en tareas de respuesta a preguntas basadas en texto con respuestas largas, o utilizando historias escritas largas basadas en audio. Ambos componentes Q-Former y LoRA se ajustan utilizando estos tres métodos. Además, el marco ignora las entradas de audio y Q-Former para ajustar los componentes LoRA y Vicuna como un modelo de lenguaje grande basado en texto adaptable, y los resultados se demuestran en la siguiente imagen, y como se puede ver, el modelo no puede ser activado por ASR (entrenando ASR con etiquetas largas), ni por la narración o el texto basado en la capacitación del componente LoRA utilizando entradas de texto.

Pensamientos Finales
En este artículo, hemos hablado sobre SALMONN o Red Neuronal Abierta de Lenguaje de Audio y Música de Habla, un marco de modelo de lenguaje grande multimodal audio-texto único capaz de percibir y comprender tres tipos básicos de audio o sonido, incluyendo habla, eventos de audio y música. El modelo SALMONN permite que los Modelos de Lenguaje Grande comprendan y procesen entradas de audio genéricas directamente, y ofrezcan un rendimiento competitivo en una amplia variedad de tareas de audio y habla.
El marco SALMONN ofrece un rendimiento competitivo en una amplia variedad de tareas entrenadas, incluyendo la generación de subtítulos de audio, la traducción y el reconocimiento de habla, y más, mientras se generaliza a una serie de tareas de comprensión no entrenadas, incluyendo la traducción de habla para la extracción de palabras clave y lenguas no entrenadas. Debido a sus capacidades, el marco SALMONN puede considerarse como el próximo paso hacia la mejora de las habilidades genéricas de audición de los modelos de lenguaje grande.












