Modelos y plataformas de IA
Uni-MoE: Escalando Modelos de Lenguaje Grande Multimodales Unificados con Mezcla de Expertos
Los recientes avances en la arquitectura y el rendimiento de los Modelos de Lenguaje Grande Multimodales (MLLM) han destacado la importancia de los datos y modelos escalables para mejorar el rendimiento. Aunque este enfoque mejora el rendimiento, incurre en costos computacionales sustanciales que limitan la practicidad y la usabilidad de dichos enfoques. A lo largo de los años, los modelos de Mezcla de Expertos (MoE) han surgido como un enfoque alternativo exitoso para escalar modelos de imagen-texto y lenguaje grande de manera eficiente, ya que los modelos de Mezcla de Expertos tienen costos computacionales significativamente más bajos y un rendimiento sólido. Sin embargo, a pesar de sus ventajas, los Modelos de Mezcla no son el enfoque ideal para escalar modelos de lenguaje grande, ya que a menudo involucran menos expertos y modalidades limitadas, lo que limita las aplicaciones.
Para contrarrestar los obstáculos encontrados por los enfoques actuales y escalar modelos de lenguaje grande de manera eficiente, en este artículo hablaremos sobre Uni-MoE, un modelo de lenguaje grande multimodal unificado con una arquitectura de Mezcla de Expertos que puede manejar una amplia variedad de modalidades y expertos. El marco de Uni-MoE también implementa una arquitectura de Mezcla de Expertos escasa dentro de los modelos de lenguaje grande para intentar hacer que el proceso de entrenamiento y inferencia sea más eficiente mediante la paralelización de expertos y datos. Además, para mejorar la generalización y la colaboración multi-experto, el marco de Uni-MoE presenta una estrategia de entrenamiento progresiva que es una combinación de tres procesos diferentes. En el primero, el marco de Uni-MoE logra la alineación de modalidades cruzadas utilizando varios conectores con diferentes datos de modalidad cruzada. En segundo lugar, el marco de Uni-MoE activa la preferencia de los componentes de expertos mediante el entrenamiento de expertos específicos de modalidad con datos de instrucción de modalidad cruzada. Finalmente, el modelo de Uni-MoE implementa la técnica de aprendizaje de adaptación de rango bajo (LoRA) en datos de instrucción multimodal mixtos para ajustar el modelo. Cuando se evaluó el marco de Uni-MoE ajustado con instrucciones en un conjunto integral de conjuntos de datos multimodales, los resultados experimentales extensos destacaron la ventaja principal del marco de Uni-MoE en la reducción del sesgo de rendimiento en el manejo de conjuntos de datos multimodales mixtos de manera significativa. Los resultados también indicaron una mejora significativa en la colaboración multi-experto y la generalización.
Este artículo tiene como objetivo cubrir el marco de Uni-MoE en profundidad, y exploramos el mecanismo, la metodología, la arquitectura del marco junto con su comparación con marcos de estado del arte. Así que comencemos.
Uni-MoE: Escalando Modelos de Lenguaje Grande Multimodales Unificados
El advenimiento de modelos de lenguaje grande multimodal de código abierto, incluidos LLama e InstantBlip, ha destacado el éxito notable y el avance en tareas que involucran la comprensión de imagen-texto en los últimos años. Además, la comunidad de IA está trabajando activamente hacia la construcción de un modelo de lenguaje grande multimodal unificado que pueda acomodar una amplia variedad de modalidades, incluyendo imagen, texto, audio, video y más, yendo más allá del paradigma tradicional de imagen-texto. Un enfoque común seguido por la comunidad de código abierto para mejorar las capacidades de los modelos de lenguaje grande multimodal es aumentar el tamaño de los modelos de visión fundamentales, integrándolos con modelos de lenguaje grande con miles de millones de parámetros, y utilizando conjuntos de datos multimodales diversos para mejorar el ajuste de instrucciones. Estos desarrollos han destacado la capacidad creciente de los modelos de lenguaje grande multimodal para razonar y procesar múltiples modalidades, lo que destaca la importancia de expandir los datos de instrucción multimodal y la escalabilidad del modelo.
Aunque escalar un modelo es un enfoque probado que produce resultados sustanciales, escalar un modelo es un proceso computacionalmente costoso tanto para el entrenamiento como para los procesos de inferencia.
Para contrarrestar el problema de los altos costos computacionales, la comunidad de código abierto se está moviendo hacia la integración de la arquitectura de Modelo de Mezcla de Expertos en los modelos de lenguaje grande para mejorar la eficiencia tanto del entrenamiento como de la inferencia. A diferencia de los modelos de lenguaje grande multimodal y los modelos de lenguaje grande que emplean todos los parámetros disponibles para procesar cada entrada, lo que resulta en un enfoque computacional denso, la arquitectura de Mezcla de Expertos solo requiere que los usuarios activen un subconjunto de parámetros de expertos para cada entrada. Como resultado, la arquitectura de Mezcla de Expertos surge como una ruta viable para mejorar la eficiencia de los modelos grandes sin una activación extensa de parámetros y altos costos computacionales. Aunque los trabajos existentes han destacado la implementación exitosa y la integración de modelos de Mezcla de Expertos en la construcción de modelos de lenguaje grande de solo texto y texto-imagen, los investigadores aún no han explorado completamente el potencial de desarrollar la arquitectura de Mezcla de Expertos para construir modelos de lenguaje grande multimodal unificados poderosos.
Uni-MoE es un modelo de lenguaje grande multimodal que aprovecha los modelos de Mezcla de Expertos escasos para interpretar y gestionar múltiples modalidades en un intento de explorar la escalabilidad de los modelos de lenguaje grande multimodal unificados con la arquitectura de MoE. Como se demuestra en la siguiente imagen, el marco de Uni-MoE primero obtiene la codificación de diferentes modalidades utilizando codificadores específicos de modalidad, y luego asigna estas codificaciones al espacio de representación de lenguaje de los modelos de lenguaje grande utilizando varios conectores diseñados. Estos conectores contienen un modelo de transformador entrenable con proyecciones lineales subsiguientes para destilar y proyectar las representaciones de salida del codificador congelado. El marco de Uni-MoE luego introduce capas de Mezcla de Expertos escasas dentro del bloque interno del Modelo de Lenguaje Grande denso. Como resultado, cada bloque basado en Mezcla de Expertos presenta una capa de autoatención compartida aplicable a todas las modalidades, un enrutador escaso para asignar la pericia a nivel de token y expertos diversos basados en la red de alimentación hacia adelante. Debido a este enfoque, el marco de Uni-MoE es capaz de comprender múltiples modalidades, incluyendo habla, audio, texto, video, imagen, y solo requiere la activación de parámetros parciales durante la inferencia.

Además, para mejorar la colaboración multi-experto y la generalización, el marco de Uni-MoE implementa una estrategia de entrenamiento de tres etapas. En la primera etapa, el marco utiliza pares de imagen/sonido-lenguaje extensos para entrenar el conector correspondiente debido a la representación de modalidad unificada en el espacio de lenguaje del modelo de lenguaje grande. En segundo lugar, el modelo de Uni-MoE entrena expertos específicos de modalidad empleando conjuntos de datos de modalidad cruzada por separado en un intento de refinar la pericia de cada experto dentro de su dominio respectivo. En la tercera etapa, el marco de Uni-MoE integra estos expertos entrenados en la capa de Mezcla de Expertos del modelo de lenguaje grande y entrena todo el marco de Uni-MoE con datos de instrucción multimodal mixtos. Para reducir aún más el costo de entrenamiento, el marco de Uni-MoE emplea el enfoque de aprendizaje LoRA para ajustar finamente estas capas de autoatención y los expertos pre-ajustados.
Uni-MoE: Metodología y Arquitectura
La motivación básica detrás del marco de Uni-MoE es el alto costo de entrenamiento y inferencia de los modelos de lenguaje grande multimodal, así como la eficiencia de los modelos de Mezcla de Expertos, y explorar la posibilidad de crear un modelo de lenguaje grande multimodal unificado eficiente, poderoso y utilizando la arquitectura de MoE. La siguiente figura presenta una representación de la arquitectura implementada en el marco de Uni-MoE, demostrando el diseño que incluye codificadores individuales para diferentes modalidades, es decir, audio, habla y visuales, junto con sus respectivos conectores de modalidad.

El marco de Uni-MoE luego integra la arquitectura de Mezcla de Expertos con los bloques centrales del modelo de lenguaje grande, un proceso crucial para mejorar la eficiencia general tanto del proceso de entrenamiento como del de inferencia. El marco de Uni-MoE logra esto implementando un mecanismo de enrutamiento escaso. El proceso de entrenamiento general del marco de Uni-MoE se puede dividir en tres fases: alineación de modalidades cruzadas, entrenamiento de expertos específicos de modalidad y ajuste de Uni-MoE utilizando un conjunto diverso de conjuntos de datos de instrucción multimodal. Para transformar eficientemente las entradas de modalidades diversas en un formato lingüístico, el marco de Uni-MoE se basa en LLaVA, un marco de lenguaje visual preentrenado. El modelo base de LLaVA integra CLIP como codificador visual, junto con una capa de proyección lineal que convierte las características de imagen en tokens de imagen suaves. Además, para procesar contenido de video, el marco de Uni-MoE selecciona ocho marcos representativos de cada video y los transforma en tokens de video mediante la agrupación por promedio para agregar su representación basada en imagen o marco. Para tareas de audio, el marco de Uni-MoE despliega dos codificadores, BEATs y el codificador Whisper, para mejorar la extracción de características. El modelo luego destila el vector de características de audio y el habla fija de longitud, y los asigna a tokens de habla y audio suaves, respectivamente, a través de una capa de proyección lineal.
Estrategia de Entrenamiento
El marco de Uni-MoE introduce una estrategia de entrenamiento progresiva para el desarrollo incremental del modelo. La estrategia de entrenamiento progresiva presentada intenta aprovechar las capacidades distintas de varios expertos, mejorar la eficiencia de la colaboración multi-experto y aumentar la generalización general del marco. El proceso de entrenamiento se divide en tres etapas con el intento de actualizar la estructura de MLLM construida sobre la integración de la Mezcla de Expertos.
Etapa 1: Alineación de Modalidades Cruzadas
En la primera etapa, el marco de Uni-MoE intenta establecer la conectividad entre diferentes lenguajes y modalidades. El marco de Uni-MoE logra esto traduciendo los datos de modalidad a tokens suaves mediante la construcción de conectores. El objetivo principal de la primera etapa de entrenamiento es minimizar la pérdida de entropía generativa. Dentro del marco de Uni-MoE, el MLL se optimiza para generar descripciones para entradas en diferentes modalidades, y el modelo solo somete a entrenamiento los conectores, una estrategia que permite al marco de Uni-MoE integrar diferentes modalidades dentro de un marco de lenguaje unificado.

Etapa 2: Entrenamiento de Expertos Específicos de Modalidad
En la segunda etapa, el marco de Uni-MoE se centra en desarrollar expertos de modalidad única entrenando el modelo dedicadamente en datos de modalidad cruzada específicos. El objetivo principal es refinar la pericia de cada experto dentro de su dominio respectivo, lo que mejora el rendimiento general del sistema de Mezcla de Expertos en una amplia variedad de datos multimodales. Además, el marco de Uni-MoE adapta las redes de alimentación hacia adelante para alinearse más estrechamente con las características de la modalidad, manteniendo la pérdida de entropía generativa como métrica de entrenamiento focal.

Etapa 3: Ajuste de Uni-MoE
En la tercera y última etapa, el marco de Uni-MoE integra los pesos ajustados por los expertos durante la Etapa 2 en las capas de Mezcla de Expertos. El marco de Uni-MoE luego ajusta los MLLM utilizando datos de instrucción multimodal mixtos de manera conjunta. Las curvas de pérdida en la siguiente imagen reflejan el progreso del proceso de entrenamiento.

El análisis comparativo entre las configuraciones de la Mezcla de Expertos reveló que los expertos que el modelo refinó durante la segunda etapa de entrenamiento mostraron una mayor estabilidad y lograron una convergencia más rápida en conjuntos de datos multimodales mixtos. Además, en tareas que involucraban datos multimodales complejos, incluyendo texto, imágenes, audio, videos, el marco de Uni-MoE demostró un rendimiento de entrenamiento más consistente y una menor variabilidad de pérdida cuando empleó cuatro expertos en comparación con cuando empleó dos expertos.

Uni-MoE: Experimentos y Resultados
La siguiente tabla resume las especificaciones arquitectónicas del marco de Uni-MoE. El objetivo principal del marco de Uni-MoE, construido sobre la arquitectura de LLaMA-7B, es escalar el tamaño del modelo.

La siguiente tabla resume el diseño y la optimización del marco de Uni-MoE, guiado por tareas de entrenamiento especializadas. Estas tareas son instrumentales para refinar las capacidades de las capas de MLP, aprovechando así su conocimiento especializado para mejorar el rendimiento del modelo. El marco de Uni-MoE emprende ocho tareas de expertos de modalidad única para elucidar los impactos diferenciales de las diversas metodologías de entrenamiento.

El modelo evalúa el rendimiento de varias variantes de modelo en un conjunto diverso de benchmarks que abarca dos tareas de comprensión de video, tres tareas de comprensión de audio y cinco tareas relacionadas con el habla. Primero, el modelo se prueba en su capacidad para comprender tareas de habla-imagen y habla-texto, y los resultados se contienen en la siguiente tabla.

Como se puede observar, los modelos de referencia anteriores entregan resultados inferiores en tareas de comprensión de habla, lo que afecta el rendimiento en tareas de razonamiento de imagen-habla. Los resultados indican que introducir la arquitectura de Mezcla de Expertos puede mejorar la generalización de los MLLM en tareas de razonamiento de audio-imagen no vistas de manera significativa. Los resultados también indican una mejora significativa en la colaboración multi-experto y la generalización.

Pensamientos Finales
En este artículo, hemos hablado sobre Uni-MoE, un modelo de lenguaje grande multimodal unificado con una arquitectura de Mezcla de Expertos que puede manejar una amplia variedad de modalidades y expertos. El marco de Uni-MoE también implementa una arquitectura de Mezcla de Expertos escasa dentro de los modelos de lenguaje grande para intentar hacer que el proceso de entrenamiento y inferencia sea más eficiente mediante la paralelización de expertos y datos. Además, para mejorar la generalización y la colaboración multi-experto, el marco de Uni-MoE presenta una estrategia de entrenamiento progresiva que es una combinación de tres procesos diferentes. En el primero, el marco de Uni-MoE logra la alineación de modalidades cruzadas utilizando varios conectores con diferentes datos de modalidad cruzada. En segundo lugar, el marco de Uni-MoE activa la preferencia de los componentes de expertos mediante el entrenamiento de expertos específicos de modalidad con datos de instrucción de modalidad cruzada. Finalmente, el modelo de Uni-MoE implementa la técnica de aprendizaje de adaptación de rango bajo (LoRA) en datos de instrucción multimodal mixtos para ajustar el modelo.












