Modelos y plataformas de IA

MoE-LLaVA: Mezcla de Expertos para Modelos de Visión-Lenguaje Grandes

mm
Añade Unite.AI a tus fuentes preferidas en Google

Los avances recientes en los Modelos de Visión-Lenguaje Grandes (LVLMs) han demostrado que escalar estos marcos significativamente mejora el rendimiento en una variedad de tareas downstream. Los LVLMs, incluyendo MiniGPT, LLaMA y otros, han logrado capacidades notables incorporando capas de proyección visual y un codificador de imágenes en su arquitectura. Al implementar estos componentes, los LVLMs mejoran las capacidades de percepción visual de los Modelos de Lenguaje Grandes (LLMs). El rendimiento puede mejorarse aún más aumentando el tamaño del modelo y el número de parámetros, así como expandiendo la escala del conjunto de datos.

Modelos como InternVL han expandido su codificador de imágenes a más de 6 mil millones de parámetros, mientras que otros han extendido la parte posterior de los LVLMs a 13 mil millones de parámetros, logrando un rendimiento superior en una amplia gama de tareas. IDEFICS ha entrenado un LVLM con más de 80 mil millones de parámetros. Estos métodos de escalado han igualado o superado el rendimiento de los LLMs preentrenados en más de 34, 70 o incluso 100 mil millones de parámetros. Sin embargo, la escalada tiene un lado negativo: aumenta significativamente los costos de entrenamiento y inferencia. Esto se debe a que requiere que todos los parámetros estén activos para cada token en cálculo, lo que conduce a necesidades computacionales altas y, en consecuencia, a costos más altos.

Este artículo discute MoE-LLaVA, una arquitectura de modelo de visión-lenguaje grande (LVLM) basada en Mixture of Experts (MoE) que emplea una estrategia de entrenamiento efectiva, MoE-Tuning, para LVLMs. MoE-Tuning aborda innovadoramente la degradación del rendimiento en el aprendizaje de esparsidad multi-modal, lo que resulta en un modelo con un gran número de parámetros pero con costos de entrenamiento y inferencia consistentes. La arquitectura de MoE-LLaVA está diseñada para activar solo los expertos superior-k durante la implementación, manteniendo inactivos al resto.

Exploraremos el marco de MoE-LLaVA, examinando su mecanismo, metodología, arquitectura y cómo se compara con los marcos de generación de imágenes y videos líderes.

MoE-LLaVA: Escalando Modelos de Visión-Lenguaje Grandes de Forma Asequible

Además de aprovechar las capas de proyección visual y los codificadores de imágenes, los Modelos de Visión-Lenguaje Grandes también escalan el tamaño del modelo aumentando el número de parámetros para mejorar el rendimiento del modelo. Algunos ejemplos notables de Modelos de Visión-Lenguaje Grandes que han seguido este enfoque para mejorar su rendimiento son MiniGPT-4, InternGPT, InternVL y otros. En aplicaciones del mundo real, escalar un Modelo de Lenguaje Grande o un Modelo de Visión-Lenguaje Grande con datos de entrenamiento de alta calidad a menudo se convierte en una necesidad para mejorar el rendimiento del modelo. Aunque escalar el tamaño del modelo mejora el rendimiento, también aumenta los costos computacionales de entrenamiento y despliegue del modelo, y aumenta las complicaciones y la eficiencia de desplegar el modelo en dispositivos paralelos simultáneamente. Una razón importante detrás del aumento de los costos de entrenamiento y inferencia, junto con los requisitos computacionales, es que cada token en el marco requiere cálculo con cada parámetro individual dentro del modelo, conocido como el modelo denso.

Por otro lado, los modelos MoE o Mixture of Expert esparsos han demostrado una escalada efectiva de los marcos procesando datos con la ayuda de parámetros activados fijos, un enfoque que ha sido ampliamente adoptado en el campo del Procesamiento de Lenguaje Natural. Sin embargo, utilizar Mixture of Expert para entrenar directamente Modelos de Visión-Lenguaje Grandes esparsos es desafiante, ya que convertir LLMs a LVLMs y esparsificar el modelo al mismo tiempo resulta en una degradación significativa del rendimiento. Para implementar Modelos de Mezcla para escalar LLMs y LVLMs, es esencial inicializar primero el LVLM para la esparsificación. Para lograr esto, el marco de MoE-LLaVA introduce MoE-Tuning, una estrategia de entrenamiento de tres fases simple pero efectiva.

Como se muestra en la figura anterior, el proceso MoE-Tuning primero entrena una MLP o una Red Neuronal Multicapa que adapta los tokens visuales a un Modelo de Lenguaje Grande en la primera etapa. El marco luego entrena todos los parámetros de la LLM para preempoderar el Modelo de Visión-Lenguaje Grande con capacidades de comprensión multi-modal general. Finalmente, en la tercera etapa, el marco replica la Red Neuronal de Avance o Feed Forward Network como los pesos de inicialización para los expertos, y entrena solo las capas de Mixture of Expert. En general, el proceso de entrenamiento ayuda en la transición gradual del modelo esparsos desde una inicialización de LVLM hasta un modelo de mezcla de expertos esparsos.

Con el proceso de entrenamiento cubierto, analicemos MoE-LLaVA, una base para Modelos de Visión-Lenguaje Grandes con Modelos de Mezcla de Expertos que incorpora enrutadores y modelos MoE aprendibles. En su núcleo, el modelo MoE-LLaVA consiste en múltiples caminos esparsos, y el marco utiliza estos caminos para enviar cada token a diferentes expertos a través del enrutador aprendible. Los tokens luego se procesan colectivamente por los expertos activados, manteniendo los caminos inactivos en silencio. El marco luego apila las capas de codificador de Mixture of Expert de forma iterativa para proporcionar un camino esparsos hacia un LVLM más grande y poderoso.

Gracias al enfoque implementado por el marco de MoE-LLaVA, es capaz de superar a modelos con un número similar de parámetros activados, y superarlos por una gran diferencia en la benchmark de alucinación de objetos POPE, a pesar de tener solo 2.2 mil millones de parámetros. Además, el marco de MoE-LLaVA con 2.2 mil millones de parámetros es capaz de lograr un rendimiento comparable al marco InternVL-Chat-19B con casi 8 veces el número de parámetros activados.

Modelos de Lenguaje Grandes poderosos con fuertes capacidades de generalización y seguimiento de instrucciones han sido implementados en Modelos de Visión-Lenguaje Grandes. Los primeros LLMs como BLIP codificaron señales visuales en una secuencia de tokens visuales, permitiéndoles adaptar la visión a los LLMs con éxito utilizando múltiples capas de proyección. Al mismo tiempo, trabajos recientes se centran en mejorar el rendimiento del modelo implementando métodos como expandir el conjunto de datos de afinación de instrucciones, aumentar la resolución de la imagen, optimizar las estrategias de entrenamiento, alinear la entrada, mejorar los codificadores de imágenes y mucho más. Estos enfoques han ayudado a empoderar a los LVLMs con capacidades de comprensión visual poderosas expandiendo el conjunto de datos de afinación de instrucciones visuales y la escala del modelo. Además, algunos LVLMs también poseen capacidades de comprensión de imágenes de grano fino, como comprensión de regiones y multi-regiones, junto con capacidades de anclaje de píxeles. Sin embargo, el costo computacional acompañado de escalar los datos visuales densos y los modelos es a menudo muy alto, lo que lo hace desafiante. Por otro lado, el marco de MoE-LLaVA tiene como objetivo hacer que la investigación de LVLMs sea más asequible aprovechando las capacidades de los modelos MoE.

MoE-LLaVA: Método y Arquitectura

En su núcleo, el marco de MoE-LLaVA consiste en una capa de proyección visual (Red Neuronal Multicapa), un codificador de visión, bloques MoE, múltiples bloques LLM apilados y una capa de incrustación de palabras.

Arquitectura

La siguiente tabla resume las configuraciones detalladas del marco de MoE-LLaVA.

Para una imagen RGB dada, el codificador de visión procesa las imágenes para obtener una secuencia de tokens visuales con una capa de proyección visual que mapea la secuencia de tokens visuales a las imágenes de entrada. Las entradas de texto se procesan por la capa de incrustación de palabras que luego las proyecta para obtener los tokens de secuencia. Al mismo tiempo, el marco de MoE-LLaVA vincula los tokens de texto y visuales, y los alimenta al LLM. Sin embargo, el marco solo entrena la capa de proyección visual con el LLM que consiste en Redes Neuronales de Avance o Feedforward y Capas de Atención de Autoatención Multicabeza. Finalmente, el marco aplica conexiones residuales y normalización de capas a cada bloque.

Continuando, el marco de MoE-LLaVA replica las Redes Neuronales de Avance o Feedforward desde la segunda etapa para formar un conjunto de expertos como el paso de inicialización. El enrutador, siendo una capa lineal, predice la probabilidad de que cada token se asigne a cada experto. Cada token se procesa por los expertos superior-k con la suma ponderada calculada en función del resultado softmax de las probabilidades. Una vez que se activan los expertos superior-k, el modelo cierra los expertos restantes, un enfoque que equipa al marco de MoE-LLaVA con caminos esparsos infinitamente posibles, equipando así al modelo con una amplia gama de capacidades.

MoE-Tuning

MoE-Tuning es una estrategia de entrenamiento de tres fases simple pero efectiva que primero entrena una MLP o una Red Neuronal Multicapa que adapta los tokens visuales a un Modelo de Lenguaje Grande en la primera etapa. El marco luego entrena todos los parámetros de la LLM para preempoderar el Modelo de Visión-Lenguaje Grande con capacidades de comprensión multi-modal general. Finalmente, en la tercera etapa, el marco replica la Red Neuronal de Avance o Feed Forward Network como los pesos de inicialización para los expertos, y entrena solo las capas de Mixture of Expert.

Etapa 1

En la primera etapa, el objetivo principal es adaptar los tokens de imagen al modelo de lenguaje grande que permite que el LLM comprenda las instancias en la imagen. El marco de MoE-LLaVA emplea una Red Neuronal Multicapa para proyectar los tokens de imagen en el dominio de entrada del modelo de lenguaje grande, y trata los parches de imagen como tokens de texto pseudo. En esta etapa, el marco de MoE-LLaVA entrena el LLM para describir las imágenes, y no aplica las capas MoE al LLM durante esta etapa.

Etapa 2

En la segunda etapa, el marco de MoE-LLaVA intenta mejorar las capacidades y la controlabilidad del marco ajustando el modelo con datos de instrucción multi-modal. El marco de MoE-LLaVA logra esto ajustando el LLM para convertirse en un LVLM con capacidades de comprensión multi-modal. El marco emplea instrucciones más complejas, incluyendo tareas de reconocimiento de texto y razonamiento lógico de imágenes que requieren que el modelo posea capacidades multi-modales más fuertes. Tradicionalmente, el proceso de entrenamiento para modelos densos se considera completo en este paso. Sin embargo, el marco de MoE-LLaVA encontró desafíos al transformar el LLM en un LVLM al mismo tiempo que esparsificaba el LVLM. Para contrarrestar este desafío, el marco utiliza los pesos de la etapa como inicialización para la siguiente etapa en un intento de aliviar la dificultad de aprendizaje del modelo esparsos.

Etapa 3

En la tercera etapa, el modelo replica la Red Neuronal de Avance o Feedforward varias veces para inicializar los expertos como un procedimiento de inicialización. El marco luego alimenta los tokens de texto y visuales a las capas de Mixture of Expert, tras lo cual el enrutador calcula los pesos de coincidencia entre expertos y cada token. Cada token se procesa por los expertos superior-k con la salida agregada calculada por suma ponderada en función de los pesos del enrutador. Una vez que se activan los expertos superior-k, el modelo cierra los expertos restantes, un enfoque que equipa al marco de MoE-LLaVA con caminos esparsos infinitamente posibles, equipando así al modelo con una amplia gama de capacidades.

MoE-LLaVA: Resultados y Experimentos

El marco de MoE-LLaVA adopta CLIP-Large como el codificador de visión con la Red Neuronal Multicapa que consiste en dos capas con una capa de activación GELU que separa las dos. Por defecto, el marco emplea un reemplazo alternado de las Redes Neuronales de Avance con las capas de Mixture of Expert, lo que significa que las capas de Mixture of Expert comprenden el 50% del número total de capas. La siguiente tabla contiene los diferentes conjuntos de datos junto con su tamaño de muestra utilizados para entrenar y evaluar el marco de MoE-LLaVA.

Preguntas y Respuestas de Imágenes de Zero-Shot

La siguiente figura demuestra que MoE-LLaVA es un modelo esparsos con un enrutador suave basado en LVLM. El marco se evalúa en 5 benchmarks de preguntas y respuestas de imágenes, y como se puede observar, el marco de MoE-LLaVA demuestra capacidades notables de comprensión de imágenes, y entrega un rendimiento comparable al marco LLaVA 1.5 en cinco benchmarks diferentes.

Evaluación de Alucinación de Objetos

Para evaluar la alucinación de objetos, el marco de MoE-LLaVA adopta la pipeline de evaluación POPE, un método de consulta basado en votación, y los resultados se demuestran en la siguiente tabla. Como se puede observar, de todos los marcos, el MoE-LLaVA entrega los resultados más fuertes, lo que indica la capacidad del marco para generar objetos consistentes con la imagen de entrada. Además, es digno de destacar que el marco de MoE-LLaVA equilibra bien la relación de sí, lo que indica la capacidad del modelo esparsos para proporcionar retroalimentación precisa para la pregunta dada.

La siguiente imagen contiene la distribución de cargas de expertos, donde las líneas discontinuas representan una distribución equilibrada de tokens entre las modalidades o expertos. La primera figura ilustra la carga de trabajo dentro de los expertos, mientras que las imágenes restantes demuestran el rendimiento de los expertos hacia diferentes modalidades.

Además, la siguiente figura demuestra la distribución de modalidades a través de diferentes expertos.

Pensamientos Finales

En este artículo, hemos hablado sobre MoE-LLaVA, una base para Modelos de Visión-Lenguaje Grandes con Modelos de Mezcla de Expertos que incorpora enrutadores y modelos MoE aprendibles. En su núcleo, el modelo MoE-LLaVA consiste en múltiples caminos esparsos, y el marco utiliza estos caminos para enviar cada token a diferentes expertos a través del enrutador aprendible. Los tokens se procesan colectivamente por los expertos activados, manteniendo los caminos inactivos en silencio. El marco luego apila las capas de codificador de Mixture of Expert de forma iterativa para proporcionar un camino esparsos hacia un LVLM más grande y poderoso. La estrategia MoE-Tuning aborda innovadoramente la degradación del rendimiento en el aprendizaje de esparsidad multi-modal, lo que resulta en un modelo con un gran número de parámetros pero con costos de entrenamiento y inferencia consistentes. La arquitectura del marco de MoE-LLaVA ha sido diseñada para activar solo los expertos superior-k durante la implementación, manteniendo inactivos al resto.

Kunal Kejriwal es un ingeniero de backend especializado en Python, PostgreSQL, Redis e infraestructura en la nube en GCP y AWS. Con tres años de experiencia construyendo y escalando sistemas de producción, escribe sobre infraestructura de IA, sistemas distribuidos y la arquitectura detrás del despliegue de cargas de trabajo de aprendizaje automático.