Modelos y plataformas de IA

El modelo MoE 8x7B más reciente de Mistral AI

mm
Añade Unite.AI a tus fuentes preferidas en Google

Mistral AI, una startup de modelos de código abierto con sede en París, ha desafiado las normas al lanzar su modelo de lenguaje grande (LLM) más reciente, MoE 8x7B, a través de un simple enlace de torrent. Esto contrasta con el enfoque tradicional de Google (GOOGL ) con su lanzamiento de Gemini, lo que ha generado conversaciones y entusiasmo en la comunidad de inteligencia artificial.

Mistral AI siempre ha tenido un enfoque inconvencional para sus lanzamientos. A menudo, prescinden de los acompañamientos habituales de artículos, blogs o comunicados de prensa, y su estrategia ha sido únicamente efectiva para captar la atención de la comunidad de inteligencia artificial.

Recientemente, la empresa logró una valoración notable de $2 mil millones después de una ronda de financiación liderada por Andreessen Horowitz. Esta ronda de financiación fue histórica, estableciendo un récord con una ronda de semilla de $118 millones, la más grande en la historia de Europa. Más allá de los éxitos en la financiación, Mistral AI ha participado activamente en las discusiones en torno a la Ley de Inteligencia Artificial de la UE, abogando por una regulación reducida en la inteligencia artificial de código abierto.

Por qué MoE 8x7B está llamando la atención

Descrito como un “GPT-4 reducido”, MoE 8x7B utiliza un marco de Mixture of Experts (MoE) con ocho expertos. Cada experto tiene 111B parámetros, junto con 55B parámetros de atención compartida, para un total de 166B parámetros por modelo. Esta elección de diseño es significativa, ya que permite que solo dos expertos participen en la inferencia de cada token, lo que destaca un cambio hacia un procesamiento de inteligencia artificial más eficiente y enfocado.

Uno de los aspectos destacados de MoE es su capacidad para manejar un contexto extenso de 32.000 tokens, lo que proporciona un amplio alcance para manejar tareas complejas. Las capacidades multilingües del modelo incluyen un soporte robusto para inglés, francés, italiano, alemán y español, lo que atiende a una comunidad de desarrolladores globales.

El preentrenamiento de MoE implica datos obtenidos de la web abierta, con un enfoque de entrenamiento simultáneo para ambos expertos y enrutadores. Este método garantiza que el modelo no solo sea vasto en su espacio de parámetros, sino también finamente ajustado a las sutilezas de los vastos datos a los que ha sido expuesto.

MoE 8x7B logra una puntuación impresionante

MoE 8x7B logra una puntuación impresionante

MoE 8x7B supera a LLaMA 2 70B y rivaliza con GPT-3.5, especialmente notable en la tarea MBPP con una tasa de éxito del 60,7%, significativamente mayor que la de sus contrapartes. Incluso en la rigurosa tarea MT-Bench diseñada para modelos de seguimiento de instrucciones, MoE 8x7B logra una puntuación impresionante, casi igualando a GPT-3.5

Entendiendo el marco de Mixture of Experts (MoE)

El modelo Mixture of Experts (MoE), aunque ha ganado atención recientemente debido a su incorporación en modelos de lenguaje de estado del arte como MoE 8x7B de Mistral AI, en realidad se basa en conceptos fundamentales que datan de varios años. Revisemos los orígenes de esta idea a través de papers de investigación seminales.

El concepto de MoE

Mixture of Experts (MoE) representa un cambio de paradigma en la arquitectura de las redes neuronales. A diferencia de los modelos tradicionales que utilizan una red homogénea para procesar todos los tipos de datos, MoE adopta un enfoque más especializado y modular. Consiste en múltiples redes de “expertos”, cada una diseñada para manejar tipos de datos o tareas específicas, supervisadas por una red de “puertas” que dirige dinámicamente los datos de entrada al experto más adecuado.

Una capa de Mixture of Experts (MoE) incrustada en un modelo de lenguaje recurrente

Una capa de Mixture of Experts (MoE) incrustada en un modelo de lenguaje recurrente (Fuente)

 

La imagen anterior presenta una vista de alto nivel de una capa MoE incrustada en un modelo de lenguaje. En esencia, la capa MoE se compone de múltiples subredes feed-forward, denominadas “expertos”, cada una con el potencial de especializarse en el procesamiento de diferentes aspectos de los datos. Una red de puertas, resaltada en el diagrama, determina qué combinación de estos expertos se activa para una entrada determinada. Esta activación condicional permite que la red aumente significativamente su capacidad sin un aumento correspondiente en la demanda computacional.

Funcionalidad de la capa MoE

En la práctica, la red de puertas evalúa la entrada (denotada como G(x) en el diagrama) y selecciona un conjunto disperso de expertos para procesarla. Esta selección se modula por las salidas de la red de puertas, determinando efectivamente la “votación” o contribución de cada experto a la salida final. Por ejemplo, como se muestra en el diagrama, solo dos expertos pueden ser elegidos para calcular la salida para cada token de entrada específico, lo que hace que el proceso sea eficiente al concentrar los recursos computacionales donde son más necesarios.

 

Codificador de Transformer con capas MoE (Fuente)

La segunda ilustración anterior contrasta un codificador de Transformer tradicional con uno aumentado con una capa MoE. La arquitectura de Transformer, ampliamente conocida por su eficacia en tareas relacionadas con el lenguaje, tradicionalmente consiste en capas de autoatención y feed-forward apiladas en secuencia. La introducción de capas MoE reemplaza algunas de estas capas feed-forward, lo que permite que el modelo se escalable en términos de capacidad de manera más efectiva.

En el modelo aumentado, las capas MoE se dividen en múltiples dispositivos, lo que muestra un enfoque de paralelismo de modelo. Esto es crucial al escalar a modelos muy grandes, ya que permite la distribución de la carga computacional y los requisitos de memoria a lo largo de un clúster de dispositivos, como GPU o TPU. Esta división es esencial para entrenar y desplegar modelos con miles de millones de parámetros de manera eficiente, como se evidencia en el entrenamiento de modelos con cientos de miles de millones a más de un billón de parámetros en clústeres de cómputo a gran escala.

El enfoque de MoE disperso con ajuste de instrucciones en LLM

El artículo titulado “Mixture of Experts (MoE) disperso para modelado de lenguaje escalable” discute un enfoque innovador para mejorar los modelos de lenguaje grande (LLM) integrando la arquitectura de Mixture of Experts con técnicas de ajuste de instrucciones.

Destaca un desafío común en el que los modelos MoE tienen un rendimiento inferior en comparación con los modelos densos de igual capacidad computacional cuando se ajustan para tareas específicas debido a discrepancias entre el preentrenamiento general y el ajuste específico de la tarea.

El ajuste de instrucciones es una metodología de entrenamiento en la que los modelos se perfeccionan para seguir mejor las instrucciones del lenguaje natural, lo que mejora efectivamente su rendimiento en tareas. El artículo sugiere que los modelos MoE exhiben una mejora notable cuando se combinan con el ajuste de instrucciones, más que sus contrapartes densas. Esta técnica alinea las representaciones preentrenadas del modelo para seguir instrucciones de manera más efectiva, lo que conduce a mejoras significativas en el rendimiento.

Los investigadores realizaron estudios en tres configuraciones experimentales, revelando que los modelos MoE inicialmente tienen un rendimiento inferior en el ajuste específico de la tarea. Sin embargo, cuando se aplica el ajuste de instrucciones, los modelos MoE destacan, particularmente cuando se suplementan con un ajuste específico de la tarea. Esto sugiere que el ajuste de instrucciones es un paso vital para que los modelos MoE superen a los modelos densos en tareas posteriores.

El efecto del ajuste de instrucciones en MoE

El efecto del ajuste de instrucciones en MoE

También introduce FLAN-MOE32B, un modelo que demuestra la aplicación exitosa de estos conceptos. Notablemente, supera a FLAN-PALM62B, un modelo denso, en tareas de referencia mientras utiliza solo un tercio de los recursos computacionales. Esto muestra el potencial de los modelos MoE dispersos combinados con el ajuste de instrucciones para establecer nuevos estándares para la eficiencia y el rendimiento de los LLM.

Implementación de Mixture of Experts en escenarios del mundo real

La versatilidad de los modelos MoE los hace ideales para una variedad de aplicaciones:

  • Procesamiento de lenguaje natural (NLP): Los modelos MoE pueden manejar las sutilezas y complejidades del lenguaje humano de manera más efectiva, lo que los hace ideales para tareas avanzadas de NLP.
  • Procesamiento de imágenes y video: En tareas que requieren un procesamiento de alta resolución, MoE puede manejar diferentes aspectos de las imágenes o cuadros de video, lo que mejora tanto la calidad como la velocidad de procesamiento.
  • Soluciones de inteligencia artificial personalizadas: Las empresas y los investigadores pueden adaptar los modelos MoE a tareas específicas, lo que conduce a soluciones de inteligencia artificial más dirigidas y efectivas.

Desafíos y consideraciones

Aunque los modelos MoE ofrecen numerosos beneficios, también presentan desafíos únicos:

  • Complejidad en el entrenamiento y ajuste: La naturaleza distribuida de los modelos MoE puede complicar el proceso de entrenamiento, requiriendo un equilibrio y ajuste cuidadoso de los expertos y la red de puertas.
  • Administración de recursos: La gestión eficiente de los recursos computacionales a través de múltiples expertos es crucial para maximizar los beneficios de los modelos MoE.

Incorporar capas MoE en las redes neuronales, especialmente en el dominio de los modelos de lenguaje, ofrece una vía hacia la escalabilidad de modelos a tamaños previamente inalcanzables debido a las limitaciones computacionales. El cálculo condicional habilitado por las capas MoE permite una distribución más eficiente de los recursos computacionales, lo que hace posible entrenar modelos más grandes y capaces. A medida que seguimos exigiendo más a nuestros sistemas de inteligencia artificial, arquitecturas como la de Transformer equipada con MoE probablemente se convertirán en el estándar para el manejo de tareas complejas y a gran escala en diversos dominios.

He dedicado los últimos cinco años sumergiéndome en el fascinante mundo de Machine Learning y Deep Learning. Mi pasión y experiencia me han llevado a contribuir a más de 50 proyectos de ingeniería de software diversos, con un enfoque particular en AI/ML. Mi curiosidad en curso también me ha llevado hacia el Procesamiento de Lenguaje Natural, un campo que estoy ansioso por explorar más a fondo.