Fundamentos de la IA

El auge de los Modelos de Mezcla de Expertos: Cómo los Modelos de Inteligencia Artificial Esparsos Están Dando Forma al Futuro del Aprendizaje Automático

mm
Añade Unite.AI a tus fuentes preferidas en Google

Modelos de Mezcla de Expertos (MoE) están revolucionando la forma en que escalamos la Inteligencia Artificial. Al activar solo un subconjunto de los componentes de un modelo en un momento dado, los MoE ofrecen un enfoque novedoso para gestionar el trade-off entre el tamaño del modelo y la eficiencia computacional. A diferencia de los modelos densos tradicionales que utilizan todos los parámetros para cada entrada, los MoE logran un enorme número de parámetros mientras mantienen los costos de inferencia y entrenamiento manejables. Este avance ha impulsado una oleada de investigación y desarrollo, lo que ha llevado a que tanto gigantes tecnológicos como startups inviertan fuertemente en arquitecturas basadas en MoE.

Cómo funcionan los Modelos de Mezcla de Expertos

En su núcleo, los modelos MoE consisten en múltiples subredes especializadas llamadas “expertos”, supervisadas por un mecanismo de puerta que decide qué expertos deben manejar cada entrada. Por ejemplo, una oración pasada a un modelo de lenguaje puede activar solo dos de ocho expertos, reduciendo drásticamente la carga de trabajo computacional.

Este concepto fue llevado al mainstream con Google’s Switch Transformer y GLaM models (GOOGL ), donde los expertos reemplazaron las capas feed-forward tradicionales en los Transformadores. Switch Transformer, por ejemplo, enruta tokens a un solo experto por capa, mientras que GLaM utiliza enrutamiento top-2 para un mejor rendimiento. Estos diseños demostraron que los MoE podrían igualar o superar a los modelos densos como GPT-3 mientras utilizaban significativamente menos energía y cómputo.

La innovación clave radica en el cálculo condicional. En lugar de activar todo el modelo, los MoE activan solo las partes más relevantes, lo que significa que un modelo con cientos de miles de millones o incluso billones de parámetros puede ejecutarse con la eficiencia de uno que es orders de magnitud más pequeño. Esto permite a los investigadores escalar la capacidad sin aumentos lineales en la computación, una hazaña inalcanzable con los métodos de escalado tradicionales.

Aplicaciones Reales de MoE

Los modelos MoE ya han dejado su huella en varios dominios. Los modelos GLaM y Switch Transformer de Google mostraron resultados de vanguardia en modelado de lenguaje con menores costos de entrenamiento y inferencia. El modelo Z-Code MoE de Microsoft (MSFT ) está operativo en su herramienta de traducción, manejando más de 100 idiomas con mayor precisión y eficiencia que los modelos anteriores. Estos no son solo proyectos de investigación—están alimentando servicios en vivo.

En visión por computadora, la arquitectura V-MoE de Google ha mejorado la precisión de clasificación en benchmarks como ImageNet, y el modelo LIMoE ha demostrado un rendimiento sólido en tareas multimodales que involucran imágenes y texto. La capacidad de los expertos para especializarse—algunos manejando texto, otros imágenes—agrega una nueva capa de capacidad a los sistemas de Inteligencia Artificial.

Los sistemas de recomendación y las plataformas de aprendizaje multi-tarea también se han beneficiado de los MoE. Por ejemplo, el motor de recomendación de YouTube ha empleado una arquitectura similar a MoE para manejar objetivos como el tiempo de visualización y la tasa de clics de manera más eficiente. Al asignar diferentes expertos a diferentes tareas o comportamientos de los usuarios, los MoE ayudan a construir motores de personalización más robustos.

Ventajas y Desafíos

La principal ventaja de los MoE es la eficiencia. Permiten que los modelos masivos se entrenen y desplieguen con significativamente menos cómputo. Por ejemplo, el modelo Mixtral 8×7B de Mistral AI tiene 47B de parámetros totales, pero solo activa 12.9B por token, lo que le da la eficiencia de un modelo de 13B mientras compite con modelos como GPT-3.5 en calidad.

Los MoE también fomentan la especialización. Debido a que los expertos diferentes pueden aprender patrones distintos, el modelo general se vuelve mejor para manejar entradas diversas. Esto es particularmente útil en tareas multilingües, multi-dominio o multimodales donde un modelo denso de un tamaño único puede tener un rendimiento deficiente.

Sin embargo, los MoE vienen con desafíos de ingeniería. El entrenamiento de ellos requiere un equilibrio cuidadoso para asegurarse de que todos los expertos se utilicen de manera efectiva. La sobrecarga de memoria es otra preocupación—mientras que solo una fracción de los parámetros están activos por inferencia, todos deben cargarse en la memoria. La distribución eficiente de la computación a través de GPUs o TPUs no es trivial y ha llevado al desarrollo de marcos especializados como DeepSpeed de Microsoft y GShard de Google.

A pesar de estos obstáculos, los beneficios de rendimiento y costo son lo suficientemente sustanciales como para que los MoE ahora se consideren un componente crítico del diseño de Inteligencia Artificial a gran escala. A medida que más herramientas y infraestructura maduran, estos desafíos se están superando gradualmente.

Cómo se Comparan los MoE con Otros Métodos de Escalado

El escalado denso tradicional aumenta el tamaño del modelo y el cómputo de manera proporcional. Los MoE rompen esta linealidad al aumentar los parámetros totales sin aumentar el cómputo por entrada. Esto permite que los modelos con billones de parámetros se entrenen en el mismo hardware que anteriormente estaba limitado a decenas de miles de millones.

En comparación con el ensamblaje de modelos, que también introduce especialización pero requiere múltiples pasadas hacia adelante completas, los MoE son mucho más eficientes. En lugar de ejecutar varios modelos en paralelo, los MoE ejecutan solo uno—pero con el beneficio de múltiples trayectorias de expertos.

Los MoE también complementan estrategias como el escalado de datos de entrenamiento (por ejemplo, el método Chinchilla). Mientras que Chinchilla enfatiza el uso de más datos con modelos más pequeños, los MoE expanden la capacidad del modelo mientras mantienen el cómputo estable, lo que los hace ideales para casos en los que el cómputo es el cuello de botella.

Finalmente, mientras que técnicas como la poda y la cuantización reducen el tamaño de los modelos después del entrenamiento, los MoE aumentan la capacidad del modelo durante el entrenamiento. No son un reemplazo para la compresión, sino una herramienta ortogonal para el crecimiento eficiente.

Las Empresas que Lideran la Revolución MoE

Gigantes Tecnológicos

Google pionero en mucha de la investigación actual de MoE. Sus modelos Switch Transformer y GLaM escalan a 1.6T y 1.2T parámetros, respectivamente. GLaM igualó el rendimiento de GPT-3 mientras utilizaba solo un tercio de la energía. Google también ha aplicado MoE a la visión (V-MoE) y tareas multimodales (LIMoE), lo que se alinea con su visión más amplia de Pathways para modelos de Inteligencia Artificial universales.

Microsoft ha integrado MoE en producción a través de su modelo Z-Code en Microsoft Translator. También desarrolló DeepSpeed-MoE, que permite un entrenamiento rápido y una inferencia de baja latencia para modelos de billones de parámetros. Sus contribuciones incluyen algoritmos de enrutamiento y la biblioteca Tutel para cálculo eficiente de MoE.

Meta exploró MoE en modelos de lenguaje a gran escala y sistemas de recomendación. Su modelo MoE de 1.1T demostró que podía igualar la calidad de los modelos densos utilizando 4 veces menos cómputo. Aunque los modelos LLaMA son densos, la investigación de Meta en MoE continúa informando a la comunidad en general.

Amazon (AMZN ) soporta MoE a través de su plataforma SageMaker y esfuerzos internos. Facilitaron el entrenamiento del modelo Mixtral de Mistral y se rumora que están utilizando MoE en servicios como Alexa AI. La documentación de AWS promueve activamente MoE para el entrenamiento de modelos a gran escala.

Huawei y BAAI en China también han desarrollado modelos MoE récord como PanGu-Σ (1.085T params). Esto muestra el potencial de MoE en tareas de lenguaje y multimodales y destaca su atractivo global.

Startups y Desafiantes

Mistral AI es el póster child de la innovación MoE en código abierto. Sus modelos Mixtral 8×7B y 8×22B han demostrado que los MoE pueden superar a los modelos densos como LLaMA-2 70B mientras ejecutan a una fracción del costo. Con más de €600M en financiamiento, Mistral está apostando fuerte por las arquitecturas esparsas.

xAI, fundada por Elon Musk, reportedly está explorando MoE en su modelo Grok. Aunque los detalles son limitados, los MoE ofrecen una forma para que las startups como xAI compitan con jugadores más grandes sin necesidad de un cómputo masivo.

Databricks, a través de su adquisición MosaicML, ha lanzado DBRX, un modelo MoE de código abierto diseñado para la eficiencia. También proporcionan infraestructura y recetas para el entrenamiento de MoE, lo que reduce la barrera para la adopción.

Otros jugadores como Hugging Face han integrado el soporte MoE en sus bibliotecas, lo que facilita a los desarrolladores la construcción sobre estos modelos. Incluso si no están construyendo MoE ellos mismos, las plataformas que los habilitan son cruciales para el ecosistema.

Conclusión

Los Modelos de Mezcla de Expertos no son solo una tendencia—representan un cambio fundamental en la forma en que se construyen y escalan los sistemas de Inteligencia Artificial. Al activar selectivamente solo partes de una red, los MoE ofrecen el poder de modelos masivos sin su costo prohibitivo. A medida que la infraestructura de software se pone al día y los algoritmos de enrutamiento mejoran, los MoE están en camino de convertirse en la arquitectura por defecto para la Inteligencia Artificial multi-dominio, multilingüe y multimodal.

Ya sea que seas un investigador, ingeniero o inversor, los MoE ofrecen una visión del futuro donde la Inteligencia Artificial es más poderosa, eficiente y adaptable que nunca antes.

Antoine es un líder visionario y socio fundador de Unite.AI, impulsado por una pasión inquebrantable por dar forma y promover el futuro de la IA y la robótica. Como empresario serial, cree que la IA será tan disruptiva para la sociedad como la electricidad, y a menudo se le escucha hablando con entusiasmo sobre el potencial de las tecnologías disruptivas y la AGI.

Como futurista, está dedicado a explorar cómo estas innovaciones darán forma a nuestro mundo. Además, es el fundador de Securities.io, una plataforma enfocada en invertir en tecnologías de vanguardia que están redefiniendo el futuro y remodelando sectores enteros.