Modelos e plataformas de IA
Uni-MoE: Escalando LLMs Multimodais Unificados com Mixture of Experts
Os recentes avanços na arquitetura e no desempenho dos Modelos de Linguagem Multimodais Grandes (MLLMs) destacaram a importância de dados escaláveis e modelos para melhorar o desempenho. Embora essa abordagem melhore o desempenho, incurre em custos computacionais substanciais que limitam a praticidade e a usabilidade dessas abordagens. Ao longo dos anos, os modelos de Mixture of Experts (MoE) surgiram como uma abordagem alternativa bem-sucedida para escalar modelos de imagem-texto e linguagem grandes de forma eficiente, pois os modelos de Mixture of Experts têm custos computacionais significativamente menores e um desempenho forte. No entanto, apesar de suas vantagens, os modelos de Mixture of Experts não são a abordagem ideal para escalar modelos de linguagem grandes, pois geralmente envolvem menos especialistas e modalidades limitadas, limitando as aplicações.
Para contrariar os obstáculos encontrados pelas abordagens atuais e escalar modelos de linguagem grandes de forma eficiente, neste artigo, vamos falar sobre o Uni-MoE, um modelo de linguagem multimodal unificado com arquitetura de Mixture of Experts que é capaz de lidar com uma ampla gama de modalidades e especialistas. O framework Uni-MoE também implementa uma arquitetura de Mixture of Experts esparsa dentro dos modelos de linguagem grandes em uma tentativa de tornar o treinamento e o processo de inferência mais eficientes, empregando paralelismo de modelo de especialista e paralelismo de dados. Além disso, para melhorar a generalização e a colaboração entre especialistas, o framework Uni-MoE apresenta uma estratégia de treinamento progressiva que é uma combinação de três processos diferentes. No primeiro, o framework Uni-MoE alcança a alinhamento entre modalidades usando conectores com diferentes dados de modalidade cruzada. Em segundo lugar, o framework Uni-MoE ativa a preferência dos componentes de especialista treinando especialistas específicos de modalidade com dados de instrução de modalidade cruzada. Finalmente, o modelo Uni-MoE implementa a técnica de aprendizado de LoRA ou Adaptação de Baixo Rango em dados de instrução multimodais mistos para ajustar o modelo. Quando o framework Uni-MoE ajustado por instrução foi avaliado em um conjunto abrangente de conjuntos de dados multimodais, os resultados experimentais extensivos destacaram a principal vantagem do framework Uni-MoE na redução do viés de desempenho no tratamento de conjuntos de dados multimodais mistos de forma significativa. Os resultados também indicaram uma melhoria significativa na colaboração entre especialistas e na generalização.
Este artigo visa cobrir o framework Uni-MoE em profundidade e exploramos o mecanismo, a metodologia, a arquitetura do framework, juntamente com sua comparação com frameworks de estado da arte. Então, vamos começar.
Uni-MoE: Escalando LLMs Multimodais Unificados
A chegada de modelos de linguagem multimodais de código aberto, incluindo LLama e InstantBlip, destacou o sucesso notável e o avanço em tarefas que envolvem a compreensão de imagem-texto nos últimos anos. Além disso, a comunidade de IA está trabalhando ativamente para construir um modelo de linguagem multimodal unificado que possa acomodar uma ampla gama de modalidades, incluindo imagem, texto, áudio, vídeo e mais, indo além do paradigma tradicional de imagem-texto. Uma abordagem comum seguida pela comunidade de código aberto para aumentar as capacidades dos modelos de linguagem multimodais é aumentar o tamanho dos modelos de visão e integrá-los com modelos de linguagem grandes com bilhões de parâmetros, e usando conjuntos de dados multimodais diversificados para melhorar o ajuste de instrução. Esses desenvolvimentos destacaram a capacidade crescente dos modelos de linguagem multimodais de raciocinar e processar múltiplas modalidades, mostrando a importância de expandir os dados de instrução multimodais e a escalabilidade do modelo.
Embora escalar um modelo seja uma abordagem testada e comprovada que entrega resultados substanciais, escalar um modelo é um processo computacionalmente caro para ambos os processos de treinamento e inferência.
Para contrariar o problema dos altos custos computacionais, a comunidade de código aberto está se movendo em direção à integração da arquitetura de Mixture of Experts (MoE) nos modelos de linguagem grandes para melhorar a eficiência tanto do treinamento quanto da inferência. Em contraste com os modelos de linguagem multimodais e os modelos de linguagem grandes que empregam todos os parâmetros disponíveis para processar cada entrada, resultando em uma abordagem computacional densa, a arquitetura de Mixture of Experts exige apenas que os usuários atuem um subconjunto de parâmetros de especialista para cada entrada. Como resultado, a abordagem de Mixture of Experts surge como uma via viável para melhorar a eficiência dos modelos grandes sem ativação extensiva de parâmetros e altos custos computacionais. Embora trabalhos existentes tenham destacado a implementação bem-sucedida e a integração de modelos de Mixture of Experts na construção de modelos de linguagem grandes de texto e imagem, os pesquisadores ainda não exploraram completamente o potencial de desenvolver a arquitetura de Mixture of Experts para construir modelos de linguagem multimodais unificados poderosos.
O Uni-MoE é um modelo de linguagem multimodal que aproveita modelos de Mixture of Experts esparsos para interpretar e gerenciar múltiplas modalidades em uma tentativa de explorar a escalabilidade de modelos de linguagem multimodais unificados com a arquitetura de MoE. Como demonstrado na imagem a seguir, o framework Uni-MoE primeiro obtém a codificação de diferentes modalidades usando codificadores específicos de modalidade e, em seguida, mapeia essas codificações no espaço de representação de linguagem dos modelos de linguagem grandes usando conectores projetados. Esses conectores contêm um modelo de transformador treinável com projeções lineares subsequentes para destilar e projetar as representações de saída do codificador congelado. O framework Uni-MoE, em seguida, introduz camadas de Mixture of Experts esparsas dentro do bloco interno do modelo de linguagem grande denso. Como resultado, cada bloco baseado em Mixture of Experts apresenta uma camada de auto-atendimento compartilhada aplicável a todas as modalidades, um roteador esparsso para alocação de especialização em nível de token e especialistas diversificados com base na rede feedforward. Devido a essa abordagem, o framework Uni-MoE é capaz de entender múltiplas modalidades, incluindo fala, áudio, texto, vídeo, imagem e apenas requer a ativação parcial de parâmetros durante a inferência.

Além disso, para melhorar a colaboração entre especialistas e a generalização, o framework Uni-MoE implementa uma estratégia de treinamento em três etapas. Na primeira etapa, o framework usa pares de imagem/áudio-linguagem extensivos para treinar o conector correspondente devido à representação unificada de modalidade no espaço de linguagem do modelo de linguagem grande. Em segundo lugar, o modelo Uni-MoE treina especialistas específicos de modalidade empregando conjuntos de dados de modalidade cruzada separadamente em uma tentativa de refinar a proficiência de cada especialista dentro de seu domínio respectivo. Na terceira etapa, o framework Uni-MoE integra esses especialistas treinados na camada de Mixture of Experts do modelo de linguagem grande e treina o framework Uni-MoE completo com dados de instrução multimodais mistos. Para reduzir o custo de treinamento ainda mais, o framework Uni-MoE emprega a abordagem de aprendizado LoRA para ajustar finamente essas camadas de auto-atendimento e os especialistas pré-treinados.
Uni-MoE: Metodologia e Arquitetura
A motivação básica por trás do framework Uni-MoE é o alto custo de treinamento e inferência de escalabilidade de modelos de linguagem multimodais, juntamente com a eficiência dos modelos de Mixture of Experts, e explorar a possibilidade de criar um modelo de linguagem multimodal unificado eficiente, poderoso e utilizando a arquitetura de MoE. A figura a seguir apresenta uma representação da arquitetura implementada no framework Uni-MoE, demonstrando o design que inclui codificadores individuais para diferentes modalidades, ou seja, áudio, fala e visuais, juntamente com seus respectivos conectores de modalidade.

O framework Uni-MoE, em seguida, integra a arquitetura de Mixture of Experts com os blocos centrais do modelo de linguagem grande, um processo crucial para aumentar a eficiência geral tanto do treinamento quanto do processo de inferência. O framework Uni-MoE alcança isso implementando um mecanismo de roteamento esparsso. O processo de treinamento geral do framework Uni-MoE pode ser dividido em três fases: alinhamento entre modalidades, treinamento de especialistas específicos de modalidade e ajuste do Uni-MoE usando um conjunto diversificado de conjuntos de dados de instrução multimodais. Para transformar eficientemente entradas modais diversificadas em um formato linguístico, o framework Uni-MoE é construído sobre o LLaVA, um framework de linguagem visual pré-treinado. O modelo base LLaVA integra o CLIP como seu codificador visual, juntamente com uma camada de projeção linear que converte recursos de imagem em tokens de imagem suaves. Além disso, para processar conteúdo de vídeo, o framework Uni-MoE seleciona oito frames representativos de cada vídeo e os transforma em tokens de vídeo por meio de pooling médio para agregar sua representação baseada em imagem ou frame. Para tarefas de áudio, o framework Uni-MoE emprega dois codificadores, BEATs e o codificador Whisper, para melhorar a extração de recursos. O modelo, em seguida, destila vetores de recursos de áudio e fala de comprimento fixo e os mapeia em tokens de fala e áudio suaves, respectivamente, por meio de uma camada de projeção linear.
Estratégia de Treinamento
O framework Uni-MoE introduz uma estratégia de treinamento progressiva para o desenvolvimento incremental do modelo. A estratégia de treinamento progressiva introduzida tenta aproveitar as capacidades distintas de vários especialistas, melhorar a eficiência da colaboração entre especialistas e aumentar a generalização geral do framework. O processo de treinamento é dividido em três etapas com a tentativa de concretizar a estrutura de MLLM construída sobre a integração de Mixture of Experts.
Etapa 1: Alinhamento entre Modalidades
Na primeira etapa, o framework Uni-MoE tenta estabelecer conectividade entre diferentes linguagens e modalidades. O framework Uni-MoE alcança isso traduzindo dados modais em tokens suaves construindo conectores. O objetivo principal da primeira etapa de treinamento é minimizar a perda de entropia geradora.Dentro do framework Uni-MoE, o LLM é otimizado para gerar descrições para entradas em diferentes modalidades, e o modelo submete apenas os conectores ao treinamento, uma estratégia que permite que o framework Uni-MoE integre diferentes modalidades dentro de um framework de linguagem unificado.

Etapa 2: Treinamento de Especialistas Específicos de Modalidade
Na segunda etapa, o framework Uni-MoE se concentra em desenvolver especialistas de modalidade única treinando o modelo dedicadamente em dados de modalidade cruzada específicos. O objetivo principal é refinar a proficiência de cada especialista dentro de seu domínio respectivo, melhorando assim o desempenho geral do sistema de Mixture of Experts em uma ampla gama de dados multimodais. Além disso, o framework Uni-MoE adapta as redes feedforward para alinhar mais de perto com as características da modalidade, mantendo a perda de entropia geradora como métrica de treinamento focal.

Etapa 3: Ajuste do Uni-MoE
Na terceira e última etapa, o framework Uni-MoE integra os pesos ajustados pelos especialistas durante a Etapa 2 nas camadas de Mixture of Experts. O framework Uni-MoE, em seguida, ajusta os MLLMs utilizando dados de instrução multimodais mistos em conjunto. As curvas de perda na imagem a seguir refletem o progresso do processo de treinamento.

A análise comparativa entre as configurações de Mixture of Experts revelou que os especialistas que o modelo refinou durante a segunda etapa de treinamento exibiram estabilidade melhorada e alcançaram convergência mais rápida em conjuntos de dados mistos. Além disso, em tarefas que envolviam dados multimodais complexos, incluindo texto, imagens, áudio e vídeos, o framework Uni-MoE demonstrou desempenho de treinamento mais consistente e variabilidade de perda reduzida quando empregou quatro especialistas em comparação com quando empregou dois especialistas.

Uni-MoE: Experimentos e Resultados
A tabela a seguir resume as especificações arquiteturais do framework Uni-MoE. O objetivo principal do framework Uni-MoE, construído sobre a arquitetura LLaMA-7B, é escalar o tamanho do modelo.

A tabela a seguir resume o design e a otimização do framework Uni-MoE, guiados por tarefas de treinamento especializadas. Essas tarefas são instrumentais para refinar as capacidades das camadas MLP, aproveitando assim seu conhecimento especializado para melhorar o desempenho do modelo. O framework Uni-MoE empreende oito tarefas de especialista de modalidade única para elucidar os impactos diferenciais de várias metodologias de treinamento.

O modelo avalia o desempenho de várias variantes de modelo em um conjunto diversificado de benchmarks que abrange duas tarefas de compreensão de vídeo, três tarefas de compreensão de áudio e cinco tarefas relacionadas à fala. Primeiramente, o modelo é testado em sua capacidade de entender tarefas de imagem-fala e texto-fala, e os resultados estão contidos na tabela a seguir.

Como pode ser observado, os modelos de baseline anteriores entregam resultados inferiores em tarefas de compreensão de fala, o que afeta o desempenho em tarefas de raciocínio imagem-fala. Os resultados indicam que introduzir a arquitetura de Mixture of Experts pode melhorar a generalização dos MLLMs em tarefas de raciocínio imagem-áudio não vistas. A tabela a seguir apresenta os resultados experimentais em tarefas de compreensão de imagem-texto. Como pode ser observado, os melhores resultados dos modelos Uni-MoE superam os modelos de baseline e superam a tarefa de ajuste fino por uma margem média de 4 pontos.

Pensamentos Finais
Neste artigo, falamos sobre o Uni-MoE, um modelo de linguagem multimodal unificado com arquitetura de Mixture of Experts que é capaz de lidar com uma ampla gama de modalidades e especialistas. O framework Uni-MoE também implementa uma arquitetura de Mixture of Experts esparsa dentro dos modelos de linguagem grandes em uma tentativa de tornar o treinamento e o processo de inferência mais eficientes, empregando paralelismo de modelo de especialista e paralelismo de dados. Além disso, para melhorar a generalização e a colaboração entre especialistas, o framework Uni-MoE apresenta uma estratégia de treinamento progressiva que é uma combinação de três processos diferentes. No primeiro, o framework Uni-MoE alcança o alinhamento entre modalidades usando conectores com diferentes dados de modalidade cruzada. Em segundo lugar, o framework Uni-MoE ativa a preferência dos componentes de especialista treinando especialistas específicos de modalidade com dados de instrução de modalidade cruzada. Finalmente, o modelo Uni-MoE implementa a técnica de aprendizado de LoRA ou Adaptação de Baixo Rango em dados de instrução multimodais mistos para ajustar o modelo.












