Modelos e plataformas de IA
MiniGPT-5: Geração Interleaved de Visão e Linguagem via Vokens Gerativos
Nos últimos anos, os Grandes Modelos de Linguagem (LLMs) têm sido alvo de atenção de desenvolvedores de IA em todo o mundo devido aos avanços no Processamento de Linguagem Natural (NLP). Esses modelos estabeleceram novos padrões em geração de texto e compreensão. No entanto, apesar do progresso na geração de texto, produzir imagens que sejam coerentes com as narrativas textuais ainda é um desafio. Para resolver isso, os desenvolvedores introduziram uma abordagem inovadora de geração de visão e linguagem baseada em “vokens gerativos”, que preenche a lacuna para saídas de texto-imagem harmonizadas.
A base do MiniGPT-5 é uma estratégia de treinamento em duas etapas que se concentra fortemente na geração de dados multimodais sem descrição, onde os dados de treinamento não exigem descrições de imagem abrangentes. Além disso, para aumentar a integridade do modelo, o modelo incorpora um sistema de orientação de classificador livre que melhora a eficácia de um voken para geração de imagem. Na fase inicial, o framework MiniGPT-5 demonstrou um desempenho poderoso e uma melhoria significativa em relação ao modelo de baseline Divter treinado no conjunto de dados MMDialog, e demonstrou constantemente sua capacidade de fornecer saídas multimodais comparáveis e até superiores em avaliações humanas realizadas no conjunto de dados VIST, o que destaca ainda mais seu desempenho e eficiência em várias avaliações.
MiniGPT5: Uma Introdução
Com os desenvolvimentos recentes dos frameworks LLM, e aplicações baseadas nesses frameworks LLM, a integração de recursos multimídia é um campo que tem experimentado um aumento em sua popularidade, pois também se prova ser um avanço vital que alimenta uma ampla gama de aplicações, desde ferramentas de criação de conteúdo de ponta até agentes de diálogo multimodal de ponta. Com pesquisas e desenvolvimentos contínuos, os modelos de linguagem e visão estão no ponto em que o trabalho está sendo feito para permitir que eles gerem texto e dados visuais de forma contínua. A capacidade do LLM de gerar dados multimodais de forma contínua ajudará a melhorar as interações em diferentes domínios, incluindo comércio eletrônico, mídia e realidade virtual.

Em última análise, o objetivo é permitir que os modelos sintetizem, reconheçam e respondam de forma consistente e lógica, utilizando tanto modalidades textuais quanto visuais, desempenhando um papel fundamental na harmonização do fluxo de informações e na criação de narrativas lógicas e consistentes. A necessidade de alcançar uma combinação de modalidades textuais e visuais é impulsionada principalmente pela necessidade de interações multimodais mais fluidas, integradas e interativas em LLMs, e, em última análise, alcançar a geração alternada de linguagem e visão. No entanto, alcançar interações multimodais integradas e interativas em LLMs é uma tarefa complicada, repleta de desafios, incluindo
- Embora os LLMs atuais sejam extremamente eficientes e capazes quando se trata de geração de texto e processamento de pares de texto-imagem, eles não fornecem um desempenho satisfatório quando se trata de gerar imagens.
- O desenvolvimento desses modelos de visão e linguagem depende fortemente de dados focados em tópicos, o que torna difícil para os modelos alinhar o texto gerado com as imagens correspondentes.
- Finalmente, há a necessidade de desenvolver estratégias mais eficazes, pois, à medida que as capacidades dos LLMs aumentam, os requisitos de memória também aumentam, especialmente ao realizar tarefas downstream.
O framework MiniGPT-5, uma técnica de geração de linguagem e visão intercalada, introduz o conceito de “vokens gerativos” em uma tentativa de resolver os desafios mencionados acima. O framework MiniGPT-5 propõe uma nova abordagem para a geração de dados multimodais, amalgamando os Grandes Modelos de Linguagem com técnicas de difusão estável, utilizando tokens visuais especiais. A abordagem de treinamento em duas etapas utilizada pelo framework MiniGPT-5 destaca a importância de uma etapa fundamental livre de descrições e prepara o modelo para fornecer um desempenho eficiente, mesmo em cenários com dados limitados.

Mas o que separa o modelo MiniGPT-5 dos frameworks existentes é que as etapas genéricas do framework MiniGPT-5 não consistem em anotações específicas de domínio. Além disso, para garantir que o texto gerado e as imagens correspondentes estejam em harmonia, o framework MiniGPT-5 utiliza uma estratégia de perda dupla que melhora ainda mais a abordagem do MiniGPT-5 de utilizar orientação de classificador livre e vokens gerativos. O framework MiniGPT-5 otimiza a eficiência do treinamento e resolve as limitações de memória graças à sua estratégia de ajuste fino de parâmetros.
Para fornecer uma visão geral rápida, o framework MiniGPT-5
- Propõe um método que utiliza codificadores multimodais que representam um método genérico e inovador que historicamente provou ser mais eficaz do que os LLMs tradicionais, e utiliza tokens gerativos combinados com técnicas de difusão estável para gerar saídas de linguagem e visão intercaladas.
- Propõe uma estratégia de treinamento em duas etapas para a geração de saída multimodal sem descrição e a inclusão de orientação de classificador livre durante o treinamento para refinar ainda mais a qualidade dos dados gerados.
O modelo MiniGPT-5 é inspirado fortemente nas pesquisas e trabalhos realizados nos campos de
- Geração de Imagem a Partir de Texto: Para facilitar a transformação de descrições textuais em suas representações visuais correspondentes e modelos de imagem a partir de texto.
- MLLMs ou Modelos de Linguagem Grande Multimodal: Usando modelos LLM pré-treinados para explorar suas aplicações e eficácia na geração de dados multimodais.
- Geração Multimodal com Modelos de Linguagem Grande: Para aumentar as capacidades de um LLM para integrar de forma contínua a geração de linguagem e dados visuais.
MiniGPT-5: Método, Arquitetura e Framework
Para facilitar a geração de dados multimodais com os Grandes Modelos de Linguagem, o modelo MiniGPT-5 introduz um framework que visa integrar modelos de geração de imagem a partir de texto e modelos de linguagem grande multimodal pré-treinados. O framework MiniGPT-5 também introduz os “vokens gerativos”, tokens visuais especiais que permitem que os desenvolvedores abordem as discrepâncias que surgem em diferentes domínios, treinando diretamente em imagens brutos. Para melhorar ainda mais a qualidade dos dados multimodais gerados pelos LLMs, o framework MiniGPT-5 introduz uma estratégia de orientação de classificador livre, combinada com um método de treinamento avançado em duas etapas. Vamos dar uma olhada detalhada no framework MiniGPT-5.
Etapa de Entrada Multimodal
Os desenvolvimentos dos LLMs nos últimos tempos trouxeram à luz as capacidades de compreensão multimodal dos LLMs, permitindo o processamento de imagens como entrada sequencial. O framework MiniGPT-5 utiliza vokens gerativos especialmente projetados para saída de recursos visuais, tentando expandir as capacidades de compreensão multimodal dos LLMs para a geração de dados multimodais. Além disso, o framework MiniGPT-5 utiliza técnicas de ajuste fino de parâmetros eficientes e de ponta para o aprendizado de saída multimodal com o framework LLM.
Codificação Multimodal
O codificador visual pré-treinado no framework MiniGPT-5 transforma cada imagem de entrada em um recurso, e cada token de texto é incorporado como um vetor, e os recursos de prompt de entrada são gerados quando essas incorporações são concatenadas umas às outras.
Adicionando Vokens em Modelos de Linguagem Grande
Tradionalmente, o vocabulário do Modelo de Linguagem Grande consiste apenas em tokens textuais, por isso os desenvolvedores que trabalham no framework MiniGPT-5 tiveram que preencher a lacuna entre os gerativos e os LLMs tradicionais. O framework MiniGPT-5 introduz um conjunto de tokens especiais como tokens gerativos no vocabulário do LLM. O framework então aproveita o estado de saída oculto do LLM para esses vokens especiais para a geração subsequente de imagem, e a inserção de imagens intercaladas é representada pela posição dos vokens.
Ajuste Fino de Parâmetros (PEFT)
O Ajuste Fino de Parâmetros (PEFT) é um conceito crucial utilizado para treinar LLMs, e, no entanto, as aplicações do PEFT em configurações multimodais ainda são pouco exploradas. O framework MiniGPT-5 utiliza o Ajuste Fino de Parâmetros sobre o codificador do framework MiniGPT-4 para treinar o modelo para entender melhor os prompts ou instruções e até melhorar o desempenho geral do modelo em ambientes zero-shot ou novos.
Geração de Saída Multimodal
Para alinhar o modelo gerativo com os tokens gerativos com precisão, o framework MiniGPT-5 formula um módulo de mapeamento compacto para corresponder às dimensões e incorporar perdas supervisoras, incluindo perda de difusão latente e perda de espaço de texto. A perda de difusão latente supervisionada alinha os recursos visuais apropriados com os tokens diretamente, enquanto a perda de espaço de texto ajuda o modelo a aprender as posições corretas dos tokens. Como os vokens gerativos no framework MiniGPT-5 são guiados diretamente pelas imagens, o framework MiniGPT-5 não exige que as imagens tenham uma descrição abrangente, resultando em um aprendizado livre de descrições.
Geração de Espaço de Texto
O framework MiniGPT-5 segue o método de modelagem de linguagem casual para gerar vokens e textos no espaço de texto conjuntamente, e, durante a fase de treinamento, os desenvolvedores anexam os vokens à posição das imagens de verdade e treinam o modelo para prever vokens dentro da geração de texto.
Mapeamento de Recursos de Voken para Geração de Imagem
Após gerar o espaço de texto, o framework alinha o estado de saída oculto com o espaço de recurso condicional de texto para o modelo de geração de imagem a partir de texto. O framework também suporta um módulo de mapeamento de recursos que inclui um modelo de MLP de duas camadas, uma sequência de decodificador aprendível e um modelo de transformador codificador-decodificador de quatro camadas.
Geração de Imagem com LDM (Modelo de Difusão Latente)
Para gerar as imagens necessárias no processo de desenoise, o framework utiliza os recursos de mapeamento como entrada condicional. O framework também emprega um Modelo de Difusão Latente (LDM) para orientação, pois, durante a fase de treinamento, a imagem de verdade é primeiro convertida em um recurso latente usando um VAE pré-treinado, após o que os desenvolvedores obtêm o recurso de ruído latente adicionando algum ruído.
A abordagem abrangente utilizada pelo framework MiniGPT-5 permite que os desenvolvedores tenham uma compreensão coerente e geração de elementos visuais e textuais, utilizando tokens especiais, aproveitando as capacidades de modelos pré-treinados e utilizando técnicas de treinamento inovadoras.
MiniGPT-5: Treinamento e Resultados
Ao trabalhar no framework MiniGPT-5, os desenvolvedores observaram que o treinamento em um conjunto de dados de texto e imagem intercalados diretamente pode resultar em imagens de qualidade diminuída e desalinhamento, dado o deslocamento significativo de domínio entre os domínios de imagem e texto. Para mitigar esse problema, os desenvolvedores adotaram duas estratégias de treinamento distintas,
- Abrangendo a incorporação de técnicas de orientação de classificador livre que aumentam a eficácia dos tokens gerativos durante o processo de difusão.
- A segunda estratégia é ainda dividida em duas etapas
- Uma etapa de pré-treinamento inicial que se concentra principalmente em alinhar recursos grosseiros.
- Uma etapa de ajuste fino que facilita o aprendizado de recursos.
CFG ou Orientação de Classificador Livre
A ideia de utilizar primeiro a CFG para a geração multimodal surgiu como resultado de uma tentativa de melhorar a consistência e a lógica entre as imagens geradas e os textos, e a CFG é introduzida durante o processo de difusão de texto para imagem. Esse método observa que, ao treinar em geração condicional e incondicional com dropout de condicionamento, o modelo gerativo pode alcançar resultados condicionais aprimorados.
Estratégia de Treinamento em Duas Etapas
Dado o deslocamento significativo de domínio observado entre a geração de texto-imagem e a geração de texto puro, o framework MiniGPT-5 utiliza uma estratégia de treinamento em duas etapas
- Etapa de Alinhamento Unimodal (UAS),
- Etapa de Aprendizado Multimodal (MLS).
Inicialmente, o framework alinha as características de geração de imagem com as características de voken em conjuntos de dados de texto-imagem simples, onde cada amostra de dados contém apenas um texto e apenas uma imagem, e o texto é geralmente a legenda da imagem. Nessa etapa, o framework permite que o LLM gere vokens utilizando as legendas como entradas do LLM.
Uma vez que a UAS tenha sido executada com sucesso, o modelo pode gerar imagens para descrições de texto simples, mas luta com a geração de linguagem e visão intercaladas, incluindo pares de texto-imagem e raciocínio complicado é necessário para a geração de imagem e texto. Para superar esse obstáculo, os desenvolvedores ajustaram ainda mais o framework MiniGPT-5 utilizando parâmetros PEFT por conjuntos de dados de visão e linguagem intercalados, como o VIST. Durante essa etapa, o framework constrói três tarefas diferentes a partir do conjunto de dados
- Geração de Texto Somente: Gera o texto relacionado dado a próxima imagem.
- Geração de Imagem Somente: Gera a imagem relacionada dado o próximo texto.
- Geração Multimodal: Gera pares de texto-imagem usando o contexto fornecido.
MiniGPT-5: Avaliações e Resultados
Para avaliar seu desempenho na geração multimodal de forma abrangente, a equipe de desenvolvimento do MiniGPT-5 compara seu desempenho com outros modelos de baseline proeminentes, incluindo Divter, GILL e o Modelo de Geração Unimodal Ajustado, e a comparação é demonstrada na tabela abaixo.

O framework MiniGPT-5 entende que a saída multimodal pode ser significativa de acordo com o contexto, mas pode diferir da realidade, o que é a razão principal pela qual o framework MiniGPT-5 também incorpora entradas humanas para avaliar e avaliar o desempenho do modelo. Em geral, a eficácia do framework MiniGPT-5 para tarefas multimodais é medida por três perspectivas.
- Continuidade de Linguagem: Avaliando se o conteúdo gerado se alinha com o contexto fornecido de forma contínua.
- Qualidade de Imagem: Avaliando ou avaliando a relevância e clareza da imagem gerada.
- Coesão Multimodal: Para determinar se a saída de texto-imagem combinada está em sincronia com o contexto inicial.
Avaliação Final do VIST
Na primeira etapa dos experimentos, o framework MiniGPT-5 visa gerar as imagens correspondentes, e a tabela abaixo resume os resultados obtidos nesse cenário.

Como pode ser visto, o framework MiniGPT-5 em todos os três cenários pode superar o framework SD2 ajustado, destacando a eficácia do pipeline MiniGPT-5.

A figura acima compara o desempenho do framework MiniGPT-5 com o framework MiniGPT-4 ajustado nas métricas de desempenho S-BERT, Rouge-L e Meteor. Os resultados indicam que o uso de vokens gerativos não afeta negativamente o desempenho do framework ao realizar tarefas de compreensão multimodal. Os resultados também demonstram que o framework MiniGPT-5 é capaz de utilizar prompts de entrada multimodal horizontais longos em uma ampla gama de dados para gerar imagens de alta qualidade e coerentes sem comprometer a capacidade do modelo original de compreensão multimodal.

A tabela acima compara o desempenho de três frameworks em 5.000 amostras para a geração multimodal a partir de aspectos de Coesão Multimodal, Qualidade de Imagem e Continuidade de Linguagem. Como pode ser observado, o framework MiniGPT-5 supera os outros dois modelos de baseline em mais de 70% dos casos. Por outro lado, a tabela abaixo demonstra o desempenho do framework MiniGPT-5 no conjunto de dados de validação CC3M para a geração de imagens únicas. Devido a limitações de dados, os desenvolvedores encontraram uma lacuna para o alinhamento de voken quando usado com a Difusão Estável. Apesar dessa limitação, o framework MiniGPT-5 supera o framework de baseline GILL atual em todas as métricas.


Conclusão
Neste artigo, discutimos o MiniGPT-5, uma técnica de geração de linguagem e visão intercalada que introduz o conceito de “vokens gerativos” para aproveitar as capacidades dos LLMs para gerar dados multimodais, alinhando o modelo de linguagem grande com um modelo de geração de imagem a partir de texto pré-treinado. Discutimos os componentes essenciais e a arquitetura geral do framework MiniGPT-5, juntamente com os resultados que indicam melhorias significativas no desempenho e eficiência em comparação com os modelos de baseline atuais e de ponta. O MiniGPT-5 aspira a estabelecer um novo padrão no domínio de geração de conteúdo e dados multimodais e visa resolver os desafios enfrentados por modelos anteriores ao tentar resolver o mesmo problema.












