Modelos e plataformas de IA

Mini-Gemini: Acelerando Modelos de Linguagem de Visão Multimodal

mm
Adicione Unite.AI às suas fontes preferidas no Google

Os avanços em modelos de linguagem grande aceleraram significativamente o desenvolvimento do processamento de linguagem natural, ou NLP. A introdução do framework de transformer provou ser um marco, facilitando o desenvolvimento de uma nova onda de modelos de linguagem, incluindo OPT e BERT, que exibem uma profunda compreensão linguística. Além disso, a invenção do GPT, ou modelos de transformer pré-treinados gerativos, introduziu um novo paradigma com modelagem autoregressiva e estabeleceu um método robusto para previsão e geração de linguagem. O advento de modelos de linguagem como GPT-4, ChatGPT, Mixtral, LLaMA e outros acelerou ainda mais a evolução, com cada modelo demonstrando um desempenho aprimorado em tarefas que envolvem processamento de linguagem complexo. Entre os métodos existentes, o ajuste de instruções emergiu como uma técnica-chave para refinar a saída de modelos de linguagem grande pré-treinados, e a integração desses modelos com ferramentas específicas para tarefas visuais destacou sua adaptabilidade e abriu portas para aplicações futuras. Essas aplicações vão muito além do processamento de texto tradicional de LLMs e incluem interações multimodais.

Além disso, a convergência do processamento de linguagem natural e modelos de visão deu origem a VLMs, ou Modelos de Linguagem de Visão, que combinam modelos linguísticos e de visão para alcançar compreensão e capacidades de raciocínio cross-modal. A integração e o advento de modelos visuais e linguísticos desempenharam um papel crucial no avanço de tarefas que exigem processamento de linguagem e compreensão visual. A emergência de modelos revolucionários como CLIP ainda mais reduziu a lacuna entre tarefas de visão e modelos de linguagem, demonstrando a viabilidade e a praticidade de aplicações cross-modais. Frameworks mais recentes, como LLaMA e BLIP, aproveitam dados de instrução personalizados para desenvolver estratégias eficientes que demonstram as capacidades potentes do modelo. Além disso, combinar modelos de linguagem grande com saídas de imagem é o foco da pesquisa multimodal recente, com métodos recentes capazes de contornar a geração direta, utilizando a abordagem de recuperação de imagem para produzir saídas de imagem e textos entrelaçados.

Com isso dito, e apesar dos avanços rápidos em modelos de linguagem de visão que facilitam o raciocínio básico e o diálogo visual, ainda existe uma lacuna de desempenho significativa entre modelos avançados como GPT-4 e modelos de linguagem de visão. Mini-Gemini é uma tentativa de reduzir a lacuna que existe entre modelos de linguagem de visão e modelos mais avançados, explorando o potencial de VLMs para um melhor desempenho em três aspectos: geração guiada por VLM, dados de alta qualidade e tokens visuais de alta resolução. Para aprimorar os tokens visuais, o framework Mini-Gemini propõe utilizar um codificador visual adicional para refinar a alta resolução sem aumentar a contagem de tokens visuais. O framework Mini-Gemini também constrói um conjunto de dados de alta qualidade em uma tentativa de promover a compreensão precisa de imagens e geração baseada em raciocínio. No geral, o framework Mini-Gemini tenta explorar o potencial de modelos de linguagem de visão e visa capacitar frameworks existentes com capacidades de raciocínio de imagem, compreensão e geração simultaneamente. Este artigo visa cobrir o framework Mini-Gemini em profundidade, e exploramos o mecanismo, a metodologia, a arquitetura do framework, juntamente com sua comparação com frameworks de estado da arte. Então, vamos começar.

Mini-Gemini: Acelerando Modelos de Linguagem de Visão Multimodal

Ao longo dos anos, os modelos de linguagem grande evoluíram e agora possuem capacidades multimodais notáveis, tornando-se uma parte essencial dos atuais modelos de linguagem de visão. No entanto, existe uma lacuna entre o desempenho multimodal dos modelos de linguagem grande e os modelos de linguagem de visão, com pesquisas recentes buscando maneiras de combinar visão com modelos de linguagem grande usando imagens e vídeos. Para tarefas de visão em si, a resolução da imagem é um elemento crucial para explicitar o ambiente circundante com alucinações visuais mínimas. Para reduzir a lacuna, os pesquisadores estão desenvolvendo modelos para melhorar a compreensão visual nos atuais modelos de linguagem de visão, e duas das abordagens mais comuns são: aumentar a resolução e aumentar a quantidade de tokens visuais. Embora aumentar a quantidade de tokens visuais com imagens de alta resolução melhore a compreensão visual, o aumento é frequentemente acompanhado de requisitos computacionais aumentados e custos associados, especialmente ao processar múltiplas imagens. Além disso, as capacidades dos modelos existentes, a qualidade dos dados existentes e a aplicabilidade permanecem inadequadas para um processo de desenvolvimento acelerado, deixando os pesquisadores com a pergunta: “como acelerar o desenvolvimento de modelos de linguagem de visão com custos aceitáveis”?

O framework Mini-Gemini é uma tentativa de responder à pergunta, pois tenta explorar o potencial de modelos de linguagem de visão em três aspectos: geração guiada por VLM ou aplicações expandidas, dados de alta qualidade e tokens visuais de alta resolução. Primeiramente, o framework Mini-Gemini implementa uma arquitetura ConvNet para gerar candidatos de alta resolução de forma eficiente, aprimorando os detalhes visuais enquanto mantém a contagem de tokens visuais para o modelo de linguagem grande. O framework Mini-Gemini combina conjuntos de dados de alta qualidade disponíveis publicamente em uma tentativa de melhorar a qualidade dos dados e integra essas melhorias com modelos gerativos e de linguagem grande de estado da arte, com a intenção de melhorar o desempenho dos VLMs e aprimorar a experiência do usuário. A estratégia multifacetada implementada pelo framework Mini-Gemini permite que ele explore capacidades ocultas de modelos de linguagem de visão e alcança avanços significativos com restrições de recursos evidentes.

Em geral, o framework Mini-Gemini emprega um paradigma de qualquer para qualquer, pois é capaz de lidar com texto e imagens como entrada e saída. Em particular, o framework Mini-Gemini introduz um pipeline eficiente para melhorar os tokens visuais para imagens de entrada e apresenta um sistema de codificador duplo, composto por dois codificadores: o primeiro codificador é para imagens de alta resolução, enquanto o segundo codificador é para embeddings visuais de baixa qualidade. Durante a inferência, os codificadores funcionam em um mecanismo de atenção, onde o codificador de baixa resolução gera consultas visuais, enquanto o codificador de alta resolução fornece chaves e valores para referência. Para aumentar a qualidade dos dados, o framework Mini-Gemini coleta e produz mais dados com base em recursos públicos, incluindo instruções orientadas para tarefas, dados relacionados à geração e respostas de alta resolução, com o aumento da quantidade e da qualidade melhorando o desempenho geral e as capacidades do modelo. Além disso, o framework Mini-Gemini suporta a geração concorrente de texto e imagem como resultado da integração do modelo de linguagem de visão com modelos gerativos avançados.

Mini-Gemini: Metodologia e Arquitetura

Em sua essência, o framework Mini-Gemini é conceitualmente simples e composto por três componentes.

  1. O framework emprega codificadores de visão duplos para fornecer embeddings visuais de baixa resolução e candidatos de alta resolução.
  2. O framework propõe implementar a mineração de informações de patch para realizar a mineração em nível de patch entre consultas visuais de baixa resolução e regiões de alta resolução.
  3. O framework Mini-Gemini utiliza um modelo de linguagem grande para casar texto com imagens para geração e compreensão simultâneas.

Codificadores de Visão Duplos

O framework Mini-Gemini pode processar entradas de texto e imagem, com a opção de lidar com elas individualmente ou em combinação. Como demonstrado na imagem a seguir, o framework Mini-Gemini começa o processo empregando interpolação bilinear para gerar uma imagem de baixa resolução a partir de sua imagem correspondente de alta resolução.

O framework então processa essas imagens e as codifica em um embedding visual multi-grid em dois fluxos de imagem paralelos. Mais especificamente, o framework Mini-Gemini mantém o pipeline tradicional para fluxos de baixa resolução e emprega um Transformer Visual pré-treinado com CLIP para codificar os embeddings visuais, facilitando que o modelo preserve a relação de longo alcance entre patches visuais para interações subsequentes em modelos de linguagem grande. Para os fluxos de alta resolução, o framework Mini-Gemini adota o codificador baseado em CNN ou Redes Neurais Convolucionais para processamento de imagem de alta resolução adaptativo e eficiente.

Mineração de Informações de Patch

Com os codificadores de visão duplos gerando os embeddings de baixa resolução e os recursos de alta resolução, o framework Mini-Gemini propõe implementar a mineração de informações de patch com o objetivo de estender o potencial de modelos de linguagem de visão com tokens visuais aprimorados. Para manter a contagem de tokens visuais para eficiência em modelos de linguagem grande, o framework Mini-Gemini toma os embeddings visuais de baixa resolução como a consulta e visa recuperar dicas visuais relevantes dos candidatos de recursos de alta resolução, com o framework tomando o mapa de recursos de alta resolução como a chave e o valor.

Como demonstrado na imagem acima, a fórmula encapsula o processo de refinar e sintetizar dicas visuais, o que leva à geração de tokens visuais avançados para o processamento subsequente do modelo de linguagem grande. O processo garante que o framework seja capaz de confinar a mineração para cada consulta à sua região correspondente no mapa de recursos de alta resolução, com a contagem de recursos por pixel, resultando em eficiência aprimorada. Devido a esse design, o framework Mini-Gemini é capaz de extrair detalhes de recursos de alta resolução sem aumentar a contagem de tokens visuais e mantém um equilíbrio entre viabilidade computacional e riqueza de detalhes.

Geração de Texto e Imagem

O framework Mini-Gemini concatena os tokens visuais e os tokens de texto de entrada como a entrada para os modelos de linguagem grande para geração autoregressiva. Ao contrário dos modelos de linguagem de visão tradicionais, o framework Mini-Gemini suporta geração de texto apenas, bem como geração de texto-imagem como entrada e saída, ou seja, inferência de qualquer para qualquer, e é o resultado dessa compreensão e capacidade de raciocínio de imagem-texto notáveis que o Mini-Gemini é capaz de gerar imagens de alta qualidade. Ao contrário de trabalhos recentes que se concentram na lacuna de domínio entre embeddings de texto dos modelos de geração e modelos de linguagem grande, o framework Mini-Gemini tenta otimizar a lacuna no domínio de prompts de linguagem, traduzindo instruções do usuário em prompts de alta qualidade que produzem imagens relevantes para o contexto em modelos de difusão latente. Além disso, para uma melhor compreensão do ajuste de instruções e alinhamento cross-modal, o framework Mini-Gemini coleta amostras de conjuntos de dados de alta qualidade disponíveis publicamente e usa o framework GPT-4 Turbo para construir ainda mais um conjunto de dados de 13K para seguir instruções e apoiar a geração de imagens.

Mini-Gemini: Experimentos e Resultados

Para avaliar seu desempenho, o framework Mini-Gemini é instanciado com o framework ConvNext-L pré-treinado para o codificador de visão de alta resolução e com um Transformer Visual pré-treinado com CLIP para o codificador de visão de baixa resolução. Para garantir a eficiência do treinamento, o framework Mini-Gemini mantém os dois codificadores de visão fixos e otimiza os projetores da mineração de informações de patch em todas as etapas, e otimiza o modelo de linguagem grande durante a etapa de ajuste de instruções.

A tabela a seguir compara o desempenho do framework Mini-Gemini contra modelos de estado da arte em diferentes configurações, e também considera modelos privados. Como pode ser observado, o Mini-Gemini supera os frameworks existentes em uma ampla gama de LLMs consistentemente na resolução normal e demonstra um desempenho superior quando configurado com o Gemma-2B na categoria de modelos eficientes. Além disso, quando modelos de linguagem grande maiores são empregados, a escalabilidade do framework Mini-Gemini é evidente.

Para avaliar seu desempenho em alta resolução e tokens visuais estendidos, os experimentos são realizados com um tamanho de entrada de 672 para o codificador de visão de baixa resolução e 1536 para o codificador visual. Como mencionado anteriormente, o objetivo principal do codificador visual de alta resolução é oferecer informações de candidatos de alta resolução. Como pode ser observado, o framework Mini-Gemini entrega um desempenho superior quando comparado a frameworks de estado da arte.

Além disso, para avaliar a capacidade de compreensão visual do framework Mini-Gemini em configurações do mundo real, os desenvolvedores aplicam o modelo a uma variedade de tarefas de raciocínio e compreensão, como demonstrado na imagem a seguir. Como pode ser observado, o framework Mini-Gemini é capaz de resolver uma ampla gama de tarefas complexas graças à implementação da mineração de informações de patch e dados de alta qualidade. Mas o que é mais impressionante é o fato de o framework Mini-Gemini demonstrar uma atenção ao detalhe que vai além da mera capacidade de reconhecimento e descreve elementos intricados de forma intricada.

A figura a seguir fornece uma avaliação abrangente das capacidades gerativas do framework Mini-Gemini.

Quando comparado a modelos recentes como ChatIllusion e AnyGPT, o framework Mini-Gemini demonstra capacidades de compreensão multimodal mais fortes, permitindo que ele gere legendas de imagem para texto que se alinham melhor com as instruções de entrada e resultam em respostas de imagem para texto com uma semelhança conceitual mais forte. O que é mais impressionante é o fato de o framework Mini-Gemini demonstrar uma proficiência notável na geração de conteúdo de alta qualidade usando apenas instruções de modelo múltiplo e dados de treinamento de texto, uma capacidade que ilustra a interpretação semântica robusta e a capacidade de alinhamento de imagem-texto do Mini-Gemini.

Pensamentos Finais

Neste artigo, falamos sobre o Mini-Gemini, um framework potente e simplificado para modelos de linguagem de visão multimodal. O objetivo principal do framework Mini-Gemini é explorar as capacidades latentes dos modelos de linguagem de visão usando dados de alta qualidade, design estratégico do framework e um escopo funcional expandido. O Mini-Gemini é uma tentativa de reduzir a lacuna que existe entre modelos de linguagem de visão e modelos mais avançados, explorando o potencial de VLMs para um melhor desempenho em três aspectos: geração guiada por VLM, dados de alta qualidade e tokens visuais de alta resolução. Para aprimorar os tokens visuais, o framework Mini-Gemini propõe utilizar um codificador visual adicional para refinar a alta resolução sem aumentar a contagem de tokens visuais. O framework Mini-Gemini também constrói um conjunto de dados de alta qualidade em uma tentativa de promover a compreensão precisa de imagens e geração baseada em raciocínio. No geral, o framework Mini-Gemini tenta explorar o potencial dos modelos de linguagem de visão e visa capacitar frameworks existentes com capacidades de raciocínio de imagem, compreensão e geração simultaneamente.

Kunal Kejriwal é engenheiro de backend especializado em Python, PostgreSQL, Redis e infraestrutura de nuvem na GCP e AWS. Com três anos de experiência construindo e dimensionando sistemas de produção, ele escreve sobre infraestrutura de IA, sistemas distribuídos e a arquitetura por trás da implantação de cargas de trabalho de aprendizado de máquina.