Modelos e plataformas de IA
AnomalyGPT: Detecção de Anomalias Industriais usando LVLMs
Recentemente, os Large Vision Language Models (LVLMs), como LLava e MiniGPT-4, demonstraram a capacidade de entender imagens e alcançar alta precisão e eficiência em várias tarefas visuais. Embora os LVLMs sejam excelentes em reconhecer objetos comuns devido aos seus conjuntos de dados de treinamento extensos, eles carecem de conhecimento específico de domínio e têm uma compreensão limitada de detalhes localizados dentro das imagens. Isso limita sua eficácia nas tarefas de Detecção de Anomalias Industriais (IAD). Por outro lado, os quadros de IAD existentes só podem identificar as fontes de anomalias e exigem configurações de limiar manual para distinguir entre amostras normais e anômalas, restringindo assim sua implementação prática.
O objetivo principal de um quadro de IAD é detectar e localizar anomalias em cenários industriais e imagens de produtos. No entanto, devido à imprevisibilidade e raridade de amostras de imagens do mundo real, os modelos são normalmente treinados apenas com dados normais. Eles diferenciam amostras anômalas das normais com base em desvios dos exemplos típicos. Atualmente, os quadros e modelos de IAD fornecem principalmente pontuações de anomalia para amostras de teste. Além disso, distinguir entre instâncias normais e anômalas para cada classe de itens requer a especificação manual de limiares, tornando-os inadequados para aplicações do mundo real.

Para explorar o uso e a implementação de Large Vision Language Models nos desafios impostos pelos quadros de IAD, AnomalyGPT, uma abordagem de IAD baseada em LVLM, foi introduzida. AnomalyGPT pode detectar e localizar anomalias sem a necessidade de configurações de limiar manual. Além disso, AnomalyGPT também pode oferecer informações pertinentes sobre a imagem para interagir interativamente com os usuários, permitindo que eles façam perguntas adicionais com base na anomalia ou em suas necessidades específicas.
Detecção de Anomalias Industriais e Large Vision Language Models
Os quadros de IAD existentes podem ser categorizados em duas categorias.
- IAD baseado em Reconstrução.
- IAD baseado em Incorporação de Recursos.
Em um quadro de IAD baseado em Reconstrução, o objetivo principal é reconstruir amostras de anomalias para suas respectivas amostras normais, e detectar anomalias calculando o erro de reconstrução. SCADN, RIAD, AnoDDPM e InTra utilizam diferentes quadros de reconstrução, que variam de Redes Adversárias Generativas (GAN) e autoencoders a modelos de difusão e transformadores.
Por outro lado, em um quadro de IAD baseado em Incorporação de Recursos, o objetivo principal é se concentrar na modelagem da incorporação de recursos de dados normais. Métodos como PatchSSVD tentam encontrar uma hipersfera que possa encapsular amostras normais firmemente, enquanto quadros como PyramidFlow e Cfl projetam amostras normais em uma distribuição gaussiana usando fluxos normalizadores. Os quadros CFA e PatchCore estabeleceram um banco de dados de amostras normais a partir de incorporações de patches e usam a distância entre a incorporação da amostra de teste e a incorporação normal para detectar anomalias.
Ambos os métodos seguem o paradigma de aprendizado “um classe, um modelo”, que exige uma grande quantidade de amostras normais para aprender as distribuições de cada classe de objetos. A necessidade de uma grande quantidade de amostras normais torna isso impraticável para categorias de objetos novas e com aplicações limitadas em ambientes de produtos dinâmicos. Por outro lado, o quadro AnomalyGPT utiliza um paradigma de aprendizado em contexto para categorias de objetos, permitindo que ele habilite interferência apenas com um punhado de amostras normais.
Avançando, temos os Large Vision Language Models ou LVLMs. LLMs ou Large Language Models desfrutaram de um tremendo sucesso na indústria de NLP e agora estão sendo explorados para suas aplicações em tarefas visuais. O quadro BLIP-2 aproveita o Q-former para inputar recursos visuais do Vision Transformer no modelo Flan-T5. Além disso, o quadro MiniGPT conecta o segmento de imagem do quadro BLIP-2 e o modelo Vicuna com uma camada linear e realiza um processo de ajuste fino em duas etapas usando dados de imagem-texto. Essas abordagens indicam que os quadros LLM podem ter algumas aplicações para tarefas visuais. No entanto, esses modelos foram treinados em dados gerais e carecem da expertise específica de domínio necessária para aplicações amplas.
Como Funciona o AnomalyGPT?
AnomalyGPT em seu núcleo é um modelo de linguagem de visão conversacional de IAD baseado em LVLM, projetado principalmente para detectar anomalias industriais e apontar suas localizações exatas usando imagens. O quadro AnomalyGPT utiliza um LLM e um codificador de imagem pré-treinado para alinhar imagens com suas descrições textuais correspondentes usando dados de anomalias estimuladas. O modelo introduz um módulo de decodificador e um módulo de aprendizado de prompt para melhorar o desempenho dos sistemas de IAD e alcançar saídas de localização de nível de pixel.
Arquitetura do Modelo

A imagem acima ilustra a arquitetura do AnomalyGPT. O modelo primeiro passa a imagem de consulta para o codificador de imagem congelado. Em seguida, o modelo extrai recursos de nível de patch das camadas intermediárias e os alimenta em um decodificador de imagem para calcular sua semelhança com textos anormais e normais para obter os resultados de localização. O módulo de aprendizado de prompt então converte-os em incorporações de prompt que são adequadas para serem usadas como entradas no LLM, juntamente com as entradas textuais do usuário. O modelo LLM então aproveita as incorporações de prompt, as entradas de imagem e as entradas textuais do usuário para detectar anomalias e apontar suas localizações e criar respostas finais para o usuário.
Decodificador
Para alcançar a localização de anomalias de nível de pixel, o modelo AnomalyGPT implanta um decodificador de imagem baseado em correspondência de recursos leve que suporta tanto quadros de IAD de poucos disparos quanto quadros de IAD não supervisionados. O design do decodificador usado no AnomalyGPT é inspirado nos quadros WinCLIP, PatchCore e APRIL-GAN. O modelo divide o codificador de imagem em 4 estágios e extrai os recursos de nível de patch intermediários em cada estágio.
No entanto, esses recursos intermediários não passaram pela alinhamento de imagem-texto final, o que os torna impossíveis de serem comparados diretamente com recursos. Para resolver esse problema, o modelo AnomalyGPT introduz camadas adicionais para projetar recursos intermediários e alinhá-los com recursos de texto que representam semântica normal e anormal.
Aprendizado de Prompt
O quadro AnomalyGPT introduz um aprendizado de prompt que tenta transformar o resultado de localização em incorporações de prompt para aproveitar a semântica de grãos finos das imagens e manter a consistência semântica entre as saídas do decodificador e do LLM. Além disso, o modelo incorpora incorporações de prompt aprendíveis, não relacionadas às saídas do decodificador, no aprendizado de prompt para fornecer informações adicionais para a tarefa de IAD. Finalmente, o modelo alimenta as incorporações e as informações de imagem originais no LLM.
O aprendizado de prompt consiste em incorporações de prompt de base aprendíveis e uma rede neural convolucional. A rede converte o resultado de localização em incorporações de prompt e forma um conjunto de incorporações de prompt que são então combinadas com as incorporações de imagem no LLM.
Simulação de Anomalia
O modelo AnomalyGPT adota o método NSA para simular dados anômalos. O método NSA usa a técnica de corte e cola usando o método de edição de imagem de Poisson para aliviar a descontinuidade introduzida pela cola de segmentos de imagem. A técnica de corte e cola é comumente usada em quadros de IAD para gerar imagens de anomalias simuladas.
A técnica de corte e cola envolve cortar uma região de bloco de uma imagem aleatoriamente e colá-la em uma localização aleatória em outra imagem, criando assim uma porção de anomalia simulada. Essas amostras de anomalias simuladas podem melhorar o desempenho dos modelos de IAD, mas há uma desvantagem, pois elas podem produzir descontinuidades perceptíveis. O método de edição de Poisson visa clonar um objeto de uma imagem para outra resolvendo as equações diferenciais parciais de Poisson.

A imagem acima ilustra a comparação entre a edição de Poisson e a técnica de corte e cola. Como pode ser visto, há descontinuidades visíveis na técnica de corte e cola, enquanto os resultados da edição de Poisson parecem mais naturais.
Conteúdo de Perguntas e Respostas
Para realizar o ajuste de prompt no Large Vision Language Model, o modelo AnomalyGPT gera uma consulta textual correspondente com base na imagem de anomalia. Cada consulta consiste em duas partes principais. A primeira parte da consulta consiste em uma descrição da imagem de entrada que fornece informações sobre os objetos presentes na imagem, juntamente com seus atributos esperados. A segunda parte da consulta é para detectar a presença de anomalias dentro do objeto ou verificar se há uma anomalia na imagem.
O LLM primeiro responde à consulta sobre se há uma anomalia na imagem. Se o modelo detectar anomalias, ele continua a especificar a localização e o número de áreas anômalas. O modelo divide a imagem em uma grade de 3×3 de regiões distintas para permitir que o LLM indique verbalmente a posição das anomalias, como mostrado na figura abaixo.

O modelo LLM é alimentado com o conhecimento descritivo da entrada com o conhecimento fundamental da imagem de entrada que ajuda a compreensão do modelo dos componentes da imagem.
Conjuntos de Dados e Métricas de Avaliação
O modelo realiza seus experimentos principalmente nos conjuntos de dados VisA e MVTec-AD. O conjunto de dados MVTec-AD consiste em 3629 imagens para treinamento e 1725 imagens para teste, divididas em 15 categorias diferentes, o que o torna um dos conjuntos de dados mais populares para quadros de IAD. As imagens de treinamento apresentam apenas imagens normais, enquanto as imagens de teste apresentam imagens normais e anômalas. Por outro lado, o conjunto de dados VisA consiste em 9621 imagens normais e cerca de 1200 imagens anômalas, divididas em 12 categorias diferentes.
Avançando, assim como os quadros de IAD existentes, o modelo AnomalyGPT emprega a AUC (Área sob a Curva de Característica de Operação do Receptor) como sua métrica de avaliação, com AUC de nível de pixel e AUC de nível de imagem usados para avaliar o desempenho de localização de anomalias e detecção de anomalias, respectivamente. No entanto, o modelo também utiliza a precisão de nível de imagem para avaliar o desempenho de sua abordagem proposta, pois isso permite determinar a presença de anomalias sem a necessidade de configuração de limiares manual.
Resultados
Resultados Quantitativos
Detecção de Anomalias Industriais de Poucos Disparos
O modelo AnomalyGPT compara seus resultados com os quadros de IAD de poucos disparos anteriores, incluindo PaDiM, SPADE, WinCLIP e PatchCore, como linhas de base.

A figura acima compara os resultados do modelo AnomalyGPT com os quadros de IAD de poucos disparos. Em ambos os conjuntos de dados, o método seguido pelo AnomalyGPT supera as abordagens adotadas pelos modelos anteriores em termos de AUC de nível de imagem e também retorna boa precisão.
Detecção de Anomalias Industriais não Supervisionada
Em um ambiente de treinamento não supervisionado com um grande número de amostras normais, o AnomalyGPT treina um único modelo em amostras obtidas de todas as classes dentro de um conjunto de dados. Os desenvolvedores do AnomalyGPT optaram pelo quadro UniAD porque ele é treinado sob o mesmo conjunto de configurações e servirá como uma linha de base para comparação. Além disso, o modelo também compara com os quadros JNLD e PaDim usando o mesmo conjunto de configurações unificado.

A figura acima compara o desempenho do AnomalyGPT em comparação com outros quadros.
Resultados Qualitativos

A imagem acima ilustra o desempenho do modelo AnomalyGPT no método de detecção de anomalias não supervisionado, enquanto a figura abaixo demonstra o desempenho do modelo no método de aprendizado de contexto de 1 disparo.

O modelo AnomalyGPT é capaz de indicar a presença de anomalias, marcar suas localizações e fornecer resultados de localização de nível de pixel. Quando o modelo está no método de aprendizado de contexto de 1 disparo, o desempenho de localização do modelo é ligeiramente menor em comparação com o método de aprendizado não supervisionado devido à falta de treinamento.
Conclusão
AnomalyGPT é um modelo de linguagem de visão conversacional de IAD baseado em LVLM, projetado para aproveitar as capacidades poderosas dos large vision language models. Ele não apenas pode identificar anomalias em uma imagem, mas também pode apontar suas localizações exatas. Além disso, o AnomalyGPT facilita diálogos de várias voltas focados na detecção de anomalias e demonstra um desempenho notável no aprendizado de contexto de poucos disparos. O AnomalyGPT explora as aplicações potenciais dos LVLMs na detecção de anomalias, introduzindo novas ideias e possibilidades para a indústria de IAD.












