AI-modellen en platforms

AnomalyGPT: Industriële anomalieën detecteren met LVLM’s

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Onlangs hebben Large Vision Language Models (LVLM’s) zoals LLava en MiniGPT-4 aangetoond dat ze beelden kunnen begrijpen en hoge nauwkeurigheid en efficiëntie kunnen bereiken in verschillende visuele taken. Terwijl LVLM’s uitblinken in het herkennen van gewone objecten vanwege hun uitgebreide trainingsdatasets, ontbreken ze aan specifieke domeinkennis en hebben ze een beperkt begrip van gelokaliseerde details binnen beelden. Dit beperkt hun effectiviteit in taken voor industriële anomaliedetectie (IAD). Aan de andere kant kunnen bestaande IAD-kaders alleen de bronnen van anomalieën identificeren en vereisen ze handmatige drempelinstellingen om normale en abnormale monsters te onderscheiden, waardoor hun praktische implementatie wordt beperkt.

Het primaire doel van een IAD-kader is om anomalieën in industriële scenario’s en productbeelden te detecteren en te lokaliseren. Echter, vanwege de onvoorspelbaarheid en zeldzaamheid van echte beeldmonsters, worden modellen meestal alleen getraind op normale gegevens. Ze onderscheiden abnormale monsters van normale monsters op basis van afwijkingen van de typische monsters. Momenteel bieden IAD-kaders en -modellen voornamelijk anomaliewaarden voor testmonsters. Bovendien is het onderscheiden tussen normale en abnormale instanties voor elke klasse van items handmatige specificatie van drempelwaarden vereist, waardoor ze ongeschikt zijn voor echte toepassingen.

Om de toepassing en implementatie van Large Vision Language Models te onderzoeken bij het aanpakken van de uitdagingen die door IAD-kaders worden gesteld, werd AnomalyGPT geïntroduceerd, een novum IAD-benadering op basis van LVLM. AnomalyGPT kan anomalieën detecteren en lokaliseren zonder de noodzaak van handmatige drempelinstellingen. Bovendien kan AnomalyGPT ook pertinente informatie over de afbeelding bieden om interactief met gebruikers te communiceren, waardoor ze follow-upvragen kunnen stellen op basis van de anomalie of hun specifieke behoeften.

Industriële anomaliedetectie en Large Vision Language Models

Bestaande IAD-kaders kunnen worden onderverdeeld in twee categorieën. 

  1. Reconstructie-gebaseerde IAD. 
  2. Feature Embedding-gebaseerde IAD. 

In een reconstructie-gebaseerd IAD-kader is het primaire doel om anomalimonsters te reconstrueren naar hun respectieve normale tegenhangermonsters en anomalieën te detecteren door reconstructiefoutberekening. SCADN, RIAD, AnoDDPM en InTra maken gebruik van verschillende reconstructiekaders, van Generative Adversarial Networks (GAN) en auto-encoders tot diffusiemodellen en transformatoren. 

Aan de andere kant, in een Feature Embedding-gebaseerd IAD-kader, is het primaire doel om de focus te leggen op het modelleren van de feature-embedding van normale gegevens. Methoden zoals PatchSSVD proberen een hypersfeer te vinden die normale monsters strak kan omvatten, terwijl kaders zoals PyramidFlow en Cfl normale monsters projecteren op een Gaussian-verdeling met behulp van normaliserende stromen. CFA- en PatchCore-kaders hebben een geheugenslot van normale monsters van patch-embeddings gemaakt en gebruiken de afstand tussen de testmonster-embedding en de normale embedding om anomalieën te detecteren. 

Beide methoden volgen het “one class one model”-leerparadigma, dat een grote hoeveelheid normale monsters vereist om de verdelingen van elk object te leren. De vereiste van een grote hoeveelheid normale monsters maakt het onpraktisch voor nieuwe objectcategorieën en beperkt de toepassingen in dynamische productomgevingen. Aan de andere kant maakt het AnomalyGPT-kader gebruik van een in-context leerparadigma voor objectcategorieën, waardoor het in staat is om interferentie te veroorzaken met slechts een handvol normale monsters. 

Verdergaand, hebben we Large Vision Language Models of LVLM’s. LLM’s of Large Language Models hebben enorm succes geboekt in de NLP-industrie en worden nu onderzocht op hun toepassingen in visuele taken. Het BLIP-2-kader maakt gebruik van Q-former om visuele functies van Vision Transformer in de Flan-T5-modellen in te voeren. Bovendien verbindt het MiniGPT-kader het beeldsegment van het BLIP-2-kader en het Vicuna-model met een lineaire laag en voert een tweefasen-finetuningsproces uit met behulp van beeld-tekstgegevens. Deze benaderingen geven aan dat LLM-kaders mogelijk enkele toepassingen voor visuele taken hebben. Echter, deze modellen zijn getraind op algemene gegevens en ontbreken de vereiste domeinspecifieke expertise voor bredere toepassingen. 

Hoe werkt AnomalyGPT?

AnomalyGPT is in zijn kern een novum conversational IAD-groot visueel taalmodel ontworpen voor het detecteren van industriële anomalieën en het lokaliseren van hun exacte locatie met behulp van beelden. Het AnomalyGPT-kader maakt gebruik van een LLM en een vooraf getrainde beeldencoder om beelden te aligneren met hun overeenkomstige tekstuele beschrijvingen met behulp van gestimuleerde anomaliegrensgegevens. Het model introduceert een decodermodule en een prompt-lermodule om de prestaties van de IAD-systemen te verbeteren en pixel-niveau-lokaliseringsuitvoer te bereiken. 

Modelarchitectuur

De bovenstaande afbeelding toont de architectuur van AnomalyGPT. Het model passeert eerst de queryafbeelding naar de bevroren beeldencoder. Het model extracteert vervolgens patch-niveau-functies van de tussenliggende lagen en voert deze functies door naar een beelddecoder om hun gelijkenis met abnormale en normale teksten te berekenen en de resultaten voor lokaliseren te verkrijgen. De prompt-lermodule zet deze om in prompt-embeddings die geschikt zijn om als invoer in de LLM te gebruiken, samen met de gebruikersinvoer. Het LLM-model maakt vervolgens gebruik van de prompt-embeddings, beeldinvoer en gebruikersinvoer om anomalieën te detecteren, hun locatie te lokaliseren en eindreacties voor de gebruiker te creëren. 

Decoder

Om pixel-niveau-anomalie-lokaliseren te bereiken, maakt het AnomalyGPT-model gebruik van een lichtgewicht functie-matching-gebaseerde beelddecoder die zowel few-shot IAD-kaders als ongeleide IAD-kaders ondersteunt. Het ontwerp van de decoder die in AnomalyGPT wordt gebruikt, is geïnspireerd door WinCLIP-, PatchCore- en APRIL-GAN-kaders. Het model deelt de beeldencoder in 4 fasen op en extracteert de tussenliggende patch-niveau-functies van elke fase. 

Echter, deze tussenliggende functies zijn nog niet door de finale beeld-tekstalignering gegaan, waardoor ze niet rechtstreeks met functies kunnen worden vergeleken. Om dit probleem aan te pakken, introduceert het AnomalyGPT-model extra lagen om intermediate functies te projecteren en ze te aligneren met tekstfuncties die normale en abnormale semantiek vertegenwoordigen. 

Prompt-lermodule

Het AnomalyGPT-kader introduceert een prompt-lermodule die de lokaliseringsresultaten omzet in prompt-embeddings om fijne semantiek van beelden te benutten en ook de semantische consistentie tussen de decoder- en LLM-uitvoer te behouden. Bovendien voegt het model leerbare prompt-embeddings toe, ongerelateerd aan decoderuitvoer, in de prompt-lermodule om extra informatie voor de IAD-taak te bieden. Ten slotte voert het model de embeddings en de oorspronkelijke beeldinformatie door naar de LLM. 

De prompt-lermodule bestaat uit leerbare basisprompt-embeddings en een convolutioneel neuronaal netwerk. Het netwerk zet de lokaliseringsresultaten om in prompt-embeddings en vormt een set van prompt-embeddings die vervolgens worden gecombineerd met de beeldembeddings in de LLM. 

Anomaliesimulatie

Het AnomalyGPT-model gebruikt de NSA-methode om abnormale gegevens te simuleren. De NSA-methode maakt gebruik van de Cut-paste-techniek met behulp van de Poisson-beeldbewerking om de discontinuïteit die wordt geïntroduceerd door beeldsegmenten te verlichten. Cut-paste is een veelgebruikte techniek in IAD-kaders om gesimuleerde anomalibeelden te genereren. 

De Cut-paste-methode omvat het bijsnijden van een blokregio van een beeld op een willekeurige locatie en plakken in een andere beeld, waardoor een deel van een gesimuleerde anomalie wordt gecreëerd. Deze gesimuleerde anomalimonsters kunnen de prestaties van IAD-modellen verbeteren, maar er is een nadeel, aangezien ze vaak opvallende discontinuïteiten kunnen produceren. De Poisson-bewerking heeft als doel om een object naadloos te klonen van het ene beeld naar het andere door de Poisson-partial differentiaalvergelijkingen op te lossen. 

De bovenstaande afbeelding toont de vergelijking tussen Poisson en Cut-paste-beeldbewerking. Zoals te zien is, zijn er zichtbare discontinuïteiten in de Cut-paste-methode, terwijl de resultaten van Poisson-bewerking meer natuurlijk lijken. 

Vraag en antwoordinhoud

Om prompt-tuning uit te voeren op het Large Vision Language Model, genereert het AnomalyGPT-model een overeenkomstige tekstuele query op basis van de anomalieafbeelding. Elke query bestaat uit twee hoofdcomponenten. Het eerste deel van de query bestaat uit een beschrijving van de invoerbeeld die informatie biedt over de objecten in de afbeelding, samen met hun verwachte attributen. Het tweede deel van de query is om de aanwezigheid van anomalieën in de afbeelding te detecteren of om te controleren of er een anomalie in de afbeelding is. 

Het LVLM-model reageert eerst op de query of er een anomalie in de afbeelding is. Als het model anomalieën detecteert, specificeert het vervolgens de locatie en het aantal abnormale gebieden. Het model deelt de afbeelding op in een 3×3-rooster van verschillende regio’s om het LVLM in staat te stellen de positie van de anomalieën te specificeren, zoals weergegeven in de onderstaande afbeelding. 

Het LVLM-model wordt gevoed met de beschrijvende kennis van de invoer met fundamentele kennis van de invoerbeeld die de begrip van beeldcomponenten door het model verbetert. 

Datasets en evaluatiemetingen

Het model voert zijn experimenten voornamelijk uit op de VisA- en MVTec-AD-datasets. De MVTech-AD-dataset bestaat uit 3629 afbeeldingen voor trainingsdoeleinden en 1725 afbeeldingen voor testdoeleinden, die zijn opgesplitst in 15 verschillende categorieën, waardoor het een van de meest populaire datasets voor IAD-kaders is. De trainingsafbeeldingen hebben alleen normale afbeeldingen, terwijl de testafbeeldingen zowel normale als abnormale afbeeldingen bevatten. Aan de andere kant bestaat de VisA-dataset uit 9621 normale afbeeldingen en ongeveer 1200 abnormale afbeeldingen, die zijn opgesplitst in 12 verschillende categorieën. 

Verder, net als bestaande IAD-kaders, maakt het AnomalyGPT-model gebruik van de AUC of het gebied onder de receiver operating characteristics als evaluatiemeting, met pixel-niveau en beeldniveau-AUC om de prestaties van anomalie-lokaliseren te beoordelen en anomalie-detectie respectievelijk. Echter, het model maakt ook gebruik van beeldniveau-nauwkeurigheid om de prestaties van de voorgestelde benadering te evalueren, omdat het uniek de mogelijkheid biedt om de aanwezigheid van anomalieën te bepalen zonder de noodzaak van handmatige drempelinstellingen. 

Resultaten

Kwantitatieve resultaten

Few-Shot industriële anomaliedetectie

Het AnomalyGPT-model vergelijkt zijn resultaten met eerdere few-shot IAD-kaders, waaronder PaDiM, SPADE, WinCLIP en PatchCore als basismodellen. 

De bovenstaande afbeelding toont de resultaten van het AnomalyGPT-model in vergelijking met few-shot IAD-kaders. Over beide datasets heen, presteert de methode die door AnomalyGPT wordt gevolgd beter dan de benaderingen van eerdere modellen in termen van beeldniveau-AUC en levert het ook een goede nauwkeurigheid. 

Ongeleide industriële anomaliedetectie

In een ongeleide trainingsinstelling met een grote hoeveelheid normale monsters, traint AnomalyGPT een enkel model op monsters die zijn verkregen uit alle klassen binnen een dataset. De ontwikkelaars van AnomalyGPT hebben gekozen voor het UniAD-kader, omdat het onder dezelfde instelling is getraind en zal fungeren als een basis voor vergelijking. Bovendien vergelijkt het model ook met JNLD- en PaDim-kaders met behulp van dezelfde geünificeerde instelling. 

De bovenstaande afbeelding toont de prestaties van AnomalyGPT in vergelijking met andere kaders. 

Kwalitatieve resultaten

De bovenstaande afbeelding toont de prestaties van het AnomalyGPT-model in ongeleide anomaliedetectie, terwijl de onderstaande afbeelding de prestaties van het model in 1-shot in-context learning toont. 

Het AnomalyGPT-model is in staat om de aanwezigheid van anomalieën aan te geven, hun locatie te markeren en pixel-niveau-lokaliseringsresultaten te bieden. Wanneer het model in 1-shot in-context learning is, is de lokaliseringsprestatie van het model iets lager in vergelijking met ongeleide learning vanwege het ontbreken van training. 

Conclusie

AnomalyGPT is een novum conversational IAD-vision language model ontworpen om de krachtige mogelijkheden van grote visuele taalmodellen te benutten. Het kan niet alleen anomalieën in een afbeelding detecteren, maar ook hun exacte locaties lokaliseren. Bovendien faciliteert AnomalyGPT multi-turn dialogen gericht op anomaliedetectie en toont uitstekende prestaties in few-shot in-context learning. AnomalyGPT onderzoekt de potentiële toepassingen van LVLM’s in anomaliedetectie, waardoor nieuwe ideeën en mogelijkheden voor de IAD-industrie worden geïntroduceerd.

Een ingenieur van beroep, een schrijver van hart. Kunal is een technisch schrijver met een diepe liefde en begrip voor AI en ML, toegewijd aan het vereenvoudigen van complexe concepten in deze gebieden door middel van zijn boeiende en informatieve documentatie.