AI-modeller och plattformar

AnomalyGPT: Upptäcker Industriella Avvikelser med Hjälp av LVLM

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Nyligen har stora visionsspråkmodeller (LVLM) som LLava och MiniGPT-4 visat förmåga att förstå bilder och uppnå hög noggrannhet och effektivitet i flera visuella uppgifter. Medan LVLM utmärker sig i att känna igen vanliga föremål på grund av deras omfattande träningsdata, saknar de specifik domänkunskap och har en begränsad förståelse för lokala detaljer inom bilder. Detta begränsar deras effektivitet i uppgifter för industriell avvikelseidentifiering (IAD). Å andra sidan kan befintliga IAD-ramverk endast identifiera källor till avvikelser och kräver manuell tröskelinställning för att skilja mellan normala och avvikande prover, vilket begränsar deras praktiska implementering.

Huvudsyftet med ett IAD-ramverk är att upptäcka och lokalisera avvikelser i industriella scenarier och produktbilder. Men på grund av oförutsägbarheten och sällsyntheten hos verkliga bildprover tränas modellerna vanligtvis endast på normala data. De skiljer avvikande prover från normala baserat på avvikelser från de typiska proverna. För närvarande tillhandahåller IAD-ramverk och modeller i huvudsak avvikelsepoäng för testprover. Dessutom kräver skiljandet mellan normala och avvikande instanser för varje artikelkategori manuell specificering av trösklar, vilket gör dem olämpliga för verkliga tillämpningar.

För att utforska användningen och implementeringen av stora visionsspråkmodeller för att hantera utmaningarna som IAD-ramverk står inför, introducerades AnomalyGPT, en ny IAD-ansats baserad på LVLM. AnomalyGPT kan upptäcka och lokalisera avvikelser utan behov av manuell tröskelinställning. Dessutom kan AnomalyGPT också tillhandahålla relevant information om bilden för att engagera sig interaktivt med användare, vilket tillåter dem att ställa följdfrågor baserat på avvikelsen eller deras specifika behov.

Industriell Avvikelseidentifiering och Stora Visionsspråkmodeller

Befintliga IAD-ramverk kan delas in i två kategorier.

  1. Rekonstruktionsbaserad IAD.
  2. Funktionsembeddingsbaserad IAD.

I en rekonstruktionsbaserad IAD-ram, är det primära målet att rekonstruera avvikelseprover till deras respektive normala motståndarprover och upptäcka avvikelser genom rekonstruktionsfelberäkning. SCADN, RIAD, AnoDDPM och InTra använder olika rekonstruktionsramverk, från generativa adversariala nätverk och autoencoders till diffusionsmodell och transformer.

Å andra sidan, i en funktionsembeddingsbaserad IAD-ram, är det primära motivet att fokusera på att modellera funktionsembeddningen av normala data. Metoder som PatchSSVD försöker hitta en hypersfär som kan omsluta normala prover tätt, medan ramverk som PyramidFlow och Cfl projicerar normala prover på en Gaussisk distribution med hjälp av normaliserande flöden. CFA- och PatchCore-ramverken har etablerat en minnesbank av normala prover från patch-embryon och använder avståndet mellan testprovs-embryot och normalt embryot för att upptäcka avvikelser.

Båda dessa metoder följer “one class one model”-paradigmet, ett lärandeparadigm som kräver en stor mängd normala prover för att lära sig distributionerna för varje objektkategori. Kravet på en stor mängd normala prover gör det omöjligt för nya objekt kategorier och med begränsad tillämpning i dynamiska produktmiljöer. Å andra sidan använder AnomalyGPT-ramverket ett in-context-lärandeparadigm för objekt kategorier, vilket tillåter det att aktivera interferens endast med ett fåtal normala prover.

Vidare har vi stora visionsspråkmodeller eller LVLM. LLM eller stora språkmodeller har haft enorm framgång i NLP-branschen och undersöks nu för deras tillämpningar i visuella uppgifter. BLIP-2-ramverket använder Q-former för att mata in visuella funktioner från Vision Transformer till Flan-T5-modellen. Dessutom ansluter MiniGPT-ramverket bildsegmentet i BLIP-2-ramverket och Vicuna-modellen med en linjär skikt och utför en tvåstegs finjusteringsprocess med hjälp av bild-textdata. Dessa tillvägagångssätt indikerar att LLM-ramverk kan ha vissa tillämpningar för visuella uppgifter. Men dessa modeller har tränats på allmänna data och saknar den erforderliga domänspecifika expertisen för omfattande tillämpningar.

Hur Fungerar AnomalyGPT?

AnomalyGPT i sin kärna är en ny konversationsbaserad IAD-stor visionsspråkmodell som är utformad för att upptäcka industriella avvikelser och peka ut deras exakta läge med hjälp av bilder. AnomalyGPT-ramverket använder en LLM och en förtränad bildencoder för att justera bilder med deras respektive textbeskrivningar med hjälp av stimulerad avvikelsedata. Modellen introducerar en dekodermodul och en promptlärarmodul för att förbättra prestandan för IAD-systemen och uppnå pixelnivålokalisering.

Modellarkitektur

Bilden ovan visar arkitekturen för AnomalyGPT. Modellen passerar först frågebilden till den frusna bildencodern. Modellen extraherar sedan patchnivåfunktioner från de mellanliggande lagren och matar in dessa funktioner till en bilddekoder för att beräkna deras likhet med abnormala och normala texter för att få lokaliseringresultat. Promptläraren omvandlar sedan dessa till prompt-embryon som kan användas som indata till LLM tillsammans med användar-textinmatning. LLM-modellen använder sedan prompt-embryona, bildinmatning och användar-textinmatning för att upptäcka avvikelser, peka ut deras läge och skapa slut-svar för användaren.

Dekoder

För att uppnå pixelnivåavvikelselokalisering använder AnomalyGPT-modellen en lättviktig funktionssökningsbaserad bilddekoder som stöder både få-skott-IAD-ramverk och oövervakade IAD-ramverk. Dekoderns design i AnomalyGPT är inspirerad av WinCLIP-, PatchCore- och APRIL-GAN-ramverken. Modellen delar upp bildencodern i 4 faser och extraherar de mellanliggande patchnivåfunktionerna från varje fas.

Men dessa mellanliggande funktioner har inte genomgått den slutliga bild-textjusteringen, vilket är varför de inte kan jämföras direkt med funktioner. För att hantera detta problem introducerar AnomalyGPT-modellen ytterligare lager för att projicera mellanliggande funktioner och justera dem med textfunktioner som representerar normala och abnormala semantik.

Promptlärare

AnomalyGPT-ramverket introducerar en promptlärare som försöker omvandla lokaliseringresultatet till prompt-embryon för att utnyttja fina semantiska detaljer från bilder och också upprätthålla semantisk konsekvens mellan dekoder- och LLM-utdata. Dessutom inkorporerar modellen lärbart prompt-embryon, orelaterade till dekoderutdata, i promptläraren för att tillhandahålla ytterligare information för IAD-uppgiften. Slutligen matar modellen in embryona och ursprunglig bildinformation till LLM.

Promptläraren består av lärbart basprompt-embryon och ett konvolutionsneuronnät. Nätverket omvandlar lokaliseringresultatet till prompt-embryon och bildar en uppsättning prompt-embryon som sedan kombineras med bild-embryona i LLM.

AvvikelseSimulering

AnomalyGPT-modellen antar NSA-metoden för att simulera avvikelsedata. NSA-metoden använder Cut-paste-tekniken med hjälp av Poisson-bildredigering för att lindra diskontinuiteten som introduceras av att klistra in bildsegment. Cut-paste är en vanlig teknik i IAD-ramverk för att generera simulerade avvikelsebilder.

Cut-paste-metoden innebär att en blockregion skärs ut från en bild slumpmässigt och klistras in i en slumpmässig plats i en annan bild, vilket skapar en del av simulerad avvikelse. Dessa simulerade avvikelseprover kan förbättra prestandan för IAD-modeller, men det finns en nackdel, eftersom de ofta kan producera märkbara diskontinuiteter. Poisson-redigeringsmetoden syftar till att klona ett föremål från en bild till en annan genom att lösa Poisson-differential ekvationer.

Bilden ovan visar jämförelsen mellan Poisson och Cut-paste-bildredigering. Som det kan ses, finns det synliga diskontinuiteter i Cut-paste-metoden, medan resultaten från Poisson-redigering verkar mer naturliga.

Fråga och Svar Innehåll

För att utföra promptjustering på den stora visionsspråkmodellen genererar AnomalyGPT-modellen en motsvarande textfråga baserat på avvikelsebilden. Varje fråga består av två huvudsakliga komponenter. Den första delen av frågan består av en beskrivning av inmatningsbilden som tillhandahåller information om de föremål som finns i bilden tillsammans med deras förväntade attribut. Den andra delen av frågan är att upptäcka förekomsten av avvikelser inom föremålet eller kontrollera om det finns en avvikelse i bilden.

LVLM svarar först på frågan om det finns en avvikelse i bilden. Om modellen upptäcker avvikelser fortsätter den att specificera läget och antalet avvikande områden. Modellen delar upp bilden i en 3×3-rutnät av distinkta regioner för att tillåta LVLM att verbalt ange avvikelsens position, som visas i figuren nedan.

LVLM-modellen matas med deskriptiv kunskap om inmatningsbilden med grundläggande kunskap om inmatningsbilden som hjälper modellens förståelse av bildkomponenter bättre.

Dataset och Utvärderingsmetoder

Modellen utför sina experiment främst på VisA- och MVTec-AD-dataseten. MVTech-AD-dataseten består av 3629 bilder för träningsändamål och 1725 bilder för test som är uppdelade över 15 olika kategorier, vilket gör det till ett av de mest populära dataseten för IAD-ramverk. Träningsbilderna har endast normala bilder, medan testbilderna har både normala och avvikande bilder. Å andra sidan består VisA-dataseten av 9621 normala bilder och nästan 1200 avvikande bilder som är uppdelade över 12 olika kategorier.

Vidare, precis som befintliga IAD-ramverk, använder AnomalyGPT-modellen AUC eller Area Under the Receiver Operating Characteristics som utvärderingsmetod, med pixelnivå och bildnivå AUC som används för att bedöma avvikelselokalisering och avvikelseupptäckt. Men modellen använder också bildnivå noggrannhet för att utvärdera prestandan för den föreslagna metoden, eftersom den unikt tillåter att bestämma förekomsten av avvikelser utan krav på manuell tröskelinställning.

Resultat

Kvantitativa Resultat

Få-skott Industriell Avvikelseidentifiering

AnomalyGPT-modellen jämför sina resultat med tidigare få-skott-IAD-ramverk, inklusive PaDiM, SPADE, WinCLIP och PatchCore som baslinjer.

Bilden ovan jämför resultaten från AnomalyGPT-modellen i jämförelse med få-skott-IAD-ramverk. Över båda dataseten överträffar metoden som följs av AnomalyGPT tidigare modellers tillvägagångssätt i termer av bildnivå AUC och returnerar också bra noggrannhet.

Oövervakad Industriell Avvikelseidentifiering

I en oövervakad träningsinställning med ett stort antal normala prover tränar AnomalyGPT en enda modell på prover som erhållits från alla klasser inom ett dataset. Utvecklarna av AnomalyGPT har valt UniAD-ramverket eftersom det tränas under samma inställning och kommer att fungera som en baslinje för jämförelse. Dessutom jämför modellen också med JNLD- och PaDim-ramverken med hjälp av samma enhetliga inställning.

Bilden ovan jämför prestandan för AnomalyGPT i jämförelse med andra ramverk.

Kvalitativa Resultat

Bilden ovan visar prestandan för AnomalyGPT-modellen i oövervakad avvikelseidentifiering, medan figuren nedan demonstrerar prestandan för modellen i 1-skott-in-context-lärande.

AnomalyGPT-modellen kan indikera förekomsten av avvikelser, markera deras läge och tillhandahålla pixelnivålokalisering. När modellen är i 1-skott-in-context-lärande är lokaliseringprestandan för modellen något lägre jämfört med oövervakat lärande på grund av avsaknad av träningsdata.

Slutsats

AnomalyGPT är en ny konversationsbaserad IAD-visionsspråkmodell som är utformad för att utnyttja de kraftfulla funktionerna hos stora visionsspråkmodeller. Den kan inte bara identifiera avvikelser i en bild utan också peka ut deras exakta lägen. Dessutom möjliggör AnomalyGPT multi-turn dialoger som fokuserar på avvikelseidentifiering och visar enastående prestanda i få-skott-in-context-lärande. AnomalyGPT undersöker de potentiella tillämpningarna av LVLM i avvikelseidentifiering och introducerar nya idéer och möjligheter för IAD-branschen.

En ingenjör till yrket, en författare av hjärtat. Kunal är en teknisk skribent med ett djupt kärlek och förståelse för AI och ML, dedikerad till att förenkla komplexa begrepp inom dessa områden genom sin engagerande och informativa dokumentation.