Modely a platformy AI

AnomalyGPT: Detekce průmyslových anomálií pomocí LVLM

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Nedávno byly představeny Large Vision Language Models (LVLM) jako LLava a MiniGPT-4, které prokázaly schopnost rozumět obrazům a dosahovat vysoké přesnosti a efektivity v několika vizuálních úkolech. Zatímco LVLM excelují v rozpoznávání běžných objektů díky svým rozsáhlým trénovacím datovým sadám, postrádají specifické znalosti z konkrétního odvětví a mají omezené pochopení lokalizovaných detailů v obrazech. To omezuje jejich účinnost při úkolech průmyslové detekce anomálií (IAD). Na druhé straně existující rámce IAD mohou pouze identifikovat zdroje anomálií a vyžadují manuální nastavení prahových hodnot pro rozlišení mezi normálními a anomálními vzorky, což omezuje jejich praktickou implementaci.

Primárním účelem rámce IAD je detekovat a lokalizovat anomálie v průmyslových scénářích a obrazech produktů. Nicméně kvůli nepředvídatelnosti a vzácnosti reálných obrazových vzorků jsou modely obvykle trénovány pouze na normálních datech. Rozlišují anomální vzorky od normálních na základě odchylek od typických vzorků. V současné době rámce IAD a modely poskytují především skóre anomálií pro testovací vzorky. Kromě toho rozlišení mezi normálními a anomálními instancemi pro každou třídu položek vyžaduje manuální specifikaci prahových hodnot, což je činí nevhodnými pro reálné aplikace.

Prozkoumání použití a implementace Large Vision Language Models při řešení problémů, které představují rámce IAD, byl představen AnomalyGPT, nový přístup IAD založený na LVLM. AnomalyGPT může detekovat a lokalizovat anomálie bez potřeby manuálního nastavení prahových hodnot. Kromě toho AnomalyGPT může také poskytnout relevantní informace o obraze a interagovat s uživateli, aby mohli klást další otázky na základě anomálie nebo svých konkrétních potřeb.

Průmyslová detekce anomálií a Large Vision Language Models

Existující rámce IAD lze rozdělit do dvou kategorií.

  1. Rekonstrukční IAD.
  2. IAD založený na vkládání funkcí.

V rekonstrukčním rámci IAD je primárním cílem rekonstruovat anomální vzorky na jejich odpovídající normální protějšky a detekovat anomálie pomocí výpočtu rekonstrukční chyby. SCADN, RIAD, AnoDDPM a InTra využívají různých rekonstrukčních rámců, od Generative Adversarial Networks (GAN) a autoencoderů až po modely difuze a transforméry.

Na druhé straně, v rámci IAD založeném na vkládání funkcí, je primárním cílem zaměřit se na modelování vkládání funkcí normálních dat. Metody jako PatchSSVD se snaží najít hypersféru, která může těsně obalit normální vzorky, zatímco rámce jako PyramidFlow a Cfl projekují normální vzorky na Gaussian distribuci pomocí normalizujících toků. Rámce CFA a PatchCore zavedly paměťový bank normálních vzorků z vkládání patchů a používají vzdálenost mezi testovacím vzorkem a normálním vkládáním k detekci anomálií.

Oba tyto metody následují „jednu třídu, jeden model“, učení paradigmata, které vyžaduje velké množství normálních vzorků pro naučení distribucí každého objektu. Požadavek na velké množství normálních vzorků činí jej nepraktickým pro nové kategorie objektů a s omezenými aplikacemi v dynamických produkčních prostředích. Na druhé straně rámec AnomalyGPT využívá paradigmata učení v kontextu pro kategorie objektů, což umožňuje interferenci pouze s malým množstvím normálních vzorků.

Pokračujeme s Large Vision Language Models nebo LVLM. LLM nebo Large Language Models měly enormní úspěch v odvětví NLP a nyní se prozkoumávají jejich aplikace ve vizuálních úkolech. Rámec BLIP-2 využívá Q-former k vložení vizuálních funkcí z Vision Transformer do modelu Flan-T5. Kromě toho rámec MiniGPT spojuje obrazový segment rámce BLIP-2 a model Vicuna lineární vrstvou a provádí dvoufázový proces jemného ladění pomocí obrazových a textových dat. Tyto přístupy naznačují, že rámce LLM mohou mít některé aplikace pro vizuální úkoly. Nicméně tyto modely byly trénovány na obecných datech a postrádají požadované odborné znalosti pro široké aplikace.

Jak AnomalyGPT funguje?

AnomalyGPT je v jádru novým konverzačním modelem IAD Large Vision Language, navrženým primárně pro detekci průmyslových anomálií a určení jejich přesné polohy pomocí obrazů. Rámec AnomalyGPT využívá LLM a předtrénovaný obrazový encoder k zarovnání obrazů s jejich odpovídajícími textovými popisy pomocí stimulovaných anomálních dat. Model zavádí dekodérský modul a modul prompt learnera pro zlepšení výkonu systémů IAD a dosažení výstupu lokalizace na úrovni pixelů.

Architektura modelu

Výše uvedený obraz znázorňuje architekturu AnomalyGPT. Model nejprve předává dotazovaný obraz do zmrazeného obrazového encoderu. Model poté extrahuje funkce na úrovni patche z meziproduktů a krmit je do obrazového dekodéru pro výpočet jejich podobnosti s abnormálními a normálními texty pro získání výsledků lokalizace. Modul prompt learner poté převádí je do prompt embeddingů, které lze použít jako vstup do LLM spolu s uživatelskými textovými vstupy. Model LLM poté využívá prompt embeddingy, obrazové vstupy a uživatelské textové vstupy k detekci anomálií, určení jejich polohy a vytváření konečných odpovědí pro uživatele.

Dekodér

Pro dosažení lokalizace anomálií na úrovni pixelů nasazuje model AnomalyGPT lehký dekodér založený na funkci matchování, který podporuje jak few-shot rámce IAD, tak nesupervizované rámce IAD. Design dekodéru použitý v AnomalyGPT je inspirován rámci WinCLIP, PatchCore a APRIL-GAN. Model rozděluje obrazový encoder do 4 fází a extrahuje meziproduktové funkce na úrovni patche z každé fáze.

Nicméně tyto meziproduktové funkce neprošly konečným zarovnáním obrazu a textu, a proto je nelze přímo porovnávat s funkcemi. Pro řešení tohoto problému model AnomalyGPT zavádí další vrstvy, aby projektované meziproduktové funkce a zarovnaly je s textovými funkcemi, které reprezentují normální a abnormální sémantiku.

Prompt learner

Rámec AnomalyGPT zavádí modul prompt learner, který se snaží transformovat výsledek lokalizace do prompt embeddingů, aby využil jemné sémantiky z obrazů a zároveň zachoval sémantickou konzistenci mezi výstupy dekodéru a LLM. Kromě toho model zahrnuje učitelné prompt embeddingy, které nejsou spojeny s výstupy dekodéru, do modulu prompt learnera, aby poskytly další informace pro úkol IAD. Nakonec model krmit embeddingy a původní obrazové informace do LLM.

Modul prompt learner se skládá z učitelných základních prompt embeddingů a konvoluční neuronové sítě. Síť převádí výsledek lokalizace do prompt embeddingů a vytváří sadu prompt embeddingů, které jsou poté kombinovány s obrazovými embeddingy do LLM.

Simulace anomálií

Model AnomalyGPT přijímá metodu NSA pro simulaci anomálních dat. Metoda NSA využívá techniku Cut-paste pomocí metody Poisson image editing pro zmírnění diskontinuity zavedené vkládáním segmentů obrazu. Cut-paste je běžně používaná technika v rámcích IAD pro generování simulovaných anomálních obrazů.

Metoda Cut-paste zahrnuje ořezání blokové oblasti z obrazu náhodně a vkládání jej do náhodné polohy v jiném obraze, čímž se vytváří část simulované anomálie. Tyto simulované anomální vzorky mohou zlepšit výkon modelů IAD, ale existuje nevýhoda, protože mohou často produkovat zřetelné diskontinuity. Metoda Poisson editing se snaží bezproblémově klonovat objekt z jednoho obrazu do jiného řešením Poissonových parciálních diferenciálních rovnic.

Výše uvedený obraz znázorňuje srovnání mezi metodami Poisson a Cut-paste. Jak je vidět, existují zřetelné diskontinuity v metodě Cut-paste, zatímco výsledky z metody Poisson vypadají přirozeněji.

Obsah otázek a odpovědí

Pro provedení promptového ladění na Large Vision Language Model generuje model AnomalyGPT odpovídající textový dotaz na základě anomálního obrazu. Každý dotaz se skládá ze dvou hlavních součástí. První část dotazu se skládá z popisu vstupního obrazu, který poskytuje informace o objektech přítomných v obraze spolu s jejich očekávanými atributy. Druhá část dotazu je detekce přítomnosti anomálií v rámci objektu nebo zjištění, zda existuje anomálie v obraze.

Model LLM nejprve reaguje na dotaz, zda existuje anomálie v obraze. Pokud model detekuje anomálie, pokračuje ve specifikaci polohy a počtu anomálních oblastí. Model rozděluje obraz do 3×3 mřížky samostatných oblastí, aby umožnil modelu LLM ústně označit polohu anomálií, jak je znázorněno na obrázku níže.

Model LLM je krmen znalostmi vstupního obrazu s fundamentálními znalostmi vstupního obrazu, které pomáhají modelu lépe pochopit složky obrazu.

Datové sady a metriky hodnocení

Model provádí experimenty primárně na datech VisA a MVTec-AD. Datová sada MVTec-AD se skládá z 3629 obrazů pro trénovací účely a 1725 obrazů pro testovací účely, rozdělených do 15 různých kategorií, což z ní činí jednu z nejpopulárnějších datových sad pro rámce IAD. Trénovací obrazové funkce pouze normální obrazů, zatímco testovací obrazové funkce zahrnují jak normální, tak anomální obrazů. Na druhé straně datová sada VisA se skládá z 9621 normálních obrazů a téměř 1200 anomálních obrazů, rozdělených do 12 různých kategorií.

Pokračujeme, podobně jako existující rámec IAD, model AnomalyGPT využívá AUC nebo plochu pod křivkou ROC jako metriku hodnocení, s použitím AUC na úrovni pixelů a obrazů pro hodnocení výkonu lokalizace anomálií a detekce anomálií. Nicméně model také využívá obrazovou přesnost pro hodnocení výkonu navrhovaného přístupu, protože umožňuje určit přítomnost anomálií bez potřeby manuálního nastavení prahových hodnot.

Výsledky

Kvantitativní výsledky

Few-Shot průmyslová detekce anomálií

Model AnomalyGPT srovnává své výsledky s předchozími few-shot rámci IAD, včetně PaDiM, SPADE, WinCLIP a PatchCore, jako základny.

Výše uvedený obrázek srovnává výsledky modelu AnomalyGPT s few-shot rámci IAD. Napříč oběma datovými sadami metoda AnomalyGPT překonává přístupy předchozích modelů z hlediska obrazové AUC a také dosahuje dobré přesnosti.

Nesupervizovaná průmyslová detekce anomálií

V nesupervizovaném trénovacím nastavení s velkým množstvím normálních vzorků trénuje model AnomalyGPT jeden model na vzorcích získaných ze všech tříd v datové sadě. Vývojáři modelu AnomalyGPT zvolili rámec UniAD, protože je trénován ve stejném nastavení a bude sloužit jako základna pro srovnání. Kromě toho model také srovnává s rámci JNLD a PaDim pomocí stejného sjednoceného nastavení.

Výše uvedený obrázek srovnává výkon modelu AnomalyGPT s ostatními rámci.

Kvalitativní výsledky

Výše uvedený obrázek znázorňuje výkon modelu AnomalyGPT v nesupervizované detekci anomálií, zatímco obrázek níže demonstruje výkon modelu v 1-shot in-context learning.

Model AnomalyGPT je schopen označit přítomnost anomálií, určit jejich polohu a poskytovat výsledky lokalizace na úrovni pixelů. Když je model v režimu 1-shot in-context learning, výkon lokalizace modelu je mírně nižší ve srovnání s nesupervizovaným učením kvůli absence trénování.

Závěr

AnomalyGPT je novým konverzačním modelem IAD-vision language, navrženým pro využití silných schopností Large Vision Language Models. Může nejen identifikovat anomálie v obraze, ale také určit jejich přesnou polohu. Kromě toho AnomalyGPT umožňuje vícevrstvé dialogy zaměřené na detekci anomálií a dosahuje vynikajícího výkonu v few-shot in-context learning. AnomalyGPT zkoumá potenciální aplikace LVLM v detekci anomálií, zavádí nové nápady a možnosti pro odvětví IAD.

Inženýr z povolání, spisovatel ze srdce. Kunal je technický spisovatel s hlubokou láskou a porozuměním pro AI a ML, který se věnuje zjednodušování složitých konceptů v těchto oblastech prostřednictvím svých přitažlivých a informačních dokumentací.