Modele și platforme AI

AnomalyGPT: Detectarea Anomaliilor Industriale Folosind LVLM

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Recent, Modelele Mari de Limbaj Vizual (LVLM) precum LLava și MiniGPT-4 au demonstrat capacitatea de a înțelege imagini și de a obține o acuratețe și eficiență ridicată în mai multe sarcini vizuale. În timp ce LVLM-urile excelează la recunoașterea obiectelor comune datorită seturilor lor extinse de date de antrenare, ele lipsesc de cunoștințe specifice de domeniu și au o înțelegere limitată a detaliilor localizate din imagini. Acest lucru limitează eficacitatea lor în sarcinile de detectare a anomaliilor industriale (IAD). Pe de altă parte, cadrele existente de IAD pot identifica doar sursele de anomalii și necesită setări manuale de prag pentru a distinge între mostre normale și anormale, ceea ce restricționează implementarea lor practică.

Scopul principal al unui cadru de IAD este de a detecta și localiza anomaliile în scenarii și imagini industriale. Cu toate acestea, datorită imprevizibilității și rarității mostrelor de imagini din lumea reală, modelele sunt de obicei antrenate doar pe date normale. Ele diferențiază mostrele anormale de cele normale pe baza abaterilor de la mostrele tipice. În prezent, cadrele și modelele de IAD oferă în principal scoruri de anomaliile pentru mostrele de test. Mai mult, diferențierea între instanțele normale și anormale pentru fiecare clasă de articole necesită specificarea manuală a pragurilor, ceea ce le face nepotrivite pentru aplicații din lumea reală.

Pentru a explora utilizarea și implementarea Modelelor Mari de Limbaj Vizual în abordarea provocărilor impuse de cadrele de IAD, AnomalyGPT, o abordare nouă de IAD bazată pe LVLM, a fost introdusă. AnomalyGPT poate detecta și localiza anomaliile fără necesitatea de setări manuale de prag. Mai mult, AnomalyGPT poate oferi, de asemenea, informații pertinente despre imagine pentru a interacționa în mod interactiv cu utilizatorii, permițându-le să pună întrebări suplimentare pe baza anomaliilor sau a nevoilor lor specifice.

Detectarea Anomaliilor Industriale și Modelele Mari de Limbaj Vizual

Cadrele existente de IAD pot fi împărțite în două categorii.

  1. IAD bazat pe reconstrucție.
  2. IAD bazat pe încorporarea caracteristicilor.

Într-un cadru de IAD bazat pe reconstrucție, scopul principal este de a reconstrui mostrele de anomaliile la mostrele lor normale corespunzătoare și de a detecta anomaliile prin calcularea erorii de reconstrucție. SCADN, RIAD, AnoDDPM și InTra utilizează diferite cadre de reconstrucție, de la Rețele Adversative Generative (GAN) și autoencoderi la modele de difuzie și transformatoare.

Pe de altă parte, într-un cadru de IAD bazat pe încorporarea caracteristicilor, scopul principal este de a se concentra pe modelarea încorporării caracteristicilor datelor normale. Metodele precum PatchSSVD încearcă să găsească o hipersferă care să poată încorpora mostrele normale strâns, în timp ce cadrele precum PyramidFlow și Cfl proiectează mostrele normale pe o distribuție Gaussiană utilizând fluxuri normalizatoare. Cadrele CFA și PatchCore au stabilit o bancă de date cu mostre normale din încorporări de patch-uri și utilizează distanța dintre încorporarea mostrei de test și încorporarea normală pentru a detecta anomaliile.

Ambele metode urmează paradigmei de învățare „o clasă, un model”, care necesită un număr mare de mostre normale pentru a învăța distribuțiile fiecărui obiect. Cerința pentru un număr mare de mostre normale face ca acestea să fie impracticabile pentru categorii de obiecte noi și cu aplicații limitate în medii de produse dinamice. Pe de altă parte, cadrul AnomalyGPT utilizează o paradigmă de învățare în context pentru categoriile de obiecte, permițându-i să permită interferența doar cu un număr mic de mostre normale.

Înainte, am Modelele Mari de Limbaj Vizual sau LVLM. Modelele Mari de Limbaj (LLM) au avut un succes enorm în industria NLP și acum sunt explorate pentru aplicațiile lor în sarcini vizuale. Cadrul BLIP-2 utilizează Q-former pentru a introduce caracteristici vizuale din Transformatorul de Viziune în modelul Flan-T5. Mai mult, cadrul MiniGPT conectează segmentul de imagine al cadrului BLIP-2 și modelul Vicuna cu un strat liniar și efectuează un proces de finisare în două etape utilizând date de imagine-text. Aceste abordări indică faptul că cadrele LLM ar putea avea anumite aplicații pentru sarcini vizuale. Cu toate acestea, aceste modele au fost antrenate pe date generale și lipsesc de expertiza specifică de domeniu necesară pentru aplicații largi.

Cum Funcționează AnomalyGPT?

AnomalyGPT, în esență, este un model de limbaj vizual conversațional nou și inovator, proiectat în primul rând pentru detectarea anomaliilor industriale și localizarea exactă a acestora utilizând imagini. Cadrul AnomalyGPT utilizează un LLM și un codificator de imagine preantrenat pentru a alinia imagini cu descrierile lor textuale corespunzătoare utilizând date de anomaliile stimulate. Modelul introduce un modul decodificator și un modul de învățare a prompturilor pentru a îmbunătăți performanța sistemelor de IAD și pentru a obține ieșiri de localizare la nivel de pixel.

Arhitectura Modelului

Imaginea de mai sus prezintă arhitectura AnomalyGPT. Modelul trece mai întâi imaginea de întrebare prin codificatorul de imagine înghețat. Modelul extrage apoi caracteristici la nivel de patch din straturile intermediare și le alimentează într-un decodificator de imagine pentru a calcula similaritatea lor cu texte anormale și normale pentru a obține rezultatele de localizare. Modulul de învățare a prompturilor convertește apoi acestea în încorporări de prompturi care pot fi utilizate ca intrări în LLM, alături de intrările textuale furnizate de utilizator. Modelul LLM utilizează apoi încorporările de prompturi, intrările de imagine și intrările textuale furnizate de utilizator pentru a detecta anomaliile, a localiza și a crea răspunsuri finale pentru utilizator.

Decodificator

Pentru a obține localizarea anomaliilor la nivel de pixel, modelul AnomalyGPT utilizează un decodificator de imagine ușor bazat pe potrivirea caracteristicilor, care susține atât cadrele de IAD cu puține mostre, cât și cadrele de IAD nesupravegheate. Proiectarea decodificatorului utilizat în AnomalyGPT este inspirată de cadrele WinCLIP, PatchCore și APRIL-GAN. Modelul împarte codificatorul de imagine în 4 etape și extrage caracteristici la nivel de patch intermediare de la fiecare etapă.

Cu toate acestea, aceste caracteristici intermediare nu au fost supuse alinierii finale imagine-text, ceea ce înseamnă că nu pot fi comparate direct cu caracteristici. Pentru a aborda această problemă, modelul AnomalyGPT introduce straturi suplimentare pentru a proiecta caracteristici intermediare și a le alinia cu caracteristici de text care reprezintă semantica normală și anormală.

Învățarea Prompturilor

Cadrul AnomalyGPT introduce un modul de învățare a prompturilor care încearcă să transforme rezultatul de localizare în încorporări de prompturi pentru a valorifica semantica fină din imagini și pentru a menține coerența semantică între ieșirile decodificatorului și LLM. Mai mult, modelul incorporează încorporări de prompturi învățabile, nelegate de ieșirile decodificatorului, în modulul de învățare a prompturilor pentru a oferi informații suplimentare pentru sarcina de IAD. În final, modelul alimentează încorporările și informațiile originale de imagine în LLM.

Modulul de învățare a prompturilor constă din încorporări de prompturi de bază învățabile și o rețea neurală convoluțională. Rețeaua convertește rezultatul de localizare în încorporări de prompturi și formează un set de încorporări de prompturi care sunt apoi combinate cu încorporările de imagine în LLM.

Simularea Anomaliilor

Modelul AnomalyGPT adoptă metoda NSA pentru a simula datele anormale. Metoda NSA utilizează tehnica de decupare și lipire, utilizând metoda de editare a imaginilor Poisson pentru a atenua discontinuitatea introdusă prin lipirea segmentelor de imagine. Decuparea și lipirea sunt o tehnică comună utilizată în cadrele de IAD pentru a genera imagini simulate de anomaliile.

Metoda de decupare și lipire implică decuparea unei regiuni de bloc dintr-o imagine în mod aleator și lipirea acesteia într-o locație aleatoare într-o altă imagine, creând astfel o porțiune de anomaliile simulate. Mostrele de anomaliile simulate pot îmbunătăți performanța modelelor de IAD, dar există un dezavantaj, deoarece acestea pot produce adesea discontinuități evidente. Metoda de editare Poisson își propune să cloneze în mod seamăn un obiect dintr-o imagine în alta, rezolvând ecuațiile diferențiale parțiale Poisson.

Imaginea de mai sus ilustrează comparația dintre editarea Poisson și decuparea și lipirea. Așa cum se poate vedea, există discontinuități evidente în metoda de decupare și lipire, în timp ce rezultatele editării Poisson par mai naturale.

Conținutul Întrebărilor și Răspunsurilor

Pentru a efectua ajustarea prompturilor pe Modelul de Limbaj Vizual Mare, modelul AnomalyGPT generează o întrebare textuală corespunzătoare pe baza imaginii de anomaliile. Fiecare întrebare constă din două componente principale. Prima parte a întrebării constă dintr-o descriere a imaginii de intrare care oferă informații despre obiectele prezente în imagine, împreună cu atributele lor așteptate. A doua parte a întrebării este de a detecta prezența anomaliilor în obiect sau de a verifica dacă există o anomaliile în imagine.

Modelul LLM răspunde mai întâi la întrebarea dacă există o anomaliile în imagine. Dacă modelul detectează anomaliile, continuă să specifice locația și numărul de zone anormale. Modelul împarte imaginea într-o grilă de 3×3 de regiuni distincte pentru a permite modelului LLM să indice poziția anomaliilor în mod verbal, așa cum se arată în figura de mai jos.

Modelul LLM este alimentat cu cunoștințe descriptive ale intrării, împreună cu cunoștințe fundamentale ale imaginii de intrare, care ajută modelul să înțeleagă mai bine componentele imaginii.

Date și Metrice de Evaluare

Modelul efectuează experimentele sale în principal pe seturile de date VisA și MVTec-AD. Setul de date MVTec-AD constă din 3629 de imagini pentru antrenare și 1725 de imagini pentru testare, împărțite în 15 categorii diferite, ceea ce îl face unul dintre cele mai populare seturi de date pentru cadrele de IAD. Imaginile de antrenare prezintă doar imagini normale, în timp ce imaginile de testare includ atât imagini normale, cât și anormale. Pe de altă parte, setul de date VisA constă din 9621 de imagini normale și aproximativ 1200 de imagini anormale, împărțite în 12 categorii diferite.

În continuare, la fel ca și cadrele existente de IAD, modelul AnomalyGPT utilizează AUC (Aria Sub Curba ROC) ca metrică de evaluare, cu AUC la nivel de pixel și la nivel de imagine utilizate pentru a evalua performanța de localizare a anomaliilor și, respectiv, detectarea anomaliilor. Cu toate acestea, modelul utilizează, de asemenea, acuratețea la nivel de imagine pentru a evalua performanța abordării sale propuse, deoarece aceasta permite în mod unic determinarea prezenței anomaliilor fără necesitatea de a seta praguri manual.

Rezultate

Rezultate Cantitative

Detectarea Anomaliilor Industriale cu Puține Mostre

Modelul AnomalyGPT compară rezultatele sale cu cadrele anterioare de IAD cu puține mostre, inclusiv PaDiM, SPADE, WinCLIP și PatchCore, ca puncte de referință.

Figura de mai sus compară rezultatele modelului AnomalyGPT cu cadrele de IAD cu puține mostre. Pe ambele seturi de date, metoda utilizată de AnomalyGPT depășește abordările utilizate de modelele anterioare în ceea ce privește AUC la nivel de imagine și returnează, de asemenea, o bună acuratețe.

Detectarea Anomaliilor Industriale Nesupravegheată

Într-un mediu de antrenare nesupravegheat, cu un număr mare de mostre normale, AnomalyGPT antrenează un singur model pe mostre obținute din toate clasele dintr-un set de date. Dezvoltatorii AnomalyGPT au ales cadrul UniAD deoarece este antrenat în același mod și va servi ca punct de referință pentru comparație. Mai mult, modelul compară, de asemenea, cu cadrele JNLD și PaDim, utilizând același mediu unificat.

Figura de mai sus compară performanța AnomalyGPT cu alte cadre.

Rezultate Calitative

Imaginea de mai sus ilustrează performanța modelului AnomalyGPT în detectarea anomaliilor nesupravegheată, în timp ce figura de mai jos demonstrează performanța modelului în învățarea contextuală cu o singură mostră.

Modelul AnomalyGPT este capabil să indice prezența anomaliilor, să marcheze locația și să furnizeze rezultate de localizare la nivel de pixel. Când modelul este în modul de învățare contextuală cu o singură mostră, performanța de localizare a modelului este ușor mai scăzută în comparație cu metoda de antrenare nesupravegheată, din cauza lipsei de antrenare.

Concluzii

AnomalyGPT este un model de limbaj vizual conversațional nou și inovator, proiectat pentru a valorifica capacitățile puternice ale Modelelor Mari de Limbaj Vizual. El nu numai că poate identifica anomaliile într-o imagine, dar poate și localiza exact locația acestora. În plus, AnomalyGPT facilitează dialoguri multi-tur pentru detectarea anomaliilor și prezintă o performanță remarcabilă în învățarea contextuală cu puține mostre. AnomalyGPT explorează aplicațiile potențiale ale Modelelor Mari de Limbaj Vizual în detectarea anomaliilor, introducând idei și posibilități noi pentru industria IAD.

"Un inginer de profesie, un scriitor din inimă". Kunal este un scriitor tehnic cu o dragoste și o înțelegere profundă a inteligenței artificiale și a învățării automate, dedicat simplificării conceptelor complexe din aceste domenii prin documentația sa captivantă și informativă.