Modele i platformy AI

AnomalyGPT: Wykrywanie anomalii przemysłowych za pomocą modeli LVLM

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Ostatnio duże modele językowe i wizji (LVLM), takie jak LLava i MiniGPT-4, wykazały zdolność do zrozumienia obrazów i osiągnięcia wysokiej dokładności i wydajności w kilku zadaniach wizualnych. Chociaż LVLM są dobrze w rozpoznawaniu obiektów ze względu na ich obszerne zestawy danych szkoleniowych, brakuje im specjalistycznej wiedzy branżowej i mają ograniczone zrozumienie szczegółów w obrazach. To ogranicza ich skuteczność w zadaniach wykrywania anomalii przemysłowych (IAD). Z drugiej strony, istniejące ramy IAD mogą tylko identyfikować źródła anomalii i wymagają ręcznego ustawiania progów, aby odróżnić próbki normalne od anomalnych, co ogranicza ich praktyczne wdrożenie.

Głównym celem ram IAD jest wykrywanie i lokalizacja anomalii w scenariuszach przemysłowych i obrazach produktów. Jednak ze względu na nieprzewidywalność i rzadkość próbek obrazów z rzeczywistych danych, modele są szkolone tylko na danych normalnych. Różnicują próbki anomalne od normalnych na podstawie odchyleń od typowych próbek. Obecnie ramy IAD i modele głównie dostarczają wyniki anomalii dla próbek testowych. Ponadto, rozróżnianie między instancjami normalnymi i anomalnymi dla każdej klasy obiektów wymaga ręcznego określenia progów, co czyni je nieodpowiednimi dla aplikacji rzeczywistych.

W celu zbadania użycia i wdrożenia dużych modeli językowych i wizji w rozwiązywaniu problemów stawianych przez ramy IAD, wprowadzono nowe podejście IAD oparte na LVLM, nazwane AnomalyGPT. AnomalyGPT może wykrywać i lokalizować anomalie bez potrzeby ręcznego ustawiania progów. Ponadto, AnomalyGPT może również dostarczać istotne informacje o obrazie, umożliwiając interaktywne rozmowy z użytkownikami, pozwalając im na zadawanie pytań następczych na podstawie anomalii lub ich specyficznych potrzeb.

Wykrywanie anomalii przemysłowych i duże modele językowe i wizji

Istniejące ramy IAD można podzielić na dwie kategorie.

  1. Rekonstrukcyjne IAD.
  2. IAD oparte na wbudowaniu cech.

W ramach rekonstrukcyjnego IAD, głównym celem jest odtworzenie próbek anomalnych do ich odpowiednich normalnych próbek, a następnie wykrywanie anomalii poprzez obliczanie błędu rekonstrukcji. SCADN, RIAD, AnoDDPM i InTra wykorzystują różne ramy rekonstrukcyjne, od sieci przeciwstawnych i autoenkoderów po modele dyfuzyjne i transformatory.

Z drugiej strony, w ramach IAD opartego na wbudowaniu cech, głównym motywem jest modelowanie wbudowania cech danych normalnych. Metody takie jak PatchSSVD próbują znaleźć hiperkulę, która może objąć próbki normalne ściśle, podczas gdy ramy takie jak PyramidFlow i Cfl projektują próbki normalne na rozkład gaussowski przy użyciu normalizujących przepływów. CFA i PatchCore ramy ustanowiły bank pamięci próbek normalnych z wbudowań fragmentów, a następnie używają odległości między wbudowaniem próbki testowej a wbudowaniem normalnym, aby wykryć anomalie.

Obie te metody stosują się do „jednej klasy, jeden model”, paradygmatu uczenia, który wymaga dużej ilości próbek normalnych, aby nauczyć się rozkładów każdej klasy obiektów. Wymóg dużej ilości próbek normalnych sprawia, że jest to niepraktyczne dla nowych kategorii obiektów i ma ograniczone zastosowanie w dynamicznych środowiskach produktowych. Z drugiej strony, ramy AnomalyGPT wykorzystują paradygmat uczenia w kontekście dla kategorii obiektów, co pozwala im na interferencję tylko z niewielką ilością próbek normalnych.

Jak działa AnomalyGPT?

AnomalyGPT jest nowym podejściem do IAD opartym na LVLM, zaprojektowanym głównie do wykrywania anomalii przemysłowych i wskazywania ich dokładnej lokalizacji przy użyciu obrazów. Ramy AnomalyGPT wykorzystują LLM i wstępnie wytrenowany kodujący obraz, aby wyrównać obrazy z ich odpowiednimi opisami tekstowymi przy użyciu stymulowanych danych anomalnych. Model wprowadza moduł dekodera i moduł uczący się prompty, aby poprawić wydajność systemów IAD i osiągnąć wyniki lokalizacji na poziomie pikseli.

Architektura modelu

Powyższy obraz przedstawia architekturę AnomalyGPT. Model najpierw przekazuje obraz zapytania do zamrożonego kodującego obrazu. Następnie model wyodrębnia cechy na poziomie fragmentu z warstw pośrednich i karmi je do dekodera obrazu, aby obliczyć ich podobieństwo z tekstem anomalous i normalnym, aby uzyskać wyniki lokalizacji. Moduł uczący się prompty następnie konwertuje je na prompty wbudowania, które mogą być używane jako dane wejściowe do LLM wraz z wejściami tekstowymi użytkownika. Model LLM wykorzystuje wbudowania prompty, dane wejściowe obrazu i dane wejściowe tekstowe użytkownika, aby wykryć anomalie, wskazać ich lokalizację i utworzyć odpowiedzi końcowe dla użytkownika.

Dekoder

Aby osiągnąć lokalizację anomalii na poziomie pikseli, model AnomalyGPT wdrożył lekki dekoder obrazu oparty na dopasowaniu cech, który obsługuje zarówno ramy IAD z few-shot, jak i ramy IAD bez nadzoru. Projekt dekodera użytego w AnomalyGPT został zainspirowany przez ramy WinCLIP, PatchCore i APRIL-GAN. Model dzieli kodujący obraz na 4 etapy i wyodrębnia cechy na poziomie fragmentu z każdego etapu.

Jednakże, te cechy pośrednie nie przeszły jeszcze końcowego wyrównania obrazu i tekstu, co sprawia, że nie mogą być porównywane bezpośrednio z cechami. Aby rozwiązać ten problem, model AnomalyGPT wprowadza dodatkowe warstwy, aby przekształcić cechy pośrednie i wyrównać je z cechami tekstowymi, które reprezentują semantykę normalną i anomalous.

Moduł uczący się prompty

Ramy AnomalyGPT wprowadzają moduł uczący się prompty, który próbuje przekształcić wynik lokalizacji w prompty wbudowania, aby wykorzystać drobne semantyki z obrazów i utrzymać spójność semantyczną między wyjściami dekodera i LLM. Ponadto, model wprowadza wbudowania prompty, które nie są powiązane z wyjściami dekodera, do modułu uczącego się prompty, aby dostarczyć dodatkowe informacje dla zadania IAD. Następnie model karmi wbudowania i oryginalne informacje o obrazie do LLM.

Moduł uczący się prompty składa się z wbudowań prompty i sieci neuronowej wytrenowanej. Sieć konwertuje wynik lokalizacji w prompty wbudowania i tworzy zestaw prompty wbudowania, które są następnie łączone z wbudowaniami obrazu w LLM.

Symulacja anomalii

Model AnomalyGPT przyjmuje metodę NSA do symulacji danych anomalnych. Metoda NSA wykorzystuje technikę Cut-paste przy użyciu metody edycji obrazu Poisson, aby złagodzić nieciągłość wprowadzoną przez wklejanie fragmentów obrazu. Cut-paste to powszechnie używana technika w ramach IAD do generowania symulowanych obrazów anomalnych.

Metoda Cut-paste polega na wycięciu bloku regionu z obrazu losowo i wklejeniu go w losowej lokalizacji w innym obrazie, tworząc część symulowanego obrazu anomalnego. Te symulowane próbki anomalne mogą poprawić wydajność modeli IAD, ale istnieje wada, ponieważ mogą one często produkować zauważalne nieciągłości. Metoda edycji Poisson ma na celu bezszwowe klonowanie obiektu z jednego obrazu do innego, rozwiązując równania różniczkowe Poisson.

Powyższy obraz ilustruje porównanie między edycją Poisson a metodą Cut-paste. Jak widać, istnieją widoczne nieciągłości w metodzie Cut-paste, podczas gdy wyniki metody Poisson wydają się bardziej naturalne.

Zawartość pytań i odpowiedzi

Aby przeprowadzić tuning prompty na dużym modelu językowym i wizji, model AnomalyGPT generuje odpowiedni tekst zapytania na podstawie obrazu anomalnego. Każde zapytanie składa się z dwóch głównych składników. Pierwsza część zapytania składa się z opisu obrazu wejściowego, który dostarcza informacji o obiektach obecnych w obrazie wraz z ich oczekiwanymi atrybutami. Druga część zapytania dotyczy wykrycia obecności anomalii wewnątrz obiektu lub sprawdzenia, czy istnieje anomalia w obrazie.

Model LLM najpierw odpowiada na zapytanie, czy w obrazie występuje anomalia. Jeśli model wykryje anomalie, kontynuuje określanie lokalizacji i liczby obszarów anomalnych. Model dzieli obraz na siatkę 3×3 odrębnych regionów, aby umożliwić modelowi LLM wskazanie pozycji anomalii słownie, jak pokazano na poniższym rysunku.

Model LLM jest karmiony wiedzą opisaną wejścia z wiedzą podstawową wejścia, co pomaga modelowi lepiej zrozumieć składniki obrazu.

Zestawy danych i metryki oceny

Model przeprowadza eksperymenty głównie na zestawach danych VisA i MVTec-AD. Zestaw danych MVTech-AD składa się z 3629 obrazów do celów szkoleniowych i 1725 obrazów do testowania, podzielonych na 15 różnych kategorii, co sprawia, że jest to jeden z najpopularniejszych zestawów danych dla ram IAD. Obrazy szkoleniowe zawierają tylko obrazy normalne, podczas gdy obrazy testowe zawierają zarówno obrazy normalne, jak i anomalne. Z drugiej strony, zestaw danych VisA składa się z 9621 obrazów normalnych i około 1200 obrazów anomalnych, podzielonych na 12 różnych kategorii.

Idąc dalej, podobnie jak istniejące ramy IAD, model AnomalyGPT wykorzystuje AUC (obszar pod krzywą ROC) jako metrykę oceny, z AUC na poziomie pikseli i AUC na poziomie obrazu, aby ocenić wydajność lokalizacji anomalii i wykrywania anomalii odpowiednio. Jednak model wykorzystuje również dokładność na poziomie obrazu, aby ocenić wydajność proponowanego podejścia, ponieważ pozwala ono unikalnie określić obecność anomalii bez konieczności ręcznego ustawiania progów.

Wyniki

Wyniki ilościowe

Few-shot wykrywanie anomalii przemysłowych

Model AnomalyGPT porównuje swoje wyniki z poprzednimi ramami few-shot IAD, w tym PaDiM, SPADE, WinCLIP i PatchCore, jako punkty odniesienia.

Powyższy rysunek porównuje wyniki modelu AnomalyGPT z ramami few-shot IAD. Na obu zestawach danych, metoda stosowana przez AnomalyGPT przewyższa podejścia stosowane przez poprzednie modele pod względem AUC na poziomie obrazu i również zwraca dobra dokładność.

Nienadzorowane wykrywanie anomalii przemysłowych

W ustawieniu szkolenia bez nadzoru z dużą ilością próbek normalnych, AnomalyGPT trenuje jeden model na próbkach pochodzących ze wszystkich klas w zestawie danych. Deweloperzy AnomalyGPT wybrali ramę UniAD, ponieważ jest szkolona w tym samym ustawieniu i będzie służyć jako punkt odniesienia do porównania. Ponadto, model porównuje się z ramami JNLD i PaDim, używając tego samego ujednoliconego ustawienia.

Powyższy rysunek porównuje wyniki modelu AnomalyGPT z innymi ramami.

Wyniki jakościowe

Powyższy obraz ilustruje wyniki modelu AnomalyGPT w nienadzorowanym wykrywaniu anomalii, podczas gdy poniższy rysunek demonstruje wyniki modelu w 1-shot in-context learning.

Model AnomalyGPT jest w stanie wskazać obecność anomalii, oznaczyć ich lokalizację i dostarczyć wyniki lokalizacji na poziomie pikseli. Kiedy model jest w trybie 1-shot in-context learning, wyniki lokalizacji są nieco gorsze w porównaniu z trybem nienadzorowanym ze względu na brak szkolenia.

Podsumowanie

AnomalyGPT to nowy model konwersacyjny IAD-wizji, zaprojektowany do wykorzystania potężnych możliwości dużych modeli językowych i wizji. Może nie tylko identyfikować anomalie w obrazie, ale także wskazywać ich dokładne lokalizacje. Ponadto, AnomalyGPT umożliwia wieloobrotowe rozmowy skupione na wykrywaniu anomalii i prezentuje wybitne wyniki w few-shot in-context learning. AnomalyGPT wprowadza nowe pomysły i możliwości dla branży IAD.

"Inżynier z zawodu, pisarz z serca". Kunal jest technicznym pisarzem z głęboką miłością i zrozumieniem AI i ML, poświęconym uproszczeniu złożonych pojęć w tych dziedzinach poprzez swoje angażujące i informacyjne dokumentacje.