AI 모델 및 플랫폼
AnomalyGPT: 산업 이상 감지에 LVLMs 사용
최근에 LLava와 MiniGPT-4와 같은 대규모 비전 언어 모델(LVLMs)은 이미지 이해와 여러 시각적 작업에서 높은 정확도와 효율성을 보여주었습니다. 그러나 LVLMs는 광범위한 훈련 데이터셋으로 인해 일반적인 객체를 인식하는 데 뛰어나지만 특정 도메인 지식이 부족하고 이미지 내의 지역화된 세부 사항을 이해하는 데 제한이 있습니다. 이것은 산업 이상 감지(IAD) 작업에서 그들의 효과를 제한합니다. 다른 한편으로, 기존의 IAD 프레임워크는 이상의 원인을 식별할 수 있지만 정상 샘플과 이상 샘플을 구분하기 위해 수동으로 임계값을 설정해야 하므로 실제 구현에 제한이 있습니다.
IAD 프레임워크의 주요 목적은 산업 시나리오와 제품 이미지에서 이상을 감지하고 위치를 지정하는 것입니다. 그러나 실제 이미지 샘플의 예측 불가능성과 희귀성으로 인해 모델은 일반적으로 정상 데이터만으로 훈련됩니다. 모델은 일반적인 샘플에서 벗어난 샘플을 이상 샘플로 식별합니다. 현재 IAD 프레임워크와 모델은 주로 테스트 샘플에 대한 이상 점수를 제공합니다. 또한 각 항목 클래스의 정상 및 이상 인스턴스를 구분하기 위해 수동으로 임계값을 지정해야 하므로 실제 적용에 적합하지 않습니다.

AnomalyGPT는 LVLM을 기반으로 하는 새로운 IAD 접근 방식입니다. AnomalyGPT는 수동으로 임계값을 설정할 필요 없이 이상을 감지하고 위치를 지정할 수 있습니다. 또한 AnomalyGPT는 이미지에 대한 관련 정보를 제공하여 사용자가 이상 또는 특정需求에 따라 후속 질문을 할 수 있습니다.
산업 이상 감지와 대규모 비전 언어 모델
기존의 IAD 프레임워크는 두 가지 범주로 분류할 수 있습니다.
- 재구성 기반 IAD.
- 기능 임베딩 기반 IAD.
재구성 기반 IAD 프레임워크에서는 이상 샘플을 해당 정상 샘플로 재구성하여 재구성 오류를 계산하여 이상을 감지합니다. SCADN, RIAD, AnoDDPM, InTra와 같은 프레임워크는 생성적 적대 네트워크(GAN), 오토인코더, 확산 모델 및 트랜스포머와 같은 다양한 재구성 프레임워크를 사용합니다.
另一方面, 기능 임베딩 기반 IAD 프레임워크에서는 정상 데이터의 기능 임베딩을 모델링하는 것이 주요 목표입니다. PatchSSVD와 같은 방법은 정상 샘플을紧密하게 포함하는 초구를 찾으려고 합니다. PyramidFlow와 Cfl과 같은 프레임워크는 정상 샘플을 가우스 분포로 정규화하여 정상 샘플을 프로젝션합니다. CFA와 PatchCore 프레임워크는 정상 샘플의 패치 임베딩에서 메모리 뱅크를 설립하고 테스트 샘플 임베딩과 정상 임베딩 사이의 거리를 사용하여 이상을 감지합니다.
이 두 가지 방법은 “한 클래스당 한 모델”이라는 학습 패러다임을 따르며 각 객체 클래스의 분포를 학습하기 위해大量의 정상 샘플이 필요합니다. 정상 샘플이大量으로 필요하기 때문에 새로운 객체 범주에 대해 실제로 적용하기는 어렵습니다.另一方面, AnomalyGPT 프레임워크는 객체 범주에 대한 컨텍스트 학습 패러다임을 사용하여 몇 개의 정상 샘플만으로도 간섭할 수 있습니다.
이제 대규모 비전 언어 모델(LVLM)에 대해 살펴보겠습니다. LLM 또는 대규모 언어 모델은 NLP 산업에서 큰 성공을 거두었으며 이제 시각적 작업에 대한 적용이 탐구되고 있습니다. BLIP-2 프레임워크는 Q-former를 사용하여 비전 트랜스포머의 시각적 기능을 Flan-T5 모델에 입력합니다. 또한 MiniGPT 프레임워크는 BLIP-2 프레임워크의 이미지 세그먼트와 Vicuna 모델을 선형 레이어로 연결하고 이미지-텍스트 데이터를 사용하여 2단계 미세 조정 프로세스를 수행합니다. 이러한 접근 방식은 LLM 프레임워크가 시각적 작업에 일부 적용이 있을 수 있음을 나타냅니다. 그러나 이러한 모델은 일반 데이터로 훈련되었으며 광범위한 적용을 위한 필요한 도메인 전문 지식이 부족합니다.
AnomalyGPT의 작동 방식
AnomalyGPT는 산업 이상 감지와 이미지의 정확한 위치를 지정하는 데 주로 사용되는 새로운 대화형 IAD 대규모 비전 언어 모델입니다. AnomalyGPT 프레임워크는 LLM과 사전 훈련된 이미지 인코더를 사용하여 이미지와 해당 텍스트 설명을 일치시킵니다. 모델은 디코더 모듈과 프롬프트 학습 모듈을 도입하여 IAD 시스템의 성능을 향상시키고 픽셀 수준의 위치 지정 출력을 달성합니다.
모델 아키텍처

위의 이미지는 AnomalyGPT의 아키텍처를 보여줍니다. 모델은 먼저 쿼리 이미지를 동결된 이미지 인코더에 전달합니다. 모델은 중간 레이어에서 패치 수준의 기능을 추출하고 이러한 기능을 이미지 디코더에 입력하여 비정상 및 정상 텍스트와의 유사성을 계산하여 위치 지정 결과를 얻습니다. 프롬프트 학습자는 이러한 결과를 LLM과 사용자 텍스트 입력으로 사용할 수 있는 프롬프트 임베딩으로 변환합니다. LLM 모델은 프롬프트 임베딩, 이미지 입력 및 사용자 제공 텍스트 입력을 사용하여 이상을 감지하고 위치를 지정하고 사용자에게 최종 응답을 생성합니다.
디코더
픽셀 수준의 이상 위치 지정에 도달하기 위해 AnomalyGPT 모델은 가벼운 기능 매칭 기반 이미지 디코더를 사용하여 몇 개의 샷 IAD 프레임워크와 무감독 IAD 프레임워크를 모두 지원합니다. AnomalyGPT에서 사용되는 디코더의 설계는 WinCLIP, PatchCore 및 APRIL-GAN 프레임워크에서 영감을 받았습니다. 모델은 이미지 인코더를 4개의 단계로 분할하고 각 단계에서 중간 패치 수준의 기능을 추출합니다.
그러나 이러한 중간 기능은 최종 이미지-텍스트 정렬을 거치지 않았으므로 직접 기능과 비교할 수 없습니다. 이를 해결하기 위해 AnomalyGPT 모델은 중간 기능을 프로젝션하고 정상 및 비정상 의미를 나타내는 텍스트 기능과 일치시킵니다.
프롬프트 학습자
AnomalyGPT 프레임워크는 위치 지정 결과를 프롬프트 임베딩으로 변환하여 이미지에서 세부한 의미를 활용하고 디코더 및 LLM 출력 사이의 의미 일관성을 유지하는 프롬프트 학습자를 도입합니다. 또한 모델은 디코더 출력과 무관한 학습 가능한 프롬프트 임베딩을 프롬프트 학습자에 통합하여 IAD 작업에 대한 추가 정보를 제공합니다. 마지막으로 모델은 임베딩과 원본 이미지 정보를 LLM에 입력합니다.
프롬프트 학습자는 학습 가능한 기본 프롬프트 임베딩과 합성곱 신경망으로 구성됩니다. 네트워크는 위치 지정 결과를 프롬프트 임베딩으로 변환하고 LLM에 입력하기 위한 프롬프트 임베딩 세트를 형성합니다.
이상 시뮬레이션
AnomalyGPT 모델은 NSA 방법을 사용하여 이상 데이터를 시뮬레이션합니다. NSA 방법은 포이슨 이미지 편집 방법을 사용하여 이미지 세그먼트를 붙여 넣는 데 의해 도입된 불연속성을 완화하기 위해 컷-붙여넣기 기술을 사용합니다. 컷-붙여넣기 기술은 IAD 프레임워크에서 이상 이미지 생성에 일반적으로 사용됩니다.
컷-붙여넣기 방법은 이미지에서 블록 영역을 무작위로 자르고 다른 이미지의 무작위 위치에 붙여넣어 시뮬레이션된 이상 영역을 생성합니다. 이러한 시뮬레이션된 이상 샘플은 IAD 모델의 성능을 향상시킬 수 있지만 종종 눈에 띄는 불연속성을 생성할 수 있습니다. 포이슨 편집 방법은 객체를 하나의 이미지에서 다른 이미지로無缝하게 복사하기 위해 포이슨 부분 미분 방정식을 해결하는 것을 목표로 합니다.

위의 이미지는 포이슨과 컷-붙여넣기 이미지 편집의 비교를 보여줍니다. 컷-붙여넣기 방법에는 눈에 띄는 불연속성이 있지만 포이슨 편집의 결과는 더 자연스럽게 보입니다.
질문과 답변 콘텐츠
대규모 비전 언어 모델에 대한 프롬프트 튜닝을 수행하기 위해 AnomalyGPT 모델은 이상 이미지에 대한 해당 텍스트 쿼리를 생성합니다. 각 쿼리는 두 가지 주요 구성 요소로 구성됩니다. 쿼리의 첫 번째 부분은 입력 이미지에 대한 설명으로 이미지에 있는 객체와 해당 속성에 대한 정보를 제공합니다. 쿼리의 두 번째 부분은 이미지 내에서 이상의 존재를 감지하거나 이미지에 이상이 있는지 확인하는 것입니다.
LVLM은 먼저 이미지에 이상이 있는지에 대한 쿼리에 응답합니다. 모델이 이상을 감지하면 이상 영역의 위치와 수를 지정합니다. 모델은 이미지를 3×3 그리드의 별도 영역으로 분할하여 LVLM이 이상의 위치를 구두로 표시할 수 있도록 합니다.

LVLM 모델은 입력 이미지에 대한 지식과 입력 이미지의 기본 지식을 함께 제공받아 이미지 구성 요소를 더 잘 이해할 수 있습니다.
데이터셋과 평가 지표
모델은 주로 VisA와 MVTec-AD 데이터셋에서 실험을 수행합니다. MVTec-AD 데이터셋은 3629개의 이미지로 훈련되고 1725개의 이미지로 테스트되며 15개의 다른 범주로 나뉩니다. 훈련 이미지에는 정상 이미지만 포함되어 있으며 테스트 이미지에는 정상 및 이상 이미지 모두 포함되어 있습니다.另一方面, VisA 데이터셋은 9621개의 정상 이미지와 1200개의 이상 이미지를 포함하며 12개의 다른 범주로 나뉩니다.
이동하여, 기존 IAD 프레임워크와 마찬가지로 AnomalyGPT 모델은 이상 위치 지정 성능을 평가하기 위해 픽셀 수준 및 이미지 수준에서 ROC(Receiver Operating Characteristics) 아래의 영역(AUC)을 사용합니다. 또한 모델은 제안된 접근 방식의 성능을 평가하기 위해 이미지 수준 정확도를 사용합니다. 이는 임계값을 수동으로 설정할 필요 없이 이상의 존재를 결정할 수 있기 때문입니다.
결과
양적 결과
산업 이상 감지
AnomalyGPT 모델은 PaDiM, SPADE, WinCLIP 및 PatchCore와 같은 이전의 몇 개의 샷 IAD 프레임워크와 비교합니다.

위의 그림은 AnomalyGPT 모델의 결과를 몇 개의 샷 IAD 프레임워크와 비교합니다. 두 데이터셋 모두에서 AnomalyGPT 모델은 이미지 수준에서 AUC와 정확도에서 이전 모델의 접근 방식을 초과합니다.
무감독 산업 이상 감지
대규모 정상 샘플이 있는 무감독 훈련 설정에서 AnomalyGPT 모델은 데이터셋 내의 모든 클래스에서 얻은 샘플로 단일 모델을 훈련합니다. 개발자들은 UniAD 프레임워크를 비교를 위한 기준선으로 선택했습니다. 또한 모델은 JNLD 및 PaDim 프레임워크와 같은統一 설정에서 비교합니다.

위의 그림은 AnomalyGPT 모델의 성능을 다른 프레임워크와 비교합니다.
질적 결과

위의 이미지는 무감독 이상 감지 방법에서 AnomalyGPT 모델의 성능을 보여줍니다. 아래의 그림은 1샷 컨텍스트 학습 방법에서 모델의 성능을 보여줍니다.

AnomalyGPT 모델은 이상의 존재를 나타내고 위치를 지정하며 픽셀 수준의 위치 지정 결과를 제공할 수 있습니다. 1샷 컨텍스트 학습 방법에서 모델의 위치 지정 성능은 무감독 학습 방법보다 약간 낮습니다. 이는 훈련이 отсутств하기 때문입니다.
결론
AnomalyGPT는 산업 이상 감지와 이미지의 정확한 위치를 지정하는 데 사용되는 새로운 대화형 IAD 대규모 비전 언어 모델입니다. AnomalyGPT는 이미지에서 이상을 감지하고 위치를 지정할 수 있을 뿐만 아니라 이상 감지에 대한 다중 대화도 지원합니다. 또한 AnomalyGPT는 몇 개의 샷 컨텍스트 학습에서 뛰어난 성능을 보여주며 IAD 산업에 새로운 아이디어와 가능성을 제공합니다.












