Yapay zeka modelleri ve platformları

AnomalyGPT: Endüstri Anomalilerini LVLM’ler Kullanarak Tespit Etme

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Son zamanlarda, LLava ve MiniGPT-4 gibi Büyük Görüntü Dili Modelleri (LVLM’ler), görsel görevlerde yüksek doğruluk ve verimlilik elde etmelerine olanak tanıyan görüntüleri anlamak ve several görsel görevlerde yüksek doğruluk ve verimlilik elde etme yeteneğini göstermiştir. LVLM’ler, geniş eğitim veri setleri nedeniyle ortak nesneleri tanıma konusunda uzmanlaşmış olsalar da, belirli bir domaine özgü bilgiye sahip değillerdir ve görüntüler içindeki yerel ayrıntıları anlamak konusunda sınırlı bir yeteneğe sahiptirler. Bu, Endüstri Anomalisi Tespiti (IAD) görevlerinde onların etkinliğini sınırlar. Diğer yandan, mevcut IAD çerçeveleri yalnızca anomalinin kaynaklarını tanımlayabilir ve normal ve anormal örnekler之间 ayrım yapmak için elle eşik ayarlarına ihtiyaç duyar, bu da onları pratik uygulamalar için sınırlı kılar.

Bir IAD çerçevesinin birincil amacı, endüstriyel senaryolarda ve ürün görüntülerinde anomalileri tespit etmek ve lokalize etmektir. Ancak, gerçek dünya görüntü örneklerinin öngörülemez ve nadir olması nedeniyle, modeller genellikle yalnızca normal verilerle eğitilir. Anormal örnekleri normal örneklerden, tipik örneklerden sapma temelinde ayırt ederler. Şu anda, IAD çerçeveleri ve modeller主要 olarak test örnekleri için anomali puanları sağlar. Ayrıca, her öğe sınıfı için normal ve anormal örnekler之间 ayrım yapmak için elle eşik ayarlarına ihtiyaç duyar, bu da onları gerçek dünya uygulamaları için uygun kılmaz.

IAD çerçevelerinin sunduğu zorlukları ele almak için Büyük Görüntü Dili Modellerinin kullanımını ve uygulanmasını keşfetmek için, AnomalyGPT, bir LVLM temelinde yeni bir IAD yaklaşımı olarak tanıtıldı. AnomalyGPT, elle eşik ayarlarına gerek kalmadan anomalileri tespit edebilir ve lokalize edebilir. Ayrıca, AnomalyGPT, görüntüye ilişkin ilgili bilgileri sunabilir ve kullanıcılarla etkileşimli bir şekilde iletişim kurabilir, böylece kullanıcılar anomalilere veya özel ihtiyaçlarına bağlı olarak takip soruları sorabilir.

Endüstri Anomalisi Tespiti ve Büyük Görüntü Dili Modelleri

Mevcut IAD çerçeveleri iki kategoriye ayrılabilir.

  1. Yeniden Yapılandırma Tabanlı IAD.
  2. Öznitelik Gömme Tabanlı IAD.

Yeniden Yapılandırma Tabanlı bir IAD çerçevesinde, birincil amaç, anormal örnekleri karşılık gelen normal karşıtı örneklerine yeniden yapılandırmak ve yeniden yapılandırma hatası hesaplayarak anomalileri tespit etmektir. SCADN, RIAD, AnoDDPM ve InTra, farklı yeniden yapılandırma çerçevelerini kullanır, bunlar arasında Sinir Ağları, oto-encode’lar, difüzyon modeli ve transformörler bulunur.

Öte yandan, Öznitelik Gömme Tabanlı bir IAD çerçevesinde, birincil amaç, normal verilerin öznitelik gömmesini modellemektir. PatchSSVD gibi yöntemler, normal örnekleri sıkı bir şekilde kapsayan bir hipersfer bulunmaya çalışır, mentre PyramidFlow ve CFA gibi çerçeveler, normal örnekleri normalleştirme akışları kullanarak bir Gaussian dağılımına projeler. CFA ve PatchCore çerçeveleri, normal örneklerin bir bellek bankasını oluşturur ve test örnek gömmesinin normal gömmeden uzaklığını kullanarak anomalileri tespit eder.

Her iki yöntem de ” bir sınıf bir model” öğrenme paradigmasını takip eder, bu, her nesne sınıfı için dağılımlarını öğrenmek için büyük miktarda normal örnek gerektirir. Normal örneklerin büyük miktarda gerektirmesi, yeni nesne kategorileri için uygulamayı pratik kılmaz ve dinamik ürün ortamlarında sınırlı uygulamalara sahiptir. Öte yandan, AnomalyGPT çerçevesi, nesne kategorileri için bir bağlam içi öğrenme paradigmasını kullanır, bu da yalnızca birkaç normal örnek ile müdahale etmeyi sağlar.

İlerleyerek, Büyük Görüntü Dili Modelleri veya LVLM’ler var. LLM’ler veya Büyük Dili Modelleri, NLP endüstrisinde büyük bir başarı elde etti ve şimdi görsel görevlerdeki uygulamaları için keşfediliyor. BLIP-2 çerçevesi, Q-former’ı kullanarak Vision Transformer’dan görsel özelliklerini Flan-T5 modeline girdi olarak kullanır. Ayrıca, MiniGPT çerçevesi, BLIP-2 çerçevesinin görüntü segmentini ve Vicuna modelini bir lineer katmanla bağlar ve görüntü-metin verisi kullanarak iki aşamalı bir fine-tuning işlemi gerçekleştirir. Bu yaklaşımlar, LLM çerçevelerinin görsel görevlerde bazı uygulamalara sahip olabileceğini gösterir. Ancak, bu modeller genel verilerle eğitilmiştir ve yaygın uygulamalar için gerekli domaine özgü uzmanlığa sahip değildir.

AnomalyGPT Nasıl Çalışır?

AnomalyGPT, temelde endüstriyel anomalileri tespit etmek ve görüntülerdeki kesin konumlarını belirlemek için tasarlanmış bir novel konversasyonel IAD büyük görüntüdili modelidir. AnomalyGPT çerçevesi, bir LLM ve önceden eğitilmiş bir görüntü kodlayıcıyı, uyarılmış anomali verisi kullanarak görüntüleri karşılık gelen metinsel açıklamalarıyla hizalamak için kullanır. Model, IAD sistemlerinin performansını artırmak ve piksel düzeyinde lokalizasyon çıkışı elde etmek için bir decoder modülü ve bir prompt öğrenme modülü tanıtır.

Model Mimarisi

Yukarıdaki resim, AnomalyGPT’nin mimarisini gösterir. Model, sorgu görüntüsünü dondurulmuş görüntü kodlayıcısına geçirir. Model, ardından ara katmanlardan patch düzeyinde özellikler çıkarmak için bu özelliklere bir görüntü decode’ünü besler ve anormal ve normal metinlerle benzerliklerini hesaplayarak lokalizasyon sonuçlarını elde eder. Prompt öğrenme modülü, bunları LLM’ye girdi olarak kullanılabilen prompt gömmelerine dönüştürür. LLM modeli, prompt gömmeleri, görüntü girişleri ve kullanıcı tarafından sağlanan metinsel girişleri kullanarak anomalileri tespit eder, konumlarını belirler ve kullanıcı için son yanıtlar oluşturur.

Decoder

Piksel düzeyinde anomali lokalizasyonu elde etmek için, AnomalyGPT modeli, hem birkaç örnek IAD çerçevelerini hem de denetimsiz IAD çerçevelerini destekleyen bir hafif özellik eşleme tabanlı görüntü decode’ünü kullanır. AnomalyGPT’de kullanılan decode’ün tasarımı, WinCLIP, PatchCore ve APRIL-GAN çerçevelerinden esinlenmiştir. Model, görüntü kodlayıcısını 4 aşamaya böler ve her aşamadan ara patch düzeyinde özellikler çıkarır.

Ancak, bu ara özellikler son görüntü-metin hizalamasından geçmediği için doğrudan özelliklerle karşılaştırılamaz. Bu sorunu çözmek için, AnomalyGPT modeli, ara özellikleri projeleyen ve onları normal ve anormal anlamsal özelliklerle hizalayan ek katmanlar tanıtır.

Prompt Öğrenme

AnomalyGPT çerçevesi, lokalizasyon sonucunu prompt gömmelerine dönüştürmeye çalışan bir prompt öğrenme modülü tanıtır, bu da görüntülerden ince düzeyde anlamsal bilgiler elde etmeyi ve decode’ün ve LLM’nin çıktıları arasındaki anlamsal tutarlılığı korumayı sağlar. Ayrıca, model, decode’ün çıktısına bağlı olmayan öğrenilebilen prompt gömmelerini prompt öğrenme modülüne dahil eder, bu da IAD görevi için ek bilgi sağlar. Son olarak, model, gömmeleri ve orijinal görüntü bilgisini LLM’ye besler.

Prompt öğrenme modülü, öğrenilebilen temel prompt gömmeleri ve bir konvolüsyonel sinir ağından oluşur. Ağ, lokalizasyon sonucunu prompt gömmelerine dönüştürür ve LLM’ye girdi olarak kullanılabilen bir dizi prompt gömmesi oluşturur.

Anomali Simülasyonu

AnomalyGPT modeli, NSA yöntemini kullanarak anormal verileri simüle eder. NSA yöntemi, Poisson görüntü düzenleme yöntemini kullanarak, görüntü segmentlerini yapıştırmaya bağlı olarak ortaya çıkan kesintileri azaltmak için kes-yapıştır tekniğini kullanır. Kes-yapıştır, IAD çerçevelerinde simüle anomali görüntüleri oluşturmak için yaygın olarak kullanılan bir tekniktir.

Kes-yapıştır yöntemi, bir görüntüden rastgele bir blok bölgesini keserek başka bir görüntüye rastgele bir konuma yapıştırmayı içerir, bu da simüle bir anomali oluşturur. Bu simüle anomali örnekleri, IAD modellerinin performansını artırabilir, ancak bir dezavantajı vardır, çünkü genellikle dikkat çekici kesintiler üretebilirler. Poisson düzenleme yöntemi, bir nesneyi bir görüntüden diğerine sorunsuz bir şekilde klonlamak için Poisson kısmi diferansiyel denklemlerini çözmeyi hedefler.

Yukarıdaki resim, Poisson ve kes-yapıştır görüntü düzenleme arasındaki karşılaştırmayı gösterir. Gördüğünüz gibi, kes-yapıştır yönteminde dikkat çekici kesintiler varken, Poisson düzenleme sonuçları daha doğal görünüyor.

Soru ve Cevap İçeriği

Büyük Görüntü Dili Modelinde prompt ayarını yapmak için, AnomalyGPT modeli, anomali görüntüsüne dayalı bir metinsel sorgu oluşturur. Her sorgu, iki ana bileşenden oluşur. Sorgunun ilk kısmı, görüntüde bulunan nesneler hakkında bilgi sağlayan bir giriş görüntüsü açıklamasını içerir. Sorgunun ikinci kısmı, görüntüdeki anomalilerin varlığını tespit etmektir.

LVLM, önce görüntüde bir anomali olup olmadığını sorar. Anomali tespit ederse, anomali alanlarının konumunu ve sayısını belirtmeye devam eder. Model, LVLM’nin anomalilerin konumunu sözlü olarak belirtmesine olanak tanıyan farklı bölgelerden oluşan bir 3×3 ızgara olarak görüntüyü böler.

LVLM modeli, giriş görüntüsünün temel bilgilerini alır, bu da modelin görüntü bileşenlerini daha iyi anlamasını sağlar.

Veri Setleri ve Değerlendirme Ölçütleri

Model, deneylerini主要 olarak VisA ve MVTec-AD veri setleri üzerinde gerçekleştirir. MVTec-AD veri seti, 15 farklı kategoriye bölünmüş 3629 eğitim görüntüsünden oluşur ve 1725 test görüntüsünden oluşur, bu da IAD çerçeveleri için en popüler veri setlerinden biridir. Eğitim görüntüleri yalnızca normal görüntüleri içerirken, test görüntüleri hem normal hem de anormal görüntüleri içerir. Öte yandan, VisA veri seti, 12 farklı kategoriye bölünmüş 9621 normal görüntü ve yaklaşık 1200 anormal görüntüden oluşur.

Devam ederek, mevcut IAD çerçevelerinin yaptığı gibi, AnomalyGPT modeli, anomali lokalizasyon performansını değerlendirmek için piksel düzeyinde ve görüntü düzeyinde AUC (Alıcı İşletme Karakteristiği) kullanır ve anomali tespitini değerlendirmek için görüntü düzeyinde AUC kullanır. Ancak, model ayrıca, eşik ayarlarına gerek kalmadan anomalilerin varlığını belirleyebildiği için proposed yaklaşımın performansını değerlendirmek için görüntü düzeyinde doğruluğu da kullanır.

Sonuçlar

Nicel Sonuçlar

Az Örnek Endüstri Anomalisi Tespiti

AnomalyGPT modeli, önceki birkaç örnek IAD çerçeveleriyle,包括 PaDiM, SPADE, WinCLIP ve PatchCore, ile sonuçlarını karşılaştırır.

Yukarıdaki şekil, AnomalyGPT modelinin, önceki modellerin yaklaşımıyla karşılaştırıldığında, her iki veri seti üzerinde de görüntü düzeyinde AUC ve iyi bir doğruluk elde ettiğini gösterir.

Denetimsiz Endüstri Anomalisi Tespiti

Bir denetimsiz eğitim ayarında, büyük miktarda normal örnekle, AnomalyGPT, bir veri setindeki tüm sınıflardan alınan örneklerle tek bir modeli eğitir. AnomalyGPT’nin geliştiricileri, aynı ayar altında eğitilen UniAD çerçevesini karşılaştırma için seçtiler. Ayrıca, model, aynı birleşik ayar altında JNLD ve PaDim çerçeveleriyle de karşılaştırılır.

Yukarıdaki şekil, AnomalyGPT’nin diğer çerçevelerle karşılaştırıldığında performansını gösterir.

Nitel Sonuçlar

Yukarıdaki resim, AnomalyGPT modelinin denetimsiz anomali tespiti yönteminin performansını gösterir, aşağıdaki resim ise modelin 1-örnek bağlam içi öğrenme yönteminin performansını gösterir.

AnomalyGPT modeli, anomalilerin varlığını belirleyebilir, konumlarını belirleyebilir ve piksel düzeyinde lokalizasyon sonuçları sağlayabilir. Model, 1-örnek bağlam içi öğrenme yöntemindeyken, lokalizasyon performansı, denetimsiz öğrenme yöntemine kıyasla slightly daha düşüktür, çünkü eğitim yoktur.

Sonuç

AnomalyGPT, büyük görüntüdili modellerinin güçlü özelliklerini kullanarak endüstriyel anomalileri tespit etmek ve kesin konumlarını belirlemek için tasarlanmış bir novel konversasyonel IAD-vizyon dili modelidir. AnomalyGPT, yalnızca anomalileri tespit edebilir ve lokalize edebilir, aynı zamanda anomali tespiti odaklı çoklu diyalogları destekler ve birkaç örnek bağlam içi öğrenmede mükemmel bir performans gösterir. AnomalyGPT, IAD endüstrisi için yeni fikir ve olanaklar sunar.

Mesleği mühendis, kalbi yazar. Kunal, AI ve ML'ye derin bir sevgi ve anlayışla technical writer, bu alanlardaki karmaşık kavramları etkileyici ve bilgilendirici belgelerle basitleştirmeye adanmış.