نماذج ومنصات الذكاء الاصطناعي
AnomalyGPT: كشف الشذوذ الصناعي باستخدام LVLMs
最近、LLava و MiniGPT-4 gibi Large Vision Language Models (LVLMs) görüntüleri anlamak ve çeşitli görsel görevlerde yüksek doğruluk ve verimlilik elde etmek için yeteneklerini göstermiştir. LVLM’ler, geniş eğitim veri setlerine sahip oldukları için ortak nesneleri tanımakta iyi olsalar da, belirli bir domaine özgü bilgiye sahip değillerdir ve görüntüler içindeki yerel ayrıntılara sınırlı bir anlayışa sahiptirler. Bu, Endüstriyel Anomalileri Algılama (IAD) görevlerinde onların etkinliğini sınırlar. Diğer yandan, mevcut IAD çerçeveleri yalnızca anomalilerin kaynaklarını tanımlayabilir ve normal ve anormal örnekleri ayırt etmek için elle eşik ayarlarına ihtiyaç duyar, bu da onları pratik uygulamalar için sınırlar.
IAD çerçevesinin birincil amacı, endüstriyel senaryolarda ve ürün görüntülerinde anomalileri tespit etmek ve lokalize etmektir. Ancak, gerçek dünya görüntü örneklerinin öngörülemez ve nadir olması nedeniyle, modeller genellikle yalnızca normal verilerle eğitilir. Anormal örnekleri normal örneklerden, tipik örneklerden sapmalara dayanarak ayırt ederler. Şu anda, IAD çerçeveleri ve modeller主要 olarak test örnekleri için anomalilik puanları sağlar. Ayrıca, her öğe sınıfı için normal ve anormal örnekleri ayırt etmek için elle eşiklerin belirtimi gereklidir, bu da onları gerçek dünya uygulamaları için uygun hale getirmez.

IAD çerçevelerinin sunduğu zorlukları ele almak için Large Vision Language Models’in kullanımını ve uygulanmasını keşfetmek için, AnomalyGPT adlı bir novel IAD yaklaşımı sunuldu. AnomalyGPT, elle eşik ayarlarına gerek kalmadan anomalileri tespit edebilir ve lokalize edebilir. Ayrıca, AnomalyGPT görüntüye ilişkin ilgili bilgileri sunabilir ve kullanıcılarla etkileşimli olarak iletişim kurabilir, böylece kullanıcılar anomalilere veya özel ihtiyaçlarına bağlı olarak takip soruları sorabilirler.
Endüstri Anomalileri Algılama ve Büyük Görsel Dil Modelleri
Mevcut IAD çerçeveleri iki kategoriye ayrılabilir.
- Yeniden Yapılandırma Tabanlı IAD.
- Özellik Gömme Tabanlı IAD.
Yeniden Yapılandırma Tabanlı IAD çerçevesinde, birincil amaç anormal örnekleri normal karşıtı örneklerine yeniden yapılandırmak ve yeniden yapılandırma hatası hesabıyla anomalileri tespit etmektir. SCADN, RIAD, AnoDDPM ve InTra, GAN ve oto-encoder’den difüzyon modeli ve transformere kadar farklı yeniden yapılandırma çerçevelerini kullanır.
Öte yandan, Özellik Gömme Tabanlı IAD çerçevesinde, birincil amaç normal verilerin özellik gömmesini modellemektir. PatchSSVD gibi yöntemler normal örnekleri sıkı bir şekilde kapsayan bir hipersfer bulunmaya çalışır, जबकi PyramidFlow ve Cfl gibi çerçeveler normal örnekleri normalleştirme akışları kullanarak Gaussian dağılımına projeler. CFA ve PatchCore çerçeveleri normal örneklerin yama gömmeğinden oluşan bir bellek bankası kurar ve test örneği gömme ile normal gömme arasındaki mesafeyi kullanarak anomalileri tespit eder.
Her iki yöntem de “bir sınıf bir model” öğrenme paradigmasını takip eder, bu da her nesne sınıfı için büyük miktarda normal örnek gerektirir. Normal örneklerin büyük miktarda gerektirmesi, yeni nesne sınıfları için pratik olmaktan çıkarmaktadır ve dinamik ürün ortamlarında sınırlı uygulamalara sahiptir. Öte yandan, AnomalyGPT çerçevesi nesne sınıfları için bağlam içi öğrenme paradigmasını kullanır, bu da yalnızca birkaç normal örnekle müdahale etmeyi sağlar.
İlerleyerek, Büyük Görsel Dil Modelleri veya LVLM’ler var. LLM’ler veya Büyük Dil Modelleri NLP endüstrisinde büyük başarı elde etti ve şimdi görsel görevlerdeki uygulamaları için keşfediliyor. BLIP-2 çerçevesi, Q-former’ı kullanarak Vision Transformer’dan görsel özelliklerini Flan-T5 modeline girdi olarak kullanır. Ayrıca, MiniGPT çerçevesi BLIP-2 çerçevesinin görüntü segmentini ve Vicuna modelini bir lineer katmanla bağlar ve görüntü-metin verisi kullanarak iki aşamalı fine-tuning işlemi gerçekleştirir. Bu yaklaşımlar, LLM çerçevelerinin görsel görevlerde bazı uygulamalara sahip olabileceğini gösteriyor. Ancak, bu modeller genel veri üzerinde eğitilmiştir ve yaygın uygulamalar için gerekli domaine özgü uzmanlığa sahip değildir.
AnomalyGPT Nasıl Çalışır?
AnomalyGPT temelde endüstriyel anomalileri tespit etmek ve görüntülerdeki kesin konumlarını belirlemek için tasarlanmış bir novel konversasyonel IAD büyük görsel dil modelidir. AnomalyGPT çerçevesi, bir LLM ve önceden eğitilmiş bir görüntü kodlayıcıyı kullanarak görüntüleri ilgili metinsel açıklamalarıyla hizalamak için uyarılmış anomalilik verilerini kullanır. Model, IAD sistemlerinin performansını artırmak ve piksel düzeyinde lokalizasyon çıktısı elde etmek için bir dekoder modülü ve bir.prompt öğrenme modülü tanıtır.
Model Mimarisi

Yukarıdaki resim AnomalyGPT’nin mimarisini gösterir. Model önce sorgu görüntüsünü dondurulmuş görüntü kodlayıcısına geçirir. Model daha sonra ara katmanlardan yama düzeyinde özellikler çıkarır ve bunları anormal ve normal metinlerle benzerlik hesaplamak için görüntü dekoderine besler ve lokalizasyon sonuçlarını elde eder. Prompt öğrenme daha sonra bunları LLM’ye girdi olarak kullanılabilen.prompt gömme haline dönüştürür. LLM modeli daha sonra.prompt gömme, görüntü girişleri ve kullanıcı tarafından sağlanan metinsel girişleri kullanarak anomalileri tespit eder, konumlarını belirler ve kullanıcı için son yanıtlar oluşturur.
Dekoder
Piksel düzeyinde anomalilik lokalizasyonu elde etmek için, AnomalyGPT modeli hem birkaç örnek IAD çerçeveleri hem de denetimsiz IAD çerçeveleri için destekleyen bir hafif özellik eşleştirme tabanlı görüntü dekoderi kullanır. AnomalyGPT’de kullanılan dekoderin tasarımı WinCLIP, PatchCore ve APRIL-GAN çerçevelerinden esinlenmiştir. Model görüntü kodlayıcısını 4 aşamaya ayırır ve her aşamadan ara yama düzeyinde özellikler çıkarır.
Ancak, bu ara özellikler son görüntü-metin hizalamasından geçmediği için doğrudan özelliklerle karşılaştırılamaz. Bu sorunu çözmek için, AnomalyGPT modeli metin özellikleriyle hizalamak için ara özelliklere ek katmanlar tanıtır.
Prompt Öğrenme
AnomalyGPT çerçevesi, lokalizasyon sonucunu.prompt gömme haline dönüştürmeye çalışan bir.prompt öğrenme tanıtır, böylece görüntülerden ince düzeyde anlamları kullanabilir ve dekoder ve LLM çıkışları arasındaki semantik tutarlılığı korur. Ayrıca, model IAD görevi için ek bilgi sağlamak için dekoder çıkışlarıyla ilgili olmayan öğrenilebilir.prompt gömme dahil eder ve bunları LLM’ye besler.
Prompt öğrenme, öğrenilebilir temel.prompt gömme ve bir convolutional neural network’den oluşur. Ağ, lokalizasyon sonucunu.prompt gömme haline dönüştürür ve bunları görüntü gömme ile birleştirerek LLM’ye girdi olarak kullanır.
Anomalilik Simülasyonu
AnomalyGPT modeli, NSA yöntemini kullanarak anormal veri simüle eder. NSA yöntemi, Poisson görüntü düzenleme yöntemini kullanarak yapıştırmadan oluşan kesintileri hafifletmek için kes-yapıştır tekniğini kullanır. Kes-yapıştır, IAD çerçevelerinde simüle anomalilik görüntüleri oluşturmak için yaygın olarak kullanılan bir tekniktir.
Kes-yapıştır yöntemi, bir görüntüden rastgele bir blok bölgesini kırpıp başka bir görüntüye rastgele bir konuma yapıştırmayı içerir, böylece simüle anomalilik oluşturulur. Bu simüle anomalilik örnekleri, IAD modellerinin performansını artırabilir, ancak bir dezavantajı vardır, çünkü genellikle dikkat çekici kesintiler üretebilirler. Poisson düzenleme yöntemi, bir nesneyi bir görüntüden diğerine sorunsuz bir şekilde klonlamak için Poisson kısmi diferansiyel denklemlerini çözmeyi hedefler.

Yukarıdaki resim, Poisson ve kes-yapıştır görüntü düzenleme arasındaki karşılaştırmayı gösterir. Görüldüğü gibi, kes-yapıştır yönteminde dikkat çekici kesintiler vardır, जबकi Poisson düzenleme sonuçları daha doğal görünmektedir.
Soru ve Cevap İçeriği
Büyük Görsel Dil Modeli’nde.prompt ayarlaması yapmak için, AnomalyGPT modeli anomalilik görüntüsüne dayalı ilgili metinsel sorguyu oluşturur. Her sorgu iki ana bileşenden oluşur. Sorgunun ilk kısmı, görüntüde bulunan nesneler ve beklenen özelliklerine ilişkin bilgi sağlayan girdi görüntüsünün bir açıklamasını içerir. Sorgunun ikinci kısmı, nesne içinde anomalilerin varlığını tespit etmek veya görüntüde bir anomalilik olup olmadığını kontrol etmektir.
Büyük Görsel Dil Modeli önce, görüntüde bir anomalilik olup olmadığını soran sorguya yanıt verir. Model anomalilik tespit ederse, anomalilerin konumunu ve sayısını belirtmeye devam eder. Model, Büyük Görsel Dil Modeli’nin anomalilerin konumunu sözlü olarak belirtmesine izin vermek için görüntüyü 3×3 ayrı bölgelere ayırır, aşağıdaki şeklide gösterildiği gibi.

Büyük Görsel Dil Modeli, girdi görüntüsünün temel bilgilerini sağlar, bu da modelin görüntü bileşenlerini daha iyi anlamasını sağlar.
Veri Setleri ve Değerlendirme Ölçütleri
Model, deneylerini主要 olarak VisA ve MVTec-AD veri setleri üzerinde gerçekleştirir. MVTec-AD veri seti, 15 farklı kategoriye yayılan 3629 eğitim görüntüsü ve 1725 test görüntüsünden oluşur ve IAD çerçeveleri için en popüler veri setlerinden biridir. Eğitim görüntüleri yalnızca normal görüntüleri içerir, जबकi test görüntüleri hem normal hem de anormal görüntüleri içerir. Öte yandan, VisA veri seti 12 farklı kategoriye yayılan 9621 normal görüntü ve yaklaşık 1200 anormal görüntüden oluşur.
Devam ederek, mevcut IAD çerçevelerinin yaptığı gibi, AnomalyGPT modeli de anomalilik lokalizasyon performansını değerlendirmek için AUC veya Alıcı İşletim Karakteristiği Grafiği Alanı’nı kullanır ve piksel düzeyinde ve görüntü düzeyinde AUC, sırasıyla anomalilik lokalizasyonu ve anomalilik tespiti için kullanılır. Ancak, model ayrıca önerilen yaklaşımın performansını değerlendirmek için görüntü düzeyinde doğruluğu da kullanır, çünkü eşiklerin elle ayarlanması gerekliliğini ortadan kaldırır.
Sonuçlar
Nicel Sonuçlar
Az Örnekli Endüstriyel Anomalilik Tespiti
AnomalyGPT modeli, PaDiM, SPADE, WinCLIP ve PatchCore gibi önceki az örnekli IAD çerçeveleri ile karşılaştırma yapar.

Yukarıdaki şekil, AnomalyGPT modelinin az örnekli IAD çerçeveleri ile karşılaştırmasını gösterir. Her iki veri seti üzerinde, AnomalyGPT modeli görüntü düzeyinde AUC’de önceki modellerin yaklaşımlarını aşar ve iyi bir doğruluk sağlar.
Denetimsiz Endüstriyel Anomalilik Tespiti
Denetimsiz eğitim ayarında, büyük miktarda normal örnek ile, AnomalyGPT modeli bir veri setindeki tüm sınıflardan alınan örneklerle tek bir model eğitir. AnomalyGPT geliştiricileri, aynı ayar altında eğitilen UniAD çerçevesini karşılaştırma için seçmiştir. Ayrıca, model JNLD ve PaDim çerçeveleri ile aynı birleşik ayar altında karşılaştırma yapar.

Yukarıdaki şekil, AnomalyGPT modelinin diğer çerçeveler ile karşılaştırmasını gösterir.
Nitel Sonuçlar

Yukarıdaki resim, AnomalyGPT modelinin denetimsiz anomalilik tespiti yönteminin performansını gösterir, जबकi aşağıdaki şekil modelin 1-örnek bağlam içi öğrenme yönteminin performansını gösterir.

AnomalyGPT modeli, anomalilerin varlığını belirleyebilir, konumlarını işaretleyebilir ve piksel düzeyinde lokalizasyon sonuçları sağlayabilir. Model 1-örnek bağlam içi öğrenme yöntemindeyken, lokalizasyon performansı, eğitim olmaması nedeniyle denetimsiz öğrenme yöntemine göre slightly daha düşüktür.
Sonuç
AnomalyGPT, endüstriyel anomalileri tespit etmek ve kesin konumlarını belirlemek için tasarlanmış bir novel konversasyonel IAD büyük görsel dil modelidir. AnomalyGPT, yalnızca anomalileri tespit etmekle kalmaz, aynı zamanda onların kesin konumlarını da belirleyebilir. Ayrıca, AnomalyGPT, anomalilik tespiti odaklı çoklu dönüşlü diyalogları kolaylaştırır ve az örnekli bağlam içi öğrenmede mükemmel bir performans sergiler. AnomalyGPT, anomalilik tespitinde LVLM’lerin potansiyel uygulamalarını keşfeder ve IAD endüstrisi için yeni fikir ve olanaklar sunar.












