Anderson’un Açısı

AI Hallüsinasyonlarını Görüntü Gerçekçiliğini Değerlendirmek için Kullanma

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
A selection of images from the WHOOPS! dataset (https://huggingface.co/datasets/nlphuji/whoops), behind central images from the paper 'Don’t Fight Hallucinations, Use Them: Estimating Image Realism using NLI over Atomic Facts' (https://arxiv.org/pdf/2503.15948).

Rusya’dan yeni bir araştırmada, büyük görme-dil modellerinin (LVLM’ler) doğruluğunu iyileştirmek yerine, kasıtlı olarak hallucinate etme eğilimini kullanarak, gerçekçi olmayan AI tarafından üretilen görüntüleri tespit etmek için alışılmadık bir yöntem öneriliyor.

Yeni yaklaşım, LVLM’leri kullanarak bir görüntüye ilişkin birden fazla ‘atomik gerçek’ çıkarır, ardından doğal dil çıkarımı (NLI) kullanarak bu ifadeler arasındaki çelişkileri sistematik olarak ölçer – efektif olarak modelin hatalarını, gerçekçi olmayan görüntüleri tespit etmek için bir tanısal araç haline getirir.

WHOOPS! veri setinden iki görüntü ve LVLM modeli tarafından otomatik olarak üretilen ifadeler. Sol görüntü gerçekçi, tutarlı açıklamalara yol açarken, sağdaki alışılmadık görüntü modelin hallucinate etmesine ve çelişkili veya yanlış ifadeler üretmesine neden oluyor. Kaynak: https://arxiv.org/pdf/2503.15948

WHOOPS! veri setinden iki görüntü ve LVLM modeli tarafından otomatik olarak üretilen ifadeler. Sol görüntü gerçekçi, tutarlı açıklamalara yol açarken, sağdaki alışılmadık görüntü modelin hallucinate etmesine ve çelişkili veya yanlış ifadeler üretmesine neden oluyor. Kaynak: https://arxiv.org/pdf/2503.15948

İkinci görüntünün gerçekçiliğini değerlendirmesi istendiğinde, LVLM, görüntüde bir şeyler yanlış olduğunu görebilir, çünkü betimlenen deve üç hörgüçü vardır, bu da doğada bilinmeyen bir özelliktir.

Ancak, LVLM ilk olarak >2 hörgüç ile >2 hayvan arasında bir ilişki kurar, çünkü bu, bir ‘deve resmi’nde üç hörgüç görmekten başka bir yol değildir. Ardından, daha da olmayacak bir şey (yani ‘iki baş’) hallucinate eder ve şüphelerini tetiklediği şeyin – olanaksız ek hörgüçün – açıklamasını hiç yapmaz.

Araştırmacılar, LVLM modellerinin bu tür bir değerlendirmeyi yerli olarak gerçekleştirebileceğini ve fine-tune edilmiş modellerle aynı düzeyde veya daha iyi performans gösterebileceğini bulmuşlardır. Fine-tune işlemi karmaşık, pahalı ve aşağı akış uygulamaları açısından oldukça kırılgan olduğu için, AI devrimindeki en büyük engellerden birinin yerli bir kullanımının keşfedilmesi, literatürdeki genel eğilimlere taze bir bakış açısı getiriyor.

Açık Değerlendirme

Yaklaşımın önemi, yazarlara göre, açık kaynak çerçevelerle dağıtılabiliyor olmasıdır. Gelişmiş ve yüksek yatırım gerektiren bir model gibi ChatGPT’nin (makale kabul ediyor) bu görevde daha iyi sonuçlar verebileceği kabul ediliyor, ancak literatürün çoğumuz (ve özellikle hobi ve VFX toplulukları) için gerçek değeri, yerel uygulamalarda yeni buluşları birleştirmek ve geliştirmek olasılığıdır; tersine, ticari API sistemine yönelik her şey geri çekilmeye, keyfi fiyat artışlarına ve şirketin kurumsal endişelerine kullanıcıların ihtiyaçlarından daha fazla yansıtan sansür politikalarına tabi olabilir.

Yeni makale, Hallüsinasyonlarla Savaşmayın, Onları Kullanın: NLI’yi Atomik Gerçekler Üzerinden Görüntü Gerçekçiliğini Tahmin Etme başlığını taşıyor ve Skolkovo Institute of Science and Technology (Skoltech), Moscow Institute of Physics and Technology, ve Rus şirketleri MTS AI ve AIRI’den beş araştırmacının eseridir. Çalışmanın accompanying GitHub sayfası bulunmaktadır.

Yöntem

Yazarlar, projede İsrail/Amerikan WHOOPS! Veri Seti‘ni kullanıyorlar:

WHOOPS! Veri Seti'nden imkansız görüntüler. Bu görüntülerin inandırıcı unsurları bir araya getirdiği ve bunların olasılıklarının bu uyumsuz yönlerin birleştirilmesiyle hesaplandığı dikkat çekicidir. Kaynak: https://whoops-benchmark.github.io/

WHOOPS! Veri Seti’nden imkansız görüntüler. Bu görüntülerin inandırıcı unsurları bir araya getirdiği ve bunların olasılıklarının bu uyumsuz yönlerin birleştirilmesiyle hesaplandığı dikkat çekicidir. Kaynak: https://whoops-benchmark.github.io/

Veri seti, 500 sentetik görüntü ve 10.874’den fazla anotasyondan oluşuyor ve özellikle AI modellerinin ortak akıl mantığı ve bileşik anlayışını test etmek için tasarlandı. Tasarım, Midjourney ve DALL-E serisi gibi metin-görüntü sistemleri kullanarak zorlu görüntüler oluşturmakla görevlendirilen tasarımcılar ile işbirliği içinde oluşturuldu – doğal olarak yakalanması zor veya imkansız senaryolar üretti:

WHOOPS! veri setinden daha fazla örnek. Kaynak: https://huggingface.co/datasets/nlphuji/whoops

WHOOPS! veri setinden daha fazla örnek. Kaynak: https://huggingface.co/datasets/nlphuji/whoops

Yeni yaklaşım üç aşamada çalışır: ilk olarak, LVLM (özellikle LLaVA-v1.6-mistral-7b) bir görüntüyü tanımlayan birden fazla basit ifade – ‘atomik gerçekler’ – üretmek için kullanılır. Bu ifadeler, Çeşitli Işın Arama kullanılarak üretilir, bu da çıktıların değişkenliğini sağlar.

Çeşitli Işın Arama, ilk olarak önerilen, diversity-augmented bir hedef için optimize ederek daha iyi bir çeşitlilikte kapanış seçenekleri üretir. Kaynak: https://arxiv.org/pdf/1610.02424

Çeşitli Işın Arama, diversity-augmented bir hedef için optimize ederek daha iyi bir çeşitlilikte kapanış seçenekleri üretir. Kaynak: https://arxiv.org/pdf/1610.02424

Sonra, her üretilen ifade, diğer tüm ifadelerle karşılaştırılarak bir Doğal Dil Çıkarım modeli kullanılarak sistematik olarak karşılaştırılır, bu da ifadelerin birbirini ima ettiği, çeliştirdiği veya tarafsız kaldığına ilişkin puanlar üretir.

Çelişkiler, görüntüde hallucinate edilen veya gerçekçi olmayan unsurları gösterir:

Algılama pipeline şeması.

Algılama pipeline şeması.

Son olarak, bu çift NLI puanları, üretilen ifadelerin genel tutarlılığını ölçen tek bir ‘gerçeklik puanı’ olarak birleştirilir.

Araştırmacılar, farklı birleştirme yöntemlerini araştırdılar ve bir kümeleme tabanlı yaklaşımın en iyi performansı gösterdiğini buldular. Yazarlar, NLI puanlarını iki küme ayırarak k-means kümeleme algoritmasını uyguladılar ve daha düşük değerli kümenin merkezi son ölçüt olarak seçildi.

İki kümenin doğrudan kullanılması, sınıflandırma görevinin ikili doğası ile uyumlu, yani gerçekçi ve gerçekçi olmayan görüntüleri ayırt etmek. Mantık, basitçe en düşük puanı seçmekle benzer, ancak kümeleme, bir dizi gerçeğin ortalama çelişkisini temsil etmeyi sağlar, tek bir aykırı değerine güvenmek yerine.

Veri ve Testler

Araştırmacılar, sistemlerini WHOOPS! temel benchmark üzerinde test ettiler, döndürülen test bölümleri (yani çapraz doğrulama) kullanarak. Test edilen modeller BLIP2 FlanT5-XL ve BLIP2 FlanT5-XXL idi ve BLIP2 FlanT5-XXL sıfır-şut formatında (yani ek eğitim olmadan) test edildi.

Emir izleme için bir temel olarak, yazarlar LVLM’leri ‘Bu alışılmadık mı? Kısa bir cümleyle kısaca açıklar mısınız?’ ifadesiyle uyarlarken, önceki bir araştırma bu ifadenin gerçekçi olmayan görüntüleri tespit etmek için etkili olduğunu buldu.

Değerlendirilen modeller LLaVA 1.6 Mistral 7B, LLaVA 1.6 Vicuna 13B ve InstructBLIP‘in 7/13 milyar parametreli iki boyutu idi.

Test prosedürü, 102 gerçek ve gerçekçi olmayan (‘garip’) görüntü çiftleri üzerine odaklandı. Her çift, normal bir görüntü ve ortak akıl karşıtı bir karşıt içeriyordu.

Üç insan anotatörü, görüntüleri etiketledi ve %92’lik bir uzlaşıya ulaştı, bu da ‘gariplik’ konusunda güçlü bir insan anlaşması olduğunu gösterdi. Değerlendirme yöntemlerinin doğruluğu, gerçekçi ve gerçekçi olmayan görüntüleri doğru bir şekilde ayırt etme yetenekleriyle ölçüldü.

Sistem, sabit bir tohumla veri karıştırarak üçlü çapraz doğrulama kullanılarak değerlendirildi. Yazarlar, eğitim sırasında ima puanları ve çelişki puanları için ağırlıkları ayarladı, ‘tarafsız’ puanları ise sıfıra sabitlendi. Son doğruluk, tüm test bölümleri boyunca ortalama olarak hesaplandı.

Farklı NLI modelleri ve birleştirme yöntemlerinin, beş üretilen gerçeğin bir alt kümesinde, doğruluk ölçütü ile karşılaştırılması.

Farklı NLI modelleri ve birleştirme yöntemlerinin, beş üretilen gerçeğin bir alt kümesinde, doğruluk ölçütü ile karşılaştırılması.

Yukarıdaki ilk sonuçlar hakkında, makale şöyle diyor:

‘[‘Küme’] yöntemi, en iyi performans gösterenlerden biri olarak öne çıkıyor. Bu, tüm çelişki puanlarının birleştirilmesinin, yalnızca aşırı değerlere odaklanmaktan daha önemli olduğunu ima ediyor. Ayrıca, en büyük NLI modeli (nli-deberta-v3-large), tüm birleştirme yöntemleri için diğerlerinden daha iyi performans gösteriyor, bu da problemin özünü daha etkili bir şekilde yakaladığını gösteriyor.’

Yazarlar, optimal ağırlıkların tutarlı olarak çelişkiyi ima puanlarından daha fazla tercih ettiğini buldular, bu da çelişkilerin gerçekçi olmayan görüntüleri ayırt etmek için daha bilgilendirici olduğunu gösteriyor. Their method, tüm test edilen sıfır-şut yöntemlerini geride bıraktı ve fine-tune edilmiş BLIP2 modelinin performansına yakın bir düzeyde kaldı:

Çeşitli yaklaşımların WHOOPS! benchmark üzerindeki performansı. Fine-tune edilmiş (ft) yöntemler üstte, sıfır-şut (zs) yöntemler ise altta listelenmiştir. Model boyutu, parametre sayısını gösterir ve doğruluk, değerlendirme ölçütü olarak kullanılır.

Çeşitli yaklaşımların WHOOPS! benchmark üzerindeki performansı. Fine-tune edilmiş (ft) yöntemler üstte, sıfır-şut (zs) yöntemler ise altta listelenmiştir. Model boyutu, parametre sayısını gösterir ve doğruluk, değerlendirme ölçütü olarak kullanılır.

Ayrıca, InstructBLIP’nin, aynı.prompt ile verilen benzer LLaVA modellerinden daha iyi performans gösterdiğini, GPT-4o’nun superior doğruluğunu tanıyarak, ancak pratik, açık kaynaklı çözümleri gösterme tercihlerini vurguladılar.

Sonuç

Ancak, yazarlar, projelerinin 2024 FaithScore çalışmasına olan borcunu kabul ediyor, bu çalışma, Teksas Üniversitesi ve Johns Hopkins Üniversitesi arasındaki bir işbirliği idi.

FaithScore değerlendirmesinin nasıl çalıştığına ilişkin bir illüstrasyon. İlk olarak, LVLM tarafından üretilen cevap içindeki betimleyici ifadeler tanımlanır. Sonra, bu ifadeler bireysel atomik gerçeklere ayrıştırılır. Son olarak, bu atomik gerçekler, girdi görüntüsüne karşı doğruluklarını doğrulamak için kullanılır. Altı çizili metin, nesnel betimleyici içeriği vurgular, mavi metin ise hallucinate edilen ifadeleri gösterir, bu da FaithScore'un yorumlanabilir bir gerçeklik ölçütü sunmasını sağlar. Kaynak: https://arxiv.org/pdf/2311.01477

FaithScore değerlendirmesinin nasıl çalıştığına ilişkin bir illüstrasyon. İlk olarak, LVLM tarafından üretilen cevap içindeki betimleyici ifadeler tanımlanır. Sonra, bu ifadeler bireysel atomik gerçeklere ayrıştırılır. Son olarak, bu atomik gerçekler, girdi görüntüsüne karşı doğruluklarını doğrulamak için kullanılır. Altı çizili metin, nesnel betimleyici içeriği vurgular, mavi metin ise hallucinate edilen ifadeleri gösterir, bu da FaithScore’un yorumlanabilir bir gerçeklik ölçütü sunmasını sağlar. Kaynak: https://arxiv.org/pdf/2311.01477

FaithScore, LVLM tarafından üretilen açıklamaların görüntü içeriğiyle tutarlılığını ölçer, mentre yeni makalenin yöntemi, LVLM hallucinasyonlarını kullanarak gerçekçi olmayan görüntüleri tespit eder, doğal dil çıkarımını üretilen gerçekler arasındaki çelişkileri ölçmek için kullanır.

Yeni çalışma, mevcut dil modellerinin tuhaflıklarına ve hallucinate etme eğilimine bağlıdır ve tamamen hallucinasyon yapmayan bir model geliştirilirse, yeni çalışmanın genel prensipleri artık geçerli olmayacaktır. Ancak, bu hala bir zorlu perspektif olarak kalıyor.

 

İlk olarak 25 Mart 2025 Salı günü yayımlandı

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai