Yapay zeka modelleri ve platformları
DiffSeg : Deneyimsiz Sıfır-Atış Segmentasyonu Kullanarak İstikrarlı Dağılma
Bilgisayarlı görme tabanlı modellerde yüksek kaliteli segmentasyon maskelerinin oluşturulması, temel bir zorluktur. Büyük ölçekli denetimli eğitimdeki recent gelişmeler, çeşitli görüntü stillerinde sıfır-atış segmentasyonuna olanak tanımıştır. Ayrıca, denetimsiz eğitim, geniş açıklamaların gerekmediği segmentasyonu basitleştirmiştir. Buna rağmen, sıfır-atış ortamında açıklamalar olmadan her şeyi segmentleyebilecek bir bilgisayar görme çerçevesi oluşturmak karmaşık bir görevdir. Bilgisayarlı görme modellerinde temel bir kavram olan anlamsal segmentasyon, bir görüntüyü uniform anlamları olan daha küçük bölgelere ayırma işlemini içerir. Bu teknik, tıbbi görüntüleme, görüntü düzenleme, otonom sürüş ve daha pek çok akış görevi için temel oluşturur.
Bilgisayarlı görme modellerinin geliştirilmesini ilerletmek için, görüntü segmentasyonunun sınırlı kategorilerle sabit bir veri kümesiyle sınırlı olmaması, bunun yerine çeşitli diğer uygulamalar için esnek bir temel görev olarak hareket etmesi önemlidir. Ancak, her piksel başına etiketler toplamanın yüksek maliyeti, açıklamaların gerekmediği sıfır-atış ve denetimli segmentasyon yöntemlerinin ilerlemesini sınırlayan önemli bir zorluktur. Bu makale, istikrarlı dağılma modellerindeki self-attention katmanlarının, açıklamalar olmadan herhangi bir girişi sıfır-atış ortamında segmentleyebilecek bir model oluşturmak için nasıl kullanılabileceğini tartışacaktır. Bu self-attention katmanları, önceden eğitilmiş bir istikrarlı dağılma modeli tarafından öğrenilen nesne kavramlarını doğal olarak anlar.
DiffSeg : Geliştirilmiş Sıfır-Atış Segmentasyon Algoritması
Anlamsal segmentasyon, bir görüntüyü çeşitli bölümlere ayırma işlemini içerir, her bölüm benzer anlamları paylaşır. Bu teknik, numerous akış görevleri için temel oluşturur. Geleneksel olarak, sıfır-atış bilgisayar görme görevleri, büyük veri kümeleriyle açıklamalı ve etiketlenmiş kategorileri kullanarak denetimli anlamsal segmentasyona dayanmıştır. Ancak, sıfır-atış ortamında denetimsiz anlamsal segmentasyonu uygulamak hala bir zorluktur. Geleneksel denetimli yöntemler etkili olsa da, her piksel başına etiketleme maliyeti genellikle engelleyici olup, daha esnek bir sıfır-atış ortamında denetimsiz segmentasyon yöntemlerinin geliştirilme ihtiyacını vurgulamaktadır.
Bu sınırlamayı gidermek için, DiffSeg, açıklamaların gerekmediği bir generic segmentasyon modeli oluşturmak için İstikrarlı Dağılma çerçevesinin yeteneklerini kullanarak yeni bir post-işleme stratejisi tanıtır. İstikrarlı Dağılma çerçeveleri,.prompt koşullarına dayalı yüksek çözünürlüklü görüntüler oluşturma konusunda themselves kanıtlamıştır. Üretilen görüntüler için, bu çerçeveler, karşılık gelen metin.promptları kullanarak segmentasyon maskeleri üretebilir, genellikle yalnızca baskın ön plan nesnelerini içerir.
Karşılaştırıldığında, DiffSeg, bir difüzyon modelindeki self-attention katmanlarından dikkat tensörleri kullanarak segmentasyon maskeleri oluşturan yeni bir post-işleme yöntemidir. DiffSeg algoritması, üç temel bileşenden oluşur: yinelemeli dikkat birleştirme, dikkat toplama ve non-maksimum bastırma, aşağıdaki görüntüde gösterildiği gibi.

DiffSeg algoritması, 4B dikkat tensörlerini uzaysal tutarlılıkla birleştirerek, çeşitli çözünürlüklerde görsel bilgilerin korunmasını sağlar ve yinelemeli birleştirme işlemiyle örnekleme anchor noktalarını kullanır. Bu anchor noktaları, aynı nesne anchor noktalarının sonunda emildiğinde, dikkat maskelerinin birleştirilmesi için bir başlangıç noktası olarak hizmet eder. DiffSeg çerçevesi, KL divergence yöntemiyle dikkat haritaları arasındaki benzerliği ölçerek birleştirme işlemini kontrol eder.
Kümeleme tabanlı denetimsiz segmentasyon yöntemleriyle karşılaştırıldığında, DiffSeg algoritmasında, geliştiricilerin önce küme sayısını belirtmesi gerekmez ve herhangi bir öncül bilgi olmadan, DiffSeg algoritması, ek kaynaklar kullanmadan segmentasyon üretebilir. Genel olarak, DiffSeg algoritması, “Önceden eğitilmiş bir İstikrarlı Dağılma modelini kullanarak, herhangi bir ek kaynağa veya öncül bilgiye gerek duymadan görüntüleri segmentleyebilen yeni bir denetimsiz ve sıfır-atış segmentasyon yöntemidir.”
DiffSeg : Temel Kavramlar
DiffSeg, Difüzyon Modelleri, Denetimsiz Segmentasyon ve Sıfır-Atış Segmentasyon öğrenimlerinden yararlanarak oluşturulmuş bir algoritmadır.
Difüzyon Modelleri
DiffSeg algoritması, önceden eğitilmiş difüzyon modellerinden öğrenimlere dayanır. Difüzyon modelleri, bilgisayar görme modelleri için en popüler üretken çerçevelerden biridir ve bir örneklenen izotropik Gaussian gürültü görüntüsünden bir görüntü oluşturmak için forward ve reverse difüzyon sürecini öğrenir. İstikrarlı Dağılma, difüzyon modellerinin en popüler varyantıdır ve denetimli segmentasyon, sıfır-atış sınıflandırma, anlamsal karşılık eşleştirmesi, etiket-etkin segmentasyon ve açık-sözlük segmentasyonu gibi çeşitli görevleri gerçekleştirmek için kullanılır. Ancak, difüzyon modellerinin sorunu, yüksek boyutlu görsel özelliklere dayanması ve bu özelliklerin tam avantajını elde etmek için ek eğitim gerektirmesidir.
Denetimsiz Segmentasyon
DiffSeg algoritması, denetimsiz segmentasyonla yakından ilgilidir, bu modern AI uygulaması, herhangi bir açıklama kullanmadan yoğun segmentasyon maskeleri oluşturmayı amaçlar. Ancak, iyi performans sergilemek için, denetimsiz segmentasyon modellerinin hedef veri kümesinde önceden eğitilmesi gerekir. Denetimsiz segmentasyon tabanlı AI çerçeveleri, iki kategoriye ayrılabilir: önceden eğitilmiş modellerin ayırt edici özelliklerini kullanan kümeleme ve değişmezlik temelinde kümeleme. İlk kategorideki çerçeveler, segmentasyon maskeleri oluşturmak için önceden eğitilmiş modellerin ayırt edici özelliklerini kullanırken, ikinci kategorideki çerçeveler, görüntüleri anlamsal kümelere ayırarak ve bozucu segmentasyonu önlemek için iki görüntü arasındaki mutual bilgiyi optimize eden genel bir kümeleme algoritması kullanır.
Sıfır-Atış Segmentasyon
DiffSeg algoritması, sıfır-atış segmentasyon çerçeveleriyle yakından ilgilidir, bu methodlar, herhangi bir öncül eğitim veya veri bilgisi olmadan herhangi bir şeyi segmentleyebilir. Sıfır-atış segmentasyon modelleri, recent zamanlarda výjeli sıfır-atış transfer kabiliyetleri göstermiştir, ancak metin girişleri ve promptlara ihtiyaç duyarlar. Karşılaştırıldığında, DiffSeg algoritması, bir difüzyon modelini kullanarak, nesne içeriğini bilmeden ve görüntüyü sentezlemeden veya sorgulamadan segmentasyon oluşturur.
DiffSeg : Yöntem ve Mimarisi
DiffSeg algoritması, yüksek kaliteli segmentasyon görevleri oluşturmak için önceden eğitilmiş bir istikrarlı dağılma modelindeki self-attention katmanlarını kullanır.
İstikrarlı Dağılma Modeli
İstikrarlı Dağılma, DiffSeg çerçevesinin temel kavramlarından biridir. İstikrarlı Dağılma, bir üretken AI çerçevesidir ve en popüler difüzyon modellerinden biridir. Bir difüzyon modelinin temel özellikleri, forward ve reverse geçişlerdir. Forward geçişte, bir görüntüye her zaman adımında küçük miktarlarda Gaussian gürültü eklenir, sonunda görüntüyü izotropik bir Gaussian gürültü görüntüsüne dönüştürür. Reverse geçişte, difüzyon modeli, izotropik Gaussian gürültü görüntüsünden Gaussian gürültüsünü kaldırarak orijinal görüntüyü geri kazanır.
İstikrarlı Dağılma çerçevesi, bir kodlayıcı-dekodör ve bir U-Net tasarımını attention katmanıyla birlikte kullanır, burada bir görüntüyü daha küçük uzaysal boyutlara sahip bir latent uzaya sıkıştırmak için bir kodlayıcı ve görüntüyü geri yüklemek için bir dekodör kullanır. U-Net mimarisi, her biri Transformer Katmanı veya ResNet katmanından oluşan modüler blokların bir yığınından oluşur.
Bileşenler ve Mimarisi
Difüzyon modellerindeki self-attention katmanları, nesnelerin doğal bilgilerini uzaysal dikkat haritaları şeklinde gruplar ve DiffSeg, geçerli bir segmentasyon maskesine dikkat tensörlerini birleştirmek için yeni bir post-işleme yöntemidir. DiffSeg pipeline üç temel bileşenden oluşur: dikkat toplama, non-maksimum bastırma ve yinelemeli dikkat.
Dikkat Toplama
Giriş görüntüsünün U-Net katmanlarından ve Kodlayıcıdan geçtikten sonra, İstikrarlı Dağılma modeli, 16 dikkat tensörü üretir, her boyut için 5 tensör. 16 tensör üretme amacının temel nedeni, farklı çözünürlüklerdeki bu dikkat tensörlerini en yüksek çözünürlüğe sahip bir tensöre birleştirmektir. Bunu başarmak için, DiffSeg algoritması, 4 boyutu birbirinden farklı olarak ele alır.
Dört boyutun son ikisi, farklı çözünürlüklere sahip olsa da, uzaysal olarak tutarlıdır, çünkü DiffSeg çerçevesinin 2B uzaysal haritası, konumlar ve uzaysal konumlar arasındaki korelasyona karşılık gelir. Sonuç olarak, DiffSeg çerçevesi, tüm dikkat haritalarının bu iki boyutunu en yüksek çözünürlüğe, 64 x 64’e örnekleme yapar. Diğer yandan, ilk iki boyut, dikkat haritalarının konum referansını gösterir, aşağıdaki görüntüde gösterildiği gibi.

Bu boyutlar, dikkat haritalarının konumuna atıfta bulunduğundan, dikkat haritaları buna göre birleştirilmelidir. Ayrıca, birleştirilmiş dikkat haritasının geçerli bir dağılımı olması için, çerçeve, birleştirmeden sonra dağılımı normalize eder, her dikkat haritasına çözünürlüğüyle orantılı bir ağırlık atar.
Yinelemeli Dikkat Birleştirme
Dikkat toplamanın temel amacı, bir dikkat tensörü hesaplamak iken, temel amaç, dikkat haritalarını bir dizi nesne önerisine birleştirmektir, her öneri tek bir nesnenin aktivasyonunu veya “stuff” kategorisini içerir. Bu amacı gerçekleştirmek için önerilen çözüm, tensörün geçerli dağılımında K-Means algoritmasını uygulamaktır, ancak K-Means kümeleme, kullanıcıların önce küme sayısını belirtmesini gerektirir. Ayrıca, K-Means algoritması, aynı görüntüde farklı sonuçlar üretebilir, çünkü başlangıç değerlerine bağımlıdır. Bu zorluğu aşmak için, DiffSeg çerçevesi, yinelemeli olarak dikkat haritalarını birleştirmek için bir örnekleme ızgarası oluşturmayı önerir.
Non-Maksimum Bastırma
Önceki yinelemeli dikkat birleştirme adımı, her biri bir nesnenin aktivasyonunu içeren olasılık veya dikkat haritalarından oluşan bir liste üretir. Çerçeve, bu liste Nesne önerilerini geçerli bir segmentasyon maskesine dönüştürmek için non-maksimum bastırma kullanır ve bu işlem, her bir liste öğesinin zaten bir olasılık dağılımı haritası olması nedeniyle etkili bir yaklaşımdır. Her uzaysal konum için tüm haritalarda, algoritma en büyük olasılığın indeksini alır ve ilgili haritanın indeksine dayalı olarak üyeliği atar.
DiffSeg : Deneyler ve Sonuçlar
Denetimsiz segmentasyonla çalışan çerçeveler, Cityscapes ve COCO-stuff-27 gibi iki segmentasyon standardını kullanır. Cityscapes standardı, 27 orta seviye kategorisi olan bir otonom sürüş veri kümesidir, enquanto COCO-stuff-27 standardı, 80 şey ve 91 kategoriyi 27 kategoriye birleştiren orijinal COCO-stuff veri kümesinin bir varyantıdır. Ayrıca, segmentasyon performansını analiz etmek için, DiffSeg çerçevesi, ortalama kesişim birleşimi (mIoU) ve piksel doğruluğu (ACC) kullanır ve DiffSeg algoritmasının bir anlamsal etiket sağlayamaması nedeniyle, her bir predicted maske ile bir ground truth maskesini eşleştirmek için Macar eşleştirme algoritması kullanılır. Predicted maskelerin sayısı, ground truth maskelerinin sayısını aştığında, çerçeve, eşleşmeyen predicted görevleri yanlış negatifler olarak dikkate alır.
Ayrıca, DiffSeg çerçevesi, üç çalışmayı da dikkate alır: Dil Bağımlılığı (LD), Denetimsiz Uyum (UA) ve Yardımcı Görüntü (AX). Dil Bağımlılığı, metin girişlerine ihtiyaç duyulan bir yöntemi ifade eder, Denetimsiz Uyum, yöntemin hedef veri kümesinde denetimsiz eğitim kullanmasını ifade eder, enquanto Yardımcı Görüntü, sentetik görüntüler veya referans görüntüleri havuzu olarak ek girişe ihtiyaç duyulan bir yöntemi ifade eder.
Sonuçlar
COCO standardında, DiffSeg çerçevesi, iki K-Means standardını içerir: K-Means-S ve K-Means-C. K-Means-C standardı, değerlendirdiği görüntülerdeki nesne sayısının ortalaması olarak hesaplanan 6 küme içerir, enquanto K-Means-S standardı, her görüntüdeki ground truth’taki nesne sayısına dayalı olarak her görüntüye özgü bir küme sayısını kullanır ve her iki standardın sonuçları aşağıdaki görüntüde gösterilir.

Görüldüğü gibi, K-Means standardı mevcut yöntemleri aşmaktadır, bu da self-attention tensörlerinin kullanımının avantajını göstermektedir. İlginç olan, K-Means-S standardının K-Means-C standardını aşması, küme sayısının her görüntüde temel bir hiperparametre olduğunu ve ayarlanmasının önemli olduğunu göstermektedir. Ayrıca, aynı dikkat tensörlerine dayanmasına rağmen, DiffSeg çerçevesi, K-Means standardlarını aşmaktadır, bu da DiffSeg çerçevesinin sadece daha iyi segmentasyon sağlamakla kalmayıp, aynı zamanda K-Means standardlarının dezavantajlarını da tránh ettiğini kanıtlamaktadır.
Cityscapes veri kümesinde, DiffSeg çerçevesi, 320 çözünürlüklü girişlerle çalışan çerçevelere benzer sonuçlar üretirken, 512 çözünürlüklü girişlerle çalışan çerçeveleri aşmaktadır.

Önce de bahsedildiği gibi, DiffSeg çerçevesi, aşağıdaki görüntüde gösterilen beberapa hiperparametreleri kullanır.

Dikkat toplama, DiffSeg çerçevesinin temel kavramlarından biridir ve farklı birleştirme ağırlıklarının kullanımı, aşağıdaki görüntüde gösterilmektedir, görüntünün çözünürlüğü sabit tutulmaktadır.

Görüldüğü gibi, yüksek çözünürlüklü haritalar (64 x 64) en ayrıntılı segmentasyonları sağlar, ancak segmentasyonlar bazı görünür kırılmalar içerebilir, mientras düşük çözünürlüklü haritalar (32 x 32) ayrıntı üzerinde fazla segmentasyon yapma eğilimindedir, ancak daha tutarlı segmentasyonlara yol açar. Düşük çözünürlüklü haritalar, mevcut hiperparametre ayarlarıyla, herhangi bir segmentasyon oluşturamaz, çünkü tüm görüntü tek bir nesneye birleştirilir. Son olarak, orantılı birleştirme stratejisi kullanan (a) şekil, daha iyi ayrıntı ve dengeli tutarlılık sağlar.
Son Düşünceler
Sıfır-atış denetimsiz segmentasyon, bilgisayar görme çerçeveleri için hala en büyük zorluklardan biridir ve mevcut modeller, sıfır-atış denetimsiz adaptasyona veya dış kaynaklara dayanmaktadır. Bu zorluğu aşmak için, self-attention katmanlarının, önceden eğitilmiş bir istikrarlı dağılma modeli tarafından öğrenilen nesnelerin doğal kavramlarını içeren bir model oluşturmak için nasıl kullanılabileceğini tartıştık. Ayrıca, DiffSeg’i, İstikrarlı Dağılma çerçevesinin yeteneklerini kullanarak, herhangi bir görüntüyü sıfır-atış ortamında segmentleyebilecek bir generic segmentasyon modeli oluşturmak için yeni bir post-işleme stratejisi olarak tanıttık. Algoritma, Dikkat Arası Benzerlik ve Dikkat İç Benzerlik kullanarak dikkat haritalarını yinelemeli olarak geçerli segmentasyon maskelerine birleştirmek için Inter-Attention Similarity ve Intra-Attention Similarity kullanır ve popüler standartlarda state-of-the-art performansı đạtar.












