Yapay zeka modelleri ve platformlarÄą

DiffSeg : Deneyimsiz SÄąfÄąr-AtÄąÅŸ Segmentasyonu Kullanarak İstikrarlÄą Dağılma

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

BilgisayarlÄą gÃķrme tabanlÄą modellerde yÞksek kaliteli segmentasyon maskelerinin oluşturulmasÄą, temel bir zorluktur. BÞyÞk Ãķlçekli denetimli eğitimdeki recent gelişmeler, çeşitli gÃķrÞntÞ stillerinde sÄąfÄąr-atÄąÅŸ segmentasyonuna olanak tanÄąmÄąÅŸtÄąr. AyrÄąca, denetimsiz eğitim, geniş aÃ§ÄąklamalarÄąn gerekmediği segmentasyonu basitleştirmiştir. Buna rağmen, sÄąfÄąr-atÄąÅŸ ortamÄąnda aÃ§Äąklamalar olmadan her şeyi segmentleyebilecek bir bilgisayar gÃķrme çerçevesi oluşturmak karmaÅŸÄąk bir gÃķrevdir. BilgisayarlÄą gÃķrme modellerinde temel bir kavram olan anlamsal segmentasyon, bir gÃķrÞntÞyÞ uniform anlamlarÄą olan daha kÞçÞk bÃķlgelere ayÄąrma işlemini içerir. Bu teknik, tÄąbbi gÃķrÞntÞleme, gÃķrÞntÞ dÞzenleme, otonom sÞrÞş ve daha pek çok akÄąÅŸ gÃķrevi için temel oluşturur.

BilgisayarlÄą gÃķrme modellerinin geliştirilmesini ilerletmek için, gÃķrÞntÞ segmentasyonunun sÄąnÄąrlÄą kategorilerle sabit bir veri kÞmesiyle sÄąnÄąrlÄą olmamasÄą, bunun yerine çeşitli diğer uygulamalar için esnek bir temel gÃķrev olarak hareket etmesi Ãķnemlidir. Ancak, her piksel baÅŸÄąna etiketler toplamanÄąn yÞksek maliyeti, aÃ§ÄąklamalarÄąn gerekmediği sÄąfÄąr-atÄąÅŸ ve denetimli segmentasyon yÃķntemlerinin ilerlemesini sÄąnÄąrlayan Ãķnemli bir zorluktur. Bu makale, istikrarlÄą dağılma modellerindeki self-attention katmanlarÄąnÄąn, aÃ§Äąklamalar olmadan herhangi bir girişi sÄąfÄąr-atÄąÅŸ ortamÄąnda segmentleyebilecek bir model oluşturmak için nasÄąl kullanÄąlabileceğini tartÄąÅŸacaktÄąr. Bu self-attention katmanlarÄą, Ãķnceden eğitilmiş bir istikrarlÄą dağılma modeli tarafÄąndan Ãķğrenilen nesne kavramlarÄąnÄą doğal olarak anlar.

DiffSeg : Geliştirilmiş SÄąfÄąr-AtÄąÅŸ Segmentasyon AlgoritmasÄą

Anlamsal segmentasyon, bir gÃķrÞntÞyÞ çeşitli bÃķlÞmlere ayÄąrma işlemini içerir, her bÃķlÞm benzer anlamlarÄą paylaÅŸÄąr. Bu teknik, numerous akÄąÅŸ gÃķrevleri için temel oluşturur. Geleneksel olarak, sÄąfÄąr-atÄąÅŸ bilgisayar gÃķrme gÃķrevleri, bÞyÞk veri kÞmeleriyle aÃ§ÄąklamalÄą ve etiketlenmiş kategorileri kullanarak denetimli anlamsal segmentasyona dayanmÄąÅŸtÄąr. Ancak, sÄąfÄąr-atÄąÅŸ ortamÄąnda denetimsiz anlamsal segmentasyonu uygulamak hala bir zorluktur. Geleneksel denetimli yÃķntemler etkili olsa da, her piksel baÅŸÄąna etiketleme maliyeti genellikle engelleyici olup, daha esnek bir sÄąfÄąr-atÄąÅŸ ortamÄąnda denetimsiz segmentasyon yÃķntemlerinin geliştirilme ihtiyacÄąnÄą vurgulamaktadÄąr.

Bu sÄąnÄąrlamayÄą gidermek için, DiffSeg, aÃ§ÄąklamalarÄąn gerekmediği bir generic segmentasyon modeli oluşturmak için İstikrarlÄą Dağılma çerçevesinin yeteneklerini kullanarak yeni bir post-işleme stratejisi tanÄątÄąr. İstikrarlÄą Dağılma çerçeveleri,.prompt koşullarÄąna dayalÄą yÞksek çÃķzÞnÞrlÞklÞ gÃķrÞntÞler oluşturma konusunda themselves kanÄątlamÄąÅŸtÄąr. Üretilen gÃķrÞntÞler için, bu çerçeveler, karÅŸÄąlÄąk gelen metin.promptlarÄą kullanarak segmentasyon maskeleri Þretebilir, genellikle yalnÄązca baskÄąn Ãķn plan nesnelerini içerir.

KarÅŸÄąlaştÄąrÄąldığında, DiffSeg, bir difÞzyon modelindeki self-attention katmanlarÄąndan dikkat tensÃķrleri kullanarak segmentasyon maskeleri oluşturan yeni bir post-işleme yÃķntemidir. DiffSeg algoritmasÄą, Þç temel bileşenden oluşur: yinelemeli dikkat birleştirme, dikkat toplama ve non-maksimum bastÄąrma, aşağıdaki gÃķrÞntÞde gÃķsterildiği gibi.

DiffSeg algoritmasÄą, 4B dikkat tensÃķrlerini uzaysal tutarlÄąlÄąkla birleştirerek, çeşitli çÃķzÞnÞrlÞklerde gÃķrsel bilgilerin korunmasÄąnÄą sağlar ve yinelemeli birleştirme işlemiyle Ãķrnekleme anchor noktalarÄąnÄą kullanÄąr. Bu anchor noktalarÄą, aynÄą nesne anchor noktalarÄąnÄąn sonunda emildiğinde, dikkat maskelerinin birleştirilmesi için bir başlangÄąÃ§ noktasÄą olarak hizmet eder. DiffSeg çerçevesi, KL divergence yÃķntemiyle dikkat haritalarÄą arasÄąndaki benzerliği Ãķlçerek birleştirme işlemini kontrol eder.

KÞmeleme tabanlÄą denetimsiz segmentasyon yÃķntemleriyle karÅŸÄąlaştÄąrÄąldığında, DiffSeg algoritmasÄąnda, geliştiricilerin Ãķnce kÞme sayÄąsÄąnÄą belirtmesi gerekmez ve herhangi bir ÃķncÞl bilgi olmadan, DiffSeg algoritmasÄą, ek kaynaklar kullanmadan segmentasyon Þretebilir. Genel olarak, DiffSeg algoritmasÄą, “Önceden eğitilmiş bir İstikrarlÄą Dağılma modelini kullanarak, herhangi bir ek kaynağa veya ÃķncÞl bilgiye gerek duymadan gÃķrÞntÞleri segmentleyebilen yeni bir denetimsiz ve sÄąfÄąr-atÄąÅŸ segmentasyon yÃķntemidir.”

DiffSeg : Temel Kavramlar

DiffSeg, DifÞzyon Modelleri, Denetimsiz Segmentasyon ve SÄąfÄąr-AtÄąÅŸ Segmentasyon Ãķğrenimlerinden yararlanarak oluşturulmuş bir algoritmadÄąr.

DifÞzyon Modelleri

DiffSeg algoritmasÄą, Ãķnceden eğitilmiş difÞzyon modellerinden Ãķğrenimlere dayanÄąr. DifÞzyon modelleri, bilgisayar gÃķrme modelleri için en popÞler Þretken çerçevelerden biridir ve bir Ãķrneklenen izotropik Gaussian gÞrÞltÞ gÃķrÞntÞsÞnden bir gÃķrÞntÞ oluşturmak için forward ve reverse difÞzyon sÞrecini Ãķğrenir. İstikrarlÄą Dağılma, difÞzyon modellerinin en popÞler varyantÄądÄąr ve denetimli segmentasyon, sÄąfÄąr-atÄąÅŸ sÄąnÄąflandÄąrma, anlamsal karÅŸÄąlÄąk eşleştirmesi, etiket-etkin segmentasyon ve aÃ§Äąk-sÃķzlÞk segmentasyonu gibi çeşitli gÃķrevleri gerçekleştirmek için kullanÄąlÄąr. Ancak, difÞzyon modellerinin sorunu, yÞksek boyutlu gÃķrsel Ãķzelliklere dayanmasÄą ve bu Ãķzelliklerin tam avantajÄąnÄą elde etmek için ek eğitim gerektirmesidir.

Denetimsiz Segmentasyon

DiffSeg algoritmasÄą, denetimsiz segmentasyonla yakÄąndan ilgilidir, bu modern AI uygulamasÄą, herhangi bir aÃ§Äąklama kullanmadan yoğun segmentasyon maskeleri oluşturmayÄą amaçlar. Ancak, iyi performans sergilemek için, denetimsiz segmentasyon modellerinin hedef veri kÞmesinde Ãķnceden eğitilmesi gerekir. Denetimsiz segmentasyon tabanlÄą AI çerçeveleri, iki kategoriye ayrÄąlabilir: Ãķnceden eğitilmiş modellerin ayÄąrt edici Ãķzelliklerini kullanan kÞmeleme ve değişmezlik temelinde kÞmeleme. İlk kategorideki çerçeveler, segmentasyon maskeleri oluşturmak için Ãķnceden eğitilmiş modellerin ayÄąrt edici Ãķzelliklerini kullanÄąrken, ikinci kategorideki çerçeveler, gÃķrÞntÞleri anlamsal kÞmelere ayÄąrarak ve bozucu segmentasyonu Ãķnlemek için iki gÃķrÞntÞ arasÄąndaki mutual bilgiyi optimize eden genel bir kÞmeleme algoritmasÄą kullanÄąr.

SÄąfÄąr-AtÄąÅŸ Segmentasyon

DiffSeg algoritmasÄą, sÄąfÄąr-atÄąÅŸ segmentasyon çerçeveleriyle yakÄąndan ilgilidir, bu methodlar, herhangi bir ÃķncÞl eğitim veya veri bilgisi olmadan herhangi bir şeyi segmentleyebilir. SÄąfÄąr-atÄąÅŸ segmentasyon modelleri, recent zamanlarda vÃ―jeli sÄąfÄąr-atÄąÅŸ transfer kabiliyetleri gÃķstermiştir, ancak metin girişleri ve promptlara ihtiyaç duyarlar. KarÅŸÄąlaştÄąrÄąldığında, DiffSeg algoritmasÄą, bir difÞzyon modelini kullanarak, nesne içeriğini bilmeden ve gÃķrÞntÞyÞ sentezlemeden veya sorgulamadan segmentasyon oluşturur.

DiffSeg : YÃķntem ve Mimarisi

DiffSeg algoritmasÄą, yÞksek kaliteli segmentasyon gÃķrevleri oluşturmak için Ãķnceden eğitilmiş bir istikrarlÄą dağılma modelindeki self-attention katmanlarÄąnÄą kullanÄąr.

İstikrarlı Dağılma Modeli

İstikrarlÄą Dağılma, DiffSeg çerçevesinin temel kavramlarÄąndan biridir. İstikrarlÄą Dağılma, bir Þretken AI çerçevesidir ve en popÞler difÞzyon modellerinden biridir. Bir difÞzyon modelinin temel Ãķzellikleri, forward ve reverse geçişlerdir. Forward geçişte, bir gÃķrÞntÞye her zaman adÄąmÄąnda kÞçÞk miktarlarda Gaussian gÞrÞltÞ eklenir, sonunda gÃķrÞntÞyÞ izotropik bir Gaussian gÞrÞltÞ gÃķrÞntÞsÞne dÃķnÞştÞrÞr. Reverse geçişte, difÞzyon modeli, izotropik Gaussian gÞrÞltÞ gÃķrÞntÞsÞnden Gaussian gÞrÞltÞsÞnÞ kaldÄąrarak orijinal gÃķrÞntÞyÞ geri kazanÄąr.

İstikrarlÄą Dağılma çerçevesi, bir kodlayÄącÄą-dekodÃķr ve bir U-Net tasarÄąmÄąnÄą attention katmanÄąyla birlikte kullanÄąr, burada bir gÃķrÞntÞyÞ daha kÞçÞk uzaysal boyutlara sahip bir latent uzaya sÄąkÄąÅŸtÄąrmak için bir kodlayÄącÄą ve gÃķrÞntÞyÞ geri yÞklemek için bir dekodÃķr kullanÄąr. U-Net mimarisi, her biri Transformer KatmanÄą veya ResNet katmanÄąndan oluşan modÞler bloklarÄąn bir yığınÄąndan oluşur.

Bileşenler ve Mimarisi

DifÞzyon modellerindeki self-attention katmanlarÄą, nesnelerin doğal bilgilerini uzaysal dikkat haritalarÄą şeklinde gruplar ve DiffSeg, geçerli bir segmentasyon maskesine dikkat tensÃķrlerini birleştirmek için yeni bir post-işleme yÃķntemidir. DiffSeg pipeline Þç temel bileşenden oluşur: dikkat toplama, non-maksimum bastÄąrma ve yinelemeli dikkat.

Dikkat Toplama

Giriş gÃķrÞntÞsÞnÞn U-Net katmanlarÄąndan ve KodlayÄącÄądan geçtikten sonra, İstikrarlÄą Dağılma modeli, 16 dikkat tensÃķrÞ Þretir, her boyut için 5 tensÃķr. 16 tensÃķr Þretme amacÄąnÄąn temel nedeni, farklÄą çÃķzÞnÞrlÞklerdeki bu dikkat tensÃķrlerini en yÞksek çÃķzÞnÞrlÞğe sahip bir tensÃķre birleştirmektir. Bunu başarmak için, DiffSeg algoritmasÄą, 4 boyutu birbirinden farklÄą olarak ele alÄąr.

DÃķrt boyutun son ikisi, farklÄą çÃķzÞnÞrlÞklere sahip olsa da, uzaysal olarak tutarlÄądÄąr, çÞnkÞ DiffSeg çerçevesinin 2B uzaysal haritasÄą, konumlar ve uzaysal konumlar arasÄąndaki korelasyona karÅŸÄąlÄąk gelir. Sonuç olarak, DiffSeg çerçevesi, tÞm dikkat haritalarÄąnÄąn bu iki boyutunu en yÞksek çÃķzÞnÞrlÞğe, 64 x 64’e Ãķrnekleme yapar. Diğer yandan, ilk iki boyut, dikkat haritalarÄąnÄąn konum referansÄąnÄą gÃķsterir, aşağıdaki gÃķrÞntÞde gÃķsterildiği gibi.

Bu boyutlar, dikkat haritalarÄąnÄąn konumuna atÄąfta bulunduğundan, dikkat haritalarÄą buna gÃķre birleştirilmelidir. AyrÄąca, birleştirilmiş dikkat haritasÄąnÄąn geçerli bir dağılÄąmÄą olmasÄą için, çerçeve, birleştirmeden sonra dağılÄąmÄą normalize eder, her dikkat haritasÄąna çÃķzÞnÞrlÞğÞyle orantÄąlÄą bir ağırlÄąk atar.

Yinelemeli Dikkat Birleştirme

Dikkat toplamanÄąn temel amacÄą, bir dikkat tensÃķrÞ hesaplamak iken, temel amaç, dikkat haritalarÄąnÄą bir dizi nesne Ãķnerisine birleştirmektir, her Ãķneri tek bir nesnenin aktivasyonunu veya “stuff” kategorisini içerir. Bu amacÄą gerçekleştirmek için Ãķnerilen çÃķzÞm, tensÃķrÞn geçerli dağılÄąmÄąnda K-Means algoritmasÄąnÄą uygulamaktÄąr, ancak K-Means kÞmeleme, kullanÄącÄąlarÄąn Ãķnce kÞme sayÄąsÄąnÄą belirtmesini gerektirir. AyrÄąca, K-Means algoritmasÄą, aynÄą gÃķrÞntÞde farklÄą sonuçlar Þretebilir, çÞnkÞ başlangÄąÃ§ değerlerine bağımlÄądÄąr. Bu zorluğu aşmak için, DiffSeg çerçevesi, yinelemeli olarak dikkat haritalarÄąnÄą birleştirmek için bir Ãķrnekleme ÄązgarasÄą oluşturmayÄą Ãķnerir.

Non-Maksimum BastÄąrma

Önceki yinelemeli dikkat birleştirme adÄąmÄą, her biri bir nesnenin aktivasyonunu içeren olasÄąlÄąk veya dikkat haritalarÄąndan oluşan bir liste Þretir. Çerçeve, bu liste Nesne Ãķnerilerini geçerli bir segmentasyon maskesine dÃķnÞştÞrmek için non-maksimum bastÄąrma kullanÄąr ve bu işlem, her bir liste Ãķğesinin zaten bir olasÄąlÄąk dağılÄąmÄą haritasÄą olmasÄą nedeniyle etkili bir yaklaÅŸÄąmdÄąr. Her uzaysal konum için tÞm haritalarda, algoritma en bÞyÞk olasÄąlığın indeksini alÄąr ve ilgili haritanÄąn indeksine dayalÄą olarak Þyeliği atar.

DiffSeg : Deneyler ve Sonuçlar

Denetimsiz segmentasyonla çalÄąÅŸan çerçeveler, Cityscapes ve COCO-stuff-27 gibi iki segmentasyon standardÄąnÄą kullanÄąr. Cityscapes standardÄą, 27 orta seviye kategorisi olan bir otonom sÞrÞş veri kÞmesidir, enquanto COCO-stuff-27 standardÄą, 80 şey ve 91 kategoriyi 27 kategoriye birleştiren orijinal COCO-stuff veri kÞmesinin bir varyantÄądÄąr. AyrÄąca, segmentasyon performansÄąnÄą analiz etmek için, DiffSeg çerçevesi, ortalama kesişim birleşimi (mIoU) ve piksel doğruluğu (ACC) kullanÄąr ve DiffSeg algoritmasÄąnÄąn bir anlamsal etiket sağlayamamasÄą nedeniyle, her bir predicted maske ile bir ground truth maskesini eşleştirmek için Macar eşleştirme algoritmasÄą kullanÄąlÄąr. Predicted maskelerin sayÄąsÄą, ground truth maskelerinin sayÄąsÄąnÄą aştığında, çerçeve, eşleşmeyen predicted gÃķrevleri yanlÄąÅŸ negatifler olarak dikkate alÄąr.

AyrÄąca, DiffSeg çerçevesi, Þç çalÄąÅŸmayÄą da dikkate alÄąr: Dil BağımlÄąlığı (LD), Denetimsiz Uyum (UA) ve YardÄąmcÄą GÃķrÞntÞ (AX). Dil BağımlÄąlığı, metin girişlerine ihtiyaç duyulan bir yÃķntemi ifade eder, Denetimsiz Uyum, yÃķntemin hedef veri kÞmesinde denetimsiz eğitim kullanmasÄąnÄą ifade eder, enquanto YardÄąmcÄą GÃķrÞntÞ, sentetik gÃķrÞntÞler veya referans gÃķrÞntÞleri havuzu olarak ek girişe ihtiyaç duyulan bir yÃķntemi ifade eder.

Sonuçlar

COCO standardÄąnda, DiffSeg çerçevesi, iki K-Means standardÄąnÄą içerir: K-Means-S ve K-Means-C. K-Means-C standardÄą, değerlendirdiği gÃķrÞntÞlerdeki nesne sayÄąsÄąnÄąn ortalamasÄą olarak hesaplanan 6 kÞme içerir, enquanto K-Means-S standardÄą, her gÃķrÞntÞdeki ground truth’taki nesne sayÄąsÄąna dayalÄą olarak her gÃķrÞntÞye ÃķzgÞ bir kÞme sayÄąsÄąnÄą kullanÄąr ve her iki standardÄąn sonuçlarÄą aşağıdaki gÃķrÞntÞde gÃķsterilir.

GÃķrÞldÞğÞ gibi, K-Means standardÄą mevcut yÃķntemleri aşmaktadÄąr, bu da self-attention tensÃķrlerinin kullanÄąmÄąnÄąn avantajÄąnÄą gÃķstermektedir. İlginç olan, K-Means-S standardÄąnÄąn K-Means-C standardÄąnÄą aşmasÄą, kÞme sayÄąsÄąnÄąn her gÃķrÞntÞde temel bir hiperparametre olduğunu ve ayarlanmasÄąnÄąn Ãķnemli olduğunu gÃķstermektedir. AyrÄąca, aynÄą dikkat tensÃķrlerine dayanmasÄąna rağmen, DiffSeg çerçevesi, K-Means standardlarÄąnÄą aşmaktadÄąr, bu da DiffSeg çerçevesinin sadece daha iyi segmentasyon sağlamakla kalmayÄąp, aynÄą zamanda K-Means standardlarÄąnÄąn dezavantajlarÄąnÄą da trÃĄnh ettiğini kanÄątlamaktadÄąr.

Cityscapes veri kÞmesinde, DiffSeg çerçevesi, 320 çÃķzÞnÞrlÞklÞ girişlerle çalÄąÅŸan çerçevelere benzer sonuçlar Þretirken, 512 çÃķzÞnÞrlÞklÞ girişlerle çalÄąÅŸan çerçeveleri aşmaktadÄąr.

Önce de bahsedildiği gibi, DiffSeg çerçevesi, aşağıdaki gÃķrÞntÞde gÃķsterilen beberapa hiperparametreleri kullanÄąr.

Dikkat toplama, DiffSeg çerçevesinin temel kavramlarÄąndan biridir ve farklÄą birleştirme ağırlÄąklarÄąnÄąn kullanÄąmÄą, aşağıdaki gÃķrÞntÞde gÃķsterilmektedir, gÃķrÞntÞnÞn çÃķzÞnÞrlÞğÞ sabit tutulmaktadÄąr.

GÃķrÞldÞğÞ gibi, yÞksek çÃķzÞnÞrlÞklÞ haritalar (64 x 64) en ayrÄąntÄąlÄą segmentasyonlarÄą sağlar, ancak segmentasyonlar bazÄą gÃķrÞnÞr kÄąrÄąlmalar içerebilir, mientras dÞşÞk çÃķzÞnÞrlÞklÞ haritalar (32 x 32) ayrÄąntÄą Þzerinde fazla segmentasyon yapma eğilimindedir, ancak daha tutarlÄą segmentasyonlara yol açar. DÞşÞk çÃķzÞnÞrlÞklÞ haritalar, mevcut hiperparametre ayarlarÄąyla, herhangi bir segmentasyon oluşturamaz, çÞnkÞ tÞm gÃķrÞntÞ tek bir nesneye birleştirilir. Son olarak, orantÄąlÄą birleştirme stratejisi kullanan (a) şekil, daha iyi ayrÄąntÄą ve dengeli tutarlÄąlÄąk sağlar.

Son DÞşÞnceler

SÄąfÄąr-atÄąÅŸ denetimsiz segmentasyon, bilgisayar gÃķrme çerçeveleri için hala en bÞyÞk zorluklardan biridir ve mevcut modeller, sÄąfÄąr-atÄąÅŸ denetimsiz adaptasyona veya dÄąÅŸ kaynaklara dayanmaktadÄąr. Bu zorluğu aşmak için, self-attention katmanlarÄąnÄąn, Ãķnceden eğitilmiş bir istikrarlÄą dağılma modeli tarafÄąndan Ãķğrenilen nesnelerin doğal kavramlarÄąnÄą içeren bir model oluşturmak için nasÄąl kullanÄąlabileceğini tartÄąÅŸtÄąk. AyrÄąca, DiffSeg’i, İstikrarlÄą Dağılma çerçevesinin yeteneklerini kullanarak, herhangi bir gÃķrÞntÞyÞ sÄąfÄąr-atÄąÅŸ ortamÄąnda segmentleyebilecek bir generic segmentasyon modeli oluşturmak için yeni bir post-işleme stratejisi olarak tanÄąttÄąk. Algoritma, Dikkat ArasÄą Benzerlik ve Dikkat İç Benzerlik kullanarak dikkat haritalarÄąnÄą yinelemeli olarak geçerli segmentasyon maskelerine birleştirmek için Inter-Attention Similarity ve Intra-Attention Similarity kullanÄąr ve popÞler standartlarda state-of-the-art performansÄą đṡtar.

Mesleği mÞhendis, kalbi yazar. Kunal, AI ve ML'ye derin bir sevgi ve anlayÄąÅŸla technical writer, bu alanlardaki karmaÅŸÄąk kavramlarÄą etkileyici ve bilgilendirici belgelerle basitleştirmeye adanmÄąÅŸ.