Yapay zeka modelleri ve platformlarÄą

TinySAM : Segment Her Şeyi Verimli Bir Şekilde Modeli

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Nesne segmentasyonu, modern bilgisayar vizyonunda temel ve kritik Ãķneme sahip bir alandÄąr. Nesne lokalizasyonu ve tanÄąmlama gibi geniş gÃķrsel bileşenler gerektiren uygulamalarda hayati bir rol oynar ve gerçek zamanlÄą, hÄązlÄą ve doğru segmentasyon gerektirir. Bu Ãķnem, nesne segmentasyonunu sÞrekli bir araştÄąrma konusu haline getirmiş ve Ãķrnek olarak instance segmentasyon, semantic segmentasyon ve panoptik segmentasyon gibi alanlarda Ãķnemli çalÄąÅŸmalar yapÄąlmÄąÅŸtÄąr.

Nesne segmentasyonunun evrimi ile birlikte, Segment Her Şeyi Modeli (SAM)remarkable bir araç olarak ortaya Ã§ÄąkmÄąÅŸ ve çeşitli bilgisayar vizyonu uygulamalarÄąnda nhanh bir şekilde benimsenmiştir. SAM mimarisini kullanan çerçeveler, aşağı akÄąm vizyon gÃķrevlerinde etkileyici performanslar elde etmişlerdir. Ancak, yÞksek doğrulukta segmentasyon gÃķrevlerinde sahip olduğu yeteneklerine rağmen, SAM’ın karmaÅŸÄąk ve ağır mimarisi, Ãķnemli miktarda hesaplama gÞcÞnÞ gerektirir ve bu da hesaplamalÄą olarak kÄąsÄątlÄą cihazlarda uygulanmasÄąnÄą engellemektedir.

SAM’ın hesaplamalÄą zorluklarÄąnÄą ele alan araştÄąrmacÄąlar, Tiny Segment Her Şeyi Modeli (TinySAM) geliştirdiler. TinySAM, orijinal çerçevedeki zero-shot performansÄąnÄą korurken daha hafif bir modeldir. TinySAM, Ãķğrenci modelini daha verimli hale getirmeyi amaçlayan bir full-stage bilgi damÄątma yÃķntemi kullanÄąr. Post-eğitim kuantizasyonu,.promptable segmentasyon gÃķrevlerine uyarlanÄąr ve hesaplama gereksinimlerini daha da azaltÄąr. AyrÄąca, TinySAM’ın tasarÄąmÄą, hiyerarşik segmentasyonu amaçlar ve bu da performansÄą bozmadan æŽĻᐆ hÄązÄąnÄą neredeyse iki katÄąna Ã§ÄąkarÄąr.

Bu makale, TinySAM çerçevesini, temel prensiplerini, mimarisini ve diğer state-of-the-art segmentasyon çerçevelerine kÄąyasla performansÄąnÄą keşfedecektir. Bu konularÄą daha ayrÄąntÄąlÄą olarak inceleyelim.

TinySAM : Verimli Segment Her Şeyi Modeli

Segment Her Şeyi Modeli, 11 milyondan fazla gÃķrÞntÞ ve bir milyardan fazla gÃķrÞntÞ maskesi içeren bÞyÞk bir segmentasyon veri setine sahip olduğu için, çeşitli bilgisayar vizyonu uygulamalarÄąnda hÄązlÄą ilerlemeye yardÄąmcÄą olmuştur. Nesneleri keyfi kategoriler ve şekillerde segmentleme gÃķrevlerinde ÞstÞn performans sergileyen SAM, image inpainting, nesne takibi, 3D vizyon ve daha fazlasÄą gibi aşağı akÄąm gÃķrevler için temel oluşturur. AyrÄąca, Segment Her Şeyi Modeli, sÄąnÄąrlÄą veri ile çalÄąÅŸan hassas endÞstriler için yararlÄą olan remarkable zero-shot segmentasyon performansÄą sunar.

Segment Her Şeyi Modeli’nin segmentasyon yetenekleri konusunda hiçbir şÞphe yok, ancak karmaÅŸÄąk mimari ve yÞksek hesaplama gereksinimleri nedeniyle, modern bir GPU’da 1024×1024 gÃķrÞntÞ içinæŽĻᐆ zamanÄą 2 saniyeye kadar Ã§Äąkabilir. Bu nedenle, SAM uygulamalarÄąnÄą hesaplamalÄą olarak kÄąsÄątlÄą cihazlara uygulamak oldukça zordur. Bu engeli aşmak için, MobileSAM ve FastSAM gibi recent çalÄąÅŸmalar, daha hesaplama verimli bir SAM modeli geliştirmeye çalÄąÅŸtÄą. MobileSAM, ağır bileşeni TinyViT mimarisi ile değiştirmeyi amaçlarken, FastSAM, segmentleme gÃķrevini tek bir kategori ile instance segmentasyon gÃķrevine dÃķnÞştÞrmeyi amaçladÄą. Ancak bu yÃķntemler, hesaplama gereksinimlerini azaltmada bazÄą başarÄąlar elde etseler de, Ãķzellikle zero-shot aşağı akÄąm gÃķrevlerde performansÄąnÄą koruyamadÄąlar.

TinySAM veya Tiny Segment Her Şeyi Modeli, mevcut SAM modelinin hesaplama gereksinimlerini azaltmaya çalÄąÅŸÄąrken, zero-shot aşağı akÄąm gÃķrevlerdeki performansÄą bozmaz. TinySAM, Ãķğrenci modelinin yeteneklerini artÄąrmayÄą amaçlayan bir full-stage bilgi damÄątma yÃķntemi Ãķnerir. TinySAM, Ãķğrenci modelini farklÄą aşamalardan Ãķğretmen modelinin gÃķzetiminde eğitir ve distilasyon sÞrecini daha da gÞçlendirmek için online hard prompt Ãķrneklemesi kullanÄąr. AyrÄąca, hesaplama maliyetlerini daha da azaltmak için, TinySAM, post-eğitim kuantizasyonu bileşenlerini promptable segmentasyon gÃķrevlerine uygular.

Segment Her Şeyi Modeli’nin hesaplamalÄą gereksinimlerinin bÞyÞk bir kÄąsmÄą, modelin gÃķrÞntÞäļ­įš„ her şeyi segmentlemek için yoğun bir nokta ÄązgarasÄą oluşturmasÄąndan kaynaklanmaktadÄąr. TinySAM, bu segmentasyon stratejisindeki hesaplamalÄą gereksinimleri aşmak için, hiyerarşik bir segmentleme stratejisi kullanÄąr ve bu daæŽĻᐆ hÄązÄąnÄą neredeyse iki katÄąna Ã§ÄąkarÄąr. Bu yÃķntemler ile TinySAM, hesaplama gereksinimlerinde Ãķnemli bir azalma sağlar ve verimli segmentleme gÃķrevleri için yeni sÄąnÄąrlar oluşturur.

TinySAM : Mimarisi ve YÃķntemi

TinySAM çerçevesinin mimarisini ve yÃķntemini konuşmadan Ãķnce, Ãķnce SAM çerçevesinin atasÄą olan SAM modeline bakmak Ãķnemlidir. SAM modeli, çeşitli aşağı akÄąm vizyon ve nesne segmentasyon gÃķrevlerinde remarkable performans, esneklik ve genelleme yetenekleri sergilemiştir.

SAM modelinin temelinde, Þç alt ağ vardÄąr: prompt kodlayÄącÄą, gÃķrÞntÞ kodlayÄącÄą ve maske kodlayÄącÄą. Prompt kodlayÄącÄą, keyfi şekilli maskeleri, girdi noktalarÄąnÄą ve metinleri konum bilgileri ile kodlar. GÃķrÞntÞ kodlayÄącÄą, bir Vision Transformer tabanlÄą ağır ağdÄąr ve girdi gÃķrÞntÞsÞnÞ gÃķmme olarak Ã§ÄąkarÄąr. Model, geometrik ve metin.promptlarÄą işlemek için farklÄą ağlar kullanÄąr. Son olarak, maske kodlayÄącÄą, prompt ve gÃķrÞntÞ kodlayÄącÄąlarÄąn Ã§ÄąktÄąsÄąnÄą alan bir iki yÃķnlÞ transformer içerir ve nihai maske tahmini Þretir. Veri seti ile birlikte, SAM çerçevesi, nesne şekli ve kategorisi ne olursa olsun yÞksek kaliteli segmentasyon yetenekleri sergiler. AyrÄąca, Segment Her Şeyi Modeli, zero-shot aşağı akÄąm vizyon gÃķrevlerinde, nesne Ãķnerisi, kenar algÄąlama, metin-maskesi tahmini ve instance segmentasyon gibi gÃķrevlerde remarkable performans sergiler. YÞksek kaliteli segmentasyon yetenekleri ve esnek.prompt teklifleri sayesinde, SAM çerçeveleri vizyon uygulamalarÄą için temel oluşturur. Ancak, geleneksel SAM mimarisinin yÞksek hesaplamalÄą gereksinimlerini gÃķz ardÄą edilemez, çÞnkÞ bÞyÞk sayÄąda parametre, SAM tabanlÄą uygulamalarÄą hesaplamalÄą olarak kÄąsÄątlÄą cihazlara uygulamayÄą neredeyse imkansÄąz hale getirir.

Bilgi DamÄątma

Bilgi damÄątma, compact ağlarÄąn eğitim aşamasÄąnda performansÄąnÄą artÄąrmak için Ãķnemli bir yaklaÅŸÄąmdÄąr. Bilgi damÄątma yÃķntemi, Ãķğretmen modelinin Ã§ÄąktÄąsÄąnÄą kullanarak hafif Ãķğrenci modelinin eğitimini denetler. Bilgi damÄątma yÃķntemi, ara Ãķzellikler için damÄątma ve ağ Ã§ÄąktÄąlarÄą için damÄątma olmak Þzere iki alt kategoriye ayrÄąlabilir, ve ÐąÐūÐŧҌ҈ÐļÐ―luğu gÃķrÞntÞ sÄąnÄąflandÄąrma gÃķrevlerine odaklanan araştÄąrma çalÄąÅŸmalarÄą vardÄąr.

Aşağıdaki şekil, TinySAM çerçevesinin genel mimarisini ve zero-shot instance segmentasyon gÃķrevlerindeki performansÄąnÄą gÃķsterir.

İlk aşamada, TinySAM çerçevesi, SAM çerçevesi için Ãķzel olarak tasarlanmÄąÅŸ bir bilgi damÄątma yÃķntemi uygular ve distilasyon sÞrecini daha da gÞçlendirmek için online hard prompt Ãķrneklemesi kullanÄąr. İkinci aşamada, TinySAM çerçevesi, post-eğitim kuantizasyonu yÃķntemini promptable segmentasyon gÃķrevlerine uyarlar ve hafif Ãķğrenci modeline uygular. Son olarak, model, segmentasyon gÃķrevleri için tasarlanmÄąÅŸ hiyerarşik bir segmentleme modu uygular ve bu daæŽĻᐆ hÄązÄąnÄą neredeyse iki katÄąna Ã§ÄąkarÄąr.

Tam Aşama Bilgi DamÄątma

Önceki kÄąsÄąmda bahsedildiği gibi, Segment Her Şeyi Modeli, Þç alt ağdan oluşur: prompt kodlayÄącÄą, gÃķrÞntÞ kodlayÄącÄą ve maske kodlayÄącÄą. GÃķrÞntÞ kodlayÄącÄą bileşeni, bir Vision Transformer tabanlÄą ağır ağdÄąr ve yÞksek hesaplamalÄą gereksinimlere sahiptir. Bu sorunu aşmak için, MobileSAM çerçevesi, Vision Transformer’ı TinyViT ile değiştirdi, ancak bu değişim Ãķnemli bir performans kaybÄąna neden oldu. Performans kaybÄąnÄą Ãķnlemek için, TinySAM çerçevesi, full-stage bilgi damÄątma yÃķntemi uygular ve hafif gÃķrÞntÞ kodlayÄącÄąsÄąnÄą Ãķğretmen modelinin Ãķğrenme dÞzeyinden çoklu bilgi dÞzeyine kadar rehberlik eder. Geleneksel kayÄąp fonksiyonuna ek olarak, TinySAM çerçevesi, farklÄą aşamalarda birçok damÄątma kaybÄą tanÄąr, aşağıdaki şekilde gÃķsterildiği gibi.

Kuantizasyon

Model kuantizasyonu, bilgisayar vizyonu çerçevelerinde popÞler bir yaklaÅŸÄąmdÄąr ve modeli daha dÞşÞk bant genişliğine sahip bir modele sÄąkÄąÅŸtÄąrmak için kullanÄąlÄąr, bu da hesaplamalÄą karmaÅŸÄąklığı ve depolama gereksinimlerini azaltmaya yardÄąmcÄą olur.

TinySAM’de kuantizasyonun temel amacÄą,Scaling faktÃķrÞ kullanarak kayan nokta tensÃķrÞnÞ tam sayÄą tensÃķrÞne projeler ve bu da hesaplamalÄą gereksinimleri azaltmaya yardÄąmcÄą olur.

Hiyerarşik Segment Her Şeyi

Segment Her Şeyi Modeli, gÃķrÞntÞäļ­įš„ her şeyi segmentlemek için otomatik bir maske oluşturucu kullanÄąr. Ancak, yoğun bir nokta ÄązgarasÄą kullanmanÄąn, Ãķver-fine grained segmentasyon Ã§ÄąktÄąlarÄąna neden olabileceği ve bu sÞrecin yÞksek hesaplamalÄą gereksinimlere neden olabileceği gÃķsterilmiştir. AyrÄąca, bir nesneyi tamamen segmentlemek için çok fazla Ãķrnek noktasÄą kullanmanÄąn, nesnenin farklÄą bÃķlÞmlerinin ayrÄą maskeler olarak yanlÄąÅŸ bir şekilde segmentlenmesine neden olabileceği ve bu da yÞksek hesaplamalÄą gereksinimlere neden olur.

Orijinal SAM çerçevesinin approach’undan farklÄą olarak, TinySAM modeli, her kenarda yalnÄązca %25 nokta kullanÄąr, bu da orijinal ayarlarÄąn yalnÄązca %1/16’sÄą kadar nokta kullanÄąlmasÄą anlamÄąna gelir. Model, bu prompt’larla maske kodlayÄącÄąsÄąnÄą ve prompt kodlayÄącÄąsÄąnÄąæŽĻᐆ eder ve Ã§ÄąktÄąyÄą alÄąr. Model, belirli bir eşiği aşan bazÄą maskeleri filtreler ve karÅŸÄąlÄąk gelen konumlarÄą potansiyel nihai tahminler olarak maskeler. Bu bÃķlgeleri yÞksek gÞvenle instance segmentasyonu sonuçlarÄą olarak gÃķren model, point prompt’larÄą oluşturmak zorunda kalmaz. Bu strateji, nesnelerin Ãķver-fine grained segmentasyonunu Ãķnler ve aynÄą zamanda hesaplamalÄą gereksinimleri ve maliyetleri Ãķnemli ÃķlçÞde azaltmaya yardÄąmcÄą olur. Çerçeve, bu iki turun sonuçlarÄąnÄą birleştirir ve nihai maskeleri elde eder.

TinySAM : Deneyler ve Sonuçlar

DamÄątma sÞrecini hÄązlandÄąrmak için, TinySAM çerçevesi, Ãķğretmen modelinin gÃķrÞntÞ gÃķmmelerini Ãķnceden hesaplar ve depolar, bu da modelin Ãķğretmen modelinin ağır gÃķrÞntÞ kodlayÄącÄąsÄąnÄą tekrar tekrar hesaplamasÄąnÄą gerektirmez.

Zero-shot instance segmentasyon gÃķrevlerinde, TinySAM çerçevesi, Segment Her Şeyi Modeli’nin deneysel ayarlarÄąnÄą takip eder ve instance segmentasyonu için Vision Transformer Det-H veya VitDet-H çerçevesinin nesne algÄąlama sonuçlarÄąnÄą kullanÄąr. Aşağıdaki gÃķrÞntÞ, TinySAM çerçevesinin instance segmentasyon gÃķrevlerinde mevcut yÃķntemleri aştığınÄą ve FLOPs puanÄąnda yÞksek performans sergilediğini gÃķsterir.

Aşağıdaki gÃķrÞntÞ, zero-shot instance segmentasyon gÃķrevlerinde TinySAM modelinin nitel performansÄąnÄą gÃķsterir, yeşil kutu prompt’larÄą temsil eder.

Zero-shot points valid mask değerlendirme gÃķrevlerinde, TinySAM modeli, MobileSAM çerçevesini Ãķnemli ÃķlçÞde aştÄą ve farklÄą veri setlerinde daha iyi sonuçlar elde etti, Ãķzellikle de daha az sayÄąda nokta kullanÄąldığında.

Aşağıdaki tablo, hiyerarşik everything mode stratejisinin hÄązlandÄąrÄąlmasÄą ve hesaplamalÄą gereksinimlerin azaltÄąlmasÄąyla ilgili sonuçlarÄą Ãķzetler. Model, aynÄą stabilite puanÄą ve eşik değerini farklÄą stratejiler için kullanÄąr ve sonuçlar aşağıdaki gibidir.

Son DÞşÞnceler

Bu makalede, TinySAM çerçevesini, verimli bir segment her şeyi modeli olarak tanÄąttÄąk ve bu modelin, orijinal SAM çerçevesinin zero-shot performansÄąnÄą korurken daha az hesaplamalÄą gereksinimlere sahip olduğunu gÃķsterdik. TinySAM, full-stage bilgi damÄątma yÃķntemi uygular, post-eğitim kuantizasyonunu promptable segmentasyon gÃķrevlerine uyarlar ve hiyerarşik segmentasyonu amaçlar. Bu yÃķntemler, hesaplamalÄą gereksinimlerde Ãķnemli bir azalma sağlar ve verimli segmentleme gÃķrevleri için yeni sÄąnÄąrlar oluşturur.

Mesleği mÞhendis, kalbi yazar. Kunal, AI ve ML'ye derin bir sevgi ve anlayÄąÅŸla technical writer, bu alanlardaki karmaÅŸÄąk kavramlarÄą etkileyici ve bilgilendirici belgelerle basitleştirmeye adanmÄąÅŸ.