Yapay zeka modelleri ve platformları

TinySAM : Segment Her Şeyi Verimli Bir Şekilde Modeli

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Nesne segmentasyonu, modern bilgisayar vizyonunda temel ve kritik öneme sahip bir alandır. Nesne lokalizasyonu ve tanımlama gibi geniş görsel bileşenler gerektiren uygulamalarda hayati bir rol oynar ve gerçek zamanlı, hızlı ve doğru segmentasyon gerektirir. Bu önem, nesne segmentasyonunu sürekli bir araştırma konusu haline getirmiş ve örnek olarak instance segmentasyon, semantic segmentasyon ve panoptik segmentasyon gibi alanlarda önemli çalışmalar yapılmıştır.

Nesne segmentasyonunun evrimi ile birlikte, Segment Her Şeyi Modeli (SAM)remarkable bir araç olarak ortaya çıkmış ve çeşitli bilgisayar vizyonu uygulamalarında nhanh bir şekilde benimsenmiştir. SAM mimarisini kullanan çerçeveler, aşağı akım vizyon görevlerinde etkileyici performanslar elde etmişlerdir. Ancak, yüksek doğrulukta segmentasyon görevlerinde sahip olduğu yeteneklerine rağmen, SAM’ın karmaşık ve ağır mimarisi, önemli miktarda hesaplama gücünü gerektirir ve bu da hesaplamalı olarak kısıtlı cihazlarda uygulanmasını engellemektedir.

SAM’ın hesaplamalı zorluklarını ele alan araştırmacılar, Tiny Segment Her Şeyi Modeli (TinySAM) geliştirdiler. TinySAM, orijinal çerçevedeki zero-shot performansını korurken daha hafif bir modeldir. TinySAM, öğrenci modelini daha verimli hale getirmeyi amaçlayan bir full-stage bilgi damıtma yöntemi kullanır. Post-eğitim kuantizasyonu,.promptable segmentasyon görevlerine uyarlanır ve hesaplama gereksinimlerini daha da azaltır. Ayrıca, TinySAM’ın tasarımı, hiyerarşik segmentasyonu amaçlar ve bu da performansı bozmadan 推理 hızını neredeyse iki katına çıkarır.

Bu makale, TinySAM çerçevesini, temel prensiplerini, mimarisini ve diğer state-of-the-art segmentasyon çerçevelerine kıyasla performansını keşfedecektir. Bu konuları daha ayrıntılı olarak inceleyelim.

TinySAM : Verimli Segment Her Şeyi Modeli

Segment Her Şeyi Modeli, 11 milyondan fazla görüntü ve bir milyardan fazla görüntü maskesi içeren büyük bir segmentasyon veri setine sahip olduğu için, çeşitli bilgisayar vizyonu uygulamalarında hızlı ilerlemeye yardımcı olmuştur. Nesneleri keyfi kategoriler ve şekillerde segmentleme görevlerinde üstün performans sergileyen SAM, image inpainting, nesne takibi, 3D vizyon ve daha fazlası gibi aşağı akım görevler için temel oluşturur. Ayrıca, Segment Her Şeyi Modeli, sınırlı veri ile çalışan hassas endüstriler için yararlı olan remarkable zero-shot segmentasyon performansı sunar.

Segment Her Şeyi Modeli’nin segmentasyon yetenekleri konusunda hiçbir şüphe yok, ancak karmaşık mimari ve yüksek hesaplama gereksinimleri nedeniyle, modern bir GPU’da 1024×1024 görüntü için推理 zamanı 2 saniyeye kadar çıkabilir. Bu nedenle, SAM uygulamalarını hesaplamalı olarak kısıtlı cihazlara uygulamak oldukça zordur. Bu engeli aşmak için, MobileSAM ve FastSAM gibi recent çalışmalar, daha hesaplama verimli bir SAM modeli geliştirmeye çalıştı. MobileSAM, ağır bileşeni TinyViT mimarisi ile değiştirmeyi amaçlarken, FastSAM, segmentleme görevini tek bir kategori ile instance segmentasyon görevine dönüştürmeyi amaçladı. Ancak bu yöntemler, hesaplama gereksinimlerini azaltmada bazı başarılar elde etseler de, özellikle zero-shot aşağı akım görevlerde performansını koruyamadılar.

TinySAM veya Tiny Segment Her Şeyi Modeli, mevcut SAM modelinin hesaplama gereksinimlerini azaltmaya çalışırken, zero-shot aşağı akım görevlerdeki performansı bozmaz. TinySAM, öğrenci modelinin yeteneklerini artırmayı amaçlayan bir full-stage bilgi damıtma yöntemi önerir. TinySAM, öğrenci modelini farklı aşamalardan öğretmen modelinin gözetiminde eğitir ve distilasyon sürecini daha da güçlendirmek için online hard prompt örneklemesi kullanır. Ayrıca, hesaplama maliyetlerini daha da azaltmak için, TinySAM, post-eğitim kuantizasyonu bileşenlerini promptable segmentasyon görevlerine uygular.

Segment Her Şeyi Modeli’nin hesaplamalı gereksinimlerinin büyük bir kısmı, modelin görüntü中的 her şeyi segmentlemek için yoğun bir nokta ızgarası oluşturmasından kaynaklanmaktadır. TinySAM, bu segmentasyon stratejisindeki hesaplamalı gereksinimleri aşmak için, hiyerarşik bir segmentleme stratejisi kullanır ve bu da推理 hızını neredeyse iki katına çıkarır. Bu yöntemler ile TinySAM, hesaplama gereksinimlerinde önemli bir azalma sağlar ve verimli segmentleme görevleri için yeni sınırlar oluşturur.

TinySAM : Mimarisi ve Yöntemi

TinySAM çerçevesinin mimarisini ve yöntemini konuşmadan önce, önce SAM çerçevesinin atası olan SAM modeline bakmak önemlidir. SAM modeli, çeşitli aşağı akım vizyon ve nesne segmentasyon görevlerinde remarkable performans, esneklik ve genelleme yetenekleri sergilemiştir.

SAM modelinin temelinde, üç alt ağ vardır: prompt kodlayıcı, görüntü kodlayıcı ve maske kodlayıcı. Prompt kodlayıcı, keyfi şekilli maskeleri, girdi noktalarını ve metinleri konum bilgileri ile kodlar. Görüntü kodlayıcı, bir Vision Transformer tabanlı ağır ağdır ve girdi görüntüsünü gömme olarak çıkarır. Model, geometrik ve metin.promptları işlemek için farklı ağlar kullanır. Son olarak, maske kodlayıcı, prompt ve görüntü kodlayıcıların çıktısını alan bir iki yönlü transformer içerir ve nihai maske tahmini üretir. Veri seti ile birlikte, SAM çerçevesi, nesne şekli ve kategorisi ne olursa olsun yüksek kaliteli segmentasyon yetenekleri sergiler. Ayrıca, Segment Her Şeyi Modeli, zero-shot aşağı akım vizyon görevlerinde, nesne önerisi, kenar algılama, metin-maskesi tahmini ve instance segmentasyon gibi görevlerde remarkable performans sergiler. Yüksek kaliteli segmentasyon yetenekleri ve esnek.prompt teklifleri sayesinde, SAM çerçeveleri vizyon uygulamaları için temel oluşturur. Ancak, geleneksel SAM mimarisinin yüksek hesaplamalı gereksinimlerini göz ardı edilemez, çünkü büyük sayıda parametre, SAM tabanlı uygulamaları hesaplamalı olarak kısıtlı cihazlara uygulamayı neredeyse imkansız hale getirir.

Bilgi Damıtma

Bilgi damıtma, compact ağların eğitim aşamasında performansını artırmak için önemli bir yaklaşımdır. Bilgi damıtma yöntemi, öğretmen modelinin çıktısını kullanarak hafif öğrenci modelinin eğitimini denetler. Bilgi damıtma yöntemi, ara özellikler için damıtma ve ağ çıktıları için damıtma olmak üzere iki alt kategoriye ayrılabilir, ve большинluğu görüntü sınıflandırma görevlerine odaklanan araştırma çalışmaları vardır.

Aşağıdaki şekil, TinySAM çerçevesinin genel mimarisini ve zero-shot instance segmentasyon görevlerindeki performansını gösterir.

İlk aşamada, TinySAM çerçevesi, SAM çerçevesi için özel olarak tasarlanmış bir bilgi damıtma yöntemi uygular ve distilasyon sürecini daha da güçlendirmek için online hard prompt örneklemesi kullanır. İkinci aşamada, TinySAM çerçevesi, post-eğitim kuantizasyonu yöntemini promptable segmentasyon görevlerine uyarlar ve hafif öğrenci modeline uygular. Son olarak, model, segmentasyon görevleri için tasarlanmış hiyerarşik bir segmentleme modu uygular ve bu da推理 hızını neredeyse iki katına çıkarır.

Tam Aşama Bilgi Damıtma

Önceki kısımda bahsedildiği gibi, Segment Her Şeyi Modeli, üç alt ağdan oluşur: prompt kodlayıcı, görüntü kodlayıcı ve maske kodlayıcı. Görüntü kodlayıcı bileşeni, bir Vision Transformer tabanlı ağır ağdır ve yüksek hesaplamalı gereksinimlere sahiptir. Bu sorunu aşmak için, MobileSAM çerçevesi, Vision Transformer’ı TinyViT ile değiştirdi, ancak bu değişim önemli bir performans kaybına neden oldu. Performans kaybını önlemek için, TinySAM çerçevesi, full-stage bilgi damıtma yöntemi uygular ve hafif görüntü kodlayıcısını öğretmen modelinin öğrenme düzeyinden çoklu bilgi düzeyine kadar rehberlik eder. Geleneksel kayıp fonksiyonuna ek olarak, TinySAM çerçevesi, farklı aşamalarda birçok damıtma kaybı tanır, aşağıdaki şekilde gösterildiği gibi.

Kuantizasyon

Model kuantizasyonu, bilgisayar vizyonu çerçevelerinde popüler bir yaklaşımdır ve modeli daha düşük bant genişliğine sahip bir modele sıkıştırmak için kullanılır, bu da hesaplamalı karmaşıklığı ve depolama gereksinimlerini azaltmaya yardımcı olur.

TinySAM’de kuantizasyonun temel amacı,Scaling faktörü kullanarak kayan nokta tensörünü tam sayı tensörüne projeler ve bu da hesaplamalı gereksinimleri azaltmaya yardımcı olur.

Hiyerarşik Segment Her Şeyi

Segment Her Şeyi Modeli, görüntü中的 her şeyi segmentlemek için otomatik bir maske oluşturucu kullanır. Ancak, yoğun bir nokta ızgarası kullanmanın, över-fine grained segmentasyon çıktılarına neden olabileceği ve bu sürecin yüksek hesaplamalı gereksinimlere neden olabileceği gösterilmiştir. Ayrıca, bir nesneyi tamamen segmentlemek için çok fazla örnek noktası kullanmanın, nesnenin farklı bölümlerinin ayrı maskeler olarak yanlış bir şekilde segmentlenmesine neden olabileceği ve bu da yüksek hesaplamalı gereksinimlere neden olur.

Orijinal SAM çerçevesinin approach’undan farklı olarak, TinySAM modeli, her kenarda yalnızca %25 nokta kullanır, bu da orijinal ayarların yalnızca %1/16’sı kadar nokta kullanılması anlamına gelir. Model, bu prompt’larla maske kodlayıcısını ve prompt kodlayıcısını推理 eder ve çıktıyı alır. Model, belirli bir eşiği aşan bazı maskeleri filtreler ve karşılık gelen konumları potansiyel nihai tahminler olarak maskeler. Bu bölgeleri yüksek güvenle instance segmentasyonu sonuçları olarak gören model, point prompt’ları oluşturmak zorunda kalmaz. Bu strateji, nesnelerin över-fine grained segmentasyonunu önler ve aynı zamanda hesaplamalı gereksinimleri ve maliyetleri önemli ölçüde azaltmaya yardımcı olur. Çerçeve, bu iki turun sonuçlarını birleştirir ve nihai maskeleri elde eder.

TinySAM : Deneyler ve Sonuçlar

Damıtma sürecini hızlandırmak için, TinySAM çerçevesi, öğretmen modelinin görüntü gömmelerini önceden hesaplar ve depolar, bu da modelin öğretmen modelinin ağır görüntü kodlayıcısını tekrar tekrar hesaplamasını gerektirmez.

Zero-shot instance segmentasyon görevlerinde, TinySAM çerçevesi, Segment Her Şeyi Modeli’nin deneysel ayarlarını takip eder ve instance segmentasyonu için Vision Transformer Det-H veya VitDet-H çerçevesinin nesne algılama sonuçlarını kullanır. Aşağıdaki görüntü, TinySAM çerçevesinin instance segmentasyon görevlerinde mevcut yöntemleri aştığını ve FLOPs puanında yüksek performans sergilediğini gösterir.

Aşağıdaki görüntü, zero-shot instance segmentasyon görevlerinde TinySAM modelinin nitel performansını gösterir, yeşil kutu prompt’ları temsil eder.

Zero-shot points valid mask değerlendirme görevlerinde, TinySAM modeli, MobileSAM çerçevesini önemli ölçüde aştı ve farklı veri setlerinde daha iyi sonuçlar elde etti, özellikle de daha az sayıda nokta kullanıldığında.

Aşağıdaki tablo, hiyerarşik everything mode stratejisinin hızlandırılması ve hesaplamalı gereksinimlerin azaltılmasıyla ilgili sonuçları özetler. Model, aynı stabilite puanı ve eşik değerini farklı stratejiler için kullanır ve sonuçlar aşağıdaki gibidir.

Son Düşünceler

Bu makalede, TinySAM çerçevesini, verimli bir segment her şeyi modeli olarak tanıttık ve bu modelin, orijinal SAM çerçevesinin zero-shot performansını korurken daha az hesaplamalı gereksinimlere sahip olduğunu gösterdik. TinySAM, full-stage bilgi damıtma yöntemi uygular, post-eğitim kuantizasyonunu promptable segmentasyon görevlerine uyarlar ve hiyerarşik segmentasyonu amaçlar. Bu yöntemler, hesaplamalı gereksinimlerde önemli bir azalma sağlar ve verimli segmentleme görevleri için yeni sınırlar oluşturur.

Kunal Kejriwal, Python, PostgreSQL, Redis ve GCP ile AWS üzerindeki bulut altyapısında uzmanlaşmış bir backend mühendisi. Üç yıllık üretim sistemleri inşa etme ve ölçeklendirme deneyimine sahip olan Kunal, AI altyapısı, dağıtık sistemler ve makine öğrenimi iş yüklerini dağıtmanın mimarisi hakkında yazıyor.