Yapay zeka modelleri ve platformları
EfficientViT: Yüksek Çözünürlüklü Bilgisayarlı Görme için Hafıza Verimli Görüntü Dönüştürücü

Yüksek model kapasiteleri nedeniyle, Görüntü Dönüştürücü modeller son zamanlarda büyük bir başarı elde etti. Performanslarına rağmen, görüntüleme dönüştürücü modellerinin bir major kusuru vardır: hesaplamalarının mükemmel gücü yüksek hesaplamalı maliyetlere sahiptir ve bu nedenle görüntüleme dönüştürücüler gerçek zamanlı uygulamalar için ilk tercih değildir. Bu sorunu çözmek için, bir grup geliştirici EfficientViT’i lanç etti, yüksek hızlı görüntüleme dönüştürücü ailesi.
EfficientViT üzerinde çalışılırken, geliştiriciler mevcut dönüştürücü modellerinin hızının genellikle verimsiz bellek operasyonları tarafından sınırlı olduğunu gözlemlediler, özellikle MHSA veya Çoklu Başlı Öz-Dikkat ağındaki öğe-bazlı işlemler ve tensor yeniden şekillendirme. Bu verimsiz bellek operasyonlarını çözmek için, EfficientViT geliştiricileri yeni bir yapı taşı kullanarak bir kumanda düzeni ile çalıştı, yani EfficientViT modeli, bellek-bağlı Çoklu Başlı Öz-Dikkat ağı arasındaki tek bir bellek-bağlı MHSA katmanını kullanır ve bu, hem bellek verimliliğini artırır hem de kanal iletişimini geliştirir. Ayrıca, model, dikkat haritalarının genellikle başlar arasında yüksek benzerlikler gösterdiğini keşfeder, bu da hesaplamalı bir redundansiye yol açar. Redundansi sorununu çözmek için, EfficientViT modeli, görüntüleme dönüştürücüler için yeni bir CGA veya kaskad grup dikkat modülü sunar, bu modül, dikkat başlarına tam özelliklerin farklı bölümlerini besler ve bu, sadece hesaplamalı maliyetleri kaydetmekle kalmaz, aynı zamanda modelin dikkat çeşitliliğini de artırır.
Farklı senaryolarda EfficientViT modeli üzerinde yapılan kapsamlı deneyler, EfficientViT’in mevcut verimli modelleri bilgisayarlı görme için vượt ettiğini ve doğruluk ve hız arasında iyi bir ticaret melakukan olduğunu gösterir. Yani, EfficientViT modelini daha derinlemesine inceleyelim.
Görüntü Dönüştürücüleri ve EfficientViT’ye Giriş
Görüntü Dönüştürücüleri, bilgisayarlı görme endüstrisinde en popüler çerçevelerden biri olmaya devam ediyor, çünkü üstün performans ve yüksek hesaplama yetenekleri sunuyorlar. Ancak, görüntüleme dönüştürücü modellerinin performansının ve doğruluğunun sürekli olarak iyileştirilmesi ile birlikte, operasyonel maliyetler ve hesaplama yükü de artıyor. Örneğin, ImageNet veri setlerinde devlet-sanat performans gösteren current modeller gibi SwinV2 ve V-MoE, sırasıyla 3B ve 14.7B parametre kullanıyor. Bu modellerin büyüklüğü ve hesaplama maliyetleri, onları pratik olarak gerçek zamanlı cihazlar ve uygulamalar için uygun olmaktan çıkarıyor.
EfficientNet modeli, görüntüleme dönüştürücü modellerinin performansını nasıl artırabileceğini ve dönüştürücü tabanlı çerçeve mimarilerinin tasarlanma ilkelerini keşfetmeyi amaçlıyor. EfficientViT modeli, mevcut görüntüleme dönüştürücü çerçeveleri gibi Swim ve DeiT’ye dayanıyor ve modelin müdahale hızlarını etkileyen üç temel faktörü analiz ediyor: hesaplamalı redundansi, bellek erişimi ve parametre kullanımı. Ayrıca, model, görüntüleme dönüştürücü modellerinin hızının bellek-bağlı olduğunu gözlemliyor, yani CPU’lar ve GPU’lar tarafından sağlanan hesaplama gücünün tam olarak kullanılması, bellek erişimi gecikmesi tarafından engelleniyor veya kısıtlanıyor, bu da dönüştürücülerin çalışma hızına olumsuz bir etkisi oluyor. MHSA veya Çoklu Başlı Öz-Dikkat ağındaki öğe-bazlı işlemler ve tensor yeniden şekillendirme, en bellek-inefficient operasyonlardır. Model ayrıca, dikkat haritalarında redundansi olduğunu gözlemliyor, çünkü dikkat başlarının benzer lineer projeksiyonları öğrenme eğilimindedir.
Model, EfficientViT için yapılan araştırma çalışmalarında elde edilen bulguların nihai bir ürünüdür. Model, yeni bir yapı taşı kullanarak kumanda düzeni ile çalışır, yani EfficientViT modeli, tek bir bellek-bağlı MHSA katmanını, FFN katmanları arasındaki bellek-bağlı Çoklu Başlı Öz-Dikkat ağı kullanır ve bu, hem bellek verimliliğini artırır hem de kanal iletişimini geliştirir. Model ayrıca, yeni bir CGA veya kaskad grup dikkat modülü kullanır, bu modül, dikkat başlarına tam özelliklerin farklı bölümlerini besler ve bu, sadece hesaplamalı maliyetleri kaydetmekle kalmaz, aynı zamanda modelin dikkat çeşitliliğini de artırır. Son olarak, model, kritik ağ bileşenlerinin kanal genişliğini genişleterek ve düşük değerli ağ bileşenlerinin kanal genişliğini daraltarak parametreleri yeniden dağıtmaya çalışır.

Yukarıdaki resimden de görülebileceği gibi, EfficientViT çerçevesi, mevcut devlet-sanat CNN ve ViT modellerinden daha iyi performans gösteriyor ve doğruluk ve hız arasında iyi bir ticaret yapıyor. Ancak EfficientViT çerçevesi, mevcut devlet-sanat çerçevelerini nasıl vượt etti? Bunu keşfedelim.
EfficientViT: Görüntü Dönüştürücülerinin Verimliliğini Artırma
EfficientViT modeli, mevcut görüntüleme dönüştürücü modellerinin verimliliğini üç perspektiften artırma amacını taşıyor,
- Hesaplamalı Redundansi.
- Bellek Erişimi.
- Parametre Kullanımı.
Model, yukarıdaki parametrelerin görüntüleme dönüştürücü modellerinin verimliliğini nasıl etkilediğini ve bunları nasıl çözebileceğini keşfetmeyi amaçlıyor. Daha derinlemesine konuşalım.
Bellek Erişimi ve Verimlilik
Modelin hızını etkileyen temel faktörlerden biri, bellek erişimi gecikmesidir. Aşağıdaki resimden de görülebileceği gibi, dönüştürücüdeki beberapa operatör, öğe-bazlı toplama, normalize etme ve sık tensor yeniden şekillendirme, bellek-inefficient operasyonlardır, çünkü farklı bellek birimlerine erişimi gerektirir, bu da zaman alıcı bir işlemdir.

Mevcut bazı yöntemler, standart softmax öz-dikkat hesaplamalarını basitleştirebilir, ancak bunlar genellikle sınırlı hızlanma sağlar ve doğruluğu bozar.
Öte yandan, EfficientViT çerçevesi, bellek erişimi maliyetini azaltmaya çalışır, yani çerçevenin bellek-inefficient katmanlarını azaltır. Model, DeiT-T ve Swin-T’yi küçük alt-ağlara ölçeklendirir ve bunların performansını MHSA katmanlarının oranlarıyla karşılaştırır. Aşağıdaki resimden de görülebileceği gibi, bu yaklaşım, MHSA katmanlarının doğruluğunu %20-40 oranında artırır.

Hesaplamalı Verimlilik
MHSA katmanları, girişi birden fazla alt-uzaya veya başa gömerek ve dikkat haritalarını bireysel olarak hesaplayarak performansını artırır. Ancak, dikkat haritaları hesaplamalı olarak ucuz değildir. EfficientViT modeli, küçük ViT modellerinde hesaplamalı redundansı azaltmayı keşfetmeyi amaçlar. Model, genişlik ölçekli DeiT-T ve Swim-T modellerini eğiterek her bir baş ve kalan başların arasındaki maksimum kosin benzerliğini ölçer. Aşağıdaki resimden de görülebileceği gibi, dikkat başları arasında yüksek bir benzerlik vardır, bu da modelin hesaplamalı redundansa uğradığını gösterir, çünkü birçok baş benzer lineer projeksiyonları öğrenir.

Başların farklı desenler öğrenmesini teşvik etmek için, model her bir başa tam özelliklerin yalnızca bir bölümünü besler, bu da grup konvolüsyonunun ideasına benzer. Model, değiştirilmiş MHSA katmanlarına sahip ölçekli modelleri eğitir.
Parametre Verimliliği
Ortalama ViT modelleri, NLP dönüştürücülerinden tasarım stratejilerini miras alır, Örneğin, projeksiyonlar için eşit genişlik kullanma, FFN’de genişleme oranını 4’e ayarlama ve aşamalar boyunca başları artırma. Bu bileşenlerin yapılandırması, hafif modüller için dikkatli bir şekilde tasarlanmalıdır. EfficientViT modeli, Swim-T ve DeiT-T katmanlarında kritik bileşenleri otomatik olarak bulmak için Taylor yapısal budama kullanır ve parametre atama ilkelerini keşfetmeyi amaçlar. Belirli kaynak kısıtlamaları altında, budama yöntemleri önemli kanalları korur ve en yüksek doğruluğu sağlamak için kritik kanalları tutar. Aşağıdaki resim, Swin-T çerçevesinde budama öncesi ve sonrası kanal oranlarını karşılaştırır. Gözlemlendi ki: Başlangıç doğruluğu: %79,1; budanmış doğruluk: %76,5.

Yukarıdaki resim, çerçevenin ilk iki aşamasının daha fazla boyut koruduğunu, son iki aşamanın ise daha az boyut koruduğunu gösterir. Bu, tipik bir kanal yapılandırmasının her aşama sonrasında kanalı iki katına çıkarması veya tüm bloklar için eşit kanallar kullanması, son bloklarda önemli bir redundansiye yol açabileceğini gösterir.
Verimli Görüntü Dönüştürücü: Mimarisi
Yukarıdaki analizlerden elde edilen bulgulara dayanarak, geliştiriciler, hızlı müdahale hızlarına sahip yeni bir hiyerarşik model olan EfficientViT modelini oluşturdular. EfficientViT çerçevesinin yapısını daha derinlemesine inceleyelim. Aşağıdaki resim, EfficientViT çerçevesinin genel bir fikrini verir.
EfficientViT Çerçevesinin Yapı Taşı
Daha verimli bir görüntüleme dönüştürücü ağı için yapı taşı, aşağıdaki resimde gösterilmiştir.

Çerçeve, kaskad grup dikkat modülü, bellek-verimli kumanda düzeni ve parametre yeniden dağıtım stratejisi içerir, bunlar sırasıyla hesaplamalı, bellek ve parametre verimliliğini artırma amacını taşırlar. Daha derinlemesine konuşalım.
Kumanda Düzeni
Model, daha etkili ve verimli bir bellek bloğu oluşturmak için yeni bir kumanda düzeni kullanır. Kumanda düzeni, daha az bellek-bağlı öz-dikkat katmanları kullanır ve kanal iletişimi için daha verimli besleme ileri ağlarını kullanır. Daha spesifik olarak, model, uzaysal karıştırma için tek bir öz-dikkat katmanını uygular, bu katman FFN katmanları arasında kumanda düzeni ile çalışır. Tasarım, sadece öz-dikkat katmanlarından dolayı bellek zamanını azaltmakla kalmaz, aynı zamanda FFN katmanlarının kullanılması sayesinde farklı kanallar arasındaki iletişimi de sağlar. Model ayrıca, her besleme ileri ağı katmanından önce bir etkileşim token katmanı uygular ve yerel yapısal bilgilerin endüktif önyargısını tanıtarak model kapasitesini artırır.
Kaskad Grup Dikkati
MHSA katmanlarının önemli bir sorunu, dikkat başlarındaki redundansiye yol açan hesaplamalı inefficiencydir. Bu sorunu çözmek için, model, görüntüleme dönüştürücüler için yeni bir CGA veya kaskad grup dikkat modülü sunar, bu modül, dikkat başlarına tam özelliklerin farklı bölümlerini besler ve bu, sadece hesaplamalı maliyetleri kaydetmekle kalmaz, aynı zamanda modelin dikkat çeşitliliğini de artırır.

Parametre Yeniden Dağıtımı
Parametre verimliliğini artırmak için, model, kritik ağ bileşenlerinin kanal genişliğini genişleterek ve düşük değerli ağ bileşenlerinin kanal genişliğini daraltarak parametreleri yeniden dağıtmaya çalışır. Taylor analizi temelinde, model, her bir baş için küçük kanal boyutları ayarlayabilir veya girişin aynı boyutuna sahip olmasını sağlayabilir. Besleme ileri ağı genişleme oranı, parametre redundansını azaltmak için 4’ten 2’ye düşürülür. EfficientViT çerçevesinin önerdiği parametre yeniden dağıtım stratejisi, önemli modüllere daha fazla kanal ayırarak, yüksek boyutlu uzayda daha iyi temsil öğrenmelerine olanak tanır ve ayrıca, hesaplama maliyetlerini azaltmak ve modelin verimliliğini artırmak için, önemli olmayan modüllerdeki redundan parametreleri otomatik olarak kaldırır.

Yukarıdaki resim, EfficientViT çerçevesinin genel bir görünümünü gösterir, burada,
- EfficientViT Mimarisi,
- Kumanda Düzeni Bloğu,
- Kaskad Grup Dikkati.
EfficientViT: Ağ Mimarileri

Yukarıdaki resim, EfficientViT çerçevesinin ağ mimarisini özetler. Model, 16×16 yamaları C1 boyutuna gömerek düşük düzeyli görsel temsil öğrenimi için model kapasitesini artıran bir örtüşen yama gömme [20,80] tanıtır. Mimarisi, her biri önerilen EfficientViT çerçevesinin yapı taşlarını yığan üç aşamadan oluşur ve her bir alt-örnekleme katmanındaki token sayısı (2x çözünürlük alt-örnekleme) 4X azaltılır. Alt-örnekleme daha verimli hale getirmek için, model, ayrıca önerilen kumanda düzeni ile bir alt-örnekleme bloğu önerir, ancak dikkat katmanını, bilgi kaybını azaltmak için bir ters kalan blokla değiştirir. Ayrıca, model, klasik LayerNorm (LN) yerine BatchNorm (BN) kullanır, çünkü BN, önceki lineer veya konvolüsyonel katmanlara katlanabilir ve bu da LN’ye göre çalışma zamanı avantajı sağlar.
EfficientViT Model Ailesi
EfficientViT model ailesi, farklı derinlik ve genişlik ölçeklerine sahip 6 modelden oluşur ve her aşama için sabit bir baş sayısı atanır. Modeller, ilk aşamalarda son aşamalara göre daha az blok kullanır, bu da MobileNetV3 çerçevesinin takip ettiği bir süreçtir, çünkü ilk aşama işlemleri daha büyük çözünürlüklerle zaman alıcıdır. Genişlik, aşamalar boyunca küçük bir faktörle artırılır, bu da son aşamalarda redundansi azaltmaya yardımcı olur. Aşağıdaki tablo, EfficientViT model ailesinin mimari ayrıntılarını sağlar, burada C, L ve H, sırasıyla genişlik, derinlik ve her aşama için baş sayısıdır.

EfficientViT: Model Uygulaması ve Sonuçlar
EfficientViT modeli, toplam batch boyutu 2.048, Timm ve PyTorch ile oluşturulur, 300 epoch için 8 Nvidia V100 GPU ile eğitilir, kosin öğrenme oranlayıcı, AdamW optimizatör kullanır ve ImageNet-1K üzerinde görüntü sınıflandırma deneyini gerçekleştirir. Giriş görüntüleri, rasgele olarak kırpılır ve 224×224 çözünürlüğe yeniden boyutlandırılır. Akış aşağı görüntü sınıflandırma deneyleri için, EfficientViT çerçevesi modeli, 300 epoch için 256 batch boyutu ile AdamW optimizatörü kullanır. Model, COCO nesne algılama görevi için RetineNet kullanır ve modelleri, aynı ayarlarla 12 epoch daha eğitime tabi tutar.
ImageNet Üzerindeki Sonuçlar
EfficientViT modelinin performansını analiz etmek için, model, mevcut ViT ve CNN modelleriyle ImageNet veri seti üzerinde karşılaştırılır. Karşılaştırma sonuçları, aşağıdaki resimde raporlanır. EfficientViT model ailesinin, çoğu durumda mevcut çerçeveleri aşmayı başardığı ve doğruluk ve hız arasında ideal bir ticaret melakukan ettiği görülebilir.

Verimli CNN’ler ve Verimli ViT’lerle Karşılaştırma
Model, önce EfficientNet gibi verimli CNN’lerle ve MobileNets gibi vanilla CNN çerçeveleriyle performansını karşılaştırır. MobileNets çerçeveleriyle karşılaştırıldığında, EfficientViT modellerinin daha iyi bir üst-1 doğruluk puanı elde ettiği, aynı zamanda Intel CPU ve V100 GPU üzerinde sırasıyla 3,0X ve 2,5X daha hızlı çalıştığı görülebilir.

Yukarıdaki resim, EfficientViT modelinin performansını, ImageNet-1K veri setinde çalışan büyük ölçekli ViT modelleriyle karşılaştırır.
Akış Aşağı Görüntü Sınıflandırma
EfficientViT modeli, çeşitli akış aşağı görevlerde uygulanır ve modelin aktarılabilirlik yeteneklerini incelemek için kullanılır. Aşağıdaki resim, deney sonuçlarını özetler. EfficientViT-M5 modelinin, tüm veri setlerinde daha iyi veya benzer sonuçlar elde ettiği, aynı zamanda daha yüksek bir hızda çalıştığı görülebilir. Ancak, Araba veri setinde, EfficientViT modeli doğrulukta geri kalır.

Nesne Algılama
EfficientViT modelinin nesne algılama yeteneklerini analiz etmek için, model, COCO nesne algılama görevinde verimli modellerle karşılaştırılır. Aşağıdaki resim, karşılaştırma sonuçlarını özetler.

Son Düşünceler
Bu makalede, EfficientViT’i, kaskad grup dikkati ve bellek-verimli operasyonlar kullanan hızlı görüntüleme dönüştürücü ailesini tanıttık. EfficientViT modelinin performansını analiz etmek için yapılan kapsamlı deneyler, çoğu durumda mevcut CNN ve görüntüleme dönüştürücü modellerini aşmayı başaran EfficientViT modelinin vaat edilen sonuçlar gösterdiğini gösterdi. Ayrıca, görüntüleme dönüştürücülerinin müdahale hızlarını etkileyen faktörleri analiz etmeye çalıştık.












