Anderson’un Açısı

AI Analizi için Tasarlanmış bir Video Kodlayıcı

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Tekno-gerilim The Circle (2017) filmi, dış video analizi pratikliklerinden çok sosyal ağların etik etkileri hakkında bir yorum olsa da, hikayenin merkezindeki inanılmaz küçük ‘SeeChange’ kamera, filmi gerçekten ‘bilim kurgu’ kategorisine iten şeydir.

Tekno-gerilim 'The Circle' (2017) filmindeki 'SeeChange' kamera/gözetim cihazı.

Tekno-gerilim ‘The Circle’ (2017) filmindeki ‘SeeChange’ kamera/gözetim cihazı.

Kablosuz ve serbest dolaşan bir cihaz olan SeeChange, bir büyük mercimek büyüklüğünde olup, güneş panellerinin olmaması veya diğer çevresel kaynaklardan (örneğin radyo dalgaları) güç çekmesi yönünden değil, sürekli video sıkıştırması gerektiği için bu kadar küçük bir cihazın olası olmadığı gerçeğidir.

Bilgisayarlı görü (CV) ve video analizi alanında, özellikle kentsel olmayan ortamlarda sensörün sınırlı güç kaynaklarından (piller, güneş, vb.) maksimum performansı elde etmesi gereken bir araştırma alanı, ucuz sensörlerin güçlendirilmesidir.

Böyle bir kenar IoT/CV cihazının görüntüleri merkezi bir sunucuya göndermesi gereken durumlarda, seçenekler zordur: ya cihaz, sunucu tarafında işlenen yalnızca optimize edilmiş veri segmentlerini göndermek için yerel olarak bir hafif sinir ağı çalıştırmalıdır; ya da ‘aptal’ videoyu bulut kaynaklarının değerlendirmesi için göndermelidir.

Ayrıca, akıllı görü sensörleri (SVS) aracılığıyla hareket etkinleştirilmesi, bu yükü azaltabilir, ancak bu etkinleştirme de enerji maliyeti gerektirir.

Gücü Koruma

Dahası, даже nadir etkinleştirme (örneğin, bir koyun ara sıra görüş alanına girerse), cihaz, gigabaytlarca sıkıştırılmamış videoyu göndermek için yeterli güce sahip değildir; aynı zamanda, H.264/5 gibi popüler video sıkıştırma kodeklerini sürekli olarak çalıştırmak için de yeterli güce sahip değildir; bu kodekler, cihazın bağlı olduğu veya bir sonraki şarj oturumuna yakın olduğu donanımı bekler.

Üç tipik bilgisayar görü görevi için video analizi boru hatları. Video kodlama mimarisi, eldeki görev için eğitilmelidir ve genellikle alıcı sinir ağına da eğitilmelidir. Kaynak: https://arxiv.org/pdf/2204.12534.pdf

Üç tipik bilgisayar görü görevi için video analizi boru hatları. Video kodlama mimarisi, eldeki görev için eğitilmelidir ve genellikle alıcı sinir ağına da eğitilmelidir. Kaynak: https://arxiv.org/pdf/2204.12534.pdf

Genel olarak yayılmış H.264 kodeki, H.265’ten daha düşük enerji tüketimine sahiptir, ancak kötü sıkıştırma verimliliği vardır. H.265, daha iyi sıkıştırma verimliliğine sahiptir, ancak daha yüksek güç tüketimi vardır. Google’ın açık kaynaklı VP9 kodeki, her iki kodeki de her alanda geçer, ancak daha yüksek yerel hesaplama kaynakları gerektirir; bu da ucuz bir IoT sensöründe ilave sorunlar oluşturur.

Yerel olarak akış analizinin yapılması durumunda: yerel bir sinir ağı çalıştırmak için gereken güç, genellikle sunucuya tüm çerçeveleri göndermek için gereken güçle aynıdır.

Şebekeden bağlantısı olmayan bir sensörle sığırın maskeli temsilini çıkarma. Sınırlı güç kapasitesini, yerel anlamsal segmentasyon için bir hafif sinir ağıyla; sunucuya sınırlı bilgi göndererek (gecikme oluşturarak); veya 'aptal' veri (bant genişliğini boşa harcayarak) göndererek harcar mı? Kaynak: https://arxiv.org/pdf/1807.01972.pdf

Şebekeden bağlantısı olmayan bir sensörle sığırın maskeli temsilini çıkarma. Sınırlı güç kapasitesini, yerel anlamsal segmentasyon için bir hafif sinir ağıyla; sunucuya sınırlı bilgi göndererek (gecikme oluşturarak); veya ‘aptal’ veri (bant genişliğini boşa harcayarak) göndererek harcar mı? Kaynak: https://arxiv.org/pdf/1807.01972.pdf

Açık ki, ‘vahşi’ bilgisayar görü projeleri, belirli sinir ağları ve çeşitli görevler için optimize edilmiş özel video sıkıştırma kodeklerine ihtiyaç duyar.

Eğer video sıkıştırma verimliliği ile minimal veri iletimi arasındaki mükemmel dengeyi elde edebilirseniz, SeeChange’e ve ucuz sensör ağlarını düşmanca ortamlarda dağıtmaya bir adım daha yakın olursunuz.

AccMPEG

Chicago Üniversitesi’nden yeni bir araştırma, böyle bir kodeke doğru bir adım atmış olabilir: AccMPEG – düşük gecikme, yüksek doğruluk ve düşük yerel hesaplama gereksinimi olan bir video kodlama ve akış çerçevesi.

AccMPEG mimarisi. Kaynak: https://arxiv.org/pdf/2204.12534.pdf

AccMPEG mimarisi. Kaynak: https://arxiv.org/pdf/2204.12534.pdf

Sistem, her 16x16px makro bloğunun, sunucu tarafındaki DNN’nin doğruluğunu nasıl etkileyeceğini değerlendirmek için önceki yöntemlere göre tasarruf sağlar. Önceki yöntemler, genellikle bu tür bir doğruluğu her bir pikselde veya yerel olarak pahalı operasyonlar yaparak değerlendirmek zorunda kalmıştır.

AccMPEG’de, bu doğruluk, AccGrad adlı özel bir modülde ölçülür; bu, makro bloğun kodlama kalitesinin, son kullanım durumuna (örneğin, insanları sayan, iskelet tahmini yapan veya diğer ortak bilgisayar görü görevleri gerçekleştiren bir sunucu tarafı DNN’sine) nasıl ilgili olabileceğini ölçer.

AccMPEG, bir video çerçevesi geldiğinde, önce ucuz bir kalite seçici model olan AccModel aracılığıyla işler. AccModel, sunucu tarafındaki DNN’nin yararlı hesaplamalarına katkıda bulunmayacağı öngörülen alanları, mümkün olan en düşük kalitede kodlanmak üzere işaretler; önemli bölgeler ise daha iyi kalitede gönderilmelidir.

Bu süreç, üç zorluğu sunar: işlem, kabul edilebilir gecikme olmadan ve enerji-drain yerel hesaplama kaynakları olmadanufficient hızlı bir şekilde gerçekleştirilebilir mi? Çerçeve hızı ve kalite arasında optimal bir ilişki kurulabilir mi? Ve bir model, bir sunucu tarafı DNN’si için hızlı bir şekilde eğitilebilir mi?

Eğitim Lojistiği

İdeal olarak, bir bilgisayar görü kodeki, belirli bir sinir ağı için, bağlı sistemlerde önceden eğitilmelidir. AccGrad modülü, ancak iki ileri propagasyon ile doğrudan bir DNN’den türetilmiştir; bu, standart yükü on kat azaltır.

AccMPEG, AccGrad’i yalnızca 15 epoch için üçer propagasyonla eğitir ve benzer özellikteki CV görevleri için mevcut model durumunu bir şablon olarak kullanarak ‘canlı’ olarak yeniden eğitilebilir.

AccModel, yaygın olarak kullanılan MobileNet-SSD öznitelik çıkarıcıyı kullanır. 12 GFLOPS’lik bir döndürme ile, model, tipik ResNet18 yaklaşımının yalnızca üçte birini kullanır. Toplu normalize etme ve aktivasyon dışında, mimari yalnızca konvolüsyonel katmanlardan oluşur ve hesaplama yükü, çerçeve boyutuna bağlıdır.

AccGrad, son DNN çıkarımının gereksizliğini ortadan kaldırır ve dağıtım lojistiğini geliştirir.

AccGrad, son DNN çıkarımının gereksizliğini ortadan kaldırır ve dağıtım lojistiğini geliştirir.

Çerçeve Hızı

Mimari, 10fps’de optimal olarak çalışır; bu, tarımsal izleme, bina bozulması gözetimi, yüksek görüş trafiği analizi ve insan hareketinin temsilci iskelet çıkarımı gibi amaçlar için uygun olur; ancak, düşük görüş trafiği (araç veya insan) gibi hızlı hareket senaryoları ve yüksek çerçeve hızlarının faydalı olduğu diğer durumlar, bu yaklaşıma uygun değildir.

Yöntemin cimriliklerinin bir kısmı, komşu makro blokların benzer değerlere sahip olacağı ön görülmesidir; makro bloğun tahmini doğruluğunun altına düşene kadar. Bu yaklaşım, daha net bir şekilde belirlenmiş alanlar sağlar ve daha hızlı hesaplanabilir.

Performans İyileştirme

Araştırmacılar, sistemi, 60 dolarlık bir Jetson Nano kartı ve tek bir 128 çekirdekli Maxwell GPU ile test etti ve çeşitli diğer ucuz eşdeğerler kullandı. OpenVINO, çok seyrek yerel DNN’lerin CPU’lara olan enerji gereksinimlerini karşılamak için kullanıldı.

AccModel, ilk olarak, sekiz GeForce RTX 2080S GPU’su olan bir sunucuda çevrimdışı olarak eğitildi. Bu, ilk model oluşturması için güçlü bir hesaplama gücüdür, ancak sistemin mümkün kıldığı hafif yeniden eğitim ve bir modelin, benzer görevleri gerçekleştiren farklı DNN’ler arasında belirli tolerans parametrelerine ayarlanabilmesi, AccMPEG’in, vahşi ortamda minimal bakım gerektiren bir sistemin parçası olabileceği anlamına gelir.

 

İlk olarak 1 Mayıs 2022’de yayımlanmıştır.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai