Anderson’un Açısı

Bilgisayarlı Görmede ‘Birleştirilmiş’ İnsanları Ayırmak

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Hyundai Motor Group Innovation Center tarafından Singapur’da sunulan yeni bir makale, bilgisayar görüşünde ‘birleştirilmiş’ insanların ayrılması için bir yöntem sunar – nesne tanıma çerçevesinin bir insanı bulduğu ancak onu diğer bir insandan ayıramadığı durumlar, örneğin ‘kucaklaşma’ eylemleri veya ‘arkada durma’ pozları ve iki kişiyi tek bir kişi veya varlık olarak karıştırdığı durumlar.

İki kişi bir olur, ancak bu, anlamsal segmentasyonda iyi bir şey değildir. Burada, makalenin yeni sisteminin, iç içe geçmiş insanların kompleks ve zorlu görüntülerdeki bireyselleştirilmesinde devlet-sanatlı sonuçlar elde ettiğini görüyoruz.

İki kişi bir olur, ancak bu, anlamsal segmentasyonda iyi bir şey değildir. Burada, makalenin yeni sisteminin, iç içe geçmiş insanların kompleks ve zorlu görüntülerdeki bireyselleştirilmesinde devlet-sanatlı sonuçlar elde ettiğini görüyoruz. Kaynak: https://arxiv.org/pdf/2210.03686.pdf

Bu, son yıllarda araştırma topluluğu tarafından büyük ilgi gören önemli bir sorundur. Bu sorunu, genellikle çok pahalı olan hiperscale, insan tarafından yürütülen özel etiketleme olmadan çözebilmek, sonunda Stable Diffusion gibi metin-görsel sistemlerinde insan bireyselleştirilmesinde iyileşmelere yol açabilir.

Korkunç bir manzara - DALL-E 2 ve Stable Diffusion gibi metin-görsel modeller, birbirlerine çok yakın olan insanları temsil etmekte zorlanırlar.

Korkunç bir manzara – DALL-E 2 ve Stable Diffusion gibi metin-görsel modeller, birbirlerine çok yakın olan insanları temsil etmekte zorlanırlar.

Genel olarak, DALL-E 2 ve Stable Diffusion gibi üretilen modeller, anlamsal segmentasyon veya nesne tanıma kullanmazlar ve bu ‘insan portmanteau’ ları, bu tür upstream yöntemlerin uygulanmasıyla düzeltilmez, çünkü nesne tanıma kütüphaneleri ve kaynaklar da insanları ayırmakta aynı derecede iyidir.

Bu sorunu ele almak için, yeni makaleİnsanların Daha Fazla İnsan Etiketlemesine İhtiyaç Yok: Gizlenmiş İnsan Örneği Segmentasyonu için Kopyala ve Yapıştır – yakın zamanda geliştirilen bir ‘kopyala ve yapıştır’ yaklaşımını uyarlar ve geliştirir ve bu görevde yeni bir devlet-sanatlı liderlik elde eder.

Yeni Occlusion Copy & Paste metodolojisi, daha önce bu zorluğu ele alan diğer çerçeveler ve yaklaşımlara karşı, örneğin özellikle gizlenme için modelleme yapanlara karşı, alanın lideridir.

Yeni Occlusion Copy & Paste metodolojisi, daha önce bu zorluğu ele alan diğer çerçeveler ve yaklaşımlara karşı, örneğin özellikle gizlenme için modelleme yapanlara karşı, alanın lideridir.

Kes That Out!

Değiştirilmiş yöntem – Gizlenme Kopyala ve Yapıştır – 2021 Basit Kopyala-Yapıştır makalesinden türetilmiştir ve çeşitli kaynak eğitim görüntülerinde nesneleri ve insanları üst üste bindirerek bir görüntü tanıma sisteminin her bir örneği ayrıştırmaya yardımcı olabileceğini önermiştir.

Google Research liderliğindeki 2021 makalesinden 'Simple Copy-Paste is a Strong Data Augmentation Method for Instance Segmentation', bir fotoğraftan alınan unsurların diğer fotoğraflara 'göç ettiği' görülüyor, amacı daha iyi bir görüntü tanıma modeli eğitimi sağlamak.

Google Research liderliğindeki 2021 makalesinden ‘Simple Copy-Paste is a Strong Data Augmentation Method for Instance Segmentation’, bir fotoğraftan alınan unsurların diğer fotoğraflara ‘göç ettiği’ görülüyor, amacı daha iyi bir görüntü tanıma modeli eğitimi sağlamak. Kaynak: https://arxiv.org/pdf/2012.07177.pdf

Yeni sürüm, bu otomatik ve algoritmik ‘yeniden yapıştırmaya’ sınırlamalar ve parametreler ekler, bu süreci bir ‘sepet’ olarak modelleyen, diğer görüntülere ‘transfer’ edilebilecek adayların bulunduğu bir resim koleksiyonu olarak düşünür.

OC&P'nin kavramsal iş akışı.

OC&P’nin kavramsal iş akışı.

Elemanları Kontrol Etme

Bu sınırlayıcı faktörler arasında, bir kopyalama ve yapıştırma işleminin olasılığı, bu işlemin her zaman gerçekleşmesini önlemek için, bir ‘doyma’ etkisi yaratarak veri artırımını boşa çıkarmak için; bir ‘sepet’te bulunan görüntülerin sayısı, daha fazla ‘parça’ çeşitliliği sağlayabilir, ancak ön işleme süresini artırabilir; ve ‘aralık’, bir ‘ana’ görüntüye yapıştırılacak görüntülerin sayısıdır.

Bu sonuncusuyla ilgili olarak, makale ‘Yeterince gizlenme olması必要, ancak çok fazla olmaması gerekir, aksi takdirde görüntü kirlenir ve öğrenme zarar görür.’ diyor.

OC&P’nin diğer iki yeniliği, ‘hedefli yapıştırma’ ve ‘artırılmış örnek yapıştırma’dır.

Hedefli yapıştırma, bir görüntünün mevcut bir örneğe yakın bir yere düşmesini sağlar. Önceki çalışmada, yeni unsur sadece görüntünün sınırları içinde kısıtlanmıştı, herhangi bir bağlam dikkate alınmamıştı.

Hedefli yapıştırma ile, insan gözü için bu 'yapıştırma' açık olsa da, OC&P ve selefi, artan görsel gerçekçiliğin gerekli olmadığını, hatta bir yük olabileceğini bulmuşlardır (aşağıdaki 'Gerçeklik Isırır' bölümüne bakınız).

Hedefli yapıştırma ile, insan gözü için bu ‘yapıştırma’ açık olsa da, OC&P ve selefi, artan görsel gerçekçiliğin gerekli olmadığını, hatta bir yük olabileceğini bulmuşlardır (aşağıdaki ‘Gerçeklik Isırır’ bölümüne bakınız).

Artırılmış örnek yapıştırma, yapıştırılan örneklerin ‘ayrı bir görünüm’ göstermemesini sağlar, bu da sistemin onları某 bir şekilde sınıflandırmasına ve genellemeyi ve uygulanabilirliği engelleyebilecek ‘özel muamele’ görmesine neden olabilir. Artırılmış yapıştırma, parlaklık, keskinlik, ölçek ve döndürme gibi görsel faktörleri düzenler.

Yeni makalenin ek malzemelerinden: OC&P'yi mevcut tanıma çerçevelerine eklemek oldukça basittir ve yakın çevredeki insanların bireyselleştirilmesinde üstün sonuçlar verir.

Yeni makalenin ek malzemelerinden: OC&P’yi mevcut tanıma çerçevelerine eklemek oldukça basittir ve yakın çevredeki insanların bireyselleştirilmesinde üstün sonuçlar verir. Kaynak: https://arxiv.org/src/2210.03686v1/anc/OcclusionCopyPaste_Supplementary.pdf

Ek olarak, OC&P, yapıştırılan örnekler için minimum bir boyut düzenler. Örneğin, bir kalabalık sahnedeki bir kişinin resmini çıkarıp başka bir resme yapıştırmak mümkün olabilir, ancak bu durumda küçük bir piksel sayısı, tanımayı muhtemelen yardım etmeyecektir. Bu nedenle, sistem, eşitlenmiş kenar uzunluğunun oranına dayalı bir minimum ölçek uygular.

Ayrıca, OC&P, ölçek-farkında yapıştırma sağlar, yani, yapıştırma konusuna benzer konuları ararken, hedef görüntüdeki sınırlayıcı kutuların boyutunu da dikkate alır. Ancak, bu, insanların gerçekçi veya inandırıcı bulacağı bileşik görüntüler oluşturmaz, ancak eğitim sırasında faydalı olan şekilde birbirlerine yakın semantik olarak uygun unsurları bir araya getirir.

Gerçeklik Isırır

Hem önceki çalışma, hem de OC&P, ‘gerçekçilik’ veya ‘foto-gerçeklik’ üzerine düşük bir prim koyar. İnsanların birleştirilmesiyle oluşan görüntülerin, gerçekçi veya inandırıcı olması gerekmez, ancak bu, sistemin gerçek dünya uygulamalarında karşılaşacağı unsurlarla karşılaşma olasılığını azaltmaz.

Yeni makalenin ek malzemelerinden: rastgele karıştırma ile artırılmış görüntüler. Bu sahneler bir kişiye göre halüsinasyon gibi görünebilir, ancak benzer konuları bir araya getirir ve insan gözü için olabilecek gizlenmelerin doğasını önceden bilemeyiz ve eğitim için bu tür 'kopuk' formlar yeterlidir.

Yeni makalenin ek malzemelerinden: rastgele karıştırma ile artırılmış görüntüler. Bu sahneler bir kişiye göre halüsinasyon gibi görünebilir, ancak benzer konuları bir araya getirir ve insan gözü için olabilecek gizlenmelerin doğasını önceden bilemeyiz ve eğitim için bu tür ‘kopuk’ formlar yeterlidir.

Veri ve Testler

Test aşaması için, sistem, 262.465 insan örneği içeren 64.115 görüntüden oluşan kişi sınıfı MS COCO veri kümesiyle eğitilmiştir. Ancak, MS COCO’dan daha iyi maskeleri elde etmek için, görüntülere ayrıca LVIS maskesi açıklamaları yapılmıştır.

2019'da yayınlanan LVIS, Facebook araştırma ekibinin Büyük Kelime Örnek Segmentasyonu için bir veri kümesidir. Kaynak: https://arxiv.org/pdf/1908.03195.pdf

2019’da yayınlanan LVIS, Facebook araştırma ekibinin Büyük Kelime Örnek Segmentasyonu için bir veri kümesidir. Kaynak: https://arxiv.org/pdf/1908.03195.pdf

Araştırmacılar, OC&P’nin, çok sayıda gizlenmiş insan görüntüsüne karşı nasıl mücadele edebileceğini değerlendirmek için, OCHuman (Gizlenmiş İnsan) benchmark’ünü kullandılar.

2018'de Pose2Seg algılama projesi kapsamında sunulan OCHuman veri kümesinden örnekler. Bu girişim, insanların duruş ve pozlarını bir anlamsal delimiter olarak kullanarak insanların anlamsal segmentasyonunu geliştirmeyi amaçlamıştır.

2018’de Pose2Seg algılama projesi kapsamında sunulan OCHuman veri kümesinden örnekler. Bu girişim, insanların duruş ve pozlarını bir anlamsal delimiter olarak kullanarak insanların anlamsal segmentasyonunu geliştirmeyi amaçlamıştır. Kaynak: https://github.com/liruilong940607/OCHumanApi

Çünkü OCHuman benchmark’i eksiksiz olarak etiketlenmemiştir, yeni makalenin araştırmacıları, yalnızca tam olarak etiketlenmiş örneklerden oluşan bir alt küme oluşturdular, OCHumanFL olarak adlandırıldı. Bu, doğrulama için 1.113 görüntüde 2.240 kişi örneğine ve test için 951 görüntüde 1.923 örneğe düşürdü. Hem orijinal hem de yeni oluşturulan kümeler, Mean Average Precision (mAP) olarak temel metriği kullanarak test edildi.

Devamında, mimari, Mask R-CNN ve bir özellik piramidi ağı ile oluşturuldu, sonuncusu, doğruluk ve eğitim hızı arasında kabul edilebilir bir uzlaşma sağladı.

Araştırmacılar, benzer durumlarda upstream ImageNet etkisinin zararlı etkisini not etti ve tüm sistemi, Facebook’un 2021 sürümünün Detectron 2 başlangıç parametrelerini kullanarak 4 NVIDIA V100 GPU’da 75 epoch için eğitti.

Sonuçlar

Yukarıda bahsedilen sonuçlara ek olarak, MMDetection (ve üç ilgili modeli) ile yapılan testler, OC&P’nin, karmaşık pozlarda insanları seçme yeteneğinde net bir liderlik gösterdi.

Ek olarak, PoSeg ve Pose2Seg‘i geride bırakmasının yanı sıra, makalenin belki de en önemli başarısı, sistemin mevcut çerçevelere kolayca uygulanabilmesidir, bu da model veya model-merkezli iyileştirmelerle birlikte kullanılabilir.

Makale şöyle diyor:

‘Yaklaşımımızın temel bir avantajı, herhangi bir model veya model-merkezli iyileştirme ile kolayca uygulanabilmesidir. Derin öğrenme alanının hızına göre, herkesin lehine olan, her türlü eğitimle yüksek düzeyde etkileşimli olan yaklaşımlar olması önemlidir. Bu çalışmada, occluded kişi örneği segmentasyonunu etkili bir şekilde çözmek için bu yaklaşımı model-merkezli iyileştirmelerle birleştirmeyi gelecekteki bir çalışma olarak bırakıyoruz.’

Metin-Görsel Sentezini İyileştirme Potansiyeli

Baş yazar Evan Ling, bize gönderdiği bir e-postada, OC&P’nin temel avantajının, orijinal maskeleri etiketleyebilmesi ve yeni bir bağlamda onlardan yeni değerler elde edebilmesi olduğunu belirtti.

İnsanların anlamsal segmentasyonu, Stable Diffusion gibi modellerin insanları bireyselleştirmekte zorlanmasının zorluğuyla yakından ilgili görünse de, anlamsal etiketleme kültürünün, SD ve DALL-E 2’nin sık sık çıkardığı kabus gibi insan görselleriyle olan herhangi bir etkisi çok uzakta.

Stable Diffusion’un üretken gücünü oluşturan LAION 5B alt kümesindeki milyarlarca görüntü, nesne düzeyinde etiketler içermez, CLIP mimarisi, görüntülerden ve veritabanı içeriğinden oluşan görüntüleri oluştururken bu tür örneklerden yararlanmış olsa da; bu görüntüler, meta veriler ve çevre açıklamalarından türetilen etiketlerle ‘ücretsiz’ olarak etiketlenmiştir.

‘Ama buna rağmen,’ Ling bize söyledi, ‘benzer bir artırma, metin-görsel üretken model eğitiminde kullanılabilir. Ancak, artırılan eğitim görüntüsünün gerçekçiliği bir sorun olabilir.

‘Çalışmamızda, ‘mükemmel’ gerçekçiliğin genellikle denetimli örnek segmentasyonu için gerekli olmadığını gösteriyoruz, ancak aynı sonuca metin-görsel üretken model eğitimi için ulaşıp ulaşılamayacağını bilmiyorum (özellikle çıktıların yüksek gerçekçilikte olması bekleniyorsa). Bu durumda, artırılan görüntülerin gerçekçiliğini ‘mükemmelleştirmek’ için daha fazla çalışma yapılması gerekebilir.’

CLIP, anlamsal segmentasyon için bir çoklu.modal araç olarak zaten kullanılıyor, bu da, OC&P gibi geliştirilmiş insan tanıma ve bireyselleştirme sistemlerinin, ‘birleştirilmiş’ ve bozulmuş insan temsilini keyfi olarak reddedecek filtreler veya sınıflandırıcılar olarak geliştirilebileceğini gösteriyor.

DALL-E 2 ve Stable Diffusion'un kalbi olan OpenAI'nin CLIP çerçevesini kullanan projelerden biri - anlamsal segmentasyon.

DALL-E 2 ve Stable Diffusion’un kalbi olan OpenAI’nin CLIP çerçevesini kullanan projelerden biri – anlamsal segmentasyon. Kaynak: https://openaccess.thecvf.com/content/CVPR2022/papers/Wang_CRIS_CLIP-Driven_Referring_Image_Segmentation_CVPR_2022_paper.pdf

‘Diğer bir soru,’ Ling öneriyor, ‘sadece occluded insan görüntülerini üretken modellere eğitim sırasında beslemek, “insan birleştirme” sorununu gidermek için yeterli olur mu? Bu, elverişsiz bir soru olabilir. İnsanların bireyselleştirilmesinde nasıl bir örnek-seviyesi rehberlik (örneğin, örnek maskesi gibi) verebileceğimizi görmek ilginç olacaktır.

 

* 10 Ekim 2022

İlk olarak 10 Ekim 2022’de yayınlandı.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai