Yapay zeka modelleri ve platformları

Sapiens: İnsan Vizyon Modellerinde Bir Başarı

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Dil modellemede büyük ölçekli ön eğitim ve görev özgülleştirme ile fine-tuning yaklaşımı, standart bir uygulama olarak kabul görmüştür. Benzer şekilde, bilgisayarlı görü yöntemleri de geniş veri ölçeklerinde ön eğitim için giderek daha fazla benimsenmektedir. LAION5B, Instagram-3.5B, JFT-300M, LVD142M, Visual Genome ve YFCC100M gibi büyük veri setlerinin ortaya çıkması, geleneksel benchmarklerin ötesinde bir veri korpusunun keşfini mümkün kılmıştır. Bu alanda önemli çalışmalar arasında DINOv2, MAWS ve AIM bulunmaktadır. DINOv2, LDV-142M veri setinde kontrastif iBot yöntemini ölçeklendirerek kendinden eğitimli özellikler oluşturarak devlet-sanat performansını elde etmektedir. MAWS, milyarlarca görsel üzerinde masked-autoencoder (MAE) ölçeklenmesini incelemektedir. AIM, BERT için görme dönüşümlerine benzer otoregresif görsel ön eğitimlerin ölçeklenebilirliğini araştırıyor. Bu yöntemlerin çoğunun aksine, genel görüntü ön eğitimine veya sıfır-şans görüntü sınıflandırmasına odaklanmak yerine, Sapiens insan-merkezli bir yaklaşım benimsemektedir: Sapiens modelleri, insan görüntülerinin geniş bir koleksiyonunu ön eğitim için kullanmakta ve daha sonra insanla ilgili çeşitli görevler için fine-tuning yapmaktadır. Büyük ölçekli 3D insan dijitalleştirmesi, bilgisayar görüşünde önemli bir hedef olmaya devam etmektedir.

Kontrol edilen veya stüdyo ortamlarında önemli ilerlemeler kaydedilmiş olsa da, bu yöntemleri kısıtlı olmayan ortamlara genişletme konusunda zorluklar devam etmektedir. Bu zorlukları gidermek için, anahtar nokta tahmini, vücut parçasısegmentasyonu, derinlik tahmini ve yüzey normali tahmini gibi temel görevleri gerçekleştirebilen esnek modeller geliştirmek önemlidir. Sapiens, bu temel insan vizyon görevleri için modeller geliştirmeyi amaçlamaktadır ve bu modellerin doğada bulunan ortamlara genellemesini hedeflemektedir. Şu anda en büyük kamu erişimi language modelleri 100M parametre içerirken, daha yaygın olarak kullanılan dil modelleri yaklaşık 7M parametre içerir. Buna karşılık, Görme Dönüşümleri (ViT), benzer bir mimariye sahip olmasına rağmen, başarılı bir şekilde bu ölçekte genişletilememiştir. Bu yönde dikkat çekici girişimlere rağmen, geleneksel olarak kullanılan görme omurga modelleri hala 300M ile 600M parametre arasında değişmekte ve genellikle 224 piksel civarında bir görüntü çözünürlüğünde ön eğitilmektedir. Benzer şekilde, mevcut transformer tabanlı görüntü oluşturma modelleri, DiT gibi, 700M’den az parametre kullanmakta ve yüksek olarak sıkıştırılmış bir latent uzayda çalışmaktadır. Bu açığı gidermek için, Sapiens, yüksek çözünürlüklü ViT modelleri koleksiyonunu sunmaktadır ve bu modeller milyonlarca insan görüntüsünden oluşan bir veri setinde 1024 piksel görüntü çözünürlüğünde ön eğitilmiştir.

Sapiens, dört temel insan-merkezli görme görevi için modeller sunmaktadır: 2D duruş tahmini, vücut parçası segmentasyonu, derinlik tahmini ve yüzey normali tahmini. Sapiens modelleri, 1K yüksek çözünürlüklü çıkarım için yerel olarak desteklenmekte ve bireysel görevler için fine-tuning için aşırı derecede kolay bir şekilde uyarlanabilmektedir. Sapiens, aynı hesaplama bütçesine sahip olduğunda, insan görüntülerinin bir koleksiyonu üzerinde kendinden eğitimli ön eğitim, çeşitli insan-merkezli görevler için performansı önemli ölçüde artırmaktadır. Sonuç olarak elde edilen modeller, etiketli veri az veya tamamen sentetik olduğunda bile, doğada bulunan verilere şaşırtıcı bir genellemeye sahiptir. Basit model tasarımı da ölçeklenebilirlik getirir – model performansı, parametre sayısının 0.3’dan 2 Milyara ölçeklenmesi ile görevler boyunca iyileşir. Sapiens, çeşitli insan-merkezli benchmark’lerde mevcut temel değerleri aşmaktadır ve önceki devlet-sanat sonuçlarına önemli iyileştirmeler elde etmektedir: Humans-5K’de (duruş) 7.6 mAP, Humans-2K’de (parça-seg) 17.1 mIoU, Hi4D’de (derinlik) %22.4 göreli RMSE ve THuman2’de (normal) %53.5 göreli açısal hata.

Sapiens : İnsan Vizyon Modellerinde Bir Başarı

Son yıllarda, 2D ve 3D’de fotogerçekçi insan üretimi için önemli adımlar atılmıştır. Bu yöntemlerin başarısı, 2D anahtar noktalarının, ince vücut parçası segmentasyonunun, derinliğin ve yüzey normalinin güçlü tahmini ile büyük ölçüde ilişkilidir. Ancak, bu varlıkların sağlam ve doğru tahmini hala aktif bir araştırma alanıdır ve bireysel görevler için performansı artırmak için karmaşık sistemler genellikle daha geniş bir benimsemeyi engellemektedir. Ayrıca, doğada bulunan ortamlarda doğru zemine bağlı açıklamaların elde edilmesi, ölçeklenebilirlik açısından zor bir görevdir. Sapiens’in amacı, bu varlıkları doğada bulunan ortamlarda çıkarsamak için birleşik bir çerçeve ve modeller sağlamaktır ve bu, geniş bir insan-merkezli uygulama yelpazesini herkes için açığa çıkarmaktadır.

Sapiens, insan-merkezli modellerin üç kriteri karşılaması gerektiğini savunmaktadır: genellemeye karşı dayanıklılık, geniş uygulama alanı ve yüksek doğruluk. Genellemeye karşı dayanıklılık, modelin çeşitli ortamlarda tutarlı bir şekilde performans göstermesini sağlar. Geniş uygulama alanı, modelin minimum değişikliklerle geniş bir görev yelpazesi için uygun olmasını ifade eder. Yüksek doğruluk, modelin yüksek çözünürlüklü ve kesin çıktılar üretme yeteneğini vurgular, bu da insan üretimi görevleri için hayati önem taşımaktadır. Bu makale, bu özelliklere sahip modellerin geliştirilmesini detaylandırır ve bu modeller topluca Sapiens olarak adlandırılmaktadır.

Bu içgörüler ışığında, Sapiens büyük veri setleri ve ölçeklenebilir model mimarilerini kullanmaktadır, bunlar genellemeye karşı dayanıklılık için anahtardır. Daha geniş bir uygulama alanı için, Sapiens ön eğitim ve ardından fine-tuning yaklaşımını benimsemektedir, bu da modelin spesifik görevlere minimum ayarlamalarla adapte edilmesini sağlar. Bu yaklaşım, kritik bir soruyu gündeme getirmektedir: Ön eğitim için en etkili veri türü nedir? Hesaplama sınırları dikkate alındığında, insan görüntülerini toplamak mı yoksa gerçek dünya değişkenliğini daha iyi yansıtmak için daha az bir veri kümesi üzerinde ön eğitim yapmak mı daha uygundur? Mevcut yöntemler genellikle ön eğitim veri dağılımını aşağı akım görevleri bağlamında göz ardı etmektedir. İnsan özgü görevleri üzerinde ön eğitim veri dağılımının etkisini incelemek için, Sapiens 300 milyon çeşitli insan görüntüsünü içeren Humans-300M veri setini toplar. Bu etiketsiz görüntüler, 300M ile 2M parametre arasında değişen bir dizi görme dönüşümünden oluşacak şekilde sıfırdan ön eğitilir.

Büyük veri setlerinden genel amaçlı görsel özellikler öğrenmek için çeşitli kendinden eğitimli yöntemler arasında, Sapiens masked-autoencoder (MAE) yaklaşımını basitliği ve ön eğitim verimliliği nedeniyle seçmektedir. MAE, kontrastif veya çoklu çıkarım stratejilerine kıyasla tek geçişli bir çıkarım modeli sunar, bu da aynı hesaplama kaynaklarıyla daha büyük bir görüntü hacminin işlenmesine olanak tanır. Daha yüksek doğruluk için, önceki yöntemlerin aksine, Sapiens ön eğitim için yerel giriş çözünürlüğünü 1024 piksele çıkarır, bu da mevcut en büyük görme omurgasına kıyasla yaklaşık 4 katlık bir FLOP artışı sağlar. Her model 1.2 trilyon token ile ön eğitilir. İnsan-merkezli görevler için fine-tuning sırasında, Sapiens tutarlı bir kodlayıcı-dekodlayıcı mimarisi kullanır. Kodlayıcı, ön eğitim ağırlıkları ile başlatılırken, dekodlayıcı, bir görev özgü ve hafif başlangıç olarak rastgele başlatılır. Her iki bileşen de sonradan fine-tuning için uçtan uca birlikte eğitilir. Sapiens, 2D duruş tahmini, vücut parçası segmentasyonu, derinlik ve normal tahmini gibi dört ana görev üzerine odaklanmaktadır, aşağıdaki şekilde gösterildiği gibi.

Önceki çalışmalarla tutarlı olarak, Sapiens etiket kalitesinin modelin doğada bulunan performansına kritik etkisini vurgulamaktadır. Kamu benchmark’ları genellikle gürültülü etiketler içerir, bu da model fine-tuning sırasında tutarlı olmayan denetleyici sinyalleri sağlar. Aynı zamanda, Sapiens’in birincil hedefi olan 3D insan dijitalleştirmesine yakın hizalanmak için fine-grained ve kesin açıklamaları kullanmak önemlidir. Bu amaçla, Sapiens duruş tahmini için daha yoğun bir 2D tüm vücut anahtar noktaları kümesi ve vücut parçası segmentasyonu için daha ayrıntılı bir sınıf sözcüğü önermektedir, bu da önceki veri setlerinin kapsamını aşmaktadır. Özellikle, Sapiens 308 anahtar noktası sunar, vücut, eller, ayaklar, yüzey ve yüzü içermektedir. Ayrıca, Sapiens segmentasyon sınıf sözcüğünü 28 sınıfa genişletir, saç, dil, diş, üst/alt dudak ve gövde gibi vücut parçalarını kapsar. Açıklamaların kalitesini ve tutarlılığını garantilemek ve yüksek bir otomasyon derecesini sağlamak için, Sapiens çoklu görüş kurulumu kullanır ve duruş ve segmentasyon açıklamaları toplar. Sapiens ayrıca, derinlik ve normal tahmini için insan-merkezli sentetik verileri kullanır ve RenderPeople’den 600 ayrıntılı tarama kullanarak yüksek çözünürlüklü derinlik haritaları ve yüzey normali üretir. Sapiens, alan özgü büyük ölçekli ön eğitimin, sınırlı ancak yüksek kaliteli açıklamalarla birleşiminin, gerçek dünya senaryolarında güçlü bir genellemeye yol açtığını göstermektedir.

Sapiens : Yöntem ve Mimari

Sapiens, ön eğitim için masked-autoencoder (MAE) yaklaşımını takip etmektedir. Model, kısmi gözlemine dayalı olarak orijinal insan görüntüsünü yeniden oluşturmak için eğitilir. Tüm oto-encoder’lar gibi, Sapiens’in modeli, görüntüyü bir latent temsil’e eşleyen bir kodlayıcı ve bu latent temsil’den orijinal görüntüyü yeniden oluşturan bir dekodlayıcı içerir. Ön eğitim veri seti, tek ve çoklu insan görüntülerini içerir ve her görüntü sabit bir boyuta ve kare bir en boy oranı ile yeniden boyutlandırılır. ViT gibi, görüntü düzenli, örtüşmeyen parçalara bölünür ve bu parçaların bir alt kümesi rastgele seçilir ve maskelenir, geri kalanı görünür olarak bırakılır. Maskeli parçaların görünen parçalara oranı, eğitim boyunca sabit kalır.

Sapiens modelleri, görüntü özelliklerine göre çeşitli ölçeklerde, kırpma oranlarında, konuların yaş ve etnik kökeninde ve konuların sayısında genellemeye sahiptir. Modeldeki her bir yama tokeni, görüntünün %0.02’sini temsil eder, bu da standart ViT’lerdekinin 16 katı daha ince bir inter-token akıl yürütmesi sağlar. Hatta %95’lik bir maske oranı ile bile, Sapiens’in ön eğitilmiş modeli, insan anatomisinin inandırıcı bir yeniden oluşturulmasını gösterir. Aşağıdaki görüntüde, Sapiens’in ön eğitilmiş modelinin, görülmemiş insan görüntülerindeki yeniden oluşturulması gösterilmektedir.

Ayrıca, Sapiens ön eğitimi için yaklaşık 1 milyar doğada bulunan insan görüntüsünden oluşan büyük bir özel veri setini kullanır. Ön işleme, su işareti, metin, sanatsal betimlemeler veya doğal olmayan unsurlar içeren görüntüleri atmaktan oluşur. Sapiens daha sonra bir kişi sınırlayıcı kutusu dedektörü kullanır ve algılama puanı 0.9’un üzerinde ve sınırlayıcı kutu boyutu 300 pikseli aşan görüntüleri tutar. Veri setindeki 248 milyondan fazla görüntü, çoklu konuları içerir.

2D Poz Tahmini

Sapien çerçevesi, K = 17 [67], K = 133 [55] ve yeni, yüksek ayrıntılı bir iskelet için, K = 308 ile birlikte, kodlayıcı ve dekodlayıcıyı P boyunca çeşitli iskeletler üzerinde fine-tuning etmektedir, aşağıdaki şekilde gösterildiği gibi.

Mevcut formatların en fazla 68 yüz anahtar noktasına kıyasla, Sapien’in açıklamaları 243 yüz anahtar noktası içerir, gözler, dudaklar, burun ve kulaklar etrafındaki temsil noktalarını içerir. Bu tasarım, gerçek dünya yüz ifadelerinin nüanslı ayrıntılarını titizlikle yakalamak için özelleştirilmiştir. Bu anahtar noktalarla, Sapien çerçevesi, 4K çözünürlüğe sahip 1 milyon görüntüyü, iç mekan kurulumundan el ile açıklamıştır. Benzer şekilde, önceki görevlerde olduğu gibi, normal tahmini için dekodlayıcı çıkış kanallarını 3 olarak ayarlarız, bu da her pikseldeki normal vektörünün xyz bileşenlerine karşılık gelir. Üretilen sentetik veri, yüzey normali tahmini için de denetim olarak kullanılır.

Sapien : Deney ve Sonuçlar

Sapiens-2B, 18 gün boyunca 1024 A100 GPU ile PyTorch kullanılarak ön eğitilir. Sapiens, tüm deneyler için AdamW optimizatörünü kullanır. Öğrenme takvimi, kısa bir lineer ısınma ile başlar, ardından ön eğitim için kosinüs azalanı ve fine-tuning için lineer azalanı içerir. Tüm modeller, 1024×1024 çözünürlüğü ve 16’lık bir yama boyutu ile sıfırdan ön eğitilir. Fine-tuning için, giriş görüntüsü 4:3 oranına yeniden boyutlandırılır, yani 1024×768. Sapiens, standardı kırpma, ölçekleme, döndürme ve fotometrik bozulma gibi augmentasyonları uygular. Vücut parçası segmentasyonu, derinlik ve normal tahmini görevleri için, non-insan COCO görüntülerinden rastgele bir arka plan eklenir. Önemli olarak, Sapiens, genellemeyi korumak için diferansiyel öğrenme oranlarını kullanır, ilk katmanlar için daha düşük öğrenme oranları ve sonraki katmanlar için artan oranlar ile. Katman-bazlı öğrenme oranı azalanması 0.85 olarak ayarlanır ve ağırlık azalanması encoder için 0.1 olarak ayarlanır.

Sapiens’in tasarım özellikleri aşağıdaki tabloda detaylandırılmıştır. Belirli bir yaklaşımı takip eden Sapiens, modelleri genişlik yerine derinlik olarak ölçeklemeyi önceliklendirmektedir. Not olarak, Sapiens-0.3B modeli, geleneksel ViT-Large’a benzer bir mimariye sahip olmasına rağmen, daha yüksek çözünürlüğü nedeniyle 20 kat daha fazla FLOP içerir.

Sapiens, yüz, vücut, ayak ve el (K = 308) için yüksek doğruluklu açıklamalar kullanarak duruş tahmini için fine-tuning yapılır. Eğitim için, 1M görüntüden oluşan eğitim seti kullanılır ve değerlendirme için, 5K görüntüden oluşan Humans5K test seti kullanılır. Değerlendirme, bir üstten aşağıya yaklaşımı takip eder, burada Sapiens, sınırlayıcı kutular için bir off-the-shelf dedektör kullanır ve tek bir insan duruşu çıkarımı gerçekleştirir. Tablo 3, Sapiens modellerini mevcut yöntemlerle birlikte bütün vücut duruş tahmini için karşılaştırmaktadır. Tüm yöntemler, Sapiens’in 308 anahtar noktası sözcüğü ile COCO-WholeBody’nin 133 anahtar noktası sözcüğü arasındaki 114 ortak anahtar noktası üzerinde değerlendirilir. Sapiens-0.6B,当前 devlet-sanat DWPose-l’i +2.8 AP ile aşmaktadır. DWPose’un aksine, görev için özelleştirilmiş bir öğrenci-öğretmen çerçevesi ve özellik damlalığı kullanan DWPose, Sapiens genel bir kodlayıcı-dekodlayıcı mimarisi benimsemektedir ve büyük ölçekli insan-merkezli ön eğitimi kullanır.

İlginç bir şekilde, aynı parametre sayısına sahip olsa bile, Sapiens modelleri, VitPose+-L ve VitPose+-H gibi karşılaştırılabilir modellere kıyasla daha iyi bir performans sergilemektedir. Sapiens ailesi içinde, sonuçlar model boyutu ile performans arasında doğrudan bir korelasyon olduğunu göstermektedir. Sapiens-2B, 61.1 AP ile yeni bir devlet-sanat oluşturur, bu da önceki sanata kıyasla +7.6 AP’lik önemli bir iyileştirme sağlar. İç mekan stüdyo açıklamaları ile fine-tuning yapılmış olmasına rağmen, Sapiens gerçek dünya senaryolarına karşı güçlü bir genellemeye sahiptir, aşağıdaki görüntüde gösterildiği gibi.

Sapiens, 28 sınıftan oluşan bir segmentasyon sözcüğü ile fine-tuning ve değerlendirme yapılır. Eğitim seti 100K görüntüden oluşurken, test seti Humans-2K, 2K görüntüden oluşmaktadır. Sapiens, aynı eğitim seti üzerinde fine-tuning yapılmış mevcut vücut parçası segmentasyonu yöntemleri ile karşılaştırılır, her yöntem için önerilen ön eğitilmiş kontrol noktaları kullanılır. Duraş tahmini gibi, Sapiens segmentasyonda da genellemeye sahiptir, aşağıdaki tabloda gösterildiği gibi.

İlginç bir şekilde, en küçük model olan Sapiens-0.3B, daha yüksek çözünürlüğü ve büyük ölçekli insan-merkezli ön eğitimi nedeniyle, mevcut devlet-sanat segmentasyon yöntemlerini Mask2Former ve DeepLabV3+’yi 12.6 mIoU ile aşmaktadır. Ayrıca, model boyutunu artırmak, segmentasyon performansını daha da iyileştirmektedir. Sapiens-2B, test setinde 81.2 mIoU ve 89.4 mAcc ile en iyi performansı sergiler, aşağıdaki görüntüde Sapiens modellerinin nitel sonuçları gösterilmektedir.

Sonuç

Sapiens, insan-merkezli görme modellerini temel modellere doğru önemli bir adım atmaktadır. Sapiens modelleri, çeşitli insan-merkezli görevler boyunca güçlü genellemeye sahip olduğunu göstermektedir. Devlet-sanat performansı, (i) insanları anlamaya özgü bir veri setinde büyük ölçekli ön eğitim, (ii) yüksek çözünürlüklü ve yüksek kapasiteli görme dönüşümleri omurgaları ve (iii) stüdyo ve sentetik veriler上的 yüksek kaliteli açıklamalara dayanmaktadır. Sapiens modelleri, bir dizi aşağı akım görev için temel bir yapı taşı haline gelebilir ve daha geniş bir topluluğa yüksek kaliteli görme omurgalarına erişim sağlar.

Mesleği mühendis, kalbi yazar. Kunal, AI ve ML'ye derin bir sevgi ve anlayışla technical writer, bu alanlardaki karmaşık kavramları etkileyici ve bilgilendirici belgelerle basitleştirmeye adanmış.