Anderson’un Açısı

Bilgisayar Görme Edebiyatı Eğilimleri Hakkında Kişisel Bir Bakış 2024

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
ChatGPT image: 'A panoramic orthographic-view image of a stylized bunch of SIMs-style scientists working in white coats at a computer research laboratory. Ariel view, orthographic projection, stylized, cartoon-style.'

Bilgisayar görme (CV) ve görüntü sentez araştırma sahnesini Arxiv ve diğer yerlerde yaklaşık beş yıl boyunca sürekli olarak takip ediyorum, böylece eğilimler zaman içinde belirgin hale geliyor ve her yıl yeni yönlerde değişiyor.

Dolayısıyla 2024 yılı sona ererken, Computer Vision and Pattern Recognition bölümünde yeni veya gelişen bazı özelliklere bakmak uygun geldi. Bu gözlemler, yüzlerce saatlik nghiênme tarafından bilgilendirilmiş olsa da, katı olarak anekdotlardır.

Doğu Asya’nın Sürekli Yükselişi

2023 yılı sonunda, ses sentez kategorisindeki literatürün çoğunun Çin ve diğer Doğu Asya bölgelerinden geldiğini fark ettim. 2024 yılı sonunda, görüntüleri ve video sentez araştırma sahnesinde de bu durumun geçerli olduğunu gözlemlemek zorundayım (anekdot olarak).

Bu, Çin ve komşu ülkelerin her zaman en iyi çalışmaları ürettiği anlamına gelmez (aslında, bunun tersine deliller vardır); ayrıca, Çin’de (Batı’da olduğu gibi) en ilginç ve güçlü yeni geliştirilen sistemlerin çoğunun araştırma literatüründen hariç tutulduğu ve propriyeterye sahip olduğu ihtimalini hesaba katmaz.

Ancak, bu durum Doğu Asya’nın bu konuda Batı’yı sayısal olarak geçtiğini gösteriyor. Bunun değeri, Edison tarzı ısrarın geçerliliğine inandığınız ölçüde önemlidir, ki bu genellikle çözülemez engeller karşısında etkisizdir.

Yapay zeka sentezinde birçok böyle engel vardır ve hangi engellerin mevcut mimarilerin ele alınarak çözülebileceğini, hangilerinin sıfırdan yeniden düşünülmesi gerektiğini bilmek kolay değildir.

Doğu Asya’dan gelen araştırmacılar bilgisayar görme konulu daha fazla makale üretiyor gibi görünse de, “Frankenstein” tarzı projelerin sıklığında bir artış gözlemledim – önceki çalışmaların bir bileşimi olan girişimler, sınırlı mimari yenilik (veya belki de sadece farklı bir veri türü) ekler.

Bu yıl, Çin ve Çin ile işbirliği yapan diğer Doğu Asya ülkelerinden gelen daha fazla makale, nicelikten ziyade nitelik tarafından yönlendiriliyor gibi görünüyordu, bu da zaten fazla aboneli bir alanda sinyal-gürültü oranını önemli ölçüde artırdı.

Aynı zamanda, 2024 yılında daha fazla Doğu Asya makalesi dikkatimi ve hayranlığımı çekti. Dolayısıyla, bu bir sayı oyunuysa, başarısız değil – ancak ucuz da değil.

Gönderilerin Artan Hacmi

Tüm ülkelerden gelen makalelerin hacmi 2024 yılında açıkça arttı.

En popüler yayın günü yıl boyunca değişir; şu anda Salı, Computer Vision and Pattern Recognition bölümüne tek bir günde 300-350 arasında makale gönderildiği “zirve” dönemlerinde (Mayıs-Ağustos ve Ekim-Aralık, yani konferans sezonu ve “yıllık kota bitiş” sezonu).

Kendi deneyimimin ötesinde, Arxiv Kasım 2024’te aylık gönderiler için yeni bir rekor bildirdi, 6000 yeni gönderi ile birlikte, Computer Vision bölümü Makine Öğrenimi bölümünden sonra en çok gönderilen ikinci bölüm oldu.

Ancak, Arxiv’in Makine Öğrenimi bölümünün genellikle bir “ek” veya birleştirilmiş süper-kategori olarak kullanıldığı düşünüldüğünde, bu durum Computer Vision ve Pattern Recognition’ın aslında en çok gönderilen Arxiv kategorisi olduğunu öne sürer.

Arxiv’in kendi istatistikleri kesinlikle bilgisayar bilimini gönderilerde açık lider olarak gösteriyor:

Bilgisayar Bilimi (CS) son beş yılda Arxiv'de gönderi istatistiklerini domine ediyor. Kaynak: https://info.arxiv.org/about/reports/submission_category_by_year.html

Bilgisayar Bilimi (CS) son beş yılda Arxiv’de gönderi istatistiklerini domine ediyor. Kaynak: https://info.arxiv.org/about/reports/submission_category_by_year.html

Stanford Üniversitesi’nin 2024 AI İndeksi, en son istatistikleri henüz raporlayamamasına rağmen, son yıllarda makine öğrenimi konulu akademik makalelerin gönderilerindeki önemli artışa da vurgu yapıyor:

2024 yılına ait rakamların mevcut olmamasına rağmen, Stanford'un raporu makine öğrenimi makalelerinin gönderi hacimlerinin artışı konusunda dramatik bir şekilde gösteriyor. Kaynak: https://aiindex.stanford.edu/wp-content/uploads/2024/04/HAI_AI-Index-Report-2024_Chapter1.pdf

2024 yılına ait rakamların mevcut olmamasına rağmen, Stanford’un raporu makine öğrenimi makalelerinin gönderi hacimlerinin artışı konusunda dramatik bir şekilde gösteriyor. Kaynak: https://aiindex.stanford.edu/wp-content/uploads/2024/04/HAI_AI-Index-Report-2024_Chapter1.pdf

Diffusion>Mesh Çerçevelerinin Yayılması

Benim için ortaya çıkan başka bir açık eğilim, Latent Diffusion Modellerinin (LDM’ler) geleneksel CGI modellerinin oluşturucuları olarak kullanılmasıyla ilgili makalelerde büyük bir artıştı.

Bu tür projeler arasında Tencent’in InstantMesh3D, 3Dtopia, Diffusion2, V3D, MVEdit ve GIMDiffusion gibi birçok benzer teklif bulunuyordu.

3Dtopia'da Diffusion tabanlı bir işlemle mesh oluşturma ve rafine etme. Kaynak: https://arxiv.org/pdf/2403.02234

3Dtopia’da Diffusion tabanlı bir işlemle mesh oluşturma ve rafine etme. Kaynak: https://arxiv.org/pdf/2403.02234

Bu ortaya çıkan araştırma dalı, generatif sistemlerin, özellikle de difüzyon modellerinin, yalnızca iki yıl önce tüm bu sistemlerin potansiyel bir alternatifi olarak sunulduğu ancak şimdi Diffusion>Mesh modelleri tarafından doldurulmaya çalışılan sistemlerin inatçı sınırlarını kaldırmak için bir tür örtülü kabul olarak yorumlanabilir.

Stability.ai, açık kaynaklı Stable Diffusion modelinin yaratıcısı, Stable Zero123‘ü yayınladı, bu, bir AI tarafından oluşturulan bir görüntünün Neural Radiance Fields (NeRF) yorumunu, bir köprü olarak kullanarak, Unity, video oyunları, artırılmış gerçeklik ve diğer platformlarda kullanılabilen açık bir mesh tabanlı CGI modeli oluşturabilir.

Oynatmak için tıklayın. Stable Diffusion’da oluşturulan görüntüler, rasyonel CGI mesh’lerine dönüştürülebilir. Burada, Stable Zero 123 kullanarak bir görüntü>CGI iş akışının sonucunu görüyoruz. Kaynak: https://www.youtube.com/watch?v=RxsssDD48Xc

3D Anlambilim

Yapay zeka sentez alanı, 2B ve 3B sistemlerin uygulamaları arasında bir ayrım yapar. Örneğin, yüz landmarking çerçeveleri, her durumda 3B nesneleri (yüzleri) temsil etseler de, hepsinin adreslenebilir 3B koordinatları hesaplamadığını belirtmek önemlidir.

Popüler FANAlign sistemi, geniş olarak 2017 dönemi deepfake mimarilerinde (diğerlerinde) kullanılan, her iki yaklaşımı da kapsayabiliyor:

Yukarıda, 2B landmarklar yalnızca tanınan yüz hatları ve özelliklerine dayalı olarak oluşturuluyor. Aşağıda, bunlar 3B X/Y/Z uzayına mantıksal olarak dönüştürülüyor. Kaynak: https://github.com/1adrianb/face-alignment

Yukarıda, 2B landmarklar yalnızca tanınan yüz hatları ve özelliklerine dayalı olarak oluşturuluyor. Aşağıda, bunlar 3B X/Y/Z uzayına mantıksal olarak dönüştürülüyor. Kaynak: https://github.com/1adrianb/face-alignment

‘Deepfake’ terimi gibi, ‘3B’ de bilgisayar görme araştırmalarında kafa karıştırıcı bir terim haline geldi.

Tüketici için, bu genellikle stereo etkinleştirilmiş medya (özel gözlüklerin takılması gereken filmler) anlamına gelir; görsel efekt uzmanları ve modelleyiciler için, 2B sanat (kavramsal çizimler) ile mesh tabanlı modeller arasındaki ayrımı sağlar, bu modeller Maya veya Cinema4D gibi 3B programlarında manipüle edilebilir.

Ancak, bilgisayar görme araştırmalarında, bu, bir Kartezyen koordinat sisteminin modelin gizli uzayında var olduğu anlamına gelir – kullanıcı tarafından doğrudan ele alınabileceği veya manipüle edilebileceği anlamına gelmez; en azından, üçüncü taraf yorumlayıcı CGI tabanlı sistemler olmadan, chẳng hạn 3DMM veya FLAME.

Diffusion>3B kavramı therefore belirsizdir; herhangi bir görüntü tipi (gerçek bir fotoğraf da dahil) bir generatif CGI modeli üretmek için girdi olarak kullanılabilir, daha az belirsiz bir terim ise ‘mesh’ tir.

Ancak, belirsizliği daha da artırmak için, çoğu yeni proje için diffusion interpretasyonu bir mesh’e dönüştürmek için gereklidir. Dolayısıyla, daha doğru bir tanım ‘görüntüden mesh’e’ olur, ‘görüntü>diffusion>mesh’ ise daha doğru bir açıklamadır.

Ancak, bu bir yönetim kurulu toplantısında veya yatırımcıları çekmek için tasarlanmış bir basın açıklamasında satmak zor olabilir.

Mimari Tıkanıklıkların Kanıtları

2023 yılına kıyasla, son 12 aylık makale koleksiyonu, difüzyon tabanlı üretimdeki sabit pratik sınırları kaldırmak için artan bir umutsuzluk sergiliyor.

Ana engel, anlatısal ve zaman bakımından tutarlı video oluşturmanın ve karakterlerin ve nesnelerin tutarlı görünümünü korumanın devam etmesidir – yalnızca farklı video klipleri arasında değil, aynı zamanda tek bir oluşturulmuş video klibinin kısa çalışma süresi boyunca.

Difüzyon tabanlı sentezdeki son büyük yenilik, 2022’de LoRA’nın ortaya çıkışıydı. Yeni sistemler gibi Flux, Stable Diffusion’un önceki metin içeriğini bir oluşturulmuş görüntüde yeniden üretme konusundaki eski eksikliğini giderdi ve genel görüntü kalitesi verbess, ancak 2024 yılında incelediğim majority makaleler esas olarak sadece yemekleri tabakta hareket ettiriyordu.

Bu tıkanmalar daha önce de Generatif Karşıt Ağlar (GAN’lar) ve Nöral Işınım Alanları (NeRF) ile yaşanmıştı, bunlar da ilk görünüşteki potansiyellerine ulaşamamışlardı ve her ikisi de artık daha geleneksel sistemlerde (NeRF’in Stable Zero 123’de kullanımı gibi) daha fazla kullanılıyor.

Gaussian Splatting Araştırması Dönüşümleri

2023 yılı sonunda, 1990’ların başlarında tıbbi görüntüleme tekniği olarak ortaya çıkan 3B Gaussian Splatting (3DGS) yönteminin, insan görüntüsü sentezinde autoencoder tabanlı sistemleri suddenly geçeceği görünüyordu.

2023 ASH makalesi tam vücutlu 3DGS insanları vaat ediyordu, Gaussian Avatars ise daha iyi ayrıntı (karşılaştırıldığında diğer yöntemlerle) ve etkileyici yeniden canlandırma sunuyordu.

Bu yıl ise, 3DGS insan sentezi için böyle bir atılımlı an olmadı; bu problemi ele alan çoğu makale, yukarıda bahsedilen çalışmaların türetilmiş veya yeteneklerini aşmayanlardı.

Bunun yerine, 3DGS’nin temel mimari uygulanabilirliğini iyileştirmeye odaklanıldı, bu da exterior ortamlar için 3DGS’ye odaklanan bir dizi makaleye yol açtı. Özellikle SLAM 3DGS yaklaşımlarına dikkat çekildi, Gaussian Splatting SLAM, Splat-SLAM, Gaussian-SLAM, DROID-Splat gibi projelerde.

Bu projelerin arasında, insan sentezini devam ettirmeye veya genişletmeye çalışanlar arasında MIGS, GEM, EVA, OccFusion, FAGhead, HumanSplat, GGHead, HGM ve Topo4D bulunuyordu. Bunların dışında başkaları da vardı, ancak hiçbiri 2023’te ortaya çıkan makalelerin ilk etkisini eşlemedi.

‘Weinstein Dönemi’ Test Örneklerinin Azalması

Güneydoğu Asya’dan (özellikle de Çin’den) gelen araştırmalar genellikle, bir inceleme makalesinde yeniden yayınlamak için problematik olan test örnekleri içerir.

Bu, Güneydoğu Asya’daki araştırma bilimcilerinin çalışmalarına dikkat çekmek için böyle örnekler kullanıp kullanmadıkları konusunda tartışmalıdır; ancak son 18 ayda, yapay zeka (görüntü ve/veya video) konulu birçok makale, genç ve az giymiş kadın ve kızları proje örnekleri olarak kullanmaya başladı.

Bu, Latent Diffüzyon Modelleri (LDM’ler) etrafındaki topluluklarda Rule 34’un geçerli olmasını yansıtıyor.

Ünlü Yüzleşmesi

Bu tür uygunsuz örnekler, AI süreçlerinin keyfi olarak ünlü benzerliklerini kullanmaması gerektiği konusundaki artan tanınma ile çakışıyor – özellikle de attractive ünlü kadınların sorgusuz sualsiz kullanıldığı ve şüpheli bağlamlarda yer aldığı çalışmalar.

Örneğin, AnyDressing, çok genç anime tarzı kadın karakterleri içeriyor ve ayrıca Marilyn Monroe gibi klasik ünlülerin ve Anne Hathaway gibi güncel ünlülerin kimliklerini liberal bir şekilde kullanıyor (Hathaway bu tür kullanımın çok sesli bir şekilde karşı çıkıyor).

Güneydoğu Asya'dan gelen makalelerde, güncel ve 'klasik' ünlülerin keyfi kullanımı hala assez yaygındır, ancak bu uygulama biraz azalmaktadır. Kaynak: https://crayon-shinchan.github.io/AnyDressing/

Güneydoğu Asya’dan gelen makalelerde, güncel ve ‘klasik’ ünlülerin keyfi kullanımı hala assez yaygındır, ancak bu uygulama biraz azalmaktadır. Kaynak: https://crayon-shinchan.github.io/AnyDressing/

Batı’daki makalelerde, bu uygulama 2024 yılı boyunca açıkça azalmaktadır, FAANG ve diğer üst düzey araştırma kurumlarından büyük yayınlar tarafından yönetilmektedir. Gelecek davalardan kaynaklanan potansiyel risklerden haberdar olan bu büyük kurumsal oyuncular, artık incluso fictional fotogerçekçi insanları temsil etmekten giderek daha fazla kaçınıyorlar.

Bununla birlikte, Imagen ve Veo2 gibi sistemler açıkça böyle bir çıktı üretebiliyor, ancak Batı’dan gelen örnekler artık ‘sevimli’, Disneyvari ve aşırı ‘güvenli’ görüntülere ve videolara doğru bir eğilim gösteriyor.

İmgene'nin fotogerçekçi çıktı üretme kapasitesine rağmen, Google Research tarafından tanıtılan örnekler genellikle fantastik, 'aile' odaklı - fotogerçekçi insanlar dikkatlice kaçınıyor veya minimal örnekler veriliyor. Kaynak: https://imagen.research.google/

İmgene’nin fotogerçekçi çıktı üretme kapasitesine rağmen, Google Research tarafından tanıtılan örnekler genellikle fantastik, ‘aile’ odaklı – fotogerçekçi insanlar dikkatlice kaçınıyor veya minimal örnekler veriliyor. Kaynak: https://imagen.research.google/

Yüz Yıkama

Batı’daki CV literatüründe, bu ikiyüzlü yaklaşım, özellikle özelleştirme sistemlerinde daha belirgindir – belirli bir kişinin birden fazla örnekte tutarlı benzerliklerini oluşturabilen yöntemler (LoRA ve daha eski DreamBooth gibi).

Örneğin, ortogonal görsel gömme, LoRA-Composer, Google’un InstructBooth ve daha birçokları.

Google'un InstructBooth sevimlilik faktörünü 11'e çıkarıyor, tarihsel olarak kullanıcıların fotogerçekçi insanlardan ziyade tüylü veya sevimli karakterler oluşturmaya daha intéresseli olduğu biliniyor. Kaynak: https://sites.google.com/view/instructbooth

Google’un InstructBooth sevimlilik faktörünü 11’e çıkarıyor, tarihsel olarak kullanıcıların fotogerçekçi insanlardan ziyade tüylü veya sevimli karakterler oluşturmaya daha intéresseli olduğu biliniyor. Kaynak: https://sites.google.com/view/instructbooth

Bununla birlikte, ‘sevimli örnek’ yükselişi, diğer CV ve sentez araştırma dallarında da görülüyor, Comp4D, V3D, DesignEdit, UniEdit, FaceChain (GitHub sayfasında daha gerçekçi kullanıcı beklentilerine teslim oluyor) ve DPG-T2I-Personalization gibi projelerde.

Bu sistemlerin (LoRA’lar gibi) ev kullanıcıları tarafından nispeten mütevazi donanımla yaratılabilmesi, sivit.ai etki alanında ve topluluğunda indirilebilen ünlü modellerin patlamasına yol açtı. Bu tür kaçak kullanımlar, Stable Diffusion ve Flux gibi mimarilerin açık kaynaklı olmasıyla mümkün olmaya devam ediyor.

Her ne kadar generatif metin-görüntü (T2I) ve metin-video (T2V) sistemlerinin güvenlik özelliklerini aşarak, platformların kullanım koşulları tarafından yasaklanan materyaller oluşturmak mümkün olsa da, en iyi sistemlerin (RunwayML ve Sora gibi) kısıtlanmış yetenekleri ile yalnızca yeterli sistemlerin (Stable Video Diffusion, CogVideo ve Hunyuan’ın yerel dağıtımları gibi) sınırsız yetenekleri arasındaki uçurum gerçekten kapanmıyor, birçokları böyle olduğunu düşünse de.

Aslında, bu sistemler, telif hakkı endişeleri nedeniyle aşırı derecede engellenen pahalı ve hyperscale T2V sistemleri ve açık kaynaklı sistemlerin lisans altyapısı ve veri seti denetimi eksikliği nedeniyle piyasadan tamamen dışlanabileceği için, eşit derecede işe yaramaz hale gelebilir.

 

İlk olarak 24 Aralık 2024 Salı günü yayınlandı.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai