Yapay zeka modelleri ve platformları

Zero123++: Tek Görüntüden Uygun Çoklu Görünüm Diffusion Taban Modeline

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Son birkaç yıl, yeni ortaya çıkan AI üretken modellerinin performansı, verimliliği ve üretken yeteneklerinin hızlı bir şekilde ilerlemesini gördü. Bugüne geldiğimizde, üretken AI modelleri 2D ve 3D medya içeriği dahil olmak üzere çeşitli formlarda 2D ve 3D medya içeriği oluşturmak için son derece yeteneklidir.

Bu makalede, Zero123++ çerçevesi hakkında konuşacağız, bir görüntüden 3D tutarlı çoklu görünüm görüntüleri oluşturmak amacıyla tasarlanmış bir görüntü koşullu difüzyon üretken AI modeli. Önceden eğitilmiş üretken modellerden elde edilen avantajı en üst düzeye çıkarmak için, Zero123++ çerçevesi çeşitli eğitim ve koşullama şemalarını uygular ve bu da off-the-shelf difüzyon görüntü modellerinden ayarlanması için gereken çabanın minimuma indirilmesini sağlar. Zero123++ çerçevesinin mimarisini, çalışma şeklini ve sonuçlarını daha derinlemesine inceleyeceğiz ve tek bir görüntüden yüksek kaliteli tutarlı çoklu görünüm görüntüleri oluşturma yeteneğini analiz edeceğiz. Başlayalım.

Zero123 ve Zero123++: Giriş

Zero123++ çerçevesi, bir görüntüden 3D tutarlı çoklu görünüm görüntüleri oluşturmak amacıyla tasarlanmış bir görüntü koşullu difüzyon üretken AI modelidir. Zero123++ çerçevesi, önceden eğitilmiş Zero123 veya Zero-1-to-3 çerçevesinin bir devamıdır ve bu çerçeve, açık kaynaklı tek görüntüden 3D dönüşümler için zero-shot yeni görünüm görüntü sentezi tekniğini kullanır. Ancak, Zero123++ çerçevesi tarafından oluşturulan görüntüler, görüntüler arasında geometrik tutarsızlıklar içerir ve bu, 3D sahneler ve çoklu görünüm görüntüleri arasındaki farkın nedenini oluşturur.

Zero-1-to-3 çerçevesi, SyncDreamer, One-2-3-45, Consistent123 gibi diğer beberapa çerçevenin temelini oluşturur ve bu çerçeveler, tutarlı sonuçlar elde etmek için Zero123 çerçevesine ek katmanlar ekler. ProlificDreamer, DreamFusion, DreamGaussian gibi diğer çerçeveler, 3D görüntüleri elde etmek için optimize edilmiş bir yaklaşım kullanır ve çeşitli tutarlı modellerden bir 3D görüntüsünü damıtırlar. Bu teknikler etkili olsa da, tutarlı çoklu görünüm görüntüleri oluşturmak için Stable Diffusion’dan bir temel difüzyon modeli elde etmek, sonuçları iyileştirebilir. Zero123++ çerçevesi, Zero-1-to-3 ve Stable Diffusion’u temel alan yeni bir çoklu görünüm temel difüzyon modelini ayarlar.

Zero-1-to-3 çerçevesinde, her yeni görünüm bağımsız olarak oluşturulur ve bu approach, difüzyon modellerinin örneklemeye dayalı doğası nedeniyle tutarlılıkların oluşmasına neden olur. Bu sorunu çözmek için, Zero123++ çerçevesi, nesnenin altı görünümünü tek bir görüntüye yerleştirerek tutarlı çoklu görünüm oluşturma yaklaşımını benimser ve bu approach, nesnenin çoklu görünümünün joint dağılımının doğru bir şekilde modellenmesini sağlar.

Zero-1-to-3 çerçevesi ile çalışan geliştiriciler, Stable Diffusion’un sunduğu olanaklardan yararlanamama gibi bir sorunla karşılaşırlar ve bu, verimsizlik ve ek maliyetlere neden olur. Zero-1-to-3 çerçevesi, Stable Diffusion’un sunduğu olanaklardan yararlanamama nedenlerinden biri, görüntü koşullarında yerel veya küresel koşullama mekanizmalarını etkili bir şekilde birleştirememesidir.

  1. Görüntü koşullarında, Zero-1-to-3 çerçevesi, Stable Diffusion’un sunduğu yerel veya küresel koşullama mekanizmalarını etkili bir şekilde birleştiremez.
  2. Eğitim sırasında, Zero-1-to-3 çerçevesi, Stable Diffusion modelleri için görüntü oluşturma kalitesini azaltabilecek bir yaklaşım olan azaltılmış çözünürlüğü kullanır.

Bu sorunları çözmek için, Zero123++ çerçevesi, Stable Diffusion’un sunduğu kaynakları en üst düzeye çıkarmak için çeşitli koşullama tekniklerini uygular ve Stable Diffusion modelleri için görüntü oluşturma kalitesini korur.

Koşullama ve Tutarlılıkları İyileştirme

Görüntü koşullamasını ve çoklu görünüm tutarlılığını iyileştirmek için, Zero123++ çerçevesi, önceden eğitilmiş Stable Diffusion modelinden alınan teknikleri uygular.

Çoklu Görünüm Oluşturma

Tutarlı çoklu görünüm görüntüleri oluşturmanın temel özelliği, çoklu görüntülerin joint dağılımını doğru bir şekilde modellemektir. Zero-1-to-3 çerçevesinde, her görüntü bağımsız olarak modellenir ve bu approach, çoklu görüntüler arasındaki korelasyonu görmezden gelir. Ancak, Zero123++ çerçevesinde, geliştiriciler, altı görüntüyü tek bir çerçeveye yerleştirerek tutarlı çoklu görünüm oluşturma yaklaşımını benimserler ve bu approach, çoklu görüntülerin joint dağılımının doğru bir şekilde modellenmesini sağlar.

Ayrıca, nesne yönlerinin, kamera pozları üzerinde eğitim sırasında belirsizleşmeye eğilimli olduğunoticedir ve bu belirsizliği önlemek için, Zero-1-to-3 çerçevesi, kamera pozları üzerinde eğitim yapar ve bu approach, ek hatalara neden olabilir. Zero123++ çerçevesi, bu sorunu çözmek için, kamera pozları üzerinde eğitim yerine, altı görüntüyü tek bir çerçeveye yerleştirerek tutarlı çoklu görünüm oluşturma yaklaşımını benimser.

Gürültü Zamanlaması

Stable Diffusion’un orijinal gürültü zamanlaması, yerel detaylara odaklanır, ancak aşağıdaki görüntüde görüldüğü gibi, düşük SNR veya Sinyal- Gürültü Oranına sahip çok az adım vardır.

Düşük Sinyal-Gürültü Oranına sahip adımlar, gürültü giderme aşamasında gerçekleşir ve bu aşama, global düşük frekanslı yapıyı belirlemede kritiktir. Gürültü giderme aşamasında adımları azaltmak, yapısal varyasyonu artırabilir. Bu kurulum, tek görüntü oluşturma için ideal olsa da, farklı görüntüler arasındaki global tutarlılığı sağlamak için çerçevenin yeteneğini sınırlar. Bu engeli aşmak için, Zero123++ çerçevesi, Stable Diffusion 2 v-öngörme çerçevesi üzerinde bir LoRA modelini ayarlar ve sonuçlar aşağıdaki gibi gösterilir.

Ölçeklenmiş doğrusal gürültü zamanlamasıyla, LoRA modeli aşırı öğrenmez, ancak yalnızca görüntüyü hafifçe beyazlatır. Buna karşılık, doğrusal gürültü zamanlamasıyla, LoRA çerçevesi, girdi.promtından bağımsız olarak başarılı bir şekilde boş bir görüntü oluşturur ve bu, gürültü zamanlamasının çerçevenin global olarak yeni gereksinimlere uyum sağlama yeteneği üzerindeki etkisini gösterir.

Yerel Koşullama için Ölçeklenmiş Referans Dikkati

Zero-1-to-3 çerçevesinde, tek görüntüden girdi veya koşullama görüntüleri, gürültülü girdilerle birlikte öznitelik boyutunda birleştirilir.

Bu birleştirme, hedef görüntü ve girdi arasındaki doğru piksel-piksel uzaysal karşılık gelenliği sağlar. Yerel koşullama girdisini sağlamak için, Zero123++ çerçevesi, bir réféans dikkat yaklaşımını kullanır ve bu approach, bir réféans görüntüsüne dayalı bir gürültü giderme UNet modelini çalıştırma ve ardından réféans görüntüsünden değer matrislerini ve self-dikkat anahtarını, model girdisinin gürültüsünü giderirken ilgili dikkat katmanlarına eklemeyi içerir ve bu approach aşağıdaki gibi gösterilir.

Réféans dikkat yaklaşımı, difüzyon modelini, réféans görüntüsüne benzeyen tekstürü ve anlamsal içeriği paylaşan görüntüler oluşturmak için yönlendirebilir ve bu approach, hiçbir ayarlamaya gerek kalmadan üstün sonuçlar verir. Ayarlamayla birlikte, réféans dikkat yaklaşımı, latenlerin ölçeklendirilmesiyle birlikte daha da iyi sonuçlar verir.

Küresel Koşullama: FlexDiffuse

Orijinal Stable Diffusion yaklaşımında, metin gömme, küresel gömme için tek kaynaktır ve bu approach, metin gömme ve model latents arasında çapraz-sorgulama yapmak için CLIP çerçevesini kullanır. Sonuç olarak, geliştiriciler, metin uzayları ve CLIP görüntüleri arasındaki hizalamayı kullanarak küresel görüntü koşullaması için kullanabilir.

Zero123++ çerçevesi, minimal ayarlamaya gerek duyulan, eğitilebilir bir lineer rehberlik mekanizması varyantını önerir ve bu approach, küresel görüntü koşullamasını çerçeve içine dahil eder. Sonuçlar aşağıdaki gibi gösterilir. Küresel görüntü koşullaması olmadan, çerçevenin oluşturduğu içeriğin kalitesi, girdi görüntüsüne karşılık gelen görünür bölgeler için tatmin edicidir. Ancak, görünmeyen bölgeler için oluşturulan görüntü kalitesi, çerçevenin nesnenin küresel anlamsal içeriğini çıkarmadaki yetenek eksikliği nedeniyle önemli ölçüde düşer.

Model Mimarisi

Zero123++ çerçevesi, Stable Diffusion 2v-modeli temel alarak, makalede bahsedilen çeşitli yaklaşımları ve teknikleri kullanır. Zero123++ çerçevesi, Objaverse veri kümesiyle önceden eğitilir ve bu veri kümesi, rastgele HDRI aydınlatmasıyla oluşturulur. Çerçeve ayrıca, Stable Diffusion Image Variations çerçevesinde kullanılan aşama aşama eğitim zamanlaması yaklaşımını benimser ve bu approach, önceden eğitilmiş Stable Diffusion’dan mümkün olduğunca çok şey korumayı amaçlar.

Zero123++ çerçevesinin çalışması veya mimarisi, sıralı adımlara veya aşamalara bölünebilir. İlk aşama, çerçevenin, Stable Diffusion’un cross-attention katmanlarının KV matrislerini ve self-attention katmanlarını, AdamW optimizatörü, 1000 ısınma adımı ve kosinüs öğrenme oranı zamanlamasıyla ayarlamasını içerir ve bu approach, 7×10^-5’de maksimuma ulaşır. İkinci aşama, çerçevenin, yüksek bir sabit öğrenme oranıyla ve 2000 ısınma kümesiyle, Min-SNR yaklaşımını kullanarak eğitim verimliliğini en üst düzeye çıkarmasını içerir.

Zero123++: Sonuçlar ve Performans Karşılaştırması

Niteliksel Performans

Zero123++ çerçevesinin kalitesi açısından performansı değerlendirmek için, çerçeve, SyncDreamer ve Zero-1-to-3-XL gibi iki state-of-the-art çerçeveyle karşılaştırılır. Çerçeveler, dört farklı girdi görüntüsüyle karşılaştırılır. İlk görüntü, Objaverse veri kümesinden alınan bir elektrik oyuncak kedidir ve bu görüntü, nesnenin arka ucunda büyük bir belirsizlik içerir. İkinci görüntü, bir yangın söndürme cihazıdır ve üçüncü görüntü, SDXL modeli tarafından oluşturulan bir köpek görüntüsüdür. Dördüncü görüntü, bir anime illüstrasyonudur. Gerekli yükseltme adımları, One-2-3-4-5 çerçevesinin yükseltme tahmini yöntemiyle elde edilir ve arka plan kaldırma, SAM çerçevesi kullanılarak gerçekleştirilir. Sonuçlar, Zero123++ çerçevesinin yüksek kaliteli çoklu görünüm görüntüleri oluşturabildiğini ve 2D illüstrasyon ve AI tarafından oluşturulan görüntülere eşit derecede iyi genelleyebildiğini gösterir.

Nicel Analiz

Zero123++ çerçevesini, state-of-the-art Zero-1-to-3 ve Zero-1-to-3 XL çerçevelerine karşı nicel olarak karşılaştırmak için, geliştiriciler, Objaverse veri kümesinin doğrulama bölümü üzerinde Öğrenilen Algısal Görüntü Yama Benzerliği (LPIPS) puanını değerlendirir. Çerçevenin çoklu görünüm görüntü oluşturma performansı değerlendirmek için, geliştiriciler, referans görüntülerini ve altı oluşturulan görüntüyü sırasıyla birleştirir ve ardından LPIPS puanını hesaplar. Sonuçlar aşağıdaki gibi gösterilir ve Zero123++ çerçevesinin, doğrulama kümesinde en iyi performansı elde ettiğini gösterir.

Metin-Çoklu Görünüm Değerlendirmesi

Zero123++ çerçevesinin metin-çoklu görünüm içeriği oluşturma yeteneğini değerlendirmek için, geliştiriciler önce SDXL çerçevesini metin promtleriyle birlikte kullanarak bir görüntü oluşturur ve ardından Zero123++ çerçevesini oluşturulan görüntüye uygular. Sonuçlar aşağıdaki gibi gösterilir ve Zero-1-to-3 çerçevesiyle karşılaştırıldığında, Zero123++ çerçevesinin tutarlı, gerçekçi ve yüksek ayrıntılı çoklu görünüm görüntüleri oluşturabildiğini gösterir.

Zero123++ Derinlik Kontrol Ağı

Zero123++ çerçevesinin yanı sıra, geliştiriciler ayrıca Derinlik Kontrol Ağı Zero123++’yi yayınladılar ve bu, orijinal çerçevenin derinlik kontrollü bir sürümüdür ve ControlNet mimarisini kullanarak oluşturuldu. Normalize edilmiş doğrusal görüntüler, sonraki RGB görüntüleriyle birlikte oluşturulur ve bir ControlNet çerçevesi, Zero123++ çerçevesinin geometrisini derinlik algılamasıyla kontrol etmek için eğitilir.

Sonuç

Bu makalede, Zero123++ hakkında konuşmuştuk, bir görüntüden 3D tutarlı çoklu görünüm görüntüleri oluşturmak amacıyla tasarlanmış bir görüntü koşullu difüzyon üretken AI modeli. Önceden eğitilmiş üretken modellerden elde edilen avantajı en üst düzeye çıkarmak için, Zero123++ çerçevesi çeşitli eğitim ve koşullama şemalarını uygular ve bu da off-the-shelf difüzyon görüntü modellerinden ayarlanması için gereken çabanın minimuma indirilmesini sağlar. Ayrıca, Zero123++ çerçevesinin, state-of-the-art çerçevelerle karşılaştırılabilir ve hatta daha iyi sonuçlar elde ettiğini gösteren farklı yaklaşımları ve iyileştirmeleri hakkında konuştuğumuz gibi, çerçevesinin yüksek kaliteli çoklu görünüm görüntüleri oluşturma yeteneğini de analiz ettik.

Ancak, verimliliği ve tutarlı çoklu görünüm görüntüleri oluşturma yeteneği rağmen, Zero123++ çerçevesi hala bazı iyileştirme alanlarına sahiptir ve bu alanlar arasında, Zero123++’nin tutarlılık gereksinimlerini karşılayamama sorununu çözebilecek iki aşamlı bir Rafiner Model ve Zero123++’nin daha yüksek kaliteli görüntüler oluşturma yeteneğini daha da artırmak için Ek Ölçeklendirme bulunmaktadır.

  • İki Aşamlı Rafiner Model Zero123++’nin tutarlılık gereksinimlerini karşılayamama sorununu çözebilir.
  • Ek Ölçeklendirme Zero123++’nin daha yüksek kaliteli görüntüler oluşturma yeteneğini daha da artırabilir.

Mesleği mühendis, kalbi yazar. Kunal, AI ve ML'ye derin bir sevgi ve anlayışla technical writer, bu alanlardaki karmaşık kavramları etkileyici ve bilgilendirici belgelerle basitleştirmeye adanmış.