Yapay zeka modelleri ve platformları

InstantID: Sıfır Atış Kimlik Koruyucu Görüntü Oluşturma

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

AI güçlendirilmiş görüntü oluşturma teknolojisi, DALL-E, GLIDE, Stable Diffusion, Imagen ve daha fazlası gibi büyük metin-görüntü difüzyon modellerinin sahneye çıkmasından bu yana geçen birkaç yıl içinde önemli bir büyüme gösterdi. Görüntü oluşturma AI modellerinin benzersiz bir mimariye ve eğitim yöntemlerine sahip olmasına rağmen, hepsi bir ortak odak noktasına sahiptir: Referans görüntülerine dayalı olarak tutarlı karakter ID, konu ve stil ile özelleştirilmiş ve kişiselleştirilmiş görüntü oluşturma. Şaşırtıcı generatif yetenekleri nedeniyle, modern görüntü oluşturma AI çerçeveleri, görüntü animasyonu, sanal gerçeklik, E-Ticaret, AI portreleri ve daha fazlası gibi alanlarda uygulamalar buldu. Ancak, şaşırtıcı generatif yeteneklerine rağmen, bu çerçeveler tümü bir ortak engel paylaşıyor: Çoğu, insan nesnelerinin narin kimlik ayrıntılarını koruyarak özelleştirilmiş görüntüler oluşturamıyor.

Özelleştirilmiş görüntüler oluştururken narin ayrıntıları korumak, özellikle yüksek bir doğruluk ve ayrıntı standardı gerektiren insan yüzü kimlik görevleri için kritik önem taşıyor ve genel nesne görüntü oluşturma görevlerine kıyasla daha nüanslı bir anlamsal gereksinim duyuyor. Ayrıca, LoRA, DreamBooth, Metin İnkılabı ve daha fazlası gibi son yearski kişiselleştirilmiş görüntü sentez çerçeveleri önemli ölçüde ilerledi. Ancak, kişiselleştirilmiş görüntü oluşturma AI modelleri hala gerçek dünya senaryolarında dağıtıma uygun değil, çünkü yüksek depolama gereksinimi var, birden fazla referans görüntüsü gerektiriyor ve genellikle uzun bir fine-tuning süreci var. Diğer yandan, mevcut ID-embedding tabanlı yöntemler ya kamu tarafından erişilebilen önceden eğitilmiş modellerle uyumlu değil, ya da birçok parametre boyunca aşırı bir fine-tuning süreci gerektiriyor, ya da yüksek yüz doğruluğunu koruyamıyor.

Bu zorlukları gidermek ve görüntü oluşturma yeteneklerini daha da geliştirmek için, bu makalede InstantID adlı bir difüzyon modeli tabanlı görüntü oluşturma çözümü hakkında konuşacağız. InstantID, çeşitli stiller boyunca yalnızca tek bir referans görüntüsü ile görüntü oluşturma ve kişiselleştirme konusunda uzmanlaşmış bir tak ve oynatma modülüdür ve aynı zamanda yüksek doğruluk sağlar. Bu makalenin temel amacı, okuyucularımıza InstantID çerçevesinin teknik altyapısı ve bileşenleri hakkında derinlemesine bir anlayış sağlamak ve modelin mimarisini, eğitim sürecini ve uygulama senaryolarını incelemektir. Şimdi başlayalım.

InstantID: Sıfır Atış Kimlik Koruyucu Görüntü Oluşturma


Metin-görüntü difüzyon modellerinin ortaya çıkışı, görüntü oluşturma teknolojisinde önemli bir ilerleme sağladı. Bu modellerin temel amacı, özelleştirilmiş ve kişiselleştirilmiş görüntü oluşturma ve referans görüntülerini kullanarak tutarlı konu, stil ve karakter ID ile görüntüler oluşturma. Bu çerçevelerin tutarlı görüntüler oluşturma yetenekleri, görüntü animasyonu, AI portre oluşturma, E-Ticaret, sanal ve artırılmış gerçeklik ve daha fazlası gibi çeşitli endüstrilerde potansiyel uygulamalar yarattı.

Ancak, şaşırtıcı yeteneklerine rağmen, bu çerçeveler temel bir zorlukla karşılaşıyor: Özelleştirilmiş görüntüler oluştururken insan konularının narin ayrıntılarını doğru bir şekilde koruyamıyorlar. İnsan yüzü kimlik görevleri için, yüksek bir doğruluk ve ayrıntı standardı gerektirdiği ve genel nesne veya stillerden daha gelişmiş bir anlamsal gereksinim duyduğu not edilmelidir. Mevcut metin-görüntü modelleri, ayrıntılı metinsel açıklamalara dayanır ve özelleştirilmiş görüntü oluşturma için güçlü anlamsal ilgili đạtma konusunda zorluklar yaşar. Ayrıca, bazı büyük önceden eğitilmiş metin-görüntü çerçeveleri, kontrollüğü artırmak için uzaysal kontrol ekler, ancak bu eklemeler ve geliştirmelere rağmen, bu çerçeveler yalnızca kısmi bir doğruluk sağlar.

Bu engelleri aşmak için, InstantID çerçevesi anında kimlik koruyucu görüntü sentezi üzerinde odaklanıyor ve verimlilik ile yüksek doğruluk arasındaki boşluğu kapatmaya çalışıyor. InstantID, yalnızca tek bir yüz görüntüsü kullanarak görüntü kişiselleştirme konusunda uzmanlaşmış basit bir tak ve oynatma modülüdür ve aynı zamanda yüksek doğruluk sağlar. Ayrıca, referans görüntüsünden yüz kimliğini korumak için, InstantID çerçevesi yeni bir yüz kodlayıcı uyguluyor ve görüntü oluşturma sürecini yönlendirmek için metinsel açıklamaları, referans görüntüsünü ve yüz görüntüsünü birleştiriyor.

InstantID çerçevesini diğer metin-görüntü oluşturma çerçevelerinden ayıran üç ayrıntı vardır.

  • Uyumluluk ve Tak ve Oynatma: InstantID çerçevesi, UNet çerçevesinin tüm parametrelerini eğitmek yerine, hafif bir adaptör üzerinde odaklanıyor. Bu nedenle, InstantID çerçevesi önceden eğitilmiş modellerle uyumlu ve tak ve oynatma yeteneğine sahiptir.
  • Ayarlama Gerektirmez: InstantID çerçevesinin metodolojisi, yalnızca tek bir ileri propagasyon için ihtiyaç duyduğu için fine-tuning gereksinimini ortadan kaldırıyor ve modeli pratik ve ekonomik hale getiriyor.
  • Üstün Performans: InstantID çerçevesi, yalnızca tek bir referans görüntüsü kullanarak devlet-sanat performansını gösteriyor ve bu, çoklu referans görüntülerine dayanan eğitim tabanlı yöntemlerle karşılaştırılabilir.

Genel olarak, InstantID çerçevesinin katkıları aşağıdaki noktalarla özetlenebilir.

  1. InstantID çerçevesi, önceden eğitilmiş metin-görüntü difüzyon modelleri için yenilikçi bir ID-koruyucu uyarlama yöntemidir ve verimlilik ile doğruluk arasındaki boşluğu kapatmayı amaçlar.
  2. InstantID çerçevesi, aynı difüzyon modelini kullanarak önceden eğitilmiş modellerle uyumlu ve tak ve oynatma yeteneğine sahiptir ve önceden eğitilmiş modellerde ID koruması sağlar.

InstantID: Metodoloji ve Mimarisi

Önceden bahsedildiği gibi, InstantID çerçevesi, önceden eğitilmiş metin-görüntü difüzyon modellerine ID koruma yetenekleri kazandıran hafif ve verimli bir adaptördür.

Mimari hakkında konuşacak olursak, InstantID çerçevesi Stable Diffusion modeli üzerine inşa edilmiştir ve bu model, düşük boyutlu latent uzayda difüzyon işlemini gerçekleştirmek için nổi tiếng bir modeldir. Giriş görüntüsü için, kodlayıcı ilk olarak görüntüyü latent bir temsil ile eşler ve ardından difüzyon işlemi, gürültülü latent gürültüsünü temizlemek için bir denoising UNet bileşeni kullanır. Koşul, önceden eğitilmiş bir CLIP metin kodlayıcı bileşeni tarafından oluşturulan metinsel açıklamaların bir gömmeidir.

Ayrıca, InstantID çerçevesi bir ControlNet bileşeni kullanır ve bu bileşen, önceden eğitilmiş bir difüzyon modeline uzaysal kontrol eklemeye olanak tanır. ControlNet bileşeni, Stable Diffusion çerçevesinden UNet mimarisini entegre eder ve bu, orta bloklarda ve kodlayıcı bloklarda sıfır convolution katmanına sahiptir. ControlNet bileşeni, uzaysal kontrol bilgilerini kodlar ve bunları orijinal ağa entegre eder.

InstantID çerçevesi ayrıca IP-Adapter veya Görüntü Açıklama Adaptörü’nden esinlenmiştir ve bu, metinsel açıklamalarla paralel olarak çalışan bir görüntü açıklama yeteneği sunar. IP-Adapter bileşeni, görüntü özelliklerini gömmek için ekstra çapraz dikkat katmanları kullanır ve diğer parametreleri değiştirmez.

Metodoloji

Kısa bir bakış için, InstantID çerçevesi, yalnızca tek bir referans ID görüntüsü kullanarak farklı stiller veya pozlar ile özelleştirilmiş görüntüler oluşturmayı amaçlar ve yüksek doğruluk sağlar. Aşağıdaki şekil, InstantID çerçevesinin bir özeti sunar.

Görüldüğü gibi, InstantID çerçevesi üç temel bileşenden oluşur:

  1. Bir ID gömme bileşeni, görüntü中的 yüz özelliklerinin güçlü anlamsal bilgilerini yakalar.
  2. Görüntüleri gömmek için bir hafif adaptör ve bir ayrık çapraz dikkat bileşeni.
  3. Referans görüntüsünden ayrıntılı özellikleri kodlayan bir IdentityNet bileşeni.

ID Gömme

Mevcut yöntemlerin çoğunun aksine, InstantID çerçevesi, ID koruma görevi için güçlü anlamsal bilgiler ve yüksek doğruluk gerektirir. CLIP görüntü kodlayıcı, zayıf olarak hizalanmış verilerle eğitildiği için, kodladığı özellikler genellikle geniş ve belirsiz anlamsal bilgilerdir. InstantID çerçevesi, yüz tanıma görevlerinde yüz temsilinin verimliliğini kullanarak, önceden eğitilmiş bir yüz modelini referans görüntüsünden yüz ID gömmelerini çıkarmak için kullanır.

Görüntü Adaptörü

Önceden eğitilmiş metin-görüntü difüzyon modellerinin görüntü açıklama görevlerinde yetenekleri, metinsel açıklamaları tam olarak tanımlayamayan senaryolarda önemli bir şekilde artar. InstantID çerçevesi, IP-Adapter modelinin kullandığı stratejiye benzer bir strateji kullanır ve görüntü girişini desteklemek için bir hafif adaptör ve bir ayrık çapraz dikkat bileşeni kullanır. Ancak, InstantID çerçevesi, ID gömmelerini görüntü açıklamaları olarak kullanır ve bu, daha zengin anlamsal bir entegrasyon sağlar.

IdentityNet

Mevcut yöntemler, görüntü açıklamalarını metinsel açıklamalarla entegre edebilir, ancak InstantID çerçevesi, bu entegrasyonun ID-koruyucu görüntü oluşturma için yeterli olmadığını savunur. InstantID çerçevesi, ControlNet adlı bir alternatif özellik gömme yöntemini kullanır ve bu, uzaysal bilgileri girdi olarak kullanır ve UNet ayarlarını korur.

InstantID çerçevesi, geleneksel ControlNet mimarisinde iki değişiklik yapar: Koşul girişleri için, InstantID çerçevesi 5 yüz anahtar noktasını kullanır ve ID gömmelerini koşullar olarak kullanır.

Eğitim ve Çıkarım

Eğitim aşamasında, InstantID çerçevesi IdentityNet ve Görüntü Adaptörü parametrelerini optimize eder ve önceden eğitilmiş difüzyon modelinin parametrelerini dondurur. Tüm InstantID pipeline, insan konularını içeren görüntü-metin çiftleri üzerinde eğitilir ve Stable Diffusion çerçevesinde kullanılan görev özel görüntü koşulları ile benzer bir eğitim hedefi kullanır. InstantID eğitim yönteminin vurguladığı nokta, görüntü ve metin çapraz dikkat katmanları arasındaki ayrılıktır ve bu, InstantID çerçevesinin görüntü koşullarının ağırlıklarını esnek ve bağımsız bir şekilde ayarlamasını sağlar.

InstantID: Deneyler ve Sonuçlar

InstantID çerçevesi, Stable Diffusion modelini LAION-Face veri seti üzerinde eğitir ve bu veri seti, 50 milyondan fazla görüntü-metin çiftini içerir. InstantID çerçevesi ayrıca, BLIP2 modeli tarafından otomatik olarak oluşturulan 10 milyondan fazla insan görüntüsünü toplar ve bu, görüntü oluşturma kalitesini artırır. InstantID çerçevesi, tek kişilik görüntülere odaklanır ve önceden eğitilmiş bir yüz modeli kullanır.

Sadece Görüntü Oluşturma

InstantID modeli, boş bir açıklama kullanarak yalnızca referans görüntüsünü kullanarak görüntü oluşturma işlemini yönlendirir ve sonuçlar aşağıdaki görüntüde gösterilir.

Boş açıklama ile oluşturulan görüntüler, InstantID çerçevesinin zengin anlamsal yüz özelliklerini koruyabildiğini gösterir. Ancak, boş açıklamalar diğer anlamsal bilgiler için aynı sonucu veremeyebilir. Ayrıca, InstantID modeli, önceden eğitilmiş uzaysal kontrol modelleri ile uyumlu çalışır.

Referans görüntüleri sayısı, oluşturulan görüntünün kalitesi üzerinde önemli bir etkiye sahiptir. InstantID çerçevesi, tek bir referans görüntüsü ile iyi sonuçlar verebilir, ancak birden fazla referans görüntüsü daha yüksek kaliteli bir görüntü oluşturur.

InstantID çerçevesi, ID gömme bilgilerini kullanarak yüz özelliklerini koruyabiliyor ve bu, diğer çerçevelerden daha iyi bir performans gösteriyor.

Son Düşünceler

Bu makalede, InstantID adlı bir difüzyon modeli tabanlı görüntü oluşturma çözümü hakkında konuştuk. InstantID, çeşitli stiller boyunca yalnızca tek bir referans görüntüsü ile görüntü oluşturma ve kişiselleştirme konusunda uzmanlaşmış bir tak ve oynatma modülüdür ve aynı zamanda yüksek doğruluk sağlar. InstantID çerçevesi, anında kimlik koruyucu görüntü sentezi üzerinde odaklanıyor ve verimlilik ile yüksek doğruluk arasındaki boşluğu kapatmaya çalışıyor.

Mesleği mühendis, kalbi yazar. Kunal, AI ve ML'ye derin bir sevgi ve anlayışla technical writer, bu alanlardaki karmaşık kavramları etkileyici ve bilgilendirici belgelerle basitleştirmeye adanmış.