Anderson’un Açısı

Neden Kavram Karışıklığı AI Videosunun ‘Sizin Yönteminiz’ Olmasını Engellemektedir

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
AI-generated image (GPT-1.5) depicting a man trying to fit disparate Legos together.

AI video araçları tam kontrol vaat ediyor, ancak gizli ‘kavram karışıklığı’ kimlikleri, ifadeleri ve davranışları bir araya getirerek, şablon hileleri ve aldatmacalarla GenAI sihirinin kolaylığını yıktığı için kullanıcıların şablon hileleri ve numaralar kullanmasını zorunlu kılar.

 

Görüş Son olarak bu konuya beş yıl önce girdiğimden beri, eğitilmiş AI sistemlerinde ‘kavram karışıklığı’ problemi çok daha geniş bir kullanıcı yelpazesine yayıldı, ancak kendi başına daha iyi anlaşılmadı.

O zamanlar, oto-encoder derin sahte sistemleri (yani artık kullanımdan kaldırılmış DeepFaceLab ve daha az pornografik FaceSwap, her ikisi de 2017 Reddit kod yayın‘ından türetilmiştir) insanların oldukça gerçekçi derin sahtelerini oluşturmak için kasabadaki tek oyun بودند.

Bu sistemler, bir kişinin nasıl göründüğüne ilişkin bilgi sağlamak amacıyla geniş yüz eğitim veri setlerine dayanıyordu: A) Bir kişi dinlenmede nasıl görünür (bir kanonik referans gömme) ve B) Bir yüzün yansıtabileceği çeşitli durumlar.

Kimlik tek başına gelmez, yüz ifadeleriyle birlikte gelir. Ayrıca, belirli duygular yalnızca belirli, aşırı açılardan yüz verisi bulunabileceği için, bu açının duygıyla ve tersi ile ilişkili olacağı eğilimindedir.

Kimlik tek başına gelmez, yüz ifadeleriyle birlikte gelir. Ayrıca, belirli duygular yalnızca belirli, aşırı açılardan yüz verisi bulunabileceği için, bu açının duyguyla ve tersi ile ilişkili olacağı eğilimindedir.

Sorun, kanonik kimliğin genellikle nötr olmayan yüz kayıtlarından çıkarılması gerektiği için, yüz verilerinin çoğu bir tür görüntü için önyargılıydı, bu da dağılımı ‘gülümseyen varsayılan’ yönünde kaydırdı.

Diğer bir deyişle, oto-encoder sistemi binlerce görüntüde yüz özelliklerinin normal yüz ifadeleri tarafından bükülmüş olduğu ‘nötr’ bir kimlik kavramını çıkarmaya çalışmak zorundaydı.

Ayrıca, yüzün çekildiği açılardan bağımsız farklı duyguların anlamsal yüz kavramlarını ayırmaya çalışmak zorundaydı. Bu, yalnızca ‘korkmuş’ yüz ifadelerinin profil görüşünden alınmış olması durumunda, eğitilmiş sistem yalnızca bu görüşten optimal olarak o duyguyu yeniden üretebileceği anlamına geliyordu.

İleriye Doğru Bakmak

Dağılma tabanlı yaklaşımlar 2022’den itibaren gen AI görüntü (ve daha sonra video) sahnesini devraldığından beri, üretken sistemler sınırlı yüz verisi sağlandığında doğru yüz ifadelerini çıkarsamada çok daha iyi hale geldi.

Mesela, zorlu bir problem olan inandırıcı profil görüntülerini oluşturma sorunu neredeyse tamamen aşıldı ve ifade verisi etkili bir şekilde kimlikten uzaklaştırıldı.

Çalmak için tıklayın. ‘FlashPortrait’ projesinden, kaynak videolar aracılığıyla avatarları sürdüren çeşitli örnekler. Bu durumda, ‘gerçekçi’ alanın hangi tarafta olduğu önemli değildir, eğer varsa. Kaynak 

Ancak, GenAI’nin paleti genişledikçe ve çıktı daha sofistike hale geldikçe, karışıklık problemi basitçe diğer birçok alana yayıldı ve şu anda bazı khá ucuz ve eski numaralarla ‘düzeltildi’. Bu numaralardan haberiniz yoksa, AI video ve görüntüsünün eski hatalarını ne kadar hızlı aştığını daha olumlu bir şekilde değerlendirebilirsiniz.

Söylü Kediler

Umarım, kimlik ve duygu neden eski 2017 dönemi oto-encoder sistemleri için ayrılmaz olduğunu açıkça ortaya koyuyor. Bunun nedeni, A) Bir tür veri için çok fazla veri olması veya B) Model mimarısının bu nitelikleri ayırmak için yeterli olmaması ve çıkarım zamanında onları birleştirmeye eğilimli olmasıydı, trừ ki kullanıcı, dengeli bir veri seti sağlamak için olağanüstü bir özen gösterdi.

Mesela, Wan2.+ sisteminde birçok kullanıcı, oluşturulan karakterlerin sürekli konuşmasını durdurmanın çok zor olduğunu ve genellikle de kameraya bakmalarını durdurmanın zor olduğunu keşfetti.

Kameraya bakma sorunu (dördüncü duvarı kırma), video sentez sistemlerinin ortaya çıkmasından önce, LAION gibi web kazılmış veri setlerindeki ‘kameraya bakan’ fotoğrafların yaygınlığı nedeniyle çeşitli görüntü yalnızca difüzyon sistemlerinde ortaya çıktı.

‘Söylü’ karakterler sorunu, YouTube’daki ‘etki alanı’ videolarının kolayca bulunabilir olmasından kaynaklanmaktadır. Bunlar, binlerce saatlik lenslere doğru konuşma sunar ve genellikle veri setlerine dönüştürülür.

Ancak, orijinal veya sonraki küratörler, bu tür videoların sayısını sınırlamaya ve diğer türlerdeki görüntüleri dengelemeye özen göstermezse, bir video modelinde ciddi bir önyargı gelişir.

Wan’ın ‘söylü’ sorunuyla karşı karşıya kalan Reddit kullanıcısı u/Several-Estimate-681, Wan 2.1 Infinite Talk V2V sistemindeki bir ayarı kullanarak bir çözüm buldu.

Çalmak için tıklayın: Sadece dinleyin – Wan2.+ ‘de karakter dikkatini elde etmek için bir çözüm. Kaynak 

Açıkçası, bu tür hileler düşük seviyeli mimari çözümlerini temsil etmez ve, gerçek çözümler bulunup uygulanmadıkça, bu ‘kavram karışıklığı’ oyununun sıfırdan başlaması muhtemeldir.

Ucuz ve Dayanıksız

Dağılma mimarisinde itself, bu sorunları kaçınılmaz kılmak için hiçbir şey yoktur; aslında, gerçekten etkili bir şekilde büyük ölçekli veri setlerine uygulandığı takdirde, bu tür bir curation, triage ve yüksek kaliteli kaptiyonlama ve açıklama ile bu sorunların çoğu muhtemelen ortadan kalkardı.

Ancak, bu düzeyde bir dikkatin lojistiği, kapsamı, gerekli kaynakları ve uzun vadeli çabayı düşünün; bu, Manhattan Projesi ile aynı düzeyde olurdu.

Bu nedenle, en ucuz yaklaşımlar tercih edilmeye devam etmektedir. ‘Cimrilik’ örneklerinden biri de veri artırımıdır.

Veri artırımı genellikle veri setlerindeki kaynak videolarının yönünü tersine çevirebildiği için, AI modeli bazen ‘imkansız’ hareketler öğrenebilir.Kaynak

Ancak, toplamda, kayaların yukarı doğru yuvarlanması ve insanların ‘etki alanını’ açması gibi durumlar, üretken sistemlerin, bu tür sürekli hatalar ve Achilles topuklarına rağmen, etkileyici sonuçlar üretebildiği ve yeterli şekilde şaşırtıcı başlıklar üretebildiği için, genellikle üretken sistemlerdeki yan hasar olarak görülür.

Kaynar Çözümler

Şu anda, neredeyse hepsi yeni bir dizi yasaya ve GenAI’ye karşı geri tepmelere aykırı olan yüzlerce üretken video alanı, bu tür ticari hizmetleri sunmadan önce keyiflerini çıkarmaktadır.

Bunların arasında daha büyük ve daha iyi bilinen siteler, genellikle bazı türlerdeki self-sansür uygulamaya eğilimlidir veya eleştirilere yanıt olarak platformlarının kullanıcılar için hangi tür içerikleri kolaylaştırdığını değiştirirler.

Ancak, bu büyük isimlerin arkasında, talebi karşılamak için her zaman yeni ve genellikle daha aşırı içerik sunan yüzlerce diğer fly-by-night operasyon bulunmaktadır.

Bu tür düşük çaba sunumu, foundation modellerini sıfırdan eğitmenin çok yüksek maliyetini ve çabanı dışlar.

Bu nedenle, bu siteler ‘şablonlar’ sunar, bunlar uygulamada özel eğitilmiş LoRAs ile aynı şekilde davranır.

LoRA, kullanıcı ve foundation modeli arasında ara bir parça olarak kullanılır ve sonuçlar, LoRA’nın eğitildiği konuya özgüdür.

LoRA’nın etkisi, modelin genel performansını zayıflatır ve yalnızca LoRA’nın kendi konusunu iyi yeniden üretebilir, ancak bu materyali her türlü talebe sokabilir.

Araştırmalar, benzer ilkeleri gösteren bazı örnekler sunmuştur. Örneğin, EffectMaker projesi, bir kullanıcı tarafından sağlanan görüntüye belirli bir eylem uygulanmasını gösterir.

Çalmak için tıklayın. EffectMaker’da, ince ayarlı özel efektler kullanıcı girişine uygulanabilir. Kaynak 

Kullanıcılar, genellikle iyi bir sonuç elde etmek için birden fazla girişimde bulunmaları gerektiğini ve bu nedenle, sağlayıcıların cimriliğinden veya hileli uygulamalarından çok, DiT GenAI çerçevelerinin ‘vur-kaç’ doğasının hatası olduğunu düşünmektedirler.

Genel halk, GenAI’nin yetenekleri hakkında, genellikle casual, acemi bir kullanıcı tarafından elde edilebilecek şeyin temsilcisi olmayan, cherry-picked örneklerden etkilenmektedir.

Sonuç

Literatür, ilk olarak 2020’de Max Planck/Google işbirliğinde ortaya çıkan ‘kavram karışıklığı’ problemine devam etmektedir.

Bu problem, AyrıştırmaVia Contrast (DisCo) gibi çeşitli araştırmalarla çözülmeye çalışılmaktadır.

2024’ten bir Çin çalışması, kavram karışıklığına bir çözüm bulunmasının, getirdiği sorunları çözmek için gerekli olmayabileceğini öne sürmektedir.

Tarihsel olarak, bu doğru görünüyor, çünkü birçok çözülmesi zor bilgisayar görme problemi, çözülmedi, ancak tamamen yeni teknikler ve yaklaşımlarla aşıldı.

Bu nedenle, kavram karışıklığına bir çözüm bulunana kadar, GenAI’nin eksikliklerine ve sınırlamalarına karşı ‘hızlı düzeltmeler’ ve ‘yama’ uygulamaya devam edeceğiz ve foundation modellerinin esnekliği ve ductility’si hakkında halkın abartılı tahminlerine katlanacağız.

 

Pazartesi, 23 Mart 2026’da ilk kez yayınlandı

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai