Anderson’un Açısı
Hunyuan Video Derin Sahteciliklerinin Yükselişi

Burada tartışılan bazı materyallerin doğası nedeniyle, bu makale genellikle olduğundan daha az referans bağlantısı ve resim içerecektir.
Şu anda yapay zeka sentez topluluğu içinde dikkat çekici bir şey oluyor, ancak önemi anlaşılmasının bir süre alması muhtemeldir. Hobiler, video tabanlı LoRAs kullanarak, insanların benzerliklerini yeniden üretmek için generatif AI video modellerini eğitmekteler. Bu, Tencent’in yakın zamanda açık kaynak olarak yayınladığı Hunyuan Video çerçevesi üzerinde gerçekleşiyor.*
Oynatmak için tıklayın. Civit topluluğunda serbestçe kullanılabilen Hunyuan tabanlı LoRA özelleştirmelerinden çeşitli sonuçlar. Düşük sıralı uyarlamalı modelleri (LoRAs) eğitmek, son iki yıldır AI video oluşturma tarafından etkilenen zamanla tutarlılık sorunlarını önemli ölçüde azaltıyor. Kaynaklar: civit.ai
Yukarıdaki videoda, Natalie Portman, Christina Hendricks ve Scarlett Johansson gibi aktrislerin yanı sıra teknoloji lideri Elon Musk’un benzerlikleri, Hunyuan generatif video sisteminin oldukça küçük eklenti dosyalarına eğitildi. Bu dosyalar, içerik filtreleri (örneğin NSFW filtreleri) olmadan bir kullanıcının bilgisayarına kurulabilir.
Yukarıdaki Christina Hendricks LoRA’nın yaratıcısı, modeli geliştirmek için Mad Men TV şovu中的 yalnızca 16 resme ihtiyaç duyduğunu belirtiyor (bu, yalnızca 307mb indirme boyutunda). Reddit ve Discord’daki Stable Diffusion topluluğundan gelen çok sayıda gönderi, bu tür LoRAs’ın genellikle büyük miktarda eğitim verisi veya uzun eğitim süreleri gerektirmediğini onaylıyor.
Oynatmak için tıklayın. Arnold Schwarzenegger, Civit’te indirilebilen bir Hunyuan video LoRA’sında canlandırılıyor. Daha fazla Arnie örneği için https://www.youtube.com/watch?v=1D7B9g9rY68 adresini ziyaret edin, AI sever Bob Doyle’dan.
Hunyuan LoRAs, statik görüntüler veya videolardan eğitilebilir, ancak videoyu eğitme daha fazla donanım kaynağı ve artan eğitim süresi gerektirir.
Hunyuan Video modeli, 13 milyar parametre ile geliyor ve Sora’nın 12 milyar parametresini aşarak, 2024 yazında açık kaynak olarak yayınlanan daha az yetenekli Hunyuan-DiT modelini de geride bırakıyor. Sonuncusu sadece 1.5 milyar parametreye sahip.
İki buçuk yıl önce Stable Diffusion ve LoRA ile olduğu gibi (Stable Diffusion 1.5’ın ‘yerli’ ünlülerinin örnekleri burada bulunabilir), ilgili temel model, ünlü kişiliklerin düzeyinde, ‘ID-enjekte’ LoRA uygulamaları yoluyla elde edilebilecek Sadakat düzeyine kıyasla çok daha sınırlı bir anlayışa sahiptir.
Esasen, bir kişilik odaklı, özelleştirilmiş LoRA, temel Hunyuan modelinin önemli sentez yeteneklerinden ‘ücretsiz bir yolculuk’ alır ve insan sentezinde, 2017-era oto-encoder derin sahtecilik veya statik görüntülere LivePortrait gibi sistemler aracılığıyla hareket eklemeye çalışmaktan daha etkili bir sonuç sunar.
Tüm burada gösterilen LoRAs, Civit topluluğundan ücretsiz olarak indirilebilirken, daha eski, özel olarak üretilen ‘statik-görüntü’ LoRAs da Hunyuan video oluşturma işleminin ‘tohum’ görüntüleri olarak (yani, görüntü-videya, Hunyuan Video için beklenen bir yayın, ancak çalışmalar mevcut) kullanılabilir.
Oynatmak için tıklayın. Yukarıda, bir ‘statik’ Flux LoRA’dan örnekler; aşağıda, Civit topluluğunda bulunan müzisyen Taylor Swift’i gösteren bir Hunyuan video LoRA’sından örnekler. Her iki LoRA da Civit topluluğunda ücretsiz olarak kullanılabilir.
Yazarken, Civit web sitesi ‘Hunyuan’ araması için 128 sonuç sunuyor. Bunların neredeyse tümü某 şekilde NSFW modelleri; 22’si ünlüleri tasvir ediyor; 18’i hardcore pornografi oluşturmayı kolaylaştırmak için tasarlandı ve yalnızca yedisi erkekleri değil, kadınları betimliyor.
Yeni Nedir?
Derin sahtecilik teriminin evrimleşen doğası ve sınırlı kamu anlayışı nedeniyle, Hunyuan LoRA’nın önemi, AI sentez topluluğunu casual olarak takip eden bir kişi için kolayca anlaşılabilir değildir. Bazı ana farklılıkları gözden geçirelim. Hunyuan LoRAs ve önceki kimlik tabanlı AI video oluşturma yaklaşımları arasındaki.
1: Engelsiz Yerel Kurulum
Hunyuan Video’nun en önemli yönü, yerel olarak indirilebilmesi ve çok güçlü ve sansürsüz bir AI video oluşturma sistemini hem casual kullanıcıların hem de VFX topluluğunun (coğrafi bölgeler arasında izin verilen lisanslara bağlı olarak) eline koymasıdır.
Sonuncusu 2022 yazında Stability.ai’nin Stable Diffusion modelinin açık kaynak olarak yayınlanmasıyla oldu. O zaman, OpenAI’nin DALL-E2 kamu hayal gücünü ele geçirmişti, ancak DALLE-2 bir ücretli hizmetti ve önemli kısıtlamaları vardı (zamanda büyüdü).
Stable Diffusion kullanılabilir olduğunda ve Düşük Sıralı Uyarlamayla birlikte herhangi bir kişinin kimliğini (ünlü veya değil) üretme olanağı sunulduğunda, büyük geliştirici ve tüketici ilgisi, Stable Diffusion’u DALLE-2’nin popülerliğini aşmasına yardımcı oldu; ikincisi daha yetenekli bir sistemdi, ancak sansür rutinleri kullanıcıları tarafından ağır olarak görülüyordu ve özelleştirme mümkün değildi.
Muhtemelen aynı senaryo şimdi Sora ve Hunyuan arasında geçerli – veya daha doğru bir şekilde, Sora-düzeyinde özel generatif video sistemleri ile açık kaynaklı rakipler arasında, ki bunlardan ilki Hunyuan’dır, ancak muhtemelen sonuncusu değildir (burada, Flux sonunda Stable Diffusion’a önemli bir ivme kazandı).
Kullanıcılar Hunyuan LoRA çıktısı oluşturmak ister, ancak etkili bir şekilde güçlü ekipmana sahip değillerse, her zaman RunPod gibi online hesaplama hizmetlerine GPU tarafını devredebilirler. Bu, Kaiber veya Kling gibi platformlarda AI videoları oluşturmakla aynı değildir, çünkü yerel bir iş akışını desteklemek için bir online GPU kiralamak, semantic veya görüntü tabanlı filtreleme (sansür) içermez.
2: ‘Konak’ Videolara ve Yüksek Çaba Gereksinimine İhtiyaç Yok
Derin sahtecilik 2017 yılı sonunda sahneye çıktığında, anonim olarak paylaşılan kod, DeepFaceLab ve FaceSwap (ve DeepFaceLive gerçek zamanlı derin sahtecilik sistemi) ana akım dallarına dönüşmüştü.
Bu yöntem, her kimliğin yüz görüntülerinin dikkatli bir şekilde küratörlüğünü gerektiriyordu; bu aşamada yapılan çaba ne kadar azsa, model o kadar etkisiz oluyordu. Ayrıca, eğitim süreleri mevcut donanım bağlı olarak 2-14 gün arasında değişiyordu ve uzun vadede yetenekli sistemleri bile strese sokuyordu.
Model nihayet hazır olduğunda, yalnızca mevcut bir videoya yüzleri yerleştirebiliyordu ve genellikle süperpoze edilen kimliğe benzer bir ‘hedef’ (yani, gerçek) kimliğe ihtiyaç duyuyordu.
Daha yakın zamanda, ROOP, LivePortrait ve benzeri birçok çerçeve, daha az çabayla ve genellikle daha iyi sonuçlarla benzer işlevselliği sağladı – ancak tam vücut derin sahtecilikleri oluşturma veya yüzlerin dışında herhangi bir unsur oluşturma yeteneğinden yoksundular.

Bob Doyle’un YouTube’daki içerik akışından ROOP Unleashed ve LivePortrait (alt sol köşede) örnekleri. Kaynaklar: https://www.youtube.com/watch?v=i39xeYPBAAM ve https://www.youtube.com/watch?v=QGatEItg2Ns
Hunyuan LoRAs (ve muhtemelen takip edecek benzer sistemler) ise, kullanıcı tarafından eğitilen LoRA kimliğinin tüm dünyalarının, tam vücut simülasyonunun özgürce oluşturulmasına izin veriyor.
3: Büyük Ölçüde İyileştirilmiş Zamanlı Tutarlılık
Zamanlı tutarlılık, difüzyon videosu için yıllardır Kutsal Kase oldu. Bir LoRA ve uygun.prompt’lar kullanarak, Hunyuan video oluşturma, sürekli bir kimlik referansına bağlı kalıyor. Teoride (erken günler), belirli giysiler giyen belirli bir kimliğin birden fazla LoRAs’ı eğitilebilir.
Bu koşullar altında, giysi de video oluşturma sırasında ‘mutasyona’ uğrama olasılığı daha düşük (çünkü generatif sistem, bir sonraki kareyi, önceki karelerin çok sınırlı bir penceresine dayandırıyor).
(Alternatif olarak, görüntü tabanlı LoRA sistemlerinde olduğu gibi, bir video oluşturmasına birden fazla LoRA uygulanabilir, örneğin kimlik + kostüm LoRAs)
4: ‘İnsan Deneyine’ Erişim
Son olarak, daha önce gözlemlediğim gibi, özel ve FAANG düzeyindeki generatif AI sektörü, projelerinin insan sentez yeteneklerine ilişkin olası eleştirilere karşı o kadar temkinli görünüyor ki, gerçek insanlar artık büyük açıklamalar ve yayınlar için projelerin sayfalarında nadiren görünüyor. Bunun yerine, ilgili literatür, sentezlenen sonuçlarda ‘sevimli’ ve ‘tehdit içermeyen’ konuları göstermeye increasingly eğilimlidir.
Hunyuan LoRAs’ın ortaya çıkışı ile birlikte, topluluk, LDM tabanlı insan video sentezini, yetenekli (marjinal değil) bir sistemde sınırları zorlama ve çoğumuzun ilgisini çeken konuyu – insanları – tam olarak keşfetme fırsatına sahip oluyor.
İmplications
Hunyuan LoRAs’ın ortaya çıkmasının temel sonucu, bunların gerçek insanların (ünlüler ve bilinmeyenler de dahil) AI pornografik (veya başka şekilde iftira niteliğinde) videolarını oluşturmak için kullanılacağıdır.
İzin amaçları için, Hunyuan LoRAs oluşturan ve çeşitli Discord sunucularında deneyen hobi severler, gerçek insanların örneklerini paylaşmaktan kaçınıyorlar. Gerçeklik, görüntü tabanlı derin sahteciliklerin artık ciddi şekilde silahlandırıldığı ve gerçek videoların eklenmesinin, son yedi yıldır medyada tekrar eden korkuları haklı çıkarabileceği gerçeğidir.
İtici Güç
Her zaman olduğu gibi, porn teknolojinin itici gücü kalıyor. Bu kullanım hakkındaki görüşümüz ne olursa olsun, bu ısrarlı ilerleme motoru, sonunda daha ana akım benimsemeye fayda sağlayabilecek teknolojideki ilerlemeleri sürdüyor.
Bu durumda, fiyat, AI video oluşturmanın açık kaynaklı olmasının, suç, siyasi ve etik suistimal için açık sonuçları nedeniyle, alışılmışın ötesinde olabilir.
Bir Reddit grubu (burada adını vermeyeceğim), AI tarafından oluşturulan NSFW video içeriğine adanmış ve Hunyuan tabanlı video pornografisi oluşturma için ComfyUI iş akışlarını geliştiren, açık bir Discord sunucusuna sahip. Kullanıcılar günlük olarak NSFW kliplerinden örnekler paylaşıyor – birçokları makul bir şekilde ‘aşırı’ veya en azından forum kurallarındaki kısıtlamaları germeye eğilimlidir.
Bu topluluk ayrıca, yeni modeller için eğitim verisi sağlamak üzere pornografik videoları indirmek ve işlemek için araçlar sunan önemli bir GitHub deposuna sahip.
En popüler LoRA eğitmeni Kohya-ss, şimdi Hunyuan LoRA eğitimini destekliyor, sınırsız generatif video eğitimi için giriş engelleri günlük olarak düşüyor, donanım gereksinimleri de Hunyuan eğitimi ve video oluşturma için düşüyor.
Porno tabanlı AI için (kimlik tabanlı modellerin aksine, örneğin ünlüler) adanmış eğitim şemalarının kritik yönü, bir standart temel modelin Hunyuan gibi NSFW çıktısı üzerinde özel olarak eğitilmediği ve bu nedenle NSFW içeriği oluşturma istendiğinde kötü performans gösterebileceği veya öğrenilen kavramları ve ilişkileri inandırıcı bir şekilde ayıramayacağıdır.
Hunyuan LoRAs ve benzer sistemlerin ortaya çıkmasıyla birlikte, ilk kez, AI video sentezinin sınırlarını, yetenekli bir sistemde, tam olarak keşfetme fırsatı doğuyor – insan sentezinin en çok ilgilendiği konu.
VFX
Hunyuan Video LoRAs’ın sunduğu büyük zamanlı tutarlılık artışı, AI görsel efekt endüstrisi için açık bir avantajdır. Bu endüstri, açık kaynaklı yazılımları uyarlamaya çok fazla güveniyor.
Hunyuan Video LoRA yaklaşımı, tüm bir kare ve ortamı oluştururken, VFX şirketleri, bu yöntemle elde edilebilecek zamanla tutarlı insan yüzlerini izole etmeye ve bunları gerçek dünya kaynak videolarına süperpoze etmeye veya entegre etmeye başlamıştır.
Hobi topluluğu gibi, VFX şirketleri de Hunyuan Video’nun görüntü-videya ve video-videya işlevselliğinin yayınlanmasını beklemek zorundalar; ya daElse, Hunyuan Video’nun outer yeteneklerini ve olası uyarlamalarını, hatta şirket içi çatallarını keşfetmek için ara verip, köprü olarak kullanabilirler.
Hunyuan Video’nun lisans koşulları teknik olarak gerçek kişilerin betimlenmesine izin veriyor, ancak AB, Birleşik Krallık ve Güney Kore’de kullanımını yasaklıyor. ‘Las Vegas’ta kalır’ ilkesine göre, bu, Hunyuan Video’nun bu bölgelerde kullanılmayacağı anlamına gelmez; ancak, dış veri denetimlerinin, generatif AI etrafındaki büyüyen düzenlemeleri uygulamak için, böyle bir kullanım riskli olabilir.
Lisans koşullarının başka bir belirsiz alanı:
‘Eğer, Tencent Hunyuan sürümünün yayınlanma tarihinde, tüm ürünlerin veya hizmetlerin aylık aktif kullanıcıları, önceki takvim ayında 100 milyondan fazla aylık aktif kullanıcı ise, size bir lisans istemek zorundasınız, Tencent size kendi takdirine bağlı olarak bunu verebilir ve aksi takdirde bu Anlaşma kapsamında hiçbir hakkı kullanmaya yetkili değilsiniz.’
Bu madde, Hunyuan Video’yu daha teknolojiden uzak bir kullanıcı kitlesine ‘ara’ sunmak üzere olacak şirketlere açıkça yöneliktir ve belirli bir kullanıcı sınırının üzerinde, Tencent’in eyleme dahil edilmesini gerektirir.
Bu geniş ifade, dolaylı kullanımı (yani, popüler filmler ve TV şovlarında Hunyuan tarafından etkinleştirilen görsel efekt çıktısının sağlanması) da kapsayabileceği belirsizdir.
Sonuç
Derin sahtecilik videoları uzun süredir var olduğundan, Hunyuan Video LoRA’nın kimlik sentezi ve derin sahtecilik yaklaşımı olarak öneminin küçümsenmesi kolaydır; ve Civit topluluğu, ilgili Discord ve subreddit’lerde ortaya çıkan gelişmelerin, gerçekten kontrollü insan video sentezine doğru sadece küçük bir adım olduğunu varsaymak kolaydır.
Muhtemelen, mevcut çabalar Hunyuan Video’nun tam vücut ve tam çevre derin sahtecikleri oluşturma potansiyelinin yalnızca bir kısmıdır; görüntü-videya bileşeni yayınlandığında (bu ay olacağı söylentisi var), çok daha granüler bir generatif güç seviyesi, hem hobi hem profesyonel topluluklara sunulacaktır.
Stability.ai 2022’de Stable Diffusion’u yayınladığında, birçok gözlemci, şirketin o zamanlar böyle değerli ve güçlü bir generatif sistemini neden sadece verdiğini anlayamadı. Hunyuan Video ile kar amacı doğrudan lisansa inşa edilmiştir – ancak Tencent’in, bir şirketin kar paylaşım şemasını tetiklediğini belirlemesinin zor olabileceği olasıdır.
Her durumda, sonuç 2022’de olduğu gibi: Hunyuan Video’nun yayınlanması etrafında, hemen ve yoğun bir şekilde, adanmış geliştirme toplulukları oluştu. Bu çabaların, önümüzdeki 12 ay içinde, yeni başlıklara yol açacak yolları kesinlikle vardır.
* Yayınlanma zamanına kadar 136’ya kadar.
İlk olarak 7 Ocak 2025 Salı günü yayınlandı.












