Anderson’un Açısı

RAG-Artımlı Görüntü Oluşturmanın Geleceği

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
ChatGPT-4o: ‘Decades ago photos were a photochemical process, and typically photographic prints were done in a darkroom, with the wet prints hung from a line like clothes. Show me that environment, with 10 photos drying on a line in darkroom, and a white-coated scientist picking one of them off the line. Bokeh focus, 1792x1024’

Stable Diffusion, Flux ve video modelleri gibi üretken difüzyon modelleri, tek bir eğitim oturumu sırasında sabit bir veri kümesiyle edinilen bilgileri kullanır. Bu eğitimden sonra tanıtılan kavramlar – bilgi kesme noktası olarak adlandırılır – modelde bulunmaz, ancak fine-tuning veya dış uyarlamayla sağlanabilir. Örneğin, bir difüzyon modeli son Apple veya Tesla sürümünü bilmiyorsa, bu ürünleri içeren görüntüler oluşturamayacaktır.

Dil modelleri için, Perplexity, Notebook LM ve ChatGPT-4o gibi sistemlerle karşılaştırıldığında, dış bilgiyi birleştirme yeteneği daha yaygın bir özelliktir. Bu sistemler, Retrieval Augmented Generation (RAG) modeli olarak adlandırılan bir yapıya sahiptir.

RAG işlemleri ChatGPT 4o’nun yanıtlarını daha alakalı hale getirir. Kaynak: https://chatgpt.com/

RAG işlemleri ChatGPT 4o’nun yanıtlarını daha alakalı hale getirir. Kaynak: https://chatgpt.com/

ChatGPT, bu konuda kendi sınırlarını kabul eder:

ChatGPT 4o, yeni bir saat modelinin görselleştirilmesi hakkında iyi bir tahminde bulunmuştur, ancak DALL-E tabanlı bir oluşturma işlemine yeni görüntüler entegre edemez.

ChatGPT 4o, yeni bir saat modelinin görselleştirilmesi hakkında iyi bir tahminde bulunmuştur, ancak DALL-E tabanlı bir oluşturma işlemine yeni görüntüler entegre edemez.

Dışarıdan alınan verilerin oluşturulan bir görüntüye entegrasyonu zorlu bir iştir, çünkü gelen görüntü önce tokenlere ve gömme alanlarına ayrılmalıdır, ardından modelin en yakın eğitimli alan bilgisine eşlenir.

Bu işlem, ControlNet gibi post-eğitim araçları için etkili bir şekilde çalışır, ancak bu tür manipülasyonlar genellikle yüzeyeldir ve oluşturma işlemine derinlemesine entegre olmaz.

Olgun Mantık

Büyük Dil Modellerinde (LLM) de benzer bir sınırlama vardır. Bir LLM, dışarıdan alınan verileri işlerken, bir yetişkinin yaşam boyu bilgi birikimine dayanarak bir konudaki olasılıkları çıkarır.

Ancak, bir kişi yeni bilgileri temel dünya görüşünü oluştururken oluşan ön yargıları ve varsayımları değiştiremez – bir LLM de önceden eğitilmiş yapısına yeni bilgileri sorunsuz bir şekilde entegre edemez.

Bunun yerine, yeni verileri mevcut içselleştirilmiş bilgilerle karşılaştırır ve analiz eder, ancak sentezleme yapamaz.

Gizli Riskler: RAG-Kabiliyetli Görüntü Oluşturma

RAG-stilinde internetten alınan görüntüleri yeni sentezlenen görüntülere sorunsuz bir şekilde entegre etmek teknik olarak mümkün olsaydı, güvenlik ile ilgili sınırlamalar ek bir zorluk oluştururdu.

Çoğu veri kümesi, açık, ırkçı veya şiddet içerikli gibi hassas kategorilerin varlığını en aza indirmek için düzenlenmiştir. Ancak bu süreç mükemmel değildir ve arta kalan ilişkiler devam edebilir. Bu nedenle, DALL·E ve Adobe Firefly gibi sistemler, girişte ve oluşturulan çıktılarda yasaklanan içerik için ikincil filtreleme mekanizmalarına güvenir.

Bu, basit bir NSFW filtresinin, özellikle RAG-tabanlı veri için yeterli olmayacağı anlamına gelir. Böyle bir içerik, modelin önceden tanımlanmış moderasyon parametrelerinin dışında kalabilir ve AI’nin uygun şekilde değerlendiremeyeceği materyalleri tanıtabilir.

RAG için Görüntü Oluşturma

Bu zorluklara ve politik açıdan hassas konulara rağmen, RAG-tabanlı yöntemleri kullanarak yeni verileri görsel oluşturmaya entegre etmeye çalışan birçok proje ortaya çıktı.

ReDi

2023’te yayınlanan Retrieval-based Diffusion (ReDi) projesi, difüzyon modeli çıkarımını hızlandıran bir öğrenme-free çerçeve sunar.

ReDi'de bir veri kümesinden değerler yeni bir oluşturma için ödünç alınabilir. Kaynak: https://arxiv.org/pdf/2302.02285

ReDi’de bir veri kümesinden değerler yeni bir oluşturma için ödünç alınabilir. Kaynak: https://arxiv.org/pdf/2302.02285

ReDi, difüzyon modelinin adım adım bir yol izleyerek bir görüntüyü saf gürültüden oluşturduğu süreci hızlandırır. Bu, hesaplamaları azaltarak difüzyon tabanlı görüntü oluşturmayı hızlandırır ve kaliteyi korur.

RDM

Diğer bir erken RAG-artımlı görüntü oluşturma girişimi, Retrieval-Augmented Diffusion Models (RDM) olarak adlandırılan yarı-parametrik bir yaklaşımı sunar.

RDM'de dış veri tabanından alınan en yakın komşular.

RDM’de dış veri tabanından alınan en yakın komşular.

RDM, oluşturma işlemini yönlendirmek için dış bir görüntü veritabanından benzer görüntüleri alır. Bu, modelin gerçek dünya görsel örneklerine dayanarak çıktı oluşturmasını sağlar.

ReMoDiffuse

ReMoDiffuse, 3B insan hareketi oluşturma için tasarlanmış bir RAG-artımlı hareket difüzyon modelidir.

ReMoDiffuse, önceki yöntemlerle karşılaştırıldığında. Kaynak: https://arxiv.org/pdf/2304.01116

ReMoDiffuse, önceki yöntemlerle karşılaştırıldığında. Kaynak: https://arxiv.org/pdf/2304.01116

ReMoDiffuse, büyük bir hareket veri kümesinden ilgili hareket örneklerini alır ve bunları gürültü azaltma işlemine entegre eder. Bu, daha doğal ve çeşitli hareket dizileri oluşturulmasını sağlar.

RA-CM3

Stanford’un 2023 çalışması, Retrieval-Augmented Multimodal Language Modeling (RA-CM3) modelini sunar.

Stanford’un RA-CM3 modeli, internetten alınan görüntüleri oluşturma işlemine entegre eder. Kaynak: https://cs.stanford.edu/~myasu/files/RACM3_slides.pdf

Stanford’un RA-CM3 modeli, internetten alınan görüntüleri oluşturma işlemine entegre eder. Kaynak: https://cs.stanford.edu/~myasu/files/RACM3_slides.pdf

RA-CM3, metin ve görüntü verilerini entegre eder ve oluşturma işlemini güçlendirir. CLIP ve Transformer gibi teknikleri kullanarak, model ilgili multimodal belgeleri referans alır ve çıktı oluşturur.

RealRAG

RealRAG, Retrieval-Augmented Realistic Image Generation olarak adlandırılan bir modeldir.

RealRAG, dış görüntüleri oluşturma işlemine entegre eder. Kaynak: https://arxiv.org/pdf/2502.00848

RealRAG, dış görüntüleri oluşturma işlemine entegre eder. Kaynak: https://arxiv.org/pdf/2502.00848

RealRAG, ilgili nesnelerin gerçek görüntülerini bir veri tabanından alır ve oluşturma işlemine entegre eder. Model, self-reflective contrastive learning kullanarak, oluşturma işlemine katkıda bulunan görüntüleri seçer.

Sonuç

Bu, RAG-artımlı görüntü oluşturma sistemlerinin temsilci bir özeti sunar. Bazı sistemler, görüntüleri yalnızca görüş 이해 veya veri kümesi oluşturma için kullanır. Örneğin, Internet Explorer.

Diğer bazı RAG-artımlı projeler, yalnızca yayınlanmış araştırmalarla sınırlıdır ve kamu erişimine açık değildir. Örneğin, Re-Imagen, yalnızca yerel bir veri tabanından görüntüleri alabilir.

Baidu, Kasım 2024’te Image-Based Retrieval-Augmented Generation (iRAG) platformunu duyurdu. Ancak, bu platformun ayrıntı düzeyleri sınırlıdır ve yerel bir veri tabanına dayanmaktadır.

RAG-artımlı görüntü oluşturma, internet kaynaklı veya kullanıcı tarafından yüklenen görüntüleri doğrudan oluşturma işlemine entegre edebilen sistemlere odaklanacaktır. Ancak, bu, teknik ve güvenlik açısından önemli bir zorluktur.

Ancak, bu zorluklar nedeniyle, RAG-artımlı görüntü oluşturma, özellikle API-tabanlı web hizmetleri ve ticari dağıtımlar için, güvenlik, yasal ve telif hakkı kısıtlamaları nedeniyle zor bir özelliktir.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: [email protected]