Anderson’un Açısı
Gerçek Fotoğrafları Çekmeden Önce Geliştirmek İçin AI Kullanma

GenAI’yi fotoğrafları çekildikten sonra düzeltmek yerine çekmeden önce nasıl hareket edeceğinizi, poz vereceğinizi ve kareyi nasıl çekeceğinizi söyleyen bir sistem geliştiren araştırmacılar, fotoğrafların akılda kalıcı olmasını sağlayan şeylerin bilgisine dayanarak bir sistem eğitmişlerdir.
Fotoğrafları çekildikten sonra düzeltmek uzun süredir kolaylaşıyor, çünkü üreticiler ve teknoloji platformları artan olarak kamera içi düzenleme sunuyor, böylece kullanıcılar fotoğrafları çektikten hemen sonra değiştirebiliyorlar. Bu tür popüler sistemler arasında Google’ın konuşmalı düzenleme ve Samsung’un yaratıcı düzenleme gibi olanlar bulunuyor.
Ancak, ‘otantiklik’ över ‘AI ile geliştirilmiş’ sonuçlara tercih eden bir eğilim, bu sistemlerin hedeflediği birçok tüketicinin ‘değiştirilmiş’ fotoğrafları ‘AI çamuru’ olarak görmesine neden olabilir.
Belki de bu, Google’ın Gemini’den bilgi alan ve fotoğrafı çekme sürecinde doğrudan talimat verebilen bir AI eğitilmiş ‘kamera koçu’ oluşturmasına ilham verdi:

Google’ın Kamera Koçu, kullanıcıya fotoğrafı yeniden çerçevelendirmesi dahil temel birkaç tavsiyede bulunuyor. Kaynak
Kamera Koçu, bir proprietary sistem olarak ve hakkında online olarak几乎 hiçbir bilgi bulunmamasıyla, Gemini’yi kullanarak kullanıcıların kareyi iyileştirmesine (yukarıdaki resme bakınız) veya duruşta küçük değişiklikler yapmaya (örneğin, birbirlerine daha yakın durmak veya doğrudan kameraya bakmak) yardımcı oluyor gibi görünüyor.
Her şeyden önce, ürün, milyonlarca yüklenen içerik veri noktalarının Gemini’nin eğitim verilerine katkıda bulunacağından, kompozisyonu ortalamaya doğru itiyor, muhtemelen eğitim verilerine dayalı olarak.
Bununla birlikte, kompozisyon açısından ‘ortalamaya çıkarılmış’ fotoğraflar, aynı zamanda ‘hatırlanabilir’ fotoğrafların sahip olduğu estetik değerlere veya izleyici etkisine sahip olmayabilir.
‘Cheese!’ ve Üçte Bir Kuralının Ötesinde
Bu amaçla ve platformlar arası daha erişilebilir bir sistem oluşturmak için, İtalya’dan yeni bir araştırma, önceden ‘fotoğrafların akılda kalıcı olmasını sağlayan şey’ bilgisine dayanan bir Koçu benzeri sistem sunuyor:

Yazarların yeni sisteminin verdiği tavsiyelerin çeşitli örnekleri. Kaynak
Yukarıdaki örneklerde, yazarların yeni sistemi – MemCoach olarak adlandırılan – tarafından verilen tavsiyeleri görüyoruz, bunları bir kompozisyon odaklı AI gibi Kamera Koçu’nun vermesi zor olurdu. İlk (en soldaki) örnekte, başlığın çıkarılması tavsiyesi özellikle önemli; ikinci resimde, genel senaryodan (yani, yerdeki genç bir kadınla ‘sanatsal’ bir fotoğraf) bir kompozisyon odaklı AI’nin ne tür bir bağlamı çekebileceği zor hayal ediliyor.
Fotoğrafçılıkta hatırlanabilirlik hakkında temel anlayış, MemCoach’u geliştirmek için kullanılan, 2015 çalışma Neyin bir nesneyi hatırlanabilir kıldığı? ve 2013 makale Bir fotoğrafın hatırlanabilir olmasını sağlayan nedir? dahil olmak üzere çeşitli önceki çalışmalardan geliyor.

2013 tarihli ‘Bir fotoğrafın hatırlanabilir olmasını sağlayan nedir?’ makalesinden, iyi, orta ve kötü fotoğrafların, hatırlanabilirlik açısından örnekleri. Kaynak
Benim gibi negatif Unix doğum tarihine sahip olanlar, muhtemelen ‘en az hatırlanabilir görüntüler’ şablonunu (yukarıdaki resmin sağ üst köşesinde), çocukluğumuzun lanetlenmiş ‘slayt gecelerinden’ tanıyacaktır. Yazarlar şöyle diyor*:
‘Bu çalışmalar, insanların ve iç mekanların varlığı, duygusal ifadeler gibi nesnelerden ve panoramik görüntülerden ziyade keyfi faktörler olarak, ayrıca bağlam ve gözlemci gibi dış faktörler olarak tanımlanan şeyleri vurguladı.’
Proje, ‘hatırlanabilirlik geri bildirimi’ (MemFeed) üzerine odaklanıyor, bu, MemCoach öğretim uygulamasında ifade ediliyor ve PPR10K veri kümesine dayanan bir referans (MemBench) içeriyor.

PPR10K: İnsan Bölgesi Maske ve Grup Düzeyinde Tutarsızlık ile Büyük Ölçekli Bir Portre Fotoğrafı Düzenleme Veri Kümesi’nden, veri kümesinin çeşitli örnekleri. Üst satır orijinal görüntüleri, alt satır uzman tarafından düzenlenmiş sürümleri ve karşılık gelen insan bölgesi maskelerini gösterir. Orijinal fotoğraflar geniş bir görüş açısına, arka plana, aydınlatmaya ve kamera ayarlarına sahiptir, ancak düzenlenmiş sonuçlar görsel kaliteyi iyileştirir ve her grupta tutarlılığı güçlendirir. Kaynak
Makale, fotoğraflarda hatırlanabilirliğin nicel olarak ölçülebileceğini, subjektif yargılardan ziyade nesnel bir ölçüm olduğunu ve bu özelliğin hem fotoğraflar (çeşitli çalışmalarda) hem de videolar (çeşitli diğer çalışmalarda) için tanımlanabileceğini belirtiyor.
Yeni makale, Unutulmaz Bir Fotoğraf Nasıl Çekiliri? Kullanıcılara Etkili Geri Bildirim Sağlama başlığını taşıyor ve Trento Üniversitesi, Pisa Üniversitesi ve Fondazione Bruno Kessler’den dört araştırmacı tarafından sunuluyor. Proje sayfası, GitHub kodu ve Hugging Face barındırılan verilerin önümüzdeki ay (Mart 2026) içinde kullanılabilir olacağını öneriyor.
Yöntem
Araştırmacılar, PPR10K portre veri kümesinden MemBench veri kümesini oluşturmak için, aynı sahneden alınan fotoğrafları grupladılar ve her görüntüyü CLIP özelliklerine dayalı eğitilmiş bir predictor kullanarak hatırlanabilirlik puanı verdi. Daha sonra her sahneden alınan fotoğrafları, hatırlanabilirlik puanlarına göre azdan çok hatırlanabilirliğe doğru sıraladılar ve bunları uygun şekilde eşleştirdiler:

MemBench oluşturulması ve değerlendirilmesi hakkında genel bakış. Üst satır, görüntüleri sahnelerine göre gruplama, hatırlanabilirlik puanı verme, sıralama ve hatırlanabilirlik odaklı eylem geri bildirimi oluşturma adımlarını gösteren veri işlem hattını gösterir. Alt satır, geri bildirimin kalitesini, düzenleme tabanlı hatırlanabilirlik kazançları ve perplexity puanlaması yoluyla ölçen değerlendirmeyi gösterir.
Her çift için, InternVL3.5 modeli kullanılarak, daha az hatırlanabilir versiyon ile daha hatırlanabilir versiyon arasındaki görünür farkları açıklayan doğal dil açıklamaları oluşturuldu; bu açıklamalar, hatırlanabilirlik geri bildirimi sistemi için eğitim sinyali oluşturacaktı.
Google’ın Kamera Koçu’nun altında yatan mantığa kıyasla, araştırmacılar daha ince bir yorum kümesi aradı†:
‘Hesaplamalı fotoğraf ayarlamalarının, örneğin “görüntüyü daha parlak yapın” gibi, sonrası düzeltmelerine odaklanmak yerine, kullanıcıların gerçekleştirebileceği anlık eylemlere odaklanıyoruz, örneğin “Birbirinize doğru dönün”.’
Nihai MemBench koleksiyonu, yaklaşık 10.000 görüntüden oluşuyor ve 1.570 sahneye gruplandırılmış, her sahne için ortalama 6,5 görüntü bulunuyor. Yazarların oluşturduğu kelime bulutu (aşağıdaki resme bakınız), veri kümesindeki geniş bir semantik kategori yelpazesini gösteriyor:

MemBench’teki en sık kullanılan terimlerin kelime bulutu.
Kaynak fotoğrafların ortalama hatırlanabilirlik puanı 0,63 iken, aynı sahneden alınan en hatırlanabilir fotoğraflar 0,51 ile 1,0 arasında değişiyor ve iki grup arasında belirgin bir örtüşme bulunuyordu:

Her sahneden alınan en az ve en çok hatırlanabilir görüntülerin hatırlanabilirlik puanı dağılımları.
Geri bildirim, kısa yedi kelimelik notlardan, oldukça uzun talimatlara (solda, aşağıdaki resimde) kadar değişiyordu. Her tavsiye, GPT-5 Mini kullanılarak küçük eylem türlerine bölündü:

İçerik kelimeleriyle ölçülen geri bildirim uzunluğu dağılımı ve kategori içi sıklık gösteren akor genişlikleriyle birlikte atomik alt-eylemlerin sınıflandırılması.
Yazarlar, çoğu önerinin konunun pozuna odaklandığını, ardından sahne içeriğinde değişikliklere, çerçevelendirmenin genellikle poza bağlı olduğunu ve aydınlatma ayarlarının genellikle semantik değişikliklerle bağlantılı olduğunu belirtiyorlar.
Flux Kapasatörü
Hatırlanabilirliğin geri bildirimiyle artırıldığını değerlendirmek için, kullanıcı uyumu, FLUX.1 Kontext üretken modeli kullanılarak simüle edildi, bu model fotoğrafçı için bir proxy olarak kullanıldı. Bir kaynak görüntü ve metin geri bildirimi verildiğinde, Flux tarafından önerilen değişiklikleri simüle eden bir düzenlenmiş sürüm oluşturuldu:

Soldaki görüntüler gerçek, veri kümesinden ve her bir durumda sağdaki görüntüler, sarı metin (aşağıda) temelinde Flux tarafından oluşturuldu. Bu şekilde, talimatların etkinliği kapsamlı insan katılımı olmadan değerlendirilebildi. Bu bilgi nihayet MemCoach çerçevesine geri beslenecek ve aslında bu tür bir sistemin (gerçek dünya örnekleriyle değil, Flux örnekleriyle) iteratif olarak iyileştirilebileceği bir iş akışı temsil edecekti.
Hem orijinal hem de düzenlenmiş görüntüler, bir hatırlanabilirlik predictoründen geçirildi, böylece düzenlenmiş sürümün daha yüksek bir puan elde ettiği sıklık ve başlangıç görüntüsüne kıyasla ne kadar kazanç sağladığı ölçülebildi – İyileştirme Oranı ve Göreceli Hatırlanabilirlik olarak adlandırılan ölçümler.
Geri bildirimin, hatırlanabilirlik odaklı referans tavsiyelerine benzerliğini, perplexity hesaplayarak ve 80-20 bölme uygulanarak ölçülendi, böylece testler yalnızca eğitim sırasında kullanılmayan sahnelerde gerçekleştirildi.
Çağın Getirdiği
Mevcut çok modelli büyük dil modellerinin hatırlanabilirlik bilinci test edildi. LaMem veri kümesinden görüntüler, çeşitli önde gelen modellere gösterildi ve görüntülerin hatırlanabilir olup olmadığı soruldu. Modelin güven puanı, orijinal çalışmadaki insan gözlemciler tarafından verilen puanlarla karşılaştırıldı:

Temel çok modelli modellerin hatırlanabilirliği yakalayamadığını gösteren testler. Solda, model tahminleri ile LaMem temel puanları arasındaki Spearman sıralama korelasyonu, referans olarak LaMem’den inter-annotator anlaşmazlığı gösteriliyor. Sağda, düzenleme temel çizgisine kıyasla sıfır çekim geri bildirimiyle elde edilen iyileştirme oranı, yalnızca marjinal kazanımlar gösteriyor.
İnsan yargılarıyla几乎 hiçbir anlamlı korelasyon bulunmadı ve yazarlar, büyük ölçekli ön eğitimlerine rağmen modellerin insanların tutarlı olarak hatırladıklarını izlemediklerini iddia ediyorlar.

LaMem veri kümesinden örnekler. Üst sol, aynı zamanda bir ısı haritası gösteriliyor. Kaynak
MemCoach
MemCoach, çekim düğmesine basılmadan önce gerçekleştirilebilecek anlık, semantik talimatlar üzerine odaklanıyor – örneğin, poz değiştirmek, konular arasındaki etkileşimleri değiştirmek veya sahne öğelerini değiştirmek. MemCoach tarafından verilen geri bildirim, 7-102 içerik kelimesi arasında değişiyor. Makale, hatırlanabilirliğin, basit kompozisyonel ayarlamalardan ziyade konfigürasyon ve anlatı ipuçlarına daha çok bağlı olduğunu öne sürüyor:

MemCoach pipeline’ın genel bakışında, bir öğretmen MLLM’den gelen hatırlanabilirlik odaklı rehberlik, nötr öğrenci yanıtlarıyla birleştiriliyor, katmanlar arası aktivasyon farklılıkları ortalama olarak hesaplanıyor ve bir hatırlanabilirlik yönlendirme vektörü türetiliyor; bu vektör, ekstra eğitim olmadan, öğrenci aktivasyonlarını iyileştirilmiş, hatırlanabilirlik odaklı geri bildirime kaydırmak için çıkarım sırasında enjekte ediliyor.
Testler
Yedi Multimodal Büyük Dil Modeli (MLLM), yeni sistemin test aşamasında kullanıldı: Qwen2.5V.L; InternVL3_5-8B; Idefics3-8B; ve LLaVA-OneVision-1.5. Ayrıca, GPT-5 Mini, kapalı kaynaklı modellerin temsilcisi olarak ve estetikle özel olarak ilgilenen Q-Instruct ve AesExpert modelleri de dahil edildi. MLLM’ler, sıfır çekim ve öğretmen veyaakl olarak çalıştı.
InternVL3.5, hem öğretmen hem de öğrenci modelleri olarak kullanıldı ve MemBench eğitim bölünmesi, karşıt örnekler oluşturmak için kullanıldı:

MemCoach’un, öğretmen orakları, estetikle özel olarak ilgilenen modeller ve sıfır çekim temel çizgileri boyunca state-of-the-art MLLM’lerle karşılaştırıldığı performansını gösteren tablo. Daha yüksek İyileştirme Oranı ve rekabetçi Göreceli Hatırlanabilirlik ile birlikte en düşük perplexity, daha tutarlı ve hatırlanabilirlik odaklı geri bildirimi gösteriyor.
Yukarıdaki tabloda (ilk test için), MemCoach’un, karşılaştırılan modellerden daha etkili hatırlanabilirlik tavsiyeleri sunduğunu görüyoruz – ve yönlendirilmiş InternVL3.5 modeli, daha sık ve daha büyük bir miktarla hatırlanabilirliği artırıyor, GPT-5 Mini’ye kıyasla %5’lik bir İyileştirme Oranı artışı ve yönlendirilmemiş versiyonuna kıyasla %31.81’lik bir Göreceli Hatırlanabilirlik artışı sağlıyor.
Ayrıca, estetik odaklı sistemleri geride bırakıyor, ekstra eğitim gerektirmiyor. Daha düşük perplexity, makaleye göre, geri bildiriminin insan hatırlanabilirlik yargıları tarafından ödüllendirilen aynı dil kalıplarını izlediğini gösteriyor:

Genelleme sonuçları, MemCoach’un, çeşitli multimodal omurgalara boyunca hatırlanabilirlik odaklı geri bildirimi iyileştirdiğini, tutarlı olarak İyileştirme Oranını ve Göreceli Hatırlanabilirliği artırırken, çoğu model için perplexity’yi azalttığını gösteriyor.
Diğer bir test (yukarıdaki tablo), MemCoach’un, her test edilen multimodal omurga boyunca hatırlanabilirlik odaklı geri bildirimi artırdığını, İyileştirme Oranında ve Göreceli Hatırlanabilirlikte tutarlı kazançlar sağlarken, çoğu model için perplexity’yi azalttığını gösteriyor.
Son olarak, MemCoach geri bildiriminin örneklerini analiz eden bir nitel değerlendirme yapıldı, kaynak görüntü, doğal dil önerisi ve hayal edilen iyileştirilmiş sonuç birlikte incelendi:

MemCoach tarafından üretilen hatırlanabilirlik odaklı geri bildirinin nitel örnekleri. Her üçlü, kaynak görüntüyü, doğal dil talimatını ve Göreceli Hatırlanabilirlik (RM) olarak belirtilen ölçülen değişikliği gösterir. Rehberlik, poz ve bakış ayarlamalarından, nesne kaldırma gibi semantik müdahalelere kadar değişiyor, hem başarılı kazançlar hem de alışılmadık öğelerin kaldırılmasının hatırlanabilirliği azaltabileceği durumları gösteriyor.
Bu sonuçlardan, yazarlar şöyle diyor:
‘Örnekler, modelin önerdiği önerilerin çeşitliliğini vurguluyor, bunlar, ince kompozisyonel ayarlamalardan, poz, bakış yönü veya el pozisyonu değişikliklerine, nesne kaldırma veya yüz ifadesi değişikliği gibi semantik müdahalelere kadar değişiyor. Geri bildirim, doğal olarak yorumlanabilir ve eyleme geçirilebilir, genellikle fiiller (“Yaklaş”, “Dur”, “Kaldır”) içeren kısa metin talimatları olarak ifade ediliyor ve doğrudan uygulanabilir.’
‘Geri bildirim, nasıl unutulmaz bir fotoğraf çekileceğini söyleyerek, kompozisyonel ayarlamalardan, poz ve bakış ayarlamalarına, nesne kaldırma gibi semantik müdahalelere kadar değişen bir dizi öneri sunuyor, böylece kullanıcılara doğrudan uygulanabilecek talimatlar sunuyor.’
Sonuç
Google’ın kapalı kutu yaklaşımının metodolojisini MemBench projesiyle karşılaştırmak çok ilginç olurdu – özellikle de Google’ın sistemini tanımlamak için hangi merkezi standartları, referansları ve veritabanlarını kullandığını bilmek için.
Bu tür sistemlerin negatif yönü, büyük ölçekte, visual standartları uniforma edecek ve nihayetinde klişe ve modaya dönüşecek bir risk taşıyor – bir çeşit görsel equivalenti, AI tire ve çizgi tartışmaları, burada ‘doğru’ prosedür, biraz lanetlenmiş hale geldi.
* Makaledeki dipnotların, makale içinde başka bir yerde sunulmayan bağlantılar olarak çevrimiçi olarak dönüştürülmesi.
† Makale, bu noktada ve diğer beberapa noktada, makale, Arxiv listesi veya proje sitesinden bulamadığım ‘ek malzeme’ye atıfta bulunuyor.
İlk yayınlanma tarihi: 26 Şubat 2026 Perşembe












