Anderson का एंगल
वास्तविक फोटो को लेने से पहले एआई का उपयोग करके उन्हें बेहतर बनाना

जेनएआई का उपयोग करके फोटो को बाद में सुधारने के बजाय, शोधकर्ताओं ने एक ऐसी प्रणाली विकसित की है जो आपको बताती है कि फोटो लेने से पहले कैसे आगे बढ़ना है, कैसे पोज देना है और फ्रेम कैसे करना है, जो फोटो को यादगार बनाने के लिए ज्ञान का उपयोग करती है।
फोटो को बाद में सुधारना एक लंबे समय से आसान हो गया है, क्योंकि निर्माता और प्रौद्योगिकी प्लेटफ़ॉर्म तेजी से कैमरे में संपादन प्रदान करते हैं जो उपयोगकर्ताओं को फोटो लेने के तुरंत बाद छवियों को बदलने की अनुमति देते हैं। इस प्रकार की लोकप्रिय प्रणाली में गूगल का कॉन्वर्सेशनल एडिटिंग और सैमसंग का जनरेटिव एडिट शामिल है, जो अन्य लोगों के बीच हैं।
हालांकि, ‘प्रामाणिकता’ पर ‘एआई-सुधार’ परिणामों को पसंद करने वाला एक नवजात रुझान यह हो सकता है कि ऐसी प्रणालियों के लिए जिन उपभोक्ताओं पर लक्ष्य है, वे ‘संशोधित’ फोटो को एआई स्लोप के रूप में मानने लगते हैं।
शायद यही कारण है कि गूगल ने जेमिनी से प्रेरित एक एआई-प्रशिक्षित ‘कैमरा कोच’ बनाया है, जो फोटो लेते समय सीधे निर्देश देने में सक्षम है:

गूगल का कैमरा कोच उपयोगकर्ता को फोटो को फिर से फ्रेम करने के लिए बताता है, साथ ही अन्य बुनियादी सलाह देता है। स्रोत
एक प्रोप्राइटरी सिस्टम के रूप में, और ऑनलाइन लगभग शून्य जानकारी के साथ, कैमरा कोच जेमिनी का लाभ उठाने के लिए लगता है ताकि उपयोगकर्ताओं को फ्रेमिंग (ऊपर देखें) में सुधार करने में मदद मिल सके या मामूली बदलाव कर सके (जैसे कि एक दूसरे के करीब जाना या कैमरे की ओर सीधे देखना)।
इस प्रकार, उत्पाद मध्य की ओर रचना को धक्का देता है, संभवतः लाखों अपलोड किए गए सामग्री डेटा बिंदुओं पर आधारित जेमिनी के प्रशिक्षण डेटा के आधार पर। इस अर्थ में, अपलोडिंग उपयोगकर्ताओं ने असंतोषजनक शॉट्स को अस्वीकार करके और जो उन्हें पसंद है उसे अपलोड करके एआई के कैलिब्रेशन का निर्माण किया है – एक प्रभावी (और मुफ्त) रूप डेटासेट क्यूरेशन!
यह कहा जा रहा है, जो फोटो आउट हैं औसत संरचना में, आवश्यक रूप से एक ही सौंदर्य मूल्य या दर्शक प्रभाव नहीं रखते हैं जो फोटो यादगार हैं।
चीज़ के अलावा और तीसरे नियम के परे
इस उद्देश्य के लिए, और एक प्रणाली की ओर जो प्लेटफ़ॉर्म पर अधिक सुलभ है, इटली से नए शोध में एक कोच-शैली की प्रणाली है जो फोटो को याद रखने वाले के पूर्व ज्ञान पर आधारित है:

लेखकों की नई प्रणाली से सलाह के विभिन्न उदाहरण। स्रोत
ऊपर दिए गए उदाहरणों में, हम लेखकों की नई प्रणाली – मेमकोच नामक – द्वारा दी गई सलाह देखते हैं, जो कि कैमरा कोच जैसे संरचना-केंद्रित एआई द्वारा प्रदान की जाने वाली सलाह की कल्पना करना मुश्किल है। पहले (बाएं) उदाहरण में, हेडड्रेस को हटाने की सलाह विशेष रूप से संदिग्ध है; दूसरी तस्वीर में, यह कठिन है कि सामान्य संदर्भ में एक संरचना-केंद्रित एआई क्या निकाल सकता है (अर्थात, एक ‘कलात्मक’ तस्वीर एक युवा महिला के साथ जो फर्श पर लेटी हुई है और उसकी आँखें बंद हैं)।
फोटोग्राफी में स्मृति के बारे में मूल समझ, जो तीन-भाग की इतालवी प्रणाली को विकसित करने के लिए उपयोग की जाती है, विभिन्न पूर्व कार्यों से ली जाती है, जिनमें 2015 का आउटिंग क्या एक वस्तु को यादगार बनाता है?, और 2013 का कागज़ एक फोटो को यादगार बनाता है? शामिल हैं।

2013 के कागज़ से जो एक फोटो को यादगार बनाता है, यादगारता के संदर्भ में अच्छे, मध्यम और बुरे फोटो के प्रतिनिधि उदाहरण। स्रोत
कोई भी, जैसे मैं, जिनकी यूनिक्स जन्म तिथि नकारात्मक है, शायद ‘सबसे कम यादगार छवियों’ (ऊपर दिए गए चित्र में ऊपरी दाएं) के लिए टेम्पलेट को पहचानेंगे, जो हमारे बचपन में शापित स्लाइड रात से। जैसा कि लेखकों ने कहा*:
‘इन कार्यों ने कुंजी अंतर्निहित कारकों की पहचान की, जैसे कि लोगों की उपस्थिति, इनडोर दृश्य, या भावनात्मक अभिव्यक्तियों, वस्तुओं और पैनोरमिक दृश्य की तुलना में, साथ ही साथ संदर्भ और पर्यवेक्षक जैसे बाहरी कारक। ‘
परियोजना ‘स्मृति प्रतिक्रिया’ (मेमफीड) पर केंद्रित है, जो मेमकोच ट्यूटर अनुप्रयोग में व्यक्त की जाती है, और एक बेंचमार्क (शीर्षक मेमबेंच) पीपीआर10के डेटासेट पर आधारित है।

पेपर पीपीआर10के: एक बड़े पैमाने पर पोर्ट्रेट फोटो रीटचिंग डेटासेट के साथ मानव-क्षेत्र मास्क और समूह-स्तर की संगति के साथ विविध नमूने। शीर्ष पंक्ति में मूल छवियां दिखाई गई हैं, नीचे की पंक्ति में विशेषज्ञ-रीटच्ड संस्करण दिखाए गए हैं साथ ही संबंधित मानव-क्षेत्र मास्क। मूल फोटो दृश्य बिंदु, पृष्ठभूमि, प्रकाश और कैमरा सेटिंग्स में व्यापक रूप से भिन्न होते हैं, जबकि रीटच्ड परिणाम बेहतर दृश्य गुणवत्ता और प्रत्येक समूह के भीतर मजबूत संगति प्रदर्शित करते हैं। स्रोत
लेख में यह देखा गया है कि स्मृति फोटो में मात्रा में मापा जा सकता है, न कि व्यक्तिपरक निर्णयों के पंजीकरण के रूप में, और लेखकों ने आगे उल्लेख किया है कि यह संपत्ति फोटो (विभिन्न कार्यों में) और वीडियो (विभिन्न कार्यों में) दोनों के लिए पहचाना गया है।
नई कागज़ का शीर्षक एक यादगार तस्वीर लेने के लिए कैसे? उपयोगकर्ताओं को क्रियाशील प्रतिक्रिया के साथ सशक्त बनाना है, और यह ट्रेंटो विश्वविद्यालय, पिसा विश्वविद्यालय और फोंडाज़ियोन ब्रूनो केसलर के चार शोधकर्ताओं से आता है। परियोजना पृष्ठ सुझाव देता है कि गिटहब कोड और हगिंग फेस-होस्टेड डेटा अगले महीने (मार्च 2026) उपलब्ध होगा।
विधि
मेमबेंच डेटासेट को स्रोत पीपीआर10के पोर्ट्रेट डेटासेट से बनाने के लिए, शोधकर्ताओं ने एक ही दृश्य से फोटो को समूहीकृत किया और प्रत्येक छवि को स्मृति के लिए एक प्रशिक्षित पूर्वानुमान का उपयोग करके स्कोर किया, जो सीएलआईपी विशेषताओं पर आधारित था। उन्होंने तब प्रत्येक दृश्य में फोटो को कम से अधिक यादगार तक रैंक किया और उन्हें उसी तरह जोड़ा:

मेमबेंच निर्माण और मूल्यांकन का अवलोकन। शीर्ष पंक्ति डेटा पाइपलाइन को दर्शाती है, छवियों को दृश्य द्वारा समूहीकृत करने और स्मृति का पूर्वानुमान लगाने से लेकर फोटो को रैंक करने और स्मृति-जागरूक क्रिया प्रतिक्रिया उत्पन्न करने तक। नीचे की पंक्ति मूल्यांकन को दर्शाती है, जो संपादन-आधारित स्मृति लाभ और परेशानी स्कोरिंग के माध्यम से प्रतिक्रिया की गुणवत्ता को मापती है।
प्रत्येक जोड़ी के लिए, दृश्य मतभेदों को समझाने के लिए प्राकृतिक भाषा विवरण इंटरनवीएल3.5 मॉडल के साथ उत्पन्न किए गए थे; और ये विवरण स्मृति प्रतिक्रिया प्रणाली के लिए प्रशिक्षण संकेत बनाते हैं।
गूगल के कैमरा कोच के तर्क के विपरीत, शोधकर्ताओं ने एक अधिक सूक्ष्म व्याख्या की तलाश की:
‘गणनात्मक फोटोग्राफी समायोजन पर ध्यान केंद्रित करने के विपरीत जो पोस्ट-हॉक सुधार पर केंद्रित हैं (जैसे “छवि को उज्जवल बनाएं”), हम उन क्रियात्मक कार्यों पर ध्यान केंद्रित करते हैं जो एक उपयोगकर्ता एक बेहतर शॉट के लिए ऑन-द-फ्लाई ले सकता है, जैसे “एक-दूसरे का सामना करें”।’
अंतिम मेमबेंच संग्रह में लगभग 10,000 छवियां शामिल हैं जो 1,570 दृश्यों में समूहीकृत हैं, जिनमें प्रति दृश्य औसतन 6.5 छवियां हैं।
लेखकों द्वारा उत्पन्न शब्द-वोल्ड (नीचे देखें) सुझाव देता है कि डेटासेट में व्यापक सेमेंटिक श्रेणियां हैं:

मेमबेंच में सबसे अधिक बार आने वाले शब्दों का एक शब्द-वोल्ड।
स्रोत फोटो ने 0.63 का स्मृति स्कोर दिया, जबकि एक ही दृश्य से सबसे यादगार शॉट 0.51 से 1.0 तक फैले थे, दोनों समूहों के बीच काफी ओवरलैप था:

प्रत्येक दृश्य में कम से कम यादगार छवियों की तुलना में स्मृति स्कोर वितरण।
प्रतिक्रिया स्वयं सात शब्दों के नोट्स से लेकर उल्लेखनीय रूप से लंबी निर्देश तक भिन्न होती है। प्रत्येक सलाह को तब जीपीटी-5 मिनी का उपयोग करके छोटे क्रिया प्रकारों में तोड़ दिया गया था:

सामग्री शब्दों में प्रतिक्रिया की लंबाई वितरण, और श्रेणियों में सह-आवृत्ति आवृत्ति के साथ परमाणु उप-क्रियाओं का वर्गीकरण।












