Anderson का एंगल

कंप्यूटर विजन साहित्य रुझानों पर एक व्यक्तिगत दृष्टिकोण 2025

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें
AI-generated image, by gpt-image-1 via ChatGPT-5.2, featuring a stylized isometric illustration of white-coated scientists in a computer laboratory.

नैतिक प्रकटीकरण और गॉसियन स्प्लैटिंग घटते जा रहे हैं, जबकि जमा किए गए पत्रों की मात्रा एक नया समस्या है जिसे 2026 में एआई को संबोधित करना होगा।

 

राय मैंने लगभग सात वर्षों से अर्क्सिव और संबंधित मंचों पर कंप्यूटर विजन और इमेज सिंथेसिस अनुसंधान का अनुसरण किया है – पर्याप्त समय है जिसमें मैं आवर्ती पैटर्न और रुझानों में बदलाव को पहचान सकता हूं। लेकिन ये अवलोकन अनुभवजन्य हैं। मैं ईमानदारी से कामना करता हूं कि मेरे पास अर्क्सिव प्रकाशन प्रवाह द्वारा प्रतिनिधित्व किए गए विशाल निगमों का शोषण करने के लिए समय हो, जो निश्चित रूप से छिपी हुई अंतर्दृष्टि से भरा हुआ है, मशीन लर्निंग विश्लेषण का उपयोग करके। जैसा कि यह खड़ा है, मैं केवल अधिक अनौपचारिक रूप से बता सकता हूं कि मेरे ध्यान में क्या आया मैंने आखिरी बार इस मामले पर विचार किया

वॉल्यूम 11 पर

कंप्यूटर विजन साहित्य रुझानों पर मेरे द्वारा 2024 में देखे गए कई रुझान 2025 में स्थापित हो गए; इनमें से कम से कम एआई से संबंधित पत्रों की मात्रा में निरंतर और बढ़ती वृद्धि है, जो स्वयं एआई द्वारा ईंधन दी जा रही है, एक महसूस किए गए संकट के बिंदु तक:

मासिक कंप्यूटर विज्ञान अर्क्सिव जमा करने, अक्टूबर 2023-नवंबर 2025, 3-महीने की घूमने वाली औसत ओवरले के साथ। स्रोत: https://arxiv.org/stats/monthly_submissions

मासिक कंप्यूटर विज्ञान अर्क्सिव जमा करने, अक्टूबर 2023-नवंबर 2025, 3-महीने की घूमने वाली औसत ओवरले के साथ. स्रोत

इस वृद्धि की दर को कई साल पहले एआई पेपर जमा करने की मात्रा में एक घातांक दोगुनी वृद्धि के रूप में वर्णित किया गया था, और यह केवल हाल के एआई निवेश मनिया के हाल के आगमन के साथ गहरा हो गया है, जिसने हितों को बढ़ा दिया है और एआई से संबंधित अनुसंधान के लिए उपलब्ध धनराशि बढ़ा दी है।

2025 के लिए पूर्ण आंकड़े अभी तक उपलब्ध नहीं हैं, और उपरोक्त दिखाए गए सामूहिक आंकड़े सामान्य संख्या में वृद्धि का प्रतिनिधित्व करते हैं जो सभी श्रेणियों में हो रही है। नीचे हम देख सकते हैं कि कंप्यूटर विज्ञान अभी भी एक प्रमुख रुझान पर सवार है, जो अपने स्थिर साथियों से काफी ऊपर है:

2022-2025 में कंप्यूटर विज्ञान जमा करने में वृद्धि। स्रोत - https://info.arxiv.org/about/reports/submission_category_by_year.html

2022-2025 में कंप्यूटर विज्ञान जमा करने में वृद्धि। स्रोत

चाफ को छांटना

अक्टूबर में, गिरावट के सम्मेलन की शुरुआत, जो हमेशा नए अनुसंधान की बाढ़ लाता है, इसके बजाय एक डीओएस-हमले स्तर की मात्रा में जमा लाया, जो अनुसंधान रुझान विश्लेषण के शोध धारा को और भी प्रोत्साहित और तत्काल बना दिया, जो कि पत्र और भंडार हैं जो स्वयं में शोध दृश्य में बिगड़ते सिग्नल-टू-शोर अनुपात में कटौती करने का प्रयास करते हैं।

नवीनतम केवल पिछले सप्ताह में आया, नोवेल्टी रैंक के रूप में, एक पेपर और गिटहब भंडार जो एलएलएम जैसे क्यूवेन 3-4 बी-इन्स्ट्रक्ट-2507 और साइबेर्ट को बारीक-ट्यून करता है ताकि वे जमा किए गए पत्रों (पिछले जमाओं से ‘नवीनता’ की भविष्यवाणी करने) का द्विआधारी वर्गीकरण कर सकें, या जोड़ीदार नवीनता तुलना (वर्तमान जमाओं के लिए ‘नवीनता’ की तुलना करने) कर सकें:

नोवेल्टी रैंक सिस्टम एक जमा के शीर्षक और अमूर्त की तुलना करता है समान पिछले पत्र, एलएलएम का उपयोग करके अंतरों को सारांशित करता है, और इसे एक बारीक-ट्यून किए गए क्यूवेन 3-4 बी मॉडल में पास करता है जो यह तय करता है कि क्या काम 'संकल्पनात्मक रूप से नए' के रूप में गिना जाता है। स्रोत - https://arxiv.org/pdf/2512.14738

नोवेल्टी रैंक सिस्टम एक जमा के शीर्षक और अमूर्त की तुलना करता है समान पिछले पत्र, एलएलएम का उपयोग करके अंतरों को सारांशित करता है, और इसे एक बारीक-ट्यून किए गए क्यूवेन 3-4 बी मॉडल में पास करता है जो यह तय करता है कि क्या काम ‘संकल्पनात्मक रूप से नए’ के रूप में गिना जाता है। स्रोत

इस तरह के ‘छानने’ दृष्टिकोण के साथ समस्या यह है कि अर्थपूर्ण चर को परिभाषित करने की चुनौती। नोवेल्टी रैंक दृष्टिकोण एक पत्र की स्वीकृति को एक सम्मेलन के रूप में नवीनता के सूचक के रूप में उपयोग करता है, और – शायद थोड़ा उपेक्षित रूप से – अर्क्सिव प्रकाशन का उपयोग एक पृष्ठभूमि सूचक के रूप में नकारात्मक नवीनता के रूप में करता है।

यह दो झूठे पूर्वकल्पनाओं पर आधारित है: पहला, यह कि सभी सम्मेलन-स्वीकृत जमाओं में नवीनता या परिणाम होता है, जो स्पष्ट रूप से मामला नहीं है; और दूसरा, यह कि नवीनता स्वयं एक योग्य मूल्य है। जो कोई भी कुछ व्यर्थ, यहां तक कि हास्यास्पद पत्रों पर आधा घंटा बर्बाद कर चुका है – शायद – केवल ‘प्रकाशित या मरने’ कोटा बनाए रखने के लिए, यह जानता है कि नवीनता अक्सर तुच्छ होती है, और आंशिक कार्य अक्सर महत्वपूर्ण होता है।

एक नए पत्र के मूल्य को समझने में शामिल है एक क्षेत्र जहां एआई वर्तमान में बहुत कमजोर है – लंबी अवधि संदर्भ। क्योंकि वे अक्सर कपटपूर्ण तरीके से लिखे जाते हैं, जो पत्र जमीन तोड़ने लगते हैं वे अक्सर मामूली प्रगति के रूप में प्रकट हो सकते हैं; हालांकि, स्वचालित प्रणालियों को ऐसे मामलों के लिए एक ‘अंतर्ज्ञान’ विकसित करने की आवश्यकता होगी, बिना कई झूठे सकारात्मक को झंडा दिए, और जमा करने वाले लेखकों की ईमानदारी पर भरोसा किए बिना।

नैतिक प्लंज

जैसा कि मैंने पहले देखा, अर्क्सिव जैसे पोर्टल लैसेज़ फ़ेयर स्क्रैपिंग के प्रति काफी प्रतिरोधी हैं, और वे जो डेटा डंप प्रदान करते हैं वे अक्सर विस्तृत विवरण की कमी होती है।

अतः, भले ही मेरे पास पर्याप्त संसाधन और समय हो कंप्यूटर विज्ञान के पत्रों के एक पर्याप्त प्रतिनिधि क्रॉस-सेक्शन से विशेषताओं को डाउनलोड और निकालने के लिए, कई अधिक सूक्ष्म रुझानों का विश्लेषण नहीं किया जाएगा।

इनमें से एक नैतिक बयान शपथ पत्र की उपस्थिति या अनुपस्थिति है; लंबे समय से जैविक विज्ञान के लिए एक आवश्यक समावेश जो जानवरों के प्रयोग पर छूता है, 2024 में कंप्यूटर विज्ञान श्रेणी में जमा किए गए काम के नैतिक चरित्र के प्रति रुझान के शिखर को देखा।

अनुभवजन्य रूप से, मैं कहता हूं कि यह अभ्यास 2025 के दौरान एक खाई से गिर गया है। मेरा अनुमान है कि वर्तमान अमेरिकी सरकार द्वारा एआई विकास से संबंधित नियामक प्रयासों के उत्साही निरीक्षण ने शोध समुदाय को दोनों देशों में और विदेशों में एक निश्चित बढ़ी हुई लाइसेंस और कानूनी जोखिम से सुरक्षा की भावना प्रदान की है।

इसके बावजूद अन्टी-डीपफेक नियमन के लिए इसके समर्थन के, वर्तमान अमेरिकी प्रशासन ने प्रभावी रूप से बहुत सारे ‘वाइल्ड वेस्ट’ को बहाल कर दिया है जो 2021-23 युग की विशेषता थी – हालांकि जिस शुद्ध वैज्ञानिक अनुसंधान के संदर्भ में इसे परिभाषित किया गया था, वह तब से ऐतिहासिक स्तर के निवेश में विकसित हो गया है।

जनरेटिव वीडियो पेपर्स को ‘एआई स्लोप’ के रूप में

पिछले साल हुन्युआन वीडियो और वैन जनरेटिव वीडियो श्रृंखला के लॉन्च के साथ, एआई वीडियो 2025 में पूरी तरह से परिवर्तित हो गया है। पुराने रोडब्लॉक्स जैसे पूर्ण-शारीरिक अवतार बनाने में कठिनाई, या एक व्यक्ति के प्रोफाइल दृश्य प्राप्त करने में कठिनाई, रातोंरात दूर हो गईं।

इस प्रकार के वजन-शामिल रिलीज चीन से स्पष्ट रूप से 2025 में जनरेटिव वीडियो रिलीज के लिए गति तय कर रहे हैं, और वे पश्चिमी एआई वीडियो आर्किटेक्चर की प्रवृत्ति को कम करने के लिए एक प्रतिकूल दबाव हैं जो अधिक सेंसर्ड, पूर्व-वाणिज्यिक और निर्धारित हैं।

इन पहलों में से अधिकांश अल्पकालिक नकदी हैं जो अंततः बाजार के समेकन से अपसाइड होने की उम्मीद करते हैं (हालांकि उनके संस्थापकों को गलती से एक प्रमुख बाजार हिस्सेदारी पर ठोकर लगने पर कोई आपत्ति नहीं होगी, यदि ऐसा होता है)।

इसी तरह की साधारणता और प्रतिकृति ने 2025 में अर्क्सिव के जमाओं में इस श्रेणी को मारा है। जैसा कि मैंने पिछले सप्ताह देखा, इस श्रेणी के लिए सिग्नल-टू-शोर अनुपात एक संख्यात्मक शिखर पर पहुंच गया है, क्योंकि शोधकर्ता सार्वजनिक रूप से इस वर्ष के माध्यम से जारी किए गए विशाल धनराशि के संभावित निधिकरण के लिए प्रतिस्पर्धा करते हैं।

उस कहा कि, इस प्रकार के अधिकांश जमाओं में केवल आंशिक प्रगति होती है, सर्वश्रेष्ठ। जनरेटिव एआई में शेष मूल समस्याएं इस वर्ष बहुत नहीं देखी गई हैं: पहचान बनाए रखने की आवश्यकता, लोरा-शैली के माध्यम से, एक पात्र चित्रण में; आउटपुट वीडियो के लिए लंबे समय तक चलने वाले रनटाइम की आवश्यकता, जिसमें वातावरण और विषयों की निरंतरता (यानी, केवल आईडी के अलावा) बनाए रखी जाती है; और बेहतर ऑडियो जनरेशन और हेरफेर जनरेटिव वीडियो और वीडियो संपादन आर्किटेक्चर में; अन्य लोगों के बीच में।

मेश बुखार कम हो जाता है

मैंने पिछले साल देखा कि दृश्य पारंपरिक सीजीआइ (यानी, मेश-आधारित प्रतिनिधित्व के प्रकार जो 1970 के दशक में वापस आते हैं) का लाभ उठाने वाले प्रणालियों को बढ़ावा देने वाले पत्रों में एक उल्लेखनीय वृद्धि का अनुभव कर रहा था, या न्यूरल फ्रेमवर्क में शामिल हैं। मैंने 2025 के दौरान, विशेष रूप से वर्ष के दूसरे भाग में, मेश-आधारित समाधानों की ओर प्रवृत्ति की गति में एक महत्वपूर्ण कमी देखी है।

पिछले तरंग में सीजीआइ-एकीकृत समाधानों में, विशेष रूप से उन लोगों में जो पैरामेट्रिक मानव ‘नियंत्रण’ आंकड़े जैसे 3डी मॉर्फेबल मॉडल से संबंधित हैं, वे नए क्षमताओं द्वारा प्रतिस्थापित किए जा सकते हैं वेो और वैन जैसे डिफ्यूजन-आधारित जनरेटिव फ्रेमवर्क।

एक साल पहले मैंने देखा था कि जीएसप्लैट की प्रारंभिक उत्साह, जिसने देर से 2023 में एक उल्लेखनीय प्रभाव डाला था, संकीर्ण अनुसंधान रेखाओं में बस गया था। इस वर्ष, मैं जीएसप्लैट दृष्टिकोण को संबोधित करने वाले पत्रों की एक धारा देखता हूं, जिनमें से कई समस्याओं में से एक को संबोधित करते हैं।

हालांकि मैं जीएसप्लैट को ‘वर्तमान में ठप’ के रूप में वर्णित करूंगा, हमें यह याद रखना चाहिए कि यह प्रौद्योगिकी 1990 के दशक की शुरुआत से है।

मेश-आधारित दृष्टिकोणों से सामान्य पीछे हटने का एक अपवाद 3डी प्रिंटिंग के लिए निर्देशित फ्रेमवर्क में एआई को शामिल करने में रुचि में वृद्धि का प्रतीत होता है।

एआई सुरक्षा जमाओं में कमी

2025 के लिए मेरा अंतिम अवलोकन यह है कि अर्क्सिव में कंप्यूटर विज्ञान अनुभाग में ‘सुरक्षा’ जमा श्रेणी में एक उल्लेखनीय गिरावट और गुणवत्ता में कमी आई है, और यह अनुमान लगाना मुश्किल है कि क्यों।

कंप्यूटर विज्ञान में क्रिप्टोग्राफी और सुरक्षा संग्रह ने तर्कसंगत रूप से एक दूसरे दर्जे का स्थान बनाया है जहां पत्र पोस्ट करने के लिए, क्योंकि यह अनुसंधान की यह शाखा निजी क्षेत्र के स्वामित्व वाले आईपी द्वारा असाधारण रूप से प्रभावित है, जो शायद ही कभी अकादमिक पत्रिकाओं में सतह पर आता है, और जो मुफ्त मंचों जैसे अर्क्सिव में दिखाई नहीं देता है।

इसके अलावा, अर्क्सिव में इस श्रेणी में जमा करने में ‘गोटचास’ की संख्या अधिक है – अक्सर अप्रत्याशित स्थानों में दबी हुई प्रवेश, जो पत्र के स्पष्ट मूल्य और नवीनता को नकारते हैं या कम करते हैं। एक उदाहरण एक कथित तौर पर सेंसेशनल सुरक्षा उल्लंघन विधि होगी जो वास्तव में कुछ ‘व्हाइट बॉक्स’ पहलू – यानी, कुछ प्रकार की विशेषाधिकार प्राप्त पहुंच की आवश्यकता होती है डेटा या प्रक्रियाओं के लिए, जैसे कि एक हमलावर सुरक्षित नहीं कर सकता है।

2026 में क्या अपेक्षा करें

हालांकि मीडिया बार-बार जेन एआई बूम को डॉट-कॉम बूम-और-बस्ट दुर्घटना के रूप में दोहराता है प्रारंभिक नoughties (के साथ कुछ असहमति), यह वास्तव में एक प्रकार की झूठी सुरक्षा का प्रतिनिधित्व करता है। बुनियादी ढांचे, निवेश, संस्कृति और अनुसंधान के संदर्भ में, मानव इतिहास में ऐसा समय नहीं रहा है।

अतः, यह देखना मुश्किल है कि 2026 में अनुसंधान दृश्य किस दिशा में बढ़ेगा, सिवाय इसके कि – जैसा कि हमेशा होता है – कई दीर्घकालिक प्रयास 2025 के जुनून और रुझानों के एक निश्चित ‘मुहर’ के साथ अब और अप्रैल के बीच परिपक्व होंगे।

एक ऐसा विकास जो अर्क्सिव और अन्य पोर्टलों पर जमा करने की मात्रा संकट में मदद कर सकता है, एक प्रतिबंध या जांच है जो एआई-उत्पन्न / सहायता प्राप्त पत्रों पर है, जैसा कि अर्क्सिव ने हाल ही में समीक्षा पत्रों के लिए किया है – हालांकि, एआई की किसी एक पत्र में सगाई की मात्रा को मापना मुश्किल साबित हो सकता है, क्योंकि एआई ने अनुसंधान संस्कृति (और पियर रिव्यू) में प्रवेश किया है जैसा कि यह अन्य डोमेन में प्रवेश कर चुका है – एक बूंद ‘स्याही’ के रूप में जो पूरे (मौजूदा) पानी के गिलास को प्रभावित करती है, इसके माध्यम को नाटकीय रूप से बदलने के बजाय।

 

सोमवार, 22 दिसंबर, 2025 को पहली बार प्रकाशित

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai