Anderson का एंगल
स्ट्रीमिंग एआई अवतार जैसे कि यह 1999 है

नई रिसर्च एक तरीका प्रस्तुत करती है जिसमें जीवन जैसे 3D अवतारों को स्ट्रीम किया जा सकता है जो लगभग तुरंत दिखाई देते हैं और वास्तविक समय में तेज होते हैं, इसके बजाय उपयोगकर्ताओं को बड़े डाउनलोड पूरे होने के लिए इंतजार करने के लिए मजबूर नहीं करते हैं।
कई मायनों में, जनरेटिव एआई और एआई-सहायता प्राप्त रेंडरिंग सिस्टम की विशाल संसाधन मांगों ने उपभोक्ता-तैयारी को बीस या अधिक वर्षों से वापस ले लिया है। केवल 2023 में, एक लैपटॉप या डेस्कटॉप पीसी में 64GB रैम आवंटन अत्यधिक लगता था; अब, रैम और/या सीपीयू ऑफलोडिंग की बढ़ती लोकप्रियता के साथ, 64GB स्थानीय एआई की जरूरतों के लिए बहुत मामूली है; और ये एक बार सामान्य और सस्ते पीसी तत्व लगातार कीमतों में वृद्धि के साथ एआई सेवाओं की मांग को पूरा करने के लिए निगमों के साथ संघर्ष करते हैं।
एआई और इसकी प्रक्रियाओं और पर्यावरणों का पैमाना और लालच आमतौर पर उपभोक्ता-स्तर के हार्डवेयर को पार करता है, और यहां तक कि स्थानीय-उन्मुख मॉडल को जीजीयूएफ संस्करण के रूप में चलाने से भी औसत प्रणाली पर दबाव पड़ता है।
यहां तक कि पाठ-आधारित एआई सेवाएं जैसे कि चैटजीपीटी दोनों क्लाइंट और सर्वर स्तर पर महत्वपूर्ण दबाव के अधीन हैं । इसलिए, एक बार एआई को ऑनलाइन मल्टीमीडिया अनुभवों को वास्तविक समय में वितरित करने का काम सौंपा जाता है, तो हम कुछ बहुत गंभीर समझौतों की उम्मीद कर सकते हैं – लेटेंसी और/या गुणवत्ता में – इंटरनेट के शुरुआती दिनों के साथ मल्टीमीडिया स्ट्रीमिंग के साथ, और रियलप्लेयर और क्विकटाइम के बहुत नापसंदीदा एनिमेटेड ‘बफरिंग’ आइकनों के साथ।
पिछली बार जब मल्टीमीडिया और नेटवर्क समस्याओं ने उपयोगकर्ता अनुभव में घर्षण पैदा किया, तो उपभोक्ता-स्तर के हार्डवेयर अभी भी मूरे के नियम के माध्यम से विकसित हो रहे थे, लगभग हर साल असीमित रूप से बेहतर हो रहे थे, यहां तक कि ओएस, नेटवर्क और अन्य समर्थन बुनियादी ढांचे को मांग को पूरा करने के लिए विकसित किया गया था; और पिछले दस वर्षों में, अधिक या कम, उपभोक्ता प्रौद्योगिकी की क्षमताएं मल्टीमीडिया की मांगों से अधिक हो गई हैं (शायद इतनी कि चूर्ण को बनाए रखने के लिए बिक्री को बनाए रखने के लिए चूर्ण की जरूरत थी)।
लेकिन स्थानीय क्षमता की यह अधिकता जल्द ही समाप्त हो सकती है, क्योंकि स्थानीय हार्डवेयर कम-स्पेक्ड और अधिक महंगा होता जा रहा है, और एआई-आधारित सेवाएं उच्च सर्वर-साइड और स्थानीय संसाधनों की मांग कर रही हैं।
एक सिर प्राप्त करना
प्री-ब्रॉडबैंड युग में, यहां तक कि पहले उपयोगी स्ट्रीमिंग वीडियो से पहले, वेब उपयोगकर्ता धीरे-धीरे फोकस में आने वाली छवियों के लिए अभ्यस्त थे, क्योंकि प्रगतिशील जेपीईजी उपयोगकर्ता को बैंडविथ-स्टार्व्ड उपयोगकर्ता को देखने की अनुमति देते थे क्योंकि छवि डेटा स्थानीय रूप से लोड हो रहा था, कभी-कभी बहुत धीरे-धीरे, जैसा कि अधिक छवि डेटा लोड हो रहा था।
अब, ऐसा लगता है, हम एक समान अनुभव के लिए एआई-सहायता प्राप्त गॉसियन स्पलैट अवतार के साथ हो सकते हैं:
प्ले करने के लिए क्लिक करें। न्यू प्रोग्रेसिवएवाटर्स प्रोजेक्ट से, गॉसियन अवतारों की तुलना。 स्रोत
उपरोक्त दो गॉसियन स्प्लैट-आधारित (जीएसप्लाट) अवतार दिखाई दे रहे हैं – एक मानव प्रतिनिधित्व जो आंशिक रूप से एक गैर-एआई रेंडरिंग तकनीक द्वारा संचालित होता है जो 1990 के दशक की शुरुआत में वापस आता है, और आधुनिक तरीकों जैसे फ्लेम पैरामेट्रिक मानव मॉडल, और एआई-आधारित प्रशिक्षण दृष्टिकोण:

गॉसियन स्प्लैटिंग एक गॉसियन प्रतिनिधित्व का उपयोग करता है रंग और 3D जानकारी के लिए एक पिक्सेल या वोक्सेल के बजाय, और इस अल्ट्रा-वास्तविक बनावट को एक अधिक पारंपरिक प्रकार के सीजीआई मेश पर मैप करता है, जो खुद एक ‘पैरामेट्रिक मानव’ द्वारा सुविधा प्रदान की जाती है, एक सीजीआई चेहरे और/या शरीर, प्रणालियों में जैसे फ्लेम और स्टार। स्रोत
वीडियो में ऊपर बाएं, हम देख सकते हैं कि एक पारंपरिक गॉसियन स्प्लैट अवतार का कार्यान्वयन बहुत भयानक दिखता है क्योंकि हम डेटा लोड होने का इंतजार करते हैं। दाईं ओर, चीन में एक नई कार्यान्वयन, जिसे प्रोग्रेसिवएवाटर्स कहा जाता है, डेटा लोड होने पर बहुत अधिक सुंदरता से हल हो जाता है, और एक मानव छवि प्रस्तुत करता है जो शुरू से ही बुनियादी मानव रूप प्रस्तुत करता है:
प्ले करने के लिए क्लिक करें।प्रोग्रेसिवएवाटर्स प्रोजेक्ट साइट से, ध्यान-जागरूक लोडिंग का एक चित्रण।
इससे पहले, एक ‘विवरण स्तर’ (एलओडी) दृष्टिकोण का उपयोग गॉसियन स्प्लैट अवतारों को पतला करने के प्रयासों में किया गया है, जो वीडियो गेम अनुकूलन के समान है, जहां व्यक्ति को पर्याप्त रूप से व्यूवर्ट या दर्शक का ध्यान आकर्षित करने के लिए पर्याप्त विस्तार से लोड किया जाता है ताकि यह प्रयास के लायक हो:
एक उभरता हुआ डोमेन
यदि यह एक निचे समस्या लगती है, तो यह स्ट्रीमिंग वीडियो की तरह था, जब सबसे पहले प्लग-इन को काम करने के लिए निकटतम उपलब्ध नेर्ड को आउटसोर्स किया गया था। इसके अलावा, एआई-आधारित स्ट्रीमिंग प्रतिनिधित्व की संभावना मानव अवतारों से परे है, जो शहर पीढ़ी, गेम, और 3D-आधारित* संस्करणों में विस्तारित होती है लगभग किसी भी ऑनलाइन डोमेन – जैसे वर्चुअल ट्राई-ऑन, कपड़ों की खरीदारी के लिए:
प्ले करने के लिए क्लिक करें। 2024 के एक परियोजना से, ऑनलाइन ‘ट्राई-ऑन’ के भविष्य का एक खुरदरा दृश्य। अन्य परियोजनाएं गति और इंटरैक्टिविटी जोड़ने का प्रयास करती हैं – मांग वाली सुविधाएं स्ट्रीम और प्रबंधित करने के लिए। स्रोत
जैसा कि एलओडी दृष्टिकोणों का उपयोग मुख्य रूप से वीडियो गेम द्वारा किया गया है, कई अन्य विचार जो एक बार केवल गेम विकास के प्रांत थे, संभवतः स्प्लैट-आधारित प्रतिनिधित्व में प्रवेश करेंगे। उदाहरण के लिए, इन शुरुआती जीएसप्लाट आउटिंग में से अधिकांश एक एकल मानव को चित्रित करते हैं जो मुस्करा रहे हैं और बात कर रहे हैं; लेकिन कई स्थितियों की आवश्यकता होगी जिनमें कई मानव, साथ ही पर्यावरणीय विशेषताएं और वातावरण शामिल हों – एक परिदृश्य जहां उच्च प्रदर्शन वाले ‘ट्राइएज’ प्रणाली यह निर्धारित करेंगे कि स्ट्रीमिंग डेटा को कहां प्राथमिकता देने की आवश्यकता है, ताकि दर्शक को पल में रखा जा सके:
नई कागज़ का शीर्षक प्रोग्रेसिवएवाटर्स: प्रोग्रेसिव एनिमेटेबल 3D गॉसियन अवतार है, और यह चीन के हेफ़ेई में विज्ञान और प्रौद्योगिकी विश्वविद्यालय के तीन शोधकर्ताओं से आता है।
विधि
दृष्टिकोण शुरू में एक व्यक्ति के सिर के वीडियो का उपयोग करता है। प्रत्येक फ्रेम के लिए, एक मानक फ्लेम पैरामेट्रिक चेहरे का मॉडल फिट किया जाता है, ताकि आकार और अभिव्यक्ति समय के साथ बदलते रहें, जबकि अंतर्निहित मेश संरचना स्थिर रहती है। क्योंकि आधार टोपोलॉजी नहीं बदलती है, एक स्थिर फ्लेम टेम्पलेट को पुनः प्राप्त और परिष्कृत किया जा सकता है, न कि प्रत्येक पल में स्क्रैच से पुनः निर्मित किया जा सकता है, जैसा कि समान पिछले कार्यों में होता है:

सिर वीडियो को पहले एक ट्रैक किए गए फ्लेम मेश के साथ फिट किया जाता है, जिसके बाद 3D गॉसियन को प्रत्येक चेहरे पर जोड़ा जाता है और स्क्रीन-स्पेस ग्रेडियंट्स द्वारा इंगित किए गए लापता विवरण के स्थान पर पदानुक्रमित रूप से बढ़ाया जाता है। प्रशिक्षण के दौरान, यह अनुकूली उप-विभाजन एक बहुस्तरीय प्रतिनिधित्व का निर्माण करता है बहुस्तरीय पर्यवेक्षण के तहत, और अनुमान में, प्रति-चेहरे महत्व स्कोर यह निर्धारित करते हैं कि कौन से गॉसियन पहले स्ट्रीम किए जाते हैं, जिससे अवतार जल्दी से दिखाई देता है और अधिक विवरण जोड़े जाने के साथ प्रगतिशील रूप से तेज हो जाता है।
इस आधार संरचना पर, विवरण परतों में जोड़ा जाता है; सतह को एक पदानुक्रम में छोटे तीन आयामी गॉसियन के साथ आंशिक रूप से विभाजित किया जाता है और प्रत्येक विवरण स्तर पर चेहरों पर जोड़ा जाता है।
हालांकि प्रारंभिक मोटे परतें समग्र सिर के आकार और गति को पकड़ती हैं, बाद की महीन परतें मुंहासे, सूक्ष्म विकृतियों और उच्च आवृत्ति बनावट प्रदान करती हैं। छवियों को इन गॉसियन से एक अलग गॉसियन रास्टराइज़र का उपयोग करके और बहुस्तरीय मैदान सच्चाई फुटेज के खिलाफ प्रशिक्षित करके रेंडर किया जाता है, ताकि अवतार वास्तविक व्यक्ति की उपस्थिति को पुन: उत्पन्न करना सीखे।
प्रशिक्षण के दौरान, यह पदानुक्रम स्वचालित रूप से बढ़ता है: क्षेत्र जिन्हें अधिक विवरण की आवश्यकता है, स्क्रीन स्पेस संकेतों द्वारा निर्देशित, आगे उप-विभाजित हैं, ताकि गणनात्मक प्रयास उन क्षेत्रों पर केंद्रित हो जहां दर्शक की आंख सबसे अधिक संभावना त्रुटियों को देखेगी।
अनुमान में, यह पदानुक्रम प्रगतिशील स्ट्रीमिंग को सक्षम बनाता है, जिसमें एक अवतार का एक खुरदरा संस्करण पहले प्रदर्शित किया जा सकता है, और जैसे ही अतिरिक्त परतें लोड होती हैं, नए गॉसियन जोड़े जा सकते हैं जो पहले से ही दिखाई दे रहे हैं, जिससे एक एनिमेटेबल हेड अवतार बनता है जो जल्दी से दिखाई देता है और अधिक विवरण जोड़े जाने के साथ तेज हो जाता है।
लेखकों का अवलोकन है कि पूरी प्रणाली आगे आने वाले डेटा के प्राथमिकता पर निर्भर करती है:

जब एक दिए गए स्तर पर सभी गॉसियन उपलब्ध होते हैं, तो पूरा मॉडल अधिकतम विश्वासघात के साथ रेंडर किया जाता है; लेकिन स्ट्रीमिंग के दौरान, उच्चतम-योगदान गॉसियन को पहले भेजने से पहले आंशिक परिणाम बारीकी से अंतिम छवि से मेल खाते हैं, जबकि कम-योगदान गॉसियन को पहले प्रसारित करने से रंग संतुलन बिगड़ जाता है और छोटे घटकों पर जोर देता है।
डेटा और परीक्षण
परीक्षणों के लिए, नई विधि का मूल्यांकन नेर्सेम्बल डेटासेट पर किया गया था, जिसमें प्रत्येक विषय के लिए बहुस्तरीय वीडियो शामिल थे, जिसमें सभी दृश्यों में कैलिब्रेटेड पैरामीटर थे:

प्रोग्रेसिवएवाटर्स के लिए परीक्षणों में उपयोग किए जाने वाले नेर्सेम्बल डेटासेट में विभिन्न व्याख्याओं के उदाहरण। स्रोत
मूल गॉसियनएवाटर्स विधि के अनुसार, छवियों को 802x550px तक डाउनसैंपल किया गया था, एक फोरग्राउंड मास्क उत्पन्न किया गया था, और मूल परियोजना के प्रशिक्षण/परीक्षण विभाजन को अपनाया गया था।
पैरामीटर अपडेट के लिए एडम ऑप्टिमाइज़र का उपयोग किया गया था, जिसमें सभी बेरीसेंट्रिक समन्वय में 1×10-2 की सीखने की दर थी। प्रशिक्षण 60,000 पुनरावृत्तियों के लिए चलाया गया था, जिसमें पदानुक्रम प्रत्येक 2,000 पुनरावृत्तियों के बाद स्वचालित रूप से विस्तारित हुआ था।
शुरू में, लेखकों ने पुनर्निर्माण और एनिमेशन के लिए परीक्षण किया – एक 3D-जागरूक (x/y/x) प्रणाली में फ्लैट वीडियो को परिवर्तित करने का कार्य, फ्लेम के मानक सीजीआई प्रतिनिधित्व का उपयोग करके एक एंकर मेश के रूप में। इसके लिए, सभी बेसलाइन्स को स्क्रैच से प्रशिक्षित किया गया था, और प्रतिद्वंद्वी फ्रेमवर्क का परीक्षण पॉइंटएवाटर के साथ किया गया था।
इन परीक्षणों के लिए, मेट्रिक्स का उपयोग पीक सिग्नल-टू-नॉइज़ रेशियो (पीएसएनआर), स्ट्रक्चरल सिमिलैरिटी इंडेक्स (एसएसआईएम), और लर्न्ड परसेप्टुअल इमेज पैच समानता (एलपीआईपीएस) थे:

नवीन-दृश्य और नवीन-अभिव्यक्ति सिंथेसिस पर गुणात्मक तुलना। बेसलाइन गॉसियनएवाटर्स आंखों, मुंहासों, और त्वचा की बनावट के आसपास महीन विवरण के साथ संघर्ष करता है, जबकि प्रस्तावित विधि पहले से ही पांच प्रतिशत प्रसारित डेटा पर मुख्य चेहरे की संरचना को संरक्षित करती है और अधिक गॉसियन के प्रसार के साथ मैदान सच्चाई और संदर्भ छवियों (मैदान सच्चाई) की ओर अभिसरण करती है।
लेखकों का दावा है:
‘[हमारी] विधि कई क्षेत्रों में तेज विवरण का पुनर्निर्माण करती है, विशेष रूप से गर्दन, कंधे, और कपड़ों के आसपास। ये क्षेत्र फ्लेम टेम्पलेट में उच्च-सaliency चेहरे क्षेत्रों (जैसे कि परि-आंख क्षेत्र) की तुलना में अपेक्षाकृत मोटे तौर पर जालीदार हैं।
‘परिणामस्वरूप, पूर्व के तरीके अक्सर इन क्षेत्रों में विवरण को विश्वासपूर्वक पकड़ने के लिए 3D गॉसियन को बहुत कम आवंटित करते हैं। इसके विपरीत, हमारी अनुकूल वृद्धि रणनीति केवल जहां आवश्यक है वहां गॉसियन की संख्या बढ़ाती है और पदानुक्रम को परिष्कृत करती है, जिससे आवंटन फ्लेम के असमान जालीदारी से असंवेदनशील हो जाता है।’
लेखकों का आगे कहना है कि उनकी विधि राज्य-оф-द-आर्ट विधियों के साथ बराबर है, जो 5% बैंडविथ अनुमति के साथ एक कार्यशील अवतार प्रदान करती है:

नवीन-दृश्य सिंथेसिस और नवीन-अभिव्यक्ति सिंथेसिस पर पीएसएनआर, एसएसआईएम, और एलपीआईपीएस का उपयोग करके मात्रात्मक तुलना। पूर्ण प्रसारण पर, प्रस्तावित विधि दोनों कार्यों पर उच्चतम पीएसएनआर प्राप्त करती है और नवीन-दृश्य सिंथेसिस पर गॉसियनएवाटर्स के साथ एलपीआईपीएस पर प्रतिस्पर्धी रहती है, जबकि 5% सेटिंग चरम बैंडवidth प्रतिबंधों के तहत गुणवत्ता व्यापार-बंद को दर्शाता है।
इसके बाद, शोधकर्ताओं ने प्रगतिशील रेंडरिंग का परीक्षण किया। यह एक एनवीडिया आरटीएक्स 4090 पर किया गया था, जिसमें 24Gb का वीआरएएम था, 550x802px रिज़ॉल्यूशन पर। इस परिदृश्य में, लेखकों का कहना है कि 25% बजट सभी ‘स्तर 1’ गॉसियन का उपयोग करेगा, साथ ही स्तर 2 गॉसियन का एक उपसेट, जो यह दिखाता है कि गॉसियन समूह विवरण को कैसे जोड़ते हैं और निम्न संख्या समूहों में आधार कैनवास का निर्माण कैसे करते हैं:

नवीन-दृश्य और नवीन-अभिव्यक्ति सिंथेसिस के लिए विभिन्न प्रसारण बजट के तहत प्रदर्शन, जो यह दिखाता है कि गुणवत्ता अधिक गॉसियन और डेटा के प्रसार के साथ धीरे-धीरे गॉसियनएवाटर्स की ओर बढ़ती है या उससे अधिक हो जाती है, जबकि वास्तविक समय की गति बनी रहती है, एक आरटीएक्स 4090 पर।
लेखकों का टिप्पणी है:
‘केवल 2.60 एमबी प्रसारित (5% बजट) के साथ, अवतार पहले से ही उचित गुणवत्ता प्राप्त करता है। जैसे ही उच्च-स्तरीय गॉसियन प्रसारित होते हैं, महीन संरचनाएं जैसे कि शर्ट बटन, दांत, और बाल धीरे-धीरे तेज हो जाते हैं जबकि समयिक स्थिरता बनी रहती है। ‘
‘100% प्रसारण पर, हमारा दृष्टिकोण रेंडरिंग गुणवत्ता प्राप्त करता है जो एसओटीए विधियों के साथ तुलनीय है। उल्लेखनीय है कि फ्रेम दर में कोई महत्वपूर्ण गिरावट नहीं है, संभवतः क्योंकि 3DGS कार्यभार अभी तक जीपीयू को संतृप्त नहीं करता है।’
हालांकि, लेखकों का कहना है कि मल्टी-यूज़र वीआर परिदृश्यों में, 3D गॉसियन की संख्या जल्दी से जीपीयू रास्टरीकरण को एक बोतलनेक बना देगी, जिसमें प्रस्तावित दृष्टिकोण दृश्य गुणवत्ता के खिलाफ प्राथमिकों की संख्या को व्यापार करने की अनुमति देता है, जिससे रेंडर को कम करने में मदद मिलती है:
हालांकि पत्र में इसका विवरण नहीं किया गया है, परियोजना साइट पर अतिरिक्त परीक्षण तुलनाएं भी हैं, जिनमें मेगा हाइब्रिड मेश-गॉसियन अवतार परियोजना भी शामिल है:
प्ले करने के लिए क्लिक करें। पत्र की साथी परियोजना साइट से, एक श्रृंखला के पूरक वीडियो में से एक, जो नवीन-दृश्य सिंथेसिस के संदर्भ में नई दृष्टिकोण की तुलना करता है।
निष्कर्ष
गॉसियन स्प्लैटिंग बनी रह सकती है या नहीं, या यहां तक कि इंटरैक्टिव स्ट्रीमिंग के शुरुआती दिनों की तरह याद की जा सकती है – एआई-संचालित या एआई-सहायता प्राप्त 3D-जागरूक प्रतिनिधित्व अनुभव, जिनमें वीडियो चैट, वर्चुअल शॉपिंग, मार्ग नेविगेशन, और विभिन्न मनोरंजन अनुप्रयोग शामिल हैं – यह हो सकता है कि वैकल्पिक प्रौद्योगिकियां या दृष्टिकोण जीत जाएं, या जीएसप्लैट सबसे विश्वसनीय एआई-वीडियो प्रतिनिधित्व साबित हो:
यदि कुछ भी हो, तो यह दिलचस्प नई पत्र इस नए डोमेन के दायरे का एक छोटा सा हिस्सा संकेत देता है, जबकि हमें शायद नॉस्टैल्जिक रूप से योरे के बैंडवidth-भूखे इंटरनेट की याद दिलाता है।
* मैं ‘3D’ का अर्थ विशेष चश्मे की आवश्यकता वाले अनुभव से नहीं लेता, बल्कि मल्टीमीडिया सामग्री में X/Y/Z समन्वय के कुछ प्रकार की समझ वाले अनुभवों से लेता हूं।
पहली बार बुधवार, 18 मार्च, 2026 को प्रकाशित।










