एआई मॉडल और प्लेटफ़ॉर्म

अलीबाबा का अमैप 24 घंटे तक एक जीपीयू पर विश्व मॉडल चलाता है

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

अलीबाबा का लोकेशन-आधारित सेवा प्लेटफ़ॉर्म अमैप कहता है कि उसका इंटरैक्टिव वर्ल्ड मॉडल एबीओटी-वर्ल्ड-0 अब 24 घंटे तक एक निरंतर सत्र को बनाए रखने में सक्षम है, और उसने इसे एक सीकेबल रिकॉर्ड के रूप में प्रकाशित किया है, न कि एक हाइलाइट रील के रूप में। पेज किसी को भी दिन के किसी भी सेकंड में कूदने देता है, छह-, बारह- और अठारह-घंटे के निशान पर तयशुदा प्रवेश बिंदुओं के साथ, घास के मैदान, रेगिस्तान, शहर और बर्फ के मैदान के दृश्यों के माध्यम से पांच और पूर्ण रन के साथ।

यह आंकड़ा इसलिए महत्वपूर्ण है क्योंकि यह एक सीमा को पार करता है। एक इंटरैक्टिव वर्ल्ड मॉडल उपयोगकर्ता की कार्रवाई के प्रतिक्रियास्वरूप फ्रेम दर फ्रेम वीडियो उत्पन्न करता है, इसलिए प्रत्येक नई खंड मॉडल द्वारा उत्पन्न फ्रेमों पर निर्भर करता है जो कुछ क्षण पहले उत्पन्न हुए थे। छोटी त्रुटियां आगे बढ़ती हैं, और दृश्य अंततः खराब हो जाता है। अमैप कहता है कि इस वर्ग में अधिकांश प्रणालियां 30 सेकंड से एक मिनट तक एक साथ रहती हैं। अपने 16 जुलाई, 2026 की घोषणा में मॉडल की घोषणा एक घंटे से अधिक समय तक की गई थी।

लॉन्गफोर्सिंग कैसे रन को स्थिर रखता है

अमैप द्वारा श्रेय दी गई विधि को लॉन्गफोर्सिंग कहा जाता है, जिसे तकनीकी रिपोर्ट में वर्णित किया गया है जिसे टीम ने 21 जुलाई, 2026 को पोस्ट किया था। इस तरह के मॉडल का निर्माण करने का सामान्य तरीका डिस्टिलेशन है: एक धीमी द्विदिशा शिक्षक जो एक पूरे क्लिप में एक बार में ध्यान केंद्रित कर सकता है, एक तेज़ कारण छात्र को प्रशिक्षित करता है जो केवल अतीत को देखता है, जो वास्तविक समय की बातचीत की आवश्यकता है। उस पर्यवेक्षण आमतौर पर छोटे क्लिप को कवर करता है, इसलिए छात्र कुछ सेकंड के लिए सही दिखता है और उसके बाद सुधार करता है।

लॉन्गफोर्सिंग पर्यवेक्षण को विस्तारित करता है जहां विफलताएं होती हैं। छात्र अपने आप एक लंबी रोलआउट उत्पन्न करता है, और एक शिक्षक जिसका एक लंबा समय संदर्भ है, बाद के हिस्सों की देखरेख करता है, जहां भविष्यसूचक त्रुटियों को सबसे अधिक समय मिला है। रिपोर्ट इसे संचित वितरण बदलाव और स्व-सरंक्षित ड्रिफ्ट की सुधार के रूप में फ्रेम करती है, न कि एक स्मृति तंत्र के रूप में। मॉडल से पहले के फ्रेम को अधिक सटीक रूप से याद रखने के लिए नहीं कहा जा रहा है; यह एक स्थिर दुनिया वितरण की ओर खींचा जा रहा है क्योंकि यह आगे बढ़ता है।

अमैप कहता है कि यह व्यवहार में दिखाई देता है: मॉडल रोलआउट के दौरान नए दृश्यों के साथ पर्यावरण का विस्तार करता है, जो शुरू में जिस दृश्य में शुरू हुआ था उसमें तालमेल नहीं बैठता है, और ऐसा करता है बिना उपयोगकर्ता को ताज़ा प्रॉम्प्ट डाले।

रिपोर्ट किए गए आंकड़े क्या कवर करते हैं

प्रदर्शन लिफाफा टीम के अपने उपायों से आता है। अनुकूलित कम-बिट कॉन्फ़िगरेशन के माध्यम से, रिपोर्ट एबीओटी-वर्ल्ड-0 को 720पी आउटपुट और एक निविड़ अंडकोस रटएक्स 5090 डेस्कटॉप कार्ड पर 16 फ्रेम प्रति सेकंड पर रखती है, जिसमें एक इनपुट क्रिया और पहले फ्रेम के बीच 1.2 सेकंड का समय लगता है जो इसे प्रतिबिंबित करता है, और लगभग 19 जीबी पीक वीडियो मेमोरी। नियंत्रण रन रॉ कीबोर्ड इनपुट पर दृश्य घूमने और तीसरे व्यक्ति के चरित्र आंदोलन के लिए, एक संदर्भ-चरित्र स्मृति के साथ जो एक लंबे सत्र में एक चरित्र की उपस्थिति को स्थिर रखती है।

मूल्यांकन के लिए, पेपर वर्ल्डरोमबेंच सूट के साथ-साथ विस्तारित इंटरैक्टिव रोलआउट पर परिणामों की रिपोर्ट करता है, परिणाम को प्रतिस्पर्धी नियंत्रणीयता और सुसंगत लंबी-क्षितिज दुनिया विकास के रूप में वर्णित करता है। जो प्रकाशित 24-घंटे का रिकॉर्ड जोड़ता है वह निरीक्षणीयता है: पूरा टाइमलाइन वहां है जिसे सेकंड दर सेकंड रगड़ा जा सकता है, एक तालिका में संकुचित होने के बजाय।

रिपोर्ट ने तब ध्यान आकर्षित किया जब यह उतरा। हगिंग फेस के पेपर पेज ने इसे 22 जुलाई, 2026 के लिए दिन का शीर्ष पेपर के रूप में सूचीबद्ध किया, और तब से इसे वहां 300 से अधिक अपवोट मिले हैं।

डेवलपर्स को क्या मिलता है

व्यावहारिक बदलाव हार्डवेयर है। लंबी क्षितिज इंटरैक्टिव पीढ़ी एक डेटा सेंटर कार्यभार रहा है, और अमैप का तर्क है कि एक डेस्कटॉप कार्ड अब इसका कवर करता है, जो विकासकर्ताओं, स्टूडियो और शोध समूहों के लिए प्रवेश की लागत को कम करता है जो क्लस्टर बजट के बिना काम करते हैं। यह सबसे ज्यादा निहित कृत्रिम बुद्धिमत्ता के लिए मायने रखता है, जहां नीतियों को वास्तविक हार्डवेयर से मिलने से पहले विभिन्न वातावरण के खिलाफ अभ्यास करना होता है, एक क्षेत्र जिस पर गूगल के जेमिनी रोबोटिक्स ईआर 2 से लेकर मिमिक रोबोटिक्स के वीडियो-एक्शन मॉडल ऑडी के फैक्ट्री फ्लोर पर निरंतर काम हो रहा है।

सब कुछ गिटहब रिपॉजिटरी में एक अपाचे 2.0 लाइसेंस के तहत बैठता है, जो अनुमान कोड, स्थानीय डेमो और हगिंग फेस और मॉडलस्कोप पर जारी चेकपॉइंट पर संकेत देता है। यह एबीओटी-वर्ल्ड-0 को इस साल काम करने वाले डेवलपर्स तक पहुंचाने वाले ओपन-वेट रिलीज़ की अधिक धारा के साथ रखता है, जिनमें थिंकिंग मशीन लैब का इंकलिंग शामिल है।

24-घंटे के रिकॉर्ड के साथ, टीम ने अपना प्रशिक्षण डेटा जारी किया: 30,969 एक्शन-कंडीशन वीडियो एपिसोड जो कुल 2.74 टीबी हैं, प्रत्येक एक एमपी4 को पैकेजिंग करता है जो इसे उत्पन्न करने वाली कीबोर्ड क्रियाओं के साथ, कैप्शन और दृश्य का एक विरल कैमरा-मुद्रा पुनर्निर्माण के साथ। कॉर्पस को प्रकाशित करने से बाहरी शोधकर्ता उसी सामग्री के खिलाफ प्रशिक्षित हो सकते हैं और परीक्षण कर सकते हैं कि क्या लॉन्गफोर्सिंग उनके हाथों में खड़ा रहता है, और परियोजना का रोडमैप अगले दरवाजे पर द्विदिशा शिक्षक मॉडल को रखता है।

जोनस रीव यूनाइट.एआई में एक एआई-जनरेटेड विश्लेषक है, जो कॉग्निटिव एआई, आर्टिफिशियल जनरल इंटेलिजेंस (एजीआई), और मशीन इंटेलिजेंस के सैद्धांतिक आधारों पर ध्यान केंद्रित करता है। उनका काम यह देखता है कि जीवविज्ञान और कृत्रिम प्रणालियों दोनों में सीखने, तर्क, स्मृति, और अमूर्तता कैसे उत्पन्न होती है, आधुनिक एआई आर्किटेक्चर और संज्ञान विज्ञान और मन के दर्शन में लंबे समय से चली आ रही प्रश्नों के बीच संबंध बनाते हैं।
एक अवधारणात्मक और प्रतिबिंबात्मक दृष्टिकोण के साथ, जोनस तर्क मॉडल, एजेंटिक सिस्टम, उभरने वाली संज्ञान, और संरेखण सिद्धांत जैसे ढांचे की जांच करता है, एजीआई की ओर वास्तविक प्रगति का क्या अर्थ है - और क्या नहीं - स्पष्ट करने का लक्ष्य रखते हुए। समयसीमा या हाइप का पीछा करने के बजाय, वह पहले सिद्धांतों, अवधारणात्मक कठोरता, और वर्तमान मॉडलों की सीमाओं पर जोर देता है।
जोनस रीव द्वारा लिखित लेख एआई-जनरेटेड हैं और यूनाइट.एआई की संपादकीय टीम द्वारा उन्नत एआई अवधारणाओं की सटीकता, स्पष्टता, और जिम्मेदार चर्चा सुनिश्चित करने के लिए समीक्षा की जाती है।