एआई मॉडल और प्लेटफ़ॉर्म

यूनी3डी: एकीकृत 3डी प्रतिनिधित्व का अन्वेषण

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

पाठ और दृश्यों के प्रतिनिधित्व को बढ़ाने पर हाल के वर्षों में शोध का एक प्रमुख केंद्र रहा है। हाल के दिनों में किए गए विकास और शोध ने भाषा सीखने और दृष्टि में कई क्रांतियों को जन्म दिया है। हालांकि, पाठ और दृश्य प्रतिनिधित्व को बढ़ाने की लोकप्रियता के बावजूद, 3डी दृश्यों और वस्तुओं के प्रतिनिधित्व को बढ़ाने पर पर्याप्त चर्चा नहीं हुई है।

आज, हम यूनी3डी पर चर्चा करेंगे, जो एक 3डी फाउंडेशन मॉडल है जो एकीकृत 3डी प्रतिनिधित्व का अन्वेषण करने का उद्देश्य रखता है। यूनी3डी फ्रेमवर्क एक 2डी इनिशियलाइज्ड वीआईटी फ्रेमवर्क का उपयोग करता है, जो पूरी तरह से प्री-ट्रेन्ड है, ताकि यह छवि-पाठ सुविधाओं को उनके संबंधित 3डी पॉइंट क्लाउड सुविधाओं के साथ संरेखित कर सके।

यूनी3डी फ्रेमवर्क पूर्व-शिक्षा कार्यों और एक सरल वास्तुकला का उपयोग करके पूर्व-प्रशिक्षित 2डी मॉडलों और छवि-पाठ-संरेखित मॉडलों की बहुतायत का लाभ उठाने के लिए प्रारंभिककरण और लक्ष्य के रूप में क्रमशः। यह दृष्टिकोण 2डी मॉडलों और रणनीतियों को 3डी दुनिया में स्केल करने की उनकी पूरी क्षमता को छोड़ देता है।

इस लेख में, हम 3डी कंप्यूटर विजन और यूनी3डी फ्रेमवर्क में गहराई से जाने का इरादा रखते हैं, जिसमें मॉडल की आवश्यक अवधारणाओं और वास्तुकला का अन्वेषण किया जाएगा। तो आइए शुरू करें।

यूनी3डी और 3डी प्रतिनिधित्व सीखना: एक परिचय

पिछले कुछ वर्षों में, कंप्यूटर विजन एआई उद्योग में सबसे अधिक निवेश वाले क्षेत्रों में से एक के रूप में उभरा है। 2डी कंप्यूटर विजन फ्रेमवर्क में महत्वपूर्ण प्रगति के बाद, डेवलपर्स ने 3डी कंप्यूटर विजन पर अपना ध्यान केंद्रित किया है। यह क्षेत्र, विशेष रूप से 3डी प्रतिनिधित्व सीखना, कंप्यूटर ग्राफिक्स, मशीन लर्निंग, कंप्यूटर विजन और गणित के तत्वों को एक साथ लाता है ताकि 3डी ज्यामिति के प्रसंस्करण और समझ को स्वचालित किया जा सके। लिडार जैसे 3डी सेंसर के तेजी से विकास, साथ ही उनके एआर/वीआर उद्योग में व्यापक अनुप्रयोगों के साथ, 3डी प्रतिनिधित्व सीखने में बढ़ती रुचि का परिणाम है। इसके संभावित अनुप्रयोग दैनिक रूप से बढ़ रहे हैं।

हालांकि मौजूदा फ्रेमवर्कों ने 3डी मॉडल वास्तुकला, कार्य-उन्मुख मॉडलिंग और सीखने के उद्देश्यों में उल्लेखनीय प्रगति दिखाई है, अधिकांश 3डी वास्तुकला को एक tương đối छोटे पैमाने पर सीमित डेटा, पैरामीटर और कार्य परिदृश्यों के साथ अन्वेषण करते हैं। स्केलेबल 3डी प्रतिनिधित्व सीखने की चुनौती, जो विभिन्न वातावरणों में वास्तविक समय अनुप्रयोगों में लागू की जा सकती है, बड़े पैमाने पर अन्वेषणित रहती है।

आगे बढ़ते हुए, पिछले कुछ वर्षों में, बड़े पैमाने पर पूर्व-प्रशिक्षित भाषा मॉडलों को स्केल करने से प्राकृतिक भाषा प्रसंस्करण डोमेन में क्रांति आ गई है, और हाल के कार्यों से संकेत मिलता है कि डेटा और मॉडल स्केलिंग का उपयोग करके 2डी से भाषा में प्रगति को अनुवादित करना संभव है, जो डेवलपर्स को 3डी प्रतिनिधित्व सीखने के लिए इस सफलता को दोहराने और पुनः प्रयास करने का अवसर प्रदान करता है।

यूनी3डी एक स्केलेबल और एकीकृत पूर्व-प्रशिक्षण 3डी फ्रेमवर्क है जो बड़े पैमाने पर 3डी प्रतिनिधित्व सीखने के उद्देश्य से विकसित किया गया है, जो एक अरब से अधिक पैरामीटर, 10 मिलियन से अधिक छवियों और 70 मिलियन से अधिक पाठों के साथ-साथ एक मिलियन से अधिक 3डी आकारों के पैमाने पर अपनी सीमाओं का परीक्षण करता है। नीचे दी गई छवि यूनी3डी फ्रेमवर्क में पैरामीटर के खिलाफ शून्य-शॉट सटीकता की तुलना दिखाती है। यूनी3डी फ्रेमवर्क 3डी प्रतिनिधित्व को 6 मिलियन से अधिक एक अरब तक सफलतापूर्वक स्केल करता है।

यूनी3डी फ्रेमवर्क में एक 2डी वीआईटी या विजन ट्रांसफॉर्मर होता है जो 3डी एनकोडर के रूप में कार्य करता है, जिसे पूरी तरह से प्री-ट्रेन्ड किया जाता है ताकि यह छवि-पाठ सुविधाओं को 3डी पॉइंट क्लाउड सुविधाओं के साथ संरेखित कर सके। यूनी3डी फ्रेमवर्क पूर्व-शिक्षा कार्यों और एक सरल वास्तुकला का उपयोग करके पूर्व-प्रशिक्षित 2डी मॉडलों और छवि-पाठ-संरेखित मॉडलों की बहुतायत का लाभ उठाने के लिए प्रारंभिककरण और लक्ष्य के रूप में क्रमशः, जो 2डी मॉडलों और रणनीतियों को 3डी दुनिया में स्केल करने की उनकी पूरी क्षमता को छोड़ देता है।

  1. मॉडल को 6एम से अधिक एक अरब पैरामीटर तक स्केल करना।
  2. 2डी प्रारंभिकरण से पाठ पर्यवेक्षित दृश्य स्व-पर्यवेक्षित सीखने तक।
  3. पाठ-छवि लक्ष्य मॉडल को 150 मिलियन से अधिक एक अरब पैरामीटर तक स्केल करना।

यूनी3डी द्वारा प्रदान किए गए लचीले और एकीकृत फ्रेमवर्क के तहत, डेवलपर्स प्रत्येक घटक को स्केल करने पर प्रदर्शन में एक सुसंगत वृद्धि देखते हैं। बड़े पैमाने पर 3डी प्रतिनिधित्व सीखने से भी 2डी और स्केल-अप रणनीतियों को साझा करने का लाभ होता है।

जैसा कि नीचे दी गई छवि में देखा जा सकता है, यूनी3डी फ्रेमवर्क पिछले कला की तुलना में कुछ-शॉट और शून्य-शॉट सेटिंग्स में प्रदर्शन में वृद्धि दिखाता है। यह ध्यान देने योग्य है कि यूनी3डी फ्रेमवर्क मॉडेलनेट पर शून्य-शॉट वर्गीकरण सटीकता स्कोर में 88% से अधिक का प्रदर्शन करता है, जो कई राज्य-ऑफ-द-आर्ट पर्यवेक्षित विधियों के प्रदर्शन के बराबर है।

इसके अलावा, यूनी3डी फ्रेमवर्क अन्य प्रतिनिधित्व 3डी कार्यों जैसे भाग सेगमेंटेशन और ओपन वर्ल्ड समझ में शीर्ष स्तर की सटीकता और प्रदर्शन प्रदान करता है। यूनी3डी फ्रेमवर्क 2डी दृष्टि और 3डी दृष्टि के बीच की खाई को पुल करने और विभिन्न मोडलिटी में 2डी और 3डी दृष्टि के समन्वय को सुविधाजनक बनाने के लिए एकीकृत पूर्व-प्रशिक्षण दृष्टिकोण का उपयोग करके 3डी फाउंडेशनल मॉडल को स्केल करने का लक्ष्य रखता है।

यूनी3डी: संबंधित कार्य

यूनी3डी फ्रेमवर्क 3डी प्रतिनिधित्व सीखने और फाउंडेशनल मॉडल्स के विकास से प्रेरित है, विशेष रूप से विभिन्न मोडलिटी के तहत।

3डी प्रतिनिधित्व सीखना

3डी प्रतिनिधित्व सीखने की विधि बादल बिंदुओं का उपयोग वस्तु की 3डी समझ के लिए करती है, और यह क्षेत्र हाल के दिनों में डेवलपर्स द्वारा बहुत अन्वेषित किया गया है। यह देखा गया है कि इन बादल बिंदुओं को स्व-पर्यवेक्षित 3डी पूर्व-शिक्षा कार्यों का उपयोग करके पूर्व-प्रशिक्षित किया जा सकता है, जिसमें मास्क बिंदु मॉडलिंग, स्व-निर्माण और विरोधी सीखना शामिल हैं।

यह ध्यान देने योग्य है कि ये विधियां सीमित डेटा के साथ काम करती हैं और अक्सर 2डी या एनएलपी से 3डी तक बहुमोडल प्रतिनिधित्व की जांच नहीं करती हैं। हालांकि, क्लिप फ्रेमवर्क की हाल की सफलता ने कंट्रास्टिव सीखने की विधि का उपयोग करके कच्चे पाठ से दृश्य अवधारणाओं को सीखने में उच्च दक्षता दिखाई है, और इसके बाद 3डी प्रतिनिधित्व सीखने के लिए छवि, पाठ और बादल बिंदु सुविधाओं को संरेखित करने के लिए समान विरोधी सीखने की विधि का उपयोग किया जाता है।

फाउंडेशनल मॉडल्स

डेवलपर्स बहुमोडल प्रतिनिधित्व को स्केल करने और एकीकृत करने के लिए फाउंडेशनल मॉडल्स को डिज़ाइन करने पर काम कर रहे हैं। उदाहरण के लिए, एनएलपी डोमेन में, डेवलपर्स पूर्व-प्रशिक्षित भाषा मॉडल्स को स्केल करने वाले फ्रेमवर्क पर काम कर रहे हैं, और यह धीरे-धीरे एनएलपी उद्योग को क्रांतिकारी बना रहा है। इसके अलावा, 2डी दृष्टि डोमेन में भी प्रगति देखी जा रही है क्योंकि डेवलपर्स डेटा और मॉडल स्केलिंग तकनीकों का उपयोग करके भाषा से 2डी मॉडल्स में प्रगति करने में मदद कर रहे हैं, हालांकि ऐसे फ्रेमवर्क को 3डी मॉडल्स के लिए दोहराना मुश्किल है क्योंकि 3डी डेटा की सीमित उपलब्धता और 3डी फ्रेमवर्क को एकीकृत और स्केल करने में आने वाली चुनौतियों के कारण।

उपरोक्त दो कार्य क्षेत्रों से सीखने के बाद, डेवलपर्स ने यूनी3डी फ्रेमवर्क बनाया है, जो एक अरब से अधिक पैरामीटर वाला पहला 3डी फाउंडेशनल मॉडल है, जो एक एकीकृत वीआईटी या विजन ट्रांसफॉर्मर वास्तुकला का उपयोग करता है, जो डेवलपर्स को 3डी या एनएलपी रणनीतियों का उपयोग करके मॉडल को स्केल करने की अनुमति देता है। डेवलपर्स उम्मीद करते हैं कि यह विधि 2डी और 3डी दृष्टि के बीच की खाई को पुल करने में मदद करेगी और बहुमोडल समन्वय को सुविधाजनक बनाएगी।

यूनी3डी: विधि और वास्तुकला

उपरोक्त छवि यूनी3डी फ्रेमवर्क का एक सामान्य अवलोकन दिखाती है, जो एक स्केलेबल और एकीकृत पूर्व-प्रशिक्षण 3डी फ्रेमवर्क है जो बड़े पैमाने पर 3डी प्रतिनिधित्व सीखने के लिए डिज़ाइन किया गया है। डेवलपर्स 70 मिलियन से अधिक पाठों और 10 मिलियन छवियों के साथ-साथ एक मिलियन से अधिक 3डी आकारों का उपयोग करके यूनी3डी फ्रेमवर्क को एक अरब पैरामीटर तक स्केल करते हैं। यूनी3डी फ्रेमवर्क एक 2डी वीआईटी या विजन ट्रांसफॉर्मर का उपयोग 3डी एनकोडर के रूप में करता है, जिसे पूरी तरह से प्री-ट्रेन्ड किया जाता है ताकि यह पाठ-छवि सुविधाओं को 3डी पॉइंट क्लाउड सुविधाओं के साथ संरेखित कर सके, जिससे यूनी3डी फ्रेमवर्क विभिन्न बेंचमार्क पर कुशल और सटीक परिणाम प्रदान कर सके। आइए अब यूनी3डी फ्रेमवर्क के कार्य को विस्तार से देखें।

यूनी3डी फ्रेमवर्क को स्केल करना

बादल बिंदु प्रतिनिधित्व सीखने पर पिछले अध्ययनों ने मुख्य रूप से विशिष्ट मॉडल वास्तुकला को डिज़ाइन करने पर ध्यान केंद्रित किया है जो विभिन्न अनुप्रयोगों में बेहतर प्रदर्शन प्रदान करते हैं, और वे एक सीमित मात्रा में डेटा पर काम करते हैं क्योंकि छोटे पैमाने पर डेटासेट हैं। हालांकि, हाल के अध्ययनों ने 3डी में स्केलेबल पूर्व-प्रशिक्षण की संभावना का अन्वेषण करने का प्रयास किया है, लेकिन 3डी डेटा की सीमित उपलब्धता के कारण कोई बड़ा परिणाम नहीं मिला है। 3डी फ्रेमवर्क की स्केलेबिलिटी समस्या को हल करने के लिए, यूनी3डी फ्रेमवर्क एक वैनिला ट्रांसफॉर्मर संरचना की शक्ति का लाभ उठाता है जो लगभग एक विजन ट्रांसफॉर्मर की नकल करता है, और यह 2डी या एनएलपी स्केलिंग-अप रणनीतियों का उपयोग करके मॉडल के आकार को स्केल करने की समस्या को हल कर सकता है।

बादल बिंदु प्रतिनिधित्व सीखने पर पिछले अध्ययनों ने मुख्य रूप से विशिष्ट मॉडल वास्तुकला को डिज़ाइन करने पर ध्यान केंद्रित किया है जो विभिन्न अनुप्रयोगों में बेहतर प्रदर्शन प्रदान करते हैं, और वे एक सीमित मात्रा में डेटा पर काम करते हैं क्योंकि छोटे पैमाने पर डेटासेट हैं। हालांकि, हाल के अध्ययनों ने 3डी में स्केलेबल पूर्व-प्रशिक्षण की संभावना का अन्वेषण करने का प्रयास किया है, लेकिन 3डी डेटा की सीमित उपलब्धता के कारण कोई बड़ा परिणाम नहीं मिला है। 3डी फ्रेमवर्क की स्केलेबिलिटी समस्या को हल करने के लिए, यूनी3डी फ्रेमवर्क एक वैनिला ट्रांसफॉर्मर संरचना की शक्ति का लाभ उठाता है जो लगभग एक विजन ट्रांसफॉर्मर की नकल करता है, और यह 2डी या एनएलपी स्केलिंग-अप रणनीतियों का उपयोग करके मॉडल के आकार को स्केल करने की समस्या को हल कर सकता है।

यूनी3डी को प्रारंभ करना

3डी प्रतिनिधित्व को स्केल करने में शामिल पिछले कार्यों द्वारa एक अन्य प्रमुख चुनौती का सामना करना पड़ा, जो मॉडल के बड़े आकार के कारण अभिसरण और ओवरफिटिंग में कठिनाइयों का कारण बनता है। इस बाधा को पार करने के लिए एक प्रभावी दृष्टिकोण यह है कि विशिष्ट 3डी पूर्व-शिक्षा कार्यों के साथ 3डी बैकबोन को पूर्व-प्रशिक्षित करना और पूर्व-प्रशिक्षित पैरामीटर को प्रारंभ करना। हालांकि, यह दृष्टिकोण उच्च प्रशिक्षण लागत के साथ आता है, और यह क्रॉस-मॉडल सीखने के लिए एक मजबूत प्रारंभिकरण स्थापित करना मुश्किल है क्योंकि 3डी डेटा की सीमित उपलब्धता है।

यूनी3डी फ्रेमवर्क एक वैनिला ट्रांसफॉर्मर का लाभ उठाता है, जिसकी संरचना वीआईटी के समान है। इस दृष्टिकोण के साथ, यूनी3डी फ्रेमवर्क अन्य मोडलिटी के साथ पूर्व-प्रशिक्षित बड़े मॉडल को प्राकृतिक रूप से अपना सकता है।

बहुमोडल संरेखण

यूनी3डी फ्रेमवर्क ओपनशेप और यूलिप फ्रेमवर्क के समान दृष्टिकोण का उपयोग करके छवि, भाषा और बादल बिंदुओं के बीच बहुमोडल संरेखण सीखने का प्रयास करता है। इसके अलावा, अन्य विधियों के साथ एक निष्पक्ष तुलना सुनिश्चित करने के लिए, यूनी3डी फ्रेमवर्क ओपनशेप द्वारा प्रदान किए गए 3डी डेटासेट का उपयोग प्रशिक्षण के लिए करता है। इस 3डी डेटासेट में 4 3डी डेटासेट शामिल हैं:

  1. ओब्जवर्स।
  2. शेपनेट।
  3. 3डी-फ्यूचर।
  4. एबीओ।

प्रयोग और परिणाम

यूनी3डी फ्रेमवर्क को विभिन्न सेटिंग्स में परीक्षण किया जाता है, और विभिन्न वर्गीकरण कार्यों में इसका प्रदर्शन देखा जाता है, जिसमें शून्य-शॉट और कुछ-शॉट सेटिंग्स में इसका प्रदर्शन, ओपन वर्ल्ड समझ और अधिक शामिल हैं। आइए इन परिणामों को विस्तार से देखें।

शून्य-शॉट आकार वर्गीकरण

यूनी3डी फ्रेमवर्क के प्रदर्शन का मूल्यांकन शून्य-शॉट आकार वर्गीकरण कार्यों में करने के लिए, डेवलपर्स मॉडेलनेट, स्कैनओबीजेएनएन और ओब्जवर्स-एलवीआईएस बेंचमार्क डेटासेट पर प्रयोग करते हैं। मॉडेलनेट और स्कैनओबीजेएनएन वर्गीकरण कार्यों के लिए व्यापक रूप से उपयोग किए जाने वाले डेटासेट हैं, और वे क्रमशः 15 और 40 वस्तु श्रेणियों की सुविधा प्रदान करते हैं, जबकि ओब्जवर्स-एलवीआईएस बेंचमार्क एक साफ़ और एनोटेटेड डेटासेट है जिसमें 1,100+ श्रेणियों में 40,000 से अधिक वस्तुएं हैं। फ्रेमवर्क की तुलना नीचे दी गई छवि में दिखाई गई है, और जैसा कि देखा जा सकता है, यूनी3डी फ्रेमवर्क विभिन्न सेटिंग्स में पिछले राज्य-ऑफ-द-आर्ट फ्रेमवर्क को महत्वपूर्ण रूप से बेहतर प्रदर्शन करता है।

कुछ-शॉट रैखिक प्रोबिंग

एआई में, रैखिक प्रोबिंग एक सामान्य विधि है जिसका उपयोग मॉडल द्वारा सीखे गए प्रतिनिधित्व का मूल्यांकन करने के लिए किया जाता है। यूनी3डी की रैखिक प्रोबिंग क्षमता का मूल्यांकन करने के लिए, डेवलपर्स ओपनशेप के समान सेटिंग्स का उपयोग करके यूनी3डी फ्रेमवर्क के पैरामीटर को फ्रीज करते हैं। इसके बाद, डेवलपर्स ओब्जवर्स-एलवीआईएस डेटासेट पर यूनी3डी के लिए एक रैखिक वर्गीकरणकर्ता को प्रशिक्षित करते हैं। नीचे दी गई छवि ओब्जवर्स-एलवीआईएस डेटासेट पर विभिन्न फ्रेमवर्क की रैखिक प्रोबिंग क्षमता को दर्शाती है, और यह 10 यादृच्छिक बीजों के साथ मॉडल के औसत प्रदर्शन को दर्शाती है। जैसा कि देखा जा सकता है, यूनी3डी फ्रेमवर्क विभिन्न कुछ-शॉट सेटिंग्स में मौजूदा विधियों को महत्वपूर्ण रूप से बेहतर प्रदर्शन करता है।

ओपन वर्ल्ड समझ

यूनी3डी फ्रेमवर्क की क्षमता का मूल्यांकन करने के लिए वास्तविक दुनिया के आकार और वस्तुओं को वास्तविक समय में समझने के लिए, डेवलपर्स स्कैननेट और क्लिप डेटासेट का उपयोग करके यूनी3डी के प्रदर्शन का अन्वेषण करते हैं। यह ध्यान देने योग्य है कि ग्राउंड ट्रुथ इंस्टेंट सेगमेंटेशन उपलब्ध है, और प्राथमिक उद्देश्य प्रत्येक दृश्य की व्यक्तिगत इंस्टेंट की श्रेणी को पहचानना है एक शून्य-शॉट सेटिंग में। परिणाम नीचे दी गई छवि में दिखाए गए हैं। जैसा कि देखा जा सकता है, यूनी3डी फ्रेमवर्क वास्तविक दुनिया की समझ और पहचान में असाधारण परिणाम प्रदान करता है। यूनी3डी फ्रेमवर्क मौजूदा फ्रेमवर्क को महत्वपूर्ण रूप से बेहतर प्रदर्शन करता है,尽管 यह वास्तविक दुनिया के डेटासेट पर प्रशिक्षित नहीं किया गया है।

क्रॉस-मॉडल रिट्रीवल

यूनी3डी फ्रेमवर्क द्वारा सीखे गए बहुमोडल प्रतिनिधित्व छवियों या पाठ से 3डी आकार को प्राकृतिक रूप से पुनर्प्राप्त करने की अनुमति देते हैं। 3डी आकार को पुनर्प्राप्त करने के लिए, मॉडल 3डी आकार और एक प्रश्न पाठ प्रोम्प्ट या प्रश्न छवि के बीच कोसाइन समानता की गणना करता है। फिर, यह केएनएन या के निकटतम पड़ोसी अल्गोरिथ्म का उपयोग करके 3डी आकार को उत्पन्न करता है जो प्रश्न के सबसे अधिक समान होता है, और परिणाम नीचे दी गई छवि में दिखाए गए हैं। जैसा कि देखा जा सकता है, यूनी3डी फ्रेमवर्क वास्तविक दुनिया की छवियों का उपयोग करके 3डी आकार को सफलतापूर्वक पुनर्प्राप्त करता है। इसके अलावा, यह ध्यान देने योग्य है कि प्रशिक्षण छवियों का उपयोग केवल रेंडरिंग उद्देश्यों के लिए किया जाता है, और प्रशिक्षण छवियों और वास्तविक दुनिया की छवियों के बीच की खाई महत्वपूर्ण है। इसके अलावा, मॉडल दो इनपुट छवियों का उपयोग करके दोनों इनपुट छवियों के लिए समान आकार को पुनर्प्राप्त करता है जो दोनों छवियों के बीच कोसाइन समानता का उपयोग करके उनके एम्बेडेड 3डी आकार को पुनर्प्राप्त करता है। परिणाम दिलचस्प हैं क्योंकि वे यूनी3डी की विविध 3डी प्रतिनिधित्व सीखने और कई 2डी संकेतों को समझने की क्षमता को दर्शाते हैं।

पहले कॉलम में, फ्रेमवर्क दो प्रश्न छवियों का उपयोग करके 3डी आकार को पुनर्प्राप्त करता है जो प्रश्न छवियों के सबसे अधिक समान होता है। दूसरे कॉलम में, फ्रेमवर्क दो इनपुट छवियों का उपयोग करके 3डी आकार को पुनर्प्राप्त करता है जो दोनों इनपुट छवियों के लिए समान होता है। अंतिम कॉलम में, मॉडल प्रश्न पाठ का उपयोग करके 3डी आकार को पुनर्प्राप्त करता है जो प्रश्न पाठ प्रोम्प्ट के सबसे अधिक समान होता है।

अंतिम विचार

इस लेख में, हमने यूनी3डी पर चर्चा की है, जो एक स्केलेबल और एकीकृत पूर्व-प्रशिक्षण 3डी फ्रेमवर्क है जो बड़े पैमाने पर 3डी प्रतिनिधित्व सीखने के उद्देश्य से विकसित किया गया है, जो एक अरब पैरामीटर से अधिक, 10 मिलियन से अधिक छवियों और 70 मिलियन से अधिक पाठों के साथ-साथ एक मिलियन से अधिक 3डी आकारों के पैमाने पर अपनी सीमाओं का परीक्षण करता है। यूनी3डी फ्रेमवर्क के डेवलपर्स ने एक वैनिला ट्रांसफॉर्मर का उपयोग किया है जिसकी संरचना वीआईटी के समान है, जो डेवलपर्स को 2डी या एनएलपी स्केलिंग-अप रणनीतियों का उपयोग करके मॉडल को स्केल करने की अनुमति देता है। इसके अलावा, यूनी3डी फ्रेमवर्क एक व्यापक श्रृंखला के 2डी फ्रेमवर्क और 2डी रणनीतियों को 3डी दुनिया में ले जाने का लाभ उठा सकता है। प्रयोगात्मक परिणामों ने पहले ही यूनी3डी फ्रेमवर्क की बड़ी संभावना का प्रदर्शन किया है, क्योंकि यूनी3डी फ्रेमवर्क विभिन्न सेटिंग्स में सटीक और कुशल परिणाम प्रदान करता है, और मौजूदा राज्य-ऑफ-द-आर्ट फ्रेमवर्क को बेहतर प्रदर्शन करता है।

एक इंजीनियर पेशे से, एक लेखक दिल से। कुनाल एक तकनीकी लेखक हैं जिन्हें एआई और एमएल के प्रति गहरा प्यार और समझ है, जो अपने आकर्षक और जानकारीपूर्ण दस्तावेज़ के माध्यम से इन क्षेत्रों में जटिल अवधारणाओं को सरल बनाने के लिए समर्पित हैं।