रोबोटिक्स और भौतिक एआई
गूगल ने जेमिनी रोबोटिक्स ईआर 2 को मल्टी-रोबोट टीमवर्क के साथ लॉन्च किया

गूगल ने जेमिनी रोबोटिक्स ईआर 2 लॉन्च किया है, जो एक एम्बॉडेड-रीजनिंग मॉडल है जो एक रोबोट के उच्च-स्तरीय योजनाकार के रूप में कार्य करता है, जबकि एक अलग मॉडल मोटर्स को संभालता है। यह जेमिनी एपीआई और गूगल एआई स्टूडियो के माध्यम से डेवलपर्स के लिए उपलब्ध है, और जेमिनी एंटरप्राइज एजेंट प्लेटफॉर्म पर निजी पूर्वावलोकन तक पहुंच है।
ईआर 2 वीडियो, छवियों, ऑडियो और पाठ को स्वीकार करता है, दृश्य के बारे में तर्क करता है, एक कार्य की योजना बनाता है जो कई मिनट तक चलता है, और फिर कुछ और को हार्डवेयर चलाने के लिए कहता है: एक दृष्टि-भाषा-क्रिया मॉडल, एक नेविगेशन एपीआई, या एक डेवलपर का अपना फंक्शन जो मॉडल को एक टूल के रूप में घोषित किया जाता है। यह कार्य के दौरान गूगल सर्च को भी कॉल कर सकता है। मॉडल कार्ड इसे जेमिनी 3.5 फ्लैश पर आधारित एक दृष्टि-भाषा मॉडल के रूप में वर्णित करता है, जिसमें 128,000-टोकन संदर्भ विंडो और 64,000 टोकन का आउटपुट है।
यह जेमिनी रोबोटिक्स-ईआर 1.6 का अनुसरण करता है, जो 14 अप्रैल, 2026 को जारी किया गया था, जिसने उपकरण पढ़ने (एक दबाव गेज या एक रासायनिक दृष्टि ग्लास की व्याख्या), एक क्षमता जोड़ी, जिसे गूगल ने बोस्टन डायनामिक्स के साथ सुविधा निरीक्षण राउंड के लिए विकसित किया था। ईआर 2 इसे डिजिटल प्रदर्शन, रैखिक स्केल, शासक और तरल थर्मामीटर तक बढ़ाता है, जिसे 10 प्रकार के उपकरणों पर परीक्षण किया जाता है।
निरंतर वीडियो क्या जोड़ता है
मूलभूत परिवर्तन यह है कि ईआर 2 एक लाइव वीडियो फीड पर कारण बनता है, न कि स्थिर फ्रेम, जो इसे यह निर्धारित करने की अनुमति देता है कि एक चरण समाप्त हो गया है या नहीं।
इसके दो क्षमताएं हैं। प्रगति वर्गीकरण मॉडल को प्रत्येक फ्रेम को पांच पूर्णता बैंड में से एक में वर्गीकृत करने के लिए कहता है, 0-20% से 80-100% तक; गूगल 57.4% सटीकता की रिपोर्ट करता है। पल खोजने में यह मॉडल से एक महत्वपूर्ण घटना के बिल्कुल उस फ्रेम को इंगित करने के लिए कहता है जहां एक कप पर्याप्त भरा हुआ है जिससे डालना बंद करने के लिए। कंपनी 0.96 सेकंड के माध्यम से त्रुटि के साथ 91.3% सटीकता की रिपोर्ट करती है, और कहती है कि मॉडल इसे बड़े मॉडल की तुलना में लगभग चार गुना निष्पादन गति से और कम गणना के लिए वितरित करता है।
सब-सेकंड टाइमिंग वास्तविक मशीन पर वह हिस्सा है जो महत्वपूर्ण है। एक रोबोट जो बता सकता है कि एक चरण 60% पूरा हो गया है या पूरी तरह से विफल हो गया है, वह चरण को फिर से करने के बजाय कार्य प्रवाह को पुनः आरंभ करने या एक ऑपरेटर की प्रतीक्षा करने के बजाय। ईआर 2 जेमिनी लाइव एपीआई के द्विदिश एंडपॉइंट के माध्यम से प्रवाहित होता है, जो यह है कि गूगल कारण लूप को क्रियाओं के बीच रुकने और सोचने के विराम को डालने से रोकता है। निष्कर्ष लेटेंसी को शारीरिक नियंत्रण के लिए पर्याप्त कम करना वही प्रतिबंध है जो रोबोटिक्स विक्रेताओं को विशिष्ट ऑन-रोबोट सिलिकॉन और एकल-जीपीयू रियल-टाइम मॉडल की ओर धकेलता है।
दो रोबोट, एक काम
दूसरी नई क्षमता मल्टी-रोबोट सहयोग है: विभिन्न मशीनें एक कार्य की सेमांटिक समझ साझा करती हैं और उन्हें एक दूसरे के बीच काम सौंपती हैं, इस तर्क पर कि एक पहियेदार आधार और एक जोड़ी पैर एक ही काम के विभिन्न भागों के लिए उपयुक्त हैं। डीपमाइंड का प्रदर्शन एप्ट्रोनिक्स के अपोलो 2 मानवनुमा को फ्रैंका डुओ बाय-आर्म प्लेटफ़ॉर्म के साथ जोड़ता है। एक दूसरे डेमो में ईआर 2 बोस्टन डायनामिक्स के स्पॉट पर नेविगेशन और मैनिपुलेटर एपीआई चला रहा है ताकि एक वस्तु को एक बोले गए कमांड पर लाया जा सके।
यह सभी हार्डवेयर पर चलता है जो गूगल नहीं बनाता है, जो अब इस बाजार का अधिकांश हिस्सा है: मॉडल एक फ्रंटियर लैब से आता है और बाहें, पैर और ग्रिपर भागीदारों से आते हैं, जो कोबोट निर्माताओं और प्लेटफ़ॉर्म-स्तर के एम्बॉडेड स्टैक के पीछे एक ही विभाजन है।
ईआर 2 तीन-मॉडल परिवार के हिस्से के रूप में आया। जेमिनी रोबोटिक्स टीम की साथी शोध पोस्ट जेमिनी रोबोटिक्स 2 को कवर करती है, जो एक क्रिया मॉडल है जो पूर्ण मानवनुमा रोबोटों को नियंत्रित करता है, और जेमिनी रोबोटिक्स ऑन-डिवाइस 2, जो स्थानीय रूप से चलता है और कुछ घंटों में कम से कम 200 उदाहरणों से एक नए बाय-आर्म रोबोट के अनुकूल होता है। दोनों प्रारंभिक पहुंच भागीदारों के लिए जाते हैं न कि खुले एपीआई के लिए।
टीम ने उस क्रिया मॉडल के पीछे की सफलता दर भी प्रकाशित की, जिसने एक ही चेकपॉइंट से तीन अलग-अलग रोबोट शरीरों को नियंत्रित किया। अपोलो 2 इंस्पायर हाथों से लैस एक अलमारी से 76.3% बार वस्तुओं को उठाता है, एक टेबल से 68.4% और फर्श से 45.7%। पांच-अंगुली का काम 22-डिग्री की स्वतंत्रता वाले शार्पावेव हाथ के साथ और पीछे है: 92% एक लाइट बल्ब को खोलने के लिए, 36% इसे कसकर बंद करने के लिए, 44% एक कूड़ा थैला बांधने के लिए। डीपमाइंड बहु-अंगुली डेक्सटरस मैनिपुलेशन को अभी भी चुनौतीपूर्ण बताता है, जो किसी भी मानवनुमा क्षमता दावों का आकलन करने वालों के लिए एक उपयोगी मार्कर सेट करता है।
सुरक्षा सीमाएं और पहले तैनाती
गूगल सुरक्षा निर्देशों का पालन करने और मानव निकटता बेंचमार्क पर लाभ की रिपोर्ट करता है, और कहता है कि ईआर 2 एक मानवनुमा रोबोट को रोकता है जब कोई व्यक्ति निकट आता है, और फिर एक बार क्षेत्र साफ हो जाने पर अपने आप फिर से शुरू हो जाता है। डीपमाइंड एक निकट मानव के लिए रुकने को सहयोगी सुरक्षा मानकों में एक प्रमुख आवश्यकता कहता है, और यह आमतौर पर हार्डवेयर में नहीं बल्कि योजना मॉडल में पूरा किया जाता है: अपोलो 2 का अपना डिज़ाइन अपने परिभाषित प्रभाव व्यास में किसी वस्तु के प्रवेश पर आंदोलन को रोकता है।
डीपमाइंड ने एएसआईएमओवी-एजेंटिक भी जारी किया, जो एक बेंचमार्क है जो यह निर्धारित करता है कि क्या एक तर्क मॉडल एक ऑर्केस्ट्रेटर के रूप में सुरक्षित रूप से व्यवहार करता है: असुरक्षित टूल कॉल को क्रिया मॉडल से इनकार करना, यह निर्धारित करना कि क्या एक कार्य शारीरिक रूप से व्यावहारिक है, और जब यह अनिश्चित होता है तो मानव से मदद मांगना।
मॉडल कार्ड एक सख्त तैनाती सीमा खींचता है। गूगल डेवलपर्स को सलाह देता है कि वे रोबोटिक्स मॉडल का उपयोग सुरक्षा-संबंधी कार्यों के लिए न करें, स्वास्थ्य सेवा और परिवहन का नाम लेते हैं, या जहां एक दोष से मृत्यु, चोट या संपत्ति की क्षति हो सकती है। यह भाषा पहली लहर की तैनाती को निरीक्षण, गोदाम हैंडलिंग और प्रयोगशाला कार्यों की ओर इशारा करती है।
रोबोट निर्माताओं के लिए, ईआर 2 जेमिनी एपीआई से बुलाने के लिए उपलब्ध परत है, जो उन टीमों के लिए है जिनके पास पहले से ही काम करने वाले हार्डवेयर हैं और उन्हें यह तय करने के लिए कुछ चाहिए कि वे आगे क्या करते हैं।










