Robotyka i fizyczna AI

Google Wprowadza Gemini Robotics ER 2 Z WspÃģłpracą Między Robotami

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google

Firma Google uruchomiła Gemini Robotics ER 2, model rozumnego rozumowania stworzony do pełnienia roli wysokiego poziomu planisty dla robota, podczas gdy oddzielny model zajmuje się silnikami. Jest on dostępny dla deweloperÃģw za pośrednictwem interfejsu API Gemini i Google AI Studio, z dostępem do wersji prywatnej na platformie Gemini Enterprise Agent.

ER 2 przyjmuje dane wideo, obrazy, dÅšwięk i tekst, rozumnego rozumowania o scenie, planowania zadania, ktÃģre trwa kilka minut, a następnie wywołuje inne elementy w celu przeniesienia sprzętu: model widzenia-języka-działania, interfejs API nawigacji lub funkcja zadeklarowana przez dewelopera jako narzędzie. MoÅže rÃģwnieÅž wywołać Google Search w trakcie wykonywania zadania. Karta modelu opisuje go jako model widzenia-języka oparty na Gemini 3.5 Flash, z oknem kontekstowym 128 000 tokenÃģw i maksymalnie 64 000 tokenÃģw wyjściowych.

Następuje on Gemini Robotics-ER 1.6, wydanemu 14 kwietnia 2026 r., ktÃģry dodał odczyt instrumentÃģw (interpretowanie manometru ciśnieniowego lub szkła kontrolnego), funkcjonalność opracowaną przez Google z Boston Dynamics do inspekcji obiektÃģw. ER 2 rozszerza tę funkcjonalność do wyświetlaczy cyfrowych, skal liniowych, linijek i termometrÃģw cieczowych, przetestowanych w 10 typach instrumentÃģw.

Co dodaje wideo ciągłe

Istotną zmianą jest to, Åže ER 2 rozumie dane z Åžywego strumienia wideo, a nie tylko z pojedynczych klatek, co pozwala mu ocenić, czy dany krok został ukończony.

Wynikają z tego dwie moÅžliwości. Klasyfikacja postępu polega na tym, Åže model klasyfikuje kaÅždą klatkę strumienia do jednej z pięciu kategorii ukończenia, od 0-20% do 80-100%; Google podaje 57,4% dokładności. Znajdowanie momentu polega na tym, aby model wskazał dokładną klatkę, w ktÃģrej występuje krytyczne zdarzenie, takie jak moment, w ktÃģrym kubek jest wystarczająco pełny, aby przestać nalewać. Firma podaje 91,3% dokładności w tym zadaniu z błędem średnim 0,96 sekundy i mÃģwi, Åže model dostarcza go przy przybliÅžonej czterokrotnej szybkości wykonywania w porÃģwnaniu z znacznie większymi modelami za ułamek obliczeń.

Czas poniÅžej sekundy jest tym, co ma znaczenie w przypadku rzeczywistych maszyn. Robot, ktÃģry moÅže powiedzieć, Åže krok jest wykonany w 60%, lub Åže całkowicie nie powiÃģdł się, moÅže ponowić ten krok, zamiast restartować przepływ pracy lub czekać na operatora. ER 2 jest przesyłany przez punkt końcowy Gemini Live API, ktÃģry jest sposobem, w jaki Google utrzymuje pętlę rozumowania, aby nie wstawiać przerw między akcjami. Uzyskanie niskiej latencji inferencji jest tym samym ograniczeniem, ktÃģre popycha dostawcÃģw robotÃģw w kierunku specjalistycznego sprzętu na robocie i modeli czasu rzeczywistego na jednym GPU.

Dwa roboty, jeden cel

Inną nową moÅžliwością jest wspÃģłpraca między robotami: rÃģÅžne maszyny dzielą się semantycznym zrozumieniem zadania i przekazują pracę między sobą, opierając się na załoÅženiu, Åže podwozie kołowe i para nÃģg są odpowiednie dla rÃģÅžnych części tego samego zadania. Demonstracja DeepMind łączy Apptronik Apollo 2 z platformą bi-ramienną Franka Duo. Druga demonstracja ma ER 2, ktÃģry steruje interfejsem API nawigacji i manipulatora na Spot Boston Dynamics, aby pobrać obiekt na mÃģwione polecenie.

Wszystko to działa na sprzęcie, ktÃģrego Google nie produkuje, co jest tym, jak dzisiaj działa większość tego rynku: model pochodzi z laboratorium na froncie, a ramiona, nogi i chwytaki pochodzą od partnerÃģw, tak jak w przypadku producentÃģw cobotÃģw i platformy poziomu osadzonego AI.

ER 2 pojawił się jako część rodziny trzech modeli. Towarzyszący post badawczy zespołu Gemini Robotics opisuje Gemini Robotics 2, model działania, ktÃģry kontroluje pełne humanoidy od stÃģp do końcÃģwek palcÃģw, oraz Gemini Robotics On-Device 2, ktÃģry działa lokalnie i dostosowuje się do nowego robota bi-ramiennego w ciągu kilku godzin od mniej niÅž 200 przykładÃģw. Oba trafiają do partnerÃģw wczesnego dostępu, a nie do otwartego interfejsu API.

ZespÃģł opublikował rÃģwnieÅž wskaÅšniki sukcesu za tym modelem działania, ktÃģry sterował trzema rÃģÅžnymi ciałami robota z jednego punktu kontrolnego. Apollo 2 z rękami Inspire podniosło obiekty z pÃģłki 76,3% czasu, z tabeli 68,4%, a z podłogi 45,7%. Praca pięciopalczasta z ręką SharpaWave jest jeszcze dalej: 92% przy odkręcaniu ÅžarÃģwki, 36% przy kręceniu, 44% przy wiązaniu worka na śmieci. DeepMind opisuje wielopalczaste manipulowanie jako wciÄ…Åž wyzwaniem, co ustanawia uÅžyteczną granicę dla kaÅždego, kto ocenia moÅžliwości humanoidalne.

Granice bezpieczeństwa i pierwsze wdroÅženia

Google podaje zyski w zakresie bezpieczeństwa i podÄ…Åžania za instrukcjami, oraz mÃģwi, Åže ER 2 zatrzymuje humanoida, gdy osoba zbliÅža się, a następnie wznawia samodzielnie, gdy obszar jest juÅž wolny. DeepMind nazywa zatrzymanie dla osoby w pobliÅžu kluczowym wymogiem w standardach bezpieczeństwa wspÃģłpracy, i jest to wymÃģg, ktÃģry jest zwykle spełniony w sprzęcie, a nie w modelu planistycznym: własny projekt Apollo 2 wstrzymuje ruch, gdy obiekt wchodzi w jego zdefiniowany promień wpływu.

DeepMind rÃģwnieÅž wydał ASIMOV-Agentic, benchmark dla modelu rozumowania, ktÃģry zachowuje się bezpiecznie jako orchestrator: odmawia niebezpiecznych wywołań narzędzi od modelu działania, ocenia, czy zadanie jest fizycznie wykonalne, oraz prosi o pomoc człowieka, gdy jest niepewny.

Karta modelu rysuje wyraÅšną granicę wdroÅženia. Google mÃģwi deweloperom, aby nie uÅžywać modeli robotÃģw do krytycznych zadań bezpieczeństwa, wymieniając opiekę zdrowotną i transport, lub w miejscach, w ktÃģrych awaria mogłaby racjonalnie spowodować śmierć, uraz lub szkodę majątkową. Ten język kieruje pierwszą falę wdroÅžeń w kierunku inspekcji, obsługi magazynowej i zadań laboratoryjnych.

Dla budowniczych robotÃģw ER 2 jest warstwą dostępną do wywołania z interfejsu API Gemini bez partnerstwa, skierowaną do zespołÃģw, ktÃģre juÅž mają działający sprzęt i potrzebują czegoś, co zdecyduje, co robić dalej.

Orion Sato jest korespondentem wygenerowanym przez AI, specjalizującym się w robotyce, automatyce i inteligentnych maszynach. Jego pisanie opisuje, jak postępy w robotyce zmieniają produkcję, logistykę, opiekę zdrowotną i codzienne Åžycie poprzez coraz bardziej autonomiczne systemy.
Z technicznego i ukierunkowanego na wykonanie punktu widzenia, Orion analizuje architektury robotÃģw, fuzję czujnikÃģw, systemy sterowania i zbieÅžność AI z inteligencją mechaniczną. Jest szczegÃģlnie zainteresowany tym, jak automatyka przechodzi z kontrolowanych środowisk do rzeczywistego wdroÅženia, gdzie niezawodność, bezpieczeństwo i wydajność mają największe znaczenie.
Artykuły autorstwa Orion Sato są generowane przez AI i sprawdzane przez zespÃģł redakcyjny Unite.AI, aby zapewnić techniczną dokładność, klarowność i zgodność z normami redakcyjnymi.