Robotyka i fizyczna AI

Google Wprowadza Gemini Robotics ER 2 Z Współpracą Między Robotami

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Firma Google uruchomiła Gemini Robotics ER 2, model rozumnego rozumowania stworzony do pełnienia roli wysokiego poziomu planisty dla robota, podczas gdy oddzielny model zajmuje się silnikami. Jest on dostępny dla deweloperów za pośrednictwem interfejsu API Gemini i Google AI Studio, z dostępem do wersji prywatnej na platformie Gemini Enterprise Agent.

ER 2 przyjmuje dane wideo, obrazy, dźwięk i tekst, rozumnego rozumowania o scenie, planowania zadania, które trwa kilka minut, a następnie wywołuje inne elementy w celu przeniesienia sprzętu: model widzenia-języka-działania, interfejs API nawigacji lub funkcja zadeklarowana przez dewelopera jako narzędzie. Może również wywołać Google Search w trakcie wykonywania zadania. Karta modelu opisuje go jako model widzenia-języka oparty na Gemini 3.5 Flash, z oknem kontekstowym 128 000 tokenów i maksymalnie 64 000 tokenów wyjściowych.

Następuje on Gemini Robotics-ER 1.6, wydanemu 14 kwietnia 2026 r., który dodał odczyt instrumentów (interpretowanie manometru ciśnieniowego lub szkła kontrolnego), funkcjonalność opracowaną przez Google z Boston Dynamics do inspekcji obiektów. ER 2 rozszerza tę funkcjonalność do wyświetlaczy cyfrowych, skal liniowych, linijek i termometrów cieczowych, przetestowanych w 10 typach instrumentów.

Co dodaje wideo ciągłe

Istotną zmianą jest to, że ER 2 rozumie dane z żywego strumienia wideo, a nie tylko z pojedynczych klatek, co pozwala mu ocenić, czy dany krok został ukończony.

Wynikają z tego dwie możliwości. Klasyfikacja postępu polega na tym, że model klasyfikuje każdą klatkę strumienia do jednej z pięciu kategorii ukończenia, od 0-20% do 80-100%; Google podaje 57,4% dokładności. Znajdowanie momentu polega na tym, aby model wskazał dokładną klatkę, w której występuje krytyczne zdarzenie, takie jak moment, w którym kubek jest wystarczająco pełny, aby przestać nalewać. Firma podaje 91,3% dokładności w tym zadaniu z błędem średnim 0,96 sekundy i mówi, że model dostarcza go przy przybliżonej czterokrotnej szybkości wykonywania w porównaniu z znacznie większymi modelami za ułamek obliczeń.

Czas poniżej sekundy jest tym, co ma znaczenie w przypadku rzeczywistych maszyn. Robot, który może powiedzieć, że krok jest wykonany w 60%, lub że całkowicie nie powiódł się, może ponowić ten krok, zamiast restartować przepływ pracy lub czekać na operatora. ER 2 jest przesyłany przez punkt końcowy Gemini Live API, który jest sposobem, w jaki Google utrzymuje pętlę rozumowania, aby nie wstawiać przerw między akcjami. Uzyskanie niskiej latencji inferencji jest tym samym ograniczeniem, które popycha dostawców robotów w kierunku specjalistycznego sprzętu na robocie i modeli czasu rzeczywistego na jednym GPU.

Dwa roboty, jeden cel

Inną nową możliwością jest współpraca między robotami: różne maszyny dzielą się semantycznym zrozumieniem zadania i przekazują pracę między sobą, opierając się na założeniu, że podwozie kołowe i para nóg są odpowiednie dla różnych części tego samego zadania. Demonstracja DeepMind łączy Apptronik Apollo 2 z platformą bi-ramienną Franka Duo. Druga demonstracja ma ER 2, który steruje interfejsem API nawigacji i manipulatora na Spot Boston Dynamics, aby pobrać obiekt na mówione polecenie.

Wszystko to działa na sprzęcie, którego Google nie produkuje, co jest tym, jak dzisiaj działa większość tego rynku: model pochodzi z laboratorium na froncie, a ramiona, nogi i chwytaki pochodzą od partnerów, tak jak w przypadku producentów cobotów i platformy poziomu osadzonego AI.

ER 2 pojawił się jako część rodziny trzech modeli. Towarzyszący post badawczy zespołu Gemini Robotics opisuje Gemini Robotics 2, model działania, który kontroluje pełne humanoidy od stóp do końcówek palców, oraz Gemini Robotics On-Device 2, który działa lokalnie i dostosowuje się do nowego robota bi-ramiennego w ciągu kilku godzin od mniej niż 200 przykładów. Oba trafiają do partnerów wczesnego dostępu, a nie do otwartego interfejsu API.

Zespół opublikował również wskaźniki sukcesu za tym modelem działania, który sterował trzema różnymi ciałami robota z jednego punktu kontrolnego. Apollo 2 z rękami Inspire podniosło obiekty z półki 76,3% czasu, z tabeli 68,4%, a z podłogi 45,7%. Praca pięciopalczasta z ręką SharpaWave jest jeszcze dalej: 92% przy odkręcaniu żarówki, 36% przy kręceniu, 44% przy wiązaniu worka na śmieci. DeepMind opisuje wielopalczaste manipulowanie jako wciąż wyzwaniem, co ustanawia użyteczną granicę dla każdego, kto ocenia możliwości humanoidalne.

Granice bezpieczeństwa i pierwsze wdrożenia

Google podaje zyski w zakresie bezpieczeństwa i podążania za instrukcjami, oraz mówi, że ER 2 zatrzymuje humanoida, gdy osoba zbliża się, a następnie wznawia samodzielnie, gdy obszar jest już wolny. DeepMind nazywa zatrzymanie dla osoby w pobliżu kluczowym wymogiem w standardach bezpieczeństwa współpracy, i jest to wymóg, który jest zwykle spełniony w sprzęcie, a nie w modelu planistycznym: własny projekt Apollo 2 wstrzymuje ruch, gdy obiekt wchodzi w jego zdefiniowany promień wpływu.

DeepMind również wydał ASIMOV-Agentic, benchmark dla modelu rozumowania, który zachowuje się bezpiecznie jako orchestrator: odmawia niebezpiecznych wywołań narzędzi od modelu działania, ocenia, czy zadanie jest fizycznie wykonalne, oraz prosi o pomoc człowieka, gdy jest niepewny.

Karta modelu rysuje wyraźną granicę wdrożenia. Google mówi deweloperom, aby nie używać modeli robotów do krytycznych zadań bezpieczeństwa, wymieniając opiekę zdrowotną i transport, lub w miejscach, w których awaria mogłaby racjonalnie spowodować śmierć, uraz lub szkodę majątkową. Ten język kieruje pierwszą falę wdrożeń w kierunku inspekcji, obsługi magazynowej i zadań laboratoryjnych.

Dla budowniczych robotów ER 2 jest warstwą dostępną do wywołania z interfejsu API Gemini bez partnerstwa, skierowaną do zespołów, które już mają działający sprzęt i potrzebują czegoś, co zdecyduje, co robić dalej.

Orion Sato jest korespondentem wygenerowanym przez AI, specjalizującym się w robotyce, automatyce i inteligentnych maszynach. Jego pisanie opisuje, jak postępy w robotyce zmieniają produkcję, logistykę, opiekę zdrowotną i codzienne życie poprzez coraz bardziej autonomiczne systemy.
Z technicznego i ukierunkowanego na wykonanie punktu widzenia, Orion analizuje architektury robotów, fuzję czujników, systemy sterowania i zbieżność AI z inteligencją mechaniczną. Jest szczególnie zainteresowany tym, jak automatyka przechodzi z kontrolowanych środowisk do rzeczywistego wdrożenia, gdzie niezawodność, bezpieczeństwo i wydajność mają największe znaczenie.
Artykuły autorstwa Orion Sato są generowane przez AI i sprawdzane przez zespół redakcyjny Unite.AI, aby zapewnić techniczną dokładność, klarowność i zgodność z normami redakcyjnymi.