Robotyka i fizyczna AI
Google Wprowadza Gemini Robotics ER 2 Z WspÃģÅpracÄ MiÄdzy Robotami

Firma Google uruchomiÅa Gemini Robotics ER 2, model rozumnego rozumowania stworzony do peÅnienia roli wysokiego poziomu planisty dla robota, podczas gdy oddzielny model zajmuje siÄ silnikami. Jest on dostÄpny dla deweloperÃģw za poÅrednictwem interfejsu API Gemini i Google AI Studio, z dostÄpem do wersji prywatnej na platformie Gemini Enterprise Agent.
ER 2 przyjmuje dane wideo, obrazy, dÅšwiÄk i tekst, rozumnego rozumowania o scenie, planowania zadania, ktÃģre trwa kilka minut, a nastÄpnie wywoÅuje inne elementy w celu przeniesienia sprzÄtu: model widzenia-jÄzyka-dziaÅania, interfejs API nawigacji lub funkcja zadeklarowana przez dewelopera jako narzÄdzie. MoÅže rÃģwnieÅž wywoÅaÄ Google Search w trakcie wykonywania zadania. Karta modelu opisuje go jako model widzenia-jÄzyka oparty na Gemini 3.5 Flash, z oknem kontekstowym 128 000 tokenÃģw i maksymalnie 64 000 tokenÃģw wyjÅciowych.
NastÄpuje on Gemini Robotics-ER 1.6, wydanemu 14 kwietnia 2026 r., ktÃģry dodaÅ odczyt instrumentÃģw (interpretowanie manometru ciÅnieniowego lub szkÅa kontrolnego), funkcjonalnoÅÄ opracowanÄ przez Google z Boston Dynamics do inspekcji obiektÃģw. ER 2 rozszerza tÄ funkcjonalnoÅÄ do wyÅwietlaczy cyfrowych, skal liniowych, linijek i termometrÃģw cieczowych, przetestowanych w 10 typach instrumentÃģw.
Co dodaje wideo ciÄ gÅe
IstotnÄ zmianÄ jest to, Åže ER 2 rozumie dane z Åžywego strumienia wideo, a nie tylko z pojedynczych klatek, co pozwala mu oceniÄ, czy dany krok zostaÅ ukoÅczony.
WynikajÄ z tego dwie moÅžliwoÅci. Klasyfikacja postÄpu polega na tym, Åže model klasyfikuje kaÅždÄ klatkÄ strumienia do jednej z piÄciu kategorii ukoÅczenia, od 0-20% do 80-100%; Google podaje 57,4% dokÅadnoÅci. Znajdowanie momentu polega na tym, aby model wskazaÅ dokÅadnÄ klatkÄ, w ktÃģrej wystÄpuje krytyczne zdarzenie, takie jak moment, w ktÃģrym kubek jest wystarczajÄ co peÅny, aby przestaÄ nalewaÄ. Firma podaje 91,3% dokÅadnoÅci w tym zadaniu z bÅÄdem Årednim 0,96 sekundy i mÃģwi, Åže model dostarcza go przy przybliÅžonej czterokrotnej szybkoÅci wykonywania w porÃģwnaniu z znacznie wiÄkszymi modelami za uÅamek obliczeÅ.
Czas poniÅžej sekundy jest tym, co ma znaczenie w przypadku rzeczywistych maszyn. Robot, ktÃģry moÅže powiedzieÄ, Åže krok jest wykonany w 60%, lub Åže caÅkowicie nie powiÃģdÅ siÄ, moÅže ponowiÄ ten krok, zamiast restartowaÄ przepÅyw pracy lub czekaÄ na operatora. ER 2 jest przesyÅany przez punkt koÅcowy Gemini Live API, ktÃģry jest sposobem, w jaki Google utrzymuje pÄtlÄ rozumowania, aby nie wstawiaÄ przerw miÄdzy akcjami. Uzyskanie niskiej latencji inferencji jest tym samym ograniczeniem, ktÃģre popycha dostawcÃģw robotÃģw w kierunku specjalistycznego sprzÄtu na robocie i modeli czasu rzeczywistego na jednym GPU.
Dwa roboty, jeden cel
InnÄ nowÄ moÅžliwoÅciÄ jest wspÃģÅpraca miÄdzy robotami: rÃģÅžne maszyny dzielÄ siÄ semantycznym zrozumieniem zadania i przekazujÄ pracÄ miÄdzy sobÄ , opierajÄ c siÄ na zaÅoÅženiu, Åže podwozie koÅowe i para nÃģg sÄ odpowiednie dla rÃģÅžnych czÄÅci tego samego zadania. Demonstracja DeepMind ÅÄ czy Apptronik Apollo 2 z platformÄ bi-ramiennÄ Franka Duo. Druga demonstracja ma ER 2, ktÃģry steruje interfejsem API nawigacji i manipulatora na Spot Boston Dynamics, aby pobraÄ obiekt na mÃģwione polecenie.
Wszystko to dziaÅa na sprzÄcie, ktÃģrego Google nie produkuje, co jest tym, jak dzisiaj dziaÅa wiÄkszoÅÄ tego rynku: model pochodzi z laboratorium na froncie, a ramiona, nogi i chwytaki pochodzÄ od partnerÃģw, tak jak w przypadku producentÃģw cobotÃģw i platformy poziomu osadzonego AI.
ER 2 pojawiÅ siÄ jako czÄÅÄ rodziny trzech modeli. TowarzyszÄ cy post badawczy zespoÅu Gemini Robotics opisuje Gemini Robotics 2, model dziaÅania, ktÃģry kontroluje peÅne humanoidy od stÃģp do koÅcÃģwek palcÃģw, oraz Gemini Robotics On-Device 2, ktÃģry dziaÅa lokalnie i dostosowuje siÄ do nowego robota bi-ramiennego w ciÄ gu kilku godzin od mniej niÅž 200 przykÅadÃģw. Oba trafiajÄ do partnerÃģw wczesnego dostÄpu, a nie do otwartego interfejsu API.
ZespÃģÅ opublikowaÅ rÃģwnieÅž wskaÅšniki sukcesu za tym modelem dziaÅania, ktÃģry sterowaÅ trzema rÃģÅžnymi ciaÅami robota z jednego punktu kontrolnego. Apollo 2 z rÄkami Inspire podniosÅo obiekty z pÃģÅki 76,3% czasu, z tabeli 68,4%, a z podÅogi 45,7%. Praca piÄciopalczasta z rÄkÄ SharpaWave jest jeszcze dalej: 92% przy odkrÄcaniu ÅžarÃģwki, 36% przy krÄceniu, 44% przy wiÄ zaniu worka na Åmieci. DeepMind opisuje wielopalczaste manipulowanie jako wciÄ Åž wyzwaniem, co ustanawia uÅžytecznÄ granicÄ dla kaÅždego, kto ocenia moÅžliwoÅci humanoidalne.
Granice bezpieczeÅstwa i pierwsze wdroÅženia
Google podaje zyski w zakresie bezpieczeÅstwa i podÄ Åžania za instrukcjami, oraz mÃģwi, Åže ER 2 zatrzymuje humanoida, gdy osoba zbliÅža siÄ, a nastÄpnie wznawia samodzielnie, gdy obszar jest juÅž wolny. DeepMind nazywa zatrzymanie dla osoby w pobliÅžu kluczowym wymogiem w standardach bezpieczeÅstwa wspÃģÅpracy, i jest to wymÃģg, ktÃģry jest zwykle speÅniony w sprzÄcie, a nie w modelu planistycznym: wÅasny projekt Apollo 2 wstrzymuje ruch, gdy obiekt wchodzi w jego zdefiniowany promieÅ wpÅywu.
DeepMind rÃģwnieÅž wydaÅ ASIMOV-Agentic, benchmark dla modelu rozumowania, ktÃģry zachowuje siÄ bezpiecznie jako orchestrator: odmawia niebezpiecznych wywoÅaÅ narzÄdzi od modelu dziaÅania, ocenia, czy zadanie jest fizycznie wykonalne, oraz prosi o pomoc czÅowieka, gdy jest niepewny.
Karta modelu rysuje wyraÅšnÄ granicÄ wdroÅženia. Google mÃģwi deweloperom, aby nie uÅžywaÄ modeli robotÃģw do krytycznych zadaÅ bezpieczeÅstwa, wymieniajÄ c opiekÄ zdrowotnÄ i transport, lub w miejscach, w ktÃģrych awaria mogÅaby racjonalnie spowodowaÄ ÅmierÄ, uraz lub szkodÄ majÄ tkowÄ . Ten jÄzyk kieruje pierwszÄ falÄ wdroÅžeÅ w kierunku inspekcji, obsÅugi magazynowej i zadaÅ laboratoryjnych.
Dla budowniczych robotÃģw ER 2 jest warstwÄ dostÄpnÄ do wywoÅania z interfejsu API Gemini bez partnerstwa, skierowanÄ do zespoÅÃģw, ktÃģre juÅž majÄ dziaÅajÄ cy sprzÄt i potrzebujÄ czegoÅ, co zdecyduje, co robiÄ dalej.












