Robotică și IA fizică
Google lansează Gemini Robotics ER 2 cu lucru în echipă multi-robot

Google a lansat Gemini Robotics ER 2, un model de raționament încorporat conceput pentru a servi ca planificator de nivel superior pentru un robot, în timp ce un model separat gestionează motoarele. Acesta este disponibil dezvoltatorilor prin Gemini API și Google AI Studio, cu acces la previzualizare privată pe platforma Gemini Enterprise Agent.
ER 2 preia video, imagini, audio și text, raționează despre scenă, planifică o sarcină care rulează câteva minute, apoi apelează altceva pentru a mișca hardware-ul: un model de viziune-limbaj-acțiune, un API de navigare sau o funcție proprie declarată modelului ca unelte. De asemenea, poate apela Google Search în timpul sarcinii. Cardul modelului îl descrie ca un model de viziune-limbaj bazat pe Gemini 3.5 Flash, cu o fereastră de context de 128.000 de tokeni și până la 64.000 de tokeni de ieșire.
Acesta succede Gemini Robotics-ER 1.6, lansat pe 14 aprilie 2026, care a adăugat citirea instrumentelor (interpretarea unui manometru sau a unui geam de vedere chimic), o capacitate pe care Google a dezvoltat-o împreună cu Boston Dynamics pentru inspecția facilităților. ER 2 extinde această funcționalitate la afișaje digitale, scări liniare, rigle și termometre lichide, testate pe 10 tipuri de instrumente.
Ce adaugă videoul continuu
Schimbarea substanțială constă în faptul că ER 2 raționează pe baza unui flux de video live, în loc de cadre statice, ceea ce îi permite să judece dacă o etapă este finalizată.
Din această funcționalitate rezultă două capacități. Clasificarea progresului solicită modelului să sorteze fiecare cadru dintr-un flux în una dintre cele cinci benzi de finalizare, de la 0-20% la 80-100%; Google raportează o acuratețe de 57,4%. Găsirea momentului solicită modelului să identifice exact cadrul în care are loc un eveniment critic, cum ar fi momentul în care o cană este suficient de plină pentru a înceta turnarea. Compania raportează o acuratețe de 91,3% pentru această sarcină, cu o eroare medie de 0,96 secunde, și afirmă că modelul oferă această funcționalitate la aproximativ patru ori viteza de execuție a unor modele mult mai mari, pentru o fracțiune din calcul.
Cronometrajul subsecundar este partea care contează pe o mașină reală. Un robot care poate spune că o etapă este finalizată cu 60% sau a eșuat complet poate reîncerca etapa respectivă, în loc să reînceapă fluxul de lucru sau să aștepte un operator. ER 2 difuzează prin punctul de capăt bidirecțional al Gemini Live API, care este modul în care Google menține bucla de raționament fără a insera pauze de stop-and-think între acțiuni. Obținerea latenței de inferență suficient de mică pentru controlul fizic este aceeași constrângere care împinge furnizorii de robotici către siliciu dedicat pe robot și modele în timp real pe o singură GPU.
Doi roboți, o sarcină
Capacitatea nouă este colaborarea multi-robot: mașini diferite care împărtășesc o înțelegere semantică a unei sarcini și care își transmit munca între ele, pe baza ideii că o bază cu rotile și o pereche de picioare sunt potrivite pentru diferite părți ale aceleiași sarcini. Demonstrația DeepMind îi pune pe Apptronik’s Apollo 2 humanoid și pe o platformă bi-armă Franka Duo. O a doua demonstrație are ER 2 care conduce API-urile de navigare și manipulare pe Spot de la Boston Dynamics pentru a recupera un obiect la o comandă vocală.
Toate acestea rulează pe hardware pe care Google nu îl construiește, ceea ce este modul în care funcționează acum cea mai mare parte a acestui segment: modelul provine dintr-un laborator de frontieră, iar brațele, picioarele și cleștii provin de la parteneri, aceeași diviziune care se află în spatele producătorilor de roboți colaborativi care își promovează dezvoltatorii de modele de frontieră și stive de inteligență artificială încorporată la nivel de platformă.
ER 2 a sosit ca parte a unei familii de trei modele. Postul de cercetare companion de la echipa Gemini Robotics acoperă Gemini Robotics 2, un model de acțiune care controlează roboți umanoizi de la picioare până la vârfuri de degete, și Gemini Robotics On-Device 2, care rulează local și se adaptează la un nou robot bi-armă în câteva ore, de la mai puțin de 200 de exemple. Ambele merg către parteneri de acces timpuriu, în loc de API deschis.
Echipa a publicat, de asemenea, ratele de succes din spatele acelui model de acțiune, care a condus trei corpuri de roboți diferite de la un singur punct de control. Apollo 2, echipat cu mâini Inspire, a ridicat obiecte de pe o raft 76,3% din timp, de pe o masă 68,4% și de pe podea 45,7%. Lucrul cu degete multiple cu mâna SharpaWave este mai în urmă: 92% pentru descremarea unei becuri, 36% pentru înșurubarea unei becuri, 44% pentru legarea unei pungi de gunoi. DeepMind descrie manipularea dexteră multi-deget ca fiind încă o provocare, ceea ce stabilește un marker util pentru oricine evaluează afirmațiile despre capacitățile umanoide.
Limite de siguranță și primele implementări
Google raportează câștiguri în urma urmăririi instrucțiunilor de siguranță și a benchmark-urilor de proximitate umană și afirmă că ER 2 oprește un robot umanoid atunci când o persoană se apropie, apoi reia singur odată ce zona este curată. DeepMind numește oprirea pentru un om apropiat o cerință cheie în standardele de siguranță colaborativă și este o cerință care este, de obicei, îndeplinită în hardware, mai degrabă decât în modelul de planificare: proiectarea Apollo 2 însăși oprește mișcarea atunci când un obiect intră în raza de impact definită.
DeepMind a lansat, de asemenea, ASIMOV-Agentic, un benchmark pentru a determina dacă un model de raționament se comportă în siguranță ca orchestrator: refuză apeluri de unelte nesigure de la modelul de acțiune, judecă dacă o sarcină este fizic fezabilă și solicită ajutor uman atunci când este nesigur.
Cardul modelului desenează o graniță fermă de implementare. Google le spune dezvoltatorilor să nu folosească modelele de robotici pentru lucrări critice pentru siguranță, numind îngrijirea sănătății și transportul, sau oriunde o defecțiune ar putea provoca moarte, vătămare sau daune materiale. Această limbaj direcționează prima undă de implementări către inspecție, manipulare de depozit și sarcini de laborator.
Pentru constructorii de roboți, ER 2 este stratul disponibil pentru a apela din Gemini API fără parteneriat, destinat echipelor care au deja hardware funcțional și au nevoie de ceva pentru a decide ce face următorul.












