Robotika a fyzická AI

Google Spustil Gemini Robotics ER 2 S Multi-Robotním Týmovým Prací

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Google spustil Gemini Robotics ER 2, model s tělesným rozuměním, který slouží jako vysokou úroveň plánovače pro roboty, zatímco samostatný model zpracovává motory. Je k dispozici vývojářům prostřednictvím Gemini API a Google AI Studio, s privátním náhledem na platformě Gemini Enterprise Agent.

ER 2 zpracovává video, obrázky, audio a text, rozumí scéně, plánuje úkol, který trvá několik minut, a poté volá jinou funkci, aby se pohyboval hardware: model vidění-jazyka-akce, navigační API nebo funkci vyvinutou vývojářem. Může také volat Google Search během úkolu. Modelová karta popisuje jej jako model vidění-jazyka založený na Gemini 3.5 Flash, s kontextovým oknem 128 000 tokenů a až 64 000 tokenů výstupu.

Následuje Gemini Robotics-ER 1.6, který byl vydán 14. dubna 2026 a který přidával čtení přístrojů (interpretaci tlakoměru nebo chemického skla), schopnost, kterou Google vyvinul s Boston Dynamics pro inspekční kola zařízení. ER 2 rozšiřuje tuto funkci na digitální displeje, lineární stupnice, pravidla a teploměry, testované na 10 typech přístrojů.

Co přidává kontinuální video

Zásadní změna spočívá v tom, že ER 2 rozumí živému video toku místo statických snímků, což mu umožňuje posoudit, zda je krok dokončen.

Dvě schopnosti vyplývají z toho. Klasifikace pokroku vyžaduje, aby model rozdělil každý snímek toku do jedné z pěti dokončovacích pásem, od 0–20 % do 80–100 %; Google uvádí 57,4% přesnost. Nalezení okamžiku vyžaduje, aby model určil přesně ten snímek, ve kterém dochází k kritické události, jako je okamžik, kdy je šálek dostatečně plný, aby se přestalo lít. Společnost uvádí 91,3% přesnost při této úloze s průměrnou chybou 0,96 sekundy a uvádí, že model dodává tuto funkci při zhruba čtyřnásobné rychlosti provádění ve srovnání s mnohem většími modely za zlomek výpočetního výkonu.

Podsekundové časování je to, co záleží na skutečném stroji. Robot, který může určit, zda je krok dokončen z 60 %, nebo zda selhal, může tento krok opakovat místo restartování pracovního postupu nebo čekání na operátora. ER 2 proudí přes bidirekční koncový bod Gemini Live API, což je způsob, jakým Google udržuje smyčku rozumu od vkládání pauz mezi akcemi. Získání inferenční latence dostatečně nízké pro fyzickou kontrolu je stejným omezením, které tlačí dodavatele robotiky směrem k specializovanému silikonu na robotech a modelům v reálném čase na jedné GPU.

Dva roboti, jedna práce

Další novou schopností je multi-robotická spolupráce: různé stroje sdílejí semantické porozumění úkolu a předávají práci mezi nimi, na základě předpokladu, že vozidlo s kolečky a pár nohou je vhodný pro různé části stejné práce. Demonstrační ukázka DeepMindu spojuje Apptronikův Apollo 2 humanoida s platformou Franka Duo bi-arm. Druhá ukázka má ER 2, který řídí navigační a manipulační API na Spotu od Boston Dynamics, aby na základě mluveného příkazu načerpala objekt.

Všechno běží na hardwaru, který Google nevyrábí, což je způsob, jakým nyní funguje většina tohoto trhu: model pochází z laboratoře na hranici možností a ruce, nohy a gripery pocházejí od partnerů, stejný rozdělení jako u výrobce cobotů a platformy pro roboty.

ER 2 přišel jako součást třímodelové rodiny. Výzkumný příspěvek od týmu Gemini Robotics pokrývá Gemini Robotics 2, akční model, který ovládá plné humanoidy od nohou po prsty, a Gemini Robotics On-Device 2, který běží místně a přizpůsobuje se novému bi-arm robotu za několik hodin z méně než 200 příkladů. Oba jdou k partnerům s časným přístupem místo otevřeného API.

Tým také zveřejnil úspěsné míry za tento akční model, který řídil tři různé robotické tělo z jednoho kontrolního bodu. Apollo 2 s Inspire rukama vybral objekty ze Police 76,3 % času, ze stolu 68,4 % a z podlahy 45,7 %. Práce s pěti prsty pomocí 22stupňového volného ruky SharpaWave je dále zpět: 92 % pro odšroubování žárovky, 36 % pro šroubování, 44 % pro vázání sáčku na odpad. DeepMind popisuje víceprstovou dexteritu jako stále výzvou, což nastavuje užitečnou značku pro každého, kdo hodnotí humanoidní schopnosti.

Bezpečnostní limity a první nasazení

Google uvádí, že dosáhl pokroku v bezpečnostních instrukcích a blízkosti člověka a říká, že ER 2 zastaví humanoida, když se člověk přiblíží, a poté pokračuje sám, jakmile je oblast čistá. DeepMind popisuje zastavení pro blízkého člověka jako klíčový požadavek pro bezpečnostní standardy a je to požadavek, který je obvykle splněn v hardwaru spíše než v modelu plánování: vlastní design Apollo 2 zastavuje pohyb, když objekt vstoupí do jeho definovaného rádia dopadu.

DeepMind také vydal ASIMOV-Agentic, benchmark pro chování bezpečnostního modelu jako orchestrátor: odmítání nebezpečných volání nástrojů z akčního modelu, posuzování, zda je úkol fyzicky proveditelný, a žádání člověka o pomoc, když je nejistý.

Modelová karta vykresluje pevnou hranici nasazení. Google informuje vývojáře, aby nepoužívali modely robotiky pro bezpečnostně kritické práce, jmenovitě zdravotnictví a dopravu, nebo kde by selhání mohlo předvídatelně způsobit smrt, zranění nebo poškození majetku. Tento jazyk směřuje první vlnu nasazení směrem k inspekci, manipulaci ve skladech a laboratorním úkolům.

Pro stavitele robotů je ER 2 vrstvou, která je k dispozici pro volání z Gemini API bez partnerství, zaměřenou na týmy, které již mají funkční hardware a potřebují něco, co rozhodne, co bude dělat dál.

Orion Sato je korespondent generovaný umělou inteligencí, zaměřený na robotiku, automatizaci a inteligentní stroje. Jeho psaní zkoumá, jak pokroky v robotice mění výrobu, logistiku, zdravotnictví a každodenní život prostřednictvím stále autonomnějších systémů.
S technickým a výkonnostně orientovaným pohledem analyzuje Orion robotické architektury, fúzi senzorů, řídicí systémy a konvergenci umělé inteligence s mechanickou inteligencí. Zajímá se zejména o to, jak se automatizace přesouvá z kontrolovaných prostředí do reálného nasazení, kde záleží na spolehlivosti, bezpečnosti a efektivitě.
Články autora Oriona Sata jsou generovány umělou inteligencí a recenzovány redakčním týmem Unite.AI, aby zajistily technickou přesnost, srozumitelnost a soulad s redakčními standardy.