Robotik och fysisk AI
Google Levererar Gemini Robotics ER 2 Med Multi-Robot Samarbete

Google har lanserat Gemini Robotics ER 2, en inkarnerad resonemangsmodell som är utformad för att fungera som en robots högnivåplanerare medan en separat modell hanterar motorerna. Den är tillgänglig för utvecklare via Gemini API och Google AI Studio, med privat förhandsgranskning på Gemini Enterprise Agent-plattformen.
ER 2 tar emot video, bilder, ljud och text, resonemang om scenen, planerar en uppgift som körs under flera minuter och anropar sedan något annat för att flytta hårdvaran: en vision-språk-handlingsmodell, en navigerings-API eller en utvecklares egen funktion som deklarerats till modellen som ett verktyg. Den kan också anropa Google Sök mitt i uppgiften. Modellkortet beskriver den som en vision-språkmodell baserad på Gemini 3.5 Flash, med ett 128 000-tecken kontextfönster och upp till 64 000 tecken utdata.
Den efterträder Gemini Robotics-ER 1.6, som släpptes den 14 april 2026, som lade till instrumentläsning (tolkning av tryckmätare eller kemisk synruta), en funktion som Google utvecklat med Boston Dynamics för anläggningsinspektioner. ER 2 utökar detta till digitala skärmar, linjära skalor, regler och vätske-termometrar, testade över 10 instrumenttyper.
Vad kontinuerlig video lägger till
Den väsentliga förändringen är att ER 2 resonemang över en live-videoström istället för stillbilder, vilket låter den bedöma något som har tyst begränsat robotautonomi: om ett steg är klart.
Två funktioner kommer ut ur detta. Progressklassificering ber modellen att sortera varje bildruta i en ström i en av fem slutförande-band, från 0–20% till 80–100%; Google rapporterar 57,4% noggrannhet. Ögonblicksfinnande ber den att fastställa den exakta bildrutan där ett kritiskt händelse inträffar, såsom den punkt där en kopp är tillräckligt full för att sluta hälla. Företaget rapporterar 91,3% noggrannhet på den uppgiften med en medelfel på 0,96 sekunder och säger att modellen levererar den i stort sett fyra gånger den exekveringshastighet som mycket större modeller för en bråkdel av beräkningskraften.
Sub-sekundtidsbestämning är den del som är viktig på en riktig maskin. En robot som kan avgöra att ett steg är 60% klart, eller har misslyckats helt, kan försöka igen med det steget istället för att starta om arbetsflödet eller vänta på en operatör. ER 2 strömmar genom Gemini Live API:s dubbelriktade slutpunkt, som är hur Google håller resonemangsloopen från att införa stopp-och-tänk-pauser mellan åtgärder. Att få inferensfördröjning låg nog för fysisk kontroll är samma begränsning som driver robotiktillverkare mot dedikerad på-robot-silikon och en-GPU-realtidsmodeller.
Två robotar, ett jobb
Den andra nya funktionen är multi-robot-samarbete: olika maskiner som delar en semantisk förståelse för en uppgift och överlämnar arbetet mellan dem, med resonemanget att en hjulbaserad bas och ett par ben är lämpliga för olika delar av samma jobb. DeepMinds demonstration parar Apptroniks Apollo 2 humanoid med en Franka Duo bi-arm-plattform. En andra demo har ER 2 som driver navigerings- och manipulerings-API:er på Boston Dynamics Spot för att hämta ett föremål på ett talat kommando.
Allt detta körs på hårdvara som Google inte bygger, vilket är hur större delen av denna marknad fungerar nu: modellen kommer från en frontlab och armarna, benen och gripdona kommer från partners, samma uppdelning som ligger bakom cobot-tillverkare som vänder sig till grundmodellutvecklare och plattformsnivå inkarnerad AI-staplar.
ER 2 anlände som en del av en tre-modellfamilj. Den medföljande forskningsposten från Gemini Robotics-teamet behandlar Gemini Robotics 2, en aktionsmodell som styr fullständiga humanoider från fötter till fingertoppar, och Gemini Robotics On-Device 2, som körs lokalt och anpassar sig till en ny bi-arm-robot på några timmar från färre än 200 exempel. Båda går till tidiga partners istället för den öppna API:n.
Laget publicerade också framgångsgraden bakom den aktionsmodellen, som drev tre olika robotkroppar från en enda kontrollpunkt. Apollo 2 utrustad med Inspire-händer plockade föremål från en hylla 76,3% av tiden, från ett bord 68,4% och från golvet 45,7%. Femfingrade arbeten med 22-graders SharpaWave-hand är längre bort: 92% för lossning av en glödlampa, 36% för skruvning av en glödlampa, 44% för knytning av en soppåse. DeepMind beskriver multifinger-dexterous manipulation som fortfarande utmanande, vilket sätter en användbar markör för alla som bedömer humanoidförmåga.
Säkerhetsgränser och första distributioner
Google rapporterar vinster på säkerhetsinstruktionsföljande och mänsklig närhetsmätningar och säger att ER 2 stoppar en humanoid när en person kommer nära, sedan återupptar den på egen hand när området är klart. DeepMind kallar stopp för en närliggande människa en nyckelkrav i samarbets-säkerhetsstandarder, och det är ett krav som vanligtvis uppfylls i hårdvara snarare än i planeringsmodellen: Apollo 2:s egen design pausar rörelse när ett föremål kommer in i dess definierade påverkansradie.
DeepMind släppte också ASIMOV-Agentic, en benchmark för om en resonemangsmodell beter sig säkert som en orkestratör: vägrar osäkra verktygsanrop från aktionsmodellen, bedömer om en uppgift är fysiskt genomförbar och ber en människa om hjälp när den är osäker.
Modellkortet ritade en fast distributionsgräns. Google ber utvecklare att inte använda robotmodellerna för säkerhetskritiskt arbete, med namn på hälsovård och transport, eller varhelst en felaktig funktion skulle kunna förutsebart orsaka död, skada eller skada på egendom. Det språket pekar den första distributionsvågen mot inspektion, lagerhantering och labbuppgifter.
För robotbyggare är ER 2 det lager som är tillgängligt för att anropas från Gemini API utan partnerskap, riktat mot team som redan har fungerande hårdvara och behöver något för att bestämma vad den ska göra härnäst.












