Robotteknologi og fysisk AI
Google udgiver Gemini Robotics ER 2 med multi-robot samarbejde

Google har lanceret Gemini Robotics ER 2, en inkarneret-forståelsesmodel bygget til at fungere som en robots højniveauplanlægger, mens en separat model håndterer motorerne. Den er tilgængelig for udviklere via Gemini API og Google AI Studio, med privat-forhåndsvisning på Gemini Enterprise Agent Platform.
ER 2 modtager video, billeder, lyd og tekst, forstår scenen, planlægger en opgave, der varer flere minutter, og kalder herefter noget andet for at flytte hårdwaren: en vision-sprog-handling-model, en navigations-API eller en udviklers egen funktion, der er erklæret for modellen som et værktøj. Den kan også kalde Google Søg under opgaven. Modelkortet beskriver det som en vision-sprog-model baseret på Gemini 3.5 Flash, med en 128.000-token kontekstvindue og op til 64.000 tokens af output.
Det efterfølger Gemini Robotics-ER 1.6, der blev udgivet den 14. april 2026, som tilføjede instrumentlæsning (fortolkning af et trykmåler eller et kemisk sigtglas), en funktion, som Google udviklede med Boston Dynamics til facilitetsinspektion. ER 2 udvider dette til digitale displays, lineære skalaer, regler og væske-termometre, testet på 10 instrumenttyper.
Hvad kontinuerligt video tilføjer
Den væsentlige ændring er, at ER 2 forstår over en live video-feed i stedet for stille billeder, hvilket giver det mulighed for at bedømme, om en opgave er færdig.
To funktioner kommer ud af dette. Fremdriftsklassifikation beder modellen om at sortere hver ramme af en feed ind i en af fem fuldførelsesbånd, fra 0-20% til 80-100%; Google rapporterer 57,4% nøjagtighed. Øjeblikets fund beder det om at fastsætte den præcise ramme, hvor et kritisk begivenhed indtræffer, såsom det punkt, hvor en kop er fuld nok til at stoppe med at hælde. Selskabet rapporterer 91,3% nøjagtighed på denne opgave med en middel fejl på 0,96 sekunder og siger, at modellen leverer det i omtrent fire gange den udviklingshastighed af langt større modeller for en brøkdel af beregningen.
Under-sekund-tidsstyring er den del, der betyder noget på en reel maskine. En robot, der kan fortælle, om en opgave er 60% færdig eller har fejlet helt, kan prøve igen i stedet for at genstarte arbejdsgangen eller vente på en operatør. ER 2 strømmer gennem Gemini Live API’s tovejs-endpoint, som er, hvordan Google holder forståelsesløkken fra at indsætte stop-og-tænke-pauser mellem handlinger. At få inferens-forsinkelsen lav nok til fysisk kontrol er den samme begrænsning, der driver robotik-leverandører mod dedikeret på-robot-silicon og single-GPU real-time-modeller.
To robotter, en opgave
Den anden nye funktion er multi-robot-samarbejde: forskellige maskiner, der deler en semantisk forståelse af en opgave og håndterer arbejdet imellem dem, på grundlag af, at en hjulbase og et par ben er egnede til forskellige dele af samme opgave. DeepMinds demonstration parrer Apptroniks Apollo 2 humanoid med en Franka Duo bi-arm-platform. En anden demo har ER 2, der driver navigations- og manipulator-API’erne på Boston Dynamics’ Spot for at hente et objekt på en talt kommando.
Alt dette kører på hardware, som Google ikke bygger, hvilket er, hvordan størstedelen af denne marked nu fungerer: modellen kommer fra en frontlab og armene, benene og griberne kommer fra partnere, samme opdeling bag cobot-producenter, der tiltrækker foundation-model-udviklere og platform-niveau inkarneret AI-stakke.
ER 2 ankom, som en del af en tre-model-familie. Den ledsagende forskningspost fra Gemini Robotics-holdet dækker Gemini Robotics 2, en handling-model, der kontrollerer fulde humanoider fra fødder til fingertoppe, og Gemini Robotics On-Device 2, som kører lokalt og tilpasser sig en ny bi-arm-robot på få timer fra færre end 200 eksempler. Begge går til tidlige adgangspartnere i stedet for den åbne API.
Holdet har også offentliggjort succesraterne bag denne handling-model, som drev tre forskellige robotkroppe fra et enkelt checkpoint. Apollo 2 udstyret med Inspire-hænder samlede objekter fra en hylder 76,3% af tiden, fra en bord 68,4% og fra gulvet 45,7%. Fem-finger-arbejde med 22-graders-frihedsgrad SharpaWave-hånd er længere tilbage: 92% for at skrue af en lyspære, 36% for at skrue en i, 44% for at binde en affaldssæk. DeepMind beskriver multi-finger-dexterous-manipulation som stadig udfordrende, hvilket sætter en nyttig markør for enhver, der vurderer humanoid-kapacitetskrav.
Sikkerhedsgrænser og første udrulninger
Google rapporterer gevinster på sikkerheds-instruktions-følgeskab og menneske-nærheds-benchmarks og siger, at ER 2 standser en humanoid, når en person kommer nær, og genoptager på egen hånd, når området er klart. DeepMind kalder stop for en nær menneske en nøglekrav i samarbejdende sikkerhedsstandarder og er et krav, der normalt opfyldes i hardware i stedet for i planlægningsmodellen: Apollo 2’s egen design standser bevægelse, når et objekt indtræder i dets definerede påvirkningsradius.
DeepMind har også udgivet ASIMOV-Agentic, en benchmark for, om en forståelsesmodel opfører sig sikkert som en orkestrator: afvisning af usikre værktøjskald fra handling-modellen, vurdering af, om en opgave er fysisk mulig, og beder en menneske om hjælp, når det er usikkert.
Modelkortet tegner en fast udrulningsgrænse. Google fortæller udviklerne ikke at bruge robotik-modellerne til sikkerhedskritisk arbejde, navngivning sundheds- og transportsektoren eller hvor en fejl kan forudses at forårsage død, skade eller ejendomsskade. Denne sprogretning peger den første bølge af udrulninger mod inspektion, lagerhåndtering og laboratorieopgaver.
For robot-byggere er ER 2 det lag, der er tilgængeligt for at kalde fra Gemini API uden en samarbejdsaftale, rettet mod hold, der allerede har arbejdende hardware og har brug for noget til at bestemme, hvad det skal gøre herefter.










