Robotikk og fysisk AI
Google lanserer Gemini Robotics ER 2 med multi-robot samarbeid

Google har lansert Gemini Robotics ER 2, en inkarnert resonansmodell bygget for å tjene som en robots høynivåplanlegger mens en separat modell håndterer motorer. Den er tilgjengelig for utviklere gjennom Gemini API og Google AI Studio, med privat-forhåndsvisning på Gemini Enterprise Agent Platform.
ER 2 tar inn video, bilder, lyd og tekst, resonerer om scenen, planlegger en oppgave som varer flere minutter, og så kaller noe annet for å flytte hårdwaren: en visjon-språk-handling modell, en navigasjons-API eller en utviklers egen funksjon erklært til modellen som et verktøy. Den kan også kalle Google Søk midt i oppgaven. Modellkortet beskriver det som en visjon-språk-modell basert på Gemini 3.5 Flash, med en 128 000-token kontekstvindu og opptil 64 000 token utdata.
Det etterfølger Gemini Robotics-ER 1.6, utgitt 14. april 2026, som la til instrumentlesing (tolking av trykkgauger eller kjemiske sikteglass), en funksjon Google utviklet med Boston Dynamics for inspeksjonsrundturer i anlegg. ER 2 utvider dette til digitale skjermer, lineære skalaer, regler og væske-termometre, testet på 10 instrumenttyper.
Hva kontinuerlig video legger til
Den vesentlige endringen er at ER 2 resonerer over en live videostrøm i stedet for stille bilder, noe som lar det dømme noe som har stille begrenset robotautonomi: om et skritt er fullført.
To evner kommer ut av dette. Fremgangsklassifisering ber modellen om å sortere hver ramme i en strøm inn i en av fem fullføringsbånd, fra 0–20% til 80–100%; Google rapporterer 57,4% nøyaktighet. Øyeblikksfunn ber det om å plassere den eksakte rammen der et kritisk hendelse skjer, som punktet der en kopp er full nok til å stoppe å helle. Selskapet rapporterer 91,3% nøyaktighet på denne oppgaven med en gjennomsnittlig feil på 0,96 sekunder, og sier at modellen leverer det omtrent fire ganger kjøretidshastigheten til mye større modeller for en brøkdel av beregningen.
Sub-sekundtidsstyring er det som teller på en virkelig maskin. En robot som kan si at et skritt er 60% fullført, eller har feilet fullstendig, kan prøve å gjøre om skrittet i stedet for å starte på nytt eller vente på en operatør. ER 2 strømmer gjennom Gemini Live API’s toveiskommunikasjonsendepunkt, som er hvordan Google holder resonansløkken fra å sette inn stopp-og-tenk-pauser mellom handlinger. Å få inferensforsinkelse lav nok for fysisk kontroll er det samme begrensningen som driver robotikk-leverandører mot dedikert på-robot-silikon og enkel-GPU-sanntidsmodeller.
To roboter, en jobb
Den andre nye evnen er multi-robot samarbeid: forskjellige maskiner deler en semantisk forståelse av en oppgave og håndterer arbeid mellom dem, basert på antagelsen at en hjulbasert og et par ben er egnet til forskjellige deler av samme jobb. DeepMinds demonstrasjon parer Apptronik’s Apollo 2 humanoid med en Franka Duo bi-arm plattform. En annen demo har ER 2 som kjører navigasjons- og manipulator-API-er på Boston Dynamics’ Spot for å hente et objekt på en talt kommando.
Alt dette kjører på hårdware som Google ikke bygger, som er hvordan størsteparten av denne markedet nå fungerer: modellen kommer fra en frontlab og armene, bena og grippere kommer fra partnere, samme splitt som bak cobot-produsenter som søker etter grunnleggende AI-utviklere og plattformnivå-inkarnert AI-stakker.
ER 2 ankom som en del av en tre-modell-familie. Den ledsagende forskningsposten fra Gemini Robotics-teamet dekker Gemini Robotics 2, en handlingmodell som kontrollerer fullstendige humanoider fra føtter til fingertopper, og Gemini Robotics On-Device 2, som kjører lokalt og tilpasser seg en ny bi-arm robot på noen få timer fra færre enn 200 eksempler. Begge går til tidlige tilgangspartnere i stedet for åpen API.
Laget publiserte også suksessraten bak denne handlingmodellen, som drev tre forskjellige robotkropper fra ett enkelt kontrollpunkt. Apollo 2 utstyrt med Inspire-hender plukket objekter fra en hylle 76,3% av tiden, fra et bord 68,4% og fra gulvet 45,7%. Fem-finger-arbeid med 22-graders-frihet SharpaWave-hånd er lengre tilbake: 92% for å skru av en lyspære, 36% for å skru på en, 44% for å knyte en søppelsekk. DeepMind beskriver multi-finger-dexterous manipulering som fortsatt utfordrende, noe som setter en nyttig markør for hvem som vurderer humanoid-kapasitetskrav.
Sikkerhetsbegrensninger og første utrullinger
Google rapporterer fremgang på sikkerhetsinstruksjonsfølgelse og menneske-nærhet-benchmark, og sier at ER 2 stopper en humanoid når en person kommer nær, og så gjenopptar på egen hånd når området er klart. DeepMind kaller stopp for en nær menneske en nøkkelkrav i samarbeidssikkerhetsstandarder, og det er et krav som vanligvis møtes i hårdware i stedet for i planleggingsmodellen: Apollo 2s egen design stopper bevegelse når et objekt går inn i dens definerte impaktradius.
DeepMind har også lansert ASIMOV-Agentic, en benchmark for om en resonansmodell oppfører seg trygt som en orkestrator: nekte ubesikrede verktøykall fra handlingmodellen, dømme om en oppgave er fysisk gjennomførbare, og be en menneske om hjelp når det er usikkert.
Modellkortet tegner en fast utrullingsgrense. Google forteller utviklere å ikke bruke robotikk-modellene til sikkerhetskritisk arbeid, navngir helsevesen og transport, eller hvor en feil kunne forutsigbart forårsake død, skade eller eiendomsskade. Denne språkretningen peker den første bølgen av utrullinger mot inspeksjon, lagerhåndtering og lab-oppgaver.
For robot-byggere er ER 2 laget tilgjengelig for å kalle fra Gemini API uten partnerskap, rettet mot lag som allerede har arbeidende hårdware og trenger noe som bestemmer hva det gjør neste.












