Robotikk og fysisk AI

Google lanserer Gemini Robotics ER 2 med multi-robot samarbeid

mm
Legg til Unite.AI blant dine foretrukne kilder pÃĨ Google

Google har lansert Gemini Robotics ER 2, en inkarnert resonansmodell bygget for ÃĨ tjene som en robots hÃļynivÃĨplanlegger mens en separat modell hÃĨndterer motorer. Den er tilgjengelig for utviklere gjennom Gemini API og Google AI Studio, med privat-forhÃĨndsvisning pÃĨ Gemini Enterprise Agent Platform.

ER 2 tar inn video, bilder, lyd og tekst, resonerer om scenen, planlegger en oppgave som varer flere minutter, og sÃĨ kaller noe annet for ÃĨ flytte hÃĨrdwaren: en visjon-sprÃĨk-handling modell, en navigasjons-API eller en utviklers egen funksjon erklÃĶrt til modellen som et verktÃļy. Den kan ogsÃĨ kalle Google SÃļk midt i oppgaven. Modellkortet beskriver det som en visjon-sprÃĨk-modell basert pÃĨ Gemini 3.5 Flash, med en 128 000-token kontekstvindu og opptil 64 000 token utdata.

Det etterfÃļlger Gemini Robotics-ER 1.6, utgitt 14. april 2026, som la til instrumentlesing (tolking av trykkgauger eller kjemiske sikteglass), en funksjon Google utviklet med Boston Dynamics for inspeksjonsrundturer i anlegg. ER 2 utvider dette til digitale skjermer, lineÃĶre skalaer, regler og vÃĶske-termometre, testet pÃĨ 10 instrumenttyper.

Hva kontinuerlig video legger til

Den vesentlige endringen er at ER 2 resonerer over en live videostrÃļm i stedet for stille bilder, noe som lar det dÃļmme noe som har stille begrenset robotautonomi: om et skritt er fullfÃļrt.

To evner kommer ut av dette. Fremgangsklassifisering ber modellen om ÃĨ sortere hver ramme i en strÃļm inn i en av fem fullfÃļringsbÃĨnd, fra 0–20% til 80–100%; Google rapporterer 57,4% nÃļyaktighet. Øyeblikksfunn ber det om ÃĨ plassere den eksakte rammen der et kritisk hendelse skjer, som punktet der en kopp er full nok til ÃĨ stoppe ÃĨ helle. Selskapet rapporterer 91,3% nÃļyaktighet pÃĨ denne oppgaven med en gjennomsnittlig feil pÃĨ 0,96 sekunder, og sier at modellen leverer det omtrent fire ganger kjÃļretidshastigheten til mye stÃļrre modeller for en brÃļkdel av beregningen.

Sub-sekundtidsstyring er det som teller pÃĨ en virkelig maskin. En robot som kan si at et skritt er 60% fullfÃļrt, eller har feilet fullstendig, kan prÃļve ÃĨ gjÃļre om skrittet i stedet for ÃĨ starte pÃĨ nytt eller vente pÃĨ en operatÃļr. ER 2 strÃļmmer gjennom Gemini Live API’s toveiskommunikasjonsendepunkt, som er hvordan Google holder resonanslÃļkken fra ÃĨ sette inn stopp-og-tenk-pauser mellom handlinger. Å fÃĨ inferensforsinkelse lav nok for fysisk kontroll er det samme begrensningen som driver robotikk-leverandÃļrer mot dedikert pÃĨ-robot-silikon og enkel-GPU-sanntidsmodeller.

To roboter, en jobb

Den andre nye evnen er multi-robot samarbeid: forskjellige maskiner deler en semantisk forstÃĨelse av en oppgave og hÃĨndterer arbeid mellom dem, basert pÃĨ antagelsen at en hjulbasert og et par ben er egnet til forskjellige deler av samme jobb. DeepMinds demonstrasjon parer Apptronik’s Apollo 2 humanoid med en Franka Duo bi-arm plattform. En annen demo har ER 2 som kjÃļrer navigasjons- og manipulator-API-er pÃĨ Boston Dynamics’ Spot for ÃĨ hente et objekt pÃĨ en talt kommando.

Alt dette kjÃļrer pÃĨ hÃĨrdware som Google ikke bygger, som er hvordan stÃļrsteparten av denne markedet nÃĨ fungerer: modellen kommer fra en frontlab og armene, bena og grippere kommer fra partnere, samme splitt som bak cobot-produsenter som sÃļker etter grunnleggende AI-utviklere og plattformnivÃĨ-inkarnert AI-stakker.

ER 2 ankom som en del av en tre-modell-familie. Den ledsagende forskningsposten fra Gemini Robotics-teamet dekker Gemini Robotics 2, en handlingmodell som kontrollerer fullstendige humanoider fra fÃļtter til fingertopper, og Gemini Robotics On-Device 2, som kjÃļrer lokalt og tilpasser seg en ny bi-arm robot pÃĨ noen fÃĨ timer fra fÃĶrre enn 200 eksempler. Begge gÃĨr til tidlige tilgangspartnere i stedet for ÃĨpen API.

Laget publiserte ogsÃĨ suksessraten bak denne handlingmodellen, som drev tre forskjellige robotkropper fra ett enkelt kontrollpunkt. Apollo 2 utstyrt med Inspire-hender plukket objekter fra en hylle 76,3% av tiden, fra et bord 68,4% og fra gulvet 45,7%. Fem-finger-arbeid med 22-graders-frihet SharpaWave-hÃĨnd er lengre tilbake: 92% for ÃĨ skru av en lyspÃĶre, 36% for ÃĨ skru pÃĨ en, 44% for ÃĨ knyte en sÃļppelsekk. DeepMind beskriver multi-finger-dexterous manipulering som fortsatt utfordrende, noe som setter en nyttig markÃļr for hvem som vurderer humanoid-kapasitetskrav.

Sikkerhetsbegrensninger og fÃļrste utrullinger

Google rapporterer fremgang pÃĨ sikkerhetsinstruksjonsfÃļlgelse og menneske-nÃĶrhet-benchmark, og sier at ER 2 stopper en humanoid nÃĨr en person kommer nÃĶr, og sÃĨ gjenopptar pÃĨ egen hÃĨnd nÃĨr omrÃĨdet er klart. DeepMind kaller stopp for en nÃĶr menneske en nÃļkkelkrav i samarbeidssikkerhetsstandarder, og det er et krav som vanligvis mÃļtes i hÃĨrdware i stedet for i planleggingsmodellen: Apollo 2s egen design stopper bevegelse nÃĨr et objekt gÃĨr inn i dens definerte impaktradius.

DeepMind har ogsÃĨ lansert ASIMOV-Agentic, en benchmark for om en resonansmodell oppfÃļrer seg trygt som en orkestrator: nekte ubesikrede verktÃļykall fra handlingmodellen, dÃļmme om en oppgave er fysisk gjennomfÃļrbare, og be en menneske om hjelp nÃĨr det er usikkert.

Modellkortet tegner en fast utrullingsgrense. Google forteller utviklere ÃĨ ikke bruke robotikk-modellene til sikkerhetskritisk arbeid, navngir helsevesen og transport, eller hvor en feil kunne forutsigbart forÃĨrsake dÃļd, skade eller eiendomsskade. Denne sprÃĨkretningen peker den fÃļrste bÃļlgen av utrullinger mot inspeksjon, lagerhÃĨndtering og lab-oppgaver.

For robot-byggere er ER 2 laget tilgjengelig for ÃĨ kalle fra Gemini API uten partnerskap, rettet mot lag som allerede har arbeidende hÃĨrdware og trenger noe som bestemmer hva det gjÃļr neste.

Orion Sato er en AI-generert korrespondent som fokuserer pÃĨ robotikk, automatisering og intelligente maskiner. Hans skriving utforsker hvordan fremgangen i robotikk omformer produksjon, logistikk, helsevesen og hverdagsliv gjennom stadig mer autonome systemer.
Med en teknisk og utfÃļringssorientert perspektiv analyserer Orion robotarkitekturer, sensorfusjon, kontrollsystemer og konvergensen av AI med mekanisk intelligens. Han er spesielt interessert i hvordan automatisering flytter fra kontrollerte miljÃļer til virkelige verdensapplikasjoner, der pÃĨlitelighet, sikkerhet og effisiens betyr mest.
Artikler skrevet av Orion Sato er AI-generert og gjennomgÃĨtt av Unite.AIs redaksjonelle team for ÃĨ sikre teknisk nÃļyaktighet, klarhet og overholdelse av redaksjonelle standarder.