Robotica en fysieke AI
Google lanceert Gemini Robotics ER 2 met multi-robot teamwork

Google heeft Gemini Robotics ER 2 gelanceerd, een geïncorporeerd-redeneringsmodel dat dient als een robot’s high-level planner, terwijl een apart model de motoren afhandelt. Het is beschikbaar voor ontwikkelaars via de Gemini API en Google AI Studio, met privé-voorbeeldtoegang op het Gemini Enterprise Agent Platform.
ER 2 neemt video, afbeeldingen, audio en tekst in zich op, redeneert over de scène, plant een taak die enkele minuten duurt en roept dan iets anders op om de hardware te bewegen: een visie-taal-actiemodel, een navigatie-API of een door de ontwikkelaar gedeclareerde functie voor het model als een tool. Het kan ook Google Zoeken oproepen tijdens een taak. De modelkaart beschrijft het als een visie-taalmodel gebaseerd op Gemini 3.5 Flash, met een contextwindow van 128.000 tokens en maximaal 64.000 tokens uitvoer.
Het is de opvolger van Gemini Robotics-ER 1.6, dat op 14 april 2026 werd uitgebracht en instrumentlezing (het interpreteren van een drukmeter of een chemisch zichtglas) toevoegde, een functionaliteit die Google ontwikkelde met Boston Dynamics voor inspectierondes in faciliteiten. ER 2 breidt dit uit naar digitale displays, lineaire schalen, regels en vloeistofthermometers, getest op 10 instrumenttypen.
Wat continue video toevoegt
De wezenlijke verandering is dat ER 2 redeneert over een live videofeed in plaats van stilframes, waardoor het kan beoordelen of een stap is voltooid.
Er komen twee mogelijkheden uit voort. Progressieklassificatie vraagt het model om elke frame van een feed in te delen in een van de vijf voltooiingsbanden, van 0-20% tot 80-100%; Google meldt 57,4% nauwkeurigheid. Momentvinden vraagt het model om het exacte frame te bepalen waarop een kritische gebeurtenis plaatsvindt, zoals het punt waarop een kop vol genoeg is om te stoppen met gieten. Het bedrijf meldt 91,3% nauwkeurigheid bij deze taak met een gemiddelde fout van 0,96 seconden en zegt dat het model dit levert bij ongeveer vier keer de uitvoersnelheid van veel grotere modellen voor een fractie van de berekening.
Subseconde-timing is het onderdeel dat op een echte machine telt. Een robot die kan bepalen of een stap 60% voltooid is of volledig is mislukt, kan die stap opnieuw proberen in plaats van de workflow opnieuw te starten of te wachten op een operator. ER 2 stroomt door de bidirectionele eindpunten van de Gemini Live API, waardoor Google de redeneringslus voorkomt om stop-en-denkpauzes tussen acties in te voegen. Het verkrijgen van inferentielatentie laag genoeg voor fysieke controle is dezelfde beperking die roboticsleveranciers ertoe aanzet om gedediceerde siliconen op de robot en single-GPU real-time modellen te gebruiken.
Twee robots, één taak
De andere nieuwe functionaliteit is multi-robot samenwerking: verschillende machines delen een semantische kennis van een taak en geven werk door aan elkaar, met als redenering dat een wielenbasis en een paar benen geschikt zijn voor verschillende delen van dezelfde taak. DeepMinds demonstratie koppelt Apptronik’s Apollo 2 humanoïde aan een Franka Duo bi-arm platform. Een tweede demo heeft ER 2 die de navigatie- en manipulator-API’s op Boston Dynamics’ Spot bestuurt om een object op te halen op een gesproken opdracht.
Alles draait op hardware die Google niet zelf bouwt, wat de manier is waarop de meeste van deze markt nu werkt: het model komt van een frontierlab en de armen, benen en grijpers komen van partners, dezelfde splitsing achter cobot makers die foundation-modelontwikkelaars het hof maken en platformniveau geïncorporeerde stacks.
ER 2 arriveerde als onderdeel van een driemodellenfamilie. De companion research post van het Gemini Robotics-team behandelt Gemini Robotics 2, een actiemodel dat volledige humanoïden van voeten tot vingertoppen bestuurt, en Gemini Robotics On-Device 2, die lokaal draait en zich aanpast aan een nieuwe bi-arm robot in een paar uur van minder dan 200 voorbeelden. Beide gaan naar early-access partners in plaats van de open API.
Het team publiceerde ook de succespercentages achter dat actiemodel, dat drie verschillende robotlichamen vanaf één controlepunt bestuurde. Apollo 2 met Inspire-handen pakte voorwerpen van een plank 76,3% van de tijd, van een tafel 68,4% en van de vloer 45,7%. Vijfvingerig werk met de 22-graden-vrijheidsgraad SharpaWave-hand is verder terug: 92% voor het losdraaien van een lichtpeil, 36% voor het aandraaien ervan, 44% voor het knopen van een vuilniszak. DeepMind beschrijft multi-vinger dexterous manipulatie als nog steeds uitdagend, wat een nuttige marker vormt voor iedereen die humanoïde capaciteitsclaims taxeert.
Veiligheidsgrenzen en eerste inzet
Google meldt winst op veiligheidsinstructievolging en menselijke nabijheidsbenchmarks en zegt dat ER 2 een humanoïde stopt wanneer iemand in de buurt komt, om vervolgens opnieuw te starten zodra het gebied veilig is. DeepMind noemt stoppen voor een nabije mens een belangrijke vereiste in collaboratieve veiligheidsnormen en het is een vereiste die meestal in hardware in plaats van in het planningsmodel wordt vervuld: Apollo 2’s eigen ontwerp pauzeert beweging wanneer een object de gedefinieerde impactradius binnenkomt.
DeepMind bracht ook ASIMOV-Agentic uit, een benchmark voor of een redeneringsmodel veilig gedraagt als een orkestrator: weigeren van onveilige toolaanroepen van het actiemodel, beoordelen of een taak fysiek haalbaar is en een mens om hulp vragen wanneer het onzeker is.
De modelkaart trekt een duidelijke inzetgrens. Google zegt ontwikkelaars dat ze de roboticsmodellen niet moeten gebruiken voor veiligheidscritisch werk, zoals gezondheidszorg en transport, of op plaatsen waar een storing voorzienbaar letsel, dood of eigendomsschade kan veroorzaken. Die taal richt de eerste golf van inzetten op inspectie, magazijnbehandeling en labtaken.
Voor robotbouwers is ER 2 de laag die beschikbaar is om op te roepen vanuit de Gemini API zonder partnerschap, gericht op teams die al werkende hardware hebben en iets nodig hebben om te bepalen wat het volgende is.












