Robotik und physische KI

Google liefert Gemini-Robotics-ER-2 mit Multi-Robot-Zusammenarbeit

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufÞgen

Google hat Gemini Robotics ER 2 verÃķffentlicht, ein Modell mit eingebetteter Argumentation, das als High-Level-Planner fÞr einen Roboter dient, wÃĪhrend ein separates Modell die Motoren handhabt. Es ist Entwicklern Þber die Gemini-API und Google AI Studio verfÞgbar, mit privater Vorschau auf der Gemini Enterprise Agent Plattform.

ER 2 verarbeitet Video, Bilder, Audio und Text, argumentiert Þber die Szene, plant eine Aufgabe, die mehrere Minuten dauert, und ruft dann etwas anderes auf, um die Hardware zu bewegen: ein Vision-Sprache-Handlungsmodell, eine Navigation-API oder eine Funktion, die von einem Entwickler als Werkzeug deklariert wird. Es kann auch Google-Suche wÃĪhrend der Aufgabe aufrufen. Die Modellkarte beschreibt es als Vision-Sprachmodell auf Basis von Gemini 3.5 Flash, mit einem Kontextfenster von 128.000 Token und bis zu 64.000 Token Ausgabe.

Es ist der Nachfolger von Gemini Robotics-ER 1.6, das am 14. April 2026 verÃķffentlicht wurde und das Lesen von Instrumenten (Interpretation eines DruckmessgerÃĪts oder eines chemischen Sichtglases) hinzufÞgte, eine FÃĪhigkeit, die Google mit Boston Dynamics fÞr die Inspektion von Anlagen entwickelte. ER 2 erweitert dies auf digitale Anzeigen, lineare Skalen, Lineale und FlÞssigkeitsthermometer, getestet an 10 Instrumententypen.

Was kontinuierliches Video hinzufÞgt

Die wesentliche Änderung besteht darin, dass ER 2 Þber eine Live-Video-Feed argumentiert, anstatt Þber einzelne Bilder, was es ermÃķglicht, zu beurteilen, ob ein Schritt abgeschlossen ist.

Zwei FÃĪhigkeiten resultieren daraus. Die Klassifizierung des Fortschritts fordert das Modell auf, jedes Bild eines Feed in eine von fÞnf VervollstÃĪndigungsstufen einzuordnen, von 0-20% bis 80-100%; Google berichtet Þber eine Genauigkeit von 57,4%. Die Moment-Erkennung fordert es auf, den genauen Rahmen zu bestimmen, in dem ein kritischer Ereignis auftritt, wie z.B. der Punkt, an dem ein Becher voll genug ist, um das Gießen zu stoppen. Das Unternehmen berichtet Þber eine Genauigkeit von 91,3% bei dieser Aufgabe mit einem mittleren Fehler von 0,96 Sekunden und sagt, dass das Modell dies mit etwa viermal der AusfÞhrungsgeschwindigkeit viel grÃķßerer Modelle fÞr einen Bruchteil der Rechenleistung liefert.

Unter-Sekunden-Timing ist der Teil, der auf einer realen Maschine zÃĪhlt. Ein Roboter, der erkennen kann, dass ein Schritt zu 60% abgeschlossen ist oder vollstÃĪndig fehlgeschlagen ist, kann diesen Schritt wiederholen, anstatt den Workflow neu zu starten oder auf einen Operator zu warten. ER 2 wird Þber die Gemini Live-APIs bidirektionale Endpunkt gestreamt, was die Art und Weise ist, wie Google die Argumentations-Schleife von Stop-and-Think-Pausen zwischen Aktionen befreit. Die Reduzierung der Inferenz-VerzÃķgerung auf ein ausreichendes Maß fÞr die physische Steuerung ist die gleiche EinschrÃĪnkung, die Roboter-Hersteller dazu bringt, dedizierte On-Roboter-Silizium und Single-GPU-Echtzeit-Modelle zu verwenden.

Zwei Roboter, ein Job

Die andere neue FÃĪhigkeit ist die Multi-Roboter-Zusammenarbeit: verschiedene Maschinen teilen ein semantisches VerstÃĪndnis einer Aufgabe und Þbergeben die Arbeit zwischen ihnen, basierend auf der Annahme, dass eine rollende Basis und ein Paar Beine fÞr verschiedene Teile desselben Jobs geeignet sind. DeepMinds Demonstration kombiniert Apptronik’s Apollo 2 humanoiden Roboter mit einer Franka Duo Bi-Arm-Plattform. Eine zweite Demo hat ER 2, der die Navigation und Manipulator-APIs auf Boston Dynamics’ Spot steuert, um auf einen gesprochenen Befehl hin ein Objekt zu holen.

Alles davon lÃĪuft auf Hardware, die Google nicht selbst herstellt, was die Art und Weise ist, wie dieser Markt jetzt funktioniert: das Modell kommt aus einem Frontier-Labor und die Arme, Beine und Greifer kommen von Partnern, die gleiche Aufteilung, die hinter Cobot-Herstellern und Plattform-Embodied-Stacks steckt.

ER 2 ist Teil einer dreiteiligen Modellfamilie. Der begleitende Forschungsbeitrag des Gemini-Robotics-Teams behandelt Gemini Robotics 2, ein Aktionsmodell, das vollstÃĪndige Humanoiden von den FÞßen bis zu den Fingern steuert, und Gemini Robotics On-Device 2, das lokal lÃĪuft und sich an einen neuen Bi-Arm-Roboter in wenigen Stunden anpasst, basierend auf weniger als 200 Beispielen. Beide Modelle sind nur fÞr Early-Access-Partner verfÞgbar und nicht fÞr die offene API.

Das Team hat auch die Erfolgsraten hinter diesem Aktionsmodell verÃķffentlicht, das drei verschiedene RoboterkÃķrper von einem einzigen Checkpoint aus steuerte. Apollo 2 mit Inspire-HÃĪnden nahm Objekte von einem Regal 76,3% der Zeit, von einem Tisch 68,4% und vom Boden 45,7%. FÞnffinger-Arbeit mit der 22-Grad-der-Freiheit-SharpaWave-Hand ist weiter zurÞck: 92% fÞr das LÃķsen einer GlÞhbirne, 36% fÞr das Einschrauben einer GlÞhbirne, 44% fÞr das Binden einer MÞlltÞte. DeepMind beschreibt die multi-finger-DexteritÃĪt als immer noch herausfordernd, was ein nÞtzliches Maß fÞr die Bewertung von humanoiden FÃĪhigkeitsansprÞchen darstellt.

Sicherheitsgrenzen und erste Einsatzbereiche

Google berichtet Þber Fortschritte bei der Einhaltung von Sicherheitsanweisungen und der NÃĪhe zu Menschen und sagt, dass ER 2 einen Humanoiden stoppt, wenn eine Person in der NÃĪhe kommt, und dann wieder startet, wenn der Bereich frei ist. DeepMind bezeichnet das Stoppen fÞr einen nahegelegenen Menschen als eine wichtige Anforderung in den Sicherheitsstandards fÞr die Zusammenarbeit und sagt, dass dies normalerweise in der Hardware und nicht im Planungsmodell erfÞllt wird: Apollo 2s eigene Konstruktion stoppt die Bewegung, wenn ein Objekt in seinen definierten Einflussbereich eintritt.

DeepMind hat auch ASIMOV-Agentic verÃķffentlicht, einen Benchmark fÞr die Frage, ob ein Argumentationsmodell als Orchestrator sicher verhÃĪlt: es weigert sich, unsichere Werkzeugaufrufe vom Aktionsmodell zu akzeptieren, beurteilt, ob eine Aufgabe physisch machbar ist, und fragt einen Menschen um Hilfe, wenn es unsicher ist.

Die Modellkarte zieht eine feste Einsatzgrenze. Google sagt Entwicklern, dass sie die Robotik-Modelle nicht fÞr sicherheitskritische Arbeiten verwenden sollten, wie z.B. im Gesundheitswesen oder im Verkehr, oder an Orten, an denen ein Ausfall vorhersehbar den Tod, eine Verletzung oder Sachschaden verursachen kÃķnnte. Diese Sprache lenkt die erste Welle der Einsatzbereiche in Richtung Inspektion, Lagerverwaltung und Laboraufgaben.

FÞr Roboterbauer ist ER 2 die Schicht, die Þber die Gemini-API ohne Partnerschaft aufgerufen werden kann, gerichtet an Teams, die bereits funktionierende Hardware haben und etwas benÃķtigen, um zu entscheiden, was sie als nÃĪchstes tun. oder property damage. That language points the first wave of deployments toward inspection, warehouse handling and lab tasks. For robot builders, ER 2 is the layer available to call from the Gemini API without a partnership, aimed at teams that already have working hardware and need something to decide what it does next.

Orion Sato ist ein kÞnstlich intelligenter Korrespondent, der sich auf Robotik, Automatisierung und intelligente Maschinen konzentriert. Seine Schriften erforschen, wie Fortschritte in der Robotik die Fertigung, Logistik, Gesundheitsversorgung und das alltÃĪgliche Leben durch zunehmend autonome Systeme verÃĪndern.

Mit einer technischen und ausfÞhrungsorientierten Perspektive analysiert Orion robotische Architekturen, Sensor-Fusion, Steuersysteme und die Konvergenz von kÞnstlicher Intelligenz mit mechanischer Intelligenz. Er ist besonders an der Frage interessiert, wie die Automatisierung aus kontrollierten Umgebungen in die reale Welt Þbergeht, wo ZuverlÃĪssigkeit, Sicherheit und Effizienz am wichtigsten sind.

Artikel, die von Orion Sato verfasst werden, sind kÞnstlich intelligente Generierungen, die von Unite.AIs Redaktionsteam ÞberprÞft werden, um technische Genauigkeit, Klarheit und Einhaltung von Redaktionsstandards sicherzustellen.