Robotik und physische KI

Google liefert Gemini-Robotics-ER-2 mit Multi-Robot-Zusammenarbeit

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Google hat Gemini Robotics ER 2 veröffentlicht, ein Modell mit eingebetteter Argumentation, das als High-Level-Planner für einen Roboter dient, während ein separates Modell die Motoren handhabt. Es ist Entwicklern über die Gemini-API und Google AI Studio verfügbar, mit privater Vorschau auf der Gemini Enterprise Agent Plattform.

ER 2 verarbeitet Video, Bilder, Audio und Text, argumentiert über die Szene, plant eine Aufgabe, die mehrere Minuten dauert, und ruft dann etwas anderes auf, um die Hardware zu bewegen: ein Vision-Sprache-Handlungsmodell, eine Navigation-API oder eine Funktion, die von einem Entwickler als Werkzeug deklariert wird. Es kann auch Google-Suche während der Aufgabe aufrufen. Die Modellkarte beschreibt es als Vision-Sprachmodell auf Basis von Gemini 3.5 Flash, mit einem Kontextfenster von 128.000 Token und bis zu 64.000 Token Ausgabe.

Es ist der Nachfolger von Gemini Robotics-ER 1.6, das am 14. April 2026 veröffentlicht wurde und das Lesen von Instrumenten (Interpretation eines Druckmessgeräts oder eines chemischen Sichtglases) hinzufügte, eine Fähigkeit, die Google mit Boston Dynamics für die Inspektion von Anlagen entwickelte. ER 2 erweitert dies auf digitale Anzeigen, lineare Skalen, Lineale und Flüssigkeitsthermometer, getestet an 10 Instrumententypen.

Was kontinuierliches Video hinzufügt

Die wesentliche Änderung besteht darin, dass ER 2 über eine Live-Video-Feed argumentiert, anstatt über einzelne Bilder, was es ermöglicht, zu beurteilen, ob ein Schritt abgeschlossen ist.

Zwei Fähigkeiten resultieren daraus. Die Klassifizierung des Fortschritts fordert das Modell auf, jedes Bild eines Feed in eine von fünf Vervollständigungsstufen einzuordnen, von 0-20% bis 80-100%; Google berichtet über eine Genauigkeit von 57,4%. Die Moment-Erkennung fordert es auf, den genauen Rahmen zu bestimmen, in dem ein kritischer Ereignis auftritt, wie z.B. der Punkt, an dem ein Becher voll genug ist, um das Gießen zu stoppen. Das Unternehmen berichtet über eine Genauigkeit von 91,3% bei dieser Aufgabe mit einem mittleren Fehler von 0,96 Sekunden und sagt, dass das Modell dies mit etwa viermal der Ausführungsgeschwindigkeit viel größerer Modelle für einen Bruchteil der Rechenleistung liefert.

Unter-Sekunden-Timing ist der Teil, der auf einer realen Maschine zählt. Ein Roboter, der erkennen kann, dass ein Schritt zu 60% abgeschlossen ist oder vollständig fehlgeschlagen ist, kann diesen Schritt wiederholen, anstatt den Workflow neu zu starten oder auf einen Operator zu warten. ER 2 wird über die Gemini Live-APIs bidirektionale Endpunkt gestreamt, was die Art und Weise ist, wie Google die Argumentations-Schleife von Stop-and-Think-Pausen zwischen Aktionen befreit. Die Reduzierung der Inferenz-Verzögerung auf ein ausreichendes Maß für die physische Steuerung ist die gleiche Einschränkung, die Roboter-Hersteller dazu bringt, dedizierte On-Roboter-Silizium und Single-GPU-Echtzeit-Modelle zu verwenden.

Zwei Roboter, ein Job

Die andere neue Fähigkeit ist die Multi-Roboter-Zusammenarbeit: verschiedene Maschinen teilen ein semantisches Verständnis einer Aufgabe und übergeben die Arbeit zwischen ihnen, basierend auf der Annahme, dass eine rollende Basis und ein Paar Beine für verschiedene Teile desselben Jobs geeignet sind. DeepMinds Demonstration kombiniert Apptronik’s Apollo 2 humanoiden Roboter mit einer Franka Duo Bi-Arm-Plattform. Eine zweite Demo hat ER 2, der die Navigation und Manipulator-APIs auf Boston Dynamics’ Spot steuert, um auf einen gesprochenen Befehl hin ein Objekt zu holen.

Alles davon läuft auf Hardware, die Google nicht selbst herstellt, was die Art und Weise ist, wie dieser Markt jetzt funktioniert: das Modell kommt aus einem Frontier-Labor und die Arme, Beine und Greifer kommen von Partnern, die gleiche Aufteilung, die hinter Cobot-Herstellern und Plattform-Embodied-Stacks steckt.

ER 2 ist Teil einer dreiteiligen Modellfamilie. Der begleitende Forschungsbeitrag des Gemini-Robotics-Teams behandelt Gemini Robotics 2, ein Aktionsmodell, das vollständige Humanoiden von den Füßen bis zu den Fingern steuert, und Gemini Robotics On-Device 2, das lokal läuft und sich an einen neuen Bi-Arm-Roboter in wenigen Stunden anpasst, basierend auf weniger als 200 Beispielen. Beide Modelle sind nur für Early-Access-Partner verfügbar und nicht für die offene API.

Das Team hat auch die Erfolgsraten hinter diesem Aktionsmodell veröffentlicht, das drei verschiedene Roboterkörper von einem einzigen Checkpoint aus steuerte. Apollo 2 mit Inspire-Händen nahm Objekte von einem Regal 76,3% der Zeit, von einem Tisch 68,4% und vom Boden 45,7%. Fünffinger-Arbeit mit der 22-Grad-der-Freiheit-SharpaWave-Hand ist weiter zurück: 92% für das Lösen einer Glühbirne, 36% für das Einschrauben einer Glühbirne, 44% für das Binden einer Mülltüte. DeepMind beschreibt die multi-finger-Dexterität als immer noch herausfordernd, was ein nützliches Maß für die Bewertung von humanoiden Fähigkeitsansprüchen darstellt.

Sicherheitsgrenzen und erste Einsatzbereiche

Google berichtet über Fortschritte bei der Einhaltung von Sicherheitsanweisungen und der Nähe zu Menschen und sagt, dass ER 2 einen Humanoiden stoppt, wenn eine Person in der Nähe kommt, und dann wieder startet, wenn der Bereich frei ist. DeepMind bezeichnet das Stoppen für einen nahegelegenen Menschen als eine wichtige Anforderung in den Sicherheitsstandards für die Zusammenarbeit und sagt, dass dies normalerweise in der Hardware und nicht im Planungsmodell erfüllt wird: Apollo 2s eigene Konstruktion stoppt die Bewegung, wenn ein Objekt in seinen definierten Einflussbereich eintritt.

DeepMind hat auch ASIMOV-Agentic veröffentlicht, einen Benchmark für die Frage, ob ein Argumentationsmodell als Orchestrator sicher verhält: es weigert sich, unsichere Werkzeugaufrufe vom Aktionsmodell zu akzeptieren, beurteilt, ob eine Aufgabe physisch machbar ist, und fragt einen Menschen um Hilfe, wenn es unsicher ist.

Die Modellkarte zieht eine feste Einsatzgrenze. Google sagt Entwicklern, dass sie die Robotik-Modelle nicht für sicherheitskritische Arbeiten verwenden sollten, wie z.B. im Gesundheitswesen oder im Verkehr, oder an Orten, an denen ein Ausfall vorhersehbar den Tod, eine Verletzung oder Sachschaden verursachen könnte. Diese Sprache lenkt die erste Welle der Einsatzbereiche in Richtung Inspektion, Lagerverwaltung und Laboraufgaben.

Für Roboterbauer ist ER 2 die Schicht, die über die Gemini-API ohne Partnerschaft aufgerufen werden kann, gerichtet an Teams, die bereits funktionierende Hardware haben und etwas benötigen, um zu entscheiden, was sie als nächstes tun. oder property damage. That language points the first wave of deployments toward inspection, warehouse handling and lab tasks. For robot builders, ER 2 is the layer available to call from the Gemini API without a partnership, aimed at teams that already have working hardware and need something to decide what it does next.

Orion Sato ist ein künstlich intelligenter Korrespondent, der sich auf Robotik, Automatisierung und intelligente Maschinen konzentriert. Seine Schriften erforschen, wie Fortschritte in der Robotik die Fertigung, Logistik, Gesundheitsversorgung und das alltägliche Leben durch zunehmend autonome Systeme verändern.

Mit einer technischen und ausführungsorientierten Perspektive analysiert Orion robotische Architekturen, Sensor-Fusion, Steuersysteme und die Konvergenz von künstlicher Intelligenz mit mechanischer Intelligenz. Er ist besonders an der Frage interessiert, wie die Automatisierung aus kontrollierten Umgebungen in die reale Welt übergeht, wo Zuverlässigkeit, Sicherheit und Effizienz am wichtigsten sind.

Artikel, die von Orion Sato verfasst werden, sind künstlich intelligente Generierungen, die von Unite.AIs Redaktionsteam überprüft werden, um technische Genauigkeit, Klarheit und Einhaltung von Redaktionsstandards sicherzustellen.