Robotiikka ja fyysinen AI

Google julkaisee Gemini Robotics ER 2:n, jossa on monirobottiyhteistyö

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Google on julkaissut Gemini Robotics ER 2:n, joka on kehon sisäinen malli, joka toimii robotin korkean tason suunnittelijana, kun erillinen malli vastaa moottoreista. Se on saatavilla kehittäjille Gemini API:n ja Google AI Studio:n kautta, ja yksityinen esikatselu on saatavilla Gemini Enterprise Agent -alustalla.

ER 2 vastaanottaa videon, kuvat, äänen ja tekstin, pohtii kohtausta, suunnittelee useita minuutteja kestävän tehtävän ja kutsuu jotakin muuta liikuttamaan laitteistoa: visio-kieli-toimintamalli, navigointi-API tai kehittäjän oma funktio, joka on ilmoitettu mallille työkaluna. Se voi myös kutsua Google-hakua tehtävän aikana. Mallikortti kuvailee sen visio-kielimalliksi, joka perustuu Gemini 3.5 Flashiin, jossa on 128 000 tokenin kontekstiruutu ja jopa 64 000 tokenin tuloste.

Se seuraa Gemini Robotics-ER 1.6:aa, joka julkaistiin 14. huhtikuuta 2026, jolloin se lisäsi soittimen lukemisen (tulkitsemalla painemittarin tai kemikaalilasien) mahdollisuuden, jonka Google kehitti yhdessä Boston Dynamicsin kanssa laitosten tarkastuskiertoja varten. ER 2 laajentaa sen digitaalisille näytöille, lineaarisille skaaloille, viivoittimille ja nestetermometreille, joita on testattu 10 eri instrumenttityyppiä.

Mitä jatkuva video lisää

Merkittävin muutos on, että ER 2 pohtii reaaliajassa videovirtaa sen sijaan, että se käyttäisi vain yksittäisiä kehyskokoelmia, mikä mahdollistaa sen, että se voi arvioida jotakin, joka on hiljaisesti rajoittanut robottien autonomiaa: onko askel valmis.

Kaksi ominaisuutta tulee siitä. Edistymisen luokittelu pyytää mallilta jokaisen kehyksen luokitteluun yhteen viidestä valmiuskaistasta, 0-20 prosentista 80-100 prosenttiin; Google ilmoittaa 57,4 prosentin tarkkuuden. Hetken etsintä pyytää sitä määrittämään tarkka kehys, jossa kriittinen tapahtuma tapahtuu, kuten se kohta, jossa kuppi on täynnä tarpeeksi lopettaaksesi kaatamisen. Yritys ilmoittaa 91,3 prosentin tarkkuuden tässä tehtävässä keskimääräisellä virheellä 0,96 sekuntia, ja sanoo, että malli toimittaa sen noin neljä kertaa suuremmalla suoritusnopeudella kuin paljon suuremmat mallit murto-osaan laskentakapasiteetista.

Alle sekunnin aikamuotoilu on se osa, joka on tärkeää oikealla koneella. Robotti, joka voi kertoa, onko askel 60 prosenttisesti valmis tai on epäonnistunut kokonaan, voi yrittää uudelleen kyseistä askelta sen sijaan, että se käynnistäisi uudelleen työnkulun tai odottaisi operaattoria. ER 2 virtaa Gemini Live API:n kaksisuuntaisessa päätepisteessä, joka on se, miten Google pitää pohtimissilmukkaa lisäämästä pysäytys- ja ajattelupaukkoja toimien välille. Saada inference-viive riittävän alhaiseksi fyysiseen ohjaamiseen on sama rajoitus, joka pakottaa robotti-valmistajia käyttämään omistettua robotti-siliconia ja yksittäisen GPU:n reaaliaikaisia malleja.

Kaksi robottia, yksi työ

Toinen uusi ominaisuus on monirobottiyhteistyö: eri koneet jakavat semanttisen ymmärryksen tehtävästä ja luovuttavat työt toisilleen, perustellen, että pyörivä alusta ja pari jalkoja soveltuvat eri osiin samasta työstä. DeepMindin esittely parittaa Apptronikin Apollo 2 humanoidin Franka Duo -bi-arm-alustan kanssa. Toinen esittelyssä ER 2 ohjaa navigointi- ja manipulaattori-API:ja Boston Dynamicsin Spot:lla hakemaan esineen äänikomennolla.

Kaikki tämä toimii laitteistolla, jota Google ei itse valmistaa, joka on se, miten suurin osa tästä markkinasta toimii nykyään: malli tulee eturintamalaboratoriosta ja käsivarret, jalat ja otteet tulevat kumppaneilta, sama jakautuminen kuin cobot-valmistajien ja alustatasoisten kehollisten pinostusten kanssa.

ER 2 saapui osana kolmen malliperheen joukkoa. Tutkimusjulkaisu Gemini Robotics -tiimiltä kattaa Gemini Robotics 2:n, toimintamallin, joka ohjaa täysin humanoidirobotteja jalasta sormenpäihin, ja Gemini Robotics On-Device 2:n, joka toimii paikallisesti ja sopeutuu uuteen bi-arm-robottiin muutamassa tunnissa vähemmän kuin 200 esimerkin avulla. Molemmat menevät varhaisiin kumppaneihin avoimen API:n sijaan.

Tiimi julkaisi myös onnistumisprosentit takana olevasta toimintamallista, joka ohjasi kolmea eri robotti-runkoa yhdestä tarkistuspisteestä. Apollo 2, jossa on Inspire-kädet, poimi esineitä hyllystä 76,3 prosenttisesti, pöydältä 68,4 prosenttisesti ja lattialta 45,7 prosenttisesti. Viisivarpaisten työn kanssa 22 astetta vapautta olevalla SharpaWave-kädellä on edelleen takana: 92 prosenttia ruuvien irrottamisesta, 36 prosenttia ruuvien kiinnittämisestä, 44 prosenttia roskapussin sitomisesta. DeepMind kuvailee monisormista taiturimaista manipulaatiota edelleen haastavaksi, mikä asettaa hyödyllisen merkin kenenkään arvioinnille humanoidin kyvyistä.

Turvalimitit ja ensimmäiset käyttöönotot

Google ilmoittaa voittoja turvallisuusohjeiden noudattamisesta ja lähellä olevien ihmisten vertailuista, ja sanoo, että ER 2 pysäyttää humanoidin, kun ihminen tulee lähelle, ja jatkaa itsestään, kun alue on selvä. DeepMind kutsuu lähellä olevan ihmisen pysäyttämistä avainvaatimukseksi yhteistyössä turvallisuusstandardeissa, ja se on vaatimus, jota yleensä täytetään laitteistossa eikä suunnittelumallissa: Apollo 2:n oma suunnittelu pysäyttää liikkeen, kun esine sisääntullessaan määritetyn vaikutusalueen.

DeepMind julkaisi myös ASIMOV-Agenticin, jonka ansiosta voidaan arvioida, käyttäyköön malli toimii turvallisesti orkestraattorina: kieltäminen turvattomia työkalukutsuja toimintamallilta, arviointi siitä, onko tehtävä fyysisesti toteutettavissa, ja pyytäminen apua ihmiseltä, kun se on epävarma.

Mallikortti piirtää tiukan käyttöönoton rajan. Google kertoo kehittäjille, ettei heidän pidä käyttää robottimalleja turvallisuuskriittiseen työhön, kuten terveydenhuoltoon tai liikenteeseen, tai mihin tahansa, missä virhe voisi ennustettavasti aiheuttaa kuoleman, vammoja tai vahinkoa omaisuudelle. Tämä kieli ohjaa ensimmäisen aallon käyttöönottoja tarkastus-, varastohallinta- ja laboratoriotöihin.

Robottirakentajille ER 2 on kerros, jota voidaan kutsua Gemini API:sta ilman kumppanuutta, joka on suunnattu tiimille, joilla on jo toimiva laitteisto ja jotka tarvitsevat jotakin, joka päättää, mitä se tekee seuraavaksi.

Orion Sato on tekoälygeneroiva kirjeenvaihtaja, joka keskittyy robotiikkaan, automaatioon ja älykkäisiin koneisiin. Hänen kirjoituksensa tarkastelevat, miten robotiikan edistysaskeleet muokkaavat valmistusta, logistiikkaa, terveydenhuoltoa ja arkipäivän elämää yhä enenevässä määrin autonomisten järjestelmien kautta.
Teknisen ja toteutukseen suunnatun näkökulman kautta Orion analysoi robotiikan arkkitehtuureja, sensorien yhdistämistä, ohjausjärjestelmiä ja tekoälyn yhdistymistä mekaaniseen älykkyyteen. Hän on erityisen kiinnostunut siitä, miten automaatio siirtyy ohjatuista ympäristöistä todelliseen maailman käyttöön, jossa luotettavuus, turvallisuus ja tehokkuus ovat tärkeimmät.
Orion Sato kirjoittamat artikkelit ovat tekoälygeneroituja ja Unite.AI:n toimittajatiimin tarkastamia, jotta varmistetaan tekninen tarkkuus, selkeys ja yhdenmukaisuus toimittajien standardeiden kanssa.