Robotiikka ja fyysinen AI

Figure esittelee Helix 2.5:n, testattu zero-shot-tilassa 30 näkemättömässä kodissa

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Figure esitteli Helix 2.5 17. syyskuuta 2026, humanoidinen neuroverkko, joka on esikoulutettu yrityksen Index‑datassa ihmisen käyttäytymisestä, ja arvioitu 30 Bay Area -kodissa ilman, että niissä kerättiin dataa. Figure raportoi, että Index‑esikoulutus nosti zero-shot‑menestyksen 9 %:sta 56 %:iin kontrolloidussa vertailussa toisin kuin identtinen alusta alun perin koulutettu politiikka.

Figure kuvaili Helix 2.5:n olevan kehittynein neuroverkko, jonka se on rakentanut. Yhdestä Index‑esikoulutetusta perustamallista yritys tuotti kolme koko‑kehon käyttäytymistä: olohuoneiden siivoaminen, pyyhkeiden taittelu ja sängyn teko. Aikaisempi Helix 02 -järjestelmä koordinoi koko‑kehon ohjausta pitkien aikavälien aikana, mukaan lukien astianpesukoneen tyhjentäminen ja logistiikkatehtävän suorittaminen itsenäisesti 200 tunnin ajan, mutta se oppi dataa kerättyä paikoista, joissa robotit toimivat.

Arviointisuunnittelu ja arviointikriteerit

Figure määrittelee zero-shot‑tilanteen viittaavan arviointiympäristöihin ja käsiteltäviin kohteisiin; jokainen käyttäytyminen määriteltiin hienosäätötietojen avulla, jotka kerättiin muualla. Mikään arviointilelu, pyyhe tai vuodevaate ei esiintynyt tehtävänmäärittelytiedoissa, ja robotti käytti kunkin kodin olemassa olevia sohvia, sänkyjä ja taittopintoja. Arviointikohteet asetettiin sivuun ennen kokeiden alkamista, ja tekoälymalli, jonka jälkeen ihmisarviointi, vahvisti, ettei ne olleet mukana tehtävänmäärittelytiedoissa.

Jokaisessa tehtävässä käytettiin yhtä kiinteää tarkistuspistettä kaikissa 30 kodissa. Painoja ei sovitettu arviointikoteihin tai -kohteisiin, eikä arviointirullauksen dataa tai suorituskykyä käytetty tarkistuspisteen valintaan. Menestys vaati koko tehtävän suorittamista ilman osapisteitä. Jokainen kokeilu alkoi ainutlaatuisesta alkukokoonpanosta, ja nollausolosuhteet toteutettiin identtisesti kaikille arvioiduille politiikoille, ja mikä tahansa ihmisen puuttuminen turvallisuuden vuoksi keskeytti rullauksen ja merkitsi sen epäonnistuneeksi.

Arvioijat työskentelivät ennalta määriteltyjen kriteerien mukaan. Olohuoneen siivoaminen vaati kaikkien 13–15 leikin, jotka olivat hajallaan, keräämistä ja laittamista koriin, yhden minuutin aikakatkaisulla per lelu ennen rullauksen keskeytystä. Pyyhkeen taittelu vaati jokaisen pyyhkeen nostamista, taittelua ja sijoittamista koriin, ja taittelun laatu arvioitiin kulmien linjauksesta — paras arvosana vaati kaikkien neljän kulman olevan lähes kosketuksissa yhden tuuman sisällä — sekä kolmen minuutin aikakatkaisulla per pyyhe. Sängyn teko vaati, että molemmat tyynyt ja molemmat peiton kulmat saavuttivat sängyn yläkolmanneksen tasaisen venytetyn peiton kanssa, tyynyjä arvioitiin myös asennon perusteella, ja yhden minuutin aikakatkaisu sovellettiin jokaiselle tyynylle ja jokaiselle peiton puolelle.

Index‑esikoulutuksen vaikutuksen eristäminen

Mittaakseen, kuinka paljon tuloksesta johtui Index‑datasta eikä itse tehtävänmäärittelydatasta, Figure koulutti kaksi politiikkaa identtisellä tehtävänmäärittelydatalla, toinen aloitettu satunnaisilla painoilla ja toinen aloitettu Index‑esikoulutetusta Helix 2.5 -mallista. Arkkitehtuuri, optimointi, hyperparametrit, alijärjestelmän data ja arviointi pidettiin vakiona, jättäen Index‑esikoulutuksen ainoaksi kokeelliseksi muuttujaksi. Helix 2.5 itsessään esikoulutettiin satunnaisesta aloituksesta kokonaan Index‑datalla, toisin kuin Helix 02, joka aloitti esikoulutetusta näkö‑kielimallista.

Sokeissa arvioinneissa alusta alun perin koulutettu politiikka onnistui 9 %:ssa zero-shot‑kokeista, kun taas Index‑esikoulutettu politiikka onnistui 56 %:ssa, mikä on Figure:n kuvaama kuuden kertaa suurempi ero. Koska esikoulutus oli ainoa muuttuja, yritys sanoo, että ero mittaa suoraan sen panosta. Figure raportoi, että mikään yksittäinen arviointitehtävä ei kata yli 1,90 %:a Index‑esikoulutusdatasta, ja totesi, että tietoonsa tämä on ensimmäinen zero-shot‑koko‑kehon yleistämisen demonstraatio tällaisessa mittakaavassa humanoidissa.

Datatehokkuus ja siirto‑skaalauslaki

Figure vertasi myös Helix 2.5:n aiempaan Helix 02 -politiikkaan, joka oli koulutettu suorittamaan sama tehtävä käyttämällä suoraan arviointiympäristössä kerättyä dataa. Yritys raportoi, että Helix 2.5 saavutti saman onnistumisprosentin käyttäen vain puolta adaptationdatasta, ja teki sen zero-shot‑tilassa 30 näkemättömässä kodissa. Figure kuvaili lisäksi laadullista parannusta koko‑kehon itsekorjauksessa, kuten askeleen taakseasentoon, asennon muuttamista tai liikkumista täyden sängyn ympärillä taittelun korjaamiseksi, kutsuen sitä tärkeäksi Index‑esikoulutuksen vaikutukseksi.

Erikseen yritys koulutti neljä mallia sisäkkäisissä Index‑osajoukoissa, jotka kattavat kahdeksankertaisen kasvun esikoulutusdatassa, pitäen mallikoon ja alijärjestelmän koulutuksen vakiona, ja raportoi, että pidätetty toimintojen ennustamisvirhe laski ennustettavasti jokaisen Index‑datan kaksinkertaistuksen myötä. Figure kertoi käyttäneensä vain pienempiä suorituksia ennustaakseen suurimman suorituksen testivirheen neljään desimaaliin ennen koulutuksen alkamista, ennusteen virheen ollessa 0,54 % koko kahdeksankertaisen datavälin vaihtelusta. Yritys kuvaili tulosta tietoonsa ensimmäiseksi ihmisen‑robotin siirto-skaalauslaituksi, joka on mitattu humanoidissa, huomauttaen, että se mittaa vain datan skaalausta.

Helix 2.5:n takana oleva Index‑datakokoelma

Figure esitteli Indexin 25. elokuuta 2026, lopetti salamyhkäisyyden ja uudelleennimeä tietojen keräyssovelluksen, jonka se oli lanseerannut neljä kuukautta aiemmin, ja kuvaili sitä kaikkien aikojen monimuotoisimmaksi robottien koulutusdataksi. Tässä ilmoituksessa Figure raportoi 264,000 sovelluksen latausta 108 maassa, yli 44,000 viikoittaista aktiivista käyttäjää, yli 16 miljoonaa videota, jotka Creators, jotka keräävät dataa, ovat ladanneet, $15 miljoonaa maksettu näille Creatorsille, ja 30 minuuttia videoiden latauksia käsiteltynä sekunnissa. Jokaista 1 000 kerättyä tuntia kohden yritys kertoi, että Index sisälsi 373 ainutlaatuista tehtävää, 1 146 ainutlaatuista manipuloitua kohdetta ja 116 ainutlaatuista ympäristöä, jotka prosessoitiin viiden vaiheen putkistossa: suodatus, petostarkastus, deduplikaatio, tasapainotus ja annotointi.

Helix 2.5 -ilmoitus toteaa, että Index tuottaa nyt noin 35 minuuttia uutta ihmiskokemusta sekunnissa, ja että Figure on sitoutunut käyttämään $3.5 miljardia laskentatehoa Helixin kouluttamiseen. Yritys päätti ilmoituksen sanomalla, että se rekrytoi työskentelemään yleisen fyysisen älykkyyden parissa.

Orion Sato on tekoälygeneroiva kirjeenvaihtaja, joka keskittyy robotiikkaan, automaatioon ja älykkäisiin koneisiin. Hänen kirjoituksensa tarkastelevat, miten robotiikan edistysaskeleet muokkaavat valmistusta, logistiikkaa, terveydenhuoltoa ja arkipäivän elämää yhä enenevässä määrin autonomisten järjestelmien kautta.
Teknisen ja toteutukseen suunnatun näkökulman kautta Orion analysoi robotiikan arkkitehtuureja, sensorien yhdistämistä, ohjausjärjestelmiä ja tekoälyn yhdistymistä mekaaniseen älykkyyteen. Hän on erityisen kiinnostunut siitä, miten automaatio siirtyy ohjatuista ympäristöistä todelliseen maailman käyttöön, jossa luotettavuus, turvallisuus ja tehokkuus ovat tärkeimmät.
Orion Sato kirjoittamat artikkelit ovat tekoälygeneroituja ja Unite.AI:n toimittajatiimin tarkastamia, jotta varmistetaan tekninen tarkkuus, selkeys ja yhdenmukaisuus toimittajien standardeiden kanssa.