Myslitelé
Učili jsme roboty pohybovat se. Nyní je učíme žít

Moderní robotika dospěla do fáze, kdy pohyb již není hlavní výzvou – stroje již mohou navigovat, zachytit a operovat v prostoru s působivou přesností. Přesto umožnit jim skutečně “žít” a fungovat ve skutečném světě zůstává nevyřešeným problémem.
V tomto procesu hraje klíčovou roli to, co lze nazvat “míchou” : systém zodpovědný za základní reakce, chování a interakci s prostředím.
Když se podíváme na vývoj robotů skrze tuto optiku, stává se zřejmým, že tato posloupnost fází – kde systém naučí něco nového v každém kroku, od jednoduchého pohybu po komplexní, kontextově závislé akce – úzce připomíná lidský vývoj.
A přesně v tomto vývoji – od “prázdného” hardwaru k smysluplnému chování – dochází dnes k hlavnímu posunu v fyzické AI. Zajímavé je to lépe pochopit.
Základ robotiky: fáze, která se zřídka diskutuje
Co je robot v praktických termínech? Je to fyzické zařízení původně vytvořené jako univerzální platforma. V podstatě je to “prázdná stránka”, která musí být poté přizpůsobena konkrétním úkolům, naučena fungovat v daném prostředí a naučena provádět požadované akce.
Pokud se přesuneme za každodenní scénáře a zvažujeme více realistické blízké aplikace, stává se zřejmým, že plné přijetí robotů se bude primárně vyskytovat v průmyslových a potenciálně nebezpečných prostředích. To naopakimplikuje podstatně vyšší požadavky na jejich chování, robustnost a kvalitu výcviku.
Proces začíná nejzákladnějším krokem – stavbou zařízení samotného. Robot se skládá z více komponent, včetně aktuatorů, motorů, senzorů, kamer, LiDARů. Může být humanoidní, na kolečkách, bipedální nebo kvadrupedální – forma je sekundární. Co je důležité, je to, že v této fázi skončíme s funkčním, ale stále “prázdným” zařízením.
Další fází je instalace základní modelu, který slouží jako základ pro jeho chování. V širokém smyslu je “model” celý funkční kontrolní vrstva. Je zodpovědný za základní schopnosti: udržování rovnováhy, stání a pohyb, navigaci z bodu A do bodu B, vyhýbání se překážkám, nezpůsobení poškození prostředí a bezpečnou interakci s lidmi.
To je místo, kde se uplatňuje učení posilováním. V takových systémech se spouští miliardy simulací. Často vidíme videa robotů, kteří “učí” v komplexních prostředích: většina z nich spadne, ztratí rovnováhu nebo nedokáže dokončit úkol. Ale ti, kteří se dokážou udržet vzhůru a pokračovat v pohybu, jsou ti, kteří postupují.
To je podstatou učení posilováním: výběr úspěšného chování. Algoritmy těch, kteří “přežijí”, se stávají základem pro další iterace. Jako výsledek, po enormním počtu běhů, vyvine se model, který může s jistotou zvládnout překážky. Tento algoritmus se pak přenese do fyzického zařízení.
Je to ukotvená, ale kriticky důležitá fáze – často zahrnující málo nebo žádné počítačové vidění, které není vyžadováno v této fázi. S čím se zde zabýváme, je základní fyzika a mechanika, která musí být vložena do systému od samého začátku.
Jak roboti začínají “cítit” svět
Takže, už máme “hardwar” – robota s nainstalovaným základním modelem: může stát, chodit a udržovat rovnováhu. Ale je to dostatečné pro reálné úkoly, například v průmyslových prostředích? Zjevně ne.
Další úroveň začíná zde. Integrujeme senzory a učíme model reagovat na základě senzorických vstupů. Nová vrstva základních dovedností se objevuje – již mnohem komplexnější než jednoduchý pohyb.
Analogie s lidským vývojem je zde užitečná. V první fázi jsme systém přivedli na úroveň zhruba jednoho roku starého dítěte: může stát, udělat první kroky a udržet rovnováhu bez pádu. Další krok je více v souladu s osmiletým dítětem.
V tomto věku dítě aktivně využívá své “senzory”: může vnímat riziko a hodnotit důsledky svých činů. Chápe, že by nemělo dotknout se něčeho horkého nebo vložit něco velmi studeného do úst. Může vylézt na stůl, jet na kole a interagovat s objekty. Je schopno chytit, nést a manipulovat s předměty a provádět základní sebeobslužné akce.
Označujeme tuto fázi jako pre-trénink. A v tomto bodě již simulace samotné nejsou dostatečné.
Ano, některé scénáře mohou být stále účinně modelovány: jak vzít sklenici, nebo vyměnit baterii, například odstranit jednu součást, umístit ji na nabíječku, vzít další a nainstalovat ji zpět.
Ale celkově se rovnováha posouvá: kolem 80% tréninku může stále probíhat v simulaci, zatímco asi 20% dat musí pocházet z reálného světa. A právě zde začínáme diskutovat o egocentrických datech.
Egocentrická data jako základ pro pochopení prostředí
Dnes se egocentrická data sbírají ve velkém měřítku po celém světě – protože bez nich je nemožné přejít od základních mechanik k smysluplné interakci s reálným světem. Můj kolega, který řídí síť autoservisů, má zaměstnance, kteří nosí kamery na hlavě, aby nahráli celý proces opravování aut. Majitel budovy v New Yorku zavedl podobný přístup: uklízeči nosí kamery na čele, které zaznamenávají, jak uklízejí prostory a udržují hygienické oblasti.
Časem se tyto nahrávky stávají samostatným produktem – jsou zabalené a prodávané. Jejich klíčová hodnota spočívá v jejich vhodnosti pro fázi pre-tréninku, která pomáhá budovat základní pochopení prostředí a sekvencí akcí.
například taková služba existovala na Keymakr, kde tým nezávisle vytvořil celé sbírky egocentrických dat z jednoduchých scénářů, jako je mytí nádobí, až po složitější.
Proč je to tak důležité? Protože taková data poskytují něco, co čisté simulace nemohou – rozmanitost reálných prostředí. Kanceláře, autoservisy, staveniště, restaurace a hotely – každé z nich přidává svou vlastní kontext, scénáře a nuance. Společně tvoří dataset, který umožňuje systému ne jen “vidět”, ale postupně začít chápat dynamiku reálného světa.
V této fázi již není cílem učit robota dokonale provést konkrétní akci. Co je důležitější, je umožnit mu orientovat se ve svém okolí.
Dnes téměř všechny společnosti, které pracují v robotice – od Tesly po Unitree Robotics a Figure AI – se soustředí na tuto přesně fázi. Jejich cílem je vytvořit základní model, jehož schopnosti se podobají těm, které má “osmileté dítě”, a poté postupovat směrem k “dvanáctiletému”. To je také to, na čem se soustředíme v Introspector – připravujeme data požadovaná pro fázi pre-tréninku, nejkritičtější fázi ve “zrání” moderní robotiky.
Poslední míle tréninku: kde končí univerzálnost a začíná specializace
Představme si, že robot již dokončil pre-trénink a je vyroben od začátku s základním pochopením světa a souborem dovedností srovnatelných s těmi, které má teenager. Ale ani to není dostatečné pro reálné obchodní případy. Společnosti nepotřebují jen “univerzální” robota – potřebují specialistu.
Vezměme si jako příklad výrobu automobilů. Některé úkoly jsou stále prováděny lidmi, protože vyžadují citlivost, přesnost a kontinuální vizuální kontrolu. Tradiční automatizace v tomto selhává. Průmyslové manipulátory vynikají v opakujících se, rigidních úkolech – “zvednout, přesunout, umístit”. Ale úkoly, které vyžadují adaptabilitu, tlak a reálné úpravy, zůstávají v lidské doméně.
To je místo, kde vzniká nová poptávka: trénovat robota, aby provedl konkrétní operaci přesně jako zkušený pracovník. Jinými slovy, po základním tréninku přichází další úroveň: trénink pro konkrétní profesi a scénář.
V tomto bodě vzniká praktická otázka: co přesně je vyžadováno pro tuto úroveň tréninku? Pokud chceme, aby robot replikoval lidské chování, musíme zachytit toto chování co nejpřesněji. Například specialista na výrobní lince by musel nosit kameru a po delší dobu, měsíce nebo dokonce rok, nahrávat, jak provádí úkol.
Co je potřeba, aby roboti “žili” v lidském světě
Kamera sama o sobě nestačí. Je nutné zachytit nejen vizuální perspektivu, ale také fyziku pohybu. To se provádí pomocí specializovaných rukavic se senzory, které měří tlak, aplikovanou sílu a povahu interakce s objekty. To je zejména důležité, protože objekty samy o sobě mohou podstatně variovat. Například těsnicí pásky se mohou lišit v tuhosti podle modelu auta, což přímo ovlivňuje, jak se úkol provádí.
Dále přichází kinematické sledování. Označovače – vizuální nebo senzorické – se umístí na zápěstí, lokty a někdy ramena. Tyto mohou zahrnovat, například, náramky s identifikovatelnými označovači (podobnými QR kódům), které umožňují systému sledovat polohu ruky v prostoru z videa. Další senzory, jako jsou gyroskopy, se používají k zachycení pohybů kloubů.
Cílem je plně rekonstruovat mechaniku pohybu: jak se rameno pohybuje, jak se loket ohýbá, jak se zápěstí otáčí. To vše se stává nezbytným pro další fázi – post-trénink.
Pokud během pre-tréninku jsme mohli částečně spoléhat na simulaci, v této fázi již to nefunguje. Tato “poslední míle” je téměř nemožné modelovat přesně. Nemůžete plně simulerovat, například, jak šéfkuchař rozválí těsto – aplikovanou sílu, jak je tlak rozložen, jak se materiál cítí.
To je důvod, proč během post-tréninku téměř všechna data musí pocházet z reálného světa. A právě zde se stává zřejmým: hlavní výzva se posouvá do praktické domény – jak získat taková data v realitě. Sběr egocentrických dat na této úrovni je složitý, vícekrokový proces, který zahrnuje přístup k prostředím, specializované vybavení, účast zkušených pracovníků a následnou přípravu dat.
Mimo teorii, toto je místo, kde roboti skutečně “ožívají” – poté, co se nám podaří zorganizovat tento proces, překonat omezení, kterým čelí týmy napříč odvětvími, a annotovat taková data ve velkém měřítku. To bude pokryto v další části, kde se budeme blíže zabývat všemi výzvami, které vznikají během jeho označení a přípravy.












