Myslitelé

Skutečné náklady na výcvik robotů

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

V první části jsme diskutovali, jak se roboti vyvíjejí z základní mechaniky na pochopení svého okolí. Ve fázi “posledního míli” – kdy roboti procházejí post-školením pro specifické, přizpůsobené úkoly – se objeví neočekávaná bariéra. Je spojena s daty: jejich sběrem, organizací a škálováním v reálných podmínkách.

Je přesně v této fázi, že se mezera mezi konceptem a implementací stává nejzřetelnější. Jaké jsou klíčové úzká místa a jak je lze překonat s minimálním třením?

Proč tisíce hodin dat se mění v roky práce

Takže si představme, že už máme vyškoleného robota, který prošel předběžným školením. Může se pohybovat ve svém okolí, pohybovat se, vyhýbat se překážkám a interagovat s objekty. Je to jako “desetileté dítě”, které je obecně schopné jednat nezávisle. Další krok spočívá v tom, aby se naučil provádět specifické akce za specifických podmínek, například instalovat skleněné panely a těsnicí pásky na výrobní lince automobilů.

Na první pohled se zdá, že úkol je jednodušší. Spočívá v ovládnutí jediného scénáře a objem dat, který je vyžadován, je podstatně menší než během předběžného školení. Zatímco základní školení může vyžadovat stovky tisíc hodin, post-školení může trvat pouze tisíce. Ale tato čísla jsou zavádějící.

Když je proces přeložen do reálného času, odhalí svou skutečnou složitost. Pod standardním pracovním rozvrhem pracuje člověk asi 160 hodin měsíčně. Nicméně, to neznamená, že veškerý tento čas lze využít pro záznam.

V praxi dochází k neustálým přerušením: baterie se vybíjejí, kamery se posunují, senzory selhávají. Čím je složitější vybavení, tím vyšší je pravděpodobnost problémů. I jednoduché selhání, jako je selhání senzorů na rukavici, může zastavit proces a vést ke ztrátě času.

Jako výsledek je skutečná rychlost sběru dat 2-3krát nižší. Jedna hodina kvalitního záznamu může vyžadovat až tři hodiny reálné práce. To radikálně mění výpočet: 5 000 hodin dat se mění v přibližně 15 000 hodin práce.

vrstvy na vrstvách složitosti

Během předběžného školení může být dostatečné dát člověku kameru a požádat ho, aby nahrál každodenní činnosti. V této fázi je však vyžadován přístup ke specifickému prostředí, jako je továrna, staveniště nebo specializované výrobní zařízení.

Toto okamžitě zavádí praktické omezení. Například na staveništi jsou pracovníci povinni nosit bezpečnostní přilby, což znamená, že je třeba vyvinout specializované vybavení: přilby s integrovanými kamerami, které jsou odolné proti prachu, vlhkosti a nárazu.

Pak je tu přístup na místo samotné. Je třeba uzavřít dohody s majiteli místa, získat povolení a sjednat podmínky. To téměř vždy zahrnuje dodatečné náklady: společnosti očekávají kompenzaci a pracovníci očekávají, že budou placeni za účast.

Pojištění a dodržování bezpečnostních předpisů se také stávají kritickými problémy. Pokud vybavení nesplňuje požadované standardy, pojištění může být zrušeno, což nutí celý proces restrukturalizovat.

Even na úrovni denních operací přetrvávají výzvy. Kamery musí být zapnuty, monitorovány a udržovány. Pracovníci pracují v rukavicích a drsných podmínkách. Vybavení se znečišťuje, opotřebovává a rozbití. Kamera může být vypnuta po několika minutách a osoba si toho možná ani nevšimne.

To vytváří potřebu, aby se účastníci sami vyškolili – musí rozumět, jak používat vybavení. Kromě toho je vyžadováno nepřetržité dohledávání – někdo musí zajistit, aby záznam pokračoval a aby zařízení fungovala správně.

Od surového videa k tréninkovým datům

Po nahrání začíná další fáze: sběr dat, nahrání, strukturalizace, ověření kvality a označení.

Jakékoli surové údaje se skládají z videa a signálů senzorů. Aby se z nich stalo tréninkový materiál, musí být strukturalizovány: objekty musí být identifikovány, akce zachyceny a stavy, pohyby a interakce s prostředím popsány. To je místo, kde vstupuje do hry anotace. Logická otázka se nabízí – co je zlatý standard pro takový anotační workflow?

V některých případech stačí jednoduché rámečky pro identifikaci objektů v rámci. V jiných případech je vyžadována temporální anotace pro popis sekvencí akcí v čase. V určitých scénářích se používají klíčové body a skeletální modely pro zachycení pohybu těla. V složitějších případech se používají 3D sítě nebo sledování polohy ruky pro přesné znázornění interakčních mechanismů. Další senzory, jako jsou akcelerometry, se často integrují pro zachycení dynamiky pohybu a aplikovaného tlaku.

Projekty, jako je tento, často vyžadují škálování týmu. Označení je velkou a složitou úlohou, která vyžaduje čas, odborné znalosti a podstatné lidské zdroje. To je místo, kde vstupují do hry poskytovatelé datových řešení s vlastními anotačními týmy. Jako je Keymakr, který se ukázal být zvláště účinný díky své schopnosti škálovat týmy na libovolný objem dat, od jednoho specialisty až po stovky anotátorů.

Neexistuje žádný správný přístup k tréninku

Průmysl je stále ve fázi zkoumání, protože neexistuje shoda na to, která kombinace dat poskytuje nejlepší výsledky. Mnoho přístupů je ověřeno empiricky, protože fungují ve specifických experimentech. Jako výsledek, různé týmy pokračují v používání různých technologií, které jsou tvarovány jejich vlastnou zkušeností, úkoly a omezeními.

Na akademické i aplikované úrovni to vede k fragmentaci: laboratoře a společnosti se pohybují v různých směrech. Situace připomíná rané dny autonomního řízení, kdy Tesla vsadila na přístup založený pouze na vizi bez LiDARu, zatímco většina ostatních hráčů zvolila LiDAR jako jádrový senzor.

Dnes tendují LiDAR-založené systémy k prokázání stabilnějšího výkonu, zatímco přístup Tesly pokračuje v evoluci. Rozdíl spočívá v tom, že v autonomním řízení se trh již značně zral: stabilní architektury se objevily, omezení jsou dobře pochopitelná a byla накопena podstatná odborná znalost.

Naopak, pro Fyzikální AI a podobná modelová školení tato úroveň zralosti nebyla dosud dosažena. Trh se stále formuje, chybí standardy a většina pokroku je poháněna experimentováním. Nové metody pro trénink modelů, zlepšení efektivity a adaptaci na reálné scénáře pokračují v objevování, což naznačuje, že nejvýznamnější průlomy v tomto oboru jsou ještě před námi.

Člověk jako posilovací systém

Označení neexistuje v izolaci, ani pro model samotný. Slouží jako nástroj pro inženýra, který staví tento model. Prostřednictvím něj formalizuje realitu, identifikuje klíčové parametry a definuje pravidla chování systému.

Úkol inženýra spočívá v tom, aby naučil systém provádět akce správně v reálných podmínkách. Například základní scénář může sestávat ze čtyř akcí: vzít sklenici, zapnout kohoutek, naplnit ji a vypnout kohoutek. Ale v realitě dochází k odchylce – sklenice přeteče.

V tomto okamžiku se očekává, že model dokončí scénář a provede další akce: zastaví tok vody, upraví úroveň vody a zabrání rozlití. To je behaviorální logika založená na kontextuálním pochopení.

Inženýr následuje cyklus: označí data, vyškolí model, otestuje ho. Pokud systém funguje, je hypotéza potvrzena. Pokud ne, začíná analýza.

V某 okamžiku může být jasné, že model chybí důležitý parametr, například úroveň plnění sklenice. Předtím mohla data zahrnovat označení objektů (sklenice, kohoutek, rukojeť) a akcí (otevření, naplnění, zavření), ale chybělo označení stavu, například stupně plnosti.

Pak je přidána nová vrstva do procesu: označení úrovně plnění, následované formalizací, například definováním všeho nad 85% jako kritického stavu.

To vede k další iteraci tréninku. Můžete mít stovky takových iterací.

Nikdo nepředpokládá, že systém bude fungovat správně okamžitě. Naopak, proces je postaven kolem postupných aproximací: nejdříve je vytvořena základní verze; pak je otestována v reálných nebo téměř reálných podmínkách; jsou identifikovány mezery; a systém je rafinován. To je něco, co často diskutuji se klienty v Introspector, se kterým procházíme celou cestu Fyzikální AI společně.

V某 okamžiku je dosaženo požadovaného výsledku. Ale jeho hodnota spočívá nejen v tom, že systém začíná fungovat, ale v nahromaděné zkušenosti, která umožňuje tento výsledek reprodukovat více předvídatelně.

Ekonomika, kterou všichni zapomínají

Za poslední rok nebo tak jsem si všiml, že největší chyba, kterou společnosti dělají, když pracují s egocentrickými daty, nemá nic společného s technologií.

Core problém je ve skutečnosti v podcenění ekonomiky projektu.

Videa fáze je technologie v centru – které modely použít, jak je vyškolit a které přístupy použít. Studujete, zkoumáte, diskutujete architektury a testujete hypotézy. To je přirozené: technologie se zdá být nejzřetelnější a nejzjevnější částí problému.

Ale mnohem méně často se týmy ve této fázi ptají přímé a praktické otázky: kolik to bude stát?

Když projekt přechází z teorie do implementace, stává se jasné, že za každým modelem jsou desítky tisíc hodin dat. Sběr těchto dat vyžaduje čas, přístup k reálným prostředím a účast specialistů. Označení přidává další vrstvu složitosti a nákladů. Jako výsledek, konečné čísla jsou často řádově vyšší, než se původně očekávalo.

To neznamená, že takové projekty by neměly být sledovány. Naopak, jsou to projekty, které pohání průmysl kupředu.

Ale co je důležité, je pochopit rozsah výzvy od samého začátku. Rozpoznat, že v tréninku modelů, za každým úžasným algoritmem je komplexní, náročná práce s daty.

Even silné nápady selhávají v dosažení plné implementace, když náklady na data začínají překračovat sedmimístná čísla.

A možná nejvýznamnější posun, který se děje v robotice dnes, je spojen s touto realizací. Budoucnost těchto systémů bude definována tím, jak “inteligentní” jsou a jak efektivní a přesně je celá datová pipeline postavena – od sběru dat až po konečnou interpretaci.

Michael Abramov je zakladatel a CEO společnosti Introspector, který přináší více než 15 let zkušeností se softwarovým inženýrstvím a počítačovým viděním AI systémů do budování podnikových nástrojů pro označování.

Michael začal svou kariéru jako softwarový inženýr a manažer výzkumu a vývoje, budující škálovatelné datové systémy a řídící mezioborové inženýrské týmy. Do roku 2025 působil jako CEO společnosti Keymakr, společnosti pro označování dat, kde průkopnický lidský workflow, pokročilé systémy QA a speciální nástroje pro podporu velkých počítačových vidění a autonomních datových potřeb.

Vystudoval bakalářský titul v oboru počítačových věd a má zkušenosti z inženýrství a kreativních umění, což mu umožňuje přistupovat k řešení složitých problémů z mezioborového hlediska. Michael žije na rozhraní technologických inovací, strategického produktového vedení a skutečného dopadu, který pohání další hranici autonomních systémů a inteligentní automatizace.