Tankeledare

Vi lÃĪrde robotar att rÃķra sig. Nu lÃĪr vi dem att leva

mm
LÃĪgg till Unite.AI bland dina fÃķredragna kÃĪllor pÃĨ Google

Modern robotteknik har nÃĨtt en punkt dÃĪr rÃķrelse inte lÃĪngre ÃĪr den stÃķrsta utmaningen – maskiner kan redan navigera, gripa och operera i rummet med imponerande precision. Men att gÃķra det mÃķjligt fÃķr dem att verkligen “leva” och fungera i den riktiga vÃĪrlden fÃķrblir ett olÃķst problem.

I denna process spelar det som kan kallas “ryggraden” en nyckelroll: systemet som ansvarar fÃķr grundlÃĪggande reaktioner, beteende och interaktion med miljÃķn.

NÃĪr man tittar pÃĨ robotarnas utveckling genom denna lins blir det tydligt att denna sekvens av stadier – dÃĪr systemet lÃĪr sig nÃĨgot nytt vid varje steg, frÃĨn enkel rÃķrelse till komplexa, kontextmedvetna handlingar – liknar den mÃĪnskliga utvecklingen.

Och det ÃĪr just inom denna utveckling – frÃĨn “tom” hÃĨrdvara till meningsfullt beteende – som den stora skiftet i fysisk AI sker idag. Det ÃĪr intressant att lÃĪra sig mer om detta.

Robotikens grundval: ett sÃĪllan diskuterat stadium

Vad ÃĪr en robot i praktiska termer? Det ÃĪr en fysisk enhet som initialt skapats som en universell plattform. I sjÃĪlva verket ÃĪr det en “tom” som sedan mÃĨste anpassas till specifika uppgifter, trÃĪnas fÃķr att operera i en given miljÃķ och lÃĪras att utfÃķra de krÃĪvda handlingarna.

Om vi gÃĨr bortom vardagliga scenarier och ÃķvervÃĪger mer realistiska nÃĪra-framtid-scenarier, blir det tydligt att den fullstÃĪndiga antagandet av robotar frÃĪmst kommer att ske i industriella och potentiellt farliga miljÃķer. Detta innebÃĪr i sin tur betydligt hÃķgre krav pÃĨ deras beteende, robusthet och utbildningskvalitet.

Processen bÃķrjar med det mest grundlÃĪggande steget – att bygga enheten sjÃĪlv. En robot monteras frÃĨn flera komponenter, inklusive aktuatorer, motorer, sensorer, kameror, LiDARs. Den kan vara humanoid, hjulburen, tvÃĨbent eller fyrabent – formfaktorn ÃĪr sekundÃĪr. Vad som ÃĪr viktigt ÃĪr att vi pÃĨ detta stadium slutar med en fungerande men fortfarande “tom” enhet.

NÃĪsta stadium ÃĪr att installera en basmodell som fungerar som grunden fÃķr dess beteende. I en bred bemÃĪrkelse ÃĪr “modellen” den hela funktionella kontrollskiktet. Det ÃĪr ansvarigt fÃķr kÃĪrnfÃķrmÃĨgor: att upprÃĪtthÃĨlla balans, stÃĨ och rÃķra sig, navigera frÃĨn punkt A till punkt B, undvika hinder, inte skada miljÃķn och sÃĪkert interagera med mÃĪnniskor.

Detta ÃĪr dÃĪr fÃķrstÃĪrkningsinlÃĪrning kommer in i bilden. I sÃĨdana system kÃķrs miljarder simuleringar. Vi ser ofta videor av robotar som “lÃĪr” i komplexa miljÃķer: de flesta av dem faller, fÃķrlorar balans eller misslyckas med att slutfÃķra uppgiften. Men de som lyckas stanna upprÃĪtta och fortsÃĪtta rÃķra sig ÃĪr de som utvecklas.

Detta ÃĪr kÃĪrnan i fÃķrstÃĪrkningsinlÃĪrning: att vÃĪlja framgÃĨngsrikt beteende. Algoritmerna fÃķr de som “Ãķverlever” blir grunden fÃķr nÃĪsta iterationer. Som ett resultat, efter en enorm mÃĪngd kÃķrningar, uppstÃĨr en modell som kan med sÃĪkerhet hantera hinder. Denna algoritm ÃķverfÃķrs sedan till den fysiska enheten.

Det ÃĪr ett grundat men kritiskt viktigt stadium – ofta med lite eller ingen datorseende, som inte krÃĪvs vid denna punkt. Vad vi har att gÃķra med hÃĪr ÃĪr grundlÃĪggande fysik och mekanik som mÃĨste infÃķrlivas i systemet frÃĨn bÃķrjan.

Hur robotar bÃķrjar “kÃĪnna” vÃĪrlden

SÃĨ, vi har redan “hÃĨrdvaran” – en robot med en basmodell installerad: den kan stÃĨ, gÃĨ och upprÃĪtthÃĨlla balans. Men rÃĪcker detta fÃķr verkliga uppgifter, till exempel i industriella miljÃķer? Tydligtvis inte.

NÃĪsta nivÃĨ bÃķrjar hÃĪr. Vi integrerar sensorer och trÃĪnar modellen att agera baserat pÃĨ sensoriska indata. En ny nivÃĨ av kÃĪrnfÃķrmÃĨgor uppstÃĨr – redan betydligt mer komplexa ÃĪn enkel rÃķrelse.

En analogi med mÃĪnsklig utveckling ÃĪr anvÃĪndbar hÃĪr. Vid det fÃķrsta stadiet fÃķrde vi systemet till ungefÃĪr samma nivÃĨ som ett ettÃĨrigt barn: det kan stÃĨ, ta sina fÃķrsta steg och upprÃĪtthÃĨlla balans utan att falla. NÃĪsta steg ÃĪr mer i linje med en ÃĨttaÃĨrigs nivÃĨ.

Vid denna ÃĨlder anvÃĪnder barnet aktivt sina “sensorer”: de kan uppfatta risk och utvÃĪrdera konsekvenserna av sina handlingar. De fÃķrstÃĨr att inte rÃķra vid nÃĨgot hett eller lÃĪgga nÃĨgot mycket kallt i munnen. De kan klÃĪttra upp pÃĨ ett bord, cykla och interagera med fÃķremÃĨl. De ÃĪr kapabla att gripa, bÃĪra och manipulera fÃķremÃĨl och utfÃķra grundlÃĪggande sjÃĪlvvÃĨrdsÃĨtgÃĪrder.

Vi kallar detta stadium fÃķrtrÃĪning. Och vid denna punkt rÃĪcker simuleringar ensamma inte lÃĪngre.

Ja, vissa scenarier kan fortfarande modelleras effektivt: hur man plockar upp ett glas, eller byter ut en batteri, till exempel, ta bort en komponent, placera den pÃĨ laddning, ta en annan och installera den tillbaka.

Men Ãķvergripande skiftar balansen: runt 80% av utbildningen kan fortfarande ske i simulering, medan cirka 20% av data mÃĨste komma frÃĨn den riktiga vÃĪrlden. Och det ÃĪr hÃĪr vi bÃķrjar diskutera egocentriska data.

Egocentriska data som grund fÃķr miljÃķfÃķrstÃĨelse

Idag samlas egocentriska data in i stor skala Ãķver hela vÃĪrlden – eftersom utan dem ÃĪr det omÃķjligt att gÃĨ frÃĨn grundlÃĪggande mekanik till meningsfull interaktion med den riktiga vÃĪrlden. En kollega till mig, som driver ett nÃĪtverk av bilverkstÃĪder, har anstÃĪllda som anvÃĪnder huvudburna kameror fÃķr att spela in hela bilreparationsprocessen. En byggnadsÃĪgare i New York City har infÃķrt en liknande approach: stÃĪdpersonalen bÃĪr pannkameror som fÃĨngar hur de stÃĪdar utrymmen och upprÃĪtthÃĨller hygieniska omrÃĨden.

Med tiden blir dessa inspelningar en fristÃĨende produkt – de paketeras och sÃĪljs. Deras nyckelvÃĪrde ligger i deras lÃĪmplighet fÃķr fÃķrtrÃĪningsstadiet, vilket hjÃĪlper till att bygga en grundlÃĪggande fÃķrstÃĨelse av miljÃķer och sekvenser av handlingar.

Till exempel fanns en sÃĨdan tjÃĪnst pÃĨ Keymakr, dÃĪr teamet oberoende skapade hela samlingar av egocentriska data frÃĨn enkla scenarier som att tvÃĪtta disk till mer komplexa.

VarfÃķr ÃĪr detta sÃĨ viktigt? Eftersom sÃĨdana data tillhandahÃĨller nÃĨgot som ren simulering inte kan – mÃĨngfalden av verkliga miljÃķer. Kontor, bilverkstÃĪder, byggarbetsplatser, restauranger och hotell – var och en av dessa lÃĪgger till sin egen kontext, scenarier och nyanser. Tillsammans bildar de en datamÃĪngd som tillÃĨter ett system att inte bara “se”, utan att gradvis bÃķrja fÃķrstÃĨ dynamiken i den verkliga vÃĪrlden.

Detta stadium ÃĪr inte lÃĪngre att lÃĪra en robot att perfekt utfÃķra en specifik handling. Vad som ÃĪr viktigare ÃĪr att gÃķra det mÃķjligt fÃķr den att orientera sig i sin omgivning fÃķrst.

Idag fokuserar nÃĪstan alla fÃķretag som arbetar med robotik – frÃĨn Tesla till Unitree Robotics och Figure AI – pÃĨ just detta stadium. Deras mÃĨl ÃĪr att bygga en basmodell vars fÃķrmÃĨgor fÃķrst liknar de hos ett “ÃĨttaÃĨrigt barn”, och sedan fortsÃĪtta mot en “tolvÃĨring”. Detta ÃĪr ocksÃĨ vad vi fokuserar pÃĨ pÃĨ Introspector – att fÃķrbereda data som krÃĪvs fÃķr fÃķrtrÃĪning, den mest kritiska fasen i “vÃĪxandet” av modern robotik.

Den sista milen av utbildning: dÃĪr universalitet slutar och specialisering bÃķrjar

LÃĨt oss fÃķrestÃĪlla oss att en robot redan har slutfÃķrt fÃķrtrÃĪning och tillverkats frÃĨn bÃķrjan med en grundlÃĪggande fÃķrstÃĨelse av vÃĪrlden och en fÃĪrdighetsnivÃĨ som ÃĪr jÃĪmfÃķrbar med en tonÃĨrings. Men inte ens detta rÃĪcker fÃķr verkliga affÃĪrsfall. FÃķretag behÃķver inte bara en “allmÃĪn” robot – de behÃķver en specialist.

Tag till exempel bilproduktion. Vissa uppgifter utfÃķrs fortfarande av mÃĪnniskor eftersom de krÃĪver kÃĪnslighet, precision och kontinuerlig visuell kontroll. Traditionell automation kÃĪmpar hÃĪr. Industriella manipulatorer excellerar i upprepad, styv uppgift – “plocka, flytta, placera”. Men uppgifter som krÃĪver anpassningsfÃķrmÃĨga, tryckkÃĪnslighet och realtidsjusteringar fÃķrblir i den mÃĪnskliga domÃĪnen.

Detta ÃĪr dÃĪr en ny efterfrÃĨgan uppstÃĨr: att utbilda en robot att utfÃķra en specifik operation exakt som en skicklig arbetare gÃķr pÃĨ en produktionslinje. Med andra ord, efter basutbildning kommer nÃĪsta nivÃĨ: utbildning fÃķr en specifik profession och scenario.

Vid denna punkt uppstÃĨr en praktisk frÃĨga: vad krÃĪvs egentligen fÃķr denna nivÃĨ av utbildning? Om vi vill att en robot ska replikera mÃĪnskligt prestanda, mÃĨste vi fÃĨnga den mÃĪnskliga beteendet sÃĨ exakt som mÃķjligt. Till exempel skulle specialisten pÃĨ fabriksgolvet behÃķva bÃĪra en kamera och, under en lÃĪngre period, mÃĨnader eller till och med ett ÃĨr, spela in hur de utfÃķr uppgiften.

Vad det krÃĪver fÃķr att robotar ska “leva” i den mÃĪnskliga vÃĪrlden

En kamera ensam rÃĪcker inte. Det ÃĪr nÃķdvÃĪndigt att fÃĨnga inte bara den visuella perspektiven utan ocksÃĨ fysiken i rÃķrelsen. Detta gÃķrs med hjÃĪlp av specialiserade handskar med taktila sensorer som mÃĪter tryck, applicerad kraft och arten av interaktion med fÃķremÃĨl. Detta ÃĪr sÃĪrskilt viktigt eftersom fÃķremÃĨlen sjÃĪlva kan variera betydligt. Till exempel kan tÃĪtningsskivor skilja sig i styvhet beroende pÃĨ bilmodell, vilket direkt pÃĨverkar hur uppgiften utfÃķrs.

NÃĪsta steg ÃĪr kinematisk spÃĨrning. MarkÃķrer – visuella eller sensorbaserade – placeras pÃĨ handleder, armbÃĨgar och ibland axlar. Dessa kan inkludera, till exempel, armband med identifierbara markÃķrer (liknande QR-koder) som tillÃĨter systemet att spÃĨra handpositionen i rummet frÃĨn video. Ytterligare sensorer, som gyroskop, anvÃĪnds fÃķr att fÃĨnga led-rÃķrelser.

Det slutliga mÃĨlet ÃĪr att fullstÃĪndigt rekonstruera mekaniken i rÃķrelsen: hur axeln rÃķr sig, hur armbÃĨgen bÃķjer sig, hur handleden roterar. Allt detta blir avgÃķrande fÃķr nÃĪsta stadium – efterutbildning.

Om, under fÃķrtrÃĪning, vi kunde fortfarande delvis lita pÃĨ simulering, fungerar det inte lÃĪngre pÃĨ detta stadium. Denna “sista mil” ÃĪr nÃĪstan omÃķjlig att modellera exakt. Man kan inte fullstÃĪndigt simulera, till exempel, hur en kock rullar ut deg – den applicerade kraften, hur trycket fÃķrdelas, hur materialet kÃĪnns.

Det ÃĪr dÃĪrfÃķr, under efterutbildning, nÃĪstan all data mÃĨste komma frÃĨn den verkliga vÃĪrlden. Och det ÃĪr hÃĪr det blir tydligt: den stÃķrsta utmaningen skiftar till den praktiska domÃĪnen – hur man fÃĨr sÃĨdan data i verkligheten. Insamling av egocentriska data pÃĨ denna nivÃĨ ÃĪr en komplex, flerstegsprocess som involverar tillgÃĨng till miljÃķer, specialiserad utrustning, deltagande av skickliga arbetare och efterfÃķljande datafÃķrberedelser.

Bortom teori, detta ÃĪr dÃĪr robotar verkligen “kommer till liv” – efter att vi har lyckats organisera denna process, Ãķvervinna begrÃĪnsningar som team stÃĨr infÃķr Ãķver hela branschen och annotera sÃĨdana datamÃĪngder i stor skala. Detta kommer att behandlas i nÃĪsta del, dÃĪr vi kommer att ta en nÃĪrmare titt pÃĨ alla utmaningar som uppstÃĨr under dess mÃĪrkning och fÃķrberedelser.

Michael Abramov ÃĪr grundare och VD fÃķr Introspector, med Ãķver 15 ÃĨrs erfarenhet av programvaruteknik och datorseende AI-system fÃķr att bygga fÃķretagsklassade mÃĪrkningsverktyg.

Michael bÃķrjade sin karriÃĪr som programvarutekniker och R&D-chef, byggde skalbara datasystem och ledde tvÃĪrfunktionella ingenjÃķrsteam. Fram till 2025 har han varit VD fÃķr Keymakr, ett datamÃĪrkningsfÃķretag, dÃĪr han banade vÃĪg fÃķr mÃĪnskliga-i-loopen-arbetsflÃķden, avancerade QA-system och specialanpassade verktyg fÃķr att stÃķdja storskaliga datorseende- och autonomidatabehov.

Han har en kandidatexamen i datavetenskap och en bakgrund inom teknik och kreativa konstarter, vilket ger honom en tvÃĪrvetenskaplig synvinkel fÃķr att lÃķsa svÃĨra problem. Michael verkar i skÃĪrningspunkten mellan teknisk innovation, strategisk produktledning och verklig pÃĨverkan, och driver framÃĨt den nÃĪsta fronten fÃķr autonoma system och intelligent automatisering.