Tankeledere

Den Sande Omkostning Ved Uddannelse Af Robotter

mm
FÃļj Unite.AI til dine foretrukne kilder pÃĨ Google

I den fÃļrste del diskuterede vi, hvordan robotter udvikler sig fra grundlÃĶggende mekanik til at forstÃĨ deres omgivelser. Ved “sidste mil”-stadiet – hvor robotter undergÃĨr efteruddannelse for bestemte, brugerdefinerede opgaver – opstÃĨr der en uventet barriere. Den er forbundet med data: indsamling, organisation og skalering i virkelige forhold.

Det er netop pÃĨ dette stadium, at gapet mellem koncept og implementering bliver mest ÃĨbenlyst. Hvad er de vigtigste flaskehalse, og hvordan kan de overvindes med minimalt slid?

Hvorfor tusinder af timers data bliver til ÃĨrs arbejde

Lad os forestille os, at vi allerede har en uddannet robot, der har gennemgÃĨet foruddannelse. Den kan navigere i sin omgivelse, bevÃĶge sig, undgÃĨ hindringer og interagere med objekter. Det er som en “ti-ÃĨrig” barn, der generelt kan fungere uafhÃĶngigt. NÃĶste skridt er at lÃĶre det at udfÃļre bestemte handlinger under bestemte betingelser, f.eks. montering af glaspaneler og tÃĶtningsstriber pÃĨ en bilproduktionslinje.

PÃĨ overfladen ser opgaven ud til at vÃĶre enklere. Den indebÃĶrer at mestre en enkelt scenario, og datavolumenet er betydeligt mindre end under foruddannelse. Mens grundlÃĶggende trÃĶning kan krÃĶve hundredtusinder af timer, kan efteruddannelse kun tage fÃĨ tusinder. Men disse tal er misvisende.

NÃĨr de oversÃĶttes til reel tid, afslÃļrer processen sin sande kompleksitet. Under en standardarbejdstid arbejder en person omkring 160 timer om mÃĨneden. Dette betyder dog ikke, at al denne tid kan bruges til optagelse.

I praksis opstÃĨr der konstant forstyrrelser: batterier lÃļber tÃļmmer, kameraer skifter, sensorer fejler. Jo mere kompleks udstyret er, desto hÃļjere er sandsynligheden for problemer. Selv et simpelt fejl som sensorer pÃĨ en hÃĨndskoe, der holder op med at fungere, kan standse processen og resultere i tabt tid.

Som fÃļlge heraf er den faktiske datavolume 2-3 gange lavere. En time hÃļjkvalitets optagelse kan krÃĶve op til tre timer reelt arbejde. Dette ÃĶndrer radikalt beregningen: 5.000 timers data oversÃĶtter til omtrent 15.000 timers arbejde.

Lag pÃĨ lag af kompleksitet

Under foruddannelse kan det vÃĶre nok at give en person et kamera og bede dem om at optage dagligdagsaktiviteter. PÃĨ dette stadium krÃĶves adgang til en bestemt omgivelse, sÃĨsom en fabrik, et byggeomrÃĨde eller en specialiseret produktionsfacilitet.

Dette introducerer straks praktiske begrÃĶnsninger. F.eks. pÃĨ et byggeomrÃĨde skal arbejdere bÃĶre sikkerhedshjelme, hvilket betyder, at specialudstyr mÃĨ udvikles: hjelme med integrerede kameraer, der er resistente over for stÃļv, fugt og pÃĨvirkning.

SÃĨ kommer adgangen til selv omrÃĨdet. Der skal aftales med ejere af omrÃĨdet, tilladelser skal erhverves, og betingelser skal forhandles. Dette indebÃĶrer nÃĶsten altid ekstra omkostninger: virksomheder forventer kompensation, og arbejdere forventer at blive betalt for deres deltagelse.

Forsikring og sikkerhedsstandarder bliver ogsÃĨ kritiske bekymringer. Hvis udstyret ikke opfylder de nÃļdvendige standarder, kan forsikringen vÃĶre ugyldig, hvilket tvinger hele processen til at blive omstruktureret.

Selv pÃĨ niveauet for daglige operationer bestÃĨr udfordringerne. Kameraer skal tÃĶndes, overvÃĨges og vedligeholdes. Arbejdere opererer i handsker og under hÃĨrde forhold. Udstyret bliver beskidt, slidt og Ãļdelagt. Et kamera kan lukke af efter fÃĨ minutter, og personen mÃĨske ikke engang bemÃĶrker det.

Dette skaber behov for, at deltagere selv uddanner sig – de mÃĨ forstÃĨ, hvordan de skal bruge udstyret. Desuden krÃĶves kontinuerlig overvÃĨgning – nogen skal sikre, at optagelsen er i gang, og at enhederne fungerer korrekt.

Fra rÃĨ video til trÃĶningsdata

Efter optagelse begynder nÃĶste skridt: dataindsamling, upload, strukturering, validering af kvaliteten og mÃĶrkning.

Enhver rÃĨ data bestÃĨr af video- og sensorsignaler. For at omdanne det til trÃĶningsmateriale skal det struktureres: objekter skal identificeres, handlinger skal indfanges, og tilstande, bevÃĶgelser og interaktioner med omgivelsen skal beskrives. Her kommer mÃĶrkning ind i billedet. En logisk spÃļrgsmÃĨl opstÃĨr – hvad er standarden for en sÃĨdan mÃĶrkningsproces?

I visse tilfÃĶlde er simple begrÃĶnsningsbokse nok til at identificere objekter i en ramme. I andre tilfÃĶlde krÃĶves tidsmÃĶssig mÃĶrkning for at beskrive handlingers sekvenser over tid. I visse scenarier bruges nÃļglepunkter og skeletmodeller til at indfange kropsbevÃĶgelser. I mere komplekse tilfÃĶlde bruges 3D-net eller hÃĨndstillingsspor til at prÃĶcisere interaktionsmekanikken. Yderligere sensorer, sÃĨsom accelerometre, integreres ofte for at indfange bevÃĶgelsesdynamik og pÃĨvirkningskraft.

Projekter som disse krÃĶver ofte en udvidelse af holdet. MÃĶrkning er en stor og kompleks opgave i sig selv, der krÃĶver tid, ekspertise og betydelige menneskelige ressourcer. Her kommer data-lÃļsningsudbydere med interne mÃĶrkningshold ind i billedet. SÃĨsom Keymakr, der har vist sig at vÃĶre sÃĶrligt effektiv pÃĨ grund af deres evne til at udvide hold til at matche ethvert datavolume, fra en enkelt specialist til hundredvis af mÃĶrkere.

Der er ingen ret vej til trÃĶning endnu

Branchen er stadig i en eksplorerende fase, da der ikke er enighed om, hvilken kombination af data giver de bedste resultater. Mange tilgange valideres empirisk, fordi de virker i bestemte eksperimenter. Som fÃļlge heraf fortsÃĶtter forskellige hold med at stole pÃĨ forskellige teknologier, formede af deres egen erfaring, opgaver og begrÃĶnsninger.

PÃĨ bÃĨde akademisk og anvendt niveau fÃļrer dette til fragmentering: laboratorier og virksomheder bevÃĶger sig i forskellige retninger. Situationen minder om de tidlige dage af selvstÃĶndig kÃļrsel, hvor Tesla satte sin lid til en vision-baseret tilgang uden LiDAR, mens de fleste andre spillere valgte LiDAR som en kerne-sensor.

I dag tenderer LiDAR-baserede systemer til at demonstrere mere stabilt prÃĶstation, mens Teslas tilgang fortsat udvikler sig. Forskellen er, at i selvstÃĶndig kÃļrsel har markedet i hÃļj grad modnet: stabile arkitekturer er opstÃĨet, begrÃĶnsninger er godt forstÃĨet, og betydelig ekspertise er opbygget.

I modsÃĶtning hertil har dette niveau af modning endnu ikke vÃĶre nÃĨet for Fysisk AI og lignende modeltrÃĶning. Markedet er stadig under udvikling, standarder mangler, og meget af fremgangen drives af eksperimenter. Nye metoder til modeltrÃĶning, effektivitetsforbedring og tilpasning til virkelige scenarier fortsÃĶtter med at opstÃĨ, hvilket antyder, at de vigtigste gennembrud i dette felt stadig er foran os.

Mennesket som en forstÃĶrkningssystem

MÃĶrkning eksisterer ikke i isolation, ej heller for modellen alene. Den fungerer som et vÃĶrktÃļj for ingeniÃļren, der bygger modellen. Gennem den formaliserer de virkeligheden, identificerer nÃļgleparametre og definerer systemets adfÃĶrdsregler.

IngeniÃļrens opgave er at lÃĶre systemet at udfÃļre handlinger korrekt i virkelige forhold. F.eks. kan en grundlÃĶggende scenario bestÃĨ af fire handlinger: samle et glas op, tÃĶnde for vandet, fylde det og slukke for vandet. Men i virkeligheden opstÃĨr en afvigelse – glasset lÃļber over.

PÃĨ det tidspunkt forventes modellen at fuldfÃļre scenariet og udfÃļre yderligere handlinger: stoppe vandstrÃļmmen, justere vandniveauet og forhindre overskylning. Dette er adfÃĶrdslogik baseret pÃĨ kontekstforstÃĨelse.

IngeniÃļren fÃļlger en cyklus: mÃĶrke data, trÃĶne modellen, teste den. Hvis systemet fungerer, bekrÃĶftes hypotesen. Hvis ikke, begynder analysen.

PÃĨ et tidspunkt kan det blive klart, at modellen mangler en vigtig parameter, sÃĨsom glassets fyldningsniveau. Tidligere kan data have indeholdt mÃĶrkninger for objekter (glas, vand, hÃĨndtag) og handlinger (ÃĨbning, fyldning, lukning), men manglede mÃĶrkninger for tilstand, sÃĨsom graden af fuldhed.

En ny lag tilfÃļjes herefter til processen: mÃĶrkning af fyldningsniveauet, efterfulgt af formalisering, f.eks. definition af alt over 85% som en kritisk tilstand.

Dette fÃļrer til den nÃĶste iteration af trÃĶning. Du kan have hundredvis af sÃĨdanne iterationer.

Ingen antager, at systemet vil fungere korrekt med det samme. TvÃĶrtimod er processen bygget op omkring succesive tilnÃĶrmelser: fÃļrst oprettes en baseline-version; derefter testes den i virkelige eller nÃĶsten-virkelige forhold; huller identificeres; og systemet forfineres. Dette er noget, jeg ofte diskuterer med kunder pÃĨ Introspector, hvor vi gÃĨr gennem hele den fysiske AI-rejse sammen.

PÃĨ et bestemt tidspunkt opnÃĨs det Ãļnskede resultat. Men dets vÃĶrdi ligger ikke kun i, at systemet begynder at fungere, men i den opbyggede erfaring, der tillader dette resultat at blive reproduceret mere forudsigeligt.

Økonomien, alle glemmer

I lÃļbet af det sidste ÃĨr eller sÃĨ har jeg bemÃĶrket, at den stÃļrste fejl, virksomheder begÃĨr, nÃĨr de arbejder med egocentrisk data, har lidt at gÃļre med teknologi.

Det centrale problem er faktisk underestimering af projektÃļkonomien.

Ved ide-stadiet er teknologi i centrum – hvilke modeller at bruge, hvordan at trÃĶne dem, og hvilke tilgange at anvende. Du studerer, forsker, diskuterer arkitekturer og tester hypoteser. Dette er naturligt: teknologi fÃļles som den mest konkrete og ÃĨbenlyse del af problemet.

Men langt mindre ofte stiller hold pÃĨ dette stadium et direkte og praktisk spÃļrgsmÃĨl: hvor meget vil det koste?

NÃĨr et projekt bevÃĶger sig fra teori til implementering, bliver det klart, at bag hver model ligger titusinder af timers data. At indsamle disse data krÃĶver tid, adgang til virkelige omgivelser og deltagelse af specialister. MÃĶrkning tilfÃļjer endnu en lag af kompleksitet og omkostninger. Som fÃļlge heraf er de endelige tal ofte mange gange hÃļjere, end forventet.

Dette betyder ikke, at sÃĨdanne projekter ikke skal forfÃļlges. TvÃĶrtimod er de det, der driver branchen fremad.

Men det, der betyder noget, er at forstÃĨ udfordringens stÃļrrelse fra begyndelsen. At erkende, at i modeltrÃĶning ligger bag hver fantastisk algoritme kompleks, ressourcekrÃĶvende dataarbejde.

Selv stÃĶrke idÃĐer mislykkes med at nÃĨ fuld implementering, nÃĨr dataomkostningerne begynder at stige langt over syv cifre.

Og mÃĨske den vigtigste ÃĶndring, der sker i robotteknologi i dag, er forbundet med denne erkendelse. Fremtiden for disse systemer vil blive defineret af, hvor “intelligente” de er, og hvor effektivt og prÃĶcist hele dataprocessen er bygget – fra dataindsamling til endelig fortolkning.

Michael Abramov er grundlÃĶgger og administrerende direktÃļr for Introspector, og har mere end 15 ÃĨrs erfaring med softwareudvikling og computer vision AI-systemer til opbygning af virksomhedsklasse-vÃĶrktÃļjer til mÃĶrkning.

Michael startede sin karriere som softwareingeniÃļr og R&D-chef, hvor han opbyggede skalerbare datasystemer og ledte tvÃĶrfaglige ingeniÃļrhold. Indtil 2025 har han fungeret som administrerende direktÃļr for Keymakr, et selskab, der tilbyder mÃĶrkningstjenester, hvor han har banet vejen for menneske-i-lÃļkken-arbejdsprocesser, avancerede QA-systemer og specialtilpasset vÃĶrktÃļj til at understÃļtte store computersyns- og autonomidatamÃĶssige behov.

Han har en bachelorgrad i datalogi og en baggrund i ingeniÃļrvidenskab og kreative kunstneriske fag, hvilket giver ham en tvÃĶrfaglig indsigt i lÃļsning af komplekse problemer. Michael befinder sig pÃĨ skÃĶringen af teknologisk innovation, strategisk produktledelse og virkelystisk impact, og driver fremad mod den nÃĶste front i autonome systemer og intelligent automation.