Robotteknologi og fysisk AI

Hvordan robotter lÃĶrer at bede om hjÃĶlp

mm
FÃļj Unite.AI til dine foretrukne kilder pÃĨ Google

I den udviklende verden af robotteknologi udgÃļr et banebrydende samarbejde mellem Princeton University og Google (GOOGL ) en fremtrÃĶdende position. IngeniÃļrer fra disse prestigefyldte institutioner har udviklet en innovativ metode, der lÃĶrer robotter en afgÃļrende fÃĶrdighed: at genkende, nÃĨr de har brug for hjÃĶlp, og hvordan de beder om det. Denne udvikling markerer et betydeligt skridt fremad i robotteknologi, idet den broer gapet mellem autonom funktion og menneske-robot-interaktion.

Rejsen mod mere intelligente og uafhÃĶngige robotter er altid blevet hindret af en vÃĶsentlig udfordring: kompleksiteten og tvetydigheden af menneskesprog. I modsÃĶtning til den binÃĶre klarhed i computerkoder er menneskesprog fyldt med nuancer og subtiliteter, hvilket gÃļr det til en labyrint for robotter. For eksempel kan en kommando sÃĨ simpel som “tag skÃĨlen” blive til en kompleks opgave, nÃĨr der er flere skÃĨle til stede. Robotter, der er udstyret til at fornemme deres omgivelser og reagere pÃĨ sprog, finder ofte sig selv i en krydsvej, nÃĨr de stÃĨr over for sÃĨdanne sproglige usikkerheder.

Kvantificering af usikkerhed

For at imÃļdekomme denne udfordring har Princeton- og Google-holdet introduceret en ny tilgang, der kvantificerer “uskarpheden” i menneskesprog. Denne teknik mÃĨler grundlÃĶggende niveauet af usikkerhed i sprogkommandoer og bruger denne mÃĨling til at guide robot-handlinger. I situationer, hvor en kommando kan fÃļre til multiple fortolkninger, kan robotten nu bedÃļmme niveauet af usikkerhed og afgÃļre, hvornÃĨr den skal sÃļge yderligere opklaring. For eksempel i en omgivelse med flere skÃĨle ville et hÃļjere niveau af usikkerhed fÃĨ robotten til at spÃļrge, hvilken skÃĨl den skal tage, og dermed undgÃĨ potentielle fejl eller ineffektiviteter.

Denne tilgang giver ikke kun robotter en bedre forstÃĨelse af sprog, men forbedrer ogsÃĨ deres sikkerhed og effektivitet i opgaveudfÃļrelse. Ved at integrere store sprogmodeller (LLM’er) som dem, der ligger bag ChatGPT, har forskerne taget et vÃĶsentligt skridt i retning af at tilpasse robot-handlinger mere nÃļjagtigt til menneskelige forventninger og behov.

Rollen for store sprogmodeller

Integrationen af LLM’er spiller en afgÃļrende rolle i denne nye tilgang. LLM’er er afgÃļrende for at bearbejde og fortolke menneskesprog. I denne kontekst bruges de til at evaluere og mÃĨle usikkerheden, der er til stede i sprogkommandoer givet til robotter.

Men afhÃĶngigheden af LLM’er er ikke uden udfordringer. Som forskerholdet har pÃĨpeget, kan output fra LLM’er undertiden vÃĶre upÃĨlidelige.

Anirudha Majumdar, en adjunktprofessor ved Princeton, understreger vigtigheden af denne balance:

“At blinde fÃļlge planer genereret af en LLM kan fÃĨ robotter til at handle pÃĨ en usikker eller utrovÃĶrdig mÃĨde, og derfor har vi brug for, at vores LLM-baserede robotter ved, nÃĨr de ikke ved.”

Dette understreger nÃļdvendigheden af en nuanceret tilgang, hvor LLM’er bruges som vÃĶrktÃļjer til vejledning snarere end ufejlbarlige beslutningstager.

Praktisk anvendelse og test

Den praktiske anvendelighed af denne metode er blevet testet i forskellige scenarier, der illustrerer dets fleksibilitet og effektivitet. Et sÃĨdant test involverede en robotarm, der skulle sortere legetÃļjsmadvarer i forskellige kategorier. Denne simple opsÃĶtning demonstrerede robotens evne til at navigere opgaver med klare valg effektivt.

Billede: Princeton University

Kompleksiteten Ãļgedes betydeligt i et andet eksperiment, der involverede en robotarm monteret pÃĨ en hjulplatform i et kontorkÃļkken. Her stod robotten over for virkelige udfordringer som at identificere den korrekte vare til at placere i en mikrobÃļlgeovn, nÃĨr der var flere muligheder.

Gennem disse tests demonstrerede robotterne med succes deres evne til at bruge den kvantificerede usikkerhed til at trÃĶffe beslutninger eller sÃļge opklaring, og dermed validerede den praktiske nytte af denne metode.

Fremtidige implikationer og forskning

Settende blikket fremad, gÃĨr implikationerne af denne forskning langt ud over de nuvÃĶrende anvendelser. Holdet, ledet af Majumdar og ph.d.-studerende Allen Ren, udforsker, hvordan denne tilgang kan anvendes pÃĨ mere komplekse problemer i robotperception og kunstig intelligens. Dette inkluderer scenarier, hvor robotter skal kombinere visuel og sproglig information for at trÃĶffe beslutninger, og dermed lukke gapet mellem robotforstÃĨelse og menneskelige interaktioner.

Forskningen sigter mod ikke kun at forbedre robotternes evne til at udfÃļre opgaver med hÃļjere prÃĶcision, men ogsÃĨ at navigere i verden med en forstÃĨelse lignende menneskelig kognition. Denne forskning kunne bana vejen for robotter, der ikke kun er mere effektive og sikrere, men ogsÃĨ mere i harmoni med de nuancerede krav i menneskelige miljÃļer.

DU kan finde den publicerede forskning her.

Alex McFarland er en AI-journalist og forfatter, der udforsker de seneste udviklinger inden for kunstig intelligens. Han har samarbejdet med talrige AI-startups og publikationer verden over.