Robotik och fysisk AI

Hur robotar lär sig att be om hjälp

mm
Lägg till Unite.AI bland dina föredragna källor på Google

I den utvecklande världen av robotik sticker ett banbrytande samarbete mellan Princeton University och Google (GOOGL ) ut. Ingenjörer från dessa prestigefyllda institutioner har utvecklat en innovativ metod som lär robotar en avgörande färdighet: att känna igen när de behöver hjälp och hur de ska be om det. Denna utveckling markerar ett betydande steg framåt i robotiken, som broar gapet mellan autonom funktion och mänsklig-robotinteraktion.

Resan mot mer intelligenta och oberoende robotar har alltid hämmats av en betydande utmaning: komplexiteten och tvetydigheten i mänskligt språk. Till skillnad från den binära tydligheten i datorkoder är mänskligt språk fullt av nyanser och subtiliteter, vilket gör det till en labyrint för robotar. Till exempel kan en kommando så enkel som “plocka upp skålen” bli en komplex uppgift när det finns flera skålar närvarande. Robotar, utrustade för att känna sin omgivning och svara på språk, finner ofta sig själva vid en vägskäl när de står inför sådana språkliga osäkerheter.

Kvantifiering av osäkerhet

För att möta denna utmaning har Princeton- och Google-teamet introducerat en ny approach som kvantifierar “dimheten” i mänskligt språk. Denna teknik mäter i princip nivån av osäkerhet i språkkommandon och använder denna mått för att vägleda robotens handlingar. I situationer där en kommando kan leda till flera tolkningar kan roboten nu mäta nivån av osäkerhet och bestämma när den ska söka ytterligare förtydligande. Till exempel, i en miljö med flera skålar, skulle en högre grad av osäkerhet få roboten att fråga vilken skål den ska plocka upp, och därmed undvika potentiella fel eller ineffektiviteter.

Denna approach inte bara ger robotar en bättre förståelse av språk, utan förbättrar också deras säkerhet och effektivitet i uppgiftsutförande. Genom att integrera stora språkmodeller (LLM) som de som ligger bakom ChatGPT, har forskarna tagit ett betydande steg i att anpassa robotiska handlingar mer i linje med mänskliga förväntningar och behov.

Rollen för stora språkmodeller

Integrationen av LLM spelar en avgörande roll i denna nya approach. LLM är instrumentala i att bearbeta och tolka mänskligt språk. I detta sammanhang används de för att utvärdera och mäta osäkerheten i språkkommandon som ges till robotar.

Men beroendet av LLM är inte utan utmaningar. Som forskarteamet påpekar kan utdata från LLM ibland vara opålitliga.

Anirudha Majumdar, en biträdande professor vid Princeton, betonar vikten av denna balans:

“Att blint följa planer som genereras av en LLM kan få robotar att agera på ett osäkert eller opålitligt sätt, och så vi behöver våra LLM-baserade robotar att veta när de inte vet.”

Detta betonar behovet av en nyanserad approach, där LLM används som verktyg för vägledning snarare än ofelbara beslutsfattare.

Praktisk tillämpning och testning

Den praktiska tillämpningen av denna metod har testats i olika scenarier, vilket visar dess flexibilitet och effektivitet. Ett sådant test involverade en robotarm, som fick i uppgift att sortera leksaksartiklar i olika kategorier. Detta enkla setup demonstrerade robotens förmåga att navigera uppgifter med tydliga val effektivt.

Bild: Princeton University

Komplexiteten ökade betydligt i ett annat experiment med en robotarm monterad på en hjulburen plattform i ett kontorskök. Här stod roboten inför riktiga utmaningar som att identifiera rätt föremål att placera i en mikrovågsugn när det fanns flera alternativ.

Genom dessa tester demonstrerade robotarna framgångsrikt sin förmåga att använda den kvantifierade osäkerheten för att fatta beslut eller söka förtydligande, och därmed validerade den praktiska nyttan av denna metod.

Framtida implikationer och forskning

Blickar man framåt, har denna forskning långtgående implikationer som sträcker sig bortom de nuvarande tillämpningarna. Teamet, lett av Majumdar och doktoranden Allen Ren, undersöker hur denna approach kan appliceras på mer komplexa problem inom robotperception och AI. Detta inkluderar scenarier där robotar behöver kombinera syn och språkinformation för att fatta beslut, och därmed ytterligare minska gapet mellan robotisk förståelse och mänsklig interaktion.

Den pågående forskningen syftar inte bara till att förbättra robotarnas förmåga att utföra uppgifter med högre precision, utan också att navigera i världen med en förståelse liknande mänsklig kognition. Denna forskning kunde bana väg för robotar som inte bara är mer effektiva och säkrare, utan också mer anpassade till de nyanserade kraven i mänskliga miljöer.

Du kan hitta den publicerade forskningen här.

Alex leder Unite.AI:s AI-drivna nyhetsverksamhet, som kombinerar journalistik, forskning och automation för att stödja snabb och skalbar bevakning av artificiell intelligens. Hans arbete hjälper till att säkerställa att framväxande AI‑utvecklingar lyfts fram effektivt samtidigt som publikations redaktionella standarder upprätthålls.