Robotyka i fizyczna AI

Badacze z MIT łączą dane ruchu robota z modelami językowymi w celu poprawy wykonywania zadań

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Roboty domowe są coraz częściej uczane do wykonywania złożonych zadań za pomocą naśladownictwa, procesu, w którym są one programowane do kopiowania ruchów demonstrowanych przez człowieka. Chociaż roboty okazały się być doskonałymi naśladownikami, często mają trudności z dostosowaniem się do zakłóceń lub nieoczekiwanych sytuacji występujących podczas wykonywania zadań. Bez jawnej programacji do obsługi tych odchyleń, roboty są zmuszone do rozpoczęcia zadania od początku. Aby rozwiązać ten problem, inżynierowie z MIT opracowują nowe podejście, które ma na celu dać robotom zdrowy rozsądek w sytuacjach nieoczekiwanych, umożliwiając im dostosowanie się i kontynuowanie zadań bez wymagania interwencji ręcznej.

Nowe podejście

Badacze z MIT opracowali metodę, która łączy dane ruchu robota z “wiedzą zdrowego rozsądku” dużych modeli językowych (LLM). Łącząc te dwa elementy, podejście umożliwia robotom logiczne rozłożenie zadania domowego na podzadania i fizyczne dostosowanie się do zakłóceń w ramach każdego podzadania. Pozwala to robotowi na kontynuowanie zadania bez konieczności restartowania całego zadania od początku, eliminując potrzebę jawnej programacji napraw dla każdego możliwego awarii na drodze.

Jako student doktorancki Yanwei Wang z Wydziału Inżynierii Elektrycznej i Nauk Komputerowych (EECS) wyjaśnia, “Nasza metoda pozwala robotom na samokorektę błędów wykonania i poprawę ogólnego powodzenia zadania.”

Aby zademonstrować nowe podejście, badacze użyli prostego zadania: przesypywania kulek z jednej miski do drugiej. Tradycyjnie, inżynierowie poruszali robotem przez ruchy przesypywania i wylewania w jednej płynnej trajektorii, często zapewniając wiele demonstracji ludzkich dla robota do naśladownictwa. Jednak, jak zauważa Wang, “demonstracja ludzka jest jedną długą, ciągłą trajektorią”. Zespół zrealizował, że chociaż człowiek może zademonstrować pojedyncze zadanie w jednym przejściu, zadanie zależy od sekwencji podzadań. Na przykład, robot musi najpierw włożyć rękę do miski, zanim będzie mógł przesypać kulki, i musi przesypać kulki, zanim będzie mógł przenieść się do pustej miski.

Jeśli robot popełni błąd podczas któregokolwiek z tych podzadań, jego jedyną możliwością jest zatrzymanie się i rozpoczęcie od początku, chyba że inżynierowie jawnie oznaczą każde podzadanie i zaprogramują lub zbiorą nowe demonstracje dla robota, aby odzyskać od awarii. Wang podkreśla, że “ten poziom planowania jest bardzo uciążliwy”. To właśnie tutaj nowe podejście badaczy wchodzi w grę. Wykorzystując moc LLM, robot może automatycznie identyfikować podzadania w ramach zadania ogólnego i określać potencjalne działania odzyskiwania w przypadku zakłóceń. Eliminuje to potrzebę jawnej programacji robota do obsługi każdego możliwego scenariusza awarii, sprawiając, że robot staje się bardziej adaptacyjny i wydajny w wykonaniu zadań domowych.

Rola dużych modeli językowych

LLM odgrywają kluczową rolę w nowym podejściu badaczy z MIT. Te głębokie modele uczące się przetwarzają ogromne biblioteki tekstu, ustanawiając połączenia między słowami, zdaniem i akapitami. Dzięki tym połączeniom, LLM może generować nowe zdania na podstawie nauczonych wzorców, podstawowo rozumiejąc rodzaj słowa lub frazy, które najprawdopodobniej nastąpi po ostatnim.

Badacze zrealizowali, że ta zdolność LLM może być wykorzystana do automatycznego identyfikowania podzadań w ramach zadania ogólnego i potencjalnych działań odzyskiwania w przypadku zakłóceń. Łącząc “wiedzę zdrowego rozsądku” LLM z danymi ruchu robota, nowe podejście umożliwia robotom logiczne rozłożenie zadania na podzadania i dostosowanie się do nieoczekiwanych sytuacji. Ta integracja LLM i robotyki ma potencjał rewolucjonizacji sposobu, w jaki programowane i szkolone są roboty domowe, sprawiając, że stają się one bardziej adaptacyjne i zdolne do radzenia sobie z wyzwaniami świata rzeczywistego.

W miarę postępu w dziedzinie robotyki, włączanie technologii sztucznej inteligencji, takich jak LLM, stanie się coraz bardziej ważne. Podejście badaczy z MIT jest znaczącym krokiem w kierunku stworzenia robotów domowych, które nie tylko mogą naśladować ludzkie działania, ale także rozumieć podstawową logikę i strukturę zadań, które wykonują. To zrozumienie będzie kluczem do opracowania robotów, które mogą działać autonomicznie i wydajnie w złożonych, rzeczywistych środowiskach.

Ku bardziej inteligentnej i adaptacyjnej przyszłości robotów domowych

Umożliwiając robotom samokorektę błędów wykonania i poprawę ogólnego powodzenia zadania, ta metoda rozwiązuje jeden z głównych wyzwań w programowaniu robota: adaptacyjność do sytuacji świata rzeczywistego.

Wnioski z tego badania sięgają daleko poza proste zadanie przesypywania kulek. W miarę jak roboty domowe stają się coraz bardziej powszechne, będą musiały być w stanie radzić sobie z szerokim zakresem zadań w dynamicznych, nieustrukturyzowanych środowiskach. Możliwość rozłożenia zadań na podzadania, zrozumienia podstawowej logiki i dostosowania się do zakłóceń będzie niezbędna dla tych robotów, aby mogły one działać skutecznie i wydajnie.

Ponadto, integracja LLM i robotyki pokazuje potencjał technologii sztucznej inteligencji do rewolucjonizacji sposobu, w jaki programujemy i szkolimy roboty. W miarę jak te technologie będą się rozwijać, możemy spodziewać się bardziej inteligentnych, adaptacyjnych i autonomicznych robotów w naszych domach i miejscach pracy.

Praca badaczy z MIT jest krytycznym krokiem w kierunku stworzenia robotów domowych, które mogą prawdziwie zrozumieć i nawigować złożoności świata rzeczywistego. W miarę jak to podejście będzie udoskonalane i stosowane do szerszego zakresu zadań, ma ono potencjał przekształcić sposób, w jaki żyjemy i pracujemy, sprawiając, że nasze życie staje się łatwiejsze i bardziej wydajne.

Alex McFarland jest dziennikarzem i pisarzem zajmującym się sztuczną inteligencją, który bada najnowsze rozwoje w dziedzinie sztucznej inteligencji. Współpracował z licznymi startupami i wydawnictwami związanymi z sztuczną inteligencją na całym świecie.