Robotică și IA fizică

Oamenii de știință din domeniul informaticii folosesc întărirea pozitivă pentru a învăța roboții

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Oamenii de știință din domeniul informaticii de la Universitatea Johns Hopkins au folosit tehnica de antrenament prin întărirea pozitivă, care este adesea utilizată pentru a antrena animale, cum ar fi câinii, pe un robot, astfel încât acesta să poată învăța singur noi trucuri. Printre aceste noi abilități s-a numărat și capacitatea de a stivui blocuri.

Robotul se numește Spot, iar potrivit cercetătorilor, el poate învăța abilități în câteva zile, care în mod normal ar dura aproximativ o lună.

Întărirea pozitivă

Întărirea pozitivă a fost utilizată de echipă pentru a crește setul de abilități ale robotului. Viteza cu care echipa a reușit să facă acest lucru face ca aceste tipuri de roboți să poată fi utilizați mai ușor în lumea reală.

Lucrarea a fost publicată în IEEE Robotics and Automation Letters, cu titlul „Good Robot! Efficient Reinforcement Learning for Multi-Step Visual Tasks with Sim to Real Transfer.

Andrew Hundt este student doctorand la Universitatea Johns Hopkins și autorul principal al cercetării.

„Întrebarea aici a fost cum să facem ca robotul să învețe o abilitate?” a spus el. „Am avut câini, așa că știu că recompensele funcționează și aceasta a fost inspirația pentru modul în care am proiectat algoritmul de învățare.”

Unul dintre motivele pentru care întărirea pozitivă funcționează pe calculatoare este că acestea nu au creierul intuitiv, ceea ce înseamnă că sunt practic o tablă de șah goală pe care poate fi proiectat orice. Cu alte cuvinte, acestea trebuie să învețe totul de la zero. Una dintre metodele de învățare cele mai eficiente pentru calculatoare este încercarea și eroarea, ceea ce este ceva pe care roboticienii încă lucrează astăzi.

Acesta este exact ceea ce au făcut cercetătorii atunci când au creat un sistem de recompense pentru robot, similar cu procesul de antrenare a unui câine prin oferirea de recompense. Diferența constă în faptul că robotul primește puncte numerice atunci când completează o sarcină corect.

https://www.youtube.com/watch?v=dvxqjJBWFD4

Abitături învățate

Atunci când a venit vorba de învățarea modului de a stivui blocuri, robotul a trebuit să învețe să se concentreze pe acțiuni constructive. În această metodă, robotul Spot a primit puncte mai mari atunci când a completat comportamente corecte în timpul stivuirii blocurilor. La capătul opus, nu a primit nimic pentru comportamente incorecte. A primit cel mai mare număr de puncte prin completarea unei stive de patru blocuri cu ultimul bloc în vârf.

Cercetătorii au văzut un mare succes în această metodă, cu robotul care a învățat în câteva zile ceea ce ar fi durat săptămâni în trecut. Prin antrenarea unui robot simulat, echipa a redus timpul de practică înainte de a trece la robotul Spot.

„Robotul vrea punctajul mai mare”, a spus Hundt. „Acesta învață rapid comportamentul corect pentru a obține cea mai bună recompensă. De fapt, în trecut, dura o lună de practică pentru ca robotul să atingă o acuratețe de 100%. Am reușit să facem acest lucru în două zile.”

Pe lângă învățarea modului de a stivui blocuri, robotul a folosit și întărirea pozitivă pentru a învăța alte sarcini, cum ar fi jocul unui joc de navigare simulat.

„La început, robotul nu are nicio idee ce face, dar va deveni tot mai bun cu fiecare practică. Acesta nu renunță niciodată și continuă să încerce să stivuiască și reușește să finalizeze sarcina de 100% din timp”, a spus Hundt.

Unele dintre posibilele aplicații ale acestei metode includ antrenarea roboților casnici pentru a completa anumite sarcini, precum și îmbunătățirea vehiculelor autonome.

„Scopul nostru este să dezvoltăm în cele din urmă roboți care pot efectua sarcini complexe în lumea reală – cum ar fi asamblarea produselor, îngrijirea persoanelor în vârstă și chirurgia”, a spus Hager. „În prezent, nu știm cum să programăm astfel de sarcini – lumea este prea complexă. Dar lucrări precum aceasta ne arată că există o promisiune în ideea că roboții pot învăța să efectueze astfel de sarcini din lumea reală într-un mod sigur și eficient.

Alex conduce operațiunile de știri alimentate de AI ale Unite.AI, combinând jurnalismul, cercetarea și automatizarea pentru a susține o acoperire rapidă și scalabilă a inteligenței artificiale. Munca sa contribuie la asigurarea că evoluțiile emergente în domeniul AI sunt evidențiate eficient, menținând în același timp standardele editoriale ale publicației.