Interviuri
Marlos C. Machado, profesor adjunct la Universitatea din Alberta, cercetător Amii, CIFAR AI Chair – Seria de interviuri

Marlos C. Machado este cercetător la Alberta Machine Intelligence Institute (Amii), profesor adjunct la Universitatea din Alberta și cercetător Amii, unde deține și o poziție de Canada CIFAR AI Chair. Cercetarea lui Marlos se axează în principal pe problema învățării prin întărire. El a obținut licența și masteratul de la UFMG, în Brazilia, și doctoratul de la Universitatea din Alberta, unde a popularizat conceptul de explorare temporară prin opțiuni.
El a fost cercetător la DeepMind din 2021 până în 2023 și la Google (GOOGL ) Brain din 2019 până în 2021, perioadă în care a făcut contribuții semnificative la învățarea prin întărire, în special la aplicarea învățării prin întărire profundă pentru controlul baloanelor stratosferice Loon. Lucrările lui Marlos au fost publicate în conferințe și reviste de top din domeniul inteligenței artificiale, inclusiv Nature, JMLR, JAIR, NeurIPS, ICML, ICLR și AAAI. Cercetările sale au fost prezentate și în mass-media, cum ar fi BBC, Bloomberg TV, The Verge și Wired.
Am avut o discuție cu el la conferința anuală Upper Bound din 2023, care a avut loc la Edmonton, Alberta, și a fost găzduită de Amii (Alberta Machine Intelligence Institute).
Care este principalul dumneavoastră focus în ceea ce privește învățarea prin întărire și ce vă atrage la acest tip de învățare a mașinilor?
Ceea ce îmi place la învățarea prin întărire este conceptul de învățare prin interacțiune. Mi se pare că este un mod foarte natural de învățare, adică învățăm prin încercări și experimente. Îmi place că este un mod intuitiv de a învăța, așa cum oamenii învață în general. Nu îmi place să antropomorfizez inteligența artificială, dar este un mod de învățare care pare firesc.
Una dintre lucrurile care mă fascinează la învățarea prin întărire este faptul că, deoarece interacționați cu lumea, puteți descoperi noi comportamente. De exemplu, unul dintre cele mai faimoase exemple este AlphaGo, care a făcut o mutare pe care oamenii au numit-o “creativă”. A fost ceva pe care nu l-am văzut niciodată înainte și ne-a lăsat pe toți uimiți. Este un exemplu de cum învățarea prin întărire poate descoperi noi comportamente.
Care a fost aplicația dvs. istorică preferată?
Cred că există două exemple foarte faimoase, unul este elicopterul care a fost controlat cu ajutorul învățării prin întărire la Stanford, și celălalt este TD-Gammon, un jucător de backgammon care a devenit campion mondial. Acesta a fost un proiect din anii ’90, și am fost încântat să lucrez cu Gerald Tesauro, care a condus proiectul TD-Gammon.
La Google Brain, ați lucrat la navigarea autonomă a baloanelor stratosferice. De ce a fost acesta un caz de utilizare bun pentru furnizarea de acces la internet în zone greu accesibile?
Acesta a fost proiectul Loon, o filială a Alphabet (GOOG ), care a încercat să furnizeze acces la internet în zone greu accesibile. Ideea a fost să pună baloane în stratosferă pentru a oferi acces la internet în zone unde nu există infrastructură de telecomunicații.
Care au fost principalele provocări pe care le-ați întâmpinat la navigarea baloanelor stratosferice?
Una dintre principalele provocări a fost că nu știam cum arătau vânturile la altitudini mari. Am avut un model de vânt, dar nu era suficient de precis. Am trebuit să găsim o modalitate de a naviga baloanele folosind date istorice și de a învăța să anticipăm vânturile.
Ce studiază algoritmul de învățare prin întărire?
Algoritmul nostru de învățare prin întărire a învățat să navigheze baloanele folosind date istorice și un model de vânt. Am creat un simulator care a permis baloanelor să învețe să navigheze într-un mediu virtual.
Care sunt provocările principale în implementarea învățării prin întărire în lumea reală, în comparație cu mediul de jocuri?
Cred că una dintre principalele provocări este ingineria și siguranța. Trebuie să ne asigurăm că soluția noastră este sigură și nu are consecințe neașteptate. De asemenea, trebuie să luăm în considerare constrângerile și limitările lumii reale, care pot fi foarte diferite de cele dintr-un mediu de jocuri.
Ce cercetare sunteți implicat în prezent?
Acum sunt la Universitatea din Alberta și am un grup de cercetare aici, cu mulți studenți. Cercetarea mea este mult mai diversă, deoarece studenții mei mă permit să fac acest lucru. Una dintre lucrurile care mă interesează în special este noțiunea de învățare continuă.
Care sunt aplicațiile viitoare care vă entuziasmează cel mai mult?
Cred că una dintre aplicațiile care mă entuziasmează cel mai mult este tratamentul apei. Avem un proiect aici, la Universitatea din Alberta, în care încercăm să creăm algoritmi de învățare prin întărire care să poată sprijini oamenii în procesul de decizie sau să poată face acest lucru în mod autonom.
În unele locuri, până la 75% din consumul de energie este literalmente pentru unitățile de aer condiționat, deci are sens.
Exact, și cred că multe dintre aceste sisteme pot fi optimizate folosind învățarea prin întărire. De exemplu, putem crea algoritmi care să poată învăța să controleze temperatura și umiditatea în clădiri, ceea ce ar putea avea un impact semnificativ asupra consumului de energie.
Îi mulțumim pentru acest interviu minunat. Citiitorii care doresc să afle mai multe despre subiectul acesta pot vizita următoarele resurse:












