Modele și platforme AI

DeepMind Descoperă o Tehnică de Antrenare a Inteligenței Artificiale care Ar Putea Funcționa și în Creierul Uman

mm
Adaugă Unite.AI la sursele tale preferate pe Google

DeepMind a publicat recent un articol care detaliază modul în care un nou tip de învățare prin întărire ar putea explica modul în care funcționează căile de recompensă din creierul uman. Conform unui raport din NewScientist, metoda de antrenare a inteligenței artificiale se numește învățare prin întărire distributivă și mecanismele care stau la baza acesteia par să explice plauzibil modul în care dopaminei este eliberată de neuronii din creier.

Neuroștiința și informatica au o lungă istorie împreună. Încă din 1951, Marvin Minsky a utilizat un sistem de recompense și pedepse pentru a crea un program de calculator capabil să rezolve un labirint. Minsky a fost inspirat de lucrarea lui Ivan Pavlov, un fiziolog care a demonstrat că câinii pot învăța prin intermediul unei serii de recompense și pedepse. Articolul recent al DeepMind adaugă la istoria împletită a neuroștiinței și informaticii, aplicând un tip de învățare prin întărire pentru a obține insight-uri despre modul în care neuronii dopaminergici ar putea funcționa.

Oricând o persoană sau un animal este pe cale să efectueze o acțiune, colecțiile de neuroni din creierul său responsabili de eliberarea dopaminei fac o previziune despre cât de recompensatorie va fi acțiunea. Odată ce acțiunea a fost efectuată și consecințele (recompensele) acesteia au devenit evidente, creierul eliberează dopamină. Cu toate acestea, eliberarea dopaminei este scalată în conformitate cu mărimea erorii de previziune. Dacă recompensa este mai mare/mai bună decât se aștepta, se declanșează o undă mai puternică de dopamină. În schimb, o recompensă mai slabă duce la eliberarea unei cantități mai mici de dopamină. Dopamina servește ca o funcție corectivă care face ca neuronii să-și ajusteze previziunile până când acestea converg către recompensele reale obținute. Acest lucru este foarte asemănător cu modul în care funcționează algoritmii de învățare prin întărire.

Anul 2017 a văzut cercetătorii de la DeepMind lansând o versiune îmbunătățită a unui algoritm de învățare prin întărire utilizat în mod obișnuit, iar această metodă de învățare superioară a fost capabilă să îmbunătățească performanța la multe sarcini de învățare prin întărire. Echipa de la DeepMind a considerat că mecanismele care stau la baza noului algoritm ar putea fi utilizate pentru a explica mai bine modul în care funcționează neuronii dopaminergici din creierul uman.

În contrast cu algoritmii de învățare prin întărire mai vechi, noul algoritm al DeepMind reprezintă recompensele sub formă de distribuție. Abordările mai vechi de învățare prin întărire reprezentau recompensele estimate sub formă de un singur număr care reprezenta rezultatul mediu așteptat. Această schimbare a permis modelului să reprezinte mai precis posibilele recompense și să obțină o performanță mai bună ca urmare. Performanța superioară a noii metode de antrenare a determinat cercetătorii de la DeepMind să investigheze dacă neuronii dopaminergici din creierul uman funcționează într-un mod similar.

Pentru a investiga funcționarea neuronilor dopaminergici, DeepMind a colaborat cu Harvard pentru a cerceta activitatea neuronilor dopaminergici la șoareci. Cercetătorii au făcut șoarecii să efectueze diverse sarcini și le-au oferit recompense pe baza aruncării cu zarul, înregistrând modul în care neuronii lor dopaminergici s-au activat. Diferiți neuroni păreau să prevadă rezultate diferite, eliberând cantități diferite de dopamină. Unii neuroni prevedeau rezultate mai mici decât cele reale, în timp ce alții prevedeau recompense mai mari decât cele reale. După ce au graficat distribuția previziunilor de recompensă, cercetătorii au constatat că distribuția previziunilor era foarte aproape de distribuția reală a recompenselor. Acest lucru sugerează că creierul utilizează într-adevăr un sistem distributiv atunci când face previziuni și ajustează previziunile pentru a se potrivi mai bine cu realitatea.

Studiul ar putea informa atât neuroștiința, cât și informatica. Studiul susține utilizarea învățării prin întărire distributivă ca metodă de creare a unor modele de inteligență artificială mai avansate. Dincolo de aceasta, ar putea avea implicații pentru teoriile noastre despre modul în care funcționează creierul în ceea ce privește sistemele de recompensă. Dacă neuronii dopaminergici sunt distribuiți și unii sunt mai pesimiști sau mai optimiști decât alții, înțelegerea acestor distribuții ar putea schimba modul în care abordăm aspecte ale psihologiei, cum ar fi sănătatea mintală și motivația.

Conform unui raport din MIT Technology Review, Matt Botvinik, directorul de cercetare în neuroștiință la DeepMind, a explicat importanța descoperirilor la o conferință de presă. Botvinik a spus:

“Dacă creierul utilizează această tehnică, este probabil o idee bună. Ne spune că aceasta este o tehnică computațională care poate fi scalată în situații din lumea reală. Va funcționa bine cu alte procese computaționale. Ne oferă o nouă perspectivă asupra a ceea ce se întâmplă în creierul nostru în timpul vieții de zi cu zi”

Blogger și programator cu specializări în Machine Learning și Deep Learning subiecte. Daniel speră să ajute pe alții să folosească puterea inteligenței artificiale pentru binele social.