Modele și platforme AI

Agenții Inteligenței Artificiale Demonstrează Proprietăți Ale Inteligenței Emergente În Jocul Virtual De Ascunseț

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Una dintre faptele interesante despre cercetarea inteligenței artificiale este că aceasta poate executa acțiuni și urma strategii care surprind chiar și cercetătorii care le proiectează. Acest lucru s-a întâmplat în timpul unui joc recent de ascunseț virtual, în care mai mulți agenți de inteligență artificială au fost puși unul împotriva celuilalt. Cercetătorii de la OpenAI, o firmă de inteligență artificială cu sediul în San Francisco, au fost surprinși să constate că agenții lor de inteligență artificială au început să exploateze strategii în lumea jocului pe care cercetătorii nu le-au cunoscut nici măcar că există.

OpenAI a instruit un grup de agenți de inteligență artificială să joace un joc de ascunseț unul cu celălalt. Programele de inteligență artificială sunt instruite cu învățarea prin întărire, o tehnică în care comportamentul dorit este obținut de la algoritmi prin oferirea de feedback. Inteligența artificială pornește prin efectuarea de acțiuni aleatoare, și de fiecare dată când efectuează o acțiune care o apropie de obiectiv, agentul este recompensat. Inteligența artificială dorește să obțină recompensa maximă posibilă, așa că experimentează pentru a vedea care acțiuni îi aduc cea mai mare recompensă. Prin încercări și erori, inteligența artificială este capabilă să distingă strategiile care o vor duce la victorie, cele care îi vor aduce cea mai mare recompensă.

Învățarea prin întărire a demonstrat deja succese impresionante în învățarea regulilor jocurilor. OpenAI a instruit recent o echipă de inteligență artificială să joace jocul MMORPG DOTA 2, și inteligența artificială a învins o echipă de jucători umani campioni mondiali anul trecut. Un lucru similar s-a întâmplat cu jocul StarCraft, când o inteligență artificială a fost instruită pe joc de DeepMind. Învățarea prin întărire a fost folosită și pentru a preda programe de inteligență artificială să joace Pictionary cu oameni, învățând să interpreteze imagini și să folosească raționamentul comun.

În jocul de ascunseț virtual creat de cercetători, mai mulți agenți de inteligență artificială au fost puși unul împotriva celuilalt. Rezultatul a fost o cursă a înarmării, în care fiecare agent dorește să performeze mai bine decât celălalt și să obțină cele mai multe puncte de recompensă. O strategie nouă adoptată de un agent va determina adversarul să caute o strategie nouă pentru a o contracara, și viceversa. Igor Mordatch, un cercetător de la OpenAI, a explicat pentru IEEE Spectrum că experimentul demonstrează că acest proces de încercări și erori între agenți “este suficient pentru ca agenții să învețe comportamente surprinzătoare de unii singuri – este ca și cum copiii ar juca unul cu celălalt”.

Ce au fost exact comportamentele surprinzătoare? Cercetătorii aveau patru strategii de bază pe care se așteptau să le învețe agenții de inteligență artificială, și acestea au fost învățate destul de repede, devenind competenți în ele după doar 25 de milioane de jocuri simulate. Jocul a avut loc într-un mediu 3D plin de rampe, blocuri și pereți. Agenții de inteligență artificială au învățat să se urmărească unul pe celălalt, să mute blocuri pentru a construi forturi în care să se ascundă, și să mute rampe. Agenții de inteligență artificială care căutau au învățat să tragă rampe pentru a intra în forturile celor care se ascundeau, în timp ce cei care se ascundeau au învățat să încerce să ia rampele în forturile lor, astfel încât cei care căutau să nu le poată folosi.

Însă, în jurul baremului de 380 de milioane de jocuri, s-a întâmplat ceva neașteptat. Agenții de inteligență artificială au învățat să folosească două strategii pe care cercetătorii nu le-au așteptat. Agenții de inteligență artificială care căutau au învățat că, prin săritul pe o cutie și înclinarea/condusul cutiei spre o fortăreață din apropiere, puteau să sară în fortăreață și să găsească pe cel care se ascundea. Cercetătorii nu și-au dat seama nici măcar că acest lucru era posibil în fizica mediului jocului. Cei care se ascundeau au învățat să rezolve această problemă prin tragem cutiilor în fortăreața lor.

În timp ce comportamentul neașteptat al agenților de inteligență artificială instruiți cu algoritmi de învățare prin întărire este inofensiv în acest caz, ridică unele preocupări potențiale cu privire la modul în care învățarea prin întărire este aplicată în alte situații. Un membru al echipei de cercetare a OpenAI, Bowen Baker, a explicat pentru IEEE Spectrum că aceste comportamente neașteptate ar putea fi potențial periculoase. Ce se întâmplă dacă roboții încep să se comporte în moduri neașteptate?

„Construirea acestor medii este grea”, a explicat Baker. „Agenții vor găsi aceste comportamente neașteptate, ceea ce va fi o problemă de siguranță pe termen lung atunci când îi puneți în medii mai complexe.”

Însă, Baker a explicat și că strategiile de întărire pot duce la soluții inovatoare pentru problemele actuale. Sistemele instruite cu învățarea prin întărire ar putea rezolva o gamă largă de probleme cu soluții pe care nu le putem nici măcar imagina.

Blogger și programator cu specializări în Machine Learning și Deep Learning subiecte. Daniel speră să ajute pe alții să folosească puterea inteligenței artificiale pentru binele social.