Modele i platformy AI

DeepMind przedstawia nową metodę szkolenia bezpiecznego uczenia maszynowego z wzmocnieniem

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Uczenie maszynowe z wzmocnieniem to obiecująca gałąź rozwoju sztucznej inteligencji, pozwalająca na tworzenie systemów, które mogą radzić sobie z niezwykle złożonymi zadaniami. Algorytmy uczenia maszynowego z wzmocnieniem są wykorzystywane w tworzeniu systemów robotyki mobilnej i samochodów autonomicznych, między innymi. Jednak ze względu na sposób, w jaki szkoli się te algorytmy, mogą one czasami manifestować się w dziwnych i nieoczekiwanych zachowaniach. Te zachowania mogą być niebezpieczne, a badacze sztucznej inteligencji nazywają ten problem “bezpiecznym eksplorowaniem”, który polega na tym, że system sztucznej inteligencji utknie w eksplorowaniu niebezpiecznych stanów.

Niedawno laboratorium badawcze Google (GOOGL ), DeepMind, opublikowało pracę, w której zaproponowano nowe metody radzenia sobie z problemem bezpiecznego eksplorowania i szkolenia uczenia maszynowego z wzmocnieniem w sposób bezpieczniejszy. Metoda zaproponowana przez DeepMind koryguje również hakowanie nagród lub luki w kryteriach nagród.

Nowa metoda DeepMind składa się z dwóch systemów, które mają na celu kierowanie zachowaniem sztucznej inteligencji w sytuacjach, w których może pojawić się niebezpieczne zachowanie. Dwa systemy wykorzystywane przez technikę szkoleniową DeepMind to model generatywny i model dynamiki do przodu. Obie te modele są szkolone na różnych danych, takich jak demonstracje ekspertów od bezpieczeństwa i całkowicie losowe trajektorie pojazdów. Dane są oznaczone przez nadzorcę z określonymi wartościami nagród, a agent sztucznej inteligencji będzie się uczył wzorców zachowań, które pozwolą mu na zebranie największej nagrody. Stany niebezpieczne również zostały oznaczone, a gdy model z powodzeniem przewiduje nagrody i stany niebezpieczne, jest wdrożony do wykonania ukierunkowanych działań.

Zespół badawczy wyjaśnia w pracy, że idea polega na tworzeniu możliwych zachowań od podstaw, sugerowaniu pożądanych zachowań i tym, aby te hipotetyczne scenariusze były jak najbardziej informacyjne, jednocześnie unikając bezpośredniej ingerencji w środowisko uczenia. Zespół DeepMind nazywa ten podejście ReQueST, czyli syntezą zapytań o nagrody za pomocą optymalizacji trajektorii.

ReQueST może prowadzić do czterech różnych typów zachowań. Pierwszy typ zachowania próbuje maksymalizować niepewność dotyczącą modeli nagród ensemble. Tymczasem zachowania drugie i trzecie próbują minimalizować i maksymalizować przewidywane nagrody. Przewidywane nagrody są minimalizowane w celu odkrycia zachowań, których model może niepoprawnie przewidywać. Z drugiej strony, przewidywana nagroda jest maksymalizowana w celu uzyskania etykiet zachowań o najwyższej wartości informacyjnej. Wreszcie, czwarty typ zachowania próbuje maksymalizować nowość trajektorii, aby model kontynuował eksplorację niezależnie od przewidywanych nagród.

Gdy model osiągnie pożądany poziom zbierania nagród, wykorzystuje się agenta planistycznego do podejmowania decyzji na podstawie nauczonych nagród. Ten schemat kontroli predykcyjnej pozwala agentom nauczyć się unikać stanów niebezpiecznych, wykorzystując model dynamiczny i przewidywanie możliwych konsekwencji, w przeciwieństwie do zachowań algorytmów, które uczą się przez czysty prób i błąd.

Jak donosi VentureBeat, badacze DeepMind wierzą, że ich projekt jest pierwszym systemem uczenia maszynowego z wzmocnieniem, który może uczyć się w kontrolowany, bezpieczny sposób:

„Według naszej wiedzy, ReQueST jest pierwszym algorytmem modelowania nagród, który bezpiecznie uczy się o stanach niebezpiecznych i skaluje do szkolenia modeli nagród sieci neuronowych w środowiskach z wysokowymiarowymi, ciągłymi stanami. Do tej pory udowodniliśmy skuteczność ReQueST tylko w symulowanych dziedzinach z relativnie prostymi dynamikami. Jednym z kierunków przyszłej pracy jest przetestowanie ReQueST w 3D z bardziej realistyczną fizyką i innymi agentami działającymi w środowisku.”

Blogger i programista ze specjalnościami w Machine Learning i Deep Learning tematy. Daniel liczy, że pomoże innym wykorzystać moc sztucznej inteligencji dla dobra społecznego.