Modele i platformy AI

DeepMind odkrywa technikę szkolenia AI, która może również działać w naszych mózgach

mm
Dodaj Unite.AI do preferowanych źródeł w Google

DeepMind opublikował niedawno artykuł opisujący, jak nowy typ uczenia wzmacniania może potencjalnie wyjaśnić, jak ścieżki nagród w ludzkim mózgu funkcjonują. Jak donosi NewScientist, metoda szkolenia maszynowego nazywa się uczeniem wzmacniania dystrybucyjnym, a mechanizmy za nią stojące wydają się prawdopodobnie wyjaśniać, jak dopamina jest uwalniana przez neurony w mózgu.

Neurobiologia i informatyka mają długą historię współpracy. Już w 1951 roku Marvin Minsky użył systemu nagród i kar, aby stworzyć program komputerowy, który mógł rozwiązać labirynt. Minsky był zainspirowany pracą Iwana Pawłowa, fizjologa, który udowodnił, że psy mogą uczyć się za pomocą serii nagród i kar. Nowy artykuł DeepMind dodaje do splątanej historii neurobiologii i informatyki, stosując typ uczenia wzmacniania, aby uzyskać wgląd w to, jak neurony dopaminy mogą funkcjonować.

Kiedy osoba lub zwierzę jest gotowe do wykonania czynności, zbiór neuronów w mózgu odpowiedzialnych za uwalnianie dopaminy robi przewidywania dotyczące tego, jak nagradzająca będzie ta czynność. Po wykonaniu czynności i ujawnieniu konsekwencji (nagród) mózg uwalnia dopaminę. Jednak uwalnianie dopaminy jest skalowane zgodnie z wielkością błędu przewidywania. Jeśli nagroda jest większa/lepsza niż oczekiwana, wyzwala się silniejszy przypływ dopaminy. W przeciwnym razie, gorsza nagroda prowadzi do uwalniania mniejszej ilości dopaminy. Dopamina służy jako funkcja korygująca, która powoduje, że neurony dostosowują swoje przewidywania, aż do momentu, gdy zbiegają się one z rzeczywistymi nagrodami. To jest bardzo podobne do tego, jak algorytmy uczenia wzmacniania działają.

Rok 2017 przyniósł wydanie przez DeepMind zwiększonej wersji powszechnie używanego algorytmu uczenia wzmacniania, a ta lepsza metoda szkolenia była w stanie poprawić wyniki w wielu zadaniach uczenia wzmacniania. Zespół DeepMind uznał, że mechanizmy za nowym algorytmem mogą być użyte do lepszego wyjaśnienia, jak neurony dopaminy działają w ludzkim mózgu.

W przeciwieństwie do starszych algorytmów uczenia wzmacniania, nowszy algorytm DeepMind reprezentuje nagrody jako dystrybucję. Starsze podejścia do uczenia wzmacniania reprezentowały szacowane nagrody jako pojedynczą liczbę, która reprezentowała średni oczekiwany wynik. To pozwoliło modelowi na lepsze reprezentowanie możliwych nagród i osiągnięcie lepszych wyników. Lepsze wyniki nowej metody szkolenia skłoniły zespół DeepMind do zbadania, czy neurony dopaminy w ludzkim mózgu działają w podobny sposób.

W celu zbadania pracy neuronów dopaminy DeepMind współpracował z Harvardem, aby zbadać aktywność neuronów dopaminy u myszy. Naukowcy kazali myszom wykonywać różne zadania i dawali im nagrody w zależności od wyniku rzutu kości, rejestrując, jak ich neurony dopaminy były aktywne. Różne neurony wydawały się przewidywać różne potencjalne wyniki, uwalniając różne ilości dopaminy. Niektóre neurony przewidywały niższe wyniki niż rzeczywiste nagrody, podczas gdy inne przewidywały nagrody wyższe niż rzeczywiste nagrody. Po wykreśleniu dystrybucji przewidywań nagród naukowcy odkryli, że dystrybucja przewidywań była dość bliska rzeczywistej dystrybucji nagród. To sugeruje, że mózg używa systemu dystrybucyjnego do robienia przewidywań i dostosowywania przewidywań, aby lepiej odpowiadać rzeczywistości.

Badanie może poinformować zarówno neurobiologię, jak i informatykę. Badanie wspiera użycie uczenia wzmacniania dystrybucyjnego jako metody tworzenia bardziej zaawansowanych modeli AI. Poza tym może mieć implikacje dla naszych teorii na temat tego, jak mózg działa w odniesieniu do systemów nagród. Jeśli neurony dopaminy są rozproszone i niektóre z nich są bardziej pesymistyczne lub optymistyczne niż inne, zrozumienie tych dystrybucji może zmienić, jak podchodzimy do aspektów psychologii, takich jak zdrowie psychiczne i motywacja.

Jak donosi MIT Technology Review, Matt Botvinik, dyrektor badań neurobiologicznych w DeepMind, wyjaśnił znaczenie odkrycia na konferencji prasowej. Botvinik powiedział:

„Jeśli mózg używa tego, to jest prawdopodobnie dobry pomysł. Mówi nam, że jest to technika obliczeniowa, która może skalować się w sytuacjach rzeczywistych. Będzie się dobrze komponować z innymi procesami obliczeniowymi. Daje nam nową perspektywę na to, co dzieje się w naszych mózgach podczas codziennego życia”

Blogger i programista ze specjalnościami w Machine Learning i Deep Learning tematy. Daniel liczy, że pomoże innym wykorzystać moc sztucznej inteligencji dla dobra społecznego.