Modele i platformy AI
Sztuczna inteligencja może unikać konkretnych niepożądanych zachowań dzięki nowym algorytmom
Jako że algorytmy i systemy sztucznej inteligencji stają się coraz bardziej zaawansowane i przejmują coraz większe odpowiedzialności, staje się coraz ważniejsze, aby zapewnić, że systemy sztucznej inteligencji unikają niebezpiecznych, niepożądanych zachowań. Niedawno zespół badaczy z Uniwersytetu Massachusetts Amherst i Stanford opublikował pracę, która pokazuje, jak można unikać konkretnych zachowań sztucznej inteligencji, za pomocą techniki, która wykorzystuje precyzyjne instrukcje matematyczne, które mogą być użyte do dostosowania zachowania sztucznej inteligencji.
Według TechXplore, badania opierały się na założeniu, że nieuczciwe/niebezpieczne zachowania mogą być zdefiniowane za pomocą funkcji i zmiennych matematycznych. Jeśli to prawda, to powinno być możliwe, aby badacze trenowali systemy, aby unikały tych konkretnych zachowań. Zespół badawczy dążył do stworzenia zestawu narzędzi, który mógłby być użyty przez użytkowników sztucznej inteligencji, aby określić, jakie zachowania chcą uniknąć, i umożliwić inżynierom sztucznej inteligencji niezawodne trenowanie systemu, który unika niepożądanych działań w sytuacjach rzeczywistych.
Phillip Thomas, pierwszy autor pracy i asystent profesora informatyki na Uniwersytecie Michigan Amherst, wyjaśnił, że zespół badawczy dąży do pokazania, że projektanci algorytmów sztucznej inteligencji mogą ułatwić użytkownikom sztucznej inteligencji opisanie niepożądanych zachowań i sprawić, aby było bardzo prawdopodobne, że system sztucznej inteligencji unika tych zachowań.
Zespół badawczy przetestował swoją technikę, stosując ją do powszechnego problemu w nauce o danych, czyli uprzedzeń płciowych. Zespół badawczy dążył do uczynienia algorytmów używanych do przewidywania średniej ocen studentów uczciwszymi, zmniejszając uprzedzenia płciowe. Zespół badawczy wykorzystał eksperymentalny zestaw danych i polecił swojemu systemowi sztucznej inteligencji, aby unikał tworzenia modeli, które systematycznie zaniżały lub zawyżały oceny dla jednej płci. W wyniku instrukcji badaczy, algorytm stworzył model, który lepiej przewidywał oceny studentów i miał znacznie mniej systematycznych uprzedzeń płciowych niż wcześniej istniejące modele. Poprzednie modele przewidywania ocen cierpiały na uprzedzenia, ponieważ modele redukujące uprzedzenia były często zbyt ograniczone, aby być użyteczne, lub nie używały w ogóle redukcji uprzedzeń.
Zespół badawczy opracował również inny algorytm. Algorytm ten został zaimplementowany w automatycznym insulinie, a jego celem było znalezienie równowagi między wydajnością a bezpieczeństwem. Automatyczne insulinowe muszą decydować, jaka dawka insuliny powinna być podana pacjentowi. Po jedzeniu, pompa powinna dostarczyć dawkę insuliny wystarczająco dużą, aby utrzymać poziom cukru we krwi w normie. Dawki insuliny, które są dostarczane, nie mogą być zbyt duże ani zbyt małe.
Algorytmy sztucznej inteligencji są już dobre w identyfikowaniu wzorców w odpowiedziach osób na dawki insuliny, ale istniejące metody analizy nie pozwalają lekarzom określić wyników, które powinny być unikane, takich jak nagłe spadki poziomu cukru we krwi. W przeciwieństwie do tego, zespół badawczy opracował metodę, która mogła być trenowana do dostarczania dawek insuliny, które pozostają w granicach dwóch skrajności, uniemożliwiając zarówno niedodawanie, jak i przedawkowanie. Chociaż system nie jest jeszcze gotowy do testowania na prawdziwych pacjentach, bardziej zaawansowana sztuczna inteligencja oparta na tym podejściu mogłaby poprawić jakość życia osób cierpiących na cukrzycę.
W pracy badawczej, badacze nazywają algorytm “Seledonian”. Jest to odniesienie do trzech praw robotyki opisanych przez autora science fiction, Isaaca Asimova. Implikacja jest taka, że system sztucznej inteligencji “nie może skrzywdzić człowieka ani, poprzez bierność, pozwolić człowiekowi na szkodę”. Zespół badawczy liczy, że ich ramy pozwolą badaczom i inżynierom sztucznej inteligencji na stworzenie sztucznej inteligencji, która szanuje wartości swoich użytkowników i uzasadnia zaufanie, które pokładamy w systemach autonomicznych. Emma Brunskill, starszy autor pracy i asystent profesora informatyki na Stanfordzie, wyjaśnił TechXplore:
“Chcemy rozwijać sztuczną inteligencję, która szanuje wartości swoich użytkowników i uzasadnia zaufanie, które pokładamy w systemach autonomicznych.”












