Modele i platformy AI
Algorytm TextFooler oszukuje sztuczną inteligencję NLP
Chociaż algorytmy i systemy przetwarzania języka naturalnego w ostatnich latach znacznie się rozwinęły, nadal są one podatne na rodzaj ataku zwanego “przykładem przeciwnym”. Przykłady przeciwne to starannie skonstruowane zdania, które mogą powodować, że system NLP zachowuje się w nieoczekiwany i niepożądany sposób. Programy AI mogą być sprowokowane do niewłaściwego zachowania za pomocą tych dziwnych przykładów, a w związku z tym badacze AI starają się znaleźć sposoby, aby chronić się przed skutkami przykładów przeciwnych.
Niedawno zespół badaczy z Uniwersytetu w Hongkongu i Agencji Nauki, Technologii i Badań w Singapurze współpracował przy tworzeniu algorytmu, który demonstrował niebezpieczeństwo przykładów przeciwnych. Jak donosi Wired, algorytm został nazwany TextFooler przez zespół badawczy i działa on przez drobne zmiany części zdania, wpływając na to, jak klasyfikator NLP interpretuje zdanie. Jako przykład, algorytm przekształcił jedną zdanie w inne podobne zdanie i zdanie to zostało wprowadzone do klasyfikatora, który miał za zadanie określić, czy recenzja była negatywna czy pozytywna. Oryginalne zdanie brzmiało:
“Postacie, obsadzone w niemożliwie wykonanych sytuacjach, są całkowicie oderwane od rzeczywistości.”
Zostało ono przekształcone w następujące zdanie:
“Postacie, obsadzone w niemożliwie skonstruowanych okolicznościach, są całkowicie oderwane od rzeczywistości.”
Te drobne zmiany spowodowały, że klasyfikator tekstu sklasyfikował recenzję jako pozytywną zamiast negatywnej. Zespół badawczy przetestował ten sam podejście (zamienianie pewnych słów na synonimy) na kilku różnych zbiorach danych i algorytmach klasyfikacji tekstu. Zespół badawczy donosi, że byli w stanie obniżyć dokładność klasyfikacji algorytmu do zaledwie 10%, w dół z 90%. Jest to pomimo faktu, że ludzie czytający te zdania interpretowaliby je jako mające ten sam sens.
Te wyniki są niepokojące w erze, w której algorytmy NLP i AI są używane coraz częściej i do ważnych zadań, takich jak ocena roszczeń medycznych lub analiza dokumentów prawnych. Nie jest znany stopień niebezpieczeństwa, jakie przykłady przeciwne stanowią dla obecnie używanych algorytmów. Zespoły badawcze na całym świecie nadal starają się ustalić, jaki wpływ mogą one mieć. Niedawno opublikowany raport przez grupę Stanford Human-Centered AI sugeruje, że przykłady przeciwne mogą oszukiwać algorytmy AI i być używane do popełnienia oszustw podatkowych.
Istnieją pewne ograniczenia ostatniego badania. Na przykład, Sameer Singh, asystent profesora informatyki na UC Irvine, zauważa, że metoda przeciwna użyta w badaniu była skuteczna, ale opiera się na pewnej wiedzy o architekturze AI. AI musi być wielokrotnie badany, aż skuteczna grupa słów może być znaleziona, a takie powtarzające się ataki mogą być zauważone przez programy bezpieczeństwa. Singh i jego koledzy przeprowadzili własne badania na ten temat i odkryli, że zaawansowane systemy, takie jak algorytmy OpenAI, mogą dostarczać rasistowskie, szkodliwe treści, gdy są pobudzane pewnymi wyzwalaczami.
Przykłady przeciwne są również potencjalnym problemem przy dealingu z danymi wizualnymi, takimi jak zdjęcia lub filmy wideo. Jednym z słynnych przykładów jest zastosowanie pewnych subtelnych transformacji cyfrowych do obrazu kotka, co powoduje, że klasyfikator obrazu interpretuje go jako monitor lub komputer. W innym przykładzie badania przeprowadzone przez profesora Uniwersytetu Kalifornijskiego w Berkeley, Dawn Song, wykazały, że przykłady przeciwne mogą być używane do zmiany, w jaki sposób znaki drogowe są postrzegane przez systemy widzenia komputerowego, co może być potencjalnie niebezpieczne dla pojazdów autonomicznych.
Badania, takie jak te przeprowadzone przez zespół z Hongkongu i Singapuru, mogą pomóc inżynierom AI lepiej zrozumieć, jakie rodzaje słabości mają algorytmy AI i potencjalnie zaprojektować sposoby, aby ich chronić. Na przykład, klasyfikatory ensemble mogą być używane do zmniejszenia szans, że przykład przeciwny będzie w stanie oszukać system widzenia komputerowego. Z tego podejścia, kilka klasyfikatorów jest używanych i drobne transformacje są robione na obrazie wejściowym. Większość klasyfikatorów zwykle rozróżnia aspekty prawdziwej treści obrazu, które są następnie agregowane razem. Rezultatem jest to, że nawet jeśli kilka klasyfikatorów jest oszukanych, większość z nich nie będzie i obraz będzie właściwie sklasyfikowany.












