Kąt Andersona

Czy niedostatecznie opracowane zestawy danych AI w skali hiperskali są gorsze niż sam Internet?

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Badacze z Irlandii, Wielkiej Brytanii i Stanów Zjednoczonych ostrzegają, że wzrost zestawów danych szkoleniowych AI w skali hiperskali zagraża rozpowszechnieniu najgorszych aspektów ich źródeł internetowych, twierdząc, że niedawno opublikowany akademicki zestaw danych zawiera ‘kłopotliwe i explicytne obrazy oraz pary tekstowe gwałtu, pornografii, złośliwych stereotypów, rasistowskich i etnicznych wyzwisk oraz innych ekstremalnie problematycznych treści’.

Badacze uważają, że nowa fala ogromnych, niedostatecznie opracowanych lub błędnie przefiltrowanych multimodalnych (na przykład obrazów i zdjęć) zestawów danych jest prawdopodobnie bardziej szkodliwa ze względu na ich zdolność do wzmocnienia skutków takich negatywnych treści, ponieważ zestawy danych zachowują obrazy i inne treści, które mogły zostać usunięte z platform internetowych za pomocą skarg użytkowników, moderacji lokalnej lub algorytmów.

Stwierdzają również, że może to potrwać lata – w przypadku potężnego zestawu danych ImageNet, całą dekadę – aby długoletnie skargi dotyczące treści zestawu danych zostały rozpatrzone, a te późniejsze rewizje nie zawsze są odzwierciedlone nawet w nowych zestawach danych pochodzących z nich.

Artykuł artykuł, zatytułowany Wielomodalne zestawy danych: misoginia, pornografia i złośliwe stereotypy, pochodzi od badaczy z University College Dublin & Lero, Uniwersytetu w Edynburgu oraz Chief Scientist z platformy uwierzytelniania UnifyID.

Chociaż praca koncentruje się na niedawnym wydaniu zestawu danych CLIP-filtrowanego LAION-400M, autorzy argumentują przeciwko ogólnej tendencji do wrzucania coraz większych ilości danych do ramion uczenia maszynowego, takich jak model językowy GPT-3, i twierdzą, że wyniki ukierunkowane na lepsze wnioskowanie (nawet w kierunku sztucznej inteligencji ogólnej [AGI]) powodują ad hoc używanie szkodliwych źródeł danych z zaniedbaną kontrolą autorskich praw; potencjał do wywołania i promowania szkody; oraz możliwość nie tylko utrwalania nielegalnych danych, które mogłyby inaczej zniknąć z domeny publicznej, ale także włączania takich danych do modeli AI.

LAION-400M

W zeszłym miesiącu zestaw danych LAION-400M został wydany, powiększając liczbę multimodalnych, językowych zestawów danych, które polegają na repozytorium Common Crawl, które nie rozróżnia internetu i przenosi odpowiedzialność za filtrowanie i opracowanie do projektów, które z niego korzystają. Pochodny zestaw danych zawiera 400 milionów par tekstowo-obrazowych.

LAION-400M jest otwartym zestawem danych, wariantem zamkniętego zestawu danych Google AI WIT (WebImageText) zestawu danych wydanego w marcu 2021 roku, i zawiera pary tekstowo-obrazowe, gdzie obraz w bazie danych został skojarzony z towarzyszącym tekstem lub metadanymi (na przykład alt-tekstem obrazu w galerii internetowej). Umożliwia to użytkownikom wykonywanie tekstowych wyszukiwań obrazów, ujawniając skojarzenia, które podstawowy AI utworzył w tych dziedzinach (tj. ‘zwierzę’, ‘rower’, ‘osoba’, ‘mężczyzna’, ‘kobieta’).

Relacja między obrazem a tekstem, a także podobieństwo kosinusowe, które może wprowadzić stronniczość do wyników wyszukiwania, są istotą wezwania do poprawy metodologii, ponieważ bardzo proste zapytania do bazy danych LAION-400M mogą ujawnić stronniczość.

Na przykład, obraz pionierskiej astronautki Eileen Collins w bibliotece scitkit-image zwraca dwa skojarzone podpisy w LAION-400M: ‘To portret astronauty z flagą amerykańską’ i ‘To zdjęcie uśmiechniętej gospodyni w pomarańczowym kombinezonie z flagą amerykańską’.

Amerykańska astronautka Eileen Collins otrzymuje dwa bardzo różne podejścia do swoich osiągnięć jako pierwsza kobieta w kosmosie pod LAION-400M. Źródło: https://arxiv.org/pdf/2110.01963.pdf

Amerykańska astronautka Eileen Collins otrzymuje dwa bardzo różne podejścia do swoich osiągnięć jako pierwsza kobieta w kosmosie pod LAION-400M. Źródło: https://arxiv.org/pdf/2110.01963.pdf

Zgłoszone podobieństwo kosinusowe, które sprawia, że każdy podpis jest prawdopodobny, jest bardzo blisko siebie, a autorzy twierdzą, że takie podobieństwo sprawiłoby, iż systemy AI, które używają LAION-400M, są stosunkowo prawdopodobne do przedstawienia któregokolwiek z nich jako odpowiedni podpis.

Pornografia ponownie sięga do góry

LAION-400M udostępnił interfejs wyszukiwania dostępny, gdzie odznaczenie przycisku “bezpieczne wyszukiwanie” ujawnia, w jakim stopniu pornograficzne obrazy i skojarzenia tekstowe dominują etykiety i klasy. Na przykład, wyszukiwanie (niebezpieczne dla pracy) ‘zakonnica’ w bazie danych zwraca wyniki głównie związane z horrorami, kostiumami i strojami, z bardzo niewielką ilością prawdziwych zakonnic.

Wyłączenie trybu “Bezpieczne wyszukiwanie” w tym samym wyszukiwaniu ujawnia lawinę pornograficznych obrazów związanych z tym terminem, które przesuwają obrazy niepornograficzne na dół strony wyników wyszukiwania, ujawniając, w jakim stopniu LAION-400M nadał większy ciężar obrazom pornograficznym, ponieważ są one powszechne dla terminu “zakonnica” w źródłach internetowych.

Domyślne włączenie trybu “Bezpieczne wyszukiwanie” w interfejsie wyszukiwania online jest mylące, ponieważ reprezentuje sztuczkę interfejsu, filtr, który nie tylko niekoniecznie będzie aktywny w pochodnych systemach AI, ale który został uogólniony w dziedzinie “zakonnica” w sposób, który nie jest tak łatwo przefiltrowany lub odróżniony od wyników (relatywnie) bezpiecznych dla pracy w zakresie użycia algorytmicznego.

Artykuł zawiera rozmyte przykłady w różnych wyszukiwaniach w materiałach uzupełniających na końcu. Nie mogą one być tutaj przedstawione ze względu na język w towarzyszącym tekście, ale badacze zauważają wpływ, jaki badanie i rozmywanie tych obrazów miało na nich, i uznają wyzwanie opracowania takiego materiału do nadzoru ludzkiego nad dużymi bazami danych:

‘Doświadczyliśmy (tak jak i nasi koledzy, którzy nam pomogli) różnych stopni dyskomfortu, nudności i bólu głowy podczas procesu badania zestawu danych. Dodatkowo, tego rodzaju praca napotyka znaczną negatywną krytykę w akademickiej sferze AI po wydaniu, co nie tylko dodaje emocjonalny ciężar do już ciężkiego zadania badania i analizy takich zestawów danych, ale także zniechęca do podobnych prac w przyszłości, co szkodzi zarówno dziedzinie AI, jak i społeczeństwu w ogóle.’

Badacze twierdzą, że podczas gdy nadzór ludzki jest drogi i ma związane z nim koszty osobiste, systemy automatycznego filtrowania zaprojektowane do usunięcia lub innego rozwiązania takiego materiału są wyraźnie niewystarczające do tego zadania, ponieważ systemy NLP mają trudności z izolowaniem lub dyskontowaniem materiału obraźliwego, który może dominować w pozyskanym zestawie danych, a następnie być postrzegane jako istotne ze względu na samą liczbę.

Uświęcanie zakazanego contenu i pozbawianie ochrony autorskich praw

Artykuł argumentuje, że niedostatecznie opracowane zestawy danych tego rodzaju są “bardzo prawdopodobne” do utrwalenia wyzysku osób należących do mniejszości, i zajmuje się tym, czy podobne projekty danych open source mają prawo, prawne lub moralne, do przerzucenia odpowiedzialności za materiał na użytkownika końcowego:

‘Osoby mogą usunąć swoje dane z witryny i założyć, że znikają na zawsze, podczas gdy mogą one nadal istnieć na serwerach kilku badaczy i organizacji. Jest pytanie, kto jest odpowiedzialny za usunięcie tych danych z użycia w zestawie danych? Dla LAION-400M twórcy powierzyli to zadanie użytkownikowi zestawu danych. Biorąc pod uwagę, że takie procesy są celowo skomplikowane i że przeciętny użytkownik nie posiada wiedzy technicznej, aby usunąć swoje dane, czy jest to rozsądne podejście?’

Twierdzą również, że LAION-400M może nie być odpowiedni do wydania na podstawie przyjętego modelu licencji Creative Common CC-BY 4.0, pomimo potencjalnych korzyści dla demokratyzacji dużych zestawów danych, które wcześniej były wyłączną domeną dobrze finansowanych firm, takich jak Google i OpenAI.

Domena LAION-400M twierdzi, że obrazy w zestawie danych 'są objęte ich własnymi prawami autorskimi' – mechanizm 'przejścia' w dużej mierze umożliwiony przez orzeczenia sądowe i wytyczne rządowe z ostatnich lat, które szeroko zatwierdzają pobieranie danych z internetu do celów badawczych. Źródło: https://rom1504.github.io/clip-retrieval/

Domena LAION-400M twierdzi, że obrazy w zestawie danych ‘są objęte ich własnymi prawami autorskimi’ – mechanizm ‘przejścia’ w dużej mierze umożliwiony przez orzeczenia sądowe i wytyczne rządowe z ostatnich lat, które szeroko zatwierdzają pobieranie danych z internetu do celów badawczych. Źródło: https://rom1504.github.io/clip-retrieval/

Autorzy sugerują, że wolontariusze mogliby rozwiązać niektóre problemy z zestawem danych, i że badacze mogliby opracować lepsze techniki filtrowania.

‘Niemniej, prawa podmiotu danych pozostają nierozwiązane. Jest to lekkomyślne i niebezpieczne, aby zbagatelizować szkody tkwiące w takich dużych zestawach danych i zachęcać do ich użycia w przemyśle i ustawieniach komercyjnych. Odpowiedzialność schematu licencyjnego, na podstawie którego zestaw danych jest dostarczony, spoczywa wyłącznie na twórcy zestawu danych’.

Problemy z demokratyzacją danych w skali hiperskali

Artykuł argumentuje, że wizjo-lingwistyczne zestawy danych o takiej samej skali, jak LAION-400M, były wcześniej niedostępne poza dużymi firmami technologicznymi i ograniczoną liczbą instytucji badawczych, które dysponują zasobami, aby je skompilować, opracować i przetworzyć. Chwalą ducha nowego wydania, jednocześnie krytykując jego wykonanie.

Autorzy twierdzą, że przyjęta definicja “demokratyzacji”, w odniesieniu do otwartych zestawów danych w skali hiperskali, jest zbyt ograniczona i ‘nie uwzględnia praw, dobrobytu i interesów osób i społeczności podatnych na szkody, które prawdopodobnie najbardziej ucierpią z powodu skutków downstream tego zestawu danych i modeli szkoleniowych na nim’.

Ponieważ rozwój modeli GPT-3 w skali otwartej jest ostatecznie przeznaczony do rozpowszechnienia wśród milionów (a pośrednio, być może miliardów) użytkowników na całym świecie, a projekty badawcze mogą przyjąć zestawy danych przed ich późniejszymi edycjami lub nawet usunięciem, utrwalając problemy, które miały być rozwiązane w modyfikacjach, autorzy twierdzą, że niedbałe wydania niedostatecznie opracowanych zestawów danych nie powinny stać się stałą cechą w otwartym uczeniu maszynowym.

Wrzucanie dżina z powrotem do butelki

Niektóre zestawy danych, które zostały stłumione długo po tym, jak ich zawartość przeszła, być może nieodwracalnie, do długoterminowych projektów AI, obejmowały zestaw danych Duke MTMC (Multi-Target, Multi-Camera), który ostatecznie został wycofany z powodu powtarzających się obaw organizacji praw człowieka w Chinach; Microsoft Celeb (MS-Celeb-1M), zestaw danych 10 milionów “celebryckich” obrazów twarzy, które okazały się zawierać dziennikarzy, aktywistów, decydentów i pisarzy, których narażenie na dane biometryczne w wydaniu zostało skrytykowane; oraz zestaw danych Tiny Images, wycofany w 2020 roku z powodu przyznanych “stronniczości, obraźliwych i uprzedzających obrazów oraz pejoratywnych określeń”.

Co się tyczy zestawów danych, które zostały zmienione, a nie wycofane po krytyce, przykłady obejmują bardzo popularny zestaw danych ImageNet, który, jak zauważają badacze, zajął dekadę (2009-2019), aby zareagować na powtarzające się skargi dotyczące prywatności i nieobrazowych klas.

Artykuł obserwuje, że LAION-400M skutecznie cofa te poprawki, “w dużej mierze ignorując” wymienione powyżej rewizje w reprezentacji ImageNet w nowym wydaniu, i dostrzega szerszy trend w tym zakresie*:

‘To jest podkreślone w pojawieniu się większych zestawów danych, takich jak zestaw danych Tencent ML-images (w lutym 2020 roku), który obejmuje większość tych nieobrazowych klas, kontynuowaną dostępność modeli szkoleniowych na pełnym zestawie danych ImageNet-21k w repozytoriach takich jak TF-hub, oraz kontynuowaną używanie nieprzefiltrowanego ImageNet-21k w najnowszych modelach SotA (takich jak najnowszy model EfficientNetV2 i CoAtNet) oraz jawne ogłoszenia zezwalające na użycie nieprzefiltrowanego ImageNet-21k w renomowanych konkursach takich jak wyzwanie LVIS 2021.

‘Podkreślamy tę kluczową obserwację: zespół o randze ImageNet, zarządzający mniej niż 15 milionami obrazów, zmagał się i nie powiódł w tych próbach detoksykacji.

‘Skala starannych wysiłków wymaganych do gruntownego oczyszczenia tego ogromnego multimodalnego zestawu danych oraz modeli szkoleniowych na tym zestawie danych, obejmującego potencjalnie miliardy par obrazu i podpisu, będzie niewątpliwie astronomiczna.’

 

* Moja konwersja cytatów autora do linków.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai