Kąt Andersona

Adobe i Meta potępiają nadużycia badań użytkowników w badaniach nad widzeniem komputerowym

mm
Dodaj Unite.AI do preferowanych źródeł w Google
Source: 'Evacuated King's College London students at the University of Bristol in 1940' - https://www.hmoob.press/nn/Bristol_University#wiki-2

Adobe i Meta, wraz z Uniwersytetem Waszyngtonu, opublikowały obszerną krytykę dotyczącą tego, co twierdzą, że jest rosnącym nadużyciem i wykorzystywaniem badań użytkowników w badaniach nad widzeniem komputerowym (CV).

Badania użytkowników były wcześniej zwykle ograniczone do lokalnych mieszkańców lub studentów wokół kampusu jednej lub więcej uczestniczących instytucji akademickich, ale od tego czasu przeniosły się prawie w całości na platformy crowdsourcingowe, takie jak Amazon Mechanical Turk (AMT).

Wśród szerokiej gamy zarzutów nowy artykuł twierdzi, że projekty badawcze są pod presją, aby wykonać badania; często źle formułują badania; zlecają badania, gdzie logika projektu nie wspiera tego podejścia; i często są “oszukiwane” przez cynicznych crowdworkerów, którzy “rozgrywają” pożądane odpowiedzi zamiast naprawdę myśleć o problemie.

Piętnastostronicowy traktat (pt. Ku lepszym badaniom użytkowników w grafice komputerowej i widzeniu) składa się z centralnej części nowego artykułu i zawiera wiele innych krytycznych uwag dotyczących sposobu, w jaki crowdsourcedowe badania użytkowników mogą rzeczywiście hamować postęp w podsektorach widzenia komputerowego, takich jak rozpoznawanie obrazów i syntezowanie obrazów.

Chociaż artykuł dotyka znacznie szerszego zakresu problemów związanych z badaniami użytkowników, jego najostrzejsze ataki są skierowane przeciwko sposobowi, w jaki ocena wyjściowa w badaniach użytkowników (tj. gdy crowdsourcedowi ludzie są płaceni w badaniach użytkowników, aby wykonać oceny wartości – na przykład – nowych algorytmów syntezowania obrazów) może negatywnie wpływać na cały sektor.

Zobaczmy wybrane punkty.

Interpretacje sensacyjne

Jednym z sugestii autorów artykułu dla tych, którzy publikują w sektorze widzenia komputerowego, jest nakaz “ostrożnej interpretacji wyników”. Artykuł cytuję jeden przykład z 2021 roku, kiedy nowa praca badawcza twierdziła, że “ludzie nie są w stanie dokładnie identyfikować sztuki wygenerowanej przez AI” była szeroko nagłośniona w prasie.

Jeden z najbardziej znanych raportów medialnych na temat pracy z 2021 roku 'The Role of AI Attribution Knowledge in the Evaluation of Artwork', autorstwa Harshi Gangadharbatla, cytowany jako przykład w nowym artykule. Tutaj źródłem The Daily Mail jest The Times (zamknięty dla czytelników). Źródła: Daily Mail (link do archiwum) / https://www.gwern.net/docs/ai/nn/gan/2021-gangadharbatla.pdf

Jeden z najbardziej znanych raportów medialnych na temat pracy z 2021 roku ‘The Role of AI Attribution Knowledge in the Evaluation of Artwork’, autorstwa Harshi Gangadharbatla, cytowany jako przykład w nowym artykule. Tutaj źródłem The Daily Mail jest The Times (zamknięty dla czytelników). Źródła: Daily Mail (link do archiwum) / https://www.gwern.net/docs/ai/nn/gan/2021-gangadharbatla.pdf

Autorzy stwierdzają*:

‘[W] jednym badaniu w czasopiśmie psychologicznym zebrano obrazy tradycyjnych dzieł sztuki i obrazów stworzonych przez technologie AI, a crowdworkerom kazano odróżnić, które obrazy pochodzą z których źródeł. Z wyników wnioskowano, że “ludzie nie są w stanie dokładnie identyfikować sztuki wygenerowanej przez AI”, co jest bardzo szerokim wnioskiem, który nie wynika bezpośrednio z eksperymentów.

‘Ponadto, artykuł nie podaje szczegółów na temat konkretnych zestawów obrazów, które zostały zebrane lub użyte, co utrudnia, jeśli nie uniemożliwia, weryfikację i powtarzalność twierdzeń.

‘Co gorsza, prasa popularna podała te wyniki z mylącymi twierdzeniami, że AI może niezależnie tworzyć sztukę równie dobrą jak ludzie.’

Rozwiązywanie problemu oszukiwania przez crowdworkerów

Crowdsourcedowi pracownicy zazwyczaj nie są zbyt dobrze wynagradzani za swoje wysiłki. Ponieważ ich perspektywy są minimalne, a ich najlepszy potencjał zarobkowy jest uzależniony od ukończenia dużej liczby zadań, wiele z nich jest, według badań, skłonnych do podejmowania każdego “skrótu”, który przyspieszy bieżące zadanie, aby mogli przejść do następnego zadania.

Artykuł obserwuje, że crowdworkerzy, podobnie jak systemy machine learning, nauczą się powtarzalnych wzorców w badaniach użytkowników, które badacze sformułowali, i po prostu wnioskują “poprawną” lub “pożądaną” odpowiedź, zamiast wytworzyć prawdziwą, organiczną odpowiedź na materiał.

W tym celu artykuł zaleca przeprowadzanie kontroli crowdworkerów, znanych również jako “próby walidacyjne” lub “strażnicy” – skutecznie, fałszywe sekcje testu zaprojektowane w celu sprawdzenia, czy pracownik jest uwagę, losowo klikając, czy po prostu śledzi wzorzec, który saminferowany z testów, zamiast myśleć o swoich wyborach.

Autorzy stwierdzają:

‘Na przykład, w przypadku par stylizowanych obrazów, jeden obraz pary może być zamierzenie i obiektywnie słabym wynikiem. Podczas analizy danych od uczestników, którzy nie powiodli się w określonej liczbie kontroli, mogą być odrzuceni, przyjęci jako nieuwagi lub niekonsekwentni.

‘Te kontrole powinny być losowo wstawione do badania i powinny wyglądać tak samo jak inne próby; w przeciwnym razie uczestnicy mogą dowiedzieć się, które próby są kontrolami.’

Rozwiązywanie problemu oszukiwania przez badaczy

Z zamiarem lub bez, badacze mogą być współwinni tego rodzaju “gry”; istnieje wiele sposobów, aby nawet nieumyślnie “sygnałować” ich pożądane wybory crowdworkerom.

Na przykład, artykuł obserwuje, że przez wybór crowdworkerów z profilami, które mogą być korzystne dla uzyskania “idealnych” odpowiedzi w badaniu, nominalnie udowadniając hipotezę, która mogłaby nie powieść w mniej “wybranym” i bardziej przypadkowym grupie.

Frazeologia jest również kluczową kwestią:

‘Słownictwo powinno odzwierciedlać cele na wysokim poziomie, np. “który obraz zawiera mniej artefaktów?” zamiast “który obraz zawiera mniej wad kolorystycznych w okolicy twarzy?” Odwrotnie, niedokładne sformułowanie zadania pozostawia zbyt wiele do interpretacji, np. “który obraz jest lepszy?” może być rozumiany jako “który jest bardziej estetyczny?” gdzie intencją mogłoby być ocenienie “który jest bardziej realistyczny?”

Inny sposób “dobronamernego wpływu” na uczestników polega na tym, aby dano im do zrozumienia, jawnie lub niejawnie, który z możliwych wyborów przed nimi jest metoda autora, a nie wcześniejsza metoda lub losowy przykład.

Artykuł stwierdza*:

‘[U]czestnicy mogą odpowiedzieć na pytania, które badacze chcą usłyszeć, świadomie lub nie, co jest znane jako “dobry efekt podmiotu”. Nie należy oznaczać wyjść nazwami takimi jak “nasza metoda” lub “istniejąca metoda”. Uczestnicy mogą być uprzedzeni przez dynamikę władzy (tj. badacz prowadzący sesję badawczą), język badaczy do wprowadzania uczestników (np. “jak bardzo lubisz ten narzędzie, które zbudowałem wczoraj?”), oraz relację między badaczami i uczestnikami (np. jeśli obie strony pracują w tym samym laboratorium lub firmie).’

Formatowanie zadania w badaniu użytkowników może również wpłynąć na bezstronność badania. Autorzy zauważają, że jeśli w prezentacji obok siebie, podstawa jest stale umieszczona po lewej stronie (tj. “obraz A”), a wyjście nowego algorytmu po prawej, uczestnicy badania mogą wnioskować, że B jest “najlepszym” wyborem, opierając się na ich rosnącym przypuszczeniu, że badacze mają nadzieję na okreścony wynik.

‘Inne aspekty prezentacji, takie jak rozmiar obrazów na ekranie, ich odległość od siebie, itp. mogą wpłynąć na odpowiedzi uczestników. Przeprowadzenie badania z kilkoma różnymi ustawieniami może pomóc w wykryciu tych potencjalnych nieporozumień na wczesnym etapie.’

Niewłaściwi ludzie dla niewłaściwego produktu

Autorzy zauważają na kilku punktach w artykule, że crowdworkerzy są bardziej “ogólnymi” zasobami niż można by się spodziewać w poprzednich dekadach, kiedy badacze byli zmuszeni do pozyskiwania pomocy lokalnej, często od studentów wyższych uczelni, którzy uzupełniali swój dochód poprzez udział w badaniach.

Wymóg aktywnego udziału pozostawia wynajętemu crowdworkerowi mało miejsca, aby być “niezainteresowanym” produktem, który jest testowany, a autorzy artykułu zalecają, aby badacze zidentyfikowali swoich docelowych użytkowników przed opracowaniem i przetestowaniem potencjalnego produktu lub usługi – w przeciwnym razie ryzykując stworzenie czegoś bardzo trudnego do stworzenia, ale co nikt tak naprawdę nie chce.

‘Rzeczywiście, często widzieliśmy, jak badacze grafiki komputerowej lub widzenia próbowali uzyskać przyjęcie swoich badań przez praktyków przemysłowych, tylko po to, aby odkryć, że badania nie odpowiadają potrzebom użytkowników docelowych. Badacze, którzy nie wykonują potrzeb w początkowej fazie, mogą być zaskoczeni, gdy okaże się, że użytkownicy nie mają potrzeby lub zainteresowania narzędziem, które zostało opracowane przez kilka miesięcy lub lat.

‘Takie narzędzia mogą działać słabo w badaniach oceny, ponieważ użytkownicy mogą stwierdzić, że technologia daje nieprzydatne, niewłaściwe lub nieoczekiwane wyniki.’

Artykuł obserwuje ponadto, że użytkownicy, którzy są prawdopodobnie użytkownikami produktu, powinni być wybrani do badań, nawet jeśli nie są łatwi do znalezienia (lub, przypuszczalnie, tak tanie).

Zamiast powrotu do rekrutacji na kampusie (co byłoby może trochę wycofanym posunięciem), autorzy sugerują, aby badacze “rekrutowali użytkowników w terenie”, angażując się w odpowiednie społeczności.

‘Na przykład, może istnieć aktywny serwis internetowy lub społeczność, która może być wykorzystana. Nawet spotkanie z jednym członkiem społeczności może prowadzić do metody śnieżnej kulki, w której odpowiedni użytkownicy oferują połączenia z podobnymi osobami w swojej sieci.’

Wnioskowanie o informacje zwrotne

Artykuł zaleca również wnioskowanie o jakościową informację zwrotną od tych, którzy brali udział w badaniach użytkowników, nie tylko dlatego, że może to potencjalnie ujawnić fałszywe założenia ze strony badaczy.

‘Mogą one pomóc w debugowaniu badania, ale mogą również ujawnić nieoczekiwane aspekty wyników, które wpłynęły na oceny użytkowników. Czy uczestnik był “bardzo niezadowolony” z wyników, ponieważ były one nierzeczywiste, nieestetyczne, tendencyjne czy z innego powodu?

‘Bez informacji jakościowych badacz może pracować nad udoskonaleniem algorytmu, aby był bardziej realistyczny, zamiast rozwiązywać podstawowy problem użytkownika.’

Jak w przypadku wielu zaleceń w całym artykule, ta konkretna rekomendacja wymaga dalszych wydatków czasu i pieniędzy ze strony badaczy, w kulturze, która, jak obserwuje praca, domyślnie przyjmuje szybkie i praktycznie obligatoryjne crowdsourcedowe badania użytkowników, które są zwykle dość tanie i które odpowiadają studium-driven kulturze, którą artykuł krytykuje na przestrzeni całego artykułu.

Przebadani

Artykuł sugeruje, że badania użytkowników stają się rodzajem “wymogu minimalnego” w społeczności pre-print widzenia komputerowego, nawet w przypadkach, w których badanie nie może być rozsądnie sformułowane (na przykład z pomysłem tak nowym lub marginalnym, że nie ma “podobnego” analizy do przeprowadzenia, i który może nie być podatny na żadną rozsądną miarę, która mogłaby dać znaczące wyniki w badaniu użytkowników).

Jako przykład “przymusu badawczego” (nie jest to fraza autorów), badacze cytują przypadek artykułu ICLR 2022, dla którego recenzje są dostępne online (zapis archiwum z 24 czerwca 2022 r.; link pobrany bezpośrednio z nowego artykułu):

‘Dwóch recenzentów dał bardzo negatywne oceny, częściowo z powodu braku badań użytkowników. Artykuł został ostatecznie zaakceptowany, zaopatrzony w podsumowanie, które krytykuje recenzentów za używanie “badań użytkowników” jako wymówki dla słabego przeglądu i oskarża ich o bramkarstwo. Cała dyskusja jest warta przeczytania.

‘Ostateczna decyzja stwierdziła, że zgłoszenie opisuje bibliotekę oprogramowania, która była wdrożona przez lata, z tysiącami użytkowników (informacja, która nie została ujawniona recenzentom do anonimowego przeglądu). Czy artykuł, który opisuje bardzo wpływowy system, zostałby odrzucony, gdyby komitet nie miał tej informacji?

‘I czy, gdyby autorzy podjęli dodatkowy wysiłek, aby sfabrykować i przeprowadzić badanie użytkowników, byłoby to znaczące, i czy byłoby to wystarczające, aby przekonać recenzentów?’

Autorzy stwierdzają, że widzieli recenzentów i redaktorów, którzy nakładają “uciążliwe wymagania oceny” na zgłoszone artykuły, niezależnie od tego, czy takie oceny miałyby jakąkolwiek wartość.

‘Widzieliśmy również, jak autorzy i recenzenci używają ocen MTurk jako wsparcia, aby uniknąć podejmowania trudnych decyzji. Komentarze recenzentów, takie jak “nie mogę stwierdzić, czy obrazy są lepsze, może badanie użytkowników pomoże” są potencjalnie szkodliwe, zachęcając autorów do wykonania dodatkowej pracy, która nie poprawi słabego artykułu.’

Autorzy kończą artykuł centralnym “wezwaniem do działania”, dla społeczności widzenia komputerowego i grafiki komputerowej, aby rozważyć bardziej starannie swoje żądania dotyczące badań użytkowników, zamiast pozwolić, aby kultura badawcza rozwinęła się jako domyślna, pomimo “przypadków granicznych”, w których najbardziej interesująca praca może nie pasować do najbardziej lukratywnych lub owocnych kanałów badawczych i składowych.

Autorzy kończą:

‘[J]eśli głównym celem prowadzenia badań użytkowników jest uspokojenie recenzentów, a nie wytworzenie nowych wniosków, użyteczność i ważność takich badań użytkowników powinny być poddane w wątpliwość przez autorów i recenzentów. Karanie pracy, która nie zawiera oceny użytkowników, ma niezamierzone konsekwencje, zachęcając do pośpiesznie wykonanych, źle wykonanych badań użytkowników.

‘Maksyma, której należy przypomnieć, jest taka, że “złe badanie użytkowników prowadzi do złych wyników”, i takie badania będą kontynuowane, jeśli recenzenci będą nadal o nie prosić.’

 

* Moja konwersja cytowań wewnętrznych artykułu do odpowiednich hiperłączy
Moje podkreślenie, a nie autorów.

Pierwotnie opublikowano 24 czerwca 2022.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai