Andersonův úhel

‘Neviditelná’, Často Nešťastná Pracovní Síla, Která Rozhoduje o Budoucnosti Umělé Inteligence

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Dvě nové zprávy, včetně studie vedené Google Research, vyjadřují obavy, že současný trend spoléhat se na levnou a často bezmocnou skupinu globálních pracovníků na základě úkolů pro vytváření základních pravd pro systémy strojového učení by mohl mít významné důsledky pro umělou inteligenci.

Mezi řadou závěrů studie Google zjistila, že vlastní předpojatosti pracovníků jsou pravděpodobně zakotveny v systémech umělé inteligence, jejichž základní pravdy budou založeny na jejich odpovědích; že široce rozšířené nespravedlivé pracovní postupy (včetně USA) na platformách pro práci na základě úkolů jsou pravděpodobně degradovat kvalitu odpovědí; a že „konsenzuální“ systém (efektivně „mini-volba“ pro některé kusy základních pravd, které budou ovlivňovat systémy umělé inteligence) který目前 řeší spory může vlastně odhodit nejlepší a / nebo nejvíce informované odpovědi.

To je špatná zpráva; horší zpráva je, že téměř všechny nápravné opatření jsou drahá, časově náročná nebo obojí.

Nejistota, Náhodné Odmítnutí a Zloba

První studie, od pěti výzkumníků Google, se jmenuje Čí Základní Pravda? Účetnictví pro Individuální a Kolektivní Identity Podkladů Anotace; druhá, od dvou výzkumníků ze Syracuse University v New Yorku, se jmenuje Původ a Hodnota Nesouhlasu Mezi Anotátory Dat: Případová Studie Individuálních Rozdílností v Anotaci Špatného Chování.

Studie Google poznamenává, že pracovníci – jejichž hodnocení často tvoří definující základ systémů strojového učení, které mohou nakonec ovlivnit naše životy – jsou často provozováni v rámci řady omezení, které mohou ovlivnit, jak reagují na experimentální úkoly.

Například současné politiky Amazon Mechanical Turk umožňují žadatelům (těm, kteří zadávají úkoly) odmítnout práci anotátora bez zodpovědnosti*:

‘[V]elká většina pracovníků na základě úkolů (94%) měla práci, která byla odmítnuta nebo za kterou nebyli vyplaceni. Přesto žadatelé si ponechávají plná práva na data, která obdrží, bez ohledu na to, zda je přijmou nebo odmítnou; Roberts (2016) popisuje tento systém jako „umožňující krádež mzdy“.

‘Navíc, odmítnutí práce a zadržování mzdy je bolestivé, protože odmítnutí jsou často způsobena nejasnými pokyny a nedostatkem smysluplných komunikačních kanálů; mnoho pracovníků na základě úkolů uvádí, že špatná komunikace negativně ovlivňuje jejich práci.’

Autoři doporučují, aby výzkumníci, kteří používají outsourcované služby pro vývoj datových sad, měli zvážit, jak platforma pro práci na základě úkolů zachází se svými pracovníky. Dále poznamenávají, že ve Spojených státech jsou pracovníci na základě úkolů klasifikováni jako „nezávislí dodavatelé“, a proto nejsou pokryti minimální mzdou stanovenou Zákonem o spravedlivých pracovních standardech.

Context Matters

Studie také kritizuje použití ad hoc globální pracovní síly pro úkoly anotace, bez ohledu na pozadí anotátorů.

Kde je rozpočet, je běžné, že výzkumníci používající AMT a podobné platformy pro práci na základě úkolů zadají stejný úkol čtyřem anotátorům a budou se řídit „většinovým rozhodnutím“ o výsledcích.

Kontextuální zkušenost, studie argumentuje, je zřetelně podceňována. Například, pokud je otázka související s sexismem náhodně rozdělena mezi tři souhlasící muže ve věku 18-57 a jednu nesouhlasící ženu ve věku 29, muži výhra, kromě relativně vzácných případů, kdy výzkumníci dbají na kvalifikaci svých anotátorů.

Podobně, pokud je otázka související s chováním gangů v Chicagu rozdělena mezi venkovskou ženu z USA ve věku 36, muže z Chicaga ve věku 42 a dva anotátory z Bangaluru a Dánska, osoba, která je pravděpodobně nejvíce postižena problémem (muž z Chicaga), má pouze čtvrtinový podíl na výsledku, ve standardní konfiguraci outsourcingu.

Výzkumníci uvádějí:

‘[P]ojem „jedna pravda“ v odpovědích na základě úkolů je mýtus; nesouhlas mezi anotátory, který je často považován za negativní, může ve skutečnosti poskytnout cenný signál. Za druhé, protože mnoho anotátorů na základě úkolů je socio-demograficky zkresleno, existují důsledky pro to, které populace jsou reprezentovány v datech, jakož i které populace čelí problémům [práce na základě úkolů].

‘Účetnictví pro zkreslení v demografii anotátorů je kritické pro kontextualizaci dat a zajištění odpovědného následného použití. Stručně řečeno, existuje hodnota v uznání a účetnictví za socio-kulturní pozadí pracovníků — jak z hlediska kvality dat, tak z hlediska společenského dopadu.’

Žádné ‘Neutrální’ Názory na Horké Témata

I když názory čtyř anotátorů nejsou zkresleny, buď demograficky nebo jiným metricky, studie Google vyjadřuje obavy, že výzkumníci nejsou brát v úvahu životní zkušenosti nebo filozofickéDisposition anotátorů:

‘Zatímco některé úkoly kladou objektivní otázky s správnou odpovědí (je tam lidská tvář na obrázku?), často datasets cílem je zachytit soud o relativně subjektivních úkolech s žádnou univerzálně správnou odpovědí (je tento kus textu urážlivý?). Je důležité být úmyslný o tom, zda se spolehnout na subjektivní soudy anotátorů.’

V souvislosti se svou konkrétní ambicí řešit problémy při označování nenávistné řeči studie Syracuse poznamenává, že více kategoriálních otázek, jako je Je tam kočka na této fotografii?, jsou zřetelně odlišné od ptaní se na crowdworkera, zda je určitý výraz „toxický“:

‘Vzít v úvahu složitost sociální reality, lidé vnímají toxicitu velmi odlišně. Jejich označení toxického obsahu je založeno na jejich vlastních vnímáních.’

Zjistiv, že osobnost a věk mají „značný vliv“ na dimenzionální označení nenávistné řeči, výzkumníci ze Syracuse uzavírají:

‘Tyto výsledky naznačují, že úsilí o dosažení konzistence mezi anotátory s odlišným pozadím a osobností pro nenávistnou řeč může nikdy plně nezdařit.’

Soudce Může Být Také Zaujatý

Tato absence objektivnosti je pravděpodobně iterovat nahoru, podle studie Syracuse, která argumentuje, že manuální zásah (nebo automatizovaná politika, také rozhodnutá člověkem), který určuje „vítěze“ konsenzuálních hlasů, by měl být také podroben zkoumání.

Porovnávajíce proces s moderací fóra, autoři uvádějí*:

‘[M]oderátoři komunity mohou rozhodnout o osudu příspěvků a uživatelů ve své komunitě tím, že propagují nebo skrývají příspěvky, stejně jako ctí, haní, nebo zakazují uživatele. Rozhodnutí moderátorů ovlivňují obsah doručený členům komunity a divákům a tím také ovlivňují zkušenost komunity s diskusí.

‘Předpokládá se, že lidský moderátor je členem komunity, který má demografickou homogenitu s ostatními členy komunity, zdá se možné, že mentální schéma, které používají k hodnocení obsahu, bude odpovídat schématům ostatních členů komunity.’

To dává nějakou nápovědu, proč výzkumníci ze Syracuse dospěli k takovému pesimistickému závěru ohledně budoucnosti označení nenávistné řeči; implikace je, že politiky a soudy o nesouhlasných názorech na základě úkolů nelze aplikovat náhodně podle „přijatelných“ principů, které nejsou zakotveny nikde (nebo nejsou redukovatelné na aplikovatelné schéma, i když existují).

Lidé, kteří činí rozhodnutí (pracovníci na základě úkolů), jsou zaujatí, a byli by k ničemu pro takové úkoly, pokud by nebyli zaujatí, protože úkol spočívá v poskytnutí hodnotového soudu; lidé, kteří rozhodují o sporech v výsledcích na základě úkolů, také činí hodnotové soudy při stanovení politik pro spory.

Mohou existovat stovky politik v jediném rámci pro detekci nenávistné řeči, a pokud není každá z nich zcela projednána u Nejvyššího soudu, odkud může pocházet „autoritativní“ konsenzus?

Výzkumníci ze Google navrhují, že ‘[nesouhlas mezi anotátory může zakotvit cenné nuance o úkolu’. Studie navrhuje použití metadat v datech, která odrážejí a kontextualizují spory.

Nicméně je obtížné vidět, jak by takový kontextově specifický vrstva dat mohla vést k podobným metrikám, přizpůsobit se požadavkům standardních testů, nebo podporovat jakékoli definitivní výsledky – kromě nereálného scénáře přijetí stejné skupiny výzkumníků napříč následnými pracemi.

Kurátorská Anotátorů

Všechno to předpokládá, že existuje alespoň rozpočet na výzkumném projektu pro více anotací, které by vedly k konsenzuálnímu hlasu. Ve mnoha případech se výzkumníci snaží „kurátovat“ outsourcovanou anotátorů levněji tak, že specifikují rysy, které by měli mít pracovníci, jako je geografická poloha, pohlaví nebo jiné kulturní faktory, obchodující pluralitu za specificitu.

Studie Google tvrdí, že cestou vpřed z těchto výzev by mohlo být stanovení prodloužených komunikačních rámců s anotátory, podobných minimálním komunikačním kanálům, které aplikace Uber umožňuje mezi řidičem a pasažérem.

Taková pečlivá úvaha o anotátorech by samozřejmě byla překážkou pro hyperscale outsourcing anotace, vedoucí buď k omezenějším a nízkovolumovým datovým sadám, které mají lepší zdůvodnění pro své výsledky, nebo k „spěšnému“ hodnocení anotátorů zapojených, získávání omezených informací o nich a charakterizaci jako „vhodné pro úkol“ na základě příliš málo informací.

To je, pokud anotátoři jsou upřímní.

‘Lidé, Kteří Se Chovají Lidově’ v Outsourcovaných Označováních Dat

S dostupnou pracovní silou, která je podplacena, pod těžkou konkurencí pro dostupné úkoly, a deprimována nedostatkem kariérních perspektiv, anotátoři jsou motivováni k rychlému poskytnutí „správné“ odpovědi a přechodu k dalšímu mini-úkolu.

Pokud je „správná“ odpověď něco složitějšího než Má kočku / Nemá kočku, studie Syracuse tvrdí, že pracovník se pravděpodobně pokusí odvodit „přijatelnou“ odpověď na základě obsahu a kontextu otázky*:

‘[O]becné konceptualizace a široké použití jednoduchých metod anotace jsou zřejmě bránící pokroku výzkumu o nenávistné řeči online. Například Ross a kol. zjistili, že zobrazení definice Twitteru nenávistné řeči anotátorům vedlo k částečnému sladění jejich vlastních názorů s definicí. Toto sladění vedlo k velmi nízké spolehlivosti anotací.’

 

* Můj převod inline citací ve studii na hypertextové odkazy.

Publikováno 13. prosince 2021 – Aktualizováno 18. prosince 2021: Přidány značky

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai