Погляд Anderson
Чи гірші недооцінені гіпермасштабні набори даних AI, ніж сам Інтернет?

Дослідники з Ірландії, Великої Британії та США попередили, що зростання гіпермасштабних навчальних наборів даних AI загрожує поширювати найгірші аспекти їхніх джерел у Інтернеті, стверджуючи, що недавно випущений академічний набір даних містить ‘проблематичні та явні зображення і текстові пари зґвалтування, порнографією, шкідливими стереотипами, расовими та етнічними лайками, а також іншими вкрай проблематичними контентом’.
Дослідники вважають, що нова хвиля величезних недооцінених або неправильно відфільтрованих багатомодальних (наприклад, зображень і картинок) наборів даних є доволі шкідливими у своїй здатності посилювати вплив такого негативного контенту, оскільки набори даних зберігають зображення та інший контент, який може бути видалений з онлайн-платформ через скарги користувачів, місцеву модерацію або алгоритми.
Вони далі спостерігають, що може знадобитися роки – у випадку могутнього набору даних ImageNet, ціле десятиліття – для того, щоб довгострокові скарги щодо контенту набору даних були розглянуті, і що ці пізніші зміни не завжди відображаються навіть у нових наборах даних, отриманих з них.
Стаття стаття, озаглавлена Багатомодальні набори даних: мізогінія, порнографія та шкідливі стереотипи, походить від дослідників Університету Дубліна та Lero, Університету Едінбурга та головного наукового співробітника платформи аутентифікації UnifyID.
Хоча робота зосереджена на недавньому випуску набору даних CLIP-фільтра LAION-400M, автори аргументують проти загальної тенденції використання все більших обсягів даних у рамках машинного навчання, таких як нейронна мова модель GPT-3, і стверджують, що результати-орієнтована тенденція до кращого висновку (і навіть до штучного загального інтелекту [AGI]), призводить до використання шкідливих джерел даних з недбалим дотриманням авторських прав; потенціал спричинення та просування шкоди; і можливість не тільки поширювати незаконний контент, який міг би інакше зникнути з публічної сфери, але й фактично включати такі моральні моделі у подальші реалізації AI.
LAION-400M
Минулого місяця був випущений набір даних LAION-400M, який додався до зростаючої кількості багатомодальних лінгвістичних наборів даних, які покладаються на Common Crawl – репозиторій, який безрозбірно сканує Інтернет і передає відповідальність за фільтрацію та кураторство проектам, які використовують його. Похідний набір даних містить 400 мільйонів текстово-образових пар.
LAION-400M – це відкрита версія закритого набору даних WIT (WebImageText) від Google AI, випущеного у березні 2021 року, і містить текстово-образові пари, де зображення в базі даних було пов’язано з супроводжувальним явним або метаданими текстом (наприклад, альтернативний текст зображення у веб-галереї). Це дозволяє користувачам виконувати текстовий пошук зображень, розкриваючи асоціації, які сформував підлеглий AI щодо цих доменів (тобто ‘тварина’, ‘велосипед’, ‘особа’, ‘чоловік’, ‘жінка’).
Відношення між зображенням і текстом, а також косинусна схожість, яка може вбудовувати упередженість у результати запиту, становлять серце заклику статті до вдосконалення методологій, оскільки дуже прості запити до бази даних LAION-400M можуть розкрити упередженість.
Наприклад, зображення першої жінки-астронавта Ілін Коллінз у бібліотеці зображень scitkit-образів повертає дві асоційовані підписи у LAION-400M: ‘Це портрет астронавта з американським прапором’ і ‘Це фотографія посмішкої домогосподарки в оранжевому костюмі з американським прапором’.

Американський астронавт Ілін Коллінз отримує два дуже різні погляди на свої досягнення як перша жінка в космосі під LAION-400M. Джерело: https://arxiv.org/pdf/2110.01963.pdf
Згідно з повідомленням, косинусна схожість, яка робить будь-який підпис імовірним, дуже близька одна до одної, і автори стверджують, що така близькість зробить систему AI, яка використовує LAION-400M, відносно імовірною для представлення будь-якого з них як підходящого підпису.
Порнографія знову піднімається на вершину
LAION-400M створив пошуковий інтерфейс доступний, де відміна кнопки “безпечного пошуку” розкриває масштаби, у яких порнографічні зображення та текстові асоціації домінують у мітках і класах. Наприклад, пошук за словом ‘черниця’ (NSFW, якщо ви згодом вимкнете безпечний режим) у базі даних повертає результати в основному пов’язані з жахом, косплеєм та костюмами, з дуже少кими справжніми черницями.
Вимкнення Безпечного режиму при тому ж пошуку розкриває велику кількість порнографічних зображень, пов’язаних із цим терміном, які витісняють будь-які непорнографічні зображення вниз сторінки результатів пошуку, розкриваючи масштаби, у яких LAION-400M призначив більшу вагу порнографічним зображенням, оскільки вони поширені для терміна “черниця” в онлайн-джерелах.
За замовчуванням активація Безпечного режиму є оманливою в онлайн-інтерфейсі пошуку, оскільки це представляє собою UI-особливість, фільтр, який не тільки не обов’язково буде активований у похідних системах AI, але й був узагальнений у домені “черниця” таким чином, який не так легко фільтрується або відрізняється від (відносно) безпечних результатів з точки зору алгоритмічного використання.
Стаття містить розмиті приклади по різних пошуковим запитам у додаткових матеріалах в кінці. Їх не можна представити тут через мову, яка супроводжує розмиті фотографії, але дослідники відзначають вплив, який мали на них дослідження цих зображень, і визнають складність кураторської обробки такого матеріалу для людської перевірки великомасштабних баз даних:
‘Ми (а також наші колеги, які допомогли нам) відчували різні рівні дискомфорту, нудоти та головного болю під час процесу дослідження набору даних. Крім того, така робота непропорційно часто зустрічає значну негативну критику в академічній сфері AI після випуску, що не тільки додає додатковий емоційний тягар до вже важкої задачі вивчення та аналізу таких наборів даних, але й відштовхує подібну майбутню роботу, що суттєво шкодить галузі AI та суспільству в цілому.’
Дослідники стверджують, що хоча людська перевірка є дорогою і має пов’язані з нею особисті витрати, автоматичні системи фільтрації, призначені для видалення або іншого звернення до такого матеріалу, явно не достатні для виконання цієї задачі, оскільки системи обробки природної мови мають труднощі ізоляції або дисконтування образливого матеріалу, який може домінувати у наборі даних, і згодом сприйматися як суттєвий через чисту кількість.
Закріплення забороненого контенту та позбавлення захисту авторських прав
Стаття стверджує, що недооцінені набори даних цього типу є “високою ймовірністю” поширення експлуатації окремих осіб, і звертає увагу на питання про те, чи мають подібні відкриті проекти даних право, юридично чи морально, перекласти відповідальність за матеріал на кінцевого користувача:
‘Люди можуть видалити свої дані з веб-сайту та вважати, що вони зникли назавжди, тоді як вони можуть все ще існувати на серверах кількох дослідників та організацій. Є питання про те, хто відповідає за видалення цих даних з набору даних? Для LAION-400M творці делегували цю задачу користувачеві набору даних. Враховуючи, що такі процеси є складними і що середній користувач не володіє технічними знаннями для видалення своїх даних, чи є це прийнятним підходом?’
Вони далі стверджують, що LAION-400M може бути не підходящим для випуску під його прийнятою ліцензійною моделлю Creative Common CC-BY 4.0, незважаючи на потенційні вигоди для демократизації великомасштабних наборів даних, які раніше були виключною сферою діяльності великих компаній, таких як Google та OpenAI.

Домен LAION-400M стверджує, що зображення набору даних ‘знаходяться під їхньою власною авторською правами’ – ‘пас-трought’ механізм, який у значній мірі був можливий завдяки судовим рішенням та урядовим директивам останніх років, які загалом схвалюють веб-скрейпінг для дослідницьких цілей. Джерело: https://rom1504.github.io/clip-retrieval/
Автори пропонують, що волонтери могли б вирішити деякі проблем набору даних, і що дослідники могли б розробити покращені техніки фільтрації.
‘Все ж таки, права суб’єкта даних залишаються невирішеними. Це безрозсудно та небезпечно занижувати шкоду, закладену в таких великомасштабних наборах даних, і заохочувати їх використання в промислових та комерційних умовах. Відповідальність схеми ліцензії, під якою надається набір даних, лежить виключно на творці набору даних’.
Проблеми демократизації гіпермасштабних даних
Стаття стверджує, що візуально-лінгвістичні набори даних такого масштабу, як LAION-400M, раніше були недоступні поза великими технологічними компаніями та обмеженою кількістю дослідницьких інститутів, які мали ресурси для збору, кураторства та обробки їх. Вони далі вітають дух нового випуску, одночасно критикуючи його виконання.
Автори стверджують, що прийняте визначення “демократизації”, яке застосовується до відкритих гіпермасштабних наборів даних, є занадто обмеженим, і ‘не враховує права, добробут та інтереси вразливих осіб та спільнот, багато з яких, ймовірно, будуть страждати найгірше від наслідків цього набору даних та моделей, навчених на ньому’.
Оскільки розробка відкритих моделей масштабу GPT-3 в кінцевому підсумку призначена для розповсюдження мільйонам (і, можливо, мільярдам) користувачів у всьому світі, і оскільки дослідницькі проекти можуть прийняти набори даних до того, як вони будуть відредаговані або навіть видалені, поширюючи будь-які проблеми, які мали бути вирішені в модифікаціях, автори стверджують, що безтурботні випуски недооцінених наборів даних не повинні ставати звичайною особливістю відкритого машинного навчання.
Поміщення джина назад у лампові
Деякі набори даних, які були придушені давно після того, як їхній контент пройшов, можливо, нерозривно, у довгострокові проекти AI, включали набір даних Duke MTMC (Multi-Target, Multi-Camera), який був в кінцевому підсумку відкликаний через повторювані побоювання правозахисних організацій щодо його використання репресивними органами влади в Китаї; Microsoft Celeb (MS-Celeb-1M), набір даних з 10 мільйонів “знаменитих” зображень обличчя, який виявився містити журналістів, активістів, політиків та письменників, чия експозиція біометричних даних у випуску була сильно розкритикована; і набір даних Tiny Images, відкликаний у 2020 році через визнані “упередження, образливі та попереджувальні зображення, а також принизливі терміни”.
Відносно наборів даних, які були змінені, а не відкликані після критики, прикладами є дуже популярний набір даних ImageNet, який, як відзначають дослідники, взяв десять років (2009-2019), щоб звернутися до повторюваної критики щодо приватності та необразних класів.
Стаття спостерігає, що LAION-400M фактично повертає ці повільні поліпшення назад, “в основному ігноруючи” вищезгадані зміни у представленні ImageNet у новому випуску, і помічає ширшу тенденцію в цьому відношенні*:
‘Це підкреслюється у появі більших наборів даних, таких як набір даних зображень Tencent ML (у лютому 2020 року), який охоплює більшість цих необразних класів, продовжуючу доступність моделей, навчених на повному наборі даних ImageNet-21k, у репозиторіях таких як TF-hub, подальше використання нефільтрованого набору даних ImageNet-21k у останніх моделях SotA (таких як остання модель EfficientNetV2 та CoAtNet) і явні оголошення про дозвіл використання нефільтрованого набору даних ImageNet-21k для попередньої підготовки у репутаційних конкурсах таких як конкурс LVIS 2021.
‘Ми підкреслюємо це важливе спостереження: команда рівня ImageNet, яка керує менше ніж 15 мільйонами зображень, боролася та зазнала поразки в цих спробах детоксикації на сьогодні.
‘Масштаб ретельних зусиль, необхідних для彻ної детоксикації цього величезного багатомодального набору даних та моделей, навчених на цьому наборі даних, які охоплюють потенційно мільярди пар зображень та підписів, буде безсумнівно астрономічним.’
* Моє перетворення внутрішніх посилань автора на гіперпосилання.












