Взгляд Anderson

Являются ли недооцененные гипермасштабные наборы данных AI хуже, чем сам Интернет?

mm
Добавьте Unite.AI в избранные источники в Google

Исследователи из Ирландии, Великобритании и США предупредили, что рост гипермасштабных наборов данных для обучения AI угрожает распространить худшие аспекты их источников в Интернете, утверждая, что недавно выпущенный академический набор данных содержит ‘проблемные и явные изображения и текстовые пары изнасилования, порнографии, злых стереотипов, расистских и этнических оскорблений, и другой крайне проблематичной информации’.

Исследователи считают, что новая волна огромных недооцененных или неправильно отфильтрованных многомодальных (например, изображений и картинок) наборов данных аргументированно более вредна в своей способности укреплять эффекты такой негативной информации, поскольку наборы данных сохраняют изображения и другую информацию, которая могла быть удалена из онлайн-платформ через жалобы пользователей, местную модерацию или алгоритмы.

Они также отмечают, что может потребоваться годы – в случае с мощным набором данных ImageNet, целое десятилетие – для того, чтобы устранить давно существующие жалобы на содержание набора данных, и что эти поздние исправления не всегда отражаются даже в новых наборах данных, полученных из них.

Статья называется Многомодальные наборы данных: мисогиния, порнография и злые стереотипы и исходит от исследователей Университетского колледжа Дублина и Lero, Университета Эдинбурга, и главного ученого аутентификационной платформы UnifyID.

Хотя работа фокусируется на недавнем выпуске CLIP-фильтрованного набора данных LAION-400M, авторы утверждают против общей тенденции бросания все больших объемов данных на框ки машинного обучения, такие как нейронная языковая модель GPT-3, и утверждают, что результаты-ориентированная тенденция к лучшему выводу (и даже к искусственному общему интеллекту [AGI]), приводит к использованию вредных источников данных с пренебрежительной авторской правовой проверкой; потенциал вызвать и продвигать вред; и способность не только распространять незаконную информацию, которая могла бы иначе исчезнуть из публичной сферы, но и фактически включать моральные модели такой информации в реализацию AI.

LAION-400M

В прошлом месяце был выпущен набор данных LAION-400M, добавивший к растущему числу многомодальных лингвистических наборов данных, которые полагаются на репозиторий Common Crawl, который скрапит Интернет без разбора и передает ответственность за фильтрацию и курирование проектам, которые используют его. Производный набор данных содержит 400 миллионов пар текста и изображений.

LAION-400M – это открытая версия закрытого набора данных WIT (WebImageText) Google AI, выпущенного в марте 2021 года, и содержит пары текста и изображений, где изображение в базе данных было связано с сопровождающим явным или метаданным текстом (например, альтернативным текстом изображения в веб-галерее). Это позволяет пользователям выполнять текстовый поиск изображений, раскрывая ассоциации, которые лежат в основе AI о этих доменах (т. е. ‘животное’, ‘велосипед’, ‘человек’, ‘мужчина’, ‘женщина’).

Эта связь между изображением и текстом, и косинусная подобие, которая может внедрить предвзятость в результаты запросов, являются в центре призыва статьи к улучшению методов, поскольку очень простые запросы к базе данных LAION-400M могут раскрыть предвзятость.

Например, изображение пионерского астронавта Илин Коллинз в библиотеке scitkit-image возвращает две связанные подписи в LAION-400M: ‘Это портрет астронавта с американским флагом’ и ‘Это фотография улыбающейся домохозяйки в оранжевом комбинезоне с американским флагом’.

Американский астронавт Илин Коллинз получает два очень разных взгляда на свои достижения как первый человек в космосе под LAION-400M. Источник: https://arxiv.org/pdf/2110.01963.pdf

Американский астронавт Илин Коллинз получает два очень разных взгляда на свои достижения как первый человек в космосе под LAION-400M. Источник: https://arxiv.org/pdf/2110.01963.pdf

Отчетные косинусные подобия, которые делают любую подпись вероятной, очень близки друг к другу, и авторы утверждают, что такие близость сделает системы AI, которые используют LAION-400M, относительно вероятными для представления любой из них в качестве подходящей подписи.

Порнография вновь поднимается на вершину

LAION-400M сделал доступным поисковый интерфейс доступным, где снятие флажка “безопасный поиск” раскрывает масштаб, в котором порнографические изображения и текстовые ассоциации доминируют в метках и классах. Например, поиск по запросу ‘монахиня’ (NSFW, если вы последовательно отключите безопасный режим) в базе данных возвращает результаты, в основном связанные с ужасом, косплеем и костюмами, с очень немногими фактическими монахинями.

Отключение безопасного режима в том же поиске раскрывает множество порнографических изображений, связанных с термином, которые отталкивают любые непорнографические изображения вниз по странице результатов поиска, раскрывая масштаб, в котором LAION-400M присвоил больший вес порнографическим изображениям, поскольку они распространены для термина ‘монахиня’ в онлайн-источниках.

По умолчанию включение безопасного режима является обманчивым в онлайн-интерфейсе поиска, поскольку представляет собой особенность интерфейса, фильтр, который не только не обязательно будет активирован в полученных системах AI, но и был обобщен в домене ‘монахиня’ таким образом, который не так легко фильтруется или отличается от (относительно) SFW-результатов с точки зрения алгоритмического использования.

В статье представлены размытые примеры по различным поисковым запросам в дополнительных материалах в конце. Они не могут быть представлены здесь из-за языка в тексте, который сопровождает размытые фотографии, но исследователи отмечают нагрузку, которую оказало на них изучение и размытие изображений, и признают сложность курирования такого материала для человеческого надзора за крупномасштабными базами данных:

‘Мы (а также наши коллеги, которые помогали нам) испытали различные уровни дискомфорта, тошноты и головной боли во время процесса исследования набора данных. Кроме того, эта работа непропорционально встречает значительную негативную критику по всей академической сфере AI после выпуска, что не только добавляет эмоциональную нагрузку к уже тяжелой задаче изучения и анализа таких наборов данных, но и отговаривает подобную будущую работу, во многом к ущербу для области AI и общества в целом.’

Исследователи утверждают, что хотя человеческая курирование в цикле является дорогим и имеет связанные с этим личные затраты, автоматические системы фильтрации, предназначенные для удаления или решения такой информации, явно неадекватны для этой задачи, поскольку системы NLP испытывают трудности с изоляцией или дисконтированием оскорбительного материала, который может доминировать в скрапированном наборе данных, и впоследствии восприниматься как значимый из-за чистого объема.

Укрепление запрещенного контента и лишение авторских прав

Статья утверждает, что недооцененные наборы данных этого типа ‘высоко вероятно’ распространят эксплуатацию отдельных лиц из меньшинств и решат, имеют ли подобные открытые данные проекты право, юридически или морально, передать ответственность за материал на конечного пользователя:

‘Отдельные лица могут удалить свои данные с веб-сайта и предположить, что они исчезнут навсегда, в то время как они могут все еще существовать на серверах нескольких исследователей и организаций. Есть вопрос о том, кто несет ответственность за удаление этих данных из набора данных? Для LAION-400M создатели делегировали эту задачу пользователю набора данных. Учитывая, что такие процессы намеренно делаются сложными и что средний пользователь не обладает техническими знаниями для удаления своих данных, является ли это разумным подходом?’

Они также утверждают, что LAION-400M может не подходить для выпуска под его принятой лицензионной моделью Creative Common CC-BY 4.0, несмотря на потенциальные выгоды для демократизации крупномасштабных наборов данных, ранее эксклюзивной области хорошо финансируемых компаний, таких как Google и OpenAI.

Домен LAION-400M утверждает, что изображения в наборе данных 'находятся под их собственным авторским правом' - 'проходной' механизм, в значительной степени облегченный судебными решениями и правительственными рекомендациями recent лет, которые в целом одобряют веб-скрапинг для исследовательских целей. Источник: https://rom1504.github.io/clip-retrieval/

Домен LAION-400M утверждает, что изображения в наборе данных ‘находятся под их собственным авторским правом’ – ‘проходной’ механизм, в значительной степени облегченный судебными решениями и правительственными рекомендациями recent лет, которые в целом одобряют веб-скрапинг для исследовательских целей. Источник: https://rom1504.github.io/clip-retrieval/

Авторы предлагают, что волонтеры (т. е. добровольные волонтеры) могли бы решить некоторые проблемы набора данных, и что исследователи могли бы разработать улучшенные методы фильтрации.

‘Тем не менее, права субъекта данных остаются без внимания. Это безрассудно и опасно преуменьшать вред, присущий таким крупномасштабным наборам данных, и поощрять их использование в промышленных и коммерческих условиях. Ответственность схемы лицензирования, под которой предоставляется набор данных, лежит исключительно на создателе набора данных.’

Проблемы демократизации гипермасштабных данных

Статья утверждает, что визуально-лингвистические наборы данных, такие как LAION-400M, ранее были недоступны вне крупных технологических компаний и ограниченного числа исследовательских институтов, которые обладают ресурсами для сбора, курирования и обработки их. Они также приветствуют дух нового выпуска, критикуя его выполнение.

Авторы утверждают, что принятая дефиниция ‘демократизации’, применяемая к открытым гипермасштабным наборам данных, слишком ограничена и ‘не учитывает права, благополучие и интересы уязвимых лиц и сообществ, многие из которых, вероятно, пострадают хуже от последствий этого набора данных и моделей, обученных на нем’.

Поскольку разработка моделей GPT-3 масштаба открытым исходным кодом в конечном итоге предназначена для распространения среди миллионов (и, возможно, миллиардов) пользователей по всему миру, и поскольку исследовательские проекты могут принять наборы данных до их последующего редактирования или даже удаления, распространяя любые проблемы, которые были призваны решить в изменениях, авторы утверждают, что безрассудные выпуски недооцененных наборов данных не должны стать привычной особенностью в открытом машинном обучении.

Помещение джинна обратно в бутылку

Некоторые наборы данных, которые были подавлены давно после того, как их содержание прошло, возможно, необратимо, в долгосрочные проекты AI, включали набор данных Duke MTMC (Multi-Target, Multi-Camera), который в конечном итоге был отозван из-за повторяющихся опасений правозащитных организаций вокруг его использования репрессивными властями в Китае; Microsoft Celeb (MS-Celeb-1M), набор данных из 10 миллионов ‘знаменитых’ изображений лиц, который оказалось, что включал журналистов, активистов, политиков и писателей, чья экспозиция биометрических данных в выпуске была сильно раскритикована; и набор данных Tiny Images, отозванный в 2020 году за признанные ‘предвзятости, оскорбительные и предвзятые изображения, и уничижительные термины’.

Что касается наборов данных, которые были изменены, а не отозваны после критики, примеры включают чрезвычайно популярный набор данных ImageNet, который, как отмечают исследователи, взял десять лет (2009-2019), чтобы устранить повторяющуюся критику вокруг частной жизни и не-изображаемых классов.

Статья отмечает, что LAION-400M фактически отбрасывает назад даже эти медленные улучшения, ‘в значительной степени игнорируя’ вышеуказанные исправления в представлении ImageNet в новом выпуске, и обнаруживает более широкую тенденцию в этом отношении*:

‘Это подчеркивается в появлении более крупных наборов данных, таких как набор данных изображений Tencent ML (в феврале 2020 года), который включает большинство этих не-изображаемых классов, продолжающуюся доступность моделей, обученных на полном наборе данных ImageNet-21k, в репозиториях таких как TF-hub, продолжающееся использование нефильтрованного набора данных ImageNet-21k в последних моделях SotA (таких как последние модели EfficientNetV2 и CoAtNet) и явные объявления, разрешающие использование нефильтрованного набора данных ImageNet-21k для предварительной подготовки в авторитетных конкурсах таких как конкурс LVIS 2021.

‘Мы подчеркиваем это важное наблюдение: команда такого уровня, как ImageNet, управляющая менее чем 15 миллионами изображений, боролась и потерпела неудачу в этих попытках детоксикации до сих пор.

‘Масштаб тщательных усилий, необходимых для тщательной детоксикации этого огромного многомодального набора данных и моделей, обученных на этом наборе данных, охватывающих потенциально миллиарды пар изображений и подписей, будет, безусловно, астрономическим.’

 

* Мое преобразование встроенных цитат автора в гиперссылки.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai