Взгляд Anderson
Кар텔 влиятельных наборов данных доминирует в исследованиях машинного обучения, говорит новое исследование

Новая работа исследователей из Калифорнийского университета и Google Research показала, что небольшое количество «эталонных» наборов данных машинного обучения, в основном из влиятельных западных учреждений и часто из государственных организаций, все больше доминируют в секторе исследований ИИ.
Исследователи приходят к выводу, что эта тенденция «по умолчанию» использовать популярные открытые наборы данных, такие как ImageNet, вызывает ряд практических, этических и даже политических проблем.
Среди их выводов – на основе основных данных из проекта Papers With Code (PWC) – авторы утверждают, что «широко используемые наборы данных вводятся только горсткой элитных учреждений», и что эта «консолидация» увеличилась до 80% в последние годы.
‘[Мы] обнаружили, что существует растущее неравенство в использовании наборов данных во всем мире, и что более 50% всех использований наборов данных в нашей выборке из 43 140 соответствуют наборам данных, введенным двенадцатью элитными, в основном западными, учреждениями.’

Карта использования наборов данных, не специфичных для задачи, за последние десять лет. Критерии включения – учреждения или компании, которые составляют более 50% известных использований. Справа показан коэффициент Джини для концентрации наборов данных во времени для учреждений и наборов данных. Источник: https://arxiv.org/pdf/2112.01716.pdf
Доминирующими учреждениями являются Стэнфордский университет, Microsoft, Принстон, Facebook, Google, Институт Макса Планка и AT&T. Четыре из десяти лучших источников наборов данных – корпоративные учреждения.
В работе также характеризуется растущее использование этих элитных наборов данных как ‘средство неравенства в науке’. Это связано с тем, что исследовательские команды, стремящиеся к общественному признанию, более мотивированы добиться результатов, соответствующих состоянию искусства (SOTA), на постоянном наборе данных, чем генерировать оригинальные наборы данных, которые не имеют такого же статуса и которые потребуют от коллег адаптироваться к новым метрикам вместо стандартных индексов.
В любом случае, как признает работа, создание своего собственного набора данных – это запретительно дорогой подход для менее обеспеченных учреждений и команд.
‘Прима фацие научная обоснованность, предоставляемая SOTA-оценкой, обычно связана с социальной достоверностью, которую исследователи получают, показывая, что они могут конкурировать на широко признанном наборе данных, даже если более контекстно-специфичная оценка может быть технически более подходящей.
‘Мы полагаем, что эти динамики создают «эффект Матфея» (т.е. «богатые становятся богаче, а бедные – беднее»), где успешные оценки и элитные учреждения, которые их вводят, получают непропорционально большое значение в области.
Работа названа Сокращенные, повторно используемые и переработанные: жизнь набора данных в исследованиях машинного обучения и исходит от Бернарда Коха и Джейкоба Г. Фостера из UCLA, и Эмили Дентон и Алекса Ханны из Google Research.
Работа поднимает ряд вопросов с растущей тенденцией к консолидации, которую она документирует, и была встречена с общим одобрением на Open Review. Один из рецензентов из NeurIPS 2021 отметил, что работа ‘крайне актуальна для всех, кто участвует в исследованиях машинного обучения.’ и предвидит ее включение в качестве обязательного чтения в университетских курсах.
От необходимости к коррупции
Авторы отмечают, что текущая культура «победить эталон» возникла как средство для устранения отсутствия объективных инструментов оценки, которые привели к краху интереса и инвестиций в ИИ во второй раз более тридцати лет назад, после спада делового энтузиазма к новым исследованиям в «Экспертных системах»:
‘Эталонные оценки обычно формализуют определенную задачу через набор данных и связанную с ним количественную метрику оценки. Эта практика была первоначально введена в исследования машинного обучения после «зимы ИИ» 1980-х годов государственными финансистами, которые стремились более точно оценить стоимость, полученную на грантах.’
Работа утверждает, что первоначальные преимущества этой неформальной культуры стандартизации (снижение барьеров для участия, последовательные метрики и более гибкие возможности разработки) начинают перевешиваться недостатками, которые естественно возникают, когда набор данных становится достаточно мощным, чтобы эффективно определять свои «условия использования» и сферу влияния.
Авторы предлагают, в соответствии с недавними промышленными и академическими мыслями на этот счет, что исследовательское сообщество больше не ставит новые проблемы, если они не могут быть решены с помощью существующих эталонных наборов данных.
Они также отмечают, что слепое следование этому небольшому количеству «золотых» наборов данных побуждает исследователей добиться результатов, которые переобучены (т.е. которые специфичны для набора данных и вряд ли будут работать так же хорошо на реальных данных, новых академических или оригинальных наборах данных или даже, возможно, на разных наборах данных в «золотом стандарте»).
‘Учитывая наблюдаемую высокую концентрацию исследований на небольшом количестве эталонных наборов данных, мы считаем, что диверсификация форм оценки особенно важна для избежания переобучения на существующих наборах данных и неправильного представления прогресса в области.’
Влияние правительства на исследования компьютерного зрения
Согласно работе, исследования компьютерного зрения заметно более подвержены синдрому, который они описывают, чем другие секторы, и авторы отмечают, что исследования обработки естественного языка (NLP) менее подвержены этому.
Авторы считают, что это может быть связано с тем, что сообщества NLP «более сплоченные» и крупнее по размеру, и что наборы данных NLP более доступны и легче курируются, а также меньше и менее ресурсоемкие в плане сбора данных.
В компьютерном зрении, и особенно в отношении наборов данных для распознавания лиц (FR), авторы утверждают, что корпоративные, государственные и частные интересы часто сталкиваются:
‘Корпоративные и государственные учреждения имеют цели, которые могут конфликтовать с конфиденциальностью (например, наблюдением), и их взвешивание этих приоритетов, вероятно, будет отличаться от приоритетов, которые имеют академики или более широкие заинтересованные стороны ИИ.’
Для задач распознавания лиц исследователи обнаружили, что количество чисто академических наборов данных резко снижается по сравнению со средним:
‘[Четыре] из восьми наборов данных (33,69% всех использований) были исключительно профинансированы корпорациями, вооруженными силами США или китайским правительством (MS-Celeb-1M, CASIA-Webface, IJB-A, VggFace2). MS-Celeb-1M в конечном итоге был отозван из-за противоречий, связанных со значением конфиденциальности для различных заинтересованных сторон.’
На приведенной выше схеме, как отмечают авторы, мы также видим, что относительно недавняя область генерации изображений (или синтеза изображений) сильно зависит от существующих, более старых наборов данных, которые не были предназначены для этого использования.
Фактически, работа отмечает растущую тенденцию к «миграции» наборов данных от их предполагаемого назначения, что вызывает вопросы о их пригодности для новых или периферийных исследовательских секторов, и о том, насколько ограничения бюджета могут «генерализировать» масштаб исследовательских амбиций в более узкую рамку, предоставляемую как доступными материалами, так и культурой, настолько увлеченной годовыми оценками, что новые наборы данных испытывают трудности с получением признания.
‘Наши выводы также показывают, что наборы данных регулярно передаются между различными сообществами задач. В наиболее крайнем случае большинство эталонных наборов данных, находящихся в обращении для некоторых сообществ задач, были созданы для других задач.’
Что касается известных деятелей в области машинного обучения (включая Эндрю Нга), которые все чаще призывают к большему разнообразию и курированию наборов данных в последние годы, авторы поддерживают это мнение, но считают, что такие усилия, даже если они будут успешными, потенциально могут быть подорваны текущей культурой, зависящей от результатов SOTA и установленных наборов данных:
‘Наши исследования показывают, что просто призывать исследователей машинного обучения разработать больше наборов данных и изменить структуры стимулов, чтобы разработка наборов данных была оценена и вознаграждена, может быть недостаточно для диверсификации использования наборов данных и перспектив, которые в конечном итоге формируют и определяют программы исследований машинного обучения.
‘В дополнение к стимулированию разработки наборов данных мы выступаем за ориентированные на равенство политики, которые отдают приоритет значительному финансированию для людей в менее обеспеченных учреждениях для создания высококачественных наборов данных. Это диверсифицирует – с социальной и культурной точки зрения – эталонные наборы данных, используемые для оценки современных методов машинного обучения.’
6 декабря 2021 года, 16:49 по Гринвичу +2 – Исправлена притяжательная форма в заголовке. – MA













