Взгляд Anderson
Адоб и Мета осуждают неправильное использование пользовательских исследований в исследованиях компьютерного зрения

Адоб и Мета, вместе с Университетом Вашингтона, опубликовали обширную критику того, что они считают растущим неправильным использованием и злоупотреблением пользовательскими исследованиями в исследованиях компьютерного зрения (CV).
Пользовательские исследования ранее обычно ограничивались местными жителями или студентами вокруг кампуса одного или нескольких участвующих академических учреждений, но с тех пор几乎 полностью перешли на онлайн-платформы краудсорсинга, такие как Amazon Mechanical Turk (AMT).
Среди широкого спектра жалоб новая статья утверждает, что проекты исследований подвергаются давлению со стороны рецензентов, чтобы производить исследования; часто формулируют исследования плохо; часто заказывают исследования, где логика проекта не поддерживает этот подход; и часто «обманывают» циничными краудворкерами, которые «угадывают» желаемые ответы вместо того, чтобы действительно думать о проблеме.
Пятнадцатистраничная работа (называемая К лучшим пользовательским исследованиям в компьютерной графике и зрении) составляет центральную часть новой статьи и выдвигает многие другие критические замечания в отношении того, как краудсорсинговые пользовательские исследования могут фактически препятствовать развитию подотраслей компьютерного зрения, таких как распознавание изображений и синтез изображений.
Хотя статья затрагивает гораздо более широкий спектр вопросов, связанных с пользовательскими исследованиями, ее наиболее сильные критические замечания направлены на то, как оценка вывода в пользовательских исследованиях (т. е. когда краудсорсинговые люди получают оплату за вынесение ценностных суждений о, например, выводе новых алгоритмов синтеза изображений) может негативно влиять на всю отрасль.
Давайте рассмотрим некоторые из центральных моментов.
Сенсационные интерпретации
Среди множества предложений статьи для тех, кто публикуется в секторе компьютерного зрения, есть предупреждение «интерпретировать результаты осторожно». Статья цитирует один пример из 2021 года, когда новая исследовательская работа с утверждением, что «люди не могут точно определить искусство, сгенерированное ИИ», была широко интерпретирована в популярной прессе.

Одна из наиболее заметных медиа-отчетов о статье 2021 года «Роль знаний об атрибуции ИИ в оценке произведений искусства», Харша Гангадхарбатла, цитируется в качестве примера в новой статье. Здесь источник The Daily Mail – The Times (платный доступ) Источники: Daily Mail (архивная ссылка) / https://www.gwern.net/docs/ai/nn/gan/2021-gangadharbatla.pdf
Авторы утверждают*:
«[В] одном исследовании в психологическом журнале были собраны изображения традиционных произведений искусства и изображения, созданные технологиями ИИ, и краудворкерам было предложено различать, какие изображения принадлежат к каким источникам. Из результатов было сделано вывод, что “люди не могут точно определить искусство, сгенерированное ИИ”, очень широкий вывод, который не следует напрямую из экспериментов.
«Более того, статья не сообщает подробностей о том, какие конкретные наборы изображений были собраны или использованы, что делает утверждения трудными, если не невозможными, для проверки и воспроизведения.
«Более тревожно, что популярная пресса сообщила об этих результатах с вводящими в заблуждение утверждениями, что ИИ может независимо создавать искусство так же хорошо, как и люди».
Обращение с краудворкерами, которые обманывают
Краудсорсинговые работники обычно не получают много оплаты за свои усилия. Поскольку их перспективы минимальны, и их лучший потенциал заработка заключается в выполнении большого количества задач, многие из них, как предполагает исследование, склонны использовать любую «обходной путь», который ускорит текущую задачу, чтобы они могли перейти к следующей незначительной «гигу».
Статья отмечает, что краудсорсинговые работники, как и системы машинного обучения, будут учиться повторяющимся закономерностям в пользовательских исследованиях, которые формулируют исследователи, и просто будут выводить «правильный» или «желаемый» ответ, вместо того, чтобы давать真正ую органическую реакцию на материал.
Для этого статья рекомендует проводить проверки краудворкеров, также известные как «валидационные испытания» или «сентинели» – по сути, фальшивые разделы теста, предназначенные для проверки того, обращает ли работник внимание, случайно кликает или просто следует закономерности, которую он сам вывел из тестов, вместо того, чтобы думать о своих выборах.
Авторы утверждают:
«Например, в случае пары стилизированных изображений одно изображение пары может быть намеренно и объективно плохим результатом. Во время анализа данные от участников, которые не прошли определенное количество проверок, могут быть отброшены, предполагая, что они были невнимательными или непоследовательными.
«Эти проверки должны быть вставлены случайным образом в исследование и должны выглядеть так же, как и другие испытания; в противном случае участники могут выяснить, какие испытания являются проверками».
Обращение с исследователями, которые обманывают
Исследователи могут быть соучастниками этого рода «игры», даже если они не намерены; есть много способов, которыми они, возможно, даже непреднамеренно, могут «сигнализировать» свои желаемые выборы краудворкерам.
Например, статья отмечает, что исследователи могут выбирать краудворкеров с профилями, которые могут быть благоприятными для получения «идеальных» ответов в исследовании, номинально доказывая гипотезу, которая могла бы потерпеть неудачу на менее «выборочном» и более произвольной группе.
Фразеология также является ключевой проблемой:
«Формулировка должна отражать высокоуровневые цели, например, “какое изображение содержит меньше артефактов?” вместо “какое изображение содержит меньше цветовых дефектов в области лица?” Напротив, неясная формулировка задачи оставляет слишком много места для интерпретации, например, “какое изображение лучше?” может быть понято как “какое более эстетически приятно?” где цель могла бы быть оценить “какое более реалистично?”»
Другой способ «благосклонно повлиять» на участников – это дать им знать, открыто или косвенно, какой из возможных вариантов перед ними является методом автора, а не предыдущим методом или случайной выборкой.
Статья гласит*:
«[Участники] могут отвечать теми ответами, которые, по их мнению, хотят исследователи, сознательно или нет, что известно как “эффект хорошего субъекта”. Не помечайте выводы именами, такими как “наш метод” или “существующий метод”. Участники могут быть предвзятыми динамикой власти (т. е. исследователем, проводящим исследование), исследователями, использующими язык для запуска участников (например, “как вам нравится этот инструмент, который я построил вчера?”), и отношениями между исследователями и участниками (например, если они оба работают в одной и той же лаборатории или компании)».
Форматирование задачи в пользовательском исследовании также может повлиять на нейтральность исследования. Авторы отмечают, что если в бок о бок представлении базовый вариант постоянно находится слева (т. е. «изображение А»), а вывод нового алгоритма справа, участники исследования могли бы сделать вывод, что Б – «лучший» выбор, основанный на их растущем предположении о желаемом результате исследователей.
«Другие аспекты представления, такие как размер изображений на экране, их расстояние друг от друга и т. д., могут влиять на ответы участников. Пилотирование исследования с несколькими разными настройками может помочь выявить эти потенциальные помехи на ранней стадии».
Неправильные люди для неправильного продукта
Авторы статьи отмечают в нескольких местах, что краудсорсинговые работники являются более «универсальным» ресурсом, чем можно было бы ожидать в предыдущие десятилетия, когда исследователи были вынуждены просить о помощи местных жителей, часто студентов, которые дополняли свой доход участием в исследованиях.
Требование активного участия оставляет нанятому краудворкеру мало места, чтобы быть «не впечатленным» продуктом, который он тестирует, и авторы статьи рекомендуют исследователям определить своих целевых пользователей до разработки и тестирования потенциального продукта или услуги – иначе они рискуют создать что-то очень трудное в создании, но что никто на самом деле не хочет.
«Действительно, мы часто видели, как исследователи компьютерной графики или зрения пытаются получить свою исследовательскую работу, принятую промышленными практиками, только чтобы обнаружить, что исследования не удовлетворяют потребностям целевых пользователей. Исследователи, которые не выполняют поиск потребностей на начальном этапе, могут быть удивлены, обнаружив, что у пользователей нет необходимости или интереса к инструменту, над которым они работали месяцами или годами.
«Такие инструменты могут работать плохо в оценочных исследованиях, поскольку пользователи могут обнаружить, что технология производит бесполезные, нерелевантные или неожиданные результаты».
Статья进一步 отмечает, что пользователи, которые фактически, вероятно, будут использовать продукт, должны быть выбраны для исследований, даже если они не легко найти (или, предположительно, довольно дешевы).
Вместо того, чтобы возвращаться к набору персонала на кампусе (что было бы, возможно, несколько отступным шагом), авторы предлагают исследователям «набирать пользователей в дикой природе», взаимодействуя с соответствующими сообществами.
«Например, может быть активная онлайн- доска объявлений или социальное сообщество, которое можно использовать. Даже встреча с одним членом сообщества может привести к снежному образцу, когда соответствующие пользователи предлагают связи с подобными людьми в их сети».
Сбор отзывов
Статья также рекомендует собирать качественную обратную связь от тех, кто участвовал в пользовательских исследованиях, не в последнюю очередь потому, что это может потенциально выявить ложные предположения со стороны исследователей.
«Эти могут помочь отладить исследование, но они также могут выявить неожиданные аспекты вывода, которые повлияли на рейтинги пользователей. Был ли участник “очень недоволен” выводом, потому что он был нереалистичен, не эстетически приятен, предвзят или по какой-то другой причине?
«Без качественной информации исследователь может работать над усовершенствованием алгоритма, чтобы сделать его более реалистичным, вместо того, чтобы решать основную проблему пользователя».
Как и многие рекомендации на протяжении всей статьи, это конкретное предложение предполагает дальнейшие расходы времени и денег со стороны исследователей, в культуре, которая, по мнению работы, по умолчанию прибегает к быстрым и практически обязательным краудсорсинговым пользовательским исследованиям, которые обычно довольно дешевы и соответствуют исследовательской культуре, которую статья критикует на протяжении всей работы.
Переизученность
Статья предполагает, что пользовательские исследования становятся своего рода «минимальным требованием» в до-печатной компьютерной зрительной общине, даже в случаях, когда исследование не может быть разумно сформулировано (например, с идеей, настолько новой или маргинальной, что нет «podobного» анализа, который можно было бы провести, и который может не поддаваться никакой разумной метрике, которая могла бы дать значимые результаты в пользовательском исследовании).
В качестве примера «издевательства над исследованиями» (не фраза авторов) исследователи цитируют случай статьи ICLR 2022, для которой рецензии доступны онлайн (архивный снимок, сделанный 24 июня 2022 года; ссылка взята напрямую из новой статьи)†:
«Два рецензента дали очень низкие оценки из-за отсутствия пользовательских исследований. Статья была в конечном итоге принята, сопровождаемая резюме, критикующим рецензентов за использование “пользовательских исследований” как оправдания для плохой рецензии, и обвиняющим их в создании барьеров. Полное обсуждение стоит прочитать.
«Окончательное решение отметило, что представление описывало программную библиотеку, которая была развернута в течение лет, с тысячами пользователей (информация, которая не была раскрыта рецензентам для анонимного обзора). Будет ли статья, описывающая высокоэффективную систему, отклонена, если комитет не имел этой информации?
«И, если бы авторы прошли через дополнительные усилия по созданию и проведению пользовательского исследования, было бы оно осмысленным, и было бы достаточно, чтобы убедить рецензентов?»
Авторы утверждают, что они видели рецензентов и редакторов, которые налагают «тяжелые требования к оценке» на представленные статьи, несмотря на то, что такие оценки действительно имели бы смысл или ценность.
«Мы также наблюдали, как авторы и рецензенты используют оценки MTurk как опору, чтобы избежать принятия трудных решений. Комментарии рецензентов, такие как “я не могу сказать, какие изображения лучше, может быть, пользовательское исследование поможет”, потенциально вредны, побуждая авторов выполнять дополнительную работу, которая не улучшит посредственную статью».
Авторы заканчивают статью центральным «призывом к действию» для компьютерного зрения и компьютерной графики сообществ, чтобы более полно рассмотреть свои запросы на пользовательские исследования, вместо того, чтобы позволить исследовательской культуре развиваться как рутинному варианту, несмотря на «крайние случаи», где некоторые из наиболее интересных работ могут не вписываться в некоторые из наиболее прибыльных или плодотворных исследовательских и представительских каналов.
Авторы заключают:
«[Если] основная цель проведения пользовательских исследований заключается в том, чтобы удовлетворить рецензентов, а не генерировать новые знания, полезность и действительность таких пользовательских исследований должны быть поставлены под вопрос со стороны авторов и рецензентов. Наказание работы, которая не содержит пользовательской оценки, имеет непредвиденное последствие – стимулирование поспешно выполненных, плохо выполненных пользовательских исследований.
«Максима, которую следует помнить, заключается в том, что “плохие пользовательские исследования приводят к плохим результатам”, и такие исследования будут продолжаться, если рецензенты продолжат их запрашивать».
* Мое преобразование внутренних цитат статьи в соответствующие гиперссылки
† Мое выделение, а не авторов.
Опубликовано впервые 24 июня 2022 года.












