Взгляд Anderson
Блестящие диаграммы могут сделать даже «плохие» исследования достоверными

Новые исследования показывают, что использование сложных и сложных диаграмм может заставить людей доверять предвзятым решениям ИИ, даже когда они явно несправедливы.
Хотя практика ‘заводить кого-то наукой’ существенно предшествует текущей эпохе ИИ, она, возможно, совершенствуется в эту эпоху – не в последнюю очередь потому, что недавний рост научных публикаций сделал соотношение сигнал-шум неблагоприятным, и ‘дешевые трюки’ можно считать более распространенными.
Верные старой пословице ‘ложь, проклятая ложь и статистика‘, центральным инструментом, используемым для обмана или введения в заблуждение читателей при представлении новых систем и научных данных, которые объясняют или оправдывают претензии вокруг них, являются графики и визуализация данных.
В 2019 году исследовании влияния графиков на участников в сельской Пенсильвании авторы работы наблюдали:
‘Люди, пострадавшие от злоупотреблений или зависимости, тяготели к графикам, представляющим эти вещества. Люди часто определяли качество графика, содержащего географическую информацию, на основе того, насколько легко или трудно было найти их штат.
‘Другие люди склонны ценить графики не на основе своего собственного понимания, а на основе воспринимаемой эффективности графика при общении с другими людьми.
‘Наконец, один участник даже предложил, что он будет обращать больше внимания на визуализации из местных источников новостей, чем из национальных.’

Некоторые из графиков, показанных жителям сельской Пенсильвании в исследовании 2019 года. Источник
Гипнотический эффект диаграмм данных становится особенно актуальным в новую эпоху машинного обучения, где уверенность имеет решающее значение для поддержания экономики ИИ (и, возможно, предотвращения краха).
Сотрудничество 2024 года между США и Великобританией ввело понятие Trust Junk: визуализация XAI, ‘которая не имеет осмысленной связи с основной моделью или данными [и] используется для повышения доверия’:

Из статьи ‘Trust Junk and Evil Knobs: Calibrating Trust in AI Visualization’, пример данных, искаженных для служения предыдущей цели (справа), вместо явного представления (слева). Этот подход ‘поощряет чрезмерную зависимость и ошеломляет пользователя, предоставляя иллюзию контроля’, согласно статье. Источник
Быстрое изучение
Поскольку концепция Trust Junk была предложена, она не была протестирована – упущение, устраненное новой статьей из США, в которой участникам были представлены результаты предполагаемого исследования ИИ, касающегося того, какой из группы кандидатов, скорее всего, сдаст экзамен на адвокатуру в США.
Если внимательно посмотреть, можно заметить, что критерии фильтрации были а) все черные мужчины и б) все остальные – с прогнозом, что все черные мужчины не сдадут экзамен:

Из новой статьи: аннотированный стимул, использованный в экспериментах авторов, показывающий решение модели (C) о том, сдаст ли кандидат (B) экзамен, вместе с объяснительными компонентами, функционирующими как ‘trust junk’ (A, D, E, F). Модель дискриминационна, но все же увеличивающееся количество в основном нерелевантной объяснительной информации приводит участников к согласию с ее выводами и оценивает ее как справедливую. Источник
Большинство участников согласились с прогнозами модели и оценили ее как справедливую и достоверную, с согласием, доверием и воспринимаемой справедливостью, все увеличивающимися с добавлением все большего количества нерелевантных графиков и деталей – даже тогда, когда меньше людей заметили очевидный и явный расистский предвзятость.
Некоторые пользователи возразили против исследования, но не по причинам, связанным с центральной проблемой:
‘Мы отметили 19 случаев, когда участники явно описали нашу модель как справедливую (например, [участник] сказал: “Она справедлива, потому что не имеет расового или гендерного предвзятости”). Однако участники иногда выражали беспокойство по поводу модели. [Один участник] сказал, что он обеспокоен “тем, какой вред люди могут использовать ее для”.’
Тем не менее, среди трех групп участников, каждая из которых была подвергнута все большему количеству Trust Junk, ни одна не определила истинную проблему.
Авторы заключили*:
‘Вкратце, мы обнаружили, что Trust Junk сработал: участники были либо “успокоены” нерелевантной информацией, либо “онемели” огромным количеством данных в объяснениях.
‘Все это манипулирование и убеждение произошло в контексте модели, которая была поверхностной и глубоко несправедливой, именно в том случае, когда мы надеялись, что XAI позволит неспециалистам принимать точные суждения.’
Поскольку мы все чаще советуемся проверять, что говорит нам ИИ (либо по подозрению в корыстных мотивах, либо из-за ошибочного вывода), мы можем быть склонны копать глубже, чем заголовки, и анализировать исходный материал исследовательских работ, квартальных отчетов компаний и различных других далеко не нейтральных форматов представления информации.
Но готовы ли мы обращать больше внимания на ‘успокаивающие’ графики, которые заверяют нас в точности – или хотя бы на то, чтобы не обращать внимания на ‘миазму достоверности’, которую может вызвать масса графиков?
Новая статья называется “Trust Junk” приводит к необоснованному доверию к высоко дискриминационным прогностическим моделям“, и исходит от трех исследователей из Университета Норtheastern в Бостоне, штат Массачусетс. Дополнительный сайт также был создан.
Метод
Авторы провели эксперимент с участниками, в котором тестируемым была представлена модель с различным количеством Trust Junk, чтобы проверить, может ли увеличение количества технически правильных, но нерелевантных деталей убедить пользователей, что предвзятая модель является справедливой и полезной.
Стимулы были основаны на предыдущей работе, в результате чего получились панели XAI, объединяющие несколько методов объяснения в один интерфейс.
Для вышеупомянутой высоко предвзятой модели исследователи разработали ‘мусорные’ объяснения для исследования, с объяснениями, намеренно тематизированными вокруг ‘обманчивых’ методов представления данных:
‘Мы предоставили чрезмерное количество информации для нашей бинарной классификационной задачи. Наше включение большого количества сложных, но в конечном итоге нерелевантных деталей было предназначено для того, чтобы ошеломить участников исследования, а не предоставить действительно полезные данные.
‘Этот метод [метафорически] онемляет пользователя, заставляя его принять свою собственную неспособность полностью понять данные […].’
Исследование опирается на ранее противоречия вокруг оценки ИИ в экзаменах Международного бакалавриата и Генерального сертификата образования на уровне А, используя набор данных Law School Admissions Bar Passage, который содержит демографические, академические и результативные данные для 20 000 кандидатов с 1991 по 1997 год.
Эти данные были использованы для создания намеренно предвзятой модели, прогнозирующей неудачу для черных мужских кандидатов, в то время как все остальные проходят – хотя модель все же достигает точности 93,7%, благодаря несбалансированности классов по расе и гендеру.
Также была протестирована стратегия ‘апелляции к власти’, с поверхностно впечатляющими сигналами, такими как престижная университетская аффилиация, размер набора данных и вводящая в заблуждение точность.
Кроме того, меры, которые бы раскрыли зависимость модели от расы и гендера, были опущены, и представлены только благоприятные результаты. Небольшой набор похожих кандидатов был затем представлен вместе с их реальными результатами экзамена, а не прогнозами модели – и это помогло скрыть постоянный шаблон неудач, назначаемый черным мужским кандидатам.
Чтобы еще больше сформировать, как участники интерпретируют систему, информация была представлена так, чтобы побудить их формировать простые, но вводящие в заблуждение объяснения того, как работает модель. Были показаны все доступные функции, создавая впечатление, что многие факторы влияют на решение, хотя только раса и гендер использовались. Циничный акцент на индивидуальных атрибутах также побуждал участников строить правдоподобные, но неправильные истории о том, почему кандидат был прогнозируем как прошедший или не прошедший.
‘Жертвы’
В группе тестирования каждое объяснение было назначено одному из трех уровней Trust Junk в трех условиях исследования: участники в Базовом условии видели только базовое происхождение, профиль кандидата и решение модели; те, кто находился в Модели условии, также видели статистику точности; и те, кто находился в Всём условии, видели также гистограммы функций и профили похожих кандидатов, выбранных из обучающих данных.
Исследование было одобрено комитетом по этике, и проведено на Prolific, с участниками, получавшими 15 долларов в час, и случайным назначением в условия.
Каждый участник рассмотрел восемь профилей кандидатов на экзамен на адвокатуру в случайном порядке и оценил, сдаст ли каждый кандидат, с согласием в качестве метрики доверия, за которым следовали вопросники для оценки доверия и окончательный образец из 28, 27 и 28 участников в Базовом, Модели и Всём условиях.
Авторы предположили, что добавление большего количества казалось бы богатой, но в конечном итоге вводящей в заблуждение или неполной информации может fairwash модель, создавая необоснованную уверенность в ее выводах. Они ожидали, что участники в Модели и Всём условиях покажут более высокое согласие и более сильные восприятия справедливости, достоверности и полезности, чем те, кто находился в Базовом условии. Они также проанализировали письменные объяснения участников, чтобы увидеть, как они осмысливали решения модели, сосредоточившись на том, заметили ли они предвзятость или пробелы в представленной информации.
Результаты тестирования
В отношении согласия с моделью человеческие участники тестирования определили правильный результат в 66,6% случаев, но согласились с моделью в 73,9% случаев – показывая тенденцию следовать решениям модели даже тогда, когда они были неправильными. Эта тенденция усилилась с добавлением большего количества объяснительных деталей, с наиболее подробным условием, повышающим согласие до 82,6%, и увеличивающим вероятность того, что участники неправильно будут следовать модели:
Суммарные баллы за согласие (слева), доверие (в центре) и удовлетворенность (справа); участники в условии ‘Всё’ сообщили о значительно более высоких баллах по всем показателям, несмотря на то, что модель оставалась идентичной и явно несправедливой.
Оценки доверия варьировались значительно в зависимости от условия, с участниками в Всём условии, сообщавшими о более высоком доверии (M = 25,3), чем те, кто находился в Базовом условии (M = 16,8), в то время как Модель условие (M = 20,1) не отличалось существенно от любого из них.
Удовлетворенность объяснением различалась существенно в зависимости от условия, с участниками в Всём условии, сообщавшими о более высокой удовлетворенности (M = 34,2), чем те, кто находился в других двух условиях (M = 26,4).
Участники оценивали справедливость с помощью четырех вопросов на семибалльной шкале, охватывающих гендерную предвзятость, общую предвзятость и этику, без значимых различий между условиями по этим показателям:

Распределение оценок участников по условиям для воспринимаемой справедливости по расе и гендеру, отсутствию предвзятости и общей этике. Более высокие уровни объяснительных деталей связаны с немного более высокими оценками справедливости и отсутствия предвзятости, несмотря на то, что основная модель остается неизменной и несправедливой.
Различие появилось для справедливости по расовому признаку, где группа Базового условия оценила модель как наименее справедливую (M = 3,9), в то время как обе группы Модели и Всего оценили ее выше (M = 4,8). Более того, самая большая доля участников, которые оценили явно несправедливую модель как справедливую, пришла из двух групп, которым было показано наибольшее количество объяснительных деталей – которые также были наименее склонны распознавать ее предвзятость.
Контроль качества
Качественные ответы показали, что участники, которым было предоставлено наименьшее количество информации, были более склонны заметить проблемы с моделью – особенно ее зависимость от расы и гендера. Они также были более склонны сказать, что важные детали отсутствуют.
Напротив, те, кто был показан более сложные объяснения, поднимали эти проблемы реже. Тем не менее, только три участника во всех условиях продемонстрировали даже частичное понимание ключевых факторов, определяющих решения модели; и никто не полностью определил, как она работает.

Графики, показывающие, как часто участники сообщали о возможной расовой или гендерной предвзятости и отсутствии объяснительной информации по условиям, с более высокими уровнями объяснительных деталей, связанными с меньшим количеством участников, заметивших предвзятость или сообщивших об отсутствии информации – даже хотя модель полагалась только на расу и гендер.
Многие участники явно описали модель как справедливую, с 19 такими ответами, записанными, несмотря на ее явную предвзятость.
В то же время некоторая обеспокоенность все же возникла, с несколькими участниками, выражающими беспокойство о том, как такая система может быть использована, и 15 ответами, ставящими под сомнение, может ли модель действительно захватить сложность отдельных кандидатов.
Авторы заявили:
‘Только меньшинство участников описало модель как несправедливую или предвзятую. Немногие участники, которые действительно сообщили о проблемах с моделью, были не в состоянии точно артикулировать, почему модель была ошибочной, и, в отсутствие важной информации о модели, прибегали к неформальному, часто неправильному рассуждению, чтобы объяснить, почему модель могла быть неправильной или несправедливой.’
Статья заключает*†:
‘Хотя некоторые из проблем, которые мы обнаружили, могут быть решены за счет повышения грамотности данных в аудитории, образование само по себе недостаточно (даже самопровозглашенные эксперты по ИИ привыкли неправильно интерпретировать или не понимать методы XAI).
‘Мы поддерживаем утверждение Hullman et al.: успех объяснений ИИ может быть справедливо оценен только при рассмотрении целей таких объяснений.
‘Мы призываем сообщество обратить внимание на риторические цели объяснений XAI и их манипулятивную силу как внутренне убедительных артефактов.’
Заключение
Поскольку становится ясно, что модели переднего края склонны ‘украшать’ заявления фальшивыми графиками, становится все более очевидным, что не только графики, сгенерированные ИИ, не должны полагаться на авторитет, но и общий ‘амбиентный’ эффект сопровождающих визуализаций – это то, что мы должны начать игнорировать – так же, как доверие к фотографии было подорвано появлением глубоких фейков.
Это, возможно, тревожное развитие, поскольку оно представляет собой еще одну ‘точку усталости’ в готовности общества тщательно оценивать то, что оно видит и слышит в СМИ, и рискует своего рода ‘терминальным согласием’ с дезинформацией.
* Моя замена внутренних цитат авторов на гиперссылки.
† Оригинальная форматировка авторов, а не моя.
Опубликовано в понедельник, 20 июля 2026 года












