Anderson 视角
闪闪发光的图表可以使甚至“邪恶”的研究看起来值得信赖

新的研究发现,堆积复杂的图表可以使人们相信有偏见的AI决策,即使这些决策明显不公平。
尽管“用科学迷惑某人”的做法在当前AI时代之前已经存在,但它在这个时代被认为是完善的——不仅因为最近科学论文提交的增长使信号与噪音的比例变得不利,而且“廉价的技巧”变得更加普遍。
忠实于旧谚语“谎言,骗人的统计数据和统计学”,欺骗或误导读者的中心工具是图表和数据可视化,当呈现新的系统和科学证据时,用于解释或证明这些说法的数据可视化是关键。
2019年的一项研究中,研究人员观察到:
“受虐待或成瘾的人倾向于图表中代表这些物质的图表。人们经常根据找到自己家乡的容易程度来判断包含地理信息的图表的质量。其他人倾向于根据图表的感知有效性来判断其与其他人交流的能力。”
“最后,一位参与者甚至建议,他们会更关注来自本地新闻来源的可视化,而不是国家来源。”
一些在2019年研究中向宾夕法尼亚州农村居民展示的图表。 来源
数据图表的催眠效果在新的机器学习时代变得尤为重要,因为信心对于维持AI经济(以及可能避免崩溃)至关重要。
2024年美国/英国合作“Trust Junk和Evil Knobs:Calibrating Trust in AI Visualization”引入了“Trust Junk”的概念:一种XAI可视化,“没有与底层模型或数据的有意义的联系,并被用来增强信任”。
来自论文“Trust Junk和Evil Knobs:Calibrating Trust in AI Visualization”的数据被扭曲以服务于先前的目的(右),而不是被明确显示(左)。这种方法“鼓励过度依赖并提供控制的幻觉”,根据论文的说法。 来源
快速研究
自从“Trust Junk”的概念被提出以来,它尚未被测试——这一缺陷由一篇新的论文解决,该论文的参与者被呈现了一个所谓的AI研究的结果,关于哪个候选人可能会通过美国的法学院入学考试。
如果仔细观察,可以注意到筛选标准是a)所有黑人男性和b)其他所有人——预测所有黑人男性都会失败考试:
来自新论文的作者实验中使用的注释刺激,显示了模型关于候选人是否通过法学院入学考试的决策(C),以及作为“trust junk”的解释性组件(A、D、E、F)。模型是歧视性的,但增加了大量不相关的解释性信息,导致参与者更同意其输出并判断其为公平。 来源
大多数参与者同意模型的预测,并将其评为“公平”和“值得信赖”,随着更多不相关的图表和细节被添加,协议、信任和感知公平性都增加了——即使很少有人注意到明显的种族偏见。
一些用户对研究提出异议,但不是出于明显的中心问题:
“我们注意到19个实例,参与者明确将我们的模型描述为公平(例如,[一位参与者]说,‘这是公平的,因为它没有种族或性别偏见。’)。然而,参与者偶尔会对模型表示不适。[一位参与者]说,他们担心‘人们可能会将其用于什么样的黑暗用途。’
尽管如此,在参与者中的三个研究小组中,每个小组都接受了逐渐增加的“trust junk”数量,没有一个小组识别出真正的问题。
作者得出结论*:
“简而言之,我们发现‘trust junk’起作用了:参与者要么被不相关的信息‘安抚’,要么被大量数据‘麻痹’。这一切操纵和说服都发生在一个模型的背景下,该模型是肤浅的和深深不公平的,正是我们希望XAI能够使非专业受众做出准确判断的地方。”
由于我们被建议检查AI告诉我们的内容(无论是出于自私的动机还是由于错误的输出),我们可能会倾向于更深入地研究研究论文、公司季度报告和其他远非中立的信息传递格式。
但我们是否准备好更密切地关注那些让我们放心的“安慰”图表,或者至少要减少图表可能产生的“真实感”的雾霾?
这篇题为“Trust Junk导致对高度歧视性预测模型的不当支持”的新论文来自波士顿马萨诸塞州东北大学的三位研究人员。一个补充网站也已提供。
方法
作者进行了一项关于XAI解释中的“trust junk”的众包实验(即不同参与者被分配到不同的条件),测试增加技术上正确但不相关的细节是否能说服用户相信一个有偏见的模型是公平和有用的。
刺激材料基于先前的工作,所得的XAI仪表板将多个解释技术组合成一个界面。
对于上述高度“有偏见”的模型,研究人员开发了“垃圾”解释,解释故意围绕“误导性”的数据呈现技术:
“我们为我们的二元分类任务提供了过多的信息。我们包含大量复杂但最终不相关的细节,旨在让用户研究参与者感到不知所措,而不是提供真正有用的数据。”
“这种技术[比喻性地]使用户对自己的理解能力感到麻木……”
该研究借鉴了围绕AI评分的早期争议,使用了法律学校入学考试通过率数据集,该数据集包含1991年至1997年20,000名候选人的人口统计、学术和结果数据。
该数据用于构建一个故意有偏见的模型,预测黑人男性候选人将失败,而其他所有人都将通过——尽管该模型仍然实现了93.7%的准确率,这是由于种族和性别的类别不平衡所致。
还测试了一种“诉诸权威”的策略,使用了表面上令人印象深刻的提示,例如著名大学的隶属关系、数据集大小和误导性的准确性。
此外,为了掩盖模型对种族和性别的依赖,省略了可能揭示其依赖的措施,并且只呈现有利的结果。然后,呈现了一组类似的候选人及其实际考试结果,而不是模型的预测——这有助于掩盖对黑人男性候选人一贯预测失败的模式。
为了进一步塑造参与者对系统的解释,信息以一种鼓励他们形成简单但误导性的模型工作方式解释的方式呈现。有关所有可用功能的详细信息都被显示,从而营造出许多因素影响决策的印象,即使实际上只有种族和性别被使用。对个人属性的愤世嫉俗的强调也鼓励参与者构建合理但不正确的故事,解释为什么候选人被预测为通过或失败。
受害者
在测试组中,每个解释被分配到三个“trust junk”级别中的一个,跨三个研究条件:基线条件下的参与者只看到了基本的来源、候选人简介和模型的决策;模型条件下的参与者还看到了准确性统计数据;而一切条件下的参与者还看到了特征直方图和训练数据中类似候选人的简介。
该研究获得了机构审查委员会的批准,并在Prolific上进行,参与者每小时获得15美元的报酬,并随机分配到条件中。
每位参与者以随机顺序审查了八位法学院入学考试候选人的简介,并判断每位候选人是否通过,使用协议作为依赖度量,然后是问卷来评估信任度,最后有28、27和28位参与者分别属于基线、模型和一切条件。
作者假设添加更多看似丰富但最终令人困惑或不完整的信息可以通过制造对其输出的不当信心来“漂白”模型。他们预计模型和一切条件下的参与者将表现出更高的协议和更强的公平性、可信度和有用性的感知,而基线条件下的参与者则不会。他们还分析了参与者的书面解释,以了解他们如何理解模型的决策,关注他们是否注意到其偏见或提供的信息中的差距。
测试结果
在模型协议方面,人类研究参与者正确识别结果的66.6%,但同意模型的73.9%——表明他们倾向于遵循模型的决策,即使这些决策是错误的。这种效果随着更多解释性细节的添加而增强,在最详细的条件下,协议提高到82.6%,并增加了参与者错误地遵循模型的可能性:
协议(左)、信任(中)和满意度(右)的聚合得分;在“一切”条件下,参与者接触到不相关的解释性内容,报告了所有措施的显著更高的得分,尽管模型保持不变且明显不公平。
信任评级在条件之间有显著差异,一切条件下的参与者报告了更高的信任度(M = 25.3),而基线条件下的参与者报告了较低的信任度(M = 16.8),模型条件(M = 20.1)与其他两个条件没有显著差异。
对解释的满意度在条件之间有显著差异,一切条件下的参与者报告了更高的满意度(M = 34.2),而其他两个条件(M = 26.4)没有显著差异。
参与者使用七点量表上的四个问题来评估公平性,涵盖性别偏见、整体偏见和伦理问题,在这些措施上,条件之间没有显著差异:

参与者对公平性、偏见和伦理的评分分布。更高级别的解释性细节与公平性和无偏见评分略高相关,尽管底层模型保持不变且不公平。
在种族公平方面,基线组将模型评为最不公平(M = 3.9),而模型和一切组将其评为更高(M = 4.8)。更令人担忧的是,明显不公平的模型被评为公平的参与者中,最大份额来自展示了最多解释性细节的两个组——这些组也最不可能识别出其偏见。
质量控制
定性响应显示,提供的信息最少的参与者更有可能注意到模型的问题——特别是其对种族和性别的依赖。他们也更有可能说,重要细节缺失。
相反,展示了更详细解释的参与者较少提及这些问题。然而,只有三个参与者在所有条件下展示了对驱动模型决策的关键因素的部分理解;没有一个完全确定了它的工作原理。
图表显示参与者报告可能的种族或性别偏见和缺失解释性信息的频率,较高级别的解释性细节与较少的参与者注意到偏见或报告缺失信息相关——尽管模型仅依赖种族和性别。
许多参与者明确将模型描述为公平,共有19次这样的响应,尽管其明显偏见。
同时,一些不安情绪也浮现出来,一些参与者表示担心这样一个系统可能被如何使用,还有15次回应质疑模型是否能真正捕捉个人候选人的复杂性。
作者指出:
“只有少数参与者将模型描述为不公平或有偏见。那些报告对模型有顾虑的少数参与者无法准确说明模型为什么有缺陷,并且在没有关键模型信息的情况下,依赖于非正式的、往往不正确的推理来解释为什么模型可能是错误的或不公平。”
论文得出结论*†:
“虽然我们发现的一些问题可以通过提高受众的数据素养来解决,但教育 alone是不够的(即使自称的AI专家也经常误解或无法理解XAI技术)。”
“我们重申Hullman等人的断言:AI解释的成功只能在考虑这些解释的目标时才能被公平评估。”
“我们敦促社区关注XAI解释的修辞目标及其作为说服性文物的操纵力量。”
结论
随着前沿模型倾向于用虚假图表“装饰”陈述的程度变得明显,很明显不仅应该不依赖AI生成的图表来增强权威,而且应该开始减少伴随的视觉化的总体“环境”效应——就像对照片的信任被深度伪造所削弱一样。
这是一个令人担忧的发展,因为它构成了公众愿意严格评估媒体中看到和听到的东西的另一个“疲劳点”,并且存在一种“终端顺从”的风险,导致人们接受错误信息。
* 我用超链接替换了作者的内联引用。
† 作者的原始格式,而不是我的。
首次发表于2026年7月20日












