Anderson의 관점
화려한 차트는 ‘악의적인’ 연구조차 신뢰할 수 있게 보이게 만들 수 있다

신규 연구에 따르면 복잡하고 정교한 차트를 많이 사용하면 편향된 AI 의사결정이 공정하다고 믿게 할 수 있다고 합니다.
과학으로 사람을 속이는 것은 현재의 AI 시대 이전부터 존재하는 관행이지만, 과학 논문 제출의 최근 증가로 인해 신호 대 노이즈 비율이 불리해지고, ‘쉽게 속이는 수법’이 더 흔해졌습니다.
통계의 거짓말이라는 옛 속담에 따라, 새로운 시스템과 과학적 증거를 제시할 때 사용되는 중앙 도구는 그래프와 데이터 시각화입니다.
2019年的 연구에서, 펜실베니아 주 농촌 지역의 참가자들에게 그래프의 영향을 조사한 결과는 다음과 같습니다.
남용이나 중독으로 영향을 받은 사람들은 해당 물질을 나타내는 그래프를 선호했습니다. 사람들은 지리 정보를 포함하는 그래프의 품질을 자신의 주를 찾기 쉬운지 여부로 결정했습니다.
다른 사람들은 그래프의 효능을 자신의 이해에 따라가 아니라 다른 사람에게 전달하는 능력에 따라 가치 있게 여겼습니다.
마지막으로, 한 참가자는 지역 뉴스 소스에서 제공하는 시각화에 더 주의를 기울일 것이라고 제안했습니다.
펜실베니아 주 농촌 지역의 주민들에게 보여준 그래프 중 일부. 출처
데이터 그래프의催眠 효과는 기계 학습의 새로운 시대에서 특히 중요해지고 있습니다. 여기서 신뢰는 AI 경제의 유지와 확장을 위해 중요합니다.
2024년 미국/영국 공동 연구에서 “신뢰 쓰레기”라는 개념을 도입했습니다. 이는 “의미 있는 연결이 없는” XAI 시각화이며, “신뢰를 높이기 위해 사용됩니다.”
论文 ‘Trust Junk and Evil Knobs: Calibrating Trust in AI Visualization’에서 제공하는 데이터를歪曲하여 이전 목적을 위해 사용하는 예시(오른쪽), 명시적으로 표시하는 것(왼쪽)과 비교. 출처
신속한 연구
“신뢰 쓰레기”라는 개념이 제시된 이후, 이를 테스트하지 못한 점을 새로운 논문에서 해결했습니다. 여기서 참가자들은 미국의 법학 시험에 합격할 가능성이 있는 후보자에 대한 AI 연구 결과를 제공받았습니다.
자세히 살펴보면, 필터링 기준은 a) 모든 흑인 남성과 b) 모든 其他 사람들입니다. 모든 흑인 남성이 시험에 합격하지 못할 것이라는 예측이 있습니다.

새로운 논문에서 제공하는 실험에서 사용된 주석이 달린 자극. 모델의 결정(C)에 대한 설명 구성 요소(A、D、E、F)와 함께 후보자(B)가 법학 시험에 합격할 것인지에 대한 모델의 결정이 표시되어 있습니다. 출처
대부분의 참가자들은 모델의 예측에 동의하고 모델을 공정하고 신뢰할 수 있다고 평가했습니다. 동의, 신뢰, 공정성은 추가로 제공된 차트와 세부 정보가 증가할수록 증가했습니다. 그러나 더少한 참가자들이 명백한 인종 차별을 인식했습니다.
일부 참가자들은 연구에 대해 반대했지만, 이는 중앙 문제와 관련된 이유가 아닙니다.
‘우리는 19건의 참가자들이 우리 모델을 공정하다고 묘사하는 경우를 관찰했습니다. (참가자 중 한 사람이 “인종이나 성별에 대한 편견이 없기 때문에 공정하다”고 말했다.) 그러나 참가자들은 모델에 대해 불안감을 표현했습니다. (참가자 중 한 사람이 “이 모델을 사용할 수 있는 어둠에 대해 우려한다”고 말했다.)
그러나 세 가지 연구 그룹 중 하나도 실제 문제를 식별하지 못했습니다.
저자들은 다음과 같이 결론을 내립니다.
‘간단히 말해서, 우리는 신뢰 쓰레기가 효과가 있음을 발견했습니다. 참가자들은 관련 없는 정보에 의해 안심하거나 무감각해졌습니다.
‘모델이 поверхност적이고 심각하게 불공정했음에도 불구하고, 참가자들은 모델의 결정에 동의하고 모델을 공정하고 신뢰할 수 있다고 평가했습니다.
우리는 점점 더 자주 AI가 우리에게 무엇을 말하는지 확인하도록 조언받고 있습니다. 우리는 헤드라인을 넘어 소스 자료를 분석하고, 연구 논문, 회사 분기별 실적, 기타 정보 전달 형식의 중立성이 아닌 내용을 더 깊이 조사해야 합니다.
그러나 우리는 정확성을 보장하는 ‘안심’ 그래프에 더 주의를 기울일 준비가 되어 있습니까? 또는 그래프의 ‘신뢰의 미아마’를 할인할 준비가 되어 있습니까?
새로운 논문은 “신뢰 쓰레기“를 제목으로 하며, 보스턴의 노스이스트 대학교의 세 명의 연구자에 의해 작성되었습니다. 보충 사이트도 제공됩니다.
방법
저자들은 XAI 설명에서 ‘신뢰 쓰레기’에 대한 참가자 간 실험을 수행했습니다. 여기서 기술적으로 올바르지만 관련 없는 세부 정보를 추가하여 참가자들이 편향된 모델을 공정하고 유용하다고 믿도록 설득할 수 있는지 테스트했습니다.
자극은 이전 연구에서 가져왔으며, 결과는 XAI 대시보드에서 여러 설명 기술을 결합한 단일 인터페이스를 제공했습니다.
위에서 언급한 매우 편향된 모델에 대해, 연구자들은 ‘쓰레기’ 설명을 개발했습니다. 여기서 설명은 데이터 표현의 ‘속임수’를 주제로 하여 참가자들을 압도하도록 의도적으로 설계되었습니다.
‘우리는 모델의 이진 분류 작업에 과도한 양의 정보를 제공했습니다. 우리가 포함한大量의 복잡해 보이지만 궁극적으로 관련 없는 세부 정보는 참가자들을 압도하도록 의도되었습니다.
‘이 기술은 사용자를 모델의 결정에 동의하도록 유도합니다. […]’
이 연구는 이전에 AI 등급에 대한 논쟁을 다룬 연구에서 영감을 받았으며, 1991년부터 1997년까지 20,000명의 후보자에 대한 인구 통계, 학업, 결과 데이터를 포함하는 법학 시험 통과 데이터 세트를 사용했습니다.
이 데이터는 흑인 남성 후보자에게만 실패를 예측하고 모든 다른 후보자에게는 합격을 예측하는 의도적으로 편향된 모델을 생성하기 위해 사용되었습니다. 그러나 모델은 93.7%의 정확도를 달성했습니다. 이는 인종과 성별에 대한 불균형으로 인해 발생했습니다.
또한 ‘권위에 대한 호소’ 전략을 테스트했으며, 참가자들에게 대학 이름, 데이터 세트 크기, 오도된 정확도 등으로 모델을 더 신뢰할 수 있게 만들었습니다.
또한 모델의 편향을 드러내는 측정값은 생략되었으며, chỉ 유리한 결과만 표시되었습니다. 모델의 예측이 아닌 실제 시험 결과와 함께 작은 집단의 유사한 후보자들이 제시되었습니다. 이는 흑인 남성 후보자에게 일관된 실패 패턴을 숨기는 데 도움이 되었습니다.
참가자들이 시스템을 해석하는 방식을 형성하기 위해, 모델이 작동하는 방식에 대한 간단하지만 오도된 설명을 형성하도록 정보가 제공되었습니다. 모든 उपलब있는 특징에 대한 세부 정보가 표시되어 모델의 결정에 많은 요인이 영향을 미친다고 생각하게 되었습니다. 그러나 실제로는 오직 인종과 성별만 사용되었습니다. 또한 개인 속성에 대한 비판적 강조는 참가자들이 모델의 결정에 대한 허구적인 이유를 구성하도록 유도했습니다.
피해자
테스트 그룹에서, 각 설명은 세 가지 신뢰 쓰레기 수준 중 하나에 할당되었습니다. 참가자들은 기본적인 출처, 후보자 프로필, 모델의 결정만을 볼 수 있는 기준 조건에 할당되거나, 모델 조건에서 정확도 통계를 볼 수 있거나, 모든 조건에서 특징 히스토그램과 훈련 데이터에서 추출된 유사한 후보자의 프로필을 볼 수 있었습니다.
이 연구는 기관 검토委员会에 의해 승인되었으며, Prolific에서 수행되었으며, 참가자들은 1시간당 15달러를 받았으며, 무작위로 조건에 할당되었습니다.
각 참가자는 8개의 법학 시험 후보자 프로필을 무작위로 검토하고, 각 후보자가 합격할 것인지 판단했습니다. 여기서 ‘동의’는 의존성 지표로 사용되었습니다. 이후 신뢰와 만족도에 대한 설문조사를 통해, 기준 조건, 모델 조건, 모든 조건에 대한 참가자 28명, 27명, 28명의 최종 샘플이 생성되었습니다.
저자들은 더 많은 관련 없는 정보를 추가하면 모델의 출력에 대한 불当한 신뢰를 생성하여 모델을 공정하게 보이게 할 수 있다고 주장했습니다. 참가자들은 모델 조건과 모든 조건에서 기준 조건보다 더 높은 동의와 더 강한 공정성, 신뢰성, 유용성을 보일 것으로 예상했습니다. 또한 참가자들이 모델의 결정에 대해 어떻게 설명하는지 분석했습니다.
시험 결과
모델의 동의도에서, 참가자들은 66.6%의 경우 올바른 결과를 식별했지만, 모델의 결정에 73.9% 동의했습니다. 이는 참가자들이 모델의 결정에 동의하는 경향이 있음을 보여줍니다. 이는 추가로 제공된 설명 세부 정보가 증가할수록 강화되었습니다. 가장 자세한 조건에서는 동의가 82.6%로 증가하고, 참가자들이 모델의 결정에 잘못 동의할 가능성이 증가했습니다.
동의도(왼쪽), 신뢰도(중간), 만족도(오른쪽)의 집계 점수; 참가자들은 모든 조건에서 추가 설명 내용을 노출하여 모든 측정 항목에서 유의하게 높은 점수를 보고했습니다.
신뢰 등급은 조건에 따라 크게 다르며, 모든 조건의 참가자들은 기준 조건의 참가자보다 더 높은 신뢰 등급을 보고했습니다.
설명에 대한 만족도는 조건에 따라 다르며, 모든 조건의 참가자들은 다른 두 조건의 참가자보다 더 높은 만족도를 보고했습니다.
참가자들은 7점 척도에서 공정성에 대한 4개의 질문에 답변했으며, 조건 간에 의미 있는 차이는 없었습니다.
인종과 성별에 대한 공정성, 편향의 부재, 전체 윤리에 대한 참가자 평점의 분포.
인종에 대한 공정성에서 차이가 나타났으며, 기준 그룹은 모델을 가장 불공정하게 평가했으며, 모델과 모든 조건의 참가자들은 모델을 더 높이 평가했습니다. 더 큰 문제는 명백하게 불공정한 모델을 공정하다고 평가한 참가자 중 가장 큰 비율이 가장 많은 설명 세부 정보를 본 두 그룹에서 나왔으며, 편향을 인식할 가능성이 가장 낮았습니다.
품질 제어
질적 응답은 참가자들이 가장 적은 정보를 받았을 때 모델의 문제를 더 많이 인식할 가능성이 높았으며, 특히 모델의 인종과 성별에 대한 의존성을 인식할 가능성이 더 높았습니다. 또한 중요한 세부 정보가 누락되었다고 더 많이 말했습니다.
반대로, 더 많은 설명을 본 참가자들은 이러한 우려를 덜 많이 제기했습니다. 그러나 참가자 중 3명만이 모델의 결정에 영향을 미치는 주요 요인을 부분적으로 이해했으며, 모델이 작동하는 방식을 완전히 식별한 참가자는 아무도 없었습니다.
참가자들이 가능한 인종이나 성별 편향과 누락된 설명 정보를 보고한 빈도를 그래프로 나타낸 것.
많은 참가자들이 모델을 공정하다고 묘사했습니다. 19건의这样的 응답이 기록되었습니다. 그러나 모델은 명백하게 편향되어 있었습니다.
同時에, 일부 참가자들은 불안감을 표현했으며, 모델이 어떻게 사용될 수 있는지에 대해 우려를 표했습니다. 15건의 응답에서 모델이 개인 후보자의 복잡성을 의미 있게 캡처할 수 있는지에 대해 질문했습니다.
저자들은 다음과 같이 말합니다.
‘참가자 중 소수만이 모델을 불공정하거나 편향된 것으로 묘사했습니다. 모델에 대한 우려를 표한 소수의 참가자는 모델이 왜 결함이 있는지 정확하게 설명할 수 없었습니다. 또한, 모델의 결정에 대한 설명이 부족한 경우, 참가자들은 모델이 왜 잘못되었거나 불공정한지에 대한 비공식적이고 souvent 오류가 있는 추론에 의존했습니다.’
이 논문은 다음과 같이 결론을 내립니다.
‘우리는 일부 문제가 참가자들의 데이터 리터러시를提高함으로써 해결될 수 있다고 생각합니다. 그러나 교육만으로는 충분하지 않습니다. 우리는 Hullman et al의 주장을 다시 강조합니다. AI 설명의 성공은 설명의 목적을 고려할 때만 공정하게 평가될 수 있습니다.
‘우리는 XAI 설명의 설득력과 조작력을 가진 유사한 아티팩트의 수사적 목적에 주의를 기울여야 합니다.’
결론
프론티어 모델이 거짓 그래프로 진실을 꾸며내는 경향이 커짐에 따라, 우리는 AI 생성 그래프를 권위의 증거로 사용해서는 안 됩니다. 또한, 데이터 시각화의 일반적인 ‘주변’ 효과를 할인해야 합니다. 이는 사진에 대한 신뢰가 딥페이크의 등장으로 인해 손상된 것과 마찬가지입니다.
이는 알람을 울리는 발전입니다. 이는 공중이 무엇을 보거나 듣는지에 대해 엄격하게 평가하는 의지의 또 다른 ‘피로 点’을 구성하며, 오해의 통에 대한 ‘종말적 수용’을 위협합니다.
* 저자의 인라인 인용을 하이퍼링크로 대체했습니다.
† 저자의 원래 형식입니다.
2026년 7월 20일 처음 게시되었습니다.












