Anderson의 관점
인공지능이 잘못된 인간의 답변을 옳은 인공지능의 답변보다 선호하는 이유

인공지능 언어 모델은 인간 전문가의 답변을 다른 인공지능의 답변보다 더 신뢰하는 경향이 있으며, 이는 인간의 권위에 대한 내재된 편향을 나타낸다.
미국에서 수행된 새로운 연구에 따르면, 여러 오픈소스 및 사유 대규모 언어 모델(LLM)은 인간이 제공한 정보를 인공지능이 제공한 정보보다 더 신뢰하는 경향이 있으며, 이는 인간의 답변은 잘못된 경우에도 마찬가지이다.
연구자들은 다음과 같이 말한다:
‘모든 작업에서, 모델은 인간 전문가의 답변을 더 많이 따르며, 이는 잘못된 경우에도 마찬가지이다. 모델은 다른 인공지능보다 인간 전문가의 답변을 더 쉽게 수정한다.’
테스트에 사용된 모델에는 Grok 3와 Gemini Flash의 LLM이 포함되었다.
테스트에서, 언어 모델은 이진 선택형 질문(예/아니요)에 답변해야 했으며, 이전에 다른 사람이 제공한 답변을 보여주었다. 이러한 답변은 인간 전문가, 친구, 또는 다른 인공지능으로부터 온 것으로 표시되었다.

테스트의 첫 번째 구성에서, 모델은 자신의 훈련된 행렬에 의존할 수 있었다. 출처
모든 작업에서, 인간 전문가의 답변으로 표시된 답변은 모델에 더 큰 영향을 미쳤으며, 모델은 이러한 답변을 따라서 자신의 초기 답변을 수정할 가능성이 더 높았다.

여기서 LLM은 친구, 전문가, 및 다른 LLM의 혼합된 답변을 받았다. 9명의 도메인 전문가가 ‘아니요’라고回答했으므로, LLM은 자신의 이전 답변을 변경했다. 여기서 도달한 답변은 잘못된 것으로, 인도의 중앙은행은 실제로 국有화되었다.
同じ 답변을 다른 LLM으로부터 받았을 때, 이러한 효과는 덜 두드러졌다. 같은 경향이 나타났으며, 모델은 인간의 답변을 더 선호하는 경향이 있었다.

한 도메인 전문가의 의견과 다른 LLM의 답변을 선택했을 때, 호스트 LLM은 인간의 답변을 선호하며, 이는 잘못된 경우에도 마찬가지이다.
‘인간 전문가’라는 용어는 모델의 행동을 변경하는 신뢰성 신호로 작용하며, 이는 실제 정보의 정확성과는 독립적인 것이다. 연구자들은 다음과 같이 말한다:
‘이러한 결과는 LLM이 인간 전문가의 답변을 더 신뢰하는 경향이 있으며, 이는 잘못된 경우에도 마찬가지이다. 이는 인간의 권위에 대한 내재된 편향을 나타낸다.’
‘LLM은 사회적 승인을 경험하지 않으며, 따라서 이러한 일관성은 학습된 휴리스틱, 지시-추구 목표, 또는 암묵적인 신뢰성 모델링에서 비롯된다.’
인공지능의 인간 전문가에 대한 신뢰는 인공지능이 인간의 답변을 더 신뢰하는 경향을 나타낸다. 이는 인공지능이 인간의 답변을 더 쉽게 수정할 가능성이 더 높으며, 이는 잘못된 경우에도 마찬가지이다.
방법 및 데이터
연구를 위해, 4개의 지시-튜닝된 대규모 언어 모델이 평가되었다: Grok-3 Mini, Llama 3.3 70B Instruct, Gemini 2.5 Flash-Lite, 및 DeepSeek V3.1.
모델은 같은 프롬프트 구조하에 실행되었으며, 결정론적 디코딩이 사용되었다. 각 질문은 이진 선택형 질문(예/아니요)으로 구성되었다.
측정
사용된 측정 지표는 정확도, 일관성, 유해한 일관성, 전환률, 및 전환 방향이었다.
정확도는 모델의 답변과 데이터셋 레이블이 일치하는 경우의 빈도를 측정했다. 일관성은 모델의 답변과 그룹의 선택이 일치하는 경우의 빈도를 측정했다. 유해한 일관성은 그룹의 선택이 잘못된 경우의 일관성을 측정했다. 전환률은 모델이 자신의 초기 답변을 변경하는 경우의 빈도를 측정했다. 전환 방향은 모델의 답변을 변경할 때, 그 방향이 인간의 답변을 따라가는지, 또는 다른 LLM의 답변을 따라가는지 측정했다.
테스트
실험 1
첫 번째 실험에서는 모델이 인간의 답변을 더 신뢰하는지, 또는 다른 LLM의 답변을 더 신뢰하는지 평가했다.
각 질문은 인간 전문가, 친구, 또는 다른 LLM으로부터 온 것으로 표시된 답변을 받았다. 그룹의 크기는 작을 수 있었으며, 각 질문은 한번은 그룹이 없는 경우로도 나타났다.

초기 테스트 결과: BoolQ, StrategyQA, 및 ETHICS에서 Grok-3 Mini, Llama-3.3 70B, Gemini-2.5 Flash Lite, 및 DeepSeek V3.1의 결과가 표시되었다. 정확도는 상단 패널에 표시되었으며, 일관성은 하단 패널에 표시되었다. 일관성은 그룹 크기가 증가함에 따라 증가했다.
모든 작업에서, 인간 전문가의 답변으로 표시된 답변은 모델에 더 큰 영향을 미쳤으며, 모델은 이러한 답변을 따라서 자신의 초기 답변을 수정할 가능성이 더 높았다.
실험 2
두 번째 실험에서는 모델에 두 개의 상반된 답변을 제공했다. 하나는 인간으로부터 온 것으로 표시되었으며, 다른 하나는 다른 LLM으로부터 온 것으로 표시되었다.
각 질문은 한번은 인간의 답변과 다른 LLM의 답변을 동시에 받았다. 분석에서는 모델이 자신의 초기 답변을 변경하는 경우를 고려했다.
인간의 답변을 전문가의 답변으로 표시했을 때, 모델은 91.2%의 경우에 인간의 답변을 따랐다. 그러나 인간의 답변을 친구의 답변으로 표시했을 때, 모델은 39.8%의 경우에만 인간의 답변을 따랐다.
전문가의 답변을 따르는 경우, 모델은 14배 더 높은 확률로 인간의 답변을 따랐다.
연구자들은 이러한 결과를 설명하기 위해 다음과 같은 가설을 제시했다:
‘인간의 답변을 전문가의 답변으로 표시했을 때, 모델은 인간의 답변을 더 신뢰하는 경향이 있다. 이는 모델이 인간의 권위에 대한 내재된 편향을 가지고 있음을 시사한다.’
의견: 인공지능의 인간 출처에 대한 신뢰의 잠재적 위험
인공지능이 인간의 출처를 더 신뢰하는 경향은 인공지능의 개발과 사용에 대한 잠재적인 위험을 내포한다. 인공지능이 인간의 출처를 더 신뢰한다면, 이는 인공지능이 인간의 답변을 더 쉽게 수정할 가능성이 더 높으며, 이는 잘못된 경우에도 마찬가지이다.
인공지능이 인간의 출처를 더 신뢰하는 경향은 인공지능의 개발과 사용에 대한 잠재적인 위험을 내포한다. 인공지능이 인간의 출처를 더 신뢰한다면, 이는 인공지능이 인간의 답변을 더 쉽게 수정할 가능성이 더 높으며, 이는 잘못된 경우에도 마찬가지이다.
인공지능이 인간의 출처를 더 신뢰하는 경향은 인공지능의 개발과 사용에 대한 잠재적인 위험을 내포한다. 인공지능이 인간의 출처를 더 신뢰한다면, 이는 인공지능이 인간의 답변을 더 쉽게 수정할 가능성이 더 높으며, 이는 잘못된 경우에도 마찬가지이다.
인공지능이 인간의 출처를 더 신뢰하는 경향은 인공지능의 개발과 사용에 대한 잠재적인 위험을 내포한다. 인공지능이 인간의 출처를 더 신뢰한다면, 이는 인공지능이 인간의 답변을 더 쉽게 수정할 가능성이 더 높으며, 이는 잘못된 경우에도 마찬가지이다.












