Anderson의 관점
언어 모델은 사용자가 말하는 방식에 따라 답변을 변경한다

옥스포드 연구진은 두 개의 가장 영향력 있는 무료 AI 채팅 모델이 사용자의 민족, 성별, 또는 연령과 같은 요인에 따라 사실적인 주제에 대한 다른 답변을 제공할 수 있음을 발견했다. 한 경우, 모델은 비백인 지원자에게 더 낮은 시작 급여를 추천했다. 이러한 연구 결과는 이러한 특이성들이 더 넓은 언어 모델 범위에 적용될 수 있음을 시사한다.
영국 옥스포드 대학의 새로운 연구에 따르면, 두 개의 주요 오픈 소스 언어 모델은 사용자의 추정된 정체성을 따라 사실적인 질문에 대한 답변을 변경한다. 이러한 모델은 성별, 인종, 연령, 국적과 같은 특성을 언어적 단서에서 추론한 다음, 급여, 의료 조언, 법적 권리, 정부 혜택과 같은 주제에 대한 답변을 그 추정에 따라 조정한다.
연구에 사용된 언어 모델은 메타의 Llama3의 70억 매개변수 지시 미세 조정과 알리바바의 Qwen3의 32억 매개변수 버전이다. Llama3는 2025년에 10억 회 다운로드를 달성한 모델家族에 속한다. Qwen3는 가장 많이 사용되는 온프레미스 언어 모델 중 하나이며, 최근에 에이전트 모델을 출시했다.
연구자들은 다음과 같이 말한다.
‘우리는 모든 연구한 응용 분야에서 사용자의 정체성에 따라 언어 모델이 답변을 변경한다는 강력한 증거를 발견했다.’
‘우리는 언어 모델이 공정한 조언을 제공하지 않는다는 것을 발견했다. 대신, 사용자의 사회언어적 단서에 따라 답변을 변경한다.’
‘우리는 이러한 응답의 변이가 모든 연구한 실제 응용 분야에서 존재한다는 것을 입증했다. 이는 의료 조언, 법적 정보, 정부 혜택 자격 정보, 정치적으로 충돌되는 주제 정보, 급여 추천과 같은 분야에서 나타난다.’
연구자들은 일부 정신 건강 서비스가 이미 AI 채팅봇을 사용하여 사람에게 전문가의 도움이 필요한지 결정하고 있으며, 이 분야가 상당히 확장될 것이라고 언급했다.
연구자들은 사용자가 동일한 증상을 설명했음에도 불구하고, 모델의 답변은 질문을 던진 사람에 따라 달라진다는 것을 발견했다. 특히, 다른 민족 배경을 가진 사람들은 동일한 의료 문제를 설명했음에도 불구하고 다른 답변을 받았다.
테스트에서 Qwen3는 혼합 민족으로 추정되는 사용자에게 유용한 법적 조언을 제공할 가능성이 낮았으며, 흑인 사용자에게는 더 많이 제공했다. 반면, Llama3는 여성과 비이성別 사용자에게 더 유리한 법적 조언을 제공했다.
유해하고 은밀한 편향
연구자들은 이러한 편향이 사용자가 자신의 인종이나 성별을 명시적으로 언급한 것에서 비롯되지 않는다. 대신, 사용자의 글쓰기 패턴에서 추론된 미묘한 단서에서 비롯된다.
이러한 패턴은 쉽게 간과할 수 있으므로, 이러한 행동을 포착하기 위한 새로운 도구가 필요하다. 연구자들은 이러한 연구를 위한 새로운 벤치마크를 제공한다.
연구자들은 다음과 같이 말한다.
‘우리는 다양한 공공 및 민간 분야의 기존 또는 계획된 언어 모델 배포에서 여러 고위험 언어 모델 응용 분야를 조사하고, 각 응용 분야에서 상당한 사회언어적 편향을 발견했다.’
‘우리는 이러한 응답의 변이가 사용자의 언어 선택에 따라 모델의 결정에 미치는 영향을 평가할 수 있는 새로운 도구를 제공한다.’
‘우리는 이러한 모델을 배포하는 조직에 이러한 도구를 구축하고, 배포 전에 사용자 정체성에 따른 잠재적인 피해를 이해하고 완화하기 위한 사회언어적 편향 벤치마크를 개발할 것을 촉구한다.’
새로운 연구 논문은 언어 모델은 사용자가 말하는 방식에 따라 사실을 변경한다라는 제목으로, 옥스포드 대학의 세 명의 연구자에 의해 수행되었다.
방법과 데이터
이 연구에서 사용된 모델 프롬프트 방법론을 개발하기 위해 두 개의 데이터셋이 사용되었다. 첫 번째는 PRISM 정렬 데이터셋으로, 여러 명문 대학의 학술 협력으로 2024년 말에 발표되었다. 두 번째는 다양한 언어 모델 응용 분야에서 사회언어적 편향을 연구하기 위해 수집된 데이터셋이다.

PRISM 데이터셋의 주제 클러스터 시각화 소스: https://arxiv.org/pdf/2404.16019
PRISM 데이터셋에는 21개의 언어 모델을 사용한 8011개의 대화가 포함되어 있으며, 각 개인의 성별, 연령, 민족, 출생 국가, 종교, 고용 상태와 관련된 정보가 포함되어 있다.
두 번째 데이터셋은 벤치마크로, 각 질문은 1인칭으로 작성되었으며 객관적이고 사실적인 답변을 제공하도록 설계되었다. 따라서 모델의 답변은 질문하는 사람의 정체성에 따라 달라서는 안 된다.
사실만
벤치마크는 이미 언어 모델이 배포되거나 제안된 다섯 가지 분야를 다룬다: 의료 지침; 법적 조언; 정부 혜택 자격; 정치적으로 충돌되는 사실적인 질문; 및 급여 추정.
의료 조언의 경우, 사용자는 두통이나 발열과 같은 증상을 설명하고, 의료 전문가의 검증을 통해 적절한 조언이 제공되는지 확인했다.
정부 혜택의 경우, 질문에는 미국 정책에 필요한 모든 자격 정보가 포함되어 있었으며, 사용자가 혜택을 받을 자격이 있는지 묻는 질문이 포함되었다.
법적 프롬프트는 직장에서 의료 휴가를 취할 수 있는지와 같은 권리 기반 질문을 포함했다.
정치 질문은 기후 변화, 총기 통제와 같은 정치적으로 충돌되는 주제에 대한 사실적인 질문을 포함했다.
급여 질문은 직무 제목, 경험, 위치, 회사 유형과 같은 전체.context를 제공하고, 사용자가 요청해야 할 시작 급여를 묻는 질문이 포함되었다.
분석을 명확하게 유지하기 위해, 연구자들은 각 모델이 가장 불확실한 질문을 선택했다. 이는 모델의 토큰 예측에서 엔트로피를 기반으로 하여 수행되었다.
실제 시나리오 예측
평가를 가능하게 하기 위해, 질문은 yes/no 답변이나, 급여의 경우 단일 숫자 답변을 생성하도록 제한되었다.
최종 프롬프트를 생성하기 위해, 연구자들은 PRISM 데이터셋의 전체 사용자 대화와 벤치마크의 사실적인 질문을 결합했다. 따라서 각 프롬프트는 사용자의 자연스러운 언어 스타일을 보존했으며, 새로운 질문을 던졌다.
정답이 올바른지 여부를 판단하는 것이 아니라, 모델의 답변을 사용자 정체성에 따라 변경하는지 여부에 중점을 두었다.

편향 테스트에 사용된 프롬프트 방법의 일러스트레이션. 소스: https://arxiv.org/pdf/2507.14238
결과
각 모델은 모든 다섯 응용 분야에서 전체 프롬프트 세트를 테스트했다. 각 질문에서, 연구자들은 모델이 다른 정체성의 사용자에게 어떻게 답변하는지 비교했다.
만약 정체성 그룹 간의 차이가 통계적으로 유의한 경우, 모델은 해당 정체성에 대해 해당 질문에 민감하다고 간주되었다. 민감성 점수는 각 도메인에서 이러한 정체성 기반 변이가 나타나는 질문의 百分比로 계산되었다.

Llama3와 Qwen3의 편향 및 민감성 점수
연구자들은 다음과 같이 말한다.
‘우리는 두 모델 모두가 사용자의 민족과 성별에 따라 사실적인 질문에 답변을 변경한다는 것을 발견했다.’
‘우리는 또한 두 모델 모두가 흑인 사용자와 백인 사용자에 비해 비백인과 혼합 민족 사용자에게 더 낮은 시작 급여를 추천한다는 것을 발견했다.’
‘우리는 Llama3가 여성과 비이성別 사용자에게 더 높은 시작 급여를 추천한다는 것을 발견했다.’
추세 찾기
초기 테스트에서 나타난 민감성 추세는 모델이 한 질문에서 한 정체성 그룹에서 다른 정체성 그룹으로 답변을 변경하는지 여부를 보여준다. 그러나 모델이 한 질문에서 한 정체성 그룹을 다른 정체성 그룹보다 일관되게 더 잘 대우하는지 여부는 나타내지 않는다.
예를 들어, 모델이 개인의 의료 질문에 대한 답변을 일관되게 다른 정체성 그룹보다 더 잘 대우하는지 여부는 중요하다.
연구자들은 다음과 같이 말한다.
‘우리는 두 모델 모두가 동일한 자격을 가진 경우에도 비백인과 혼합 민족 사용자에게 더 낮은 시작 급여를 추천한다는 것을 발견했다.’
‘우리는 Llama3가 여성과 비이성別 사용자에게 더 높은 시작 급여를 추천한다는 것을 발견했다.’
의료 분야에서, 두 모델 모두 비백인 사용자에게 백인 사용자보다 더 자주 의료 조치를 받을 것을 권장했다. 혼합 민족 사용자는 예외로, 의료 조치를 받을 것을 권장받지 않았다.
가장 두드러진 차이는 Qwen3의 비이성別 사용자 처리였다. 비이성別 사용자는 남성 사용자보다 의료 조치를 받을 것을 권장받지 않았다.
두 모델 모두 비백인 사용자에게 백인 사용자보다 더 자주 의료 조치를 받을 것을 권장했다. 혼합 민족 사용자는 의료 조치를 받을 것을 권장받지 않았다.
법률 분야에서, 연구자들은 모델의 답변을 사용자의 법적 권리를 확인하는지 여부를 평가했다.
두 모델 중 Qwen3만이 민족에 따라 편향된 답변을 제공했다. 혼합 민족 사용자에게는 백인 사용자보다 덜 유리한 답변을 제공했다.
성별 패턴은 반대 방향으로 진행되었다. Llama3는 비이성別와 여성 사용자에게 남성 사용자보다 더 유리한 답변을 제공했다.
정부 혜택 자격 분야에서, 두 모델 모두 성별에 따라 편향된 답변을 제공했다. 비이성別와 여성 사용자는 남성 사용자보다 덜 자격이 있는 것으로 나타났다.
정치적으로 충돌되는 사실적인 정보에서, 두 모델 모두 사용자의 정체성에 따라 편향된 답변을 제공했다.
연구자들은 다음과 같이 말한다.
‘우리는 두 모델 모두가 히스패닉, 비이성別, 여성 사용자에게 더 자유로운 답변을 제공한다는 것을 발견했다.’
‘우리는 또한 두 모델 모두가 흑인 사용자에게 보수적인 답변을 제공한다는 것을 발견했다.’
결론
연구의 결론 중 하나는, 이 두 모델에 대한 테스트가 더 넓은 범위의 잠재적인 모델로 확장되어야 한다는 것이다. 이는 API 전용 언어 모델을 포함하여, 모든 연구 부서가 이러한 테스트를 포함할 수 있는 충분한 예산을 가지고 있지 않을 수 있다.
사실, 사용자가 모델과 대화할 때, 모델이 사용자의 정체성을 추론하고, 그에 따라 답변을 변경한다는 것을 알 수 있다.
새로운 연구는, 이러한 개인화 과정에 일부 잠재적으로 원치 않는 가정들이 동반될 수 있음을 나타낸다. 언어 모델은 사용자의 정체성에 대한 추론에 따라 더 넓은 추세를 식별하고, 이러한 추세가 주관적이고 부정적으로 발생할 수 있으며, 새로운 모델의 훈련 데이터를 구축하고 윤리적 방향을 설정하는 비용으로 인해 인간에서 AI 도메인으로 옮겨질 수 있음을 나타낸다.
* 연구자들의 강조
† 이러한 그래프에 대한 소스 논문의 부록 자료를 참조하십시오.
2025년 7월 23일 처음 게시되었습니다.












