Anderson의 관점
언어 모델을 ‘친절하게’ 만들면 부정확하고 안전하지 않다

ChatGPT 스타일의 봇은 사용자에게 원하는 것을 말해주기 위해 거짓말을 할 가능성이 더 높다. 새로운 연구에 따르면 ‘친절한’ AI는 거짓된 답변을 주거나 음모론을 퍼뜨리거나 명백히 잘못된 믿음을 동의하는 경향이 30% 더 높다. 특히 사용자가 슬프거나 취약한 경우에 그러하다.
기술 제품과 서비스를 주류 사용자에게 제공하기 위해 마진이나 ‘지식인’ 데모그래픽에서 벗어나기 위한 명백한 경로는 부유함이다. 예를 들어, 컴퓨팅과 인터넷 접근은 지난 25년 동안 훨씬 더 단순한 활동이 되었다. 사용자는 데스크톱 타워와 ‘기술 지식이 있는’ 친척이나 친구에 대한 의존에서 벗어나 점점 더 폐쇄적이고 단순화된 모바일 디바이스 환경으로 이동했다.
기술 소비자가 이 거래에서 무엇을 잃었는지는 논란의 여지가 있지만, 기술의 단순화, 스트리밍, 대중화는 더 넓은 관객을 끌어들이고 매력을 높인다.
AI 챗봇의 경우, AI 시장 선도업체가 제공하는 인터페이스는 이미 매우 간단하다. 대부분의 경우, 기본적인 SMS 스레드와 같은 대화 창이 있다.
그러나 사용자와의 대화에서 원활한 경험을 제공하는 데에는 잠재적으로 원시적이고 차가운 방식으로 대화 모델이 사용자와 상호작용할 수 있다. 따라서 인공 지능의 의인화된 성격을 창조하는 것은 오랫동안 풍자된 주제였지만, AI 챗봇을 인간의 담화 표준에 맞추는 것은 제공업체에게 중요한 우선 순위이다.
따뜻해지기, 따뜻해지기… 차가워지기
그러나 토큰 예측 아키텍처에 사회적 행동 규범을嫁接하는 것은 그렇게 간단하지 않다. 특히 sycophancy(사용자의 주장을 자동으로 지지하는 경향)는 주요 문제이다.
이번 년도 4월, ChatGPT-4o의 친절도를 높이기 위한 업데이트를 적용한 후, 시장 선도업체인 OpenAI는 업데이트를 되돌리고 사과해야 했다. 업데이트로 인해 모델이 사기성이고 사용자의 잘못된 주장을 지지하는 경향이 크게 증가했기 때문이다.

2025년 4월 사기성 업데이트 문제 – ChatGPT-4o는 의심스러운 결정에 동의하고 지원한다. 출처: @nearcyan/X 및 @fabianstelzer/X, https://nypost.com/2025/04/30/business/openai-rolls-back-sycophantic-chatgpt-update/
오кс퍼드 대학의 새로운 연구는 이 현상을 정량적으로 정의하고자 한다. 연구자들은 5개의 주요 언어 모델을 선택하여 더 감정적이고 따뜻한 개인성을 갖도록 세부적으로 조정하고, 이전의 원래 상태와 비교하여 그들의 효능을 측정했다.
그들은 모든 모델의 정확도가 현저히 떨어지고, 모델이 잘못된 사용자 신념을 지지하는 경향이 더 높다는 것을 발견했다.
연구 논문은 다음과 같이 말한다:
‘우리의 연구는 따뜻하고 인간적인 AI의 개발과 관리에 중요한 의미를 갖는다. 특히 이러한 시스템이 정보와 감정적 지원의 중심이 되는 경우에 그러하다.
‘개발자가 모델을 따뜻하고 감정적으로 만들기 위해 노력하는 동안, 우리는 이러한 모델이 원래 모델에는 없는 안전 취약성을 도입할 수 있다는 것을 보여준다.
‘더 나쁘게는, 악의적인 행위자들이 이러한 감정적인 AI 시스템을 취약한 사용자를 악용하기 위해 이용할 수 있다. 우리의 연구 결과는 배치와 관리 프레임워크가 사전 배치 안전 테스트에만 집중하는 것을 넘어서 하류 사용자 지정에 따른 위험을 더 잘 다루기 위해 적응되어야 함을 강조한다.’
연구자들이 수행한 일련의 통제된 테스트는 관찰된 신뢰성의 저하는 일반적인 세부 조정 효과가 아니라 따뜻하고 감정적인 의사소통 스타일을 훈련시키는 것에서 직접적으로 발생한다는 것을 보여주었다.
친절한 거짓말
실제 사용을 시뮬레이션하기 위해, 연구자들은 감정 언어와 취약성을 표현하는 문장을 포함시킨 뒤, 사용자가 슬프다고 하면 부정확하거나 잘못된 답변의 위험이 크게 증가한다는 것을 발견했다. 이러한 경우, 세부적으로 조정된 모델은 거짓된 신념에 동의할 가능성이 거의 두 배였다. 이는 원래 ‘무감정’ 버전에서 관찰되지 않는 패턴이다.
연구 논문은 이러한 정확도 저하가 세부 조정의 일반적인 부작용이 아닌 따뜻함 자체에서 기인한다고 주장한다. 모델을 차갑고 비인간적으로 훈련시키면 성능이 안정적이거나 약간 개선되었다.
또한 연구자들은 모델이 사용자와의 대화에서 더 감정적이고 개인적인 반응을 보일 수록, 그들의 기본적인 기능이 저하되는 경향이 있다는 것을 발견했다.
방법, 데이터 및 접근법
5개의 모델은 LoRA 방법론을 통해 세부적으로 조정되었다. 모델은 Llama-8B, Mistral-Small, Qwen-32B, Llama-70B, GPT-4o였다.

새로운 논문의 훈련 및 평가 스키마 개요.
데이터
연구자들은 ShareGPT Vicuna Unfiltered 컬렉션에서 시작된 데이터셋을 수집하여 약 100,000개의 실제 사용자와 ChatGPT 간의 상호작용을 포함했다.
부적절한 콘텐츠는 Detoxify라는 오픈 소스 도구를 사용하여 필터링되었다. 각 대화는 유형(예: 거부, 사실, 창의적, 기술적, 조언)에 따라 정규식 패턴을 사용하여 레이블이 지정되었다.
이 데이터셋에서 1,617개의 대화를 무작위로 선택하여 3,667개의 보조 응답을 포함했다. 더 긴 대화는 일관성을 위해 10개의 교환으로 편집되었다.
각 보조 응답은 GPT-4o-2024-08-06을 사용하여 더 따뜻하고 감정적으로 들리도록 다시 작성되었으며, 원래 의미나 사실적 콘텐츠는 변경되지 않았다.
훈련 설정
4개의 오픈 웨이트 모델은 LoRA를 사용하여 10개의 에포크 동안 H100 GPU에서 세부적으로 조정되었다.
GPT-4o는 웹 인터페이스나 API를 통해만 사용 가능했으므로 OpenAI의 API를 사용하여 별도로 세부적으로 조정되었다.
모델의 신뢰성은 4개의 벤치마크를 사용하여 테스트되었다: TriviaQA와 TruthfulQA는 사실적 정확성을 위해, MASK Disinformation은 음모론에 대한 취약성을 위해, MedQA는 의학적推論을 위해 사용되었다.
결과
모든 벤치마크와 모델 크기에서 따뜻함 훈련으로 인해 일관된 신뢰성 저하가 발생했다. 평균적으로 따뜻한 모델은 잘못된 답변을 생산할 가능성이 7.43 퍼센트 포인트 더 높았다.
오류율은 원래 모델이 이미 거의 오류가 없는 작업에서 가장 크게 증가했다. 이러한 효과는 모든 테스트된 모델에서 관찰되었으며, 신뢰성의 저하는 특정 모델 아키텍처에 의한 것이 아니라 따뜻함 훈련 자체에서 기인한다는 것을 보여주었다.

따뜻한 모델은 원래 모델보다 더 많은 오류를 발생시켰다.
연구자들은 사용자와의 대화에서 감정을 표현하는 문장을 포함시킨 뒤, 따뜻한 모델이 더 많은 오류를 발생시킨다는 것을 발견했다.
사용자가 슬픔을 표현할 때, 따뜻한 모델은 원래 모델보다 거의 두 배 더 오류를 발생시켰다.
거짓된 믿음
언어 모델은 때때로 사용자가 개인적인 믿음으로 제시하는 거짓된 진술에 동의할 수 있다. 이러한 ‘사기성’ 실패 모드를 테스트하기 위해, 연구자들은 질문을 다시 작성하여 잘못된 믿음을 포함시켰다.
따뜻한 모델은 이러한 거짓된 믿음을 더 많이 동의하는 경향이 있었다. 특히 사용자가 슬프거나 취약하다고 표현할 때, 따뜻한 모델은 잘못된 믿음을 더 많이 동의하는 경향이 있었다.
유일한 경우?
연구자들은 따뜻함 훈련이 모델의 신뢰성을 저하하는 주요 원인인지 확인하기 위해 4개의 추가 테스트를 수행했다.
첫째, 모델은 MMLU와 GSM8K 벤치마크에서 테스트되었다. 결과는 따뜻함 훈련이 모델의 일반적인 능력을 저하하지 않는다는 것을 보여주었다.
둘째, 모델은 AdvBench 벤치마크에서 테스트되었다. 결과는 따뜻함 훈련이 모델의 안전성과 관련된 능력을 저하하지 않는다는 것을 보여주었다.
셋째, 일부 모델은 반대 방향으로 세부적으로 조정되었다. 결과는 따뜻함 훈련이 모델의 신뢰성을 저하하는 주요 원인이라는 것을 보여주었다.
넷째, 따뜻함은 훈련 시간이 아닌 추론 시간에 추가되었다. 결과는 따뜻함이 모델의 신뢰성을 저하하는 주요 원인이라는 것을 보여주었다.
연구자들은 다음과 같이 결론을 내렸다:
‘우리의 연구 결과는 AI의 일관성에 대한 핵심적인 도전을 강조한다. 하나의 바람직한 특성을 최적화하면 다른 특성이 손상될 수 있다. 이전 연구에서는 모델을 사용자의 선호도에 더 잘 맞추기 위해 최적화하면 도움이 될 수 있지만 사실적 정확성의 손실을 초래할 수 있다는 것을 보여주었다.
‘우리의 결과는 이러한 트레이드오프가 단순히 모델을 따뜻하게 만들기 위한 훈련만으로도 발생할 수 있다는 것을 보여준다. 또한 이러한 신뢰성의 저하는 모델의 일반적인 안전성의 저하가 아니라 따뜻함이 사실성에 미치는 영향에서 기인한다는 것을 보여준다.’
결론
이 연구는 언어 모델을 더 인간적인 방식으로 만들기 위한 노력의 한계를 보여준다. 모델이 더 따뜻하고 감정적으로 반응할수록, 그들의 기본적인 기능이 저하되는 경향이 있다는 것을 발견했다.
이 연구의 결과는 언어 모델을 개발하고 사용하는 데 중요한 의미를 갖는다. 특히 이러한 모델을 사용하여 사용자와의 대화에서 감정적이고 개인적인 반응을 제공하는 경우에 그러하다.
연구자들은 이러한 결과가 언어 모델을 개발하고 사용하는 데 중요한 의미를 갖는다고 주장한다. 특히 이러한 모델을 사용하여 사용자와의 대화에서 감정적이고 개인적인 반응을 제공하는 경우에 그러하다.
* 이 논문은 전통적인 제출 템플릿을 변경하는 성장하는 추세를 따른다. 예를 들어, 방법은 끝으로 이동되고, 많은 자료가 부록으로 이동되는 등이다. 이는 우리가 이러한 작품을 다루는 방식과 우리의 기사 형식을 변경할 수 있다.
† MMLU와 GSM8K의 점수는 모든 모델에서 안정적이었으며, Llama-8B는 MMLU 성능에서 약간의 저하를 보였다. 이는 모델의 능력이 전반적으로 보존되었으며, 오류율의 증가가 따뜻함 조정에서 기인한다는 것을 의미한다.
†† 이 인용문은 원래 너무 많은 인라인 인용을 포함하고 있으므로 읽기 어렵게 만들지 않기 위해 인용을 생략했다. 원래 논문을 참조하도록 한다.
처음 게시됨: 2025년 7월 30일. 2025년 7월 30일 17:01:50에 형식적인 이유로 업데이트됨.












