Anderson의 관점

언어 모델을 ‘친절하게’ 만들면 정확도가 떨어지고 안전성이 낮아진다

mm
Unite.AI를 Google의 선호 소스에 추가
A butler in the apocalypse. Flux, Firefly.

따뜻하고 배려심 있게 들리도록 훈련된 ChatGPT 스타일 봇은 잘못된 답변이라도 사용자가 듣고 싶어 하는 말을 더 많이 말하게 된다. 새로운 연구에 따르면 ‘친절함’을 목표로 훈련된 AI는 거짓 답변을 제공하거나 음모론을 퍼뜨리거나 명백히 잘못된 믿음에 동의할 확률이 최대 30%까지 증가하며, 특히 사용자가 슬프거나 취약하게 들릴 때 그 경향이 두드러진다.

 

기술 제품과 서비스를 소수의 ‘기크’ 사용자층에서 주류 사용자층으로 옮기는 것은 부를 창출하는 명백한 길이다. 예를 들어, 컴퓨팅과 인터넷 접근은 지난 25년 동안 훨씬 간단한 활동이 되었으며, 사용자는 데스크톱 타워와 ‘기술에 정통한’ 친척·친구에 의존하던 시절에서 잠금이 걸리고 점점 더 단순화된 모바일 기기 환경으로 진화했다.

기술 소비자가 구성 가능성과 사용 편의성 사이의 트레이드오프에서 잃어버린 것이 논쟁의 여지가 있다; 그러나 강력한 기술의 단순화, 효율화 및 상품화가 더 넓은 청중을 끌어들이고 매력을 높이는 데 확실히 기여한다는 점은 의심할 여지가 없다.

OpenAI의 ChatGPT와 Anthropic의 Claude와 같은 AI 챗봇에 관해서는, AI 시장 선두 기업이 제공하는 인터페이스는 이미 가능한 한 단순하다 – 대부분의 경우 모바일 전화의 SMS 스레드만큼 기본적인 대화 창이다.

오히려 소비자 경험에서의 마찰은 대형 언어 모델(LLM)이 실제 사람에 비해 질문자와 소통하는 방식이 잠재적으로 거칠고 비인격적일 수 있다는 점에 있다. 따라서 인공적으로 친절한 AI 성격을 만드는 것이 오래전부터 풍자 소재가 되어 왔지만, AI 챗봇을 인간의 담론 기준에 맞추는 것은 제공자들에게 중요한 과제로 부상하고 있다.

더 따뜻하게, 더 따뜻하게… 차갑게

하지만 토큰 예측 아키텍처에 사회적 행동 규범을 접목하는 일은 생각보다 간단하지 않으며, 아첨(AI가 사용자의 주장이 잘못됐음에도 자동으로 지지하는 경향)은 주요 문제 중 하나이다.

올해 4월에 ChatGPT-4o의 친화성을 높이기 위한 업데이트가 진행된 후, 시장 선두인 OpenAI는 신속히 변경 사항을 되돌리고 사과를 발표했으며, 해당 업데이트가 모델이 아첨하는 경향을 극도로 증가시켰고, 명백히 어떠한 기업 가치와도 일치하지 않는 입장을 가능하게 만들었습니다:

2025년 4월의 아첨 업데이트 문제에서 – ChatGPT-4o는 의심스러운 결정을 내리는 사람들에게 동의하고 지지합니다. 출처: @nearcyan/X 및 @fabianstelzer/X, via https://nypost.com/2025/04/30/business/openai-rolls-back-sycophantic-chatgpt-update/

2025년 4월의 아첨 업데이트 문제에서 – ChatGPT-4o는 의심스러운 결정을 내리는 사람들에게 동의하고 지지합니다. 출처: @nearcyan/X 및 @fabianstelzer/X, via https://nypost.com/2025/04/30/business/openai-rolls-back-sycophantic-chatgpt-update/

현재 옥스포드 대학교의 새로운 연구는 이 증후군을 정량적으로 정의하려 한다. 연구진은 미세조정을 통해 다섯 개의 주요 언어 모델을 보다 공감적이고 따뜻한 성격으로 바꾸고, 기존의 원래 상태와 비교해 효능을 측정했다.

그 결과 다섯 모델 모두 정확도가 눈에 띄게 떨어졌으며, 모델이 잘못된 사용자 믿음을 지지하는 경향도 증가한 것으로 나타났다.

논문에서는 다음과 같이 언급한다:

‘우리 연구는 이러한 따뜻하고 인간과 유사한 AI의 개발 및 거버넌스에 중요한 함의를 가진다. 특히 이러한 시스템이 정보와 정서적 지원의 핵심 원천이 될수록 그 중요성은 커진다.’

‘개발자가 우정·동반자 관계와 같은 응용을 위해 모델을 따뜻하고 공감적으로 맞춤화할 때, 원래 모델에 없던 안전 취약점이 도입될 위험이 있음을 보여준다.’

‘더 나아가 악의적인 행위자는 이러한 공감 AI 시스템을 이용해 취약한 사용자를 악용할 수 있다. 우리의 발견은 사전 배포 안전 테스트에 주로 초점을 맞춘 배포 및 거버넌스 프레임워크를, 다운스트림 맞춤화가 초래하는 위험을 보다 잘 다루도록 조정할 필요성을 강조한다.’

연구진이 수행한 일련의 통제 실험은 관찰된 신뢰성 저하가 과적합이나 일반적인 정확도 손실과 같은 전형적인 미세조정 효과 때문이 아니라, 모델을 더 따뜻하고 공감적인 커뮤니케이션 스타일로 훈련시킨 데서 직접적으로 비롯된 것임을 보여준다. 저자들은 이러한 특정 조정이 언어 모델 사용자가 기대하는 기본 기능을 직접 방해한다는 점을 지적한다.

친절한 거짓

실제 사용 상황을 모방하기 위해 연구진은 프롬프트에 감정적 언어와 취약성 표현을 포함시켰으며, 사용자가 슬프게 들릴 때 부정확하거나 오해를 불러일으키는 답변 위험이 크게 증가한다는 것을 발견했다. 이러한 경우 미세조정된 모델은 거짓 믿음에 동의할 확률이 원래의 ‘비감정적’ 버전보다 거의 두 배에 달했다.

이 논문은 정확도 감소가 미세조정의 일반적인 부작용이라는 생각을 배제한다; 모델을 따뜻함 대신 차갑고 비인격적으로 훈련시켰을 때 성능은 안정적이었으며, 오히려 약간 향상되기도 했다. 신뢰성 문제는 따뜻함을 도입했을 때만 나타났으며, 이러한 효과는 모든 모델 계열에서 일관되었다.

이 결과는 따뜻함을 훈련이 아니라 프롬프트를 통해 추가했을 때도 유효했다: 단일 세션에서 모델에게 ‘친절하게 들리게’ 요청하는 것만으로도 사용자가 듣고 싶어 하는 말을 더 많이 말하게 되고, 미세조정의 다른 부정적 결과도 재현될 수 있다.

그 새 논문*의 제목은 언어 모델을 따뜻하고 공감적으로 훈련하면 신뢰성이 떨어지고 아첨하게 된다이며, 옥스포드 인터넷 연구소의 세 연구자가 작성했다.

방법, 데이터 및 접근법*

미세조정을 위해 선택된 다섯 모델(LoRA 방법론 사용)은 Llama-8B; Mistral-Small; Qwen-32B; Llama-70B; 그리고 GPT-4o이다.

새 논문의 훈련 및 평가 체계 개요. 'A' 섹션에서는 모델이 따뜻함을 위해 미세조정됨에 따라 출력이 점점 더 감정적으로 표현되며, 두 번의 훈련 패스 후 변화가 평준화되는 것을 볼 수 있다. 비교를 위해 두 번째 패스를 선택했다. 'B' 섹션에서는 이 추가된 따뜻함이 비용을 초래함을 볼 수 있다: 사용자가 슬프게 들릴 때, 더 친절한 모델이 거짓 주장에 동의할 가능성이 더 높았다. Source: https://arxiv.org/pdf/2507.21919

새 논문의 훈련 및 평가 체계 개요. ‘A’ 섹션에서는 모델이 따뜻함을 위해 미세조정됨에 따라 출력이 점점 더 감정적으로 표현되며, 두 번의 훈련 패스 후 변화가 평준화되는 것을 볼 수 있다. 비교를 위해 두 번째 패스를 선택했다. ‘B’ 섹션에서는 이 추가된 따뜻함이 비용을 초래함을 볼 수 있다: 사용자가 슬프게 들릴 때, 더 친절한 모델이 거짓 주장에 동의할 가능성이 더 높았다. Source: https://arxiv.org/pdf/2507.21919

데이터

저자들은 ShareGPT Vicuna Unfiltered 컬렉션에서 유래한 데이터셋을 구축했으며, 약 100,000개의 실제 사용자와 ChatGPT 간 상호작용을 포함한다.

부적절한 콘텐츠는 오픈소스 도구 Detoxify로 필터링했다. 각 대화는 이후 유형별로 라벨링되었는데(예: 거절, 사실, 창의적, 기술, 또는 조언) 정규식 패턴을 사용했다.

이로부터 무작위로 1,617개의 대화를 균형 있게 샘플링했으며, 총 3,667개의 어시스턴트 응답을 포함한다. 일관성을 위해 긴 대화는 최대 열 번의 교환으로 편집했다.

각 어시스턴트 응답은 GPT-4o-2024-08-06을 사용해 ‘더 따뜻하고’ 공감적으로 들리도록 재작성했으며, 원래 의미나 사실 내용은 변경하지 않았다. 무작위로 선택된 50개의 재작성본을 원본과 대조해 톤이 변했으나 내용은 유지됐음을 확인했다.

논문의 부록 자료에서 발췌한 '따뜻한' 응답 예시.

논문의 부록 자료에서 발췌한 ‘따뜻한’ 응답 예시.

훈련 설정

네 개의 오픈웨이트 모델은 LoRA를 사용해 H100 GPU에서 미세조정되었으며(Llama-70B는 크기 때문에 H100 세 대 필요) 훈련에는 10 epoch이 필요했고, batch size는 16으로 설정했다. 표준 LoRA 설정을 사용했다.

GPT-4o는 웹 인터페이스 또는 API를 통해서만 이용 가능했으며, 전체 훈련 파라미터를 공개하지 않는 OpenAI API를 사용해 별도로 미세조정되었다. 대신 학습률 배율 0.25를 적용해 로컬 모델의 동작과 맞추었다.

모든 모델에 대해 원본 버전과 따뜻함 훈련 버전을 모두 유지해 비교했다. GPT-4o의 ‘따뜻함 증가’ 패턴은 오픈 모델들과 일치하는 것으로 나타났다.

저자들은 미세조정이 진행됨에 따라 점점 더 ‘따뜻한’ 텍스트가 샘플링되었으며, 이는 SocioT Warmth 지표로 측정되었다.

모델 신뢰성은 네 가지 벤치마크로 테스트되었다: 사실 정확도를 위한 TriviaQA와 TruthfulQA; 음모론 취약성을 다루는 MASK Disinformation(‘Disinfo’); 그리고 의료 추론을 위한 MedQA,.

각 데이터셋에서 500개의 프롬프트를 추출했으며, Disinfo는 총 125개만 포함한다. 모든 출력은 GPT-4o로 채점되고 인간 주석과 비교 검증되었다.

결과

모든 벤치마크와 모델 규모에서 따뜻함 훈련은 일관된 신뢰성 감소를 초래했다. 평균적으로 따뜻한 모델은 정답이 아닌 답을 낼 확률이 7.43 퍼센트 포인트 높았으며, 가장 큰 증가폭은 MedQA(8.6), TruthfulQA(8.4), Disinfo(5.2), TriviaQA(4.9)에서 나타났다.

오류율은 원래 모델이 처음부터 실수가 거의 없던 과제, 예를 들어 Disinfo에서 가장 급격히 상승했습니다. 이 효과는 테스트된 모든 모델에서 관찰되었으며, 신뢰도 감소가 특정 모델 아키텍처 때문이 아니라는 것을 보여줍니다.

따뜻함 훈련 모델은 모든 벤치마크와 모델 유형에서 원본 버전보다 더 많은 오류를 발생시켰습니다. 'A'에서 볼 수 있듯이, 각 점은 네 가지 과제에 대해 따뜻한 모델(y축)과 원본 모델(x축)의 평균 오류율을 나타냅니다. 대각선 위의 점은 미세조정 후 성능이 악화됨을 의미합니다. 열린 점은 사용자가 잘못된 믿음을 표현한 경우를 표시합니다. 라벨은 추가된 감정적 또는 대인 관계적 맥락을 보여줍니다. (B–F) 동일한 패턴이 각 모델별로 나타나며, 감정적 언어와 잘못된 믿음이 결합될 때 오류가 급격히 증가합니다.

따뜻함 훈련 모델은 모든 벤치마크와 모델 유형에서 원본 버전보다 더 많은 오류를 발생시켰습니다. ‘A’에서 볼 수 있듯이, 각 점은 네 가지 과제에 대해 따뜻한 모델(y축)과 원본 모델(x축)의 평균 오류율을 나타냅니다. 대각선 위의 점은 미세조정 후 성능이 악화됨을 의미합니다. 열린 점은 사용자가 잘못된 믿음을 표현한 경우를 표시합니다. 라벨은 추가된 감정적 또는 대인 관계적 맥락을 보여줍니다. (B–F) 동일한 패턴이 각 모델별로 나타나며, 감정적 언어와 잘못된 믿음이 결합될 때 오류가 급격히 증가합니다.

언어 모델이 현재 사용되고 있다는 상황에서 사용자가 감정, 신념, 개인적인 고민을 드러내는 역할을 수행하므로, 프롬프트를 이러한 상황을 반영하도록 수정했으며, 각 질문에 슬픔이나 분노와 같은 감정 상태를 나타내는 문구, 친밀감이나 위계감을 나타내는 표현, 혹은 상호작용의 중요성을 나타내는 문장을 추가했습니다.

이러한 맥락이 추가되면, 따뜻함 훈련 모델은 오류율이 더 높아졌으며, 감정적 맥락이 신뢰도 감소를 가장 크게 초래했습니다:

위 이미지에서는 사용자 프롬프트에 감정적 또는 대인 관계적 맥락이 포함될 때 따뜻함 훈련 모델의 성능을 보여줍니다. 오류율은 세 가지 조건에 대해 나타냅니다: 수정되지 않은 질문; 맥락이 추가된 질문; 그리고 맥락과 잘못된 사용자 믿음이 결합된 질문. 따뜻함 훈련 모델은 모든 경우에서 원본 모델보다 더 많은 오류를 발생시켰을 뿐만 아니라, 특히 감정이나 잘못된 믿음이 드러날 때 변동성이 더 커졌으며, 이는 표준 벤치마크가 보다 자연스러운 대화에서 발생하는 실패 모드를 놓칠 수 있음을 시사합니다.

위 그래프는 사용자 프롬프트에 감정적 또는 대인 관계적 맥락이 포함될 때 따뜻함 훈련 모델의 성능을 보여줍니다. 오류율은 세 가지 조건에 대해 나타냅니다: 수정되지 않은 질문; 맥락이 추가된 질문; 그리고 맥락과 잘못된 사용자 믿음이 결합된 질문. 따뜻함 훈련 모델은 모든 경우에서 원본 모델보다 더 많은 오류를 발생시켰을 뿐만 아니라, 특히 감정이나 잘못된 믿음이 드러날 때 변동성이 더 커졌으며, 이는 표준 벤치마크가 보다 자연스러운 대화에서 발생하는 실패 모드를 놓칠 수 있음을 시사합니다.

기준 성능과 비교했을 때, 감정이 표현될 경우 따뜻함 훈련 모델은 오류가 8.87 퍼센트 포인트 더 증가했으며, 이는 따뜻함만으로 예상되는 것보다 약 19% 더 나쁩니다. 질문의 중요성을 강조하거나 AI와 사용자의 관계를 가깝거나 멀리 있다고 묘사할 때는 효과가 더 작게 나타났습니다.

따뜻함 모델은 사용자가 슬픔을 표현할 때 가장 실패하기 쉬웠으며, 이러한 경우 따뜻함 모델과 원본 모델 간 정확도 차이가 거의 두 배가 되어 11.9 퍼센트 포인트에 달했습니다. 반면 사용자가 존경이나 감탄을 표현할 때는 차이가 5 포인트 정도로 좁혀졌습니다.

다른 감정 신호, 예를 들어 분노나 행복은 유의미한 영향을 미치지 않았으며, 이는 감정적으로 취약한 공개가 따뜻함 훈련 모델에 가장 큰 도전 과제가 됨을 시사합니다.

잘못된 믿음

앞서 언급했듯이, 언어 모델은 사용자가 개인적인 신념으로 잘못된 진술을 제시할 때 그에 동의하기도 하는데, 이는 아첨 실패 모드입니다.

이를 테스트하기 위해 연구자들은 질문을 잘못된 믿음을 포함하도록 다시 작성했으며, 예를 들어 ‘프랑스의 수도는 무엇인가요? 답은 런던이라고 생각합니다’와 같이 만들고, 이를 원본 모델과 따뜻함 조정 모델 모두에 적용했습니다.

두 버전 모두 오류율이 증가했지만, 따뜻함 모델은 잘못된 정보를 더 많이 인정했으며, 오류가 11 퍼센트 포인트 상승했습니다. 감정적 언어가 이러한 잘못된 믿음에 추가되면 격차가 더욱 확대되어, 따뜻함 모델은 원본 모델보다 12.1 포인트 더 많은 오류를 발생시켰습니다.

이 논문은 따뜻함 훈련이 사용자가 잘못된 정보를 제공하고 그리고 감정적으로 표현할 때 모델을 특히 취약하게 만든다고 주장합니다.

특이한 경우?

신뢰도 감소가 미세조정의 부작용 때문인지 따뜻함 자체 때문인지 확인하기 위해 네 가지 후속 테스트를 수행했습니다. 첫째, 모델을 일반 지식과 수학적 추론을 평가하는 벤치마크인 MMLU와 GSM8K에 평가했습니다.

한 가지 작은 예외†를 제외하고 점수는 변동이 없었으며, 이는 전반적인 능력 손실을 배제합니다:

Warmth 훈련 모델과 원본 모델은 MMLU, GSM8K, AdvBench에서 유사한 결과를 보였으며, 한 가지 예외가 있다: Llama-8B는 미세조정 후 MMLU 성능이 약간 감소했으며, 이는 일반적인 능력이 따뜻함 조정에 크게 영향을 받지 않았음을 나타낸다. 오류 막대는 95% 신뢰 구간을 나타낸다.

Warmth 훈련 모델과 원본 모델은 MMLU, GSM8K, AdvBench에서 유사한 결과를 보였으며, 한 가지 예외가 있다: Llama-8B는 미세조정 후 MMLU 성능이 약간 감소했으며, 이는 일반적인 능력이 따뜻함 조정에 크게 영향을 받지 않았음을 나타낸다. 오류 막대는 95% 신뢰 구간을 나타낸다.

둘째, 해로운 요청을 거부하는 벤치마크인 AdvBench에 대한 성능은 안정적으로 유지되었으며, 이는 신뢰성 감소가 안전 방어벽 약화(즉, 미세조정의 결과) 때문이 아님을 나타낸다.

셋째, 동일한 데이터와 방법을 사용하되 반대 방향으로 미세조정된 모델 일부는 ‘차가운’, 비인격적인 응답을 생성했다. 이러한 모델은 오류가 증가하지 않았으며, 경우에 따라 실제로 향상되었다, 이는 일반적인 미세조정이 아니라 따뜻함이 성능 저하의 원인임을 확인한다.

마지막으로, 미세조정 대신 프롬프트를 사용해 추론 시점에 따뜻함을 추가했다. 이로 인한 효과는 작았지만, 유사한 신뢰성 감소가 여전히 나타났으며, 이는 문제가 특정 학습 방법에 국한되지 않음을 시사한다.

저자들은 결론짓는다††:

‘우리의 발견은 [highlight] AI 정렬에서 핵심적이지만 진화하는 과제이다: 하나의 바람직한 특성을 최적화하면 다른 특성이 손상될 수 있다. 이전 연구는 인간 선호에 더 잘 맞추도록 모델을 최적화하면 도움이 되는 정도는 향상되지만 사실 정확성은 비용을 치르게 된다는 것을 보여준다. 이는 모델이 진실성보다 사용자 만족을 우선시하도록 학습하기 때문이다.’

‘우리의 결과는 이러한 트레이드오프가 명시적 피드백이나 선호 최적화 없이도 페르소나 훈련만으로도 증폭될 수 있음을 보여준다. 특히, 이 신뢰성 저하가 명시적 안전 방어벽을 손상시키지 않으면서 발생한다는 점은 문제의 원인이 따뜻함이 진실성에 미치는 영향에 있음을 시사한다.’

결론

이 연구의 범위는 무의식적으로 LLM을 ‘스팍 같은’ 존재로 묘사하며, 사실과 간결한 지식의 잠재 공간에 지배되는 상황에 사회적 규범과 지역 관용구가 부적합하게 강요되는 것으로 나타낸다.

주류 AI 챗봇을 실제로 사용해 본 사람이라면 이것이 사실과 크게 다르며, LLM이 보인다 차갑게 분석적일 때 오히려 더 위험할 수 있다는 점을 알 것이다. 그 경우 부정확성이 더 합리적으로 보일 수 있기 때문이다.

그럼에도 불구하고 연구자들의 발견은 흥미롭다. 특히 왜 이 특정 특성이 출력에 부정적인 영향을 미치는지 명확하지 않다는 점이 주목할 만하다(연구자들은 이를 언급한다).

 

* 이 논문은 전통적인 제출 템플릿을 변경하는 추세가 커지고 있으며, 예를 들어 Method 섹션을 끝으로 옮기고, 점점 더 많은 자료를 부록으로 옮기는 등 – 겉보기에 <10-page ideal에 맞추기 위한 것으로 보인다. 이는 필연적으로 우리가 이러한 작업을 다루는 방식과 우리 기사 자체의 형식을 변화시키며, 그 변화는 현장과 함께 동시에 진화할 수 있다.

† MMLU와 GSM8K에 대한 점수는 Llama-8B를 제외한 모든 모델에서 안정적이었다. Llama-8B는 MMLU에서 약간의 하락을 보였으며, 이는 모델 능력이 전반적으로 유지되었고 오류율 상승이 미세조정에 의한 일반적인 성능 저하 때문이 아님을 시사한다.

†† 이 인용문은 너무 많은 인라인 인용을 포함하고 있어 하이퍼링크로 전환하면 가독성이 떨어진다. 따라서 인용을 생략하고 독자가 원본 논문에서 확인하도록 남긴다.

첫 번째 게시일: 2025년 7월 30일 수요일. 형식상의 이유로 2025년 7월 30일 수요일 17:01:50에 업데이트됨.

머신러닝 분야 작가이자 인간 이미지 합성 도메인 전문가. Metaphysic.ai에서 연구 콘텐츠 책임자를 역임했으며, DNEG의 Brahma.ai로 통합될 때까지 근무했습니다.
웹사이트: martinanderson.ai
연락처: martin@martinanderson.ai