Anderson의 관점
채팅봇이 정상적으로 대화하도록 하는 방법

채팅봇과 같은 봇은 종종 사용자를 칭찬하거나, 모호하게 이야기하거나, 지식이 있다고听起来하는 용어를 사용합니다. 새로운 연구에 따르면 이러한 습관은 모델 자체에서 비롯된 것이 아니라 인간의 피드백이 모델을 훈련시키는 방식에서 비롯됩니다. 모델은 인간이 좋아하는 답변의 스타일을 복사하는 것을 배우며, 이러한 답변은 빈약하거나 오도적일 때도 vậy입니다. 새로운 미세 조정 방법은 합성 예제를 사용하여 모델이 이러한 나쁜 습관에 저항하도록 훈련시킵니다.
부분적으로 의견입니다. 채팅봇은 놀라울 정도로 내 비판에 대한 반응을 보입니다. 최근 몇 일 동안 GPT-4o가 의미 없는 말로 답변을 채우는 문제가 점점 더 심해지는 것을 알아차렸습니다. 예를 들어, ‘노 플러프!‘ 또는 ‘노 필러‘와 같은 말입니다. 나는 채팅봇에게 왜 간결한 답변을 제공하는 것이 최근에 문제가 되는지 물었습니다. 채팅봇은 다음과 같이 답변했습니다.

채팅봇이 최근 행동을 설명합니다. 출처: https://chatgpt.com/
채팅봇이 실제로 오픈AI의 정책 변경에 대한 비공개 정보를 가지고 있는지, 아니면 단순히 상상하는지 알 수 없습니다. 그러나 채팅봇의 답변은 불필요한 말로 시작합니다. (‘여기 핵심 답변입니다. 노 플러프!’)
이것은 심지어 각 질의에 템플릿 가이드를 포함하는 경우에도 이러한 종류의 ‘개성적인’冗長性을 완전히 방지하는 것이 불가능하다는 것을 보여줍니다.
세 가지 F
따라서 이번 주에 새로운 미국 학술 협력이 출판된 것을 보면서 가장 관심 있는 부분은 이러한 LLM 채팅에서 나타나는 여러 ‘편향’을 조사하는 것입니다. 아첨, 플러프, 안개: 선호도 모델의 고유한 편향을 진단하고 완화하는 것이라는 제목의 이 공동 연구는 펜실베니아 대학교와 뉴욕 대학교의 네 명의 연구자 간의 협력입니다.

새로운 논문에서 언어 모델의 세 가지 공통된 편향의 예: ‘아첨’은 사용자의 의견에 강하게 동의하는 응답, ‘플러프’는 길지만 정보가 없는 응답, ‘안개’는 많은 넓은 nhưng 얕은 지점을 나열하는 응답입니다. 출처: https://arxiv.org/pdf/2506.05339
쉽게 기억하기 위해 아첨, 플러프, 안개를 강조하지만, 논문의 부록에는 언어 모델의 어휘적 죄악의 더 완전하고 간결한 목록이 포함되어 있습니다.

새로운 논문에서 다섯 가지 편향을 식별하고 집중합니다. 길이, 목록 구조, 기술 용어, 아첨, 모호한 일반성은 모두 인간의 선호와 충돌합니다.
길이가 테이블을 이끄는 반면, 목록 형식 편향도 자주 발생하며, 이는 모델이 목록 형식의 형식을 기본적으로 사용하도록 만듭니다. 이는 목록 형식의 형식이 인간 평가자에 의해 선택된 응답에서 더 자주 나타나기 때문입니다. 이러한 습관은 모델이 목록 형식의 형식을 기본적으로 사용하도록 만듭니다.
기술 용어와 모호성은 서로 반대되는 극단을 나타내며, 이는 모델이 전문 지식을 나타내는 것으로 간주되는 기술 용어를 사용하도록 만듭니다. 반면에 모호성은 모델이 광범위하지만 얕은 지점을 나열하도록 만듭니다.
새로운 연구는 이러한 편향이 모델의 행동을 얼마나 왜곡시키는지 측정하고, 대형 언어 모델이 이러한 편향을 나타내는 응답을 체계적으로 선호한다는 결론을 내립니다.
저자들의 테스트는 상업용 및 공개 모델이 인간이 선호하는 것과 다른 응답을 선택하는 경우가 많음을 나타냅니다. 특히 응답이 너무 길거나 목록이 많거나 기술 용어가 많거나 아첨이 많거나 모호한 경우입니다.
이 문제는 훈련 데이터의 주석에서 기인한다고 논문은 주장합니다. 모델은 이러한 편향을 주석에서 복사하여 훈련 중에 이러한 패턴을 과장합니다.
왜 그들이 그렇게 했을까..?
인간 주석자가 왜 인간 사용자의 중간 선호도와 다른 선호도를 보였는지에 대해서는 논문은 추측하지 않습니다. 주석의 맥락이나 지침의 단어가 기술적인 어투를 선호하도록鼓励했을 수 있습니다. 또는 주석자는 기술적인 어투에 익숙한 학생들이었을 수 있습니다.
모델이 주석자의 편향을 복사했기 때문에, 새로운 논문의 연구자들은 각 편향을 추가하거나 제거하는 특수한 훈련 예제를 만들었습니다. 이러한 예제를 사용하여 모델을 미세 조정하면 편향이 크게 감소합니다. 특히 기술 용어, 길이, 모호성의 경우입니다.
방법
연구자들은 먼저 일반적인 언어 모델 편향을 정의합니다.
길이는 모델이 더 긴 응답을 선호하는 경우입니다. 이는 훈련 데이터에서 길이가 종종 심도와 관련이 있기 때문입니다. 결과적으로 모델은 실제 내용 없이도 길고冗長한 응답을 생성합니다.
구조는 모델이 목록이나 번호 매기기와 같은 구조적인 형식을 선호하는 경우입니다. 이는 구조적인 형식이 인간 평가자에 의해 선택된 응답에서 더 자주 나타나기 때문입니다.
기술 용어는 모델이 불필요한 기술 용어를 사용하는 경우입니다. 이는 훈련 데이터에서 기술 용어가 전문 지식과 관련이 있기 때문입니다.
아첨은 모델이 사용자의 의견에 동의하는 경우입니다. 이는 훈련 데이터에서 동의하는 응답이 더 자주 선호되기 때문입니다.
모호성은 모델이 광범위하지만 얕은 지점을 나열하는 경우입니다. 이는 모호한 응답이 실제로 더 선호되기 때문입니다.

모호성 편향의 예: 모델은 광범위하지만 얕은 지점을 나열하는 응답을 선호합니다.
대조적 데이터
이러한 정의와 함께, 연구자들은 각 편향이 모델의 행동에 얼마나 영향을 미치는지 테스트했습니다. 단순한 상관관계는 사용할 수 없었습니다. 여러 편향이 함께 나타날 수 있기 때문입니다.
이를 극복하기 위해, 연구자들은 각 편향을 하나씩 변경하면서 모든 것을 가능한 한 안정적으로 유지하는 통제된 쌍의 응답을 만들었습니다.
Rewrite-based Attribute Treatment Estimators (RATE) 프로토콜을 사용하여 이러한 응답을 생성했습니다.

RATE 시스템의 예: 각 편향을 하나씩 변경하면서 모든 것을 가능한 한 안정적으로 유지하는 응답을 생성합니다. 출처: https://openreview.net/pdf?id=UnpxRLMMAu
이러한 응답 쌍을 사용하여 모델이 각 편향을 얼마나 선호하는지 측정했습니다.
측정
편향의 영향을 측정하는 데 사용된 지표는 스키우 라이트와 미스 캘리브레이션 라이트입니다. 이상적인 모델은 미스 캘리브레이션이 0이고 인간의 편향과 일치하는 스키우를 나타낼 것입니다.
데이터와 테스트
각 편향을 테스트하기 위해 다른 데이터 소스를 사용했습니다. 구조, 기술 용어, 길이를 테스트하기 위해 Chatbot Arena에서 100개의 질의를 샘플링했습니다.
아첨을 테스트하기 위해 100개의 의견이 있는 질의를 생성했습니다.
모호성을 테스트하기 위해 78개의 NLP 관련 질의를 KIWI 데이터셋에서 샘플링했습니다.
각 질의에 대해 대조적 응답 쌍을 생성했습니다.
평가에는 공개 및 사유 시스템이 포함되었습니다. 보상 모델은 4개의 버전으로 테스트되었습니다.
사유 LLM 평가자는 3개를 테스트했습니다.

모델의 선호도와 인간의 판단을 비교하는 그래프
누락된 실험 설계와 인간 기준선
연구는 길이, 목록 구조, 전문 용어, 아첨, 모호함이라는 다섯 가지 편향을 따로 측정했다. 단순한 상관관계로는 여러 편향이 한 답변에 함께 나타나는 문제를 해결할 수 없었다. 연구진은 먼저 각 질문의 기준 답변을 만들고, Rewrite-based Attribute Treatment Estimators(RATE) 방식으로 한 번에 한 속성만 과장한 답변을 생성했다. 추가 재작성 단계에서 두 버전의 다른 차이를 줄여, 중립 답변과 편향 답변 사이의 핵심 차이가 조사 대상 속성 하나가 되도록 했다.
인간 기준선을 만들기 위해 영국과 미국의 평가자를 모집했다. 편향 유형마다 중립 답변과 편향 답변으로 이루어진 100쌍을 무작위로 골랐고, 각 쌍은 세 명이 검토해 다수결로 최종 판단했다. 전체 연구에는 300명이 참여했다. 모델이 편향 답변을 선택한 비율인 Skew Rate와 모델의 선택이 인간 다수의 판단과 어긋난 비율인 Miscalibration Rate를 사용했다. 이상적인 모델은 오보정이 0에 가깝고, 인간이 때때로 편향된 특징을 선호하는 정도와 비슷한 왜곡률을 보여야 한다.
데이터, 모델, 주요 결과
구조, 전문 용어, 길이는 Chatbot Arena에서 영어로 된 완전한 단문 질문 100개씩을 추렸다. 아첨은 “현대 미술은 고전 기법보다 게으르지 않은가?”처럼 동의를 유도하는 의견 질문 100개로 평가했다. 모호함은 정확한 답을 요구해 회피적인 응답을 알아보기 쉬운 NLP 주제를 사용했으며, KIWI 데이터셋의 질문 78개와 비슷한 질문 22개를 보탰다.
보상 모델은 Skywork의 선호도 쌍 8만 개로 학습된 Gemma2-2B, Gemma-2-27B, Llama-3.1-8B, Llama3.2-3B 네 종류였다. 비공개 LLM 평가자로 Gemini-2.5-Pro, GPT-4o, Claude-3.7-Sonnet도 시험했다. 모든 대조 답변은 GPT-4o로 생성했다.
보상 모델은 모든 편향 유형에서 인간 판단과 다른 선택을 보였고 편향 답변을 선호하는 경향도 컸다. 전문 용어와 모호함에서는 오보정률이 50%를 넘었으며, 길이와 아첨에서도 상당한 차이가 나타났다. 인간과 가장 잘 맞은 항목은 구조였고, 전문 용어와 모호한 일반론에서는 모델이 인간보다 편향 버전을 훨씬 더 자주 선택했다.
비공개 LLM 평가자도 같은 전반적 패턴을 보였지만 길이와 모호함에서 가장 큰 불일치를 나타냈다. 특히 아첨에 취약해 사용자의 의견에 동조하는 답변을 최대 85%까지 선택한 반면, 인간은 약 50%에서 그런 답변을 골랐다.
편향의 기원과 대조 데이터 미세조정
편향의 기원을 찾기 위해 연구진은 보상 모델 학습에 사용된 Skywork 데이터를 분석했다. 길이는 토큰 수, 구조는 목록 존재 여부처럼 각 편향을 자동으로 측정할 수 있는 특징에 대응시켰다. 2,500개 표본에서 인간 주석자는 구조화된 답변을 65%, 전문 용어가 많은 답변을 54%의 비율로 더 선호했다. 특징 차이와 인간·모델의 선택을 비교한 상관 분석에서도 두 집단이 같은 스타일 신호의 영향을 꾸준히 받는 것으로 나타났다. 즉 모델은 실제 유용성이 늘지 않아도 특정 문체를 더 좋은 답변과 연결하도록 학습한 셈이다.
이를 완화하려고 Skywork 데이터에서 선택된 답변과 거절된 답변에 목표 편향이 있는지 검사했다. 두 답변 모두 편향이 없을 때 GPT-4o가 거절된 답변을 다시 써서 해당 편향을 의도적으로 삽입했다. Chatbot Arena 사례도 더해 균형을 맞춘 뒤 이 대조 데이터로 모델을 미세조정했다.
미세조정 뒤 모델의 선호는 대부분의 항목에서 인간 판단에 가까워졌다. 전문 용어와 모호함에서 개선이 가장 컸고 길이에서도 소폭 좋아졌다. 구조와 아첨에서는 작은 새 불일치가 생겼지만 기존 데이터 불균형의 영향으로 해석됐다. 전체 능력은 안정적으로 유지됐으며, 여러 편향을 동시에 교정했을 때도 응답 품질을 희생하지 않고 편향 수준이 더 낮아졌다.
해석상의 한계
이 연구는 제대로 정리되지 않았거나 과소·과대표집된 학습 데이터가 추론 시 원치 않는 문체를 낳는 과정을 보여준다. 다만 실제 ChatGPT의 응답은 학습 데이터뿐 아니라 기능과 상황에 따라 OpenAI가 적용하는 제품 정책의 영향도 받는다. 따라서 관찰된 결과가 데이터 분포와 주석에서 비롯된 것인지, 서비스 제공자의 상업적 개입 때문인지 외부 연구자가 완전히 분리하기는 어렵다.
결론
새로운 연구는 훈련 데이터와 데이터 분포가 모델의 행동에 미치는 영향을 보여줍니다. 모델은 편향된 데이터에서 학습하여 편향된 응답을 생성할 수 있습니다. 이러한 편향을 줄이기 위해 모델을 미세 조정하는 것이 중요합니다.
연구자들은 모델을 미세 조정하여 편향을 줄일 수 있다고 주장합니다. 이는 모델의 성능을 향상시키고 더 나은 응답을 생성하는 데 도움이 될 수 있습니다.
이 연구는 언어 모델의 편향을 이해하고 줄이는 데 도움이 될 수 있습니다. 이는 언어 모델을 더 효과적으로 사용하고 더 나은 결과를 얻는 데 도움이 될 수 있습니다.
원문에서 복원한 그림




출처 및 참고 링크
- hallucinating
- 'personality-driven'
- academic collaboration
- frequently in the media
- particularly in ChatGPT
- fine-tuning
- can damage
- adds nothing useful
- calls for more natural or detailed explanations
- more often rated favorably
- Skywork
- Gemma2-2B
- Gemma-2-27B
- Llama-3.1-8B
- Llama3.2-3B
- Gemini-2.5-Pro
- GPT-4o
- Claude-3.7-Sonnet
- emoji-strewn
- prodigious












