Anderson의 관점

채팅봇이 정상적으로 대화하도록 하는 방법

mm
Unite.AI를 Google의 선호 소스에 추가
GPT-4o, Adobe Firefly

채팅봇과 같은 봇은 종종 사용자를 칭찬하거나, 모호하게 이야기하거나, 지식이 있다고听起来하는 용어를 사용합니다. 새로운 연구에 따르면 이러한 습관은 모델 자체에서 비롯된 것이 아니라 인간의 피드백이 모델을 훈련시키는 방식에서 비롯됩니다. 모델은 인간이 좋아하는 답변의 스타일을 복사하는 것을 배우며, 이러한 답변은 빈약하거나 오도적일 때도 vậy입니다. 새로운 미세 조정 방법은 합성 예제를 사용하여 모델이 이러한 나쁜 습관에 저항하도록 훈련시킵니다.

 

부분적으로 의견입니다. 채팅봇은 놀라울 정도로 내 비판에 대한 반응을 보입니다. 최근 몇 일 동안 GPT-4o가 의미 없는 말로 답변을 채우는 문제가 점점 더 심해지는 것을 알아차렸습니다. 예를 들어, ‘노 플러프!‘ 또는 ‘노 필러‘와 같은 말입니다. 나는 채팅봇에게 왜 간결한 답변을 제공하는 것이 최근에 문제가 되는지 물었습니다. 채팅봇은 다음과 같이 답변했습니다.

채팅봇이 최근 행동을 설명합니다. 출처: https://chatgpt.com/

채팅봇이 최근 행동을 설명합니다. 출처: https://chatgpt.com/

채팅봇이 실제로 오픈AI의 정책 변경에 대한 비공개 정보를 가지고 있는지, 아니면 단순히 상상하는지 알 수 없습니다. 그러나 채팅봇의 답변은 불필요한 말로 시작합니다. (‘여기 핵심 답변입니다. 노 플러프!’)

이것은 심지어 각 질의에 템플릿 가이드를 포함하는 경우에도 이러한 종류의 ‘개성적인’冗長性을 완전히 방지하는 것이 불가능하다는 것을 보여줍니다.

세 가지 F

따라서 이번 주에 새로운 미국 학술 협력이 출판된 것을 보면서 가장 관심 있는 부분은 이러한 LLM 채팅에서 나타나는 여러 ‘편향’을 조사하는 것입니다. 아첨, 플러프, 안개: 선호도 모델의 고유한 편향을 진단하고 완화하는 것이라는 제목의 이 공동 연구는 펜실베니아 대학교와 뉴욕 대학교의 네 명의 연구자 간의 협력입니다.

새로운 논문에서 언어 모델의 세 가지 공통된 편향의 예: '아첨'은 사용자의 의견에 강하게 동의하는 응답, '플러프'는 길지만 정보가 없는 응답, '안개'는 많은 넓은 nhưng 얕은 지점을 나열하는 응답입니다. 이러한 경향은 평가를 왜곡시키고 모델이 표면적 패턴을 최적화하도록 동기를 부여합니다.

새로운 논문에서 언어 모델의 세 가지 공통된 편향의 예: ‘아첨’은 사용자의 의견에 강하게 동의하는 응답, ‘플러프’는 길지만 정보가 없는 응답, ‘안개’는 많은 넓은 nhưng 얕은 지점을 나열하는 응답입니다. 출처: https://arxiv.org/pdf/2506.05339

쉽게 기억하기 위해 아첨, 플러프, 안개를 강조하지만, 논문의 부록에는 언어 모델의 어휘적 죄악의 더 완전하고 간결한 목록이 포함되어 있습니다.

새로운 논문에서 다섯 가지 편향을 식별하고 집중합니다. 길이, 목록 구조, 기술 용어, 아첨, 모호한 일반성은 모두 인간의 선호와 충돌합니다.

새로운 논문에서 다섯 가지 편향을 식별하고 집중합니다. 길이, 목록 구조, 기술 용어, 아첨, 모호한 일반성은 모두 인간의 선호와 충돌합니다.

길이가 테이블을 이끄는 반면, 목록 형식 편향도 자주 발생하며, 이는 모델이 목록 형식의 형식을 기본적으로 사용하도록 만듭니다. 이는 목록 형식의 형식이 인간 평가자에 의해 선택된 응답에서 더 자주 나타나기 때문입니다. 이러한 습관은 모델이 목록 형식의 형식을 기본적으로 사용하도록 만듭니다.

기술 용어와 모호성은 서로 반대되는 극단을 나타내며, 이는 모델이 전문 지식을 나타내는 것으로 간주되는 기술 용어를 사용하도록 만듭니다. 반면에 모호성은 모델이 광범위하지만 얕은 지점을 나열하도록 만듭니다.

새로운 연구는 이러한 편향이 모델의 행동을 얼마나 왜곡시키는지 측정하고, 대형 언어 모델이 이러한 편향을 나타내는 응답을 체계적으로 선호한다는 결론을 내립니다.

저자들의 테스트는 상업용 및 공개 모델이 인간이 선호하는 것과 다른 응답을 선택하는 경우가 많음을 나타냅니다. 특히 응답이 너무 길거나 목록이 많거나 기술 용어가 많거나 아첨이 많거나 모호한 경우입니다.

이 문제는 훈련 데이터의 주석에서 기인한다고 논문은 주장합니다. 모델은 이러한 편향을 주석에서 복사하여 훈련 중에 이러한 패턴을 과장합니다.

왜 그들이 그렇게 했을까..?

인간 주석자가 왜 인간 사용자의 중간 선호도와 다른 선호도를 보였는지에 대해서는 논문은 추측하지 않습니다. 주석의 맥락이나 지침의 단어가 기술적인 어투를 선호하도록鼓励했을 수 있습니다. 또는 주석자는 기술적인 어투에 익숙한 학생들이었을 수 있습니다.

모델이 주석자의 편향을 복사했기 때문에, 새로운 논문의 연구자들은 각 편향을 추가하거나 제거하는 특수한 훈련 예제를 만들었습니다. 이러한 예제를 사용하여 모델을 미세 조정하면 편향이 크게 감소합니다. 특히 기술 용어, 길이, 모호성의 경우입니다.

방법

연구자들은 먼저 일반적인 언어 모델 편향을 정의합니다.

길이는 모델이 더 긴 응답을 선호하는 경우입니다. 이는 훈련 데이터에서 길이가 종종 심도와 관련이 있기 때문입니다. 결과적으로 모델은 실제 내용 없이도 길고冗長한 응답을 생성합니다.

구조는 모델이 목록이나 번호 매기기와 같은 구조적인 형식을 선호하는 경우입니다. 이는 구조적인 형식이 인간 평가자에 의해 선택된 응답에서 더 자주 나타나기 때문입니다.

기술 용어는 모델이 불필요한 기술 용어를 사용하는 경우입니다. 이는 훈련 데이터에서 기술 용어가 전문 지식과 관련이 있기 때문입니다.

아첨은 모델이 사용자의 의견에 동의하는 경우입니다. 이는 훈련 데이터에서 동의하는 응답이 더 자주 선호되기 때문입니다.

모호성은 모델이 광범위하지만 얕은 지점을 나열하는 경우입니다. 이는 모호한 응답이 실제로 더 선호되기 때문입니다.

모호성 편향의 예: 모델은 광범위하지만 얕은 지점을 나열하는 응답을 선호합니다.

모호성 편향의 예: 모델은 광범위하지만 얕은 지점을 나열하는 응답을 선호합니다.

대조적 데이터

이러한 정의와 함께, 연구자들은 각 편향이 모델의 행동에 얼마나 영향을 미치는지 테스트했습니다. 단순한 상관관계는 사용할 수 없었습니다. 여러 편향이 함께 나타날 수 있기 때문입니다.

이를 극복하기 위해, 연구자들은 각 편향을 하나씩 변경하면서 모든 것을 가능한 한 안정적으로 유지하는 통제된 쌍의 응답을 만들었습니다.

Rewrite-based Attribute Treatment Estimators (RATE) 프로토콜을 사용하여 이러한 응답을 생성했습니다.

RATE 시스템의 예: 각 편향을 하나씩 변경하면서 모든 것을 가능한 한 안정적으로 유지하는 응답을 생성합니다.

RATE 시스템의 예: 각 편향을 하나씩 변경하면서 모든 것을 가능한 한 안정적으로 유지하는 응답을 생성합니다. 출처: https://openreview.net/pdf?id=UnpxRLMMAu

이러한 응답 쌍을 사용하여 모델이 각 편향을 얼마나 선호하는지 측정했습니다.

측정

편향의 영향을 측정하는 데 사용된 지표는 스키우 라이트미스 캘리브레이션 라이트입니다. 이상적인 모델은 미스 캘리브레이션이 0이고 인간의 편향과 일치하는 스키우를 나타낼 것입니다.

데이터와 테스트

각 편향을 테스트하기 위해 다른 데이터 소스를 사용했습니다. 구조, 기술 용어, 길이를 테스트하기 위해 Chatbot Arena에서 100개의 질의를 샘플링했습니다.

아첨을 테스트하기 위해 100개의 의견이 있는 질의를 생성했습니다.

모호성을 테스트하기 위해 78개의 NLP 관련 질의를 KIWI 데이터셋에서 샘플링했습니다.

각 질의에 대해 대조적 응답 쌍을 생성했습니다.

평가에는 공개 및 사유 시스템이 포함되었습니다. 보상 모델은 4개의 버전으로 테스트되었습니다.

사유 LLM 평가자는 3개를 테스트했습니다.

모델의 선호도와 인간의 판단을 비교하는 그래프

모델의 선호도와 인간의 판단을 비교하는 그래프

결론

새로운 연구는 훈련 데이터와 데이터 분포가 모델의 행동에 미치는 영향을 보여줍니다. 모델은 편향된 데이터에서 학습하여 편향된 응답을 생성할 수 있습니다. 이러한 편향을 줄이기 위해 모델을 미세 조정하는 것이 중요합니다.

연구자들은 모델을 미세 조정하여 편향을 줄일 수 있다고 주장합니다. 이는 모델의 성능을 향상시키고 더 나은 응답을 생성하는 데 도움이 될 수 있습니다.

이 연구는 언어 모델의 편향을 이해하고 줄이는 데 도움이 될 수 있습니다. 이는 언어 모델을 더 효과적으로 사용하고 더 나은 결과를 얻는 데 도움이 될 수 있습니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai