Anderson의 관점

인공지능이 반드시 더 나은 답변을 주지는 않는다 – 예의를 지키는 것이 중요할까?

mm
Unite.AI를 Google의 선호 소스에 추가
Adobe Firefly + post editing

인공지능에 대한 예의 바른 태도는 커피나 레드 와인에 대한 최신 판결만큼 자주 바뀝니다. 한 달에는 칭송받고, 다음 달에는 도전받습니다. 그럼에도 불구하고, 점점 더 많은 사용자가 자신의 프롬프트에 ‘제발’이나 ‘감사합니다’를 추가하고 있습니다. 이는 단순히 습관이나, 거친 대화가 실제 삶으로 전이될 수 있다는 우려 때문이 아니라, 예의가 더 나은 결과와 더 생산적인 결과를 가져온다고 믿기 때문입니다.

이 가정은 사용자와 연구자 사이에서 유행하고 있으며, 프롬프트의 문장 구조는 연구 круг에서 정렬, 안전성, 음调 제어를 위한 도구로 연구되고 있습니다.同時에 사용자 습관은 이러한 기대를 강화하고 재구성합니다.

예를 들어, 2024년 일본의 한 연구에서는 프롬프트의 예의가 대규모 언어 모델의 행동을 변경할 수 있다는 것을 발견했습니다. GPT-3.5, GPT-4, PaLM-2, Claude-2를 영어, 중국어, 일본어 작업에서 테스트하고, 각 프롬프트를 세 가지 예의 수준으로 재작성했습니다. 연구자들은 ‘직접적인’ 또는 ‘무례한’ 단어가 낮은 사실적 정확도와 더 짧은 답변으로 이어진다는 것을 관찰했습니다. 한편, 중간적으로 예의 있는 요청은 더 분명한 설명과 거부가 적은 답변을 생산했습니다.

또한 마이크로소프트는 Co-Pilot와 함께 예의 있는 음调을 권장합니다. 이는 문화적인 관점보다는 성능적인 관점에서입니다.

그러나 조지 워싱턴 대학교의 새로운 연구 논문은 이러한 점점 더 인기 있는 아이디어에 도전합니다. 이는 큰 언어 모델의 출력이 언제 ‘붕괴’할지 예측하는 수학적 프레임워크를 제시합니다. 즉, 출력이 일관성 있는 내용에서 잘못된 또는 위험한 내용으로 전환하는 시점입니다. 이 맥락에서 연구자들은 예의가 이러한 ‘붕괴’를 의미 있게 지연시키거나 방지하지 않는다고 주장합니다.

시작

연구자들은 예의 있는 언어 사용은 일반적으로 프롬프트의 주요 주제와 무관하므로 모델의 초점에 의미 있는 영향을 미치지 않는다고 주장합니다. 이를 뒷받침하기 위해, 연구자들은 단일 주의 헤드가 각 새로운 토큰을 처리함에 따라 내부 방향을 어떻게 업데이트하는지에 대한 자세한 공식화를 제시합니다. 즉, 모델의 행동은 내용을 담은 토큰의 누적적인 영향에 의해 결정됩니다.

결과적으로 예의 있는 언어는 모델의 출력이 저하되기 시작하는 시점에 거의 영향을 미치지 않는다고 주장합니다. 출력의 붕괴를 결정하는 것은 좋은 출력 경로 또는 나쁜 출력 경로와의 토큰의 정렬입니다. 즉, 예의 있는 언어는 모델의 내부 동작에 거의 영향을 미치지 않습니다.

[…이하 생략…]

마무리

현재, 소비자용 대규모 언어 모델에 대한 예의 바른 태도는 두 가지 관점에서 접근됩니다. 하나는 훈련된 시스템이 예의 있는 질문에 더 유용한 답변을 줄 수 있다는 관점입니다. 다른 하나는 인공지능 시스템과 대화할 때 무례한 언어를 사용하면 실제 사회 관계로 전이될 수 있다는 관점입니다.

대규모 언어 모델이 실제 사회적 맥락에서 널리 사용되지 않았기 때문에, 연구 문헌은 후者の 경우를 확인하지 못했지만, 새로운 논문은 이러한 유형의 인공지능 시스템에 대한 인간화의 이점에 대해 일부 의문을 제기합니다.

스坦포드 대학교의 지난 10월 연구에서는 인공지능 플랫폼에서 인간화의 중간 정도를 제안했습니다. 즉, 인공지능 시스템을 인간처럼 대우하면 언어의 의미가 저하될 수 있다고 결론지었습니다. “인간 발화자에게 친절하거나 진정성 있는 것으로 보이는 문장은, 의도나 약속이 없는 인공지능 시스템에서 비어 있고 속임수적인 것으로 간주될 수 있습니다.”

그러나 약 67%의 미국人が 인공지능 챗봇에 대해 예의를 지킨다고 합니다. 대부분은 단순히 ‘옳은 일’이라고 생각했으며, 12%는 기계가いつ उठ고 일어날지 모르기 때문에 조심스럽다고 했습니다.

* 저자가 인라인 인용을 하이퍼링크로 변환한 것입니다. 어느 정도는 임의적이거나 예시적인 하이퍼링크입니다. 저자들은 특정 출판물보다는 폭넓은 주석 인용을 링크합니다.

2025년 4월 30일 처음 게시되었습니다. 2025년 4월 30일 15:29:00에 형식으로 수정되었습니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai