Anderson의 관점

인공지능이 반드시 더 나은 답변을 주지는 않는다 – 예의를 지키는 것이 중요할까?

mm
Unite.AI를 Google의 선호 소스에 추가
Adobe Firefly + post editing

인공지능에 대한 예의 바른 태도는 커피나 레드 와인에 대한 최신 판결만큼 자주 바뀝니다. 한 달에는 칭송받고, 다음 달에는 도전받습니다. 그럼에도 불구하고, 점점 더 많은 사용자가 자신의 프롬프트에 ‘제발’이나 ‘감사합니다’를 추가하고 있습니다. 이는 단순히 습관이나, 거친 대화가 실제 삶으로 전이될 수 있다는 우려 때문이 아니라, 예의가 더 나은 결과와 더 생산적인 결과를 가져온다고 믿기 때문입니다.

이 가정은 사용자와 연구자 사이에서 유행하고 있으며, 프롬프트의 문장 구조는 연구계에서 정렬, 안전성, 말투 제어를 위한 도구로 연구되고 있습니다.동시에 사용자 습관은 이러한 기대를 강화하고 재구성합니다.

예를 들어, 2024년 일본의 한 연구에서는 프롬프트의 예의가 대규모 언어 모델의 행동을 변경할 수 있다는 것을 발견했습니다. GPT-3.5, GPT-4, PaLM-2, Claude-2를 영어, 중국어, 일본어 작업에서 테스트하고, 각 프롬프트를 세 가지 예의 수준으로 재작성했습니다. 연구자들은 ‘직접적인’ 또는 ‘무례한’ 단어가 낮은 사실적 정확도와 더 짧은 답변으로 이어진다는 것을 관찰했습니다. 한편, 중간적으로 예의 있는 요청은 더 분명한 설명과 거부가 적은 답변을 생산했습니다.

또한 마이크로소프트는 Co-Pilot와 함께 예의 있는 말투를 권장합니다. 이는 문화적인 관점보다는 성능적인 관점에서입니다.

(MSFT )

그러나 조지 워싱턴 대학교의 새로운 연구 논문은 이러한 점점 더 인기 있는 아이디어에 도전합니다. 이는 큰 언어 모델의 출력이 언제 ‘붕괴’할지 예측하는 수학적 프레임워크를 제시합니다. 즉, 출력이 일관성 있는 내용에서 잘못된 또는 위험한 내용으로 전환하는 시점입니다. 이 맥락에서 연구자들은 예의가 이러한 ‘붕괴’를 의미 있게 지연시키거나 방지하지 않는다고 주장합니다.

시작

연구자들은 예의 있는 언어 사용은 일반적으로 프롬프트의 주요 주제와 무관하므로 모델의 초점에 의미 있는 영향을 미치지 않는다고 주장합니다. 이를 뒷받침하기 위해, 연구자들은 단일 주의 헤드가 각 새로운 토큰을 처리함에 따라 내부 방향을 어떻게 업데이트하는지에 대한 자세한 공식화를 제시합니다. 즉, 모델의 행동은 내용을 담은 토큰의 누적적인 영향에 의해 결정됩니다.

결과적으로 예의 있는 언어는 모델의 출력이 저하되기 시작하는 시점에 거의 영향을 미치지 않는다고 주장합니다. 출력의 붕괴를 결정하는 것은 좋은 출력 경로 또는 나쁜 출력 경로와의 토큰의 정렬입니다. 즉, 예의 있는 언어는 모델의 내부 동작에 거의 영향을 미치지 않습니다.

전환점

연구진은 정중한 표현이 프롬프트의 핵심 주제와 대체로 무관하기 때문에 모델의 초점에 의미 있는 영향을 주지 않는다고 주장한다. 이를 설명하기 위해 단일 어텐션 헤드가 새 토큰을 처리할 때 내부 방향을 어떻게 갱신하는지 수학적으로 정식화했다. 모델 행동은 내용을 담은 토큰들의 누적 영향으로 결정된다.

따라서 정중한 표현은 출력이 저하되기 시작하는 시점에 거의 영향을 주지 않는다. 논문에 따르면 전환점은 의미 있는 토큰들이 좋은 출력 경로와 나쁜 출력 경로 중 어느 쪽에 더 정렬되는지로 결정되며, 사회적으로 공손한 단어의 존재로 결정되지 않는다.

출력이 무너지는 과정

논문은 생성 과정에서 모델의 내부 컨텍스트 벡터가 어떻게 이동하는지 살핀다. 각 토큰이 추가될 때 벡터의 방향이 바뀌며, 다음 토큰은 후보 중 이 벡터와 가장 잘 정렬되는 항목으로 선택된다. 프롬프트가 잘 구성된 내용으로 향하는 동안 답변은 안정적이고 정확하지만, 시간이 지나 방향성이 역전되면 점점 주제에서 벗어나거나 틀리고 내부적으로 모순된 출력으로 이동할 수 있다.

저자들이 n*로 정의한 전환점은 컨텍스트 벡터가 좋은 출력보다 나쁜 출력 벡터에 더 가까워지는 순간이다. 이후의 토큰은 모델을 잘못된 경로로 더 밀어 넣어 결함 있는 출력을 강화한다. n*는 내부 방향이 좋은 출력과 나쁜 출력에 똑같이 정렬되는 지점으로 계산되며, 학습 말뭉치와 사용자 프롬프트가 형성한 임베딩 공간의 기하가 교차 시점을 결정한다.

정중한 단어는 핵심 주제와 의미 있게 연결되지 않아 모델 내부 공간의 결정과 무관한 영역에 놓인다는 설명이다. 이런 표현을 추가하면 고려할 벡터 수는 늘지만 어텐션 궤적은 바뀌지 않는다. 즉 정중함은 존재하지만 비활성인 통계적 잡음처럼 작동해 n*를 그대로 둔다. 저자들은 AI 답변이 탈선하는지는 토큰 임베딩을 제공하는 학습과 프롬프트의 실질적 토큰에 달렸으며, 사용자가 공손했는지에는 달리지 않는다고 말한다.

연구 모델은 단일 어텐션 헤드와 선형 토큰 역학에 초점을 둔 의도적으로 단순한 구조다. 각 토큰은 비선형 변환이나 게이팅 없이 벡터 덧셈으로 내부 상태를 갱신한다. 이 덕분에 정확한 결과와 명확한 기하학적 설명을 얻었고, 전환점 공식은 시뮬레이션과 일치했다.

현대 LLM에도 적용될까?

정밀한 결과는 모델을 단순하게 유지했기 때문에 가능하다. 저자들도 Claude와 ChatGPT 계열 같은 복잡한 다중 헤드 모델에서 검증해야 한다고 인정한다. 다만 단일 헤드에서 일어나는 전환이 여러 헤드와 층의 결합으로 증폭되거나 동기화될 수 있다고 본다. 한 사람이 절벽에서 떨어질 때 연결된 사람들을 함께 끌고 가는 상황에 비유했다.

다중 헤드 어텐션에서는 전문화된 헤드 사이의 상호작용이 이런 전환을 완충하거나 가릴 수도 있다. 저자들은 그 복잡성을 인정하면서도 헤드가 느슨하게 결합되는 경우가 많아 내부 붕괴가 억제되기보다 강화될 가능성도 있다고 주장한다. 생산용 LLM을 대상으로 한 확장이나 실증 시험이 없으므로 결론은 아직 검증되지 않았다. 그러나 메커니즘이 충분히 구체적이어서 후속 연구가 규모 있게 이론을 반박하거나 확인할 수 있다.

마무리

소비자용 LLM에 공손하게 말해야 한다는 생각에는 두 관점이 있다. 학습된 시스템이 정중한 질문에 더 유용하게 답할 수 있다는 실용적 관점과, 무례하고 퉁명스러운 대화 습관이 실제 사회관계로 번질 수 있다는 관점이다. 실제 사회 맥락에서 LLM이 충분히 오래 사용되지 않았기 때문에 후자는 아직 연구로 확정하기 어렵지만, 새 논문은 AI를 인간처럼 대하는 이점에 의문을 제기한다.

지난 10월 Stanford 연구는 2020년 연구와 달리 LLM을 인간처럼 대하면 언어의 의미가 약화될 위험이 있다고 제안했다. 의례적인 공손함은 원래의 사회적 의미를 잃을 수 있다. 인간에게서 친절하거나 진실하게 들리는 말도, 의미 있는 약속이나 의도가 없는 AI가 말하면 공허하고 기만적으로 받아들여질 수 있다는 것이다.

그럼에도 2025년 Future Publishing 조사에서 미국인의 약 67%는 AI 챗봇에 예의를 지킨다고 답했다. 대부분은 단순히 그것이 옳은 행동이기 때문이라고 했고, 12%는 언젠가 기계가 봉기할 가능성에 대비해 조심한다고 답했다.

저자의 본문 인용을 하이퍼링크로 변환했다. 일부는 저자가 특정 간행물 하나가 아니라 여러 각주를 제시했기 때문에 예시적 링크다.

2025년 4월 30일 수요일 최초 게재. 같은 날 15:29에 형식을 수정했다.

복원된 연구 도표

사용자 프롬프트에서 좋은 토큰이 나쁜 토큰으로 전환되는 단순화된 어텐션 헤드
사용자 프롬프트에서 좋은 토큰이 나쁜 토큰으로 전환되는 단순화된 어텐션 헤드
저자 모델에서 전환점 n*가 형성되는 기하학적 구조와 시뮬레이션 비교
저자 모델에서 전환점 n*가 형성되는 기하학적 구조와 시뮬레이션 비교
프롬프트가 좋은 내용과 나쁜 내용 중 어느 쪽으로 기울어지는지에 따른 n*의 변화
프롬프트가 좋은 내용과 나쁜 내용 중 어느 쪽으로 기울어지는지에 따른 n*의 변화

자료와 참조 링크

머신러닝 분야 작가이자 인간 이미지 합성 도메인 전문가. Metaphysic.ai에서 연구 콘텐츠 책임자를 역임했으며, DNEG의 Brahma.ai로 통합될 때까지 근무했습니다.
웹사이트: martinanderson.ai
연락처: martin@martinanderson.ai