Anderson의 관점
언어 모델이 대화에서迷失되는 이유

마이크로소프트 연구소와 Salesforce의 새로운 논문에 따르면, 가장 강력한 대규모 언어 모델(Large Language Models, LLM)조차도 지시가 단계적으로 주어지면 기능이 저하된다고 한다. 저자들은 지시가 여러 차례에 걸쳐 주어질 때 성능이 평균 39% 저하된다는 것을 발견했다.

단일 차례 대화(왼쪽)가 가장 좋은 결과를 얻는다. 다중 차례 대화(오른쪽)는 가장 높은 순위와 성능을 가진 LLM조차도 대화에서 功能을 잃어버린다. 출처: https://arxiv.org/pdf/2505.06120
더욱 놀라운 것은 응답의 신뢰성이 급격히 저하된다는 것이다. 유명한 모델인 ChatGPT-4.1과 Gemini 2.5 Pro는 거의 완벽한 답변과 명확한 실패를 번갈아 가며 나타난다. 출력 일관성이 절반 이상 줄어들 수 있다.
이러한 행동을 조사하기 위해, 논문에서는 지시를 작은 조각으로 나누어 대화에 하나씩 주는 방법을 소개한다.
간단히 말하면, 이것은 음식점에서 종업원에게 전체 주문을 한꺼번에 내리는 것과 같다. 또는 협력적으로 문제를 해결하는 것이다.

음식점 대화의 두 가지 극단적인 버전(새 논문에서 가져온 것이 아님, 설명을 위해 사용됨).
위의 예는 고객을 부정적인 ánh으로 비추는 것일 수 있다. 그러나 두 번째 열에 있는 핵심 아이디어는 문제를 명확히 하는 거래적 교환을 나타낸다.
이 설정은 새로운 연구의 방식과 일치한다.
저자들은 LLM이 종종 너무 긴 응답을 생성하고 자신의 통찰력을 계속 사용하는 경향이 있다고 주장한다. 이것은 시스템이 전체 교환을 잃어버리게 할 수 있다.
사실, 연구자들은 많은 사람들이 경험적으로 발견한 것을 발견했다. LLM과 대화가 예상된 결과를 가져오지 않으면, 동일한 정보를 반복하는 새로운 대화를 시작하는 것이 더 나은 결과를 가져올 수 있다.
‘LLM과 대화가 예상된 결과를 가져오지 않으면, 동일한 정보를 반복하는 새로운 대화를 시작하는 것이 더 나은 결과를 가져올 수 있다.’
저자들은 Autogen이나 LangChain과 같은 에이전트 시스템이 해석적 계층으로서 개선될 수 있다고 인정한다.
그러나 저자들은 별도의 추상화 계층이 필요하지 않거나, 또는 원본 LLM에 직접 구축되어야 한다고 주장한다.
‘다중 차례 기능이 LLM의 필수적인 기능은 아니며, 에이전트 프레임워크에 위임될 수 있다…’
그러나 저자들은 테스트를 통해, 에이전트 프레임워크에 의존하는 것이 제한적일 수 있으며, LLM은 다중 차례 상호작용을 기본적으로 지원해야 한다고 결론지었다.
‘에이전트 프레임워크에 의존하는 것이 제한적일 수 있으며, LLM은 다중 차례 상호작용을 기본적으로 지원해야 한다.’
분산된 대화
새로운 방법은 기존의 단일 차례 지시를 작은 조각으로 나누어 대화 중에 하나씩 주는 방식이다.
각 원래 지시는 하나의 완전한 프롬프트로, 전체 작업을 하나의 차례에 전달한다. 분산된 버전은 여러 작은 부분으로 나누어지며, 각 조각은 하나의 정보만 추가한다.

완전한 프롬프트와 분산된 버전의 짝을 이루는 지시.
첫 번째 조각은 작업의 주요 목표를 소개한다. 나머지 조각은 명확화하는 세부 사항을 제공한다. 함께 전체 작업을 전달하지만, 여러 차례에 걸쳐 자연스럽게 전달된다.
각 시뮬레이션은 세 가지 구성 요소 사이에서 진행된다: 어시스턴트, 사용자, 시스템.
대화는 사용자가 첫 번째 조각을 공개하고 어시스턴트가 자유롭게 응답하는 것으로 시작된다. 시스템은 응답을 분류하고, 다음 차례에 사용자가 추가적인 조각을 공개한다.
모델이 답변을 시도하면, 별도의 구성 요소가 관련된 스팬만을 추출하여 평가한다.
이러한 초기 테스트는 모델이 아직 공유되지 않은 정보에 대해 질문하는 경우가 많았으므로, 저자들은 조각을 고정된 순서로 공개하는 아이디어를 버렸다.
대신, 시뮬레이터는 대화가 진행되는 방식에 따라 다음에 공개할 조각을 결정한다.
사용자 시뮬레이터는 GPT-4o-mini를 사용하여 구현되었으며, 전체 지시와 대화 기록에 접근할 수 있었다.
사용자 시뮬레이터는 또한 각 조각을 재구성하여 대화의 흐름을 유지했다.
어시스턴트는 대화가 시작되기 전에 작업을 완료하는 데 필요한 기본 정보만 받았다.
GPT-4o-mini는 또한 어시스턴트의 응답을 분류하고, 최종 답변을 추출하는 데 사용되었다.
시뮬레이션 시나리오
저자들은 다섯 가지 유형의 시뮬레이션을 사용하여 모델의 행동을 다른 조건에서 테스트했다.
각 시뮬레이션은 지시의 일부가 공개되는 방식의 변형이다.
전체 설정에서는 모델이 전체 지시를 단일 차례에 받는다.
분산된 설정에서는 지시가 여러 부분으로 나누어져 하나씩 전달된다.
연결된 설정에서는 조각이 다시 하나의 목록으로 연결된다.
요약 설정에서는 마지막 차례에 이전 모든 조각이 다시 요약된다.
눈사람 설정에서는 모든 이전 조각이 매 차례마다 반복된다.

분산된 지시를 사용한 시뮬레이션 유형.
작업과 지표
여섯 가지 생성 작업을 선택하여 프로그래밍과 자연어 도메인을 모두 다루었다.
모델의 성능은 세 가지 핵심 지표를 사용하여 측정되었다: 평균 성능, 적성, 불안정성.
모든 점수는 0-100의 척도로 일관성을 보장하기 위해 조정되었다.
지표는 각 지시에 대해 계산되었으며, 전체적인 모델 성능의 그림을 제공하기 위해 평균화되었다.

실험에 사용된 여섯 가지 분산된 작업.
경쟁자와 테스트
초기 시뮬레이션에서는 600개의 지시가 여섯 가지 작업에 걸쳐 분산되었으며, 세 가지 유형의 대화가 시뮬레이션되었다.
모델당 10개의 대화가 실행되어 총 20만 개의 시뮬레이션이 생성되었다.
15개의 모델이 테스트되었으며, 다양한 제공업체와 아키텍처를 포함했다.
OpenAI 모델은 GPT-4o, GPT-4o-mini, GPT-4.1, o3를 포함했다.
Anthropic 모델은 Claude 3 Haiku와 Claude 3.7 Sonnet을 포함했다.
Google 모델은 Gemini 2.5 Flash와 Gemini 2.5 Pro를 포함했다.
Meta 모델은 Llama 3.1-8B-Instruct, Llama 3.3-70B-Instruct, Llama 4 Scout-17B-16E를 포함했다.
다른 참가자는 OLMo 2 13B, Phi-4, Command-A, Deepseek-R1을 포함했다.
두 가지 “사고” 모델(o3와 R1)의 경우, 토큰 제한을 10,000으로 늘렸다.

모델당 평균 성능 점수.
저자들은 다음을 말한다.
‘모델의 성능은 모든 작업에서 FULL과 SHARDED 성능을 비교했을 때 저하된다. 이것을 우리는 ‘대화에서迷失’이라고 부른다. 모델은 랩에서 완전한 지시와 단일 차례 대화를 통해 훌륭한 성능을 보이지만, 더 현실적인 설정에서 지시가 분산되고 다중 차례인 경우에 같은 작업에서 어려움을 겪는다.’
연결된 점수는 평균 95%의 전체 점수를 보였다. 이는 분산된 설정에서 성능 저하가 정보 손실로 인한 것이 아니라는 것을 나타낸다.
작은 모델은 연결된 설정에서 더 큰 성능 저하를 보였다.
저자들은 다음과 같이 관찰한다.
‘더 나은 모델은 다중 차례 설정에서 약간 더 높은 적성을 보이지만, 모든 모델은 유사한 수준의 불안정성을 보인다. 즉, 다중 차례 설정에서 모든 모델은 매우 높은 불안정성을 보이며, 동일한 지시에서 최고와 최저 시뮬레이션 रन 사이의 성능은 평균 50점 저하된다.’
신뢰성
적성과 신뢰성의 관계는 단일 차례 시뮬레이션에서 명확했지만, 다중 차례 조건에서 깨졌다.
적성은 약간만 저하되었지만, 신뢰성은 평균 2배 증가했다.
모델은 단일 차례 프롬프트에서 안정적이었지만, 지시가 분산되면 매우 불규칙해졌다.

적성과 신뢰성의 개요.
모델의 응답은 동일한 작업에서 50점까지 변할 수 있었다.
저자들은 다음과 같이 말한다.
‘모델은 다중 차례 설정에서 매우 높은 불안정성을 보이며, 동일한 지시에서 최고와 최저 시뮬레이션 रन 사이의 성능은 평균 50점 저하된다. 이것은 모델의 능력이 아니라 일관성의 문제이다.’
온도 제어
별도의 실험은 불안정성이 단순히 무작위성의 결과인지 테스트했다.
저자들은 어시스턴트와 사용자 시뮬레이터의 온도 설정을 세 가지 값(1.0, 0.5, 0.0)으로 변경했다.
단일 차례 형식에서는 온도 설정을 낮추면 신뢰성이 크게 향상되었다.
그러나 분산된 설정에서는 동일한 개입이 거의 효과가 없었다.

다양한 온도 조합에 대한 불안정성 점수.
어시스턴트와 사용자 시뮬레이터의 온도 설정을 모두 0으로 설정해도, 불안정성은 여전히 높았다.
이것은 다중 차례 대화에서 나타나는 불안정성이 단순한 무작위성의 결과가 아니라, 모델이 분산된 입력을 처리하는 방식의 구조적 약점임을 시사한다.
의미
저자들은 강한 단일 차례 성능이 다중 차례 신뢰성을 보장하지 않는다고 주장한다.
저자들은 또한 불안정성이 샘플링 아티팩트가 아니라, 현재 모델이 발전하는 입력을 처리하는 방식의 근본적인 제한이라고 주장한다.
저자들은 다중 차례 능력이 LLM의 핵심 능력으로서 다루어져야 한다고 주장한다.
저자들은 결과가 실제 문제의 규모를 과소평가할 수 있다고 주목한다.
저자들은 다음과 같이 결론지었다.
‘우리는 수행한 시뮬레이션이 LLM의 다중 차례 능력에 대한 선한 테스트 환경을 나타낸다고 믿는다. 그러나 시뮬레이션의 조건이 너무 단순화되어 있으므로, 실험에서 관찰된 저하는 실제 환경에서 LLM이 대화에서迷失되는 빈도보다 과소평가된 것일 수 있다.’
결론
LLM과 대화하는 사람들은 이러한 문제를 실제로 경험했을 것이다.
대화가 예상된 결과를 가져오지 않으면, 동일한 정보를 반복하는 새로운 대화를 시작하는 것이 더 나은 결과를 가져올 수 있다.
이것은 실제로 많은 사람들이 직관적으로 발견한 것이다.
논문은 더 많은 질문을 제기한다.
첫 번째로 게시된 2025년 5월 12일












