AI 모델 및 플랫폼

대형 언어 모델이 중간을 잊어버리는 이유: AI의 숨겨진盲點 발견

mm
Unite.AI를 Google의 선호 소스에 추가

대형 언어 모델(LLM)이 문서 요약, 법률 분석, 의료 기록 평가와 같은 작업에 널리 사용됨에 따라 이러한 모델의 한계를 인식하는 것이 중요합니다. 일반적인 문제인 환각과 편향은 잘 알려져 있지만, 최근 연구에서는 또 다른 중대한 결함을 발견했습니다. 즉, 긴 텍스트를 처리할 때 LLM은 처음과 끝의 정보를 기억하지만 중간의 정보를 자주 무시하는 경향이 있습니다.

이 문제는 “중간에서 잃어버린” 현상으로 알려져 있으며, 이러한 모델의 실세계 응용에서 성능에 심각한 영향을 미칠 수 있습니다. 예를 들어, AI가 긴 법률 문서를 요약하는 경우, 중간의 중요한 세부 사항을 놓치면 잘못된 또는 불완전한 요약으로 이어질 수 있습니다. 의료 환경에서 환자의 기록 중간의 정보를 무시하면 부정확한 추천으로 이어질 수 있습니다. 이러한 현상이 발생하는 이유를 이해하는 것은 연구자들이 더 안전하고 신뢰할 수 있는 AI를 구축하려고 하는데 도전적인 작업입니다. 그러나 최근 연구에서는 이 문제가 이러한 모델의 아키텍처에 깊이 뿌리박혀 있음을 밝혀냈습니다.

중간에서 잃어버린 문제

“중간에서 잃어버린” 현상은 LLM이 긴 입력 시퀀스의 중간에 있는 정보에 덜 주의를 기울이는 경향을 말합니다. 이것은 인간이 목록의 처음과 끝의 항목을 중간의 항목보다 더 잘 기억하는 것과 유사합니다. 이러한 인지적 편향은 인간에게서 흔히 “초기 효과와 최근 효과”로 알려져 있습니다. LLM의 경우, 이것은 모델이 텍스트의 처음과 끝에 있는 중요한 정보를 처리할 때 잘 작동하지만 중간에 있는 정보를 처리할 때 어려움을 겪는 것을 의미합니다. 이것은 “U자형” 성능 곡선을 생성하여, 정확도가 처음에 높지만 중간에서 급격히 떨어지고 끝에서 다시 상승합니다.

이 현상은 순전히 이론적인 문제가 아닙니다. 이것은 질문에 대한 답변부터 문서 요약까지 다양한 작업에서 관찰되었습니다. 예를 들어, 긴 기사에서 처음 몇 단락에 있는 정보를 묻는 질문에 대한 답변을 요구하면, LLM은 올바른 답변을 제공할 것입니다. 끝의 몇 단락에 있는 정보를 묻는 질문에도 마찬가지입니다. 그러나 중요한 정보가 중간에 숨겨져 있는 경우, 모델의 정확도는 급격히 떨어집니다. 이것은 심각한 제한입니다. 왜냐하면 이것은 우리가 이러한 모델을 긴 및 복잡한 컨텍스트를 이해하는 작업에 완전히 신뢰할 수 없다는 것을 의미하기 때문입니다. 또한 이것은 모델을 조작하기 쉽게 만듭니다. 누군가가 문서의 처음이나 끝에 잘못된 정보를 의도적으로 배치하여 AI의 출력을 영향할 수 있습니다.

LLM의 아키텍처 이해

중간 정보 소실의 원인을 이해하려면 LLM의 트랜스포머 구조를 살펴봐야 합니다. 자기주의는 입력의 각 단어를 처리할 때 다른 단어의 중요도를 평가해 이전 구조보다 풍부한 관계를 학습합니다.

자기주의 자체에는 단어 순서 감각이 없어 위치 인코딩으로 각 단어의 위치 정보를 더합니다. 두 요소가 결합해 LLM의 성능을 높이지만 최근 연구는 그 상호작용이 긴 텍스트 가운데를 놓치는 맹점의 원인이 될 수 있음을 보여줍니다.

위치 편향이 어떻게 발생하는지

최근의 연구에서는 트랜스포머 내부의 정보 흐름을 그래프로 모델링하여 이 현상을 설명합니다. 여기서 각 단어는 노드이고, 주의 연결은 에지입니다. 이를 통해 연구자들은 모델의 여러 층을 통해 어떻게 다른 위치의 정보가 처리되는지 수학적으로 추적할 수 있습니다.

그들은 두 가지 주요 통찰력을 얻었습니다. 첫째, 많은 LLM에서 사용되는 인과 마스킹은 시퀀스의 처음으로 편향을 생성합니다. 인과 마스킹은 모델이 단어를 생성할 때, 이전에 나온 단어만 주의를 기울이고, 이후에 나온 단어는 주의를 기울이지 않도록 보장하는 기술입니다. 이것은 텍스트 생성과 같은 작업에 중요합니다. 그러나 여러 층을 거치면서, 이것은 누적 효과를 생성합니다. 처음 몇 단어는 여러 번 처리되고, 그들의 표현은 점점 더 영향력이 커집니다. 반면, 중간의 단어들은 항상 이미 잘 정립된 컨텍스트를 뒤돌아보며, 그들의 고유한 기여는 묻혀질 수 있습니다.

둘째, 연구자들은 위치 인코딩이 인과 마스킹 효과와 어떻게 상호 작용하는지 살펴보았습니다. 현대의 LLM은 상대적 위치 인코딩을 사용하여, 단어 간의 거리에 초점을 맞추고, 절대적 위치는 무시합니다. 이것은 모델이 다양한 길이의 텍스트에 일반화하도록 도와줍니다. 그러나 이것은 경쟁적인 압력을 생성합니다. 인과 마스크는 모델의 주의를 처음으로 이동시키고, 상대적 위치 인코딩은 근처의 단어에 주의를 기울이도록 유도합니다. 이러한 줄다리기의 결과는 모델이 매우 처음의 텍스트와 임의 단어의 즉각적인 지역 컨텍스트에 가장 많은 주의를 기울이는 것입니다. 즉, 처음이 아니고 멀리 있는 정보, 즉 중간의 정보는 가장 적은 주의를 받습니다.

보다 넓은 의미

중간 정보 소실은 긴 텍스트를 처리하는 응용 프로그램에 큰 영향을 줍니다. 무작위 현상이 아니라 모델 구조에서 비롯되므로 데이터만 더 늘려서는 해결하기 어렵고 트랜스포머의 핵심 설계를 다시 검토해야 할 수 있습니다.

개발자와 사용자는 긴 문서 작업에서 이 한계를 고려해 문서를 작은 단위로 나누거나 모델의 주의를 여러 부분으로 유도하는 전략을 써야 합니다. 짧은 텍스트에서 잘 작동한다고 길고 복잡한 입력에서도 신뢰할 수 있다고 가정하지 말고 엄격히 시험해야 합니다.

결론

AI 개발은 늘 한계를 찾아 극복하는 과정이었습니다. LLM의 중요한 결함 중 하나인 ‘중간 정보 소실’은 긴 텍스트의 가운데 놓인 정보를 모델이 자주 무시하는 현상입니다. 트랜스포머 구조에서 인과 마스킹과 상대적 위치 인코딩이 상호작용하는 방식 때문에 발생합니다. 모델은 텍스트의 처음과 끝은 잘 처리하지만 핵심 세부 정보가 가운데 있으면 어려움을 겪습니다. 문서 요약과 질의응답의 정확도를 떨어뜨려 법률과 의료 같은 분야에 심각한 영향을 줄 수 있으므로 개발자와 연구자는 실제 응용에서 신뢰성을 높이기 위해 이 문제를 해결해야 합니다.

Dr. Tehseen Zia는 COMSATS University Islamabad의 정교수이며, 오스트리아 비엔나 기술대학교에서 인공지능 박사학위를 취득했습니다. 인공지능, 기계학습, 데이터 과학, 컴퓨터 비전을 전문으로 하며, 유명한 과학 저널에 발표된 논문으로 знач적인 기여를 했습니다. Dr. Tehseen은 주요 연구자로서 다양한 산업 프로젝트를 이끌었으며, 인공지능 컨설턴트로도 활동했습니다.