AI 모델 및 플랫폼

최고의 AI 모델은 긴 문서에서 길을 잃고 있다

mm
Unite.AI를 Google의 선호 소스에 추가

LMU 뮌헨, 머신 러닝 뮌헨 센터, 애드비 연구소의 연구자들이 수행한 새로운 연구에 따르면, AI 언어 모델에는 한 가지 약점이 있다.それは 긴 문서를 이해하는 능력이다. 연구 팀의 연구 결과에 따르면, 가장 발전된 AI 모델도 단순한 단어 일치에 의존할 수 없는 경우 정보를 연결하는 데 어려움을 겪는다는 것을 보여주었다.

AI의 독해 능력에 대한 숨겨진 문제

연구 논문에서 특정 세부 정보를 찾으려고 하는 상황을 상상해 보라. 당신은 그것을 스킴하여 다른 섹션之间의 정신적 연결을 만들어 필요한 정보를 조각조각으로 모을 수 있다. 그러나 많은 AI 모델은 이런 방식으로 작동하지 않는다. 대신, 그들은 종종 단순한 단어 일치를 찾는 것에 크게 의존한다. 이것은 컴퓨터에서 Ctrl+F를 사용하는 것과 비슷하다.

연구 팀은 다양한 AI 모델을 테스트하기 위해 NOLIMA(NOLiteral Matching)라는 새로운 벤치마크를 개발했다. 결과는 AI 모델이 2,000단어 이상의 텍스트를 다루는 경우 성능이 급격히 떨어진다는 것을 보여주었다. 약 6,000단어(8,000토큰)에 해당하는 텍스트 길이에서 가장 강력한 성능을 보인 GPT-4o 모델조차도 더 긴 텍스트에서 성능이 크게 떨어진다는 것을 보여주었다. 다른 모델들도 마찬가지였다.

의료 연구자가 환자 기록을 분석하기 위해 AI를 사용하거나 법률 팀이 사례 문서를 검토하기 위해 AI를 사용하는 경우, 관련 정보가 검색 쿼리와 다른 단어를 사용하는 경우 AI가 중요한 연결을 놓칠 수 있다. 이는 상당한 결과를 초래할 수 있다.

단어 일치가 충분하지 않은 이유

현재의 AI 모델은 텍스트를 처리하기 위해 주의 메커니즘을 사용한다. 이 시스템은 AI가 텍스트의 다른 부분에 집중하여 단어와 아이디어 간의 관계를 이해하는 데 도움이 된다. 짧은 텍스트에서는 충분히 작동하지만, 텍스트가 길어지면 특히 단순한 단어 일치에 의존할 수 없는 경우 이 메커니즘이 압도당한다.

NOLIMA 테스트는 단어 일치를 찾는 것보다 맥락을 이해하는 데 필요한 질문을 AI 모델에 물어봄으로써 이러한 제한을暴露했다. 결과는 충격적이었다. 모델은 짧은 텍스트에서는 잘 작동했지만 텍스트 길이가 증가함에 따라 성능이 크게 떨어졌다. 심지어 추론 작업을 위한 특별한 모델도 50%의 정확도를 넘지 못했다.

단어 일치를頼む 않고, AI 모델은 다음과 같은 것에 어려움을 겪었다:

  • 다른 용어를 사용하는 관련 개념을 연결
  • 다단계 추론 경로를 따르
  • 중요한 컨텍스트 이후에 나타나는 관련 정보를 찾
  • 관련 없는 섹션의 유사한 단어 일치를 무시

숫자가 말하는 이야기

연구 결과는 AI 모델이 긴 텍스트를 처리하는 방식에 대한 충격적인 그림을 보여준다. GPT-4o는 가장 강력한 성능을 보였지만, 약 6,000단어(8,000토큰)에서 성능이 크게 떨어졌다. 다른 모델들은 2,000에서 8,000 토큰 사이에서 성능이 급격히 떨어졌다.

다단계 추론이 필요한 작업에서는 성능 저하가 더욱 두드러졌다. 예를 들어, 모델이 두 개의 논리적 연결을 만들어야 하는 경우(예: 특정 지명 근처에 사는一个人과 그 지명이 특정 도시 안에 있다는 것을 이해), 성공률이 크게 떨어졌다. 연구에 따르면, 이러한 다단계 추론은 16,000 토큰을 넘는 텍스트에서 특히 어려워진다.

이 발견은 특히 주목할 만하다. 많은 모델이 긴 컨텍스트를 처리할 수 있다고 주장하지만, NOLIMA 벤치마크는 실제 이해력이 이러한 이론적인 한계에 도달하기 훨씬 전에 떨어진다는 것을 보여준다.

출처: Modarressi et al.

AI가 숲을 못 보고 나무만 보는 경우

이러한 제한은 실제 응용에서 AI를 사용하는 방식에重大한 영향을 미친다. 예를 들어, 법률 AI 시스템이 사례 법을 검색하는 경우, 관련된 이전 사례를 놓칠 수 있다. 시스템은 검색 쿼리와 단어가 일치하는 경우에만 관련이 없는 사례에 집중할 수 있다.

검색 및 문서 분석에 대한 영향은 특히 우려스럽다. 현재의 AI 기반 검색 시스템은 종종 RAG(Retrieval-Augmented Generation)라는 기술을 사용한다. 이러한 시스템은 문서를 검색하여 정보를 찾는 데 성공할 수 있지만, AI가 검색 쿼리와 단어가 일치하지 않는 경우 관련 정보를 인식하지 못할 수 있다.

AI 사용자에게 이러한 발견은 몇 가지 중요한 고려 사항을 제시한다:

첫째, 더 짧은 쿼리와 문서가 더 신뢰할 수 있는 결과를 줄 수 있다. 더 긴 텍스트에서는 이를 작은 섹션으로 나누어 AI 성능을 유지하는 데 도움이 될 수 있다.

둘째, 사용자는 긴 문서에서 AI가 연결을 만들 때 특히 주의해야 한다. 연구에 따르면, AI 모델은 다른 섹션에서 정보를 조각조각으로 모으는 데 어려움을 겪는다. 특히 관련성이 단어와 일치하지 않는 경우에 그렇다.

셋째, 이러한 제한은 인간의 감시가 계속 중요하다는 것을 강조한다. AI는 텍스트를 처리하고 분석하는 데 강력한 도구일 수 있지만, 복잡한 문서에서 중요한 연결을 식별하는 데 humans의 대체물로 사용되어서는 안 된다.

이 발견은 AI 기술이 빠르게 발전하고 있음에도 불구하고, 이러한 시스템이 정보를 처리하는 방식이 인간과 다르다는 것을 상기시킨다. 이러한 제한을 이해하는 것은 AI 도구를 효과적으로 사용하고 humans의 판단이 언제 필요하다는 것을 아는 데 중요하다.

다음은 무엇인가?

현재 AI 모델이 긴 텍스트를 처리하는 능력에 대한 제한을 이해하는 것은 중요한 질문을 제기한다. NOLIMA 벤치마크背后的 연구는 우리의 현재 접근 방식이 텍스트 처리에 대한根本的な 개선이 필요하다는 것을 보여주었다. 특히 모델이 더 긴 구절에서 정보를 처리하는 방식이다.

현재의 해결책은 부분적인 성공만을 보였다. Chain-of-Thought 프롬프팅은 AI 모델이 추론을 단계적으로 나누는 데 도움이 되지만, 16,000 토큰을 넘는 텍스트에서는 여전히 부족하다. 따라서 더 근본적인 해결책이 필요하다.

현재 AI 모델이 텍스트를 처리하는 방식의 핵심인 주의 메커니즘을 재고해야 한다. 이는 대화하는 방식과 비슷하다. 대화가 길어질수록 이전에 언급된 중요한 점을 모두 기억하는 것이 더 어려워진다. 현재의 AI 모델도 비슷한 도전을 겪는다.

미래를 향한 방향은 여러 가지이다. 하나는 AI가 긴 텍스트에서 정보를 조직하고 우선순위를 정하는 새로운 방법을 개발하는 것이다. 단순한 단어 일치를 넘어서서 의미에 기반한 더 깊은 개념적 연결을 이해하는 방식이다.

또 다른 방향은 AI 모델이 정보를 연결하는 논리적인 단계를 처리하는 방식을 개선하는 것이다. 현재의 모델은 이러한 연결에 어려움을 겪는다. 특히 긴 텍스트에서 그렇다. 그러나 새로운 아키텍처는 이 간격을 메울 수 있다.

현재 AI 도구를 사용하는 사람들에게 이러한 발견은 몇 가지 실제적인 접근 방식을 제시한다. 긴 문서를 의미 있는 섹션으로 나누는 것을 고려하라. इसस테가 중요한 컨텍스트를 유지하는 데 도움이 된다. 예를 들어, 연구 논문을 분석하는 경우, 방법론과 결과 섹션을 함께 유지하는 것이 좋다. 두 섹션이 관련된 정보를 포함하기 때문이다.

긴 텍스트를 분석하도록 AI에게 요청할 때, 연결을 만들고 싶은 것을 구체적으로 지시하라. 광범위한 질문을 하는 대신, 관심 있는 관계를 탐색하도록 AI를 안내하라. 이를 통해 모델의 현재 제한을 보완할 수 있다.

가장 중요한 것은, 긴 텍스트에서 AI의 능력에 대한 현실적인 기대를 유지하는 것이다. 이러한 도구는 많은 작업에 매우 유용할 수 있지만, 복잡한 문서의 분석을 위한 humans의 완전한 대체물로 사용되어서는 안 된다. humans가 긴 텍스트에서 컨텍스트를 유지하고 개념적 연결을 만드는 능력은 현재의 AI 능력보다 우수하다.

이 분야의 AI 개발을 위한 앞으로의 길은 도전적이지만 흥미롭다. 이러한 제한을 더 잘 이해할수록, 우리는 실제로 긴 텍스트를 이해하는 AI 시스템을 개발할 수 있다. 그 때까지, 우리는 AI의 현재 제한을 이해하고 강점을 인정하면서 효과적으로 사용해야 한다.

Alex McFarland은 인공 지능의 최신 개발을 탐구하는 AI 저널리스트이자 작가입니다. 그는 전 세계의 수많은 AI 스타트업과 출판물들과 협력했습니다.