AI 모델 및 플랫폼

DeepMind의 미켈란젤로 벤치마크: 긴 문맥의 LLMs의 한계를 밝히다

mm
Unite.AI를 Google의 선호 소스에 추가

인공지능(AI)이 발전함에 따라 긴 시퀀스의 정보를 처리하고 이해하는 능력은 더욱 중요해지고 있다. 현재 AI 시스템은 긴 문서를 분석하고, 긴 대화를 유지하며,大量의 데이터를 처리하는 복잡한 작업에 사용되고 있다. 그러나 많은 현재 모델은 긴 문맥의推論에 어려움을 겪고 있다. 입력이 길어질수록 중요한 세부 사항을 잃어버리게 되어 정확하거나 일관된 결과를 내놓지 못한다.

이 문제는 특히 의료, 법률, 금융 산업에서 심각한 문제이다. 이러한 산업에서 AI 도구는詳細한 문서나 긴 대화를 처리하면서 정확하고 문맥에 맞는 응답을 제공해야 한다. 일반적인 도전은 문맥漂移(context drift)이다. 모델이 새로운 입력을 처리함에 따라 이전의 정보를 잃어버리게 되어 결과가 덜 관련性이 있게 된다.

이러한 제한을 해결하기 위해 DeepMind는 미켈란젤로 벤치마크를 개발했다. 이 도구는 AI 모델이 긴 문맥의推論을 얼마나 잘 처리하는지 철저하게 테스트한다. 미켈란젤로 벤치마크는 긴 데이터 시퀀스에서 의미 있는 패턴을 추출하는 모델의 능력을 테스트한다. 이것은 인간이 복잡한 데이터를 분석하여 중요한 정보를 찾는 것과 유사하다. 벤치마크는 두 가지 주요 영역에 초점을 맞춘다: 자연어와 코드. 이것은 단순한 데이터 검색 이상의 작업을 테스트한다.

중요한 작업 중 하나는 잠재적 구조 쿼리(Latent Structure Queries, LSQ) 프레임워크이다. 이 방법은 모델이大量의 데이터에서 의미 있는 패턴을 찾는 것을 요구한다. 이것은 인간이 복잡한 데이터에서 중요한 정보를 찾는 것과 유사하다. 벤치마크는 두 가지 주요 영역에 초점을 맞춘다: 자연어와 코드.

또 다른 중요한 작업은 다중 라운드 공통 참조 해결(Multi-Round Co-reference Resolution, MRCR)이다. 이 작업은 모델이 긴 대화에서 공통 참조를 추적하는 능력을 테스트한다. 이것은 실제 대화에서 주제가 변경되거나 불분명한 경우에 모델이 참조를 정확하게 추적할 수 있는지 테스트한다.

또한, 미켈란젤로 벤치마크에는 IDK 작업이 있다. 이 작업은 모델이 정보가 충분하지 않은 경우 “모르겠습니다“라는 응답을 제공하는 능력을 테스트한다. 이것은 모델이 불확실성을 인식하는 중요한 측면이다.

이러한 작업을 통해 미켈란젤로 벤치마크는 단순한 데이터 검색 이상의 모델의 능력을 테스트한다. 이것은 긴 문맥의 입력을 처리하고 理解하는 모델의 능력을 테스트한다.

긴 문맥의 推論을 이해하는 것

긴 문맥의 推論은 AI 모델이 긴 텍스트, 코드, 또는 대화 시퀀스에서 일관된이고 정확한 결과를 내놓는 능력을 말한다. GPT-4와 PaLM-2와 같은 모델은 짧은 또는 중간 길이의 입력에서 잘 작동한다. 그러나 긴 문맥에서는 어려움을 겪는다. 입력 길이가 증가할수록 이러한 모델은 이전의 중요한 세부 사항을 잃어버리게 되어 오류가 발생한다. 이것은 문맥 창의 제한으로 알려져 있다. 모델의 능력은 입력 길이가 증가할수록 감소한다.

이 문제는 실제 응용에서 중요하다. 예를 들어, 법률 서비스에서 AI 모델은 계약, 사례 연구, 또는 규정과 같은 수백 페이지의 긴 문서를 분석해야 한다. 이러한 모델이 긴 문서를 효과적으로 처리하지 못하면 중요한 조항이나 법적 용어를 잘못 해석할 수 있다. 의료 분야에서 AI 시스템은 환자 기록, 의료 역사, 및 치료 계획과 같은 수년 또는 수십 년에 걸친 데이터를 분석해야 한다. 모델이 이전의 중요한 정보를 정확하게 기억하지 못하면 부적절한 치료 또는 잘못된 진단을 할 수 있다.

미켈란젤로 벤치마크: 개념과 접근 방법

미켈란젤로 벨치마크는 긴 문맥의 推論을 테스트하기 위해 개발되었다. 이것은 이전의 벤치마크와 달리, 단순한 데이터 검색 이상의 작업을 테스트한다. 벤치마크는 모델이 긴 데이터 시퀀스에서 의미 있는 패턴을 추출하는 능력을 테스트한다.

미켈란젤로 벨치마크는 잠재적 구조 쿼리(Latent Structure Queries, LSQ) 프레임워크를 사용하여 모델을 테스트한다. 이 방법은 모델이大量의 데이터에서 의미 있는 패턴을 찾는 것을 요구한다. 이것은 인간이 복잡한 데이터에서 중요한 정보를 찾는 것과 유사하다.

AI 연구 및 개발에 대한 함의

미켈란젤로 벨치마크의 결과는 AI 개발에 중요한 함의를 가지고 있다. 벤치마크는 현재의 LLMs가 더好的 아키텍처가 필요하다는 것을 보여준다. 특히, 주의 메커니즘과 메모리 시스템이 중요하다. 현재 대부분의 LLMs는 셀프-주의 메커니즘을 사용한다. 이것은 짧은 작업에서 효과적이지만, 긴 문맥에서는 어려움을 겪는다. 이것은 문맥漂移의 문제를 일으킨다. 모델은 이전의 세부 사항을 잊어버리거나混동하게 되어 결과가 덜 관련性이 있게 된다.

또 다른 유망한 접근 방법은 계층적 처리이다. 이 방법은 모델이 긴 입력을 더 작은, 관리 가능한 부분으로 나누어 처리할 수 있게 한다. 이것은 모델이 복잡한 작업을 더 잘 처리할 수 있게 한다.

긴 문맥의 推論을 개선하면 의료, 법률, 금융 산업에서 중요한 영향을 미칠 수 있다. 의료 분야에서 이것은 환자 기록을 분석하여 더 정확한 치료를 추천할 수 있게 한다. 법률 서비스에서 이것은 긴 계약이나 사례 연구를 분석하여 더 정확한 통찰력을 제공할 수 있게 한다.

결론

미켈란젤로 벨치마크는 긴 문맥의 推論을 테스트하기 위해 개발되었다. 이것은 모델이 긴 데이터 시퀀스에서 의미 있는 패턴을 추출하는 능력을 테스트한다. 벤치마크는 AI 개발에 중요한 함의를 가지고 있다. 특히, 더好的 아키텍처가 필요하다는 것을 보여준다.

미켈란젤로 벨치마크의 결과는 AI 개발에 중요한 영향을 미칠 수 있다. 특히, 의료, 법률, 금융 산업에서 중요한 영향을 미칠 수 있다. 그러나, 이러한 발전은 중요한倫理적 문제를 일으킬 수 있다. 예를 들어, 모델이 이전의 중요한 정보를 기억할 수 있다면, 개인 정보를 노출할 수 있다.

미켈란젤로 벨치마크는 긴 문맥의 推論을 테스트하기 위해 개발되었다. 이것은 모델이 긴 데이터 시퀀스에서 의미 있는 패턴을 추출하는 능력을 테스트한다. 벤치마크는 AI 개발에 중요한 함의를 가지고 있다. 특히, 더好的 아키텍처가 필요하다는 것을 보여준다.

Dr. Assad Abbas, COMSATS University Islamabad, 파키스탄의 정교수는 North Dakota State University, USA에서 박사학위를 취득했습니다. 그의 연구는 클라우드, 포그, 에지 컴퓨팅, 빅데이터 분석, AI를 포함한 고급 기술에 중점을 두고 있습니다. Dr. Abbas는 유명한 과학 저널 및 컨퍼런스에 게재된 논문으로 상당한 기여를 했습니다. 그는 또한 MyFastingBuddy의 창립자입니다.