Anderson의 관점

AI에게 더 오래 기억하도록 가르치는 법

mm
Unite.AI를 Google의 선호 소스에 추가
AI-generated image: A robot with ChatGPT logo at laptop, with vice on open head and glowing text emerging from head. GPT-image-1.

언어 모델은 대화의 시작을 기억하지 못하는 경우가 많습니다. 새로운 텍스트 압축 방법을 사용하면 이 문제를 해결하고 AI 채팅 세션을 훨씬 덜 화나게 만들 수 있습니다.

 

ChatGPT와 같은 대화형 AI 시스템은 종종 대화의 이전 부분을 잊어버리거나 반복하거나 이전에 동의한 규칙을 무시하는 답변을 제공합니다.

이는 Large Language Models (LLMs)이 제한된 주의 능력을 가지고 있기 때문입니다. 이는 ‘컨텍스트 윈도우’로 정의되며, 직접 조준된 대상과 인접한 몇 개의 객체만을照明할 수 있는 토치와 유사합니다.

이러한 ‘기억력 결핍’ 성향을 고치는 것은 언어 기반 AI 모델에 대한 연구의 가장 중요한 방향 중 하나입니다. 특히 이러한 증상은 유용하고 일관된 다중 회신 대화를 가능하게 하지 못하며, 의료 및 법률과 같은 정확도에 중요한 다양한 상황에서 LLM의 유용성을 제한합니다.

성공을 위한 열쇠

중국에서 나온 새로운 연구는 AI 모델을 실행하는 GPU의 제한된 자원에 훨씬 더 많은 텍스트를 맞출 수 있는 새로운 방법을 제안합니다. 결과는 20배의 압축 개선과 98%의 정확도를 달성합니다.

컨텍스트 캐스케이드 압축은 오픈 압축 방법과 비교하여 긴 문서를 더 정확하게 재구성합니다.

컨텍스트 캐스케이드 압축은 오픈 압축 방법과 비교하여 긴 문서를 더 정확하게 재구성합니다. 출처

93%의 정확도로, 텍스트 압축은 40배의 압축 비율을 달성할 수 있습니다.

긴 텍스트를 언어 모델 입력으로 압축하는 세 가지 접근 방식

긴 텍스트를 언어 모델 입력으로 압축하는 세 가지 접근 방식

이것은 매우 긴 대화의 전체를 압축하고, 이후 채팅에서 배경 컨텍스트 정보로 재주입할 수 있습니다. 일반적으로 LLM은 이전的事実을 잊어버리고 ‘기억력 결핍’ 행동으로 넘어갑니다.

이 방법은 손실 압축 방법이지만, 손실이 발생하는 방식은 유용합니다. 새로운 방법에서 메모리는 문장의 끝에서 손실되며, DeepSeek-OCR 아키텍처와 달리 균일하게 전체에 걸쳐 손실되지 않습니다. 실제로 연구자들은 자신의 방법이 인간의 기억과 같은 방식으로 손실된다고 제안합니다.

인간의 기억, DeepSeek-OCR, 새로운 방법의 비교

인간의 기억, DeepSeek-OCR, 새로운 방법의 비교

이것은 예측할 수 있는 방식으로 데이터가 기억되지 않을 수 있는 위치를 알 수 있으며, 이러한 지식을 사용하여 문제를 해결할 수 있습니다. 이는 대화 회상과 일관성에서 대규모 개선을 제공할 수 있습니다.

새로운 접근 방식은 컨텍스트 캐스케이드 압축(C3)이라고 합니다. 이는 DeepSeek-OCR가 텍스트를 이미지로 압축하는 방식에서 영감을 받았습니다.

방법

새로운 접근 방식을 이해하기 위해서는 광학 문자 인식(OCR)이 무엇인지 알아야 합니다. 이는 컴퓨터 프로그램이 이미지 내의 텍스트를 편집 가능한 텍스트로 변환하는 알고리즘 방식입니다.

DeepSeek-OCR의 창조자는 텍스트를 OCR을 중간 단계로 사용하여 표준 파이프라인보다 훨씬 더 압축할 수 있음을 발견했습니다. 즉, 텍스트 자체를 압축하는 대신, 그 텍스트의 래스터화된 버전을 압축할 수 있습니다.

DeepSeek-OCR 압축 파이프라인

DeepSeek-OCR 압축 파이프라인 출처

새로운 논문은 광학적 접근 방식이 압축 이익의 원천을 잘못 귀속할 수 있음을 시사합니다. 텍스트에서 이미지로의 전환 대신, 핵심적인 이점은冗長한 텍스트 토큰을 더 효율적인 잠재적인 표현으로 변환하는 것입니다.

이를 테스트하기 위해, 연구자들은 두 개의 언어 모델을 사용하는 파이프라인을 만들었습니다. 작은 Qwen2.5 1.5B 모델은 긴 구절을 작은 잠재적인 토큰 집합으로 압축하고, 더 큰 Qwen2.5 3B 모델은 토큰에서 원래 텍스트를 재구성합니다.

새로운 C3 시스템

새로운 C3 시스템

데이터 및 테스트

논문은 저자가 원래 OCR 자료의 데이터셋을 수집했으며, 이는 인터넷에서 얻은 1백만 페이지입니다. 데이터 엔지니어링과 큐레이션이 불필요했으며, 저자들은 자신의 아키텍처가 훈련 설정에 따라 잘 일반화되어 있다고 주장합니다.

모델은 8개의 NVIDIA H800 GPU로 구성된 고성능 클러스터에서 훈련되었으며, 각 GPU에는 80GB의 VRAM이 있습니다. 총 VRAM 자원은 640GB입니다. 각 GPU는 배치 크기 2를 수용하며, 총 글로벌 배치 크기는 256입니다.

최적화기는 AdamW였으며, 총 40,000 스텝으로 훈련되었습니다. 평가를 위해, 연구자들은 원래 DeepSeek-OCR 논문에서 사용된 평가 설정을 따랐으며, Fox 벤치마크를 사용하여 문서 길이 범위에 대한 압축 및 재구성 정확도를 측정했습니다.

영어 텍스트가 선택되었으며, 구절은 600에서 1300 토큰까지 다양했습니다. 토큰화는 Qwen 토크나이저를 사용하여 수행되었습니다.

공정한 비교를 위해, 등가의 압축 수준을 사용하여 광학적 기준선과 비교했습니다. 추가 테스트는 32개의 잠재적인 토큰을 사용하여 수행되었습니다.

초기 테스트 결과

초기 테스트 결과

논문은 다음과 같이 말합니다.

‘데이터는 C3가 모든 테스트 조건에서 광학적 압축 접근 방식을 크게 능가한다는 것을 명확하게 보여줍니다. 이는 높은忠實도 컨텍스트 압축의 새로운 상태를 설정합니다.’

결론

이것은 최근에 내가 본 가장 명확하고 접근하기 쉬운 논문 중 하나입니다. 핵심 아이디어는 ‘컨텍스트 윈도우 문제’에 대한 추가적인 공격 방식이 될 수 있습니다.

많은 LLM 사용자들은 이미 중요한 정보나 지침을 주기적으로 새로 고침으로써, ChatGPT와 같은 시스템이 오래 기억하지 못한다는 것을 알게 되었습니다. 새로운 논문에서 제안하는 아이디어는 긴 대화의 고도로 압축된 버전을 자동으로 재주입하여 LLM의 컨텍스트 윈도우를 기억하는 대리人的 역할을 할 수 있습니다.

GPU 부족으로 인해 전통적인 컴퓨터 메모리에서까지 가격 상승이 발생하는 상황에서, AI의 호스트 하드웨어가 가까운 미래에 크게 더 커지지 않을 가능성이 있습니다. 따라서 이러한 혁신적인 접근 방식은 성능을 향상시키는 데 필요할 수 있습니다.

가장 중요한 것은 LLM이 1시간 이상의 일관된 대화를 유지하고, 대화의 내용을 기억할 수 있는 것입니다.

 

* CLI 설치 지침이 제공되지만, 설치를 시도할 시간이 없으며, 저장소가 코드 완료인지 확실하지 않습니다.

두 저자는 Liu Fanfan과 Qiu Haibo로 명시되어 있습니다. 캐주얼 연구에 따르면, Qiu는 현재 중국 기술 회사 Meituan의 연구자이며, Liu는 중국 과학 아카데미의 석사 과정 학생입니다. 둘 다 현재 논문을 자신의 역사에 나열하지 않고 있습니다. 이러한 속성이 잘못된 경우, 프로필을 통해 저자에게 연락하십시오.

†† 저자들은 추가적인 질적 테스트를 제공하지만, 이전의 압축 테스트와 비교하여 비록하지 못했습니다. 여기서 이러한 테스트를 다루지 않았습니다.

最初에 게시된 2025년 11월 21일

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai