사상 리더

AI의 기억 문제: 효율적인 긴 문맥이 모든 것을 변경하고, 올바르게 구현하기 위해 필요한 것

mm
Unite.AI를 Google의 선호 소스에 추가

대화가 끝나는 순간 이전 내용을 전부 잊는 동료라면 대부분의 직장에서 오래 버티기 어려울 것입니다. 그런데 많은 업무용 AI가 바로 그렇게 작동합니다. 세션이 닫히면 맥락도 사라집니다. 단발성 질문을 하는 소비자는 거의 느끼지 못해도 한 번의 접속보다 오래 이어지는 절차를 운영하는 기업은 곧바로 한계에 부딪힙니다.

실제 업무는 한 세션에서 다음 세션으로 이어집니다. 목요일의 결정은 보통 월요일의 결정에 기반하므로 그 사이에도 판단 근거가 남아 있어야 합니다. 세션이 끝나면 모두 지우는 AI는 그 안에서는 잘해도 일주일간 이어지는 작업에는 아무 기여를 못 할 수 있습니다.

기업용 AI가 모델에 요구하는 것은 조용히 바뀌었습니다. 수년간 모델은 주로 흡수한 지식의 양으로 평가됐지만 이제 기업은 일이 진행되는 동안 적절한 정보를 계속 유지하길 원합니다. 여기에는 다른 종류의 효율적인 설계가 필요합니다. 이런 수준의 지속적 지식을 규모 있게 유지하는 데 필요한 GPU 메모리, 연산, 비용이 커서 아직 달성하지 못했습니다. 대규모 맥락을 여러 사용자가 동시에 이용하면 허용 가능한 지연과 환각 수준을 유지하기도 어렵습니다. 수요는 늘지만 메모리와 연산 자원은 충분하지 않습니다. 더 적은 인프라와 더 작은 자원 규모로 더 정확한 지능을 확장하려면 어떻게 해야 할까요?

책상과 서류함

기억이라는 이름 아래 묶인 두 가지는 작동 방식이 충분히 다릅니다. 이후 논의를 이해하려면 이를 구분해야 합니다.

컨텍스트 창은 모델이 한 번에 받아들여 추론할 수 있는 정보량이며 책상 표면과 비슷합니다. 작은 책상에는 몇 쪽씩 놓고 나머지는 서랍에 뒀다가 필요할 때 꺼내고 치웁니다. 큰 책상에는 사건 자료 전체를 펼쳐 놓고 작업할 수 있습니다. 하지만 책상 위의 내용은 매일 하루가 끝나면 모두 치워집니다.

지속 기억은 책상 옆 서류함입니다. 시스템이 저장할 내용을 골라 관련 있을 때 다시 꺼내므로 이번 주의 일이 다음 주의 행동에 반영됩니다. 세션을 넘어 유지되는 저장소이며 무엇을 저장하고 어떻게 정리하며 언제 다시 꺼낼지 별도 판단이 필요합니다.

눈에 보이는 기술 경쟁은 주로 책상을 넓히는 데 집중됐습니다. 몇 천 토큰이던 창은 이제 수십만 토큰이며 오픈AI와 앤트로픽의 가장 큰 모델은 약 100만 토큰에 이릅니다.

이 작업을 뜻하는 “컨텍스트 엔지니어링”은 Shopify (SHOP )의 토비 뤼트케가 제시한 용어이며 2025년 중반 안드레이 카르파티가 널리 알렸습니다. 카르파티는 본격적인 AI 애플리케이션의 핵심 기술이 다음 단계에 맞는 정보로 창을 채우는 것이라고 썼습니다. 모델은 프로세서이고 창은 작업 메모리라는 하드웨어 비유였습니다. 실무자들은 이름 없이 생각해 오던 개념이었기에 이 말을 빠르게 받아들였습니다.

책상이 커져도 기억 문제는 해결되지 않는다

책상을 계속 넓히자는 뻔한 해법은 여기서 어려움에 부딪힙니다.

스탠퍼드 연구진은 2024년 연구 에서 필요한 정보가 긴 입력의 중간에 있으면 같은 사실을 앞이나 뒤에 놓았을 때보다 정확도가 크게 떨어진다는 것을 보였습니다. “Lost in the Middle”이라 부른 현상은 긴 맥락 전용 모델에도 나타났습니다. 정보를 더 많이 제시하는 것과 모델이 이를 신뢰성 있게 쓰는 것은 달랐습니다.

다른 연구팀도 같은 현상을 확인했습니다. 2025년 연구는 최첨단 모델 18개에 점점 긴 입력을 주고 창이 가득 차기 훨씬 전부터 성능이 떨어진다는 사실을 발견했습니다. 연구진은 이를 “컨텍스트 부패”라고 불렀습니다. 책상을 넓히는 것과 그 위의 모든 정보를 모델이 정확히 추론하게 하는 것은 별개의 문제이며 전자가 후자를 해결하지는 않습니다.

용량보다 정보 선별이 더 큰 가치를 만든다

이런 문제를 배경으로 컨텍스트 엔지니어링이 전문 분야로 발전했습니다. 논문 1,400편 이상을 바탕으로 한 2025년 종설 이 방법론을 정리했고, Gartner는 2025년 7월 고객에게 프롬프트보다 맥락을 우선하라고 조언했습니다. 더 정교한 지시문을 쓰는 것에서 모델이 작업할 더 적절한 입력 묶음을 구성하는 것으로 초점이 옮겨 갔습니다.

책상이 넓을수록 무엇을 올릴지의 중요성이 커집니다. 문서 저장소 전체를 쏟아 놓으면 중요한 몇 쪽이 잡음, 모순, 폐기된 버전 사이에 묻힙니다. 실제 작업과 관련된 자료를 더 엄선하면 같은 모델도 훨씬 잘할 수 있습니다. 모델 앞에 무엇을 어떤 맥락으로 언제 제시하고 무엇은 서류함에 남길지 판단하는 일이 핵심입니다.

RAG(검색 증강 생성)는 전체 문서를 담기에는 창이 작다는 문제를 우회하려고 문서를 조각내고 관련 있어 보이는 부분을 가져오는 방식입니다. 예를 들어 계약 분쟁이 200쪽의 한 조항에 달려 있다면, 보통 계약서를 조각내 검색 시스템이 관련 있어 보이는 부분을 가져오게 합니다. 200쪽을 무관하다고 평가하면 모델은 그 조항을 아예 보지 못합니다.

계약 전체를 담는 창은 검색 단계를 건너뛰고 조항과 주변 맥락을 함께 줍니다. 그 뒤 모델이 긴 입력을 잘 읽는지는 앞 절의 신뢰성 문제입니다. 검색 시스템이 조용히 조항을 전달할 가치가 없다고 판단하는 문제보다는 더 나은 문제입니다.

세션 안에서, 그리고 세션이 끝난 뒤

긴 맥락은 AI 에이전트가 한 번의 문답을 넘어 긴 작업을 수행하게 합니다. 여러 날에 걸친 준법 검토나 공급업체 등록을 담당하는 에이전트는 작업 전체를 창 안에 유지해 각 단계가 전체 상태를 참고하게 할 수 있습니다. 충분히 긴 창은 세션 안에서 기억을 대신할 수 있습니다.

유사성은 거기까지입니다. 하지만 세션이 끝난 뒤 다음 주에도 기억해야 하는 정보는 컨텍스트 창 밖의 어딘가에 남아 있어야 합니다. 이런 기억을 만들면 업계가 이제 막 마주하기 시작한 다른 문제들이 생깁니다. 심리학과 신경과학을 공부한 제게 인간 기억과의 비교는 자연스럽습니다. 우리는 사건의 완벽한 녹음을 꺼내지 않습니다. 기억할 때마다 재구성하며 작은 오류가 점차 받아들여진 이야기의 일부가 될 수 있습니다. 기계 기억도 저장 정보를 반복해서 요약·병합·수정하면 비슷한 문제가 생길 수 있습니다. 누군가 확인하고 오류를 고치며 신뢰할 수 없게 된 정보를 제거하지 않으면 기록은 시간이 갈수록 원래 사건에서 멀어질 수 있습니다.

도입 기업 상당수는 아직 이런 문제를 겪지 않았고 해결에 가까운 문제도 드뭅니다. 공급업체를 볼 때 저는 광고하는 창 크기보다 다른 것을 보겠습니다. 1,000만 토큰을 담아도 대부분이 오래됐거나 무관하거나 틀렸다면 가치가 작습니다. 답에 출처가 풍부해 보여도 기업이 신뢰해서는 안 될 자료에 기대고 있을 수 있습니다. 돈이 되는 것은 무엇을 남길지의 판단과 모든 정보를 정확히 추론하는 능력을 훨씬 적은 인프라 비용과 자원으로 제공하는 것입니다. 적은 것으로 더 많은 성과를 내는 것이며 큰 창이 모두 이 실제 역량을 갖추는 것은 아닙니다.

매튜 해스웰은 리피언트의 공동 창립자로, 효율적인 AI, 압축, 및 모델을 더 효율적이고 실제로 배포할 수 있도록 하는 데 중점을 둔 회사입니다. 의학 과학 석사이며 신경 과학자로 훈련을 받았으며, 기술, 핀테크, 게임, 소매, 금융 서비스 업계에서 전략적 집행, 비즈니스, 운영, 제품 역할을 수행했습니다.