사상 리더
AI의 기억 문제: 효율적인 긴 문맥이 모든 것을 변경하고, 올바르게 구현하기 위해 필요한 것

세션을 마치면 모든 이전 대화 내용을 잊어버리는 동료는 대부분의 직업에서 오래 지속하지 못할 것입니다. 그러나 많은 비즈니스 AI는 정확히那样으로 작동합니다. 세션이 종료되면 컨텍스트가 함께 사라집니다. 단발성 질문을 보내는 소비자는 거의 알아차리지 못할 수 있지만, 단일 시팅보다 더 오래 지속되는 프로세스를 실행하는 회사는 거의 즉시 한계에 도달합니다.
실제 작업은 한 세션에서 다음 세션으로 전달됩니다. 목요일에 내린 결정은 일반적으로 월요일에 내린 결정에 기반하며, 그 결정의 근거는 사이에 살아남아야 합니다. 세션이 종료되면 컨텍스트가 사라지는 AI는 세션 내에서 잘 작동할 수 있지만 일주일 동안 실행되는 작업에 기여할 수 없습니다.
엔터프라이즈 AI는 조용히 모델에서 요구하는 것을 변경했습니다. 수년 동안 모델은 주로 흡수한 지식의 양으로 판단되었습니다. 비즈니스에서는 이제 모델이 작업이 진행되는 동안 올바른 정보를 유지하도록 요구합니다. 이는 다른 종류의 효율적인 엔지니어링을 필요로 하는 기능입니다. 현재까지, 이러한 수준의 지속적인 지식을 유지하는 능력은 대규모 메모리(GPU), 컴퓨팅 능력, 비용이 필요하여 달성되지 못했습니다. 대규모 컨텍스트를 사용할 때 대기 시간과 모델의 환상이 발생하는 문제가 있습니다. 이러한 지식 능력에 대한需求이 증가하고 있지만 충분한 메모리와 컴퓨팅 능력이 없습니다. 따라서, 더 적은 인프라와 풋프린트로 더 정확한 지능을 확대하는 방법은 무엇일까요?
책상과 파일 캐비넷
메모리라는 용어 아래에 두 가지가 포함되며, 그들은 충분히 다르게 작동하여 나머지 내용은 그것들을 분리하는 것에 달려 있습니다.
컨텍스트 창에서 시작하겠습니다. 컨텍스트 창은 모델이 단일 패스에서 처리할 수 있는 양입니다. 책상 표면과 같습니다. 작은 책상은 몇 페이지씩 처리하며, 나머지는 서랍에 기다리고, 필요한 경우 가져오고 지웁니다. 큰 책상은 전체 케이스 파일을 한 번에 열어 두고 작업할 수 있습니다. 책상에 있는 내용은 매일 종료되면 지워집니다.
영구 메모리는 책상 옆의 파일 캐비넷입니다. 시스템은 저장할 내용을 선택하고, 관련이 있는 경우 다시 가져옵니다. 따라서 이번 주에 발생한 사건은 다음 주에 발생하는 사건에 영향을 줄 수 있습니다. 이러한 저장은 세션 간에 유지되며, 저장할 내용, 구성 방법, 언제 다시 가져올지에 대한 결정이 필요합니다.
많은 엔지니어링 경쟁이 책상에 집중되었습니다. 과거에는 몇 천 토큰을 처리할 수 있었지만, 현재에는 수십 만 토큰을 처리할 수 있으며, OpenAI와 Anthropic의 가장 큰 모델은 약 1백만 토큰을 처리할 수 있습니다.
이러한 작업을 위한 용어인 ‘컨텍스트 엔지니어링’은 Shopify의 Tobi Lutke가 만들었으며, 2025년 중반 Andrej Karpathy에 의해 대중화되었습니다. Karpathy는 심각한 AI 응용 프로그램의 핵심 기술은 다음 단계에 대한 올바른 정보로 창을 채우는 것이라고 썼습니다. 그의 비유는 하드웨어였습니다. 모델은 프로세서, 창은 작업 메모리입니다. 전문가들은 빠르게 이 용어를 채택했습니다. 왜냐하면 그들은 이미 이 아이디어를 라벨 없이 둘러싸고 있었기 때문입니다.
더 큰 책상을 가지는 것이 기억 문제를 해결하지 못한다
여기서 가장 명백한 해결책, 즉 책상을 계속 확대하는 것이 문제를 만나는 곳입니다.
스탠퍼드 연구진은 2024년에 모델이 필요한 정보가 긴 입력의 중간에 위치할 때 정확도가 크게 떨어진다는 것을 보여주었습니다. 그들은 이를 ‘중간에서 잃어버리다’라고 불렀으며, 이는 긴 컨텍스트를 위한 모델에서도 동일했습니다. 모델에 더 많은 정보를 제공하는 것은 모델이 정보를 신뢰성 있게 사용하는 것과 다릅니다.
이 효과는 다른 팀이 이를 찾기 위해 이동함에 따라 유지되었습니다. 2025년 연구에서는 18개의 최전선 모델을 점점 더 긴 입력에 대해 테스트했으며, 창이 채워지기 전에 성능이 저하되는 것을 발견했습니다. 그들은 이를 ‘컨텍스트 부패’라고 이름 붙였습니다. 책상을 확대하고 모델이 창의 모든 것을 신뢰성 있게 사용하는 것은 두 가지 별개的问题입니다. 첫 번째는 두 번째 문제를 해결하지 못합니다.
큐레이션이容量보다 더 많은 것을 얻는다
컨텍스트 엔지니어링은 이러한 문제를 해결하기 위해 발전했습니다. 2025년调查에서는 1,400개 이상의 논문을 기반으로 컨텍스트 엔지니어링의 방법을 설명했습니다. Gartner는 2025년 7월에 클라이언트에게 컨텍스트를 프롬프트보다 우선시하도록 조언했습니다. 이 기술은 모델에 더 날카로운 지시를 제공하는 것에서 모델이 작업할 수 있는 더 날카로운 입력 집합을 조립하는 것으로 발전했습니다.
더 큰 책상을 가지는 것은 책상에 무엇을 넣을지에 대한 내기를 높입니다. 문서 저장소를 책상 위에倒으면 중요한 페이지가 노이즈, 모순, 및 구식 버전과 함께 사라질 수 있습니다. 반면에 작업과 관련된 페이지만 선택하면 모델이 더 잘 작동할 수 있습니다. 판단은 모델에 무엇을 넣을지, 어떻게 프레임을 설정할지, 언제 나타날지, 그리고 무엇을 캐비넷에 둘지에 달려 있습니다.
RAG(Retrieval-Augmented Generation)는 이러한 문제를 해결하기 위해 만들어졌습니다. 문서를 조각으로 나누고 관련된 조각을 가져옵니다. 예를 들어 계약 분쟁이 페이지 200의 한 조항에 달려 있다면, 일반적인 접근 방식은 계약을 조각으로 나누고, 관련된 조각을 가져오는 것입니다. 페이지 200을 관련 없다고 판단하면 모델은 조항을 볼 수 없습니다.
더 큰 창은 문서 전체를 모델에 제공할 수 있으므로, 모델이 긴 입력을 잘 읽을 수 있는지 여부는 이전 섹션의 신뢰성 문제입니다. 이는 검색 시스템이 조항을 제공하지 않도록 결정하는 문제보다 더 좋은 문제입니다.
세션 내에서, 그리고 이후에
긴 컨텍스트는 AI 에이전트가 단일 교환보다 긴 작업을 처리할 수 있도록 합니다. 다일한 컴플라이언스 검토 또는 공급업체 온보딩을 처리하는 에이전트는 작업의 전체 상태를 유지하며, 각 단계는 작업의 전체 상태에서 bénéfice를 얻습니다. 세션 내에서 충분히 긴 창은 메모리를 대체할 수 있습니다.
그러나 시스템이 다음 주에 기억해야 할 내용은 세션이 종료된 후에도 유지되어야 합니다. 이러한 종류의 메모리를 구축하는 것은 다양한 문제를帶來합니다. 많은 산업은 아직 이러한 문제에 직면하지 못했습니다. 내 심리학 및 신경과학 교육은 인간의 기억과 비교하기 어렵지 않습니다. 우리는 이벤트의 완벽한 기록을 회상하지 않습니다. 우리는 기억할 때마다 이를 재구성하며, 작은 오류가渐渐적으로 받아들여지는 버전이 될 수 있습니다. 기계 메모리도 저장된 정보를 반복적으로 요약, 병합, 또는 다시 작성할 때 비슷한 문제가 발생할 수 있습니다. 시간이 지남에 따라 기록은 원래 이벤트에서 멀어질 수 있습니다. 이러한 문제를 해결하기 위해, 저장된 정보를 검사하고, 오류를 수정하며, 신뢰할 수 없는 정보를 제거해야 합니다.
이러한 시스템을 배포하는 많은 회사들은 아직 이러한 문제에 직면하지 못했습니다. 또한, 이러한 문제는 거의 해결되지 않았습니다. 나는 벤더에서 광고하는 창의 크기가 아니라, 무엇을 유지할지에 대한 판단력과 모든 정보에 대해 정확하게推論할 수 있는 능력을 살펴볼 것입니다. 이러한 능력은 더 적은 인프라와 풋프린트로 더 많은 것을 얻을 수 있습니다. 이는 더 적은 것으로 더 많은 것을 하는 것입니다. 그러나 모든 큰 창이 이러한 真の 能力を 갖고 있는 것은 아닙니다.












