ソートリーダー

AIのメモリ問題:効率的な長いコンテキストが何を変えるのか、そしてそれを正しく実現するために何が必要か

mm
Unite.AI を Google の優先ソースに追加

会話の内容をセッションが終了するたびに忘れてしまう同僚は、ほとんどの仕事では長くは続きません。しかし、多くのビジネスAIはまさにそのように動作しています。セッションが閉じると、コンテキストも一緒に消え去ります。単発の質問を投げかける消費者であれば、気付くことはないかもしれませんが、単一のセッションよりも長く続くプロセスを実行している企業は、すぐに限界に達します。

実際の仕事は、1つのセッションから次のセッションへ継続的に進みます。木曜日に下した決定は、通常、月曜日に下した決定に基づいています。その思考プロセスは、その間ずっと存続する必要があります。セッションが終了するたびに自分をクリーンアップするAIは、セッション内ではうまく動作するかもしれませんが、1週間以上にわたるタスクに何の貢献もしません。

エンタープライズAIは、モデルに対する要求を静かに変化させてきました。長い間、モデルは吸収した知識の量で評価されていました。企業は、仕事が進むにつれて、正しい情報を保持する能力が必要です。この能力は、異なる種類の効率的なエンジニアリングを必要とします。現在、持続的な知識を保持する能力は、GPU、コンピューティング、コストが必要になるため、実現できていません。大きなコンテキストを使用する場合、同時使用時に許容される遅延とモデルホールユーションのレベルを維持することは課題です。このような知識能力の需要は増えていますが、十分なメモリとコンピューティング能力はありません。したがって、インフラストラクチャとフットプリントを削減しながら、より正確なインテリジェンスを実現する方法は何でしょうか。

机とファイリングキャビネット

メモリという用語には2つの異なるものが含まれています。これらを区別することが重要です。

コンテキストウィンドウから始めましょう。これは、モデルが1回のパスで処理できる情報の量です。机の表面のように動作します。小さな机では、数ページずつ処理します。その他のページは引き出しからフェッチされ、クリアされます。一方、大きな机では、ケースファイル全体が開かれたままになります。机上にあるものは、毎日終了時にクリアされます。

永続的なメモリは、机の隣にあるファイリングキャビネットです。システムは、保存するものを選択し、関連するときにそれを取り出します。つまり、1週間前に起こったことと、次に何をするかを関連付けることができます。保存された情報はセッションを超えて保持され、保存方法、整理方法、取り出すタイミングについての判断が必要です。

多くのエンジニアリングの努力は、机に注がれてきました。数千トークンしか保持できなかったウィンドウは、現在では数十万トークン、または数百万トークンを保持できます。OpenAIやAnthropicの最大モデルは、約100万トークンに達します。

コンテキストエンジニアリングという用語は、ShopifyのTobi Lutkeによって生み出され、Andrej Karpathyによって2025年に普及しました。Karpathyは、真剣にAIを適用する場合、ウィンドウに次のステップに必要な正しい情報を入れることが最も重要なスキルであると書きました。彼のアナロジーは、ハードウェアに基づいていました。モデルはプロセッサであり、ウィンドウはそのワーキングメモリです。エンジニアは、すぐにこの用語を採用しました。なぜなら、彼らはこのアイデアをラベルなしで取り巻いていたからです。

机を大きくするだけではメモリの問題は解決されない

ここで、明らかな解決策、つまり机を大きくするだけ、が問題に直面します。

スタンフォードの研究者は2024年に、モデルが必要とする情報が長い入力の中央に位置しているとき、その精度が急激に低下することを示しました。彼らはこれを「真ん中で失われる」と呼びました。これは、モデルが長いコンテキストに特化して設計されていた場合でも当てはまります。モデルにさらに多くの情報を与えることは、モデルがそれを信頼性高く利用することと同じではありません。

この効果は、他のチームがこれを探すにつれても維持されています。2025年の研究では、18の最先端モデルを順に長くした入力に対して実行し、ウィンドウが満たされる前にパフォーマンスが低下することを発見しました。著者はこれを「コンテキストの腐敗」と名付けました。机を大きくすることと、机上のすべてをきれいに処理することは、別々の問題です。前者は後者を解決しません。

キュレーションは容量よりも多く稼ぐ

コンテキストエンジニアリングは、この問題に対処するために発展してきました。2025年の調査では、1,400以上の論文を引用して、その方法を説明しています。また、Gartnerは2025年7月にクライアントにコンテキストを優先するようアドバイスしています。コンテキストエンジニアリングは、モデルに与える入力をより鋭くすることに焦点を当てています。

机が大きくなると、そこに何を置くかについての賭けが高まります。ドキュメントストア全体を机上に置くと、重要なページはノイズ、矛盾、古いバージョンの中で失われます。一方、タスクに関連するものだけを厳選してモデルに与えると、同じモデルがはるかに優れたパフォーマンスを発揮します。判断は、モデルに何を提示するか、どのように提示するか、いつ提示するか、そして何を机の脇にあるキャビネットに残すかということです。

RAG(retrieval-Augmented Generation)は、ドキュメントを断片化し、関連する断片を取り出すことで、ウィンドウが小さすぎる問題を回避するために構築されました。たとえば、契約紛争が200ページ目の1つの条項に依存している場合、通常のアプローチでは契約を断片化し、関連する断片を取り出します。200ページ目が関連しないと判断されると、モデルはその条項を見ません。

契約全体をウィンドウに収めることで、フェッチのステップを完全に省略し、モデルに条項とその周囲の情報を提供します。モデルが長い入力をうまく処理するかどうかは、前のセクションの信頼性の問題です。これは、取り出しシステムが条項を重要でないと判断し、モデルに提示しないという問題よりも、はるかに良い問題です。

セッション内とセッション後

長いコンテキストは、AIエージェントが単一のやり取りではなく、長いジョブで作業できるようにします。複数日のコンプライアンスレビューまたはサプライヤー登録を扱うエージェントは、ジョブ全体をウィンドウ内に保持し、各ステップでジョブの完全な状態を利用します。セッション内では、十分に長いウィンドウはメモリの代わりになります。

しかし、セッションが閉じた後、システムが次週に思い出すべきものは、ウィンドウ内に存在できないどこか別の場所に保存されなければなりません。

そのようなメモリを構築することは、業界がまだ対処し始めたばかりの別の問題セットをもたらします。心理学と神経科学の訓練を受けた私は、人間のメモリとの類似性を無視することが難しいです。私たちは、出来事の完全な記録を思い出すのではありません。私たちは、それを思い出すたびに、それを再構築します。小さなミスは、時間の経過とともに受け入れられたバージョンの一部になることができます。機械のメモリも、保存された情報が繰り返し要約されたり、結合されたり、書き換えられたりすると、同様の問題が発生する可能性があります。時間の経過とともに、記録は元の出来事から遠ざかる可能性があります。誰かがそれをチェックし、ミスを修正し、信頼性の低い情報を削除しない限りはです。

これらのシステムを展開している多くの企業はまだこれらの問題に直面していません。解決策を見つけた企業もほとんどありません。ベンダーに注目するのは、ウィンドウのサイズではなく、宣伝しているものです。1,000万トークンを保持できるモデルは、保持している情報のほとんどが古くなっている、関連性がなく、間違っている場合、ほとんど価値がありません。回答は信頼できる情報源に基づいているように見えますが、実際にはビジネスが信頼すべきではない情報に基づいている可能性があります。情報を保持することの判断と、すべての情報を正確に推論する能力が、インフラストラクチャのコストとフットプリントの小さい部分で稼ぐものです。那が、より少ないものでより多くのことを行うことです。すべての大きいウィンドウがこの真の能力を持っているわけではありません。

マシュー・ハズウェルは、Refiantの共同創設者です。Refiantは、効率的なAI、圧縮、モデルをより効率的に実装可能なものにすることに焦点を当てたAI企業です。医学科学の修士号を持ち、神経科学の訓練を受けたハズウェルは、テクノロジー、フィンテック、ゲーム、小売、金融サービス企業の戦略的なエグゼクティブ、ビジネス、運用、製品役割を歴任しています。

一般的に、私たちは、長いコンテキストを計算資源とメモリの小さな部分で実現できる独自のAI効率アプローチに焦点を当てたいと思います。