Лидеры мнений

Проблема памяти ИИ: почему эффективный длинный контекст меняет всё, и что нужно, чтобы всё сделать правильно

mm
Добавьте Unite.AI в избранные источники в Google

Коллега, забывающий каждый разговор сразу после его завершения, на большинстве рабочих мест долго не продержался бы. Однако многие системы ИИ для бизнеса устроены именно так: сессия заканчивается, и вместе с ней исчезает контекст. Потребитель, задающий разовые вопросы, может почти этого не заметить, но компания, выполняющая процесс дольше одного сеанса, практически сразу сталкивается с ограничением.

Реальная работа продолжается от сессии к сессии. Решение, принятое в четверг, обычно опирается на принятое в понедельник, и обоснование должно сохраниться между ними. ИИ, очищающий своё состояние в конце сессии, может хорошо работать в её рамках и при этом ничего не давать задаче, которая длится неделю.

Требования бизнеса к моделям незаметно изменились. Годами их оценивали преимущественно по объёму усвоенных знаний. Теперь компаниям нужно, чтобы по мере выполнения работы модели удерживали в поле зрения нужную информацию, а это требует иного подхода к инженерной эффективности. До сих пор обеспечить такой уровень постоянного сохранения знаний в масштабе мешали объёмы памяти GPU, вычислительные ресурсы и затраты. При одновременной работе множества пользователей с большим контекстом становится сложно поддерживать приемлемую задержку и уровень галлюцинаций. Спрос на такие возможности растёт, а памяти и вычислительных ресурсов на всех не хватает. Возникает вопрос: как добиться более точной интеллектуальной работы в масштабе, используя меньше инфраструктуры и ресурсов?

Рабочий стол и картотечный шкаф

Под словом «память» объединяют две вещи, которые работают настолько по-разному, что дальше важно их различать.

Начнём с контекстного окна: это объём информации, который модель может принять и осмыслить за один проход. Оно похоже на поверхность рабочего стола. На маленьком одновременно помещается несколько страниц, а всё остальное ждёт в ящике: материалы приходится доставать и убирать по ходу работы. Большой позволяет разложить всё дело сразу. Но каждый вечер стол полностью очищают.

Постоянная память — это стоящий рядом картотечный шкаф. Система выбирает, что сохранить, и достаёт нужное, когда оно становится актуальным. Поэтому произошедшее на этой неделе может повлиять на действия на следующей. Хранилище сохраняется между сессиями и требует отдельных решений о том, что записывать, как организовывать и когда извлекать.

Значительная часть заметной инженерной гонки сосредоточилась на столе. Окна, вмещавшие когда-то несколько тысяч токенов, теперь достигают сотен тысяч, а у крупнейших моделей OpenAI и Anthropic — примерно миллиона.

Название этой работы, «контекстная инженерия», предложил Тоби Лютке из Shopify (SHOP ), а в середине 2025 года его популяризировал Андрей Карпаты. Карпаты писал, что ключевой навык при создании серьёзного ИИ-приложения — заполнить окно правильной информацией для следующего шага. Он сравнивал модель с процессором, а окно — с его оперативной памятью. Практики быстро приняли термин, потому что давно обсуждали эту идею, но не имели для неё названия.

Большой стол не решает проблему памяти

Здесь очевидный ход — просто увеличивать стол — сталкивается с трудностями.

Исследователи Стэнфорда показали в 2024 году , что когда нужная модели информация находится в середине длинного ввода, точность резко падает по сравнению с размещением того же факта в начале или конце. Они назвали это «потерей в середине», причём эффект наблюдался даже у моделей, специально созданных для длинного контекста. Предъявить модели больше информации, как оказалось, не значит добиться её надёжного использования.

Другие команды также обнаружили этот эффект. Исследование 2025 года, проверившее 18 передовых моделей на всё более длинных входных данных, выявило ухудшение качества задолго до полного заполнения окна. Авторы назвали закономерность деградацией контекста. Увеличить стол и научить модель правильно рассуждать обо всём, что на нём лежит, — две разные задачи. Решение первой само по себе не решает вторую.

Отбор информации ценнее вместимости

На этой основе контекстная инженерия выросла в отдельную дисциплину. Её методы систематизировал обзор 2025 года, охвативший более 1 400 работ , а Gartner в июле 2025 года посоветовала клиентам ставить контекст выше промптов. Акцент сместился с более точной формулировки инструкции на более качественный набор входных данных для модели.

Чем больше стол, тем важнее выбор того, что на него положить. Если вывалить туда всё хранилище документов, несколько нужных страниц затеряются среди шума, противоречий и устаревших версий. Более строгий отбор действительно относящихся к задаче материалов позволяет той же модели работать заметно лучше. Нужна осмысленная оценка того, что должно находиться перед моделью, как это представить, когда показать и что оставить в шкафу.

Именно для этого создавали RAG — генерацию с дополнением извлечёнными материалами: документы разбивают на фрагменты и выбирают кажущиеся релевантными, обходя ограничение окна, которое не вмещает всё целиком. Допустим, спор по договору зависит от одного пункта на странице 200. При обычном подходе договор разбивают, а система поиска подбирает подходящие части. Если она сочтёт страницу 200 нерелевантной, модель никогда не увидит нужный пункт.

Окно, вмещающее весь договор, позволяет полностью пропустить этап поиска и передать модели этот пункт вместе с окружением. Насколько хорошо модель прочитает длинный ввод — вопрос надёжности из предыдущего раздела. Но лучше решать его, чем зависеть от системы поиска, которая незаметно решила не передавать нужный пункт.

Внутри сессии и после неё

Длинный контекст позволяет ИИ-агенту выполнять продолжительную работу, а не ограничиваться одним обменом сообщениями. Агент, проводящий многодневную проверку соблюдения требований или подключающий поставщика, по ходу работы держит всю задачу в окне. Каждый шаг опирается на её полное состояние. Достаточно длинное окно может заменять память внутри сессии.

На этом сходство заканчивается. Всё, что системе нужно вспомнить на следующей неделе после закрытия текущей сессии, должно храниться вне окна.

Создание такой памяти приносит другой набор проблем, со многими из которых отрасль только начинает сталкиваться. Моё образование в психологии и нейронауках заставляет обратить внимание на сходство с человеческой памятью. Мы не извлекаем идеальную запись события. Вспоминая, мы каждый раз воссоздаём его, и небольшие ошибки постепенно могут стать частью принятой версии. Похожая проблема возникает у машинной памяти, когда сохранённую информацию многократно суммируют, объединяют или переписывают. Запись со временем отдаляется от исходного события, если её не проверять, не исправлять ошибки и не удалять ставшие ненадёжными сведения.

Многие компании, внедряющие такие системы, ещё не встретились с этими проблемами, и лишь немногие из самих проблем близки к решению. При оценке поставщика я смотрел бы не на рекламируемый размер окна. Модель на десять миллионов токенов мало чего стоит, если большая часть сохранённого устарела, не относится к делу или неверна. Ответы могут выглядеть хорошо подтверждёнными источниками, но опираться на материалы, которым бизнес вообще не должен был доверять. Ценность создают осмысленный выбор сохраняемой информации и способность точно рассуждать на её основе при существенно меньших затратах и объёме инфраструктуры. Это и значит делать больше с меньшими ресурсами. Не каждое большое окно действительно даёт такую возможность.

Мэтью Хасвелл является сооснователем Refiant, компании по искусственному интеллекту, которая фокусируется на эффективном ИИ, сжатии и повышении эффективности и практичности моделей, включая длинный контекст. Обладая степенью магистра медицинских наук и будучи нейробиологом по образованию, он занимал стратегические исполнительные, деловые, операционные и продуктовые роли в технологических, финтех, игровых, розничных и финансовых компаниях.