Лидеры мнений

Проблема памяти ИИ: почему эффективный длинный контекст меняет всё, и что нужно, чтобы всё сделать правильно

mm
Добавьте Unite.AI в избранные источники в Google

Коллега, который забывает каждое предыдущее разговор сразу после его окончания, не продержится долго на большинстве работ. Однако многие бизнес-ИИ работают именно так. Сессия заканчивается, и контекст исчезает вместе с ней. Потребитель, который задает одноразовые вопросы, может едва заметить это, но компания, которая проводит процесс, который длится дольше одной сессии, сталкивается с лимитом почти сразу.

Настоящая работа продолжается из одной сессии в другую, и решение, принятое в четверг, обычно основано на решении, принятом в понедельник, с необходимостью сохранить мыслительный процесс между ними. ИИ, который стирает себя, когда сессия заканчивается, может хорошо работать внутри этой сессии и всё равно не внести никакого вклада в задачу, которая длится неделю.

Корпоративный ИИ тихо изменил то, что он требует от модели. В течение многих лет модели оценивались в основном по количеству знаний, которые они впитали. Бизнес теперь требует от них сохранять правильную информацию на виду, когда работа развивается, что требует другого вида эффективной инженерии. До сих пор способность сохранять этот уровень постоянных знаний не была достигнута из-за большого количества памяти (GPU), вычислительной мощности и стоимости, необходимых для масштабирования такой возможности. Поддержание приемлемой задержки и уровня галлюцинации модели становится проблемой при одновременном использовании, когда используется большая контекстная информация. Растет спрос на такие знания, и не хватает памяти и вычислительной мощности.

Стол и файловый шкаф

Два вещи объединяются под названием памяти, и они ведут себя достаточно по-разному, чтобы остальная часть этого зависела от их разделения.

Начните с контекстного окна, которое представляет собой то, сколько модель может принять и рассуждать за один проход. Это работает как поверхность стола. Маленький стол может принять несколько страниц одновременно, поэтому всё остальное ждёт в ящике и извлекается и очищается по мере продвижения, тогда как большой стол позволяет整个 деловой файл лежать открытым во время работы. То, что лежит на столе, убирается в конце дня, каждый день.

Постоянная память – это файловый шкаф рядом со столом. Система выбирает, что хранить, и извлекает это, когда это становится актуальным, поэтому что-то, что произошло на этой неделе, может повлиять на то, что она делает на следующей неделе. Этот запас сохраняется между сессиями и требует собственных решений о том, что сохранить, как его организовать и когда его вернуть.

Большая часть видимой инженерной работы была направлена на стол. Окна, которые ранее содержали несколько тысяч токенов, теперь могут содержать сотни тысяч, и самые крупные модели от OpenAI и Anthropic достигают миллиона.

Большой стол не решает проблему памяти

Именно здесь очевидный шаг – просто увеличивать стол – сталкивается с трудностями.

Исследователи Стэнфорда показали в 2024 году, что когда информация, необходимая модели, находится в середине длинного входа, её точность резко падает по сравнению с тем же фактом, размещённым в начале или конце. Они назвали это “потерянным в середине”, и это сохранялось даже для моделей, специально разработанных для длинного контекста. Помещение большего количества информации перед моделью, оказывается, не то же самое, что модель надёжно использует её.

Контекстная инженерия приносит больше, чем ёмкость

Контекстная инженерия выросла в отдельную дисциплину на основе этого, и обзор 2025 года, основанный на более чем 1400 работах, изложил её методы, и Gartner посоветовал клиентам в июле 2025 года уделять приоритетное внимание контексту над подсказками. Ремесло перешло от формулирования более точной инструкции к сбору более точного набора входных данных для модели.

Больший стол повышает ставки на то, что вы решаете положить на него. Переворачивание всего документооборота на поверхность и несколько страниц, которые имеют значение, окажутся потерянными среди шума, противоречий и устаревших версий, тогда как более тесный выбор того, что действительно влияет на задачу, позволяет одной и той же модели работать намного лучше. Суждение заключается в том, что принадлежит перед модели, как оно сформулировано, когда оно появляется и что остаётся в шкафу.

Внутри сессии и после неё

Длинный контекст – это то, что позволяет ИИ-агенту работать над длинной задачей, а не над одной транзакцией. Агент, который обрабатывает многодневный обзор соблюдения требований или регистрацию поставщика, сохраняет всю задачу в окне во время выполнения, поэтому каждый шаг опирается на полное состояние задачи. Достаточно длинное окно может заменить память внутри сессии.

То, что система должна вспомнить на следующей неделе, после закрытия этой сессии, должно жить где-то, где окно не является.

Создание такого рода памяти приносит другую серию проблем, многие из которых отрасль только начала решать. Мои знания в области психологии и нейробиологии делают сравнение с человеческой памятью трудным для игнорирования. Мы не извлекаем идеальную запись события. Каждый раз, когда мы вспоминаем его, мы перестраиваем его, и небольшие ошибки могут постепенно стать частью принятой версии. Машина памяти может развить подобную проблему, когда сохранённая информация повторно суммируется, объединяется или переписывается. Со временем запись может отойти от исходного события, если кто-то не проверит её, исправит ошибки и удалит информацию, которая стала ненадёжной.

Многие компании, которые развертывают эти системы, ещё не столкнулись с этими проблемами, и немногие из них близки к решению. То, на что я бы обратил внимание у поставщика, – это не размер окна, которое они рекламируют. Модель, которая может содержать 10 миллионов токенов, стоит мало, если большая часть того, что она сохраняет, устарела, неактуальна или неверна. Её ответы могут выглядеть хорошо обоснованными, основанными на материале, который бизнес никогда не должен был доверять. То, что приносит деньги, – это суждение о том, что сохранить, и способность точно рассуждать над всей информацией, на доле инфраструктурной стоимости и следа. Это делать больше с меньшим, и не все более крупные окна имеют эту истинную способность.

Мэтью Хасвелл является сооснователем компании Refiant, которая занимается разработкой эффективного ИИ, сжатием и созданием более эффективных и практичных моделей, включая длинный контекст. Обладая степенью магистра медицинских наук и будучи нейробиологом по образованию, он занимал стратегические должности в области управления, бизнеса, операций и продукта в технологических, финтех, игровых, розничных и финансовых компаниях

В целом, я хотел бы, чтобы мы больше фокусировались на том, что у нас есть новый подход к эффективности ИИ, который позволяет использовать длинный контекст на доле вычислительных ресурсов и памяти.