Взгляд Anderson
Обучение забывчивому ИИ «запоминать» на более длительный период

Модели языка часто не могут вспомнить начало разговора. Новый метод сжатия текста может изменить это и сделать сеансы разговора с ИИ намного менее раздражающими.
Системы разговорного ИИ, такие как ChatGPT, часто теряют связь с ранними частями разговора, повторяя себя или давая ответы, которые игнорируют ранее согласованные правила.
Это связано с тем, что большие языковые модели (LLM) имеют ограниченную способность фокусироваться, определяемую как контекстное окно внимания – как фонарик, который может освещать только то, на что он направлен, и несколько соседних объектов.
Исправление таких «амнезийных» тенденций, которые обусловлены этими ограничениями внимания, является одним из наиболее важных направлений исследований языковых моделей ИИ – не в последнюю очередь потому, что этот синдром серьезно ограничивает возможность полезных и последовательных многоходовых разговоров и ограничивает полезность LLM в различных контекстах, требующих точности, таких как медицина и право.
Разгром
Новые исследования из Китая† предлагают новый метод, позволяющий значительно увеличить количество текста, который может поместиться в ограниченные ресурсы GPU, работающего с моделью ИИ – с результатами, достигающими 20-кратного сжатия при сохранении 98% точности:

Контекстное каскадное сжатие (C3) реконструирует длинные документы более точно, чем оптические методы сжатия, такие как DeepSeek-OCR, даже когда входные данные уменьшаются до сорока раз. На протяжении всего диапазона длин документов и настроек сжатия новый метод сохраняет почти идеальную точность, в то время как оптический подход ухудшается при более высоком сжатии. Источник
С точностью 93%, которая находится в рабочих параметрах, сжатие текста может даже достичь 40-кратного отношения сжатия:

Три подхода к сжатию длинного текста для входных данных языковой модели: базовый метод (слева) токенизирует текст直接, в результате чего получается большой счетчик токенов; оптический путь (в центре) преобразует текст в изображение и извлекает визуальные вложения с помощью трансформера зрения, достигая 10-кратного сжатия; и новый метод C3 (справа) использует небольшую языковую модель для сжатия текста в только 32 латентных токена, получая 40-кратное сжатие без использования визуальных кодирований.
Это означает, что вся даже очень длинная беседа может быть сжата и повторно введена (обновлена) на интервалах в обменах как контекстная информация, позже в чате – когда LLM обычно забывает ранее установленные факты и скользит в «амнезийное» поведение.
Хотя это является потерянным методом сжатия, даже то, как происходит потеря, является полезным: при новом методе память ухудшается в конце предложения, а не равномерно на протяжении всего, как при архитектуре DeepSeek-OCR, которая вдохновила новый подход; фактически, исследователи, стоящие за новой работой, предлагают, что их метод ухудшается таким же образом, как и реальная человеческая память, а не случайно:

Вверху, человеческая память ухудшается в конце потока данных; в середине: DeepSeek-OCR ухудшается случайно, не оставляя якорей, которые могли бы помочь в решении проблемы; внизу: новый метод ухудшается таким же образом, как человеческая память, к завершению потока данных, предлагая маркеры, которые могут помочь улучшить точность посредством постфактум-процессинга.
Это означает, что можно предсказать, где запомненные данные могут быть менее надежными, и использовать это знание для решения проблемы – потенциально предлагая огромное улучшение в воспоминании разговора и последовательности, с 100% точностью после исправления.
Новый подход называется Контекстным каскадным сжатием (C3), и вдохновлен способом, которым DeepSeek-OCR сжимает текст как изображения, достигая больших уровней сжатия. Однако, используя две (средние и большие) языковые модели для сжатия длинного текста непосредственно в латентные вложения, новый подход исключает задержку, вызванную использованием растровых изображений, тем самым достигая улучшенной производительности.
Статья гласит:
‘Превосходная производительность C3 может быть отнесена к его фундаментальной архитектурной конструкции. Анализ DeepSeek-OCR предполагает, что его производительность снижается из-за факторов, таких как “сложная компоновка” и “размытие изображения при более низких разрешениях” – внутренних ограничений оптического пути.’
‘Наш парадигма C3, работающий直接 в текстовом домене, полностью защищен от этих визуальных артефактов. Он избегает потери информации, связанной с отображением текста в пиксели и их последующим кодированием. Вместо этого он использует мощное семантическое понимание предварительно обученной LLM для извлечения текстовой информации непосредственно в эффективное латентное представление.’
Новая статья озаглавлена Контекстное каскадное сжатие: Изучение верхних пределов текстового сжатия и исходит от двух авторов†, которые, кажется, также предлагают C3 как открытое хранилище на GitHub.
Метод
Чтобы понять новый подход, полезно знать, что такое оптическое распознавание символов (OCR), поскольку именно отсюда возникла вся идея.
OCR – это алгоритмический метод, восходящий к 1920-м годам, хотя и получил популярность в 1990-х годах, где метод обнаружения закономерностей позволяет компьютерной программе преобразовать растровый текст (т.е. текст внутри изображений, который не может быть выбран и который существует только как фотографический контент) в редактируемый текст.
Создатели DeepSeek-OCR обнаружили, что текст можно сжать гораздо больше, чем стандартные конвейеры, используя OCR в качестве промежуточной стадии. Другими словами, вместо сжатия текста самого по себе можно добиться большей плотности латентных вложений (т.е. сохранить больше информации), сжимая растеризованную версию этого текста:
![Из статьи о выпуске DeepSeek-OCR, схема конвейера сжатия, включая 16x16 растровые патчи в качестве компонента OCR. Источник [ https://arxiv.org/pdf/2510.18234 ]](https://www.unite.ai/wp-content/uploads/2025/11/deepseekocr.jpg)
Из статьи о выпуске DeepSeek-OCR, схема конвейера сжатия, включая 16×16 растровые патчи в качестве компонента OCR. Источник
Новая статья предполагает, что оптические подходы, такие как DeepSeek-OCR, могут быть неправильно атрибутированы источнику их прироста сжатия. Вместо того, чтобы сдвиг с текста на изображение был основным фактором, авторы полагают, что ключевым преимуществом является преобразование многословных текстовых токенов в более эффективные латентные представления.
Чтобы проверить это, они создали конвейер, использующий две языковые модели: меньшую Qwen2.5 1.5B, которая функционирует как кодировщик, сжимающий длинные отрывки в небольшой набор латентных токенов; и большую Qwen2.5 3B, которая функционирует как декодировщик, восстанавливающий исходный текст из этих токенов:

В новой системе C3 меньшая модель Qwen2.5 1.5B сжимает длинный вход в фиксированный набор латентных токенов, используя обучаемые запросные вложения. Эти токены, вместе с подсказкой, передаются большей модели Qwen2.5 3B, которая восстанавливает исходный текст. Эта архитектура позволяет высокоточное воспоминание длинных последовательностей, используя только часть исходного количества токенов.
Чтобы обработать стадию сжатия, исследователи адаптировали предварительно обученную модель Qwen2.5 1.5B, введя обучаемые запросные вложения: абстрактные подсказки, которые направляют модель в извлечении входного длинного контекста в гораздо меньшее латентное представление.
Вместо изменения архитектуры метод просто подает длинный текст и запросные вложения вместе как единый вход. Механизм самовнимания модели рассматривает эти элементы идентично, позволяя ей выдавать фиксированное латентное контекстное представление без необходимости новых слоев или изменений в конструкции; и это выход затем передается большей модели для восстановления.
Чтобы оценить, сколько информации сохранилось после сжатия, исследователи инструктировали декодировщик Qwen2.5 3B восстановить исходный вход, используя только латентные токены и подсказку ‘повторить текст’. Поскольку задача заключалась в точной репродукции, а не в суммировании или парафразе, любое отклонение от исходного могло быть напрямую отнесено к потерянной информации в сжатии, предлагая чистый и объективный тест точности на протяжении всего конвейера кодирования-декодирования.
Данные и тесты
Статья гласит, что авторы собрали исходный набор данных OCR, состоящий из миллиона страниц, полученных из интернета. Никаких дальнейших деталей на этот счет не видно, и авторы, кажется, намеренно расплывчаты на этот счет.
Тем не менее, они отмечают, что инженерия и курирование данных были ненужными для их целей, и что они смогли эффективно обучить свою модель на образцах «различной длины»; и они утверждают, что это указывает на то, что их архитектура является устойчивой (и, следовательно, хорошо генерализированной, в зависимости от настроек обучения).
Модель была обучена на высокопроизводительном кластере, состоящем из восьми GPU NVIDIA H800, каждая из которых оснащена 80 ГБ видеопамяти, в результате чего общий объем видеопамяти составил 640 ГБ. Каждая GPU могла вместить пакетный размер 2, в результате чего общий глобальный пакетный размер составил 256, учитывая 16 накопительных шагов, запланированных. Оптимизатором был AdamW, в течение общего количества 40 000 шагов.
Чтобы проверить эффективность архитектуры C3, исследователи использовали тот же набор оценки, который был использован в исходной статье DeepSeek-OCR, используя бенчмарк Fox для измерения сжатия и точности восстановления на протяжении всего диапазона длин документов.
Были выбраны тексты на английском языке, с отрывками, варьирующимися от 600 до 1300 токенов, с токенизацией, выполненной с помощью токенизатора Qwen.
Чтобы обеспечить справедливое сравнение, были использованы эквивалентные уровни сжатия из оптической базовой линии, с 64 и 100 латентными токенами. Чтобы изучить пределы метода, были проведены дополнительные тесты, используя только 32 латентных токена. В каждом случае восстановление было инициировано с помощью инструкции ‘повторить текст’:

Результаты из начального теста. Точность восстановления и отношения сжатия были измерены на протяжении семи диапазонов токенов, используя 64 и 100 латентных токенов, показывая постоянное превосходство C3 над DeepSeek-OCR, особенно на более высоких уровнях сжатия.
Обсуждая начальные результаты, показанные выше, статья гласит:
‘Данные неоспоримо демонстрируют, что парадигма C3 значительно превосходит оптический подход к сжатию во всех протестированных условиях, устанавливая новый уровень высокоточной контекстной компрессии.’
Когда обе системы были протестированы на более длинных документах, DeepSeek-OCR начала терять точность при увеличении сжатия, падая ниже 60% в наиболее экстремальном случае. C3 справилась с тем же уровнем сжатия с гораздо меньшей потерей, сохраняя точность gầnко 98%, даже когда входные данные были уменьшены до одной двадцатой части от исходного размера.
В наиболее требовательном тесте полные тексты были уменьшены до всего 32 токенов. Даже тогда модель смогла восстановить почти весь исходный контент, сохраняя точность близко к 99% в многих случаях:

Точность восстановления и отношения сжатия при 32 латентных токенах, показывая, что даже при экстремальных уменьшениях (до почти 40-кратного) точность остается выше 93%.
На наиболее экстремальной настройке, когда входные данные были сжаты почти до одной сороковой части от исходного размера, она все еще вспомнила более 93%. Для сравнения, более ранние оптические методы упали до примерно 60% точности при половине этого уровня сжатия.
Авторы утверждают††:
‘Эти результаты окончательно демонстрируют преимущество архитектуры C3. Избегая информационных бутылочных горлышек и потенциальных артефактов, присущих визуальной модальности (например, ограничения разрешения изображения, сложность компоновки), наш метод без проблем обрабатывает экстремальное сжатие с минимальной потерей информации. ‘
‘Результаты из этого агрессивного тестового случая укрепляют нашу претензию на то, что прямое текстово-латентное сжатие является фундаментально более эффективным и мощным парадигмой, чем его оптические аналоги.’
Они также заключили, что C3 может ‘разблокировать новые возможности в обработке целых книг, обширных юридических документов или больших кодовых баз для задач, таких как ответы на вопросы, суммирование и анализ’.
Вывод
Это одна из наиболее ясных и доступных статей, с которой я недавно столкнулся, с похвально ясной основной идеей, которая может оказаться, по крайней мере, дополнительной линией атаки против проблемы «контекстного окна».
Многие пользователи LLM будут знать к этому моменту, что необходимо «освежить» важную информацию или рекомендации периодически на протяжении долгого обмена, обнаружив по трудному пути, что системы, такие как ChatGPT, не могут сохранить эту информацию в течение очень долгого времени. Следуя за этим интуитивным быстрым исправлением, идея, представленная в новой статье, заключается в том, что высокосжатая версия длинной беседы может быть повторно введена на интервалах, автоматически, в контекстное окно текущего экземпляра LLM, по сути «запоминая по прокси».
В климате, где нехватка GPU приводит к рыночному ралли даже на традиционную компьютерную память (такую как DRAM, где многие бывшие рабочие нагрузки GPU теперь передаются для поддержки более крупных моделей), кажется маловероятным, что аппаратное обеспечение ИИ станет значительно более емким в ближайшем будущем; поэтому инновационные подходы, такие как этот, которые почти являются ностальгическим повторением эволюции сжатия файлов 1990-х годов, могут оказаться необходимыми для продвижения производительности вперед.
Более того, было бы просто замечательно, если бы LLM могли поддерживать связный разговор в течение часа или более и фактически помнить, о чем разговор был изначально.
* Инструкции по установке CLI приведены, но я не имею возможности попытаться установить их, и не уверен, что репозиторий является код-полным.
† Два автора указаны как Фанфан Лю и Хайбо Цюй. Как показывает случайное исследование, Цюй в настоящее время является исследователем в китайской технологической компании Meituan, а Лю является студентом магистратуры в Китайской академии наук. Ни один из них в настоящее время не имеет статьи в своих историях. Если любая из этих атрибуций неверна, пожалуйста, свяжитесь со мной через мой профиль.
†† Хотя авторы придерживаются формулы, предоставляя дополнительные качественные тесты, они неосвещают по сравнению с предыдущим раундом тестов на сжатие, и я не освещал их здесь.
Опубликовано впервые в пятницу, 21 ноября 2025 года












