Модели и платформы ИИ
Почему большие языковые модели забывают середину: Раскрытие скрытой слепой зоны ИИ

Поскольку большие языковые модели (LLM) широко используются для задач, таких как суммаризация документов, юридический анализ и оценка медицинской истории, важно признать ограничения этих моделей. Хотя распространенные проблемы, такие как галлюцинации и предвзятость, хорошо известны, исследователи недавно обнаружили еще один значительный недостаток: при обработке длинных текстов LLM склонны сохранять информацию в начале и конце, но часто забывают середину.
Эта проблема, называемая “потерянной в середине” феноменом, может серьезно повлиять на производительность этих моделей в реальных приложениях. Например, если ИИ задача состоит в том, чтобы суммировать длинный юридический документ, пропуск критической информации из середины может привести к вводящим в заблуждение или неполным суммированиям. В медицинских учреждениях игнорирование информации из середины истории пациента может привести к неточным рекомендациям. Понимание того, почему это происходит, остается сложной задачей для исследователей, пытающихся создать более безопасные и надежные ИИ. Однако недавно исследование предоставило некоторые из самых ясных ответов, показав, что эта проблема глубоко укоренена в архитектуре этих моделей.
Проблема “Потерянной в середине”
Феномен “потерянной в середине” относится к тенденции LLM уделять меньше внимания информации в середине длинных входных последовательностей. Это похоже на то, как люди часто лучше помнят первые и последние элементы в списке, чем те, что находятся в середине. Этот когнитивный предвзятость у людей часто называют эффектом первичности и новизны. Для LLM это означает, что они работают лучше, когда ключевая информация находится в начале или конце текста, но испытывают трудности, когда она находится в середине. Это приводит к “U-образной” кривой производительности, где точность высока в начале, резко падает в середине и затем снова возрастает в конце.
Эта проблема не только теоретическая. Она была обнаружена в широком диапазоне задач, от ответов на вопросы до суммирования документов. Например, если вы зададите LLM вопрос, ответ на который находится в первых нескольких абзацах длинной статьи, он, скорее всего, ответит правильно. То же самое верно, если ответ находится в последних нескольких абзацах. Но если критическая информация находится где-то в середине, точность модели резко падает. Это серьезное ограничение, поскольку это означает, что мы не можем полностью доверять этим моделям задачам, которые требуют понимания длинного и сложного контекста. Это также делает их уязвимыми для манипуляций. Кто-то может намеренно разместить вводящую в заблуждение информацию в начале или конце документа, чтобы повлиять на вывод ИИ.
Понимание архитектуры LLM
Чтобы понять, почему LLM забывают середину, нам нужно посмотреть, как они построены. Современные LLM основаны на архитектуре, называемой Transformer. Transformer был прорывом в ИИ, поскольку он ввел механизм, называемый само-вниманием. Само-внимание позволяет модели оценивать важность разных слов во входном тексте при обработке любого данного слова. Например, при обработке предложения “Кошка сидела на коврике” механизм само-внимания может узнать, что “кошка” и “сидела” тесно связаны. Это позволяет модели построить более богатое понимание отношений между словами, чем предыдущие архитектуры могли.
Другим ключевым компонентом является позиционная кодировка. Поскольку механизм само-внимания сам по себе не имеет врожденного чувства порядка слов, позиционные кодировки добавляются к входным данным, чтобы дать модели информацию о позиции каждого слова в последовательности. Без этого модель бы рассматривала входной текст как просто “мешок слов” без структуры. Эти два компонента, само-внимание и позиционная кодировка, работают вместе, чтобы сделать LLM более эффективными. Однако новое исследование показывает, что то, как они взаимодействуют, также является источником этой скрытой слепой зоны.
Как возникает предвзятость позиции
Недавнее исследование использует умный подход, чтобы объяснить этот феномен. Оно моделирует поток информации внутри Transformer как граф, где каждое слово является узлом, а связи внимания являются ребрами. Это позволяет исследователям математически отслеживать, как информация из разных позиций обрабатывается через многие слои модели.
Они обнаружили два основных вывода. Во-первых, использование каузального маскирования во многих LLM создает предвзятость в сторону начала последовательности. Каузальное маскирование – это техника, которая обеспечивает, что когда модель генерирует слово, она может обращать внимание только на слова, которые предшествуют ей, а не после. Это важно для задач, таких как генерация текста. Однако через многие слои это создает компаундовый эффект. Первые несколько слов в тексте обрабатываются снова и снова, и их представления становятся все более и более влиятельными. Напротив, слова в середине всегда смотрят назад на этот уже хорошо установленный контекст, и их уникальный вклад может быть заглушен.
Во-вторых, исследователи посмотрели, как позиционные кодировки взаимодействуют с этим каузальным маскированием. Современные LLM часто используют относительные позиционные кодировки, которые фокусируются на расстоянии между словами, а не на их абсолютной позиции. Это помогает модели обобщать тексты разной длины. Хотя это кажется хорошей идеей, оно создает конкурирующее давление. Каузальное маскирование толкает фокус модели к началу, в то время как относительная позиционная кодировка поощряет ее фокусироваться на ближайших словах. Результатом этого противостояния является то, что модель уделяет больше внимания самому началу текста и непосредственному локальному контексту любого данного слова. Информация, которая находится далеко и не в начале, то есть в середине, получает наименьшее внимание.
Более широкие последствия
Феномен “потерянной в середине” имеет значительные последствия для приложений, которые полагаются на обработку длинных текстов. Исследование показывает, что проблема не является просто случайным эффектом, а фундаментальным следствием того, как мы спроектировали эти модели. Это означает, что простое обучение их на большем количестве данных вряд ли решит проблему. Вместо этого нам, возможно, придется пересмотреть некоторые основные архитектурные принципы Transformer.
Для пользователей и разработчиков ИИ это критическое предупреждение. Мы должны быть осведомлены об этом ограничении при проектировании приложений, которые полагаются на LLM. Для задач, которые включают длинные документы, нам, возможно, придется разработать стратегии, чтобы смягчить эту предвзятость. Это может включать разбиение документа на более мелкие части или создание моделей, которые специально направляют внимание модели на разные части текста. Это также подчеркивает важность тщательного тестирования. Мы не можем предположить, что LLM, который работает хорошо с короткими текстами, будет надежным, когда сталкивается с более длинными, сложными входными данными.
Основная мысль
Разработка ИИ всегда фокусировалась на выявлении ограничений и поиске способов их преодоления. Проблема “потерянной в середине” – это значительный недостаток больших языковых моделей, где они склонны забывать информацию в середине длинных последовательностей текста. Эта проблема возникает из-за предвзятости в архитектуре Transformer, особенно в взаимодействии между каузальным маскированием и относительной позиционной кодировкой. Хотя LLM работают хорошо с информацией в начале и конце текста, они испытывают трудности, когда важные детали находятся в середине. Это ограничение может снизить точность LLM в задачах, таких как суммирование документов и ответы на вопросы, что может иметь серьезные последствия в областях, таких как право и медицина. Разработчикам и исследователям необходимо решить эту проблему, чтобы улучшить надежность LLM в практических приложениях. ils are placed in the middle. This limitation can reduce the accuracy of LLMs in tasks like document summarization and question answering, which can have serious implications in fields like law and medicine. Developers and researchers must resolve this issue to improve the reliability of LLMs in practical applications.












