Модели и платформы ИИ

Лучшие модели ИИ теряются в длинных документах

mm
Добавьте Unite.AI в избранные источники в Google

Новое исследование исследователей из LMU Munich, Munich Center for Machine Learning и Adobe Research (ADBE ) выявило слабость в моделях языка ИИ: они испытывают трудности в понимании длинных документов так, как это может удивить вас. Результаты исследования показывают, что даже самые передовые модели ИИ испытывают трудности в соединении информации, когда они не могут полагаться на простое совпадение слов.

Скрытая проблема с навыками чтения ИИ

Представьте, что вы пытаетесь найти конкретный факт в длинной научной статье. Вы можете просмотреть ее, создавая мысленные связи между различными разделами, чтобы собрать вместе необходимую информацию. Многие модели ИИ, оказывается, не работают таким образом. Вместо этого они часто сильно полагаются на поиск точных совпадений слов, подобно использованию Ctrl+F на вашем компьютере.

Исследовательская команда разработала новый тестовый стандарт под названием NOLIMA (Нет Литерального Совпадения), чтобы протестировать различные модели ИИ. Результаты показали, что когда модели ИИ имеют дело с текстами длиннее 2000 слов, их производительность резко падает. Когда они достигают 32000 слов – примерно длины короткой книги – большинство моделей работают на половине своей обычной способности. Это включало тестирование основных моделей, таких как GPT-4o, Gemini 1.5 Pro и Llama 3.3 70B.

Рассмотрите медицинского исследователя, использующего ИИ для анализа медицинских записей, или юридическую команду, использующую ИИ для просмотра документов по делам. Если ИИ пропускает важные связи, потому что соответствующая информация использует разные слова, чем поисковый запрос, последствия могут быть значительными.

Почему совпадение слов недостаточно

Текущие модели ИИ обрабатывают текст, используя что-то под названием механизм внимания. Эта система помогает ИИ сосредоточиться на различных частях текста, чтобы понять отношения между словами и идеями. Когда работа идет с более короткими текстами, это работает достаточно хорошо. Однако исследование показывает, что этот механизм становится перегруженным, когда тексты становятся длиннее, особенно когда он не может полагаться на точные совпадения слов.

Тест NOLIMA выявил это ограничение, попросив модели ИИ ответить на вопросы, ответы на которые требовали понимания контекста, а не поиска совпадений слов. Результаты были показательными. Хотя модели показали хорошую производительность с короткими текстами, их способность устанавливать эти связи резко снизилась по мере увеличения длины текста. Даже специализированные модели, предназначенные для задач рассуждения, показали точность ниже 50%, когда имели дело с более длинными документами.

Без опоры на совпадение слов модели ИИ испытывали трудности с:

  • Соединением связанных концепций, использующих разную терминологию
  • Следованием за многоступенчатыми путями рассуждения
  • Поиском релевантной информации, когда она появляется после ключевого контекста
  • Игнорированием вводящих в заблуждение совпадений слов в нерелевантных разделах

Цифры рассказывают историю

Результаты исследования рисуют яркую картину того, как модели ИИ справляются с более длинными текстами. GPT-4o показал самую сильную производительность, сохраняя эффективность до примерно 8000 токенов (примерно 6000 слов). Однако даже этот лучший исполнитель показал значительное снижение производительности с более длинными текстами. Большинство других моделей, включая Gemini 1.5 Pro и Llama 3.3 70B, испытали резкое снижение производительности между 2000 и 8000 токенами.

Снижение производительности стало еще более выраженным, когда задачи требовали нескольких шагов рассуждения. Например, если модель должна была установить две логические связи – например, понять, что персонаж жил рядом с ориентиром, и что ориентир находился в определенном городе – процент успешных ответов значительно снизился. Исследование показало, что этот тип многоступенчатого рассуждения стал особенно сложным в текстах длиной более 16000 токенов, даже при использовании методов, предназначенных для улучшения рассуждений, таких как Chain-of-Thought prompting.

Что делает эти результаты особенно заметными, так это то, что они бросают вызов заявлениям о способности моделей ИИ справляться с длинными контекстами. Хотя многие модели рекламируют поддержку обширных контекстных окон, тестовый стандарт NOLIMA показывает, что эффективное понимание снижается намного раньше достижения этих теоретических пределов.

Источник: Modarressi et al.

Когда ИИ теряет лес за деревьями

Эти ограничения имеют серьезные последствия для того, как мы используем ИИ в реальных приложениях. Рассмотрите систему ИИ для поиска в юридических документах. Она может пропустить релевантные прецеденты просто потому, что они используют разную терминологию, чем поисковый запрос. Система может вместо этого сосредоточиться на менее релевантных делах, которые случайно делят больше слов с поисковыми терминами.

Влияние на поиск и анализ документов особенно тревожно. Текущие системы ИИ для поиска часто полагаются на метод под названием Retrieval-Augmented Generation (RAG). Даже когда эти системы успешно извлекают документ, содержащий необходимую информацию, ИИ может не распознать его релевантность, если формулировка отличается от запроса. Вместо этого ИИ может склоняться к менее релевантным документам, которые имеют поверхностное сходство с поисковыми терминами.

Для пользователей ИИ эти результаты предполагают несколько важных соображений:

Во-первых, более короткие запросы и документы, вероятно, дадут более надежные результаты. Когда работа идет с более длинными текстами, разбиение их на более мелкие, сосредоточенные сегменты может помочь сохранить производительность ИИ.

Во-вторых, пользователи должны быть особенно осторожны, когда просят ИИ устанавливать связи между различными частями длинного документа. Исследование показывает, что модели ИИ испытывают наибольшие трудности, когда им необходимо собрать информацию из разных разделов, особенно когда связь не очевидна через общую лексику.

Наконец, эти ограничения подчеркивают продолжающуюся важность человеческого надзора. Хотя ИИ может быть мощным инструментом для обработки и анализа текста, он не должен рассматриваться как полная замена человеческого анализа сложных документов. Способность человека сохранять контекст и устанавливать концептуальные связи на длинных текстах остается выше текущих возможностей ИИ.

Результаты служат напоминанием о том, что, несмотря на быстрые достижения в технологии ИИ, эти системы все еще обрабатывают информацию очень по-другому, чем люди. Понимание этих ограничений имеет решающее значение для эффективного использования инструментов ИИ и знания того, когда человеческая оценка остается необходимой.

Что дальше?

Понимание ограничений текущих моделей ИИ в обработке длинных текстов открывает важные вопросы о будущем развития ИИ. Исследование, стоящее за тестовым стандартом NOLIMA, показало, что наши текущие подходы к обработке текста ИИ могут потребовать значительного усовершенствования, особенно в том, как модели справляются с информацией на более длинных отрывках.

Текущие решения показали только частичный успех. Промптинг Chain-of-Thought, который побуждает модели ИИ разбивать свое рассуждение на шаги, немного улучшает производительность. Например, при использовании этого метода Llama 3.3 70B показала лучшую способность справляться с более длинными контекстами. Однако этот подход все еще не дотягивает, когда имеет дело с текстами длиной более 16000 токенов, что предполагает, что нам нужны более фундаментальные решения.

Механизм внимания, который образует основу того, как текущие модели ИИ обрабатывают текст, требует пересмотра. Представьте, что вы пытаетесь вести разговор в многолюдной комнате – чем длиннее разговор, тем труднее отслеживать все важные моменты, упомянутые ранее. Наши текущие модели ИИ сталкиваются с аналогичной проблемой, но в гораздо большем масштабе.

Глядя в будущее, исследователи изучают несколько перспективных направлений. Одним из подходов является разработка новых способов организации и определения приоритетов информации в длинных текстах ИИ, переходя за пределы простого совпадения слов для понимания более глубоких концептуальных связей. Это может работать подобно тому, как люди создают мысленные карты информации, соединяя идеи на основе смысла, а не только общей лексики.

Другой областью разработки является улучшение того, как модели ИИ справляются с тем, что исследователи называют “латентными скачками” – логическими шагами, необходимыми для соединения различных фрагментов информации. Текущие модели испытывают трудности с этими связями, особенно в более длинных текстах, но новые архитектуры могут помочь преодолеть этот разрыв.

Для тех, кто работает с инструментами ИИ сегодня, эти результаты предполагают несколько практических подходов:

Рассмотрите возможность разбиения более длинных документов на осмысленные сегменты при работе с ИИ. Это помогает создать логические разделы, сохраняющие важный контекст. Например, если вы анализируете научную статью, вы можете сохранить разделы методологии и результатов вместе, поскольку они часто содержат связанную информацию.

Когда вы просите ИИ проанализировать более длинные тексты, будьте конкретны относительно связей, которые вы хотите, чтобы он установил. Вместо того, чтобы задавать общие вопросы, направляйте ИИ к конкретным отношениям, которые вас интересуют. Это помогает компенсировать текущие ограничения модели в установлении этих связей самостоятельно.

Возможно, самое главное – сохранять реалистичные ожидания относительно возможностей ИИ с длинными текстами. Хотя эти инструменты могут быть невероятно полезными для многих задач, они не должны рассматриваться как полная замена человеческого анализа сложных документов. Способность человека сохранять контекст и устанавливать концептуальные связи на длинных текстах остается выше текущих возможностей ИИ.

Путь вперед для развития ИИ в этой области является одновременно сложным и интересным. Когда мы лучше понимаем эти ограничения, мы можем работать над созданием систем ИИ, которые действительно понимают длинные тексты, а не просто обрабатывают их. До тех пор, пока мы используем ИИ эффективно, мы должны работать с его текущими ограничениями, ценя его сильные стороны.

Алекс Макфарленд - журналист и писатель в области искусственного интеллекта, исследующий последние разработки в этой области. Он сотрудничал с многочисленными стартапами и изданиями в области искусственного интеллекта во всем мире.