Модели и платформы ИИ

Исследование показывает, что Большие Языковые Модели (LLM) по умолчанию используют простое рассуждение при увеличении сложности

mm
Добавьте Unite.AI в избранные источники в Google

Команда исследователей опубликовала всестороннее исследование 20 ноября, проанализировав более 192 000 следов рассуждений от больших языковых моделей (LLM), показав, что системы ИИ полагаются на поверхностные, линейные стратегии, а не на иерархические когнитивные процессы, которые люди естественным образом используют.

Исследовательская команда проанализировала 18 разных моделей по задачам рассуждения текста, зрения и аудио, сравнивая их подходы с 54 человеческими следами рассуждений, собранными специально для исследования. Анализ установил таксономию из 28 когнитивных элементов, охватывающих вычислительные ограничения, метакогнитивные контроли, представления знаний и операции трансформации — предоставляя основу для оценки не только того, производят ли модели правильные ответы, но и того, как они приходят к этим выводам.

Фундаментальные различия в когнитивной архитектуре

Человеческое рассуждение последовательно демонстрирует иерархическое вложение и метакогнитивный контроль — способность отражать и регулировать свои собственные мыслительные процессы. Люди легко организуют информацию в вложенные структуры, активно отслеживая свой прогресс через сложные проблемы.

Большие языковые модели в основном используют поверхностную прямую цепочку, перемещаясь шаг за шагом через проблемы без иерархической организации или самоанализа, характеризующего человеческое познание. Это расхождение становится наиболее выраженным, когда задачи плохо структурированы или двусмысленны, где человеческая адаптивность значительно превосходит подходы ИИ.

Исследование показало, что языковые модели обладают поведенческими компонентами, связанными с успешным рассуждением, но часто не способны развернуть их спонтанно. Производительность варьируется драматически в зависимости от типа проблемы: рассуждение при дилеммах показало наибольшую вариативность, при этом более мелкие модели испытывали значительные трудности, а логическое рассуждение показало умеренную производительность, при которой более крупные модели в целом превосходили более мелкие. Модели демонстрируют контринтуитивные слабости, преуспевая в сложных задачах и неудачно справляясь с более простыми вариантами.

Улучшение производительности за счет руководимого рассуждения

Исследовательская команда разработала руководство по рассуждению во время тестирования, которое автоматически создает успешные когнитивные структуры, демонстрируя улучшение производительности до 66,7% на сложных проблемах, когда модели запрограммированы на использование более человеческих подходов к рассуждению. Это открытие показывает, что большие языковые модели обладают潜ными возможностями для более сложного рассуждения, но нуждаются в явном руководстве, чтобы использовать их эффективно.

Разрыв между человеческим и искусственным рассуждением расширяется с увеличением сложности задач. Хотя модели могут справиться с прямыми проблемами с помощью прямой цепочки, они испытывают трудности с рекурсивными, самоаналитическими стратегиями, которые люди естественным образом используют, сталкиваясь с неоднозначными или многослойными задачами.

Публично доступный набор данных исследования предоставляет базовую линию для будущих исследований, сравнивающих искусственный и человеческий интеллект. Отображая 28 различных когнитивных элементов, основа позволяет исследователям точно определить, где разумение ИИ разрушается, а не просто измерять показатели точности.

Последствия для разработки ИИ

Результаты подчеркивают фундаментальное ограничение в текущих системах ИИ: разрыв между вычислительной способностью и подлинной когнитивной сложностью. Модели, обученные на огромных наборах данных, могут найти правильные ответы на многие задачи, но не обладают рефлексивным, иерархическим мышлением, характерным для человеческого решения проблем.

Это исследование основано на растущих опасениях по поводу ограничений рассуждения ИИ, выявленных в нескольких областях. Улучшение производительности от руководимого рассуждения предполагает, что лучшие стратегии подсказок и модификации архитектуры могут помочь моделям получить доступ к их потенциальным возможностям рассуждения более эффективно.

Самый значительный вклад исследования может быть его подробной таксономией когнитивных элементов, предоставляющей исследователям и разработчикам конкретные цели для улучшения. Вместо того, чтобы рассматривать рассуждение как монолитную способность, основа разбивает его на измеримые компоненты, которые можно решить индивидуально с помощью модификаций обучения или техник инженерии подсказок.

Алекс Макфарленд - журналист и писатель в области искусственного интеллекта, исследующий последние разработки в этой области. Он сотрудничал с многочисленными стартапами и изданиями в области искусственного интеллекта во всем мире.