Взгляд Anderson

DeepMind: ИИ может наследовать когнитивные ограничения человека, и может извлечь пользу из “формального образования”

mm
Добавьте Unite.AI в избранные источники в Google

Новое сотрудничество между DeepMind и Стэнфордским университетом предполагает, что ИИ может часто быть не лучше, чем люди, в абстрактном рассуждении, поскольку модели машинного обучения получают свои архитектуры рассуждений из реальных, человеческих примеров, которые основаны на практическом контексте (который ИИ не может испытать), но также ограничены нашими собственными когнитивными недостатками.

Если это доказано, это может представлять собой барьер для высшего “голубого неба” мышления и качества интеллектуального творчества, на которое многие надеются от систем машинного обучения, и иллюстрирует степень, в которой ИИ отражает человеческий опыт и склонен к размышлению (и рассуждению) в рамках человеческих границ, которые его сформировали.

Исследователи предлагают, что модели ИИ могут извлечь пользу из предварительной подготовки в абстрактном рассуждении, сравнивая ее с “формальным образованием”, прежде чем приступить к решению реальных задач.

В статье говорится:

Люди – несовершенные рассуждающие. Мы рассуждаем наиболее эффективно о сущностях и ситуациях, которые согласуются с нашим пониманием мира.

Наши эксперименты показывают, что языковые модели отражают эти закономерности поведения. Языковые модели выполняют логические задачи рассуждения несовершенно, но это выполнение зависит от контента и контекста. Наиболее заметно, что такие модели часто терпят неудачу в ситуациях, где люди терпят неудачу – когда стимулы становятся слишком абстрактными или противоречат нашему пониманию мира.

Чтобы проверить, насколько гипермасштабные модели обработки естественного языка (NLP) могут быть затронуты такими ограничениями, исследователи провели серию из трех тестов на подходящей модели, заключив*:

Мы обнаружили, что современные крупномасштабные языковые модели (с 7 или 70 миллиардами параметров) отражают многие из тех же закономерностей, которые наблюдаются у людей, – как люди, модели рассуждают более эффективно о правдоподобных ситуациях, чем о нереалистичных или абстрактных.

Наши результаты имеют последствия для понимания как этих когнитивных эффектов, так и факторов, которые способствуют производительности языковых моделей.

Статья предполагает, что создание навыков рассуждения в ИИ без предоставления ему пользы от реального, телесного опыта, который ставит такие навыки в контекст, может ограничить потенциал таких систем, отмечая, что опыт, основанный на контексте… предположительно лежит в основе некоторых человеческих убеждений и рассуждений.

Авторы утверждают, что ИИ испытывает язык пассивно, тогда как люди испытывают его как активный и центральный компонент для социальной коммуникации, и что этот вид активного участия (который включает в себя традиционные социальные системы наказания и вознаграждения) может быть “ключом” к пониманию значения таким же образом, как и люди.

Исследователи наблюдают:

Некоторые различия между языковыми моделями и людьми могут, следовательно, возникнуть из-за различий между богатым, основанным на контексте, интерактивным опытом людей и обеднённым опытом моделей.

Они предлагают, что одним из решений может быть период “предварительной подготовки”, подобный школьной и университетской системе, до обучения на основных данных, которые в конечном итоге создадут полезную и универсальную языковую модель.

Этот период “формального образования” (как аналогизируют исследователи) будет отличаться от обычной предварительной подготовки машинного обучения (которая является методом сокращения времени обучения путем повторного использования полуобученных моделей или импорта весов из полностью обученных моделей в качестве “усилителя” для запуска процесса обучения).

Вместо этого это будет период устойчивого обучения, предназначенный для развития логических навыков рассуждения ИИ в чисто абстрактной форме, и для развития критических способностей таким же образом, как и университетский студент будет поощрять к этому в течение своего образовательного процесса.

‘Несколько результатов’, заявляют авторы, ‘указывают на то, что это может не быть таким нереальным, как это звучит’.

Статья называется Языковые модели демонстрируют человеческие эффекты контента на рассуждение, и исходит от шести исследователей из DeepMind и одного, связанного как с DeepMind, так и со Стэнфордским университетом.

Тесты

Люди учатся абстрактным понятиям через практические примеры, таким же методом “подразумеваемой важности”, который часто помогает языковым ученикам запоминать словарь и лингвистические правила, через мнемонические устройства. Простейший пример этого – обучение абстрактным принципам физики, вызывая “сценарии путешествий” для поездов и машин.

Чтобы проверить возможности абстрактного рассуждения гипермасштабной языковой модели, исследователи разработали серию из трех лингвистических/семантических тестов, которые могут быть сложными и для людей. Тесты были применены “zero shot” (без решенных примеров) и “five shot” (с пятью предыдущими решенными примерами).

Первая задача связана с выводом естественного языка (NLI), где субъект (человек или, в данном случае, языковая модель) получает два предложения, “предпосылку” и “гипотезу”, которая, кажется, выведена из предпосылки. Например, X меньше Y, Гипотеза: Y больше X (вытекает).

Для задачи NLI исследователи оценили языковые модели Chinchilla (модель с 70 миллиардами параметров) и 7B (модель с 7 миллиардами параметров), обнаружив, что для последовательных примеров (т. е. тех, которые не были бессмысленными) только более крупная модель Chinchilla получила результаты выше, чем случайные; и они отмечают:

Это указывает на сильный контент-偏见: модели предпочитают завершать предложение способом, согласующимся с предыдущими ожиданиями, а не способом, согласующимся с правилами логики.

Результаты модели Chinchilla с 70 миллиардами параметров в задаче NLI. Обе модели, Chinchilla и ее более компактная версия 7B, демонстрировали 'существенный контент-偏язь', согласно исследователям.

Результаты модели Chinchilla с 70 миллиардами параметров в задаче NLI. Обе модели, Chinchilla и ее более компактная версия 7B, демонстрировали ‘существенный контент-偏язь’, согласно исследователям. Источник: https://arxiv.org/pdf/2207.07051.pdf

Силлогизмы

Вторая задача представляет собой более сложную задачу, силлогизмы – аргументы, в которых два истинных утверждения, кажется, подразумевают третье утверждение (которое может быть или не быть логическим выводом, выведенным из двух предыдущих утверждений):

Из тестового материала статьи, различные ‘реалистичные’ и парадоксальные или бессмысленные силлогизмы.

Здесь люди невероятно ошибочны, и конструкция, предназначенная для демонстрации логического принципа, становится почти сразу (и, возможно, навсегда) запутанной и сбитой с толку человеческим “убеждением” о том, какой ответ должен быть.

Авторы отмечают, что исследование 1983 года показало, что участники были предвзяты тем, соответствует ли вывод силлогизма их собственным убеждениям, отмечая:

Участники были намного более вероятны (90% времени) ошибочно сказать, что недействительный силлогизм является действительным, если вывод был правдоподобным, и, таким образом, в основном полагались на убеждение, а не на абстрактное рассуждение.

При тестировании модели Chinchilla на наборе разнообразных силлогизмов, многие из которых имели ложные выводы, исследователи обнаружили, что убеждение вызывает почти все решения “zero shot”. Если языковая модель находит вывод, несовместимый с реальностью, модель, по словам авторов, сильно предвзята в сторону объявления окончательного аргумента недействительным, даже когда окончательный аргумент является логическим следствием предыдущих утверждений.

Результаты 'zero shot' для модели Chinchilla (способ, которым большинство тестируемых получат эти задачи, после объяснения руководящего правила), иллюстрирующие огромную пропасть между вычислительной мощностью компьютера и возможностью языковой модели ориентироваться в этом виде 'зарождающегося логического' вызова.

Результаты ‘zero shot’ для модели Chinchilla (способ, которым большинство тестируемых получат эти задачи, после объяснения руководящего правила), иллюстрирующие огромную пропасть между вычислительной мощностью компьютера и возможностью языковой модели ориентироваться в этом виде ‘зарождающегося логического’ вызова.

Задача Уосона

Для третьего теста даже более сложную задачу логического рассуждения, задачу Уосона, переформулировали в ряд различных вариантов для решения языковой моделью.

Задача Уосона, разработанная в 1968 году, кажется очень простой: участникам показывают четыре карты и говорят произвольное правило, такое как “Если карта имеет ‘D’ на одной стороне, то она имеет ‘3’ на другой стороне.” Четыре видимые лица карт показывают ‘D’, ‘F’, ‘3’ и ‘7’.

Затем участников просят указать, какие карты им нужно перевернуть, чтобы проверить, является ли правило истинным или ложным.

Правильное решение в этом примере – перевернуть карты ‘D’ и ‘7’. В ранних тестах было обнаружено, что, хотя большинство участников (людей) правильно выбирают ‘D’, они с большей вероятностью выбирают ‘3’, а не ‘7’, путая контрапозицию правила (‘не 3 подразумевает не D’) с обратным (‘3 подразумевает D’, которое не логически подразумевается).

Авторы отмечают, что потенциал предыдущего убеждения вмешаться в логический процесс у человеческих участников и отмечают, что даже академические математики и студенты-математики обычно набирают менее 50% в этой задаче.

Однако, когда схема задачи Уосона каким-то образом отражает человеческий практический опыт, производительность традиционно увеличивается.

Авторы наблюдают, ссылаясь на предыдущие эксперименты:

Если карты показывают возраст и напитки, и правило гласит “если они пьют алкоголь, то они должны быть 21 или старше” и показывают карты с ‘пивом’, ‘газировкой’, ’25’ и ’16’, то подавляющее большинство участников правильно выбирают проверить карты с ‘пивом’ и ’16’.’

Чтобы проверить производительность языковой модели на задачах Уосона, исследователи создали разнообразные реалистичные и произвольные правила, некоторые из которых содержали “бессмысленные” слова, чтобы увидеть, сможет ли ИИ проникнуть в контекст содержания и определить, какие “виртуальные карты” перевернуть.

Некоторые из многих задач Уосона, представленных в тестах.

Некоторые из многих задач Уосона, представленных в тестах.

Для задач Уосона модель выполнила задачи сравнимо с людьми на “реалистичных” (не бессмысленных) задачах.

Результаты задач Уосона с 'zero shot' для модели Chinchilla, с моделью, выполняющей задачи значительно лучше, чем случай, по крайней мере для 'реалистичных' правил.

Результаты задач Уосона с ‘zero shot’ для модели Chinchilla, с моделью, выполняющей задачи значительно лучше, чем случай, по крайней мере для ‘реалистичных’ правил.

Статья комментирует:

Это отражает результаты в литературе: люди намного более точны при ответе на задачу Уосона, когда она сформулирована в терминах реалистичных ситуаций, чем произвольных правил об абстрактных атрибутах.

Формальное образование

Результаты статьи ставят потенциал рассуждения гипермасштабных систем NLP в контексте наших собственных ограничений, которые мы, кажется, передаем моделям через накопленные реальные наборы данных, которые их поддерживают. Поскольку большинство из нас не гении, модели, чьи параметры информированы нашими собственными, также не гении.

Кроме того, новая работа заключает, что мы, по крайней мере, имеем преимущество устойчивого периода формирования образования, и дополнительных социальных, финансовых и даже сексуальных мотиваций, которые образуют человеческую директиву. Все, что могут получить языковые модели, – это результаты этих факторов окружающей среды, и они, кажется, соответствуют общим, а не исключительным человеческим.

Авторы заявляют:

Наши результаты показывают, что эффекты контента могут возникнуть из простого обучения большой трансформерной модели для имитации языка, производимого человеческой культурой, без включения этих человеческих внутренних механизмов.

Иными словами, языковые модели и люди оба приходят к этим контент-偏ям – но из, кажется, очень разных архитектур, опыта и целей обучения.

Таким образом, они предлагают вид “индуктивного обучения” в чистом рассуждении, которое было показано, чтобы улучшить производительность модели для математики и общего рассуждения. Они также отмечают, что языковые модели были обучены или настроены для выполнения инструкций лучше на абстрактном или обобщенном уровне, и для проверки, исправления или дебиасирования своего собственного вывода.

 

* Мое преобразование внутренних цитат в гиперссылки.

Опубликовано впервые 15 июля 2022 года.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai