Модели и платформы ИИ
Руководитель исследований Amazon Alexa утверждает, что тест Тьюринга устарел
Рохит Прасад, вице-президент и главный ученый Alexa в Amazon (AMZN ), недавно утверждал, что тест Тьюринга, lâu использованный для измерения сложности моделей ИИ, должен быть уволен в качестве эталона для ИИ.
Компьютерный ученый и математик Алан Тьюринг впервые ввел понятие теста Тьюринга более 70 лет назад. Целью теста Тьюринга было помочь ответить на вопрос об интеллекте машин, определении, способна ли машина к “мысли” в человеческом смысле. Чтобы ответить на этот вопрос, Тьюринг утверждал, что если машины могут проявлять разговорное поведение настолько сложное, что человеческий наблюдатель не может различить диалог компьютера и диалог человека, машина должна быть считана способной к мысли.
Ограничения теста Тьюринга
Прасад утверждал, что тест Тьюринга ограничен во многих отношениях, и что сам Тьюринг даже отметил некоторые из этих ограничений в своей初альной статье. Поскольку ИИ стал все более интегрированным во все аспекты нашей жизни, люди меньше заботятся о том, что он неотличим от человека, и больше о том, что их взаимодействия с ИИ являются бесшовными, утверждает Прасад. По этой причине тест Тьюринга должен быть считан устаревшим и замененным более полезными эталонами.
Прасад отметил, что многие ранние чат-боты были разработаны с учетом прохождения теста Тьюринга, и в последние годы некоторые чат-боты последовательно смогли обмануть более одной трети человеческих судей (этот порог был необходим для прохождения теста Тьюринга). Однако способность успешно имитировать речевые модели людей не означает, что машина может быть действительно считана “интеллектуальной”. Модели ИИ могут быть чрезвычайно профессиональными в одной области и чрезвычайно несовершенными в других, не обладающими никаким видом общего интеллекта. Несмотря на это, тест Тьюринга остается широко используемым эталоном для чат-ботов и цифровых помощников, с которым Прасад отметил, что бизнес-лидеры и журналисты постоянно спрашивают, когда Alexa будет способна пройти тест Тьюринга.
Согласно Прасаду, одной из основных проблем с использованием теста Тьюринга для оценки интеллекта машин является то, что он почти полностью игнорирует способность машин искать информацию и выполнять быстрые вычисления. Программы ИИ вводят искусственные паузы в ответ на сложные математические и географические вопросы, чтобы обмануть людей, но они имеют ответ на такие вопросы почти мгновенно. Помимо этого, тест Тьюринга не учитывает растущую способность ИИ использовать данные, собранные внешними датчиками, игнорируя, как ИИ могут взаимодействовать с окружающим миром через алгоритмы зрения и движения, полагаясь только на текстовую связь.
Создание новых эталонов
Прасад утверждал, что должны быть созданы новые формы измерения интеллекта, методы, которые лучше подходят для оценки общего типа интеллекта. Эти тесты должны отражать, как ИИ фактически используется в современном обществе и цели людей для его использования. Тесты должны быть способны определить, как хорошо ИИ дополняет человеческий интеллект и как хорошо ИИ улучшает повседневную жизнь людей. Кроме того, тест должен понимать, как ИИ проявляет человеческие черты интеллекта, включая языковую компетентность, самоуправление и “здравый смысл”.
Текущие и важные области исследований ИИ, такие как рассуждение, справедливость, разговор и сенсорное понимание, не оцениваются тестом Тьюринга, но они могут быть измерены различными способами. Прасад объяснил, что одним из способов измерения этих характеристик интеллекта является разбиение задач на составные задачи. Другим методом оценки является создание крупномасштабного реального вызова для взаимодействия человека и компьютера.
Когда Amazon создал Alexa Prize, он создал рубрику, которая требовала от социальных ботов говорить с человеком в течение 20 минут. Боты оценивались по их способности вести связный разговор на широкий спектр тем, таких как технологии, спорт, политика и развлечения. Клиенты были ответственны за оценку ботов во время фазы разработки, присваивая им баллы на основе их желания поговорить с ботом снова. Во время финального раунда независимые судьи были ответственны за оценку ботов по 5-балльной шкале. Рубрика, используемая судьями, полагалась на методы, которые позволяли ИИ проявлять важные человеческие атрибуты, такие как эмпатия, когда это уместно.
В конечном итоге, Прасад утверждал, что растущее распространение устройств, оснащенных ИИ, таких как Alexa, представляет собой важную возможность измерить прогресс ИИ, но нам понадобятся разные метрики, чтобы воспользоваться этой новой возможностью.
«Такие ИИ должны быть экспертами в большом,不断 растущем количестве задач, что возможно только с более общей обучающей способностью, а не с задачеспецифическим интеллектом», – объяснил Прасад. «Следовательно, в течение следующего десятилетия и далее, полезность услуг ИИ, с их разговорными и проактивными возможностями помощи на фоновых устройствах, является достойным тестом».












