Моделі та платформи ШІ

Головний дослідник Amazon Alexa вважає, що тест Тюрінга застарів

mm
Додайте Unite.AI до бажаних джерел у Google

Рохіт Прасад, віцепрезидент і головний вчений Alexa в Amazon (AMZN ), нещодавно стверджував, що тест Тюрінга, який протягом тривалого часу використовувався для вимірювання складності моделей штучного інтелекту, повинен бути замінений на новий стандарт для оцінки штучного інтелекту.

Комп’ютерний вчений і математик Алан Тюрінг вперше ввів концепцію тесту Тюрінга понад 70 років тому. Метою тесту Тюрінга було допомогти відповісти на питання про інтелект машин, визначити, чи здатна машина до “думки” в людському сенсі. Для відповіді на це питання Тюрінг стверджував, що якщо машини можуть демонструвати розмовну поведінку настільки складну, що людина-спостерігач не зможе розрізнити діалог комп’ютера та людини, машину слід вважати здатною до думки.

Обмеження тесту Тюрінга

Прасад стверджував, що тест Тюрінг має багато обмежень, і що сам Тюрінг відзначав деякі з цих обмежень у своєму першому документі. Оскільки штучний інтелект став все більш інтегрованим у кожній сфері нашого життя, люди менше турбуються про те, що він не відрізняється від людини, а більше про те, щоб їхнє взаємодіяння зі штучним інтелектом було безперебійним, стверджує Прасад. Через це тест Тюрінга слід вважати застарілим і замінити його на більш корисні стандарти.

Прасад зазначив, що багато ранніх чат-ботів були розроблені з урахуванням проходження тесту Тюрінга, і за останні роки деякі чат-боти змогли успішно обманути понад одну третину людських суддів (що було необхідним для проходження тесту Тюрінга). Однак можливість успішно імітувати мовні патерни людей не означає, що машину можна вважати真正ньо “інтелектуальною” Моделі штучного інтелекту можуть бути非常о ефективними в одній області та非常о недостатніми в інших, не володіючи жодною формою загального інтелекту. Незважаючи на це, тест Тюрінга залишається широко використовуваним стандартом для чат-ботів та цифрових помічників, з Прасадом, який відзначає, що бізнес-лідери та журналісти постійно запитують, коли Alexa буде здатна пройти тест Тюрінга.

Згідно з Прасадом, однією з основних проблем при використанні тесту Тюрінга для оцінки інтелекту машин є те, що він майже повністю ігнорує здатність машин шукати інформацію та виконувати дуже швидкі обчислення. Програми штучного інтелекту вводять штучні паузи у відповідь на складні математичні та географічні питання, щоб обманути людей, але вони мають відповідь на такі питання майже миттєво. Окрім цього, тест Тюрінга не бере до уваги зростаючу здатність штучного інтелекту використовувати дані, зібрані зовнішніми сенсорами, ігноруючи, як штучний інтелект може взаємодіяти зі світом навколо себе через алгоритми зору та руху, спираючись лише на текстову комунікацію.

Створення нових стандартів

Прасад стверджував, що необхідно створити нові форми вимірювання інтелекту, методи, які будуть краще підходити для оцінки загального типу інтелекту. Ці тести повинні відображати, як штучний інтелект фактично використовується в сучасному суспільстві та які цілі люди ставлять перед ним. Тести повинні бути здатні визначити, як добре штучний інтелект підтримує людський інтелект та як він покращує повсякденне життя людей. Крім того, тест повинен розуміти, як штучний інтелект проявляє людські ознаки інтелекту, включаючи мовну компетентність, самоочікувану поведінку та “здоровий глузд”.

Поточні та важливі галузі досліджень штучного інтелекту, такі як висновок, справедливість, розмовна поведінка та сенсорне розуміння, не оцінюються тестом Тюрінга, але їх можна виміряти різними способами. Прасад пояснив, що одним із способів вимірювання цих ознак інтелекту є розбивка завдань на складові частини. Інший метод оцінки полягає у створенні великомасштабного реального завдання для взаємодії людини та комп’ютера.

Коли Amazon створила Alexa Prize, вона створила систему оцінювання, яка вимагала від соціальних ботів розмовляти з людиною протягом 20 хвилин. Боти оцінювалися за їхню здатність розмовляти логічно на широкому спектрі тем, таких як технології, спорт, політика та розваги. Клієнти були відповідальними за оцінювання ботів під час фази розробки, присвоюючи їм оцінки на основі свого бажання знову поговорити з ботом. У фінальному раунді незалежні судді були відповідальними за оцінювання ботів за 5-бальною шкалою. Система оцінювання, яку використовували судді, спиралася на методи, які дозволяли штучному інтелекту проявляти важливі людські атрибути, такі як емпатія, коли це було доречним.

У підсумку Прасад стверджував, що зростаюча кількість пристроїв, оснащених штучним інтелектом, таких як Alexa, представляє важливу можливість виміряти прогрес штучного інтелекту, але нам знадобляться інші метрики, щоб скористатися цією новою можливістю.

“Такі штучні інтелекти повинні бути експертами у великій, постійно зростаючій кількості завдань, що можливо лише за умови більш загальної здатності до навчання, а не інтелекту, специфічного для окремих завдань”, – пояснив Прасад. “Отже, для наступного десятиліття та подальшого періоду корисність сервісів штучного інтелекту з їхніми розмовними та проактивними можливостями допомоги на фоні пристроїв є гідним тестом”.

Блогер і програміст з спеціалізацією у темах Machine Learning і Deep Learning. Даніель сподівається допомогти іншим використовувати силу штучного інтелекту для соціальної добробути.