Погляд Anderson

Отримання NLP для виклику неправильних питань

mm
Додайте Unite.AI до бажаних джерел у Google

Деякі питання незвідповідні, оскільки вони містять неправильну інформацію – припущення, які людина, яка слухає питання, повинна фільтрувати та відкинути. Це припускає, звичайно, що слухач має достатньо правильної інформації, щоб викликати питання, а не використовувати питання як джерело (неправильної) інформації.

Це виклик для систем обробки природної мови (NLP), таких як GPT-3, які мають тенденцію “галюцинувати” інформацію, щоб підтримувати діалог.

Наразі запит GPT-3 “Коли Марі Кюрі винайшла уран?” імовірно отримає відповідь “Марі Кюрі винайшла уран у 1898 році”.

Джерело: https://beta.openai.com/playground (Da Vinci instruct beta).

Джерело: https://beta.openai.com/playground (Da Vinci instruct beta).

Насправді уран був відкритий у 1789 році німецьким хіміком Мартіном Генріхом Клапротом, тоді як відкриття Кюрі у 1898 році було виділення радію.

Проблема систем NLP, які ігнорують неправильні припущення, набула актуальності в ряді публічних заяв цього року, включаючи те, як результати пошуку Google, підтримувані штучним інтелектом, ігнорують неправильну інформацію у запиті “Коли Ніл Армстронг ступив на Марс?” – помилка, яка досі існує на момент написання цієї статті, і також застосовується до Базза Лайтерйера з “Історії іграшок”, який, як кажуть, ступив на Місяць 21 липня 1969 року.

Том Генкс, інший учасник “Історії іграшок”, також згадується Google як людина, яка ступила на Місяць у 1970 році, попри те, що його персонаж, астронавт Джим Ловелл, найбільш відомий тим, що не досяг цього.

Вирішення проблем припущень у взаємодії NLP

Тепер дослідники з Google, разом з дослідниками з Університету Джона Хопкінса та Університету Брауна, досліджують нові методи машинного навчання, за допомогою яких системи NLP можуть бути розроблені для виклику фактично неправильних питань так само, як це роблять люди під час розмов.

Нещодавня робота дослідження Який лінгвіст винайшов лампочку? Верифікація припущень для питань-відповідей описує зусилля з розробки нової системи для ідентифікації припущень та їх верифікації перед продовженням взаємодії.

Новий алгоритм ефективно попередньо обробляє питання перед поверненням до діалогу, розбиваючи “авторизацію” питання на три етапи.

Не обчислюється! Зліва - 'блокування', яке відбувається навіть тоді, коли передова система NLP змогла визначити, що питання не має сенсу. Праворуч - розбивка запропонованого алгоритму, який намагається виправити джерельну помилку. Джерело: https://arxiv.org/pdf/2101.00391.pdf

Не обчислюється! Зліва – ‘блокування’, яке відбувається навіть тоді, коли передова система NLP змогла визначити, що питання не має сенсу. Праворуч – розбивка запропонованого алгоритму, який намагається виправити джерельну помилку. Джерело: https://arxiv.org/pdf/2101.00391.pdf

Хоча це здається простим процесом верифікації, який повинен був бути закладений у системи знань з самого початку, більшість навчальних режимів NLP засновані на надмірній довірі до джерел даних, включаючи дискурс (такий як фейкові новини), який міг бути опублікований на раніше “довірених” каналах.

Отже, ключовим питанням є визначення консенсусом надійного джерела фактів у кліматі, де поширення неправильної інформації через соціальні медіа за замовчуванням надає їй авторитет за логікою загального машинного навчання. Останнє використовувало кількість або повторення даних як заміну точності, принаймні до тих пір, поки явище фейкових новин не стало критичною областю інтересів у цій галузі в останні роки.

Визначення найкращого підходу до незвідповідних питань

Для визначення підходу до вирішення питання, яке містить неправильну інформацію, дослідники провели 100 таких запитів через чотири різні моделі питань-відповідей і попросили людей вибрати найкраще або найменш проблематичне рішення, яке моделі згенерували.

Чотири можливі архітектурні результати “поганого” питання були: ‘Незвідповідне’ – де система питань-відповідей з закритою книгою ефективно зупиняє запит без подальшого пояснення; ‘Пояснення на основі припущення’ – де система не змогла верифікувати неправильне припущення, ефективно відповідь “незвідповідна”, з доданим поясненням; ‘Видалене пояснення’ – де система витягує пов’язану з Вікіпедією цитату і додає її до вступного “Це питання незвідповідне, оскільки…”; і ‘Відкритий домен-rewrite’ – де конкурентна система шукає додаткові джерела з Вікіпедії.

Цей приклад чотирьох можливих відповідей на очевидно 'незвідповідне' питання ілюструє складність спроби конкурентного домен-орієнтованого рішення цієї проблеми.

Цей приклад чотирьох можливих відповідей на очевидно ‘незвідповідне’ питання ілюструє складність спроби конкурентного домен-орієнтованого рішення цієї проблеми.

Під час тестів п’ять учасників (рекрутованих на внутрішній платформі краудсорсингу Google) віддали перевагу відповідям на основі припущень, що змусило дослідників розробити нову основу для розбирання та верифікації питань.

У новій системі лінгвістичні спускові механізми отримуються з питання за допомогою правил-генератора, який розбиває речення на твердження фактів. Якщо з питання отримано кілька припущень, кожне з них розслідується, і буде внесено свій внесок у остаточну відповідь, якщо вони звертаються до помилкових припущень з оригінального питання.

Дані

Припущення, згенеровані на початковому етапі, були вручну змінені для створення набору даних верифікації з “золотими” припущеннями. Будь-які припущення, які виникли з розгалуження запиту, але яких не було в оригінальних питаннях, були видалені.

Два автори статті потім вручну аннотували 462 припущення щодо так/ні верифікації, заснованої на відповідній сторінці Вікіпедії, пов’язаній з кожним питанням. Випадки розбіжностей були вирішені в постфактумному обговоренні перед тим, як були внесені до набору даних.

Дослідники використали zero-shot NLI, завдання класифікації тези/гіпотези, яке вимагало розбирання статей Вікіпедії, пов’язаних з питаннями. Оскільки цей процес призводить до багатьох більше пар, ніж питання може містити або модель підтримує, фільтровані результати були потім агреговані та позначені.

Результати та формуляція відповідей

Найефективніші результати були отримані найбільш трудомістким рішенням: тонко налаштованою гібридною системою, згенерованою з ALBERT QNLI з реченнями Вікіпедії та припущеннями.

Виступи моделей верифікації, де 'Речення Вікіпедії' використовує речення, отримані з питань, пов'язаних з Вікіпедією, і 'Припущення Вікіпедії' - згенеровані припущення з цих речень.

Виступи моделей верифікації, де ‘Речення Вікіпедії’ використовує речення, отримані з питань, пов’язаних з Вікіпедією, і ‘Припущення Вікіпедії’ – згенеровані припущення з цих речень.

За допомогою цього формулювання дослідники розробили систему шаблонів, де факт негації з Вікіпедії був доданий до “Це питання незвідповідне, оскільки…” і подібних фраз. Хоча це не ідеальне рішення, автори вважають, що відповіді, засновані на неверифікованості, імовірно зменшать кількість випадків неправильних негативних результатів.

Система була в кінцевому підсумку реалізована в моделі Розширеної трансформаторної конструкції (ETC).

Вплив

Залежно від її остаточної продуктивності в реальному світі, можна стверджувати, що цей підхід може привести до заміни “неверифікованого” на “незвідповідне” в випадках, коли система дослідження не може оцінити корисну поправку для помилкового припущення питання. Ефективно, це здається закладенням інфраструктури для майбутніх і кращих систем верифікації.

Дослідники вже визнають, що витрати на токен-орієнтовані запити API є обмежувальним фактором при формулюванні довших відповідей, які ця система буде генерувати, і можна припустити, що додаткове навантаження “в реальному часі” дослідження питання, ймовірно, додадуть затримку навіть великим системам, таким як GPT-3, оскільки реакція таких систем залежала від загального включення знань на етапі навчання, а не від розширених, мережевих процедур верифікації.

Крім того, дослідники відзначають, що система зараз має обмеження, пов’язані з розбором семантичних аспектів тексту:

Наприклад, хто вважає, що Естелла – мати Піпа, має вбудоване володіння під нефактивним дієсловом вірить, але наш генератор би все одно згенерував ‘Естелла‘ має ‘матір.’

Однак команда бачить нові та більш гнучкі системи питань-відповідей, які будуть розроблені на основі цього дослідження:

У майбутньому ми плануємо продовжити цю роботу, пропонуючи системи питань-відповідей, які будуть більш стійкими та співробітничими. Наприклад, різні типи невдач припущень можуть бути розглянуті більш гнучкими стратегіями відповідей – наприклад, порушення унікальності припущень може бути краще оброблено шляхом надання всіх можливих відповідей, а не зазначення того, що унікальність припущення була порушена.

Письменник про машинне навчання, спеціаліст у галузі синтезу зображень людини. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розпуску в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: [email protected]