Погляд Anderson

Боротьба за припинення шахрайства штучного інтелекту під час тестування

mm
Додайте Unite.AI до бажаних джерел у Google

Нові дослідження китайського університету дають уявлення про те, чому генеративні моделі обробки природної мови, такі як GPT-3, схильні “шахраювати”, коли їм задають складне питання, надавши відповіді, які можуть бути технічно правильними, але без справжнього розуміння того, чому відповідь правильна; і чому вони демонструють мало чи жодної здатності пояснити логіку своїх “легких” відповідей. Дослідники також пропонують нові методи, щоб зробити системи “навчалися сильніше” під час фази навчання.

Проблема двоїста: по-перше, ми розробляємо системи, які намагаються досягти результатів швидко та з оптимальним використанням ресурсів. Навіть якщо, як у випадку з GPT-3, ресурси можуть бути значно більші, ніж ті, які може забезпечити середній проект дослідження NLP, ця культура результатів-орієнтованої оптимізації все ще панує у методології, оскільки вона стала домінувати в академічній конвенції.

Відповідно, наші навчальні архітектури винагороджують моделі, які швидко збігаються та надають явно підходящі відповіді на питання, навіть якщо модель NLP згодом не зможе виправдати свою відповідь або продемонструвати, як вона прийшла до своїх висновків.

Ранні нахили до шахрайства

Це відбувається тому, що модель вчиться “шляхетним” відповідям значно раніше в процесі навчання, ніж вона вчиться більш складних типів придбання знань. Оскільки підвищення точності часто винагороджується досить безрозбірливо протягом всього навчання, модель потім пріоритезує будь-який підхід, який дозволить їй відповісти на питання “гладко” та без справжнього розуміння.

Оскільки навчання шляхом скорочення буде обов’язково представляти перші успіхи під час навчання, сесія природно відхилиться від більш складного завдання отримання корисної та більш повної епістемологічної перспективи, яка може містити глибші та більш проникливі шари атрибуції та логіки.

Кормлення штучного інтелекту “легкими” відповідями

Друга проблема полягає в тому, що навіть якщо останні дослідницькі ініціативи вивчали схильність штучного інтелекту “шахраювати” таким чином, і визначили явище “скорочень”, досі не було жодних зусиль класифікувати матеріал, що дозволяє “скороченню”, у внесеному наборі даних, який би був логічним першим кроком у вирішенні того, що може виявитися фундаментальною архітектурною помилкою в системах машинного читання (MRC).

Нова робота, спільна робота між Інститутом комп’ютерної техніки Вансуаня таМОЕ Ключової лабораторії обчислювальної лінгвістики у Пекінському університеті, тестує різні мовні моделі проти новоанотованого набору даних, який містить класифікації для “легких” та “важких” рішень можливого питання.

Джерело: https://arxiv.org/pdf/2106.01024.pdf

Джерело: https://arxiv.org/pdf/2106.01024.pdf

Набір даних використовує парафразування як критерій для більш складних та глибоких відповідей, оскільки семантичне розуміння необхідно для переформулювання отриманих знань. Натомість “скороченні” відповіді можуть використовувати токени, такі як дати, та інші ключові слова, щоб надати відповідь, яка є фактично точною, але без контексту чи обґрунтування.

Компонент скорочень у анотаціях включає співпадіння слів питання (QWM) та просте співпадіння (SpM). Для QWM модель використовує сутності, витягнуті з наданого текстового даних, та викидає контекст; для SpM модель визначає перекриття між реченнями відповідей та питаннями, які надані в навчальних даних.

Дані скорочень майже “вірусні” за впливом у наборі даних

Дослідники стверджують, що набори даних схильні містити велику частку питань зі скороченнями, які змушують навчені моделі покладатися на хитрощі зі скороченнями.

Дві моделі, використані в експериментах, були BiDAF та BERT-base. Дослідники спостерігають, що навіть коли навчені на варіантах наборів даних з більшим відсотком “важких” питань, обидві моделі все одно виконують краще на питаннях зі скороченнями, ніж на важчих парафразованих питаннях, незважаючи на малий розмір прикладів у наборах даних.

Це представляє дані скорочень майже у контексті вірусу – тобто потрібно дуже мало їх у наборі даних, щоб вони були прийняті та пріоритезовані під час навчання, згідно з традиційними стандартами та практиками в NLP.

Доведення шахрайства

Одним із методів, який дослідження використовує для доведення хитрощів скороченої відповіді, є заміна “легкого” слова-ентітету на аномальне слово. Якщо було використано метод скорочення, логіка “шахрайської” відповіді не може бути надана; але якщо відповідь була надана з більш глибокого контексту та семантичної оцінки ширшого спектра тексту, то система може розібрати помилку та реконструювати правильну відповідь.

Заміна 'Бейонсе' (людина) на 'Америку' (місце), показує, чи має модель будь-яку логіку для своєї відповіді.

Заміна ‘Бейонсе’ (людина) на ‘Америку’ (місце), показує, чи має модель будь-яку логіку для своєї відповіді.

Скорочення через економічну необхідність

Відносно деяких архітектурних причин, чому скорочення так пріоритезуються у навчальних потоках NLP, автори коментують ‘Моделі MRC можуть вивчити хитрощі зі скороченнями, такі як QWM, з меншими обчислювальними ресурсами, ніж завдання зі зрозуміння, такі як ідентифікація парафразування’.

Це, тоді, може бути непередбачуваним результатом стандартної оптимізації та філософії збереження ресурсів у підходах до машинного читання, та тиску на отримання результатів з обмеженими ресурсами у вузьких термінах.

Дослідники також зазначають:

‘[Оскільки] хитрощі зі скороченнями можуть бути використані для відповіді на більшість питань навчання правильно, обмежені нерозwiązані питання можуть не мотивувати моделі вивчати складні рішення, які вимагають складних навичок.’

Якщо результати статті будуть згодом підтверджені, то величезна та постійно зростаюча галузь попередньої обробки даних може потребувати розгляду “прихованих підказок” у даних як проблеми, яку потрібно вирішити у довгостроковій перспективі, або ж змінити архітектури NLP, щоб пріоритезувати більш складні процедури для прийому даних.

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai