Погляд Anderson
Моделі генеративного письма на основі штучного інтелекту часто “копіюють і вставляють” джерельні дані

Американський драматург і підприємець Вілсон Мізнер часто цитується як той, хто сказав: “Коли ви вкрадаєте у одного автора, це плагіат; якщо ви вкрадаєте у багатьох, це дослідження”.
Подібно, припущення щодо нового покоління систем творчого письма на основі штучного інтелекту полягає в тому, що величезні об’єми даних, які подаються їм на стадії навчання, призвели до справжньої абстракції високорівневих концепцій та ідей; що ці системи мають у своєму розпорядженні відфільтровану мудрість тисяч авторів, з якої штучний інтелект може сформулювати інноваційні та оригінальні тексти; і що ті, хто використовує такі системи, можуть бути впевнені, що вони не займаються плагіатом-посередником.
Це припущення викликає сумніви у новій роботі дослідницького консорціуму (до складу якого входять підрозділи штучного інтелекту Facebook та Microsoft ), який виявив, що моделі генерації мови на основі машинного навчання, такі як серія GPT, “іноді копіюють навіть довгі пасажі” у свій нібито оригінальний вивід, без посилання.
У деяких випадках автори відзначають, що GPT-2 дублює понад 1000 слів з навчальної вибірки у своєму виводі.
Документ документ називається Як багато мовні моделі копіюють з їхніх навчальних даних? Оцінка лінгвістичної новизни в генерації тексту за допомогою RAVEN і є спільною роботою університету Джонса Гопкінса, дослідницького центру Microsoft, Нью-Йоркського університету та дослідницького центру штучного інтелекту Facebook.
RAVEN
Дослідження використовує новий підхід під назвою RAVEN (RAtingVErbalNovelty), акронім, який був забавно витворений, щоб віддзеркалити пташину лиходія класичної поеми:
‘Цей акронім відноситься до “Ворона” Едгара Аллана По, у якому оповідач зустрічає загадкового ворона, який повторює крик “Ніколи більше!” Оповідач не може сказати, чи просто повторює ворона щось, що він чув від людини, чи створює свої власні вирази (можливо, поєднуючи ніколи і більше)—та сама основна двозначність, яку наш документ розглядає.’
Висновки з нової роботи виходять на тло великого зростання систем генерації вмісту на основі штучного інтелекту, які намагаються замінити “прості” завдання редагування, а також написати повноцінний вміст. Одна з таких систем отримала 21 мільйон доларів у вигляді фінансування серії А на початку цього тижня.
Дослідники відзначають, що ‘GPT-2 іноді дублює навчальні пасажі, які мають довжину понад 1000 слів.‘ (їхнє підкреслення), і що системи генерації мови пропагують лінгвістичні помилки у джерельних даних.
Моделі мови, вивчені під RAVEN, були серією GPT до GPT-2 (автори не мали доступу до GPT-3 на той час), Transformer, Transformer-XL та LSTM.
Новизна
Документ відзначає, що GPT-2 створює слова типу “швейцарифікований” та похідні типу “IKEA-ність”, створюючи такі нові слова (їх немає у навчальних даних GPT-2) на основі лінгвістичних принципів, отриманих під час навчання.
Результати також показують, що ‘74% речень, згенерованих Transformer-XL, мають синтаксичну структуру, якої немає в жодному навчальному реченні’, вказуючи, як зазначають автори, ‘нейронні мовні моделі не просто запам’ятовують; натомість вони використовують продуктивні процеси, які дозволяють їм поєднувати знайомі частини новими способами.’
Отже, технічно абстракція та узагальнення повинні виробляти інноваційний та оригінальний текст.
Дублікування даних може бути проблемою
Документ припускає, що довгі та дослівні цитати, створені системами генерації природної мови, можуть бути “запечатані” у модель штучного інтелекту, оскільки оригінальний джерельний текст повторюється кілька разів у наборах даних, які не були достатньо дедупліковані.
Хоча інший дослідницький проект виявив, що повне дублікування тексту може відбуватися навіть якщо джерельний текст з’являється тільки один раз у наборі даних, автори відзначають, що цей проект має інші концептуальні архітектури порівняно з загальними системами генерації вмісту.
Автори також відзначають, що зміна декодувального компонента в системах генерації мови може збільшити новизну, але виявили під час тестів, що це відбувається за рахунок якості виводу.
Додаткові проблеми виникають, коли набори даних, які живлять алгоритми генерації вмісту, стають все більші. Окрім того, що вони погіршують питання щодо доступності та життєздатності попередньої обробки даних, а також якості та дедуплікації даних, багато базових помилок залишаються у джерельних даних, які потім пропагуються у виводі вмісту штучним інтелектом.
Автори відзначають*:
‘Недавнє збільшення розмірів навчальних наборів робить особливо важливим перевірку новизни, оскільки масштаб цих навчальних наборів може порушити наші інтуїтивні уявлення про те, що можна очікувати природно. Наприклад, деяка помітна робота в мові придбанні залежить від припущення, що регулярні форми минулого часу неправильних дієслів (наприклад, becomed, teached) не з’являються в досвіді учня, тому якщо учень створює такі слова, вони повинні бути новими для учня.
‘Однак виявилося, що для всіх 92 основних неправильних дієслів англійської мови неправильна регулярна форма з’являється в навчальному наборі GPT-2.’
Потрібна більша кураторська робота з даними
Документ стверджує, що потрібно звернути більше уваги на новизну при формуванні систем генерації мови, з особливим акцентом на тому, щоб частина даних, яка утримується (частина джерельних даних, яка відкладається для тестування того, як добре алгоритм оцінив основну частину навчальних даних), була відповідною для завдання.
‘У машинному навчанні критично важливо оцінювати моделі на утриманому тестовому наборі. Через відкритий характер генерації тексту згенерований текст моделі може бути скопійований з навчального набору, у цьому випадку він не утримується — тому використання цих даних для оцінки моделі (наприклад, для оцінки сполучення або граматичності) не є дійсним.’
Автори також стверджують, що потрібна більша увага у виробництві мовних моделей через ефект Елізи, синдром, ідентифікований у 1966 році, який ідентифікує “сприйнятливість людей до читання значно більшого розуміння, ніж це виправдано, у рядках символів — особливо слова — сполучених комп’ютерами”.
* Моє перетворення внутрішніх посилань на гіперпосилання












