Погляд Anderson
Чому історична мова є викликом для штучного інтелекту
Одним з центральних викликів систем обробки природної мови (NLP) є отримання суттєвих висновків з широкого різноманіття письмових матеріалів. Джерелами даних для навчальної вибірки нового алгоритму NLP можуть бути такої лінгвістичної різноманітності, як Twitter, газети та наукові журнали, з усіма апеляційними ексцентричностями, властивими кожному з цих джерел.
У більшості випадків це стосується лише англійської мови; і це стосується лише поточних або недавніх джерел тексту. Коли алгоритм NLP має розглядати матеріали, що походять з кількох епох, він зазвичай має труднощі з примиренням різних способів, якими люди говорять або пишуть у національних і субнаціональних спільнотах, а особливо в різні періоди історії.
Відже, використання текстових даних (наприклад, історичних трактатів і шанованих наукових робіт), які охоплюють епохи, є потенційно корисним методом отримання історичної оцінки теми та формування статистичних реконструкцій хронології, які передують прийняттю та підтримці метрик для галузі.
Наприклад, інформація про погоду, яка сприяє моделям прогнозування зміни клімату штучного інтелекту, не була достатньо зареєстрована по всьому світу до 1880 року, тоді як видобування класичних текстів пропонує старіші записи про значні метеорологічні події, які можуть бути корисними для надання до-Вікторіанських даних про погоду.
Хронологічна невідповідність
Нова робота університету Вашингтона та Інституту штучного інтелекту Аллена показала, що навіть такий короткий інтервал, як п’ять років, може спричинити хронологічну невідповідність, яка може зруйнувати корисність попередньо натренованої моделі NLP.

У всіх випадках вищі оцінки кращі. Тут ми бачимо теплову карту хронологічного погіршення по чотирьох корпусах текстових матеріалів, що охоплюють п’ятирічний період. Такі розбіжності між навчальними та оціночними даними, згідно з авторами нової роботи, можуть спричинити ‘масове падіння продуктивності’. Джерело: https://arxiv.org/pdf/2111.07408.pdf
У роботі зазначається:
‘Ми виявили, що хронологічна невідповідність впливає як на узагальнення моделі мови, так і на продуктивність завдання. Ми виявили суттєві відмінності в погіршенні по текстових доменах і завданнях. За 5 років оцінка F1 класифікаторів може погіршитися на 40 балів (приналежність до політичної партії у Twitter) або на 1 бал (оцінка відгуків у Yelp). Два різні завдання, визначені на одному домені, можуть показувати різні рівні погіршення з часом.’
Нерівномірний розподіл
Основна проблема полягає в тому, що навчальні набори даних зазвичай діляться на дві групи, іноді у досить нерівномірному співвідношенні 80/20, через обмежену доступність даних. Більша група даних тренується на нейронній мережі, тоді як решта даних використовується як контрольна група для перевірки точності отриманого алгоритму.
У змішаних наборах даних, що містять матеріали, які охоплюють кілька років, нерівномірний розподіл даних з різних періодів може означати, що оціночні дані складаються переважно з матеріалів однієї конкретної епохи.
Це призведе до того, що вони стануть поганим полігоном для моделі, натренованої на більш різноманітному складі епох (тобто на більшій частині всього доступного даних). По суті, залежно від того, чи переважно оціночні дані представляють новіші або старіші матеріали, це подібно до того, щоб просити вашого дідуся оцінити останніх K-Pop-ідолів.
Тривалий обхідний шлях полягав би у тренуванні кількох моделей на набагато більш обмежених за часом наборах даних та спробі зібрати сумісні функції з результатів кожної моделі. Однак випадкова ініціалізація моделей сама по собі означає, що цей підхід стикається з власним набором проблем у досягненні міжмодельної паритету та рівності – навіть не беручи до уваги, чи були декілька джерел даних достатньо схожими один на одного, щоб зробити експеримент значимим.
Дані та навчання
Для оцінки хронологічної невідповідності автори тренували чотири текстові корпуси по чотирьох доменах;
Twitter
…де вони зібрали необроблені дані шляхом видобування випадкової вибірки з 12 мільйонів твітів, рівномірно розподілених між 2015-2020 роками, де автори вивчали іменовані сутності (тобто людей та організацій) та політичні приналежності.
Наукові статті
…де автори отримали необроблені дані з корпусу Semantic Scholar, що складається з 650 000 документів, охоплюючи 30-річний період, і на яких вони вивчали класифікацію типу згадування (SciERC) та класифікацію місця проведення конференції з штучного інтелекту (AIC, яка розрізняє, чи була робота опублікована в AAAI чи в ICML).
Новинні статті
…де автори використали дев’ять мільйонів статей з Набору даних Newsroom, охоплюючи період з 2009 по 2016 рік, на яких вони виконували три завдання: сумаризацію новин, класифікацію видавців та класифікацію медіа-фреймів (MFC), яка остання завдання вивчає сприйняту пріоритетність різних тем у новинній продукції.
Відгуки про їжу
…де дослідники використали Відкритий набір даних Yelp на одному завданні: класифікації оцінок відгуків (YELPCLS), традиційному виклику аналізу настрою, характерному для багатьох досліджень NLP у цій галузі.
Результати
Моделі були оцінені на GPT-2, з різними результатами оцінок F1. Автори виявили, що втрати продуктивності через хронологічну невідповідність є двонаправленими, тобто моделі, натреновані на недавніх даних, можуть бути негативно вплинуті впливом старішого даних, і навпаки (див. зображення на початку статті для графіків). Автори зазначають, що це має особливі наслідки для застосувань у соціальних науках.
У загальному, результати показують, що хронологічна невідповідність суттєво погіршує продуктивність, і має широкий вплив на більшість завдань. Набори даних, які охоплюють дуже довгі періоди, наприклад десятиліття, природно погіршують проблему.
Автори далі зазначають, що хронологічна невідповідність також впливає на марковані, а також на необроблені дані попереднього навчання. Крім того, їхні спроби пом’якшити наслідки за допомогою адаптації домену (див. нижче) не суттєво покращили ситуацію, хоча вони стверджують, що донастроювання інформації про дані в наборі даних може допомогти до певної міри.
Висновок
Дослідники підтверджують попередні висновки, що раніше запропоновані засоби, пов’язані з адаптацією домену (DAPT, де робиться припущення про розбіжність даних), і хронологічною адаптацією (де дані вибираються за періодом часу), роблять мало для пом’якшення проблеми.
У роботі зазначається*:
‘Наші експерименти показали суттєві відмінності в хронологічному погіршенні по завданнях, більше, ніж було виявлено в попередніх дослідженнях. Ці висновки мотивують подальше вивчення хронологічної невідповідності по застосувань NLP, її розгляду в оцінках бенчмарків, і пильності з боку фахівців, які можуть контролювати продуктивність системи в реальному часі.
‘Відзначимо, що ми спостерігали, що подальше навчання моделей мови на хронологічно узгоджених даних не має суттєвого впливу, мотивуючи подальше дослідження для пошуку ефективних методів хронологічної адаптації, які були б менш дорогими, ніж постійна збирання анотованих/маркованих даних з часом.’
Автори пропонують, що подальше дослідження продовжального навчання, де дані постійно оновлюються, може бути корисним в цьому відношенні, і що концепція дрейфу, а також інші методи виявлення зсувів завдань, могли б бути корисними засобами для оновлення наборів даних.
* Моє перетворення внутрішніх посилань на гіперпосилання.












