Взгляд Anderson
Почему исторический язык является проблемой для искусственного интеллекта
Одной из центральных проблем систем обработки естественного языка (NLP) является получение важных выводов из широкого разнообразия письменных материалов. Источники, которые могут быть использованы для обучения нового алгоритма NLP, могут быть так же лингвистически разнообразны, как Twitter, крупные газеты и научные журналы, со всеми их уникальными особенностями.
В большинстве случаев это относится только к английскому языку и только к текущим или недавним источникам текста. Когда алгоритм NLP должен учитывать материал из разных эпох, он обычно испытывает трудности в согласовании очень разных способов, которыми люди говорят или пишут в разных национальных и субнациональных сообществах, и особенно в разных исторических периодах.
Однако использование текстовых данных (таких как исторические трактаты и научные работы), которые охватывают несколько эпох, может быть полезным методом получения исторического обзора темы и формирования статистических временных реконструкций, которые предшествуют принятию и поддержанию метрик для области.
Например, информация о погоде, которая способствует прогностическим моделям изменения климата, не была адекватно записана во всем мире до 1880 года, в то время как анализ классических текстов предоставляет более старые записи значимых метеорологических событий, которые могут быть полезны для предоставления погодных данных до викторианской эпохи.
Временная несогласованность
Новая статья из Университета Вашингтона и Института Аллена для ИИ показала, что даже такой короткий интервал, как пять лет, может вызвать временную несогласованность, которая может испортить полезность предварительно обученной модели NLP.

В всех случаях более высокие баллы лучше. Здесь мы видим тепловую карту временного ухудшения по четырем корпусам текстовых материалов, охватывающим пять лет. Такие несоответствия между обучающими и оценочными данными, по мнению авторов новой статьи, могут вызвать ‘массовое снижение производительности’. Источник: https://arxiv.org/pdf/2111.07408.pdf
Статья гласит:
‘Мы обнаружили, что временная несогласованность влияет как на обобщение языковой модели, так и на производительность задачи. Мы обнаружили значительные различия в ухудшении по текстовым доменам и задачам. За 5 лет балл F1 классификаторов может ухудшиться на 40 баллов (политическая принадлежность в Twitter) или на 1 балл (рейтинги Yelp). Две различные задачи, определенные на одном и том же домене, могут показать разные уровни ухудшения во времени.’
Неравные разделы
Основная проблема заключается в том, что обучающие наборы данных обычно делятся на две группы, иногда в довольно неравном соотношении 80/20, из-за ограниченной доступности данных. Более крупная группа данных обучается на нейронной сети, а оставшиеся данные используются в качестве контрольной группы для проверки точности полученного алгоритма.
В смешанных наборах данных, содержащих материал, охватывающий несколько лет, неравномерное распределение данных из различных периодов может означать, что оценочные данные чрезмерно состоят из материала из одной конкретной эпохи.
Это сделает его плохой площадкой для проверки модели, обученной на более разнообразной смеси эпох (т.е. на более всего доступных данных). По сути, в зависимости от того, представляет ли меньшинство оценочных данных более новую или более старую информацию, это похоже на то, чтобы попросить вашего дедушку оценить последних K-Pop-идолов.
Долгий обходной путь будет заключаться в обучении нескольких моделей на более ограниченных временных наборах данных и попытке объединить совместимые функции из результатов каждой модели. Однако случайная инициализация модели сама по себе уже сталкивается со своими собственными проблемами в достижении межмодельного паритета и справедливости – даже не учитывая, были ли несколько вносящих вклад наборов данных достаточно похожи друг на друга, чтобы сделать эксперимент осмысленным.
Данные и обучение
Чтобы оценить временную несогласованность, авторы обучили четыре текстовых корпуса по четырем доменам;
Twitter
…где они собрали неаннотированные данные, извлекая случайный выбор 12 миллионов твитов, равномерно распределенных между 2015-2020 годами, где авторы изучали именованные сущности (т.е. людей и организаций) и политические принадлежности.
Научные статьи
…где авторы получили неаннотированные данные из корпуса Semantic Scholar, состоящего из 650 000 документов, охватывающих 30-летний период, и на котором они изучали классификацию упоминаний (SciERC) и классификацию мест проведения конференций по ИИ (AIC, которая различает, была ли статья опубликована в AAAI или ICML).
Новостные статьи
…где авторы использовали девять миллионов статей из Набора данных Newsroom, охватывающих период 2009-2016 годов, на которых они выполнили три задачи: суммирование новостей, классификацию издателя и классификацию медиа-рамок (MFC), которая последняя задача изучает воспринимаемую приоритетность различных тем в новостном контенте.
Отзывы о еде
…где исследователи использовали Открытый набор данных Yelp на одной задаче: классификации рейтингов отзывов (YELPCLS), традиционном вызове анализа настроений в этом секторе.
Результаты
Модели были оценены на GPT-2, с диапазоном полученных баллов F1. Авторы обнаружили, что потеря производительности из-за временной несогласованности является двусторонней, то есть модели, обученные на недавних данных, могут быть негативно затронуты влиянием более старых данных, и наоборот (см. изображение в начале статьи для графиков). Авторы отмечают, что это имеет особые последствия для социальных научных приложений.
В целом результаты показывают, что временная несогласованность существенно ухудшает производительность, и оказывает широкое влияние на большинство задач. Наборы данных, охватывающие очень длинные периоды, такие как десятилетия, естественно усугубляют проблему.
Авторы также отмечают, что временная несогласованность влияет как на аннотированные, так и на неаннотированные предварительно обученные данные. Кроме того, их попытки смягчить последствия с помощью адаптации домена (см. ниже) не существенно улучшили ситуацию, хотя они утверждают, что тонкая настройка информации в наборе данных может помочь до определенной степени.
Заключение
Исследователи подтверждают предыдущие выводы, что ранее предложенные средства, включающие адаптацию домена (DAPT, где делается поправка на несоответствие данных) и временную адаптацию (где данные выбираются по времени), мало что делают, чтобы облегчить проблему.
Статья заключает*:
‘Наши эксперименты показали значительные различия во временном ухудшении по задачам, больше, чем было найдено в предыдущих исследованиях. Эти результаты мотивируют продолжение изучения временной несогласованности в приложениях NLP, ее учета в оценках эталонных значений и бдительность со стороны практиков, способных контролировать производительность системы во времени.
‘В частности, мы наблюдали, что продолжение обучения языковых моделей на временно согласованных данных не имеет большого эффекта, что мотивирует дальнейшие исследования для нахождения эффективных методов временной адаптации, которые были бы менее дорогими, чем постоянное сбор аннотированных/меток данных во времени.’
Авторы предлагают, что дальнейшее исследование непрерывного обучения, где данные постоянно обновляются, может быть полезным в этом отношении, и что концепция дрейфа и другие методы обнаружения сдвигов в задачах могли бы быть полезными средствами для обновления наборов данных.
* Мое преобразование встроенных цитат в гиперссылки.












