Взгляд Anderson
Демотация устаревшей “правды” с помощью машинного обучения

Иногда правда имеет срок годности. Когда появляется временно ограниченное утверждение (например, “маски обязательны на общественном транспорте”), его кажущееся “авторитетное” решение может задержаться даже на многие годы, превосходя более поздний и точный контент на одну и ту же тему.
Это является побочным продуктом алгоритмов поисковых систем, которые определяют и продвигают “долгосрочные” окончательные решения, и их склонности отдавать приоритет хорошо связанному контенту, который поддерживает трафик во времени – и все более осторожного отношения к новому контенту в эпоху фейковых новостей.
С другой стороны, снижение стоимости ценного веб-контента просто потому, что метка времени, связанная с ним, прошла произвольное “окно допустимости”, рискует тем, что целое поколение действительно полезного контента будет автоматически понижено в пользу последующего материала, который может быть худшего качества.
В направлении исправления этого синдрома, новая статья исследователей из Италии, Бельгии и Дании использовала различные методы машинного обучения для разработки методологии временного ранжирования доказательств.
За пределами устаревших ответов
Статья написана исследователями из Европейской комиссии в Центре совместных исследований (JRC) в Испре, Католического университета в Лувене и Копенгагенского университета.
Работа учитывает четыре метода временного ранжирования, применяемых к трем методологиям проверки фактов, каждая из которых имеет разный подход к ранжированию доказательств, и предлагает новую методологию ранжирования, которая использует метки времени доказательств в качестве “золотого стандарта”. Исследование показывает, что временное ранжирование доказательств улучшает проницательность результатов и также улучшает предсказания авторитета и достоверности временно-чувствительных фактов и утверждений.
Исследование предлагается как возможное дополнение к существующим системам, и предназначено для помощи в исследованиях, и как возможный дополнительный фактор для включения в разработку новых и эволюционирующих алгоритмов поисковых систем.
Работа моделирует временную динамику доказательств для контент-ориентированной проверки фактов и превосходит “семантическую схожесть” подходы, принятые типичными алгоритмами ранжирования поисковых систем. Модель, обученная исследователями, использует оптимизированную функцию ранжирования, которая может быть легко наложена на существующую архитектуру проверки фактов. Исследователи утверждают, что система является новым вкладом в автоматическую проверку фактов.
Исправление нескольких архитектур проверки фактов
Исследователи наложили временное ограничение на три существующие архитектуры проверки фактов. Первая из них – это модель Bidirectional Long Short Term Memory (BiLSTM), предложенная в MultiFC dataset, выпущенном в 2019 году.
Вторая – это модификация первой, с односторонней рекуррентной нейронной сетью (RNN), заменяющей компонент LSTM.
Третья модель, которую использовали исследователи, – это DistilBERT transformer из библиотеки Hugging Faces, уменьшенная версия модели NLP BERT от Google.
На всех трех архитектурах исследователи применили функцию потерь ListMLE, из исследований под руководством Microsoft, которая последовательно вносила вклад в новые исследования проверки фактов за последние два десятилетия.

Две основные модели проверки фактов, к которым команда исследователей добавила временный компонент в качестве фильтра для авторитета и последующего ранжирования. Источник: https://arxiv.org/pdf/2009.06402.pdf
Значения меток времени были извлечены из метаданных обучения и включены в качестве факторов ранжирования в каждой модели.
Тестирование
Экспериментальная оценка системы включала использование набора данных MultiFC, поскольку он в настоящее время является единственным открытым набором данных высокого объема, доступным для этого конкретного исследовательского интереса. MultiFC содержит 34 924 реальных утверждения, полученных из 26 различных доменов проверки фактов, включая Snopes и Washington Post.
Предсказание достоверности каждого утверждения дополняется десятью фрагментами доказательств, предоставленными API поиска Google, и предсказаниями, полученными путем сочетания элементов, включая докладчика, теги и категории.
Очень часто актуальная метка времени не обязательно является той, которая содержится в метаданных; статья может относиться к событиям из предыдущих времен, и в этом случае системы исследователей должны были позаботиться об извлечении и преобразовании этих данных直接 из текста. Без этого процесса “пересмотр” устаревших новостей будет склонен придать ему новый блеск, особенно в случае высокоавторитетных сайтов, распространяя устаревшие данные.
Даты были извлечены с помощью Python-рутины, и официальные метаданные дат были протестированы на последовательность форматирования (поскольку, например, форматирование меток дат в США и Великобритании различно). При ручной проверке не было найдено ни одной ошибки в метаданных меток времени.
Результаты
По сравнению с ручной проверкой автоматических результатов, исследователи обнаружили, что временное ранжирование доказательств значительно улучшилось на предположениях о релевантности, основанных на чистой семантической схожести или ранжировании SERP. Они также утверждают, что их метод улучшает предсказания достоверности для временно-чувствительных утверждений (т.е. обстоятельств, когда новостная ситуация может быстро меняться, и когда важно отдавать приоритет актуальной информации без простого принуждения к приоритету наиболее недавних результатов на тему).
Исследователи отмечают, что этот подход будет иметь высокую ценность в улучшении моделей ранжирования для волатильных тем, таких как политика и развлечения, где информация меняется быстро, и высоко ранжируемые разработки требуют рамки для автоматического понижения с верхних мест в ранжировании, которые они могли достичь при выпуске.












