Погляд Anderson
Виявлення «професійних» шкідливих онлайн-відгуків за допомогою машинного навчання

Нова дослідницька співпраця між Китаєм і США пропонує спосіб виявлення шкідливих відгуків електронної комерції, призначених для підірвання конкурентів або для отримання викупу, шляхом використання сигнатури поведінки таких відгуків.
Система, названа модель виявлення шкідливого користувача (MMD), використовує Метричний навчання, техніку загальновживану в комп’ютерному зорі та системах рекомендацій, разом з рекурентною нейронною мережею (RNN), для ідентифікації та маркування виводу таких відгуків, які в статті називаються професійними шкідливими користувачами (PMU).
Відмінно! 1 зірка
Більшість онлайн-відгуків електронної комерції надають два види зворотної зв’язку користувача: рейтинг зірок (або рейтинг з 10) та текстовий відгук, і в типовому випадку вони будуть логічно відповідати один одному (тобто поганий відгук буде супроводжуватися низьким рейтингом).
PMU, однак, зазвичай порушують цю логіку, залишаючи поганий текстовий відгук з високим рейтингом, або низький рейтинг, супроводжуваний добрим відгуком.
Це дозволяє відгук користувача завдавати репутаційного збитку без спрацювання відносно простих фільтрів, розгорнутих сайтами електронної комерції для ідентифікації та вирішення виводу шкідливих відгуків. Якщо фільтр, заснований на обробці природної мови (NLP), визначає інвективу в тексті відгука, цей “прапор” ефективно скасовується високим рейтингом зірок (або десятковим), який також призначив PMU, фактично роблячи шкідливий вміст “нейтральним” з статистичної точки зору.

Приклад того, як шкідливий відгук може бути статистично змішаний з справжніми відгуками з точки зору системи колективного фільтрування, яка намагається ідентифікувати таке поведінку. Джерело: https://arxiv.org/pdf/2205.09673.pdf
Нова стаття зазначає, що намір PMU часто полягає в тому, щоб вимагати гроші у онлайн-рітейлерів в обмін на виправлення негативних відгуків, і/або обіцянку не публікувати подальших негативних відгуків. У деяких випадках акторами є ад хок особи шукають знижки, хоча часто PMU використовується випадково працевлаштовується жертвами-конкурентами.
Маскування негативних відгуків
Поточне покоління автоматичних детекторів таких відгуків використовує колективне фільтрування або модель, засновану на вмісті, і шукають явні та недвозначні “відхилення” – відгуки, які є однозначно негативними за обома методами зворотної зв’язку, і які суттєво відрізняються від загальної тенденції настрою відгуків і рейтингу.
Інша класична сигнатура, на яку ці фільтри орієнтуються, – це висока частота публікації, тоді як PMU публікує стратегічно і тільки час від часу (оскільки кожен відгук може представляти індивідуальну комісію або стадію довшої стратегії, призначеної для розмиття метрики “частоти”).
Отже дослідники нової статті інтегрували дивну полярність професійних шкідливих відгуків у спеціальну систему, що призвело до алгоритму, який майже на рівні з можливістю людини-відгуківника “чухати” розбіжність між рейтингом і текстовим вмістом відгука.

Концептуальна архітектура MMD, що складається з двох центральних модулів: Профайлінг шкідливого користувача (MUP) і Метричний навчання уваги (MLC, сірим).
Порівняння з попередніми підходами
Оскільки MMD, як заявляють автори, є першою системою, яка намагається ідентифікувати PMU на основі їхньої шизофренічної стилістики публікації, немає прямих попередніх робіт, з якими можна порівняти її. Тому дослідники протиставили свою систему ряду алгоритмів, на яких часто залежать традиційні автоматичні фільтри, включаючи кластеризацію K-means++; відомий виявлення статистичних відхилень (SOD); Hysad; Semi-sad; CNN-sad; і Систему рекомендацій виявлення шкідливого користувача (SDRS).

Тестування проти позначених наборів даних з Amazon [securities_stock_price_tag symbol="amzn" exchange="nasdaq"] і Yelp, MMD здатний ідентифікувати професійних онлайн-детракторів з найвищим рівнем точності, заявляють автори. Жирний шрифт позначає MMD, а зірочка (*) вказує на найкращу продуктивність. У цьому випадку MMD був переможений лише в двох завданнях окремою технологією (MUP), яка вже включена в нього, але не інструментована за замовчуванням для завдання в руках.

У цьому випадку MMD був протиставлений ненаданих наборів даних з Taobao і Jindong, роблячи його фактично задачею навчання без нагороди. Знову ж таки, MMD був перевершений лише однією зі своїх власних складових технологій, високо адаптованої для завдання для цілей тестування.
Дослідники спостерігають:
‘[На] всіх чотирьох наборах даних наш запропонований модель MMD (MLC+MUP) перевершує всі базові рівні за рахунок F-оцінки. Відзначте, що MMD є комбінацією MLC і MUP, що забезпечує його перевагу над моделями з нагородою та без нагороди в цілому.’
Стаття також пропонує, що MMD може служити корисним методом попередньої обробки для традиційних автоматичних фільтрів систем, і надає експериментальні результати щодо ряду наборів даних, включаючи колективне фільтрування на основі користувача (UBCF), колективне фільтрування на основі елемента (IBCF), факторизацію матриці (MF-eALS), персоналізований рейтинг Баєса (MF-BPR) і нейронне колективне фільтрування (NCF).
За термінами кількості влучень (HR) і нормованої дискретної вигоди (NDCG) у результатах цих тестових доповнень, автори заявляють:
‘Серед усіх чотирьох наборів даних MMD значно покращує моделі рекомендацій за термінами HR і NDCG. Зокрема, MMD може підвищити продуктивність HR на 28,7% в середньому і NDCG на 17,3% в середньому.
‘Видаливши професійних шкідливих користувачів, MMD може покращити якість наборів даних. Без цих професійних шкідливих користувачів фальшивих [відгуків] набір даних стає більш [інтуїтивним].’
Стаття називається Виявлення професійного шкідливого користувача за допомогою метричного навчання в системах рекомендацій, і надходить від дослідників кафедри комп’ютерних наук і технологій університету Цзілінь; ключової лабораторії інтелектуальної обробки інформації Китайської академії наук у Пекіні; і школи бізнесу у Рутгерсі в Нью-Джерсі.
Дані та підхід
Виявлення PMU – це багатомодальне завдання, оскільки потрібно розглянути два нееквівалентні параметри (числовий рейтинг зірок/десятковий рейтинг і текстовий відгук). Автори нової статті стверджують, що жодна попередня робота не розглядала це завдання.
MMD використовує ієрархічну двоступеневу рекурентну нейронну мережу (HDAN) для асиміляції вмісту відгуків у бал оцінки настрою.

Проєкція відгуків у бал оцінки настрою з HDAN, який сприяє вкладенню слів і пропозицій для отримання оцінки настрою.
HDAN використовує механізми уваги для призначення вагових коефіцієнтів кожному слову та кожній пропозиції. На зображенні вище, автори заявляють, слово бідніше повинно бути явно призначено більшою вагою, ніж конкуруючі слова у відгуку.
Для проекту HDAN взяв рейтинги продуктів у чотирьох наборах даних як істину. Набори даних були Amazon.com; Yelp для RecSys (2013); і два “реальних світу” (а не експериментальних) набори даних, з Taobao і Jindong.
MMD використовує метричний підхід, який намагається оцінити точну відстань між сутностями для характеристики загальної групи відносин у даних.
MMD починається з однозначної кодування для вибору користувача та елемента через латентну факторну модель (LFM), яка отримує базовий бал рейтингу. Тим часом HDAN проєктує вміст відгуків у бал оцінки настрою як додаткові дані.
Результати потім обробляються у модель профайлінгу шкідливого користувача (MUP), яка виводить вектор розриву настрою – розрив між рейтингом і оцінкою настрою текстового вмісту відгуків. Таким чином, вперше, PMU можуть бути категоризовані та позначені.

Метричний підхід для кластеризації на основі уваги.












