Погляд Anderson
Використання відгуків для створення системи рекомендацій, яка працює

Якщо ви коли-небудь купували продукт онлайн і дивувалися безглуздості та непридатності “пов’язаних товарів”, які переслідують процес покупки та післяпродажного обслуговування, ви вже розумієте, що популярні та широко поширені системи рекомендацій часто не справляються з розумінням відносин між потенційними покупками.
Якщо ви купуєте рідкісний і рідко куплений товар, такий як духовка, рекомендації щодо інших духовок, ймовірно, будуть зайвими, хоча найгірші системи рекомендацій не визнають цього. Наприклад, у 2000-х роках система рекомендацій TiVO створила ранню контроверсію в цій сфері, перепризначивши сприйняту стать користувача, який згодом намагався “перевірити” свій профіль користувача, вибравши військові фільми – це був грубий підхід до перегляду алгоритму.
Ще гірше, вам не потрібно нічого купувати (наприклад, на Amazon ) або навіть починати дивитися фільм, чию опис вам переглядаєте на будь-якій великій платформі потокового відео, щоб інформаційно-голодні алгоритми рекомендацій почали рухатися неправильним шляхом; пошук, затримка і кліки на сторінках “деталі” достатньо, і ця бідна (і, ймовірно, неправильна) інформація, ймовірно, буде поширена на майбутні сесії перегляду на платформі.
Спроба зробити систему рекомендацій забути
Іноді можна втрутитися: Netflix пропонує систему “вгору/вниз”, яка, теоретично, повинна допомогти його алгоритмам машинного навчання видалити певні вбудовані концепції та слова з вашого профілю рекомендацій (хоча його ефективність була поставлена під сумнів, і залишається значно легше створити персоналізовану систему рекомендацій з нуля ніж видалити нежадані онтології), тоді як Amazon дозволяє вам видалити назви з вашої історії клієнта, що повинно знижувати будь-які незажадані області, які проникли в ваші рекомендації.
Hulu має подібну функцію, тоді як HBO Max частково відступив від алгоритмічних систем рекомендацій, перед лицем їхніх поточних недоліків.
Жодна з цих строго споживчих досвідів навіть не торкається поширеної та зростаючої критики “пасивних” систем рекомендацій платформ реклами (де відбуваються суттєві зміни через публічне обурення), або палкої теми рекомендацій штучного інтелекту в соціальних мережах, де сайти, такі як YouTube, Twitter і Facebook продовжують зазнавати критики за нерелевантні або навіть шкідливі рекомендації.
Машина, здається, не знає, чого ми хочемо, якщо тільки ми не хочемо суміжного товару, який з’явився у нашому пошуку – навіть якщо цей товар є дублікатом або альтернативою основному товару, який ми щойно купили, а не потенційним додатковим або допоміжним покупком.
Точні рекомендації з використанням відгуків
Нове дослідження спільної роботи Китаю та Австралії пропонує новий метод для вирішення таких нерелевантних рекомендацій, використовуючи зовнішні відгуки користувачів для отримання кращого розуміння справжніх відносин між товарами в сесії покупки. У тестах архітектура перевершила всі сучасні методи, надаючи надію на системи рекомендацій, які мають кращу внутрішню карту залежностей товарів:

RI-GNN перевершує основних конкурентів за точністю відносин між товарами, працюючи найкраще на сесіях з більш ніж п’ятьма товарами. Система була протестована проти наборів даних Pet Supplies і Movies and TV з Amazon Review Data (2018). Джерело: https://arxiv.org/pdf/2201.12532.pdf
Крім того, проект вирішує суттєву проблему створення рекомендацій навіть в анонімних сесіях, де система рекомендацій не має доступу до даних користувача, таких як історія покупок, або власні онлайн-відгуки про попередні покупки.
Нове дослідження називається Перегляд залежності в сесійних рекомендаціях, і походить від дослідників Університету технологій Цілу, Університету технологій Пекіна в Китаї, Університету RMIT у Мельбурні та Австралійського інституту штучного інтелекту Університету технологій Сіднея.
Що далі?
Основним завданням сесійних рекомендацій (SBR) є визначення “наступного” товару від поточного товару, заснованого на його розрахованій залежності від поточного товару. У практичному сенсі це може проявлятися у вигляді списку “Пов’язаних товарів” на сторінці товару на сайті електронної комерції.
Якщо ви купуєте клітку для птахів, чого ще вам, ймовірно, знадобиться? Ну, як мінімум, вам знадобиться птах, щоб помістити його туди – це справжня залежність. Однак, клітка для птахів представлена в онтології товари для домашніх тварин, де не продаються птахи. Пerverse, корм для котів знаходиться в тій же онтології, хоча додання миски для годування кота як пов’язаної рекомендації для продукту клітки для птахів є помилковою залежністю – це помилкова та неправильна асоціація.

З дослідження: справжні та хибні відносини між декількома товарами, візуалізовані праворуч як граф між товарами.
Як це часто буває в архітектурах машинного навчання, це виклик переконати систему рекомендацій, що “віддалений” об’єкт (птах зовсім не представлений у товарах для домашніх тварин) може мати внутрішню та важливу залежність від товару, тоді як товари, які знаходяться в тій же категорії, і дуже близькі за функцією та центральною концепцією (наприклад, миска для годування кота), можуть бути ортогональними або прямо протилежними до розглянутого покупки.
Єдиним способом створення цих відображень між “не-суміжними” об’єктами є краудсорсинг проблеми, оскільки відносини, про які йдеться, є аспектом людського досвіду, не можуть бути визначені програмно та, ймовірно, виходять за межі фінансових можливостей традиційних підходів до маркування наборів даних, таких як Amazon Mechanical Turk.
Отже, дослідники використали механізми обробки природної мови (NLP), щоб витягти важливі слова з відгуків про товар, і використали частоти з цих аналізів для створення вкладень, здатних “відповідати” здавалося б віддаленим товарам.

Архітектура Review-refined Inter-item Graph Neural Network (RI-GNN).
Архітектура та дані
Як зазначено в новому дослідженні, попередні роботи подібного роду використовували журнал відгуків користувача для надання первинних відображень. DeepCONN і RNS обидва використовували цей підхід. Однак це не враховує той факт, що користувач може не написати жодних відгуків або жодних відгуків, що стосуються конкретного товару, який знаходиться “поза межами” його звичайних покупок. Крім того, це щось на зразок “білого ящика”, оскільки це припускає, що користувач вже достатньо взаємодіяв з магазином, щоб створити обліковий запис і увійти до нього.
Розширена графова нейронна мережа (GNN), запропонована дослідниками, використовує більш оракульний підхід, виводячи справжні залежності a priori, так що, ймовірно, анонімний і невідомий користувач може отримувати більш релевантні рекомендації з мінімальними входними даними.
Система, доповнена відгуками, називається Review-refined Inter-item Graph Neural Network (RI-GNN). Дослідники протестували її проти двох наборів даних з Amazon, Товари для домашніх тварин і Фільми та телебачення. Хоча це розв’язує проблему доступності відгуків досить елегантно, реалізація в дикій природі потребуватиме пошуку та витягування відповідної бази даних відгуків. Такий джерело даних могло б бути будь-чим, від постів у соціальній мережі до відповідей на Quora.
Відношення такого рівня будуть корисними для багатьох застосунків машинного навчання, окрім систем рекомендацій. Багато поточних проектів обмежені через відсутність між- та внутрішньодоменних відображень через обмежені фінанси та масштаб, тоді як комерційна мотивація真正ої системи рекомендацій електронної комерції могла б потенційно заповнити цю прогалину.
Метрики та тестування
Автори протестували RI-GNN проти двох версій кожного набору даних, кожна з яких складається з історії покупок користувача та загальних відгуків про товар. Товари, які з’являлися менше п’яти разів, були видалені, а історія користувача була розділена на одиниці тижня. Перша версія набору даних мала всі сесії з більш ніж одним товаром, а друга – всі сесії з більш ніж п’ятьма товарами.
Проект використовував P@K (Точність) і MRR@K (Середнє взаємне ранкове) для своїх метрик оцінки. Суперницькими архітектурами були: S-KNN; GRU4Rec; S-POP; STAMP; BERT4Rec; DHCN; GCE-GNN; SR-GNN; і NARM.
Фреймворк був навчений у партіях по 100 на Adam з швидкістю навчання 0,001, з кількістю тем, встановлених на 24 і 20, відповідно, для Товарів для домашніх тварин і Фільмів та телебачення.
Перша публікація 1 лютого 2022 року.












