Kąt Andersona

Dlaczego sztuczna inteligencja nie zapewnia lepszych rekomendacji produktów

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Jeśli interesujesz się rzeczami niezwykłymi, istnieją dwa powody, dla których Twoje wyszukiwania przedmiotów i produktów są mniej związane z Twoimi zainteresowaniami niż w przypadku Twoich “głównego nurtu” rówieśników; albo jesteś przypadkiem “krawędziowym” pod względem monetyzacji, którego zainteresowania będą zaspokojone tylko wtedy, gdy również należysz do wyższych kategorii siły nabywczej (na przykład produkty i usługi związane z zarządzaniem majątkiem); lub algorytmy wyszukiwania, których używasz, wykorzystują filtrowanie współpracy (CF), które faworyzuje zainteresowania większości.

Ponieważ filtrowanie współpracy jest tańsze i bardziej ugruntowane niż inne potencjalnie bardziej zdolne algorytmy i ramy, jest możliwe, że oba te przypadki mają zastosowanie.

Wyniki wyszukiwania opartego na filtrowaniu współpracy będą priorytetowo traktować elementy, które są postrzegane jako popularne wśród “ludzi podobnych do Ciebie”, tak dobrze, jak to możliwe, w ramach hostowanego frameworku.

Jeśli boisz się udostępniania informacji o profilowaniu danych systemowi hostowanemu – na przykład nie masz skłonności do klikania przycisków “Lubię” w serwisach wideo, takich jak Netflix – prawdopodobnie zostaniesz sklasyfikowany dość ogólnie w Twoich pierwszych interakcjach z systemem, a rekomendacje, które otrzymasz, będą odzwierciedlać najpopularniejsze trendy.

Na platformie streamingowej może to oznaczać rekomendowanie pokazów i filmów, które są obecnie “gorące”, takich jak reality TV i dokumenty o morderstwach, niezależnie od Twoich zainteresowań tymi tematami. Podobnie jest w przypadku platform rekomendacji książek, które będą skłonne do proponowania obecnych i niedawnych bestsellerów, wydawałoby się, że w sposób przypadkowy.

W teorii, nawet użytkownicy, którzy są ostrożni w udostępnianiu danych, powinni ostatecznie uzyskać lepsze wyniki z takich systemów na podstawie sposobu, w jaki je używają i rzeczy, które wyszukują, ponieważ większość frameworków wyszukiwania daje użytkownikom ograniczoną możliwość edycji ich historii użycia.

Jakikolwiek kolor, pod warunkiem, że jest to czarny

Jednakże, zgodnie z nowym badaniem przeprowadzonym w Austrii, dominacja filtrowania współpracy nad filtrowaniem opartym na treści (które próbuje określić relacje między produktami, a nie tylko brać pod uwagę agregowaną popularność), oraz innymi alternatywnymi podejściami, skłania systemy wyszukiwania w kierunku długoterminowej popularityzacji, gdzie oczywiście popularne wyniki są przedstawiane użytkownikom, którzy nie są nimi zainteresowani.

Artykuł stwierdza, że użytkownicy, którzy nie są zainteresowani popularnymi przedmiotami, otrzymują “znacznie gorsze” rekomendacje niż użytkownicy ze średnim lub wysokim zainteresowaniem popularnością, i (może trywialnie) że popularne przedmioty są rekomendowane częściej niż niepopularne. Badacze również dochodzą do wniosku, że użytkownicy z niskim zainteresowaniem popularnymi przedmiotami mają tendencję do posiadania większych profili użytkowników, które mogą potencjalnie poprawić systemy rekomendacji – jeśli tylko systemy mogą pokonać swoją uzależnienie od “stadnych” wskaźników.

Porównanie popularności z złożonością profili użytkowników pokazuje, że 'marginalni' użytkownicy niezainteresowani treściami głównego nurtu mają więcej potencjalnej treści dla systemów rekomendacji; ale ponieważ tacy użytkownicy nie dostosowują się do trendów, wydaje się to straconą okazją. Źródło: https://arxiv.org/pdf/2203.00376.pdf

Porównanie popularności z złożonością profili użytkowników pokazuje, że ‘marginalni’ użytkownicy niezainteresowani treściami głównego nurtu mają więcej potencjalnej treści dla systemów rekomendacji; ale ponieważ tacy użytkownicy nie dostosowują się do trendów, wydaje się to straconą okazją. Źródło: https://arxiv.org/pdf/2203.00376.pdf

Artykuł ten nosi tytuł Popularityzacja w systemach rekomendacji multimedialnych opartych na filtrowaniu współpracy, i pochodzi od badaczy z now-Center GmbH w Grazu oraz Uniwersytetu Technicznego w Grazu.

Domeny objęte

Rozwijając wcześniejsze prace, które badały poszczególne sektory (takie jak rekomendacje książek), nowy artykuł bada cztery domeny: cyfrowe książki (za pomocą zestawu danych BookCrossing); filmy (za pomocą MovieLens); muzykę (za pomocą Last.fm); oraz anime (za pomocą MyAnimeList).

Badanie zastosowało cztery popularne algorytmy filtrowania współpracy w systemach rekomendacji multimedialnych (MMRS) do danych podzielonych na trzy grupy użytkowników, według ich skłonności do odbioru “popularnych” wyników: LowPop, MedPop i HighPop. Grupy użytkowników zostały przefiltrowane do 1000 grup o równych rozmiarach, na podstawie najmniejszej, średniej i największej skłonności do faworyzowania “popularnych” wyników.

Komentując wyniki, autorzy stwierdzają:

‘[Stwierdzamy], że prawdopodobieństwo polecenia multimedialnego elementu silnie koreluje z jego popularnością [i] że użytkownicy, którzy nie są zainteresowani popularnymi przedmiotami, otrzymują znacznie gorsze rekomendacje multimedialne niż użytkownicy ze średnim i wysokim zainteresowaniem popularnością…

‘Nasze wyniki pokazują, że chociaż użytkownicy z niewielkim zainteresowaniem popularnymi przedmiotami mają tendencję do posiadania większych profili użytkowników, które mogą potencjalnie poprawić systemy rekomendacji, otrzymują one najgorsze rekomendacje. Stąd potrzebne są dalsze badania, aby złagodzić popularityzację w MMRS, zarówno na poziomie elementu, jak i użytkownika.’

Wśród ocenianych algorytmów były dwa warianty K-Nearest Neighbors (KNN), UserKNN i UserKNNAvg. Pierwszy z nich nie generuje średniej oceny dla użytkownika i elementu. Zastosowano również nieujemną macierzową faktoryzację (NMF) oraz algorytm CoClustering.

Protokół oceny rozpatrywał zadanie rekomendacji jako wyzwanie predykcyjne, które zostało zmierzone przez badaczy w kategoriach średniego błędu bezwzględnego (MAE), wobec pięciokrotnego podziału walidacyjnego, który przekracza zwykły podział 80/20 między danymi szkoleniowymi a testowymi.

Wyniki wskazują na prawie pewną gwarancję popularityzacji w filtrowaniu współpracy. Pytanie, można by rzec, jest takie, czy jest to postrzegane jako problem przez wielomiliardowe firmy, które obecnie włączają CF do swoich algorytmów wyszukiwania.

We wszystkich czterech badanych zestawach danych, przy użyciu czterech popularnych rekomendacji filtrowania współpracy, każdy wynik wskazuje, że popularne elementy multimedialne są bardziej prawdopodobne do polecenia niż niepopularne oferty.

We wszystkich czterech badanych zestawach danych, przy użyciu czterech popularnych rekomendacji filtrowania współpracy, każdy wynik wskazuje, że popularne elementy multimedialne są bardziej prawdopodobne do polecenia niż niepopularne oferty.

Najłatwiejszy sposób

Chociaż filtrowanie współpracy jest coraz częściej stosowane jako tylko jeden element szerszej strategii algorytmu wyszukiwania, ma silny udział w sektorze wyszukiwania i jego logika oraz potencjalna opłacalność są atrakcyjnie łatwe do zrozumienia.

Sam filtrowanie współpracy w zasadzie przenosi zadanie oceny wartości treści na użytkowników końcowych i wykorzystuje ich przyjęcie treści jako wskaźnik jej wartości i potencjalnej atrakcyjności dla innych klientów. Za analogią, jest to podstawowo mapa “rozmów przy fontannie”.

Filtrowanie oparte na treści (CBF) jest trudniejsze, ale mogłoby potencjalnie zapewnić bardziej istotne wyniki. W sektorze widzenia komputerowego, obecnie wydatkowana jest coraz większa ilość badań na kategoryzowanie treści wideo i próby wywnioskowania dziedzin, cech i wysokopoziomowych pojęć poprzez analizę audio i wideo w filmach i programach telewizyjnych.

Jeden z wielu projektów badawczych z ostatnich pięciu lat, które próbują wywnioskować cechy semantyczne z treści filmów, w celu wygenerowania bardziej inteligentnych 'sąsiednich' rekomendacji. Źródło: https://arxiv.org/pdf/1701.00199.pdf

Jeden z wielu projektów badawczych z ostatnich pięciu lat, które próbują wywnioskować cechy semantyczne z treści filmów, w celu wygenerowania bardziej inteligentnych ‘sąsiednich’ rekomendacji. Źródło: https://arxiv.org/pdf/1701.00199.pdf

Jednakże, jest to dość nowy przedsięwzięcie, i związane z bieżącą, bardziej ogólną walką o ilościową, izolowaną i wykorzystywaną wiedzę wysokiego poziomu i cechy w dziedzinie wiedzy.

Kto używa filtrowania współpracy?

W momencie pisania, silnik rekomendacji krytykowany przez Netflix pozostaje skupiony na różnych podejściach filtrowania współpracy, stosując różne technologie pomocnicze w ciągłych próbach wygenerowania bardziej istotnych rekomendacji dla użytkownika.

Silnik wyszukiwania Amazon ewoluował od wczesnego zastosowania filtrowania współpracy opartego na użytkowniku do metody filtrowania współpracy między elementami, która kładzie większy nacisk na historię zakupów klienta. Naturalnie, może to prowadzić do różnych rodzajów nieścisłości, takich jak bańki filtrujące, lub nadmierne podkreślanie rzadkich danych. W tym ostatnim przypadku, jeśli rzadki klient Amazon dokonuje “niezwykłego” zakupu, takiego jak zestaw operetek dla przyjaciela, któremu podoba się opera, może nie być wystarczających innych zakupów, które odzwierciedlają preferencje klienta, aby zapobiec temu, że ten zakup stanie się wpływem na ich własne rekomendacje.

Filtrowanie współpracy jest również szeroko stosowane przez Facebook, w połączeniu z innymi podejściami, oraz przez LinkedIn, YouTube i Twitter.

 

Pierwotnie opublikowane 2 marca 2022.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai