Andersonin kulma

Miksi tekoäly ei tarjoa parempia tuotesuosituksia

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Jos olet kiinnostunut harvinaisista asioista, on kaksi syytä, miksi hakusi tuotteista ja tuotteista ovat todennäköisesti vähemmän liittyneitä kiinnostuksiisi verrattuna “päävirta” -vertaisiisi; joko olet rahastamisen “reunatapaus”, jonka kiinnostuksia palvelaan vain, jos olet myös taloudellisen ostovoiman ylempien luokkien joukossa (esim. tuotteet ja palvelut, jotka liittyvät “varallisuuden hallintaan”); tai hakualgoritmit, joita käytät, hyödyntävät yhteisöllistä suodatusta (CF), joka suosii enemmistön kiinnostuksia.

Koska yhteisöllinen suodatus on halvempi ja vakiintunut kuin muut mahdollisesti kyvykkäämmät algoritmit ja kehykset, on mahdollista, että molemmat tapaukset ovat soveltuvia.

CF-pohjaiset hakutulokset priorisoivat kohteita, jotka katsotaan suosituiksi “ihmisten kaltaisille” kuin sinä, niin hyvin kuin isäntäkehys ymmärtää, millainen kuluttaja sinä olet.

Jos et ole halukas antamaan tietoja profiilistasi isäntäjärjestelmälle – esimerkiksi et ole taipuvainen painamaan “Tykkää” -painiketta Netflixissä ja muissa video sisältö palveluissa – sinut luokitellaan todennäköisesti hyvin yleisesti varhaisissa vuorovaikutuksissasi järjestelmän kanssa, ja suositukset, jotka saat, heijastelevat suosituimpia trendejä.

Striimauspalvelussa tämä voi tarkoittaa, että sinulle suositellaan mitä tahansa ohjelmia ja elokuvia, jotka ovat tällä hetkellä “kuumia”, kuten reality-tv ja rikosdokumentteja, riippumatta siitä, oletko kiinnostunut näistä. Vastaavasti kirjasuosituspalveluissa, jotka tarjoavat nykyisiä ja viimeaikaisia bestsellereitä, näyttää siltä, että ne valitsevat ne satunnaisesti.

Teoriassa jopa tietojen varovaiset käyttäjät saavat lopulta parempia tuloksia näistä järjestelmistä sen mukaan, miten he käyttävät niitä ja mitä he etsivät, koska useimmat hakukehykset antavat käyttäjille rajoitetun mahdollisuuden muokata käyttöhistoriaansa.

Mikä tahansa väri, jonka haluat, kunhan se on musta

Kuitenkin Itävallasta tehty uusi tutkimus osoittaa, että yhteisöllisen suodatuksen ylivalta sisisältöperusteisessa suodatuksessa (joka pyrkii määrittämään suhteita tuotteiden välillä sen sijaan, että ottaa vain yhteisen suosion huomioon), ja muissa vaihtoehtoisissa lähestymistavoissa, kallistaa hakujärjestelmiä pitkäaikaiseen suosion harhaan, jossa ilmiselvästi suositut tulokset ohjataan loppukäyttäjille, jotka eivät todennäköisesti ole innostuneita niistä.

Tutkimus osoittaa, että käyttäjät, jotka eivät ole kiinnostuneita suosituista tuotteista, saavat “merkittävästi huonompia” suosituksia kuin käyttäjät, joilla on keskivertoinen tai korkea kiinnostus suosittuihin tuotteisiin, ja (ehkä tautologisesti) suositut tuotteet suositellaan useammin kuin epäsuositut tuotteet. Tutkijat myös toteavat, että käyttäjillä, joilla on vähäinen kiinnostus suosittuihin tuotteisiin, on usein suuremmat käyttäjäprofiilit, jotka voivat parantaa suosittelujärjestelmiä – jos järjestelmät voivat vain lopettaa “lauman” mittareiden käytön.

Vertaileva suositteluryhmien suosituksia osoittaa, että

Vertaileva suositteluryhmien suosituksia osoittaa, että “reunatapauksien” käyttäjät, jotka eivät ole kiinnostuneita valtavirta sisällöstä, ovat todellakin suuremmalla potentiaalilla sisällön kaivamiseen suosittelujärjestelmille; mutta koska nämä käyttäjät eivät mukaudu trendeihin, näyttää siltä, että se on menetetty mahdollisuus. Lähde: https://arxiv.org/pdf/2203.00376.pdf

Tutkimus tutkimus on otsikoitu Popularity Bias in Collaborative Filtering-Based Multimedia Recommender Systems, ja se on tehty tutkijoilla now-Center GmbH:stä Grazista ja Grazin teknillisestä yliopistosta.

Alueet, joita tutkitaan

Rakentamalla aiempiin tutkimuksiin, jotka tutkivat yksittäisiä sektoreita (kuten kirjasuositukset), uusi tutkimus tutkii neljää aluetta: digitaalisia kirjoja (BookCrossing-aineistoa käyttäen); elokuvia (MovieLens-aineistoa käyttäen); musiikkia (Last.fm-aineistoa käyttäen); ja animesarjoja (MyAnimeList-aineistoa käyttäen).

Tutkimus sovelsi neljää suosituinta monimediallista suosittelujärjestelmän (MMRS) yhteisöllistä suodatusalgoritmeja aineistoihin jaettu kolmeen käyttäjäryhmään sen mukaan, miten he suhtautuvat “suosittuihin” tuloksiin: LowPop, MedPop ja HighPop. Käyttäjäryhmät jaettiin 1000 samankokoiseen ryhmään, jotka perustuivat vähimpään, keskimääräiseen ja eniten suosittuihin tuloksiin.

Tutkijat kommentoivat tuloksia:

‘[Me] havaitsemme, että monimediallisen kohteen suosittelun todennäköisyys korreloi vahvasti kohteen suosiota [ja] että käyttäjät, joilla on vähäinen suositus suosittuihin tuotteisiin, saavat tilastollisesti merkittävästi huonompia suosituksia kuin käyttäjät, joilla on keskivertoinen ja korkea suositus suosittuihin tuotteisiin…

‘Tutkimuksemme osoittaa, että vaikka käyttäjillä, joilla on vähäinen kiinnostus suosittuihin tuotteisiin, on usein suuremmat käyttäjäprofiilit, he saavat silti alhaisimman suosittelun tarkin. Tämän vuoksi tulevaisuuden tutkimuksissa on pyrittävä vähentämään suosion harhaa MMRS-järjestelmissä sekä tuotetasolla että käyttäjätasolla.’

Arvioituja algoritmeja olivat kaksi K-Nearest Neighbors (KNN) -varianttia, UserKNN ja UserKNNAvg. Ensimmäinen näistä ei luo keskiarvoa kohdetiedolle ja käyttäjälle. Myös ei-negatiivinen matriisifaktorointi -versio (NMF) testattiin, sekä CoClustering-algoritmi.

Arviointiprotokolla käsitteli suosittelutehtävän ennustehaasteena, joka mitattiin tutkijoiden toimesta keskimääräisen absoluuttisen virheen (MAE) avulla, viisinkertaista ristivalidointia vastaan, joka ylittää tavallisen 80/20 -jaon koulutettujen ja testatutujen tietojen välillä.

Tulokset osoittavat lähes varman suosion harhan yhteisöllisessä suodatuksessa. Kysymys, jota voidaan perustellusti kysyä, on, onko tämä nähtävissä ongelmaksi monien miljardien dollarien arvoisille yrityksille, jotka ottavat CF:n osaksi hakualgoritmejaan.

Kaikissa neljässä tutkitussa aineistossa neljä suosituinta yhteisöllistä suodatusta suosittelua osoittaa, että suositut median kohteet ovat todennäköisemmin suositeltavissa kuin epäsuositut tarjoukset.

Kaikissa neljässä tutkitussa aineistossa neljä suosituinta yhteisöllistä suodatusta suosittelua osoittaa, että suositut median kohteet ovat todennäköisemmin suositeltavissa kuin epäsuositut tarjoukset.

Helppo tie ulos

Vaikka yhteisöllinen suodatus on yhä enemmän käytössä ainoastaan yhtenä laajemman hakualgoritmin strategian osana, sillä on vahva osuus hakusektorilla, ja sen logiikka ja potentiaalinen kannattavuus on houkuttelevasti helppo ymmärtää.

Itsessään CF siirtää tehtävän sisällön arvon arvioinnista loppukäyttäjille, ja käyttää heidän sisällön käyttöä sen arvon ja potentiaalisen houkuttelevuuden mittaamiseen muiden asiakkaiden kannalta. Vertauksena se on käytännössä “vesihanan kuohu” -kartta.

Sisältöperusteinen suodatus (CBF) on vaikeampaa, mutta se voi tarjota relevantimmat tulokset. Tietokoneen näköalalla suoritetaan lisää tutkimusta videosisällön luokittelussa ja pyrkimyksessä johdattaa alueita, ominaisuuksia ja korkean tason käsitteitä audio- ja videoanalyysin kautta elokuva- ja tv-tuotannossa.

Yksi monista tutkimushankkeista viiden viime vuoden aikana, jossa pyritään johdattamaan semanttisia ominaisuuksia elokuvien sisällöstä, jotta voidaan luoda älykkäämpiä

Yksi monista tutkimushankkeista viiden viime vuoden aikana, jossa pyritään johdattamaan semanttisia ominaisuuksia elokuvien sisällöstä, jotta voidaan luoda älykkäämpiä “vieressä olevia” suosituksia. Lähde: https://arxiv.org/pdf/1701.00199.pdf

Kuitenkin tämä on suhteellisen uusi tavoite, ja se on sidottu nykyiseen, laajempaan kamppailuun määritellä, erottaa ja hyödyntää korkean tason käsitteitä ja ominaisuuksia alueen tiedossa.

Kuka käyttää yhteisöllistä suodatusta?

Kirjoitushetkellä Netflixin usein kritisoitu suosittelumoottori on edelleen kiinni erilaisissa yhteisöllisissä suodatuslähestymistavoissa, soveltamalla erilaisia liitännäistechnologioita jatkuvissa yrityksissä luoda käyttäjäläheisempiä suosituksia.

Amazonin hakukone kehittyi varhaisesta käytöstään käyttäjäperusteisesta yhteisölliseen suodatukseen, jossa tuotteiden suosittelu perustuu enemmän asiakkaan ostohistoriaan. Luonnollisesti tämä voi johtaa erilaisiin virheisiin, kuten suodattimien kuplat tai liiallinen korostus harvojen tietojen perusteella. Jälkimmäisessä tapauksessa, jos harvinainen Amazon-asiakas tekee “epätavallisen” ostoksen, kuten oopperaradioita oopperarakkautta rakastavalle ystävälle, ei välttämättä ole riittävästi vaihtoehtoisia ostoja, jotka heijastelevat asiakkaan omia mieltymyksiä, jotta se ei vaikuttaisi omiin suosituksiin.

Yhteisöllinen suodatus on myös laajasti käytössä Facebookissa, yhdessä muiden lähestymistapojen kanssa, sekä LinkedInissä, YouTubessa ja Twitterissä.

 

Julkaistu ensimmäisen kerran 2. maaliskuuta 2022.

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai