Andersonův úhel

Používání recenzí pro vytvoření funkčního doporučovacího systému

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Pokud jste již někdy nakupovali online a divili se nesmyslnosti a neaplikovatelnosti „souvisejících položek“, které vás pronásledují během nákupního procesu a poté, už rozumíte, že populární a mainstreamové doporučovací systémy často selhávají při porozumění vztahům mezi potenciálními nákupy.

Pokud koupíte neobvyklou a málo častou položku, jako je například troubu, doporučené položky jsou pravděpodobně zbytečné, ačkoli nejhorší doporučovací systémy nezohledňují tuto skutečnost. V roce 2000, například, doporučovací systém TiVO vytvořil早jší kontroverzi v tomto sektoru, když přiřadil uživateli jiný sex, který následně snažil „zmužit“ svůj uživatelský profil výběrem válečných filmů – hrubý přístup k revizi algoritmu.

Ještě horší je, že nemusíte nic kupovat (například na Amazonu), nebo dokonce začít sledovat film, jehož popis prohlížíte na velké streamovací platformě, aby informační hladoví algoritmy doporučení začaly bloudit po špatné cestě; vyhledávání, prohlížení a kliknutí na „podrobnosti“ stačí, a tato skromná (a pravděpodobně nesprávná) informace se pravděpodobně bude opakovat v budoucích prohlíženích na platformě.

Pokus o to, aby doporučovací systém zapomněl

Někdy je možné zasáhnout: Netflix nabízí systém „palce nahoru/dolů“, který by teoreticky měl pomoci jeho algoritmům strojového učení odstranit bestimmé vložené koncepty a slova z vašeho profilu doporučení (ačkoli jeho účinnost byla zpochybněna, a zůstává mnohem snazší vytvořit personalizovaný algoritmus doporučení od začátku než odstranit nežádoucí ontologie), zatímco Amazon umožňuje odstranit tituly z vaší zákaznické historie, což by mělo snížit nežádoucí domény, které vnikly do vašich doporučení.

Hulu má podobnou funkci, zatímco HBO Max částečně ustoupil od algoritmických doporučovacích systémů, tváří v tvář jejich současným nedostatkům.

Žádné z těchto zkušeností na úrovni spotřebitele se vůbec nedotýkají široké a rostoucí kritiky „pasivních“ reklamních platforem doporučení (kde dochází k významným změnám kvůli veřejné nelibosti), nebo zápalné téma sociálních médií AI doporučení, kde stránky jako YouTube, Twitter a Facebook nadále čelí kritice za irelevantní nebo dokonce škodlivé doporučení.

Stroj nezdá se vědět, co chceme, pokud nechceme příbuznou položku, která se objevila ve vyhledávání – i když tato položka je prakticky duplikátem nebo alternativou primární položky, kterou jsme možná právě koupili, spíše než potenciální doplňkovou nebo pomocnou koupí.

Přesná doporučení s využitím recenzí

Nová výzkumná spolupráce z Číny a Austrálie nabízí novou metodu, jak řešit taková nevhodná doporučení, pomocí externích uživatelských recenzí pro lepší pochopení skutečných vztahů mezi položkami v nákupní relaci. Při testech tato architektura překonala všechny současné metody, nabízející naději pro doporučovací systémy, které mají lepší vnitřní mapu závislostí položek:

RI-GNN překonává hlavní konkurenty v přesnosti vztahů mezi položkami, přičemž funguje nejlépe na relacích s více než pěti položkami. Systém byl testován proti datasetům Pet Supplies a Movies and TV z Amazon Review Data (2018). Zdroj: https://arxiv.org/pdf/2201.12532.pdf

RI-GNN překonává hlavní konkurenty v přesnosti vztahů mezi položkami, přičemž funguje nejlépe na relacích s více než pěti položkami. Systém byl testován proti datasetům Pet Supplies a Movies and TV z Amazon Review Data (2018). Zdroj: https://arxiv.org/pdf/2201.12532.pdf

Kromě toho projekt řeší významnou výzvu spočívající v vytváření doporučení i v anonymních relacích, kde doporučovací systém nemá přístup k uživatelským podrobnostem, jako je historie nákupů, nebo uživatelské recenze předchozích nákupů.

Nová práce se nazývá Přemýšlení o adjacentských závislostech v zasedáních založených na doporučení a pochází od výzkumníků z Qilu University of Technology a Beijing Institute of Technology v Číně, RMIT University v Melbourne a Australského institutu umělé inteligence na University of Technology Sydney.

Co dál?

Hlavním úkolem zasedání založených na doporučení (SBR) je určit „další“ položku od aktuální položky, na základě jejího vypočítaného vztahu k aktuální položce. V praktických termínech by se to mohlo projevit jako seznam „Souvisejících položek“ na stránce položky pro ptákovinu na e-commerce webu.

Pokud kupujete ptákovinu, co jiného budete pravděpodobně potřebovat? No, alespoň budete potřebovat ptáka, kterého budete dávat do ní – to je skutečná závislost. Nicméně, ptákovina je součástí ontologie zboží pro domácí mazlíčky, kde nejsou prodáváni ptáci. ironicky, kočičí jídlo se nachází ve stejné ontologii, ačkoli přidání kočičí misky jako spojené doporučení pro produkt ptákoviny je falešná závislost – chybné a zavádějící spojení.

Z práce: skutečné a falešné vztahy mezi několika položkami, zobrazené vpravo jako graf položek.

Z práce: skutečné a falešné vztahy mezi několika položkami, zobrazené vpravo jako graf položek.

Jako je tomu často v architekturách strojového učení, je to výzva přesvědčit doporučovací systém, že „vzdálená“ entita (pták se vůbec neobjevuje v zboží pro domácí mazlíčky) může mít vnitřní a důležitý vztah k položce, zatímco položky, které jsou ve stejné kategorii a velmi blízké v funkcích a centrálním konceptu (jako kočičí miska), mohou být ortogonální nebo přímo proti koupi, kterou zvažujete.

Jediný způsob, jak vytvořit tyto mapy mezi „nepříbuznými“ entitami, je řešit problém pomocí crowdsourcu, protože vztahy v otázce jsou součástí lidské zkušenosti, nemohou být odhadnuty programově a jsou pravděpodobně za hranicemi konvenčních přístupů k označení datasetů, jako je Amazon Mechanical Turk.

Proto výzkumníci použili mechanismy zpracování přirozeného jazyka (NLP) k extrahování významných slov z recenzí produktů a použili frekvence z těchto analýz k vytvoření vnoření schopných „párovat“ zdánlivě vzdálené položky.

Architektura pro Review-refined Inter-item Graph Neural Network (RI-GNN).

Architektura pro Review-refined Inter-item Graph Neural Network (RI-GNN).

Architektura a data

Jak nová práce uvádí, předchozí práce podobného druhu využívaly přihlašovací historii uživatele k poskytnutí základních map. DeepCONN a RNS oba používaly tento přístup. Nicméně, toto zanedbává fakt, že uživatel nemusí mít žádnou historii recenzí, nebo žádné recenze relevantní pro konkrétní položku, která je „mimo dosah“ jeho běžných nákupních zvyklostí. Kromě toho, toto je něco jako „bílá skříňka“ přístup, protože se předpokládá, že uživatel již dostatečně interagoval s výstupem, aby vytvořil účet a přihlásil se.

Rozšířená grafická neuronová síť (GNN) navržená výzkumníky používá více oracle-driven přístup, odvozující skutečné závislosti a priori, takže, zřejmě, anonymní a odhlášený uživatel může zažít relevantnější doporučení s minimálními vstupními požadavky.

Recenze-augmentovaný systém se nazývá Review-refined Inter-item Graph Neural Network (RI-GNN). Výzkumníci otestovali jej proti dvěma datasetům z Amazonu, Zboží pro domácí mazlíčky a Filmy a TV. Ačkoli toto řeší problém dostupnosti recenzí poměrně elegantně, implementace v terénu by potřebovala najít a extrahovat vhodnou databázi recenzí. Takový zdroj dat by mohl být teoreticky cokoliv od příspěvků na sociálních sítích po odpovědi na Quoru.

Vysokouhlíkové mapování vztahů tohoto druhu by bylo navíc cenné pro řadu aplikací strojového učení beyond doporučovacích systémů. Mnoho současných projektů je omezeno nedostatkem mezidoménového a intradoménového mapování kvůli omezeným finančním prostředkům a rozsahu, zatímco komerční impuls skutečně znalého a crowdsourcového e-commerce doporučovacího systému by mohl potenciálně vyplnit tuto mezeru.

Metriky a testování

Autoři otestovali RI-GNN proti dvěma verzím každého datasetu, z nichž každý se skládá z historie nákupů uživatele a obecných recenzí produktu. Položky, které se objevily méně než pětkrát, byly odstraněny, a historie uživatele byla rozdělena do jednotek jednoho týdne. První verze datasetu zahrnovala všechny relace s více než jednou položkou, a druhá verze zahrnovala všechny relace s více než pěti položkami.

Projekt používal P@K (Přesnost) a MRR@K (Průměrná reciproční hodnota) pro jeho evaluační metriky. Rivalitní architektury testované byly: S-KNN; GRU4Rec; S-POP; STAMP; BERT4Rec; DHCN; GCE-GNN; SR-GNN; a NARM.

Rámec byl trénován v dávkách po 100 na Adam s rychlostí učení 0,001, s počtem témat nastaveným na 24 a 20, resp. pro Zboží pro domácí mazlíčky a Filmy a TV.

 

 

Poprvé publikováno 1. února 2022.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai