Andersonův úhel

Systém doporučení partnera založený pouze na obrazech pomocí umělé inteligence

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Výzkumníci z Velké Británie použili neuronové sítě k vývoji systému doporučení partnerů pro online seznamky, který bere v úvahu pouze to, zda se dva uživatelé navzájem líbí na fotografiích (a nikoliv informace z profilu, jako je zaměstnání, věk apod.) a zjistili, že tento systém je přesnější než méně „povrchový“ systém.

Výsledný systém se jmenuje Temporal Image-Based Reciprocal Recommender (TIRR) a používá rekurentní neuronové sítě (RNN) k interpretaci historie uživatelova preference pro obličeje, se kterými se setká při procházení potenciálních partnerů.

Článek má název – možná zklamáním – Fotografie jsou vše, co potřebujete pro vzájemné doporučení v online seznamkách, a pochází od dvou výzkumníků z Univerzity v Bristolu, kteří významně vylepšili podobný systém (zvaný ImRec) vydaný stejným týmem v roce 2020.

V testech systém dosáhl špičkové přesnosti ve své schopnosti předpovídat vzájemné zápasy mezi uživateli, a to nejenom ve srovnání s prací výzkumníků z roku 2020, ale také s jinými systémy doporučení založenými na obsahu, které berou v úvahu podrobnější, textové informace v profilech uživatelů.

Reálný dataset pro online seznamky

TIRR byl trénován na uživatelských datech poskytnutých neznámou „populární“ online seznamkou se „několika miliony registrovaných uživatelů“, která umožňuje uživatelům komunikovat pouze tehdy, pokud si obě strany „líbí“ profil druhé strany. Použité podmnožina dat zahrnovala 200 000 subjektů, rozdělených rovnoměrně mezi muže a ženy, a přibližně 800 000 uživatelsky vyjádřených preferencí napříč všemi profily.

Pokud anonymní seznamka poskytující data podporuje pouze heterosexuální zápasy, byly v rámci výzkumu pokryty pouze zápasy mezi muži a ženami.

TIRR vylepšuje předchozí systémy vzájemného doporučení (RRS) v tomto oboru tím, že přímo vypočítává pravděpodobnost zápasu mezi dvěma profily, a to pouze na základě profilových fotografií. Předchozí systémy místo toho předpovídaly dvě jednosměrné preference a poté je agregovaly, aby získaly předpověď.

Výzkumníci vyloučili uživatele, kteří byli odstraněni ze seznamky (z jakéhokoli důvodu, včetně dobrovolného odchodu), a vyloučili profily, které neobsahovaly fotografie obličeje.

Historie uživatelů byly omezeny na jeden rok zpět, aby se zabránilo potenciálním anomáliím, které by mohly nastat, pokud by seznamka měnila své algoritmy v průběhu času. Byly také omezeny na maximum 15 uživatelských preferencí, protože se prokázalo, že jsou dostatečné pro prokázání návrhu modelu, zatímco rozsáhlejší použití preferencí zhoršovalo výkon a prodlužovalo dobu trénování.

Kromě toho měli někteří z více aktivních nebo dlouhodobých uživatelů historii s tisíci preferencemi, které by mohly ohrozit váhu získaných funkcí a dále prodloužit dobu trénování.

Siamese síť

TIRR je formulován pomocí Siamese sítě, která se obvykle používá pro ‘one-shot’ učení.

Šablona Siamese sítě, kde paralelní konvoluční neuronové sítě (CNN) sdílejí váhy, ale ne data. Sdílejí také funkci ztráty odvozenou z výstupů každé CNN a označení ground truth.

Šablona Siamese sítě, kde paralelní konvoluční neuronové sítě (CNN) sdílejí váhy, ale ne data. Sdílejí také funkci ztráty odvozenou z výstupů každé CNN a označení ground truth. Source: https://arxiv.org/pdf/2108.11714.pdf

Síť byla trénována pomocí binární cross-entropie, běžné funkce ztráty v neuronových sítích, a výzkumníci zjistili, že poskytuje lepší výsledky ve srovnání s kontrastivní ztrátou. Ta je nejúčinnější ve systémech, které hodnotí paritu mezi dvěma obličeji, ale jelikož toto není cílem TIRR, je to přístup, který v tomto kontextu funguje špatně.

Je nezbytné, aby systém uchovával a rozvíjel informace, které vyvíjí během iterací trénování, a Siamese síť v TIRR používá LSTM (Long Term Short-Term Memory) síť, aby činila tato rozhodnutí a zajistila, že funkce považované za relevantní nejsou odstraněny ad hoc, jakmile rámec buduje své poznatky.

Konkrétní architektura Siamese sítě pro TIRR.

Konkrétní architektura Siamese sítě pro TIRR.

Výzkumníci zjistili, že síť se trénovala velmi pomalu, když byl zadán celý datový soubor, a následně rozdělili trénování do tří fází pomocí tří různých podmnožin dat. Existuje určitá výhoda v tom, že výzkumníci v roce 2020 již prokázali, že trénování mužských a ženských dat samostatně zlepšuje výkon systému vzájemného doporučení.

Rozdělení samostatných trénovacích relací pro Siamese síť TIRR.

Rozdělení samostatných trénovacích relací pro Siamese síť TIRR.

Testování

Pro vyhodnocení výkonu TIRR výzkumníci ponechali část získaných dat stranou a provedli je skrze plně konvergovanou síť. Nicméně, jelikož je systém poměrně nový, neexistují žádné přímo analogické předchozí systémy, se kterými by se mohl srovnávat.

Výzkumníci proto nejprve stanovili základnu pro křivku přijímací operace (ROC) pro Siamese síť, a poté použili Uniform Manifold Approximation and Projection for Dimensionality Reduction (UMAP) ke zmenšení 128-rozměrných vektorů pro snadnou vizualizaci, aby stanovili soudržný tok „líbí se“ a „nelíbí se“.

Vlevo, ROC Siamese sítě jako základna výkonu; vpravo, UMAP vizualizace ukazuje 'líbí se' v červené, 'nelíbí se' v černé.

Vlevo, ROC Siamese sítě jako základna výkonu; vpravo, UMAP vizualizace ukazuje ‘líbí se’ v červené, ‘nelíbí se’ v černé.

TIRR byl testován proti spolupráci filtrování a systémem založeným na obsahu se stejným rozsahem, včetně předchozí práce výzkumníků ImRec (viz výše), a RECON, RRS z roku 2010, a také algoritmy spolupráce filtrování RCF (systém doporučení založený na textovém obsahu profilů z roku 2015) a LFRR (podobný projekt z roku 2019).

Všechny případy TIRR byly schopny nabídnout vyšší přesnost, i když pouze marginálně ve srovnání s LFRR, což naznačuje, že existují korelační faktory mezi textovým obsahem profilů a vnímanou úrovní atraktivity subjektů na profilech.

Skoro rovnost mezi image-založeným TIRR a více text-založeným LFRR umožňuje alespoň dvě možnosti: že uživatelé vnímají vizuální atraktivitu ovlivněnou textovým obsahem profilů; nebo že textový obsah dostává větší pozornost a schválení, než by se stalo, pokud by spojená fotografie nebyla vnímána jako atraktivní.

Pro zřejmé důvody výzkumný tým není schopen zveřejnit datový soubor nebo zdrojový kód pro TIRR, ale povzbuzují ostatní týmy, aby duplikovali a potvrdili jejich přístup.

 

n.b Obrázky použité v hlavní ilustraci jsou z thispersondoesnotexist.com.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai