Angolo di Anderson

Un sistema di raccomandazione di anime basato solo su immagini sviluppato con l’intelligenza artificiale

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

I ricercatori del Regno Unito hanno utilizzato reti neurali per sviluppare un sistema di raccomandazione per incontri di dating online basato interamente su immagini, che tiene conto solo dell’attrazione tra due utenti per le foto dei loro profili (piuttosto che le informazioni del profilo come lavoro, età, ecc.) e hanno scoperto che supera sistemi meno “superficiali” nel ottenere una corrispondenza precisa.

Il sistema risultante si chiama Temporal Image-Based Reciprocal Recommender (TIRR) e utilizza Reti Neurali Ricorrenti (RNN) per interpretare la predilezione storica di un utente per i volti che incontra mentre cerca potenziali corrispondenze.

L’articolo si intitola – forse in modo scoraggiante – Le foto sono tutto ciò di cui hai bisogno per la raccomandazione reciproca nel dating online e proviene da due ricercatori dell’Università di Bristol, migliorando notevolmente un sistema simile (chiamato ImRec) rilasciato dalla stessa squadra nel 2020.

Nelle prove, il sistema ha ottenuto un’accuratezza di stato dell’arte nella sua capacità di prevedere corrispondenze reciproche tra gli utenti, migliorando non solo il lavoro dei ricercatori del 2020, ma anche altri sistemi di raccomandazione basati su contenuti che tengono conto di informazioni più dettagliate e basate su testo nei profili di dating.

Dataset di dating del mondo reale

TIRR è stato addestrato con informazioni utente fornite da un servizio di dating online anonimo con “diversi milioni di utenti registrati”, che consente agli utenti di comunicare tra loro solo una volta che ciascuno ha “mi piace” il profilo dell’altro. Il subset di dati utilizzato includeva 200.000 soggetti, divisi equamente tra uomini e donne, e circa 800.000 preferenze espresse dagli utenti in tutti i profili di dating.

Dal momento che il servizio di dating anonimo che fornisce i dati supporta solo corrispondenze eterosessuali, solo le corrispondenze uomo/donna sono state coperte nella ricerca.

TIRR migliora i progetti di sistemi di raccomandazione reciproca (RRS) in questo campo calcolando direttamente la probabilità di una corrispondenza tra due profili, basandosi solo sulle immagini del profilo. I sistemi precedenti prevedevano invece due preferenze unidirezionali e le aggregavano per ottenere una previsione.

I ricercatori hanno escluso gli utenti che erano stati rimossi dal servizio di dating (per qualsiasi motivo, compreso il fatto di essersene andati volontariamente) e hanno escluso i profili che non includevano foto basate su volti.

Le storie degli utenti sono state limitate a un anno indietro, per evitare potenziali anomalie che potrebbero verificarsi mentre il sito di dating modificava i suoi algoritmi nel tempo. Sono state inoltre limitate a un massimo di 15 preferenze dell’utente, poiché queste sono state dimostrate come sufficienti per provare il design del modello, mentre l’uso più estensivo delle preferenze degradava le prestazioni e aumentava i tempi di addestramento.

Inoltre, alcuni degli utenti più appassionati o a lungo termine avevano storie con migliaia di preferenze, che avrebbero potuto rischiare di alterare il peso delle caratteristiche ottenute e prolungare ulteriormente i tempi di addestramento.

Rete Siamese

TIRR è formulato utilizzando una rete Siamese, tipicamente utilizzata per l’apprendimento “one-shot”.

La rete è stata addestrata utilizzando l’entropia cross binaria, una funzione di perdita comune nelle reti neurali, e una che i ricercatori hanno trovato dare risultati superiori rispetto alla perdita contrastiva. Quest’ultima è più efficace nei sistemi che valutano la parità tra due volti, ma poiché questo non è l’obiettivo di TIRR, si tratta di un approccio che si esegue male in questo contesto.

È necessario che il sistema conservi e costruisca informazioni che sviluppa mentre l’addestramento si ripete molte volte sui dati, e la rete Siamese in TIRR utilizza una rete LSTM (Long Term Short-Term Memory) per prendere queste decisioni e assicurarsi che le caratteristiche ritenute rilevanti non vengano scartate ad hoc mentre la struttura costruisce le sue intuizioni.

I ricercatori hanno scoperto che la rete si addestrava molto lentamente quando tutti i dati venivano inseriti e successivamente hanno diviso l’addestramento in tre fasi utilizzando tre subset diversi dei dati. C’è anche un vantaggio aggiuntivo in questo, poiché gli esperimenti del 2020 avevano già dimostrato che l’addestramento dei set di dati maschili e femminili separatamente migliora le prestazioni di un sistema di raccomandazione reciproca.

Test

Per valutare le prestazioni di TIRR, i ricercatori hanno tenuto da parte una porzione dei dati ottenuti e l’hanno eseguita attraverso il sistema completamente convergente. Tuttavia, poiché il sistema è abbastanza innovativo, non ci sono sistemi precedenti direttamente analoghi con cui poterlo confrontare.

Pertanto, i ricercatori hanno stabilito prima una curva ROC (Receiver Operating Characteristic) di base per la rete Siamese, prima di utilizzare l’Uniform Manifold Approximation and Projection for Dimensionality Reduction (UMAP) per ridurre i vettori a 128 dimensioni per una facile visualizzazione, al fine di stabilire un flusso coerente di “mi piace” e “non mi piace”.

TIRR è stato testato contro il filtering collaborativo e i sistemi basati su contenuti con un ambito simile, inclusi il lavoro precedente dei ricercatori ImRec (vedi sopra) e RECON, un RRS del 2010, nonché gli algoritmi di filtering collaborativo RCF (un sistema di raccomandazione di dating del 2015 basato sul contenuto testuale dei profili di dating) e LFRR (un progetto simile del 2019).

In tutti i casi, TIRR è stato in grado di offrire una maggiore accuratezza, sebbene solo marginalmente rispetto a LFRR, possibilmente indicando fattori di correlazione tra il contenuto testuale dei profili e il livello percepito di attrattiva dei soggetti dei profili.

La quasi-parità tra TIRR basato su immagini e LFRR più basato su testo consente almeno due possibilità: che la percezione degli utenti dell’attrattiva visiva sia influenzata dal contenuto testuale dei profili; o che il contenuto testuale riceva maggiore attenzione e approvazione di quanto potrebbe essere accaduto se la foto associata non fosse stata percepita come attraente.

Per ovvi motivi, il team di ricerca non è in grado di rilasciare il set di dati o il codice sorgente per TIRR, ma incoraggia altri team a duplicare e confermare il loro approccio.

n.b Le immagini utilizzate nell’illustrazione principale sono di thispersondoesnotexist.com.

Scrittore di apprendimento automatico, specialista nel dominio della sintesi di immagini umane. Ex capo del contenuto di ricerca presso Metaphysic.ai, fino alla sua dissoluzione in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai