Kąt Andersona

System rekomendacji partnerów oparty wyłącznie na obrazach przy użyciu sztucznej inteligencji

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Naukowcy z Wielkiej Brytanii wykorzystali sieci neuronowe do opracowania systemu rekomendacji partnerów opartego wyłącznie na zdjęciach, który bierze pod uwagę tylko to, czy dwa użytkownicy są przyciągnięci przez zdjęcia siebie nawzajem (zamiast informacji z profilu, takich jak praca, wiek itp.), i stwierdzili, że system ten przewyższa mniej “płytkie” systemy w kwestii uzyskania dokładnego dopasowania.

Wynikowy system nosi nazwę Temporal Image-Based Reciprocal Recommender (TIRR) i wykorzystuje sieci neuronowe rekurencyjne (RNN) do interpretacji historycznej preferencji użytkownika dla twarzy, które spotyka podczas przeglądania potencjalnych partnerów.

Artykuł nosi tytuł – być może zniechęcająco – Zdjęcia to wszystko, czego potrzebujesz do wzajemnej rekomendacji w randkach online, i pochodzi od dwóch naukowców z Uniwersytetu w Bristolu, znacznie poprawiając podobny system (zwanego ImRec) wydany przez tę samą grupę w 2020 roku.

W testach system osiągnął najwyższą dokładność w swojej zdolności do przewidywania wzajemnych dopasowań między użytkownikami, poprawiając nie tylko pracę naukowców z 2020 roku, ale także inne systemy rekomendacji oparte na zawartości, które biorą pod uwagę bardziej szczegółowe, tekstowe informacje w profilach randkowych.

Real World Dating Dataset

TIRR został opracowany przy użyciu informacji użytkowników dostarczonych przez anonimową “popularną” usługę randkową z “kilku milionami zarejestrowanych użytkowników”, która pozwala użytkownikom na komunikację tylko wtedy, gdy obie strony “polubiły” profil drugiej strony. Podzbiór danych obejmował 200 000 osób, podzielonych równo między mężczyzn i kobiety, oraz około 800 000 preferencji wyrażonych przez użytkowników we wszystkich profilach randkowych.

Ponieważ anonimowa usługa randkowa dostarczająca dane obsługuje tylko heteroseksualne dopasowania, w badaniu uwzględniono tylko pary mężczyzna/kobieta.

TIRR poprawia poprzednie projekty systemów rekomendacji wzajemnej (RRS) w tej dziedzinie, bezpośrednio obliczając prawdopodobieństwo dopasowania między dwoma profilami, opierając się wyłącznie na zdjęciach profilowych. Poprzednie systemy zamiast tego przewidywały dwa jednokierunkowe preferencje, a następnie agregowały je, aby uzyskać przewidywanie.

Naukowcy wykluczyli użytkowników, którzy zostali usunięci z usługi randkowej (z jakiegokolwiek powodu, w tym dobrowolnego opuszczenia), oraz profile, które nie zawierały zdjęć twarzy.

Historie użytkowników zostały ograniczone do jednego roku wstecz, aby uniknąć potencjalnych anomalii, które mogłyby wystąpić, gdy strona randkowa modyfikowała swoje algorytmy w czasie. Historie zostały również ograniczone do maksymalnie 15 preferencji użytkownika, ponieważ okazało się, że są one wystarczające do udowodnienia projektu modelu, podczas gdy bardziej obszerna preferencja pogarszała wyniki i zwiększała czas treningu.

Ponadto niektórzy bardziej zaangażowani lub długoterminowi użytkownicy mieli historie z tysiącami preferencji, co mogłoby ryzykować przewagę uzyskanych cech i dalsze prolongowanie czasu treningu.

Siamese Network

TIRR jest sformułowany przy użyciu sieci Siamese, zwykle używanej do ‘uczenia się jednorazowego’.

Szablon sieci Siamese, gdzie równoległe sieci neuronowe współdzielą wagi, ale nie dane. Współdzielą również funkcję straty pochodzącą z wyjść każdej sieci neuronowej oraz etykietę prawdy.

Szablon sieci Siamese, gdzie równoległe sieci neuronowe współdzielą wagi, ale nie dane. Współdzielą również funkcję straty pochodzącą z wyjść każdej sieci neuronowej oraz etykietę prawdy.  Źródło: https://arxiv.org/pdf/2108.11714.pdf

Sieć została opracowana przy użyciu binarnej entropii krzyżowej, powszechnej funkcji straty w sieciach neuronowych, i okazało się, że daje lepsze wyniki w porównaniu z kontrastową stratą. Ostatnia jest najbardziej skuteczna w systemach, które oceniają równość między dwiema twarzami, ale ponieważ nie jest to cel TIRR, jest to podejście, które wykonuje słabo w tym kontekście.

Wymaga to, aby system utrzymywał i rozwijał informacje, które rozwija podczas wielokrotnych iteracji nad tymi samymi danymi, a sieć Siamese w TIRR wykorzystuje sieć LSTM (pamięć krótkotrwała i długotrwała), aby podejmować te decyzje i zapewnić, że cechy uznane za istotne nie są odrzucane ad hoc, gdy ramy budują swoje spostrzeżenia.

Konkretna architektura sieci Siamese dla TIRR.

Konkretna architektura sieci Siamese dla TIRR.

Naukowcy stwierdzili, że sieć trenowała się bardzo wolno, gdy wszystkie dane zostały wprowadzone, i następnie podzielili trening na trzy etapy przy użyciu trzech różnych podzbiorów danych. Istnieje pewna dodatkowa zaleta w tym, ponieważ doświadczenia z 2020 roku już wykazały, że trenowanie danych męskich i żeńskich oddzielnie poprawia wyniki systemu rekomendacji wzajemnej.

Rozbicie oddzielnych sesji treningowych dla sieci Siamese TIRR.

Rozbicie oddzielnych sesji treningowych dla sieci Siamese TIRR.

Testowanie

Aby ocenić wyniki TIRR, naukowcy zachowali część uzyskanych danych i przeprowadzili je przez w pełni sformatowany system. Jednakże, ponieważ system jest dość nowy, nie ma bezpośrednio analogicznych poprzednich systemów, z którymi mógłby być porównany.

Dlatego naukowcy najpierw ustalili krzywą charakterystyki odbiornika (ROC) dla sieci Siamese, a następnie wykorzystali Uniform Manifold Approximation and Projection for Dimensionality Reduction (UMAP), aby zredukować 128-wymiarowe wektory do łatwej wizualizacji, w celu ustalenia spójnego przepływu polubień i niepolubień.

Po lewej, ROC sieci Siamese jako wskaźnik wydajności; po prawej, wizualizacja UMAP pokazuje 'polubienia' w czerwonym kolorze, 'niepolubienia' w kolorze czarnym.

Po lewej, ROC sieci Siamese jako wskaźnik wydajności; po prawej, wizualizacja UMAP pokazuje ‘polubienia’ w czerwonym kolorze, ‘niepolubienia’ w kolorze czarnym.

TIRR został przetestowany w porównaniu z filtrowaniem współpracy i systemami opartymi na zawartości o podobnym zakresie, w tym poprzednią pracę naukowców ImRec (patrz powyżej), oraz RECON, system RRS z 2010 roku, a także algorytmy filtrowania współpracy RCF (system randkowy z 2015 roku oparty na zawartości tekstowej profili randkowych) i LFRR (podobny projekt z 2019 roku).

W wszystkich przypadkach TIRR był w stanie zaoferować lepszą dokładność, choć tylko nieznacznie w porównaniu z LFRR, co może wskazywać na korelujące czynniki między zawartością tekstową profili a postrzeganą atrakcyjnością zdjęć profilowych.

Prawie równość między opartym na obrazach TIRR a bardziej opartym na tekście LFRR pozwala na co najmniej dwie możliwości: że postrzeganie atrakcyjności wizualnej przez użytkowników jest wpływane przez zawartość tekstową profili; lub że zawartość tekstowa otrzymuje większą uwagę i aprobatę, niż mogłoby to nastąpić, gdyby powiązane zdjęcie nie było postrzegane jako atrakcyjne.

Z oczywistych powodów zespół badawczy nie jest w stanie udostępnić zestawu danych ani kodu źródłowego dla TIRR, ale zachęca inne zespoły do duplikowania i potwierdzania ich podejścia.

 

n.b Zdjęcia użyte w głównej ilustracji pochodzą z thispersondoesnotexist.com.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai