Взгляд Anderson
Система рекомендации партнеров на основе изображений, созданная с помощью ИИ

Исследователи из Великобритании использовали нейронные сети для разработки полностью основанной на изображениях системы рекомендации для онлайн-знакомств, которая учитывает только то, привлекают ли пользователи друг друга по фотографиям (а не информацию о профиле, такую как работа, возраст и т. д.), и обнаружили, что она превосходит менее “поверхностные” системы в плане получения точного совпадения.
Результатом стала система под названием Temporal Image-Based Reciprocal Recommender (TIRR), которая использует рекуррентные нейронные сети (RNN) для интерпретации исторической склонности пользователя к лицам, которые он встречает при просмотре потенциальных партнеров.
Статья называется – возможно, обескураживающе – Фотографии – все, что вам нужно для взаимной рекомендации в онлайн-знакомствах, и написана двумя исследователями из Университета Бристоля, значительно улучшая подобную систему (называемую ImRec), выпущенную той же командой в 2020 году.
В испытаниях система показала высочайшую точность в своей способности предсказывать взаимные совпадения между пользователями, улучшая не только работу исследователей 2020 года, но и другие системы рекомендации на основе содержания, учитывающие более подробную, текстовую информацию в профилей знакомств.
Набор данных реальных онлайн-знакомств
TIRR была обучена на информации пользователей, предоставленной неизвестным “популярным” онлайн-сервисом знакомств с “несколькими миллионами зарегистрированных пользователей”, который позволяет пользователям общаться друг с другом только после того, как каждый из них “лайкнул” профиль другого. Подмножество использованных данных включало 200 000 субъектов, разделенных поровну между мужчинами и женщинами, и примерно 800 000 выраженных пользователем предпочтений по всем профилям знакомств.
Поскольку анонимный сервис знакомств, предоставляющий данные, поддерживает только гетеросексуальные совпадения, в исследовании были рассмотрены только мужские и женские совпадения.
TIRR улучшает предыдущие системы взаимной рекомендации (RRS) в этой области,直接 вычисляя вероятность совпадения между двумя профилями, основанную исключительно на изображениях профилей. Предыдущие системы вместо этого предсказывали два односторонних предпочтения, а затем объединяли их, чтобы получить прогноз.
Исследователи исключили пользователей, удаленных из сервиса знакомств (по любой причине, включая добровольный уход), и исключили профили, не содержащие фотографий с лицами.
Истории пользователей были ограничены одним годом назад, чтобы избежать потенциальных аномалий, которые могли бы возникнуть, поскольку сайт знакомств изменял свои алгоритмы с течением времени. Они также были ограничены максимально 15 предпочтениями пользователя, поскольку они были признаны достаточными для доказательства конструкции модели, в то время как более широкое использование предпочтений ухудшало производительность и увеличивало время обучения.
Кроме того, некоторые более активные или долгосрочные пользователи имели истории с тысячами предпочтений, которые могли бы рисковать сместить вес полученных функций и еще больше продлить время обучения.
Сиамская сеть
TIRR сформулирована с помощью сиамской сети, обычно используемой для ‘одношагового’ обучения.

Шаблон сиамской сети, где параллельные сверточные нейронные сети (CNN) имеют общие веса, но не данные. Они также имеют общую функцию потерь, полученную из выходов каждой CNN, и метку основной истины. Источник: https://arxiv.org/pdf/2108.11714.pdf
Сеть была обучена с помощью бинарной кросс-энтропии, обычной функции потерь в нейронных сетях, и одной, которую исследователи обнаружили, дающей лучшие результаты по сравнению с контрастивной потерей. Последняя наиболее эффективна в системах, оценивающих паритет между двумя лицами, но поскольку это не является целью TIRR, это подход, который работает плохо в этом контексте.
Для системы необходимо сохранять и развивать информацию, которую она разрабатывает при многократном повторении обучения над одними и теми же данными, и сиамская сеть в TIRR использует LSTM (долгосрочная краткосрочная память) сеть для принятия этих решений и для обеспечения того, чтобы функции, признанные актуальными, не были выбрасываны случайно, поскольку框架 развивает свои идеи.
Исследователи обнаружили, что сеть обучалась очень медленно, когда все данные вводились, и в результате разделили обучение на три этапа, используя три разных подмножества данных. Есть некоторое дополнительное преимущество в этом, поскольку эксперименты исследователей 2020 года уже продемонстрировали, что обучение мужских и женских наборов данных отдельно улучшает производительность системы взаимной рекомендации.

Разбивка отдельных сессий обучения для сиамской сети TIRR.
Тестирование
Чтобы оценить производительность TIRR, исследователи сохранили часть полученных данных и прошли через полностью сформированную систему. Однако, поскольку система довольно новая, нет直接 аналогичных предыдущих систем, с которыми можно было бы ее сравнить.
Следовательно, исследователи сначала установили базовую кривую оперативной характеристики приемника (ROC) для сиамской сети, а затем использовали Uniform Manifold Approximation и Projection для уменьшения размерности (UMAP) для уменьшения 128-мерных векторов для легкой визуализации, чтобы установить связный поток лайков и дизлайков.

Слева, ROC сиамской сети в качестве базового индикатора производительности; справа, визуализация UMAP показывает ‘лайки’ красным, ‘дизлайки’ черным.
TIRR была протестирована на совместном фильтровании и системах на основе содержания с аналогичным объемом, включая предыдущую работу исследователей ImRec (см. выше), и RECON, RRS из 2010 года, а также алгоритмы совместного фильтрования RCF (система рекомендации знакомств 2015 года на основе текстового содержания профилей знакомств) и LFRR (аналогичный проект 2019 года).

Во всех случаях TIRR смогла предложить лучшую точность, хотя и только незначительно по сравнению с LFRR, что, возможно, указывает на коррелирующие факторы между текстовым содержанием профилей и воспринимаемым уровнем привлекательности фотографий профилей.
Почти полное совпадение между основанной на изображениях TIRR и более текстовой LFRR позволяет для как минимум двух возможностей: либо восприятие пользователем визуальной привлекательности влияет на текстовое содержание профилей; либо текстовое содержание получает больше внимания и одобрения, чем могло бы произойти, если бы связанная с ним фотография не была воспринята как привлекательная.
По очевидным причинам исследовательская команда не может выпустить набор данных или исходный код для TIRR, но поощряет другие команды дублировать и подтверждать их подход.
n.b Изображения, использованные в основной иллюстрации, взяты с thispersondoesnotexist.com.













