Взгляд Anderson

Почему ИИ не обеспечивает лучшие рекомендации продуктов

mm
Добавьте Unite.AI в избранные источники в Google

Если вы интересуетесь малоизвестными вещами, есть две причины, почему ваши поиски товаров и продуктов с большей вероятностью будут менее связаны с вашими интересами, чем интересами ваших «мейнстримовых» коллег; либо вы являетесь «монетизационным边缘 случаем», интересы которого будут удовлетворяться только в том случае, если вы также находитесь в верхних категориях экономической покупательной способности (например, продукты и услуги, связанные с «управлением богатством»); либо поисковые алгоритмы, которые вы используете, используют коллаборативную фильтрацию (CF), которая отдает предпочтение интересам большинства.

Поскольку коллаборативная фильтрация дешевле и более устоялась, чем другие потенциально более способные алгоритмы и рамки, возможно, что оба этих случая применяются.

Результаты поиска на основе CF будут отдавать приоритет элементам, которые воспринимаются как популярные среди «людей, подобных вам», насколько это лучше всего понимает хост-фреймворк, какой вы потребитель.

Если вы осторожны в предоставлении информации о профилировании данных хост-системе – например, не склонны нажимать кнопки «Нравится» в Netflix и других сервисах видеоконтента – вы, скорее всего, будете классифицированы довольно общим образом на ранних этапах взаимодействия с системой, и рекомендации, которые вы получите, будут отражать наиболее популярные тенденции.

На платформе потокового вещания это может означать рекомендацию того, что сейчас «горячо», например, реалити-шоу и документальные фильмы о убийствах, независимо от вашего интереса к ним. Аналогично для платформ рекомендаций книг, которые будут склонны предлагать текущие и недавние бестселлеры, казалось бы, произвольно.

В теории, даже пользователи, ограничивающие данные, в конечном итоге должны получить лучшие результаты от таких систем на основе того, как они используют их и что они ищут, поскольку большинство поисковых рамок предоставляют пользователям ограниченную возможность редактировать свою историю использования.

Любой цвет, который вам нравится, пока это черный

Однако, согласно новому исследованию из Австрии, доминирование коллаборативной фильтрации над контент-ориентированной фильтрацией (которая стремится определить отношения между продуктами, а не просто учитывать агрегатную популярность), и других альтернативных подходов, склоняет системы поиска к долгосрочной популярности предвзятости, где, очевидно, популярные результаты отдаются приоритет конечным пользователям, которые вряд ли будут ими увлечены.

В работе обнаружено, что пользователи, которые не интересуются популярными элементами, получают «значительно худшие» рекомендации, чем пользователи со средним или высоким интересом к популярности, и (может быть, тавтологически) что популярные элементы рекомендуются чаще, чем непопулярные элементы. Исследователи также приходят к выводу, что пользователи с низким интересом к популярным элементам имеют более крупные профили пользователей, которые потенциально могут улучшить системы рекомендаций – если только системы не могут отказаться от «стадных» метрик.

Сравнение популярности с сложностью профилей пользователей показывает, что «маргинальные» пользователи, не интересующиеся мейнстримовым контентом, на самом деле имеют больше потенциального контента для систем рекомендаций; но поскольку такие пользователи не соответствуют тенденциям, это, кажется, потерянная возможность. Источник: https://arxiv.org/pdf/2203.00376.pdf

Сравнение популярности с сложностью профилей пользователей показывает, что «маргинальные» пользователи, не интересующиеся мейнстримовым контентом, на самом деле имеют больше потенциального контента для систем рекомендаций; но поскольку такие пользователи не соответствуют тенденциям, это, кажется, потерянная возможность. Источник: https://arxiv.org/pdf/2203.00376.pdf

Работа названа Популярная предвзятость в системах рекомендаций, основанных на коллаборативной фильтрации, и исходит от исследователей из now-Center GmbH в Граце и Грацского технологического университета.

Домены, охваченные исследованием

Развивая предыдущие работы, которые изучали отдельные сектора (например, рекомендации книг), новая работа изучает четыре домена: цифровые книги (через набор данных BookCrossing); фильмы (через MovieLens); музыка (через Last.fm); и аниме (через MyAnimeList).

Исследование применило четыре популярных алгоритма коллаборативной фильтрации к наборам данных, разделенным на три группы пользователей, в зависимости от их склонности быть восприимчивыми к «популярным» результатам: LowPop, MedPop и HighPop. Группы пользователей были отфильтрованы до 1000 групп одинакового размера, на основе наименьшей, средней и наиболее вероятной склонности к популярным результатам.

Комментируя результаты, авторы заявляют:

«[Мы] обнаружили, что вероятность того, что элемент будет рекомендован, сильно коррелирует с его популярностью [и] что пользователи, которые не интересуются популярными элементами, получают статистически значимо худшие рекомендации, чем пользователи со средней или высокой склонностью к популярным элементам…

«Наши результаты показывают, что хотя пользователи с небольшим интересом к популярным элементам имеют наиболее крупные профили пользователей, они получают наименьшую точность рекомендаций. Следовательно, будущие исследования необходимы для смягчения популярной предвзятости в системах рекомендаций, как на уровне элемента, так и на уровне пользователя».

Среди оцененных алгоритмов были два варианта K-Ближайших Соседей (KNN), UserKNN и UserKNNAvg. Первый из них не генерирует среднюю оценку для целевого пользователя и элемента. Также был протестирован вариант негативной матрицы факторизации (NMF), а также алгоритм CoClustering.

Протокол оценки рассматривал задачу рекомендации как задачу прогнозирования, измеренную исследователями в терминах средней абсолютной ошибки (MAE), против протокола пятикратной перекрестной проверки, превышающей обычный деление 80/20 между обученными и тестовыми данными.

Результаты указывают на почти гарантированную популярную предвзятость при коллаборативной фильтрации. Вопрос, возможно, заключается в том, воспринимается ли это как проблема многомиллиардными компаниями, в настоящее время включая CF в свои алгоритмы поиска.

На всех четырех изученных наборах данных, по четырем популярным алгоритмам коллаборативной фильтрации, каждый результат указывает на то, что популярные медиа-элементы более вероятно будут рекомендованы, чем непопулярные предложения.

На всех четырех изученных наборах данных, по четырем популярным алгоритмам коллаборативной фильтрации, каждый результат указывает на то, что популярные медиа-элементы более вероятно будут рекомендованы, чем непопулярные предложения.

«Легкий» выход

Хотя коллаборативная фильтрация все чаще используется как только один элемент более широкой стратегии алгоритмов поиска, она имеет сильную долю в секторе поиска, и ее логика и потенциальная прибыльность привлекательно легко понять.

Сама по себе CF по сути передает задачу оценки ценности контента конечным пользователям и использует их использование контента в качестве индекса его ценности и потенциальной привлекательности для других клиентов. По аналогии, это по сути карта «водяного колокола».

Контент-ориентированная фильтрация (CBF) более сложна, но потенциально может обеспечить более релевантные результаты. В секторе компьютерного зрения в настоящее время расходуется значительное количество исследований на категоризацию видеоконтента и попытки получить области, функции и высокоуровневые понятия через анализ аудио и видео в фильмах и телевизионном контенте.

Одно из многих исследовательских проектов за последние пять лет, которые пытаются получить семантические функции из контента фильмов, чтобы сгенерировать более интеллектуальные «смежные» рекомендации. Источник: https://arxiv.org/pdf/1701.00199.pdf

Одно из многих исследовательских проектов за последние пять лет, которые пытаются получить семантические функции из контента фильмов, чтобы сгенерировать более интеллектуальные «смежные» рекомендации. Источник: https://arxiv.org/pdf/1701.00199.pdf

Однако это относительно новое начинание, и связано с текущей, более общей борьбой за количественную оценку, изоляцию и эксплуатацию высокоуровневых понятий и функций в области знаний.

Кто использует коллаборативную фильтрацию?

На момент написания этого текста, часто критикуемый движок рекомендаций Netflix остается сосредоточенным на различных подходах коллаборативной фильтрации, применяя различные смежные технологии в непрерывных попытках сгенерировать более релевантные для пользователя рекомендации.

Поисковый движок Amazon эволюционировал от его раннего принятия пользовательской коллаборативной фильтрации к методу коллаборативной фильтрации элемент-элемент, который уделяет больше внимания истории покупок клиента. Естественно, это может привести к разным типам неточностей, таким как фильтр-пузыри, или чрезмерный акцент на скудных данных. В последнем случае, если редкий клиент Amazon совершает «необычную» покупку, например, набор оперетт для друга, любящего оперу, может не быть достаточных альтернативных покупок, отражающих предпочтения клиента, чтобы предотвратить это покупку от влияния на свои собственные рекомендации.

Коллаборативная фильтрация также широко используется Facebook, в сочетании с другими подходами, и также LinkedIn, YouTube и Twitter.

 

Опубликовано впервые 2 марта 2022 г.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai