Ángulo de Anderson

Por qué la IA no proporciona mejores recomendaciones de productos

mm
Añade Unite.AI a tus fuentes preferidas en Google

Si te interesan cosas poco comunes, hay dos razones por las que tus búsquedas de artículos y productos probablemente serán menos relacionadas con tus intereses que las de tus pares “mainstream”; o eres un caso de “borde” de monetización cuyos intereses solo serán atendidos si también estás en las categorías superiores de poder adquisitivo económico (por ejemplo, productos y servicios relacionados con ‘gestión de patrimonio’); o los algoritmos de búsqueda que estás utilizando están utilizando filtrado colaborativo (CF), que favorece los intereses de la mayoría.

Dado que el filtrado colaborativo es más barato y más establecido que otros algoritmos y marcos potencialmente más capaces, es posible que ambos casos se apliquen.

Los resultados de la búsqueda basados en CF priorizarán los artículos que se perciben como populares entre “personas como tú”, según lo mejor que el marco de alojamiento pueda entender qué tipo de consumidor eres.

Si te preocupa proporcionar información de perfil de datos al sistema de alojamiento, por ejemplo, no estás inclinado a presionar los botones “Me gusta” en Netflix y otros servicios de contenido de video, es probable que seas clasificado de manera bastante genérica en tus primeras interacciones con el sistema, y las recomendaciones que recibes reflejarán las tendencias más populares.

En una plataforma de streaming, eso podría significar que se te recomiendan los programas y películas que actualmente son “calientes”, como la televisión reality y los documentales de asesinato forense, independientemente de tu interés en ellos. De manera similar, para las plataformas de recomendación de libros, que tenderán a ofrecer los best-sellers actuales y recientes, aparentemente de manera arbitraria.

En teoría, incluso los usuarios que son cautelosos con los datos deberían obtener mejores resultados de dichos sistemas con el tiempo, basándose en la forma en que los utilizan y las cosas que buscan, ya que la mayoría de los marcos de búsqueda dan a los usuarios una capacidad limitada para editar su historial de uso.

Cualquier que te guste, siempre y cuando sea negro

Sin embargo, según un nuevo estudio de Austria, la supremacía del filtrado colaborativo sobre filtrado basado en contenido (que busca definir relaciones entre productos en lugar de simplemente tener en cuenta la popularidad agregada), y otros enfoques alternativos, inclina los sistemas de búsqueda hacia un sesgo de popularidad a largo plazo, donde los resultados obviamente populares se promocionan a los usuarios finales que es poco probable que se entusiasmen con ellos.

El documento encuentra que los usuarios que no están interesados en artículos populares reciben ‘significativamente peores’ recomendaciones que los usuarios con interés medio o alto en la popularidad, y (quizás tautológicamente) que los artículos populares se recomiendan con más frecuencia que los artículos no populares. Los investigadores también concluyen que los usuarios con poco interés en artículos populares tienden a tener perfiles de usuario más grandes que podrían potencialmente mejorar los sistemas de recomendación, si solo los sistemas pudieran superar su adicción a las métricas de “manada”.

Comparar la popularidad con la complejidad de los perfiles de usuario muestra que los usuarios 'marginados' desinteresados en el contenido mainstream tienen más potencial de contenido para que los sistemas de recomendación lo exploren; pero como tales usuarios no se ajustan a las tendencias, parece ser una oportunidad perdida. Fuente: https://arxiv.org/pdf/2203.00376.pdf

Comparar la popularidad con la complejidad de los perfiles de usuario muestra que los usuarios ‘marginados’ desinteresados en el contenido mainstream tienen más potencial de contenido para que los sistemas de recomendación lo exploren; pero como tales usuarios no se ajustan a las tendencias, parece ser una oportunidad perdida. Fuente: https://arxiv.org/pdf/2203.00376.pdf

El documento se titula Sesgo de popularidad en sistemas de recomendación de multimedia basados en filtrado colaborativo, y proviene de investigadores de now-Center GmbH en Graz, y la Universidad Técnica de Graz.

Domínios cubiertos

Basándose en trabajos anteriores que estudiaron sectores individuales (como recomendaciones de libros), el nuevo documento examina cuatro dominios: libros digitales (a través del conjunto de datos BookCrossing); películas (a través de MovieLens); música (a través de Last.fm); y animes (a través de MyAnimeList).

El estudio aplicó cuatro algoritmos de recomendación de multimedia colaborativa (MMRS) populares contra conjuntos de datos divididos en tres grupos de usuarios, según su inclinación a ser receptivos a resultados ‘populares’: LowPop, MedPop y HighPop. Los grupos de usuarios se filtraron para tener 1000 grupos de tamaño igual, según la menor, promedio y mayor probabilidad de favorecer resultados ‘populares’.

Al comentar sobre los resultados, los autores afirman:

‘[Encontramos] que la probabilidad de que un artículo de multimedia sea recomendado se correlaciona fuertemente con la popularidad del artículo [y] que los usuarios con poca inclinación a la popularidad (LowPop) reciben recomendaciones de multimedia significativamente peores que los usuarios con inclinación media (MedPop) y alta (HighPop) a artículos populares…

‘Nuestros resultados demuestran que aunque los usuarios con poco interés en artículos populares tienden a tener los perfiles de usuario más grandes, reciben la menor precisión de recomendación. Por lo tanto, se necesita investigación futura para mitigar el sesgo de popularidad en MMRS, tanto a nivel de artículo como de usuario.’

Entre los algoritmos evaluados se encontraban dos variantes de K-Nearest Neighbors (KNN), UserKNN y UserKNNAvg. El primero de ellos no genera una calificación promedio para el usuario y el artículo objetivo. También se probó una variante de factorización de matrices no negativas (NMF), junto con un algoritmo de CoClustering.

El protocolo de evaluación consideró la tarea de recomendación como un desafío de predicción, medido por los investigadores en términos de error absoluto medio (MAE), contra un protocolo de validación cruzada de cinco pliegues que supera la división habitual de 80/20 entre datos de entrenamiento y de prueba.

Los resultados indican una casi garantía de sesgo de popularidad bajo filtrado colaborativo. La pregunta, arguyendo, es si esto se percibe como un problema por las empresas de varios miles de millones de dólares que actualmente incorporan CF en sus algoritmos de búsqueda.

A través de los cuatro conjuntos de datos estudiados sobre cuatro recomendaciones de filtrado colaborativo populares, cada resultado indica que los artículos de medios populares son más propensos a ser recomendados que las ofertas no populares.

A través de los cuatro conjuntos de datos estudiados sobre cuatro recomendaciones de filtrado colaborativo populares, cada resultado indica que los artículos de medios populares son más propensos a ser recomendados que las ofertas no populares.

La ‘salida fácil’

Aunque el filtrado colaborativo se utiliza cada vez más como solo una parte de una estrategia de algoritmo de búsqueda más amplia, tiene una participación importante en el sector de la búsqueda, y su lógica y rentabilidad potencial es atractivamente fácil de entender.

En sí mismo, CF básicamente descarga la tarea de evaluar el valor del contenido a los usuarios finales, y utiliza su adopción del contenido como un índice de su valor y atractivo potencial para otros clientes. Por analogía, es esencialmente un mapa de ‘rumores de agua fresca’.

El filtrado basado en contenido (CBF) es más difícil, pero podría potencialmente proporcionar resultados más relevantes. En el sector de la visión por computadora, actualmente se está invirtiendo una gran cantidad de investigación en categorizar el contenido de video y intentar derivar dominios, características y conceptos de alto nivel a través del análisis de audio y video en la salida de películas y televisión.

Uno de muchos proyectos de investigación de los últimos cinco años que intenta derivar características semánticas del contenido de las películas, con el fin de generar recomendaciones 'adyacentes' más inteligentes. Fuente: https://arxiv.org/pdf/1701.00199.pdf

Uno de muchos proyectos de investigación de los últimos cinco años que intenta derivar características semánticas del contenido de las películas, con el fin de generar recomendaciones ‘adyacentes’ más inteligentes. Fuente: https://arxiv.org/pdf/1701.00199.pdf

Sin embargo, esto es una búsqueda relativamente naciente, y está ligada a la lucha actual, más general, para cuantificar, aislar y explotar conceptos y características de alto nivel en el conocimiento de dominio.

¿Quién utiliza el filtrado colaborativo?

En el momento de escribir, el motor de recomendación de Netflix, a menudo criticado, sigue centrado en varios enfoques de filtrado colaborativo, aplicando una variedad de tecnologías auxiliares en intentos continuos de generar recomendaciones más relevantes para el usuario.

El motor de búsqueda de Amazon evolucionó desde su adopción temprana del filtrado colaborativo basado en el usuario hasta un método de filtrado colaborativo de artículo a artículo, que pone mayor énfasis en el historial de compras del cliente. Naturalmente, esto puede conducir a diferentes tipos de inexactitud, como burbujas de filtro, o un énfasis excesivo en datos escasos. En el último caso, si un cliente infrecuente de Amazon hace una compra ‘inusual’, como un conjunto de operetas para un amigo amante de la ópera, es posible que no haya compras alternativas suficientes que reflejen las preferencias del cliente para evitar que esta compra se convierta en una influencia en sus propias recomendaciones.

El filtrado colaborativo también se utiliza ampliamente por Facebook, en conjunto con otros enfoques, y también por LinkedIn, YouTube y Twitter.

 

Publicado por primera vez el 2 de marzo de 2022.

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai