Ángulo de Anderson
Utilizando reseñas para crear un sistema de recomendación que funcione

Si alguna vez ha comprado un producto en línea y se ha maravillado de la inutilidad y la no aplicabilidad de los ‘artículos relacionados’ que acechan el proceso de compra y las ventas, ya entiende que los sistemas de recomendación populares y mainstream tienden a fallar en términos de comprender las relaciones entre compras potenciales.
Si compra un artículo poco frecuente, como un horno, es probable que las recomendaciones para otros hornos sean superfluas, aunque los peores sistemas de recomendación no reconocen esto. En la década de 2000, por ejemplo, el sistema de recomendación de TiVO creó una controversia temprana en este sector al reassignar la sexualidad percibida de un usuario, que posteriormente buscó ‘remasculinizar’ su perfil de usuario seleccionando películas de guerra, un enfoque crudo para la revisión del algoritmo.
Peor aún, no necesita comprar nada en (por ejemplo) Amazon, o comenzar a ver una película cuya descripción está navegando en cualquier plataforma de streaming importante, para que algoritmos de recomendación hambrientos de información comiencen alegremente por el camino equivocado; las búsquedas, las pausas y los clics en las páginas de ‘detalles’ son suficientes, y esta información escasa (y probablemente incorrecta) probablemente se perpetuará en futuras sesiones de navegación en la plataforma.
Intentando hacer que un sistema de recomendación olvide
A veces es posible intervenir: Netflix proporciona un sistema de ‘pulgar hacia arriba/abajo’ que debería, en teoría, ayudar a sus algoritmos de aprendizaje automático a eliminar ciertos conceptos y palabras incrustados de su perfil de recomendaciones (aunque su eficacia ha sido cuestionada, y sigue siendo mucho más fácil evolucionar un algoritmo de recomendación personalizado desde cero que eliminar ontologías no deseadas), mientras que Amazon le permite eliminar títulos de su historial de cliente, lo que debería degradar cualquier dominio no deseado que haya infiltrado sus recomendaciones.
Hulu tiene una característica similar, mientras que HBO Max ha retrocedido parcialmente de los sistemas de recomendación solo basados en algoritmos, frente a sus limitaciones actuales.
Ninguna de estas experiencias estrictamente de nivel de consumidor toca siquiera la amplia y creciente crítica de los sistemas de recomendación de plataformas publicitarias ‘pasivas’ (donde un notable cambio está llegando debido a la ira pública), o el tema incendiario de las recomendaciones de AI de los medios sociales, donde sitios como YouTube, Twitter y Facebook siguen soportando críticas por recomendaciones no relevantes o incluso dañinas.
La máquina no parece saber lo que queremos, a menos que queramos el artículo adyacente que apareció en nuestra búsqueda – incluso si ese artículo es esencialmente un duplicado o alternativa al artículo principal que acabamos de comprar, en lugar de una compra complementaria o auxiliar potencial.
Recomendaciones precisas con datos de reseñas
Una nueva colaboración de investigación de China y Australia ofrece un método novedoso para abordar tales recomendaciones no apropiadas, utilizando reseñas de usuarios externas para obtener una mejor comprensión de las relaciones reales entre artículos en una sesión de compras. En pruebas, la arquitectura superó a todos los métodos actuales de vanguardia, ofreciendo esperanza para sistemas de recomendación que tengan un mapa interno mejor de las dependencias de los artículos:

RI-GNN supera a los competidores importantes en términos de precisión de las relaciones entre artículos, realizando lo mejor en sesiones con más de cinco artículos. El sistema se probó contra los conjuntos de datos de Pet Supplies y Movies and TV de Amazon Review Data (2018). Fuente: https://arxiv.org/pdf/2201.12532.pdf Fuente: https://arxiv.org/pdf/2201.12532.pdf
Además, el proyecto aborda el notable desafío de crear recomendaciones incluso en sesiones anónimas, donde el sistema de recomendación no tiene acceso a detalles contribuidos por el usuario, como el historial de compras o las reseñas del usuario de compras anteriores.
El nuevo documento se titula Reconsiderando la dependencia adyacente en recomendaciones basadas en sesión, y proviene de investigadores de la Universidad de Tecnología Qilu y el Instituto de Tecnología de Beijing en China, la Universidad RMIT en Melbourne, y el Instituto de Inteligencia Artificial de Australia en la Universidad de Tecnología de Sídney.
¿Qué sigue?
La tarea principal de las recomendaciones basadas en sesión (SBR) es determinar el ‘siguiente’ artículo a partir del artículo actual, en función de su relación calculada con el artículo actual. En términos prácticos, esto podría manifestarse como una lista de ‘artículos relacionados’ en una página de artículo para una jaula de pájaros en un sitio web de comercio electrónico.
Si está comprando una jaula de pájaros, ¿qué más es probable que necesite? Bueno, como mínimo, necesitará un pájaro para poner en ella, eso es una dependencia real. Sin embargo, la jaula de pájaros se encuentra en la ontología artículos para mascotas, donde no se venden pájaros. Perversamente, alimento para gatos se encuentra en la misma ontología, aunque adjuntar un tazón de comida para gatos como una recomendación asociada para un producto de jaula de pájaros es una falsa dependencia – una asociación equivocada y desorientada.

Del documento: relaciones verdaderas y falsas entre varios artículos, visualizadas a la derecha como un gráfico de artículo a artículo.
Como sucede tan a menudo en las arquitecturas de aprendizaje automático, es un desafío persuadir a un sistema de recomendación de que una entidad ‘lejana’ (pájaro no aparece en absoluto en artículos para mascotas) puede tener una relación intrínseca y importante con un artículo, mientras que los artículos que están en la misma categoría y muy cercanos en función y concepto central (como tazón de comida para gatos) pueden ser ortogonales o directamente opuestos a la compra que se considera.
La única forma de crear estos mapeos entre entidades ‘no adyacentes’ es subcontratar el problema, ya que las relaciones en cuestión son un aspecto de la experiencia humana, no se pueden adivinar de forma programática y probablemente están más allá del alcance asequible de los enfoques convencionales para la etiquetado de conjuntos de datos, como Amazon Mechanical Turk.
Por lo tanto, los investigadores han empleado mecanismos de Procesamiento de Lenguaje Natural (NLP) para extraer palabras destacadas de las reseñas de un producto y han utilizado frecuencias de estos análisis para crear incrustaciones capaces de ‘coincidir’ con artículos aparentemente distantes.

La arquitectura para la Red Neuronal de Gráficos de Artículos Refinados por Revisión (RI-GNN).
Arquitectura y datos
Como señala el nuevo documento, los trabajos anteriores de naturaleza similar han explotado el historial de reseñas de un usuario conectado para proporcionar mapeos rudimentarios. DeepCONN y RNS ambos utilizaron este enfoque. Sin embargo, esto descuenta el hecho de que un usuario puede no haber escrito ninguna reseña, o ninguna reseña pertinente para un artículo particular que está ‘fuera de rango’ de sus hábitos de compra habituales. Además, este es algo de un enfoque de ‘caja blanca’, ya que asume que el usuario ya ha interactuado lo suficiente con el outlet para crear una cuenta y conectarse.
La Red Neuronal de Gráficos (GNN) extendida propuesta por los investigadores adopta un enfoque más dirigido por oráculo, derivando dependencias verdaderas a priori, para que, presumiblemente, el usuario anónimo y desconectado pueda experimentar recomendaciones más relevantes con un mínimo de entrada requerida.
El sistema de revisión mejorado se titula Red Neuronal de Gráficos de Artículos Refinados por Revisión (RI-GNN). Los investigadores han probado el sistema contra dos conjuntos de datos de Amazon, Suministros para mascotas y Películas y TV. Aunque esto resuelve el problema de la disponibilidad de reseñas de manera bastante elegante, una implementación en el mundo real necesitaría localizar y extraer una base de datos de reseñas adecuada. Esta fuente de conjunto de datos podría, en teoría, ser cualquier cosa, desde publicaciones en una red social hasta respuestas en Quora.
Los mapeos de relaciones de alto nivel de este tipo también serían valiosos para una variedad de aplicaciones de aprendizaje automático más allá de los sistemas de recomendación. Muchos proyectos actuales están limitados por la falta de mapeo entre dominios e intra-dominio debido a fondos y alcance limitados, mientras que el impulso comercial de un sistema de recomendación de comercio electrónico verdaderamente conocedor y subcontratado podría potencialmente llenar esa brecha.
Métricas y pruebas
Los autores probaron RI-GNN contra dos versiones de cada conjunto de datos, cada uno de los cuales consta del historial de compras de un usuario y reseñas generales del producto. Los artículos que aparecen menos de cinco veces se eliminaron, y el historial del usuario se dividió en unidades de una semana. La primera versión del conjunto de datos presentaba todas las sesiones con más de un artículo, y la segunda presentaba todas las sesiones con más de cinco artículos.
El proyecto utilizó P@K (Precisión) y MRR@K (Media de Rango Recíproco) para sus métricas de evaluación. Las arquitecturas rivales probadas fueron: S-KNN; GRU4Rec; S-POP; STAMP; BERT4Rec; DHCN; GCE-GNN; SR-GNN; y NARM.
El marco se entrenó en lotes de 100 en Adam con una tasa de aprendizaje de 0.001, con el número de temas establecido en 24 y 20, respectivamente, para Suministros para mascotas y Películas y TV.
Publicado por primera vez el 1 de febrero de 2022.












