Angle d’Anderson
Les systèmes de recommandation doivent-ils être exemptés de l’ère post-suivi ?

Alors que la collecte de données de première partie devient la nouvelle étoile polaire pour les marketeurs et les courtiers de données, l’attention accrue sur les systèmes de collecte de données « fermés » risque de traîner l’un des secteurs de recherche les plus fervents de l’apprentissage automatique dans la controverse et une réglementation plus stricte.
Les actions entreprises par les acteurs de FAANG et les producteurs de FOSS au cours des 12 à 18 prochains mois sont sur le point de mettre fin à la culture du suivi inter-domaines qui a envahi les systèmes d’analyse d’utilisateurs au cours des vingt dernières années, et qui a abouti aux scandales de Cambridge Analytica et, par la suite, à une demande irrésistible de confidentialité en ligne accrue.
Que la mise en œuvre réponde ou non à l’idéal, et quelle que soit la mesure dans laquelle des systèmes de suivi plus généralisés (tels que FLOC de Google et SKAdNetwork d’Apple) peuvent apaiser la colère des consommateurs et satisfaire les annonceurs, cette nouvelle vague de préoccupation pour la confidentialité des utilisateurs ne s’applique qu’au suivi inter-domaines dans un contexte « public », et non aux environnements de consommateurs fermés ou propriétaires, et aux systèmes de recommandation sur mesure qui alimentent l’engagement là-bas.
Données riches dans les jardins murés
Les plateformes telles que Netflix, Disney+, HBO Max, Roku et l’écostructure Amazon (y compris Prime Video et les recommandations de produits), qui utilisent des systèmes de recommandation de machine learning personnalisés, sont parmi les services de contenu qui prolifèrent et se renforcent à mesure que l’industrie de la diffusion en continu se balkanise.
Alors que la collecte de données de tiers recule, l’avantage que ces grands acteurs de la diffusion en continu conservent en termes d’accès granulaire aux données d’utilisation des clients semble susceptible d’inspirer l’envie et l’imitation, et un accent renouvelé sur les cadres de première partie comme moyen de récupérer une ciblage hyper-personnalisé à partir des systèmes d’analyse plus généralisés.
Si cela se produit, il est peu probable que cela soit aussi démocratique ou méritocratique que les critères d’entrée antérieurs, car le plus grand avantage reviendra aux fournisseurs ayant le plus vaste réseau de plateformes de première partie; avec suffisamment de ressources de développement pour fournir des systèmes d’authentification locaux sécurisés; et qui sont en mesure de gérer, d’analyser et de monétiser des données de grande volumétrie localement.
Cela mettrait l’accent sur les aspects de confidentialité des systèmes de recommandation « fermés » d’une manière qui leur a largement échappé jusqu’à présent, car, jusqu’à ce point, ils ont été des cas exceptionnels et ont bénéficié de privilèges exceptionnels, opérant dans un contexte où l’utilisateur final a explicitement opté pour des pratiques de collecte de données agressives qui ne sont généralement pas autorisées dans les réseaux ouverts.
Un retour plus large aux environnements de première partie hermétiques
Un accent accru sur les données de première partie semble susceptible de ramener les systèmes d’authentification spécifiques au domaine qui ont précédé la popularité des méthodes de tiers fournies par Google (0Auth 2.0), Facebook et Twitter, ainsi que d’autres plateformes sociales populaires telles que Disqus.
Il y a dix ans, l’adoption généralisée de ces plateformes d’authentification de tiers a résolu de nombreux problèmes de sécurité pour les domaines ayant des ressources de développement limitées, mais a également rendu plus difficile l’obtention de la même granularité de données d’utilisateurs actionnables que permet un système d’authentification et de surveillance local dédié. À l’époque, cela n’avait pas beaucoup d’importance, car le suivi inter-domaines pouvait combler ce fossé de données.
La connexion en tant que solution à une crise existentielle
Maintenant, l’avantage réside dans le fait de s’assurer que l’utilisateur est connecté, même s’il n’y a pas de mécanismes explicites pour le monétiser. Un exemple de ceci est le nombre croissant de médias qui exigent une connexion pour afficher le contenu, même s’il n’y a pas de paywall en place. Par exemple, The Guardian expérimente actuellement des exigences de connexion pour les vues d’articles qui proviennent de recherches Google:

Capture d’écran d’un « mur de connexion » pour une vue d’article de The Guardian provenant d’une recherche Google. Cela ne peut pas être capturé dans les instantanés d’archive Web, car la restriction est générée soit par des en-têtes de référent, soit par des systèmes basés sur l’adresse IP qui révèlent Google comme l’originateur du clic.
Des restrictions de ce type peuvent être difficiles à déterminer pour un spectateur individuel, car elles peuvent varier en fonction des géolocalisations ou d’autres circonstances. Par exemple, l’article de The Guardian ci-dessus n’est pas restreint de quelque manière que ce soit lorsqu’il est navigué à partir du site Web de The Guardian (même si le lecteur n’est pas connecté), ou lorsqu’il est accédé directement. Exiger une connexion à partir d’une référence Google est un moyen peu coûteux de générer une augmentation de la demande de membership sans aliéner les lecteurs « pré-capturés ».
Bien qu’il y ait toujours eu des avantages en matière de collecte de données dans ce type d’engagement de première partie (c’est-à-dire une connexion « locale »), la chute du suivi inter-domaines est susceptible d’élever cette pratique de « avantageuse » à une nécessité existentielle afin d’éviter les flux de données marketing plus clairsemés de FLOC et SKAdNetwork.
L’impulsion vers la collecte de données de première partie
Les preuves d’une « ruée vers l’or » des données de première partie sont abondantes. Selon l’avis d’un insider de l’industrie chez Forbes, la chute des cookies de tiers entraînera de nouvelles opportunités pour les entreprises de curater et vendre des données de seconde partie, où elles ont suffisamment d’infrastructures de première partie pour devenir effectivement des courtiers de données à part entière.
Une analyse ailleurs prévoit que les détaillants (qui investissent lourdement dans les systèmes de recommandation de machine learning) deviendront les nouveaux « magnats des médias ».
Dans un billet de blog, la plateforme de monétisation Setupad illustre l’intention de l’industrie de la publicité de ne pas céder à des systèmes fédérés et limités en données tels que FLOC, déclarant que ‘le ciblage comportemental est la réponse au succès futur des annonceurs’, et que la capture de première partie est l’exigence absolue pour cela.
Le ciblage comportemental est ce qui a causé le changement tectonique actuel dans la confidentialité des consommateurs en premier lieu; et c’est ce que les industries marketing et d’influence professionnelle veulent reconquérir – par procuration, par discrétion ou par tout autre moyen, peu importe qu’il puisse éventuellement entraîner le secteur de la recherche sur les systèmes de recommandation dans la tourbe avec lui.
Le « club » de première partie
Outre l’exigence d’infrastructures coûteuses, ainsi que de ressources de sécurité et de développement, un autre facteur indique pourquoi seuls les plus grands acteurs sont susceptibles de prospérer à l’ère des systèmes de collecte de données de première partie: une entreprise devra avoir une prise de marché convaincante pour ramener les consommateurs dans les systèmes de connexion locaux qu’ils avaient abandonnés il y a une décennie.
C’est un mouvement risqué, même pour un acteur majeur, et le souvenir de la disparition de Digg en 2010 hante encore le monde du référencement et du marketing. Plus l’emprise de marché d’une entreprise est convaincante, moins ce mouvement sera préjudiciable, les entreprises les plus puissantes étant capables de résister aux creux et de s’adapter mieux à l’écosystème de première partie que les plus petites entreprises.
Effets sur la recherche sur les systèmes de recommandation
Alors que cette situation évolue, elle peut menacer le « laissez-passer » relatif que la surveillance réglementaire a accordé à la recherche sur les systèmes de recommandation de machine learning de la part d’entreprises telles que Google, Amazon et Netflix.
Jusqu’à un certain point, les nouvelles propositions de l’UE pour la législation sur l’IA prévoient une surveillance accrue des systèmes de recommandation dans tous les cas. Bien qu’il soit peu clair si la disposition du projet contre les ‘techniques subliminales au-delà de la conscience d’une personne pour déformer matériellement le comportement d’une personne’ s’appliquera aux systèmes de recommandation, il est prévu que les annonceurs et les chercheurs sur les systèmes de recommandation feront valoir un traitement exceptionnel.
Mais il peut être difficile de plaider en faveur d’un traitement spécial pour la recherche sur les systèmes de recommandation dans l’hypothèse où l’approche « jardin muré » deviendra la nouvelle norme de l’industrie, et que les pâturages académiques qui ont abrité ce secteur de la recherche sur l’apprentissage automatique deviendront un lit de développement à haute volumétrie pour la recherche comportementale de première partie massivement commercialisée.
Un investissement majeur dans les flux de travail de données de première partie peut être le seul espoir pour recréer les mêmes publicités « psychiques » et la propagande politique très efficaces qui ont caractérisé l’ère de Cambridge Analytica; mais pour les régulateurs, il peut sembler que la mort du cookie de tiers a simplement déplacé les pratiques « discréditées » des rues dans des locaux fermés. Si l’effet extérieur de ces activités suscite à nouveau la colère publique, cela peut se révéler un sanctuaire maigre.












