Ãngulo de Anderson
Devem os Sistemas de RecomendaçÃĢo ser Isentos da Era PÃģs-Rastreamento?

à medida que a coleta de dados de primeira parte se torna a nova estrela-guia para marketers e corretores de dados, a atençÃĢo aumentada sobre sistemas de coleta de dados âfechadosâ arrisca arrastar um dos setores de pesquisa de aprendizado de mÃĄquina mais fervorosos para a controvÃĐrsia e uma regulamentaçÃĢo mais rigorosa.
As açÃĩes tomadas pelos jogadores FAANG e pelos produtores FOSS nos prÃģximos 12-18 meses estÃĢo prestes a fechar a cultura de rastreamento entre domÃnios que envolveu os sistemas de anÃĄlise de usuÃĄrios nos Últimos vinte anos, e culminou nos escÃĒndalos da Cambridge Analytica e, subsequentemente, na demanda irresistÃvel por aumento da privacidade online.
Seja qual for a implementaçÃĢo, seja qual for a extensÃĢo com que sistemas de rastreamento mais generalizados (como o FLOC do Google e o SKAdNetwork da Apple ) possam acalmar a ira do consumidor e satisfazer os anunciantes, essa nova onda de preocupaçÃĢo com a privacidade do usuÃĄrio se aplica apenas à extraçÃĢo de dados entre domÃnios em um contexto âpÚblicoâ, e nÃĢo a ambientes de consumidor fechados ou proprietÃĄrios, e aos sistemas de recomendaçÃĢo personalizados que impulsionam o engajamento lÃĄ.
Dados Ricos em Jardins Murados
Plataformas como Netflix, Disney+, HBO Max, Roku e a estrutura da Amazon (incluindo Prime Video e recomendaçÃĩes de produtos), que utilizam sistemas de recomendaçÃĢo de aprendizado de mÃĄquina personalizados, estÃĢo entre os serviços de conteÚdo que agora proliferam e se retiram à medida que a indÚstria de streaming se fragmenta.
à medida que a coleta de dados de terceiros recua, a vantagem que esses grandes jogadores de streaming retÊm em termos de acesso refinado aos dados de uso do cliente parece provÃĄvel que inspire inveja e imitaçÃĢo, e um novo Ênfase em estruturas de primeira parte como uma forma de recuperar a segmentaçÃĢo hiper-personalizada dos novos sistemas de anÃĄlise mais generalizados.
Se isso acontecer, nÃĢo ÃĐ provÃĄvel que seja tÃĢo democrÃĄtico ou meritocrÃĄtico quanto os critÃĐrios anteriores para entrada, porque a maior vantagem cairÃĄ para os provedores com a rede mais extensa de plataformas de primeira parte; com recursos de desenvolvimento suficientes para fornecer sistemas de autenticaçÃĢo local seguros; e que sejam capazes de gerenciar, analisar e monetizar grandes volumes de dados localmente.
Isso focalizaria a atençÃĢo pÚblica nos aspectos de privacidade dos sistemas de recomendaçÃĢo âfechadosâ de uma maneira que eles tÊm sido capazes de evitar atÃĐ agora, porque, anteriormente, eles tÊm sido casos excepcionais, e desfrutaram de privilÃĐgios excepcionais, operando em um contexto em que o usuÃĄrio final optou explicitamente por prÃĄticas de coleta de dados agressivas que nÃĢo sÃĢo geralmente permitidas em redes abertas.
Um Retorno Mais Amplo a Ambientes de Primeira Parte HermÃĐticos
Um aumento no Ênfase em dados de primeira parte provavelmente trarÃĄ um retorno aos sistemas de autenticaçÃĢo de domÃnio especÃfico que precederam a popularidade dos mÃĐtodos de autenticaçÃĢo de terceiros fornecidos pelo Google (0Auth 2.0), Facebook e Twitter, bem como outras plataformas sociais populares como Disqus.
HÃĄ dez anos, a adoçÃĢo generalizada dessas plataformas de autenticaçÃĢo de terceiros resolveu muitos problemas de segurança para domÃnios com recursos de desenvolvimento limitados, mas tambÃĐm tornou mais difÃcil obter a mesma granularidade de dados de usuÃĄrio açÃĢo que um sistema de autenticaçÃĢo e monitoramento de primeira parte dedicado e local permite. Na ÃĐpoca, nÃĢo importava muito, porque o rastreamento entre domÃnios podia preencher essa lacuna.
A SoluçÃĢo de Login para uma Crise Existencial
Agora, a vantagem estÃĄ em garantir que um usuÃĄrio esteja logado, mesmo que nÃĢo haja mecanismos explÃcitos para monetizÃĄ-los. Um exemplo disso ÃĐ o nÚmero crescente de veÃculos de mÃdia que exigem login para visualizar conteÚdo, mesmo onde nÃĢo hÃĄ paywall em vigor. Por exemplo, o The Guardian estÃĄ experimentando requisitos de login para visualizaçÃĩes de artigos que vÊm de buscas do Google:

Screenshot de uma âparede de loginâ para uma visualizaçÃĢo de artigo do The Guardian que veio de uma busca do Google. Isso nÃĢo pode ser capturado em snapshots de arquivo da web, desde que a restriçÃĢo ÃĐ gerada por cabeçalhos de referenciador ou sistemas baseados em IP que revelam o Google como o originador do clique.
RestriçÃĩes desse tipo podem ser difÃceis de determinar para um visualizador individual, desde que possam variar por geolocalizaçÃĩes ou outras circunstÃĒncias. Por exemplo, o artigo do The Guardian acima nÃĢo ÃĐ restrito de nenhuma forma quando navegado a partir do site do The Guardian (mesmo que o leitor nÃĢo esteja logado), ou quando acessado diretamente. Exigir um login de uma referÊncia do Google ÃĐ um mÃĐtodo barato de gerar um aumento na demanda por associaçÃĢo sem alienar leitores âprÃĐ-capturadosâ.
Embora sempre haja havido vantagens de coleta de dados nesse tipo de engajamento de primeira parte (ou seja, um âloginâ local), a queda do rastreamento entre domÃnios provavelmente elevarÃĄ a prÃĄtica de âvantajosaâ a uma necessidade existencial para evitar os fluxos de dados de marketing mais esparsos do FLOC e do SKAdNetwork.
O Impulso para a Coleta de Dados de Primeira Parte
A evidÊncia de uma âcorrida ao ouroâ de dados de primeira parte ÃĐ espessa no chÃĢo. De acordo com a visÃĢo de um insider da indÚstria no Forbes, a queda dos cookies de terceiros levarÃĄ a novas oportunidades para as empresas curar e vender dados de segunda parte, onde elas tÊm suficiente infraestrutura de primeira parte para se tornarem corretores de dados por direito prÃģprio.
AnÃĄlise em outro lugar tambÃĐm prevÊ que os varejistas (que investem pesadamente em sistemas de recomendaçÃĢo de aprendizado de mÃĄquina) se tornarÃĢo os novos âmagnatas da mÃdiaâ.
Em um post de blog, a plataforma de monetizaçÃĢo Setupad exemplifica a intençÃĢo da indÚstria publicitÃĄria de nÃĢo aceder a sistemas federados e limitados de dados, como o FLOC, afirmando que âa segmentaçÃĢo comportamental ÃĐ a resposta para o sucesso futuro dos anunciantesâ, e que a captura de primeira parte ÃĐ o prÃĐ-requisito absoluto para isso.
A segmentaçÃĢo comportamental ÃĐ o que causou a atual mudança tectÃīnica na privacidade do consumidor; e ÃĐ o que as indÚstrias de marketing e influenciadores profissionais querem recuperar â por procuraçÃĢo, por stealth ou por qualquer outro meio, nÃĢo importa que possa eventualmente arrastar o setor de pesquisa de sistemas de recomendaçÃĢo para a lama com ele.
O âClubeâ de Primeira Parte
AlÃĐm do requisito de infraestrutura custosa, bem como recursos de segurança e desenvolvimento, outro fator indica por que apenas grandes empresas provavelmente prosperarÃĢo na era dos sistemas de coleta de dados de primeira parte: uma empresa precisarÃĄ de uma captura de mercado convincente para coagir os consumidores de volta aos sistemas de login local que eles estavam felizes em abandonar uma dÃĐcada atrÃĄs.
Isso ÃĐ um movimento arriscado, mesmo para um jogador importante, e a memÃģria da queda do Digg em 2010 ainda assombra o mundo do SEO e marketing. Quanto mais convincente for a captura de mercado de uma empresa, menos danoso esse movimento serÃĄ, com empresas mais poderosas capazes de suportar os vales e se adaptar melhor ao ecossistema de primeira parte do que as preocupaçÃĩes menores.
Efeitos nos Sistemas de RecomendaçÃĢo de Pesquisa
à medida que essa situaçÃĢo evolui, pode ameaçar o âpasse livreâ relativo que a supervisÃĢo regulatÃģria concedeu à pesquisa de sistemas de recomendaçÃĢo de aprendizado de mÃĄquina de empresas como Google, Amazon e Netflix.
AtÃĐ certo ponto, as novas propostas da UE para legislaçÃĢo de IA antecipam uma maior fiscalizaçÃĢo dos sistemas de recomendaçÃĢo em qualquer caso. Embora nÃĢo esteja claro se a provisÃĢo do rascunho contra âtÃĐcnicas subliminares alÃĐm da consciÊncia de uma pessoa para distorcer materialmente o comportamento de uma pessoaâ se aplicarÃĄ a sistemas de recomendaçÃĢo, ÃĐ previsto que anunciantes e pesquisadores de sistemas de recomendaçÃĢo farÃĢo lobby para tratamento excepcional.
Mas pode ser difÃcil fazer um caso para cercar a pesquisa de sistemas de recomendaçÃĢo no evento de que a abordagem âjardim muradoâ se tornar o novo padrÃĢo da indÚstria, e os pastos acadÊmicos que hospedaram esse setor de pesquisa de aprendizado de mÃĄquina se tornem um leito quente de desenvolvimento de pesquisa comportamental de primeira parte comercializada em massa.
Um grande investimento em fluxos de trabalho de dados de primeira parte pode ser a Única esperança para recriar os mesmos tipos de anÚncios âpsÃquicosâ e propaganda polÃtica altamente eficazes que caracterizaram a era da Cambridge Analytica; mas para os reguladores, pode parecer que a morte do cookie de terceiros simplesmente moveu prÃĄticas âdesonrosasâ para fora das ruas e para dentro de instalaçÃĩes fechadas. Se o efeito exterior dessas atividades despertar a ira pÚblica novamente, isso pode provar um santuÃĄrio escasso.












