Góc nhìn Anderson
Có Nên Miễn Cho Hệ Thống Khuyến Nghị Tránh Tuân Theo Thời Đại Sau Khi Theo Dõi?

Khi việc thu thập dữ liệu đầu tiên trở thành ngôi sao dẫn đường mới cho các nhà tiếp thị và nhà môi giới dữ liệu, sự chú ý ngày càng tăng đối với các hệ thống thu thập dữ liệu ‘đóng’ có nguy cơ kéo một trong những lĩnh vực nghiên cứu sôi động nhất của học máy xuống vào tranh cãi và quy định chặt chẽ hơn.
Hành động của các công ty FAANG và nhà sản xuất FOSS trong 12-18 tháng tới sẽ đóng cửa văn hóa theo dõi xuyên miền mà đã bao trùm các hệ thống phân tích người dùng trong hai thập kỷ qua, và đã kết thúc trong vụ bê bối Cambridge Analytica và sau đó là nhu cầu không thể cưỡng lại được về quyền riêng tư trực tuyến tăng cao.
Cho dù việc thực hiện có sống lên với lý tưởng hay không, và bất kể mức độ mà các hệ thống theo dõi tổng quát hơn (như FLOC của Google và SKAdNetwork của Apple ) có thể làm giảm sự phẫn nộ của người tiêu dùng và làm hài lòng các nhà quảng cáo, làn sóng quan tâm mới này về quyền riêng tư của người dùng chỉ áp dụng cho việc trích xuất dữ liệu xuyên miền trong một ‘công cộng’ bối cảnh, và không áp dụng cho môi trường người dùng đóng hoặc độc quyền, và các hệ thống khuyến nghị tùy chỉnh powers engagement ở đó.
Dữ Liệu Giàu Trong Vườn Cây Đóng
Các nền tảng như Netflix, Disney+, HBO Max, Roku, và hệ sinh thái Amazon (bao gồm Prime Video và khuyến nghị sản phẩm), những nền tảng này sử dụng hệ thống khuyến nghị máy học tùy chỉnh, là một trong những dịch vụ nội dung đang phát triển và củng cố như một ngành công nghiệp phát trực tuyến balkanizes.
Khi việc thu thập dữ liệu của bên thứ ba giảm đi, lợi thế mà những người chơi lớn này giữ lại về việc truy cập dữ liệu sử dụng khách hàng một cách tinh tế có vẻ sẽ gây ra sự ghen tị và bắt chước, và sự nhấn mạnh mới vào các khuôn khổ đầu tiên như một cách để giành lại mục tiêu cá nhân hóa từ các hệ thống phân tích mới tổng quát hơn.
Nếu điều này xảy ra, nó không có khả năng trở nên dân chủ hoặc công bằng như các tiêu chí trước đây cho việc tham gia, vì lợi thế lớn nhất sẽ thuộc về những nhà cung cấp có mạng lưới các nền tảng đầu tiên rộng lớn nhất; với đủ nguồn lực phát triển để cung cấp hệ thống xác thực địa phương an toàn; và những người có thể quản lý, phân tích và kiếm tiền từ dữ liệu khối lượng lớn tại địa phương.
Điều này sẽ tập trung sự giám sát của công chúng vào các khía cạnh quyền riêng tư của ‘hệ thống khuyến nghị đóng’ theo cách mà chúng đã tránh được cho đến nay, vì trước đến thời điểm này, chúng đã là những trường hợp ngoại lệ, và đã được hưởng những đặc quyền ngoại lệ, hoạt động trong một bối cảnh mà người dùng cuối đã chọn tham gia vào các hoạt động thu thập dữ liệu tích cực không được phép trong các mạng mở.
Sự Trở Lại Của Môi Trường Đầu Tiên Đóng
Sự nhấn mạnh ngày càng tăng vào dữ liệu đầu tiên có khả năng dẫn đến sự trở lại của các hệ thống xác thực miền cụ thể đã đi trước sự phổ biến của các phương pháp xác thực của bên thứ ba do Google (0Auth 2.0), Facebook và Twitter, cũng như các nền tảng xã hội phổ biến khác như Disqus.
Ten năm trước, việc áp dụng rộng rãi các nền tảng xác thực của bên thứ ba đã giải quyết nhiều vấn đề bảo mật cho các miền có nguồn lực phát triển hạn chế, nhưng cũng làm cho việc thu thập dữ liệu người dùng có thể hành động trở nên khó khăn hơn khi so sánh với hệ thống xác thực và giám sát địa phương chuyên dụng. Tại thời điểm đó, điều đó không quan trọng lắm, vì việc theo dõi xuyên miền có thể bắc cầu dữ liệu đó.
Đăng Nhập Là Giải Pháp Cho Khủng Hoảng Tồn Tại
Bây giờ, lợi thế nằm ở việc đảm bảo người dùng đã đăng nhập, ngay cả khi không có cơ chế rõ ràng để kiếm tiền từ họ. Một ví dụ về điều này là số lượng ngày càng tăng của các kênh truyền thông yêu cầu đăng nhập để xem nội dung, ngay cả khi không có tường lửa thanh toán ở đó. Ví dụ, The Guardian hiện đang thử nghiệm yêu cầu đăng nhập để xem các bài viết từ các tìm kiếm của Google:

Screenshot của một ‘tường lửa đăng nhập’ cho một bài viết của The Guardian từ một tìm kiếm của Google. Điều này không thể được chụp trong các bản lưu trữ web, vì hạn chế được tạo ra bởi các tiêu đề referrer hoặc các hệ thống dựa trên IP cho thấy Google là người khởi tạo click.
Các hạn chế như vậy có thể khó xác định cho người xem cá nhân, vì chúng có thể thay đổi qua các vị trí địa lý hoặc các tình huống khác. Ví dụ, bài viết của The Guardian trên không bị hạn chế theo bất kỳ cách nào khi điều hướng từ trong trang web của The Guardian (ngay cả khi người đọc không đăng nhập), hoặc khi truy cập trực tiếp. Yêu cầu đăng nhập từ một tìm kiếm của Google là một phương pháp rẻ tiền để tạo ra sự gia tăng nhu cầu về thành viên mà không làm mất lòng những người đọc ‘đã được thu hút’.
Mặc dù luôn có lợi thế trong việc thu thập dữ liệu trong loại hình tham gia đầu tiên này (tức là ‘đăng nhập địa phương’), sự sụp đổ của việc theo dõi xuyên miền có khả năng sẽ nâng cao việc thực hành này từ ‘có lợi’ lên một cần thiết để tránh các dòng dữ liệu tiếp thị thưa thớt hơn của FLOC và SKAdNetwork.
Động Lực Hướng Đến Thu Thập Dữ Liệu Đầu Tiên
Bằng chứng về ‘cuộc chạy đua vàng’ dữ liệu đầu tiên dày đặc trên mặt đất. Theo quan điểm của một người trong ngành tại Forbes, sự sụp đổ của cookie của bên thứ ba sẽ dẫn đến cơ hội mới cho các công ty chọn lọc và bán dữ liệu thứ hai, nơi họ có đủ cơ sở hạ tầng đầu tiên để trở thành nhà môi giới dữ liệu theo đúng nghĩa của mình.
Phân tích ở nơi khác cũng dự báo rằng các nhà bán lẻ (những người đầu tư mạnh vào hệ thống khuyến nghị máy học) sẽ trở thành những ‘đại gia truyền thông’ mới.
Trong một bài đăng trên blog, nền tảng kiếm tiền Setupad thể hiện ý định của ngành quảng cáo là không nhường nhịn cho các hệ thống liên bang, hạn chế dữ liệu như FLOC, nói rằng ‘tiếp thị hành vi là câu trả lời cho thành công trong tương lai của các nhà quảng cáo’, và rằng việc thu thập đầu tiên là điều kiện tiên quyết tuyệt đối cho điều này.
Tiếp thị hành vi là nguyên nhân gây ra sự thay đổi kiến tạo trong quyền riêng tư của người tiêu dùng lần này; và đó là điều mà ngành tiếp thị và các nhà ảnh hưởng chuyên nghiệp muốn giành lại – bằng cách thay thế, bằng cách lén lút hoặc bằng bất kỳ phương tiện nào, bất kể điều đó có thể kéo theo lĩnh vực nghiên cứu hệ thống khuyến nghị xuống vào bùn với nó.
Câu Lạc Bộ Đầu Tiên
Ngoài yêu cầu về cơ sở hạ tầng tốn kém, cũng như nguồn lực bảo mật và phát triển, một yếu tố khác cho thấy tại sao chỉ những công ty lớn hơn mới có khả năng phát triển trong thời đại của các hệ thống thu thập dữ liệu đầu tiên: một công ty sẽ cần có sự chiếm lĩnh thị trường hấp dẫn để ép buộc người tiêu dùng quay lại vào các hệ thống đăng nhập địa phương mà họ đã từ bỏ một thập kỷ trước.
Đây là một động thái mạo hiểm, ngay cả đối với một người chơi lớn, và ký ức về sự sụp đổ của Digg vào năm 2010 vẫn ám ảnh thế giới SEO và tiếp thị. Sự chiếm lĩnh thị trường càng hấp dẫn, động thái này sẽ càng ít gây thiệt hại, với các công ty mạnh hơn có thể vượt qua các khó khăn và thích nghi tốt hơn với hệ sinh thái đầu tiên so với các vấn đề nhỏ hơn.
Tác Động Đến Nghiên Cứu Hệ Thống Khuyến Nghị
Khi tình huống này phát triển, nó có thể đe dọa ‘giấy phép đặc biệt’ mà việc giám sát quy định đã cấp cho nghiên cứu hệ thống khuyến nghị máy học từ các công ty như Google, Amazon và Netflix.
Đến một mức độ nào đó, đề xuất mới của EU về luật AI dự kiến sự giám sát chặt chẽ hơn đối với các hệ thống khuyến nghị trong bất kỳ trường hợp nào. Mặc dù không rõ liệu điều khoản chống lại ‘các kỹ thuật tiềm thức vượt quá ý thức của một người để làm sai lệch đáng kể hành vi của một người’ sẽ áp dụng cho các hệ thống khuyến nghị hay không, nhưng được dự đoán rằng các nhà quảng cáo và nhà nghiên cứu hệ thống khuyến nghị sẽ vận động cho việc đối xử đặc biệt.
Nhưng có thể sẽ khó để tạo ra một trường hợp cho việc cách ly nghiên cứu hệ thống khuyến nghị trong trường hợp mà cách tiếp cận ‘vườn cây đóng’ trở thành tiêu chuẩn mới của ngành, và các đồng cỏ học thuật悠闲 mà đã tổ chức lĩnh vực nghiên cứu này của học máy trở thành một trung tâm nóng cho sự phát triển nghiên cứu hành vi đầu tiên được thương mại hóa hàng loạt.
Đầu tư lớn vào các luồng dữ liệu đầu tiên có thể là hy vọng duy nhất để tái tạo lại cùng loại quảng cáo ‘tâm lý’ và tuyên truyền chính trị hiệu quả mà đã đặc trưng cho thời đại Cambridge Analytica; nhưng đối với các nhà quản lý, có vẻ như sự sụp đổ của cookie của bên thứ ba chỉ di chuyển các hoạt động ‘không đứng đắn’ ra khỏi đường phố và vào các cơ sở đóng. Nếu tác động bên ngoài của các hoạt động đó lại gây ra sự phẫn nộ của công chúng một lần nữa, điều đó có thể chứng minh là một nơi ẩn náu không an toàn.












