Góc nhìn Anderson

Xác định Crowdturfers trên Instagram bằng Học máy

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Những nhà nghiên cứu ở Ý và Iran tuyên bố đã xây dựng hệ thống học máy đầu tiên có khả năng nhận biết hoạt động ‘crowdturfing’ của các tài khoản influencer (không phải tài khoản tự động) trên nền tảng Instagram. Crowdturfers là những người thực sự thực hiện các dịch vụ ‘xây dựng hồ sơ’ cho các nền tảng bán hoạt động này với số lượng lớn.

Phương pháp mới này tuyên bố đạt được điểm chính xác khoảng 95% và sử dụng học bán giám sát trong các hệ thống Xử lý Ngôn ngữ Tự nhiên (NLP).

Các tác giả tuyên bố rằng theo kiến thức tốt nhất của họ, hệ thống của họ đại diện cho hệ thống phát hiện crowdturfing (CT) đầu tiên có thể đáng tin cậy xác định các tài khoản không phải bot đang tham gia vào việc tăng cường hồ sơ và tương tác trả phí giả.

Để thực hiện việc này, các tác giả đã mua 1293 hồ sơ crowdturfing từ 11 nhà cung cấp nền tảng CT để có được dữ liệu để đào tạo bộ phát hiện CT. Vì Instagram có một số biện pháp chống bot hiệu quả, các nhà nghiên cứu lưu ý, những người muốn khai thác cơ sở người dùng khổng lồ của nền tảng này cho mục đích thương mại đã chuyển sang trả tiền cho những người dùng Instagram có ảnh hưởng thực sự để ‘tương tác chiến lược’ với các tài khoản ‘khách hàng’, chủ yếu bằng cách chia sẻ bình luận hoặc thông qua hoạt động liên quan đến bình luận trên bài đăng.

Sau khi đào tạo mô hình, các tác giả đã cho nó phân tích hồ sơ tương tác của 20 ‘mega-influencer’, mỗi người có hơn 1 triệu người theo dõi, kết luận rằng ‘hơn 20% tương tác của họ là giả tạo’.

Bài báo này có tiêu đề Chúng ta có đang sống trong một chương trình truyền hình thực tế không? Phát hiện Crowdturfing trên Instagram thông qua Tự đào tạo, và đến từ năm nhà nghiên cứu trên Đại học Padova ở Ý và Đại học Imam Reza ở Iran.

Vi phạm Điều khoản Dịch vụ của Instagram

Không giống như Twitter, được các nhà nghiên cứu về truyền thông xã hội ưa chuộng do cam kết hỗ trợ nghiên cứu, Instagram không chỉ không cung cấp API hoặc dữ liệu cập nhật để giúp các nhà nghiên cứu, mà còn cấm việc duyệt web bằng máy trong Điều khoản Dịch vụ của mình. Do đó, nhiệm vụ đầu tiên của các nhà nghiên cứu là đạt được sự miễn trừ từ Hội đồng Kiểm tra Cơ sở của họ, được chứng minh bằng các công trình trước sử dụng phương pháp tương tự để điều tra ‘hoạt động ngầm’.

Các dịch vụ crowdturfing đã được mua cho các tài khoản Instagram mới được tạo bởi các nhà nghiên cứu cho mục đích của họ, tất cả đều bị xóa sau khi thí nghiệm, loại bỏ sự tham gia của người dùng ‘hợp pháp’. Neither các tài khoản influencer được nghiên cứu nor các dịch vụ nền tảng CT được đặt tên.

Một rào cản đạo đức khác là các nhà nghiên cứu không thể yêu cầu sự đồng ý của những người dùng đang được nghiên cứu, do hiệu ứng Hawthorne (tức là nó có thể đã thay đổi hành vi của những người dùng), và sự miễn trừ này cũng được cấp bởi Hội đồng Kiểm tra Cơ sở.

Cuối cùng, vì Instagram cho phép ‘thu thập dữ liệu thủ công’, các nhà nghiên cứu đã thỏa hiệp về việc vi phạm Điều khoản Dịch vụ của họ bằng cách đặt các công cụ thu thập dữ liệu tự động của họ ở ‘tốc độ con người’, điều này đòi hỏi một giai đoạn thu thập dữ liệu trong năm tháng.

Con người để Bán

Các nhà nghiên cứu đã mua 100 ‘người theo dõi giả’ từ mỗi một trong 11 nhà cung cấp (không được đặt tên).

Bài báo tuyên bố*:

‘Tất cả các nhà cung cấp mà chúng tôi đã chọn đều đảm bảo cung cấp người theo dõi tương tác với các hồ sơ mục tiêu bằng cách thích và bình luận trên các bài đăng của họ để tăng tỷ lệ tương tác của họ.

‘Những hồ sơ CT này được xác định là người theo dõi chất lượng cao và thường có giá cao hơn so với các hồ sơ giả ‘cơ bản’. Sự tin cậy của các nhà cung cấp này được hỗ trợ bởi các nền tảng đánh giá nổi tiếng như TrustPilot.’

Từ bài báo, thống kê về các nhà cung cấp nền tảng CT (được ẩn danh), mỗi nền tảng là một thị trường cho các tài khoản influencer 'bị nhiễm'. Bảng này phác thảo thông tin được báo cáo bởi các nhà cung cấp và thu được bởi các nhà nghiên cứu thông qua phân tích 100 hồ sơ được mua từ mỗi nguồn. Nguồn: https://arxiv.org/pdf/2206.12904.pdf

Từ bài báo, thống kê về các nhà cung cấp nền tảng CT (được ẩn danh), mỗi nền tảng là một thị trường cho các tài khoản influencer ‘bị nhiễm’. Bảng này phác thảo thông tin được báo cáo bởi các nhà cung cấp và thu được bởi các nhà nghiên cứu thông qua phân tích 100 hồ sơ được mua từ mỗi nguồn. Nguồn: https://arxiv.org/pdf/2206.12904.pdf

Giá trung bình để mua một người dùng influencer trên Instagram, bài báo lưu ý, không quá cao, khoảng 3 đô la cho 100 ‘người theo dõi chất lượng cao’. Các tác giả lưu ý:

‘Hầu hết các nhà cung cấp đều giao người theo dõi trong vài giờ. Họ cung cấp bảo vệ chống mất mát, nghĩa là số lượng người theo dõi mà khách hàng mua sẽ vẫn ổn định theo thời gian hoặc người theo dõi mới sẽ được giao để bổ sung cho những người bị mất.’

Các nhà nghiên cứu báo cáo rằng một số tài khoản Instagram mới của họ đã mất 15-20% người theo dõi CT sau một tháng, nhưng trong một số trường hợp, họ đã nhận được nhiều hơn so với dự kiến. Đối với nhà cung cấp CT đắt nhất (CT-10, trong bảng trên), chỉ có ba người theo dõi bị mất sau một tháng.

Bài báo lưu ý rằng tỷ lệ người theo dõi / người theo dõi trở nên ‘hợp pháp’ hơn khi bạn trả tiền nhiều hơn cho nhà cung cấp CT, với nhà cung cấp thứ hai đắt nhất cung cấp tỷ lệ gần giống với mức cơ bản của người dùng.

Một đặc điểm của tài khoản Instagram CT là hồ sơ của nó hiếm khi được đặt ở chế độ ‘riêng tư’ (một事 thực cho phép dữ liệu được thu thập từ người theo dõi giả, vì hầu hết các phân tích tập trung vào hồ sơ và bình luận liên quan), mặc dù điều này không nên được coi là một tín hiệu ‘tin cậy’ trong trường hợp này.

‘Những người tham gia các nền tảng này quan tâm đến việc tạo ra một số lượng bài đăng tối thiểu để làm cho họ trở nên đáng tin cậy, ngoại trừ một số trường hợp (CT-4, CT-10). Những hồ sơ chất lượng thấp cho thấy sự mất cân bằng rất cao trong người theo dõi và người theo dõi, và số lượng bài đăng trung bình gần như bằng 0, thấp hơn nhiều so với hồ sơ CT.’

Dữ liệu

Các nhà nghiên cứu đã thu thập dữ liệu thông qua việc thực hiện khuôn khổ tự động hóa trình duyệt Selenium. Bộ dữ liệu kết quả bao gồm thông tin hồ sơ từ 1293 người dùng CT và 1307 người dùng không phải CT.

Sự thực rằng số lượng mẫu tương đối thấp này đã làm cho việc thiết lập Selenium ở ‘tốc độ con người’ trong một khoảng thời gian hợp lý trở nên khả thi. Ngoài ra, các tác giả lưu ý, sức mạnh đại diện / giải thích của các kỹ thuật học bán giám sát phù hợp rất tốt với các bộ dữ liệu nhỏ. Sau khi thử nghiệm, vì mục đích đầy đủ, với một mô hình được giám sát đầy đủ, các nhà nghiên cứu kết luận:

‘[Kết quả] trong chế độ bán giám sát không khác biệt đáng kể so với những kết quả trong cách giám sát đầy đủ. Điều này cho thấy rằng các hồ sơ CT chia sẻ các đặc điểm rất tương tự, và rằng thuật toán có thể hội tụ [qua một lượng nhỏ] dữ liệu đã được gắn nhãn.’

Các tác giả đã thu thập tất cả dữ liệu có sẵn từ mã nguồn của các trang hồ sơ của người dùng ‘bị nhiễm’, bao gồm cả chi tiết thường bị che giấu khi được hiển thị, chẳng hạn như phần tử #videos.

Sau đó, họ đã tiền xử lý các tính năng dữ liệu bằng cách loại bỏ những tính năng có giá trị zero hoặc phương sai thấp, và cuối cùng đã chuyển đổi bất kỳ dữ liệu danh mục hoặc không phải số thành các tính năng số hoặc Boolean nghiêm ngặt.

Đặc điểm của bộ dữ liệu cuối cùng.

Đặc điểm của bộ dữ liệu cuối cùng.

Phương pháp và Khám phá

Ngoài Selenium, các công nghệ được sử dụng trong các thí nghiệm bao gồm: một phiên bản của SpaCy được thực hiện với một đường ống chuyển đổi; một phân loại tự đào tạo của scikit learn; và khuôn khổ Instaloader.

Không có phần ‘kết quả’ thông thường trong bài báo mới, vì nó liên quan đến một mục tiêu (tức là, suy luận tự động của các tài khoản Instagram ‘bị nhiễm’) mà đi chệch khỏi tâm điểm quan tâm chính (tức là, suy luận tự động của hoạt động bot tự động trên Instagram), có nghĩa là không có công việc trước đó tương tự để so sánh.

Các nhà nghiên cứu đã áp dụng một loạt các phương pháp trên người dùng được mua, (những người họ cảm thấy thoải mái khi mô tả là ‘giả’ hơn là chỉ ‘không phải CT’, vì những tài khoản thực sự này đang thực hiện các hoạt động tương tác không tự nhiên, trả phí), trên một loạt các công nghệ liên quan đến Xử lý Ngôn ngữ Tự nhiên.

Trong số các khía cạnh được nghiên cứu có phân tích ngôn ngữ (trong thế giới CT, gần như luôn mặc định là tiếng Anh, mặc dù các nền tảng CT cũng cung cấp người theo dõi không phải tiếng Anh theo vị trí địa lý); số lượng bình luận (trong đó người dùng giả gắn rất gần với tần suất của người dùng thực, vì sợ bị phát hiện); và phân tích từ chung:

Đám mây từ của người dùng giả và thực.

Đám mây từ của người dùng giả và thực.

Bài báo lưu ý rằng sự phổ biến của từ ‘dokter’ (xem hình ảnh trên) trong các tài khoản giả dường như liên quan đến một chiến dịch nội bộ cụ thể:

‘“Dokter” [xuất hiện] trong 1069 bình luận riêng biệt. Bằng cách điều tra thêm các tài khoản spam từ [từ] này, chúng tôi đã tìm thấy một phần nhỏ của những gì dường như là một botnet có mục tiêu spam “các bác sĩ Instagram” accounts. Tất cả các hồ sơ bác sĩ này đều có liên kết WhatsApp kinh doanh mà, khi được nhấp vào, sẽ bắt đầu một cuộc trò chuyện với một tin nhắn để hoàn thành.’

Như far như các nhà nghiên cứu có thể suy luận, hiện tượng kỳ lạ này có thể là một tàn dư của một botnet lớn mà họ tình cờ gặp phải khi tìm kiếm hoạt động từ người dùng Instagram thực sự.

Tổng cộng, các nhà nghiên cứu đã thu thập 603.007 bình luận từ các bài đăng trên 248.388 người dùng Instagram duy nhất, trong đó, theo ước tính của các tác giả, 55.719 là tài khoản crowdturfing.

Bài báo lưu ý với sự quan tâm đến sự thống trị của các chủ đề liên quan đến nữ trong dữ liệu thu thập được. Sau khi sử dụng GPU-PDMM (một kỹ thuật được phát triển cho các bài đăng ngắn bắt buộc trên Twitter) để trích xuất 12.830 bình luận phù hợp từ một tập hợp các bình luận có sẵn gồm 121.822 bình luận, thuật toán đã tìm thấy rằng khi xem xét nội dung từ 12 nam và 8 nữ, đa số các bình luận liên quan đến chủ đề liên quan đến nữ.

10 chủ đề hàng đầu được trích xuất từ các bình luận giả trong một trong các thí nghiệm của các nhà nghiên cứu.

10 chủ đề hàng đầu được trích xuất từ các bình luận giả trong một trong các thí nghiệm của các nhà nghiên cứu.

Các nhà nghiên cứu kết luận:

‘[Trong khi] Instagram và cộng đồng nghiên cứu tập trung rất nhiều vào việc phát hiện bot và tài khoản tự động, chúng tôi tin rằng nên tiến hành nhiều nghiên cứu hơn về các hoạt động CT, những hoạt động này ảnh hưởng tiêu cực đến tiếp thị influencer, nền tảng Instagram và hầu hết người dùng của nó.’

 

* Liên kết TrustPilot của các nhà nghiên cứu được trích dẫn đã bị bỏ qua.

Được xuất bản lần đầu vào ngày 28 tháng 6 năm 2022.

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai