Anderson의 관점

인스타그램 크라우드터핑을 식별하는 머신 러닝

mm
Unite.AI를 Google의 선호 소스에 추가

이탈리아와 이란의 연구자들은 인스타그램 플랫폼에서 ‘크라우드터핑’ 활동을 인식할 수 있는 첫 번째 머신 러닝 시스템을 개발했다고 주장한다. 크라우드터퍼는 프로필 빌딩 서비스를 제공하는 플랫폼에 실제 사람들을 고용하여 판매하는 활동이다.

새로운 방법은 약 95%의 정확도 점수를 보이며, 자연어 처리(NLP) 시스템에서 반감독 학습을 사용한다.

저자들은 자신들의 시스템이 비.bot 계정에서 가짜, 유료 프로필 참여와 부스트를 신뢰성 있게 식별할 수 있는 첫 번째 크라우드터핑 탐지 시스템이라고 주장한다.

이를 위해 저자들은 11개의 크라우드터핑 플랫폼 제공업체에서 1293개의 크라우드터핑 프로필을 구입하여 데이터를 수집했다. 인스타그램은 효과적인 반.bot 조치를 시행하고 있기 때문에, 저자들은 상업적인 목적으로 플랫폼의 사용자 기반을 악용하려는 사람들이 실제로 영향력 있는 인스타그램 사용자에게 유료로 프로필을 구축하도록 지시한다고 주장한다.

모델을 훈련한 후, 저자들은 20명의 메가 인플루언서(100만 명 이상의 팔로워가 있는 사용자)의 참여 프로필을 분석하여 그들의 참여 중 20% 이상이 인공적이라는 결론을 내렸다.

논문은 ‘트루먼 쇼에 우리는 모두 있는가? 셀프 트레이닝을 통해 인스타그램 크라우드터핑을 식별하다’라는 제목을 가지고 있으며, 이탈리아의 파도바 대학교와 이란의 이맘 레자 대학교의 5명의 연구자에 의해 작성되었다.

인스타그램 약관 위반

트위터와는 달리, 인스타그램은 연구를 지원하기 위해 API나 데이터 덤프를 제공하지 않으며, 약관에서 기계적인 브라우징을 금지한다. 따라서 연구자들의 첫 번째 작업은 기관 검토委员会에서 예외를 얻는 것이었다. 이는 이전 연구에서 유사한 접근 방식을 사용하여 지하 활동을 조사한 결과였다.

크라우드터핑 서비스는 연구를 위해 생성된 신선한 인스타그램 계정에 구입되었으며, 모든 계정은 실험이 끝난 후 삭제되었다. 영향력 있는 계정이나 크라우드터핑 플랫폼 서비스는 이름이 명시되지 않았다.

또 다른 윤리적인 장애물은 연구자들이 조사 중인 영향력 있는 계정의 동의를 얻을 수 없다는 것이었다. 이는 호손 효과(즉, 영향력 있는 계정의 행동을 변경할 수 있음)로 인해 발생했으며, 이 예외는 또한 IRB에 의해 부여되었다.

마지막으로, 인스타그램은 수동 데이터 수집을 허용하므로, 연구자들은 자동화된 스크레이핑 도구를 인간의 속도로 설정하여 5개월 동안 데이터를 수집했다.

인간을 판매하는 사람들

연구자들은 11개의 제공업체에서 각 100개의 가짜 팔로워 프로필을 구입했다.

‘모든 제공업체는 팔로워가 타겟 프로필에 좋아요와 댓글을 남겨서 참여도를 높여주는 것을 보장한다. 이 프로필은 높은 품질의 팔로워로 식별되며, 일반적으로 기본 가짜 프로필보다 더 비싸다. 이러한 제공업체의 신뢰성은 TrustPilot과 같은 유명한 리뷰 플랫폼에서 지원된다.’

논문에서 제공된 통계, 각 제공업체는 실제 세계의 영향력 있는 계정의 시장이다. 이 표는 제공업체에서 보고된 정보와 연구자들이 각 제공업체에서 구입한 100개의 프로필을 분석하여 얻은 정보를 요약한다.

논문에서 제공된 통계, 각 제공업체는 실제 세계의 영향력 있는 계정의 시장이다. 이 표는 제공업체에서 보고된 정보와 연구자들이 각 제공업체에서 구입한 100개의 프로필을 분석하여 얻은 정보를 요약한다.

‘대부분의 제공업체는 몇 시간 내에 팔로워를 제공한다. 또한 팔로워가 떨어지는 경우 새로운 팔로워를 제공하여 고객이 구입한 팔로워 수를 유지하거나 증가시킨다.’

연구자들은 일부 신선한 인스타그램 계정이 1개월 후에 15-20%의 크라우드터핑 팔로워를 잃었다고 보고했지만, 일부 경우에는 예상보다 더 많은 팔로워를 얻었다고 한다. 가장 비싼 크라우드터핑 제공업체(표 상의 CT-10)의 경우, 1개월 후에 3명의 팔로워만이 손실되었다.

데이터

연구자들은 Selenium을 사용하여 데이터를 수집했다. 결과 데이터셋에는 1293개의 크라우드터핑 프로필과 1307개의 비-크라우드터핑 사용자 프로필의 정보가 포함되어 있다.

저자들은 모든 사용 가능한 데이터를 ‘손상된’ 사용자의 프로필 페이지 소스 코드에서 수집했으며, 일반적으로 렌더링 시 숨겨진 세부 정보도 포함한다.

최종 데이터셋의 특징.

최종 데이터셋의 특징.

방법과 탐색

연구자들은 Selenium 외에도 SpaCy, scikit-learn, Instaloader를 사용했다.

연구자들은 다양한 방법을 사용하여 구매한 사용자에 대한 언어 분석, 댓글 수, 일반 단어 분석 등을 수행했다.

가짜 사용자와 실제 사용자의 워드 클라우드.

가짜 사용자와 실제 사용자의 워드 클라우드.

‘“dokter”라는 단어가 1069개의 다른 댓글에서 나타났다. 이 단어가 스팸되는 계정을 조사한 결과, 작은 봇넷이 발견되었으며, 이 봇넷의 목적은 인스타그램 의사 계정에 스팸을 보내는 것이다. 모든 의사 계정에는 WhatsApp 비즈니스 링크가 있으며, 링크를 클릭하면 완료 메시지와 함께 채팅이 시작된다.’

연구자들은 총 603,007개의 댓글을 248,388개의 고유한 인스타그램 사용자로부터 수집했으며, 이 중 55,719개는 크라우드터핑 계정이라고 추정했다.

연구자들은 수집된 데이터에서 여성 주제가 우세하다는 점에 관심을 보였다. GPU-PDMM을 사용하여 121,822개의 댓글 중 12,830개의 적합한 댓글을 추출했으며, 알고리즘은 12명의 남성과 8명의 여성의 댓글을 분석한 결과, 대부분의 댓글이 여성 관련 주제에 관한 것으로 나타났다.

가짜 댓글에서 추출한 상위 10개 주제.

가짜 댓글에서 추출한 상위 10개 주제.

‘인스타그램과 연구 커뮤니티는 봇과 자동화된 계정을 탐지하는 데 많은 노력을 기울였지만, 우리는 크라우드터핑 활동에 대한 연구가 더 필요하다고 믿는다. 크라우드터핑 활동은 인플루언서 마케팅, 인스타그램 플랫폼, 그리고 대부분의 사용자에게 부정적인 영향을 미친다.’

* 연구자들이 인용한 TrustPilot URL은 생략되었다.

最初에 2022년 6월 28일에 게시되었다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai