Anderson의 관점

소셜 미디어 댓글 작성자의 재식별을 위한 머신 러닝

mm
Unite.AI를 Google의 선호 소스에 추가

존스 홉킨스 대학(Johns Hopkins University)의 연구진은 이전에 계정이 정지된 온라인 댓글 작성자나 여러 계정을 사용하여 온라인 커뮤니티를 조작하는 사용자를 식별하기 위한 딥 메트릭 접근 방식을 개발했습니다.

이 접근 방식은 NLP 연구자 알림 칸(Aleem Khan)이 주도한 새로운 논문에서 제시되었으며, 입력 데이터가 자동으로 또는 수동으로 주석이 달려 있지 않아도 되며, 이전 시도보다 더 나은 결과를 보여주며, 텍스트 샘플이 작거나 훈련 데이터에 없는 경우에도 개선된 결과를 제공합니다.

시스템은 간단한 데이터 증강 스키마를 제공하며, 다양한 크기의 임베딩을 높은 볼륨의 데이터셋에 훈련시킵니다. 이 데이터셋은 300만 개의 댓글과 100만 개의 사용자 계정을 포함합니다.

존스 홉킨스 재식별 시스템의 모델 아키텍처

존스 홉킨스 재식별 시스템의 모델 아키텍처

이 프레임워크는 Reddit 사용 데이터를 기반으로 하며, 텍스트 내용, 서브레딧 기능 및 게시 시간/날짜를 고려합니다. 이러한 세 가지 요인은 다양한 임베딩 방법을 사용하여 결합되며, 주의 메커니즘과 맥스 풀링 레이어를 사용하여 지원됩니다.

시스템은 텍스트 도메인에 중점을 두고 있지만, 연구진은 이 접근 방식이 비디오 또는 이미지 분석에도 적용될 수 있다고 주장합니다. 이는 유도된 알고리즘이 높은 수준에서 빈도 발생에 작동하기 때문입니다.

‘주제-이탈’을 피하는 방법

이와 같은 연구에서 빠질 수 있는 함정 중 하나는 여러 계정의 게시글에서 특정 주제나 테마의 반복을 과도하게 강조하는 것입니다. 사용자는 특정 생각이나 주제에 대해 반복적으로 글을 쓸 수 있지만, 주제는 시간이 지남에 따라 발전하고 변할 수 있습니다. 따라서 이러한 주제는 사용자의 身分을 식별하는 데 사용할 수 없습니다. 연구진은 이 잠재적인 함정을 ‘잘못된 이유로 옳은 결론’이라고 부릅니다.

훈련 방법론

시스템은 혼합 정밀도 훈련을 사용합니다. 이는 2018년 바이두와 엔비디아에서 제시한 혁신적인 방법으로, 16비트 부동 소수점 값을 사용하여 메모리 요구 사항을 절반으로 줄입니다. 데이터는 두 개의 V100 GPU에서 훈련되었으며, 평균 훈련 시간은 72시간이었습니다.

데이터셋

연구진은 2020년 Pushshift Reddit Corpus 데이터셋에서 300만 개의 Reddit 게시글을 추출했습니다. 이 데이터셋은 2015년 7월부터 2016년 6월까지 100~1000개의 게시글을 작성한 사용자의 게시글을 포함합니다.

이 데이터셋은 연구의 목적에 적합한 역사 길이를 제공하며, 연구의 범위 밖의 스팸 게시글의 영향을 줄입니다.

존스 홉킨스 재식별 프로젝트의 파생 데이터셋 통계

존스 홉킨스 재식별 프로젝트의 파생 데이터셋 통계

(NVDA )

결과

아래 이미지는 훈련 중에 1시간 간격으로 테스트한 순위 정확도의 누적 개선 사항을 보여줍니다. 6시간 후, 시스템은 이전 연구의 기준 성과를 초과합니다.

게시글 빈도作为 재식별 서명

이 결과는 또한 시스템이 텍스트 내용과 게시 시간/날짜만 사용하는 다른 댓글 또는 게시 시스템으로 쉽게 적용될 수 있음을 시사합니다. 연구진은 시스템이 서브레딧 기능을 제거해도 순위 정확도가 크게 영향을 받지 않는다는 것을 발견했습니다. 이는 시스템이 강력한 일반화를 제공함을 의미합니다.

연구 개발

연구진은 게시 시간의 분석에 대한 더 세부적인 접근 방식을 채택하여 시스템을 개발하고 싶어합니다. 이는 스팸 게시글을 더 효과적으로 제거하거나 자동화된 내용을 식별하는 데 도움이 될 수 있습니다.

연구진은 시스템의 성능이 데이터의 볼륨이 증가함에 따라 크게 개선된다는 것을 발견했습니다. 이는 시스템이 더 많은 데이터를 처리할수록 더 나은 성능을 제공함을 의미합니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai