Anderson의 관점

인공지능, 인스타그램 마약 딜러를 거의 95%의 정확도로 식별

mm
Unite.AI를 Google의 선호 소스에 추가

미국 연구진은 인스타그램에서 마약 딜러의 계정과 게시물을 식별할 수 있는 다중 모드 기계 학습 시스템을 개발했습니다. 이 시스템은 이미지 콘텐츠를 포함한 다양한 콘텐츠를 분석하여 마약 딜러를 식별합니다.

연구는 연구로 명명되었으며, 웨스트 버지니아 대학교의 3명과 케이스 웨스턴 리저브 대학교의 1명이 참여한 공동 연구입니다.

이 프로젝트를 위해 연구진은 4000개의 사용자 계정을 포함하는 데이터베이스를 생성했습니다. 이 중 1,400개의 계정은 마약 딜러의 계정으로, 나머지는 식별 프로세스를 테스트하기 위한 대조군으로 사용됩니다.

다중 모드 딜러 감지 시스템의 프레임워크. 모델에는 게시된 이미지, 게시된 댓글, 홈 페이지 이미지 및 바이오 그래프 텍스트가 포함됩니다. 출처: https://arxiv.org/pdf/2108.08301.pdf

다중 모드 딜러 감지 시스템의 프레임워크. 모델에는 게시된 이미지, 게시된 댓글, 홈 페이지 이미지 및 바이오 그래프 텍스트가 포함됩니다. 출처: https://arxiv.org/pdf/2108.08301.pdf

초기 테스트 결과, 이 기술은 거의 95%의 정확도로 인스타그램 기반 마약 딜러를 식별할 수 있습니다. 또한 이 프레임워크는 지리적 요인과 특정 마약 유형의 식별을 사용하여 불법 마약 판매와 관련된 활동의 변경되는 지표를 발견하기 위한 해시태그 기반 커뮤니티 감지 프로젝트를 설계했습니다.

데이터베이스를 개발하기 위해 수동 레이블링이 필요했기 때문에, 이 프레임워크에는 사용자 친화적인 주석 시스템이 포함되어 있습니다. 이 시스템은 Google의 Bidirectional Encoder Representations from Transformers (BERT)와 ResNet 기반 이미지 분류를 사용합니다.

IDDIG의 웹 기반 주석 시스템

IDDIG의 웹 기반 주석 시스템

마약 관련 대화에서 딜러 식별

레크리에이션 마약은 인스타그램과 같은 소셜 미디어 플랫폼에서 다양한 맥락에서 논의됩니다. 많은 게시자는 소비자이기보다 판매자입니다. 지역의 규정과 처방약의 가능성에 따라, 그들은 또한 합법적인 소비자일 수 있습니다.

프로젝트 데이터베이스에 포함된 마약 관련 이미지

프로젝트 데이터베이스에 포함된 마약 관련 이미지

또한, 인스타그램에서 마약 딜러의 행동은 항상 명시적이지 않습니다. 종종 딜러는 멀티미디어 게시물을 통해 광고하는 대신, 댓글과 해시태그를 통해 광고합니다. 이는 일반적으로 인간과 기계 오버사이트 시스템 모두에게 더 쉽게 식별할 수 있는 ‘마약 거래’ 콘텐츠입니다. 따라서 해시태그와 댓글 활동은 새로운 시스템에서 식별 자산으로 통합되었습니다.

인스타그램 게시물에서 다양한 마약 거래 패턴

인스타그램 게시물에서 다양한 마약 거래 패턴

BERT 기반 텍스트 분석과 ResNet 기반 이미지 조사 외에도, 이 연구는 2016년 IEEE 논문에서 제안된 다중 모드 데이터 퓨전을 특징으로 합니다.

데이터베이스를 위한 해시태그

프로젝트의 웹 스크래핑 메커니즘은 도메인 전문가가 식별한 200개의 마약 관련 해시태그를 추적하여 마약 딜러 계정을 식별하기 시작합니다. 해시태그 검색 API를 사용합니다.

해시태그를 사용하는 게시물의 이미지는 VGG-16 기반의 이진 분류 모델을 사용하여 분류됩니다. 알려진 마약 이미지와 상관관계가 있는 이미지는 시스템에 저장되고, 게시물은 나중에 검색할 수 있도록 JSON 객체로 변환됩니다.

그런 다음 프레임워크는 해시태그에 참여한 게시자의 홈 페이지에 포함된 관련 댓글과 정보(텍스트와 이미지 모두)를 확장합니다. 이렇게 하면 10,000개의 잠재적인 게시물과 23,034개의 사용자 홈 페이지가 데이터셋으로 흡수됩니다.

마약 관련 해시태그는 패턴 감지와 당국의 주의를 피하기 위해不断으로 진화합니다. 따라서 플래그된 게시물에서 새로운 해시태그가 이전에 수집된 해시태그 집합의 일부가 아닌 경우, 이를 미래 사용을 위해 기록합니다.

웹 기반 인터페이스(위 이미지 참조)에서 레이블링한 후, 다중 모드 데이터 퓨전은 모든 게시물이 네 가지 데이터 유형 중 하나를 포함하지 않을 수 있음을 고려해야 합니다. 따라서 알고리즘은 16개의 하위 항목 중 9개를容認하고, 결합 및 퓨전된 기능을 사용하여, 누락된 요소는 계산에서 0으로 대응합니다.

NetworkX

마지막으로 데이터셋은 뉴 멕시코의 로스 알라모스 국립 연구소에서 2008年に 제안된 NetworkX Python 언어 패키지를 사용하여 활용됩니다. NetworkX는 1,000만 개 이상의 노드를 포함하는 그래프를 포함한 대규모 작업에서 광범위하게 사용되었습니다.

데이터셋의 해시태그를 하나의 게시물에 포함된 것으로 간주하여, 연구진은 NetworkX에서 분석할 수 있는 무방향 마약 관련 그래프를 생성할 수 있었습니다.

IDDIG 데이터셋은 다중 모드 데이터 퓨전, 다중 소스 데이터 퓨전 및 쿼드러플 기반 퓨전을 포함한 다양한 프로토콜에서 테스트되었으며, 인간-루프 식별 방법과 비교하여 마약 관련 게시물 및 사용자를 식별하는 데 약 95%의 정확도를 달성했습니다.

또한 인스타그램에서 마약 관련 활동의 지리적 분포를 나타내는 광범위한 지표를 보여주는 ‘선버스트 플롯’을 생성할 수 있었습니다. 이는 유사한 프로젝트에서 향후 조사할 수 있는 다른 가능성 있는 연구 방향입니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai