Anderson 视角
AI识别Instagram毒品贩子,准确率近95%

美国研究人员开发了一种多模态机器学习系统,能够通过分析各种内容(包括图像内容)来识别Instagram上毒品贩子的账户和帖子。
该研究由西弗吉尼亚大学的三名研究人员和凯斯西储大学的一名研究人员合作完成,题为《使用大规模多模态数据融合识别Instagram上的非法毒品贩子》。
为了促进该项目的进行,研究人员创建了一个名为《识别Instagram上的毒品贩子》(IDDIG)的数据库,包含4000个用户账户,其中1400个账户属于毒品贩子,剩余的作为控制组用于测试识别过程。

多模态毒品贩子检测系统的框架。该模型包括发布的图像、发布的评论,以及主页图像和生物文本中的信息。 来源:https://arxiv.org/pdf/2108.08301.pdf
初步测试结果显示,该技术在识别Instagram上的毒品贩子方面具有几乎95%的准确率,该框架还导致了一个基于标签的社区检测项目,旨在发现与非法毒品销售相关的活动的变化标志,利用地理因素和特定毒品类型的识别。
由于项目开发的数据库需要手动标记,因此该框架具有一个用户友好的注释系统,使用基于Google的双向编码器表示的BERT分类系统以及ResNet-based图像分类。
在与毒品相关的对话中识别毒品贩子
娱乐性毒品在Instagram等社交媒体平台上被广泛讨论。许多发布这些内容的人是消费者而不是卖家。根据他们所在地区的法规以及可能的处方药,即使在不同毒品立法的地区,他们也可能是《合法》消费者。

项目数据库中的与毒品相关的图像
另外,毒品贩子在Instagram上的行为并不总是明显;经常他们通过评论和标签进行广告,而不是多媒体帖子,这通常更容易被识别为“毒品交易”内容,对于人工和机器监督系统都是如此。因此,标签和评论活动已被纳入新的系统作为识别资产。
除了基于BERT的文本分析和基于ResNet的图像调查外,该工作还融合了特征级多模态数据融合,如2016年IEEE 论文 判别相关分析:多模态生物识别的实时特征级融合中所述。
标签作为数据库的种子
该项目的网页抓取机制从跟踪由领域专家识别的200个与毒品相关的标签开始,使用 标签搜索 API。
使用这些标签的帖子中的图像然后使用VGG-16-based二元 分类模型 进行分类。与已知毒品图像相关的图像然后被保存在系统中,并将帖子转换为JSON对象以备后续检索。
然后,框架扩展到相关评论和信息(包括文本和图像),这些信息包含在参与标签的发布者的主页中,并且这些内容已被标记为与毒品相关。在这种方式下,10,000个潜在帖子和23,034个用户主页被纳入数据集。
由于与毒品相关的标签不断演变以避免模式检测和引起当局的注意,因此在标记的帖子中发现的任何新标签(这些标签不属于种子标签集合)都会被记录下来以备将来使用。
在网页界面(见上图)中标记后,多模态数据融合必须容忍这样一个事实:并非所有帖子都包含四种可能的数据类型中的所有数据。因此,算法能够容忍16个子点中的9个,使用串联和融合特征,其中缺失元素将在计算中对应为零。
NetworkX
最终,数据集通过 NetworkX Python语言包 进行利用,该包由新墨西哥州的洛斯阿拉莫斯国家实验室于2008年提出。NetworkX已被广泛应用于大规模操作,包括具有超过1000万个节点的图表。
通过将数据集中的标签视为一个帖子的一部分,研究人员能够为NetworkX分析生成一个无向的毒品相关图。
IDDIG数据集已在多种协议中进行了测试,包括多模态数据融合、多源数据融合和四元融合,并且在识别毒品相关帖子和用户方面实现了高达95%的准确率,与人工在循环中的识别方法相比。

此外,研究人员还能够生成“日晕图”以显示Instagram上毒品相关活动的地理分布的广泛指标,以及类似项目中可能的其他未来研究方向。















