Anderson 视角

使用机器学习破解CAPTCHA以实现暗网研究

mm
将 Unite.AI 添加到您在 Google 上的首选来源

来自美国的联合学术研究项目开发了一种方法来破解CAPTCHA测试,据报道,这种方法比使用生成对抗网络(GAN)来解码视觉复杂挑战的类似最先进的机器学习解决方案表现更好。

测试新系统与当前最佳框架,研究人员发现他们的方法在精心策划的真实世界基准数据集上实现了94.4%以上的成功率,并且能够在自动解决CAPTCHA挑战的过程中消除人工参与,最大尝试次数为三次,用于导航高度受CAPTCHA保护的新兴暗网市场。

DW-GAN架构。来源:https://arxiv.org/pdf/2201.02799.pdf

DW-GAN工作流程。 来源:https://arxiv.org/pdf/2201.02799.pdf

作者认为,他们的方法代表了网络安全研究人员的突破,因为传统上,他们不得不承担人工成本来手动解决CAPTCHA,通常通过众包平台,如亚马逊机械土耳其(AMT)。

如果系统能够证明其适应性和弹性,它可能进一步为更自动化的监督系统铺平道路,并为TOR网络的索引和网页抓取做出贡献。这将使大规模和高容量的分析成为可能,以及新的网络安全方法和技术的发展,这些方法和技术到目前为止都被CAPTCHA防火墙所阻碍。

该论文题为《使用生成对抗学习进行主动网络威胁情报的暗网基于文本的CAPTCHA反制》,由亚利桑那大学、南佛罗里达大学和乔治亚大学的研究人员撰写。

影响

由于系统——称为暗网GAN(DW-GAN,可在GitHub上找到)——显然比其前身更具性能,因此有可能它将被用作一种通用方法来克服(通常不太困难的)标准网络上的CAPTCHA材料,无论是这种具体实现还是基于新论文概述的总体原理。然而,由于GitHub存储空间有限,目前需要联系首席作者宁张才能获取框架相关的数据。

由于DW-GAN具有“积极”的使命来破解CAPTCHA(就像TOR本身最初具有保护军事通信和后来保护记者的积极使命一样),而CAPTCHA既是合法的防御手段(经常和有争议地被无处不在的CDN巨头CloudFlare使用),也是非法暗网市场的常用工具,因此这种方法可以被认为是一种“平衡”技术。

作者自己承认DW-GAN具有更广泛的用途:

‘[虽然]这项研究主要关注暗网CAPTCHA作为一个更具挑战性的问题,但本研究中提出的方法预计可以在不失一般性的情况下应用于其他类型的CAPTCHA。’

DW-GAN或类似系统可能需要被广泛和明显地传播,以促使暗网市场寻求更难以被机器解决的解决方案,或者至少定期演化其CAPTCHA配置,这是一个“冷战”场景。

动机

正如论文所观察到的,暗网是与网络攻击相关的黑客情报的主要来源,据估计,网络攻击将在2025年使全球经济损失10万亿美元。因此,洋葱网络仍然是非法暗网社区相对安全的环境,他们可以通过各种方法抵御入侵者,包括会话超时、Cookie和用户身份验证。

两种CAPTCHA,使用模糊背景和倾斜字体使其更难被机器识别。

两种CAPTCHA,使用模糊背景和倾斜字体使其更难被机器识读。

然而,作者观察到,这些障碍中没有一个比暗网社区中浏览体验中出现的CAPTCHA阵列更大:

‘虽然大多数这些措施可以通过在爬虫程序中实施自动化的对抗措施来有效地规避,但CAPTCHA是暗网中最大的反爬虫措施,不能轻易被规避,因为它通常需要高级别的认知能力,这些能力通常不被自动化工具所具备。’

基于文本的CAPTCHA并不是唯一可用的选项;还有许多我们熟悉的变体,它们挑战用户解释视频、音频,尤其是图像。然而,正如作者所观察到的,基于文本的CAPTCHA目前是暗网市场的首选挑战,并且是使TOR网络更容易被机器分析的自然起点。

架构

虽然中国西北大学之前的方法使用生成对抗网络从CAPTCHA平台中推导出特征模式,但新论文的作者指出,这种方法依赖于对光栅化图像的解释,而不是对挑战中识别的字母进行更深入的检查;并且DW-GAN的有效性不会受到暗网CAPTCHA中通常存在的无意义单词(和数字)长度的影响。

DW-GAN使用一个四阶段流水线:首先捕获图像,然后将其输入到一个使用训练有素的CAPTCHA样本的GAN的背景去噪模块中,因此能够将字母与它们所依赖的扰乱背景区分开来。然后,使用GAN-based提取从剩余噪音中进一步过滤掉提取的字母。

接下来,使用轮廓检测算法对提取的文本执行分割,将其分解为看似组成字符的部分。

字符分割隔离像素组并尝试使用边界跟踪进行识别。

字符分割隔离像素组并尝试使用边界跟踪进行识别。

最后,通过卷积神经网络(CNN)对“猜测”的字符段进行字符识别。

有时,字符可能会重叠,这是一种超级字距调整,旨在欺骗机器系统。因此,DW-GAN使用基于间隔的分割来增强和隔离边界,有效地分离字符。由于这些单词通常是无意义的,因此没有语义上下文来帮助这个过程。

结果

DW-GAN被测试用于三个不同暗网数据集,以及一个流行的CAPTCHA合成器。这些图像来源的暗网市场包括两个卡交易店Rescator-1和Rescator-2,以及一个新兴市场Yellow Brick(据报道后来在DarkMarket关闭后消失)。

三个数据集以及开源CAPTCHA合成器的CAPTCHA样本。

三个数据集以及开源CAPTCHA合成器的CAPTCHA样本。

根据作者的说法,用于测试的数据由网络威胁情报(CTI)专家推荐,基于它们在暗网市场上的广泛传播。

测试每个数据集涉及开发一个面向TOR的蜘蛛程序,用于收集500个CAPTCHA图像,这些图像随后由CTI顾问标记和策划。

设计了三个实验。第一个实验评估了DW-GAN在标准SOTA方法下的CAPTCHA挑战的普遍性能。对手方法包括来自伊朗和英国的学术联合努力的图像级CNN预处理,包括灰度转换、归一化和高斯平滑;来自英国牛津大学的字符级CNN,使用间隔分割;以及来自英国牛津大学的图像级CNN。

DW-GAN的结果,第一实验,相比之前的最先进方法。

DW-GAN的结果,第一实验,相比之前的最先进方法。

研究人员发现DW-GAN能够在所有情况下改进先前的结果(见上表)。

第二个实验是一个消融研究,其中活动框架的各个组件被删除或禁用,以排除外部或次要因素影响结果的可能性。

消融研究的结果。

消融研究的结果。

在这里,作者也发现,禁用架构的关键部分会在几乎所有情况下降低DW-GAN的性能(见上表)。

第三个离线实验比较了DW-GAN与基准图像方法和两个字符级方法的有效性,以确定DW-GAN的字符评估在处理无意义CAPTCHA单词时的有用性(在这种情况下,单词长度是任意的,而不是预定义的)。在这些情况下,CAPTCHA长度在4到7个字符之间变化。

对于这个实验,作者使用了一个包含50,000个CAPTCHA图像的训练集,其中5,000个图像保留用于测试,按照典型的90/10比例分配。

在这里,DW-GAN也优于先前的方法:

对暗网市场的现场测试

最后,DW-GAN被部署到(当时活跃的)黄砖暗网市场。对于这个测试,开发了一个集成DW-GAN到其浏览功能中的TOR网络浏览器,自动解析CAPTCHA挑战。

在这种情况下,CAPTCHA每15个HTTP请求一次呈现给自动爬虫。爬虫能够索引黄砖中1,831个违法物品,包括1,223种与药物相关的产品(包括阿片类药物和可卡因),44个黑客包,和9个伪造的文件扫描。总共,系统能够识别286个与网络安全相关的物品,包括102张被盗的信用卡和131个被盗的帐户登录名。

作者指出,DW-GAN在所有情况下都能够在三次或更少的尝试中破解CAPTCHA,并且需要76分钟的处理时间来处理所有1,831个产品的CAPTCHA。没有人需要介入,也没有发生端点故障的情况。

作者指出,正在出现比文本CAPTCHA更具复杂性的挑战,包括一些似乎以图灵测试为模型的挑战,并且观察到DW-GAN可以被增强以适应这些新趋势,当它们变得流行时。

 

*完全自动化的图灵测试,以区分计算机和人类

首次发表于2022年1月11日。

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直到其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:[email protected]