Anderson 视角
预测新的垃圾邮件域名通过机器学习

法国的研究人员设计了一种方法来识别新注册的域名,这些域名可能会被大量垃圾邮件发送者用于“打砸抢”式的垃圾邮件发送——有时,甚至在垃圾邮件发送者发送第一封不想要的电子邮件之前。
这种技术是基于对发送者策略框架(SPF)的分析,SPF是一种用于验证电子邮件来源的方法。
由于使用了被动DNS(域名系统)传感器,研究人员能够从西雅图的Farsight公司获得近实时的DNS数据,包括TXT记录的SPF活动数据。
使用最初为处理不平衡的医疗数据而设计的类权重算法,并在scikit-learn机器学习Python库中实现,研究人员能够在几分钟内检测到75%的垃圾邮件域名,甚至在垃圾邮件发送之前。
论文指出:
‘使用单个TXT记录请求,我们可以检测到75%的垃圾邮件域名,可能在垃圾邮件发送之前。因此,我们的方案带来了重要的反应速度:我们可以在任何邮件发送之前和DNS流量激增之前检测到垃圾邮件发送者,并且表现良好。’
研究人员声称,他们的技术可以被添加到现有的垃圾邮件检测系统中,以提高性能,而无需增加显著的计算开销,因为该系统依赖于从现有的近实时DNS源中被动推断的SPF数据。
论文题为《使用被动DNS和SPF的垃圾邮件域名的早期检测》,由格勒诺布尔大学的三位研究人员撰写。
SPF活动
SPF旨在通过验证已注册和授权的IP地址是否用于发送电子邮件来避免电子邮件地址的欺骗。

在这个SPF示例中,’Alice’向’Bob’发送了一封普通的电子邮件,而攻击者’Mallory’试图冒充Alice。两者都从自己的域名发送邮件,但只有Alice的服务器被注册为发送Alice的邮件,因此Mallory的欺骗在他的假邮件未通过SPF验证时被挫败。 来源:https://arxiv.org/pdf/2205.01932.pdf
其他电子邮件验证方法包括域名密钥识别邮件(DKIM)签名和基于域名的消息身份验证、报告和一致性(DMARC)。
所有三个方法都必须在域名注册商处注册为TXT记录(配置设置)。
垃圾邮件和烧毁
垃圾邮件发送者在这方面表现出“签名行为”。他们的意图(或者说,他们活动的附带效果)是“烧毁”域名和其IP地址的声誉,通过大量发送垃圾邮件,直到网络服务提供商采取行动或相关IP地址被列入流行的垃圾邮件过滤器,从而变得对当前发送者无用,并且对未来IP地址的所有者来说也是有问题的。

一个狭窄的机会窗口:新垃圾邮件域名被SpamHaus和其他监控服务禁止和变得无用的时间(以小时为单位)。
当域名位置不再可行时,垃圾邮件发送者会转移到其他域名和服务,必要时重复该过程,使用新的IP地址和配置。
数据和方法
研究中研究的域名涵盖2021年5月至8月的时间段,由Farsight提供。仅考虑新注册的域名,因为这符合垃圾邮件发送者的惯用手法。
域名列表是基于ICANN中央区域数据服务(CZDS)构建的。使用SURBL和SpamHaus项目的黑名单信息来实现对潜在问题的新域名注册的近实时识别——尽管作者承认,垃圾邮件列表的不完善性可能导致良性域名被错误地归类为潜在的垃圾邮件来源。
在捕获到新注册域名的DNS TXT查询后,只保留具有有效SPF数据的查询,提供算法的基准事实。

SPF具有多个可用的功能;新论文发现,虽然“良性”域名所有者通常使用+include机制,但垃圾邮件发送者对(现在已弃用的)+ptr功能的使用率最高。

垃圾邮件发送者与标准使用的SPF规则使用情况比较。
+ptr查找将发送邮件的IP地址与主机名(例如GoDaddy)之间的关联进行比较。如果发现主机名,其域名将与最初用于引用SPF记录的域名进行比较。
垃圾邮件发送者可以利用+ptr的明显严谨性来使自己看起来更可信,而实际上,进行大规模+ptr查找所需的资源会导致许多提供商完全跳过该检查。
简而言之,垃圾邮件发送者使用SPF以确保在“打砸抢”操作开始之前获得一个机会窗口,这代表了一个可以通过机器分析推断的特征签名。

垃圾邮件域名的特征SPF关系。
由于垃圾邮件发送者经常转移到非常接近的IP范围和资源,研究人员开发了一个关系图来探索IP范围和域名之间的相关性。该图可以根据SpamHaus和其他来源的新数据几乎实时更新,从而随着时间的推移变得更加有用和完整。
研究人员指出:
‘这些结构的研究可以突出潜在的垃圾邮件域名。在我们的数据集中,我们发现了[结构],其中几十个域名使用了相同的[SPF]规则,绝大多数都出现在垃圾邮件黑名单上。因此,假设剩余的域名可能尚未被检测到或尚未被激活为垃圾邮件域名是合理的。’
结果
研究人员将他们的方法与SpamHaus和SURBL在50小时内的垃圾邮件域名检测延迟进行了比较。他们报告称,对于70%的垃圾邮件域名,他们的系统更快,尽管他们承认26%的识别出的垃圾邮件域名在接下来的一个小时内出现在商业黑名单中。30%的域名在出现在被动DNS源中时已经在黑名单中。
作者声称,他们的方法在单个DNS查询的基础上实现了79%的F1分数,而像Exposure这样的竞争方法可能需要一周的预分析。
他们观察到:
‘我们的方案可以在域名生命周期的早期阶段应用:使用被动(或主动)DNS,我们可以获得新注册域名的SPF规则,并立即对其进行分类,或者等待我们检测到该域名的TXT查询,并使用难以规避的时间特征来改进分类。’
并继续:
‘[我们的]最佳分类器可以检测到85%的垃圾邮件域名,同时保持低于1%的假阳性率。检测结果很显著,考虑到分类仅使用域名SPF规则及其关系的内容,以及基于DNS流量的难以规避的特征。 ‘
‘分类器的性能保持高,即使它们只给出从单个TXT查询(被动或主动查询)中收集的静态特征。’
要查看有关新方法的演示,请查看下面的嵌入视频:
最初发布于2022年5月5日。












