Anderson 视角

在真正打击 AI 模型去审查之前,还要等多久?

mm
将 Unite.AI 添加到您在 Google 上的首选来源
Screen capture from The Matrix (1999), featuring 'warez' on optical media, hidden inside a book, about to be sold to a willing buyer. © Warner Bros. Used for commentary and illustrative purposes.

如果你年纪足够大,记得大约1995–2010年的盗版软件(warez)圈子,当时大量破解软件和提取的电影(在街头批发购买,或在高速宽带使大容量高速下载成为可能后,由业余盗版者自行收集)堆积在一堆沉重的DVD收藏中,那么新兴的“去审查”开源 AI 模型场景可能会让人感到熟悉。

From the 'golden age' of casual street trade in software and movies. Credit – Shankar.s. 'Pirated DVDs at PP street market' - https://www.flickr.com/photos/shankaronline/9163248097/in/photostream/ License - https://creativecommons.org/licenses/by/2.0/deed.en

来自软件和电影的街头随意交易的‘黄金时代’。致谢 – Shankar.s. ‘PP 街市的盗版 DVD’Source / License

那时,在软件租赁尚未成为常见消费模式之前,一小群但极为精英的“场景”软件爱好者出现,致力于破解应用程序,这些破解后会被投放到‘warez’新闻组,随后又进入种子分享群体。这些限制有时繁重,有时微不足道,但一旦破解后发布到网络,往往会留下不可磨灭的痕迹。

这正是当前开源大型语言模型(LLM)所发生的情况,它们经常且大规模地被剥离内置的安全过滤器,随后这些去审查的模型被共享到如此多的地方,以至于即使关闭“破解”源头,上游也无法影响这些模型的可获取性。

受惠者还是害群之马

问题是:你想以何种视角看待这些行为?与 warez 圈不同,似乎没有人像二三十年前的小型软件生产商那样被明确剥夺收入。

当然,在此类情况下原始许可条款常被违反*;然而,与 Black Forest Labs 等生成式 AI 模型厂商的部分权重发布不同,原始分发者并未把“低质量”版本当作升级到更强大仅 API 模型的路径;他们直接发布完整模型。

在大多数情况下,几乎没有人能在本地运行这些初始发布的模型,因为即使是配备 16–24GB 显存的高端 GPU,也难以应付其庞大的参数量。

因此,这些初始发布的模型很快会通过模型量化以及将权重转换为更轻量的格式(如 GGUF、AWQ、PTQ、EXL2 或面向 Apple 的 MLX)而转化为能够在消费级硬件上运行的精简版本。

虽然这些精简模型的性能不及原始完整模型(后者通常会在各种 GPU 农场上以商业方式提供),但它们至少掌握在用户手中,并且可以针对特定用户进行定制,这是“更好”模型所无法做到的。

随心所欲

其中一些方式显然是合法的,且通常符合上游许可范围,例如微调,使模型的权重专门倾向于用户注入的特定任务或领域。在硬盘空间允许的情况下,甚至可以对同一开源模型进行多次微调,以满足多样化任务的需求,就像一套专用的传统工具,而不是使用上游完整权重模型的“瑞士军刀”。

此外,设置兼容但训练数据不同的模型可以合并;或者通过轻量级 LoRA 滤镜在模型上叠加额外功能,而不会因微调而危及基础模型的原有能力。

然而,最吸引众多用户的修改,并且已比上述任何方法都更为简便的,是去除前述安全过滤器或护栏。

诚然,这会导致模型输出色情内容和恶意软件代码,但它也去除了许多用户认为过于严格(且常常出错)的限制集合。

One of many hilarious examples of Llama-2-7b-chat refusing reasonable requests on safety grounds, available at the source URL. Source - https://www.lesswrong.com/posts/pYcEhoAoPfHhgJ8YC/refusal-mechanisms-initial-experiments-with-llama-2-7b-chat

Llama-2-7b-chat 因安全理由拒绝合理请求的众多滑稽示例之一,可在源链接查看。 Source

Heretic

以最近颠覆模型去审查的软件 Heretic 为例,甚至可以降低模型倾向的“华丽”且冗长的文字水平。

Heretic gets to work on decensoring gpt-oss, though admittedly on a very well-specced machine that's unlikely to grace the average consumer's home – though it could be rented cheaply online, for the necessary duration of the process. Source - https://github.com/p-e-w/heretic

Heretic 开始对 gpt-oss 进行去审查,尽管实际上需要一台规格极高的机器,这在普通消费者家中不太可能出现——不过可以在网上以低价租用,满足过程所需的时间。来源 – https://github.com/p-e-w/heretic Source

更重要的是,Heretic 会自动搜索一种能够抑制拒绝的消除手段,同时尽量不损害模型原有行为——从终端用户的角度来看,它将相对困难的去审查任务简化为仅需一条指令。

从上图可以看出,Heretic 需要比普通家庭更强大的 GPU;然而,用户并不需要在家用硬件上运行它,就像 2002 年个人破解软件一样;正如 warez 时代,上游场景提供者(业余、通常非商业的爱好者)拥有此类硬件或愿意为此投入资源,便会完成越狱并将去审查模型发布到社区。

成为目标

当一种“有争议”的数字行为不再难以实现时,通常是因为能力的突飞猛进(比如 Napster 或 PopCornTime),这会让该行为本身以及官方对遏制它的兴趣骤然提升。

再加上 Ollama 等平台日益流行且易于使用,Heretic 正在让非技术用户也能获得去审查模型的渠道,尽管真正的“傻瓜式”方法尚未完全成熟。

这也让我回到之前的问题:这种行为是否构成“问题”。昨天在 Arxiv 上出现的一篇论文表明,基于近期对技术消费者自由的收紧与打压趋势,去审查可能会受到越来越多关注,进而导致全球范围内更多限制性立法的出现。

这篇新论文——10a Labs 的报告——将去审查运动描绘为负面,并提供了少数滥用案例,正如历史所示以及当前趋势所预示,这些案例将导致限制措施的出台。

该研究追踪了去审查模型发布和再分发后的情况,识别出 1,643 个在 GitHub 上集成、推荐或默认使用未审查模型的应用程序。

这些模型涵盖从通用聊天机器人和文档处理工具,到不适宜工作场所的角色扮演与写作;显性内容服务;黑客与进攻性安全工具;以及欺诈应用和恶意软件生成器,研究将其中 25% 的发布归类为“明显恶意”。

Breakdown of how uncensored AI models are being used after release. The study traced 1,643 GitHub applications that integrate, recommend or default to models whose safety restrictions have been removed, finding that 37% were general-purpose uncensored chatbots, while cybersecurity and document-processing tools each accounted for 16%, alongside smaller categories spanning voice assistants, NSFW roleplay, creative writing, coding and other uses. The paper found that around 25% of the applications identified could be classified as 'explicitly malicious'.

未审查 AI 模型发布后的使用情况细分。研究追踪了 1,643 个在 GitHub 上集成、推荐或默认使用已移除安全限制的模型的应用,发现其中 37% 为通用未审查聊天机器人,网络安全和文档处理工具各占 16%,还有包括语音助理、不适宜工作场所的角色扮演、创意写作、编程等小类。论文指出约 25% 的应用可被归类为“明显恶意”。 Source

鉴于英国最近实施的网络访问限制(以及已暂停的对绕过限制的 VPN 的限制);加州 2027 年对大多数操作系统要求收集用户年龄段并提供给应用的规定;欧盟针对成人在线内容的年龄验证方案;以及澳大利亚对未满十六岁用户的社交媒体账户禁令;这篇新论文似乎符合一个模式:关注度提升最终导致监管加强、立法约束,甚至可能出现有选择性或全面的禁令。

这里绝不会发生

不,这完全可能在这里发生,部分原因是新研究作者估计的恶意使用比例较高;此外,监管可能会对日益增长的本地运行 AI 趋势施加额外限制,政府和机构可能将其视为威胁——尤其是当模型摆脱束缚时。

如果将去审查行为描述为“助长”不适宜内容输出和恶意黑客,就会把去审查呈现为一种错误的二元命题:既然它可被用于不良用途,就必须接受监管。实际上,除了彻底禁令外,几乎没有可行的监管方式,因为其潜在用途极其广泛。

此外,如果去审查 LLM 可能导致模型生成(例如)儿童性虐待素材的虚构内容,那么严格监管似乎是必然选择,因为反对监管的人会被暗示为“支持”去审查模型的恶意用途,而非其合理用途。

然而,这忽视了一个事实:经过微调或 LoRA 调整的模型能够更高效地生成用户指定的特定领域内容,因为模型的基础权重会被任务严重扭曲,从而彻底削弱任何内置的安全防护。

全在易用性

易用性是规模化采纳的关键,而规模化采纳又会对政府施加立法压力(来自公众组织、行业游说团体或政府间的相互施压)。

虽然微调和 LoRA 几乎肯定能比仅解锁开源基础模型获得更精准的结果,但这些方法需要一定的纪律性和努力才能实施。

一旦在本地运行去审查/量化模型真正只需几次点击(因为用户几乎肯定会下载已“预解锁”的模型,而非自行使用 Heretic 破解),该行为便脱离极客的隐蔽领域,进入公共领域,其滥用可能会成为政治争论的焦点。

今年夏天,NVIDIA 率领一批重量级科技合作伙伴,提前发布公开信,呼吁防止对开源模型的政府限制,重申技术的少数滥用不应危及其作为潜在公共利益的价值。但近年来,这一立场并不受欢迎。

 

* 模型创作者是否真诚地希望限制用户活动经常受到质疑,甚至有些护栏保护被视为“作秀”。

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai