Anderson 视角

人工智能是否最终会在“护城河”之外蓬勃发展?

mm
将 Unite.AI 添加到您在 Google 上的首选来源
A cartoon image of a SIMs-style game where a Scottish Laird in his castle is regarding the thriving villagers beyond his moat with puzzlement. GPT-1.5.

大型人工智能的成本和限制,以及其对硬件成本的影响,正在迫使用户构建自己的系统——就像日益增长的监管威胁要关闭这种“影子人工智能经济”一样。

 

观点 在科学研究论文中出现的许多“陷阱”中,有一个最常见的陷阱是,该论文正在解决的问题已经在其他地方解决了,而新的研究的贡献只是次要的或增量的。

这可能是由于多种原因:研究人员希望取得量子飞跃,但只取得了类似跳跃的结果;早期解决方案比新的解决方案更耗资源;或者简单地说,项目的目标完全失败了,但学术研究的“发表或灭亡”的文化迫使团队发布了它(通常埋藏在一个门户最繁忙的发布日的雪崩中)。

然而,在机器学习文献中,一个相对较新的、毫无歉意的原因变得更加频繁:该功能或功能仅通过封闭源、API绑定门户提供。

我正在考虑一篇这样的论文——中国大学和亚马逊之间的合作,解决了对象删除失败在基于扩散的图像编辑系统中的反复出现的问题,这些系统经常只是用类似的对象重新填充目标空间,而不是删除它:

<img class="size-full wp-image-407380" src="https://www.unite.ai/wp-content/uploads/2026/04/you-only-erase-once.jpg" alt="最左边是原始图像;右边是红色分割掩码,它告诉AI哪部分图像需要删除;接下来是“我们的”方法,展示了一种成功的对象删除方法——而剩下的两张图像显示了类似的系统,它们没有删除公交车,而是插入了不同的公交车。来源 – https://arxiv.org/pdf/2603.27599v1” width=”1200″ height=”272″ /> 最左边是原始图像;右边是红色分割掩码,它告诉AI哪部分图像需要删除;接下来是“我们的”方法,展示了一种成功的对象删除方法——而剩下的两张图像显示了类似的系统,它们没有删除公交车,而是插入了不同的公交车. 来源

在上面的例子中,中间的图像显示了新方法成功地删除了公交车并插入了一个合理的背景,与前两种方法(最左边的两张图像)相比,它们删除了公交车,但随后又将不同的公交车插入了图像中!

陷阱!

放置“为什么”和“如何”这个挑战的原因,我们将在另一篇文章中讨论(而且这是一个有趣的话题),我发现了一篇经典的“陷阱”文章:作者们承认,昂贵的专有系统可以可靠地执行此任务——这也是我过去几年使用Adobe Firefly在Photoshop中以及其他封闭源系统的经验:

‘[基于扩散的]方法经常通过插入意外对象来产生幻觉,在删除目标对象之后,导致上下文不一致的[结果]。 ‘

‘另一方面,最近的封闭源多模态模型,如ChatGPT和Nano Banana,虽然在对象擦除方面更强大,但涉及大量参数和高计算开销,阻碍了它们在边缘设备上的实际部署。 ‘

‘因此,开发一个专门的对象擦除模型不仅可以实现更好的擦除性能,还可以享受低推理延迟和显著较少的参数,这是非常必要的。 ‘

这个解释,专注于技术障碍,省略了一个明显的事实:封闭源架构,如ChatGPT和Nano Banana,根本不适合用于本地安装。虽然这些系统的能力,用于生成有争议的材料,在过去一年中为它们的管理提供了额外的公共理由,但这种门户主要是由于商业迫切需要而成为专有的。

并行开发

然而,为什么要解决一个问题,它仍然依赖于一个付费系统,不是由于专有约束,而是因为所需的GPU计算超过了任何本地设置可以合理地承受?大多数这样的新“开放”论文和代码仓库都具有训练/推理设置,具有过分的资源需求,例如A100集群。

好吧,这取决于你认为所有这些即将到来的、令人破产的AI数据中心将来在线时会实现什么。普通人的恐惧和精英的希望都设想了围墙、专有的系统,取代工作岗位,同时不断提高订阅成本和降低服务水平,以满足早期风险投资者在3-5年内等待运营的需要。

但是,文献中越来越多的趋势似乎支持着一种替代的未来,以及像r/stablediffusion subreddit(目前有920,000名用户)这样的在线社区的“独自前进”的精神,这个社区早已禁止与封闭源图像/视频生成系统相关的帖子。

表面摩擦

查看r/stablediffusion上复杂的、Patreon挖掘的远程GPU演练,似乎一切都很困难:模型不断改变目标,每次更新都会改变目标;它们很难部署在本地,即使在最容易和最用户友好的框架中;总的来说,所涉及的摩擦量表明,这是一项专门为极客爱好者和不直接参与人工智能但希望开发和维护自己的本地系统的公司而设计的追求。

然而,在过去的三十年里,每项具有巨大需求的开源和民主化简化和商品化的技术都倾向于得到它,最广泛的解决方案通常从商业系统和开源替代方案和倡议之间的紧张关系中产生。

曾经是专业化的“极客”领域的追求,例如互联网连接、内容管理系统和博客框架,以及互联网安全、摄影和媒体管理,都已经从令人困惑的复杂性演变为简单和实用性。

自我实现,出于必要

讽刺的是,“大型人工智能”正通过吸收所有原本会流向“普通”消费者的计算机组件(尤其是DRAM)来为用户端贡献一种独立的精神。

因此,许多人设想了一个未来,封闭源的“全球人工智能”资源将通过低功耗的薄客户端访问,并且正在对维护现有设备产生日益增长的兴趣。

人工智能对技术供应链的攻击还导致了技术服务提供商在过去3-6个月内提高了价格,要么是因为小公司被硬件短缺真正挤压,要么只是因为人工智能

这导致了人们对自托管和本地托管(包括自托管机器学习网络)产生了日益增长的兴趣。

我最近也陷入了这种情况,转向本地LAN存储用于照片和视频,以及文件备份。对于前者,我一直使用免费和开源的Immich多平台媒体服务器,帮助我远离iCloud和其他云存储提供商的价格上涨(以及其他令人担忧的问题):

免费的Immich平台可以将您的媒体保存在您的设备上,并将其保存在您的私人频道中。在这种情况下,我还使用Docker上的Immich来通过LAN为保存照片和视频的位置提供NVIDIA 3090 GPU,以便更强大的GPU可以处理任何重型图像/视频处理。

免费的Immich平台可以将您的媒体保存在您的设备上,并将其保存在您的私人频道中。在这种情况下,我还使用Docker上的Immich来通过LAN为保存照片和视频的位置提供NVIDIA 3090 GPU,以便更强大的GPU可以处理任何重型图像/视频处理。

如果我的个人经验有任何代表性,氛围编码——目前在许多曾经“纯粹”的在线社区中被诅咒——正在推动这波独立浪潮(即使它可能威胁它所依赖的开源存储库)。

例如,网络一直是我计算机方面的弱点,所以AI的帮助对于我来说是必不可少的,以便运行一个安全的VPS来支持一系列新的自托管服务。

合规时代

好吧,那可能不会再次发生。

即使我们倾向于形成某种去护城河的边缘社会,人工智能的监管,加上当前的全球趋势,似乎很可能会预测和阻止这些发展途径。

防止“影子人工智能经济”的锚点是监管。已经,像GitHubHugging Face这样的中心存储库通常需要在线登录,然后才能在本地克隆存储库,取决于存储库的设置。

因此,机制已经存在,以便更广泛地执行人工智能框架的监控,而不是当前的做法;而意愿,以增加这种监督的力度,正在从个人政府计划凝聚为全球势头。

所以,如果市场力量和FOSS运动的聪明才智能够去除随意的人工智能部署的摩擦,障碍似乎将以治理要求的形式返回:合规要求,对于公司来说是繁琐的,但对于个人来说可能不合理——类似于自2000年代PayPal的黄金时代以来添加到消费者级在线支付系统中的摩擦。

无论Meta是否花费了20亿美元来为操作系统级别的年龄控制进行游说,还是因为他们在人工智能方面有着重要的投资,或者是因为他们的数据收集利益,大型科技公司支持年龄控制的结果是,局部人工智能可能会像一类物质一样受到监管;而且,就像DMCA是为了刑事化意图而设计的,而不是任何特定的版权规避机制一样,国际人工智能法规可能会在这种情景下使所有非合规的机器学习使用成为违法行为,而无需大量的主动监督。

结论

那么,虽然法律和立法背景可能正在为人工智能的高度监管空间做准备,这样普通用户就不能在没有许可的情况下“酿造”自己的人工智能,就像他们不能在没有许可的情况下种植或发酵受监管的物质一样,但研究部门仍然保持着更乐观的态度——人工智能将成为一个比当前更广泛的社会中受欢迎和有益的力量,而不仅仅是最流行的封闭源提供商的追随者。

很大程度上取决于人工智能泡沫破裂后,废墟的处理方式——至少在提供商要么整合,要么市场在长期内分裂为巴尔干化的意义上,这可能需要更温和的监管方法。

 

首次发表于2026年4月1日星期三

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直到其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:[email protected]