AI 模型与平台
自我学习的人工智能不再是科幻小说

新兴的人工智能框架正在迈向一个激进的飞跃:机器可以自我改进,不需要人类的洞察。
多年来,即使是最先进的人工智能模型仍然是被动的引擎,根据它们无法修改的训练数据预测响应。但今天,不是模型的大小决定了人工智能的下一章,而是模型是否可以自我演化。
最近,麻省理工学院的研究人员推出了一个新的人工智能框架,称为 自适应大语言模型(SEAL)。这种方法允许大语言模型(LLM)自主改进自己,实现人工智能可以诊断其局限性并通过强化学习的内部反馈循环永久更新其自身的神经权重。与其需要研究人员发现错误、编写新提示或提供额外示例,模型完全拥有自己的演化。
“大语言模型(LLM)很强大,但静态的;它们缺乏适应其权重以响应新任务、知识或示例的机制,”麻省理工学院的研究人员在博客文章中写道。“关于知识整合和少样本泛化的实验表明,SEAL是语言模型自主适应新数据的有前途的一步。”
在早期测试中,这个自我编辑循环使模型从完全失败到复杂抽象推理谜题上取得成功,甚至超过了更大的模型,如GPT-4.1,成功率为72.5%,传统方法失败。此外,SEAL据称将人类监督减少了85%,同时提高了准确性和适应性。
自我学习人工智能框架的崛起
SEAL是自主机器智能更广泛趋势的一部分。例如,Sakana AI的研究人员推出了 达尔文-哥德尔机器——一种使用开放式进化策略重写其自身代码的AI代理。
“它创建各种自我改进,例如补丁验证步骤、更好的文件查看、增强的编辑工具、生成和排名多个解决方案以选择最好的一个,并添加已尝试的内容历史记录(以及为什么失败)当做出新更改时,”Sakana AI在博客文章中写道。
同样,Anthropic的AI代理, 由Claude 4提供支持,现在可以自主编排代码库和商业工具中的工作流程。
“一个根据资产类型、环境和历史重新配置自身的系统,使我们能够从反应性响应转变为持续的预防策略,”Fracttal的CEO和联合创始人Christian Struve告诉我。“这不是关于更多层次或更多参数,而是关于更自主和更有用的系统。”
这些努力的共同点是一个核心信念:人工智能不需要变得更大才能变得更聪明。它需要变得更适应性。
“扩大规模带来了重大收益,但我们正在达到仅凭规模就能实现的极限。像SEAL这样的自适应学习模型提供了一个令人信服的下一步,实现系统可以随时间增长和改进,”Dataco的创始人和CEO Jorge Riera告诉我。“自我演化的模型还将进度指标从静态基准转移到适应性、学习效率和安全的长期改进的衡量标准。我们不仅可以测试模型在部署时知道什么,还可以评估它如何学习、保留和随时间演化。”
人工智能生态系统和全球自治竞赛的影响
这种自治水平还重写了人工智能部署的经济学。想象一下能够瞬间更新以应对新威胁的欺诈检测系统,或者能够根据学生行为改变其教学风格的AI导师。在机器人领域,自适应框架可以带来能够在无需重新编程的情况下学习新运动模式的自主机器。
在中东,像阿联酋和沙特阿拉伯这样的国家正在迅速构建适应性基础模型。 阿联酋的猎鹰 和 G42的Jais 是具有区域相关性的开源LLM,而沙特阿拉伯的ALLaM和 阿拉姆科数字的Metabrain 正在推动自主人工智能代理的发展,应用于智能城市、医疗保健和物流。
这些努力还没有达到与麻省理工学院的SEAL相当的自我编辑能力,但它们反映了一个共同的轨迹:从被动的人工智能系统到主动、演化的代理,可以在有限的人类指导下导航复杂性。就像SEAL一样,这些计划都有健全的治理框架,凸显了人工智能自治必须与责任相结合的日益增长的认识。
“这是迈向自我管理系统的第一步,这些系统可以在没有不断干预的情况下修改其逻辑,”斯特鲁夫说。“我相信人工智能并不重新定义什么是智慧,但它迫使我们重新思考我们与智慧的关系。重要的不是模型演化,而是它按照我们定义的目标演化。”
Gorilla Logic的CTO Jeff Townes也强调了治理与人工智能演化同步的重要性:“问题不是人工智能是否可以演化,而是企业是否可以与其同步演化。治理必须将每个人工智能适应锚定到明确的结果和KPI上,这样领导者可以衡量和信任它,创新可以带来信心而不是风险。”
我们是否准备好迎接自我重写的人工智能?
SEAL提出的最具挑战性的问题并非技术问题,而是如果模型可以决定如何教自己,我们在塑造其价值观、优先级和方向方面扮演什么角色?
专家警告,随着自适应人工智能系统获得自治权,自我改进的步伐不应超过建立道德防护栏的步伐。“我认为所有人工智能系统都必须包含至少三个基本的道德原则,”Kryterion的CTO Jacob Evans说。
“首先,这可能不言自明,但人工智能需要将自己识别为人工智能。第二,人工智能必须以人为中心,增强和不取代人类的判断力。最后,它必须承认其局限性和不确定性,同时拒绝提供可能促进严重伤害的信息。没有这些保障,人工智能可能成为操纵的工具,而不是可靠的支持。”
“为了使模型能够在生产中自我改进,它们需要一个动态的反馈循环,而不是静态的训练。一个强大的方法是使用‘数字孪生’或一个复杂的沙盒环境,在部署到用户之前,人工智能可以在其中安全地测试和验证其自身的自我生成的改进,”Automotus的计算机视觉工程师Ganesh Vanama分享道。
至于治理,Vanama补充说,“非协商控制是‘人在循环’监督。”他说,虽然我们希望模型适应,“你必须有持续的监控来检测‘对齐漂移’,即模型偏离其预期目标或安全约束。这一系统必须给人类审计员权力来否决或立即回滚任何自主更新,如果它未能通过安全或性能审查。”
但其他专家认为,还有时间来开发这些保障措施,认为建立一个真正强大的、通用、自我改进的人工智能仍然是一个巨大的挑战。
“这样的模型仍然缺乏可靠地在实时重新编程自己的能力。关键挑战包括防止错误强化、避免灾难性遗忘、确保更新期间的稳定性以及维持内部更改的透明度,”Riera说。“在这些问题得到解决之前,完全的自主适应仍然是一个前沿领域,而不是现实。”
麻省理工学院的研究人员将SEAL视为必要的演化。正如麻省理工学院的领先科学家所说,这个框架目前比以往任何时候都更接近地模拟了人类的学习。
“这些系统暗示了从静态、一次性模型到适应性架构的转变,这些架构可以从经验中学习、管理记忆并随时间追求目标。方向是明确的:朝着模块化、上下文感知的智能发展,这种智能可以连续地调整自己,”Riera告诉我。“虽然仍处于实验阶段,但这种方法标志着迈向更自主和更有弹性的人工智能系统的有意义的一步。”
这是否会带来更个性化的系统,或者完全新的机器代理形式,尚待观察。自我学习的人工智能时代已经到来——它不仅重写了自己的代码,还在重写机器可以成为什么的规则。












