融资

Deep Cogito 获得 $43M Series A 融资,构建自我改进 AI 的后训练引擎

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Deep Cogito 已完成 $43 million Series A 融资,旧金山的 AI 实验室正准备扩大人工智能技术栈中日益重要的一环——基础模型预训练完成后会发生什么。

本轮融资由 TQ Ventures 主导,BenchmarkNexus Venture PartnersAtreides ManagementSouth Park Commons 以及云安全公司 Zscaler(既是客户也是战略投资者)参与。此次融资使 Deep Cogito 的累计融资额超过 $56 million。

Deep Cogito 由曾参与谷歌 AI Search 产品(包括 AI Mode 和 AI Overviews)的 Drishan Arora 和 Dhruv Malrana 创立,公司押注未来 AI 智能的提升将更多来源于更佳的学习算法和后训练,而非单纯扩大预训练规模。

这使得该公司在 AI 竞争中处于与那些主要专注于从头构建越来越大的基础模型的实验室不同的赛道。

为什么 Deep Cogito 押注后训练

预训练 通过让大语言模型接触海量数据,为其提供广泛的知识基础。后训练则决定模型的行为方式、推理方式、遵循指令、使用工具以及执行特定任务的能力。

Deep Cogito 的论点是,这第二阶段还有相当大的发展空间。

公司的研究聚焦于大规模强化学习以及让模型逐步提升自身能力的方法。Deep Cogito 并不把预训练模型视为基本完成、只需少量对齐的产品,而是将其视为可以继续开发底层能力的起点。

Arora 在宣布本轮融资时概括了这一区别: “预训练赋予模型巨量的知识和能力。后训练决定该模型究竟能成为何种形态。”

随着单纯扩大预训练的经济成本日益高企,这一点尤为重要。训练前沿基础模型需要庞大的数据集、GPU 集群、电力设施和资本。若后训练系统足够高效,便有可能从已有模型中提取更多智能,而无需重复整个过程。

将高成本推理转化为更佳直觉

Deep Cogito 研究的核心是 迭代蒸馏与放大(IDA),该方法随其 首个 Cogito 模型系列 公布于世。

该概念相对直观,尽管大规模实现并不容易。

在放大阶段,模型获得额外的计算资源和技术,使其能够得出比即时生成的答案更强的结果。随后将这种提升蒸馏回模型参数。升级后的模型便成为下一轮迭代的起点。

与其让模型在每次遇到难题时进行日益冗长的推理过程,不如逐步内化其在这些高计算成本推理步骤中学到的部分内容。

Deep Cogito 将此称为提升模型的“直觉”。

这一区别可能对推理成本产生重要影响。冗长的推理链虽能提升准确率,却会增加 token 消耗、延迟和费用。若模型已内化更佳的推理路径,则有望在更少的推理计算下得出相似结论。

Cogito 模型为该方法提供公开测试

Deep Cogito 一直将其开放权重的 Cogito 系列模型作为这些技术的试验平台。

其最初的发布规模在 30 亿至 700 亿参数之间,随后公司又扩展至 70B、109B 混合专家(MoE)、405B 以及 671B MoE 模型。

通过 Cogito v2,公司报告称其 671B 模型的推理链比 DeepSeek R1 0528 短约 60%,且在多项评估中保持竞争力。Deep Cogito 还表示,训练包括 3B 至 671B 的八个 Cogito 模型的总费用不足 $3.5 million,尽管基准性能和训练成本的比较并不一定直接转化为生产经济性。

公司随后继续使用 Cogito v2.1 671B 对系统进行优化,该模型基于开源授权的 DeepSeek 基础模型,由 Deep Cogito 在内部进行后训练。其 v2.1 研究发布 表明,模型在推理时采用过程监督,训练旨在提升模型识别有效推理路径的能力,而非仅仅鼓励其进行更长的推理。

这一进展对 Deep Cogito 的整体论点至关重要。公司无需证明其能够预训练出比最大 AI 实验室更好的基础模型,只需展示其后训练过程能够始终如一地将已有的强大模型转化为更具能力的模型。

Zscaler 指出企业机遇

业务的另一面是将这些后训练技术从公开发布的 Cogito 模型延伸至企业 AI。

企业不必仅依赖通用的前沿模型,而是可以围绕自身专有数据、工作流、评估标准和期望结果训练专门模型。

这比检索增强生成(RAG)更为深入,后者通常在推理时让通用模型访问外部公司信息。Deep Cogito 的方法旨在通过在模型权重中训练领域特定能力,从根本上改变模型本身。

Zscaler 提供了早期案例。该网络安全公司在参与 A 轮融资前即是 Deep Cogito 的客户。双方还在专用安全情报方面合作,Deep Cogito 认为安全应用可从在组织自身安全数据和成果上进行后训练的模型中受益。

更广泛的企业诉求在于专化与控制。《华尔街日报》对本轮融资的报道指出,Deep Cogito 正将其技术定位于企业能够使用专有数据进行训练并拥有的模型,而非完全依赖封闭的前沿系统。

4300 万美元 A 轮融资的用途

Deep Cogito 计划将 A 轮资金用于扩大研发与工程团队、提升大规模训练所需的计算基础设施、开发未来的 Cogito 模型,并与更多寻求专用模型的企业合作。

基础设施可能是此次扩张的关键部分。Deep Cogito 的招聘材料描述了研究人员在新型强化学习算法、数据管道、评估以及分布式基础设施等方面工作,同时训练参数超过 4000 亿的模型。

因此,此次融资为公司提供了更大的能力,以检验其早期模型展示的改进是否在投入更多计算并进行更多后训练迭代时得以延续。

更大的意义:能够从自身推理中学习的 AI

Deep Cogito 工作的更深层意义在于,AI 开发可能从主要依赖人类生成数据的系统,转向越来越多地自行生成、评估并内化自身改进的模型。

诸如迭代蒸馏与放大之类的方法旨在将高成本推理转化为持久能力。模型可以利用额外计算解决更难问题,然后将这些收益蒸馏回权重,为下一个训练周期提供更强的起点。

随着时间推移,这可能形成“推理‑评估‑学习‑改进”的发展循环。

迭代后训练与真正递归自我改进之间仍存在巨大差距。模型需要可靠的评估、精心设计的目标以及防止错误强化的安全措施。但即使是该方法的有限版本,也能降低对日益庞大预训练的依赖,使围绕专有企业数据训练的专用 AI 更具可行性。

如果这一趋势持续下去,AI 的竞争优势可能不再仅取决于谁拥有最大的计算集群,而更在于哪些模型最善于从自身经验中学习。

安托万是一位具有远见的领导者和Unite.AI的联合创始人,他对塑造和推广人工智能和机器人技术的未来充满热情。作为一位连续创业者,他相信人工智能将对社会产生电力的影响一样的颠覆性影响,并经常对颠覆性技术和通用人工智能的潜力大加赞扬。

作为一位未来学家Securities.io的创始人,这是一个专注于投资尖端技术的平台,这些技术正在重新定义未来并重塑整个行业。