访谈
Neal Lathia,Gradient Labs 联合创始人兼首席技术官 – 访谈系列

Neal Lathia,Gradient Labs 的联合创始人兼首席技术官,是一位在机器学习和数据科学领域拥有近二十年经验的领袖,涉足金融科技、消费平台和学术研究。在 2023 年共同创立 Gradient Labs 之前,他在 Monzo 工作了超过五年,从高级数据科学家晋升至机器学习总监和资深机器学习工程师,期间构建了机器学习基础设施,并帮助扩展该学科以支持运营、金融犯罪和产品等方面的应用。此前,Lathia 曾在 Skyscanner 担任高级数据科学家,并在剑桥大学和伦敦大学学院担任研究职务,研究内容包括推荐系统、行为数据、智能手机感知以及个性化数字服务。在 Gradient Labs,他目前负责驱动面向复杂、受监管金融服务工作流的 AI 代理技术。
Gradient Labs 是一家总部位于伦敦的 AI 公司,专注于为金融服务构建专业的自主代理,旨在自动化传统上需要大量人工参与的客户运营。公司由前 Monzo 领袖 Dimitri Masin、Neal Lathia 和 Danai Antoniou 创立,开发的代理覆盖贷款与催收、争议处理、了解您的业务(Know Your Business,KYB)、客户 onboarding、保险理赔以及客户服务等领域,支持语音、聊天和电子邮件,并嵌入针对受监管环境设计的合规防护。Gradient Labs 表示,其技术已服务超过 3200 万终端用户,客户包括 Wise、Zego、Current、Stash 和 Rho。2026 年 6 月,公司宣布将 A 轮融资扩大至 2600 万美元,致力于通过互联的专业 AI 代理实现对复杂银行和金融科技业务的自动化愿景。
您在 Monzo 工作了超过五年,负责构建和领导机器学习团队,随后于 2023 年共同创立了 Gradient Labs。您在 Monzo 亲身看到哪些情况让您确信可以围绕自主 AI 代理创办新公司?大型语言模型的出现为何使这一机会成为可能?
在 Monzo,我花了多年时间构建必须在受监管环境中运行的机器学习系统,在这种环境下错误会带来真实的后果,且所有操作都需要审计追踪。对我影响最大的是必须开发定制化基础设施,因为现成的方案无法在如此严格的约束下安全运行。这段经历让我形成了两条信念。第一,技术终于有可能帮助银行摆脱长期困扰行业的运营负担。第二,通用的横向 AI 无法在此产生实质影响——受监管工作的细微差别过于专门。当大型语言模型足够强大,能够在多步骤、甚至含糊的客户交互中进行推理时,构建能够端到端管理整个受监管工作流的代理就变得可行,而不再仅仅是辅助人工。正是这种监管公司实际需求与现有技术之间的差距,促使我们创立了 Gradient Labs,并押注专为金融领域打造的垂直 AI。
您将消费者的感受描述为“体验的锯齿边缘”:一个 AI 代理能够完成极其复杂的任务,而另一个系统却在区分电话号码和姓名这样简单的任务上失效。导致这种 AI 体验之间出现如此显著差距的根本原因是什么,即使底层模型的能力相似?
我认为,这种差距更多取决于对模型投入的工程工作量,而非模型本身的原始能力。如果系统在诸如将电话号码误认作姓名的简单任务上失误,说明它在模型周边的框架上缺乏投入,例如验证、回退逻辑、结构化数据处理等。表现更出色的代理往往为其特定任务精心工程化。虽然使用的是同一基础模型族,但围绕其的严格程度截然不同,这正是导致锯齿边缘的根本原因。
随着前沿模型不断提升,为什么看似基础的 AI 失误仍然屡见不鲜?这些是模型本身的局限性为主,还是周边系统架构、数据、工作流、评估以及产品设计的失误导致的?
主要问题在于系统而非模型本身。前沿模型在推理能力上持续提升,但企业常将其套用到并非为概率行为设计的系统中。系统中存在脆弱的集成和不完整的数据,且在发布变更前缺乏真实的评估闭环。因此,生产环境中的基础 AI 失误并非真正的 AI 失误,而是对评估、监控和工作流设计投入不足的表现。
许多公司似乎将 AI 客服的优化重点放在速度、问题解决率或工单转移上。如果希望衡量 AI 代理是否真正提升了客户体验,企业应采用哪些指标?
为此,我们必须考虑解决准确率。速度和遏制率用于评估是否能够让客户挂断电话,而不是评估是否真正解决了他们的问题。解决准确率——应作为衡量 AI 代理能力的指标——会考量代理是否做了正确的事,而不仅仅是快速响应。这将与其他信号一起使用,如重复联系率、投诉量以及事后需要人工介入的频率。如果转移率上升,但重复联系和投诉也增加,就说明你在优化错误的结果。
Gradient Labs 专注于受监管的金融服务领域,在该领域,错误的响应可能导致的后果远大于普通客服失误。如何判断 AI 代理已足够可靠,能够自主处理诸如放贷、争议、客户入职或“了解你的客户”(KYC)检查等流程?
大多数团队倾向的默认做法是采用副驾驶模式:让某人批准每一步操作,因为这样感觉更安全。大多数人也会认为这样更安全。但实际上,随着 AI 正确率提升,审阅者往往在未真正检查的情况下批准,安全性反而丧失。这并没有减少现有工作量,只是让流程更快,却降低了你获得的价值。
这就是为什么在 Gradient Labs,AI 代理的可靠性概念必须针对具体流程。对我们而言,它必须通过分阶段的自主性来发展,而不能仅视为一个待勾选的目标。只有在对大量真实案例进行基准测试,并在投入生产后仍对其决策抽样进行人工审查后,代理才能在 KYC 或争议等方面获得更大的独立性。有趣的是,这也进一步证明了可逆性在此非常重要。如果某项操作可以撤销,它将比不可撤销的操作更快获得自主权。
护栏(安全规则)正日益被视为提升 AI 代理安全性的解决方案,但增加更多规则也可能导致系统僵化,或阻碍其完成合法任务。如何在保持自主性的同时平衡护栏,而不把代理简化为另一个高度受限的聊天机器人?
错误在于把护栏视作代理只能碰壁的墙。在我们的系统中,它们同时发挥两种作用。我们在对话的每一次轮次都执行护栏——有的检查客户的陈述,以捕捉脆弱性、财务困难或投诉等信息;有的检查代理即将说的话,以确保合规。但当护栏触发时,它并非仅仅阻止,而是将代理重新引导至正确的流程,并在代理的推理中透明呈现该决定,运营者可以看到其原因。更深层的护栏还嵌入在代理对任务的思考方式、可访问的数据以及可使用的工具中。这种组合既保证安全,又避免僵化:代理了解护栏的内容及其存在的理由,从而完成合法任务,而不是拒绝所有看似不允许的请求。
在我看来,问题在于把护栏视作代理只能碰撞的砖墙。更具体地说,我们在对话的每一次轮次都运行两种不同的护栏。首先是客户护栏,检查客户的发言,旨在捕捉脆弱性、财务困难、投诉等情况。其次是代理护栏,逆向工作,在发送信息前检查代理将要说的话,以确保合规。
这意味着,当某个护栏触发时,并非完全阻止该操作,而是将其重新引导至正确路径。如此一来,保持了对代理决策过程的透明度,并向人工运营者提供采取该行动的原因。
我们之所以能够实现这一点,是因为并非代理的每个推理环节都必须经过大型语言模型(LLM)。此类护栏是确定性的,它们不仅在对话结束时触发,而是贯穿代理整个生命周期。这使我们能够信任代理处理敏感沟通,并在大规模且可预测的方式下,为特定用例定制专属代理。
最关键的是代理最初是如何被教会思考任务的,确保它能够访问相关数据并了解所需使用的工具。正是这种能够完成合法任务而非拒绝所有看似不允许的请求的能力,提升了安全性并避免了僵化。
随着 AI 代理变得日益自主,人类应在何处保持参与?是否有某些决策或客户交互,即使底层模型再强大,也应继续由人工判断?
如果决策需要诚实的判断、对客户有重大影响,或涉及代理尚未评估的结果,则必须有人类参与。人类不一定要完成全部工作,但应在需要时进行审查或批准。即使模型变得更强大,这一点也可能依然成立,因为这往往不是能力的问题,而是问责制以及客户在涉及信用结果或争议等事项时拥有由人类决策者作出决定的权利。
如果决策需要诚实的判断、对客户有重大影响,或涉及代理尚未评估的结果,则必须有人类参与。我甚至会将此观点进一步超出典型的回退模型,认为代理正日益在组织结构中与人类并列。反过来,这导致人类的努力更多地被用于升级处理和判断调用,而让代理负责协调和路由工作。
但要真正成功,代理需要与人类相同的制度背景,这样它们才知道在何时将哪些问题交给谁。这也是我们构建 Collaborate 的原因。它让运营者、工程师和代理能够以同等身份协作,核心包含版本控制、评估和持续学习。这确保了人类始终全程参与,而循环的形态会随代理与人类的协同程度而变化。
Gradient Labs 专注于为特定金融服务工作流设计的专用代理,而非单一通用代理。您是否认为企业 AI 的未来主要由专用代理网络构成,还是随着基础模型能力提升,这种专用化会变得不那么重要?
我认为即使基础模型提升,专用化仍然重要。人们支付的并非仅是一个智能模型,而是针对工作流的评估、护栏以及围绕模型构建的数据集成。这些工作不会因为底层模型变好而消失。我更倾向于将其视为一组专用代理网络,全部基于同一强大的基础模型,而不是单一通用代理承担所有任务。
AI 代理在部署后需要不断学习和改进,但在受监管的环境中,即使是微小的行为变化也可能带来新风险。公司如何在持续提升代理的同时,确保更新不会导致回归、合规问题或意外行为?
我们的原则是将每一次更新视为一次全新的模型发布,而非增量配置修改,因此每一次变更在发布前都必须通过完整的评估套件。这包括针对可能导致实际影响的先例进行回归测试,并且不会一次性向所有客户上线:我们采用逐步推送并进行监控,一旦出现漂移,就能在有限的流量片段中捕获,而不是在全量环境中。正是基于此理念,我们最近发布的 Collaborate 正是围绕此构建的。Collaborate 让运营者、工程师和 AI 代理能够作为平等伙伴共同工作,在同一实时的代理思考定义上进行协作,版本控制、评估和持续学习直接嵌入工作流。因此,当有人改进代理处理某个案例的方式时,该变更会被版本化、针对过去对话进行测试,并在与其他发布相同的控制下推送。这意味着代理可以在部署后持续提升,而改进本身不会成为导致回归或合规问题的根源。
展望未来,随着强大基础模型的获取日益商品化,AI 应用的真正竞争优势将来自何处?是拥有最佳模型的企业获胜,还是那些最擅长构建可靠系统并围绕其提供始终如一的优秀体验的企业获胜?
随着越来越多的基础模型趋于趋同,上风几乎将完全倾向于那些最擅长围绕这些模型构建更可靠系统的企业,包括评估、护栏、数据以及工作流设计。模型正成为一种商品化的输入,但真正的产品是生产环境中的一致性和可靠性。
更进一步,我认为优势更多来源于代理在公司运营中的深度嵌入。能够在公司多个业务环节中嵌入的代理,将胜过只能处理特定问题或仅面向前线的工具。当代理能够跨前线和后台系统协同工作时,它能够为交互提供更多上下文,并端到端处理更复杂的问题,正如人类一样。代理能够契合公司实际运作方式的能力,是我预期的持久竞争优势所在。
感谢这次精彩的采访,想了解更多的读者请访问 Gradient Labs。












