访谈
IrisGo创始人兼CEO Jeffrey Lai – 采访系列

Jeffrey Lai,IrisGo的创始人兼CEO,是一位具有深厚智能助手和语言技术根基的AI企业家和产品领导者。在2025年创立IrisGo并在AI Fund担任创始人之前,Lai在苹果公司工作了超过12年,期间他帮助构建和扩展了Siri,最终担任Siri语言工程经理。他的工作重点是推进多语言对话式AI,包括开发Siri的中文版本。在苹果公司之前,他曾在思科系统担任工程角色,并在NASA Ames研究中心的智能机器人小组完成了实习。凭借跨越机器人、企业软件和消费者AI的职业生涯,Lai始终专注于使复杂技术更加易用和实用,以适应日常工作流程。
IrisGo 正在开发一种为新一代AI个人电脑设计的AI操作系统。与作为独立聊天机器人运行不同,该平台旨在观察用户在应用程序中执行任务的方式,学习这些工作流程,并通过智能的设备内助手来自动执行这些任务。其核心方法围绕允许用户演示一次任务,然后将该过程转换为可重用的工作流程,帮助减少重复的数字工作。通过利用现代AI PC中的专用AI处理能力,IrisGo旨在实现更私密、更响应和更上下文感知的自动化,定位自己在日益增长的代理AI系统市场中,这些系统可以代表用户主动执行任务,而不仅仅是提供推荐。
在帮助构建苹果Siri之后,您有哪些具体经历让您相信是时候开始IrisGo了?您认为人机交互中还有哪些关键问题尚未解决?
当我们构建Siri时,我们非常专注于自然语言理解。但Siri在上下文方面遇到了困难,这是一个挑战,因为人们实际工作和交流的方式充满了隐含的上下文。当你问同事“可以把那份报告发给我吗?”他们知道你指的是哪份报告。他们知道你们共享的历史,你们当前的项目,你们讨论过的内容。Siri没有这些信息。
多年来,AI被设计为对你做出响应。输入一些内容,得到一些回应。这是我们从搜索引擎和聊天机器人继承来的交互模型。但大多数人在计算机上实际做的事情不是一个问题,而是一个工作流程。编译这份报告,交叉引用这些电子表格,从三个不同的应用程序中提取数据并将其格式化为文档。这种工作不适合在一个提示中完成。
说服我开始IrisGo的是意识到该行业并没有针对日常使用场景进行建设。每个人都在构建更智能的模型,改进语言理解,实现更快的响应。但基本的差距仍然存在,即AI可以真正完成工作,而不仅仅是对请求做出响应。这就是我们试图解决的问题。
回顾您在Siri工作的那些年,您从中获得了关于语音助手的局限性的最大教训,特别是在理解上下文、意图和用户行为方面?
我学到的最大的教训是上下文是最重要的。人们很少以孤立的命令进行交流;他们的请求受到他们正在处理的内容和他们试图完成的目标的影响。早期的语音助手是围绕回答个别请求而设计的,这对于许多任务来说效果很好,但对于跨多个应用程序和工作流程的持续工作来说效果较差。这种经验教会了我,理解意图需要理解上下文,这个见解成为IrisGo背后的基本思想之一。
我们了解到,意图通常是分层的。有人说一件事,但意思是另一件事。正确理解这一点需要理解这个人,而不仅仅是理解这些话。这一理解从一开始就融入了IrisGo的设计中。
IrisGo经常被描述为AI操作系统,而不是AI助手。二者之间有什么区别?您为什么认为该行业需要一个新的软件层来适应AI PC时代?
AI助手等待您的输入。您打开它,输入一些内容,它会响应,然后就完成了。交互模型基本上与搜索引擎相同,即用户发出请求,AI生成响应。
IrisGo作为一个AI操作系统,与您正在做的所有事情一起工作,跨您的整个系统,始终如此。它可以访问您的文件、应用程序、浏览器和电子邮件。它了解您如何工作,因为它一直在观察,当然是在您的许可下。最重要的是,它可以采取行动,而不仅仅是提供建议。
想想Windows对个人计算机的影响。Windows之前,您必须是技术专家才能使用计算机。Windows创建了一个通用、直观的层,位于人们和软件之间。AI PC时代需要它自己的这种层,将AI模型的原始能力转化为真正对日常工作有用的东西。
这就是IrisGo的作用:AI PC的智能层。当您在设备上预装IrisGo时,它就在您打开盒子时就已经存在了。您不需要搜索它,下载它,或决定给它一个机会。这是一个巨大的优势。
IrisGo的一个核心理念是,用户可以通过一次演示来教会系统一项任务。为什么您认为“观察和学习”比提示或手动构建工作流程更自然?
使“观察和学习”功能如此强大的原因在于,它基于我们实际上如何相互教学。当您为新员工提供培训时,您不会给他们写一份40步的提示。您向他们展示一次,他们观察,学习,然后接管。这种方式很直观,很自然。
提示的问题在于,它将负担放在用户身上,要求用户以AI可以理解的格式准确表达他们想要什么。对于简单的查询,这很好。但对于复杂的、多步骤的工作流程,涉及您的特定文件和您的特定工作方式?它可能会迅速崩溃。大多数人无法以足够精确的方式描述他们的工作流程,以便AI能够正确地执行它们。
演示比解释更容易。这不是一个新见解;这是常识。观察和学习将这种逻辑应用于自动化。你按照正常方式执行任务一次。IrisGo学习这种模式。从那时起,它就可以为你处理这种工作流程。
当前的许多AI代理仍然需要大量的设置和监督。真正的自治代理与简单地遵循指令的聊天机器人之间有什么区别?
简短的答案是,真正的自治代理拥有自己的上下文,自己做出判断,并且即使您不在观察,也会继续工作。
聊天机器人按设计是反应性的。它依赖于提示。您给它一个指令,它执行,然后它停止。如果有什么变化,如果一个步骤失败,或者如果它需要适应,它就会迷失。它会问您下一步该怎么做。
真正的自治代理有一个目标,而不仅仅是一个指令。它对其运行的环境有上下文。它可以处理异常。它可以决定是否继续、重试或将某事标记为需要人工审查。并且重要的是,它可以在后台运行,而您可以专注于其他事情。
今天被称为“AI代理”的大多数产品实际上只是具有额外步骤的复杂聊天机器人。这些产品与真正的自治之间的差距是巨大的。IrisGo之所以与众不同,是因为它从对您的工作方式的理解开始,这种理解是通过观察您而获得的,并利用这种理解来做出正确的判断,而不仅仅是遵循指令。
您已经谈到了持久记忆和本地上下文的重要性。为什么这些能力对于AI超越回答问题并开始代表用户采取行动是必不可少的?
想象一下,您雇佣了一位助理,每天早晨都没有记忆力,根本不知道您是谁,您在做什么项目,您喜欢事情的完成方式是什么。那将会非常令人沮丧。您将会花费大量时间重新解释上下文,您也会变得非常沮丧。这基本上就是大多数AI工具今天要求您做的事情。
持久记忆意味着系统了解您。它了解您的项目、工作流程、偏好以及事情如何随时间变化。您不需要每次会话都重新建立上下文。AI会将上下文带入下一次会话。
本地上下文同样至关重要,因为您的工作不在云端,而是在您的计算机上,在文件中,在应用程序中,在电子邮件中,在浏览器标签页中。IrisGo在您的设备上运行,这意味着它可以访问您的整个工作环境,并可以代表您在所有这些环境中采取行动。
这些能力——记忆和本地访问——使AI能够停止成为一种工具,而成为一种为您工作的系统。我们看到越来越多的科技行业开始认识到这种方法的重要性,包括大型科技公司,所以这对我们的方法是一种明确的认可。
隐私仍然是AI领域最大的担忧之一。您如何平衡个性化和记忆的需求与用户对安全和数据所有权的期望?
首先要挑战的假设是,隐私和个性化是相互冲突的。我们构建IrisGo,使个性化可以在设备上进行,而不仅仅是在云端。
IrisGo的大部分处理都发生在本地,在您的计算机上。您的工作流程、文件、上下文都留在您身边。只有在您明确授权时,才会进行云处理,而且即使这样,也是端到端加密的。您控制着数据流向哪里。
这种模型使IrisGo更加强大,因为它可以访问您整个工作环境的完整上下文。并且这意味着用户不必在有用的AI和安全的AI之间做出选择。
人们信任他们的个人电脑来处理敏感工作。我们的目标是让IrisGo值得这种信任。这是产品设计的基本方面。
IrisGo已经开始在Acer的AI PC上发布,并计划扩展到其他制造商。您认为分销合作伙伴关系在决定哪些AI平台最终达到主流采用方面有多重要?
分销对于主流采用至关重要。看看科技领域平台竞争的历史。Windows获胜是因为它几乎在每台PC上都存在。Android获胜是因为它是非iPhone移动设备中使用最广泛的操作系统。那些仅通过产品质量而没有分销支持的公司基本上都没有成功。
AI PC市场遵循着类似的模式。当IrisGo预装在设备上时,它就在您打开盒子时就已经存在了。您不需要搜索它,下载它,或决定给它一个机会。这是一个巨大的优势。
我们已经在今年将要发货的300万台Acer笔记本电脑上预装了IrisGo,并且我们正在与其他一线PC制造商进行谈判。我们的目标是成为PC的默认AI操作系统。这种分销策略是我们成为该类别标准的核心部分。
随着AI代理开始处理发票、研究、报告和其他商业工作流程,组织今天应该为哪些新的治理、监督和信任挑战做好准备?
第一个挑战是可审计性。当AI代理完成一个工作流程,例如处理发票或生成报告时,您是否可以看到它做了什么,为什么做,以及数据来自哪里?这种透明的审计跟踪对于合规性和在错误扩散之前捕获错误至关重要。
第二是定义边界。哪些工作流程适合自主执行,哪些需要人工审查?公司需要围绕此类问题制定明确的政策。人们倾向于让AI做越来越多的事情,逐渐增加,然后意识到太晚,高风险的决策是在没有足够监督的情况下做出的。
第三是信任校准。员工需要了解AI可以做什么和不能做什么,以及何时验证其输出而不是假设它是正确的。这是一个文化和培训问题,就像技术问题一样。
我相信今天为此做准备的组织将拥有显著的优势,因为随着AI能力的增长,治理框架将变得更加复杂。
五年后,您认为人们是否仍将主要通过聊天界面与AI交互,还是AI将越来越多地融入背景并在未被要求的情况下主动完成工作?
轨迹已经表明,AI将越来越多地融入背景。我们正在朝着一个模型发展,即您的计算机了解您的工作并处理例行工作的基础部分,因此您的注意力可以集中在真正需要您的事情上。
想想自动驾驶飞行的工作原理。飞行员并不是每秒都手动控制飞机。系统处理基础工作,人类在需要判断和专业知识时介入。这是AI辅助知识工作的未来。您的计算机处理重复、基于规则的工作流程,您专注于战略、创造力和需要真正的人类判断的决策。
五年后,最富有成效的人将是那些与理解用户操作方式的系统并肩工作的人。过去,人们在计算机上做所有的工作。在未来,您的计算机也会为您做工作。
感谢这次精彩的采访,希望阅读本文的读者可以访问IrisGo以了解更多信息。












