访谈

Anthony Deighton,Tamr 首席执行官 – 采访系列

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Anthony Deighton 是 Tamr 的首席执行官。他有 20 年的经验,建立和扩展企业软件公司。最近,他在 Celonis 度过了两年,担任首席营销官,建立了他们在流程挖掘软件类别中的领导地位,并创建了需求生成计划,导致年度收入递增 130%。在此之前,他在 Qlik 度过了 10 多年,担任产品领导、产品营销和最后的首席技术官,帮助公司从一家不知名的瑞典软件公司发展成为一家公开上市的公司。他在 Siebel Systems 开始了他的职业生涯,学习如何建立企业软件公司,担任各种产品角色。

您能否分享您在企业软件行业的旅程中的一些关键里程碑,特别是您在 Qlik 和 Celonis 的时间?

我在 Siebel Systems 开始了我的职业生涯,学习了很多关于建立和扩展企业软件公司的知识。我加入 Qlik 时,它是一家小型、不知名的瑞典软件公司,拥有 60 人的团队,其中 95% 的员工位于瑞典的隆德。我开玩笑说,由于我不是工程师或销售人员,我被安排负责营销。我在那里建立了营销团队,但随着时间的推移,我的兴趣和贡献转向了产品管理,最后我成为首席产品官。我们在 2010 年将 Qlik 上市,并继续作为一家成功的公开上市公司。之后,我们希望进行一些收购,所以我启动了一个并购团队。经过长时间和相对成功的公开上市公司运营后,我们最终将 Qlik 卖给了一家名为 Thoma Bravo 的私募股权公司。这可以说是企业软件公司的完整生命周期。离开 Qlik 后,我加入了 Celonis,一家小型的德国软件公司,试图在美国获得成功。再次,我担任首席营销官,我们快速增长,建立了一个非常成功的全球营销功能。

Qlik 和 Celonis 都专注于数据分析挑战的前端——如何查看和理解数据?在 Qlik 的情况下,这是仪表板;在 Celonis 的情况下,这是业务流程。但两个公司都面临的一个共同挑战是这些可视化背后的数据。许多客户抱怨数据不正确:重复记录、不完整记录、缺失数据仓库。这就是我被 Tamr 吸引的原因,因为我觉得我们可能第一次能够解决企业数据混乱的问题。我的企业软件职业生涯的前 15 年都花在了数据可视化上,我希望接下来的 15 年可以花在清理数据上。

您早期的经历如何塑造您对建立和扩展企业软件公司的方法?

我在 Siebel 到 Qlik 的转变中学到的一个重要教训是简单的力量。Siebel 是非常强大的软件,但它在市场上被 Salesforce.com 杀死,Salesforce.com 提供了一个功能较少的 CRM(“玩具”),但客户可以快速将其投入使用,因为它是作为 SaaS 解决方案交付的。现在看来,这似乎很明显,但当时的共识是客户购买功能,但我们学到了客户投资于解决他们的业务问题的解决方案。如果您的软件可以更快地解决他们的问题,那么您就会赢。Qlik 是一个简单的数据分析问题解决方案,但它极其简单。因此,我们可以击败更功能丰富的竞争对手,如 Business Objects 和 Cognos。

我职业生涯中学到的第二个重要教训是在营销到产品的转变中。我发现自己可以在产品和营销之间流畅地移动。产品和营销之间存在着密切的联系,产品和潜在客户之间也存在着密切的联系。任何企业软件公司的关键成功因素是能够在这些对话之间移动。一个创业公司失败的常见原因是相信“如果你建造它,他们就会来”。这是一个常见的信念,如果你只建造很酷的软件,人们就会排队购买。但这永远不会奏效,解决方案是将强大的营销过程与软件开发过程连接起来。

我要分享的最后一个想法将我的学术工作与我的职业工作联系起来。我有机会在商学院上一门关于 Clay Christensen 的颠覆性创新理论的课程。在我的职业生涯中,我有机会体验到既是颠覆者又被颠覆的经历。关键的教训是我所学到的任何颠覆性创新都是由外部平台转变使不可能的事情变得可能的结果。在 Qlik 的情况下,这是大内存服务器的平台可用性,使 Qlik 能够颠覆传统的基于立方体的报告。在 Tamr,这是机器学习的大规模平台可用性,使我们能够颠覆手动规则基于的 MDM,转向基于 AI 的方法。了解驱动您颠覆的平台转变至关重要。

是什么启发了 AI 本土的主数据管理 (MDM) 的开发,它与传统的 MDM 解决方案有什么不同?

Tamr 的发展源于 MIT(马萨诸塞理工学院)关于实体解析的学术工作。在图灵奖得主 Michael Stonebraker 的学术领导下,团队正在研究“我们是否可以在数百万个源和数百万条记录中链接数据记录”。从表面上看,这是一个难以逾越的挑战,因为记录和源越多,每个可能的匹配就需要比较更多的记录。计算机科学家称之为“n 平方问题”,因为问题会随着规模的增加而呈几何级增长。

传统的 MDM 系统试图使用规则和大量的手动数据整理来解决这个问题。规则不适用于大规模应用,因为您永远无法编写足够的规则来涵盖每个边缘情况,而管理成千上万条规则在技术上是不可能的。手动整理非常昂贵,因为它依赖于人类尝试处理数百万条记录和比较。总的来说,这解释了传统 MDM(主数据管理)解决方案的市场采用率不佳。坦率地说,没人喜欢传统的 MDM。

Tamr 的简单想法是训练一个 AI 来执行源数据摄取、记录匹配和值解析的工作。AI 的伟大之处在于它不需要吃饭、睡觉或休假;它也高度可并行化,因此可以处理大量数据并不断地使其变得更好。因此,MDM 不再是不可能的;现在终于可以实现干净、整合、最新的数据(见上文)。

公司在数据管理方面面临的最大挑战是什么,Tamr 如何解决这些问题?

公司在数据管理方面面临的第一个也是最重要的挑战是,他们的业务用户不使用他们产生的数据。或者说得更直接一些,如果数据团队没有生产出高质量的数据供组织使用来回答分析问题或简化业务流程,那么他们就是在浪费时间和金钱。Tamr 的主要输出是每个实体记录(例如:客户、产品、零件等)的 360 度页面,它将所有底层的一级和三级数据结合起来,以便业务用户可以查看和提供对数据的反馈。就像一个用于实体数据的 wiki。这个 360 度页面也是对话式接口的输入,允许业务用户使用数据提问和回答问题。因此,首要任务是为用户提供数据。

为什么公司很难为用户提供他们喜欢的数据?因为有三个主要的难题:加载新源、将新记录匹配到现有数据中以及修复数据中的值/字段。Tamr 使加载新数据源变得容易,因为其 AI 自动将新字段映射到定义的实体模式。这意味着无论新数据源如何称呼特定字段(例如:cust_name),它都会被映射到该实体的中心定义(例如:“客户名称”)。下一个挑战是链接重复记录。在这种情况下,重复意味着记录实际上是相同的真实世界实体。Tamr 的 AI 执行此操作,甚至使用外部第三方来源作为“真实来源”来解析常见实体,例如公司和人员。一个很好的例子是链接来自多个来源的所有记录,例如“Dell Computer”。最后,对于任何给定的记录,可能有一些字段是空白或不正确的。Tamr 可以从内部和第三方来源推断出正确的字段值。

您能否分享一个 Tamr 显著改善公司数据管理和业务成果的成功故事?

CHG Healthcare 是医疗保健人员配备行业的主要参与者,连接有技能的医疗保健专业人员与需要的人员。无论是通过 Locums 提供临时医生,还是通过 RNnetwork 提供护士,还是通过 CHG 本身提供更广泛的解决方案,他们都为医疗保健设施提供定制的配备解决方案,以帮助它们顺利运行并为患者提供高质量的护理。

他们的基本价值主张是将合适的医疗保健提供者与合适的设施联系起来。他们面临的挑战是,他们没有对网络中的所有提供者进行准确和统一的了解。考虑到他们的规模(75 万 + 提供者),使用遗留的基于规则的方法在不花费大量人力成本的情况下保持数据准确性是不可行的。他们也不能忽视这个问题,因为他们的配备决策取决于它。糟糕的数据对他们来说可能意味着提供者获得的轮班比他们能处理的多,导致精疲力竭。

使用 Tamr 的高级 AI/ML 能力,CHG Healthcare 将重复的医生记录减少了 45%,几乎完全消除了使用稀缺的数据和分析资源进行的手动数据准备。最重要的是,通过拥有对提供者的可靠和准确的视图,CHG 能够优化配备,实现更好的客户体验。

关于数据管理中的 AI 有哪些常见的误解,Tamr 如何帮助消除这些神话?

一个常见的误解是 AI 必须是“完美的”,或者规则和人工策划相比之下是完美的。现实是规则经常失败。而且,更重要的是,当规则失败时,唯一的解决方案是更多的规则。所以,你会有一个不可管理的规则混乱。人工策划也是有缺陷的。人类可能有良好的意图(尽管并不总是如此),但他们并不总是正确的。而且有些人工策划者比其他人更好,或者可能做出不同的决定。AI 则是概率性的。我们可以通过统计验证这些技术的准确性,当我们这样做时,我们发现 AI 比任何竞争对手更便宜、更准确。

Tamr 将 AI 与人工精细化相结合以实现数据准确性。您能否详细说明这种组合在实践中的工作原理?

人类为 AI 提供了异常重要的东西——训练。AI 本质上是扩大人类努力的规模。Tamr 寻求人类的帮助是为了获取少量示例(“训练标签”),机器可以使用这些标签来设置模型参数。在实践中,这看起来像人类花了一小段时间与数据打交道,为 Tamr 提供数据中的错误和错误示例,然后 AI 将这些示例应用于整个数据集。另外,当添加新数据或数据更改时,AI 可以表面化它在做出决定时缺乏信心的实例(“低信心匹配”),并要求人类提供输入。这种输入当然用于改进和更新模型。

大型语言模型 (LLM) 在 Tamr 的数据质量和丰富化过程中扮演什么角色?

首先,必须明确 LLM 擅长什么。从根本上讲,LLM 是关于语言的。它们产生具有意义的文本,并且可以理解提供给它们的文本的含义。因此,可以说它们是语言机器。因此,对于 Tamr 来说,在语言很重要的地方,我们使用 LLM。一个明显的例子是我们的对话式接口,它位于我们的实体数据之上,我们亲切地称之为我们的虚拟 CDO。当您与现实生活中的 CDO 交谈时,他们理解您并使用您理解的语言做出回应。这正是我们在软件的这一部分中使用 LLM 的方式。Tamr 在这种情况下的价值在于,我们使用实体数据作为与虚拟 CDO 对话的上下文。就像您的现实生活中的 CDO 在回应您的提问时拥有所有最佳的企业数据一样——那不是很好吗?

此外,还有一些情况下,我们希望在清理数据值或推断缺失值时使用基于语言的输入值解释。例如,您可能会问“5mm 球轴承”这个文本中零件的尺寸,LLM(或一个人)会正确地回答“5mm”。

最后,LLM 的基础是嵌入模型,它们将语言含义编码为令牌(可以认为是单词)。这些可以用于计算语言比较。因此,虽然“5”和“five”在字符上没有共同点,但它们在语言含义上非常相似。因此,我们可以使用这种信息来链接记录。

您如何看待数据管理的未来,尤其是在 AI 和机器学习方面的进步?

2000 年初的“大数据”时代应该被铭记为“小数据”时代。虽然过去 20 多年中创造了大量数据,但由存储和计算的商品化所启用,但对企业产生影响的大部分数据相对较小规模——基本的销售和客户报告、营销分析和其他可以轻松在仪表板中描绘的数据集。结果是,数据管理中使用的许多工具和流程都是针对“小数据”进行优化的,这就是为什么基于规则的逻辑和人工策划仍然在数据管理中如此突出的原因。

随着 AI 和机器学习的进步,人们希望如何使用数据的方式正在从根本上改变。AI 代理能够自主执行大量工作的想法只会在这些代理拥有所需的数据时才会奏效。如果您希望 AI 代理在客户支持的前线提供服务,但您在 CRM 中有五个“Dell Computer”的表示,并且它与 ERP 中的产品信息没有关联,那么您如何期望他们提供高质量的服务,当有人从 Dell 联系您时?

这意味着我们的数据管理工具和流程需要演变以处理规模,这意味着我们需要接受 AI 和机器学习来自动执行更多的数据清理活动。人类仍将在监督流程中发挥重要作用,但从根本上说,我们需要要求机器做更多的事情,这样不仅仅是仪表板中的数据是准确和完整的,而且企业中的大部分数据都是准确和完整的。

企业今天在更有效地利用其数据方面有哪些最大机遇?

增加人们可以消费数据的方式数量。毫无疑问,数据可视化工具的改进使数据在整个企业中变得更加便捷。现在,数据和分析领导者需要寻找超越仪表板的方法来交付数据价值。像内部 360 度页面、知识图和对话式助手这样的接口正被新技术所启用,并为潜在的数据消费者提供了更多使用数据的方式。特别是当这些功能嵌入到人们已经使用的系统中时,例如 CRM 和 ERP,这些功能尤其强大。从数据中创造更多价值的最快方法是将数据带给那些可以使用它的人。感谢您这次精彩的采访,希望阅读更多的读者请访问 Tamr

安托万是一位具有远见的领导者和Unite.AI的联合创始人,他对塑造和推广人工智能和机器人技术的未来充满热情。作为一位连续创业者,他相信人工智能将对社会产生电力的影响一样的颠覆性影响,并经常对颠覆性技术和通用人工智能的潜力大加赞扬。

作为一位未来学家Securities.io的创始人,这是一个专注于投资尖端技术的平台,这些技术正在重新定义未来并重塑整个行业。