访谈

LXT 首席增长官 Phil Hall – 采访系列

mm
将 Unite.AI 添加到您在 Google 上的首选来源

LXT 首席增长官 Phil Hall 曾是 Appen 的高管,也是 Forbes Technology Council 成员。在 Appen 的领导角色中,他曾领导过 1000 多名员工,并在公司 17 年连续实现收入增长和盈利能力方面发挥了关键作用。在 LXT 的当前角色中,他正在与一支专家团队合作,以实现雄心勃勃的增长目标。

LXT 是一家领先的 AI 训练数据提供商,服务于全球组织,包括世界上最大的科技公司。通过与国际贡献者网络的合作,LXT 收集和注释多种类型的数据,具有企业所需的速度、规模和敏捷性。他们的全球专长涵盖 115 个国家和 750 个语言环境。LXT 成立于 2010 年,总部位于加拿大多伦多,在美国、澳大利亚、埃及、英国和土耳其设有办事处。该公司服务于北美、欧洲、亚太和中东的客户。

您最初是什么时候发现自己对语言充满热情的?

我对语言的兴趣可以追溯到很久以前,但在我直接参与语言和语言学方面,有一个重要的转折点。我们意识到我们的孩子之一有阅读障碍,当我们与学校讨论额外的支持时,他们说虽然有他们可以使用的程序,但我也可以在学校做志愿者,以帮助我们的女儿和其他孩子。结果很好,我后来在两所大学教语言学,并发现自己在教学中。

您在转入语音数据领域之前曾教授语言学。是什么激发了您转变焦点的决定?

悉尼的 Appen 公司当时正在从家庭客厅运营转变为商业运营。我被告知他们正在寻找语言学家(或者说,一个语言学家!),我被介绍给了创始人 Julie 和 Chris Vonwiller。这次转变花了大约两年时间。我不愿意放弃教学,因为与高成就的学生一起工作既令人振奋又很有趣。但是在那些开创性的岁月里,我正在与世界领先的语言技术专家解决棘手的问题,激动人心的程度很高。今天被认为是理所当然的事情,当时却非常具有挑战性。

您从退休中走出来加入 LXT。是什么激发了您做出这个决定?

这是一个有趣的问题,因为我当时确实很享受退休生活。事实上,我们的联合创始人和 CEO Mohammad Omar 在我回应他的初步询问之前几个月就联系了我,因为我当时正在享受悠闲的生活方式,并没有考虑过回到全职工作。

但最终,这个机会实在太好了,无法抗拒。

在与 Mohammad 和 LXT 团队的其他成员交谈时,我立即认识到了一种对语言的共同热情。Mohammad 聚集的团队中充满了富有创造力的思想家,具有无限的能量,他们完全致力于公司的使命。

当我了解更多关于 LXT 的机会时,我意识到这是一个我不想错过的机会。这里是一家具有巨大潜力的公司,能够在我热衷的领域扩大和增长。随着 AI 市场的指数级增长,帮助更多组织从实验转向生产是一个令人兴奋的机会,我很高兴能够成为其中的一部分。

目前获取大量数据的挑战是什么?

挑战与驱动它们的应用程序一样多样。

从实际角度来看,挑战包括真实性、可靠性、准确性、安全性和确保数据适合其目的 – 这还没有考虑到数据采集中日益增长的法律和道德挑战。

例如,开发支持自动驾驶汽车的技术需要收集大量数据,以涵盖汽车在现实世界中可能遇到的所有场景。驾驶中可能遇到的边缘情况数量是无穷的,因此支持这些车辆的算法需要涵盖从街道到停车标志再到掉落物体等一切的数据集。然后,如果你将其乘以可能发生的天气事件数量,所需的训练数据量就会呈指数级增加。进入自动驾驶领域的汽车公司需要建立可靠的数据管道,在没有大量资源的情况下自己完成这一任务将非常困难。

另一个用例是将现有的语音 AI 产品扩展到新的市场,以占领市场份额和新客户。这不可避免地需要语言数据,并且为了实现准确性,必须从具有代表性用户的文化背景的本地人中获取语音数据。一旦收集了数据,语音文件就需要被转录以训练产品的 NLP 算法。为多种语言和需要有效的数据量完成此操作对于公司来说是一个巨大的挑战,特别是如果他们在该领域缺乏内部专业知识的话。

这些只是与大规模 AI 数据采集相关的众多挑战中的两个例子,但您可以想象,家庭自动化、移动设备和生物数据采集都有其特定的挑战。

LXT 目前如何收集和注释数据?

在 LXT,我们根据每个客户的规格定制地收集和注释数据。我们处理多种类型的数据,包括音频、图像、语音、文本和视频。对于数据收集,我们与全球承包商网络合作,在这些不同模式下收集数据。收集可以从在现实世界环境中(如家庭、办公室或车内)获取数据到在语音数据收集项目中与经验丰富的工程师在录音室合作。

我们的数据注释能力也涵盖多种模式。我们的经验始于语音领域,过去 12 年来我们已扩展到 115 个国家和 750 个语言环境。这意味着所有规模的公司都可以依靠 LXT 帮助他们进入广泛的市场并吸引新客户群。最近,我们扩展到了文本、图像和视频数据,我们的内部平台用于向客户交付高质量的数据。

我们增长的另一个令人兴奋的领域是安全注释工作。就在今年,我们将 ISO 27001 安全设施的全球布局从 2 个扩展到 5 个。我们已经开发了一个可以在几个月内建立新设施的游戏规则。我们目前在这些安全设施中关注的服务是语音数据注释和转录,但它们可以用于注释多种数据类型。

为什么以这种方式获取数据比合成数据更好?

合成数据是 AI 领域的一个令人兴奋的发展,特别适合特定的用例,尤其是难以在现实世界中捕捉的边缘情况。合成数据的使用正在增加,特别是在 AI 成熟度的早期阶段,公司仍处于实验阶段。然而,我们自己的 研究 显示,随着组织成熟其 AI 战略并将更多模型推向生产,他们更有可能使用依赖于人工注释数据的监督或半监督机器学习方法。

人类在理解细微差别以创建训练 ML 模型以高精度运行所需的数据方面比计算机更好,人类监督也至关重要,以减少偏差。

为什么这些数据对语音和自然语言处理如此重要?

为了使语音和自然语言处理算法在预期的市场中有效地运行,需要用来自具有代表性用户文化背景的本地人的大量数据来训练它们。没有这些数据,语音 AI 的采用将受到严重限制。

此外,收集语音数据时需要考虑环境。如果要训练的语音 AI 解决方案将在汽车中使用,则需要考虑影响语音的不同道路和天气条件。这些是复杂的场景,经验丰富的数据合作伙伴可以提供帮助。

您还想分享关于 LXT 的其他信息吗?

首先,我想感谢您提供的分享我们故事的机会!我想强调,我们的公司致力于帮助所有规模的组织在 AI 计划中取得成功。我们专注于向全球公司提供高度定制的 AI 数据超过 12 年,我们很乐意与任何希望创建可靠的数据管道来支持其 AI 项目的人联系。

感谢这次精彩的采访,希望了解更多的读者可以访问 LXT

安托万是一位具有远见的领导者和Unite.AI的联合创始人,他对塑造和推广人工智能和机器人技术的未来充满热情。作为一位连续创业者,他相信人工智能将对社会产生电力的影响一样的颠覆性影响,并经常对颠覆性技术和通用人工智能的潜力大加赞扬。

作为一位未来学家Securities.io的创始人,这是一个专注于投资尖端技术的平台,这些技术正在重新定义未来并重塑整个行业。