访谈
LXT 首席运营官 Carolyn Harvey – 采访系列

Carolyn Harvey 拥有丰富的经验,领导和发展全球运营,专注于搜索相关性和机器学习数据的排名和注释。Carolyn 目前是 LXT 的首席运营官(COO),她领导公司的全球运营部门,确保所有 AI 数据程序和项目的一致性交付。她专注于大规模的高质量数据,建立长期项目的效率,并在大量全球位置上扩展。
作为 LXT 的 COO,Carolyn 借助她的丰富经验,致力于打造一流的组织。
您能否简要描述 LXT 的业务和您的 COO 角色?
人工智能依赖于数据来存在,LXT 是一家领先的公司,提供准确、道德来源的数据来驱动 AI 创新。作为首席运营官,我的角色是监督、领导和扩展我们的全球运营,通过战略、结构和流程来交付最高质量的 AI 数据给我们的客户。我确保我们按时交付,涵盖从生成式 AI 到搜索相关性和自动驾驶汽车等广泛的用例。
LXT 的使命自 2010 年成立以来如何演变?
我们的使命是通过数据生成和增强,推动未来技术的发展,涵盖每种语言、文化和模式。我们的目标是帮助各大小公司利用 AI 的不可思议的好处,通过为他们的模型提供高质量的数据。随着公司使命的演变,我们的服务范围已经扩展,从语言转录和语音采集到包括文本、图像和视频数据采集和注释、生成式 AI 服务等在内的广泛解决方案。我们还扩大了全球范围的 ISO 27001 认证设施,以满足客户日益增长的安全数据服务需求。
是什么驱动了 LXT 在 AI 训练数据领域的增长?
来自各大小组织的持续投资于 AI 推动了我们的增长。公司现在知道,AI 是他们保持竞争力的必备条件,而数据驱动着 AI。但并非所有数据都是一样的,成功的公司知道,高质量的数据对于创建更准确的 AI 至关重要。
现在,生成式 AI 成为大家的关注点,这一趋势为 LXT 带来了更多的增长机会。人类在确保这些解决方案的准确性、道德性和责任感方面至关重要。我们提供了一系列生成式 AI 服务,包括对大型语言模型的微调、提示创建等。我们的客户知道,要与最终用户建立信任,他们的生成式 AI 产品的输出需要是事实性的、代表多样化的受众、并且不包含有毒语言。我们可以通过我们的 human-in-the-loop 服务帮助他们实现这些目标。
生成式 AI 的爆发如何影响 LXT 和其客户?
LXT 已经看到对其 AI 训练数据的需求增加,特别是针对生成式 AI 的核心语言数据和分析、创造力和批判性思维等新方面。我们还看到对领域知识和项目工作者的专业资料的需求增加。
客户的请求越来越多地超出了过去的微任务机器学习输入,转向了更复杂的数据集,例如适用于 ChatGPT、Gemini 和许多其他应用的数据集。我们目前参与了几个创新项目,包括编写提示以测试生成式 AI 的反应,然后创建正确的答案。
在未来,这可能会进一步发展为人工通用智能(AGI),其中的数据集将对应于更加复杂和精致的行为。
您有多年的经验在搜索和个性化领域工作,以提高这些算法的性能。目前,领先的公司如何改进搜索相关性,以提供更好的用户体验?
在时间宝贵、信息无处不在的世界中,提高搜索相关性可以增强用户忠诚度、提高转化率、使用户更加高效。
搜索相关性始于清理和组织客户的数据,消除可能产生假阳性的任何内容,并创建额外的数据字段,以便搜索和推荐引擎可以扫描以生成更精确的结果。借助机器学习和自然语言处理,客户可以使他们的搜索引擎更直观地理解用户意图,并在时间的推移中学习他们的偏好。结果是一个更快的搜索体验,带来更个性化的结果。
实现这一目标需要大量的训练数据,特别是训练算法如何识别、排名和返回相关实体,以及如何处理拼写错误、语法错误和其他数据异常。我们还建议采用 human-in-the-loop(HITL)强化方法,以确保准确的数据、减少偏见、并为最终用户提供更好的搜索体验。随着过去 10 年的机器学习进步,HITL 对质量审查过程有了更强的关注,这推动了对数据提供商更深入的经验需求。
您能否详细介绍 LXT 的数据注释方法,以及如何确保 AI 训练数据的质量和准确性?
作为运营团队,我们必须首先了解客户如何使用我们提供的数据来开发他们的产品和服务,以确保这些数据能够满足他们的需求。为此,我们需要找到具有项目管理和注释经验的专家,特别是对于所需的数据类型。
然后,这主要是关于准备和在每个项目开始时找到合适的资源。这包括在范围定义阶段与客户对齐成功因素,以及对项目注释人员进行深入的资格和甄选过程,考虑诸如教育背景、特殊兴趣、人口统计学和经验等重要细节。我们还为每个项目开发详细的学习和参考材料作为指南。我们在整个项目生命周期中应用成熟的质量和流程管理监督,以确保结果符合客户的期望。
所有这些方法都服务于我们的保证数据质量承诺。
LXT 如何处理注释非结构化数据的挑战,非结构化数据占所有数据的 80% 以上?
LXT 已经建立了一个内部注释平台,自动化了注释过程的许多部分,并为工作者提供了结构化和一致的用户界面。在预处理阶段,我们专注于数据准备,格式化输入文件,删除重复项等。在后处理阶段,我们处理数据包装、收集和格式化,以便交付给客户。
在项目开始之前,我们会创建指南并与客户一起审查和迭代这些指南,在整个项目生命周期中进行调整。我们可以将数据标注过程分解为多个任务,以便适当地关注每个项目元素。另外,我们实施质量控制方法,以大规模消除错误。
最后,我们的运营卓越团队负责高效和可扩展的项目管理,以确保全球项目的高效率和可扩展性。
LXT 在全球范围内收集数据时面临的最大挑战是什么,以及如何克服这些挑战?
参与者和所产生的数据中多样性和偏见往往是 LXT 和任何 AI 训练数据提供商面临的最大挑战。其他挑战包括对领域专业知识的需求和快速变化的环境,特别是转向大型语言模型和生成式 AI 数据。
我们通过积极主动的候选人池来源来克服这些挑战,在那里我们审查专长、经验、以前的角色、兴趣和人口统计学,以形成团队的多样性,考虑诸如分析思维或创造性写作、教育背景等方面。
一旦我们找到合适的候选人,我们会非常努力地与工作者定期互动,以建立一个更加有经验、忠诚和满意的长期劳动力。
在 AI 评估方面,LXT 如何减轻偏见并确保 AI 系统的输出是道德的?
如前所述,确保多样性是许多 AI 训练数据提供商必须解决的挑战,这将在很大程度上减轻偏见并确保道德输出。
我将再次引用我们的参与最佳实践,包括找到多样化和代表性的注释人员,并彻底遵循指南和质量控制措施。我们有一个影响力采购策略,允许我们将工作带到新的和多样化的注释人员群体中,例如在长尾语言地区。
我们通过遵循行业最佳实践、与客户对齐期望、推动更高的项目经理和注释人员标准、进行沟通、合规审计、偏见分析和对数据监管和隐私要求的承诺来实现道德输出。
LXT 的长期愿景是什么,您如何看待公司在未来五年内的发展?
我们的愿景是提供准确、道德来源的数据,以推动 AI 和未来技术的发展,改善世界各地人们的体验。
虽然自动化和技术在 AI 中很重要,但也有一个重要的人类组成部分来补充技术。随着我们从简单的自动化任务转向大型语言模型(LLM),从生成式 AI 转向通用人工智能(GAI),将会至关重要的是,AI 产品能够忠实地代表人们,包括那些生成数据的人和我们的全球社区。
在 LXT,我们努力确保 AI 以积极和变革性的方式使用,反映这些价值观。
感谢这次精彩的采访,希望了解更多的读者可以访问 LXT。












