访谈

Graviti创始人兼CEO Edward Cui – 采访系列

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Edward Cui是Graviti的创始人兼CEO,Graviti是一家正在建设下一代数据平台的公司,这将从根本上改变开发人员与非结构化数据的交互方式。通过Graviti,AI开发人员可以更快速、更容易地获取、存储和处理数据,这是利用人工智能赋予所有行业力量的基础。

您最初在大学学习机械工程,是什么原因导致您转向计算机科学和人工智能?

我实际上在2012年以机械工程为专业开始了我的本科学习。在宾夕法尼亚大学,我参加了一门机器学习的课程,这让我大开眼界,我知道这就是未来,也是我想要从事的职业。完成那门课程后,我转到了计算机科学专业。

毕业后,我在宾夕法尼亚大学进行了强化学习的研究。2015年,我的前任老板杰夫·斯奈德(Jeff Snyder)加入了Uber,并邀请我加入Uber ATG。这标志着我在自动驾驶汽车行业的职业生涯的开始。

您能否分享Graviti的创立故事?

在Uber工作的最初阶段非常复杂,因为人们没有使用大型机器学习模型,我们也缺乏计算能力和数据管理平台来训练模型。我们为自动驾驶汽车收集的数据都是非结构化的,例如图像、视频、激光雷达点等。我们每天都会收集到大量的非结构化数据,这造成了如何存储、管理和利用这些数据来为各个组织创造价值的巨大问题。

在Uber工作了三年后,我看到了改进大规模非结构化数据管理的机会。因此,我在2019年创立了Graviti,以加速人工智能创新,通过建设非结构化数据管理平台。

您能否讨论Graviti如何成为一个管理和结构化数据的平台?

Graviti旨在推出第一个使组织能够利用大量非结构化数据来驱动创新人工智能应用的数据平台。该平台消除了麻烦,帮助开发人员更容易地管理大量非结构化数据与团队合作。

虽然人工智能开发中可用的信息大多数是低质量和非结构化的,开发团队通常会花费超过50%的时间,不是在构建模型,而是在识别、增强或清理非结构化数据,这只是他们工作的开始。Graviti提供了一种更专业的数据管理方式,释放开发人员的时间,让他们能够分析非结构化数据并训练人工智能模型。

我们在三个维度上帮助开发人员:数据发现、数据迭代和工作流自动化。

数据发现:

Graviti提供了一个数据托管功能,使得组织原始数据、注释和元数据变得更加容易,通过统一数据集和注释格式。当AI开发人员通过Graviti访问不同的数据集时,他们不需要转换数据格式,这简化了管理、查询、访问和注释相关的操作。Graviti帮助减少了原始数据不匹配或注释丢失的机会。另外,Graviti平台可以帮助开发人员通过数据可视化功能评估数据集的质量,这至少可以为开发人员节省每周8个小时的时间。

数据迭代:

当开发人员训练他们的AI模型时,他们需要使用不同版本的数据集来测试结果并标记注释。挑战在于跟踪各种编辑和版本,以及团队成员在同一个项目上合作。Graviti提供了解决方案,通过为员工分配不同的访问权限,让他们能够上传注释以跟踪项目的进度并同时工作。

工作流自动化:

通过一个名为“Action”的功能,工程师可以自动化工作流程,减少重复、耗时和手动任务。它让开发人员摆脱了编写大量手动脚本来实现这些工作流程的需要,并为他们腾出时间来做他们需要做的工作。

为什么非结构化数据是AI的未来?

目前,超过80%的企业数据是非结构化的,包括图像、录音、视频、社交媒体帖子等。AI是从非结构化数据中提取价值的关键。企业开始利用非结构化数据来支持深入的研究和进一步的分析。

Graviti最近推出了OpenBytes,一个托管在Linux基金会下的非营利开源数据项目。您能否讨论OpenBytes的具体内容?

OpenBytes的使命是通过创建数据标准、格式和流程来促进AI社区更广泛地共享数据,促进数据的贡献。OpenBytes的范围包括开放数据集的策划、开放数据规范的开发以及在开放许可下支持使命的协作开发,包括文档、测试、集成以及其他有助于开发、部署、操作或采用开源项目的文物的创建。

OpenBytes可以减少数据贡献者的责任风险。数据集持有者由于缺乏数据许可证知识而不愿意公开分享他们的数据集。一旦数据贡献者加入OpenBytes,他们的数据将受到保护,更多的开放数据将变得可访问。

我们还在发布、分享和交换数据时生成标准数据集格式。统一的格式将帮助数据贡献者了解数据集并找到他们需要的相关数据,从而导致更高质量的开放数据集贡献。

开源数据集的益处是什么?

它们造福研究人员,因为科学家有更多的免费资源来训练模型和完成研究。

它们也造福企业,它们利用这些数据集来开始构建AI能力并加速从传统企业到AI企业的转型。

Graviti如何验证数据集的质量?

即使是流行的数据集,如COCO和KITTI,对于开发人员来说也不是完美的。训练模型时总会出现错误,目前还没有找到改善数据集质量的好方法。Graviti相信,数据集评估模型将被建立,或者其他技术革命将帮助社区解决这个问题,这也是Graviti在未来实现的使命之一。

您对开发人员未来访问数据的愿景是什么?

对于少量的数据,开发人员应该能够轻松访问这些数据。对于更大量的数据,例如用于训练模型的多样化数据集,联邦学习技术将有助于以协作的方式工作,通过解耦机器学习的能力和在中央服务器上存储数据。

您是否还有其他关于Graviti的事情想要分享?

Graviti也在不断进化。我们倾听来自客户的反馈,包括初创企业、企业、个人开发人员和研究人员。我们也欢迎来自所有人的任何合作或伙伴关系机会。

我们在开源数据的AI开发中看到巨大的机会。我们建立了一个社区,用于分享和贡献开源数据。这不仅将造福研究人员进一步推动科学的边界,也将造福企业,让它们能够完善模型并在相互有益的环境中进化技术。

感谢这次精彩的采访,希望了解更多的读者可以访问Graviti。

安托万是一位具有远见的领导者和Unite.AI的联合创始人,他对塑造和推广人工智能和机器人技术的未来充满热情。作为一位连续创业者,他相信人工智能将对社会产生电力的影响一样的颠覆性影响,并经常对颠覆性技术和通用人工智能的潜力大加赞扬。

作为一位未来学家Securities.io的创始人,这是一个专注于投资尖端技术的平台,这些技术正在重新定义未来并重塑整个行业。