访谈
Datagen联合创始人兼CTO Gil Elbaz – 专访系列

Gil Elbaz是Datagen的CTO和联合创始人,总部位于特拉维夫。他从Technion获得了学士和硕士学位。Gil的论文研究重点是3D计算机视觉,并在世界顶级计算机视觉研究会议CVPR上发表。Datagen是模拟数据领域的先驱,这是一种合成数据的子集,专注于以照片般的真实性重现我们周围的世界。该公司于2021年3月以1800万美元的资金从隐身状态中脱颖而出,现在正在与包括美国顶级科技巨头在内的许多财富100强公司合作,涉及增强/虚拟现实、机器人和汽车领域。
是什么最初吸引你进入机器人和机器学习领域?
科幻小说,如艾萨克·阿西莫夫的《基础》系列和《机器人》,让我思考一个未来,机器人将成为我们日常生活中不可或缺的一部分。有这么多枯燥、重复的任务需要人们完成;我知道我不想做这些事情,我也无法想象其他人会想要做。考虑到机器人是一种技术上的必然性,我认为朝这个方向发展将是一个明智的、具有“未来导向”的职业选择。
所以,我最初接触这个领域时,关注的是物理方面,于是从特拉维夫的Technion获得了机械工程学位。在学位即将结束时,我开始深入研究CAD工具和功能。这些工具使机械工程师能够设计结构和机械设备(从桥梁到汽车)。我看到了一个巨大的机会,可以在不处理物理世界中缓慢迭代的情况下产生重大影响。在实践中,这些程序几乎没有或没有任何机器学习/计算机视觉功能集成,以帮助工程师创建更简单、更便宜、更稳定的机械系统(那是2015年)。我开始朝着使用深度学习的3D数据计算机视觉方向发展,目标是创建更智能的CAD程序。在深度学习的早期工作中,感觉就像成为了一件可能非常大的事情的一部分——就像互联网一样。
在实践中,我的研究是我们学院在Technion中第一个将深度学习革命带来的。后来,这变成了被世界顶级计算机视觉会议CVPR接受的论文,我在2017年的CVPR会议上飞往夏威夷。演讲我的论文并遇见那些人,真正地让我看到了计算机视觉社区的规模(现在至少是10倍大),成千上万的参与者都热情地在这个领域进行研究。那次活动基本上巩固了我的方向,向我展示了计算机视觉的力量和潜在的解锁。
您能分享Datagen背后的创立故事吗?
Datagen成立于2018年,旨在改变团队获取计算机视觉网络训练数据的方式。在那之前的一年,我们看到了Oculus Rift的演示,这包括一个VR头戴设备和一个手持遥控设备。演示结束后,我们开始想,“有了头戴设备中嵌入的复杂摄像头,为什么需要手持设备来连接虚拟空间和物理空间(即跟踪手部运动)?”神经网络已经足够先进,可以处理它,所以问题是什么?“那时,灵感来了——数据!我们马上看到了使用先进计算机视觉和3D元数据解决3D空间存在挑战的巨大机会。与其专注于VR/AR,我们采取了更全面的方法,专注于生成足够(和准确)的训练数据来实现现实世界中的3D AI应用。
以人类和人机交互为重点,Datagen是模拟数据领域的先驱,这是一种合成数据的子集,专注于以照片般的真实性重现我们周围的世界。如今,我们与世界上最具创新精神的公司合作,推动和加速他们的计算机视觉开发,并得到了该领域最受尊敬的投资者的支持。
对于不熟悉的人,您能解释什么是合成数据吗?
合成数据是任何通过算法或模拟生成的训练数据,而不是通过直接测量或观察现实世界获得的。在计算机视觉的背景下,合成数据是计算机生成的图像,带有用于训练人工智能所需的元数据。考虑到隐私问题和物理、经济限制,很难夸大合成数据对机器学习和人工智能的重要性。在最近的一份报告中,Gartner预测,到2024年,人工智能和分析项目中使用的数据将有60%是人工生成的,这是出于这些原因。
合成数据与手动数据采集相比有什么好处?
简短的答案是,想想手动数据采集的每个不理想的方面,然后从这个过程中去掉它们——这些就是合成数据的好处。
为计算机视觉训练生成多样化的数据集是一个昂贵、耗时的过程,且由于将人类置于特定位置并拍摄他们是一个复杂的过程,因此方差受到限制。另一个主要的好处是,有效地消除了手动注释的需要,这是一项枯燥、耗时且容易出错的任务。
Datagen将模拟数据称为合成数据的子集。您能详细解释一下什么是模拟数据吗?
模拟数据是通过模拟生成的合成数据。我们使用GAN(以及其他尖端的机器学习方法)来生成3D对象,并将它们放置在高度逼真的3D模拟环境中。它看起来像是一个第一人称的“虚拟拍照”过程,但是在一个基于物理的、照片般逼真的系统中运行。这些模拟产生视觉数据(就像在现实世界中收集的一样),以及一系列注释(物理、照明等)。因此,模拟数据是合成数据的子集,专注于以照片般的真实性重现我们周围的世界,生成的3D图像是上下文相关的,在模拟环境中收集的。
Datagen如何生成定制的模拟数据?
Datagen的技术生成模拟数据,这些数据不仅可以扩大规模,还可以根据每个客户的独特需求进行定制。我们通过考虑每个项目的每个方面来实现这一点,从所使用的计算机视觉系统到该系统将运行的地区的人口统计构成。无论我们是否直接与客户合作,还是使他们的工程师能够独立工作,Datagen的流程都从为每个特定用例建立关键参数开始,例如镜头规格、照明、环境、人口统计分布等。Datagen使用GAN和其他尖端工具和技术来生成大量资产,包括从具有动态面部表情的人类头部用于训练AI进行情感分析,到车内饰用于驾驶舱乘客监控,以及家庭环境用于视频会议应用等。对于每种资产类型,Datagen都在无数个离散轴上引入变异性(从皮肤色调和眉毛高度到家具的大小、颜色和形状),使用的参数经过精细调整,以反映特定的应用。这些能力使得Datagen的数据集不仅大且多样化,还针对训练一个独特的系统执行一个独特的任务(或一组任务)在一个独特的环境或设置中进行了优化——所有这些都没有损害扩展的能力。我们还考虑到每个应用的特定注释/元数据要求。
机器人领域中使用合成和/或模拟数据的解决方案有哪些例子?
使用模拟数据在机器人领域的最大优势之一是能够生成仍在开发中的硬件的图像。这样,机器人的“大脑”(AI)和“身体”(硬件)可以同时开发。现在,训练可以随着规格的演变而演变,而不是等到最终产品完全原型设计后才开始开发AI。
此外,由于模拟数据是在上下文中生成的,因此可以更容易地考虑机器人与其环境之间的交互作用。因此,如果你想象一个从装配线中抓取和去除有缺陷的产品的机器人,模拟数据将允许你不仅为产品中可能存在的每个物理缺陷生成数据,还可以从机器人的角度捕捉机器人臂的全部运动范围、其与物体的交互作用。更重要的是,3D元数据意味着不需要花费大量时间注释图像,以确保机器人可以正确识别产品、缺陷、其臂或视野中的任何其他内容。
智能汽车中使用模拟数据的用例有哪些?
在智能汽车开发中使用模拟数据,可以更容易地为特定的车型在设计过程中生成数据集,同时可以与汽车本身在设计和生产的各个阶段同步迭代。使用模拟图像数据,工程师还可以更有效地使用驾驶舱视觉来识别昏昏欲睡或分心的驾驶员,或者驾驶员是否将手从方向盘上拿开,或者考虑到驾驶员安全的任何边缘情况。它还可以让工程师考虑驾驶员和乘客的多样性,并引入图像角度和照明的变化——所有这些都不会侵犯真实的人的隐私。
最近,Datagen宣布了一批令人兴奋的新招聘, 这对公司的未来意味着什么?
我们最近加入的顾问委员会和高管团队中包括一些该领域最杰出、最有成就的专业人士。他们的知识、见解和经验将帮助Datagen在一个仍然年轻且充满机遇的行业中导航和加速增长。在一个有这么多未知数的领域中,没有什么比知识更有价值的了。
您还想分享关于Datagen的其他信息吗?
总部位于特拉维夫的Datagen是以色列发生的一场更大规模的经济和文化转变的一部分,我们为能成为其中的一部分而感到自豪。在短短几年内,以色列(尤其是特拉维夫),已经发展成为一个主要的全球科技中心,拥有蓬勃发展的初创企业生态系统和充满活力的投资社区。虽然以色列经常被认为是一个以网络安全为中心的科技中心,但人工智能和数据驱动的科技在这里已经经历了指数级的增长。如今,以色列有超过680家人工智能公司,这些公司已经集体筹集了45亿美元。这些公司在过去几年中的增长主要是由于工程师的高集中度和以色列世界闻名的大学。这些学术机构为我们提供了人才和该领域的尖端新技术。过去两个月,Datagen已经聘用了20多名员工,并计划在销售和营销、软件和DevOps以及产品部门中增加更多团队成员。
感谢这次精彩的采访,希望读者能够通过访问Datagen的网站来了解更多信息。












