访谈
Yashar Behzadi,Synthesis AI 的 CEO – 采访系列

Yashar Behzadi 博士是 Synthesis AI 的 CEO 和创始人。他是一位经验丰富的企业家,曾在 AI、医疗技术和物联网市场建立了具有变革性的企业。他在硅谷度过了过去 14 年,建立和扩展了以数据为中心的技术公司。Yashar 拥有超过 30 项专利和专利申请,并在 UCSD 获得了博士学位,专注于功能性脑成像的空间-时间建模。
Synthesis AI 是一个位于深度学习和 CGI 交叉点的初创公司,正在为计算机视觉模型开发创建新的范式。他们使客户能够以传统的人工注释方法的一小部分时间和成本开发出更好的模型。
您最初是如何开始从事计算机科学和 AI 的?
我于 2006 年从 UCSD 获得了计算机视觉和脑成像数据的空间-时间建模博士学位。然后,我在硅谷从事传感器、数据和机器学习领域的工作,跨越了各个行业,历时 16 年。我感到非常幸运能够有机会从事一些令人惊叹的技术,并拥有超过 30 项专利,专注于信号处理、机器学习和数据科学。
您能否分享 Synthesis AI 的创立故事?
在 2019 年创立 Synthesis AI 之前,我曾领导一家全球 AI 服务公司,专注于为领先的技术企业开发计算机视觉模型。无论公司的规模如何,我都发现我们受到高质量和大量标记训练数据的限制。随着公司的地理扩张、客户群体的增长或新模型和新硬件的开发,需要新的训练数据来确保模型的性能。同时,也很明显,计算机视觉的未来不会在今天的人工注释范式中取得成功。自主驾驶、机器人和 AR/VR/元宇宙应用中的新计算机视觉应用需要丰富的 3D 标签、深度信息、材料属性、详细分割等,人类无法注释。因此,需要一个新的范式来提供训练这些新模型所需的丰富标签集。除了技术驱动因素,我们还看到消费者和监管机构对模型偏差和消费者隐私的审查日益增加。
我创立 Synthesis AI 的目的是改变计算机视觉范式。该公司的合成数据生成平台能够按需生成具有扩展的 3D 像素完美标签的逼真图像数据。我们的使命是开创合成数据技术,以实现更具能力的模型的道德开发。
对于不熟悉这个术语的读者,您能否定义什么是合成数据?
合成数据是计算机生成的数据,作为替代现实世界数据。合成数据是在模拟的数字世界中创建的,而不是从现实世界中收集或测量的。通过结合视觉效果和 CGI 的工具与生成式 AI 模型,Synthesis AI 使公司能够创建大量的逼真、多样化的数据,以训练计算机视觉模型。该公司的数据生成平台通过保留隐私大幅度降低了获得高质量图像数据的成本和速度。
您能否讨论合成数据是如何生成的?
合成数据集是人工创建的,而不是通过现实世界数据。视觉效果行业的技术与生成式神经网络相结合,创建了大量、多样化和逼真的标记图像数据。合成数据允许以传统方法的一小部分时间和成本创建训练数据。
如何利用合成数据创建竞争优势?
目前,大多数 AI 系统使用“监督学习”,其中人类注释图像中的关键属性,然后训练 AI 算法来解释图像。这是一个耗时和耗费资源的过程,并且受到人类可以准确注释的限制。另外,AI 人口统计偏差和消费者隐私问题的担忧日益增加,使得获得代表性的人类数据变得越来越困难。
我们的方法是创建逼真的数字世界,合成复杂的图像数据。由于我们生成数据,我们知道场景中的所有信息,包括以前无法获得的有关对象 3D 位置及其与环境和其他对象的复杂交互的信息。使用当前方法获取和注释此类数据的数量需要数月甚至数年时间。这种新范式将实现效率和成本的 100 倍改善,并推动更具能力的模型的发展。
由于合成数据是人工生成的,因此消除了许多传统数据集收集方法中的偏差和隐私问题。
按需数据生成如何实现加速扩展?
捕获和准备现实世界数据用于模型训练是一个漫长而繁琐的过程。部署必要的硬件对于复杂的计算机视觉系统(如自主驾驶、机器人或卫星图像)来说可能具有禁止性的昂贵。一旦数据被捕获,人类就会注释和标记关键特征。这个过程容易出错,人类在注释关键信息(如许多应用所需的 3D 位置)方面的能力有限。
合成数据比传统的人工注释方法快了几个数量级,且更便宜,未来将加速新型和更具能力的模型在各个行业的部署。
合成数据如何实现 AI 偏差的减少或预防?
AI 系统无处不在,但可能包含固有的偏差,这些偏差会影响某些人群。数据集可能不平衡,某些类别的数据过度或不足代表。构建以人为中心的系统可能会导致性别、民族和年龄偏差。相比之下,设计生成的训练数据是平衡的,且不具有人类偏差。
合成数据可能成为解决 AI 偏差问题的强大解决方案。合成数据是部分或完全人工生成的,而不是从现实世界中测量或提取的。如果数据集不够多样或大,AI 生成的数据可以填补空白,形成无偏差的数据集。最好的部分是,手动创建这些数据集可能需要数月或数年才能完成。当使用合成数据时,可以在一夜之间完成。
除了计算机视觉之外,合成数据的其他潜在用例是什么?
除了与消费产品、自主驾驶、机器人、AR/VR/元宇宙等相关的众多计算机视觉用例外,合成数据还将影响其他数据模式。我们已经看到公司正在利用合成数据方法用于结构化表格数据、语音和自然语言处理。每种模式的底层技术和生成管道都不同,我们预计在不久的将来会看到多模式系统(例如,视频 + 语音)。
您还想分享关于 Synthesis AI 的其他信息吗?
去年晚些时候,我们发布了 HumanAPI,这是 Synthesis AI 合成数据能力的重大扩展,实现了数百万个唯一的、高质量的 3D 数字人体的程序化生成。这一公告是在 FaceAPI 合成数据即服务产品发布数月后,该产品已为领先的智能手机、远程会议、汽车和技术公司提供了超过 1000 万个标记的面部图像。HumanAPI 是公司支持高级计算机视觉人工智能应用的旅程中的下一步。
HumanAPI 还为我们的客户提供了众多新的机会,包括智能 AI 助手、虚拟健身教练,当然,还有元宇宙应用。
通过创建数字世界的数字复制品,元宇宙将实现新的应用,包括重新想象的社交网络、娱乐体验、远程会议、游戏等。计算机视觉 AI 将是现实世界在数字领域中以高保真度捕获和重建的基础。逼真、富有表现力和行为准确的人将是未来计算机视觉应用的必备组件。HumanAPI 是第一个实现公司能够按需创建大量完美标记的全身数据以构建更具能力的 AI 模型的产品,包括姿势估计、情感识别、活动和行为特征、面部重建等。
感谢您这次精彩的采访,希望了解更多的读者可以访问 Synthesis AI。












