AI 模型与平台

Omer Har,Explorium联合创始人兼CTO – 采访系列

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Omer Har是一位数据科学和软件工程领域的资深专家,拥有近十年的经验,专注于构建能够推动大型企业发展的AI模型。

Omer Har是Explorium的联合创始人兼CTO,Explorium是一家提供数据科学平台的公司,该平台由增强数据发现和特征工程驱动。通过自动连接到成千上万的外部数据源,并利用机器学习来提取最有影响力的信号,Explorium平台使数据科学家和企业领导者能够通过消除获取正确数据的障碍并实现优越的预测能力来驱动决策。

您是什么时候第一次意识到自己想要从事数据科学工作的?

我对数据科学的兴趣可以追溯到十年前,当时我开始从事数据科学和领导数据科学团队的工作。我最初是一名软件工程师,但我一直被复杂的数据和算法挑战所吸引。我很幸运能够在微软研究院学习数据科学,在那里我可以真正地从事大规模的应用机器学习挑战。

(MSFT )

 

您在2017年联合创立了Explorium,能否讨论一下创立这家初创公司的灵感来源?

Explorium的理念非常简单却强大——我们周围有大量的数据,这些数据可能有助于构建更好的模型,但我们无法提前知道哪些数据源将是有影响力的,或者如何使用它们。这个想法最初来自于Explorium的联合创始人兼CEO马奥·什洛莫,他在军事服务期间处理了前所未有的数据多样性,并探索了如何利用这些数据进行决策和建模。当我们三人第一次聚在一起时,我们很快意识到,这种需求在商业世界中也很常见,特别是在数据科学驱动的快速增长领域,如广告和营销技术领域,我和奥·塔米尔(Explorium的联合创始人兼COO)都曾在这些领域领导增长。

在Explorium之前,找到真正能够提高机器学习模型准确性的相关数据源是一个耗时、昂贵且成功率低的过程。原因是您基本上是在猜测,并且使用贵公司最昂贵的人员——数据科学家——来进行实验。此外,数据获取本身就是一个复杂的商业流程,数据科学团队通常没有能力与多个数据提供商进行商业接触。

作为一名数据科学领导者,我被要求通过模型产生业务影响,我没有奢侈地将团队派去进行漫无目的的搜索。因此,您经常更愿意将精力投入到可能产生较低影响的领域,但这些领域更容易控制。

 

Explorium最近成功地在B轮融资中获得了3100万美元的额外资金。您是否对公司的快速增长感到惊讶?

这确实是一次激动人心的旅程,我永远不会把它视为理所当然。我不能说我对数据需求的广泛性感到惊讶,但看到我们为客户和他们的业务带来的影响始终是一种难以置信的体验。未来十年中,组织将面临的最大分析挑战是找到正确的数据来驱动他们的模型和自动化流程。正确的数据资产可以让新的市场领导者脱颖而出,因此我们的增长反映了越来越多的客户意识到这一点并将数据作为优先事项的快速增长。事实上,我们遇到的“数据猎人”——那些在日常工作中寻找数据的人——的数量正在呈指数级增长。

 

您能否解释Explorium的数据平台是什么,以及自动数据发现过程是如何工作的?

Explorium提供了一个端到端的数据科学平台,驱动增强数据发现和特征工程。我们专注于数据科学的“数据”部分——这意味着自动连接到成千上万的外部数据源,并利用机器学习过程来提取最有影响力的信号和特征。这是一个复杂的多阶段过程,首先连接到我们称为Explorium数据目录的上下文相关源。然后,我们自动探索这个相互关联的数据多样性,通过测试成千上万个有意义的特征和信号的想法来创建最优的特征集,在其上构建模型,并以灵活的方式提供服务。

通过自动搜索您需要的数据,而不仅仅是您拥有的内部数据,Explorium平台正在做数据科学中与搜索引擎对网络所做的相同的事情——我们正在扫描、排名和为您提供最相关的数据来回答预测问题。

这使数据科学家和企业领导者能够通过消除获取正确数据的障碍并实现优越的预测能力来驱动决策。

 

Explorium可以访问哪些类型的外部数据源?

我们可以访问几乎所有您能想到的数据类别的成千上万个数据源,包括公司、地理空间、行为、时间、网站数据等。我们有多个专门从事数据获取的专家团队,通过开放、公共和高级来源,以及合作伙伴关系来获取数据。我们从以色列顶级情报和技术单位招募的独特人才为我们带来了在利用数据多样性进行决策方面的实质性专业知识和经验。

 

Explorium如何使用机器学习来了解哪些类型的数据对客户来说是相关的?

这是我们的“秘密酱料”,所以我不能深入探讨,但在高层次上,我们使用机器学习来理解不同数据集的含义,并不断改进算法来识别我们目录中哪些源可能是相关的。通过将这些源连接到您的数据,我们能够执行复杂的数据发现和特征工程过程,专门设计用于外部和高维数据,以识别最有影响力的特征来自最相关的源。所有这些都是在机器学习模型的背景下进行的,使得影响可以被统计测量,并允许我们不断学习和改进我们的匹配、生成和发现能力。

 

Explorium提供的一种解决方案是通过使用增强数据发现来减轻在线贷款机构的申请欺诈风险。您能否详细说明这种解决方案的工作原理?

贷款业务都与预测和减轻风险有关,无论是借款人的还款能力(例如财务表现)还是他们的还款意愿(例如欺诈)。贷款申请本质上是贷款机构希望收集更多信息与他们能够与其他提供商竞争之间的权衡,因为更长、更繁琐的问卷有较低的完成率、有偏见,并且如此等等。

有了Explorium,传统银行和在线挑战者都可以自动地用外部和客观的数据源来增强申请流程,这些数据源可以立即提供上下文并揭示有意义的关系。在欺诈的背景下,这可能意味着与真正的申请人相比,欺诈申请人表现出不同的行为和属性,如果您能够收集到关于他们的360度视图。从在线存在、官方记录、社交媒体上的行为模式到物理足迹,所有这些都可能留下面包屑,可以被假设为潜在的特征和指标,如果您可以访问相关数据和垂直专业知识。简单来说,拥有更好的数据可以确保更好的预测模型,这有助于将降低风险和增加收入转化为贷款机构的利润。

从更广泛的角度来看,自从COVID-19在全球范围内爆发以来,我们看到新的欺诈模式的增加,以及贷款机构需要回到基础的需求。由于这次疫情打破了所有模型,没人真正考虑到这种“黑天鹅”事件。我们最初的响应是为这些公司生成自定义信号,以帮助评估业务风险,在这些不确定和动态的时期。

您可以在Explorium联合创始人兼CEO马奥·什洛莫撰写的优秀文章中了解更多信息。

感谢这次精彩的采访,希望读者能够通过访问Explorium来了解更多信息。

安托万是一位具有远见的领导者和Unite.AI的联合创始人,他对塑造和推广人工智能和机器人技术的未来充满热情。作为一位连续创业者,他相信人工智能将对社会产生电力的影响一样的颠覆性影响,并经常对颠覆性技术和通用人工智能的潜力大加赞扬。

作为一位未来学家Securities.io的创始人,这是一个专注于投资尖端技术的平台,这些技术正在重新定义未来并重塑整个行业。