访谈
RapidMiner创始人兼总裁Ingo Mierswa – 采访系列

Ingo Mierswa是RapidMiner公司的创始人兼总裁。RapidMiner通过一个开放和可扩展的数据科学平台,将人工智能带入企业。该平台面向分析团队,统一了从数据准备到机器学习再到预测模型部署的整个数据科学生命周期。超过625,000名分析专业人员使用RapidMiner产品来驱动收入、降低成本和避免风险。
是什么启发你创立RapidMiner的?
我曾在数据科学咨询业务中工作了很多年,我看到需要一个更直观和易于使用的平台,即使对于没有正式数据科学教育背景的人来说也是如此。当时的许多现有解决方案都依赖于编码和脚本,并且不够用户友好。此外,这些平台使得数据难以管理和维护。基本上,我意识到这些项目不需要这么困难,所以我们开始创建RapidMiner平台,以便任何人都可以成为一名伟大的数据科学家。
可以讨论一下RapidMiner目前使用的完全透明的治理吗?
当你无法解释一个模型时,很难调整、信任和转换它。数据科学工作中的大部分内容是将结果传达给他人,以便利益相关者能够理解如何改进流程。这需要信任和深入的理解。另外,信任和转换的问题可能使得很难克服将模型投入生产的企业要求。我们正在通过以下几种方式解决这个问题:
作为一个可视化的数据科学平台,RapidMiner本质上为所有数据管道和模型提供了一个高度可消费的解释格式,可以被数据科学家或非数据科学家理解。它使模型变得透明,并帮助用户了解模型行为、评估其优缺点和检测潜在偏差。
此外,平台中创建的所有模型都附带了广泛的可视化工具,供用户(通常是创建模型的人)使用,以了解模型见解、理解模型行为和评估模型偏差。
RapidMiner还提供模型解释,即使在生产中也是如此。对于模型创建的每个预测,RapidMiner都会生成并添加影响因素,这些因素导致或影响了模型在生产中的决策。
最后——而且这对我个人来说非常重要,因为我几年前就推动我们的工程团队做这件事——RapidMiner还提供了一个非常强大的模型模拟器功能,允许用户模拟和观察模型行为,基于用户提供的输入数据。输入数据可以很容易地设置和更改,允许用户了解模型的预测行为在各种假设或真实世界场景中的表现。模拟器还显示了影响模型决策的因素。用户——在这种情况下,即使是业务用户或领域专家——可以了解模型行为、验证模型决策与实际结果或领域知识,并识别问题。模拟器允许您模拟现实世界并展望未来——您的未来。
RapidMiner如何使用深度学习?
RapidMiner对深度学习的使用是我们非常自豪的。深度学习可能很难应用,非数据科学家通常难以在没有专家支持的情况下设置这些网络。RapidMiner使这个过程对于所有类型的用户来说尽可能简单。例如,深度学习是我们自动机器学习(ML)产品RapidMiner Go的一部分。在那里,用户不需要知道任何关于深度学习的知识就可以使用这些复杂的模型。此外,高级用户可以更深入地使用流行的深度学习库,如Tensorflow、Keras或DeepLearning4J,直接从他们使用RapidMiner构建的可视化工作流中。这种方法使我们的用户能够构建具有不同激活函数和用户定义的层数和节点的灵活网络架构,具有不同层数的多个层,并选择不同的训练技术。
使用了什么其他类型的机器学习?
所有!我们提供了数百种不同的学习算法作为RapidMiner平台的一部分——所有可以在广泛使用的数据科学编程语言Python和R中应用的算法。RapidMiner提供了诸如Naive Bayes、回归(如广义线性模型)、聚类(如k-Means、FP-Growth)、决策树、随机森林、并行深度学习和梯度提升树等方法。这些以及更多都是RapidMiner的建模库的一部分,可以通过单击使用。
可以讨论一下Auto Model如何知道使用的最佳值吗?
RapidMiner AutoModel使用智能自动化来加速用户所做的一切,并确保准确、健全的模型被构建。包括实例选择和自动异常值删除、复杂数据类型(如日期或文本)的特征工程以及用于选择最佳特征和构造新特征的全多目标自动特征工程。Auto Model还包括其他数据清理方法来解决常见的数据问题,例如缺失值、数据质量评估和数据归一化等。
Auto Model还提取数据质量元数据——例如,一个列如何表现得像一个ID,或者是否有很多缺失值。这些元数据与基本元数据一起用于自动化和帮助用户“使用最佳值”并处理数据质量问题。
为了更详细地了解,我们已经将其全部绘制在我们的Auto Model Blueprint中。(下面的图像提供了额外的上下文)
有四个基本阶段应用自动化:
– 数据准备:自动分析数据以识别常见的质量问题,如相关性、缺失值和稳定性。
– 自动模型选择和优化,包括全面的验证和性能比较,建议最适合给定数据的机器学习技术并确定最佳参数。
– 模型模拟,以帮助确定实现预测结果所需的具体(规定)操作。
– 在模型部署和运营阶段,用户会自动看到诸如漂移、偏差和业务影响等因素,无需额外的工作。

计算偏差是任何类型的AI的一个问题,是否有任何控制措施来防止偏差在结果中出现?
是的,这对于道德数据科学来说确实非常重要。前面提到的治理功能确保用户可以始终看到确切的数据被用于模型构建、如何转换以及是否存在数据选择中的偏差。另外,我们的漂移检测功能是检测偏差的另一个强大的工具。如果生产中的模型表现出大量的漂移,这可能是世界发生了显著变化的迹象。然而,它也可能是训练数据中存在严重偏差的指标。在未来,我们考虑进一步采取措施,建立可以检测其他模型偏差的机器学习模型。
可以讨论一下RapidMiner AI Cloud以及它如何与竞争产品区别开来吗?
数据科学项目的要求可能很大、很复杂、计算密集,这使得使用云技术成为数据科学家的有吸引力的策略。遗憾的是,各种本地云数据科学平台将您绑定到特定的云服务和数据存储供应商的服务中。
RapidMiner AI Cloud只是我们以云服务形式提供的RapidMiner平台。该服务可以根据任何客户的环境进行定制,无论他们的云策略如何。这在当前的环境下至关重要,因为大多数企业的云数据管理方法正在迅速演变。灵活性真正使RapidMiner AI Cloud与众不同。它可以在任何云服务、专有云栈或混合环境中运行。我们是云便携、云无关、多云——无论您喜欢怎么称呼它。
RapidMiner AI Cloud还非常方便,因为我们提供了全面的部署管理服务,允许客户专注于使用AI运行业务,而不是相反。甚至还有按需选项,允许您根据需要为短期项目启动环境。
RapidMiner Radoop消除了数据科学的一些复杂性,可以告诉我们Radoop如何让开发人员受益吗?
Radoop主要面向非开发人员,他们希望利用大数据的潜力。RapidMiner Radoop直接在Hadoop中以无代码的方式执行RapidMiner工作流。我们还可以将RapidMiner执行引擎嵌入Spark,使得将完整的工作流推入Spark变得容易,而无需代码中心的复杂性。
政府实体是否可以使用RapidMiner来分析数据以预测潜在的流行病,类似于BlueDot的操作方式?
作为一个通用的数据科学和机器学习平台,RapidMiner旨在简化和增强模型创建和管理过程,无论数据科学/机器学习问题的核心是什么。虽然我们的重点不是预测流行病,但有了正确的数据,主题专家(在这种情况下,如病毒学家或流行病学家)可以使用该平台创建一个可以准确预测流行病的模型。事实上,许多研究人员使用RapidMiner——我们的平台对于学术目的是免费的。
关于RapidMiner还有什么其他信息您想分享吗?
试试看!您可能会惊讶于数据科学可以有多么简单,以及一个好的平台可以提高您和您的团队的生产力多少。
感谢这次伟大的采访,希望了解更多的读者可以访问RapidMiner。












