Интервью
Инго Мирсва, Основатель и Президент RapidMiner, Inc – Интервью

Инго Мирсва – Основатель и Президент RapidMiner, Inc. RapidMiner приносит искусственный интеллект в предприятия через открытую и расширяемую платформу данных. Разработана для команд аналитики, RapidMiner объединяет весь жизненный цикл науки о данных от подготовки данных до машинного обучения и до предсказательной развертывания моделей. Более 625 000 профессионалов аналитики используют продукты RapidMiner, чтобы стимулировать доход, снижать затраты и избегать рисков.
Какова была ваша идея создания RapidMiner?
Я работал в бизнесе консалтинга по науке о данных в течение многих лет и увидел необходимость в платформе, которая была бы более интуитивной и доступной для людей без формального образования в области науки о данных. Многие существующие решения в то время полагались на кодирование и скриптинг и были просто не удобны для пользователя. Кроме того, это делало данные трудными для управления и поддержания решений, разработанных в этих платформах. По сути, я понял, что эти проекты не должны быть такими сложными, поэтому мы начали создавать платформу RapidMiner, чтобы любой человек мог стать отличным ученым в области данных.
Можете ли вы обсудить полную прозрачность управления, которая в настоящее время используется RapidMiner?
Когда вы не можете объяснить модель, это довольно трудно настроить, доверять и перевести. Большая часть работы в области науки о данных – это коммуникация результатов другим, чтобы заинтересованные стороны могли понять, как улучшить процессы. Это требует доверия и глубокого понимания. Кроме того, проблемы с доверием и переводом могут сделать очень трудным преодолеть корпоративные требования, чтобы получить модель в производство. Мы ведем эту борьбу несколькими способами:
Как визуальная платформа науки о данных, RapidMiner по своей сути создает объяснение для всех трубопроводов данных и моделей в высоко потребляемом формате, который может быть понятен как учеными в области данных, так и не-учеными в области данных. Это делает модели прозрачными и помогает пользователям понимать поведение модели и оценивать ее сильные и слабые стороны, а также обнаруживать потенциальные предубеждения.
Кроме того, все модели, созданные в платформе, поставляются с обширными визуализациями для пользователя – обычно для пользователя, создающего модель, – чтобы получить представление о модели, понять поведение модели и оценить предубеждения модели.
RapidMiner также предоставляет объяснения моделей – даже при производстве: Для каждого прогноза, созданного моделью, RapidMiner генерирует и добавляет факторы, которые привели или повлияли на решения, принятые этой моделью в производстве.
Наконец – и это очень важно для меня лично, поскольку я был движущей силой наших инженерных команд несколько лет назад – RapidMiner также предоставляет очень мощную возможность моделирования, которая позволяет пользователям моделировать и наблюдать поведение модели на основе входных данных, предоставленных пользователем. Входные данные можно легко задать и изменить, что позволяет пользователю понять предсказательное поведение моделей на различных гипотетических или реальных случаях. Симулятор также отображает факторы, которые влияют на решение модели. Пользователь – в данном случае даже бизнес-пользователь или эксперт в области – может понять поведение модели, проверить решение модели против реальных результатов или знаний в области и выявить проблемы. Симулятор позволяет вам симулировать реальный мир и заглянуть в будущее – в ваше будущее, на самом деле.
Как RapidMiner использует глубокое обучение?
Использование RapidMiner глубокого обучения – это то, чем мы очень гордимся. Глубокое обучение может быть очень трудным для применения, и не-ученые в области данных часто борются с настройкой этих сетей без экспертной поддержки. RapidMiner делает этот процесс как можно проще для пользователей всех типов. Глубокое обучение, например, является частью нашего продукта Auto машинного обучения (ML) под названием RapidMiner Go. Здесь пользователь не должен знать ничего о глубоком обучении, чтобы использовать эти сложные модели. Кроме того, пользователи с большими возможностями могут глубже и использовать популярные библиотеки глубокого обучения, такие как Tensorflow, Keras или DeepLearning4J, прямо из визуальных рабочих процессов, которые они строят с RapidMiner. Это как игра с строительными блоками и упрощает опыт для пользователей с меньшими навыками в области науки о данных. Благодаря этому подходу наши пользователи могут создавать гибкие сетевые архитектуры с разными функциями активации и пользовательским количеством слоев и узлов, несколько слоев с разным количеством узлов и выбирать из разных методов обучения.
Какой еще тип машинного обучения используется?
Все! Мы предлагаем сотни различных алгоритмов обучения в составе платформы RapidMiner – все, что можно применить в широко используемых языках программирования науки о данных Python и R. Среди прочего RapidMiner предлагает методы для Наивного Байеса, регрессии, такой как Обобщенные Линейные Модели, кластеризации, такой как k-Means, FP-Growth, Деревья Решений, Случайные Леса, Параллельное Глубокое Обучение и Градиентно-Усиленные Деревья. Все это и многое другое являются частью библиотеки моделей RapidMiner и могут быть использованы с одним кликом.
Можете ли вы обсудить, как Auto Model знает оптимальные значения для использования?
RapidMiner AutoModel использует интеллектуальную автоматизацию, чтобы ускорить все, что делают пользователи, и обеспечить точные, правильные модели. Это включает в себя выбор экземпляров и автоматическое удаление аномалий, инженерия функций для сложных типов данных, таких как даты или тексты, и полную многоцелевую автоматическую инженерию функций, чтобы выбрать оптимальные функции и создать новые. Auto Model также включает в себя другие методы очистки данных, чтобы исправить общие проблемы в данных, такие как пропущенные значения, профилирование данных, оценивающее качество и ценность столбцов данных, нормализацию и различные другие преобразования.
Auto Model также извлекает метаданные качества данных – например, как столбец ведет себя как идентификатор или есть ли много пропущенных значений. Эти метаданные используются в дополнение к базовым метаданным в автоматизации и помощи пользователям в использовании оптимальных значений и решении проблем качества данных.
Для более подробной информации мы все это изложили в нашей Схеме Auto Model. (Изображение ниже для дополнительного контекста)
Есть четыре основных фазы, где применяется автоматизация:
– Подготовка данных: Автоматический анализ данных для выявления общих проблем качества, таких как корреляции, пропущенные значения и стабильность.
– Автоматический выбор модели и оптимизация, включая полную проверку и сравнение производительности, предлагающее лучшие методы машинного обучения для заданных данных и определяющее оптимальные параметры.
– Симуляция модели, чтобы помочь определить конкретные (предписывающие) действия, которые необходимо предпринять, чтобы достичь желаемого результата, предсказанного моделью.
– На этапе развертывания и эксплуатации модели пользователи показывают факторы, такие как дрейф, предубеждение и бизнес-воздействие, автоматически без дополнительной работы.

Компьютерное предубеждение – это проблема с любым типом ИИ, есть ли какие-либо контроли, чтобы предотвратить предубеждение от проникновения в результаты?
Да, это действительно очень важно для этической науки о данных. Функции управления, упомянутые ранее, гарантируют, что пользователи всегда могут видеть, какие данные были использованы для построения модели, как они были преобразованы и есть ли предубеждение в выборе данных. Кроме того, наши функции для обнаружения дрейфа являются еще одним мощным инструментом для обнаружения предубеждения. Если модель в производстве демонстрирует много дрейфа в входных данных, это может быть признаком того, что мир изменился значительно. Однако это также может быть индикатором того, что было серьезное предубеждение в обучающих данных. В будущем мы рассматриваем возможность дальнейшего развития и создания моделей машинного обучения, которые могут обнаруживать предубеждение в других моделях.
Можете ли вы обсудить RapidMiner AI Cloud и то, как он отличается от конкурирующих продуктов?
Требования для проекта науки о данных могут быть большими, сложными и требовательными к вычислениям, что сделало использование облачных технологий такой привлекательной стратегией для ученых в области данных. К сожалению, различные облачные платформы науки о данных привязывают вас к облачным услугам и предложениям хранения данных конкретного облачного поставщика.
RapidMiner AI Cloud – это просто наш облачный сервис доставки платформы RapidMiner. Предложение может быть адаптировано к любой среде клиента, независимо от его облачной стратегии. Это важно в наши дни, поскольку подход большинства бизнесов к управлению облачными данными развивается очень быстро в текущем климате. Гибкость – это то, что отличает RapidMiner AI Cloud. Он может работать в любой облачной службе, частной облачной стеке или в гибридной установке. Мы являются облачными, независимыми от облака, многооблачными – как вам угодно.
RapidMiner AI Cloud также очень низкозатратен, поскольку мы, конечно, предлагаем возможность управлять всем или частью развертывания для клиентов, чтобы они могли сосредоточиться на управлении своим бизнесом с помощью ИИ, а не наоборот. Есть даже опция по требованию, которая позволяет запустить среду по мере необходимости для коротких проектов.
RapidMiner Radoop устраняет некоторые сложности, стоящие за наукой о данных, можете ли вы рассказать нам, как Radoop выгоден для разработчиков?
Radoop в основном предназначен для не-разработчиков, которые хотят использовать потенциал больших данных. RapidMiner Radoop выполняет рабочие процессы RapidMiner напрямую внутри Hadoop в код-независимом режиме. Мы также можем встроить движок выполнения RapidMiner в Spark, поэтому легко запустить полные рабочие процессы в Spark без сложности, которая возникает из код-центрических подходов.
Могла бы государственная сущность использовать RapidMiner для анализа данных, чтобы предсказать потенциальные пандемии, аналогично тому, как работает BlueDot?
Как общая платформа науки о данных и машинного обучения, RapidMiner предназначена для оптимизации и улучшения процесса создания и управления моделями, независимо от предметной области или области, находящейся в центре проблемы науки о данных/машинного обучения. Хотя наша основная направленность не лежит в области предсказания пандемий, с правильными данными эксперт в предметной области (например, вирусолог или эпидемиолог в данном случае) может использовать платформу для создания модели, которая могла бы точно предсказать пандемии. На самом деле, многие исследователи используют RapidMiner – и наша платформа бесплатна для академических целей.
Есть ли что-то еще, что вы хотели бы поделиться о RapidMiner?
Попробуйте! Вы можете быть удивлены, насколько легко может быть наука о данных и насколько хорошая платформа может улучшить вас и вашу команду.
Спасибо за это отличное интервью, читатели, которые хотят узнать больше, должны посетить RapidMiner.












