Інтерв’ю

Інґо Мірсва, Засновник та Президент RapidMiner, Inc – Серія інтерв’ю

mm
Додайте Unite.AI до бажаних джерел у Google

Інґо Мірсва – Засновник та Президент RapidMiner, Inc. RapidMiner привносить штучний інтелект до підприємств через відкриту та розширювану платформу даних науки. Розроблена для команд аналітиків, RapidMiner об’єднує весь життєвий цикл даних науки від підготовки даних до машинного навчання та передбачувальної моделі розгортання. Більше 625 000 фахівців з аналітики використовують продукти RapidMiner для підвищення доходів, зниження витрат та уникнення ризиків.

Яка була ваша ідея створення RapidMiner?

Я працював у сфері консалтингу даних науки протягом багатьох років і побачив потребу в платформі, яка була б більш інтуїтивною та доступною для людей без формальної освіти в галузі даних науки. Багато існуючих рішень на той час залежали від кодування та скріптів і були просто не зручними для користування. Крім того, це робило дані важкими для управління та підтримки рішень, розроблених у цих платформах. По суті, я зрозумів, що ці проекти не повинні були такими складними, тому ми почали створювати платформу RapidMiner, щоб дозволити будь-кому стати великим фахівцем з даних науки.

Чи можете ви обговорити повну прозорість управління, яку зараз використовує RapidMiner?

Коли ви не можете пояснити модель, досить складно налаштувати, довіряти та перекласти. Багато роботи з даних науки полягає у спілкуванні результатів з іншими, щоб зацікавлені сторони могли зрозуміти, як покращити процеси. Це вимагає довіри та глибокого розуміння. Також питання довіри та перекладу можуть зробити дуже складним подолання корпоративних вимог для розгортання моделі. Ми боремося з цією битвою кількома способами:

Як візуальна платформа даних науки, RapidMiner природно створює пояснення всіх трубопроводів даних та моделей у високорозробленому форматі, який можна зрозуміти фахівцям з даних науки або не-фахівцям. Це робить моделі прозорими та допомагає користувачам зрозуміти поведінку моделі та оцінити її сильні та слабкі сторони та виявити потенційні упередження.

Крім того, всі моделі, створені на платформі, супроводжуються широкими візуалізаціями для користувача – зазвичай користувача, який створює модель, – щоб здобути уявлення про модель, зрозуміти поведінку моделі та оцінити упередження моделі.

RapidMiner також надає пояснення моделей – навіть у виробництві: Для кожного прогнозу, створеного моделлю, RapidMiner генерує та додає фактори впливу, які призвели до або вплинули на рішення, прийняте моделлю у виробництві.

Нарешті – і це дуже важливо для мене особисто, оскільки я керував цим з нашими інженерними командами кілька років тому – RapidMiner також надає надзвичайно потужну можливість симуляції моделі, яка дозволяє користувачам симулювати та спостерігати поведінку моделі на основі вхідних даних, наданих користувачем. Вхідні дані можна легко встановити та змінити, що дозволяє користувачеві зрозуміти передбачувану поведінку моделей у різних гіпотетичних або реальних випадках. Симулятор також відображає фактори, які впливають на рішення моделі. Користувач – у цьому випадку навіть бізнес-користувач або експерт з предметної області – може зрозуміти поведінку моделі, перевірити рішення моделі проти реальних результатів або знань з предметної області та виявити проблеми. Симулятор дозволяє вам симулювати реальний світ та подивитися в майбутнє – у ваше майбутнє, фактично.

Як RapidMiner використовує глибоке навчання?

Використання глибокого навчання в RapidMiner – це те, чим ми дуже пишаємось. Глибоке навчання може бути дуже складним для застосування, і не-фахівці з даних науки часто мають труднощі з налаштуванням цих мереж без експертної підтримки. RapidMiner робить цей процес якнайпрощим для користувачів усіх типів. Глибоке навчання, наприклад, є частиною нашого продукту Автоматичного машинного навчання (ML) під назвою RapidMiner Go. Тут користувач не повинен знати нічого про глибоке навчання, щоб використовувати ці типи складних моделей. Крім того, користувачі з більшими можливостями можуть йти глибше та використовувати популярні бібліотеки глибокого навчання, такі як Tensorflow, Keras чи DeepLearning4J, прямо з візуальних робочих процесів, які вони створюють з RapidMiner. Це подібно до гри з будівельними блоками та спрощує досвід для користувачів з меншими навичками даних науки. Через такий підхід наші користувачі можуть створювати гнучкі архітектури мереж з різними функціями активації та визначеною кількістю шарів та вузлів, декілька шарів з різною кількістю вузлів, і вибирати з різних методів навчання.

Який інший тип машинного навчання використовується?

Всі вони! Ми пропонуємо сотні різних алгоритмів навчання як частини платформи RapidMiner – все, що можна застосувати в широко використовуваних мовах програмування даних науки Python та R. Серед інших, RapidMiner пропонує методи для Наївного Баєса, регресії, таких як Загальні Лінійні Моделі, кластеризації, таких як k-Means, FP-Growth, Дерев’яні Моделі, Случайні Ліси, Паралельне Глибоке Навчання та Градієнтні Бустовані Дерева. Це та багато іншого є частиною бібліотеки моделей RapidMiner і можуть бути використані за один клік.

Чи можете ви обговорити, як Авто Модель знає оптимальні значення для використання?

RapidMiner Авто Модель використовує інтелектуальну автоматизацію для прискорення всього, що роблять користувачі, та забезпечення точних та надійних моделей. Це включає вибір екземплярів та автоматичне видалення аутлієрів, інженерію функцій для складних типів даних, таких як дати чи тексти, та повну багатокритеріальну автоматичну інженерію функцій для вибору оптимальних функцій та створення нових. Авто Модель також включає інші методи очищення даних для виправлення загальних проблем у даних, таких як відсутні значення, профайлінг даних шляхом оцінки якості та цінності стовпців даних, нормалізація та різні інші перетворення.

Авто Модель також витягує метадані про якість даних – наприклад, як сильно стовпець поводиться як ідентифікатор або чи є багато відсутніх значень. Ці метадані використовуються додатково до базових метаданих для автоматизації та допомоги користувачам у використанні “оптимальних значень” та боротьбі з проблемами якості даних.

Для більшої деталізації ми змапували все у нашому Блюпринті Авто Моделі. (Зображення нижче для додаткового контексту)

Є чотири основні фази, на яких застосовується автоматизація:

– Підготовка даних: Автоматичний аналіз даних для виявлення загальних проблем якості, таких як кореляції, відсутні значення та стабільність.
– Автоматичний вибір моделі та оптимізація, включаючи повну перевірку та порівняння продуктивності, що пропонує найкращі техніки машинного навчання для заданих даних та визначає оптимальні параметри.
– Симуляція моделі для визначення конкретних (прескриптивних) дій, які потрібно виробити для досягнення бажаного результату, передбаченого моделлю.
– На етапі розгортання та експлуатації моделі користувачеві показуються фактори, такі як дрейф, упередження та вплив на бізнес, автоматично без будь-якої додаткової роботи.

Комп’ютерне упередження – це проблема будь-якого типу штучного інтелекту, чи є заходи для запобігання упередженню в результатах?

Так, це дуже важливо для етичної науки про дані. Функції управління, згадані раніше, забезпечують, що користувачі завжди можуть побачити точно, які дані були використані для побудови моделі, як вони були перетворені, та чи є упередження у виборі даних. Крім того, наші функції для виявлення дрейфу є ще одним потужним інструментом для виявлення упередження. Якщо модель у виробництві демонструє багато дрейфу у вхідних даних, це може бути ознакою того, що світ змінився суттєво. Однак це також може бути індикатором того, що було серйозне упередження у навчальних даних. У майбутньому ми розглядаємо можливість подальших кроків та будівництва моделей машинного навчання, які можуть бути використані для виявлення упередження в інших моделях.

Чи можете ви обговорити RapidMiner AI Cloud та те, як він відрізняється від конкуруючих продуктів?

Вимоги до проекту даних науки можуть бути великими, складними та обчислювально інтенсивними, що зробило використання технології хмари таким привабливим стратегією для фахівців з даних науки. Нажаль, різні рідні хмарні платформи даних науки прив’язують вас до хмарних послуг та пропозицій зберігання даних конкретного хмарного постачальника.

RapidMiner AI Cloud – це просто наш хмарний сервіс доставки платформи RapidMiner. Ця пропозиція може бути адаптована до будь-якого середовища клієнта, незалежно від їхньої хмарної стратегії. Це важливо сьогодні, оскільки підхід більшості підприємств до управління хмарними даними розвивається дуже швидко у поточному кліматі. Гнучкість – це те, що відрізняє RapidMiner AI Cloud. Він може працювати у будь-якій хмарній службі, приватному хмарному стеку чи гібридному середовищі. Ми є хмарно-портативними, хмарно-агностичними, багатокладовими – як вам хочеться.

RapidMiner AI Cloud також дуже низький за трудомісткістю, оскільки ми пропонуємо можливість керувати всією чи частиною розгортання для клієнтів, щоб вони могли зосередитися на роботі свого бізнесу з AI, а не навпаки. Є навіть варіант на вимогу, який дозволяє запустити середовище за потреби для короткострокових проектів.

RapidMiner Radoop усуває деяку складність даних науки, чи можете ви розповісти нам, як Radoop вигідно відрізняється для розробників?

Radoop в основному призначений для не-розробників, які хочуть використати потенціал великих даних. RapidMiner Radoop виконує робочі процеси RapidMiner безпосередньо всередині Hadoop у спосіб, вільному від коду. Ми також можемо вбудувати двигун виконання RapidMiner у Spark, щоб було легко推ити повні робочі процеси у Spark без складності, яка супроводжує кодо-орієнтовані підходи.

Чи зможе урядова організація використовувати RapidMiner для аналізу даних для прогнозування потенційних пандемій, подібно до того, як це робить BlueDot?

Як загальна платформа даних науки та машинного навчання, RapidMiner призначена для спрощення та покращення процесу створення та управління моделями, незалежно від предметної області чи домену, який знаходиться в центрі проблеми даних науки/машинного навчання. Хоча наша увага не зосереджена на прогнозуванні пандемій, з правильними даними експерт з предметної області (наприклад, вірусолог або епідеміолог у цьому випадку) міг би використовувати платформу для створення моделі, яка могла б точно прогнозувати пандемії. Насправді, багато дослідників використовують RapidMiner – і наша платформа безкоштовна для академічних цілей.

Чи є щось інше, що ви хотіли б поділитися про RapidMiner?

Спробуйте! Ви можете бути здивовані, наскільки легко може бути наука про дані та наскільки хороша платформа може покращити продуктивність вас та вашої команди.

Дякую за це велике інтерв’ю, читачам, які бажають дізнатися більше, слід відвідати RapidMiner.

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.