Wywiady
Ingo Mierswa, Założyciel i Prezes RapidMiner, Inc – Wywiad

Ingo Mierswa jest założycielem i prezesem RapidMiner, Inc. RapidMiner wprowadza sztuczną inteligencję do przedsiębiorstw poprzez otwarty i rozszerzalny platformę data science. Zbudowany dla zespołów analitycznych, RapidMiner ujednolica cały cykl życia data science od przygotowania danych do uczenia maszynowego i wdrożenia modeli predykcyjnych. Ponad 625 000 profesjonalistów z dziedziny analityki używa produktów RapidMiner, aby zwiększyć przychody, zmniejszyć koszty i uniknąć ryzyka.
Jaki był Twój pomysł na założenie RapidMiner?
Pracowałem w branży konsultingu data science przez wiele lat i zauważyłem potrzebę platformy, która byłaby bardziej intuicyjna i dostępna dla ludzi bez formalnego wykształcenia w dziedzinie data science. Wiele istniejących rozwiązań w tamtym czasie opierało się na kodowaniu i skryptach, które po prostu nie były przyjazne dla użytkownika. Ponadto, utrudniały one zarządzanie danymi i utrzymanie rozwiązań opracowanych w ramach tych platform. Podstawowo, zrozumiałem, że te projekty nie muszą być tak trudne, więc zaczęliśmy tworzyć platformę RapidMiner, aby umożliwić każdemu zostać wielkim naukowcem danych.
Czy możesz omówić pełną przejrzystość zarządzania, która jest obecnie stosowana przez RapidMiner?
Gdy nie możesz wyjaśnić modelu, jest to dość trudne do dostrojenia, zaufania i przetłumaczenia. Dużo pracy związanej z data science dotyczy komunikowania wyników do innych, aby stakeholderzy mogli zrozumieć, jak poprawić procesy. Wymaga to zaufania i głębokiego zrozumienia. Ponadto, problemy z zaufaniem i tłumaczeniem mogą uczynić bardzo trudnym pokonanie wymagań korporacyjnych, aby wprowadzić model do produkcji. Walczymy z tymi bitwami na kilka różnych sposobów:
Jako wizualna platforma data science, RapidMiner niejawnie mapuje wyjaśnienie wszystkich potoków danych i modeli w wysoko spożywanym formacie, który może być zrozumiany przez naukowców danych lub osoby niebędące naukowcami danych. Ułatwia to modele transparentne i pomaga użytkownikom w zrozumieniu zachowania modelu i ocenie jego siły i słabości oraz wykryciu potencjalnych stronniczości.
Ponadto, wszystkie modele utworzone na platformie są wyposażone w obszerną wizualizację dla użytkownika – zwykle użytkownika tworzącego model – w celu uzyskania wglądu w model, zrozumienia zachowania modelu i oceny stronniczości modelu.
RapidMiner również zapewnia wyjaśnienia modelu – nawet w trakcie produkcji: Dla każdej prognozy utworzonej przez model, RapidMiner generuje i dodaje czynniki wpływające, które doprowadziły do lub wpłynęły na decyzje podjęte przez ten model w trakcie produkcji.
Wreszcie – i to jest dla mnie bardzo ważne, ponieważ kierowałem tym z naszymi zespołami inżynierskimi kilka lat temu – RapidMiner zapewnia również niezwykle potężną możliwość symulacji modelu, która pozwala użytkownikom symulować i obserwować zachowanie modelu na podstawie danych wejściowych dostarczonych przez użytkownika. Dane wejściowe mogą być ustawione i zmienione bardzo łatwo, co pozwala użytkownikowi zrozumieć predykcyjne zachowanie modelu w różnych hipotetycznych lub rzeczywistych przypadkach. Symulator wyświetla również czynniki, które wpływają na decyzję modelu. Użytkownik – w tym przypadku nawet użytkownik biznesowy lub ekspert domeny – może zrozumieć zachowanie modelu, zwalidować decyzję modelu w stosunku do rzeczywistych wyników lub wiedzy domenowej i zidentyfikować problemy. Symulator pozwala Ci spojrzeć w przyszłość – w Twoją przyszłość, tak naprawdę.
Jak RapidMiner wykorzystuje głębokie uczenie?
RapidMiner korzysta z głębokiego uczenia w sposób, którego możemy być bardzo dumni. Głębokie uczenie może być bardzo trudne do zastosowania, a osoby niebędące naukowcami danych często mają trudności z ustaleniem tych sieci bez wsparcia ekspertów. RapidMiner upraszcza ten proces jak najbardziej dla użytkowników wszystkich typów. Głębokie uczenie jest, na przykład, częścią naszego produktu Auto machine learning (ML) o nazwie RapidMiner Go. Tutaj użytkownik nie musi wiedzieć nic o głębokim uczeniu, aby skorzystać z tych zaawansowanych modeli. Ponadto, użytkownicy z większymi umiejętnościami mogą zagłębić się i korzystać z popularnych bibliotek głębokiego uczenia, takich jak Tensorflow, Keras lub DeepLearning4J, bezpośrednio z wizualnych przepływów, które tworzą z RapidMiner. Jest to jak zabawa z klockami i upraszcza doświadczenie dla użytkowników z mniejszymi umiejętnościami w dziedzinie data science. Dzięki temu podejściu nasi użytkownicy mogą tworzyć elastyczne architektury sieci z różnymi funkcjami aktywacji i określoną liczbą warstw i węzłów, wiele warstw z różną liczbą węzłów i wybierać spośród różnych technik szkoleniowych.
Jaki inny typ uczenia maszynowego jest stosowany?
Wszystkie! Oferujemy setki różnych algorytmów uczenia, które są częścią platformy RapidMiner – wszystko, co można zastosować w językach programowania data science, takich jak Python i R. Wśród innych, RapidMiner oferuje metody dla Naive Bayes, regresji, takiej jak Generalized Linear Models, klastry, takie jak k-Means, FP-Growth, Decision Trees, Random Forests, Parallelized Deep Learning i Gradient Boosted Trees. Te i wiele innych są częścią biblioteki modeli RapidMiner i mogą być używane za pomocą jednego kliknięcia.
Czy możesz omówić, jak Auto Model wie, jakie są optymalne wartości do użycia?
RapidMiner AutoModel wykorzystuje inteligentną automatyzację, aby przyspieszyć wszystko, co użytkownicy robią, i zapewnić, że modele są dokładne i poprawne. Obejmuje to wybór instancji i automatyczne usuwanie outlierów, inżynierię cech dla złożonych typów danych, takich jak daty lub teksty, oraz pełną wieloobiektową automatyczną inżynierię cech w celu wyboru optymalnych cech i konstruowania nowych. Auto Model obejmuje również inne metody czyszczenia danych, aby naprawić typowe problemy w danych, takie jak brakujące wartości, profilowanie danych, ocenę jakości i wartości kolumn danych, normalizację i różne inne transformacje.
Auto Model również wyodrębnia metadane jakości danych – na przykład, jak bardzo kolumna zachowuje się jak ID lub czy jest wiele brakujących wartości. Te metadane są używane dodatkowo do podstawowych metadanych w celu automatyzacji i wspomagania użytkowników w „używaniu optymalnych wartości” i radzeniu sobie z problemami jakości danych.
Dla większych szczegółów, wszystko to zostało odwzorowane w naszym Auto Model Blueprint. (Obraz poniżej dla dodatkowego kontekstu)
Istnieją cztery podstawowe fazy, w których stosowana jest automatyzacja:
– Przygotowanie danych: Automatyczna analiza danych w celu identyfikacji typowych problemów jakości, takich jak korelacje, brakujące wartości i stabilność.
– Automatyczny wybór modelu i optymalizacja, w tym pełna walidacja i porównanie wydajności, które sugerują najlepsze techniki uczenia maszynowego dla danych i określają optymalne parametry.
– Symulacja modelu, aby pomóc określić konkretną (preskryptywną) akcję, którą należy podjąć, aby osiągnąć pożądany wynik przewidziany przez model.
– W fazie wdrożenia i eksploatacji modelu użytkownicy są wyświetlani czynniki, takie jak dryft, stronniczość i wpływ biznesowy, automatycznie, bez dodatkowej pracy.

Sztuczna inteligencja jest zagrożona przez komputerową stronniczość, czy istnieją jakieś mechanizmy, które zapobiegają stronniczości w wynikach?
Tak, jest to naprawdę bardzo ważne dla etycznego data science. Funkcje zarządzania, o których wspomnieliśmy wcześniej, zapewniają, że użytkownicy mogą zawsze zobaczyć dokładnie, jakie dane zostały użyte do budowy modelu, jak zostały one przekształcone i czy istnieje stronniczość w danych. Ponadto, nasze funkcje wykrywania dryftu są kolejnym potężnym narzędziem do wykrywania stronniczości. Jeśli model w trakcie produkcji wykazuje dużo dryftu w danych wejściowych, może to być oznaką, że świat zmienił się dramatycznie. Może to być również wskaźnikiem, że istniała poważna stronniczość w danych szkoleniowych. W przyszłości rozważamy posunięcie o krok dalej i budowę modeli uczenia maszynowego, które mogą być używane do wykrywania stronniczości w innych modelach.
Czy możesz omówić RapidMiner AI Cloud i jak różni się od konkurencyjnych produktów?
Wymagania dotyczące projektu data science mogą być duże, złożone i wymagające obliczeniowo, co sprawiło, że korzystanie z technologii chmury stało się atrakcyjną strategią dla naukowców danych. Niestety, różne rodzime platformy data science oparte na chmurze wiążą Cię z usługami chmury i ofertami magazynowania danych konkretnego dostawcy chmury.
RapidMiner AI Cloud to po prostu nasza usługa dostarczania platformy RapidMiner w chmurze. Oferta może być dostosowana do środowiska każdego klienta, niezależnie od ich strategii chmury. Jest to ważne w dzisiejszych czasach, ponieważ podejście większości firm do zarządzania danymi w chmurze ewoluuje bardzo szybko. Elastyczność jest naprawdę tym, co wyróżnia RapidMiner AI Cloud. Może działać w dowolnej usłudze chmury, prywatnym stosie chmury lub w hybrydowym ustawieniu. Jesteśmy przenośni, agnostycznymi chmury, wielochmurowymi – czy jak kto woli.
RapidMiner AI Cloud jest również bardzo niskim stresem, ponieważ oczywiście oferujemy możliwość zarządzania wszystkimi lub częścią wdrożenia dla klientów, aby mogli się skoncentrować na prowadzeniu swojego biznesu z AI, a nie odwrotnie. Istnieje nawet opcja na żądanie, która pozwala uruchomić środowisko w razie potrzeby dla krótkich projektów.
RapidMiner Radoop eliminuje część złożoności związanej z data science, czy możesz powiedzieć, jak Radoop korzysta deweloperom?
Radoop jest głównie dla osób niebędących deweloperami, którzy chcą wykorzystać potencjał dużych danych. RapidMiner Radoop wykonywać przepływy pracy RapidMiner bezpośrednio w Hadoop w sposób wolny od kodu. Możemy również osadzić silnik wykonywania RapidMiner w Spark, aby było łatwo wypchnąć całe przepływy pracy do Spark bez złożoności, która pochodzi z podejścia opartego na kodzie.
Czy jednostka rządowa mogłaby użyć RapidMiner, aby analizować dane w celu przewidzenia potencjalnych pandemii, podobnie jak BlueDot działa?
Jako ogólna platforma data science i machine learning, RapidMiner ma na celu usprawnienie i poprawienie procesu tworzenia i zarządzania modelami, niezależnie od tego, jaki temat lub dziedzina jest centralnym punktem problemu data science/machine learning. Chociaż naszym celem nie jest przewidywanie pandemii, z odpowiednimi danymi ekspert ds. przedmiotu (taki jak wirusolog lub epidemiolog) mógłby użyć platformy do stworzenia modelu, który mógłby dokładnie przewidzieć pandemie. W rzeczywistości, wielu badaczy używa RapidMiner – i nasza platforma jest bezpłatna do celów akademickich.
Czy jest coś jeszcze, co chciałbyś podzielić się na temat RapidMiner?
Wypróbuj to! Możesz być zaskoczony, jak łatwo może być data science i jak wiele dobra platforma może poprawić Twoją i Twojego zespołu produktywność.
Dziękuję za ten wspaniały wywiad, czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić RapidMiner.












