Rozhovory
Ingo Mierswa, zakladatel a prezident společnosti RapidMiner, Inc. – Interview Series

Ingo Mierswa je zakladatel a prezident společnosti RapidMiner, Inc. RapidMiner přináší umělou inteligenci do podniků prostřednictvím otevřené a rozšiřitelné platformy pro datové vědy. Navržená pro analytické týmy, RapidMiner sjednocuje celý životní cyklus datové vědy od přípravy dat po strojové učení až po nasazení prediktivních modelů. Více než 625 000 analytických profesionálů používá produkty RapidMiner, aby generovali příjmy, snižovali náklady a zabraňovali rizikům.
Co vás inspirovalo k založení RapidMiner?
Pracoval jsem mnoho let v oblasti poradenské činnosti pro datové vědy a viděl jsem potřebu platformy, která by byla intuitivnější a přístupnější pro lidi bez formálního vzdělání v oblasti datové vědy. Mnohé z existujících řešení v té době závisely na kódování a skriptování a nebyly prostě uživatelsky přívětivé. Kromě toho to činilo datové vědy obtížné spravovat a udržovat řešení, která byla vyvinuta v rámci těchto platforem. Základní myšlenka spočívala v tom, že tyto projekty nemusí být tak složité, a tak jsme začali vytvářet platformu RapidMiner, aby kdokoli mohl být skvělým datovým vědcem.
Můžete diskutovat o plné transparentnosti řízení, které目前 používá RapidMiner?
Když nelze vysvětlit model, je poměrně obtížné jej ladit, důvěřovat a překládat. Velká část práce v oblasti datové vědy spočívá ve komunikaci výsledků ostatním, aby mohli pochopit, jak zlepšit procesy. To vyžaduje důvěru a hluboké porozumění. Kromě toho problémy s důvěrou a překladem mohou učinit velmi obtížným překonat firemní požadavky na nasazení modelu. Bojujeme s touto bitvou několika způsoby:
Jako vizuální platforma pro datové vědy RapidMiner automaticky mapuje vysvětlení pro všechny datové potrubí a modely ve vysoce spotřebovatelném formátu, který lze pochopit datovými vědci i negativními datovými vědci. To činí modely transparentními a pomáhá uživatelům pochopit chování modelu a vyhodnotit jeho sílu a slabiny a detekovat potenciální předpojatosti.
Kromě toho všechny modely vytvořené na platformě jsou vybaveny rozsáhlými visualizacemi pro uživatele – typicky pro uživatele, který vytváří model – aby získal přehled o modelu, pochopil chování modelu a vyhodnotil předpojatost modelu.
RapidMiner také poskytuje vysvětlení modelu – i v produkci: Pro každou předpověď vytvořenou modelem RapidMiner generuje a přidává vlivné faktory, které vedly k rozhodnutí modelu v produkci.
Nakonec – a toto je pro mě osobně velmi důležité, protože jsem to řídil s našimi inženýrskými týmy před několika lety – RapidMiner také poskytuje velmi silnou schopnost simulace modelu, která umožňuje uživatelům simulovat a pozorovat chování modelu na základě vstupních dat poskytnutých uživatelem. Vstupní data lze snadno nastavit a změnit, což umožňuje uživateli pochopit prediktivní chování modelu v různých hypotetických nebo reálných případech. Simulátor také zobrazuje faktory, které ovlivňují rozhodnutí modelu. Uživatel – v tomto případě i obchodní uživatel nebo odborník na doménu – může pochopit chování modelu, ověřit rozhodnutí modelu proti reálným výsledkům nebo znalostem domény a identifikovat problémy. Simulátor umožňuje vám simulovat skutečný svět a nahlédnout do budoucnosti – do vaší budoucnosti, vlastně.
Jak RapidMiner využívá hluboké učení?
RapidMiner je hrdý na své využití hlubokého učení. Hluboké učení může být velmi obtížné aplikovat a negativní datoví vědci často bojují s nastavením těchto sítí bez odborné podpory. RapidMiner činí tento proces co nejjednodušší pro uživatele všech typů. Hluboké učení je například součástí našeho automatického produktu strojového učení (ML) nazvaného RapidMiner Go. Zde uživatel nemusí vědět nic o hlubokém učení, aby využil tyto typy sofistikovaných modelů. Kromě toho mohou pokročilí uživatelé jít hlouběji a používat populární knihovny hlubokého učení, jako je Tensorflow, Keras nebo DeepLearning4J, přímo z vizuálních pracovních postupů, které vytvářejí s RapidMiner. To je jako hraní s stavebními bloky a zjednodušuje zkušenost pro uživatele s menšími datovými vědeckými dovednostmi. Díky tomuto přístupu mohou naši uživatelé vytvářet flexibilní architektury sítí s různými aktivními funkcemi a uživatelem definovaným počtem vrstev a uzlů, více vrstvami s různým počtem uzlů a volbou z různých tréninkových technik.
Jaký jiný typ strojového učení se používá?
Všechny! Nabízíme stovky různých algoritmů učení jako součást platformy RapidMiner – vše, co můžete aplikovat v široce používaných programovacích jazycích pro datové vědy Python a R. Mezi nimi RapidMiner nabízí metody pro Naive Bayes, regresi, jako je obecný lineární model, shlukování, jako je k-Means, FP-Growth, rozhodovací stromy, náhodné lesy, paralelní hluboké učení a gradientové zesílené stromy. Tyto a mnoho dalších jsou všechny součástí modelové knihovny RapidMiner a lze je použít jedním kliknutím.
Můžete diskutovat o tom, jak Auto Model ví, jaké jsou optimální hodnoty pro použití?
RapidMiner AutoModel používá inteligentní automatizaci, aby urychlil vše, co uživatelé dělají, a zajistil, aby byly postaveny přesné a správné modely. To zahrnuje výběr instance a automatické odstranění outlierů, inženýrství funkcí pro komplexní datové typy, jako jsou datumy nebo texty, a plnou multiobjektivní automatizovanou inženýrství funkcí pro výběr optimálních funkcí a konstrukci nových. Auto Model také zahrnuje další metody čištění dat pro opravu běžných problémů v datech, jako jsou chybějící hodnoty, profilování dat tím, že hodnotí kvalitu a hodnotu sloupců dat, normalizaci dat a různé další transformace.
Auto Model také extrahuje metadata o kvalitě dat – například, jak se sloupec chová jako ID nebo zda existuje mnoho chybějících hodnot. Tato metadata se používají kromě základních metadat pro automatizaci a pomoc uživatelům při „používání optimálních hodnot“ a řešení problémů s kvalitou dat.
Pro více informací jsme vše zmapovali v naší Auto Model Blueprint. (Obrázek níže pro další kontext)
Existují čtyři základní fáze, ve kterých se uplatňuje automatizace:
– Příprava dat: Automatická analýza dat pro identifikaci běžných kvalitativních problémů, jako jsou korelace, chybějící hodnoty a stabilita.
– Automatizovaný výběr modelu a optimalizace, včetně plné validace a srovnání výkonu, které navrhuje nejlepší techniky strojového učení pro daná data a určuje optimální parametry.
– Simulace modelu pro určení specifických (preskriptivních) akcí, které je třeba podniknout, aby se dosáhlo požadovaného výsledku předpovězeného modelem.
– Ve fázi nasazení a provozu modelu jsou uživatelé automaticky informováni o faktorech, jako je drift, předpojatost a obchodní dopad, bez dalších požadavků.

Počítačová předpojatost je problémem u jakéhokoli typu AI, jsou zde nějaké kontroly, aby se zabránilo předpojatosti v výsledcích?
Ano, toto je skutečně velmi důležité pro etickou datovou vědu. Funkce řízení, které jsem zmínil dříve, zajišťují, aby uživatelé mohli vždy vidět přesně, která data byla použita pro stavbu modelu, jak byla transformována a zda existuje předpojatost v datech. Kromě toho jsou naše funkce pro detekci driftu další silným nástrojem pro detekci předpojatosti. Pokud model v produkci prokazuje mnoho driftu ve vstupních datech, může to být znamením, že se svět dramaticky změnil. Může to být však také indikátorem, že existovala závažná předpojatost ve výcvikových datech. V budoucnu zvažujeme, že půjdeme ještě o krok dále a vyvineme modely strojového učení, které mohou detekovat předpojatost v jiných modelech.
Můžete diskutovat o RapidMiner AI Cloud a jak se liší od konkurenčních produktů?
Požadavky na projekt datové vědy mohou být velké, složité a výpočetně náročné, což je důvod, proč je využití cloudové technologie tak atraktivní strategií pro datové vědce. Bohužel různé cloudové platformy pro datové vědy váží uživatele k cloudovým službám a nabídkám úložiště konkrétního cloudového dodavatele.
RapidMiner AI Cloud je jednoduše naše cloudová služba pro dodávku platformy RapidMiner. Nabídka může být přizpůsobena prostředí každého zákazníka, bez ohledu na jeho cloudovou strategii. To je důležité v dnešní době, protože většina firemních přístupů ke cloudovému řízení dat se vyvíjí velmi rychle. Flexibilita je skutečně tím, co odlišuje RapidMiner AI Cloud. Může běžet v jakékoli cloudové službě, privátním cloudovém stacku nebo v hybridním nastavení. Jsme cloud-portabilní, cloud-agnostic, multi-cloud – jakkoli chcete.
RapidMiner AI Cloud je také velmi nízkou záležitostí, protože samozřejmě nabízíme možnost spravovat nasazení pro klienty, aby se mohli soustředit na běh svého podnikání s AI, ne naopak. Existuje dokonce možnost na vyžádání, která umožňuje spustit prostředí podle potřeby pro krátké projekty.
RapidMiner Radoop eliminuje některé složitosti za datovou vědu, můžete nám říci, jak Radoop prospívá vývojářům?
Radoop je hlavně pro negativních vývojářů, kteří chtějí využít potenciál velkých dat. RapidMiner Radoop spouští pracovní postupy RapidMiner přímo uvnitř Hadoopu bez kódu. Můžeme také vložit engine RapidMiner do Spark, aby bylo snadné tlačit kompletní pracovní postupy do Spark bez složitosti, která pochází z kódově orientovaných přístupů.
Budou moci vládní subjekty použít RapidMiner pro analýzu dat, aby předpověděly potenciální pandemie, podobně jako BlueDot?
Jako obecná platforma pro datové vědy a strojové učení je RapidMiner navržen tak, aby urychlil a vylepšil proces vytváření a správy modelů, bez ohledu na předmět nebo doménu, která je středem problému datové vědy/strojového učení. Ačkoli se naše zaměření nezaměřuje na předpovídání pandemií, s vhodnými daty by odborník na danou problematiku (jako virolog nebo epidemiolog) mohl použít platformu pro vytvoření modelu, který by mohl přesně předpovědět pandemie. Ve skutečnosti mnoho výzkumníků používá RapidMiner – a naše platforma je zdarma pro akademické účely.
Ještě něco, co byste chtěli sdílet o RapidMiner?
Vyzkoušejte to! Můžete být překvapeni, jak snadná může být datová věda a jak dobrá platforma může zlepšit vaši a vaší týmovou produktivitu.
Děkuji za tento skvělý rozhovor, čtenáři, kteří chtějí se dozvědět více, by měli navštívit RapidMiner.












