Interviews
Ingo Mierswa, Oprichter & President bij RapidMiner, Inc – Interview Serie

Ingo Mierswa is de Oprichter & President bij RapidMiner, Inc. RapidMiner brengt kunstmatige intelligentie naar het bedrijfsleven met een open en uitbreidbare data science-platform. Gebouwd voor analytics-teams, unifieert RapidMiner de hele data science-levenscyclus van data-voorbereiding tot machine learning tot voorspellende modelimplementatie. Meer dan 625.000 analytics-professionals gebruiken RapidMiner-producten om omzet te stimuleren, kosten te verlagen en risico’s te vermijden.
Wat was uw inspiratie achter het lanceren van RapidMiner?
Ik had jarenlang in de data science-consultancy-branche gewerkt en zag een behoefte aan een platform dat intuïtiever en toegankelijker was voor mensen zonder formele opleiding in data science. Veel van de bestaande oplossingen op dat moment waren afhankelijk van codering en scripting en waren simpelweg niet gebruikersvriendelijk. Bovendien maakte het data moeilijk te beheren en te onderhouden de oplossingen die binnen die platforms waren ontwikkeld. Eigenlijk realiseerde ik me dat deze projecten niet zo moeilijk hoefden te zijn, dus zijn we begonnen met het creëren van het RapidMiner-platform om iedereen een geweldige data scientist te laten zijn.
Kunt u de volledige transparantie van governance bespreken die momenteel door RapidMiner wordt gebruikt?
Wanneer u een model niet kunt verklaren, is het heel moeilijk om het af te stellen, te vertrouwen en om te zetten. Veel van het data science-werk is de communicatie van de resultaten naar anderen, zodat stakeholders kunnen begrijpen hoe processen kunnen worden verbeterd. Dit vereist vertrouwen en diep begrip. Ook kunnen problemen met vertrouwen en vertaling het heel moeilijk maken om de corporate-eisen te overwinnen om een model in productie te krijgen. We vechten deze strijd op een paar verschillende manieren:
Als een visueel data science-platform zet RapidMiner inherent een verklaring voor alle data-pijpleidingen en -modellen om in een zeer consumeerbaar formaat dat kan worden begrepen door data scientists of niet-data scientists. Het maakt modellen transparant en helpt gebruikers bij het begrijpen van modelgedrag en het evalueren van hun sterktes en zwaktes en het detecteren van potentiële vooroordelen.
Bovendien komen alle modellen die in het platform zijn gemaakt met uitgebreide visualisaties voor de gebruiker – meestal de gebruiker die het model maakt – om modelinzichten te krijgen, modelgedrag te begrijpen en modelvooroordeel te evalueren.
RapidMiner biedt ook modelverklaringen – zelfs wanneer deze in productie zijn: voor elke voorspelling die door een model wordt gemaakt, genereert RapidMiner en voegt de invloedsfactoren toe die hebben geleid tot of de beslissingen van dat model in productie hebben beïnvloed.
Tenslotte – en dit is voor mij persoonlijk heel belangrijk, omdat ik dit een paar jaar geleden met onze technische teams heb aangedreven – biedt RapidMiner ook een extreem krachtige model simulator-functionaliteit, die gebruikers in staat stelt om modelgedrag te simuleren en te observeren op basis van invoergegevens die door de gebruiker zijn verstrekt. Invoergegevens kunnen heel gemakkelijk worden ingesteld en gewijzigd, waardoor de gebruiker het predictieve gedrag van de modellen op verschillende hypothetische of werkelijke gevallen kan begrijpen. De simulator toont ook factoren die de modelbeslissing beïnvloeden. De gebruiker – in dit geval zelfs een zakelijke gebruiker of domeinexpert – kan modelgedrag begrijpen, modelbeslissingen valideren tegen werkelijke resultaten of domeinkennis en problemen identificeren. De simulator laat je toe om de echte wereld te simuleren en in de toekomst te kijken – in jouw toekomst, eigenlijk.
Hoe gebruikt RapidMiner diepe leer?
RapidMiner’s gebruik van diepe leer is iets waar we heel trots op zijn. Diepe leer kan heel moeilijk zijn om toe te passen en niet-data scientists worstelen vaak met het instellen van die netwerken zonder expertondersteuning. RapidMiner maakt dit proces zo eenvoudig mogelijk voor gebruikers van alle soorten. Diepe leer is bijvoorbeeld onderdeel van ons Auto machine learning (ML) product genaamd RapidMiner Go. Hier hoeft de gebruiker niets over diepe leer te weten om gebruik te maken van die geavanceerde modellen. Bovendien kunnen power users dieper gaan en populaire diepe leer bibliotheken zoals Tensorflow, Keras of DeepLearning4J rechtstreeks vanuit de visuele workflows gebruiken die ze met RapidMiner bouwen. Dit is als het spelen met bouwblokken en vereenvoudigt de ervaring voor gebruikers met minder data science-vaardigheden. Door deze benadering kunnen onze gebruikers flexibele netwerkarchitecturen bouwen met verschillende activatiefuncties en een door de gebruiker gedefinieerd aantal lagen en knooppunten, meerdere lagen met verschillende aantallen knooppunten en kiezen uit verschillende trainingsmethoden.
Wat voor andere type machine learning wordt gebruikt?
Alles! We bieden honderden verschillende leer-algoritmen aan als onderdeel van het RapidMiner-platform – alles wat u kunt toepassen in de breed gebruikte data science-programmeertalen Python en R. Onder andere biedt RapidMiner methoden voor Naive Bayes, regressie zoals Generalized Linear Models, clustering zoals k-Means, FP-Growth, Decision Trees, Random Forests, Parallelized Deep Learning en Gradient Boosted Trees. Deze en veel meer zijn allemaal onderdeel van de modeling-bibliotheek van RapidMiner en kunnen met één klik worden gebruikt.
Kunt u bespreken hoe de Auto Model de optimale waarden weet te gebruiken?
RapidMiner AutoModel gebruikt intelligente automatisering om alles wat gebruikers doen te versnellen en ervoor te zorgen dat nauwkeurige, solide modellen worden gebouwd. Dit omvat instantie-selectie en automatische outlier-removal, feature-engineering voor complexe gegevenstypen zoals datums of teksten en volledige multi-objective automatische feature-engineering om de optimale functies te selecteren en nieuwe te construeren. Auto Model omvat ook andere data-reinigingsmethoden om gemeenschappelijke problemen in data op te lossen, zoals ontbrekende waarden, data-profielen door de kwaliteit en waarde van datakolommen te beoordelen, data-normalisatie en verschillende andere transformaties.
Auto Model extracteert ook datakwaliteitsmeta-data – bijvoorbeeld hoeveel een kolom zich als een ID gedraagt of of er veel ontbrekende waarden zijn. Deze meta-data wordt gebruikt in combinatie met de basis-meta-data om gebruikers te helpen bij het ‘gebruiken van de optimale waarden’ en omgaan met datakwaliteitsproblemen.
Om meer details te geven, hebben we alles in kaart gebracht in onze Auto Model Blueprint. (Afbeelding hieronder voor extra context)
Er zijn vier basisfasen waarin de automatisering wordt toegepast:
– Data-voorbereiding: Automatische analyse van data om gemeenschappelijke kwaliteitsproblemen zoals correlaties, ontbrekende waarden en stabiliteit te identificeren.
– Automatische modelselectie en -optimalisatie, inclusief volledige validatie en prestatievergelijking, die de beste machine learning-technieken voor gegeven data suggereert en de optimale parameters bepaalt.
– Model-simulatie om te helpen bij het bepalen van de specifieke (prescriptieve) acties die moeten worden ondernomen om het gewenste resultaat te bereiken dat door het model wordt voorspeld.
– In de model-implementatie- en exploitatiefase worden gebruikers factors zoals drift, bias en business-impact automatisch getoond zonder extra werk.

Computer-vooroordeel is een probleem met elk type AI, zijn er controles om te voorkomen dat vooroordeel in de resultaten sluipen?
Ja, dit is inderdaad heel belangrijk voor ethische data science. De governance-functies die eerder zijn genoemd, zorgen ervoor dat gebruikers altijd kunnen zien welke data is gebruikt voor modelbouw, hoe deze is getransformeerd en of er vooroordeel in de data-selectie is. Bovendien zijn onze functies voor drift-detectie een andere krachtige tool om vooroordeel te detecteren. Als een model in productie veel drift in de invoergegevens vertoont, kan dit een teken zijn dat de wereld drastisch is veranderd. Echter, het kan ook een indicator zijn dat er ernstig vooroordeel in de trainingsdata was. In de toekomst overwegen we om nog een stap verder te gaan en machine learning-modellen te bouwen die kunnen worden gebruikt om vooroordeel in andere modellen te detecteren.
Kunt u de RapidMiner AI Cloud bespreken en hoe deze zich onderscheidt van concurrerende producten?
De eisen voor een data science-project kunnen groot, complex en rekenintensief zijn, wat heeft gemaakt dat het gebruik van cloud-technologie een aantrekkelijke strategie is voor data scientists. Helaas binden de verschillende native cloud-gebaseerde data science-platforms u aan cloud-diensten en data-opslagopties van die specifieke cloud-leverancier.
De RapidMiner AI Cloud is eenvoudigweg onze cloud-servicelevering van het RapidMiner-platform. Het aanbod kan worden aangepast aan de omgeving van elke klant, ongeacht hun cloud-strategie. Dit is belangrijk in deze tijd, omdat de aanpak van bedrijven voor cloud-databeheer snel evolueert. Flexibiliteit is echt wat RapidMiner AI Cloud onderscheidt van anderen. Het kan worden uitgevoerd in elke cloud-service, private cloud-stack of in een hybride setup. We zijn cloud-portable, cloud-agnostisch, multi-cloud – hoe u het ook wilt noemen.
RapidMiner AI Cloud is ook heel weinig gedoe, omdat we de mogelijkheid bieden om alle of een deel van de implementatie voor klanten te beheren, zodat ze zich kunnen concentreren op het runnen van hun bedrijf met AI, niet andersom. Er is zelfs een optie voor on-demand, waarmee u een omgeving kunt starten wanneer dat nodig is voor korte projecten.
RapidMiner Radoop elimineert enige complexiteit achter data science, kunt u ons vertellen hoe Radoop ontwikkelaars ten goede komt?
Radoop is voornamelijk voor niet-ontwikkelaars die de potentie van big data willen benutten. RapidMiner Radoop voert RapidMiner-workflows rechtstreeks uit in Hadoop op een code-vrije manier. We kunnen ook de RapidMiner-executie-engine in Spark embedden, zodat het gemakkelijk is om complete workflows in Spark te pushen zonder de complexiteit die voortkomt uit code-georiënteerde benaderingen.
Zou een overheidsinstantie RapidMiner kunnen gebruiken om data te analyseren om potentiële pandemieën te voorspellen, net zoals BlueDot werkt?
Als een algemeen data science- en machine learning-platform is RapidMiner bedoeld om het model-creatie- en -beheerproces te vereenvoudigen en te verbeteren, ongeacht het onderwerp of domein dat centraal staat in het data science-/machine learning-probleem. Hoewel ons focus niet ligt op het voorspellen van pandemieën, kan een onderwerpdeskundige (zoals een viroloog of epidemioloog in dit geval) met de juiste data het platform gebruiken om een model te maken dat pandemieën nauwkeurig kan voorspellen. In feite gebruiken veel onderzoekers RapidMiner – en ons platform is gratis voor academische doeleinden.
Is er nog iets dat u zou willen delen over RapidMiner?
Probeer het eens! U zult misschien verrast zijn hoe eenvoudig data science kan zijn en hoeveel een goed platform uw productiviteit en die van uw team kan verbeteren.
Bedankt voor dit geweldige interview, lezers die meer willen leren, moeten RapidMiner bezoeken.












