Interviews
Ingo Mierswa, Gründer und Präsident von RapidMiner, Inc. – Interview-Serie

Ingo Mierswa ist der Gründer und Präsident von RapidMiner, Inc. RapidMiner bringt künstliche Intelligenz in das Unternehmen durch eine offene und erweiterbare Data-Science-Plattform. Entwickelt für Analyse-Teams, vereint RapidMiner den gesamten Data-Science-Lebenszyklus von der Datenbereitung bis zum maschinellen Lernen und zur vorhersehbaren Modellbereitstellung. Mehr als 625.000 Analyse-Experten verwenden RapidMiner-Produkte, um Umsatz zu generieren, Kosten zu reduzieren und Risiken zu vermeiden.
Was war Ihre Inspiration hinter der Gründung von RapidMiner?
Ich hatte viele Jahre in der Data-Science-Beratungsbranche gearbeitet und sah einen Bedarf an einer Plattform, die intuitiver und zugänglicher für Menschen ohne formale Ausbildung in Data Science war. Viele der bestehenden Lösungen zu dieser Zeit basierten auf Codierung und Skripten und waren einfach nicht benutzerfreundlich. Darüber hinaus machte es die Daten schwierig zu verwalten und die Lösungen, die innerhalb dieser Plattformen entwickelt wurden, zu warten. Im Grunde genommen erkannte ich, dass diese Projekte nicht so schwierig sein mussten, also begannen wir, die RapidMiner-Plattform zu erstellen, um es jedem zu ermöglichen, ein großartiger Data-Scientist zu sein.
Können Sie die vollständige Transparenz-Regierungsführung erläutern, die derzeit von RapidMiner verwendet wird?
Wenn Sie ein Modell nicht erklären können, ist es sehr schwierig, es zu justieren, zu vertrauen und zu übersetzen. Ein großer Teil der Data-Science-Arbeit besteht darin, die Ergebnisse anderen zu kommunizieren, damit Stakeholder verstehen, wie Prozesse verbessert werden können. Dies erfordert Vertrauen und tiefes Verständnis. Darüber hinaus können Probleme mit Vertrauen und Übersetzung es sehr schwierig machen, die corporate-Anforderungen zu überwinden, um ein Modell in die Produktion zu bringen. Wir bekämpfen diesen Kampf auf verschiedene Weise:
Als visuelle Data-Science-Plattform kartiert RapidMiner automatisch eine Erklärung für alle Daten-Pipelines und -Modelle in einem hoch konsumierbaren Format, das von Data-Scientist oder Nicht-Data-Scientist verstanden werden kann. Es macht Modelle transparent und hilft Benutzern, das Modellverhalten zu verstehen und dessen Stärken und Schwächen zu bewerten und potenzielle Voreingenommenheiten zu erkennen.
Zusätzlich erhalten alle im RapidMiner-Plattform erstellten Modelle umfangreiche Visualisierungen für den Benutzer – normalerweise den Benutzer, der das Modell erstellt – um Modell-Einblicke zu gewinnen, das Modellverhalten zu verstehen und Modell-Voreingenommenheiten zu bewerten.
RapidMiner bietet auch Modell-Erklärungen – sogar wenn es sich um Produktionsmodelle handelt: Für jede Vorhersage, die von einem Modell erstellt wird, generiert RapidMiner die Einflussfaktoren, die zu den Entscheidungen des Modells geführt haben, und fügt sie hinzu.
Schließlich – und das ist mir persönlich sehr wichtig, da ich es mit unseren Ingenieur-Teams vor ein paar Jahren vorangetrieben habe – bietet RapidMiner auch eine extrem leistungsstarke Modell-Simulationsfunktion, mit der Benutzer das Modellverhalten basierend auf den von ihnen bereitgestellten Eingabedaten simulieren und beobachten können. Eingabedaten können sehr einfach gesetzt und geändert werden, sodass der Benutzer das vorhersehbare Verhalten der Modelle in verschiedenen hypothetischen oder realen Fällen verstehen kann. Der Simulator zeigt auch die Faktoren an, die die Entscheidung des Modells beeinflussen. Der Benutzer – in diesem Fall sogar ein Geschäftsanwender oder Domain-Experte – kann das Modellverhalten verstehen, die Entscheidung des Modells gegen reale Ergebnisse oder Domain-Wissen validieren und Probleme identifizieren. Der Simulator ermöglicht es Ihnen, die reale Welt zu simulieren und in Ihre Zukunft zu blicken.
Wie verwendet RapidMiner Deep Learning?
RapidMiners Verwendung von Deep Learning ist etwas, worauf wir sehr stolz sind. Deep Learning kann sehr schwierig anzuwenden sein, und Nicht-Data-Scientist haben oft Schwierigkeiten, diese Netzwerke ohne Experten-Unterstützung einzurichten. RapidMiner macht diesen Prozess so einfach wie möglich für Benutzer aller Arten. Deep Learning ist beispielsweise Teil unseres Auto-Machine-Learning-Produkts (ML) namens RapidMiner Go. Hier muss der Benutzer nichts über Deep Learning wissen, um diese Art von fortschrittlichen Modellen zu nutzen. Darüber hinaus können Power-Benutzer tiefer in die populären Deep-Learning-Bibliotheken wie Tensorflow, Keras oder DeepLearning4J eintauchen, direkt aus den visuellen Workflows, die sie mit RapidMiner erstellen. Dies ist wie das Spielen mit Bausteinen und vereinfacht die Erfahrung für Benutzer mit weniger Data-Science-Fähigkeiten. Durch diesen Ansatz können unsere Benutzer flexible Netzwerk-Architekturen mit verschiedenen Aktivierungsfunktionen und benutzerdefinierten Anzahl von Schichten und Knoten, mehrere Schichten mit unterschiedlicher Anzahl von Knoten und wählen zwischen verschiedenen Trainings-Techniken erstellen.
Welche anderen Arten von Machine Learning werden verwendet?
Alle! Wir bieten Hunderte von verschiedenen Lernalgorithmen als Teil der RapidMiner-Plattform an – alles, was Sie in den weit verbreiteten Data-Science-Programmiersprachen Python und R anwenden können. Unter anderem bietet RapidMiner Methoden für Naive Bayes, Regression wie Generalized Linear Models, Clustering wie k-Means, FP-Growth, Entscheidungsbäume, Random Forests, Parallelized Deep Learning und Gradient Boosted Trees. Diese und viele mehr sind alle Teil der Modell-Bibliothek von RapidMiner und können mit einem einzigen Klick verwendet werden.
Können Sie erläutern, wie das Auto-Modell die optimalen Werte kennt, die verwendet werden sollen?
RapidMiner AutoModel verwendet intelligente Automatisierung, um alles zu beschleunigen, was Benutzer tun, und sicherzustellen, dass genaue, solide Modelle erstellt werden. Dazu gehören Instanz-Auswahl und automatische Ausreißer-Entfernung, Feature-Engineering für komplexe Datentypen wie Datum oder Text und vollständiges multi-objektives automatisches Feature-Engineering, um die optimalen Funktionen auszuwählen und neue zu konstruieren. Auto-Model umfasst auch andere Daten-Reinigungs-Methoden, um häufige Probleme in Daten wie fehlende Werte, Daten-Profilierung durch Bewertung der Qualität und des Wertes von Daten-Spalten, Daten-Normalisierung und verschiedene andere Transformationen zu beheben.
Auto-Model extrahiert auch Daten-Qualitäts-Meta-Daten – beispielsweise, wie sehr eine Spalte wie eine ID verhält oder ob es viele fehlende Werte gibt. Diese Meta-Daten werden zusätzlich zu den grundlegenden Meta-Daten verwendet, um Benutzern bei der Verwendung der optimalen Werte und der Bewältigung von Daten-Qualitäts-Problemen zu helfen.
Um mehr Details zu erhalten, haben wir alles in unserem Auto-Model-Blueprint aufgezeichnet. (Bild unten für zusätzlichen Kontext)
Es gibt vier grundlegende Phasen, in denen die Automatisierung angewendet wird:
– Daten-Vorbereitung: Automatische Analyse von Daten, um häufige Qualitätsprobleme wie Korrelationen, fehlende Werte und Stabilität zu identifizieren.
– Automatisierte Modell-Auswahl und -Optimierung, einschließlich vollständiger Validierung und Leistungsvergleich, die die besten maschinellen Lern-Techniken für die gegebenen Daten vorschlägt und die optimalen Parameter bestimmt.
– Modell-Simulation, um die spezifischen (präskriptiven) Aktionen zu bestimmen, die ergriffen werden müssen, um das gewünschte Ergebnis vorherzusagen, das vom Modell vorhergesagt wird.
– In der Modell-Bereitstellungs- und Betriebsphase werden Benutzern Faktoren wie Drift, Voreingenommenheit und Geschäftsauswirkungen automatisch ohne zusätzliche Arbeit angezeigt.

Computer-Voreingenommenheit ist ein Problem bei jeder Art von KI, gibt es Kontrollen, um zu verhindern, dass Voreingenommenheit in die Ergebnisse eincrept?
Ja, dies ist tatsächlich extrem wichtig für ethische Data Science. Die Regierungsfunktionen, die vorher erwähnt wurden, stellen sicher, dass Benutzer immer sehen können, welche Daten für die Modell-Erstellung verwendet wurden, wie sie transformiert wurden und ob es Voreingenommenheit in der Daten-Auswahl gibt. Darüber hinaus sind unsere Funktionen für Drift-Erkennung ein weiteres leistungsstarkes Werkzeug, um Voreingenommenheit zu erkennen. Wenn ein Modell in der Produktion eine Menge Drift in den Eingabedaten zeigt, kann dies ein Zeichen dafür sein, dass die Welt dramatisch geändert hat. Es kann jedoch auch ein Indikator dafür sein, dass es eine schwere Voreingenommenheit in den Trainings-Daten gab. In Zukunft planen wir, noch einen Schritt weiter zu gehen und maschinelle Lern-Modelle zu entwickeln, die verwendet werden können, um Voreingenommenheit in anderen Modellen zu erkennen.
Können Sie den RapidMiner-KI-Cloud und wie er sich von konkurrierenden Produkten unterscheidet, erläutern?
Die Anforderungen an ein Data-Science-Projekt können groß, komplex und rechenintensiv sein, was die Verwendung von Cloud-Technologie für Data-Scientist so attraktiv gemacht hat. Leider binden die verschiedenen native Cloud-basierten Data-Science-Plattformen an die Cloud-Dienste und Daten-Speicher-Angebote des jeweiligen Cloud-Anbieters.
Der RapidMiner-KI-Cloud ist einfach unsere Cloud-Service-Lieferung der RapidMiner-Plattform. Das Angebot kann an die Umgebung jedes Kunden angepasst werden, unabhängig von seiner Cloud-Strategie. Dies ist wichtig in diesen Tagen, da sich die Ansätze der meisten Unternehmen zur Cloud-Daten-Verwaltung sehr schnell ändern. Flexibilität ist wirklich das, was den RapidMiner-KI-Cloud von anderen unterscheidet. Er kann in jedem Cloud-Service, privaten Cloud-Stack oder in einer Hybrid-Umgebung ausgeführt werden. Wir sind cloud-portabel, cloud-agnostisch, multi-Cloud – wie immer Sie es nennen möchten.
Der RapidMiner-KI-Cloud ist auch sehr wenig Aufwand, da wir die Möglichkeit bieten, alle oder Teile der Bereitstellung für Kunden zu verwalten, damit sie sich auf das Führen ihres Geschäfts mit KI konzentrieren können, nicht umgekehrt. Es gibt sogar eine On-Demand-Option, die es ermöglicht, eine Umgebung aufzusetzen, wenn sie benötigt wird, für kurze Projekte.
RapidMiner Radoop eliminiert einige der Komplexität hinter Data Science, können Sie uns erläutern, wie Radoop Entwicklern nützt?
Radoop ist hauptsächlich für Nicht-Entwickler gedacht, die das Potenzial von Big Data nutzen möchten. RapidMiner Radoop führt RapidMiner-Workflows direkt innerhalb von Hadoop in einer code-freien Weise aus. Wir können auch den RapidMiner-Ausführungs-Engine in Spark einbetten, sodass es einfach ist, komplette Workflows in Spark zu pushen, ohne die Komplexität, die von code-zentrierten Ansätzen kommt.
Könnte eine Regierungsbehörde RapidMiner verwenden, um Daten zu analysieren, um mögliche Pandemien vorherzusagen, ähnlich wie BlueDot?
Als allgemeine Data-Science- und Machine-Learning-Plattform ist RapidMiner dazu gedacht, den Modell-Erstellungs- und -Verwaltungs-Prozess zu rationalisieren und zu verbessern, unabhängig davon, welches Thema oder welche Domäne im Mittelpunkt des Data-Science- oder Machine-Learning-Problems steht. Obwohl unser Fokus nicht auf der Vorhersage von Pandemien liegt, könnte ein Fachexperte (wie ein Virologe oder Epidemiologe in diesem Fall) mit den richtigen Daten die Plattform verwenden, um ein Modell zu erstellen, das Pandemien genau vorhersagen könnte. Tatsächlich verwenden viele Forscher RapidMiner – und unsere Plattform ist kostenlos für akademische Zwecke.
Gibt es noch etwas, das Sie über RapidMiner teilen möchten?
Probieren Sie es aus! Sie werden überrascht sein, wie einfach Data Science sein kann und wie sehr eine gute Plattform Ihre und die Produktivität Ihres Teams verbessern kann.
Vielen Dank für dieses großartige Interview, Leser, die mehr erfahren möchten, sollten RapidMiner besuchen.












