Intervjuer

Ingo Mierswa, grundare och VD på RapidMiner, Inc – Intervjuer

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Ingo Mierswa är grundare och VD på RapidMiner, Inc. RapidMiner tar med sig artificiell intelligens till företaget genom en öppen och utbyggbar data science-plattform. Byggd för analytiska team, förenar RapidMiner hela data science-livscykeln från dataförberedelse till maskinlärande till prediktiv modelldistribution. Mer än 625 000 analytiker använder RapidMiner-produkter för att driva intäkter, minska kostnader och undvika risker.

Vad var din inspiration bakom lanseringen av RapidMiner?

Jag hade arbetat i data science-konsultbranschen i många år och såg ett behov av en plattform som var mer intuitiv och tillgänglig för personer utan formell utbildning i data science. Många av de befintliga lösningarna vid den tiden byggde på kodning och skript och de var helt enkelt inte användarvänliga.  Dessutom gjorde det data svårt att hantera och underhålla lösningarna som utvecklades inom dessa plattformar. I grund och botten insåg jag att dessa projekt inte behövde vara så svåra, så vi började skapa RapidMiner-plattformen för att låta vem som helst bli en stor data scientist.

Kan du diskutera den fulla transparensen i RapidMiners styrning?

När du inte kan förklara en modell, är det ganska svårt att justera, lita på och översätta. Mycket av data science-arbetet handlar om att kommunicera resultaten till andra så att intressenter kan förstå hur de kan förbättra processer. Detta kräver förtroende och djup förståelse. Dessutom kan problem med förtroende och översättning göra det mycket svårt att övervinna de företagskrav som krävs för att få en modell i produktion. Vi kämpar mot detta på flera olika sätt:

Som en visuell data science-plattform, kartlägger RapidMiner automatiskt en förklaring till alla data pipelines och modeller i ett högt konsumerbart format som kan förstås av data scientists eller icke-data scientists. Det gör modellerna transparenta och hjälper användare att förstå modellbeteende och utvärdera dess styrkor och svagheter och upptäcka potentiella bias.

I tillägg tillhandahåller RapidMiner omfattande visualiseringar för varje modell som skapas i plattformen – vanligtvis den användare som skapar modellen – för att få modellinsikter, förstå modellbeteende och utvärdera modellbias.

RapidMiner tillhandahåller också modellförklaringar – även när de är i produktion: För varje förutsägelse som skapas av en modell, genererar RapidMiner och lägger till de influensfaktorer som har lett till eller påverkat de beslut som modellen har fattat i produktion.

Slutligen – och detta är mycket viktigt för mig personligen, eftersom jag drev detta med våra ingenjörsteam för några år sedan – tillhandahåller RapidMiner också en extremt kraftfull modell simulatorfunktion, som tillåter användare att simulera och observera modellbeteendet baserat på indata som tillhandahålls av användaren. Indata kan ställas in och ändras mycket enkelt, vilket gör att användaren kan förstå det prediktiva beteendet hos modellerna i olika hypotetiska eller verkliga fall. Simulatoren visar också faktorer som påverkar modellens beslut. Användaren – i detta fall även en affärsanvändare eller domänexpert – kan förstå modellbeteende, validera modellens beslut mot verkliga resultat eller domänkunskap och identifiera problem. Simulatoren tillåter dig att simulera den verkliga världen och titta in i framtiden – i din egen framtid, faktiskt.

Hur använder RapidMiner djupinlärning?

RapidMiners användning av djupinlärning är något vi är mycket stolta över. Djupinlärning kan vara mycket svårt att tillämpa och icke-data scientists har ofta svårt att konfigurera dessa nätverk utan expertstöd. RapidMiner gör denna process så enkel som möjligt för användare av alla typer. Djupinlärning är till exempel en del av vår Auto machine learning (ML) -produkt som heter RapidMiner Go. Här behöver användaren inte veta någonting om djupinlärning för att använda dessa typer av avancerade modeller. Dessutom kan avancerade användare gå djupare och använda populära djupinlärningsbibliotek som Tensorflow, Keras eller DeepLearning4J direkt från de visuella arbetsflöden de bygger med RapidMiner. Detta är som att leka med byggblock och förenklar upplevelsen för användare med färre data science -färdigheter. Genom detta tillvägagångssätt kan våra användare bygga flexibla nätverksarkitekturer med olika aktiveringsfunktioner och användardefinierat antal lager och noder, flera lager med olika antal noder och välja mellan olika träningsmetoder.

Vilken annan typ av maskinlärande används?

Alla! Vi erbjuder hundratals olika lärande algoritmer som en del av RapidMiner-plattformen – allt du kan tillämpa i de vanligt använda data science-programmeringsspråken Python och R. Bland annat erbjuder RapidMiner metoder för Naive Bayes, regression som Generalized Linear Models, kluster som k-Means, FP-Growth, beslutsfattande träd, slumpmässiga skogar, parallelliserad djupinlärning och Gradient Boosted Trees. Dessa och många fler är alla en del av RapidMiners modellbibliotek och kan användas med ett enda klick.

Kan du diskutera hur Auto Model vet vilka optimala värden som ska användas?

RapidMiner AutoModel använder intelligent automatisering för att påskynda allt användare gör och säkerställa att exakta och sunda modeller byggs. Detta inkluderar instansurval och automatiskt borttagning av avvikare, funktionsteknik för komplexa datatyper som datum eller texter och fullständig multiobjekt-automatiserad funktionsteknik för att välja de optimala funktionerna och konstruera nya. Auto Model innehåller också andra datarengöringsmetoder för att fixa vanliga problem i data, såsom saknade värden, dataprofiler genom att bedöma kvaliteten och värdet av datakolumner, datanormalisering och olika andra transformationer.

Auto Model extraherar också datakvalitetsmetadata – till exempel hur mycket en kolumn beter sig som en ID eller om det finns många saknade värden. Denna metadata används utöver den grundläggande metadatan för att automatisera och assistera användare i att “använda de optimala värdena” och hantera datakvalitetsproblem.

För mer information har vi kartlagt allt i vår Auto Model Blueprint. (Bild nedan för extra sammanhang)

Det finns fyra grundläggande faser där automatiseringen tillämpas:

– Dataförberedelse: Automatisk analys av data för att identifiera vanliga kvalitetsproblem som korrelationer, saknade värden och stabilitet.
– Automatisk modellval och optimering, inklusive fullständig validering och prestandajämförelse, som föreslår de bästa maskinlärande-teknikerna för givna data och bestämmer de optimala parametrarna.
– Modellsimulering för att bestämma de specifika (preskriptiva) åtgärderna som ska vidtas för att uppnå det önskade resultatet som förutsagts av modellen.
– I modell distributions- och driftsfasen visas användarna faktorer som drift, bias och affärspåverkan, automatiskt utan extra arbete.

Datorbias är ett problem med alla typer av AI, finns det några kontroller på plats för att förhindra att bias kryper in i resultaten?

Ja, detta är verkligen extremt viktigt för etisk data science. De styrningsfunktioner som nämns ovan säkerställer att användarna alltid kan se exakt vilka data som har använts för modellbyggnad, hur de har transformerats och om det finns bias i dataurvalet. I tillägg är våra funktioner för driftdetektering ett annat kraftfullt verktyg för att upptäcka bias. Om en modell i produktion visar en stor driftdrift i indata, kan detta vara ett tecken på att världen har förändrats dramatiskt. Men det kan också vara en indikator på att det fanns allvarlig bias i träningdata. I framtiden överväger vi att gå ännu ett steg längre och bygga maskinlärande modeller som kan användas för att upptäcka bias i andra modeller.

Kan du diskutera RapidMiner AI Cloud och hur den skiljer sig från konkurrerande produkter?

Kraven för ett data science-projekt kan vara stora, komplexa och beräkningsintensiva, vilket har gjort användningen av molnteknologi så attraktiv för data scientists. Tyvärr binder de olika nativa molnbaserade data science-plattformarna dig till molntjänster och data lagringserbjudanden från en viss molntjänstleverantör.

RapidMiner AI Cloud är helt enkelt vår molntjänstleverans av RapidMiner-plattformen. Erbjudandet kan anpassas till varje kunds miljö, oavsett deras molnstrategi. Detta är viktigt dessa dagar eftersom de flesta företags tillvägagångssätt för molndatahantering utvecklas mycket snabbt i den nuvarande klimatet. Flexibilitet är verkligen vad som särskiljer RapidMiner AI Cloud. Den kan köras i vilken molntjänst som helst, privat molnstack eller i en hybridkonfiguration. Vi är molnportabel, molnagnostisk, multi-moln – vad du vill kalla det.

RapidMiner AI Cloud är också mycket låg besvär, eftersom vi erbjuder möjligheten att hantera all eller del av distributionen för kunder så att de kan fokusera på att köra sin verksamhet med AI, inte tvärtom. Det finns till och med en på-begäran-alternativ, som tillåter dig att starta en miljö när som helst för korta projekt.

RapidMiner Radoop eliminerar en del av komplexiteten bakom data science, kan du berätta hur Radoop gynnar utvecklare?

Radoop är främst för icke-utvecklare som vill utnyttja potentialen i stora data. RapidMiner Radoop kör RapidMiner-arbetsflöden direkt inuti Hadoop på ett kodfritt sätt. Vi kan också infoga RapidMiner-körningsmotorn i Spark så att det är lätt att skjuta kompletta arbetsflöden in i Spark utan den komplexitet som kommer från kodcentrerade tillvägagångssätt.

Skulle en statlig enhet kunna använda RapidMiner för att analysera data för att förutsäga potentiella pandemier, liknande hur BlueDot fungerar?

Som en allmän data science- och maskinlärandeplattform är RapidMiner avsedd att strömlinjeforma och förbättra modellskapande- och hanteringsprocessen, oavsett vilket ämne eller domän som står i centrum för data science-/maskinlärandeproblemet. Medan vårt fokus inte ligger på att förutsäga pandemier, kan en ämnesexpert (som en virolog eller epidemiolog i detta fall) med rätt data använda plattformen för att skapa en modell som kan förutsäga pandemier med stor noggrannhet. Faktum är att många forskare använder RapidMiner – och vår plattform är gratis för akademiska ändamål.

Finns det något annat du vill dela om RapidMiner?

Testa det! Du kan bli förvånad över hur enkelt data science kan vara och hur mycket en bra plattform kan förbättra dig och ditt teams produktivitet.

Tack för den här underbara intervjun, läsare som vill lära sig mer bör besöka RapidMiner.

Antoine är en visionär ledare och medgrundare av Unite.AI, driven av en outtröttlig passion för att forma och främja framtidens AI och robotik. En serieentreprenör, han tror att AI kommer att vara lika störande för samhället som elektricitet, och han fångas ofta i att prata om potentialen för störande teknologier och AGI.

Som en futurist är han dedikerad till att utforska hur dessa innovationer kommer att forma vår värld. Dessutom är han grundare av Securities.io, en plattform som fokuserar på att investera i banbrytande teknologier som omdefinierar framtiden och omformar hela sektorer.