Intervjuer
Ingo Mierswa, grunnlegger og president i RapidMiner, Inc – Intervju-serie

Ingo Mierswa er grunnlegger og president i RapidMiner, Inc. RapidMiner bringer kunstig intelligens til bedriftene gjennom en åpen og utvidbar data science-plattform. Bygget for analytics-team, unifies RapidMiner hele data science-livssyklusen fra data-forberedelse til maskinlæring til prediktive modell-deployering. Mer enn 625 000 analytics-profesjonelle bruker RapidMiner-produkter for å drive inntekter, redusere kostnader og unngå risiko.
Hva var din inspirasjon bak lanseringen av RapidMiner?
Jeg hadde arbeidet i data science-konsulentbransjen i mange år og så et behov for en plattform som var mer intuitiv og tilgjengelig for personer uten formell utdanning i data science. Mange av de eksisterende løsningene på den tiden avhengig av kode og skript, og de var enkle ikke brukervennlige. I tillegg gjorde det data vanskelig å håndtere og vedlikeholde løsningene som ble utviklet innenfor disse plattformene. Grunnleggende sett så jeg at disse prosjektene ikke trengte å være så vanskelige, så vi startet å utvikle RapidMiner-plattformen for å tillate noen å være en stor data scientist.
Kan du diskutere den fullstendige gjennomsiktighet i styringen som nå brukes av RapidMiner?
Når du ikke kan forklare en modell, er det ganske vanskelig å justere, stole på og oversette. Mye av data science-arbeidet er kommunikasjon av resultater til andre, så at interessenter kan forstå hvordan prosesser kan forbedres. Dette krever tillit og dyp forståelse. Dessuten kan problemer med tillit og oversettelse gjøre det svært å overvinne de korporative kravene for å få en modell i produksjon. Vi kjemper mot denne kampen på flere måter:
Som en visuell data science-plattform, kartlegger RapidMiner en forklaring for alle data-pipelines og modeller i en høyt konsumabelt format som kan forstås av data scientists eller ikke-data scientists. Det gjør modellene gjennomsiktige og hjelper brukerne med å forstå modell-atferd og evaluere styrker og svakheter og oppdage potensielle fordommer.
I tillegg kommer alle modeller som er laget i plattformen med omfattende visualiseringer for brukeren – vanligvis den brukeren som lager modellen – for å få modell-innsikt, forstå modell-atferd og evaluere modell-forbud.
RapidMiner gir også modell-forklaringer – selv når i produksjon: For hver prediksjon som er laget av en modell, genererer RapidMiner og legger til påvirkningsfaktorene som har ledet til eller påvirket avgjørelsene som er tatt av modellen i produksjon.
Til slutt – og dette er veldig viktig for meg personlig, da jeg drev dette med våre ingeniørteam for noen år siden – RapidMiner gir også en ekstremt kraftig modell-simulator-kapasitet, som tillater brukerne å simulere og observere modell-atferden basert på inndata som er gitt av brukeren. Inndata kan settes og endres svært enkelt, og tillater brukeren å forstå den prediktive atferden til modellene på ulike hypotetiske eller virkelige tilfeller. Simulatoren viser også faktorene som påvirker modellens avgjørelse. Brukeren – i dette tilfelle selv en forretningsbruker eller domene-ekspert – kan forstå modell-atferd, validere modellens avgjørelse mot virkelige resultater eller domene-kunnskap og identifisere problemer. Simulatoren tillater deg å simulere den virkelige verden og se inn i fremtiden – inn i din fremtid, faktisk.
Hvordan bruker RapidMiner dypt læring?
RapidMiners bruk av dypt læring er noe vi er svært stolte av. Dypt læring kan være svært vanskelig å anvende, og ikke-data-scientists ofte sliter med å sette opp disse nettverkene uten ekspert-støtte. RapidMiner gjør denne prosessen så enkel som mulig for brukere av alle typer. Dypt læring er, for eksempel, en del av vår Auto-maskinlæring (ML)-produkt kalt RapidMiner Go. Her trenger brukeren ikke å vite noe om dypt læring for å bruke disse sofistikerte modellene. I tillegg kan power-brukere gå dyptere og bruke populære dypt læring-biblioteker som Tensorflow, Keras eller DeepLearning4J rett fra de visuelle arbeidsflytene de bygger med RapidMiner. Dette er som å leke med byggeklosser og forenkler erfaringen for brukere med færre data science-ferdigheter. Med denne tilnærmingen kan våre brukere bygge fleksible nettverks-arkitekturer med ulike aktiveringsfunksjoner og brukerdefinerte antall lag og noder, flere lag med ulike antall noder, og velge mellom ulike treningsteknikker.
Hva andre typer maskinlæring brukes?
Alle! Vi tilbyr hundrevis av ulike læring-algoritmer som en del av RapidMiner-plattformen – alt du kan anvende i de vanlig brukt data science-programmeringsspråkene Python og R. Blant annet tilbyr RapidMiner metoder for Naive Bayes, regresjon som Generalized Linear Models, klustering som k-Means, FP-Growth, Beslutningstre, Random Forests, Parallelized Deep Learning og Gradient Boosted Trees. Disse og mange flere er alle en del av modell-biblioteket til RapidMiner og kan brukes med ett enkelt klikk.
Kan du diskutere hvordan Auto-modellen kjenner de optimale verdiene som skal brukes?
RapidMiner AutoModel bruker intelligent automatisering for å akselerere alt brukerne gjør og sikre nøyaktige, solide modeller bygges. Dette inkluderer instans-seleksjon og automatisk outlier-fjerning, funksjons-injeneri for komplekse data-typer som datoer eller tekst, og fullt multi-objekt-automatisk funksjons-injeneri for å velge de optimale funksjonene og konstruere nye. Auto Model inkluderer også andre data-rengjørings-metoder for å fikse vanlige problemer i data som manglende verdier, data-profilering ved å vurdere kvaliteten og verdien av data-kolonner, data-normalisering og ulike andre transformasjoner.
Auto Model trekker også ut data-kvalitets-meta-data – for eksempel, hvor mye en kolonne oppfører seg som en ID eller om det er mange manglende verdier. Denne meta-dataen brukes i tillegg til den grunnleggende meta-dataen i å automatisere og assistere brukerne i ‘bruk av optimale verdier’ og håndtering av data-kvalitets-problemer.
I tillegg har vi kartlagt det hele i vår Auto Model Blueprint. (Bilde under for ekstra kontekst)
Det er fire grunnleggende faser hvor automatiseringen brukes:
– Data-forberedelse: Automatisk analyse av data for å identifisere vanlige kvalitets-problemer som korrelasjoner, manglende verdier og stabilitet.
– Automatisk modell-seleksjon og optimalisering, inkludert full validasjon og ytelses-sammenligning, som foreslår de beste maskinlæringsteknikkene for gitt data og bestemmer de optimale parameterne.
– Modell-simulering for å bestemme de spesifikke (prescriptive) handlinger som skal tas for å oppnå det ønskede resultatet som er prediktet av modellen.
– I modell-deployering og operasjons-fasen vises faktorer som drift, fordom og forretnings-påvirkning, automatisk uten ekstra arbeid.

Datamaskin-forbud er et problem med alle typer AI, er det noen kontroller i plass for å forhindre fordommer fra å klatre opp i resultater?
Ja, dette er virkelig veldig viktig for etisk data science. Styrings-egenskapene nevnt tidligere sikrer at brukerne alltid kan se eksakt hvilke data som er brukt for modell-bygging, hvordan det er transformert og om det er fordom i data-seleksjonen. I tillegg er våre egenskaper for drift-deteksjon en annen kraftig verktøy for å detektere fordom. Hvis en modell i produksjon viser en del drift i inndata, kan dette være et tegn på at verden har endret seg dramatisk. Men det kan også være en indikator på at det var alvorlig fordom i trenings-data. I fremtiden vurdere vi å gå enda et skritt lenger og bygge maskinlæring-modeller som kan brukes til å detektere fordom i andre modeller.
Kan du diskutere RapidMiner AI Cloud og hvordan den skiller seg fra konkurrerende produkter?
Kravene til et data science-prosjekt kan være store, komplekse og beregnings-intensivt, noe som har gjort bruk av sky-teknologi så attraktivt for data scientists. Dessverre binder de ulike native sky-baserte data science-plattformene deg til sky-tjenester og data-lagringstilbud fra den enkelte sky-leverandør.
RapidMiner AI Cloud er bare vår sky-tjeneste-levering av RapidMiner-plattformen. Tilbudet kan tilpasses hver enkelt kundes miljø, uavhengig av deres sky-strategi. Dette er viktig i disse dager, da de fleste bedrifters tilnærming til sky-data-håndtering utvikler seg svært raskt i dagens klima. Fleksibilitet er virkelig det som skiller RapidMiner AI Cloud fra andre. Den kan kjøres i enhver sky-tjeneste, privat sky-stack eller i en hybrid-oppsetting. Vi er sky-portabel, sky-agnostisk, multi-sky – hva du måtte ønske å kalle det.
RapidMiner AI Cloud er også svært lavt-hassle, da vi selvfølgelig tilbyr mulighet til å håndtere all eller deler av deployeringen for kunder, så de kan fokusere på å kjøre sin forretning med AI, ikke motsatt. Det er også en på-krav-opsjon, som tillater deg å spinne opp en miljø når som helst for korte prosjekter.
RapidMiner Radoop eliminerer noen av kompleksiteten bak data science, kan du fortelle oss hvordan Radoop forbedrer utviklere?
Radoop er hovedsakelig for ikke-utviklere som ønsker å utnytte potensialet i big data. RapidMiner Radoop kjører RapidMiner-arbeidsflyter direkte innen Hadoop på en kode-fri måte. Vi kan også innbygge RapidMiner-eksekverings-motoren i Spark, så det er enkelt å pushe komplette arbeidsflyter inn i Spark uten kompleksiteten som kommer fra kode-sentrerte tilnærminger.
Skulle en regjeringenhet kunne bruke RapidMiner til å analysere data for å forutsi potensielle pandemier, likt hvordan BlueDot opererer?
Som en generell data science- og maskinlæring-plattform er RapidMiner ment å strømlinje og forbedre modell-oppbygging og -håndtering, uavhengig av hva som er sentralt i data science/maskinlæring-problemet. Selv om vårt fokus ikke er på å forutsi pandemier, kan en sakkyndig (som en virolog eller epidemiolog, i dette tilfelle) med riktig data bruke plattformen til å lage en modell som kan nøyaktig forutsi pandemier. Faktisk bruker mange forskere RapidMiner – og vår plattform er gratis for akademiske formål.
Er det noe annet du ønsker å dele om RapidMiner?
Prøv det! Du kan bli overrasket over hvor enkelt data science kan være og hvor mye en god plattform kan forbedre deg og ditt teams produktivitet.
Takk for dette flotte intervjuet, lesere som ønsker å lære mer bør besøke RapidMiner.












