Interviews

Ingo Mierswa, grundlægger og præsident i RapidMiner, Inc – Interview-serie

mm
Føj Unite.AI til dine foretrukne kilder på Google

Ingo Mierswa er grundlægger og præsident i RapidMiner, Inc. RapidMiner bringer kunstig intelligens til virksomhederne gennem en åben og udvidbar datavidenskabsplatform. Bygget til analytics-hold, unificerer RapidMiner hele datavidenskabslivscyklussen fra dataforberedelse til maskinlæring til prædictiv modeludvikling. Over 625.000 analytics-fagfolk bruger RapidMiner-produkter til at drive omsætning, reducere omkostninger og undgå risici.

Hvad var din inspiration bag lanceringen af RapidMiner?

Jeg havde arbejdet i datavidenskabskonsulentbranchen i mange år og så et behov for en platform, der var mere intuitiv og tilgængelig for personer uden en formel uddannelse i datavidenskab. Mange af de eksisterende løsninger på det tidspunkt afhang af kodning og scripting, og de var simpelthen ikke brugervenlige. Desuden gjorde det data svært at styre og vedligeholde løsningerne, der var udviklet inden for disse platforme. Grundlæggende indså jeg, at disse projekter ikke behøvede at være så svære, så vi begyndte at opbygge RapidMiner-platformen for at tillade alle at være en stor datavidenskabsmand.

Kan du diskutere den fulde gennemsigtighed i styre, der i øjeblikket anvendes af RapidMiner?

Når du ikke kan forklare en model, er det ret svært at justere, stole på og oversætte. Meget af datavidenskabsarbejdet er kommunikationen af resultaterne til andre, så stakeholders kan forstå, hvordan de kan forbedre processer. Dette kræver tillid og dyb forståelse. Desuden kan problemer med tillid og oversættelse gøre det meget svært at overvinde de korporative krav til at få en model i produktion. Vi kæmper denne kamp på flere måder:

Som en visuel datavidenskabsplatform udvikler RapidMiner automatisk en forklaring på alle data-pipelines og modeller i en højtilgængelig format, der kan forstås af datavidenskabsfolk eller ikke-datavidenskabsfolk. Det gør modellerne gennemsigtige og hjælper brugerne med at forstå modeladfærd og evaluere modellens styrker og svagheder og detektere potentielle fordomme.

Derudover kommer alle modeller, der er oprettet i platformen, med omfattende visualiseringer til brugeren – typisk brugeren, der opretter modellen – for at få modelindsigt, forstå modeladfærd og evaluere modelforbud.

RapidMiner giver også modelforklaringer – selv når i produktion: For hver forudsigelse, der er oprettet af en model, genererer RapidMiner og tilføjer påvirkningsfaktorerne, der har ført til eller påvirket beslutningerne, der er truffet af modellen i produktion.

Til sidst – og dette er meget vigtigt for mig personligt, da jeg drev dette med vores ingeniørhold for et par år siden – giver RapidMiner også en ekstremt kraftfuld modelsimuleringsfunktion, der tillader brugerne at simulere og observere modeladfærden på basis af inputdata, der er angivet af brugeren. Inputdata kan indstilles og ændres meget let, hvilket giver brugeren mulighed for at forstå den prædiktive adfærd af modellerne i forskellige hypotetiske eller virkelige scenarier. Simuleringen viser også faktorer, der påvirker modellens beslutning. Brugeren – i dette tilfælde selv en forretningsbruger eller domæneekspert – kan forstå modeladfærd, validere modellens beslutning mod virkelige resultater eller domæneviden og identificere problemer. Simuleringen giver mulighed for at simulere den virkelige verden og kigge ind i fremtiden – ind i din fremtid, faktisk.

Hvordan bruger RapidMiner dyb læring?

RapidMiners brug af dyb læring er noget, vi er meget stolte af. Dyb læring kan være meget svært at anvende, og ikke-datavidenskabsfolk kæmper ofte med at opsætte disse netværk uden ekspertstøtte. RapidMiner gør processen så enkel som muligt for brugere af alle typer. Dyb læring er f.eks. en del af vores Auto-maskinlæringsprodukt (ML) kaldet RapidMiner Go. Her behøver brugeren ikke at vide noget om dyb læring for at anvende disse sofistikerede modeller. Desuden kan power-brugere gå dybere og bruge populære dyb læring biblioteker som Tensorflow, Keras eller DeepLearning4J direkte fra de visuelle arbejdsprocesser, de bygger med RapidMiner. Dette er som at lege med byggeklodser og simplificerer oplevelsen for brugere med færre datavidenskabsfærdigheder. Med denne tilgang kan vores brugere bygge fleksible netværksarkitekturer med forskellige aktiveringsfunktioner og brugerdefineret antal lag og noder, multiple lag med forskellige antal noder og vælge mellem forskellige træningsmetoder.

Hvad andre typer maskinlæring bruges?

Alle! Vi tilbyder hundredvis af forskellige læringsalgoritmer som en del af RapidMiner-platformen – alt, hvad du kan anvende i de almindeligste datavidenskabsprogrammeringssprog Python og R. Blandt andet tilbyder RapidMiner metoder til Naive Bayes, regression såsom Generalized Linear Models, clustering såsom k-Means, FP-Growth, Decision Trees, Random Forests, Parallelized Deep Learning og Gradient Boosted Trees. Disse og mange flere er alle en del af modellbiblioteket i RapidMiner og kan bruges med et enkelt klik.

Kan du diskutere, hvordan Auto Model kender de optimale værdier, der skal bruges?

RapidMiner AutoModel bruger intelligent automation til at accelerere alt, hvad brugerne gør, og sikre, at nøjagtige og solide modeller bygges. Dette inkluderer instansselektion og automatisk outlier-fjernelse, funktionsteknik til komplekse datatyper såsom datoer eller tekster og fuld multi-objekt-automatisk funktionsteknik til at vælge de optimale funktioner og konstruere nye. Auto Model inkluderer også andre data-rengøringsmetoder til at fikse almindelige problemer i data såsom manglende værdier, data-profilering ved at vurdere kvaliteten og værdien af datakolonner, data-normalisering og forskellige andre transformationer.

Auto Model udtrækker også datakvalitetsmeta-data – f.eks. hvordan en kolonne opfører sig som en ID eller om der er mange manglende værdier. Dette meta-data bruges i tillæg til det grundlæggende meta-data i automatisering og assistance af brugere i ‘brug af de optimale værdier’ og håndtering af datakvalitetsproblemer.

Til mere detaljer har vi kortlagt det hele i vores Auto Model Blueprint. (Billede nedenfor til ekstra kontekst)

Der er fire grundlæggende faser, hvor automatiseringen anvendes:

– Dataforberedelse: Automatisk analyse af data for at identificere almindelige kvalitetsproblemer som korrelationer, manglende værdier og stabilitet.
– Automatisk modelselektion og -optimering, herunder fuld validering og ydelseskomparation, der foreslår de bedste maskinlærings-teknikker for givet data og bestemmer de optimale parametre.
– Model-simulation til at bestemme de specifikke (præskriptive) handlinger, der skal udføres for at opnå det ønskede resultat, der er forudsat af modellen.
– I model-udviklings- og operationsfasen vises brugerne faktorer som drift, bias og forretningsimpact, automatisk uden ekstra arbejde.

Computerforudsigelser er et problem med enhver type AI, er der nogen kontroller i gang for at forhindre forudsigelser i resultaterne?

Ja, dette er virkelig meget vigtigt for etisk datavidenskab. De styre-funktioner, der er nævnt tidligere, sikrer, at brugerne altid kan se nøjagtigt, hvilke data der er brugt til modelbygning, hvordan det er transformeret, og om der er bias i data-selektionen. Desuden er vores funktioner til driftsdetektion endnu et kraftfuldt værktøj til at detektere bias. Hvis en model i produktion viser en masse drift i inputdata, kan dette være et tegn på, at verden er ændret dramatisk. Men det kan også være en indikator for, at der var alvorlig bias i træningsdata. I fremtiden overvejer vi at gå endnu et skridt videre og bygge maskinlæringsmodeller, der kan bruges til at detektere bias i andre modeller.

Kan du diskutere RapidMiner AI Cloud og hvordan det adskiller sig fra konkurrerende produkter?

Kravene til et datavidenskabsprojekt kan være store, komplekse og beregningsintensive, hvilket har gjort brugen af cloud-teknologi til en attraktiv strategi for datavidenskabsfolk. Desværre binder de forskellige native cloud-baserede datavidenskabsplatforme dig til cloud-tjenester og data-lagringstilbud fra den pågældende cloud-leverandør.

RapidMiner AI Cloud er blot vores cloud-servicelevering af RapidMiner-platformen. Tilbuddet kan tilpasses til enhver kundes miljø, uanset deres cloud-strategi. Dette er vigtigt i disse dage, da de fleste virksomheders tilgang til cloud-datastyring udvikler sig meget hurtigt i den nuværende klima. Fleksibilitet er virkelig, hvad der adskiller RapidMiner AI Cloud. Det kan køre i enhver cloud-tjeneste, privat cloud-stack eller i en hybrid-opstilling. Vi er cloud-portable, cloud-agnostisk, multi-cloud – hvad du ønsker at kalde det.

RapidMiner AI Cloud er også meget lavt vedligeholdelseskrævende, da vi selvfølgelig tilbyder mulighed for at styre alle eller dele af installationen for kunder, så de kan fokusere på at køre deres forretning med AI, ikke omvendt. Der er endda en on-demand-mulighed, der giver mulighed for at starte en miljø, når som helst det er nødvendigt for korte projekter.

RapidMiner Radoop eliminerer nogen af kompleksiteten bag datavidenskab, kan du fortælle os, hvordan Radoop forbedrer udviklerne?

Radoop er primært til ikke-udviklere, der ønsker at udnytte potentialet i big data. RapidMiner Radoop udfører RapidMiner-arbejdsprocesser direkte inden for Hadoop på en kode-fri måde. Vi kan også indbygge RapidMiner-ekssekutionsmotoren i Spark, så det er let at skubbe komplette arbejdsprocesser ind i Spark uden den kompleksitet, der kommer fra kode-centrerede tilgange.

Kunne en regeringsenhed bruge RapidMiner til at analysere data for at forudsige potentielle pandemier, ligesom BlueDot fungerer?

Som en generel datavidenskabs- og maskinlæringsplatform er RapidMiner beregnet til at strømline og forbedre modeloprettelse og -styring, uanset hvilket emne eller domæne, der er centrum for datavidenskabs-/maskinlæringsproblemet. Selvom vores fokus ikke er på at forudsige pandemier, kan en sagkyndig (som en virolog eller epidemiolog i dette tilfælde) med det rette data bruge platformen til at oprette en model, der kan nøjagtigt forudsige pandemier. Faktisk bruger mange forskere RapidMiner – og vores platform er gratis til akademiske formål.

Er der noget andet, du gerne vil dele om RapidMiner?

Prøv det!  Du kan blive overrasket over, hvor let datavidenskab kan være, og hvor meget en god platform kan forbedre dig og dit holds produktivitet.

Tak for denne store interviewer, læsere, der ønsker at lære mere, skal besøge RapidMiner.

Antoine er en visionær leder og medstifter af Unite.AI, drevet af en urokkelig passion for at forme og fremme fremtiden for AI og robotteknologi. En serieiværksætter, han tror, at AI vil være lige så omvæltende for samfundet som elektricitet, og han bliver ofte fanget i at tale om potentialet for omvæltende teknologier og AGI.

Som en futurist, er han dedikeret til at udforske, hvordan disse innovationer vil forme vores verden. Derudover er han grundlægger af Securities.io, en platform, der fokuserer på at investere i skarp teknologi, der gendefinerer fremtiden og omformer hele sektorer.