Haastattelut
Ingo Mierswa, RapidMiner Inc:n perustaja ja puheenjohtaja – Haastattelu

Ingo Mierswa on RapidMiner Inc:n perustaja ja puheenjohtaja. RapidMiner tuo tekoälyyrityksiin avoimen ja laajennettavissa olevan data science -alustan. Analytiikkatiimien rakennettu RapidMiner yhdistää koko data science -elinkaaren data-esikäsittelystä koneoppimiseen ennustavaan mallin käyttöönottoon. Yli 625 000 analytiikkaprofessionaalia käyttää RapidMiner-tuotteita lisätäkseen liikevaihtoa, vähentääkseen kustannuksia ja välttääkseen riskejä.
Mikä oli inspiraation lähteenä perustaa RapidMiner?
Olin työskennellyt data science -konsulttitoiminnassa useita vuosia ja näin tarpeen alustalle, joka olisi intuitiivisempi ja helpommin lähestyttävissä niille, joilla ei ole virallista koulutusta data scienceen. Monet olemassa olevat ratkaisut tuolloin riippuivat koodauksesta ja skriptauksesta, ja ne eivät olleet käyttäjäystävällisiä. Lisäksi ne tekivät dataa vaikeaksi hallita ja ylläpitää ratkaisuja, jotka kehitettiin näiden alustojen sisällä. Perusajatukseni oli, että nämä projektit eivät tarvinneet olla niin vaikeita, joten aloimme luomaan RapidMiner-alustaa, jotta kuka tahansa voisi olla suuri data scientist.
Voitko keskustella RapidMinerin käyttämästä avoimesta hallinnosta?
Kun et voi selittää mallia, on vaikea säätää, luottaa ja kääntää. Paljon data science -työtä on tulosten viestintä muille, jotta sidosryhmät voivat ymmärtää, miten prosesseja voidaan parantaa. Tämä vaatii luottamusta ja syvää ymmärrystä. Lisäksi luottamuksen ja käännösongelmat voivat tehdä hyvin vaikeaksi ylittää yrityksen vaatimukset saada malli tuotantoon. Taistelemme tätä taistelua usealla tavalla:
RapidMiner on visuaalinen data science -alusta, joka sisällä luonnollisesti kartan selitykseksi kaikille data-putkistoihin ja malleihin helposti kuluttavassa muodossa, jota voidaan ymmärtää data scientistien tai ei-data scientistien toimesta. Se tekee malleista läpinäkyviä ja auttaa käyttäjiä ymmärtämään mallin käyttäytymistä, arvioimaan mallin vahvuuksia ja heikkouksia ja havaitsemaan mahdollisia harhaa.
Lisäksi kaikki alustalla luodut mallit tulevat laajoin visualisoinnein käyttäjälle – tyypillisesti käyttäjälle, joka luo mallin – saadakseen mallinäkemyksiä, ymmärtääkseen mallin käyttäytymistä ja arvioimaan mallin harhaa.
RapidMiner tarjoaa myös malliselityksiä – jopa tuotannossa: Kunkin mallin luoman ennusteen kohdalla RapidMiner luo ja lisää vaikutusfaktorit, jotka ovat johtaneet tai vaikuttaneet mallin tekemiin päätöksiin tuotannossa.
Lopulta – ja tämä on minulle henkilökohtaisesti tärkeää, koska ohjasin tätä meidän insinööritiimien kanssa pari vuotta sitten – RapidMiner tarjoaa myös erittäin voimakkaan mallisimulaattorin, joka mahdollistaa käyttäjien simuloimisen ja tarkkailemisen mallin käyttäytymistä syötteenä annetun käyttäjän antaman datan perusteella. Syötettävää dataa voidaan asettaa ja muuttaa helposti, jotta käyttäjä voi ymmärtää mallin ennustavaa käyttäytymistä erilaisissa hypoteettisissa tai todellisissa tapauksissa. Simulaattori näyttää myös tekijöitä, jotka vaikuttavat mallin päätöksiin. Käyttäjä – tässä tapauksessa jopa liiketoimintakäyttäjä tai toimialan asiantuntija – voi ymmärtää mallin käyttäytymistä, vahvistaa mallin päätöksen todellisten tuloksien tai toimialan tietämyksen perusteella ja tunnistaa ongelmat. Simulaattori mahdollistaa maailman simuloimisen ja tulevaisuuden tarkastelemisen – sinun tulevaisuutesi.
Miten RapidMiner käyttää syvää oppimista?
RapidMinerin syvän oppimisen käyttö on asia, josta olemme erittäin ylpeitä. Syvä oppiminen voi olla hyvin vaikeaa soveltaa, ja ei-data scientistit usein kamppailevat verkostojen asettamisen kanssa ilman asiantuntijaohjausta. RapidMiner tekee tämän prosessin mahdollisimman yksinkertaiseksi kaiken tyyppisille käyttäjille. Syvä oppiminen on esimerkiksi osa automaattista koneoppimista (ML) -tuotetta RapidMiner Go. Tässä käyttäjän ei tarvitse tietää mitään syvää oppimista käyttääkseen näitä kehittyneitä malleja. Lisäksi power-käyttäjät voivat mennä syvemmälle ja käyttää suosittuja syvän oppimisen kirjastoja, kuten Tensorflow, Keras tai DeepLearning4J, suoraan RapidMinerin visuaalisista työnkulusta. Tämä on kuin leikkimistä rakennuspalikoilla ja yksinkertaistaa käyttäjien kokemusta vähemmän data science -taitoisille. Tämän lähestymistavan kautta käyttäjämme voivat rakentaa joustavia verkkoarkkitehtuureja eri aktivaatiofunktioilla ja käyttäjän määrittelemällä määrällä kerroksia ja solmuja, useita kerroksia eri määrällä solmuja ja valita eri koulutustekniikoita.
Mitä muita tyyppejä koneoppimista käytetään?
Kaikkia! Tarjoamme satoja eri oppimisalgoritmeja osana RapidMiner-alustaa – kaikki, mitä voidaan soveltaa laajasti käytetyissä data science -ohjelmointikielissä Python ja R. RapidMiner tarjoaa menetelmiä esimerkiksi Naive Bayes, regressio, kuten yleiset lineaariset mallit, klusterointi, kuten k-keskiarvo, FP-Growth, Päätöspuut, Satunnaiset metsät, rinnakkainen syvä oppiminen ja Gradient Boosted Trees. Nämä ja monet muut ovat osa RapidMinerin mallikirjastoa ja voidaan käyttää yhdellä klikkauksella.
Voitko keskustella siitä, miten Auto Model tietää, mitkä arvot ovat käytettäväksi?
RapidMiner AutoModel käyttää älykästä automaatiota kiihdyttääkseen kaikkea, mitä käyttäjät tekevät, ja varmistaa, että tarkat ja terveet mallit rakennetaan. Tämä sisältää esimerkiksi tapahtuman valinnan ja automaattisen poikkeaman poiston, piirteinjärjestelmän kompleksisten tietotyyppien kuten päivämäärien tai tekstien osalta sekä täydellisen monitavoitteisen automaattisen piirteinjärjestelmän valitsemaan optimaaliset piirteet ja rakentamaan uusia. Auto Model sisältää myös muita data-puhdistusmenetelmiä yleisten ongelmien kuten puuttuvien arvojen, data-profiilin arvioinnin, joka arvioi data-sarakkeiden laadun ja arvon, data-normalisoinnin ja eri muunnoksia.
Auto Model myös poistaa data-laadun meta-dataa – esimerkiksi, kuinka paljon sarake käyttäytyy kuin tunniste tai onko paljon puuttuvia arvoja. Tätä meta-dataa käytetään lisäksi perusmeta-dataan automaattisessa käyttäjien avustamisessa “optimaalisten arvojen käytössä” ja data-laadun ongelmien käsittelyssä.
Lisätietoja varten olemme kartoittaneet kaiken Auto Model Blueprintissa. (Kuva alla lisäkontekstin vuoksi)
On neljä perusvaihetta, joissa automaatio sovelletaan:
– Data-esikäsittely: Automaattinen data-analyysi yleisten laatuongelmien kuten korrelaatioiden, puuttuvien arvojen ja vakauden tunnistamiseksi.
– Automaattinen mallin valinta ja optimointi, mukaan lukien täydellinen validointi ja suorituskyvyn vertailu, joka ehdottaa parhaat koneoppimismenetelmät annetuille tiedoille ja määrittää optimaaliset parametriarvot.
– Mallin simulaatio, joka auttaa määrittämään tarkat (preskriptiiviset) toimenpiteet, joita on tehtävä saavuttaakseen halutun tuloksen, jonka malli ennustaa.
– Mallin käyttöönotto- ja toimintavaiheessa käyttäjille näytetään tekijöitä, kuten drift, bias ja liiketoimintavaikutus, automaattisesti ilman lisätyötä.

Tietokoneen harha on ongelma kaikenlaisessa tekoälyssä, onko mitään valvontaa, jotta harha ei pääse tuloksiin?
Kyllä, tämä on erittäin tärkeää eettiselle data sciencelle. Aikaisemmin mainitut hallintotoiminnot varmistavat, että käyttäjät voivat aina nähdä tarkalleen, mitä dataa on käytetty mallin rakentamiseen, miten se on muunnettu ja onko data-valinnassa harhaa. Lisäksi meidän drift-havainnontekijämme ovat toinen voimakas työkalu harhan havaitsemiseen. Jos malli tuotannossa osoittaa paljon driftiä syötedatasta, tämä voi olla merkki siitä, että maailma on muuttunut dramaattisesti. Se voi myös olla osoitus siitä, että oli vakava harha koulutusdatasta. Tulevaisuudessa olemme harkitsemassa menemistä vielä askelen eteenpäin ja rakentamista koneoppimismalleja, joita voidaan käyttää harhan havaitsemiseen malleissa.
Voitko keskustella RapidMiner AI Cloudista ja siitä, miten se erottuu kilpailevista tuotteista?
Data science -projektien vaatimukset voivat olla suuria, monimutkaisia ja laskennallisia, mikä on tehnyt pilvi-teknologian käytön houkuttelevaksi strategiaksi data scientistien keskuudessa. Valitettavasti eri pilvipohjaiset data science -alustat sitoutuvat pilvipalveluihin ja data-säilytysratkaisuihin, jotka kuuluvat tiettyyn pilvipalveluntarjoajalle.
RapidMiner AI Cloud on vain RapidMiner-alustan pilvipalvelumuoto. Tarjous voidaan räätälöidä asiakkaan ympäristöön, riippumatta heidän pilvi-strategiastaan. Tämä on tärkeää näinä päivinä, kun useimmat yritykset kehittävät nopeasti lähestymistapaansa pilviin liittyvään data-hallintaan. Joustavuus on se, mikä erottaa RapidMiner AI Cloudin. Se voidaan ajaa missä tahansa pilvipalvelussa, yksityisessä pilvistä, hybridiratkaisussa. Olemme pilviportaalisia, pilvi-agnostisia, monipilvisiä – kutsukaapa sitä mitä haluatte.
RapidMiner AI Cloud on myös erittäin vähän vaivaa, koska meillä on mahdollisuus hallita kaikkea tai osaa asiakkaan käyttöönotosta, jotta he voivat keskittyä liiketoimintansa pyörittämiseen tekoälyllä, ei toisin päin. On myös tarjolla on-demand-vaihtoehto, joka mahdollistaa ympäristön käynnistämisen tarpeen mukaan lyhytaikaisiin projekteihin.
RapidMiner Radoop poistaa osan monimutkaisuudesta data sciencesta, voitko kertoa, miten Radoop hyödyttää kehittäjiä?
Radoop on pääasiassa ei-kehittäjille, jotka haluavat hyödyntää big data -potentiaalia. RapidMiner Radoop suorittaa RapidMiner-työnkulkuja suoraan Hadoopissa koodittomalla tavalla. Voimme myös upottaa RapidMiner-suoritusmoottorin Sparkiin, jotta on helppo työntää koko työnkulkuja Sparkiin ilman koodikeskeisten lähestymistapojen monimutkaisuutta.
Voisiko hallituksen yksikkö käyttää RapidMineriä data-analyysiin potentiaalisten pandemioiden ennustamiseksi, samalla tavalla kuin BlueDot toimii?
RapidMiner on yleinen data science – ja koneoppimisalusta, joka on tarkoitettu mallien luomisen ja hallinnan prosessin sujuvoittamiseen ja parantamiseen, riippumatta siitä, mikä aihealue tai toimiala on data science / koneoppimisongelman keskiössä. Vaikka fokus ei ole pandemioiden ennustamisessa, oikean datan kanssa alan asiantuntija (kuten virologi tai epidemiologi) voi käyttää alustaa luodakseen mallin, joka voisi ennustaa pandemioita tarkasti. Itse asiassa monet tutkijat käyttävät RapidMineriä – ja alustamme on ilmainen akateemisiin tarkoituksiin.
Onko mitään muuta, mitä haluaisit jakaa RapidMineristä?
Kokeile sitä! Saattaa olla yllättävää, kuinka helppoa data science voi olla ja kuinka hyvä alusta voi parantaa sinun ja tiimisi tuottavuutta.
Kiitos tästä haastattelusta, lukijoille, jotka haluavat oppia lisää, suosittelemme vierailemaan RapidMiner.












