Interviste

Ingo Mierswa, Fondatore e Presidente di RapidMiner, Inc – Serie di Interviste

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Ingo Mierswa è il Fondatore e Presidente di RapidMiner, Inc. RapidMiner porta l’intelligenza artificiale alle imprese attraverso una piattaforma di data science aperta e estensibile. Progettata per i team di analisi, RapidMiner unifica l’intero ciclo di vita della data science, dalla preparazione dei dati all’apprendimento automatico alla distribuzione dei modelli predittivi. Oltre 625.000 professionisti dell’analisi utilizzano i prodotti RapidMiner per aumentare i ricavi, ridurre i costi e evitare i rischi.

Qual è stata la tua ispirazione dietro il lancio di RapidMiner?

Avevo lavorato nel settore della consulenza di data science per molti anni e ho visto la necessità di una piattaforma più intuitiva e accessibile per le persone senza una formazione formale in data science. Molte delle soluzioni esistenti all’epoca si basavano sulla codifica e sulla programmazione e non erano semplici da usare. Inoltre, rendevano difficile la gestione e la manutenzione delle soluzioni sviluppate all’interno di quelle piattaforme. Fondamentalmente, ho capito che questi progetti non dovevano essere così difficili, quindi abbiamo iniziato a creare la piattaforma RapidMiner per consentire a chiunque di essere un grande scienziato dei dati.

Posso discutere della governance della trasparenza attualmente utilizzata da RapidMiner?

Quando non si può spiegare un modello, è molto difficile tararlo, fidarsi e tradurlo. Molto del lavoro di data science consiste nella comunicazione dei risultati agli altri in modo che gli stakeholder possano capire come migliorare i processi. Ciò richiede fiducia e una profonda comprensione. Inoltre, problemi di fiducia e traduzione possono rendere molto difficile superare i requisiti aziendali per mettere un modello in produzione. Stiamo combattendo questa battaglia in diversi modi:

Essendo una piattaforma di data science visiva, RapidMiner mappa automaticamente una spiegazione per tutte le pipeline di dati e i modelli in un formato altamente consumabile che può essere compreso da scienziati dei dati o non scienziati dei dati. Ciò rende i modelli trasparenti e aiuta gli utenti a comprendere il comportamento del modello e a valutarne i punti di forza e di debolezza e a rilevare potenziali pregiudizi.

Inoltre, tutti i modelli creati nella piattaforma vengono forniti con estensive visualizzazioni per l’utente – di solito l’utente che crea il modello – per ottenere informazioni sul modello, comprendere il comportamento del modello e valutare i pregiudizi del modello.

RapidMiner fornisce anche spiegazioni dei modelli – anche quando sono in produzione: per ogni previsione creata da un modello, RapidMiner genera e aggiunge i fattori di influenza che hanno portato o influenzato le decisioni prese dal modello in produzione.

Infine – e questo è molto importante per me personalmente, poiché stavo guidando questo con i nostri team di ingegneria alcuni anni fa – RapidMiner fornisce anche una capacità di simulazione del modello estremamente potente, che consente agli utenti di simulare e osservare il comportamento del modello in base ai dati di input forniti dall’utente. I dati di input possono essere impostati e modificati molto facilmente, consentendo all’utente di comprendere il comportamento predittivo dei modelli in vari casi ipotetici o del mondo reale. La simulazione visualizza anche i fattori che influenzano la decisione del modello. L’utente – in questo caso anche un utente aziendale o un esperto di dominio – può comprendere il comportamento del modello, convalidare la decisione del modello rispetto ai risultati reali o alla conoscenza del dominio e identificare problemi. La simulazione consente di simulare il mondo reale e di guardare nel futuro – nel vostro futuro, in effetti.

Come utilizza RapidMiner l’apprendimento profondo?

L’utilizzo dell’apprendimento profondo da parte di RapidMiner è qualcosa di cui siamo molto orgogliosi. L’apprendimento profondo può essere molto difficile da applicare e gli non scienziati dei dati spesso lottano per impostare quelle reti senza supporto esperto. RapidMiner rende questo processo il più semplice possibile per gli utenti di tutti i tipi. L’apprendimento profondo, ad esempio, fa parte del nostro prodotto di apprendimento automatico (ML) chiamato RapidMiner Go. Qui l’utente non deve sapere nulla sull’apprendimento profondo per utilizzare quei tipi di modelli sofisticati. Inoltre, gli utenti potenti possono andare più a fondo e utilizzare librerie di apprendimento profondo popolari come Tensorflow, Keras o DeepLearning4J direttamente dalle workflow visive che stanno costruendo con RapidMiner. Ciò è come giocare con i blocchi e semplifica l’esperienza per gli utenti con meno competenze di data science. Attraverso questo approccio, i nostri utenti possono costruire architetture di rete flessibili con diverse funzioni di attivazione e un numero di livelli e nodi definito dall’utente, più livelli con diversi numeri di nodi e scegliere tra diverse tecniche di formazione.

Quali altri tipi di apprendimento automatico vengono utilizzati?

Tutti! Offriamo centinaia di diversi algoritmi di apprendimento come parte della piattaforma RapidMiner – tutto ciò che puoi applicare nei linguaggi di programmazione di data science più utilizzati, Python e R. Tra gli altri, RapidMiner offre metodi per Naive Bayes, regressione come Modelli Lineari Generalizzati, clustering come k-Means, FP-Growth, Alberi Decisionali, Foreste Casuali, Apprendimento Profondo Parallelizzato e Alberi di Boosting del Gradiente. Questi e molti altri fanno parte della libreria di modelli di RapidMiner e possono essere utilizzati con un solo clic.

Posso discutere di come il modello automatico sa quali sono i valori ottimali da utilizzare?

RapidMiner AutoModel utilizza l’automazione intelligente per accelerare tutto ciò che fanno gli utenti e assicurarsi che i modelli costruiti siano precisi e solidi. Ciò include la selezione delle istanze e la rimozione automatica degli outlier, l’ingegneria delle funzioni per tipi di dati complessi come date o testi e l’ingegneria delle funzioni automatica multi-obiettivo per selezionare le funzioni ottimali e costruirne di nuove. Auto Model include anche altri metodi di pulizia dei dati per risolvere problemi comuni nei dati come i valori mancanti, la profilazione dei dati valutando la qualità e il valore delle colonne dei dati, la normalizzazione dei dati e diverse altre trasformazioni.

Auto Model estrae anche i metadati di qualità dei dati – ad esempio, come si comporta una colonna come un ID o se ci sono molti valori mancanti. Questi metadati vengono utilizzati in aggiunta ai metadati di base per automatizzare e assistere gli utenti nell’utilizzo dei “valori ottimali” e nel gestire i problemi di qualità dei dati.

Per maggiori dettagli, abbiamo mappato tutto nel nostro Piano di Auto Model. (Immagine in basso per ulteriore contesto)

Ci sono quattro fasi di base in cui si applica l’automazione:

– Preparazione dei dati: analisi automatica dei dati per identificare problemi di qualità comuni come le correlazioni, i valori mancanti e la stabilità.
– Selezione e ottimizzazione automatica del modello, compresa la convalida e il confronto delle prestazioni, che suggerisce le migliori tecniche di apprendimento automatico per i dati dati e determina i parametri ottimali.
– Simulazione del modello per aiutare a determinare le azioni specifiche (prescrittive) da intraprendere per raggiungere il risultato desiderato previsto dal modello.
– Nella fase di distribuzione e gestione del modello, agli utenti vengono mostrati fattori come il drift, il pregiudizio e l’impatto aziendale, automaticamente senza alcun lavoro aggiuntivo richiesto.

Il pregiudizio del computer è un problema con qualsiasi tipo di intelligenza artificiale, ci sono controlli in atto per prevenire che i pregiudizi si insinuino nei risultati?

Sì, questo è estremamente importante per la data science etica. Le funzionalità di governance menzionate in precedenza assicurano che gli utenti possano sempre vedere esattamente quali dati sono stati utilizzati per la costruzione del modello, come sono stati trasformati e se c’è pregiudizio nella selezione dei dati. Inoltre, le nostre funzionalità di rilevamento del drift sono un altro potente strumento per rilevare i pregiudizi. Se un modello in produzione mostra un grande drift nei dati di input, ciò può essere un segno che il mondo è cambiato drasticamente. Tuttavia, può anche essere un indicatore che c’è stato un grave pregiudizio nei dati di addestramento. In futuro, stiamo considerando di andare ancora oltre e costruire modelli di apprendimento automatico che possano essere utilizzati per rilevare i pregiudizi in altri modelli.

Posso discutere del RapidMiner AI Cloud e di come si differenzia dai prodotti concorrenti?

I requisiti per un progetto di data science possono essere grandi, complessi e intensivi in termini di calcolo, il che ha reso l’utilizzo della tecnologia cloud una strategia attraente per gli scienziati dei dati. Purtroppo, le varie piattaforme di data science basate su cloud native legano l’utente ai servizi cloud e alle offerte di archiviazione dei dati di quel particolare fornitore di servizi cloud.

RapidMiner AI Cloud è semplicemente la nostra offerta di servizio cloud della piattaforma RapidMiner. L’offerta può essere personalizzata per qualsiasi ambiente del cliente, indipendentemente dalla loro strategia cloud. Ciò è importante in questi giorni, poiché l’approccio delle aziende alla gestione dei dati cloud sta evolvendo molto rapidamente nel clima attuale. La flessibilità è ciò che distingue RapidMiner AI Cloud. Può essere eseguito in qualsiasi servizio cloud, stack cloud privato o in un ambiente ibrido. Siamo portabili cloud, agnostici cloud, multi-cloud – come preferisci chiamarli.

RapidMiner AI Cloud è anche molto poco problematico, poiché offriamo la possibilità di gestire tutto o parte della distribuzione per i clienti in modo che possano concentrarsi sull’esecuzione del loro business con l’intelligenza artificiale, non viceversa. C’è anche un’opzione on-demand, che consente di avviare un ambiente secondo necessità per progetti brevi.

RapidMiner Radoop elimina alcune delle complessità dietro la data science, posso dirti come Radoop beneficia gli sviluppatori?

Radoop è principalmente per non sviluppatori che desiderano sfruttare il potenziale dei big data. RapidMiner Radoop esegue le workflow di RapidMiner direttamente all’interno di Hadoop in modo senza codice. Possiamo anche incorporare il motore di esecuzione di RapidMiner in Spark in modo che sia facile spingere le workflow complete in Spark senza la complessità che deriva dagli approcci basati sul codice.

Un’entità governativa potrebbe utilizzare RapidMiner per analizzare i dati per prevedere potenziali pandemie, simile a come opera BlueDot?

Essendo una piattaforma di data science e apprendimento automatico generale, RapidMiner è progettata per semplificare e migliorare il processo di creazione e gestione dei modelli, indipendentemente dal soggetto o dal dominio al centro del problema di data science/apprendimento automatico. Sebbene il nostro focus non sia sulla previsione delle pandemie, con i dati giusti un esperto del settore (come un virologo o un epidemiologo, in questo caso) potrebbe utilizzare la piattaforma per creare un modello che potrebbe prevedere con precisione le pandemie. In effetti, molti ricercatori utilizzano RapidMiner – e la nostra piattaforma è gratuita per scopi accademici.

C’è altro che vorresti condividere su RapidMiner?

Provalo! Potresti essere sorpreso da quanto sia facile la data science e da quanto una buona piattaforma possa migliorare la tua e la produttività del tuo team.

Grazie per questa grande intervista, i lettori che desiderano saperne di più possono visitare RapidMiner.

Antoine è un leader visionario e socio fondatore di Unite.AI, guidato da una passione incrollabile per plasmare e promuovere il futuro dell'AI e della robotica. Un imprenditore seriale, crede che l'AI sarà così disruptiva per la società come l'elettricità, e spesso si lascia trasportare dall'entusiasmo per il potenziale delle tecnologie disruptive e dell'AGI.

Come futurista, è dedicato a esplorare come queste innovazioni plasmeranno il nostro mondo. Inoltre, è il fondatore di Securities.io, una piattaforma focalizzata sugli investimenti in tecnologie all'avanguardia che stanno ridefinendo il futuro e riplasmando interi settori.