Fondamenti di IA
Cos’è la Scienza dei Dati?
Il campo della scienza dei dati sembra diventare sempre più grande e popolare ogni giorno. Secondo LinkedIn, la scienza dei dati è stata una delle aree di lavoro in più rapida crescita nel 2017 e nel 2020 Glassdoor ha classificato il lavoro di scienziato dei dati come uno dei tre migliori lavori negli Stati Uniti. Data la crescente popolarità della scienza dei dati, non sorprende che sempre più persone siano interessate a questo campo. Eppure, cosa è esattamente la scienza dei dati?
Facciamo la conoscenza della scienza dei dati, prendendoci il tempo per definire la scienza dei dati, esplorare come i big data e l’intelligenza artificiale stanno cambiando il campo, imparare alcuni strumenti comuni della scienza dei dati e esaminare alcuni esempi di scienza dei dati.
Cos’è la Scienza dei Dati?
Prima di poter esplorare gli strumenti o gli esempi della scienza dei dati, vogliamo ottenere una definizione concisa di scienza dei dati.
Definire “scienza dei dati” è in realtà un po’ difficile, perché il termine viene applicato a molti compiti e metodi di indagine e analisi diversi. Possiamo iniziare ricordandoci cosa significa il termine “scienza”. La scienza è lo studio sistematico del mondo fisico e naturale attraverso l’osservazione e l’esperimento, con l’obiettivo di avanzare la comprensione umana dei processi naturali. Le parole importanti in questa definizione sono “osservazione” e “comprensione”.
Se la scienza dei dati è il processo di comprensione del mondo attraverso i modelli presenti nei dati, allora la responsabilità di uno scienziato dei dati è quella di trasformare i dati, analizzare i dati e estrarre modelli dai dati. In altre parole, uno scienziato dei dati riceve i dati e utilizza una serie di strumenti e tecniche diversi per preparare i dati (renderli pronti per l’analisi) e poi analizzare i dati per modelli significativi.
Il ruolo di uno scienziato dei dati è simile al ruolo di uno scienziato tradizionale. Entrambi sono preoccupati dell’analisi dei dati per supportare o respingere ipotesi su come funziona il mondo, cercando di dare un senso ai modelli presenti nei dati per migliorare la nostra comprensione del mondo. Gli scienziati dei dati utilizzano gli stessi metodi scientifici di uno scienziato tradizionale. Uno scienziato dei dati inizia raccogliendo osservazioni su alcuni fenomeni che desidera studiare. Quindi formula un’ipotesi sul fenomeno in questione e cerca di trovare dati che contraddicano in qualche modo la sua ipotesi.
Se l’ipotesi non è contraddetta dai dati, potrebbe essere possibile costruire una teoria o un modello su come funziona il fenomeno, che può essere testato più e più volte per vedere se regge per altri set di dati simili. Se un modello è sufficientemente robusto, se spiega bene i modelli e non è contraddetto durante altri test, può anche essere utilizzato per prevedere eventi futuri.
Uno scienziato dei dati di solito non raccoglie i propri dati attraverso un esperimento. Di solito non progetta esperimenti con controlli e prove in doppio cieco per scoprire variabili di confondimento che potrebbero interferire con un’ipotesi. La maggior parte dei dati analizzati da uno scienziato dei dati sarà costituita da dati ottenuti attraverso studi osservazionali e sistemi, il che è un modo in cui il lavoro di uno scienziato dei dati potrebbe differire dal lavoro di uno scienziato tradizionale, che tende a eseguire più esperimenti.
Detto questo, uno scienziato dei dati potrebbe essere chiamato a eseguire una forma di sperimentazione chiamata test A/B dove vengono apportate modifiche a un sistema che raccoglie dati per vedere come cambiano i modelli dei dati.
Indipendentemente dalle tecniche e dagli strumenti utilizzati, la scienza dei dati ha l’obiettivo finale di migliorare la nostra comprensione del mondo dando un senso ai dati e utilizzando i dati per comprendere meglio il mondo. La scienza dei dati è il processo di utilizzo di algoritmi, principi statistici e vari strumenti e macchine per estrarre informazioni dai dati, informazioni che ci aiutano a comprendere i modelli presenti nel mondo intorno a noi.
Cosa Fanno gli Scienziati dei Dati?
Potresti notare che qualsiasi attività che coinvolge l’analisi dei dati in modo scientifico può essere chiamata scienza dei dati, il che è parte di ciò che rende difficile definire la scienza dei dati. Per chiarire, esploriamo alcune delle attività che uno scienziato dei dati potrebbe svolgere quotidianamente.

La scienza dei dati riunisce molte discipline e specializzazioni diverse. Foto: Calvin Andrus via Wikimeedia Commons, CC BY SA 3.0 (https://commons.wikimedia.org/wiki/File:DataScienceDisciplines.png)
In qualsiasi giorno, uno scienziato dei dati potrebbe essere chiamato a: creare schemi di archiviazione e recupero dei dati, creare pipeline di ETL (estrazione, trasformazione, caricamento) e pulire i dati, utilizzare metodi statistici, creare visualizzazioni e dashboard dei dati, implementare algoritmi di apprendimento automatico e intelligenza artificiale, fornire raccomandazioni per azioni basate sui dati.
Vediamo di analizzare un po’ i compiti elencati sopra.
Uno scienziato dei dati potrebbe essere tenuto a gestire l’installazione delle tecnologie necessarie per archiviare e recuperare i dati, prestando attenzione sia all’hardware che al software. La persona responsabile di questa posizione potrebbe anche essere chiamata “Ingegnere dei Dati“. Tuttavia, alcune aziende includono queste responsabilità nel ruolo degli scienziati dei dati. Uno scienziato dei dati potrebbe anche dover creare, o assistere nella creazione di, pipeline di ETL. I dati raramente arrivano già formattati come uno scienziato dei dati li necessita. Invece, i dati avranno bisogno di essere ricevuti in forma grezza dalla fonte di dati, trasformati in un formato utilizzabile e preelaborati (cose come standardizzare i dati, eliminare ridondanze e rimuovere dati corrotti).
Metodi Statistici della Scienza dei Dati
L’applicazione della statistica è necessaria per trasformare il semplice esame dei dati e la loro interpretazione in una vera e propria scienza. I metodi statistici vengono utilizzati per estrarre modelli rilevanti dai set di dati e uno scienziato dei dati deve essere ben versato in concetti statistici. Devono essere in grado di distinguere tra correlazioni significative e correlazioni spurie controllando le variabili di confondimento. Devono anche sapere quali strumenti utilizzare per determinare quali caratteristiche nel set di dati sono importanti per il loro modello/hanno un potere predittivo. Uno scienziato dei dati deve sapere quando utilizzare un approccio di regressione rispetto a un approccio di classificazione e quando curarsi della media di un campione rispetto alla mediana di un campione. Uno scienziato dei dati non sarebbe uno scienziato senza queste competenze cruciali.
Visualizzazione dei Dati
Una parte cruciale del lavoro di uno scienziato dei dati è comunicare i propri risultati agli altri. Se uno scienziato dei dati non può comunicare efficacemente i propri risultati agli altri, allora le implicazioni dei propri risultati non hanno importanza. Uno scienziato dei dati dovrebbe essere un narratore efficace. Ciò significa produrre visualizzazioni che comunicano punti rilevanti sul set di dati e sui modelli scoperti al suo interno. Esistono molti strumenti di visualizzazione dei dati diversi che uno scienziato dei dati potrebbe utilizzare e potrebbe visualizzare i dati per scopi di esplorazione iniziale (analisi dei dati esplorativa) o visualizzare i risultati prodotti da un modello.
Raccomandazioni e Applicazioni Aziendali
Uno scienziato dei dati deve avere un po’ di intuizione delle esigenze e degli obiettivi della propria organizzazione o azienda. Uno scienziato dei dati deve comprendere queste cose perché deve sapere quali variabili e caratteristiche deve analizzare, esplorando modelli che aiuteranno la propria organizzazione a raggiungere i propri obiettivi. Gli scienziati dei dati devono essere consapevoli dei vincoli entro cui operano e delle ipotesi che la dirigenza dell’azienda sta facendo.
Apprendimento Automatico e Intelligenza Artificiale
L’apprendimento automatico e altri algoritmi e modelli di intelligenza artificiale sono strumenti utilizzati dagli scienziati dei dati per analizzare i dati, identificare modelli all’interno dei dati, discernere le relazioni tra variabili e prevedere eventi futuri.
Scienza dei Dati Tradizionale vs. Scienza dei Big Data
Man mano che i metodi di raccolta dei dati sono diventati più sofisticati e le banche dati più grandi, è emersa una differenza tra la scienza dei dati tradizionale e la “scienza dei big data”.
L’analisi dei dati tradizionale e la scienza dei dati vengono eseguite con analisi descrittive e esplorative, con l’obiettivo di trovare modelli e analizzare i risultati delle prestazioni dei progetti. I metodi di analisi dei dati tradizionali spesso si concentrano solo sui dati passati e attuali. Gli analisti dei dati di solito si occupano di dati che sono già stati puliti e standardizzati, mentre gli scienziati dei dati di solito si occupano di dati complessi e “sporchi”. Le tecniche di analisi dei dati più avanzate potrebbero essere utilizzate per prevedere il comportamento futuro, anche se ciò viene fatto più spesso con i big data, poiché i modelli predittivi spesso richiedono grandi quantità di dati per essere costruiti in modo affidabile.
“I big data” si riferiscono a dati che sono troppo grandi e complessi per essere gestiti con tecniche e strumenti di analisi e scienza dei dati tradizionali. I big data vengono spesso raccolti attraverso piattaforme online e vengono utilizzati strumenti di trasformazione dei dati avanzati per rendere le grandi quantità di dati pronte per l’ispezione da parte della scienza dei dati. Man mano che vengono raccolti più dati, più del lavoro di uno scienziato dei dati consiste nell’analisi dei big data.
Strumenti della Scienza dei Dati
Gli strumenti comuni della scienza dei dati includono strumenti per archiviare i dati, eseguire l’analisi dei dati esplorativa, modellare i dati, eseguire l’ETL e visualizzare i dati. Piattaforme come Amazon (AMZN ) Web Services, Microsoft Azure e Google Cloud offrono strumenti per aiutare gli scienziati dei dati ad archiviare, trasformare, analizzare e modellare i dati. Esistono anche strumenti di scienza dei dati autonomi come Airflow (infrastruttura dei dati) e Tableau (visualizzazione e analisi dei dati).
In termini di algoritmi di apprendimento automatico e intelligenza artificiale utilizzati per modellare i dati, vengono spesso forniti attraverso moduli e piattaforme di scienza dei dati come TensorFlow, PyTorch e Azure Machine Learning Studio. Queste piattaforme consentono agli scienziati dei dati di apportare modifiche ai propri set di dati, comporre architetture di apprendimento automatico e addestrare modelli di apprendimento automatico.
Altri strumenti comuni di scienza dei dati e librerie includono SAS (per la modellazione statistica), Apache Spark (per l’analisi dei dati in streaming), D3.js (per visualizzazioni interattive nel browser) e Jupyter (per blocchi di codice interattivi e condivisibili e visualizzazioni).

Foto: Seonjae Jo via Flickr, CC BY SA 2.0 (https://www.flickr.com/photos/130860834@N02/19786840570)
Esempi di Scienza dei Dati
Gli esempi di scienza dei dati e delle sue applicazioni sono ovunque. La scienza dei dati ha applicazioni in tutto, dalla consegna di cibo, agli sport, al traffico e alla salute. I dati sono ovunque e quindi la scienza dei dati può essere applicata a tutto.
In termini di cibo, Uber sta investendo in un’estensione del proprio sistema di condivisione di passaggi per la consegna di cibo, Uber Eats. Uber Eats deve consegnare il cibo alle persone in modo tempestivo, mentre è ancora caldo e fresco. Affinché ciò accada, gli scienziati dei dati dell’azienda devono utilizzare la modellazione statistica che tiene conto di aspetti come la distanza tra i ristoranti e i punti di consegna, le festività, il tempo di cottura e persino le condizioni meteorologiche, considerati tutti con l’obiettivo di ottimizzare i tempi di consegna.
Le statistiche sportive vengono utilizzate dai manager di squadra per determinare quali sono i migliori giocatori e formare squadre forti e affidabili che possano vincere partite. Un esempio notevole è la scienza dei dati documentata da Michael Lewis nel libro Moneyball, dove il direttore generale della squadra degli Oakland Athletics ha analizzato una serie di statistiche per identificare giocatori di qualità che potevano essere firmati dalla squadra a un costo relativamente basso.
L’analisi dei modelli di traffico è fondamentale per la creazione di veicoli autonomi. I veicoli autonomi devono essere in grado di prevedere l’attività intorno a loro e rispondere ai cambiamenti nelle condizioni stradali, come la distanza di arresto richiesta quando piove, nonché la presenza di più auto sulla strada durante l’ora di punta. Oltre ai veicoli autonomi, app come Google Maps analizzano i modelli di traffico per dire ai pendolari quanto tempo ci vuole per raggiungere la propria destinazione utilizzando vari percorsi e mezzi di trasporto.
In termini di scienza dei dati sanitari, la visione artificiale viene spesso combinata con l’apprendimento automatico e altre tecniche di intelligenza artificiale per creare classificatori di immagini in grado di esaminare cose come radiografie, FMRIs e ultrasuoni per vedere se ci sono problemi medici potenziali che potrebbero essere rilevati nel referto. Questi algoritmi possono essere utilizzati per aiutare i clinici a diagnosticare le malattie.
In definitiva, la scienza dei dati copre numerose attività e riunisce aspetti di diverse discipline. Tuttavia, la scienza dei dati è sempre preoccupata di raccontare storie coinvolgenti e interessanti a partire dai dati e di utilizzare i dati per comprendere meglio il mondo.












