Βασικές αρχές της AI

Τι είναι η Επιστήμη των Δεδομένων;

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Το πεδίο της επιστήμης των δεδομένων φαίνεται να μεγαλώνει και να γίνεται πιο δημοφιλές κάθε μέρα. Σύμφωνα με το LinkedIn, η επιστήμη των δεδομένων ήταν ένα από τα ταχύτερα αναπτυσσόμενα επαγγέλματα το 2017 και το 2020 η Glassdoor κατέταξε την εργασία της επιστήμης των δεδομένων ως μία από τις τρεις καλύτερες εργασίες στις Ηνωμένες Πολιτείες. Δεδομένου του αυξανόμενου ενδιαφέροντος για την επιστήμη των δεδομένων, δεν είναι έκπληξη που περισσότεροι άνθρωποι ενδιαφέρονται για το πεδίο. Ωστόσο, τι είναι ακριβώς η επιστήμη των δεδομένων;

Ας γνωρίσουμε την επιστήμη των δεδομένων, passing κάποιο χρόνο για να ορίσουμε την επιστήμη των δεδομένων, να εξερευνήσουμε πώς τα μεγάλα δεδομένα και η τεχνητή νοημοσύνη αλλάζουν το πεδίο, να μάθουμε για κάποια κοινά εργαλεία επιστήμης των δεδομένων και να εξετάσουμε κάποια παραδείγματα επιστήμης των δεδομένων.

Τι είναι η Επιστήμη των Δεδομένων;

Πριν εξερευνήσουμε οποιοδήποτε εργαλείο επιστήμης των δεδομένων ή παράδειγμα, θα θέλαμε να λάβουμε μια συνοπτική ορισμό της επιστήμης των δεδομένων.

Ο ορισμός του “επιστήμης των δεδομένων” είναι στην πραγματικότητα немного δύσκολος, επειδή ο όρος εφαρμόζεται σε πολλές διαφορετικές εργασίες και μεθόδους ερεύνης και ανάλυσης. Μπορούμε να αρχίσουμε υπενθυμίζοντας τι σημαίνει ο όρος “επιστήμη”. Η επιστήμη είναι η συστηματική μελέτη του φυσικού και φυσικού κόσμου μέσω της παρατήρησης και του πειράματος, με στόχο την προώθηση της ανθρώπινης κατανόησης των φυσικών διαδικασιών. Τα σημαντικά λόγια σε αυτήν την ορισμό είναι “παρατήρηση” και “κατανόηση”.

Εάν η επιστήμη των δεδομένων είναι η διαδικασία κατανόησης του κόσμου από τα πρότυπα στα δεδομένα, τότε η ευθύνη ενός επιστήμονα δεδομένων είναι να μετατρέψει τα δεδομένα, να αναλύσει τα δεδομένα και να εξάγει πρότυπα από τα δεδομένα. Με άλλα λόγια, ένας επιστήμονας δεδομένων παρέχεται με δεδομένα και χρησιμοποιεί μια σειρά από διαφορετικά εργαλεία και τεχνικές για να προετοιμάσει τα δεδομένα (να τα κάνει έτοιμα για ανάλυση) και στη συνέχεια να αναλύσει τα δεδομένα για σημαντικά πρότυπα.

Ο ρόλος ενός επιστήμονα δεδομένων είναι παρόμοιος με τον ρόλο ενός παραδοσιακού επιστήμονα. Και οι δύο ασχολούνται με την ανάλυση των δεδομένων για να υποστηρίξουν ή να απορρίψουν υποθέσεις σχετικά με τον τρόπο λειτουργίας του κόσμου, προσπαθώντας να κατανοήσουν τα πρότυπα στα δεδομένα για να βελτιώσουν την κατανόησή μας για τον κόσμο. Οι επιστήμονες δεδομένων χρησιμοποιούν τις ίδιες επιστημονικές μεθόδους που χρησιμοποιεί ένας παραδοσιακός επιστήμονας. Ένας επιστήμονας δεδομένων αρχίζει συλλέγοντας παρατηρήσεις για κάποιο φαινόμενο που θα ήθελε να μελετήσει. Στη συνέχεια, διαμορφώνει μια υπόθεση για το φαινόμενο και προσπαθεί να βρει δεδομένα που να αναιρούν την υπόθεση του με κάποιο τρόπο.

Εάν η υπόθεση δεν αναιρείται από τα δεδομένα, μπορεί να κατασκευάσει μια θεωρία ή μοντέλο για το πώς λειτουργεί το φαινόμενο, το οποίο μπορεί να δοκιμαστεί ξανά και ξανά για να δει αν ισχύει για άλλα παρόμοια σύνολα δεδομένων. Εάν ένα μοντέλο είναι αρκετά robust, εάν εξηγεί τα πρότυπα καλά και δεν αναιρείται κατά τη διάρκεια άλλων δοκιμών, μπορεί ακόμη και να χρησιμοποιηθεί για να προβλέψει μελλοντικές εμφανίσεις του φαινομένου.

Ένας επιστήμονας δεδομένων συνήθως δεν συλλέγει τα δικά του δεδομένα μέσω ενός πειράματος. Δεν σχεδιάζει πειράματα με ελέγχους και διπλά τυφλά δοκιμασίες για να ανακαλύψει παρεμβατικές μεταβλητές που μπορεί να επηρεάσουν μια υπόθεση. Τα περισσότερα δεδομένα που αναλύονται από einen επιστήμονα δεδομένων θα ληφθούν μέσω παρατηρητικών μελετών και συστημάτων, το οποίο είναι ένας τρόπος με τον οποίο η δουλειά ενός επιστήμονα δεδομένων μπορεί να διαφέρει από την δουλειά ενός παραδοσιακού επιστήμονα, ο οποίος έχει την τάση να εκτελεί περισσότερα πειράματα.

Ωστόσο, ένας επιστήμονας δεδομένων μπορεί να καλεστεί να κάνει的一種 πειραματισμός που ονομάζεται A/B testing όπου γίνονται μικρές αλλαγές σε ένα σύστημα που συλλέγει δεδομένα για να δει πώς αλλάζουν τα πρότυπα στα δεδομένα.

Ανεξάρτητα από τις τεχνικές και τα εργαλεία που χρησιμοποιούνται, η επιστήμη των δεδομένων στοχεύει τελικά να βελτιώσει την κατανόησή μας για τον κόσμο, κάνοντας νόημα από τα δεδομένα, και τα δεδομένα λαμβάνονται μέσω παρατήρησης και πειράματος. Η επιστήμη των δεδομένων είναι η διαδικασία χρήσης αλγορίθμων, στατιστικών αρχών και διαφόρων εργαλείων και μηχανών για να εξάγει ερευνες από τα δεδομένα, ερευνες που μας βοηθούν να κατανοήσουμε τα πρότυπα στον κόσμο γύρω μας.

Τι κάνουν οι Επιστήμονες Δεδομένων;

Μπορείτε να δείτε ότι οποιαδήποτε δραστηριότητα που εμπλέκει την ανάλυση δεδομένων με επιστημονικό τρόπο μπορεί να ονομάζεται επιστήμη δεδομένων, το οποίο είναι μέρος του λόγου για τον οποίο ο ορισμός της επιστήμης των δεδομένων είναι τόσο δύσκολος. Για να το κάνουμε πιο σαφές, ας εξερευνήσουμε κάποιες από τις δραστηριότητες που μπορεί να κάνει ένας επιστήμονας δεδομένων σε μια καθημερινή βάση.

Η επιστήμη των δεδομένων φέρνει μαζί πολλά διαφορετικά πεδία και ειδικότητες. Φωτογραφία: Calvin Andrus via Wikimeedia Commons, CC BY SA 3.0 (https://commons.wikimedia.org/wiki/File:DataScienceDisciplines.png)

Σε οποιαδήποτε δεδομένη ημέρα, ένας επιστήμονας δεδομένων μπορεί να ζητηθεί να: δημιουργήσει σχήματα αποθήκευσης και ανάκτησης δεδομένων, δημιουργήσει管道 ETL (εξαγωγή, μετασχηματισμός, φόρτωση) και καθαρίσει τα δεδομένα, να χρησιμοποιήσει στατιστικές μεθόδους, να δημιουργήσει οπτικοποιήσεις δεδομένων και πίνακες ελέγχου, να εφαρμόσει αλγόριθμους τεχνητής νοημοσύνης και μηχανικής μάθησης, να κάνει συστάσεις για δράσεις με βάση τα δεδομένα.

Ας τα σπάσουμε τα παραπάνω καθήκοντα λίγο.

Ένας επιστήμονας δεδομένων μπορεί να απαιτείται να χειριστεί την εγκατάσταση των τεχνολογιών που χρειάζονται για την αποθήκευση και ανάκτηση δεδομένων, με προσοχή και στο υλικό και στο λογισμικό. Ο άνθρωπος που είναι υπεύθυνος για αυτήν τη θέση μπορεί επίσης να ονομάζεται “Data Engineer“. Ωστόσο, κάποιες εταιρείες περιλαμβάνουν αυτές τις ευθύνες κάτω από τον ρόλο των επιστημόνων δεδομένων. Ένας επιστήμονας δεδομένων μπορεί επίσης να χρειαστεί να δημιουργήσει, ή να βοηθήσει στη δημιουργία, ETL pipelines. Τα δεδομένα σπάνια έρχονται σε μορφή που ένας επιστήμονας δεδομένων χρειάζεται. Αντίθετα, τα δεδομένα θα χρειαστεί να ληφθούν σε μια ακατέργαστη μορφή από την πηγή δεδομένων, να μετασχηματιστούν σε eine μορφή που μπορεί να χρησιμοποιηθεί, και να προετοιμαστούν (πράγματα όπως η τυποποίηση των δεδομένων, η διαγραφή των ανακρίβειων δεδομένων και η αφαίρεση των ελαττωματικών δεδομένων).

Στατιστικές Μέθοδοι της Επιστήμης Δεδομένων

Η εφαρμογή της στατιστικής είναι απαραίτητη για να μετατρέψει την απλή παρατήρηση δεδομένων και την ερμηνεία τους σε μια πραγματική επιστήμη. Οι στατιστικές μέθοδοι χρησιμοποιούνται για να εξάγουν σχετικά πρότυπα από σύνολα δεδομένων, και ένας επιστήμονας δεδομένων πρέπει να είναι καλά ενημερωμένος στις στατιστικές έννοιες. Πρέπει να είναι σε θέση να διακρίνει σημαντικές συσχετίσεις από ψευδείς συσχετίσεις ελέγχοντας τις παρεμβατικές μεταβλητές. Πρέπει επίσης να γνωρίζει ποια εργαλεία να χρησιμοποιήσει για να καθορίσει ποια χαρακτηριστικά του συνόλου δεδομένων είναι σημαντικά για το μοντέλο/έχουν προβλεπτική δύναμη. Ένας επιστήμονας δεδομένων πρέπει να γνωρίζει πότε να χρησιμοποιήσει μια регрессιακή προσέγγιση και πότε να φροντίσει για το μέσο ενός δείγματος και πότε για τη μέση τιμή του δείγματος. Ένας επιστήμονας δεδομένων απλά δεν θα ήταν επιστήμονας χωρίς αυτές τις κρίσιμες δεξιότητες.

Οπτικοποίηση Δεδομένων

Ένα κρίσιμο μέρος της δουλειάς ενός επιστήμονα δεδομένων είναι η επικοινωνία των ευρημάτων του σε άλλους. Εάν ένας επιστήμονας δεδομένων δεν μπορεί να επικοινωνήσει αποτελεσματικά τα ευρήματά του σε άλλους, τότε οι επιπτώσεις των ευρημάτων του δεν έχουν σημασία. Ένας επιστήμονας δεδομένων πρέπει να είναι ένας αποτελεσματικός αφηγητής ιστοριών. Αυτό σημαίνει την παραγωγή οπτικοποιήσεων που επικοινωνούν σχετικά σημεία για το σύνολο δεδομένων και τα πρότυπα που ανακαλύφθηκαν μέσα σε αυτό. Υπάρχει ένας μεγάλος αριθμός διαφορετικών εργαλείων οπτικοποίησης δεδομένων που ένας επιστήμονας δεδομένων μπορεί να χρησιμοποιήσει, και μπορεί να οπτικοποιήσει δεδομένα για τους σκοπούς της αρχικής, βασικής εξερεύνησης (εξερεύνηση δεδομένων) ή να οπτικοποιήσει τα αποτελέσματα που παράγει ένα μοντέλο.

Συστασεις και Εφαρμογές Επιχειρήσεων

Ένας επιστήμονας δεδομένων πρέπει να έχει κάποια直覺 για τις απαιτήσεις και τους στόχους της οργάνωσής του ή της επιχείρησής του. Ένας επιστήμονας δεδομένων πρέπει να κατανοήσει αυτά τα πράγματα επειδή πρέπει να γνωρίζει ποια είδη μεταβλητών και χαρακτηριστικών πρέπει να αναλύσει, εξερευνώντας πρότυπα που θα βοηθήσουν την οργάνωσή του να επιτύχει τους στόχους της. Οι επιστήμονες δεδομένων πρέπει να είναι ενήμεροι για τις περιορισμούς υπό τους οποίους λειτουργούν και τις υποθέσεις που η ηγεσία της οργάνωσης κάνει.

Μηχανική Μάθηση και Τεχνητή Νοημοσύνη

Η μηχανική μάθηση και άλλοι αλγόριθμοι και μοντέλα τεχνητής νοημοσύνης είναι εργαλεία που χρησιμοποιούνται από επιστήμονες δεδομένων για να αναλύσουν δεδομένα, να ανακαλύψουν σχέσεις μεταξύ μεταβλητών και να κάνουν προβλέψεις για μελλοντικά γεγονότα.

Παραδοσιακή Επιστήμη Δεδομένων vs. Μεγάλη Επιστήμη Δεδομένων

Όπως οι μεθόδους συλλογής δεδομένων έχουν γίνει πιο εξελιγμένες και οι βάσεις δεδομένων μεγαλύτερες, μια διαφορά έχει προκύψει μεταξύ της παραδοσιακής επιστήμης δεδομένων και της “μεγάλης” επιστήμης δεδομένων.

Η παραδοσιακή ανάλυση δεδομένων και η επιστήμη δεδομένων γίνεται με περιγραφική και εξερευνητική ανάλυση, με στόχο να βρει πρότυπα και να αναλύσει τα αποτελέσματα των έργων. Οι παραδοσιακές μεθόδους ανάλυσης δεδομένων συχνά εστιάζουν μόνο στα δεδομένα του παρελθόντος και του παρόντος. Οι αναλυτές δεδομένων συχνά ασχολούνται με δεδομένα που έχουν ήδη καθαριστεί και τυποποιηθεί, ενώ οι επιστήμονες δεδομένων συχνά ασχολούνται με σύνθετα και ακατέργαστα δεδομένα. Περισσότερες προηγμένες μεθόδους ανάλυσης δεδομένων και επιστήμης δεδομένων μπορεί να χρησιμοποιηθούν για να προβλέψουν μελλοντική συμπεριφορά, αν και αυτό γίνεται πιο συχνά με μεγάλα δεδομένα, поскольку τα προβλεπτικά μοντέλα συχνά χρειάζονται μεγάλες ποσότητες δεδομένων για να κατασκευαστούν με αξιόπιστο τρόπο.

“Μεγάλα δεδομένα” αναφέρονται σε δεδομένα που είναι πολύ μεγάλα και σύνθετα για να χειριστούν με παραδοσιακές μεθόδους ανάλυσης και επιστήμης δεδομένων. Τα μεγάλα δεδομένα συλλέγονται συχνά μέσω διαδικτυακών πλατφορμών και χρησιμοποιούνται προηγμένα εργαλεία μετασχηματισμού δεδομένων για να κάνουν τις μεγάλες ποσότητες δεδομένων έτοιμες για επιθεώρηση από την επιστήμη δεδομένων. Όσο περισσότερα δεδομένα συλλέγονται, τόσο περισσότερο από την δουλειά ενός επιστήμονα δεδομένων ασχολείται με την ανάλυση μεγάλων δεδομένων.

Εργαλεία Επιστήμης Δεδομένων

Κοινά εργαλεία επιστήμης δεδομένων περιλαμβάνουν εργαλεία για την αποθήκευση δεδομένων, την εκτέλεση εξερευνητικής ανάλυσης δεδομένων, την μοντελοποίηση δεδομένων, την εκτέλεση ETL και την οπτικοποίηση δεδομένων. Πλατφόρμες όπως το Amazon Web Services, το Microsoft Azure και το Google Cloud προσφέρουν εργαλεία για να βοηθήσουν τους επιστήμονες δεδομένων να αποθηκεύσουν, να μετασχηματίσουν, να αναλύσουν και να μοντελοποιήσουν δεδομένα. Υπάρχουν επίσης αυτόνομα εργαλεία επιστήμης δεδομένων όπως το Airflow (υфраструкτούρα δεδομένων) και το Tableau (οπτικοποίηση και ανάλυση δεδομένων).

Όσον αφορά τους αλγόριθμους μηχανικής μάθησης και τεχνητής νοημοσύνης που χρησιμοποιούνται για να μοντελοποιήσουν δεδομένα, αυτά παρέχονται συχνά μέσω των μονάδων και πλατφορμών επιστήμης δεδομένων όπως το TensorFlow, το PyTorch και το Azure Machine-learning studio. Αυτές οι πλατφόρμες επιτρέπουν στους επιστήμονες δεδομένων να κάνουν επεξεργασίες στα σύνολα δεδομένων, να συνθέτουν αρχιτεκτονικές μηχανικής μάθησης και να εκπαιδεύουν μοντέλα μηχανικής μάθησης.

Άλλα κοινά εργαλεία και βιβλιοθήκες επιστήμης δεδομένων περιλαμβάνουν το SAS (για στατιστική μοντελοποίηση), το Apache Spark (για την ανάλυση δεδομένων ροής), το D3.js (για διαδραστικές οπτικοποιήσεις στο πρόγραμμα περιήγησης) και το Jupyter (για διαδραστικά, κοινά τμήματα κώδικα και οπτικοποιήσεις).

Φωτογραφία: Seonjae Jo via Flickr, CC BY SA 2.0 (https://www.flickr.com/photos/130860834@N02/19786840570)

Παραδείγματα Επιστήμης Δεδομένων

Παραδείγματα επιστήμης δεδομένων και εφαρμογών τους είναι παντού. Η επιστήμη δεδομένων έχει εφαρμογές σε όλα, από την παράδοση τροφίμων, τον αθλητισμό, την κυκλοφορία και την υγεία. Τα δεδομένα είναι παντού και έτσι η επιστήμη δεδομένων μπορεί να εφαρμοστεί σε όλα.

Όσον αφορά την τροφή, η Uber επενδύει σε μια επέκταση του συστήματος μεταφοράς που επικεντρώνεται στην παράδοση τροφίμων, Uber Eats. Η Uber Eats πρέπει να παραδώσει την τροφή στους ανθρώπους σε ένα χρονικό διάστημα, ενώ είναι ακόμη ζεστή και φρέσκια. Για να συμβεί αυτό, οι επιστήμονες δεδομένων της εταιρείας πρέπει να χρησιμοποιήσουν στατιστική μοντελοποίηση που λαμβάνει υπόψη аспектους όπως η απόσταση από τα εστιατόρια στα σημεία παράδοσης, οι διακοπές, ο χρόνος μαγειρέματος και ακόμη και οι καιρικές συνθήκες, όλα αυτά με στόχο να βελτιώσουν τους χρόνους παράδοσης.

Οι στατιστικές του αθλητισμού χρησιμοποιούνται από τους διευθυντές των ομάδων για να καθορίσουν ποιος είναι ο καλύτερος παίκτης και να σχηματίσουν ισχυρές, αξιόπιστες ομάδες που θα κερδίσουν παιχνίδια. Ένα αξιοσημείωτο παράδειγμα είναι η επιστήμη δεδομένων που τεκμηριώθηκε από τον Michael Lewis στο βιβλίο Moneyball, όπου ο γενικός διευθυντής της ομάδας Oakland Athletics ανέλυσε μια ποικιλία στατιστικών για να ανακαλύψει ποιοτικούς παίκτες που θα μπορούσαν να υπογραφούν στην ομάδα με σχετικά χαμηλό κόστος.

Η ανάλυση των προτύπων κυκλοφορίας είναι κρίσιμη για τη δημιουργία αυτονομών οχημάτων. Αυτονομικά οχήματα πρέπει να είναι σε θέση να προβλέψουν τη δραστηριότητα γύρω τους και να ανταποκριθούν σε αλλαγές στις συνθήκες του δρόμου, όπως η αυξημένη απόσταση σταματήματος που απαιτείται όταν βρέχει, καθώς και την παρουσία περισσότερων αυτοκινήτων στο δρόμο κατά τη διάρκεια της ώρας αιχμής. Πέρα από τα αυτονομικά οχήματα, εφαρμογές όπως το Google Maps αναλύουν τα πρότυπα κυκλοφορίας για να πούν στους κομμωτές πόσο χρόνο θα χρειαστούν για να φτάσουν στον προορισμό τους χρησιμοποιώντας διαφορετικές διαδρομές και μέσα μεταφοράς.

Όσον αφορά την υγεία, η επιστήμη δεδομένων, η επιστήμη δεδομένων συνδυάζεται συχνά με τη μηχανική μάθηση και άλλες τεχνικές τεχνητής νοημοσύνης για να δημιουργήσει ταξινομητές εικόνων που μπορούν να εξετάσουν πράγματα όπως ακτίνες-Χ, ΦΜΡΙ και υπερήχους για να δουν αν υπάρχουν потенτικά ιατρικά προβλήματα που θα μπορούσαν να εμφανιστούν στην σάρωση. Αυτοί οι αλγόριθμοι μπορούν να χρησιμοποιηθούν για να βοηθήσουν τους κλινικούς γιατρούς να διαγνώσουν ασθένειες.

Τελικά, η επιστήμη δεδομένων καλύπτει πολλές δραστηριότητες και φέρνει μαζί аспектους διαφόρων πεδίων. Ωστόσο, η επιστήμη δεδομένων είναι πάντα ασχολημένη με το να λέει ενδιαφέρουσες ιστορίες από δεδομένα και με το να χρησιμοποιεί δεδομένα για να κατανοήσει καλύτερα τον κόσμο.

Blogger και προγραμματιστής με ειδικότητες στα Machine Learning και Deep Learning θέματα. Ο Daniel ελπίζει να βοηθήσει τους άλλους να χρησιμοποιήσουν τη δύναμη του AI για κοινωνικό καλό.