Συνεντεύξεις
Αμί Στάιερ, Αρχισυντάκτρια Μηχανικής Μάθησης στο Gretel.ai – Σειρά Συνεντεύξεων

Η Αμί Στάιερ είναι η Αρχισυντάκτρια Μηχανικής Μάθησης στο Gretel.ai, την πιο προηγμένη πλατφόρμα μηχανικής μάθησης για την προστασία της ιδιωτικής ζωής. Το Gretel κάνει εύκολη την ενσωμάτωση της προστασίας της ιδιωτικής ζωής με 설계 στοιχείων της τεχνολογίας. Οι βιβλιοθήκες του AI, ανοιχτού κώδικα, είναι σχεδιασμένες για τη μετατροπή, την ανωνυμοποίηση και τη σύνθεση ευαίσθητων πληροφοριών.
Η Αμί είναι μια εξαιρετικά επιτυχημένη επιστήμονας μηχανικής μάθησης και δεδομένων με περισσότερες από 20 χρόνια εμπειρίας. Η αγάπη της είναι τα μεγάλα δεδομένα και η ανακάλυψη της κρυφής νοημοσύνης μέσα σε αυτά, χρησιμοποιώντας τεχνικές από τη μηχανική μάθηση, την εξόρυξη δεδομένων, την τεχνητή νοημοσύνη και την στατιστική. Είναι εξαιρετικά ικανή στη προβλεπτική μοντελοποίηση, την ταξινόμηση, την ομαδοποίηση, την ανίχνευση ανωμαλιών, την οπτική αναπαράσταση δεδομένων, τις μεθόδους συνδυασμού, την ανάκτηση πληροφοριών, την κυβερνοασφάλεια, την επεξεργασία φυσικής γλώσσας, τα μοντέλα συστάσεων και την ανάλυση συμπεριφοράς χρηστών.
Τι σας έκανε να ακολουθήσετε μια καριέρα στην επιστήμη των υπολογιστών και τη μηχανική μάθηση;
Η αγάπη μου για τα δεδομένα. Η δύναμη, το μυστήριο, η ενθάρρυνση και η δυνατότητα των δεδομένων με έχουν πάντα ενθουσιάσει. Η επιστήμη των υπολογιστών και η μηχανική μάθηση είναι εργαλεία για την αξιοποίηση αυτής της δυνατότητας. Είναι επίσης πολύ διασκεδαστικό να εργάζεστε σε ένα πεδίο όπου η τεχνολογία εξελίσσεται τόσο γρήγορα. Μου αρέσει η τομή της έρευνας και του προϊόντος. Είναι πολύ ικανοποιητικό να πάρεις ιδέες από την αιχμή της τεχνολογίας, να τις ωθήσεις немного παραπέρα και στη συνέχεια να τις μετατρέψεις για να ταιριάζουν στις υπάρχουσες, ορατές ανάγκες του προϊόντος.
Για τους αναγνώστες που δεν είναι εξοικειωμένοι, θα μπορούσατε να εξηγήσετε τι είναι τα συνθετικά δεδομένα;
Τα συνθετικά δεδομένα είναι δεδομένα που μοιάζουν και συμπεριφέρονται όπως τα πρωτότυπα δεδομένα, αλλά είναι επίσης αρκετά διαφορετικά ώστε να ικανοποιούν κάποια περίπτωση χρήσης. Η πιο συνηθισμένη περίπτωση χρήσης είναι η ανάγκη για προστασία της ιδιωτικής ζωής των πληροφοριών στα πρωτότυπα δεδομένα. Μια άλλη περίπτωση χρήσης είναι η ανάγκη για δημιουργία επιπλέον δεδομένων για αύξηση του μεγέθους του πρωτοτύπου συνόλου δεδομένων. Μια άλλη περίπτωση χρήσης είναι η βοήθεια στην αντιμετώπιση μιας ταξινόμησης ή μιας δημογραφικής προκατάληψης στο πρωτότυπο σύνολο δεδομένων.
Τα συνθετικά δεδομένα μας επιτρέπουν να συνεχίσουμε την ανάπτυξη νέων και καινοτόμων προϊόντων και λύσεων όταν τα απαραίτητα δεδομένα δεν θα ήταν διαθέσιμα.
Πώς λειτουργεί η πλατφόρμα Gretel για τη δημιουργία συνθετικών δεδομένων μέσω API;
Τα API της Gretel για την προστασία της ιδιωτικής ζωής επιτρέπουν την εισαγωγή δεδομένων στη Gretel και την εξέταση των δεδομένων που μπορούμε να εξάγουμε. Αυτά είναι τα ίδια API που χρησιμοποιούνται από το Console μας. Εξοπλίζοντας τα API με μια διεπαφή, ελπίζουμε να ενδυναμώσουμε τους développers και τους επιστήμονες δεδομένων να δημιουργήσουν τις δικές τους διαδικασίες γύρω από τη Gretel.
Ενώ το Console κάνει την δημιουργία συνθετικών δεδομένων πολύ εύκολη, τα API επιτρέπουν την ενσωμάτωση της δημιουργίας συνθετικών δεδομένων στη διαδικασία σας. Μου αρέσει να χρησιμοποιώ τα API επειδή μου επιτρέπουν να προσαρμόσω τη δημιουργία συνθετικών δεδομένων σε μια πολύ συγκεκριμένη περίπτωση χρήσης.
Θα μπορούσατε να συζητήσετε κάποια από τα εργαλεία που προσφέρονται από τη Gretel για να βοηθήσουν στην αξιολόγηση της ποιότητας των συνθετικών δεδομένων;
Μετά τη δημιουργία συνθετικών δεδομένων, η Gretel θα δημιουργήσει einen Synthetic Report. Σε αυτό το αναφορά, μπορείτε να δείτε το Synthetic Data Quality Score (SQS), καθώς και ένα βαθμό προστασίας της ιδιωτικής ζωής (PPL).
Ο SQS είναι μια εκτίμηση του πόσο καλά τα γεννημένα συνθετικά δεδομένα διατηρούν τις ίδιες στατιστικές ιδιότητες όπως το πρωτότυπο σύνολο δεδομένων. Σε αυτό το πλαίσιο, ο SQS μπορεί να θεωρηθεί ως ένας δείκτης χρησιμότητας ή एक δείκτης εμπιστοσύνης για το αν οι επιστημονικές συμπεράσματα που εξάγονται από το συνθετικό σύνολο δεδομένων θα ήταν τα ίδια αν χρησιμοποιούσατε το πρωτότυπο σύνολο δεδομένων.
Ο Synthetic Data Quality Score υπολογίζεται συνδυάζοντας τα ατομικά μέτρα ποιότητας: Σταθερότητα κατανομής πεδίου, Σταθερότητα συσχετίσεων πεδίου και Βαθιά σταθερότητα δομής.
Η σταθερότητα κατανομής πεδίου είναι ένα μέτρο του πόσο καλά τα συνθετικά δεδομένα διατηρούν τις ίδιες κατανομές πεδίου όπως στο πρωτότυπο δεδομένα. Η σταθερότητα συσχετίσεων πεδίου είναι ένα μέτρο του πόσο καλά οι συσχετίσεις μεταξύ πεδίων διατηρούνται στα συνθετικά δεδομένα. Και τελικά, η βαθιά σταθερότητα δομής μετρά την στατιστική ακεραιότητα των βαθιών, πολλαπλών πεδίων κατανομών και συσχετίσεων. Για να εκτιμήσουμε αυτό, η Gretel συγκρίνει μια ανάλυση κύριων συνιστωσών (PCA) που υπολογίζεται πρώτα στο πρωτότυπο δεδομένα και στη συνέχεια στα συνθετικά δεδομένα.
Πώς λειτουργούν οι φίλτροι προστασίας της ιδιωτικής ζωής της Gretel;
Οι φίλτροι προστασίας της ιδιωτικής ζωής της Gretel ήταν το αποτέλεσμα πολλής έρευνας για τη φύση των αντιπαλών επιθέσεων στα συνθετικά δεδομένα. Οι φίλτροι προστασίας της ιδιωτικής ζωής εμποδίζουν τη δημιουργία συνθετικών δεδομένων με αδυναμίες που εκμεταλλεύονται οι αντιπάλες. Έχουμε δύο φίλτρα προστασίας της ιδιωτικής ζωής, το πρώτο είναι το φίλτρο ομοιότητας και το δεύτερο είναι το φίλτρο εκκεντρικότητας. Το φίλτρο ομοιότητας εμποδίζει τη δημιουργία συνθετικών εγγραφών που είναι υπερβολικά παρόμοιες με μια εγγραφή εκπαίδευσης. Αυτές είναι οι κύριες στόχοι των αντιπάλων που επιδιώκουν να αποκτήσουν γνώσεις για τα πρωτότυπα δεδομένα. Το δεύτερο φίλτρο προστασίας της ιδιωτικής ζωής είναι το φίλτρο εκκεντρικότητας. Αυτό εμποδίζει τη δημιουργία συνθετικών εγγραφών που θα θεωρούνταν εκκεντρικές στο χώρο που ορίζεται από τα δεδομένα εκπαίδευσης. Οι εκκεντρικές εγγραφές που αποκαλύπτονται σε ένα συνθετικό σύνολο δεδομένων μπορούν να εκμεταλλευτούν από επιθέσεις αναγνώρισης μελών, επιθέσεις αναγνώρισης ιδιοτήτων και πολλές άλλες αντιπαλές επιθέσεις. Είναι ένα σοβαρό ρίσκο για την προστασία της ιδιωτικής ζωής.
Πώς μπορούν τα συνθετικά δεδομένα να βοηθήσουν στη μείωση της προκατάληψης του AI;
Η πιο συνηθισμένη τεχνική είναι να αντιμετωπίσουμε την προκατάληψη αναπαράστασης των δεδομένων που τροφοδοτούν ένα σύστημα AI. Για παράδειγμα, αν υπάρχει μια ισχυρή ταξινόμηση των δεδομένων ή μια δημογραφική προκατάληψη στα δεδομένα, η Gretel προσφέρει εργαλεία για να βοηθήσουν πρώτα να μετρήσουμε την ανισότητα και στη συνέχεια να την επιλύσουμε στα συνθετικά δεδομένα. Αφαιρώντας την προκατάληψη από τα δεδομένα, συχνά αφαιρούμε επίσης την προκατάληψη από το σύστημα AI που βασίζεται στα δεδομένα.
Εσείς rõρα σας αρέσει να μάθετε για νέες τεχνολογίες μηχανικής μάθησης, πώς διατηρείτε τις γνώσεις σας;
Διαβάζω, διαβάζω και στη συνέχεια διαβάζω ακόμα περισσότερο! Μου αρέσει να ξεκινάω την ημέρα μου διαβάζοντας για νέες τεχνολογίες μηχανικής μάθησης. Το Medium με γνωρίζει πολύ καλά. Μου αρέσει να διαβάζω άρθρα στο Towards Data Science, Analytics Vidhya και newsletters όπως The Sequence. Facebook (META ) AI, Google (GOOGL ) AI και OpenMined έχουν εξαιρετικά blogs. Υπάρχουν πολλά καλά συνέδρια να ακολουθήσετε, όπως NeurIPS, ICML, ICLR, AISTATS.
Μου αρέσει επίσης να χρησιμοποιώ εργαλεία που παρακολουθούν τις αναφορές εικασιών, βοηθούν να βρείτε άρθρα παρόμοια με αυτά που σας αρέσουν και που μαθαίνουν τα συγκεκριμένα ενδιαφέροντά σας και είναι πάντα σε αναμονή για ένα άρθρο που μπορεί να σας ενδιαφέρει. Το Zeta Alpha είναι ένα τέτοιο εργαλείο που χρησιμοποιώ πολύ.
Τέλος, δεν μπορείτε να υποτιμήσετε το όφελος από το να έχετε συναδέλφους με παρόμοια ενδιαφέροντα. Στη Gretel, η ομάδα μηχανικής μάθησης παρακολουθεί έρευνες σχετικές με τα πεδία που εξερευνούμε και συχνά συναντιόμαστε για να συζητήσουμε ενδιαφέροντα άρθρα.
Τι είναι η όρασή σας για το μέλλον της μηχανικής μάθησης;
Η εύκολη πρόσβαση στα δεδομένα θα ξεκινήσει μια μεγάλη εποχή καινοτομίας στη μηχανική μάθηση, η οποία στη συνέχεια θα ωθήσει την καινοτομία σε ένα ευρύ φάσμα πεδίων, όπως η υγεία, η οικονομία, η βιομηχανία και οι βιοεπιστήμες. Ιστορικά, πολλές σημαντικές προόδους στη μηχανική μάθηση μπορούν να αποδοθούν σε ένα μεγάλο όγκο πλουσιών δεδομένων. Ωστόσο, ιστορικά, πολλές έρευνες έχουν εμποδιστεί από την αδυναμία να αποκτήσουν ή να μοιράσουν δεδομένα λόγω προβλημάτων προστασίας της ιδιωτικής ζωής. Όπως εργαλεία όπως η Gretel αφαιρούν αυτό το εμπόδιο, η πρόσβαση στα δεδομένα θα δημοκρατιστεί. Η整η κοινότητα της μηχανικής μάθησης θα ωφεληθεί από την πρόσβαση σε πλούσια, μεγάλα σύνολα δεδομένων, αντί για μερικές ελίτ εταιρείες.
Υπάρχει κάτι άλλο που θα ήθελε να μοιραστείτε σχετικά με τη Gretel;
Αν σας αρέσουν τα δεδομένα, θα αγαπήσετε τη Gretel (και φυσικά, εγώ την αγαπώ!). Η εύκολη πρόσβαση στα δεδομένα έχει sido το άγκιστρο στο πλευρό κάθε επιστήμονα δεδομένων που έχω γνωρίσει. Στη Gretel, είμαστε υπερήφανοι που έχουμε δημιουργήσει μια κονσόλα και ένα σύνολο API που κάνουν τη δημιουργία ιδιωτικών, μοιραζόμενων δεδομένων τόσο απλή όσο είναι δυνατό. Πιστεύουμε βαθιά ότι τα δεδομένα είναι πιο πολύτιμα όταν μοιράζονται.
Ευχαριστούμε για τη μεγάλη συνέντευξη και για το μοιρασμό των εντυπώσεων σας, αναγνώστες που επιθυμούν να μάθουν περισσότερα πρέπει να επισκεφθούν Gretel.ai.












