Ηγέτες σκέψης

Πώς η Προκατάληψη Θα Σκοτώσει τη Στρατηγική σας για τον AI/ML και Τι να Κάνετε για Αυτό

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

‘Προκατάληψη’ στα μοντέλα οποιουδήποτε τύπου περιγράφει μια κατάσταση στην οποία το μοντέλο απαντά ανακριβώς σε ερεθίσματα ή δεδομένα εισόδου επειδή δεν έχει εκπαιδευτεί με αρκετά ποιοτικά, διαφορετικά δεδομένα για να παρέχει μια ακριβή απάντηση. Ένα παράδειγμα θα ήταν η λειτουργία ξεκλειδώματος τηλεφώνου με αναγνώριση προσώπου της Apple, η οποία απέτυχε με σημαντικά υψηλότερο ποσοστό για άτομα με σκουρότερο δέρμα σε σύγκριση με άτομα με ανοιχτότερο δέρμα. Το μοντέλο δεν είχε εκπαιδευτεί σε αρκετές εικόνες ατόμων με σκουρότερο δέρμα. Αυτό ήταν ένα σχετικά χαμηλού κινδύνου παράδειγμα προκατάληψης, αλλά είναι ακριβώς το λόγο για τον οποίο ο νόμος της ΕΕ για τον AI έχει θέσει απαιτήσεις για να αποδείξει την αποτελεσματικότητα του μοντέλου (και τον έλεγχο) πριν από την κυκλοφορία στην αγορά. Τα μοντέλα με εξόδους που επηρεάζουν τις επιχειρήσεις, τις финансиες, την υγεία ή τις προσωπικές καταστάσεις πρέπει να είναι αξιόπιστα, ή δεν θα χρησιμοποιηθούν.

Αντιμετώπιση της Προκατάληψης με Δεδομένα

Μεγάλες Ποσότητες Υψηλής Ποιότητας Δεδομένων

Μεταξύ πολλών σημαντικών πρακτικών διαχείρισης δεδομένων, ένας βασικός παράγοντας για την υπέρβαση και την ελαχιστοποίηση της προκατάληψης στα μοντέλα AI/ML είναι η απόκτηση μεγάλων ποσοτήτων υψηλής ποιότητας, διαφορετικών δεδομένων. Αυτό απαιτεί συνεργασία με πολλές οργανώσεις που έχουν τέτοια δεδομένα. Παραδοσιακά, η απόκτηση δεδομένων και οι συνεργασίες αντιμετωπίζονται με προβλήματα προστασίας προσωπικών δεδομένων και/ή πνευματικής ιδιοκτησίας–ευαίσθητα δεδομένα δεν μπορούν να σταλούν στον ιδιοκτήτη του μοντέλου, και ο ιδιοκτήτης του μοντέλου δεν μπορεί να κινδυνεύσει με τη διαρροή της πνευματικής ιδιοκτησίας του σε έναν ιδιοκτήτη δεδομένων. Ένα κοινό γύρο είναι να εργαστείτε με ψευδή ή συνθετικά δεδομένα, τα οποία μπορούν να είναι χρήσιμα, αλλά έχουν επίσης περιορισμούς σε σύγκριση με τη χρήση πραγματικών, πλήρως περιεχομένων δεδομένων. Αυτό είναι το σημείο στο οποίο οι τεχνολογίες ενίσχυσης της προστασίας των δεδομένων (PETs) παρέχουν πολλές απαντήσεις.
Συνθετικά Δεδομένα: Κοντά, αλλά όχι Ακριβώς

Συνθετικά δεδομένα είναι τεχνητά γεννημένα για να μιμούνται πραγματικά δεδομένα. Αυτό είναι δύσκολο να γίνει, αλλά γίνεται ελαφρώς πιο εύκολο με εργαλεία AI. Καλής ποιότητας συνθετικά δεδομένα πρέπει να έχουν τις ίδιες αποστάσεις χαρακτηριστικών με τα πραγματικά δεδομένα, ή δεν θα είναι χρήσιμα. Καλής ποιότητας συνθετικά δεδομένα μπορούν να χρησιμοποιηθούν για να ενισχύσουν αποτελεσματικά την ποικιλία των δεδομένων εκπαίδευσης, συμπληρώνοντας κενά για μικρότερες, περιθωριακές πληθυσμούς, ή για πληθυσμούς που ο πάροχος AI απλώς δεν έχει αρκετά δεδομένα. Συνθετικά δεδομένα μπορούν επίσης να χρησιμοποιηθούν για να αντιμετωπίσουν περιπτώσεις που μπορεί να είναι δύσκολο να βρεθούν σε επαρκείς ποσότητες στον πραγματικό κόσμο. Επιπλέον, οι οργανώσεις μπορούν να γεννήσουν ένα συνθετικό σύνολο δεδομένων για να ικανοποιήσουν απαιτήσεις κατοικίας δεδομένων και προστασίας προσωπικών δεδομένων που μπλοκάρουν την πρόσβαση στα πραγματικά δεδομένα. Αυτό ακούγεται καλό, ωστόσο, τα συνθετικά δεδομένα είναι μόνο ένα κομμάτι του παζλ, όχι η λύση.

Ένας από τους φανερούς περιορισμούς των συνθετικών δεδομένων είναι η αποσύνδεση από τον πραγματικό κόσμο. Για παράδειγμα, αυτόνομα οχήματα που εκπαιδεύονται αποκλειστικά με συνθετικά δεδομένα θα παλέψουν με πραγματικές, απρόβλεπτες οδικές συνθήκες. Επιπλέον, τα συνθετικά δεδομένα κληρονομούν προκατάληψη από τα δεδομένα του πραγματικού κόσμου που χρησιμοποιούνται για τη γεννήσή τους–σχεδόν καταρρίπτοντας τον σκοπό της συζήτησής μας. Σε σύγκριση, τα συνθετικά δεδομένα είναι một χρήσιμη επιλογή για την επιμελήωση και την αντιμετώπιση περιπτώσεων, αλλά σημαντικές βελτιώσεις στην αποτελεσματικότητα του μοντέλου και την ελαχιστοποίηση της προκατάληψης εξακολουθούν να εξαρτώνται από την πρόσβαση σε πραγματικά δεδομένα του κόσμου.

Ένας Καλύτερος Τρόπος: Πραγματικά Δεδομένα μέσω PETs-Ενεργοποιημένων Ροών Εργασίας

Οι PETs προστατεύουν τα δεδομένα ενώ χρησιμοποιούνται. Όταν πρόκειται για μοντέλα AI/ML, μπορούν επίσης να προστατεύσουν την πνευματική ιδιοκτησία του μοντέλου που εκτελείται–”δύο πουλιά, μια πέτρα.” Λύσεις που χρησιμοποιούν PETs παρέχουν την επιλογή να εκπαιδεύσουν μοντέλα σε πραγματικά, ευαίσθητα σύνολα δεδομένων που δεν ήταν προηγουμένως προσβάσιμα λόγω προβλημάτων προστασίας προσωπικών δεδομένων και ασφάλειας. Αυτή η απελευθέρωση των ροών δεδομένων σε πραγματικά δεδομένα είναι η καλύτερη επιλογή για την ελαχιστοποίηση της προκατάληψης. Αλλά πώς θα λειτουργούσε στην πράξη;

Για τώρα, οι principales επιλογές αρχίζουν με ένα περιβάλλον εμπιστευτικής υπολογιστικής. Στη συνέχεια, μια ενσωμάτωση με μια λύση λογισμικού βασισμένη σε PETs που το κάνει έτοιμο για χρήση out of the box, αντιμετωπίζοντας τις απαιτήσεις διακυβέρνησης και ασφάλειας των δεδομένων που δεν περιλαμβάνονται σε ένα τυπικό περιβάλλον εκτέλεσης εμπιστευτικών δεδομένων (TEE). Με αυτή τη λύση, τα μοντέλα και τα δεδομένα είναι όλα κρυπτογραφημένα πριν σταλούν σε ένα ασφαλές περιβάλλον υπολογιστικής. Το περιβάλλον μπορεί να φιλοξενηθεί οπουδήποτε, το οποίο είναι σημαντικό όταν αντιμετωπίζουμε ορισμένες απαιτήσεις τοπικοποίησης δεδομένων. Αυτό σημαίνει ότι και η πνευματική ιδιοκτησία του μοντέλου και η ασφάλεια των δεδομένων εισόδου διατηρούνται κατά τη διάρκεια της υπολογιστικής–ούτε ο πάροχος του περιβάλλοντος εκτέλεσης εμπιστευτικών δεδομένων έχει πρόσβαση στα μοντέλα ή τα δεδομένα μέσα σε αυτό. Τα κρυπτογραφημένα αποτελέσματα επιστρέφονται στη συνέχεια για ανασκόπηση και τα αρχεία είναι διαθέσιμα για ανασκόπηση.

Αυτή η ροή απελευθερώνει τα καλύτερα δεδομένα ανεξάρτητα από το πού βρίσκονται ή ποιος τα έχει, δημιουργώντας einen δρόμο για την ελαχιστοποίηση της προκατάληψης και τα μοντέλα υψηλής αποτελεσματικότητας που μπορούμε να εμπιστευτούμε. Αυτή η ροή είναι επίσης αυτό που περιέγραψε ο νόμος της ΕΕ για τον AI στις απαιτήσεις του για einen AI ρυθμιστικό πεδίο.

Διευκόλυνση της Ηθικής και Νομικής Συμμόρφωσης

Η απόκτηση καλής ποιότητας, πραγματικών δεδομένων είναι δύσκολο. Οι απαιτήσεις προστασίας προσωπικών δεδομένων και τοπικοποίησης περιορίζουν αμέσως τα σύνολα δεδομένων που οι οργανώσεις μπορούν να αποκτήσουν. Για την καινοτομία και την ανάπτυξη να συμβούν, τα δεδομένα πρέπει να ρέουν σε εκείνους που μπορούν να εξάγουν την αξία από αυτά.

Το Άρθρο 54 του νόμου της ΕΕ για τον AI παρέχει απαιτήσεις για τύπους μοντέλων “υψηλού κινδύνου” όσον αφορά το τι πρέπει να αποδειχθεί πριν από την κυκλοφορία στην αγορά. Σε σύντομο, οι ομάδες θα πρέπει να χρησιμοποιήσουν πραγματικά δεδομένα στον πραγματικό κόσμο μέσα σε ένα AI Ρυθμιστικό Πεδίο για να δείξουν επαρκή αποτελεσματικότητα του μοντέλου και συμμόρφωση με όλους τους ελέγχους που περιγράφονται στο Κεφάλαιο III, Κεφάλαιο 2. Οι έλεγχοι περιλαμβάνουν παρακολούθηση, διαφάνεια, εξηγησιμότητα, ασφάλεια δεδομένων, προστασία δεδομένων, ελαχιστοποίηση δεδομένων και προστασία μοντέλου–σκέψου DevSecOps + Data Ops.

Η πρώτη πρόκληση θα είναι να βρεθεί ένα πραγματικό σύνολο δεδομένων για χρήση–καθώς αυτό είναι εγγενώς ευαίσθητα δεδομένα για τέτοιους τύπους μοντέλων. Χωρίς τεχνικές εγγυήσεις, πολλές οργανώσεις μπορεί να διστάσουν να εμπιστευτούν τον πάροχο του μοντέλου με τα δεδομένα τους ή δεν θα επιτρέπεται να το κάνουν. Επιπλέον, ο τρόπος με τον οποίο ο νόμος ορίζει ένα “AI Ρυθμιστικό Πεδίο” είναι μια πρόκληση καθ’ εαυτό. Ορισμένες από τις απαιτήσεις περιλαμβάνουν eine εγγύηση ότι τα δεδομένα αφαιρούνται από το σύστημα μετά την εκτέλεση του μοντέλου, καθώς και οι έλεγχοι διακυβέρνησης, επιβολή και αναφορά για να το αποδείξουν.

Πολλές οργανώσεις έχουν προσπαθήσει να χρησιμοποιήσουν out-of-the-box δωμάτια καθαρισμού δεδομένων (DCRs) και περιβάλλοντα εκτέλεσης εμπιστευτικών δεδομένων (TEEs). Αλλά, από μόνα τους, αυτές οι τεχνολογίες απαιτούν σημαντική εμπειρία και εργασία για να λειτουργήσουν και να ικανοποιήσουν τις απαιτήσεις ρυθμιστικού πεδίου και προστασίας δεδομένων.
Τα DCRs είναι πιο εύκολα στη χρήση, αλλά δεν είναι ακόμη χρήσιμα για πιο ρομποτικά AI/ML αναγκαιότητες. Τα TEEs είναι ασφαλείς διακομιστές και vẫn χρειάζονται μια ολοκληρωμένη πλατφόρμα συνεργασίας για να είναι χρήσιμα, γρήγορα. Αυτό, ωστόσο, αναγνωρίζει μια ευκαιρία για πλατφόρμες τεχνολογιών ενίσχυσης της προστασίας των δεδομένων να ολοκληρώσουν τα TEEs για να αφαιρέσουν αυτή τη δουλειά, τριβιάζοντας την εγκατάσταση και τη χρήση ενός AI ρυθμιστικού πεδίου, και επομένως, απόκτηση και χρήση ευαίσθητων δεδομένων.

Ενεργοποιώντας τη χρήση πιο διαφορετικών και ολοκληρωμένων συνόλων δεδομένων με έναν τρόπο που προστατεύει την προστασία προσωπικών δεδομένων, αυτές οι τεχνολογίες βοηθούν να διασφαλίσουν ότι οι πρακτικές AI και ML συμμορφώνονται με ηθικά πρότυπα και νομικές απαιτήσεις που σχετίζονται με την προστασία προσωπικών δεδομένων (π.χ. GDPR και νόμος της ΕΕ για τον AI στην Ευρώπη). Σε σύγκριση, ενώ οι απαιτήσεις συχνά συναντούνται με ακουστικές γκρουντ και σιγές, αυτές οι απαιτήσεις οδηγούν απλώς στη δημιουργία καλύτερων μοντέλων που μπορούμε να εμπιστευτούμε και να βασιστούμε για σημαντικές αποφάσεις που βασίζονται σε δεδομένα, ενώ προστατεύουμε την προστασία προσωπικών δεδομένων των υποκειμένων που χρησιμοποιούνται για την ανάπτυξη και την προσαρμογή του μοντέλου.

στην Ευρώπη.

Ο Adi Hirschtein είναι ο VP of product tại Duality Technologies. Ο Adi έχει περισσότερες από 20 χρόνια εμπειρίας ως εκτελεστικός, product manager και επιχειρηματίας, xây dựng και οδηγώντας την καινοτομία στις εταιρείες τεχνολογίας, κυρίως σε startups B2B στον τομέα των δεδομένων και του AI. Πριν από τη Duality, ο Adi υπηρέτησε ως VP of product για την Iguazio (εταιρεία MLOps) η οποία αποκτήθηκε από τη McKinsey και πριν από αυτό υπηρέτησε ως Director of product στην EMC μετά από την απόκτηση ενός άλλου startup με το όνομα Zettapoint (εταιρεία βάσεων δεδομένων και αποθήκευσης) όπου υπηρέτησε ως VP of product, οδηγώντας το προϊόν από την αρχή στην διείσδυση της αγοράς και την ανάπτυξη.