Συνεντεύξεις
Xavier Conort, Συνιδρυτής και CPO της FeatureByte – Σειρά Συνεντεύξεων

Xavier Conort είναι ένας οραματιστής επιστήμονας δεδομένων με περισσότερες από 25 χρόνια εμπειρίας στα δεδομένα. Ξεκίνησε την καριέρα του ως ακτουάριος στην ασφαλιστική βιομηχανία πριν μεταπηδήσει στην επιστήμη των δεδομένων. Είναι ένας κορυφαίος ανταγωνιστής στο Kaggle και ήταν ο Chief Data Scientist στη DataRobot πριν συνιδρύσει την FeatureByte.
FeatureByte έχει ως αποστολή να κλιμακωθεί η επιχειρηματική AI, μερικώς απλοποιώντας και βιομηχανοποιώντας τα δεδομένα της AI. Η πλατφόρμα feature engineering και διαχείρισης ενδυναμώνει τους επιστήμονες δεδομένων να δημιουργούν και να μοιράζονται state-of-the-art χαρακτηριστικά και δεδομένα παραγωγής σε λίγα λεπτά – αντί για εβδομάδες ή μήνες.
Ξεκινήσατε την καριέρα σας ως ακτουάριος στην ασφαλιστική βιομηχανία πριν μεταπηδήσετε στην επιστήμη των δεδομένων, τι προκάλεσε αυτή η αλλαγή;
Ένα καθοριστικό σημείο ήταν η νίκη στο GE Flight Quest, ένα διαγωνισμό που διοργανώθηκε από την GE με ένα βραβείο 250.000 δολαρίων, όπου οι συμμετέχοντες έπρεπε να προβλέψουν τις καθυστερήσεις των εσωτερικών πτήσεων στις Ηνωμένες Πολιτείες. Οφείλω μέρος αυτής της επιτυχίας σε μια πολύτιμη πρακτική ασφάλισης: το 2-σταδιακό μοντέλο. Αυτή η προσέγγιση βοηθά να ελέγξει την προκατάληψη στα χαρακτηριστικά που λείπουν επαρκούς αναπαράστασης στα διαθέσιμα δεδομένα εκπαίδευσης. Μαζί με άλλες νίκες στο Kaggle, αυτή η επιτυχία με πείστησε ότι η ακτουαριακή μου βάση μου έδωσε einen ανταγωνιστικό πλεονέκτημα στον τομέα της επιστήμης των δεδομένων.
Κατά τη διάρκεια του ταξιδιού μου στο Kaggle, είχα επίσης την τιμή να συνδεθώ με άλλους ενθουσιώδεις επιστήμονες δεδομένων, συμπεριλαμβανομένων των Jeremy Achin και Tom De Godoy, οι οποίοι αργότερα έγιναν οι συνιδρυτές της DataRobot. Μοιραζόμαστε ένα κοινό υπόβαθρο στην ασφάλιση και είχαμε επιτύχει αξιοσημείωτες επιτυχίες στο Kaggle. Όταν τελικά ξεκίνησαν την DataRobot, μια εταιρεία που ειδικεύεται στην AutoML, με προσκάλεσαν να τους ενωθώ ως ο Chief Data Scientist. Η όρασή τους να συνδυάσουν τις καλύτερες πρακτικές από την ασφαλιστική βιομηχανία με την δύναμη της μηχανικής μάθησης με ενθουσίασε, παρουσιάζοντας μια ευκαιρία να δημιουργήσουμε κάτι καινοτόμο και επηρεαστικό.
Στη DataRobot και ήσαστε ουσιαστικός στην κατασκευή του οδικού χάρτη της επιστήμης των δεδομένων. Ποιοι τύποι προκλήσεων δεδομένων αντιμετωπίσατε;
Η πιο σημαντική πρόκληση που αντιμετωπίσαμε ήταν η ποικιλία της ποιότητας των δεδομένων που παρέχονταν ως είσοδος στην λύση AutoML μας. Αυτό το ζήτημα συχνά οδηγούσε либо σε χρονοβόρες συνεργασίες μεταξύ της ομάδας μας και των πελατών μας, либо σε απογοητευτικά αποτελέσματα στην παραγωγή εάν δεν αντιμετωπιστούν σωστά. Τα ζητήματα ποιότητας προέρχονταν από πολλές πηγές που απαιτούσαν την προσοχή μας.
Μια από τις основικές προκλήσεις προέκυψε από τη γενική χρήση εργαλείων επιχειρηματικής ευφυΐας για την προετοιμασία και διαχείριση δεδομένων. Ενώ αυτά τα εργαλεία είναι πολύτιμα για τη δημιουργία ερευνών, λείπουν των ικανοτήτων που απαιτούνται για να διασφαλίσουν την ορθότητα στο σημείο του χρόνου για την προετοιμασία δεδομένων της μηχανικής μάθησης. Ως αποτέλεσμα, διαρροές στα δεδομένα εκπαίδευσης θα μπορούσαν να συμβούν, οδηγώντας σε υπερπροσαρμογή και ανακριβή απόδοση του μοντέλου.
Η κακοσυνεννόηση μεταξύ των επιστημόνων δεδομένων και των μηχανικών δεδομένων ήταν μια άλλη πρόκληση που επηρέασε την ακρίβεια των μοντέλων κατά την παραγωγή. Οι ασυνέπειες μεταξύ των φάσεων εκπαίδευσης και παραγωγής, που προέρχονται από την αποσύνδεση μεταξύ αυτών των δύο ομάδων, θα μπορούσαν να επηρεάσουν την απόδοση του μοντέλου σε ένα πραγματικό περιβάλλον.
Τι ήταν κάποια από τα βασικά συμπεράσματα από αυτήν την εμπειρία;
Η εμπειρία μου στη DataRobot τόνισε τη σημασία της προετοιμασίας δεδομένων στη μηχανική μάθηση. Αντιμετωπίζοντας τις προκλήσεις της δημιουργίας δεδομένων εκπαίδευσης μοντέλων, όπως η ορθότητα στο σημείο του χρόνου, τα κενά εμπειρογνωσίας, η γνώση τομέα, οι περιορισμοί εργαλείων και η κλιμάκωση, μπορούμε να βελτιώσουμε την ακρίβεια και την αξιοπιστία των μοντέλων μηχανικής μάθησης. Έφτασα στο συμπέρασμα ότι η απλοποίηση της διαδικασίας προετοιμασίας δεδομένων και η ενσωμάτωση καινοτόμων τεχνολογιών θα είναι ουσιαστικές για το ξεκλείδωμα του πλήρους potencial της AI και την εκπλήρωση των υποσχέσεών της.
Ακούσαμε από τον συνιδρυτή σας Razi Raziuddin για την ιστορία γέννησης της FeatureByte, θα μπορούσατε να μας δώσετε την εκδοχή σας για τα γεγονότα;
Όταν συζήτησα τις παρατηρήσεις και τις εντυπώσεις μου με τον συνιδρυτή μου Razi Raziuddin, συνειδητοποιήσαμε ότι μοιραζόμαστε μια κοινή κατανόηση των προκλήσεων στην προετοιμασία δεδομένων για τη μηχανική μάθηση. Κατά τη διάρκεια των συζητήσεων, μοιράστηκα με τον Razi τις εντυπώσεις μου για τις πρόσφατες προόδους στην κοινότητα MLOps. Μπορούσα να παρατηρήσω την εμφάνιση των feature stores και των πλατφορμών χαρακτηριστικών που οι εταιρείες AI-first τοποθετούν για να μειώσουν την υστέρηση της εξυπηρέτησης χαρακτηριστικών, να ενθαρρύνουν την επαναχρησιμοποίηση χαρακτηριστικών ή να απλοποιήσουν την υλικοποίηση χαρακτηριστικών σε δεδομένα εκπαίδευσης ενώ διασφαλίζουν την ομοιότητα εκπαίδευσης-εξυπηρέτησης. Ωστόσο, ήταν σαφές σε εμάς ότι υπήρχε ακόμη ένα κενό στην ικανοποίηση των αναγκών των επιστημόνων δεδομένων. Ο Razi μοιράστηκε μαζί μου τις εντυπώσεις του για το πώς η σύγχρονη στοίβα δεδομένων έχει επανακατασκευάσει την επιχειρηματική ευφυΐα και την ανάλυση, αλλά δεν αξιοποιείται πλήρως για την AI.
Εμφανίστηκε σε εμάς ότι είχαμε την ευκαιρία να κάνουμε μια σημαντική επίδραση απλοποιώντας δραματικά τη διαδικασία feature engineering και παρέχοντας στους επιστήμονες δεδομένων και τους μηχανικούς ML τα σωστά εργαλεία και την εμπειρία χρήστη για άρτια πειραματισμό και εξυπηρέτηση χαρακτηριστικών.
Τι ήταν κάποια από τα μεγαλύτερα προβλήματα σας στην μετάβαση από επιστήμονα δεδομένων σε επιχειρηματία;
Η μετάβαση από επιστήμονα δεδομένων σε επιχειρηματία απαιτούσε από εμένα να αλλάξω από μια τεχνική προοπτική σε μια ευρύτερη επιχειρηματική προοπτική. Ενώ είχα μια ισχυρή βάση στην κατανόηση των προβλημάτων, τη δημιουργία ενός οδικού χάρτη, την εκτέλεση σχεδίων, την κατασκευή μιας ομάδας και τη διαχείριση προϋπολογισμών, βρήκα ότι η δημιουργία του σωστού μηνύματος που πραγματικά αντηχούσε με το στόχο μας κοινό ήταν ένα από τα μεγαλύτερα εμπόδια μου.
Ως επιστήμονας δεδομένων, η основική μου εστίαση είχε πάντα τη ανάλυση και την ερμηνεία δεδομένων για την εξαγωγή πολύτιμων ερευνών. Ωστόσο, ως επιχειρηματίας, έπρεπε να στρέψω την σκέψη μου προς την αγορά, τους πελάτες και την συνολική επιχείρηση.
Τυχαία, μπόρεσα να ξεπεράσω αυτήν την πρόκληση αξιοποιώντας την εμπειρία κάποιου σαν τον συνιδρυτή μου Razi.
Ακούσαμε από τον Razi γιατί η feature engineering είναι τόσο δύσκολη, στην άποψή σας τι την κάνει τόσο προκλητική;
Η feature engineering έχει δύο βασικές προκλήσεις:
- Μετατροπή υφιστάμενων στηλών: Αυτό περιλαμβάνει τη μετατροπή δεδομένων σε einen κατάλληλο μορφότυπο για αλγορίθμους μηχανικής μάθησης. Τεχνικές όπως η one-hot κωδικοποίηση, η κλιμάκωση χαρακτηριστικών και προηγμένα μέθοδοι όπως οι μετασχηματισμοί κειμένου και εικόνας χρησιμοποιούνται. Η δημιουργία νέων χαρακτηριστικών από υφιστάμενα, όπως χαρακτηριστικά αλληλεπίδρασης, μπορεί να βελτιώσει σημαντικά την απόδοση του μοντέλου. Δημοφιλείς βιβλιοθήκες όπως η scikit-learn και η Hugging Face παρέχουν εκτεταμένη υποστήριξη για αυτόν τον τύπο feature engineering. Λύσεις AutoML στοχεύουν να απλοποιήσουν τη διαδικασία.
- Εξαγωγή νέων στηλών από ιστορικά δεδομένα: Τα ιστορικά δεδομένα είναι κρίσιμα σε τομείς όπως τα συστήματα σύστασης, η marketing, η ανίχνευση απάτης, η ασφάλιση, η πιστωτική αξιολόγηση, η πρόβλεψη ζήτησης και η επεξεργασία δεδομένων αισθητήρων. Η εξαγωγή ενημερωτικών στηλών από αυτά τα δεδομένα είναι προκλητική. Παραδείγματα περιλαμβάνουν τον χρόνο από την τελευταία घटनή, τις συναθροίσεις πάνω από πρόσφατες γεγονότα και τις ενσωματώσεις από ακολουθίες γεγονότων. Αυτός ο τύπος feature engineering απαιτεί γνώση τομέα, πειραματισμό, ισχυρές δεξιότητες κωδικοποίησης και μηχανικής δεδομένων, και βαθιά γνώση επιστήμης δεδομένων. Παράγοντες όπως η διαρροή χρόνου, η αντιμετώπιση μεγάλων συνόλων δεδομένων και η αποτελεσματική εκτέλεση κώδικα cũng απαιτούν προσοχή.
Συνολικά, η feature engineering απαιτεί εμπειρογνωσία, πειραματισμό και κατασκευή σύνθετων ad-hoc δεδομένων pipelines στην απουσία εργαλείων που σχεδιάζονται ειδικά για αυτό.
Μπορείτε να μοιραστείτε πώς η FeatureByte ενδυναμώνει τους επαγγελματίες επιστήμης δεδομένων ενώ απλοποιεί τις pipelines χαρακτηριστικών;
Η FeatureByte ενδυναμώνει τους επαγγελματίες επιστήμης δεδομένων απλοποιώντας όλη τη διαδικασία feature engineering. Με ένα εύχρηστο Python SDK, επιτρέπει τη γρήγορη δημιουργία και εξαγωγή χαρακτηριστικών από XLarge Event και Item Tables. Η υπολογιστική επεξεργασία χειρίζεται αποτελεσματικά αξιοποιώντας την κλιμάκωση των πλατφορμών δεδομένων όπως η Snowflake, DataBricks και Spark. Τα σημειωματάρια διευκολύνουν τον πειραματισμό, ενώ η κοινή χρήση και η επαναχρησιμοποίηση χαρακτηριστικών εξοικονομούν χρόνο. Η ελέγχου εξασφαλίζει την ακρίβεια χαρακτηριστικών, ενώ η άμεση ανάπτυξη εξαλείφει τα προβλήματα διαχείρισης pipelines.
Εκτός από τις ικανότητες που προσφέρονται από τη βιβλιοθήκη ανοιχτού κώδικα, η λύση μας για επιχειρήσεις παρέχει einen ολοκληρωμένο πλαισιο για τη διαχείριση και τον οργανισμό των επιχειρηματικών λειτουργιών AI σε κλίμακα, συμπεριλαμβανομένων διαδικασιών διακυβέρνησης και μιας διεπαφής χρήστη για τον κατάλογο χαρακτηριστικών.
Τι είναι η όρασή σας για το μέλλον της FeatureByte;
Η τελική μας όραση για την FeatureByte είναι να επανακατασκευάσει τον τομέα της επιστήμης δεδομένων και της μηχανικής μάθησης, ενδυναμώνοντας τους χρήστες να απελευθερώσουν το πλήρες δημιουργικό τους potencial και να εξαγάγουν άνευ προηγουμένου αξία από τα περιουσιακά στοιχεία δεδομένων τους.
Είμαστε ιδιαίτερα ενθουσιασμένοι για την ταχεία πρόοδο στη Γεννητική AI και τους μετασχηματισμούς, οι οποίοι ανοίγουν έναν κόσμο δυνατοτήτων για τους χρήστες μας. Επιπλέον, είμαστε αφοσιωμένοι στη δημοκρατικοποίηση της feature engineering. Η Γεννητική AI έχει το potencial να μειώσει την είσοδο για τη δημιουργική feature engineering, καθιστώντας την πιο προσιτή σε ένα ευρύτερο κοινό.
Συνολικά, η όρασή μας για το μέλλον της FeatureByte περιστρέφεται γύρω από τη συνεχής καινοτομία, την αξιοποίηση της δύναμης της Γεννητικής AI και τη δημοκρατικοποίηση της feature engineering. Στόχος μας είναι να γίνουμε η πλατφόρμα που επιτρέπει στους επαγγελματίες δεδομένων να μετατρέψουν τα ακατέργαστα δεδομένα σε ενεργά δεδομένα εισόδου για τη μηχανική μάθηση, οδηγώντας σε καινοτομίες και προόδους σε όλους τους τομείς.
Έχετε κάποια συμβουλή για τους πιθανούς επιχειρηματίες AI;
Ορίστε τον χώρο σας, μείνετε εστιασμένοι και καλωσορίστε την καινοτομία.
Ορίζοντας τον χώρο που θέλετε να κατέχετε, μπορείτε να διαφοροποιηθείτε και να καθιερωθείτε μια ισχυρή παρουσία σε εκείνη την περιοχή. Ερευνήστε την αγορά, κατανοήστε τις ανάγκες και τα προβλήματα των potencial πελατών σας, και προσπαθήστε να παρέχετε μια μοναδική λύση που αντιμετωπίζει αποτελεσματικά αυτές τις προκλήσεις.
Ορίστε την μακροπρόθεσμη όρασή σας και θέστε σαφείς βραχυπρόθεσμους στόχους που ευθυγραμμίζονται με αυτήν την όραση. Εστιαστείτε στην κατασκευή μιας ισχυρής βάσης και στην παροχή αξίας στον καθορισμένο χώρο σας.
Τέλος, ενώ είναι σημαντικό να μείνετε εστιασμένοι, μην φοβηθείτε να ενστερνιστείτε την καινοτομία και να εξερευνήσετε νέες ιδέες μέσα στον καθορισμένο χώρο σας. Ο τομέας της AI εξελίσσεται συνεχώς, και οι καινοτόμες προσεγγίσεις μπορούν να ανοίξουν νέες ευκαιρίες.
Ευχαριστούμε για τη μεγάλη συνέντευξη, οι αναγνώστες που επιθυμούν να μάθουν περισσότερα μπορούν να επισκεφθούν την FeatureByte.












