Συνεντεύξεις
Алекс Ράτνερ, CEO και συνιδρυτής της Snorkel AI – Σειρά Συνεντεύξεων

Ο Алекс Ράτνερ είναι ο CEO και συνιδρυτής της Snorkel AI, μια εταιρεία που γεννήθηκε από το εργαστήριο AI του Στάνφορντ.
Snorkel AI κατασκευάζει την ανάπτυξη του AI γρήγορη και πρακτική, μετατρέποντας τις χειροκίνητες διαδικασίες ανάπτυξης του AI σε προγραμματικές λύσεις. Η Snorkel AI επιτρέπει στις επιχειρήσεις να αναπτύξουν AI που λειτουργεί για τις μοναδικές τους εργασίες, χρησιμοποιώντας τα ιδιόκτητα δεδομένα και τη γνώση τους 10-100 φορές γρηγορότερα.
Τι σας έκανε να ενδιαφερθείτε για την πληροφορική;
Υπάρχουν δύο πολύ ενδιαφέροντα аспектs της πληροφορικής όταν είσαι νέος. Ένα, μπορείς να μάθεις όσο γρήγορα θέλεις από το πειραματισμό και την κατασκευή, με την άμεση ανάδραση, αντί να πρέπει να περιμένεις έναν δάσκαλο. Δύο, μπορείς να κατασκευάσεις πολλά χωρίς να πρέπει να ζητήσεις άδεια από κανέναν!
Εγώ μπήκα στην προγραμματισμό όταν ήμουν μικρό παιδί για αυτούς τους λόγους. Επίσης, μου άρεσε η ακρίβεια που απαιτούσε. Μου άρεσε η διαδικασία της αφαίρεσης των σύνθετων διαδικασιών και ρουτινών και στη συνέχεια της κωδικοποίησής τους με έναν modulaire τρόπο.
Αργότερα, ως ενήλικας, επέστρεψα στην πληροφορική επαγγελματικά μέσω μιας δουλειάς σε μια εταιρεία συμβούλων όπου μου ζητήθηκε να γράψω σενάρια για να κάνω κάποιες βασικές αναλύσεις του σώματος των πατεντών. Ήμουν ενθουσιασμένος από το πόσο ανθρώπινη γνώση – οτιδήποτε είχε θεωρηθεί πατέντα – ήταν διαθέσιμο, αλλά ήταν τόσο αδύνατο να κάνει ακόμη και τις πιο απλές αναλύσεις σε σύνθετο τεχνικό κείμενο και πολυμεσικά δεδομένα.
Αυτό με οδήγησε πίσω στο ραβδί, και τελικά πίσω στο πανεπιστήμιο του Στάνφορντ, με επίκεντρο την NLP, η οποία είναι η περιοχή της χρήσης του ML/AI σε φυσική γλώσσα.
Ξεκινήσατε και ηγηθήκατε το ανοιχτό πρόγραμμα Snorkel ενώ byli στο Στάνφορντ, μπορείτε να μας οδηγήσετε μέσα από το ταξίδι των πρώτων ημερών;
Τότε ήμασταν, όπως πολλοί στην βιομηχανία, επικεντρωμένοι στην ανάπτυξη νέων αλγορίθμων και – δηλαδή όλα τα “εlegant” πράγματα του machine learning που οι άνθρωποι στην κοινότητα έκαναν έρευνα και δημοσίευαν εργασίες.
Ωστόσο, ήμασταν πάντα πολύ δεσμευμένοι να εδραιώσουμε αυτό σε πραγματικά προβλήματα – κυρίως με γιατρούς και επιστήμονες στο Στάνφορντ. Αλλά κάθε φορά που μας ζητήθηκε να παρουσιάσουμε ένα νέο μοντέλο ή αλγόριθμο, η απάντηση έγινε “βέβαια, θα το δοκιμάσουμε, αλλά θα χρειαζόμαστε όλα αυτά τα δεδομένα εκπαίδευσης που δεν έχουμε χρόνο να δημιουργήσουμε!”
Είδαμε ότι το μεγάλο άρρητο πρόβλημα ήταν γύρω από τη διαδικασία της επισήμανσης και της επιμέλειας αυτών των δεδομένων εκπαίδευσης – έτσι μεταφέραμε όλη την προσοχή μας σε αυτό, το οποίο είναι πώς ξεκίνησε το πρόγραμμα Snorkel και η ιδέα της “data-centric AI”.
Η Snorkel έχει μια data-centric AI προσέγγιση, μπορείτε να ορίσετε τι σημαίνει αυτό και πώς διαφέρει από την model-centric AI ανάπτυξη;
Η data-centric AI σημαίνει την κατασκευή καλύτερων δεδομένων για να κατασκευάσουμε καλύτερα μοντέλα.
Αυτό αντιτίθεται – αλλά συνεργάζεται με – την model-centric AI. Στην model-centric AI, οι ερευνητές και οι επιστήμονες δεδομένων υποθέτουν ότι τα δεδομένα είναι στατικά και ρίχνουν την ενέργειά τους στην προσαρμογή των αρχιτεκτονικών μοντέλων και των παραμέτρων για να επιτύχουν καλύτερα αποτελέσματα.
Οι ερευνητές vẫn κάνουν εξαιρετική δουλειά στην model-centric AI, αλλά τα off-the-shelf μοντέλα και οι τεχνικές auto ML έχουν βελτιωθεί τόσο πολύ που η επιλογή μοντέλου έχει γίνει εμπορεύσιμο στη время παραγωγής. Όταν είναι έτσι, ο καλύτερος τρόπος για να βελτιώσετε αυτά τα μοντέλα είναι να τους παρέχετε περισσότερα και καλύτερα δεδομένα.
Τι είναι τα βασικά principia μιας data-centric AI προσέγγισης;
Το βασικό principium της data-centric AI είναι απλό: καλύτερα δεδομένα κατασκευάζουν καλύτερα μοντέλα.
Στη δουλειά μας, έχουμε ονομάσει αυτό “data programming”. Η ιδέα είναι ότι αν ταΐσετε ένα robust enough μοντέλο με αρκετά παραδείγματα εισόδων και αναμενόμενων εξόδων, το μοντέλο μαθαίνει να αναπαράγει αυτά τα πρότυπα.
Αυτό παρουσιάζει ένα μεγαλύτερο πρόβλημα από ό,τι θα περιμένατε. Η πλειονότητα των δεδομένων δεν έχει ετικέτες – ή, τουλάχιστον, δεν έχει χρήσιμες ετικέτες για την εφαρμογή σας. Η επισήμανση αυτών των δεδομένων με το χέρι απαιτεί単調ότητα, χρόνο και ανθρώπινη προσπάθεια.
Η διαδικασία της επισήμανσης των δεδομένων με το χέρι παρουσιάζει σοβαρά προβλήματα. Αυτό απαιτεί πολλές ανθρώπινες ώρες, και đôifois αυτές οι ώρες possono είναι ακριβές. Για παράδειγμα, τα ιατρικά έγγραφα μπορούν να επισημανθούν μόνο από γιατρούς.
Επιπλέον, η χειροκίνητη επισήμανση συχνά οδηγεί σε μονόχρονα projects. Οι επισήμαντες επισήμανουν τα δεδομένα σύμφωνα με ένα σκληρό σχήμα. Αν οι ανάγκες μιας επιχείρησης αλλάξουν και απαιτούν ένα διαφορετικό σύνολο ετικετών, οι επισήμαντες πρέπει να ξεκινήσουν από την αρχή.
Οι προγραμματικές προσεγγίσεις για την data-centric AI ελαχιστοποιούν και τα δύο προβλήματα. Το προγραμματικό σύστημα επισήμανσης της Snorkel AI ενσωματώνει διαφορετικά σήματα – από legacy μοντέλα σε υπάρχουσες ετικέτες σε εξωτερικές βάσεις γνώσης – για να αναπτύξει πιθανοτικές ετικέτες σε κλίμακα. Η основная πηγή σήματος μας έρχεται από ειδικούς που συνεργάζονται με επιστήμονες δεδομένων για να κατασκευάσουν λειτουργίες επισήμανσης. Αυτές κωδικοποιούν την εμπειρία τους σε αναλώσιμες κανόνες, επιτρέποντας στην προσπάθεια που επενδύεται σε μια απόφαση να επηρεάσει δεκάδες ή εκατοντάδες σημεία δεδομένων.
Αυτό το πλαίσιο είναι επίσης ευέλικτο. Αντί να ξεκινήσετε από την αρχή όταν οι ανάγκες μιας επιχείρησης αλλάξουν, οι χρήστες προσθέτουν, αφαιρούν και調整ují τις λειτουργίες επισήμανσης για να εφαρμόσουν νέες ετικέτες σε ώρες αντί για ημέρες.
Πώς αυτή η data-centric προσέγγιση επιτρέπει την ταχεία κλιμάκωση των μη επισημανμένων δεδομένων;
Η προγραμματική μας προσέγγιση για την data-centric AI επιτρέπει την ταχεία κλιμάκωση των μη επισημανμένων δεδομένων, ενισχύοντας την επίδραση κάθε επιλογής. Μόλις οι ειδικοί καθορίσουν ένα αρχικό, μικρό σύνολο δεδομένων εκπαίδευσης, αρχίζουν να συνεργάζονται με επιστήμονες δεδομένων για γρήγορη επανάληψη. Ορίζουν quelques λειτουργίες επισήμανσης, εκπαιδεύουν ένα γρήγορο μοντέλο, αναλύουν την επίδραση των λειτουργιών επισήμανσης και στη συνέχεια προσθέτουν, αφαιρούν ή調整ují τις λειτουργίες επισήμανσης ανάλογα με τις ανάγκες.
Κάθε κύκλος βελτιώνει την απόδοση του μοντέλου μέχρι να ικανοποιήσει ή να υπερβεί τους στόχους του project. Αυτό μπορεί να μειώσει τους μήνες εργασίας επισήμανσης δεδομένων σε μόνο ώρες. Σε ένα project έρευνας της Snorkel, δύο από τους ερευνητές μας επέσημαναν 20.000 έγγραφα σε μια ημέρα – ένα όγκο που θα μπορούσε να είχε πάρει χειροκίνητους επισήμαντες δέκα εβδομάδες ή περισσότερο.
Η Snorkel προσφέρει πολλαπλά λύσεις AI, συμπεριλαμβανομένων Snorkel Flow, Snorkel GenGlow και Snorkel Foundry. Ποίες είναι οι διαφορές μεταξύ αυτών των προσφερόμενων;
Το σύνολο λύσεων AI της Snorkel επιτρέπει στους χρήστες να δημιουργούν λειτουργίες επισήμανσης (π.χ. αναζήτηση λέξεων ή προτύπων σε έγγραφα) για να επισήμανουν προγραμματικά εκατομμύρια σημεία δεδομένων σε λεπτά, αντί να επισήμανουν χειροκίνητα ένα σημείο δεδομένων την φορά.
Συμπιέζει τον χρόνο που απαιτείται για τις επιχειρήσεις να μετατρέψουν τα ιδιόκτητα δεδομένα σε μοντέλα που είναι έτοιμα για παραγωγή και να αρχίσουν να εξάγουν αξία από αυτά. Η Snorkel AI επιτρέπει στις επιχειρήσεις να κλιμακώσουν προσεγγίσεις με ανθρώπινη συμμετοχή, ενσωματώνοντας αποτελεσματικά την ανθρώπινη κρίση και τη γνώση των ειδικών.
Αυτό οδηγεί σε πιο διαφανή και εξηγημένα AI, εξοπλίζοντας τις επιχειρήσεις να διαχειρίζονται την προκατάληψη και να παρέχουν υπεύθυνες εξόδους.
Πηγαίνοντας στα βασικά, η Snorkel AI επιτρέπει στις επιχειρήσεις Fortune 500 να:
- Αναπτύξουν υψηλής ποιότητας δεδομένα για την εκπαίδευση μοντέλων ή την βελτίωση της RAG;
- Προσαρμόσουν τα LLM με την fine-tuning;
- Αποσταξυλώσουν τα LLM σε εξειδικευμένα μοντέλα που είναι πολύ μικρότερα και φθηνότερα να λειτουργούν;
- Κτίσουν domain και task-ειδικά LLM με προ-εκπαίδευση.
Έχετε γράψει κάποια πρωτοποριακά έγγραφα, ποιο είναι το πιο σημαντικό έγγραφο σύμφωνα με την κρίση σας;
Ένα από τα βασικά έγγραφα ήταν το αρχικό για την data programming (επισήμανση δεδομένων εκπαίδευσης προγραμματικά) και για την Snorkel.
Τι είναι η ορασή σας για το μέλλον της Snorkel;
Βλέπω την Snorkel να γίνεται ένα αξιόπιστο партνέρ για όλες τις μεγάλες επιχειρήσεις που είναι σοβαρές για το AI.
Η Snorkel Flow πρέπει να γίνει ένα πανταχού παρούσα εργαλείο για τις ομάδες επιστημόνων δεδομένων στις μεγάλες επιχειρήσεις – είτε είναι fine-tuning προσαρμοσμένων μεγάλων μοντέλων γλώσσας για τις οργανώσεις τους, είτε κατασκευάζουν μοντέλα ταξινόμησης εικόνων ή κατασκευάζουν απλά, αναπτυξίματα μοντέλα logistic regression.
Ανεξάρτητα από το ποιο είδος μοντέλων μια επιχείρηση χρειάζεται, θα χρειαστούν υψηλής ποιότητας δεδομένα για την εκπαίδευση.
Ευχαριστώ για τη μεγάλη συνέντευξη, οι αναγνώστες που επιθυμούν να μάθουν περισσότερα πρέπει να επισκεφθούν την Snorkel AI,












