Συνεντεύξεις

Χριστιανός Στάνο, Field CTO στην Anyscale – Σειρά Συνεντεύξεων

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Χριστιανός Στάνο, Field CTO στην Anyscale, έχει χτίσει την καριέρα του στο σημείο τομής της μεγάλης κλίμακας υποδομής AI, πλατφόρμων μηχανικής μάθησης και κατανεμημένης υπολογιστικής. Πριν από τη σύνδεσή του με την Anyscale, ηγήθηκε της οργάνωσης πλατφόρμας AI/ML στην Attentive, όπου ανέπτυξε την υποδομή που υποστήριζε την προσωποποίηση για πάνω από μισό δισεκατομμύριο συνδρομητές και βοήθησε στην έγκριση των συστημάτων υπολογισμού Ray που βελτίωσαν την ταχύτητα ανάπτυξης ενώ μειώνουν τους λειτουργικούς κόστους. Νωρίτερα στην καριέρα του, εργάστηκε σε κυβερνοασφάλεια, αρχιτεκτονική cloud και δημόσιες πρωτοβουλίες AI σε οργανισμούς όπως η Coalfire και η Deloitte, όπου συνεισέφερε σε μία από τις πρώτες πλατφόρμες μηχανικής μάθησης του Υπουργείου Άμυνας των ΗΠΑ. Το υπόβαθρό του περιλαμβάνει μηχανική πλατφόρμας AI, MLOps, υποδομή cloud-φιλική, ενεργοποίηση αναπτυξιακού προσωπικού και οργανωτική κλιμάκωση, δίνοντάς του βαθιά εμπειρία στην βοήθεια επιχειρήσεων να λειτουργούν το AI σε κλίμακα παραγωγής.

Anyscale είναι η εταιρεία πίσω από το Ray, το ανοικτό κατανεμημένο πλαίσιο υπολογισμού που χρησιμοποιείται ευρέως για την κλιμάκωση AI και Python σε κλάστερ CPU και GPU. Ιδρυθείσα από τους αρχικούς δημιουργούς του Ray από το RISELab του UC Berkeley, η εταιρεία επικεντρώνεται στην απλοποίηση της ανάπτυξης, ορχήστρας και διαχείρισης της μεγάλης κλίμακας υποδομής AI για εκπαίδευση, inference, επεξεργασία δεδομένων και εργασίες AI. Η πλατφόρμα της επιτρέπει στις οργανώσεις να εκτελούν κατανεμημένα συστήματα AI σε περιβάλλοντα cloud και on-premise, ενώ παρέχει παρατηρησιμότητα, διακυβέρνηση και βελτιώσεις απόδοσης που σχεδιάζονται για σύγχρονες εφαρμογές AI. Το Ray έχει γίνει ένα βασικό επίπεδο στο αναδυόμενο στάδιο υποδομής AI, βοηθώντας τους développers να κλιμακώσουν τις εργασίες από μια μηχανή σε χιλιάδες κόμβους με ελάχιστες αλλαγές στο υπάρχον κώδικα Python.

Έχετε εργαστεί σε κυβερνοασφάλεια, δημόσιες πλατφόρμες ML και υπερ-κλιμακωμένα συστήματα προσωποποίησης. Ποια πρότυπα έχετε δει συνεχώς όταν οι οργανώσεις προσπαθούν να μεταβούν από πιλοτικές εφαρμογές σε παραγωγή;

Σε όλους τους κλάδους, τρία πρότυπα εμφανίζονται κανονικά. Πρώτον, οι ομάδες δεν έχουν ένα αξιόπιστο οδικό χάρτη από την ανάπτυξη στην παραγωγή. Μπορούν να χτίσουν ένα μοντέλο σε ένα σημειωματάριο, αλλά δεν υπάρχει ένας τυποποιημένος τρόπος να το εκτελέσουν στην παραγωγή. Κάθε ανάπτυξη γίνεται μια μοναδική περίπτωση και κάθε αποτυχία είναι μια έκπληξη. Δεύτερον, η υποδομή δεν μπορεί να κλιμακωθεί με τις ανάγκες. Το σύστημα που λειτουργούσε σε πιλότο καταρρέει όταν το τροφοδοτήσετε με πραγματικά δεδομένα ή πραγματική κίνηση. Τρίτον, οι ομάδες πετάνε τυφλά. Λείπουν η παρατηρησιμότητα για να γνωρίζουν πώς λειτουργούν πραγματικά τα συστήματά τους, πού είναι πρόκειται να σπάσουν και πότε να επέμβουν.

Αυτό που συνδέει όλα αυτά είναι η ίδια ριζική πρόκληση — οι ομάδες δεν έχουν ένα σolid νοητικό μοντέλο για κλιμάκωση. Προσπαθούν να λύσουν όλα ταυτόχρονα αντί να είναι επιμελείς για τη σειρά. Το σκέφτομαι ως τρεις φάσεις: κάνε το να λειτουργήσει, κάνε το σωστό, κάνε το γρήγορο. Αυτές οι φάσεις δεν είναι μοναδικά ορόσημα — αυτές οι φάσεις είναι επαναλαμβανόμενες. Εσείς συνεχώς προτεραιοποιείτε μεταξύ αυτού που είναι σπασμένο τώρα και τι θα σπάσει την επόμενη φορά. Οι ομάδες που επιτυγχάνουν γνωρίζουν σε ποια φάση βρίσκονται και παραμένουν πειθαρχημένες για να μην προχωρήσουν μπροστά πριν η βάση είναι στερεή.

Στην Anyscale, βλέπουμε ομάδες να έρχονται σε κάθε στάδιο. Μερικές είναι ακόμη προσπαθούν να το κάνουν να λειτουργήσει — χρειάζονται einen αξιόπιστο οδικό χάρτη από την ανάπτυξη στην παραγωγή. Άλλοι το έχουν αυτό, αλλά πνίγονται στην λειτουργική πολυπλοκότητα και χρειάζονται να το κάνουν σωστό. Και πολλές έρχονται σε μας επειδή έχουν χτίσει κάτι που λειτουργεί, αλλά δεν μπορούν να το οδηγήσουν στην κλίμακα που η επιχείρηση απαιτεί. Ένα ενοποιημένο επίπεδο υπολογισμού βοηθά σε κάθε φάση, αλλά το σημείο εισόδου εξαρτάται από το πού είναι ο πόνος πιο οξύς.

Στην Attentive, βοήθησες να κλιμακωθούν τα συστήματα AI που υποστήριζαν εκατοντάδες εκατομμύρια χρηστών. Ποια ήταν τα μεγαλύτερα αρχιτεκτονικά ή οργανωτικά εμπόδια που έπρεπε να ξεπεράσετε για να φτάσετε σε αυτό το επίπεδο κλίμακας;

Το μεγαλύτερο εμπόδιο ήταν η καμπύλη της υποδομής πολυπλοκότητας. Όταν pushed τα μοντέλα μας για να ενσωματώσουν περισσότερα δεδομένα και να εξυπηρετήσουν περισσότερους πελάτες, χτυπήσαμε ένα σημείο inflection υπολογισμού όπου ακόμη και οι μεγαλύτεροι κόμβοι με κάθετη κλίμακα έβγαζαν σφάλματα out-of-memory, και η ανοχή horizontal scaling δεν ήταν επαρκής. Η υπολογιστική μας δεν μπορούσε να ακολουθήσει την κλίμακα των δεδομένων μας.

Η φυσική απάντηση ήταν να στρώσει περισσότερα εργαλεία για να δουλέψουν γύρω από τα όρια. Αυτό ήταν το εσωτερικό μου playbook από προηγούμενη εμπειρία. Κάθε εργαλείο λύσε ένα στενό πρόβλημα, αλλά πρόσθεσε λειτουργική πολυπλοκότητα. Η ML pipeline μας αντιμετώπισε να γίνει ένα patchwork από ολοκλήρωσεις, και κάθε νέα περίπτωση χρήσης σήμαινε περισσότερο ράψιμο, περισσότερα μοντέλα αποτυχίας, υψηλότερα κόστη και περισσότερη επιβάρυνση για την ομάδα πλατφόρμας.

Αυτό που τελικά ξεκλείδωσε την κλίμακα για μας ήταν η ενοποίηση της επεξεργασίας δεδομένων, εκπαίδευσης, inference και εξυπηρέτησης στο Ray και Anyscale. Η επίδραση ήταν άμεση: με δραματικά χαμηλότερα λειτουργικά κόστη, σημαντικά γρηγορότερους κύκλους εκπαίδευσης ακόμη και καθώς τα δεδομένα μεγάλωναν, και την ικανότητα να κλιμακωθούν τα μοντέλα σε τάξεις μεγέθους περισσότερους πελάτες.

Τι σας παρακίνησε να ενταχθεί στην Anyscale σε αυτό το στάδιο, και πώς βλέπετε το ρόλο του Field CTO να διαμορφώνει την υιοθέτηση AI από τις επιχειρήσεις;

Η εμπειρία μου να φέρω την Anyscale στην Attentive άλλαξε θεμελιωδώς το playbook μου για την κατασκευή πλατφόρμων ML. Πριν από αυτό, ένα σημαντικό μέρος της μηχανικής πλατφόρμας ήταν το κόστος του ραψίματος των συστημάτων. Με την Anyscale, μπορούσαμε να εξαλείψουμε πολύ από αυτήν την επιβάρυνση και αντίθετα να επικεντρωθούμε στην εμπειρία του développer, την αξιοπιστία και την απόδοση. Αυτή η αλλαγή είχε τεράστια επίδραση και στην παραγωγικότητα της ομάδας και στα αποτελέσματα του συστήματος. Η ένταξη στην Anyscale ήταν μια ευκαιρία να δουλέψω σε αυτό το πρόβλημα full-time και να βοηθήσω άλλες οργανώσεις να διαπεράσουν την ίδια μετάβαση. Ως Field CTO, ο ρόλος μου είναι πραγματικά να πάρω αυτά τα πραγματικά μαθήματα και να τα μετατρέψω σε επαναλαμβανόμενα πρότυπα που οι πελάτες μας μπορούν να εφαρμόσουν καθώς κλιμακώνουν το AI.

Πολυάριθμες επιχειρήσεις εξακολουθούν να είναι κολλημένες στην «πιλότικη» φάση του AI. Από την οπτική σας, τι συγκεκριμένα σπάει όταν οι εταιρείες προσπαθούν να κλιμακώσουν αυτές τις πρώτες πειραματικές εφαρμογές σε συστήματα παραγωγής;

Όταν οι εταιρείες μεταβαίνουν από πειραματικές εφαρμογές AI σε παραγωγή, αυτό που σπάει σπάνια είναι μόνο το μοντέλο — είναι το περιβάλλον σύστημα και λειτουργίες. Σε ορισμένες περιπτώσεις, οι ομάδες χτυπούν τα όρια της υποδομής νωρίς και δεν μπορούν να εκπαιδεύσουν ή να εξυπηρετήσουν στην κλίμακα που θέλουν. Πρέπει να περιορίσουν τον αριθμό των πελατών ή των περιπτώσεων χρήσης που εξυπηρετεί το μοντέλο τους ως αποτέλεσμα. Περισσότερες φορές, προβλήματα εμφανίζονται στην παραγωγή μέσω απροσδόκητων περιπτώσεων ή αλλαγών δεδομένων. Ένα από τα πιο συχνά σημεία αποτυχίας είναι η μνήμη: καθώς το μέγεθος, η κατανομή ή η modality των δεδομένων αλλάζει, οι εργασίες εξαντλούν τη μνήμη και αποτυγχάνουν. Αυτά τα ζητήματα είναι δύσκολο να προβλεφθούν και ακόμη πιο δύσκολο να auto-ανακτούν. Η πραγματικότητα είναι ότι η αποτυχία είναι αναπόφευκτη στην παραγωγή AI. Ο στόχος δεν είναι να την αποφύγουν εντελώς, αλλά να την ανιχνεύσουν γρήγορα, να την κατανοήσουν και να χτίσουν αυτο-θεραπευτικά συστήματα για να την επιλύσουν πριν επηρεάσει την επιχείρηση.

Το Ray, το κατανεμημένο πλαίσιο υπολογισμού που δημιουργήθηκε από την ομάδα πίσω από την Anyscale, κερδίζει έδαφος ως βάση για AI εργασίες. Γιατί η κατανεμημένη εκτέλεση γίνεται τόσο κρίσιμο επίπεδο στη σύγχρονη υποδομή AI;

Η κατανεμημένη εκτέλεση και διαχείριση εργασιών έχουν γίνει απαραίτητες για τις πipelines AI. Σύγχρονες AI εργασίες είναι εγγενώς παράλληλες και πόρων-εντατικές. Η εκπαίδευση, inference και επεξεργασία δεδομένων απαιτούν συντονισμό μεγάλου αριθμού εργασιών σε CPUs και GPUs, συχνά δυναμικά. Στο σημερινό τοπίο υπολογισμού, η πολυπλοκότητα της διαχείρισης αυτών των εργασιών σε σπάνιους πόρους είναι ένα τεράστιο λειτουργικό βάρος. Παραδοσιακά συστήματα δεν σχεδιάστηκαν για αυτήν την πολυπλοκότητα ή κλίμακα. Πλαίσια όπως το Ray είναι κρίσιμα επειδή επιτρέπουν στις ομάδες να κλιμακώσουν εργασίες χωρίς προβλήματα από μια μηχανή σε χιλιάδες κόμβους με ελάχιστες αλλαγές στο υπάρχον κώδικα Python. Αυτή η αλλαγή αντανακλά μια ευρύτερη κίνηση προς την υπολογιστική AI, όπου η υποδομή σχεδιάζεται ειδικά για τα πρότυπα των AI εργασιών αντί να προσαρμόζεται από παλαιότερα παραδείγματα.

Όσο περισσότερες εταιρείες υιοθετούν το Ray μέσω της πλατφόρμας Anyscale, ποια διαφορές βλέπετε μεταξύ των οργανισμών που τυποποιούν μια ενοποιημένη προσέγγιση έναντι εκείνων που ράβουν μαζί θραυσματικά εργαλεία;

Η διαφορά μεταξύ ενοποιημένων πλατφόρμων και θραυσματικών εργαλείων τελικά κατεβαίνει στην εστίαση και την αποτελεσματικότητα. Όταν οι ομάδες εξαρτώνται από πολλά μη συνδεδεμένα συστήματα, ξοδεύουν σημαντικό χρόνο για να τα ράψουν μαζί, να διαχειριστούν ασυνέπειες και να απαντήσουν σε αποτυχίες σε διαφορετικά περιβάλλοντα. Αυτό δημιουργεί λειτουργική επιβάρυνση και επιβραδύνει την πειραματική διαδικασία. Σε αντίθεση, μια ενοποιημένη προσέγγιση επιτρέπει στις ομάδες να επικεντρώσουν τις προσπάθειές τους στην βελτίωση ενός συστήματος, το οποίο οδηγεί σε καλύτερη αξιοπιστία, ισχυρότερη απόδοση και μια πιο ροή εμπειρίας développer. Επίσης, απλοποιεί τις διαδικασίες on-call και debugging επειδή τα πρότυπα είναι συνεπή και πιο εύκολο να κατανοηθούν. Το αποτέλεσμα δεν είναι μόνο τεχνική αποτελεσματικότητα, αλλά και οργανωτική σαφήνεια.

Βασισμένος στην εμπειρία σας στη δημιουργία πλήρως ενοποιημένων πλατφόρμων ML, πόσο σημαντική είναι η εμπειρία développer (DevEx) στη διευκόλυνση της υιοθέτησης AI σε ομάδες;

Η εμπειρία développer είναι μια από τις υψηλότερες-επιρροή περιοχές για την επιτάχυνση της υιοθέτησης AI. Όταν οι ομάδες πλατφόρμας επενδύουν στην κάνουν τα συστήματα πιο εύχρηστα μέσω τυποποιημένων workflows, προτύπων και μειωμένης υποδομής τριβής, ενισχύουν την παραγωγικότητα κάθε développer στην οργάνωση. Αυτό είναι ιδιαίτερα σημαντικό στο AI όπου ο ρυθμός αλλαγής είναι εξαιρετικά γρήγορος και οι ομάδες χρειάζονται να επαναλαμβάνουν γρήγορα για να παραμείνουν ανταγωνιστικές. Βελτιώσεις στην εμπειρία développer μεταφράζονται trực tiếp σε γρηγορότερη πειραματική διαδικασία, ταχύτερο χρόνο παραγωγής και τελικά μεγαλύτερη επιχειρηματική επίδραση. Τα εργαλεία κωδικοποίησης AI ενισχύουν αυτές τις θεμελιώδεις DevEx. Σε πολλές περιπτώσεις, είναι ο πιο κλιμακώσιμος τρόπος για την αύξηση της ταχύτητας σε όλη την οργάνωση.

Η αποτελεσματικότητα κόστους γίνεται μια σημαντική ανησυχία καθώς οι εργασίες AI κλιμακώνονται. Ποια είναι κάποια από τα πιο παραμελημένα τρόπους που οι επιχειρήσεις μπορούν να μειώσουν τα λειτουργικά κόστη χωρίς να θυσιάσουν την απόδοση;

Όσο οι εργασίες AI κλιμακώνονται, η διαχείριση κόστους γίνεται και πιο σημαντική και πιο σύνθετη. Ένα από τα πιο παραμελημένα προκλήματα είναι το πώς γρήγορα τα κόστη μπορούν να σπείρουν λόγω ανεπάρκειας, ιδιαίτερα με υποδομή GPU-βασισμένη. Μεγάλα συμπλέγματα μπορούν να ξεκινήσουν χιλιάδες κόμβους, και αν οι πόρους δεν διαχειρίζονται σωστά ή δεν σταματούν, τα κόστη συσσωρεύονται γρήγορα. Αυτό δημιουργεί ένα είδος AI-ειδικής διασποράς, όπου η χρήση υπολογισμού μεγαλώνει γρηγορότερα από ό,τι οι ομάδες μπορούν να παρακολουθήσουν ή να ελέγξουν. Η αντιμετώπιση αυτού απαιτεί μια συνδυασμένη ισχυρή διακυβέρνηση, ορατότητα και αυτοματοποίηση, όπως η αυτο-κλιμάκωση, η αυτο-τερματισμός και η κεντρική διαχείριση πόρων. Σε κλίμακα, η αποτελεσματικότητα κόστους δεν είναι μόνο μια λειτουργική ανησυχία, είναι ένα θεμελιώδες μέρος του σχεδιασμού συστήματος.

Έχετε εργαστεί σε όλα, από αποθήκες χαρακτηριστικών μέχρι συστήματα πραγματικού χρόνου. Πώς νομίζετε ότι η ισορροπία μεταξύ batch και πραγματικού χρόνου AI εργασιών εξελίσσεται;

Η ισορροπία μεταξύ batch και πραγματικού χρόνου AI εργασιών δεν έχει αλλάξει θεμελιωδώς — παραμένει ένα ζήτημα επιχειρηματικών απαιτήσεων. Η επεξεργασία batch είναι συνήθως πιο οικονομική και πιο εύκολη να λειτουργήσει, καθιστώντας την κατάλληλη για πολλές περιπτώσεις χρήσης. Τα συστήματα πραγματικού χρόνου, από την άλλη πλευρά, είναι απαραίτητα όταν η καθυστέρηση επηρεάζει άμεσα την εμπειρία του χρήστη ή το επιχειρηματικό αποτέλεσμα, όπως σε εφαρμογές chat ή ανίχνευση απάτης. Και οι δύο προσεγγίσεις θα συνεχίσουν να συνυπάρχουν, και το κλειδί για τις οργανώσεις είναι να χτίσουν πλατφόρμες που μπορούν να υποστηρίξουν και τις δύο αποτελεσματικά. Η απόφαση τελικά κατεβαίνει σε ανταλλαγές μεταξύ κόστους, καθυστέρησης και αξιοπιστίας.

Κοιτάζοντας μπροστά, τι είναι ένα «ωριμό» επιχειρηματικό πλαίσιο AI σε 2-3 χρόνια — και πώς τα εργαλεία όπως το Ray και οι πλατφόρμες όπως η Anyscale ταιριάζουν σε αυτό το μέλλον;

Τα επόμενα χρόνια, οι ώριμες εταιρικές πλατφόρμες AI θα καθορίζονται από ορισμένα βασικά χαρακτηριστικά. Θα βασίζονται σε ενοποιημένη υποδομή που υποστηρίζει ολόκληρο τον κύκλο ζωής της AI, από την επεξεργασία δεδομένων έως την εκπαίδευση και την εξαγωγή συμπερασμάτων, αντί για μια συλλογή ασύνδετων εργαλείων. Θα διαθέτουν ισχυρές λειτουργίες μετά την ανάπτυξη, με αυτοματοποιημένη από πράκτορες παρατηρησιμότητα, αξιοπιστία και ταχεία αποσφαλμάτωση. Η διαχείριση κόστους θα είναι προβλέψιμη και ελεγχόμενη, ώστε οι οργανισμοί να κλιμακώνονται βιώσιμα. Και ίσως το σημαντικότερο, θα επιτρέπουν υψηλή ταχύτητα ανάπτυξης, ώστε οι ομάδες να περνούν γρήγορα από την ιδέα στην παραγωγή. Πλατφόρμες όπως οι Ray και Anyscale διαδραματίζουν κεντρικό ρόλο σε αυτό το μέλλον, προσφέροντας τη βάση που είναι εγγενής στην AI και καθιστά εφικτή αυτή την κλίμακα και αποδοτικότητα.

Σας ευχαριστούμε για την εξαιρετική συνέντευξη. Οι αναγνώστες που επιθυμούν να μάθουν περισσότερα μπορούν να επισκεφθούν την Anyscale.

Ο Antoine είναι ένας οραματιστής ηγέτης και συνιδρυτής της Unite.AI, οδηγείται από μια αμετάβλητη страсть για το σχήμα και την προώθηση του μέλλοντος της τεχνητής νοημοσύνης και της ρομποτικής. Ένας σειριακός επιχειρηματίας, πιστεύει ότι η τεχνητή νοημοσύνη θα είναι τόσο διαταρακτική για την κοινωνία όσο και η ηλεκτρική ενέργεια, και συχνά πιάνεται να μιλάει για το δυναμικό των διαταρακτικών τεχνολογιών και της AGI.

Ως μελλοντολόγος, είναι αφιερωμένος στο να εξερευνήσει πώς αυτές οι καινοτομίες θα σχήματίσουν τον κόσμο μας. Επιπλέον, είναι ο ιδρυτής του Securities.io, μιας πλατφόρμας που επικεντρώνεται στις επενδύσεις σε ακριβές τεχνολογίες που ανασχεδιάζουν το μέλλον και αναμορφώνουν ολόκληρες βιομηχανίες.