Συνεντεύξεις
Νικούνι Μπάτζαϊ, Συνιδρυτής και Διευθύνων Σύμβουλος της TrueFoundry – Σειρά Συνεντεύξεων

Έχετε εργαστεί σε έρευνα μηχανικής μάθησης, παραγωγή AI στη Facebook (META ) και σε μεγάλης κλίμακας συστήματα συστάσεων πριν ιδρύσετε την TrueFoundry — ποια εμπειρία σας οδήγησε πιο直接α στη δημιουργία μιας εταιρείας υποδομής AI επιχείρησης, και ποιο πόνο δεν αντιμετωπίστηκε εκείνη την εποχή;
Στη Meta, θεωρούσαμε τη μηχανική μάθηση ως einen ειδικό περίπτωση λογισμικού, και τη GenAI ως einen ειδικό περίπτωση μηχανικής μάθησης, το οποίο οδήγησε σε einen κατακόρυφο σωρό με το λογισμικό στη βάση, τη μηχανική μάθηση στο μέσο και τη GenAI στην κορυφή. Σε αυτό το στήσιμο, αν είμαι ένας développer μηχανικής μάθησης, τα μοντέλα που κατασκευάζω ακολουθούν το ίδιο μοτίβο ανάπτυξης όπως και το υπόλοιπο λογισμικό, το οποίο καθιστά την κλιμάκωση των συστημάτων πολύ απλή.
Οι περισσότερες επιχειρήσεις, ωστόσο, αναπτύσσουν παράλληλους σωρούς, που σημαίνει ότι έχουν ξεχωριστούς σωρούς για λογισμικό, μηχανική μάθηση και GenAI. Η στιγμή που έχετε αυτούς τους παράλληλους σωρούς, η κλιμάκωση γίνεται πιο σύνθετη λόγω των χειρισμών που απαιτούνται μεταξύ μηχανικής μάθησης και του κόσμου του λογισμικού.
Η ομάδα μας έχει εργαστεί πάντα στην τομή της κατασκευής μοντέλων μηχανικής μάθησης και της υποδομής μηχανικής μάθησης, οπότε είχαμε μια μοναδική οπτική που μπορούσαμε να φέρουμε παρόμοιους κατακόρυφους σωρούς στις επιχειρήσεις και να τους προσαρμόζουμε στις συγκεκριμένες απαιτήσεις τους. Είχαμε επίσης μια υπόθεση προς το τέλος του 2021 ότι η μηχανική μάθηση προσεγγίζει ένα σημείο καμπής, και όταν το κάνει, περισσότερες εταιρείες θα χρειαζόντουσαν einen κατακόρυφο σωρό για να αναπτύξουν και να κλιμακώσουν αυτά τα συστήματα αποτελεσματικά. Αυτό είναι που μας οδήγησε τελικά στην ίδρυση της TrueFoundry, και η υπόθεσή μας ήταν σωστή. Η υιοθέτηση AI επιταχύνθηκε μετά την εκκίνηση του ChatGPT στα τέλη του 2022.
Όταν τα συστήματα AI μετακινούνται από την πειραματική φάση στις καθημερινές επιχειρησιακές διαδικασίες, τι έχει αλλάξει στον τρόπο που οι οργανώσεις πρέπει να σκέφτονται τη αξιοπιστία και την αποτυχία;
Τα στοιχήματα με τη Gen AI είναι σημαντικά υψηλότερα σε σύγκριση με τα παραδοσιακά συστήματα μηχανικής μάθησης. Όταν αυτά τα συστήματα μετακινούνται στην παραγωγή, οι οργανώσεις αντιμετωπίζουν ένα πολύ υψηλότερο επίπεδο αβεβαιότητας και μη-детерμινισμού επειδή τα LLMs είναι στοχαστικά από τη φύση τους. Τα συστήματα που κατασκευάζονται πάνω σε αυτά προσθέτουν thêm αβεβαιότητα.
Επιπλέον, οι αποτυχίες δεν είναι πλέον δυαδικές. Αντί να αποτυγχάνουν τα συστήματα απλώς ή να μην αποτυγχάνουν, πολλά προβλήματα εμφανίζονται ως μερικές αποτυχίες ή σιωπηλές επιδείνωσης. Τα συστήματα μπορεί να απαντήσουν με υψηλότερη καθυστέρηση, επιδείνωση ποιότητας ή λανθασμένη συμπεριφορά με τον καιρό. Σε πολλές περιπτώσεις, αυτές οι επιδείνωσης possono να είναι πιο δύσκολο να ανιχνευθούν και μερικές φορές ακόμη και πιο καταστροφικές από μια σκληρή διακοπή.
Οι οργανώσεις πρέπει να σκέφτονται την αξιοπιστία όχι μόνο σε σχέση με τον χρόνο λειτουργίας αλλά και την επιδείνωση της απόδοσης με τον καιρό.
TrueFailover was launched amid a wave of high-profile cloud and AI service disruptions. What recent events made it clear that AI reliability had shifted from a “nice to have” to a core architectural requirement?
Ένας από τους πελάτες μας στην υγεία που επεξεργάζεται πραγματικό χρόνο, χρονικά κρίσιμες αιτήσεις ασθενών σχετικά με συνταγές επηρεάστηκε από μια διακοπή που προκλήθηκε από μια αποτυχία μοντέλου. Οι ροές εργασίας τους παράγουν χιλιάδες δολάρια εσόδων ανά δευτερόλεπτο, και η διακοπή διέκοψε μερικές από αυτές τις κρίσιμες ροές εργασίας. Ως πρώτοι πελάτες της TrueFailover, μπόρεσα να βοηθήσω με γρήγορη ανάκτηση, και η επίδραση περιορίστηκε.
Γεγονότα όπως αυτό θέτουν ένα σημαντικό ερώτημα. Όταν τα στοιχήματα των συστημάτων Gen AI συνεχίζουν να αυξάνονται, γιατί οι διαδικασίες ανάκτησης εξακολουθούν να είναι σε μεγάλο βαθμό χειροκίνητες; Αυτό ενίσχυσε την ιδέα ότι τα συστήματα πρέπει να κατασκευαστούν με την υπόθεση ότι οι αποτυχίες θα συμβούν, και πρέπει να σχεδιαστούν να διορθώνουν αυτόματα τον εαυτό τους. Η αξιοπιστία πρέπει επίσης να ενσωματωθεί στην ίδια την πila AI μέσω της χρήσης πυλών AI, οι οποίες μπορούν να παρέχουν κεντρική δρομολόγηση, παρακολούθηση, φράγματα και έξυπνη εναλλαγή μοντέλων μεταξύ παρόχων.
Πολλά αποτυχίες AI εξακολουθούν να παρουσιάζονται ως τεχνικές δυσκολίες. Πού βλέπετε τις πραγματικές οικονομικές και ανθρώπινες κόστους αρχίζοντας να εμφανίζονται όταν τα συστήματα AI πάθουν;
Η επιχειρηματική AI έχει εξελιχθεί στο σημείο όπου αυτές οι δυσκολίες δεν επηρεάζουν πλέον μόνο τις εσωτερικές διαδικασίες. Σήμερα, οι διακοπές και οι επιδείνωσης επηρεάζουν άμεσα την δημόσια αντίληψη και τα κέρδη, επειδή οι περιπτώσεις χρήσης παραγωγής είναι τώρα προσανατολισμένες στον πελάτη. Αυτή η μετατόπιση από την εσωτερική δοκιμή σε υψηλές-στοιχήματα, προσανατολισμένες στον πελάτη εφαρμογές είναι ο λόγος για τον οποίο βλέπουμε αυξημένη ζήτηση για εκτελεστική προσοχή και εποπτεία.
Όταν τα συστήματα AI ενσωματωθούν βαθύτερα στις επιχειρησιακές διαδικασίες, οι διακοπές δεν είναι πλέον απλώς τεχνικά ζητήματα. Αυτές έχουν άμεσες επιχειρηματικές, πελάτες και φήμης επιπτώσεις.
Σε κρίσιμες περιπτώσεις όπως φαρμακεία, επιχειρήσεις υγείας ή υποστήριξη πελατών, πώς γρήγορα μπορεί να εξελιχθεί η διακοπή AI σε επιχειρησιακό ή φήμης κίνδυνο;
Σε κρίσιμες περιπτώσεις, η εξέλιξη συμβαίνει σχεδόν αμέσως επειδή αυτά τα συστήματα υποστηρίζουν πραγματικό χρόνο, χρονικά κρίσιμες ροές εργασίας. Ακόμη και μια σύντομη διακοπή μπορεί να σταματήσει κρίσιμες διαδικασίες, να καθυστερήσει την παράδοση υπηρεσιών ή να διακόψει συστήματα που εξαρτώνται από αυτές τις εξόδους, δημιουργώντας κασκαντίζουσες επιχειρησιακές επιπτώσεις σε όλη την οργάνωση.
Στους τομείς της υγείας, η επίδραση εκτείνεται πέρα από την επιχειρησιακή διακοπή στην εμπειρία του πελάτη και τα αποτελέσματα υπηρεσιών. Αν ένας ασθενής δεν μπορεί να εκπληρώσει την συνταγή του εγκαίρως, μπορεί να υπάρχουν πραγματικές επιπτώσεις. Όχι μόνο είναι αυτό ένα ζήτημα για τον ασθενή, αλλά μπορεί επίσης να βλάψει τη φήμη ενός φαρμακείου ή ενός παρόχου υγείας. Σε κρίσιμες περιπτώσεις όπου η εμπιστοσύνη είναι παράγοντας, είναι απαραίτητο τα συστήματα να παραμείνουν online. Αυτός είναι ο λόγος για τον οποίο οι οργανώσεις αναγνωρίζουν όλο και περισσότερο ότι τα συστήματα AI πρέπει να σχεδιαστούν με την υπόθεση ότι οι αποτυχίες θα συμβούν και ότι οι μηχανισμοί ανάκτησης πρέπει να ενεργοποιηθούν αυτόματα για να ελαχιστοποιήσουν τον κίνδυνο.
Έχετε πει ότι πολλές ομάδες αρχιτεκτούν για ικανότητα αντί για συνέχεια. Γιατί νομίζετε ότι η ανθεκτικότητα έχει ιστορικά υποτιμηθεί στο σχεδιασμό συστημάτων AI;
Αυτό οφείλεται σε μεγάλο βαθμό στους κινήτρους εντός των οργανισμών. Νέες ικανότητες είναι ορατές και ενθουσιάζουσες. Ανα解ουν demos, χαρακτηριστικά και δυνατότητες προϊόντων που η ηγεσία μπορεί να δει αμέσως.
Η συνέχεια, κατά定义, είναι αόρατη όταν τα πράγματα λειτουργούν καλά. Λόγω αυτού, τα συστήματα ανταμοιβής tend να είναι προκατειλημμένα προς την αποστολή νέων χαρακτηριστικών rather niż την εγγύηση ότι τίποτα δεν σπάει. Jako αποτέλεσμα, οι οργανώσεις συχνά επενδύουν αναλογικά περισσότερο στην ανάπτυξη ικανοτήτων rather niż στην ανθεκτικότητα.
Όταν οι επιχειρήσεις εξαρτώνται όλο και περισσότερο από εξωτερικά μοντέλα και API, ποίες νέες ευπαθής σημεία εισάγονται στο σωρό AI που οι ηγέτες μπορεί να μην εκτιμούν ακόμη;
Τα LLMs είναι ουσιαστικά κοινές πηγές, και οι επιχειρήσεις δεν τις κατέχουν όπως τις παραδοσιακές υποδομές. Επιπλέον, σημαντικά επιχειρηματικά συστήματα με τις επιχειρήσεις τρέχουν σε εξωτερικά συστήματα που δεν έχουν πλήρως δοκιμαστεί. Τα LLMs themselves εξελίσσονται γρήγορα, το οποίο σημαίνει ότι ένας παρόχος μοντέλου δεν μπορεί να θεωρηθεί υπεύθυνος για πράγματα όπως καθυστέρηση ή απόδοση μοντέλου που μειώνεται ελαφρώς, επειδή επεξεργάζονται γρήγορα την έρευνά τους.
Λόγω του ότι τα LLMs είναι κοινές πηγές, η καθυστέρηση μπορεί να αυξηθεί επειδή ένας άλλος καταναλωτής αυτών των LLMs λαμβάνει μια συγκεκριμένη ενέργεια. Υπάρχουν πολλά από αυτά τα σημεία αποτυχίας που εισάγονται λόγω της θεμελιώδους φύσης των LLMs, και οι επιχειρήσεις σε αυτόν τον νέο κόσμο απλώς δεν έχουν πλήρη έλεγχο. Χωρίς πλήρη έλεγχο, το καλύτερο που μπορεί να κάνει μια επιχείρηση είναι να δημιουργήσει αρκετές συστημικές διπλοίσεις για να σχεδιάσει ένα ανθεκτικό σύστημα.
Χωρίς να επικεντρωθεί σε συγκεκριμένα προϊόντα, πώς πρέπει οι οργανώσεις να ξανασκέφτονται την αρχιτεκτονική AI για να υποθέσουν αποτυχία αντί να αντιμετωπίσουν διακοπές ως σπάνιες περιπτώσεις;
Οι οργανώσεις πρέπει να επιστρέψουν στις αρχές του σχεδιασμού κατανεμημένων συστημάτων. Τα λογισμικά συστήματα κατασκευάζονται με την υπόθεση ότι τα στοιχεία δικτύου και οι μηχανές θα αποτύχουν, και ότι ένας ολόκληρος τομέας μπορεί να πάθει διακοπή.
Τα συστήματα AI δεν πρέπει να είναι διαφορετικά. Πρέπει να υποθέσουμε ότι οι παρόχοι μοντέλων θα αντιμετωπίσουν προβλήματα καθυστέρησης, επιδείνωσης ή διακοπής, και να ενσωματώσουμε διπλοίσεις ώστε οι εφαρμογές να παραμείνουν ανθεκτικές σε διάφορες περιπτώσεις αποτυχίας.
Περιμένετε η ανθεκτικότητα AI να γίνει ένας καθοριστικός παράγοντας στην επιλογή πλατφόρμας και προμηθευτή, παρόμοια με τον τρόπο που η διαθεσιμότητα και η διπλοίσεις έπαιξαν τον ρόλο τους στις αποφάσεις υποδομής cloud;
Όταν περισσότερα συστήματα AI μετακινούνται στην παραγωγή, η ανθεκτικότητα θα γίνει το βασικό στοιχείο. Αν ένας προμηθευτής δεν μπορεί να δείξει τα γραφήματα και τα μετρικά του για διαθεσιμότητα και συνολική ανθεκτικότητα, δεν θα θεωρηθεί καν. Μόλις η ανθεκτικότητα γίνει μια βασική προσδοκία σε όλους τους προμηθευτές, οι καθοριστικοί παράγοντες θα μετατοπιστούν προς την εμπειρία χρήστη, την βελτιστοποίηση απόδοσης, την παρακολούθηση και υψηλότερες ικανότητες προϊόντων. Με τον καιρό, στοιχεία όπως μια πύλη AI και αυτόματη δυνατότητα διακοπής θα γίνουν βασικά θεμελιώδη στοιχεία της επιχειρηματικής υποδομής AI.
Προβλέποντας, τι σημαίνει πραγματικά η “παραγωγή-έτοιμη” AI σε ένα κόσμο όπου η AI αναμένεται να είναι συνεχώς διαθέσιμη, όχι μόνο περιστασιακά χρήσιμη;
Τα συστήματα AI παραγωγής πρέπει να είναι παρατηρήσιμα, ελεγχόμενα και ανακτήσιμα. Όλα αυτά τα κουτιά πρέπει να ελέγχονται.
Για τα συστήματα AI παραγωγής να είναι παρατηρήσιμα, οι ομάδες χρειάζονται βαθιά ορατότητα στη συμπεριφορά μοντέλων, καθυστέρηση, ποσοστά σφαλμάτων, χρήσης token, μετατόπιση και μοτίβα αποτυχίας. Χωρίς ισχυρή παρατηρήσιμη, γίνεται πολύ δύσκολο να ανιχνευθούν επιδείνωσης πριν οι χρήστες αρχίσουν να τις παρατηρούν.
Για τα συστήματα να είναι ελεγχόμενα, αυτό περιλαμβάνει διαμόρφωση κυκλοφορίας, περιορισμό ρυθμού, φράγματα, επιβολή πολιτικής και έξυπνη δρομολόγηση μεταξύ μοντέλων και παρόχων. Αυτό είναι το σημείο όπου μια πύλη AI γίνεται θεμελιώδες, ενεργώντας ως một κεντρικό επίπεδο ελέγχου που επιβάλλει φράγματα, παρέχει συνεχή διακυβέρνηση και επιτρέπει δυναμική εναλλαγή μοντέλων όταν η απόδοση ή η αξιοπιστία μειώνεται.
Και τελευταίο, όταν πρόκειται για την ανάκτηση, τα συστήματα πρέπει να κατασκευαστούν με την υπόθεση ότι τα στοιχεία μπορούν να είναι μερικά ή πλήρως κατεστραμμένα, είτε λόγω διακοπής παρόχου, επιδείνωσης ποιότητας μοντέλου, ορίου ρυθμού ή απροσδόκητων εισόδων από κακόβουλους παράγοντες. Αυτόματες δυνατότητες διακοπής και αυτο-θεραπείας πρέπει να είναι εγγενείς στην αρχιτεκτονική, όχι χειροκίνητα βιβλία που ενεργοποιούνται μετά από κάτι που πάθει λάθος.
Αυτή είναι η κατεύθυνση που εργαζόμαστε στη TrueFoundry. Οι προμηθευτές που ορίζουν την ετοιμότητα παραγωγής με αυτόν τον τρόπο, συνδυάζοντας παρατηρήσιμη, κεντρικό έλεγχο και αυτόματη ανάκτηση, θα κερδίσουν την μακροχρόνια εμπιστοσύνη των πελατών και θα μπορέσουν να συνεχίσουν να λύνουν νέα ζητήματα καθώς εμφανίζονται.
Ευχαριστώ για τη μεγάλη συνέντευξη, οι αναγνώστες που επιθυμούν να μάθουν περισσότερα πρέπει να επισκεφθούν TrueFoundry.












