Συνεντεύξεις

Kismat Singh, Συνιδρυτής και Διευθύνων Σύμβουλος της MachGen AI – Σειρά Συνεντεύξεων

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Ο Kismat Singh, Συνιδρυτής και Διευθύνων Σύμβουλος της MachGen AI, είναι στελέχος υποδομών AI και μηχανικής με περισσότερα από δύο δεκαετίες εμπειρίας στην κατασκευή συστημάτων υψηλής απόδοσης υπολογιστών και μηχανικής μάθησης. Πριν συνιδρύσει τη MachGen AI, ο Singh υπηρέτησε ως Αντιπρόεδρος Μηχανικής για τα AI Frameworks στην Intel και προηγουμένως κατείχε ανώτερες θέσεις μηχανικής στις NVIDIA, AMD, HP και άλλες τεχνολογικές εταιρείες. Η δουλειά του περιλαμβάνει συνεισφορές σε βιβλιοθήκες βαθιάς μάθησης και μεταγλωττιστές, βελτιστοποίηση πλαισίων AI και βελτιώσεις στην ανθεκτικότητα της υπερκλιμάκωσης εκπαίδευσης. Στην Intel, συμμετείχε στενά στις πρωτοβουλίες της εταιρείας για το PyTorch και μίλησε δημόσια για το πώς να καταστήσει τα πλαίσια AI πιο προσιτά σε διαφορετικές πλατφόρμες υλικού.

MachGen AI είναι μια εταιρεία υποδομών AI που εστιάζει στο να κάνει τα γενετικά μοντέλα εικόνας και βίντεο δραματικά ταχύτερα και πιο οικονομικά στη λειτουργία. Ιδρύθηκε από τον Kismat Singh και τον Manoj Krishnan, η εταιρεία αναπτύσσει μια στοίβα υψηλής απόδοσης για inference και fine‑tuning ειδικά σχεδιασμένη για μοντέλα διάχυσης, αντί να προσαρμόζει υποδομές που αρχικά δημιουργήθηκαν για μεγάλα γλωσσικά μοντέλα. Η MachGen βελτιστοποιεί περιοχές όπως η υπολογιστική προσοχή, η προσωρινή αποθήκευση, οι πυρήνες GPU, η διαχείριση μνήμης, ο παραλληλισμός, ο προγραμματισμός και η ανάπτυξη, ώστε να μειώσει την καθυστέρηση παραγωγής διατηρώντας την ποιότητα του μοντέλου. Η πλατφόρμα της παρέχει API για κείμενο‑προς‑εικόνα, εικόνα‑προς‑εικόνα, κείμενο‑προς‑βίντεο, εικόνα‑προς‑βίντεο και αναφορά‑προς‑βίντεο, με την υποκείμενη τεχνολογία να στοχεύει στην ενεργοποίηση εφαρμογών χαμηλής καθυστέρησης όπως η διαδραστική δημιουργία περιεχομένου, τα άβατα σε πραγματικό χρόνο, τα παιχνίδια και η εξατομικευμένη διαφήμιση.

Έχετε περάσει πάνω από δύο δεκαετίες δουλεύοντας σε βίντεο, υπολογισμούς GPU και απόδοση AI, συμπεριλαμβανομένου του TensorRT στη NVIDIA, λογισμικού AI στην Intel, βελτιστοποίησης GPU στην AMD, και προηγούμενης εργασίας στην κωδικοποίηση βίντεο σε πραγματικό χρόνο. Τι παρατηρήσατε κατά τη διάρκεια αυτών των ετών που τελικά σας έπεισε να αφήσετε τις μεγάλες τεχνολογικές εταιρείες και να συνιδρύσετε τη MachGen, και γιατί πίστεψατε ότι η inference διάχυσης ήταν το πρόβλημα υποδομής που άξιζε να δημιουργηθεί μια εταιρεία γύρω του;

Ο συνιδρυτής μου Manoj και εγώ παίζαμε μπάντμιντον στην ίδια γυμναστική αίθουσα για σχεδόν 10 χρόνια. Για το μεγαλύτερο μέρος εκείνου του χρόνου, προσπαθούσαμε να προσλάβουμε ο ένας τον άλλον. Τελικά αποφασίσαμε ότι ήταν πιο εύκολο να συνεργαστούμε μεταξύ μας παρά να συνεχίσουμε να προσλαμβάνουμε ο ένας τον άλλον.

Ο λόγος που επιλέξαμε αυτό το πρόβλημα είναι ότι και οι δύο έχουμε παρακολουθήσει την εξέλιξη μιας στοίβας inference από το εσωτερικό. Βοήθησα στην κατασκευή της ομάδας πλατφόρμας inference της NVIDIA και στη συνέχεια ηγήθηκα του λογισμικού AI στην Intel. Ο Manoj ανέπτυξε την υποδομή εκπαίδευσης μεγάλων μοντέλων πίσω από το PyTorch στη Meta. Παρακολουθήσαμε χρόνια εργασίας σε προσωρινή αποθήκευση, ομαδοποίηση, προγραμματισμό και πυρήνες, που μετέτρεψαν τα πρώιμα ερευνητικά συστήματα LLM σε υποδομή παραγωγής που εξυπηρετεί τρισεκατομμύρια διακριτικά.

Η διάχυση βρίσκεται περίπου εκεί που ήταν η inference των LLM πριν τρία χρόνια. Τα μοντέλα εικόνας και βίντεο έχουν προοδεύσει γρήγορα, αλλά τα συστήματα που τα εξυπηρετούν παραμένουν αργά, ακριβά και δύσκολα στην κλιμάκωση. Οι περισσότερες υπάρχουσες υποδομές σχεδιάστηκαν για LLM, με τη διάχυση να προστίθεται αργότερα.

Τρία πράγματα που έκαναν το χρονικό σημείο σωστό: τα μοντέλα έγιναν αρκετά καλής ποιότητας για να δημιουργηθούν πραγματικά προϊόντα, το πρόβλημα απαιτούσε ακριβώς τις δεξιότητες που έχουμε αφιερώσει τις καριέρες μας στην ανάπτυξή τους, και ο αντίκτυπος είναι τόσο μεγάλος ώστε να στηριχθεί μια γενεαλογική εταιρεία. Όταν ένα βίντεο που κάποτε απαιτούσε αρκετά λεπτά μπορεί να παραχθεί σε δευτερόλεπτα με ένα κλάσμα του κόστους, η διαδραστική παραγωγή, η εξατομικευμένη διαφήμιση, τα άβατα σε πραγματικό χρόνο και εντελώς νέα δημιουργικά προϊόντα γίνονται εφικτά.

Η MachGen υποστηρίζει ότι πολλές από τις τεχνικές που μεταμόρφωσαν την inference μεγάλων γλωσσικών μοντέλων δεν μεταφέρονται καθαρά σε μοντέλα διάχυσης. Τι είναι θεμελιωδώς διαφορετικό στην εξυπηρέτηση μοντέλων εικόνας και βίντεο, και πού βρίσκονται τα μεγαλύτερα εμπόδια απόδοσης που η συμβατική υποδομή AI τείνει να παραβλέπει;

Τα LLM και τα μοντέλα διάχυσης έχουν θεμελιωδώς διαφορετικά υπολογιστικά πρότυπα. Τα LLM είναι αυτοπαλινδρομικά, με μια προφόρτωση βαριάς υπολογιστικής απαισίας ακολουθούμενη από αποκωδικοποίηση περιορισμένης μνήμης, διακριτικό προς διακριτικό. Τεχνικές όπως η προσωρινή αποθήκευση KV και η αποσύνδεση προφόρτωσης/αποκωδικοποίησης σχεδιάστηκαν γύρω από αυτή τη δομή.

Τα μοντέλα διάχυσης δεν είναι αυτοπαλινδρομικά και παραμένουν περιορισμένα από τον υπολογισμό καθ’ όλη τη διαδικασία αποθορύβωσης. Η δημιουργία βίντεο περιλαμβάνει επίσης μεγάλες ποσότητες χωρικών και χρονικών δεδομένων, δημιουργώντας διαφορετικές απαιτήσεις όσον αφορά την προσοχή, τη μνήμη, την επικοινωνία και τον παραλληλισμό.

Ως αποτέλεσμα, πολλές από τις βελτιστοποιήσεις που αναπτύχθηκαν για τα LLM δεν μεταφέρονται καθαρά. Η συμβατική προσωρινή αποθήκευση KV δεν λύνει το ίδιο πρόβλημα, ο τυπικός παραλληλισμός μπορεί να εισάγει σημαντικό κόστος επικοινωνίας, και οι διαθέσιμοι ανοιχτού κώδικα πυρήνες είναι πολύ λιγότερο ώριμοι. Ο προγραμματιστής, το μοντέλο μνήμης, η στρατηγική προσωρινής αποθήκευσης, οι πυρήνες και ο παραλληλισμός πρέπει όλα να σχεδιαστούν γύρω από τη διάχυση αυτή καθαυτή. Γι’ αυτό χτίσαμε τη MachGen με τη διάχυση ως κύριο στοιχείο.

Η MachGen αναφέρει περίπου 4–6 φορές χαμηλότερη καθυστέρηση σε ορισμένα μοντέλα εικόνας και περίπου 6 φορές βελτιώσεις σε αρκετά μοντέλα βίντεο ενώ τρέχει τα αρχικά, αδιαλύτα μοντέλα. Ποιες είναι οι πιο σημαντικές τεχνικές καινοτομίες πίσω από αυτά τα κέρδη, και πώς διασφαλίζετε ότι οι βελτιώσεις απόδοσης δεν έρχονται εις βάρος της ποιότητας του αποτελέσματος;

Τα κέρδη προέρχονται από πολλαπλά τμήματα της στοίβας που λειτουργούν από κοινού. Η προσοχή κυριαρχεί στον προϋπολογισμό υπολογισμού σε πολλά μοντέλα βίντεο, γι’ αυτό εστιάζουμε σε συνταγές χαμηλότερης ακρίβειας, σπάνια προσοχή και σχετικές τεχνικές. Έχουμε επίσης αναπτύξει μεθόδους προσωρινής αποθήκευσης που εκμεταλλεύονται την χωρική και χρονική πλεοναστικότητα, εξαιρετικά βελτιστοποιημένους πυρήνες για αρχιτεκτονικές διάχυσης και τεχνικές παραλληλισμού που μειώνουν το κόστος επικοινωνίας.

Μαζί, αυτές οι βελτιώσεις επιτρέπουν στο MachGen να παραδίδει το HiDream σε ένα δευτερόλεπτο αντί για έξι δευτερόλεπτα και το Flux σε 1,5 δευτερόλεπτα αντί για 6,2 δευτερόλεπτα. Για βίντεο, το Wan 2.2 εκτελείται σε 16,5 δευτερόλεπτα αντί για 98 δευτερόλεπτα, ενώ το LTX 2.3 σε 10,7 δευτερόλεπτα αντί για 67 δευτερόλεπτα. Το κόστος εκτέλεσης είναι επίσης 2–4 φορές χαμηλότερο για μοντέλα εικόνας και 2–3 φορές χαμηλότερο για βίντεο.

Αυτά τα αποτελέσματα χρησιμοποιούν τα αρχικά, μη αποσταγμένα μοντέλα. Βελτιώνουμε τον τρόπο λειτουργίας των μοντέλων χωρίς να θυσιάζουμε την ποιότητα του αποτελέσματος. Για την υιοθέτηση στην παραγωγή, η ταχύτητα, το κόστος και η ποιότητα πρέπει να λειτουργούν από κοινού.

Το Trusted TV αποτελεί ένα ενδιαφέρον παράδειγμα, επειδή η μείωση της δημιουργίας από λεπτά σε δευτερόλεπτα αλλάζει περισσότερα από το λογαριασμό υποδομής. Μόλις η δημιουργία βίντεο γίνει αρκετά γρήγορη ώστε να παράγει χιλιάδες καμπάνιες και εξατομικευμένες δημιουργικές παραλλαγές, ποια νέα επιχειρηματικά μοντέλα ή προϊόντικές εμπειρίες γίνονται εφικτά που προηγουμένως δεν ήταν βιώσιμα;

Το TrustedTV βοηθά τις επιχειρήσεις να δημιουργούν διαφημίσεις έτοιμες για εκπομπή με AI και να τις τοποθετούν σε πλατφόρμες συνδεδεμένης τηλεόρασης όπως το Prime Video, το Roku και το DirecTV. Πολλοί από τους πελάτες του είναι μικρές επιχειρήσεις. Η παραδοσιακή δημιουργία τηλεδιαφημίσεων απαιτούσε ομάδα κινηματογράφησης και μοντάζ, με κόστος που ξεκινούσε από χιλιάδες δολάρια και συνήθως έφτανε τις δεκάδες χιλιάδες. Το Trusted TV το φέρνει στο μηδέν. Ένας μικρός επιχειρηματίας μπορεί να δημιουργήσει μια πλήρη διαφήμιση από ένα smartphone σε περίπου πέντε λεπτά και να τη δει πριν πληρώσει οτιδήποτε. Πάνω από 10.000 καμπάνιες έχουν δημιουργηθεί στην πλατφόρμα.

Ο Ian, διευθύνων σύμβουλος του Trusted TV, είδε το benchmark καθυστέρησης του MachGen στο Artificial Analysis και δεν το πίστευε. Εγγράφηκε για να το δοκιμάσει ο ίδιος. Η πρώτη του απόδοση ήρθε πίσω σε περίπου 25 δευτερόλεπτα χωρίς απώλεια ποιότητας, και όταν έκανε δοκιμές ταυτόχρονης εκτέλεσης, οι βελτιώσεις διατηρήθηκαν σε κλίμακα. Μετακίνησαν ολόκληρη τη ροή παραγωγής τους στο MachGen σε λιγότερο από 48 ώρες, και το MachGen τροφοδοτεί τώρα όλη τη νέα δημιουργία βίντεο τους. Στην πιο πρόσφατη υλοποίηση, είμαστε κοντά στα 10 ή 11 δευτερόλεπτα για αυτό το μοντέλο, και θα συνεχίσουμε να το βελτιώνουμε.

Το αποτέλεσμα για το προϊόν είναι ότι οι διαφημιστές σταματούν να δημιουργούν μία ή δύο γενικές διαφημίσεις. Οι χρήστες τους βλέπουν δύο ή τρεις νέες διαφημίσεις την εβδομάδα, δοκιμάζουν δημιουργικά σε διαφορετικά τμήματα κοινού και επαναλαμβάνουν αντί να δεσμεύονται. Το επόμενο βήμα είναι η γεωγραφική και προσωπική προσαρμογή σε επίπεδο κοινού σε κλίμακα, κάτι που προηγουμένως ήταν δυνατό μόνο για εταιρείες με προϋπολογισμούς πολλαπλών εκατομμυρίων δολαρίων.

Μια εκδοχή που σκέφτομαι προσωπικά: Σήμερα, λαμβάνω μια διαφήμιση παπουτσιών που τραβήχτηκε σε έναν δρόμο στο Manhattan. Ζω στην περιοχή του Κόλπου, οπότε δεν έχει νόημα για μένα. Θα ήθελα την ίδια διαφήμιση με το Mission Peak στο παρασκήνιο. Δεν είναι μια φθηνότερη διαφήμιση· είναι ένας διαφορετικός τύπος διαφήμισης, και γίνεται οικονομικά βιώσιμη μόνο όταν η δημιουργία είναι τόσο γρήγορη και φθηνή ώστε να παράγει χιλιάδες παραλλαγές.

Για εταιρείες που ενσωματώνουν τη δημιουργία εικόνας ή βίντεο απευθείας στα προϊόντα τους, πώς πρέπει να σκέφτονται την οικονομία της εκτέλεσης; Σε ποιο επίπεδο κλίμακας η βελτιστοποίηση της χρήσης GPU γίνεται στρατηγικά σημαντική αντί να πληρώνουν απλώς έναν πάροχο API για κάθε δημιουργία;

Το σημείο καμπής έρχεται όταν η εκτέλεση αρχίζει να επηρεάζει είτε την εμπειρία του πελάτη είτε τα περιθώρια κέρδους της εταιρείας.

Ένα γενικού σκοπού API μπορεί να έχει νόημα ενώ μια ομάδα επικυρώνει ένα προϊόν. Μόλις η δημιουργία γίνει κεντρική για το προϊόν, οι ομάδες πρέπει να κοιτάξουν πέρα από την αναγραφόμενη τιμή ανά έξοδο. Η καθυστέρηση, η ταυτόχρονη εκτέλεση, η ποιότητα, η αξιοπιστία και η χρήση GPU γίνονται όλα μέρος της οικονομίας.

Μια δημιουργία μπορεί να φαίνεται φθηνή, αλλά δημιουργεί επιχειρηματικό πρόβλημα αν οι χρήστες πρέπει να περιμένουν αρκετά λεπτά και εγκαταλείπουν τη ροή εργασίας. Μια αρχιτεκτονική που απαιτεί την αύξηση της χωρητικότητας GPU με τον ίδιο ρυθμό με τη χρήση θα ασκεί επίσης αυξανόμενη πίεση στα περιθώρια κέρδους.

Δεν υπάρχει ένα ενιαίο όριο όγκου αιτήσεων, επειδή η υπολογιστική ισχύς που απαιτείται για ένα σύντομο κλιπ 540p διαφέρει πολύ από ένα μακρύτερο βίντεο 1080p. Η βελτιστοποίηση γίνεται στρατηγική όταν η αυξανόμενη χρήση προκαλεί το κόστος να αυξάνεται σχεδόν με τον ίδιο ρυθμό, η αιχμή της ζήτησης δημιουργεί ουρές ή η καθυστέρηση αρχίζει να περιορίζει την εμπειρία του προϊόντος.

Το MachGen λειτουργεί σε πολλαπλά επίπεδα, συμπεριλαμβανομένων προσαρμοσμένων πυρήνων GPU, προσωρινής αποθήκευσης, βελτιστοποίησης ακρίβειας, προγραμματισμού και παραλληλισμού. Καθώς τα μοντέλα εξελίσσονται γρήγορα, ποιο επίπεδο της στοίβας εκτέλεσης πιστεύετε ότι προσφέρει τη μεγαλύτερη υπόλοιπη ευκαιρία για δραματικές βελτιώσεις στην ταχύτητα και το κόστος;

Για τη δημιουργία βίντεο, η προσοχή αποτελεί μία από τις μεγαλύτερες υπόλοιπες ευκαιρίες, επειδή κυριαρχεί στον προϋπολογισμό υπολογισμού σε πολλά μοντέλα. Υπάρχει ακόμη σημαντικός χώρος για βελτίωση των συνταγών χαμηλότερης ακρίβειας, της σπάνιας προσοχής και των πυρήνων προσοχής ειδικά για διάχυση.

Η προσοχή είναι μόνο ένα μέρος της ευκαιρίας. Τα μεγαλύτερα συνολικά κέρδη θα προκύψουν από τον συνδυασμό βελτιώσεων σε όλη τη στοίβα. Η προσωρινή αποθήκευση είναι ένα παράδειγμα. Οι τεχνικές προσωρινής αποθήκευσης KV που χρησιμοποιούνται στα LLM δεν μεταφέρονται άμεσα, αλλά τα μοντέλα διάχυσης περιέχουν χωρική και χρονική πλεοναστικότητα που μπορεί να εκμεταλλευτεί με τη σωστή προσέγγιση.

Η παράλληλη εκτέλεση προσφέρει μια ακόμη ευκαιρία. Η προσθήκη GPU δεν οδηγεί αυτόματα σε ανάλογη επιτάχυνση, επειδή το κόστος επικοινωνίας μπορεί να αντισταθμίσει το όφελος. Αναπτύσσουμε προσαρμοσμένους πυρήνες που επικαλύπτουν την επικοινωνία με υπολογισμούς ανεξάρτητους από τα δεδομένα και τη διασυνδέουν με εργασίες εξαρτημένες από τα δεδομένα.

Η προσοχή, η προσωρινή αποθήκευση, οι πυρήνες, η παράλληλη εκτέλεση, η μνήμη και ο προγραμματισμός επηρεάζουν αλληλοεπιδραστικά μεταξύ τους. Η βελτιστοποίηση μόνο ενός επιπέδου τελικά δημιουργεί ένα στενό σημείο κάπου αλλού. Οι μεγαλύτερες βελτιώσεις θα προκύψουν από την αντιμετώπιση του στοίβας ως ολοκληρωμένου συστήματος σχεδιασμένου για το υπολογιστικό προφίλ της διάχυσης.

Καθώς τα νεότερα μοντέλα βίντεο μειώνουν τους χρόνους δημιουργίας κοντά σε πραγματικό χρόνο, πόσο κοντά είμαστε σε πραγματικά διαδραστικό γενετικό βίντεο και ποιες τεχνικές προκλήσεις πρέπει ακόμη να ξεπεραστούν πριν η δημιουργία βίντεο σε πραγματικό χρόνο γίνει κοινή πρακτική;

Ήδη φτάνουμε σε διαδραστικές ταχύτητες για ορισμένες εφαρμογές. Το MachGen δημιουργεί ένα πεντάλεπτο βίντεο Vidu Q3 Turbo σε 720p περίπου σε έξι δευτερόλεπτα και σε 540p σε λιγότερο από τρία. Αυτό είναι αρκετά γρήγορο για γρήγορη δημιουργική επανάληψη και φέρνει κοντά τα ανταποκρινόμενα άβαταρ και το διαδραστικό βίντεο.

Ένα παράδειγμα του τι θεωρώ διαδραστικό. Φανταστείτε ότι παρακολουθείτε μια ιστορία, μπορείτε να δείτε πού κατευθύνεται το τέλος και δεν σας αρέσει. Αντί να παραμένετε παθητικά, την ανακατευθύνετε: αυτοί οι δύο χαρακτήρες πρέπει να ανακαλύψουν τι κρύβει ο τρίτος και να τον αντιμετωπίσουν αντί να αφήσουν την υπόθεση να εξελιχθεί αυτόματα. Περιεχόμενο που εσείς καθοδηγείτε αντί για περιεχόμενο που λαμβάνετε. Αυτό είναι αυτό που καθιστά δυνατή η γρήγορη, φθηνή παραγωγή και αλλάζει σχεδόν τα πάντα που καταναλώνουμε.

Η επίτευξη αυτού συνήθως απαιτεί περισσότερα από ένα αξιόπιστα μέτρα καθυστέρησης. Η συνολική εμπειρία πρέπει να παραμένει ανταποκρινόμενη υπό παραγωγική κίνηση, διατηρώντας την οπτική ποιότητα, τη συνέπεια μεταξύ καρέ και το προβλέψιμο κόστος. Μεγαλύτερα βίντεο, υψηλότερες αναλύσεις και ταυτόχρονες αιτήσεις αυξάνουν το βάρος της υποδομής, ενώ το σύστημα πρέπει ακόμη να προμηθεύει χωρητικότητα, να δρομολογεί αιτήσεις και να ανακάμπτει από αποτυχίες υλικού χωρίς να το παρατηρήσει ο χρήστης.

Θα φτάσει περίπτωση προς περίπτωση. Τα σύντομα κλιπ, τα άβαταρ, τα παιχνίδια και τα δημιουργικά εργαλεία είναι πιθανό να είναι τα πρώτα, επειδή η δημιουργία σε δευτερόλεπτα είναι ήδη επαρκής για αυτά. Καθώς η ποιότητα των μοντέλων και η απόδοση της επαγωγής βελτιώνονται ταυτόχρονα, περισσότερες εφαρμογές θα ξεπεράσουν αυτό το όριο.

Καθώς οι AI‑πράκτορες παράγουν ολοένα και περισσότερο εικόνες και βίντεο αυτόνομα, αντί να περιμένουν έναν άνθρωπο να πατήσει ένα κουμπί, πώς αλλάζουν οι απαιτήσεις της υποδομής; Δημιουργούν τα φορτία εργασίας που οδηγούνται από πράκτορες θεμελιωδώς διαφορετικές απαιτήσεις όσον αφορά την καθυστέρηση, τη συνάφεια, το κόστος και την αξιοπιστία;

Ένας πράκτορας μετατρέπει ένα μοναδικό αίτημα χρήστη σε δεκάδες ή εκατοντάδες εργασίες δημιουργίας. Δημιουργεί πολλές επιλογές, τις αξιολογεί, τροποποιεί την προτροπή και επαναλαμβάνει τη διαδικασία, χωρίς ανθρώπινη παρέμβαση μεταξύ των βημάτων.

Αυτό καθιστά την καθυστέρηση, τη συνάφεια, το κόστος και την αξιοπιστία πολύ πιο σημαντικά. Αν κάθε δημιουργία διαρκεί λεπτά, η ροή εργασίας του πράκτορα είναι πολύ αργή για να είναι χρήσιμη. Αν κάθε προσπάθεια είναι δαπανηρή, η αυτόνομη επανάληψη γίνεται οικονομικά μη πρακτική. Το σύστημα πρέπει επίσης να διαχειρίζεται αξιόπιστα πολλές ταυτόχρονες αιτήσεις, επειδή μια αποτυχία μπορεί να διακόψει ολόκληρη την αλυσίδα εργασίας.

Εδώ οι δυνατότητες όπως η παροχή GPU, η αυτόματη κλιμάκωση και η δρομολόγηση έχουν σημασία εξίσου με τη βελτιστοποίηση σε επίπεδο μοντέλου. Η ζήτηση από πράκτορες είναι πολύ πιο «εκρήγνυμη» από τη ζήτηση μιας δημιουργικής εφαρμογής όπου ένας χρήστης πατάει ένα κουμπί.

Η σχετική μονάδα εργασίας δεν είναι πλέον μια μοναδική εικόνα ή βίντεο. Είναι ο πλήρης κύκλος δημιουργίας, αξιολόγησης και βελτίωσης του περιεχομένου. Η υποδομή πρέπει να κάνει ολόκληρο αυτόν τον κύκλο γρήγορο, προσιτό και αξιόπιστο.

Υπάρχει έντονος ανταγωνισμός μεταξύ παρόχων GPU, υπηρεσιών inference cloud, δημιουργών μοντέλων και πλατφορμών βελτιστοποίησης. Καθώς το ίδιο το υλικό γίνεται ταχύτερο, γιατί οι εταιρείες θα χρειάζονται ακόμη ένα εξειδικευμένο επίπεδο inference όπως το MachGen αντί να βασίζονται στις βελτιώσεις από τη NVIDIA, την AMD, τους παρόχους cloud ή τους ίδιους τους δημιουργούς μοντέλων;

Το ταχύτερο υλικό αυξάνει το ανώτατο όριο. Το λογισμικό καθορίζει πόσο από αυτό το όριο θα επιτευχθεί.

Το είδαμε να συμβαίνει με τα LLM. Νέοι επιταχυντές βελτίωσαν την ακατέργαστη απόδοση σε κάθε γενιά, ενώ η συνεχής ομαδοποίηση, η διαχείριση της KV‑cache, η εικαστική αποκωδικοποίηση και οι εξειδικευμένοι πυρήνες ήταν ακόμη αυτά που έφεραν τη βιομηχανία σε παραγωγικό επίπεδο απόδοσης και οικονομίας. Τίποτα από αυτά δεν προήλθε από το υλικό.

Η συνεχής βελτιστοποίηση ολόκληρης της παραγωγικής διαδρομής για τη δημιουργία εικόνας και βίντεο είναι διαφορετική εργασία από αυτή που κάνουν οι προμηθευτές υλικού, οι πάροχοι cloud και οι δημιουργοί μοντέλων, και δεν αποτελεί βασική προτεραιότητα για κανέναν από αυτούς.

Υπάρχουν μερικές προσεγγίσεις για αυτή τη δουλειά. Μία είναι το μοντέλο αγοράς, όπου τα μοντέλα συγκεντρώνονται και δρομολογούν αιτήσεις. Δεν το θεωρούμε βιώσιμο μακροπρόθεσμα, επειδή δεν υπάρχει έλεγχος πάνω στο επίπεδο όπου ζει η απόδοση. Επιλέξαμε να χτίσουμε το στοίβα μας μόνοι μας και να το φιλοξενήσουμε εγγενώς, κάτι που είναι ο μόνος τρόπος για να επιτύχουμε τις τιμές καθυστέρησης και κόστους που παρατηρούμε.

Αυτό σημαίνει ρύθμιση της προσοχής, της προσωρινής αποθήκευσης, των πυρήνων, της ακρίβειας, της μνήμης και του παραλληλισμού ανά μοντέλο και ανά επιταχυντή, καθώς και υποστήριξη διαχειριζόμενων API, αφιερωμένου cloud και αυτο-φιλοξενημένης ανάπτυξης. Καθώς αυξάνεται ο αριθμός των μοντέλων και των επιλογών υλικού, αυξάνεται και η πολυπλοκότητα. Ο ρόλος μας είναι να το απορροφήσουμε ώστε οι πελάτες μας να μπορούν να αφιερώνουν τον χρόνο τους σε ό,τι διαφοροποιεί τα προϊόντα τους.

Έχετε περιγράψει τα world models ως μέρος της μακροπρόθεσμης όρασης της MachGen, με πολλές από τις υπολογιστικές τους ιδιότητες να μοιάζουν με φορτία διάχυσης. Πώς πρέπει να είναι η υποδομή για world models κλίμακας παραγωγής και ποιες εφαρμογές γίνονται εφικτές εάν η δημιουργία και προσομοίωση οπτικών περιβαλλόντων τελικά γίνει τόσο φθηνή και ανταποκριτική όσο η δημιουργία κειμένου είναι σήμερα;

Ένας τρόπος να σκεφτούμε την πλατφόρμα μας είναι παρόμοιος με ένα γενικού σκοπού LLM. Το ίδιο μοντέλο συντάσσει μια νομική σύμβαση και απαντά σε ερώτηση σχετικά με εστιατόρια. Για εμάς, η ίδια στοίβα εξυπηρετεί εταιρείες βίντεο-αβατάρ, διαφημίσεις AI, δημιουργία ιστοριών και μικροδράματος, και τελικά world models. Διαφορετικοί κλάδοι, ένα σύνολο υποκείμενων προβλημάτων απόδοσης.

Τα world models δεν αποτελούν σήμερα τον κύριο τομέα μας, αλλά είναι προς τα οποία χτίζουμε και εργαζόμαστε ενεργά. Τα world models κλίμακας παραγωγής θα χρειάζονται εξαιρετικά υψηλό ρυθμό διαμεταγωγής και πολύ χαμηλή καθυστέρηση, επειδή δημιουργούν και ενημερώνουν συνεχώς ένα περιβάλλον αντί να παράγουν ένα μόνο αποτέλεσμα. Χρειάζονται επίσης χωρική και χρονική συνέπεια, τη δυνατότητα ανταπόκρισης σε ενέργειες, και συχνά τη δυνατότητα προσομοίωσης πολλαπλών πιθανών αποτελεσμάτων ταυτόχρονα. Αυτό δημιουργεί δύσκολα προβλήματα στη μνήμη, τη μετακίνηση δεδομένων, τον παραλληλισμό και την αξιοπιστία. Ένα world model που οδηγεί ρομπότ ή παιχνίδι δεν μπορεί να χρειάζεται λεπτά για να παραγάγει την επόμενη κατάσταση. Η απόδοση αποφασίζει αν αυτά τα συστήματα είναι καθόλου χρησιμοποιήσιμα.

Από υπολογιστική άποψη, τα σημερινά world models μοιάζουν πολύ με μοντέλα διάχυσης, έτσι η στοίβα που χτίζουμε τώρα αποτελεί τη φυσική βάση. Δεν υπάρχει ακόμη ώριμο επίπεδο εξυπηρέτησης παραγωγικής κλίμακας για αυτά, συγκρίσιμο με ό,τι υπάρχει για τα LLM. Σκοπεύουμε να το δημιουργήσουμε.

Εάν η προσομοίωση γίνει τόσο ανταποκριτική και προσιτή όσο η δημιουργία κειμένου είναι τώρα, τα ρομπότ μπορούν να εξασκηθούν σε σπάνιες καταστάσεις πριν τις αντιμετωπίσουν, τα παιχνίδια μπορούν να δημιουργούν περιβάλλοντα που ανταποκρίνονται σε ατομικούς παίκτες, και οι σχεδιαστές μπορούν να δοκιμάσουν δεκάδες δυνατότητες πριν τις υλοποιήσουν στον φυσικό κόσμο. Η διάχυση είναι όπου κερδίζουμε τη ζωή μας σήμερα. Τα world models είναι το Βόρειο Αστέρι μας.

Σας ευχαριστούμε για τη σπουδαία συνέντευξη, οι αναγνώστες που θέλουν να μάθουν περισσότερα θα πρέπει να επισκεφθούν MachGen AI.

Ο Antoine είναι ένας οραματιστής ηγέτης και συνιδρυτής της Unite.AI, οδηγείται από μια αμετάβλητη страсть για το σχήμα και την προώθηση του μέλλοντος της τεχνητής νοημοσύνης και της ρομποτικής. Ένας σειριακός επιχειρηματίας, πιστεύει ότι η τεχνητή νοημοσύνη θα είναι τόσο διαταρακτική για την κοινωνία όσο και η ηλεκτρική ενέργεια, και συχνά πιάνεται να μιλάει για το δυναμικό των διαταρακτικών τεχνολογιών και της AGI.

Ως μελλοντολόγος, είναι αφιερωμένος στο να εξερευνήσει πώς αυτές οι καινοτομίες θα σχήματίσουν τον κόσμο μας. Επιπλέον, είναι ο ιδρυτής του Securities.io, μιας πλατφόρμας που επικεντρώνεται στις επενδύσεις σε ακριβές τεχνολογίες που ανασχεδιάζουν το μέλλον και αναμορφώνουν ολόκληρες βιομηχανίες.