Μοντέλα και πλατφόρμες AI

Το Μέλλον της Ασύρματης Ανάπτυξης για Μεγάλες Γλωσσικές Μοντέλα

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Οι πρόσφατες προόδους στις μεγάλες γλωσσικές μοντέλα (LLMs) όπως το GPT-4, το PaLM έχουν οδηγήσει σε μετασχηματιστικές ικανότητες στις φυσικές γλώσσες. Τα LLMs ενσωματώνονται σε διάφορες εφαρμογές όπως chatbots, μηχανές αναζήτησης και βοηθοί προγραμματισμού. Ωστόσο, η εξυπηρέτηση των LLMs σε κλίμακα παραμένει μια πρόκληση λόγω των σημαντικών απαιτήσεων GPU και μνήμης.

Οι προσεγγίσεις για την υπέρβαση αυτής της πρόκλησης γενικά διακρίνονται σε δύο κύριες κατηγορίες:

  1. Τεχνικές Συμπίεσης Μοντέλου

Αυτές οι τεχνικές στοχεύουν στη μείωση του μεγέθους του μοντέλου διατηρώντας την ακρίβεια. Συνηθισμένες προσεγγίσεις περιλαμβάνουν:

  • Κόψιμο – Αφαίρεση των περιττών ή λιγότερο σημαντικών παραμέτρων από το μοντέλο. Αυτό δημιουργεί ένα σπαρσό μοντέλο με λιγότερες παραμέτρους.
  • Κυματιστικό – Χρήση αριθμών χαμηλότερης ακρίβειας όπως int8 ή bfloat16 για την αναπαράσταση βαρών αντί για fp32 ή fp16. Αυτό μειώνει το αποτύπωμα μνήμης.
  • Διάχυση Γνώσης – Εκπαίδευση ενός μικρότερου “μαθητή” μοντέλου να μιμείται ένα μεγάλο “δάσκαλο” μοντέλο. Το μικρότερο μοντέλο χρησιμοποιείται στη συνέχεια για την ανάκτηση.
  1. Επιλεκτική Εκτέλεση

Αντί για συμπιεσμένα μοντέλα, αυτές οι τεχνικές επιλέγουν την εκτέλεση μόνο τμήματος του μοντέλου ανά ανάκτηση:

  • Σπαρσές Ενεργοποιήσεις – Παραλείποντας τον υπολογισμό για μηδενικές ενεργοποιήσεις.
  • Συμπεριφορική Εκτέλεση – Εκτέλεση μόνο ορισμένων στρωμάτων με βάση την είσοδο.

Στην συμπληρωματική πλευρά ως προς την αρχιτεκτονική του λογισμικού, για να ενεργοποιηθεί η ταχύτερη ανάπτυξη των LLMs, οι ερευνητές έχουν προτείνει συστήματα ανάκτησης χωρίς διακομιστή. Σε αρχιτεκτονικές χωρίς διακομιστή, τα LLMs φιλοξενούνται σε κοινές κλίκες GPU και ανατίθενται δυναμικά με βάση την ζήτηση. Αυτό επιτρέπει την αποτελεσματική αξιοποίηση των GPU και μειώνει το κόστος για τους développers. Προεξάρχουσες υλοποιήσεις περιλαμβάνουν το Amazon (AMZN ) SageMaker, το Microsoft Azure ML και ανοιχτές επιλογές όπως το KServe.

Παρά την υπόσχεση των LLMs χωρίς διακομιστή, τα υπάρχοντα συστήματα παρουσιάζουν υψηλές επιβαρύνσεις καθυστέρησης που μειώνουν την εμπειρία του χρήστη στις διαδραστικές εφαρμογές:

  1. Δαπανηρές Λήψεις Σημείων: Τα LLMs έχουν μεγάλο αποτύπωμα μνήμης, συχνά μεγαλύτερο από gigabytes έως terabytes. Η λήψη σημείων από απομακρυσμένη αποθήκευση είναι χρονοβόρα, διαρκώντας πάνω από 20 δευτερόλεπτα ακόμη και με βελτιωμένα δίκτυα.
  2. Ανεφάρμοστη Φόρτωση Σημείων: Ακόμη και με τοπική αποθήκευση SSD, η φόρτωση σημείων στη μνήμη GPU διαρκεί δεκάδες δευτερόλεπτα λόγω παραγόντων όπως η αποσύνθεση των tensores και η ανάθεση. Αυτό προστίθεται σε σημαντικές καθυστερήσεις πέρα από τον χρόνο εκκίνησης του контέινερ.

Για να αντιμετωπιστούν αυτά τα ζητήματα, ερευνητές στο MIT CSAIL πρότειναν το ServerlessLLM, ένα καινοτόμο σύστημα που επιτυγχάνει χαμηλή καθυστέρηση ανάκτησης χωρίς διακομιστή για LLMs. Το ServerlessLLM ενισχύει τη τοπικότητα εκμεταλλευόμενο την αφθονία αλλά υποεκμεταλλευμένη ικανότητα και εύρος ζώνης στη πολυβάθμια αποθήκευση διακομιστή για την ανάπτυξη LLM.

Επισκόπηση συστημάτων ανάκτησης LLM χωρίς διακομιστή

Επισκόπηση συστημάτων ανάκτησης LLM χωρίς διακομιστή

Κλειδιά Καινοτομίες στο ServerlessLLM Το ServerlessLLM ενσωματώνει διάφορες καινοτόμες σχεδιαστικές για να μειώσει τους χρόνους φόρτωσης LLM σε περιβάλλοντα χωρίς διακομιστή:

  1. Γρήγορη Φόρτωση Σημείων
  • Μορφή φόρτωσης-βελτιστοποιημένου σημείου που επιτρέπει τη γρήγορη ακολουθιακή ανάγνωση και την αποτελεσματική διεύθυνση τενσορών στη μνήμη.
  • Πipeline φόρτωσης σημείων πολλαπλών επιπέδων που μεγιστοποιεί την αξιοποίηση του εύρους ζώνης σε δίκτυο, SSD, DRAM και μνήμη GPU μέσω τεχνικών όπως η άμεση Εισαγωγή/Εξαγωγή, η μεταφορά μνήμης με πινακίδες και η παραλληλία.
  1. Ζωντανή Μετανάστευση για Τοπικότητα-Οδηγούμενη Ανάκτηση
  • Μετανάστευση με βάση τοκεν που μεταφέρει μόνο τα απαραίτητα προrompt τοκεν πάνω στο δίκτυο, αποφεύγοντας την αργή μεταφορά σναπσότ.
  • Διφασική μετανάστευση που επιτρέπει την αδιάκοπη ανάκτηση με την ασύγχρονη επαναυπολογισμό των καταστάσεων cache στον προορισμό διακομιστή πριν από τη μεταφορά των τελικών τοκεν.
  1. Λατρεία-Βελτιστοποιημένη Ανάθεση Διακομιστή
  • Ακρίβεια μοντέλα για την εκτίμηση χρόνων φόρτωσης σημείων από κάθε επίπεδο και χρόνων μετανάστευσης για einen διακομιστή.
  • Προγραμματιστής με γνώμονα τη τοπικότητα που επιλέγει διακομιστές που ελαχιστοποιούν τον αναμενόμενο χρόνο εκκίνησης χρησιμοποιώντας τα παραπάνω μοντέλα.

Αυτές οι βελτιστοποιήσεις επιτρέπουν στο ServerlessLLM να μειώσει τους χρόνους φόρτωσης LLM 4-8 φορές και τους συνολικούς χρόνους εκκίνησης περισσότερο από 25 φορές σε σύγκριση με τα υπάρχοντα συστήματα όπως το PyTorch, το TensorFlow και το KServe.

Επιταχύνοντας τη Φόρτωση Σημείων

Το πρώτο σημαντικό εμπόδιο που αντιμετωπίζει το ServerlessLLM είναι η υψηλή καθυστέρηση της φόρτωσης σημείων LLM από την αποθήκευση στη μνήμη GPU.

Για να ενεργοποιήσει τη γρήγορη φόρτωση σημείων, το ServerlessLLM εισάγει:

  1. Μορφή Φόρτωσης-Βελτιστοποιημένου Σημείου

Τα τυπικά σημεία που χρησιμοποιούνται από πλαίσια όπως το PyTorch είναι σχεδιασμένα για την εκπαίδευση και την αποσφαλμάτωση του μοντέλου. Για την ανάκτηση χωρίς διακομιστή, τα σημεία είναι μόνο για ανάγνωση και προσεγγίζονται επαναλαμβανόμενα.

Για να βελτιστοποιήσει για τέτοια χρήση με επαναλαμβανόμενη ανάγνωση, το ServerlessLLM μετατρέπει τα σημεία σε μορφή με δύο κλειδιά ιδιότητες:

  • Ακολουθιακή ανάγνωση chunk-με-βάση: Οι τένσορες ομαδοποιούνται σε δυαδικά αρχεία ανά GPU, διευκολύνοντας μεγάλες ακολουθιακές αναγνώσεις.
  • Αποτελεσματική διεύθυνση τενσορών: Ένας δείκτης χαρτογραφεί ονόματα τενσορών σε offsets μνήμης, επιτρέποντας την άμεση αποκατάσταση στη μνήμη χωρίς αποσύνθεση.
  1. Πολυεπίπεδη Pipeline Φόρτωσης Σημείων

Το ServerlessLLM εκμεταλλεύεται την αρχιτεκτονική πολλαπλών επιπέδων των διακομιστών GPU, με μέσα αποθήκευσης όπως SSD και δίκτυο που συνδέουν τους GPU μέσω PCIe, NVMe κ.λπ.

Το σύστημα ενσωματώνει μια pipeline πολλαπλών σταδίων για να μεγιστοποιήσει την αξιοποίηση του εύρους ζώνης σε όλα τα επίπεδα:

  • Θύρες μνήμης ανατίθενται χρησιμοποιώντας πινακίδες μνήμης για γρήγορη μεταφορά GPU.
  • Η άμεση Εισαγωγή/Εξαγωγή χρησιμοποιείται για αποτελεσματικές αναγνώσεις SSD χωρίς επιβαρύνσεις cache.
  • Πολλαπλά νήματα διαβάζουν διαφορετικά τμήματα αποθήκευσης παράλληλα.
  • Συντονισμός μεταξύ σταδίων πραγματοποιείται μέσω ασύγχρονων ουρών εργασιών.

Μαζί, αυτό επιτρέπει την κορύφωση της ικανότητας εύρους ζώνης ακόμη και των ταχύτερων επιπέδων όπως το NVMe RAID. Πειράματα αποκαλύπτουν ότι το ServerlessLLM επιτυγχάνει φόρτωση 6-8 φορές ταχύτερη από το PyTorch/TensorFlow, μειώνοντας τους χρόνους εκκίνησης για μεγάλα LLMs από πάνω από ένα λεπτό σε λιγότερο από 10 δευτερόλεπτα.

Τοπικότητα-Οδηγούμενη Ανάκτηση LLM μέσω Ζωντανής Μετανάστευσης

Με την επιταχύνουσα φόρτωση, το ServerlessLLM αντιμετωπίζει μια νέα πρόκληση – πώς να εκμεταλλευτεί τα προ-φορτωμένα σημεία για τοπικότητα χωρίς διακοπή της συνεχούς ανάκτησης σε繁ασμένους διακομιστές;

Το ServerlessLLM εισάγει μια καινοτόμο τεχνική – ζωντανή μετανάστευση της ανάκτησης LLM σε διακομιστές GPU. Αυτό επιτρέπει την ομαλή μεταφορά της εκτέλεσης σε διακομιστές με τοπικά διαθέσιμα σημεία.

Κλειδιά ενεργοποιητές της ζωντανής μετανάστευσης LLM:

  1. Μετανάστευση με Βάση Τοκεν

Αντί να σναπσότ ολόκληρη την κατάσταση του μοντέλου, το ServerlessLLM μεταφέρει μόνο τα ελάχιστα απαραίτητα τοκεν προrompt πάνω στο δίκτυο. Αυτό μεταφέρει τάξεις μεγέθους λιγότερα δεδομένα από σναπσότ.

  1. Διφασική Μετανάστευση

Ο προορισμός διακομιστή προ-υπολογίζει ασύγχρονα τις καταστάσεις cache από τα τοκεν προrompt. Μόλις είναι έτοιμος, ο πηγή διακομιστή μεταφέρει τα τελικά τοκεν πριν απελευθερώσει τους πόρους. Αυτό αποτρέπει τις καθυστερήσεις ανάκτησης.

Πειράματα αποκαλύπτουν ότι η μετανάστευση με βάση τοκεν μειώνει τους χρόνους μετανάστευσης από δεκάδες δευτερόλεπτα σε λιγότερο από ένα δευτερόλεπτο ακόμη και για μεγάλες ακολουθίες. Η ζωντανή μετανάστευση είναι κρίσιμη για την αποφυγή καθυστερήσεων ουράς όταν επιτυγχάνεται η τοπικότητα-οδηγούμενη ανάθεση.

Λατρεία-Βελτιστοποιημένη Προγραμματισμός Μοντέλου

Για να ελαχιστοποιήσει την συνολική καθυστέρηση, το ServerlessLLM ενισχύει τον προγραμματιστή για να βελτιστοποιήσει την επιλογή διακομιστή με βάση τη τοπικότητα. Αυτό περιλαμβάνει:

  1. Λεπτομερής Εκτιμητής Χρόνου Φόρτωσης

Μοντέλα προβλέπουν χρόνους φόρτωσης από δίκτυο, cache SSD, και μνήμη για κάθε διακομιστή χρησιμοποιώντας μετρικά όπως καθυστερήσεις ουράς, μεγέθη μοντέλου και μετρημένα εύρος ζώνης.

  1. Ακρίβεια Προβλέπτης Χρόνου Μετανάστευσης

Ο προγραμματιστής εκτιμά τους χρόνους μετανάστευσης για διακομιστές χρησιμοποιώντας τον αριθμό τοκεν προrompt και εξόδου. Παρακολουθεί την πρόοδο ανάκτησης ασύγχρονα για να αποφευχθεί η επιβάρυνση.

  1. Προγραμματισμός με Γνώμονα τη Τοπικότητα

Για κάθε αίτηση ανάκτησης, ο προγραμματιστής αξιολογεί τους εκτιμώμενους χρόνους φόρτωσης και μετανάστευσης σε διακομιστές. Επιλέγει τον διακομιστή που ελαχιστοποιεί τον αναμενόμενο χρόνο εκκίνησης.

Ο προγραμματιστής επίσης διατηρεί ουρές εργασιών διακομιστή και αξιοποιεί ένα ισχυρά συνεπές αποθήκευμα για αντοχή σε σφάλματα. Μαζί, αυτές οι καινοτομίες μειώνουν τις επιβαρύνσεις προγραμματισμού ενώ μεγιστοποιούν τα οφέλη της τοπικότητας.

Αξιολόγηση της Απόδοσης του ServerlessLLM

Περιεκτικά πειράματα αξιολογούν την συνολική αποτελεσματικότητα του ServerlessLLM σε σύγκριση με τα υπάρχοντα συστήματα χρησιμοποιώντας πραγματικά μοντέλα όπως το OPT-175B και φορτία που μοντελοποιούνται μετά από ιχνηλάτηση Azure.

Κλειδιά αποτελέσματα:

  • Μικρο-Βεντσμάρκ: Το ServerlessLLM επιταχύνει τη φόρτωση σημείων 3,6-8,2 φορές περισσότερο από το PyTorch/TensorFlow. Πλήρως κορυφώνει το εύρος ζώνης αποθήκευσης, ακόμη και για τα τελευταία NVMe RAID.
  • Προγραμματισμός: Το ServerlessLLM μειώνει την καθυστέρηση ανάθεσης 4-12 φορές σε σύγκριση με τυχαίο προγραμματισμό, υπογραμμίζοντας τα οφέλη της τοπικότητας. Η ζωντανή μετανάστευση αποτρέπει τις καθυστερήσεις ουράς.
  • Συνολική Εξυπηρέτηση: Για μεγάλα μοντέλα όπως το OPT-30B, το ServerlessLLM βελτιστοποιεί την 99η百τιστη καθυστέρηση 28-200 φορές περισσότερο από συστήματα όπως το KServe και το Ray Serve. Επίσης, βελτιστοποιεί την αποτελεσματικότητα πόρων.

Αυτά τα σημαντικά κέρδη αποδεικνύουν την ικανότητα του ServerlessLLM να υπερβεί τα εμπόδια στα υπάρχοντα συστήματα χωρίς διακομιστή και να απελευθερώσει τη δύναμη των LLMs για διαδραστικές υπηρεσίες.

Οι βελτιστοποιήσεις που εισάγονται στο ServerlessLLM, όπως η φόρτωση πολλαπλών επιπέδων, η ζωντανή μετανάστευση και ο προγραμματισμός με βάση τη λατρεία, μπορούν να ενημερώσουν το σχεδιασμό των μελλοντικών αρχιτεκτονικών χωρίς διακομιστή. Η ικανότητα του συστήματος να μειώσει τους χρόνους φόρτωσης και εκκίνησης απελευθερώνει την κλιμάκωση των μεγάλων γλωσσικών μοντέλων για πρακτικές εφαρμογές.

Βλέποντας μπροστά: Συνεχιζόμενες Προκλήσεις

Ενώ ένα σημαντικό βήμα προς τα εμπρός, το ServerlessLLM αντιπροσωπεύει μόνο το πρώτο βήμα στην оптимποίηση της ανάκτησης χωρίς διακομιστή για τα μεγάλα LLMs. Πολλές ανοιχτές προκλήσεις παραμένουν, συμπεριλαμβανομένων:

  • Προβλέπωντας την πραγματική ζήτηση μοντέλου για να οδηγήσει την προ-φόρτωση και την ανάθεση.
  • Τοποθετώντας έξυπνα τα σημεία σε διακομιστές για να μεγιστοποιήσει τις επιτυχίες cache.
  • Κλιμάκωση των αλγορίθμων προγραμματισμού για να χειριστεί μεγαλύτερες κλίκες.
  • Εγγυώμενος τη δίκαιη ανάθεση πόρων σε μοντέλα και développers.
  • Γενικεύοντας καινοτομίες όπως η ζωντανή μετανάστευση σε άλλες εργασίες χωρίς διακομιστή.

Η αντιμετώπιση αυτών των περιοχών μπορεί να βοηθήσει στην οικοδόμηση της υπόσχεσης των LLMs χωρίς διακομιστή και να κάνει τις ικανότητές τους ακόμη πιο προσιτές. Πέρα από τις βελτιστοποιήσεις του συστήματος, η μείωση του εκληφθέντος αποτυπώματος άνθρακα και των πιθανών ζημιών των μεγάλων μοντέλων παραμένει μια επείγουσα προτεραιότητα.

Το ServerlessLLM αποδεικνύει ότι υπάρχει τεράστιο περιθώριο για καινοτομία στις μελλοντικές αρχιτεκτονικές χωρίς διακομιστή για φόρτους εργασίας AI. Όσο τα LLMs συνεχίζουν να αυξάνονται σε μέγεθος και δημοτικότητα, λύσεις όπως το ServerlessLLM που απελευθερώνουν την κλιμάκωσή τους θα γίνουν ακόμη πιο σημαντικές. Η σύγκλιση της έρευνας συστημάτων και μηχανικής μάθησης μπορεί να εισαγάγει νέες παραδείγματα στην εξυπηρέτηση, τη μοιραζόμενη και την κλιμάκωση των μοντέλων AI με ασφάλεια και βιωσιμότητα.

Έχω περάσει τα τελευταία πέντε χρόνια βυθισμένος στον συναρπαστικό κόσμο της Μηχανικής Μάθησης και του Βαθιάς Μάθησης. Η δέσμευσή μου και η εξειδίκευσή μου με οδήγησαν να συμβάλλω σε πάνω από 50 διαφορετικά projects μηχανικής λογισμικού, με ιδιαίτερη έμφαση στο AI/ML. Η συνεχής περιέργειά μου με έχει οδηγήσει επίσης προς την Επεξεργασία Φυσικής Γλώσσας, ένα πεδίο που είμαι πρόθυμος να εξερευνήσω περαιτέρω.