Μοντέλα και πλατφόρμες AI

LoReFT: Βελτιστοποίηση Αναπαράστασης για Μοντέλα Γλωσσών

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Οι μεθόδοι βελτιστοποίησης παραμέτρων ή PeFT αποσκοπούν να προσαρμόσουν μεγάλες γλωσσικές μοντέλα μέσω ενημερώσεων σε μικρό αριθμό παραμέτρων. Ωστόσο, η πλειοψηφία των υφιστάμενων έργων ερμηνευσιμότητας έχει αποδείξει ότι οι αναπαραστάσεις κωδικοποιούν πλούσια σημασιολογική πληροφορία, υποδεικνύοντας ότι μπορεί να είναι μια καλύτερη και πιο ισχυρή εναλλακτική λύση να επεξεργαστούν αυτές τις αναπαραστάσεις. Τα προ-εκπαιδευμένα μεγάλα μοντέλα συχνά βελτιστοποιούνται για να χρησιμοποιηθούν σε νέες περιοχές ή εργασίες, και κατά τη διαδικασία βελτιστοποίησης, ένα μοντέλο βάσης μπορεί να προσαρμοστεί σε eine ποικιλία εργασιών ακόμη και με μικρή ποσότητα δεδομένων περιοχής διαθέσιμων στο μοντέλο. Ωστόσο, η διαδικασία βελτιστοποίησης ολόκληρου του μοντέλου είναι δαπανηρή, και ακριβή, ιδιαίτερα για γλωσσικά μοντέλα με σημαντικά υψηλότερο αριθμό μεγέθους και παραμέτρων.

Οι μεθόδοι βελτιστοποίησης παραμέτρων ή PeFT προτείνουν να αντιμετωπίσουν τα υψηλά έξοδα που συνδέονται με τη βελτιστοποίηση ολόκληρου του μοντέλου, ενημερώνοντας μόνο μικρό αριθμό από τις συνολικές παραμέτρους που διατίθενται, μια διαδικασία που βοηθά στη μείωση του χρόνου εκπαίδευσης μαζί με τη χρήση μνήμης. Τι είναι πιο σημαντικό είναι ότι οι μεθόδοι βελτιστοποίησης παραμέτρων ή PeFT έχουν αποδείξει παρόμοια απόδοση με τη βελτιστοποίηση σεSeveral πρακτικές ρυθμίσεις. Οι προσαρμογείς, μια κοινή οικογένεια μεθόδων βελτιστοποίησης παραμέτρων ή PeFT, μαθαίνουν μια επέμβαση που μπορεί να προστεθεί σε ένα επιπλέον σύνολο παραμέτρων που λειτουργούν παράλληλα με το παγωμένο μοντέλο βάσης, με πρόσφατους προσαρμογείς όπως LoRA να μειώνουν τον αριθμό των εκπαιδεύσιμων παραμέτρων στις εκπαιδεύσιμες ενημερώσεις βαρών χρησιμοποιώντας χαμηλού βαθμού προσεγγίσεις αντί για πλήρεις матриτσες βαρών κατά την εκπαίδευση των προσαρμογέων.

Με προηγούμενα έργα που αποδεικνύουν ότι η επεξεργασία αναπαραστάσεων μπορεί να είναι μια καλύτερη εναλλακτική λύση στις μεθόδοι βελτιστοποίησης παραμέτρων ή PeFT, σε αυτό το άρθρο, θα μιλήσουμε για τις μεθόδοι βελτιστοποίησης αναπαράστασης ή ReFT που λειτουργούν σε ένα παγωμένο μοντέλο, και μαθαίνουν επεμβάσεις ειδικές για εργασίες σε κρυφές αναπαραστάσεις. Το άρθρο αυτό αποσκοπεί να καλύψει το πλαίσιο ReFt ή βελτιστοποίηση αναπαράστασης σε βάθος, και εξετάζουμε τη μηχανισμό, τη μεθοδολογία, την αρχιτεκτονική του πλαισίου μαζί με τη σύγκρισή του με τα state-of-the-art πλαισια. Έτσι, ας ξεκινήσουμε.

ReFT: Βελτιστοποίηση Αναπαράστασης για Μοντέλα Γλωσσών

Σε μια προσπάθεια να υιοθετήσουν προ-εκπαιδευμένα γλωσσικά μοντέλα σε νέες περιοχές και εργασίες, τα τρέχοντα πλαισια βελτιστοποιούν συχνά αυτά τα προ-εκπαιδευμένα γλωσσικά μοντέλα, όπως με τη διαδικασία βελτιστοποίησης που εφαρμόζεται, ένα μοντέλο βάσης μπορεί να προσαρμοστεί σε μια ποικιλία εργασιών ακόμη και με μικρή ποσότητα δεδομένων περιοχής διαθέσιμων στο μοντέλο. Αν και η διαδικασία βελτιστοποίησης αυξάνει την συνολική απόδοση, είναι μια δαπανηρή διαδικασία, ιδιαίτερα αν το γλωσσικό μοντέλο έχει σημαντικά υψηλότερο αριθμό μεγέθους και παραμέτρων. Για να αντιμετωπίσουν αυτό το ζήτημα και να μειώσουν τα συνδεόμενα έξοδα, τα πλαισια βελτιστοποίησης παραμέτρων ή PeFT ενημερώνουν μόνο μικρό αριθμό από τις συνολικές παραμέτρους, μια διαδικασία που μειώνει τον χρόνο εκπαίδευσης μαζί με τη χρήση μνήμης, επιτρέποντας στα πλαισια βελτιστοποίησης παραμέτρων ή PeFT να επιτύχουν παρόμοια απόδοση σε σύγκριση με τις πλήρεις μεθόδοι βελτιστοποίησης σε πρακτικές ρυθμίσεις. Οι προσαρμογείς, μια κοινή οικογένεια μεθόδων βελτιστοποίησης παραμέτρων ή PeFT, λειτουργούν μαθαίνοντας μια επέμβαση που μπορεί να προστεθεί σε ένα επιπλέον σύνολο παραμέτρων που λειτουργούν παράλληλα με το παγωμένο μοντέλο βάσης. Πρόσφατοι προσαρμογείς όπως LoRA και QLoRA έχουν αποδείξει ότι είναι δυνατό να εκπαιδευτούν προσαρμογείς πλήρους ακρίβειας πάνω από μοντέλα με μειωμένη ακρίβεια χωρίς να επηρεάζουν την απόδοση.

Ένα σημαντικό χαρακτηριστικό των τρεχοντων state-of-the-art μεθόδων βελτιστοποίησης παραμέτρων ή PeFT είναι ότι αντί να τροποποιούν αναπαραστάσεις, τροποποιούν παραμέτρους. Ωστόσο, πλαισια που ασχολούνται με την ερμηνευσιμότητα έχουν αποδείξει ότι οι αναπαραστάσεις κωδικοποιούν πλούσια σημασιολογική πληροφορία, υποδεικνύοντας ότι η επεξεργασία αναπαραστάσεων μπορεί να είναι μια καλύτερη και πιο ισχυρή προσέγγιση σε σύγκριση με τις ενημερώσεις παραμέτρων. Αυτή η υπόθεση ότι η επεξεργασία αναπαραστάσεων είναι η καλύτερη προσέγγιση είναι το θεμέλιο του πλαισίου ReFT ή βελτιστοποίησης αναπαράστασης που εκπαιδεύει επεμβάσεις αντί να προσαρμόζει παραμέτρους μοντέλου, επιτρέποντας στο μοντέλο να χειρίζεται μικρό αριθμό από όλες τις αναπαραστάσεις σε μια προσπάθεια να κατευθύνει τη συμπεριφορά του μοντέλου για να λύσει εργασίες κατά την εύρεση. Οι μεθόδοι ReFT ή βελτιστοποίησης αναπαράστασης είναι αντικαταστάτες για τις μεθόδοι βελτιστοποίησης παραμέτρων ή PeFT. Η προσέγγιση ReFT αντλεί έμπνευση από πρόσφατα μοντέλα που εργάζονται με μεγάλη ερμηνευσιμότητα μοντέλων που επεμβαίνουν σε αναπαραστάσεις για να βρουν πιστές αιτιώδεις μηχανισμούς και κατευθύνουν τη συμπεριφορά του μοντέλου κατά την εύρεση, και επομένως μπορεί να θεωρηθεί ως μια γενίκευση των μοντέλων επεξεργασίας αναπαράστασης.

Συνεχίζοντας, αντίθετα με τη πλήρη βελτιστοποίηση, το πλαίσιο βελτιστοποίησης παραμέτρων ή PeFT εκπαιδεύει μόνο μικρό αριθμό παραμέτρων του μοντέλου και διαχειρίζεται να προσαρμόσει το μοντέλο σε εργασίες. Το πλαίσιο βελτιστοποίησης παραμέτρων ή PeFT μπορεί να ταξινομηθεί σε τρεις κύριες κατηγορίες:

  • Μέθοδοι προσαρμογέων: Οι μέθοδοι προσαρμογέων εκπαιδεύουν πρόσθετα模块 όπως πλήρως-συνδεδεμένα στρώματα πάνω από το προ-εκπαιδευμένο μοντέλο με παγωμένες παραμέτρους. Οι σειριακοί προσαρμογείς εισάγουν компоненты μεταξύ του πολυστρώματος perceptron ή MLP και LM ή μεγάλου μοντέλου προσοχής, ενώ οι παράλληλοι προσαρμογείς προσθέτουν μονάδες παράλληλα με υφιστάμενες компоненты.既然 οι προσαρμογείς προσθέτουν νέες компоненты που δεν μπορούν να αναπτυχθούν εύκολα σε υφιστάμενες παραμέτρους μοντέλου, επιβάλλουν πρόσθετο φόρτο κατά την εύρεση.
  • LoRA: Το LoRA μαζί με τις πρόσφατες παραλλαγές του προσεγγίζει τις προσθετικές παραμέτρους κατά την εκπαίδευση χρησιμοποιώντας χαμηλού βαθμού матриτσες, και δεν απαιτούν πρόσθετους φόρτους κατά την εύρεση,既然 οι ενημερώσεις παραμέτρων μπορούν να συγχωνευτούν στο μοντέλο, και είναι ο λόγος για τον οποίο θεωρούνται τα ισχυρότερα πλαισια βελτιστοποίησης παραμέτρων ή PeFT.
  • Μέθοδοι πρόθεσης: Οι μέθοδοι πρόθεσης προσθέτουν μαλακές λέξεις-κλειδιά που αρχικοποιούνται τυχαία στην είσοδο, και εκπαιδεύουν τις εμβυθύνσεις τους ενώ giữουν τις παραμέτρους του γλωσσικού μοντέλου παγωμένες. Η απόδοση που προσφέρουν αυτές οι μέθοδοι είναι συχνά μη ικανοποιητική όταν συγκρίνονται με άλλες μεθόδοι βελτιστοποίησης παραμέτρων ή PeFT, και επίσης φέρουν σημαντικό φόρτο εύρεσης.

Αντί να ενημερώσουν τις παραμέτρους, το πλαίσιο ReFT μαθαίνει επεμβάσεις για να τροποποιήσει μικρό αριθμό από τις συνολικές αναπαραστάσεις. Επιπλέον, πρόσφατες εργασίες για την μηχανική αναπαράστασης και την κατεύθυνση ενεργειών έχουν αποδείξει ότι η προσθήκη σταθερών διανυσμάτων κατεύθυνσης στο ρεύμα υπολοίπων μπορεί να διευκολύνει ένα βαθμό ελέγχου πάνω από τις γεννήτριες μεγάλων προ-εκπαιδευμένων μοντέλων χωρίς να απαιτούν πόρους-εντοπισμό βελτιστοποίησης.

ReFT: Μεθοδολογία και Αρχιτεκτονική

Για να διατηρήσει τη διαδικασία διατήρησης στυλ απλή, το πλαίσιο ReFT υποθέτει ένα μετασχηματιστή-βασισμένο μεγάλο μοντέλο ως μοντέλο-στόχο που είναι ικανό να παράγει контекουαλισμένες αναπαραστάσεις ακολουθιών λέξεων. Για μια δεδομένη ακολουθία με n αριθμό εισόδου λέξεων, το πλαίσιο ReFT πρώτα ενσωματώνει αυτές τις εισόδου λέξεις σε μια λίστα αναπαραστάσεων που ακολουθούν, και μετά τα m στρώματα υπολογίζουν τη λίστα των κρυφών αναπαραστάσεων διαδοχικά ως μια συνάρτηση της προηγούμενης λίστας κρυφών αναπαραστάσεων. Κάθε κρυφή αναπαράσταση είναι ένα διάνυσμα, και το γλωσσικό μοντέλο χρησιμοποιεί τις τελικές κρυφές αναπαραστάσεις για να παράγει τις προβλέψεις. Το πλαίσιο ReFT θεωρεί και τις μασκοποιημένες γλωσσικές μοντέλα και τις αυτο-αναγωγικές γλωσσικές μοντέλα.

Επιπλέον, στις μελέτες ερμηνευσιμότητας, το πλαίσιο αιτιώδους αφαίρεσης χρησιμοποιεί ανταλλακτικές επεμβάσεις για να καθορίσει τον ρόλο των компонентів του νευρωνικού δικτύου αιτιωδώς όταν εφαρμόζονται συγκεκριμένες συμπεριφορές. Η λογική πίσω από τις ανταλλακτικές επεμβάσεις είναι ότι αν ένας καθορίσει μια αναπαράσταση σε αυτό που θα ήταν για μια αντίθετη είσοδο, και αυτή η επέμβαση επηρεάζει τη έξοδο του μοντέλου σταθερά με τον τρόπο που οι ισχυρισμοί που γίνονται από το πλαίσιο ReFT για το компонόν που παράγει αυτή την αναπαράσταση, τότε το компонόν παίζει αιτιώδη ρόλο στη συμπεριφορά. Αν και υπάρχουν μερικές μεθόδοι, η μεθοδολογία DAS είναι η ιδανική προσέγγιση για να δοκιμάσει αν ένα концепτό κωδικοποιείται σε μια γραμμική υποχώρηση αναπαράστασης, όπως ισχυρίζεται η υπόθεση αναπαράστασης. Επιπλέον, η μεθοδολογία DAS έχει χρησιμοποιηθεί προηγουμένως για να βρει γραμμικές αναπαραστάσεις σε γλωσσικά μοντέλα οντοτήτων, συναισθημάτων, γλωσσικών χαρακτηριστικών, και μαθηματικών συλλογισμών.

Η εκφραστική ικανότητα που προσφέρει η μεθοδολογία DAS υποδηλώνει ότι η προσέγγιση θα μπορούσε να είναι ένα ιδανικό εργαλείο για να ελέγξει τη συμπεριφορά του γλωσσικού μοντέλου μαζί με την εργασία του στην ελεγχόμενη γεννήτρια και την υπεύθυνη επεξεργασία. Επομένως, για να προσαρμόσουν τα γλωσσικά μοντέλα για εργασίες, το πλαίσιο ReFT χρησιμοποιεί την ανταλλακτική επέμβαση για να κάνει μια νέα μεθοδολογία βελτιστοποίησης παραμέτρων. Επιπλέον, η μεθοδολογία ReFT είναι ένα σύνολο επεμβάσεων, και το πλαίσιο επιβάλλει ότι για οποιαδήποτε δύο επεμβάσεις που λειτουργούν στην ίδια στρώση, οι θέσεις επεμβάσεων πρέπει να είναι μη-επεκτατές, με τις παραμέτρους όλων των συναρτήσεων επεμβάσεων να παραμένουν ανεξάρτητες. Ως αποτέλεσμα, το ReFT είναι ένα γενικό πλαίσιο που περιλαμβάνει επεμβάσεις σε κρυφές αναπαραστάσεις κατά τη διάρκεια της προώθησης μοντέλου.

ReFT: Πειράματα και Αποτελέσματα

Για να αξιολογήσει την απόδοσή του ενάντια στις υφιστάμενες μεθόδοι βελτιστοποίησης παραμέτρων ή PeFT, το πλαίσιο ReFT διεξάγει πειράματα σε τέσσερις διαφορετικές φυσικές γλωσσικές επεξεργασίες, και καλύπτει πάνω από 20 συνόλους δεδομένων, με το πρωταρχικό στόχο να παρέχει μια πλούσια εικόνα για το πώς το πλαίσιο LoReFT λειτουργεί σε διαφορετικές ρυθμίσεις. Επιπλέον, όταν το πλαίσιο LoReFT εφαρμόζεται στην πραγματική ζωή, οι développers πρέπει να αποφασίσουν πόσες επεμβάσεις να μάθουν μαζί με τις θέσεις εισόδου και τα στρώματα να εφαρμόσουν κάθε μια. Για να ολοκληρώσουν την εργασία, το πλαίσιο ReFT ρυθμίζει τέσσερις υπερπαράμετρους.

  1. Ο αριθμός των θέσεων πρόθεσης για επέμβαση.
  2. Ο αριθμός των θέσεων επιλογής για επέμβαση.
  3. Ποιο σύνολο στρωμάτων να επεμβαίνει.
  4. Εάν να δέσει τις παραμέτρους επεμβάσεων σε διαφορετικές θέσεις στην ίδια στρώση.

Κάνωντας αυτό, το πλαίσιο ReFT απλοποιεί τον χώρο αναζήτησης υπερπαράμετρων, και εξασφαλίζει μόνο einen σταθερό πρόσθετο κόστος εύρεσης που δεν κλιμακώνεται με το μήκος της πρόθεσης.

Ο παραπάνω πίνακας συγκρίνει την ακρίβεια του LLaMA-7B και LLaMA-13B ενάντια στις υφιστάμενες μεθόδοι βελτιστοποίησης παραμέτρων ή PeFT σε 8 συνόλους δεδομένων κοινής λογικής. Όπως μπορεί να παρατηρηθεί, το μοντέλο LoReFT υπερέχει των υφιστάμενων μεθόδων βελτιστοποίησης παραμέτρων ή PeFT με ένα αξιοσημείωτο περιθώριο, παρά το γεγονός ότι έχει πολύ λιγότερες παραμέτρους, με την μέση απόδοση τριών τρέχων με διαφορετικά σπόρους παραμέτρων για το μοντέλο LoReFT. Η παραμετρική (%) υπολογίζεται με τη διαίρεση του αριθμού των εκπαιδεύσιμων παραμέτρων με τον αριθμό των συνολικών παραμέτρων του μεγάλου μοντέλου βάσης.

Ο παραπάνω πίνακας συνοψίζει την σύγκριση ακρίβειας του LLaMA-7B και LLaMA-13B ενάντια στις υφιστάμενες μεθόδοι βελτιστοποίησης παραμέτρων ή PeFT σε 4 διαφορετικά συνόλους δεδομένων αριθμητικής λογικής, με το πλαίσιο να αναφέρει την μέση απόδοση τριών τρέχων με διαφορετικά τυχαία σπόρους. Όπως μπορεί να παρατηρηθεί, παρά το γεγονός ότι έχει πολύ λιγότερες παραμέτρους (%), το πλαίσιο LoReFT υπερέχει των υφιστάμενων μεθόδων βελτιστοποίησης παραμέτρων ή PeFT με ένα αξιοσημείωτο περιθώριο.

Ο παραπάνω πίνακας συνοψίζει την σύγκριση ακρίβειας του RoBERTa-base και RoBERTa-large ενάντια στις υφιστάμενες μεθόδοι βελτιστοποίησης παραμέτρων ή PeFT στο σύνολο δεδομένων GLUE, με το πλαίσιο να αναφέρει την μέση απόδοση πέντε τρέχων με διαφορετικά τυχαία σπόρους. Όπως μπορεί να παρατηρηθεί, παρά το γεγονός ότι έχει πολύ λιγότερες παραμέτρους (%), το πλαίσιο LoReFT υπερέχει των υφιστάμενων μεθόδων βελτιστοποίησης παραμέτρων ή PeFT με ένα αξιοσημείωτο περιθώριο.

Τελικές Σκέψεις

Σε αυτό το άρθρο, μιλήσαμε για το LoReFT, μια ισχυρή εναλλακτική λύση στις υφιστάμενες μεθόδοι βελτιστοποίησης παραμέτρων ή PeFT που επιτυγχάνει ισχυρή απόδοση σε διαφορετικά συνόλους δεδομένων ενώ προσφέρει μέχρι 50 φορές την αποδοτικότητα που προσφέρεται από τις προηγούμενες μεθόδοι βελτιστοποίησης παραμέτρων ή PeFT. Τα προ-εκπαιδευμένα μεγάλα μοντέλα συχνά βελτιστοποιούνται για να χρησιμοποιηθούν σε νέες περιοχές ή εργασίες, και κατά τη διαδικασία βελτιστοποίησης, ένα μοντέλο βάσης μπορεί να προσαρμοστεί σε μια ποικιλία εργασιών ακόμη και με μικρή ποσότητα δεδομένων περιοχής διαθέσιμων στο μοντέλο. Ωστόσο, η διαδικασία βελτιστοποίησης ολόκληρου του μοντέλου είναι δαπανηρή, και ακριβή, ιδιαίτερα για γλωσσικά μοντέλα με σημαντικά υψηλότερο αριθμό μεγέθους και παραμέτρων. Οι μεθόδοι βελτιστοποίησης παραμέτρων ή PeFT προτείνουν να αντιμετωπίσουν τα υψηλά έξοδα που συνδέονται με τη βελτιστοποίηση ολόκληρου του μοντέλου, ενημερώνοντας μόνο μικρό αριθμό από τις συνολικές παραμέτρους που διατίθενται, μια διαδικασία που βοηθά στη μείωση του χρόνου εκπαίδευσης μαζί με τη χρήση μνήμης. Ιδιαίτερα, το LoReFT καθιερώνει νέα state-of-the-art απόδοση σε κοινή λογική, ακολουθία οδηγιών, και φυσική γλωσσική κατανόηση ενάντια στις ισχυρότερες μεθόδοι βελτιστοποίησης παραμέτρων ή PeFT.

Ένας μηχανικός επάγγελμα, ένας συγγραφέας με την καρδιά. Ο Kunal είναι ένας τεχνικός συγγραφέας με einen βαθύ έρωτα και κατανόηση του AI και ML, αφιερωμένος στο να απλοποιεί σύνθετες έννοιες σε αυτά τα πεδία μέσω των ελκυστικών και ενημερωτικών εγγράφων του.