Μοντέλα και πλατφόρμες AI

Zephyr-7B: Η Υπερ-Βελτιστοποιημένη ΛΛΜ της Hugging Face, Βασισμένη στο Mistral 7B

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Εισαγωγή

Η εξέλιξη των ανοιχτών μεγάλων γλωσσικών μοντέλων (LLM) έχει επηρεάσει σημαντικά την ερευνητική κοινότητα του AI, ιδιαίτερα στην ανάπτυξη chatbot και παρόμοιων εφαρμογών. Μετά την κυκλοφορία μοντέλων όπως το LLaMA, υπήρξε μια αύξηση της έρευνας για την αποτελεσματική εκπαίδευση, την επέκταση της επεξεργασίας προτύπων, την αναζήτηση και την γενίκευση (RAG) και την ποσοτικοποίηση.

Το μοντέλο LLaMA, για παράδειγμα, σηματοδότησε μια νέα εποχή στην εκπαίδευση και την προσωποποίηση του контекστού, ανοίγοντας τον δρόμο για τα επόμενα μοντέλα όπως το MPT της MosaicML, το RedPajama-INCITE της Together AI, το Falcon της TII και το Llama 2 της Meta. Κάθε ένα από αυτά τα μοντέλα συνεισφέρει μοναδικές ικανότητες, ενισχύοντας την συνολική λειτουργικότητα και το πεδίο των LLM.

Η Mistral AI, μια εταιρεία από το Παρίσι και ιδρυθείσα από πρώην υπαλλήλους της Google DeepMind και Meta, έχει κάνει το όνομά της με την πρώτη της προσφορά: το Mistral 7B.

Το Mistral 7B έχει το πλεονέκτημα της αποτελεσματικότητας, προσφέροντας παρόμοιες ή ενισχυμένες ικανότητες σε σύγκριση με τους ομολόγους του, όπως το Llama 2, αλλά με λιγότερη υπολογιστική ζήτηση.

Ειδικά调τισμένο για διδακτικές εργασίες, το Mistral 7B Instruct ξεχωρίζει σε πλατφόρμες όπως η Hugging Face, όπου υπερβαίνει άλλα μοντέλα του ίδιου μεγέθους και ανταγωνίζεται στενά με αυτά που έχουν σχεδόν το διπλό αριθμό παραμέτρων.

Βασισμένη σε αυτό, η Hugging Face εισήγαγε το Zephyr 7B Alpha, δείχνοντας ότι ένα μοντέλο Mistral 7B που έχει υποβληθεί σε εκπαίδευση μπορεί να υπερβεί τις ικανότητες μεγαλύτερων μοντέλων και, σε ορισμένες εργασίες, ακόμη και να ανταγωνιστεί το GPT-4. Το “Alpha” ήταν μόνο η αρχή, καθώς ακολούθησε το Zephyr 7B Beta.

Αυτό το άρθρο θα εξετάσει πώς το Zephyr 7B αξιοποιεί τη δύναμη μεγαλύτερων μοντέλων για να βελτιώσει την ικανότητά του να απαντά και να ευθυγραμμίζεται με τις ανθρώπινες οδηγίες, μια διαδικασία που καθίσταται δυνατή μέσω της τεχνικής της απόσταξης γνώσης. Αυτή η μέθοδος περιλαμβάνει την εκπαίδευση μικρότερων μοντέλων στα σύνθετα μοτίβα που έχουν μάθει τα μεγαλύτερα μοντέλα, μειώνοντας τις απαιτήσεις εκπαίδευσης χωρίς να θυσιάζεται η ικανότητα μοντελοποίησης της γλώσσας. Θα εμβαθύνουμε στις λεπτομέρειες της προσέγγισης της Hugging Face για την απόσταξη γνώσης.

Απόσταξη Γνώσης

Μια κλειδί καινοτομία στην ανάπτυξη μοντέλων όπως το Zephyr-7B είναι η αποσταγμένη εποπτευόμενη εκπαίδευση (dSFT). Αυτή η μέθοδος περιλαμβάνει την उपयποίηση της έξοδου από ένα μεγαλύτερο, πιο ικανό “δάσκαλο” μοντέλο για την εκπαίδευση ενός μικρότερου “μαθητή” μοντέλου, βελτιώνοντας την ακρίβειά του. Ενώ η απόσταξη βελτιώνει τα ανοιχτά μοντέλα σε διάφορες εργασίες, vẫn υπάρχει ένα χάσμα στην απόδοση σε σύγκριση με τα μοντέλα δασκάλου.

Η απόσταξη γνώσης είναι μια μέθοδος στο машинικό μάθηση όπου ένα συμπαγές μοντέλο, που ονομάζεται “μαθητής”, διδάσκεται να αναπαράγει την απόδοση ενός μεγαλύτερου, πιο σύνθετου “δασκάλου” μοντέλου. Αυτή η τεχνική επιτρέπει στον μαθητή να εκτελεί εργασίες που ήταν προηγουμένως πέρα από τις δυνατότητές του, μεταφέροντας τα περίπλοκα μοτίβα που έχει μάθει ο δάσκαλος.

Απόσταξη Γνώσης, Μοντέλο Δασκάλου-Μαθητή

Απόσταξη Γνώσης | Μοντέλο Δασκάλου-Μαθητή

Ο μαθητής μοντέλος εκπαιδεύεται στις πιθανότητες εξόδου ή στα χαρακτηριστικά που παράγονται από το μοντέλο δασκάλου, εστιάζοντας στο να ταιριάζουν αυτές οι εξόδους αντί να επικεντρωθεί μόνο στις τελικές προβλέψεις. Αυτό επιτρέπει στον μαθητή να μάθει τις νюανσες διαδικασίες λήψης αποφάσεων του δασκάλου, συχνά με αποτέλεσμα την βελτίωση της απόδοσης σε σύγκριση με την εκπαίδευση μόνο με τα δεδομένα της αλήθειας.

Ιστορικά, η απόσταξη γνώσης έχει χρησιμοποιηθεί σε μοντέλα όπως τα αρχικά δίκτυα απόσταξης του Hinton, και πιο πρόσφατα στο NLP με μοντέλα όπως το DistilBERT, το οποίο αποσταξένευσε το μοντέλο BERT σε ένα μικρότερο, ταχύτερο που διατηρεί τις περισσότερες από τις αρχικές ικανότητες γλωσσικής κατανόησης. Ένα άλλο παράδειγμα είναι το TinyBERT, το οποίο προωθεί την βελτιστοποίηση του μεγέθους και της ταχύτητας για κινητές ή περιφερειακές συσκευές.

Στην περίπτωση του Zephyr-7B, η απόσταξη γνώσης χρησιμοποιείται για να ενδυναμώσει ένα μικρότερο μοντέλο 7B παραμέτρων με τις ικανότητες των μεγαλύτερων ομόλογων του. Κάνοντας così, το Zephyr-7B επιτυγχάνει μια ισορροπία μεταξύ απόδοσης και αποτελεσματικότητας, καθιστώντας το κατάλληλο για περιβάλλοντα όπου οι υπολογιστικές πόρων είναι περιορισμένες, χωρίς να θυσιάζει την ποιότητα της αλληλεπίδρασης και της κατανόησης.

Στην ανάπτυξη του Zephyr-7B, οι ερευνητές αντιμετώπισαν την πρόκληση της ευθυγράμμισης ενός μικρού ανοιχτού LLM εξ ολοκλήρου μέσω απόσταξης. Εισήγαγαν μια προσέγγιση που ονομάζεται αποσταγμένη άμεση βελτιστοποίηση προτίμησης (dDPO), η οποία χρησιμοποιεί AI ανατροφοδότηση από ένα σύνολο δασκάλων μοντέλων ως δεδομένα προτίμησης. Αυτή η μέθοδος, που δεν απαιτεί ανθρώπινη αναnotation, μειώνει σημαντικά τον χρόνο και τους πόρους που απαιτούνται για την εκπαίδευση του μοντέλου.

Κατασκευή του ZEPHYR-7B

Για να επικυρώσουν την dDPO, οι ερευνητές κατασκεύασαν το ZEPHYR-7B, μια ευθυγραμμισμένη έκδοση του μοντέλου Mistral-7B. Η διαδικασία περιελάμβανε τρία βήματα:

  1. dSFT χρησιμοποιώντας το σύνολο δεδομένων UltraChat: Η αποσταγμένη εποπτευόμενη εκπαίδευση (dSFT) είναι μια προηγμένη μέθοδος για την εκπαίδευση μεγάλων γλωσσικών μοντέλων (LLM) αξιοποιώντας την έξοδο από μεγαλύτερα, πιο ικανά “δάσκαλο” μοντέλα. Ξεκινά με ένα ακατέργαστο LLM που εκπαιδεύεται να απαντά σε προτροπές χρήστη. Σε αντίθεση με την παραδοσιακή εποπτευόμενη εκπαίδευση (SFT) που χρησιμοποιεί ένα σταθερό σύνολο δεδομένων, η dSFT χρησιμοποιεί μια δυναμική προσέγγιση όπου το μοντέλο γεννάει οδηγίες και απαντήσεις. Αυτή η μέθοδος, γνωστή ως self-instruct, περιλαμβάνει την उपयποίηση του δασκάλου μοντέλου για να απαντήσει και να βελτιώσει τις οδηγίες με βάση τις απαντήσεις.
  2. Ενσωμάτωση δεδομένων ανατροφοδότησης AI από το UltraFeedback: Αυτά τα δεδομένα ήταν κρίσιμα για την βελτίωση των απαντήσεων του μοντέλου. Σε αυτό το βήμα, το μοντέλο γεννάει απαντήσεις σε διάφορες προτροπές (όπως περιγράφοντας πώς να φτιάξετε σοκολατίnes) που στη συνέχεια αξιολογούνται από ένα πιο προηγμένο μοντέλο όπως το GPT-4. Η υψηλότερη βαθμολογούμενη απάντηση (yw) και μια τυχαία χαμηλότερα βαθμολογούμενη απάντηση (yl) σχηματίζουν ένα σύνολο δεδομένων ανατροφοδότησης D.
  3. Εφαρμογή dDPO: Η τελευταία φάση, η αποσταγμένη άμεση βελτιστοποίηση προτίμησης (dDPO), περιλαμβάνει την βελτίωση του μοντέλου dSFT μέσω της μεγιστοποίησης της πιθανότητας να βαθμολογηθούν οι προτιμώμενες απαντήσεις υψηλότερα. Αυτό επιτυγχάνεται χρησιμοποιώντας μια συνάρτηση ανταμοιβής rθ(x, y) στο μοντέλο προτίμησης, η οποία βασίζεται στην βέλτιστη πολιτική LLM π* και την αρχική πολιτική πdSFT. Το αντικείμενο της βελτιστοποίησης διαμορφώνεται ως πθ = max π E (x, yw, yl) ∼ D log σ (β log π(yw|x)/πdSFT(yw|x) − β log π(yl|x)/πdSFT(yl|x)), που απλοποιεί την διαδικασία εκπαίδευσης ξεκινώντας από την εκδοχή dSFT του μοντέλου και επαναλαμβάνοντας κάθε τριάδα AIF.
Η μέθοδος που χρησιμοποιείται στο Zephyr-7B αντανακλά τις διαδικασίες που χρησιμοποιούνται στο InstructGPT.

Η μέθοδος που χρησιμοποιείται στο Zephyr-7B αντανακλά τις διαδικασίες που χρησιμοποιούνται στο InstructGPT.

Εξαιρετικά, το Zephyr-7B επιτυγχάνει απόδοση συγκρίσιμη με μοντέλα 70B παραμέτρων που ευθυγραμμίζονται με ανθρώπινη ανατροφοδότηση. Ξεχωρίζει και στις ακαδημαϊκές βάσεις και στις συνομιλητικές ικανότητες, υπογραμμίζοντας την αποτελεσματικότητα της μάθησης προτίμησης στη ανάπτυξη μοντέλων. Για περαιτέρω διερεύνηση, μοντέλα, κώδικας και οδηγίες είναι διαθέσιμα στο Αποθετήριο της Hugging Face.

Αντιμετώπιση της Πρόκλησης της Ευθυγράμμισης Προθέσεων

Μια αξιοσημείωτη ανησυχία με τα LLM έχει sido η ευθυγράμμισή τους με τις ανθρώπινες προθέσεις. Προηγούμενα μοντέλα συχνά απέτυχαν να παράγουν απαντήσεις που ταιριάζουν με τις προτιμήσεις των χρηστών, οδηγώντας σε ανακριβείς ή άσχετες απαντήσεις. Ωστόσο, πρόσφατες βάσεις όπως το MT-Bench και το AlpacaEval έχουν παρέχει εργαλεία για να ποσοτικοποιήσουν και να βελτιώσουν αυτό το аспект, υπογραμμίζοντας την υπεροχή των ιδιωτικών μοντέλων που εκπαιδεύονται με ανθρώπινη ανατροφοδότηση над εκείνα που εκπαιδεύονται μόνο μέσω απόσταξης.

Μέθοδοι Αξιολόγησης

Η αξιολόγηση του Zephyr 7B περιελάμβανε αυστηρά τεστ σε βάσεις που αξιολογούν τις συνομιλητικές ικανότητες του μοντέλου σε cả μονο- και πολυ-στροφικές συνθήκες:

  • MT-Bench: Αυτή η πολυ-στροφική βάση απαιτεί από το μοντέλο να απαντήσει σε 160 ερωτήσεις που καλύπτουν οκτώ τομείς. Κάθε απάντηση αξιολογείται από το GPT-4, με το τελικό σκορ του μοντέλου να αντανακλά τον μέσο όρο δύο γύρων ερωτήσεων.
  • AlpacaEval: Σε αυτή τη μονο-στροφική βάση, το μοντέλο παρουσιάζεται με 805 ερωτήσεις σε διάφορα θέματα. Η έμφαση εδώ είναι στην χρησιμότητα του μοντέλου, με το GPT-4 να βαθμολογεί τις απαντήσεις για να καθορίσει έναν συγκριτικό ρυθμό νικών.

Επιπλέον, το Zephyr 7B δοκιμάστηκε στην Ανοιχτή Λίστα LLM, η οποία, αν και δεν είναι μια άμεση αξιολόγηση των συνομιλητικών ικανοτήτων, προσφέρει εποπτικές για την ικανότητα του μοντέλου στη σκέψη και την αλήθεια μετά την εκπαίδευση.

Το Zephyr 7B συγκρίθηκε με eine ποικιλία ανοιχτών και ιδιωτικών μοντέλων, συμπεριλαμβανομένων εκείνων με διαφορετικά μεγέθη και μεθόδους ευθυγράμμισης. Καθístησε νέες βάσεις για μοντέλα 7B στο MT-Bench και AlpacaEval και έδειξε ανταγωνιστική απόδοση έναντι μεγαλύτερων μοντέλων, επικυρώνοντας την αποτελεσματικότητα της άμεσης βελτιστοποίησης προτίμησης (dDPO) στην εκπαίδευση.

Η φάση εκπαίδευσης SFT και DPO ρυθμίστηκε με προσοχή, καλύπτοντας πολλαπλά επαναλαμβανόμενα και ρυθμίζοντας τα ποσοστά εκπαίδευσης και τα μεγέθη batch για βέλτιστη απόδοση. Το τελικό μοντέλο Zephyr εμφανίστηκε όχι μόνο ανθεκτικό στην υπερ-προσαρμογή αλλά και ενισχυμένο στην αντιμετώπιση πρακτικών εργασιών και ακαδημαϊκών βάσεων.

Συνολικές Βάσεις και Αποτελέσματα

Χρησιμοποιούμενες Βάσεις

Στην ανάπτυξη του Zephyr-7B, δύο κλειδιά βάσεις δεδομένων χρησιμοποιήθηκαν για την εκπαίδευση και την βελτίωση του μοντέλου, κάθε μια από τις οποίες αντιμετωπίζει διαφορετικά аспектια της γενίκευσης διαλόγου:

Βάση Δεδομένων UltraChat

  • Πηγή: Ανεπτυγμένη από διαλόγους που παράγονται από το GPT-3.5-TURBO.
  • Περιεχόμενα: Περιλαμβάνει 1,47 εκατομμύρια πολυ-στροφικούς διαλόγους σε 30 θέματα και 20 τύπους υλικού.
  • Βελτίωση: Η βάση δεδομένων υποβλήθηκε σε μια ευθυγράμμισή heuristic για τη διόρθωση γραμματικών προβλημάτων, και φίλτρα εφαρμόστηκαν για να αυξήσουν τη χρησιμότητα των απαντήσεων και να απομακρύνουν άχρηστες προτάσεις.

Βάση Δεδομένων UltraFeedback

  • Πηγή: Περιλαμβάνει προτροπές που αξιολογούνται από το GPT-4, το οποίο βαθμολογεί τις απαντήσεις με βάση την ακολουθία οδηγιών, την ειλικρίνεια και τη χρησιμότητα.
  • Περιεχόμενα: Περιλαμβάνει 64.000 προτροπές με τέσσερις απαντήσεις η καθεμία, βαθμολογημένες από το GPT-4.
  • Διπλά Προτιμήσεις: Παραγόμενα από την επιλογή της απάντησης με το υψηλότερο μέσο σκορ ως “επιλεγμένη” και μια τυχαία από τις υπόλοιπες ως “απορριπτέα” για να ενισχύσει τη διαφοροποίηση και να προκαλέσει την άμεση βελτιστοποίηση προτίμησης (DPO).

Και οι δύο βάσεις είναι κρίσιμες για την εκπαίδευση του Zephyr-7B ώστε να κατανοήσει και να παράγει ανθρώπινους διαλόγους που ακολουθούν οδηγίες, είναι ειλικρινείς και χρήσιμοι. Αυτές οι βάσεις έχουν διατεθεί στο Hub της Hugging Face, το οποίο μπορείτε να προσεγγίσετε εδώ.

Επιδόσεις και Αποτελέσματα

Το παρακάτω διάγραμμα απεικονίζει την απόδοση του Zephyr 7B σε διάφορες κατηγορίες εργασιών σε σύγκριση με άλλα μοντέλα όπως το GPT-3.5-turbo, το Claude 1, το GPT-4 και το Llama-2-70b-chat. Οι κατηγορίες μπορεί να περιλαμβάνουν Γραφή, Ανθρωπιστικές Επιστήμες, Ρόλος, Λογική, Επιστήμες, Εξαγωγή, Κωδικοποίηση και Μαθηματικά.

Από το διάγραμμα, μπορούμε να συναγάγουμε ποια πεδία το Zephyr 7B ξεχωρίζει και ποια πεδία μπορεί να χρειάζονται περαιτέρω βελτίωση. Για παράδειγμα, αν η γραμμή του Zephyr είναι πιο μακρυά στην άξονα της Γραφής, αυτό σημαίνει ότι το Zephyr είναι ιδιαίτερα ισχυρό στη γενίκευση γραπτού περιεχομένου. Αντίθετα, αν η γραμμή είναι πιο κοντά στο κέντρο στην άξονα των Μαθηματικών, μπορεί να υποδηλώνει μια σχετική αδυναμία στη λύση μαθηματικών προβλημάτων.

Το ραντάρ διάγραμμα βοηθά στην αναγνώριση των ισχυρών και αδύναμων πλευρών του Zephyr 7B, παρέχοντας μια οπτική αναπαράσταση του πώς τοποθετείται σε σύγκριση με μεγαλύτερα μοντέλα όπως το GPT-4 και εξειδικευμένα μοντέλα όπως το Llama-2-70b-chat.

 

Διάγραμμα Απόδοσης Μοντέλου

Διάγραμμα Απόδοσης Μοντέλου

Σύγκριση διαφόρων γλωσσικών μοντέλων σε δύο βάσεις: MT-Bench και AlpacaEval. Τα μοντέλα αξιολογούνται με βάση το μέγεθός τους, τη μέθοδο ευθυγράμμισης (όπως dSFT για αποσταγμένη εποπτευόμενη εκπαίδευση ή dDPO για αποσταγμένη άμεση βελτιστοποίηση προτίμησης) και τα σκορ απόδοσης. Το Zephyr ξεχωρίζει με υψηλά σκορ και στις δύο βάσεις, υποδηλώνοντας την αποτελεσματικότητά του στην παραγωγή ευθυγραμμισμένων απαντήσεων.

MT-Bench και AlpacaEval

MT-Bench και AlpacaEval

Συμπέρασμα

Συμπερασματικά, η ανάπτυξη του Zephyr-7B αποδεικνύει ότι η ευθυγράμμισή των συνομιλητικών ικανοτήτων από ένα μεγάλο γλωσσικό μοντέλο (LLM) σε ένα μικρότερο μοντέλο μπορεί να επιτευχθεί χωρίς να βασίζεται σε μεθόδους δειγματοληψίας. Χρησιμοποιώντας την άμεση βελτιστοποίηση προτίμησης (DPO) με ανατροφοδότηση AI, το Zephyr-7B αξιοποιεί τη σθεναρή βάση του Mistral-7B για να θέσει νέα βάση για μοντέλα 7B παραμέτρων, δείχνοντας την ικανότητα μικρότερων, ανοιχτών μοντέλων να κατανοούν και να απαντούν σε ανθρώπινες οδηγίες αποτελεσματικά.

Ωστόσο, αυτή η μελέτη δεν είναι χωρίς τις περιορισμοί της. Η εξάρτηση από το GPT-4 ως αξιολογητή για τις βάσεις εισάγει μια προκατάληψη προς τα μοντέλα που αποσταγνύονται από αυτό, πιθανόν να ευνοούν τις ακριβείς απαντήσεις. Επιπλέον, η κλιμάκωση αυτής της μεθόδου σε μεγαλύτερα μοντέλα, όπως το LLAMA2-70B, και η επίδραση στα κέρδη απόδοσης παραμένουν περιοχές για περαιτέρω έρευνα. Αυτοί οι περιορισμοί υπογραμμίζουν την ανάγκη για συνεχείς καινοτομίες και την ανάπτυξη αμερόληπτων μεθόδων αξιολόγησης στην κοινότητα του AI.

Κοιτάζοντας πέρα από τη μελέτη, είναι φανερό ότι το потенシャル για μικρότερα μοντέλα να επιτύχουν το επίπεδο των μεγαλύτερων ομόλογων τους μπορεί να δημοκρατίσει το AI, επιτρέποντας μια πιο προσιτή και αποτελεσματική χρήση σε διάφορες εφαρμογές. Η επιτυχία του Zephyr-7B ενθαρρύνει περαιτέρω διερεύνηση σε ανοιχτά μοντέλα, τα οποία μπορούν να επιταχύνουν τις προόδους στο AI με την προώθηση της συνεργατικής έρευνας και ανάπτυξης.

Έχω περάσει τα τελευταία πέντε χρόνια βυθισμένος στον συναρπαστικό κόσμο της Μηχανικής Μάθησης και του Βαθιάς Μάθησης. Η δέσμευσή μου και η εξειδίκευσή μου με οδήγησαν να συμβάλλω σε πάνω από 50 διαφορετικά projects μηχανικής λογισμικού, με ιδιαίτερη έμφαση στο AI/ML. Η συνεχής περιέργειά μου με έχει οδηγήσει επίσης προς την Επεξεργασία Φυσικής Γλώσσας, ένα πεδίο που είμαι πρόθυμος να εξερευνήσω περαιτέρω.