Μοντέλα και πλατφόρμες AI

Ζέφυρ-7B: Μια Εισαγωγή στη Στενή Απόσταξη της Συστάδας στις Γλωσσικές Μοντέλα

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Η ικανότητα και η απόδοση των μικρότερων, ανοιχτών μεγάλων γλωσσικών μοντέλων έχουν προοδεύσει σημαντικά τα τελευταία χρόνια, και έχουμε μάρτυρες την πρόοδο από τα πρώτα μοντέλα GPT-2 σε πιο συμπαγή, ακριβή και αποτελεσματικά πλαίσια LLM που χρησιμοποιούν σημαντικά μεγαλύτερο αριθμό token από τον “συνδυασμό-βέλτιστο” αριθμό token που συνιστάται από τους νόμους κλιμάκωσης Chinchilla. Επιπλέον, οι dévelopπεροι έχουν αποδείξει ότι αυτά τα μικρότερα πλαίσια LLM μπορούν να εκπαιδευτούν περαιτέρω χρησιμοποιώντας μια προπριetary-μοντέλα-βασισμένη dSFT ή Distilled Supervised Fine-Tuning προσέγγιση, που χρησιμοποιεί την έξοδο από ένα αποτελεσματικό δασκάλο μοντέλο ως εποπτευόμενη δεδομένα για το μαθητή μοντέλο σε μια προσπάθεια να αυξήσει την ακρίβεια.

Σε αυτό το άρθρο, θα μιλήσουμε για το πλαίσιο Zephyr-7B, ένα state of the art chat benchmark για μοντέλα 7B παραμέτρων που δεν απαιτεί ανθρώπινες αναφορές. Ο πρωταρχικός στόχος του πλαισίου είναι να επιτρέψει στους dévelopπεροι να παράγουν μικρότερα μεγάλα γλωσσικά μοντέλα που συστάζονται με την πρόθεση του χρήστη πιο κοντά παρά ποτέ. Το πλαίσιο Zephyr-7B δεν εξετάζει μόνο την εφαρμογή των τρεχόντων προσεγγίσεων για μεγαλύτερα πλαίσια LLM όπως dSFT, αλλά cũng εξετάζει τη δυνατότητα χρήσης άλλων προσεγγίσεων για να μάθει ένα chat μοντέλο με καλύτερη συστάδα με την πρόθεση του χρήστη. Θα πάρουμε einen βαθύτερο взгляд στο πλαίσιο Zephyr, και θα εξετάσουμε την αρχιτεκτονική, τη λειτουργία και τα αποτελέσματα. Έτσι, ας ξεκινήσουμε.

Ζέφυρ-7B: Μια Εισαγωγή στη Στενή Απόσταξη της Συστάδας στις Γλωσσικές Μοντέλα

Όπως αναφέρθηκε νωρίτερα, τα γλωσσικά μοντέλα έχουν προοδεύσει ταχύτατα τα τελευταία χρόνια, από τα πρώτα μοντέλα GPT-2 στα τρέχοντα μοντέλα GPT-4 και MiniGPT-5 LLM που αν και είναι πολύ token-εξαντλημένα, είναι τώρα πιο ακριβή και αποτελεσματικά. Ένα σημαντικό χαρακτηριστικό αυτών των προηγμένων μοντέλων LLM είναι ότι ενσωματώνουν σημαντικά περισσότερους token από τον αριθμό token που θεωρείται συνδυαστικά-βέλτιστος υπό τους νόμους κλιμάκωσης Chinchilla. Επιπλέον, οι dévelopπεροι και ερευνητές που εργάζονται στα πλαίσια LLM έχουν μάθει ότι αυτά τα μικρότερα πλαίσια LLM μπορούν να εκπαιδευτούν περαιτέρω χρησιμοποιώντας μια προπριetary-μοντέλα-βασισμένη dSFT ή Distilled Supervised Fine-Tuning προσέγγιση, που χρησιμοποιεί την έξοδο από ένα αποτελεσματικό δασκάλο μοντέλο ως εποπτευόμενη δεδομένα για το μαθητή μοντέλο σε μια προσπάθεια να αυξήσει την ακρίβεια. Η στρατηγική της απόσταξης έχει αποδειχθεί ως ένα πολύ αποτελεσματικό και χρήσιμο εργαλείο για να μεγιστοποιήσει τις δυνατότητες των ανοιχτών μοντέλων σε eine ευρεία γκάμα εργασιών, αν και δεν μπορεί ακόμη να αναπαράγει την απόδοση που επιτυγχάνεται από το δασκάλο μοντέλο. Επιπλέον, οι χρήστες έχουν συχνά αναφέρει ότι αυτά τα μοντέλα συχνά εμφανίζουν “συστάδα-αποσύνδεση”, που σημαίνει ότι τα μοντέλα δεν συμπεριφέρονται με τρόπο που συστάζεται με τις απαιτήσεις των τελικών χρηστών, οδηγώντας σε λανθασμένα αποτελέσματα που δεν παρέχουν το σωστό αποτέλεσμα ή απαντήσεις στις εισόδους ή ερωτήσεις του χρήστη.

Η συστάδα έχει πάντα ήταν ένα σημαντικό πρόβλημα για τους dévelopπεροι με πρόσφατες εργασίες που επικεντρώνονται στην ανάπτυξη βεντσών όπως AlpacaEval και MT-Bench που έχουν αναπτυχθεί για να στοχεύσουν την αποσύνδεση. Η мотивασία για την ανάπτυξη του πλαισίου Zephyr μπορεί να αποδοθεί στο πρόβλημα της χρήσης απόσταξης για να συστάξει ένα μικρό ανοιχτό πλαίσιο LLM εντελώς, όπου ο πρωταρχικός βήμα είναι να χρησιμοποιήσει μια AIF ή Artificial Intelligence Feedback για να λάβει δεδομένα προτίμησης από ένα σύνολο του δασκάλου μοντέλου, και στη συνέχεια να εφαρμόσει την απόσταξη προτίμησης άμεσα ως το πρωταρχικό στόχο μάθησης, μια προσέγγιση που αναφέρεται ως dDPO ή Denoising Diffusion Policy Optimization. Το κύριο χαρακτηριστικό της προσέγγισης dDPO είναι ότι αντίθετα με τους προκατόχους του όπως PPO ή Proximal Preference Optimization, δεν απαιτεί ανθρώπινη δειγματοληψία ή αναφορές, και επίσης μειώνει τον χρόνο που απαιτείται για την εκπαίδευση ενός γλωσσικού μοντέλου. Επιπλέον, επίσης επιτρέπει στους dévelopπεροι να μεγιστοποιήσουν τις ανταμοιβές του τελικού δείγματος με την προσοχή στη σειρά των βημάτων απόσταξης από την αρχή μέχρι το τέλος, σε άλλες λέξεις, καθ’ όλη τη διάρκεια.

Οι dévelopπεροι έχουν αναπτύξει το πλαίσιο Zephyr-7B για να επικυρώσουν αυτήν την προσέγγιση, και σε κάποιους τρόπους, είναι μια συστάδα έκδοση του state of the art πλαισίου Mistral-7B. Το πλαίσιο πρώτα χρησιμοποιεί dSFT ή Distilled Supervised Fine-Tuning με βάση το σύνολο δεδομένων UltraChat, και εφαρμόζει την προσέγγιση dDPO ή Denoising Diffusion Policy Optimization στα δεδομένα ανατροφοδότησης. Πειράματα δείχνουν ότι το πλαίσιο Zephyr-7B με 7 δισεκατομμύρια παραμέτρους παρέχει αποτελέσματα συγκρίσιμα με αυτά που παρέχονται από μοντέλα chat που συστάζονται με ανθρώπινη ανατροφοδότηση με πάνω από 70 δισεκατομμύρια παραμέτρους. Επιπλέον, πειράματα δείχνουν επίσης ότι τα αποτελέσματα μπορούν να βελτιωθούν και σε σχέση με τα βεντς που λαμβάνουν υπόψη τις ικανότητες συνομιλίας, καθώς και τα τυπικά ακαδημαϊκά βεντς, και η χρήση της μάθησης προτίμησης είναι κρίσιμη για την επίτευξη των επιθυμητών αποτελεσμάτων.

Η παραπάνω εικόνα δείχνει την απόδοση των verschiedenen γλωσσικών μοντέλων στο βέντς MT-bench. Το πλαίσιο Zephyr-7B που εκπαιδεύτηκε με την προσέγγιση dDPO αντιμετωπίζεται με ιδιωτικά και ανοιχτά, μεγαλύτερα γλωσσικά μοντέλα όπως GPT-3.5 turbo, Llama-2-70B, και άλλα που εκπαιδεύτηκαν με πρόσθετη ενίσχυση μάθησης και επίσης περιελάμβαναν một μεγάλο αριθμό ανθρώπινης ανατροφοδότησης. Όπως είναι σαφές, παρά την τεράστια διαφορά στον αριθμό παραμέτρων που αυτά τα πλαίσια χρησιμοποιούν, το πλαίσιο Zephyr-7B παρέχει συγκρίσιμα αποτελέσματα με τα περισσότερα από αυτά, και υπερτερεί αρκετών πλαισίων σε διαφορετικά πεδία.

Ζέφυρ-7B: Μέθοδος, Λειτουργία και Αρχιτεκτονική

Ο πρωταρχικός στόχος του πλαισίου Zephyr-7B είναι να βοηθήσει ένα ανοιχτό γλωσσικό μοντέλο να συστάξει όσο το δυνατόν πιο κοντά στην πρόθεση του χρήστη, και καθ’ όλη τη διάρκεια, το πλαίσιο Zephyr-7B υποθέτει πρόσβαση σε ένα μεγάλο δασκάλο μοντέλο που ερωτάται με γεννήτρια προώθησης. Το Zephyr-7B ακολουθεί μια προσέγγιση παρόμοια με αυτήν που χρησιμοποιείται στο πλαίσιο InstructGPT, και στοχεύει να γεννήσει ένα αποτελεσματικό και ακριβές μαθητή μοντέλο.

Η ακόλουθη εικόνα δείχνει συνοπτικά τα τρία πρωταρχικά βήματα που εμπλέκονται στη λειτουργία του πλαισίου Zephyr-7B.

  1. dSFT για μεγάλη κλίμακα κατασκευή συνόλου δεδομένων με στυλ αυτο-διδασκαλίας.
  2. Συλλογή AIF χρησιμοποιώντας ένα σύνολο ολοκληρωμένων μοντέλων συνομιλίας followed by προτίμηση διωνυμική και σκοράρισμα από GPT-4.
  3. dPO του μοντέλου dSFT χρησιμοποιώντας τα δεδομένα ανατροφοδότησης.

dSFT ή Distilled Supervised Fine-Tuning

Το πλαίσιο αρχίζει με ένα ακατέργαστο Μεγάλο Γλωσσικό Μοντέλο που πρώτα πρέπει να εκπαιδευτεί για να ανταποκριθεί σε προωθήσεις χρήστη. Παραδοσιακά, η εκπαίδευση αυτών των μοντέλων LLM για να ανταποκριθούν σε προωθήσεις χρήστη γίνεται χρησιμοποιώντας SFT ή Supervised Fine Tuning σε ένα σύνολο δεδομένων που αποτελείται από υψηλής ποιότητας οδηγίες και τις αντίστοιχες απαντήσεις.既然 το πλαίσιο Zephyr-7B έχει πρόσβαση σε ένα δασκάλο γλωσσικό μοντέλο, το πλαίσιο μπορεί να γεννήσει οδηγίες και απαντήσεις, και να εκπαιδεύσει το μοντέλο απευθείας σε αυτές τις οδηγίες και απαντήσεις, και αυτή η προσέγγιση ονομάζεται dSFT ή distilled SFT. Η ακόλουθη εικόνα δείχνει την απόσταξη που thựcείται από SFT όπου x αντιπροσωπεύει ένα σύνολο σπορ προωθήσεων που κατασκευάζονται με τον πρωταρχικό σκοπό της αναπαράστασης ενός διαφορετικού συνόλου θεματικών τομέων, y αντιπροσωπεύει την απάντηση δείγματος, που βελτιώνεται χρησιμοποιώντας μια νέα δείγμα οδηγία που αντιπροσωπεύεται από x1 και C αντιπροσωπεύει το τελικό σημείο στο τελικό σύνολο δεδομένων.

AI Feedback через Προτιμήσεις

Η ανθρώπινη ανατροφοδότηση χρησιμοποιείται για να ανατεθεί Γλωσσικά Μοντέλα καθώς μπορούν να παρέχουν τα απαραίτητα πρόσθετα σήματα, και αυτά τα ανθρώπινα feedback παραδοσιακά παρέχονται μέσω προτιμήσεων στην ποιότητα των απαντήσεων που γεννήθηκαν από τα μοντέλα LLM. Ωστόσο, το πλαίσιο Zephyr χρησιμοποιεί AI Feedback από το δασκάλο μοντέλο στα αποτελέσματα άλλων μοντέλων αντί για ανθρώπινη ανατροφοδότηση για σκοπούς απόσταξης. Η προσέγγιση που ακολουθεί το πλαίσιο Zephyr επηρεάζεται από αυτήν που χρησιμοποιείται από το πλαίσιο UltraFeedback που χρησιμοποιεί το δασκάλο μοντέλο για να παρέχει προτιμήσεις στα αποτελέσματα του μοντέλου.

Παρόμοια με την προσέγγιση SFT ή Supervised Fine Tuning, αρχίζει με ένα σύνολο προωθήσεων, όπου x αντιπροσωπεύει κάθε μεμονωμένη προώθηση που στη συνέχεια τροφοδοτείται σε ένα σύνολο τεσσάρων μοντέλων όπως Llama, Falcon, Claude, και άλλα, τα οποία γεννήθηκαν μια απάντηση του δικού τους. Αυτές οι απαντήσεις στη συνέχεια τροφοδοτούνται ως είσοδος στο δασκάλο μοντέλο όπως GPT-3 ή GPT-4, και το μοντέλο εξόδου ένα σκορ για την είσοδο απάντηση. Μετά τη συλλογή των σκορ εξόδου, το μοντέλο αποθηκεύει την απάντηση με το υψηλότερο σκορ.

dDPO ή Distilled Direct Preference Optimization

dDPO είναι το τελικό βήμα του πλαισίου Zephyr, και ο πρωταρχικός στόχος του είναι να βελτιώσει το μοντέλο dSFT δασκάλου με τη μεγιστοποίηση της πιθανότητας της προτίμησης απάντησης σε ένα μοντέλο προτίμησης που καθορίζεται από μια συνάρτηση ανταμοιβής χρησιμοποιώντας το μαθητή γλωσσικό μοντέλο. Το προηγούμενο βήμα που αφορούσε τη χρήση AI Feedback εστίασε κυρίως στη χρήση μεθόδων Ενίσχυσης Μάθησης όπως PPO ή Proximal Policy Optimization για μέγιστη βελτίωση σχετικά με την ανταμοιβή που παράγεται. Σε αυτό το βήμα, η ανταμοιβή πρώτα εκπαιδεύεται, και στη συνέχεια δειγματοληψία από την τρέχουσα πολιτική για να υπολογίσει τις ενημερώσεις, και έτσι μεγιστοποιώντας την βελτίωση. DPO ή Direct Preference Optimization ακολουθεί μια παρόμοια προσέγγιση για να βελτιώσει το μοντέλο προτίμησης άμεσα χρησιμοποιώντας τα στατικά δεδομένα. Ο στόχος μετά τη σύνδεση της συνάρτησης ανταμοιβής στο μοντέλο προτίμησης μπορεί να γραφτεί ως

Ζέφυρ-7B: Πειράματα, Βεντς και Αποτελέσματα

Το πλαίσιο Zephyr διεξάγει τα πειράματά του για την εκπαίδευση στο τρέχον state of the art πλαίσιο Mistral-7B που παρέχει αποτελέσματα συγκρίσιμα με αυτά των πολύ μεγαλύτερων γλωσσικών μοντέλων σε eine ευρεία γκάμα φυσικής επεξεργασίας γλώσσας ή NLP εργασιών.

Σύνολα Δεδομένων

Το πλαίσιο Zephyr χρησιμοποιεί δύο σύνολα διαλόγου που έχουν αποσταχθεί από ένα μείγμα ιδιωτικών και ανοιχτών μοντέλων, που έχουν προηγουμένως αποδείξει ότι είναι αποτελεσματικά στην παραγωγή αποτελεσματικών μοντέλων συνομιλίας.

UltraChat

Το UltraChat είναι ένα σύνολο αυτο-βελτίωσης που αποτελείται από σχεδόν 1,5 εκατομμύρια multi-στροφικές συνομιλίες που διανέμονται σε 30 θέματα, και 20 κείμενα που παράγονται από το πλαίσιο GPT-3.5-Turbo. Για να αντιμετωπιστούν τα προβλήματα λανθασμένης κεφαλαιοποίησης που αντιμετωπίζει το σύνολο UltraChat, το πλαίσιο εφαρμόζει μια προσέγγιση truecasing εύρησης για να απομακρύνει τα γραμματικά λάθη.

UltraFeedback

Το UltraFeedback είναι ένα σύνολο προωθήσεων με πάνω από 64k προωθήσεις, με κάθε μια από αυτές τις προωθήσεις να έχει τέσσερις μεμονωμένες απαντήσεις LLM. Το πλαίσιο Zephyr χρησιμοποιεί το υψηλότερο μέσο σκορ που λαμβάνεται από το σύνολο UltraFeedback για να κατασκευάσει δυαδικές προτιμήσεις, και μια από τις τρεις απαντήσεις LLM απορρίπτεται ως τυχαία.

Αξιολόγηση

Για να αξιολογήσει την απόδοση του πλαισίου Zephyr, οι dévelopπεροι έχουν επιλέξει δύο βεντς συνομιλίας, ένα single-στροφή και ένα multi-στροφή, σε μια προσπάθεια να αξιολογήσει την ικανότητα του μοντέλου να ακολουθεί τις οδηγίες του χρήστη και να απαντάει ανάλογα.

MT-Bench

Το βέντς MT-Bench αποτελείται από 160 ερωτήσεις που διανέμονται σε 8 μοναδικά πεδία γνώσης, και υπό το βέντς MT-Bench, το μοντέλο πρέπει να απαντήσει σε μια αρχική ερώτηση, και να παρέχει μια απάντηση στην ερώτηση που ακολουθεί.

AlpacaEval

Το AlpacaEval είναι ένα single-στροφή βέντς υπό το οποίο το μοντέλο ή το πλαίσιο γεννήτειες απαντήσεις χρήστη σε πάνω από 800 ερωτήσεις που διανέμονται σε διαφορετικά θέματα με τον πρωταρχικό στόχο να είναι η χρησιμότητα.

Επιπλέον των δύο αυτών βεντς, το πλαίσιο Zephyr-7B αξιολογείται επίσης στο Open LLM Leaderboard για εργασίες πολλαπλής ταξινόμησης, ARC, HellaSwag, MMLU, και άλλα. Επιπλέον, ανεξάρτητα από το ποιο βέντς αξιολογείται το πλαίσιο Zephyr-7B, συγκρίνεται με μια σειρά ιδιωτικών και ανοιχτών μοντέλων, με την διαδικασία συστάδας να είναι ο μόνος διαφοροποιητικός παράγοντας.

Αποτελέσματα

Ας δούμε πώς το πλαίσιο Zephyr-7B εκτελείται, και συγκρίνεται με τα τρέχοντα state of the art γλωσσικά μοντέλα.

Εφαρμογή της Προσέγγισης dDPO Βελτιώνει τις Ικανότητες Συνομιλίας

Ο ακόλουθος πίνακας συγκρίνει την απόδοση του πλαισίου Zephyr-7B με τα state of the art γλωσσικά μοντέλα στα βεντς AlpacaEval και MT-Bench.

Όπως είναι σαφές, όταν τοποθετείται ενάντια σε ανοιχτά μοντέλα 7B, το πλαίσιο Zephyr-7B δεν μόνο υπερτερεί σημαντικά τα μοντέλα dSFT σε αυτά τα δύο βεντς, αλλά επίσης θέτει νέα state of the art πρότυπα. Επιπλέον, το πλαίσιο Zephyr-7B επίσης καταφέρνει να υπερτερήσει το μοντέλο XWIN-LM-7B, το οποίο είναι ένα από τα σπάνια μοντέλα που εκπαιδεύτηκαν με την προσέγγιση dPPO. Επιπλέον, η απόδοση που παρέχει το πλαίσιο Zephyr-7B είναι συγκρίσιμη με τα αποτελέσματα που παρέχονται από πολύ μεγαλύτερα γλωσσικά μοντέλα όπως Llama2-Chat με πάνω από 70 δισεκατομμύρια παραμέτρους.

dDPO Βελτιώνει την Απόδοση των Ακαδημαϊκών Εργασιών

Η ακόλουθη εικόνα συγκρίνει την απόδοση του πλαισίου Zephyr-7B με eine ευρεία γκάμα ανοιχτών και ιδιωτικών μοντέλων LLM.

Όπως είναι σαφές, το πλαίσιο Zephyr-7B υπερτερεί σημαντικά τα μοντέλα LLM με 7B παραμέτρους, και ο χάσμα μεταξύ της απόδοσης του και της απόδοσης που παρέχεται από τα καλύτερα μοντέλα dSFT είναι επίσης εμφανής. Όταν ο αριθμός παραμέτρων αυξάνεται, το πλαίσιο Zephyr-7B μειώνεται, αν και ταιριάζει με την απόδοση που παρέχεται από τα μοντέλα με 40 δισεκατομμύρια παραμέτρους.

Προτίμηση Βελτίωσης

Στην ακόλουθη εικόνα, αξιολογούμε πώς τα διαφορετικά βήματα που ακολουθούνται στη διαδικασία συστάδας επηρεάζουν την απόδοση. Όπως είναι σαφές, η προσέγγιση dDPO όταν συνδυάζεται με dSFT βελτιώνει σημαντικά την απόδοση και στα δύο βεντς MT-Bench και AlpacaEval.

Τέλος, στην ακόλουθη εικόνα μπορούμε να δούμε τις ακρίβειες δοκιμών και εκπαίδευσης κατά τη διάρκεια της εφαρμογής DPO. Όπως είναι σαφές, η προσέγγιση DPO δεν επηρεάζει την απόδοση του μοντέλου στις εργασίες μετά-εκπαίδευσης.

Συμπέρασμα

Σε αυτό το άρθρο, έχουμε μιλήσει για το πλαίσιο Zephyr-7B με βάση το τρέχον state of the art πλαίσιο Mistral-7B που στοχεύει να λύσει το τρέχον πρόβλημα της απόσταξης συστάδας από ένα μεγάλο γλωσσικό μοντέλο σε ένα πολύ μικρότερο προ-εκπαιδευμένο πλαίσιο. Ο πρωταρχικός στόχος του πλαισίου είναι να επιτρέψει στους dévelopπεροι να παράγουν μικρότερα μεγάλα γλωσσικά μοντέλα που συστάζονται με την πρόθεση του χρήστη πιο κοντά παρά ποτέ. Το πλαίσιο Zephyr-7B δεν εξετάζει μόνο την εφαρμογή των τρεχόντων προσεγγίσεων για μεγαλύτερα πλαίσια LLM όπως dSFT, αλλά επίσης εξετάζει τη δυνατότητα χρήσης άλλων προσεγγίσεων για να μάθει ένα chat μοντέλο με καλύτερη συστάδα με την πρόθεση του χρήστη.

Ωστόσο, παρά τα υποσχόμενα αποτελέσματα, το πλαίσιο Zephyr-7B δεν είναι τέλειο, και κάποια δουλειά πρέπει ακόμη να γίνει. Ένα από τα σαφή προβλήματα είναι η χρήση του πλαισίου GPT-4 για να αξιολογήσει τα βεντς MT-Bench και AlpacaEval, τα οποία έχουν συχνά προκατειλημμένα προς τα μοντέλα που αποσταξυτίζονται από αυτά. Ωστόσο, το πλαίσιο Zephyr-7B ελπίζει να ανοίξει einen δρόμο για την εξέταση των ικανοτήτων των μικρότερων ανοιχτών μοντέλων που είναι ικανά να συστάζονται με την πρόθεση και τις互одействίες του χρήστη.

Ένας μηχανικός επάγγελμα, ένας συγγραφέας με την καρδιά. Ο Kunal είναι ένας τεχνικός συγγραφέας με einen βαθύ έρωτα και κατανόηση του AI και ML, αφιερωμένος στο να απλοποιεί σύνθετες έννοιες σε αυτά τα πεδία μέσω των ελκυστικών και ενημερωτικών εγγράφων του.