Prompt engineering
Εμπλουτισμένα Κείμενα Embeddings με Μεγάλες Γλωσσικές Μοντέλα

Τα κείμενα embeddings είναι διανυσματικές αναπαραστάσεις λέξεων, προτάσεων, παραγράφων ή εγγράφων που αποτυπώνουν τη σημασιολογική τους σημασία. Λειτουργούν ως βασικός строительный блок σε πολλές εφαρμογές επεξεργασίας φυσικής γλώσσας (NLP) σήμερα, συμπεριλαμβανομένης της ανάκτησης πληροφοριών, της απάντησης σε ερωτήσεις, της σεματικής αναζήτησης και πολλών άλλων.
Οι πρόσφατες προόδους στις μεγάλες γλωσσικές μοντέλα (LLMs) όπως το GPT-3 έχουν δείξει εντυπωσιακές ικανότητες στην εκμάθηση με λίγα παραδείγματα και τη φυσική γλωσσική γενεσιουργία. Μπορούμε να αξιοποιήσουμε τα LLMs για να προωθήσουμε επίσης την κατάσταση των κειμένων embeddings; Στην εργασία τους “Βελτίωση των Κειμένων Embeddings με Μεγάλες Γλωσσικές Μοντέλα“, ερευνητές από τη Microsoft (MSFT ) προτείνουν μια νέα μέθοδο που επιτυγχάνει ανώτερα αποτελέσματα με τη γενεσιουργία συνθετικών δεδομένων εκπαίδευσης με LLMs και την εκπαίδευση σε αυτά.
Προκλήσεις με τις Υπάρχουσες Μέθοδους
Οι παραδοσιακές τεχνικές κειμένων embeddings όπως οι σταθμισμένες μεσολάβες των διανυσμάτων λέξεων ή το TF-IDF δεν καταφέρνουν να αποτυπώσουν επαρκώς την πλούσια контекστοποιημένη πληροφορία στο κείμενο. Οι πιο πρόσφατες μέθοδοι που βασίζονται σε προ-εκπαιδευμένα γλωσσικά μοντέλα όπως το BERT αποκτούν πολύ καλύτερα αποτελέσματα που είναι συνείδηση του контέκστου.
Ωστόσο, απαιτούν σύνθετες πολλαπλάστιες διαδικασίες εκπαίδευσης:
- Προ-εκπαίδευση σε δισεκατομμύρια αδύναμα επισημασμένα ή τεχνητά ζευγάρια κειμένων
- Εκπαίδευση σε περιορισμένα χειροκίνητα επιμελημένα σύνολα δεδομένων
Αυτό απαιτεί τεράστια υπολογιστικά μέσα και ανθρώπινη προσπάθεια για τη συλλογή δεδομένων. Τα δεδομένα εκπαίδευσης είναι επίσης περιορισμένα σε ποικιλία και γλωσσική κάλυψη. Για παράδειγμα, το BEIR benchmark αποτελείται από σύνολα δεδομένων για μόνο 15 εργασίες ανάκτησης στην αγγλική γλώσσα.
Οι υφιστάμενες μέθοδοι χρησιμοποιούν κυρίως μικρότερα αρχιτεκτονικά στυλ BERT ως το βασικό μοντέλο. Δεν μπορούν να επωφεληθούν από πιο προηγμένα LLMs και συναφείς τεχνικές.
Μεθοδολογία: Συνθετική Γενεσιουργία Δεδομένων με LLMs
Για να υπερβούν αυτές τις περιορισμοί, οι ερευνητές προτείνουν μια νέα μονο-σταδιακή προσέγγιση εκπαίδευσης που αξιοποιεί τα LLMs όπως το GPT-3 και το GPT-4 για τη γενεσιουργία ποικίλων συνθετικών δεδομένων εκπαίδευσης.
Τα βασικά βήματα είναι:
- Ταξινόμηση Εργασιών: Ορίστε μια ταξινόμηση που κατηγοριοποιεί τις εργασίες κειμένων embeddings σε:
- Ασυμμετρικές εργασίες (ερώτηση και έγγραφο δεν είναι παραφράσεις, π.χ. αναζήτηση)
- Συμμετρικές εργασίες (ερώτηση και έγγραφο είναι παραφράσεις, π.χ. σεματική ομοιότητα)
- Σχεδιασμός Προώθησης: Δημιουργήστε προωθητικές προτυπώσεις που είναι προσαρμοσμένες σε κάθε τύπο εργασίας και που οδηγούν το LLM να γεννήσει σχετικά παραδείγματα εκπαίδευσης.
- Γενεσιουργία Συνθετικών Δεδομένων: Προωθήστε το LLM με τις σχεδιασμένες προωθητικές προτυπώσεις για να γεννήσετε εκατοντάδες χιλιάδες (ερώτηση, έγγραφο) ζευγάρια που καλύπτουν eine ευρεία ποικιλία σεματικών εργασιών σε 93 γλώσσες.
- Εκπαίδευση Μοντέλου: Εκπαιδεύστε ένα ισχυρό ανοιχτό LLM όπως το Mistral στα συνθετικά δεδομένα χρησιμοποιώντας αντίθετη απώλεια.
Αυτή η μεθοδολογία επιτρέπει τη δημιουργία επαρκών δεδομένων εκπαίδευσης για ποικίλες εργασίες σε πολλές γλώσσες χωρίς ανθρώπινη επέμβαση. Αξιοποιώντας τις γνώσεις που ήδη είναι ενσωματωμένες στα LLMs μέσω προ-εκπαίδευσης σε ιστοσελίδες-κλίμακας corpora, μπορούμε να συνθέσουμε υψηλής ποιότητας δεδομένα που είναι ακριβώς προσαρμοσμένα για κείμενα embeddings.
Οι ερευνητές αποδεικνύουν αυτό με μια 2-βήματη στρατηγική προώθησης:
- Προωθήστε το GPT-4 για να προτείνει πιθανές εργασίες ανάκτησης
- Προωθήστε το ξανά για να γεννήσετε (ερώτηση, έγγραφο) δείγματα με βάση τις προτεινόμενες εργασίες
Ορισμένα βασικά χαρακτηριστικά του σχεδιασμού προώθησης:
- Φυσική γλώσσα προώθησης για直觀 ανθρώπινες οδηγίες
- Προσωρινά για να ενθαρρύνουν την ποικιλία (π.χ. μήκος ερωτήματος, σαφήνεια, μήκος εγγράφου)
- Συνδυασμός δεδομένων από πολλές προτυπώσεις για τον ίδιο τύπο εργασίας
- Βάρος γλωσσών με βάση τη διαθεσιμότητα πόρων
Συνολικά, ήταν σε θέση να γεννήσουν 500k παραδείγματα κειμένων embeddings με ένα υπολογιστικό κόστος 180M tokens. Η κυρίαρχη γλώσσα ήταν η αγγλική (43%) ακολουθούμενη από την πολωνική, την ιαπωνική, την ιταλική και άλλες.
Για την εκπαίδευση του μοντέλου, επέλεξαν να εκπαιδεύσουν το ανοιχτό 7B παραμέτρου Mistral μοντέλο αντί για μικρότερα αρχιτεκτονικά στυλ BERT.既然 το Mistral ήταν ήδη προ-εκπαιδευμένο σε τεράστιες κλίμακας corpora, δεν χρειαζόταν πρόσθετη αντίθετη προ-εκπαίδευση. Η προσθήκη του παρείχε αμελητέες βελτιώσεις.
Η ολόκληρη διαδικασία εκπαίδευσης διήρκεσε λιγότερο από 1k βήματα, χρησιμοποιώντας ένα μείγμα συνθετικών και ανθρώπινων δεδομένων. Αυτό αποδεικνύει την αποτελεσματικότητα της προτεινόμενης μεθόδου.
Αποτελέσματα
Οι ερευνητές αξιολόγησαν το μοντέλο τους στο MTEB benchmark, το οποίο καλύπτει ποικίλες εργασίες σε κατηγοριοποίηση, ομαδοποίηση, σεματική ομοιότητα, περίληψη και ανάκτηση πληροφοριών.
Το μοντέλο τους υπερέβη την προηγούμενη καλύτερη επίδοση με 2.4 πόντους στο μέσο όρο, θέτοντας νέα ρεκόρ σχεδόν σε κάθε κατηγορία:
| Μοντέλο | Προηγούμενη Καλύτερη Επίδοση | Προτεινόμενο Μοντέλο |
|---|---|---|
| Κατηγοριοποίηση | 76.0 | 78.5 |
| Ομαδοποίηση | 46.1 | 50.3 |
| Ζευγαρωτή Κατηγοριοποίηση | 87.1 | 88.3 |
| Επανταξινόμηση | 60.0 | 60.2 |
| Ανάκτηση | 54.3 | 56.9 |
| STS | 83.1 | 84.6 |
| Περίληψη | 31.6 | 31.4 |
| Μέσος Όρος | 64.2 | 66.6 |
Εντυπωσιακά, ακόμη και χωρίς τη χρήση επισημασμένων δεδομένων και εκπαίδευση μόνο σε συνθετικά δεδομένα, πέτυχε ανταγωνιστική ακρίβεια – μόνο 3.5 πόντους πίσω από το πλήρως επιβλεπόμενο μοντέλο. Αυτό αποδεικνύει την εφικτότητα της γενεσιουργίας κειμένων embeddings μόνο με LLMs, χωρίς ανθρώπινη επέμβαση.
Οι ερευνητές αξιολόγησαν επίσης στο multilingual MIRACL benchmark που καλύπτει 18 γλώσσες. Το μοντέλο τους υπερέβη την προηγούμενη καλύτερη επίδοση σε γλώσσες με υψηλές πόρους, αλλά ήταν πιο αδύναμο σε γλώσσες με χαμηλές πόρους. Υποθέτουν ότι αυτό θα μπορούσε να μετριαστεί με την προ-εκπαίδευση LLMs πιο εκτενώς σε γλώσσες με χαμηλές πόρους.
Συνοψίζοντας, τα κείμενα embeddings που εκπαιδεύονται σε συνθετικά δεδομένα που γεννήθηκαν από LLMs θέτουν νέα ρεκόρ, ενώ χρησιμοποιούν απλούστερες και πιο αποτελεσματικές διαδικασίες εκπαίδευσης σε σύγκριση με τις προηγούμενες πολλαπλάστιες προσεγγίσεις. Με περαιτέρω έρευνα στη μηχανική προώθησης και την ποιότητα συνθετικών δεδομένων, αυτή η μεθοδολογία θα μπορούσε να προωθήσει σημαντικά τις multilingual κείμενα embeddings.
Ανάλυση
Αυτή η εργασία προσφέρει πολλάτιμες λήψεις:
- Τα LLMs όπως το GPT-3 και το GPT-4 έχουν εντυπωσιακή ικανότητα να γεννήσουν υψηλής ποιότητας συνθετικά δεδομένα εκπαίδευσης για ποικίλες NLP εργασίες όταν προωθούνται σωστά. Αυτό μπορεί να μειώσει την εξάρτηση από ανθρώπινη επέμβαση.
- Για τα κείμενα embeddings, η αντίθετη προ-εκπαίδευση παρέχει αμελητέες βελτιώσεις σε σύγκριση με την απλή εκπαίδευση μοντέλων όπως το Mistral που ήδη έχουν trillion-κλίμακας προ-εκπαίδευση. Αυτό είναι ένα σημαντικό εύρημα για την αποτελεσματικότητα της εκπαίδευσης.
- Οι μεθόδους ανάκτησης που ενισχύουν τη γενεσιουργία είναι ικανές να δώσουν στα LLMs δυναμική πρόσβαση σε εξωτερικές γνώσεις. Έτσι, η βελτίωση των κειμένων embeddings είναι πολύτιμη για την ενίσχυση αυτών των LLMs.
- Υπάρχει σημαντικός χώρος για βελτίωση στις γλώσσες με χαμηλές πόρους. Multilingual LLMs που προ-εκπαιδεύονται σε πιο αντιπροσωπευτικά δεδομένα θα μπορούσαν να βοηθήσουν να κλείσουν αυτό το χάσμα.
- Εννοιολογικά, η γλωσσική μοντελοποίηση και τα κείμενα embeddings είναι δύο πλευρές του ίδιου νομίσματος – κατανόηση της γλωσσικής σημασίας. Με τη συνθετική προώθηση, τα LLMs μπορούν να προσαρμοστούν οργανικά σε embedders χωρίς σύνθετες διαδικασίες.
Ορισμένες υποσχόμενες κατευθύνσεις για μελλοντική εργασία περιλαμβάνουν:
- Αξιοποίηση ανοιχτών LLMs όπως το GPT-NeoX για τη γενεσιουργία συνθετικών δεδομένων
- Εξερεύνηση ελαφριών μεθόδων μετά την εκπαίδευση για την προσαρμογή των embedders σε μεγαλύτερες περιπτώσεις
- Ανάπτυξη τεχνικών προώθησης για τον έλεγχο της ποιότητας και της κάλυψης των εργασιών
- Μέθοδοι για τη βελτίωση της καθυστέρησης και του κόστους αποθήκευσης για βιομηχανική χρήση
Πέρα από την υπέρβαση των ρεκόρ, η χρήση μεγάλων γλωσσικών μοντέλων για την ενίσχυση των κειμένων embeddings ανοίγει ενδιαφέρουσες δυνατότητες για το μέλλον. Όσο τα LLMs συνεχίζουν να προοδεύουν στην κυριαρχία της φυσικής γλώσσας, η ικανότητά τους να γεννήσουν υψηλής ποιότητας συνθετικά δεδομένα θα είναι πιθανό να βελτιωθεί επίσης.
Ωστόσο, κρίσιμες ερευνητικές κατευθύνσεις παραμένουν για να μετατρέψουν αυτό το δυναμικό σε πραγματική επίδραση.
Προσαρμογή και Έλεγχος
Ένα βασικό πλεονέκτημα των συνθετικών δεδομένων είναι η khảότητα να γεννήσετε παραδείγματα που είναι προσαρμοσμένα σε συγκεκριμένες ανάγκες. Όπως αποδείχθηκε στην εργασία, ο σχεδιασμός προώθησης επιτρέπει τη δημιουργία δεδομένων εκπαίδευσης για εκατοντάδες χιλιάδες εργασίες embeddings.
Ωστόσο, οι τρέχουσες πρακτικές σχεδιασμού προώθησης παραμένουν περισσότερο ένα έργο τέχνης παρά επιστήμη. Η ανάπτυξη συστηματικών, αναπαραγώγιμων μεθόδων για τον ακριβή έλεγχο των ιδιοτήτων των γεννημένων δεδομένων θα επέκτεινε την εφαρμοσιμότητα αυτής της τεχνικής.
Για παράδειγμα, τεχνικές για τον έλεγχο παραγόντων όπως η πολυπλοκότητα, η αμφιiguity και η καινοτομία των παραδειγμάτων θα μπορούσαν να βοηθήσουν στην αντιμετώπιση προβλημάτων ανθεκτικότητας σε εργασίες κατάρτισης. Η δυναμική γενεσιουργία προώθησης για να ταιριάζει με τις εξελισσόμενες πραγματικές διανομές είναι μια άλλη ανοιχτή πρόκληση.
Εκπαίδευση σε Κλίμακα
Ενώ τα προ-εκπαιδευμένα LLMs ήδη κωδικοποιούν σημαντικές γλωσσικές γνώσεις, οι ικανότητές τους στη γενεσιουργία δεδομένων είναι πιθανό να ενισχυθούν περαιτέρω με πρόσθετη κλίμακα. Μοντέλα όπως το GPT-4 που εκπαιδεύονται σε τρισεκατομμύρια tokens διαδικτυακών κειμένων εμφανίζουν ισχυρή εκμάθηση με λίγα παραδείγματα, αλλά δεν έχουν βελτιστοποιηθεί ειδικά για τη γενεσιουργία δεδομένων εκπαίδευσης.
Αρχιτεκτονικές και αντικείμενα που προορίζονται για την αυτο-εκπαίδευση της γενεσιουργίας δεδομένων σε κλίμακα διαδικτύου θα μπορούσαν να προωθήσουν σημαντικά την ποιότητα και την αποτελεσματικότητα αυτής της μεθόδου. Η αποτελεσματική ενσωμάτωση ανακτημένων γνώσεων για να συμπληρώσει τις γνώσεις που έχουν μάθει είναι μια άλλη υποσχόμενη κατεύθυνση.
Πολυεργασίες και Πολυγλωσσικές
Όπως σημειώθηκε στην εργασία, η βελτίωση της απόδοσης σε γλώσσες με χαμηλές πόρους παραμένει ένα ζήτημα. Αντί να προ-εκπαιδεύσετε ένα ενιαίο τεράστιο LLM, μια εναλλακτική είναι η εκπαίδευση ενός στόλου μικρότερων ειδικών μοντέλων που ειδικεύονται σε συγκεκριμένες δεδομενικές modalities ή γλωσσικές περιοχές.
Μια τέτοια προσέγγιση ensemble θα μπορούσε να βοηθήσει στην βελτίωση της κάλυψης σπάνιων εργασιών και γλωσσών με τη μοιρασία αναπαραστάσεων που έχουν μάθει μεταξύ ειδικών. Η συνεχής εκμάθηση για την επέκταση της γλωσσικής και εργασιακής εμπειρογνωσίας με τον καιρό είναι επίσης μια ενθουσιώδης προοπτική.
Συνοψίζοντας, αυτή η εργασία εισάγει μια καινοτόμο έννοια της γενεσιουργίας δεδομένων εκπαίδευσης από LLMs για τη δημιουργία αποτελεσματικών κειμένων embeddings. Τα αποτελέσματά τους αποδεικνύουν την αποτελεσματικότητα αυτής της μεθόδου, υπερβαίνοντας τις προηγούμενες επιδόσεις. Όσο τα LLMs και οι τεχνικές συνθετικών δεδομένων προοδεύουν, η αξιοποίηση της γνώσης τους για την εκπαίδευση embedders θα μπορούσε να γίνει μια πολύ υποσχόμενη κατεύθυνση.















