Μοντέλα και πλατφόρμες AI
LongWriter: Απελευθερώνοντας τη Γεννήτρια 10.000+ Λέξεων από τις Μεγάλες Γλώσσες ΛΛΜ
Οι τρέχουσες μεγάλες γλώσσες με μεγάλο контέκστ (LLMs) μπορούν να επεξεργαστούν εισαγωγές μέχρι 100.000 tokens, αλλά δυσκολεύονται να παράγουν εξοδούς που υπερβαίνουν ακόμη και ένα μέτριο μήκος 2.000 λέξεων. Έλεγχοι πειραμάτων αποκαλύπτουν ότι το αποτελεσματικό μήκος γεννήτριας του μοντέλου είναι εγγενώς περιορισμένο από τα παραδείγματα που είδαν κατά τη διάρκεια της επίβλεψης της εκπαίδευσης (SFT). Με άλλα λόγια, αυτό το όριο εξόδου προέρχεται από την σπανιότητα των παραδειγμάτων με μακρά έξοδο στις υφιστάμενες βάσεις δεδομένων SFT.
Οι πρόσφατες προόδους στις μεγάλες γλώσσες με μεγάλο контέκστ έχουν οδηγήσει στην ανάπτυξη μοντέλων με σημαντικά διευρυμένες ικανότητες μνήμης, ικανών να επεξεργαστούν ιστορίες που υπερβαίνουν τα 100.000 tokens. Ωστόσο, παρά την ικανότητά τους να χειρίζονται εκτενείς εισαγωγές, οι τρέχουσες μεγάλες γλώσσες με μεγάλο контέκστ δυσκολεύονται να παράγουν εξοδούς tương đương μήκους.
Για να διερευνήσουμε αυτό το όριο, ο LongWriter εξετάζει το μέγιστο μήκος εξόδου των μοντέλων με μεγάλο контέκστ μέσω πολλών ερωτημάτων που απαιτούν διαφορετικά μήκη απάντησης, όπως «Γράψτε ένα άρθρο 10.000 λέξεων για την ιστορία της Ρωμαϊκής Αυτοκρατορίας». Τα αποτελέσματα δείχνουν ότι όλα τα μοντέλα αποτυγχάνουν να παράγουν εξοδούς μεγαλύτερους από 2.000 λέξεις. Παράλληλα, η ανάλυση των αρχείων αλληλεπίδρασης των χρηστών δείχνει ότι πάνω από το 1% των ερωτημάτων των χρηστών απαιτούν εξοδούς μεγαλύτερους από αυτό το όριο, υπογραμμίζοντας μια επείγουσα ανάγκη στην τρέχουσα έρευνα να αντιμετωπίσουν αυτό το ζήτημα.
Για να αντιμετωπίσουν αυτό το όριο, ο LongWriter εισάγει τον AgentWrite, μια.pipeline με βάση τον πράκτορα που διασπά τις υπέρ-μακρές εργασίες γεννήτριας σε υποεργασίες, επιτρέποντας στα μοντέλα LLM να παράγουν συνεκτικές εξοδούς που υπερβαίνουν τις 20.000 λέξεις. Χρησιμοποιώντας τον AgentWrite, ο LongWriter κατασκευάζει το LongWriter-6k, ένα σύνολο δεδομένων που περιέχει 6.000 δείγματα δεδομένων SFT με μήκη εξόδου που κυμαίνονται από 2k έως 32k λέξεις. Ενσωματώνοντας αυτά τα δεδομένα στη διαδικασία εκπαίδευσης, ο LongWriter manages να αυξήσει το μήκος εξόδου των υφιστάμενων μοντέλων σε πάνω από 10.000 λέξεις, διατηρώντας παράλληλα την ποιότητα εξόδου.
Ο LongWriter αναπτύσσει επίσης το LongBench-Write, một αναλυτικό chuẩn για την αξιολόγηση των ικανοτήτων υπέρ-μακρής γεννήτριας. Το μοντέλο 9B, που βελτιώνεται περαιτέρω μέσω της DPO, επιτυγχάνει την κορυφαία απόδοση σε αυτό το chuẩn, υπερβαίνοντας ακόμη και μεγαλύτερα ιδιωτικά μοντέλα.
Σε αυτό το άρθρο, θα συζητήσουμε το πλαίσιο LongWriter, θα εξετάσουμε την αρχιτεκτονική του και θα συγκρίνουμε την απόδοσή του με τα μοντέλα με μεγάλο контέκστ. Ας ξεκινήσουμε.
LongWriter: Πλαίσιο Γεννήτριας 10.000+ Λέξεων
Οι πρόσφατες προόδους στις μεγάλες γλώσσες με μεγάλο контέκστ έχουν οδηγήσει στην ανάπτυξη μοντέλων με σημαντικά διευρυμένες ικανότητες μνήμης, ικανών να επεξεργαστούν ιστορίες που υπερβαίνουν τα 100.000 tokens. Παρά την ικανότητά τους να χειρίζονται εκτενείς εισαγωγές, οι τρέχουσες μεγάλες γλώσσες με μεγάλο контέκστ δυσκολεύονται να παράγουν εξοδούς tương đương μήκους. Για να διερευνήσουμε αυτό το όριο, ο LongWriter εξετάζει το μέγιστο μήκος εξόδου των μοντέλων με μεγάλο контέκστ μέσω πολλών ερωτημάτων που απαιτούν διαφορετικά μήκη απάντησης, όπως «Γράψτε ένα άρθρο 10.000 λέξεων για την ιστορία της Ρωμαϊκής Αυτοκρατορίας». Τα αποτελέσματα δείχνουν ότι όλα τα μοντέλα αποτυγχάνουν να παράγουν εξοδούς μεγαλύτερους από 2.000 λέξεις. Παράλληλα, η ανάλυση των αρχείων αλληλεπίδρασης των χρηστών δείχνει ότι πάνω από το 1% των ερωτημάτων των χρηστών απαιτούν εξοδούς μεγαλύτερους από αυτό το όριο, υπογραμμίζοντας μια επείγουσα ανάγκη στην τρέχουσα έρευνα να αντιμετωπίσουν αυτό το ζήτημα.

Η μελέτη του LongWriter αποκαλύπτει μια βασική έμπνευση: το όριο του μήκους εξόδου είναι πρωτίστως εδραιωμένο στις ιδιότητες των συνόλων δεδομένων SFT. Συγκεκριμένα, ο LongWriter διαπιστώνει ότι το μέγιστο μήκος γεννήτριας ενός μοντέλου είναι αποτελεσματικά περιορισμένο από το άνω όριο των μηκών εξόδου που υπάρχουν στο σύνολο δεδομένων SFT, παρά την έκθεσή του σε πολύ μεγαλύτερες ακολουθίες κατά τη διάρκεια της προ-εκπαίδευσης. Αυτή η ανακάλυψη εξηγεί το πανταχού παρόν όριο 2.000 λέξεων στη γεννήτρια των τρεχόντων μοντέλων, поскольку τα υφιστάμενα σύνολα δεδομένων SFT σπάνια περιέχουν παραδείγματα που υπερβαίνουν αυτό το μήκος. Επιπλέον, поскольку πολλά σύνολα δεδομένων είναι αποσταγμένα από μοντέλα LLM, κληρονομούν επίσης το όριο μήκους εξόδου από τα μοντέλα πηγής.
Για να αντιμετωπίσουν αυτό το όριο, ο LongWriter εισάγει τον AgentWrite, μια pipeline με βάση τον πράκτορα που διασπά τις υπέρ-μακρές εργασίες γεννήτριας σε υποεργασίες, επιτρέποντας στα μοντέλα LLM να παράγουν συνεκτικές εξοδούς που υπερβαίνουν τις 20.000 λέξεις. Ο AgentWrite λειτουργεί σε δύο στάδια: Πρώτον, δημιουργεί einen λεπτομερή σχεδιασμό γραπτής εργασίας, που περιλαμβάνει την структуρά και τις απαιτήσεις λέξεων για κάθε παράγραφο, με βάση την εισαγωγή του χρήστη. Στη συνέχεια, ακολουθώντας αυτόν τον σχεδιασμό, ο AgentWrite καλεί το μοντέλο να παράγει περιεχόμενο για κάθε παράγραφο με σειρά, επιτρέποντας στο μοντέλο να συνεχίσει τη γραπτή εργασία με βάση την υπάρχουσα ιστορία γραπτής εργασίας. Αν και αυτή η σειριακή διαδικασία αποτρέπει τις παράλληλες κλήσεις στο μοντέλο για την ολοκλήρωση πολλών υποεργασιών ταυτόχρονα, και το μήκος εισαγωγής γίνεται μεγαλύτερο, ο LongWriter δείχνει στη διεξαγωγή ότι η συνολική συνεκτικότητα και ποιότητα της γραπτής εργασίας που λαμβάνεται με αυτόν τον τρόπο είναι πολύ ανώτερη από την έξοδο που παράγεται παράλληλα.
Χτίζοντας πάνω στην pipeline AgentWrite, ο LongWriter αξιοποιεί το GPT-4o για τη δημιουργία 6.000 δειγμάτων δεδομένων SFT με μακρά έξοδο, που ονομάζονται LongWriter-6k, και τα προσθέτει στη διαδικασία εκπαίδευσης των υφιστάμενων μοντέλων. Ιδιαίτερα, το LongWriter-6k καταφέρνει να ξεκλειδώσει την ικανότητα του μοντέλου να παράγει καλά δομημένες εξοδούς που υπερβαίνουν τις 10.000 λέξεις σε μήκος. Για να αξιολογήσει αυστηρά την αποτελεσματικότητα αυτής της προσέγγισης, ο LongWriter αναπτύσσει το LongBench-Write, ένα αναλυτικό chuẩn για την αξιολόγηση των ικανοτήτων υπέρ-μακρής γεννήτριας. Η αξιολόγηση στο LongBench-Write δείχνει ότι το μοντέλο 9B του LongWriter επιτυγχάνει την κορυφαία απόδοση, ακόμη και σε σύγκριση με μεγαλύτερα ιδιωτικά μοντέλα.
Για να συνοψίσουμε, η εργασία του LongWriter κάνει τις ακόλουθες καινοφανείς συνεισφορές:
- Ανάλυση των Ορίων Μήκους Γεννήτριας: Ο LongWriter ανακαλύπτει τον πρωταρχικό παράγοντα που περιορίζει το μήκος εξόδου των τρεχόντων μοντέλων LLM, που είναι το όριο του μήκους εξόδου στα δεδομένα SFT.
- AgentWrite: Για να υπερβεί αυτό το όριο, ο LongWriter προτείνει τον AgentWrite, που χρησιμοποιεί μια διαδικασία διαίρεσης και κατάκτησης με μοντέλα LLM για την αυτόματη κατασκευή δεδομένων SFT με υπέρ-μακρές εξοδούς. Χρησιμοποιώντας αυτή τη μέθοδο, ο LongWriter κατασκευάζει το LongWriter-6k.
- Κλιμάκωση του Μήκους Παραθύρου Εξόδου των Υφιστάμενων Μοντέλων LLM: Ο LongWriter ενσωματώνει το LongWriter-6k στη διαδικασία εκπαίδευσης, και με επιτυχία αυξάνει το μήκος παραθύρου εξόδου των υφιστάμενων μοντέλων σε πάνω από 10.000 λέξεις, διατηρώντας παράλληλα την ποιότητα εξόδου. Ο LongWriter δείχνει επίσης ότι η DPO βελτιώνει περαιτέρω τις ικανότητες γραπτής εργασίας του μοντέλου.
AgentWrite: Αυτόματη Κατασκευή Δεδομένων
Για να αξιοποιήσει τα μοντέλα LLM για την αυτόματη κατασκευή δεδομένων SFT με μακρά έξοδο, ο LongWriter σχεδιάζει τον AgentWrite, μια pipeline με βάση τον πράκτορα. Ο AgentWrite διασπά τις υπέρ-μακρές εργασίες γεννήτριας σε υποεργασίες, με κάθε υποεργασία να απαιτεί από το μοντέλο να γράψει μόνο μια παράγραφο. Το μοντέλο εκτελεί αυτές τις υποεργασίες σειριακά, και ο LongWriter συνδυάζει τις εξοδούς των υποεργασιών για να λάβει την τελική μακρά έξοδο. Αυτή η προσέγγιση της διαίρεσης μιας σύνθετης εργασίας σε πολλές υποεργασίες χρησιμοποιώντας πράκτορες LLM έχει ήδη εφαρμοστεί σε διάφορα πεδία, όπως η επίλυση προβλημάτων, η ανάπτυξη λογισμικού και η αξιολόγηση μοντέλων. Η εργασία του LongWriter είναι η πρώτη που διερευνά την ενσωμάτωση της σχεδίασης για να επιτρέψει στα μοντέλα να ολοκληρώσουν σύνθετες εργασίες γραπτής εργασίας. Κάθε βήμα του AgentWrite εισάγεται με λεπτομέρειες παρακάτω.

Βήμα I: Σχεδιασμός
Εμπνευσμένος από τη διαδικασία σκέψης των ανθρώπινων συγγραφέων, οι οποίοι συνήθως αρχίζουν με τη δημιουργία ενός γενικού σχεδιασμού για τις μακρές εργασίες γραπτής εργασίας, ο LongWriter αξιοποιεί τις ικανότητες σχεδίασης των μοντέλων LLM για να εξαγάγει einen λεπτομερή σχεδιασμό γραπτής εργασίας, με βάση την εισαγωγή του χρήστη. Αυτός ο σχεδιασμός περιλαμβάνει το основικό περιεχόμενο και τις απαιτήσεις λέξεων για κάθε παράγραφο. Η πρόκληση που χρησιμοποιεί ο LongWriter είναι η ακόλουθη:
“Χρειάζομαι τη βοήθειά σας για να διασπάσετε την ακόλουθη μακρά εργασία γραπτής εργασίας σε πολλές υποεργασίες. Κάθε υποεργασία θα οδηγήσει τη γραφή μιας παραγράφου στο άρθρο και πρέπει να περιλαμβάνει τα основικά σημεία και τις απαιτήσεις λέξεων για αυτήν την παράγραφο. Η εργασία γραπτής εργασίας είναι η ακόλουθη: {Εισαγωγή χρήστη}. Παρακαλώ διασπάστε την σε αυτή τη μορφή, με κάθε υποεργασία να καταλαμβάνει μια γραμμή:
Παράγραφος 1 – Κύριο Σημείο: [Περιγράψτε το κύριο σημείο της παραγράφου, με λεπτομέρειες] – Απαίτηση Λέξεων: [Απαίτηση λέξεων, π.χ. 400 λέξεις]
Παράγραφος 2 – Κύριο Σημείο: [Περιγράψτε το κύριο σημείο της παραγράφου, με λεπτομέρειες] – Απαίτηση Λέξεων: [Απαίτηση λέξεων, π.χ. 1000 λέξεις].Βεβαιωθείτε ότι κάθε υποεργασία είναι σαφής και συγκεκριμένη, και ότι όλες οι υποεργασίες καλύπτουν όλο το περιεχόμενο της εργασίας γραπτής εργασίας. Μην διασπάσετε τις υποεργασίες πολύ λεπτά· κάθε υποεργασία πρέπει να είναι τουλάχιστον 200 λέξεις και όχι περισσότερες από 1000 λέξεις. Μην εξαγάγετε κανένα άλλο περιεχόμενο.”
Βήμα II: Γράψτε
Μετά την απόκτηση του σχεδιασμού γραπτής εργασίας από το Βήμα I, ο LongWriter καλεί το μοντέλο LLM σειριακά για να ολοκληρώσει κάθε υποεργασία, παράγοντας το περιεχόμενο γραπτής εργασίας τμήμα προς τμήμα. Για να διασφαλιστεί η συνεκτικότητα της εξόδου, όταν ο LongWriter καλεί το μοντέλο για να παράγει την n-οστή ενότητα, οι προηγούμενες n-1 ενότητες επίσης εισάγονται, επιτρέποντας στο μοντέλο να συνεχίσει τη γραπτή εργασία με βάση την υπάρχουσα ιστορία γραπτής εργασίας. Αν και αυτή η σειριακή διαδικασία αποτρέπει τις παράλληλες κλήσεις στο μοντέλο για την ολοκλήρωση πολλών υποεργασιών ταυτόχρονα, και το μήκος εισαγωγής γίνεται μεγαλύτερο, ο LongWriter δείχνει στη διεξαγωγή ότι η συνολική συνεκτικότητα και ποιότητα της γραπτής εργασίας που λαμβάνεται με αυτόν τον τρόπο είναι πολύ ανώτερη από την έξοδο που παράγεται παράλληλα.
“Είστε ένας εξαιρετικός βοηθός γραπτής εργασίας. Θα σας δώσω την αρχική εργασία γραπτής εργασίας και τα σχεδιασμένα βήματα γραπτής εργασίας. Θα σας δώσω επίσης το κείμενο που έχω ήδη γράψει. Παρακαλώ βοηθήστε με να συνεχίσω τη γραπτή εργασία της επόμενης παραγράφου με βάση την εργασία γραπτής εργασίας, τα βήματα γραπτής εργασίας και το ήδη γραφέν κείμενο.
Εργασία γραπτής εργασίας:
{Εισαγωγή χρήστη}
Βήματα γραπτής εργασίας:
{Ο σχεδιασμός γραπτής εργασίας που παράγεται στο Βήμα I}
Ηδη γραφέν κείμενο:
{Προηγούμενες n-1 παραγράφοι}
Παρακαλώ ενσωματώστε την αρχική εργασία γραπτής εργασίας, τα βήματα γραπτής εργασίας και το ήδη γραφέν κείμενο, και τώρα συνεχίστε τη γραπτή εργασία {Ο σχεδιασμός για την n-οστή παράγραφο, δηλαδή η n-οστή γραμμή στο σχεδιασμό γραπτής εργασίας}.”
Επιβεβαίωση
Ο LongWriter δοκιμάζει το μήκος γεννήτριας και την ποιότητα της προτεινόμενης μεθόδου AgentWrite σε δύο σύνολα δεδομένων γραπτής εργασίας. Το πρώτο, LongWrite-Ruler, χρησιμοποιείται για να μετρήσει ακριβώς πόσο μακρύ μπορεί να είναι η έξοδος της μεθόδου. Το δεύτερο, LongBench-Write, χρησιμοποιείται κυρίως για να αξιολογήσει πόσο καλά το περιεχόμενο που παράγεται από το μοντέλο συμμορφώνεται με τις οδηγίες του χρήστη σε σχέση με το μήκος και την ποιότητα γραπτής εργασίας.
LongBench-Write: Για να αξιολογήσει την απόδοση του μοντέλου σε μια πιο ποικίλη σειρά οδηγιών γραπτής εργασίας, ο LongWriter συλλέγει 120 διαφορετικές οδηγίες γραπτής εργασίας, με 60 στα αγγλικά και 60 στα κινέζικα. Για να αξιολογήσει καλύτερα αν το μήκος εξόδου του μοντέλου ανταποκρίνεται στις απαιτήσεις του χρήστη, ο LongWriter διασφαλίζει ότι όλες αυτές οι οδηγίες περιλαμβάνουν ρητές απαιτήσεις λέξεων. Αυτές οι οδηγίες διαιρούνται σε τέσσερις υποομάδες με βάση τις απαιτήσεις λέξεων: 0-500 λέξεις, 500-2.000 λέξεις, 2.000-4.000 λέξεις και πάνω από 4.000 λέξεις. Επιπλέον, οι οδηγίες κατηγοριοποιούνται σε επτά τύπους με βάση τον τύπο εξόδου: Λογοτεχνία και Δημιουργική Γραφή, Ακαδημαϊκή και Μονογραφία, Επιστήμη, Λειτουργική Γραφή, Ειδήσεις, Κοινότητα και Εκπαίδευση.
Κατά τη διάρκεια της αξιολόγησης, ο LongWriter υιοθετεί δύο μετρικά: ένα για την αξιολόγηση του μήκους εξόδου και ένα για την αξιολόγηση της ποιότητας εξόδου. Το μήκος εξόδου του μοντέλου αξιολογείται με βάση την εγγύτητά του στις απαιτήσεις που καθορίζονται στις οδηγίες. Για την ποιότητα εξόδου, ο LongWriter χρησιμοποιεί την προσέγγιση LLM-ως-κρίτη, επιλέγοντας το μοντέλο GPT-4o για να αξιολογήσει την έξοδο σε έξι διαστάσεις: Συσχετισμένη, Ακρίβεια, Συνεκτικότητα, Σαφήνεια, Πλάτος και Βάθος, και Αναγνωσιμότητα. Το τελικό σκορ υπολογίζεται με την μέση τιμή του σκορ μήκους και του σκορ ποιότητας.
Αποτελέσματα Επιβεβαίωσης: Ο LongWriter παρουσιάζει την μέτρηση του μήκους εξόδου στο LongWrite-Ruler και βρίσκει ότι ο AgentWrite επεκτείνει επιτυχώς το μήκος εξόδου του GPT-4o από το μέγιστο των 2k λέξεων σε περίπου 20k λέξεις. Ο LongWriter αξιολογεί επίσης την ποιότητα εξόδου και την τήρηση του μήκους εξόδου στο LongBench-Write, δείχνοντας ότι το GPT-4o μπορεί να ολοκληρώσει επιτυχώς εργασίες με εξοδούς κάτω από 2.000 λέξεις σε μήκος όταν αξιολογείται η απόδοση του AgentWrite.

Επίβλεψη Εκπαίδευσης
Ο LongWriter διεξάγει εκπαίδευση με βάση δύο από τα τελευταία ανοιχτά μοντέλα, δηλαδή GLM-4-9B και Llama-3.1-8B. Και τα δύο είναι βασικά μοντέλα και υποστηρίζουν ένα παράθυρο контέκστ μέχρι 128k tokens, καθιστώντας τα φυσικά κατάλληλα για εκπαίδευση σε μακρές εξοδούς. Για να κάνει την εκπαίδευση πιο αποτελεσματική, ο LongWriter υιοθετεί εκπαίδευση συσκευασίας με σταθμισμένη απώλεια. Η εκπαίδευση στα δύο μοντέλα οδηγεί σε δύο μοντέλα: LongWriter-9B (συντομογραφία για GLM-4-9B-LongWriter) και LongWriter-8B (συντομογραφία για Llama-3.1-8B-LongWriter).
Ταυτόχρονα, ο LongWriter παρατηρεί ότι αν η απώλεια μετριέται ως μέσο όρος της ακολουθίας, δηλαδή λαμβάνοντας το μέσο όρο της μέσης απώλειας κάθε ακολουθίας μέσα σε μια παρτίδα, η συμβολή κάθε στόχου token στην απώλεια σε δεδομένα με μακρές εξοδούς θα είναι σημαντικά μικρότερη από εκείνη με μικρότερες εξοδούς. Στα πειράματα του LongWriter, βρέθηκε επίσης ότι αυτό οδηγεί σε υποβελτιστοποιημένη απόδοση του μοντέλου σε εργασίες με μακρές εξοδούς. Για αυτόν τον λόγο, ο LongWriter επιλέγει μια στρατηγική σταθμισμένης απώλειας που μετρά την απώλεια ανά token, όπου η απώλεια υπολογίζεται ως ο μέσος όρος των απωλειών σε όλα τα στόχους tokens μέσα στην παρτίδα.
Όλα τα μοντέλα εκπαιδεύονται χρησιμοποιώντας ένα κόμβο με 8xH800 80G GPUs και DeepSpeed+ZeRO3+CPU offloading. Ο LongWriter χρησιμοποιεί μέγεθος παρτίδας 8, ρυθμό μάθησης 1e-5 και μήκος συσκευασίας 32k. Τα μοντέλα εκπαιδεύονται για 4 εποχές, που διαρκεί περίπου 2.500-3.000 βήματα.
Συγκλίνηση (DPO)
Για να βελτιώσει περαιτέρω την ποιότητα εξόδου του μοντέλου και να ενισχύσει την ικανότητά του να ακολουθεί τις απαιτήσεις μήκους στις οδηγίες, ο LongWriter εκτελεί άμεση προτίμηση βελτιστοποίησης (DPO) στο μοντέλο LongWriter-9B. Τα δεδομένα DPO προέρχονται από τα δεδομένα DPO του GLM-4 (περίπου 50k εγγραφές). Επιπλέον, ο LongWriter κατασκευάζει 4k ζευγάρια δεδομένων που στοχεύουν ειδικά στις οδηγίες μακράς γραπτής εργασίας. Για κάθε οδηγία γραπτής εργασίας, ο LongWriter δείγμα 4 εξοδούς από το LongWriter-9B και τους βαθμολογεί με βάση μια συγκεκριμένη μέθοδο. Ένα σκορ που ακολουθεί το μήκος επίσης συνδυάζεται. Η υψηλότερη βαθμολογία εξόδου επιλέγεται ως το θετικό δείγμα, και ένα από τα υπόλοιπα τρία εξοδούς επιλέγεται τυχαία ως το αρνητικό δείγμα.
Το αποτέλεσμα μοντέλο, LongWriter-9B-DPO, εκπαιδεύεται για 250 βήματα στα ανωτέρω δεδομένα. Ο LongWriter ακολουθεί μια συγκεκριμένη συνταγή για την εκπαίδευση DPO.
LongWriter: Πειράματα και Αποτελέσματα
Ο LongWriter αξιολογεί 4 ιδιωτικά μοντέλα και 5 ανοιχτά μοντέλα στο LongBench-Write, μαζί με τα εκπαιδευμένα μοντέλα LongWriter. Κατά τη γνώση του LongWriter, το Suri-IORPO είναι το μόνο προηγούμενο μοντέλο που είναι επίσης ευθυγραμμισμένο για τη γεννήτρια μακράς γραπτής εργασίας. Εκπαιδεύεται με βάση το Mistral-7B-Instruct-v0.2 χρησιμοποιώντας LoRA. Σύμφωνα με τη ρύθμιση αξιολόγησης στο LongWrite-Ruler, ο LongWriter ορίζει την θερμοκρασία εξόδου στο 0,5 και ρυθμίζει το μέγιστο μήκος εξόδου του μοντέλου στο μέγιστο που επιτρέπεται από την API κλήση. Για τα ανοιχτά μοντέλα, ορίζεται στο 32.768.

Τα περισσότερα προηγούμενα μοντέλα δεν μπορούν να ικανοποιήσουν την απαίτηση μήκους πάνω από 2.000 λέξεις, ενώ τα μοντέλα LongWriter παρέχουν συνεχώς μακρύτερες και πλουσιότερες απαντήσεις σε τέτοιες οδηγίες.
Παρατηρώντας το σκορ μήκους εξόδου SlS_lSl για τις οδηγίες σε κάθε απαιτούμενο εύρος μήκους, ο LongWriter βρίσκει ότι τα προηγούμενα μοντέλα γενικά έχουν κακή απόδοση (βαθμολογία κάτω από 70) στις οδηγίες στο εύρος [2k, 4k), με μόνο το Claude 3.5 Sonnet να επιτυγχάνει μια αξιοπρεπή βαθμολογία. Για τις οδηγίες στο εύρος [4k, 20k), σχεδόν όλα τα προηγούμενα μοντέλα είναι完全 ανίκανα να φθάσουν το Ziel μήκους εξόδου, ακόμη και βαθμολογώντας 0 (που σημαίνει ότι όλα τα μήκη εξόδου είναι μικρότερα από το ένα τρίτο του απαιτούμενου μήκους). Με την προσθήκη δεδομένων εκπαίδευσης από το LongWriter-6k, το εκπαιδευμένο μοντέλο του LongWriter μπορεί αποτελεσματικά να φθάσει το απαιτούμενο μήκος εξόδου, διατηρώντας παράλληλα την ποιότητα εξόδου, όπως υποδεικνύεται από τις βαθμολογίες στο εύρος [2k, 20k) και τα σκέτη plots.

Η DPO βελτιώνει αποτελεσματικά και την ποιότητα εξόδου του μοντέλου και την ικανότητά του να ακολουθεί τις απαιτήσεις μήκους στη μακρά γεννήτρια.
Συγκρίνοντας τις βαθμολογίες του LongWriter-9B και του LongWriter-9B-DPO, βρισκόμαστε ότι η DPO βελτιώνει σημαντικά cả τις βαθμολογίες Sl (+4%) και Sq (+3%), και η βελτίωση είναι συνεπής σε όλα τα εύρη. Αυτό δείχνει ότι στη μακρά γεννήτρια, η DPO vẫn βοηθά να βελτιώσει την ποιότητα εξόδου του μοντέλου και να ευθυγραμμίσει το μήκος εξόδου του μοντέλου με το αιτούμενο μήκος. Αυτός ο τελευταίος結 luận έχει επίσης παρατηρηθεί πρόσφατα από τον Yuan et al. (2024) σε μικρότερες γεννήτριες. Επίσης, αναノται 手動 pairwise νίκες και ήττες για το GPT-4o και τα τρία μοντέλα LongWriter στις εξοδούς τους στο LongBench-Write και οπτικοποιούνται τα αποτελέσματα στο Σχήμα 9. Μπορούμε να δούμε ότι οι άνθρωποι προτιμούν το μοντέλο DPO-εκπαιδευμένο над το LongWriter-9B στο 58% των περιπτώσεων. Επιπλέον, παρά το ότι έχει λιγότερους παραμέτρους, το LongWriter-9B-DPO επιτυγχάνει ισοπαλία με το GPT-4o.

Το όριο μήκους εξόδου των μοντέλων LongWriter επεκτείνεται μεταξύ 10k και 20k λέξεων, ενώ απαιτούνται περισσότερα δεδομένα με μακρές εξοδούς για να υποστηρίξουν ακόμη μεγαλύτερες εξοδούς.
Ακολουθώντας την εξέταση LongWrite-Ruler, ο LongWriter επίσης παρουσιάζει τα αποτελέσματα LongWrite-Ruler των μοντέλων LongWriter. Τα αποτελέσματα δείχνουν ότι τα μέγιστα μήκη εξόδου τους είναι μεταξύ 10k και 20k λέξεων. Η έλλειψη δεδομένων SFT με μακρύτερες εξοδούς είναι πιθανότατα ο κύριος λόγος που εμποδίζει το μοντέλο να επιτύχει μεγαλύτερα μήκη εξόδου.
Τελικές Σκέψεις
Σε αυτή τη δουλειά, έχουμε συζητήσει τον LongWriter, μια pipeline με βάση τον πράκτορα που διασπά τις υπέρ-μακρές εργασίες γεννήτριας σε υποεργασίες, αναγνωρίζει το όριο 2.000 λέξεων για τα τρέχοντα μοντέλα LLM και προτείνει την αύξηση του μήκους παραθύρου εξόδου τους με την προσθήκη δεδομένων με μακρές εξοδούς κατά τη διάρκεια της ευθυγράμμισης. Για να κατασκευάσει αυτόματα δεδομένα με μακρές εξοδούς, ο LongWriter αναπτύσσει τον AgentWrite, μια pipeline με βάση τον πράκτορα που χρησιμοποιεί μοντέλα LLM για να δημιουργήσει επεκτάσεις, συνεκτικές εξοδούς. Ο LongWriter επεκτείνει επιτυχώς το μήκος παραθύρου εξόδου των τρεχόντων μοντέλων LLM σε πάνω από 10.000 λέξεις με τα κατασκευασμένα δεδομένα LongWriter-6k. Εκτεταμένες μελέτες αποσπάθμησης των δεδομένων εκπαίδευσης αποδεικνύουν την αποτελεσματικότητα αυτής της προσέγγισης. Για μελλοντική εργασία, ο LongWriter προτείνει τις ακόλουθες τρεις κατευθύνσεις: 1. Επέκταση του πλαισίου AgentWrite για την κατασκευή δεδομένων με μακρύτερες εξοδούς για να επεκτείνει περαιτέρω το μήκος παραθύρου των μοντέλων LLM. 2. Βελτίωση του πλαισίου AgentWrite για να επιτύχει υψηλότερη ποιότητα δεδομένων με μακρές εξοδούς. 3. Μακρύτερες εξοδούς μοντέλων φέρνουν προκλήσεις στην αποδοτικότητα της εύρεσης. Πολλές μεθόδους έχουν προταθεί για τη βελτίωση της αποδοτικότητας της εύρεσης. Αξίζει να διερευνηθεί πώς αυτές οι μεθόδους μπορούν να διασφαλίσουν τη βελτίωση της αποδοτικότητας του μοντέλου χωρίς να επηρεάσουν την ποιότητα της γεννήτριας.












