Μοντέλα και πλατφόρμες AI

EUREKA: Σχεδιασμός Ανταμοιβής σε Επίπεδο Ανθρώπου μέσω Κωδικοποίησης Μεγάλων Γλωσσικών Μοντέλων

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Με τις προόδους που έχουν γίνει στα Μεγάλα Γλωσσικά Μοντέλα τα τελευταία χρόνια, δεν είναι έκπληξη που αυτά τα πλαίσια LLM exceling ως σεμαντικά планиστές για ακολουθίες υψηλού επιπέδου λήψης αποφάσεων. Ωστόσο, οι développers vẫnλο βρίσκουν δύσκολο να χρησιμοποιήσουν το πλήρες δυναμικό των πλαισίων LLM για την εκμάθηση σύνθετων καθηκόντων χαμηλού επιπέδου. Παρά την αποτελεσματικότητά τους, τα σημερινά Μεγάλα Γλωσσικά Μοντέλα απαιτούν σημαντική εξειδίκευση σε domaine και αντικείμενο για να μάθουν ακόμη και απλές δεξιότητες ή να κατασκευάσουν κειμενικές προτροπές, δημιουργώντας ένα σημαντικό χάσμα μεταξύ της απόδοσής τους και της ανθρώπινης δεξιοτεχνίας.

Για να γεφυρώσουν αυτό το χάσμα, développers από την Nvidia (NVDA ), CalTech, UPenn και άλλους έχουν εισαγάγει το EUREKA, ένα αλγόριθμο σχεδιασμού ανταμοιβής που βασίζεται σε LLM. Το EUREKA στοχεύει να αξιοποιήσει διάφορες ικανότητες των πλαισίων LLM, συμπεριλαμβανομένης της κωδικοποίησης, της βελτίωσης σε контекστ και της γεννήτριας περιεχομένου χωρίς προηγούμενη εκπαίδευση, για να πραγματοποιήσει μια άνευ προηγουμένου βελτίωση των κωδικών ανταμοιβής. Οι κώδικες ανταμοιβής, σε συνδυασμό με την εκμάθηση ενίσχυσης, επιτρέπουν στα πλαίσια να μάθουν σύνθετες δεξιότητες ή να εκτελέσουν καθήκοντα χειρισμού.

Σε αυτό το άρθρο, θα εξετάσουμε το πλαίσιο EUREKA από μια προοπτική ανάπτυξης, αναλύοντας το πλαίσιο, τη λειτουργία και τα αποτελέσματα που επιτυγχάνει στη γεννήτρια συναρτήσεων ανταμοιβής. Αυτές οι συναρτήσεις, όπως ισχυρίζονται οι développers, υπερβαίνουν εκείνες που παράγονται από τους ανθρώπους. Θα εξετάσουμε επίσης πώς το πλαίσιο EUREKA ανοίγει τον δρόμο για μια νέα προσέγγιση στην εκμάθηση ενίσχυσης με ανθρώπινη ανάδραση (RLHF) μέσω της ενεργοποίησης της εκμάθησης χωρίς gradient σε контекστ. Ας ξεκινήσουμε.

EUREKA: Εισαγωγή

Σήμερα, τα state of the art πλαίσια LLM όπως το GPT-3 και το GPT-4 παρέχουν εξαιρετικά αποτελέσματα όταν χρησιμεύουν ως σεμαντικές планиστές για ακολουθίες υψηλού επιπέδου λήψης αποφάσεων, αλλά οι développers vẫnλο αναζητούν τρόπους για να βελτιώσουν την απόδοσή τους όταν πρόκειται για την εκμάθηση καθηκόντων χαμηλού επιπέδου όπως η δεξιοτεχνία σπινNING. Επιπλέον, οι développers έχουν παρατηρήσει ότι η εκμάθηση ενίσχυσης μπορεί να χρησιμοποιηθεί για να επιτύχει βιώσιμα αποτελέσματα σε συνθήκες δεξιοτεχνίας και άλλους τομείς, εφόσον οι συναρτήσεις ανταμοιβής κατασκευάζονται προσεκτικά από ανθρώπινους σχεδιαστές και αυτές οι συναρτήσεις ανταμοιβής είναι ικανές να παρέχουν τα σήματα εκμάθησης για ευνοϊκές συμπεριφορές. Όταν συγκρίνονται με πραγματικές εργασίες εκμάθησης ενίσχυσης που δέχονται σπάνιες ανταμοιβές, η διαμόρφωση αυτών των ανταμοιβών παρέχει τα απαραίτητα σήματα εκμάθησης για την επαναλαμβανόμενη εκμάθηση. Επιπλέον, οι συναρτήσεις ανταμοιβής, παρά την σημασία τους, είναι εξαιρετικά δύσκολο να σχεδιαστούν και οι υποβέλτιστες σχεδιάσεις αυτών των συναρτήσεων συχνά οδηγούν σε μη προβλεπόμενες συμπεριφορές.

Για να αντιμετωπίσουν αυτές τις προκλήσεις και να μεγιστοποιήσουν την αποτελεσματικότητα αυτών των κωδικών ανταμοιβής, το EUREKA ή Εvolution-driven Universal REward Kit για Agent στοχεύει να κάνει τις ακόλουθες συμβολές.

  1. Επίγνωση ανθρώπινου επιπέδου για τον σχεδιασμό συναρτήσεων ανταμοιβής.
  2. Εфективική λύση καθηκόντων χειρισμού χωρίς τη χρήση χειροκίνητου μηχανισμού ανταμοιβής.
  3. Γεννήτρια ανταμοιβών που είναι πιο ευθυγραμμισμένες με τον άνθρωπο και πιο αποτελεσματικές, εισάγοντας μια νέα προσέγγιση εκμάθησης χωρίς gradient σε контекστ αντί της παραδοσιακής μεθόδου RLHF ή εκμάθησης ενίσχυσης από ανθρώπινη ανάδραση.

… (the translation continues until the final source heading and tail anchor are complete)

Ένας μηχανικός επάγγελμα, ένας συγγραφέας με την καρδιά. Ο Kunal είναι ένας τεχνικός συγγραφέας με einen βαθύ έρωτα και κατανόηση του AI και ML, αφιερωμένος στο να απλοποιεί σύνθετες έννοιες σε αυτά τα πεδία μέσω των ελκυστικών και ενημερωτικών εγγράφων του.