Μοντέλα και πλατφόρμες AI

Αξιολόγηση Μεγάλων Μοντέλων Γλώσσας: Ένας Τεχνικός Οδηγός

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Τα μεγάλα μοντέλα γλώσσας (LLM) όπως το GPT-4, το Claude και το LLaMA έχουν εκραγεί σε δημοτικότητα. Χάρη στην ικανότητά τους να παράγουν εντυπωσιακά ανθρώπινα κείμενα, αυτά τα συστήματα AI χρησιμοποιούνται τώρα για όλα, από τη δημιουργία περιεχομένου μέχρι τα chatbot υπηρεσιών πελατών.

Αλλά πώς γνωρίζουμε αν αυτά τα μοντέλα είναι πραγματικά καλά; Με νέα LLM να ανακοινώνονται συνεχώς, όλα ισχυρίζονται ότι είναι μεγαλύτερα και καλύτερα, πώς αξιολογούμε και συγκρίνουμε την απόδοσή τους;

Σε αυτόν τον ολοκληρωμένο οδηγό, θα εξερευνήσουμε τις κορυφαίες τεχνικές για την αξιολόγηση μεγάλων μοντέλων γλώσσας. Θα δούμε τα πλεονεκτήματα και τα μειονεκτήματα κάθε προσέγγισης και πώς μπορείτε να τα εκμεταλλευτείτε στις δικές σας δοκιμές LLM.

Μετρήσεις Ειδικών Καθηκόντων

Ένας από τους πιο ευθείς τρόπους για την αξιολόγηση ενός LLM είναι να το δοκιμάσουμε σε καθιερωμένα καθήκοντα NLP χρησιμοποιώντας стандαρδισμένες μετρήσεις. Για παράδειγμα:

Σύνοψη

Για καθήκοντα σύνοψης, μετρήσεις όπως το ROUGE (Recall-Oriented Understudy for Gisting Evaluation) χρησιμοποιούνται συνήθως. Το ROUGE συγκρίνει τη σύνοψη που παράγεται από το μοντέλο με μια ανθρώπινη “αναφορά” σύνοψη, μετρώντας την επικάλυψη των λέξεων ή των φράσεων.

Υπάρχουν πολλές εκδοχές του ROUGE, каждая με τα δικά της πλεονεκτήματα και μειονεκτήματα:

  • ROUGE-N: Συγκρίνει την επικάλυψη των n-γραμματικών (σειρών από N λέξεις). Το ROUGE-1 χρησιμοποιεί μονογράμματα (μονές λέξεις), το ROUGE-2 χρησιμοποιεί δίγραμμα, κ.λπ. Το πλεονέκτημα είναι ότι καταγράφει τη σειρά των λέξεων, αλλά μπορεί να είναι πολύ αυστηρό.
  • ROUGE-L: Βασίζεται στη μακρύτερη κοινή υποσειρά (LCS). Πιο ευέλικτο στη σειρά των λέξεων, αλλά επικεντρώνεται στα κύρια σημεία.
  • ROUGE-W: Βαρύνει τις LCS αντιστοιχίσεις με τη σημασία τους. Προσπαθεί να βελτιώσει το ROUGE-L.

Γενικά, οι μετρήσεις ROUGE είναι γρήγορες, αυτόματες και λειτουργούν καλά για την κατάταξη των συνοψέων του συστήματος. Ωστόσο, δεν μετρούν τη συνάφεια ή τη σημασία. Μια σύνοψη μπορεί να λάβει υψηλό σκορ ROUGE και να είναι ακόμα ανοησία.

Η формуλή για το ROUGE-N είναι:

ROUGE-N=∑∈{Reference Summaries}∑∑�∈{Reference Summaries}∑

Πού:

  • Count_{match}(gram_n) είναι ο αριθμός των n-γραμματικών (σειρών από N λέξεις) και στις δύο περιπτώσεις, στη σύνοψη που παράγεται από το μοντέλο και στη σύνοψη αναφοράς.
  • Count(gram_n) είναι ο αριθμός των n-γραμματικών στη σύνοψη αναφοράς.

Για παράδειγμα, για το ROUGE-1 (μονογράμματα):

  • Παράγεται σύνοψη: “Το γάτο καθόταν.”
  • Σύνοψη αναφοράς: “Το γάτο καθόταν στο χαλί.”
  • Επικαλυπτόμενες μονογράμματα: “Το”, “γάτο”, “καθόταν”
  • Σκορ ROUGE-1 = 3/5 = 0,6

Το ROUGE-L χρησιμοποιεί τη μακρύτερη κοινή υποσειρά (LCS). Είναι πιο ευέλικτο στη σειρά των λέξεων. Η формуλή είναι:

ROUGE-L=���(generated,reference)max(length(generated), length(reference))

Πού LCS είναι το μήκος της μακρύτερης κοινής υποσειράς.

Μετάφραση

Για καθήκοντα μετάφρασης, το BLEU (Bilingual Evaluation Understudy) είναι μια δημοφιλής μετρική. Το BLEU μετρά τη ομοιότητα μεταξύ της μετάφρασης που παράγεται από το μοντέλο και των επαγγελματικών ανθρώπινων μεταφράσεων, χρησιμοποιώντας την ακρίβεια των n-γραμματικών και μια ποινή για τη σύντομη μετάφραση.

Κλειδιά πώς λειτουργεί το BLEU:

  • Συγκρίνει τις επικαλύψεις των n-γραμματικών για n μέχρι 4 (μονογράμματα, δίγραμμα, τρίγραμμα, 4-γράμματα).
  • Υπολογίζει το γεωμετρικό μέσο των n-γραμματικών ακριβειών.
  • Εφαρμόζει μια ποινή για τη σύντομη μετάφραση αν η μετάφραση είναι πολύ πιο σύντομη από την αναφορά.
  • Γενικά κυμαίνεται από 0 έως 1, με 1 να είναι η τέλεια αντιστοιχία με την αναφορά.

Το BLEU συσχετίζεται λογικά καλά με τις ανθρώπινες κρίσεις για την ποιότητα της μετάφρασης. Αλλά έχει ακόμα περιορισμούς:

  • Μετρά μόνο την ακρίβεια έναντι των αναφορών, όχι την ανάκληση ή το F1.
  • Δυσκολεύεται με δημιουργικές μεταφράσεις που χρησιμοποιούν διαφορετική ορολογία.
  • Εύθραυστο στο “παίγνιο” με τεχνάσματα μετάφρασης.

Άλλες μετρήσεις μετάφρασης όπως το METEOR και το TER προσπαθούν να βελτιώσουν τις αδυναμίες του BLEU. Αλλά γενικά, οι αυτόματες μετρήσεις δεν καταγράφουν πλήρως την ποιότητα της μετάφρασης.

Άλλα Καθήκοντα

Εκτός από τη σύνοψη και τη μετάφραση, μετρήσεις όπως το F1, η ακρίβεια, το MSE και άλλα μπορούν να χρησιμοποιηθούν για την αξιολόγηση της απόδοσης του LLM σε καθήκοντα όπως:

  • Κατηγοριοποίηση κειμένου
  • Εξαγωγή πληροφοριών
  • Απάντηση σε ερωτήσεις
  • Ανάλυση συναισθήματος
  • Ανίχνευση γραμματικών λαθών

Το πλεονέκτημα των μετρήσεων ειδικών καθηκόντων είναι ότι η αξιολόγηση μπορεί να γίνει πλήρως αυτόματα χρησιμοποιώντας стандαρδικές βάσεις δεδομένων όπως το SQuAD για την απάντηση σε ερωτήσεις και το GLUE benchmark για eine σειρά από καθήκοντα. Τα αποτελέσματα μπορούν εύκολα να παρακολουθούνται με τον καιρό καθώς τα μοντέλα βελτιώνονται.

Ωστόσο, αυτές οι μετρήσεις είναι στενά εστιασμένες και δεν μπορούν να μετρήσουν την συνολική ποιότητα της γλώσσας. Τα LLM που εκτελούν καλά στις μετρήσεις για ένα μόνο καθήκον μπορεί να αποτύχουν στη δημιουργία συνετών, λογικών, χρήσιμων κειμένων γενικά.

Ερευνήσεις ΒENCHMARK

Ένας δημοφιλής τρόπος για την αξιολόγηση των LLM είναι να τα δοκιμάσουμε σε ερευνήσεις που καλύπτουν διάφορα θέματα και δεξιότητες. Αυτές οι ερευνήσεις επιτρέπουν στα μοντέλα να δοκιμαστούν γρήγορα σε κλίμακα.

Ορισμένες γνωστές ερευνήσεις περιλαμβάνουν:

  • SuperGLUE – Μια προκλητική σειρά από 11 διαφορετικά καθήκοντα γλώσσας.
  • GLUE – Μια συλλογή από 9 καθήκοντα κατανόησης προτάσεων. Λιγότερο προκλητικό από το SuperGLUE.
  • MMLU – 57 διαφορετικά καθήκοντα STEM, κοινωνικών επιστημών και ανθρωπιστικών επιστημών. Δοκιμάζει τη γνώση και την ικανότητα συλλογισμού.
  • Winograd Schema Challenge – Προβλήματα επίλυσης προσωρινών που απαιτούν κοινή λογική.
  • ARC – Προκλητικά καθήκοντα συλλογισμού φυσικής γλώσσας.
  • Hellaswag – Κοινή λογική για καταστάσεις.
  • PIQA – Ερωτήσεις φυσικής που απαιτούν διαγράμματα.

Με την αξιολόγηση αυτών των ερευνήσεων, οι ερευνητές μπορούν να δοκιμάσουν τα μοντέλα τους στην ικανότητά τους να εκτελούν μαθηματικά, λογική, συλλογισμό, κωδικοποίηση, κοινή λογική και πολλά άλλα. Το ποσοστό των σωστών απαντήσεων γίνεται μια μετρική ερευνήσεων για την σύγκριση των μοντέλων.

Ωστόσο, ένα σημαντικό ζήτημα με τις ερευνήσεις είναι η μολύβδινη μόλυνση των δεδομένων. Πολλές ερευνήσεις περιέχουν παραδείγματα που έχουν ήδη δει τα μοντέλα κατά τη διάρκεια της προ-εκπαίδευσης. Αυτό επιτρέπει στα μοντέλα να “θυμούνται” τις απαντήσεις σε συγκεκριμένα ερωτήματα και να εκτελούν καλύτερα από τις πραγματικές τους ικανότητες.

Γίνονται προσπάθειες για να “καθαρίσουν” τις ερευνήσεις αφαιρώντας τις επικαλυπτόμενες περιπτώσεις. Αλλά αυτό είναι δύσκολο να γίνει ολοκληρωτικά, ιδιαίτερα όταν τα μοντέλα μπορεί να έχουν δει παραφράσεις ή μεταφράσεις των ερωτημάτων.

Έτσι, ενώ οι ερευνήσεις μπορούν να δοκιμάσουν μια ευρεία σειρά από δεξιότητες αποτελεσματικά, δεν μπορούν να μετρήσουν με σιγουριά τις πραγματικές ικανότητες συλλογισμού ή να αποφύγουν την πληθωρική βαθμολογία λόγω μόλυνσης. Χρειάζονται συμπληρωματικές μεθόδους αξιολόγησης.

Αυτο-Αξιολόγηση LLM

Μια ενδιαφέρουσα προσέγγιση είναι να αφήσουμε ένα LLM να αξιολογεί τις εξόδους ενός άλλου LLM. Η ιδέα είναι να εκμεταλλευτεί την “ευκολότερη” έννοια του καθήκοντος:

  • Η παραγωγή μιας υψηλής ποιότητας εξόδου μπορεί να είναι δύσκολο για ένα LLM.
  • Αλλά η καθορισμός αν μια δεδομένη έξοδος είναι υψηλής ποιότητας μπορεί να είναι ένα ευκολότερο καθήκον.

Για παράδειγμα, ενώ ένα LLM μπορεί να δυσκολευτεί να παράγει μια πραγματική και συνεχή παράγραφο από το μηδέν, μπορεί να είναι πιο εύκολο να κρίνει αν μια δεδομένη παράγραφος έχει λογική σημασία και ταιριάζει στο контέκστ.

Έτσι, η διαδικασία είναι:

  1. Περάστε την είσοδο στην πρώτη LLM για να παράγετε έξοδο.
  2. Περάστε την είσοδο + την παραγμένη έξοδο στη δεύτερη LLM “αξιολογητή”.
  3. Ζητήστε από τον αξιολογητή LLM μια ερώτηση για να αξιολογήσετε την ποιότητα της εξόδου. π.χ. “Η παραπάνω απάντηση έχει λογική σημασία;”

Αυτή η προσέγγιση είναι γρήγορη να εφαρμοστεί και αυτοματοποιεί την αξιολόγηση του LLM. Αλλά υπάρχουν κάποια προκλήματα:

  • Η απόδοση εξαρτάται πολύ από την επιλογή του αξιολογητή LLM και τη διατύπωση της ερώτησης.
  • Περιορίζεται από τη δυσκολία του αρχικού καθήκοντος. Η αξιολόγηση του συλλογισμού είναι ακόμα δύσκολο για τα LLM.
  • Μπορεί να είναι υπολογιστικά ακριβό αν χρησιμοποιούνται API-βασισμένα LLM.

Η αυτο-αξιολόγηση είναι ιδιαίτερα υποσχόμενη για την αξιολόγηση της ανακτημένης πληροφορίας σε συστήματα RAG (retrieval-augmented generation). Πρόσθετες ερωτήσεις LLM μπορούν να επικυρώσουν αν η ανακτημένη πληροφορία χρησιμοποιείται σωστά.

Συνολικά, η αυτο-αξιολόγηση δείχνει υποσχόμενη αλλά απαιτεί προσοχή στην εφαρμογή. Συμπληρώνει, αντί να αντικαθιστά, την ανθρώπινη αξιολόγηση.

Ανθρώπινη Αξιολόγηση

Λόγω των περιορισμών των αυτόματων μετρήσεων και των ερευνήσεων, η ανθρώπινη αξιολόγηση είναι ακόμα ο χρυσός κανόνας για την αυστηρή αξιολόγηση της ποιότητας του LLM.

Εкспέρτες μπορούν να παρέχουν λεπτομερείς ποιοτικές αξιολογήσεις για:

  • Ακρίβεια και фактиκή ορθότητα
  • Λογική, συλλογισμός και κοινή λογική
  • Συνέχεια, συνεπής και αναγνωσιμότητα
  • Κατάλληλη τονικότητα, στυλ και φωνή
  • Γραμματική και ροή
  • Δημιουργικότητα και νюανς

Για να αξιολογήσουν ένα μοντέλο, οι άνθρωποι λαμβάνουν ένα σύνολο από είσοδο και τις απαντήσεις LLM. Αξιολογούν την ποιότητα των απαντήσεων, συχνά χρησιμοποιώντας κλίμακες βαθμολογίας και rubrics.

Το μειονέκτημα είναι ότι η χειροκίνητη ανθρώπινη αξιολόγηση είναι ακριβή, chậmη και δύσκολο να κλιμακωθεί. Απαιτεί επίσης την ανάπτυξη стандαρδικών κριτηρίων και την εκπαίδευση των αξιολογητών να τα εφαρμόζουν συνεπώς.

Ορισμένοι ερευνητές έχουν εξερευνήσει δημιουργικές τρόπους για να χρηματοδοτήσουν την ανθρώπινη αξιολόγηση LLM χρησιμοποιώντας συστήματα τουρνουά όπου οι άνθρωποι στοιχηματίζουν και κρίνουν τις αναμετρήσεις μεταξύ μοντέλων. Αλλά η κάλυψη είναι ακόμα περιορισμένη σε σύγκριση με τις πλήρεις χειροκίνητες αξιολογήσεις.

Για τις επιχειρηματικές περιπτώσεις όπου η ποιότητα έχει περισσότερη σημασία από την κλίμακα, η expert ανθρώπινη δοκιμή παραμένει ο χρυσός κανόνας παρά το κόστος. Αυτό είναι ιδιαίτερα αλήθεια για τις πιο ριψοκίνδυνες εφαρμογές των LLM.

Συμπέρασμα

Η πλήρης αξιολόγηση των μεγάλων μοντέλων γλώσσας απαιτεί τη χρήση ενός διαφορετικού εργαλείου από συμπληρωματικές μεθόδους, αντί να βασίζεται σε οποιαδήποτε seule τεχνική.

Συνδυάζοντας τις αυτόματες προσεγγίσεις για ταχύτητα με αυστηρή ανθρώπινη επιτήρηση για ακρίβεια, μπορούμε να αναπτύξουμε αξιόπιστες μεθόδους δοκιμής για τα μεγάλα μοντέλα γλώσσας. Με τη ριζική αξιολόγηση, μπορούμε να ξεκλειδώσουμε το τεράστιο δυναμικό των LLM ενώ διαχειριζόμαστε τους κινδύνους τους υπεύθυνα.

Έχω περάσει τα τελευταία πέντε χρόνια βυθισμένος στον συναρπαστικό κόσμο της Μηχανικής Μάθησης και του Βαθιάς Μάθησης. Η δέσμευσή μου και η εξειδίκευσή μου με οδήγησαν να συμβάλλω σε πάνω από 50 διαφορετικά projects μηχανικής λογισμικού, με ιδιαίτερη έμφαση στο AI/ML. Η συνεχής περιέργειά μου με έχει οδηγήσει επίσης προς την Επεξεργασία Φυσικής Γλώσσας, ένα πεδίο που είμαι πρόθυμος να εξερευνήσω περαιτέρω.