Ηγέτες σκέψης

ΒENCHMARKS ΓΙΑ LLMs

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Κατανοήστε τον ρόλο και τους περιορισμούς των βENCHMARKS στη αξιολόγηση της απόδοσης των LLM. Εξερευνήστε τις τεχνικές για την ανάπτυξη ισχυρών LLM.

Τα Μεγάλα Γλωσσικά Μοντέλα (LLM) έχουν κερδίσει τεράστια δημοτικότητα τα τελευταία χρόνια. Λόγω της εξαιρετικής ικανότητάς τους να κατανοούν τις εντολές της ανθρώπινης γλώσσας, έγιναν το ιδανικό εργαλείο για τις επιχειρήσεις, υποστηρίζοντας κρίσιμες ροές εργασιών και αυτοματοποιώντας εργασίες με μέγιστη αποδοτικότητα. Πέρα από την κατανόηση του μέσου χρήστη, τα LLM μπορούν να κάνουν πολύ περισσότερα. Όσο αυξάνεται η εξάρτησή μας από αυτά, πρέπει να δώσουμε περισσότερη προσοχή στα μέτρα για να διασφαλίσουμε την απαιτούμενη ακρίβεια και αξιοπιστία. Αυτό είναι ένα παγκόσμιο έργο που αφορά ολόκληρες οργανώσεις, αλλά στον τομέα των επιχειρήσεων υπάρχουν τώρα αρκετά βENCHMARKS που μπορούν να χρησιμοποιηθούν για την αξιολόγηση της απόδοσης των LLM σε διάφορους τομείς. Αυτά μπορούν να δοκιμάσουν τις ικανότητες του μοντέλου σε κατανόηση, λογική, μαθηματικά και άλλα, και τα αποτελέσματα καθορίζουν εάν ένα LLM είναι έτοιμο για ανάπτυξη σε επιχειρήσεις.

Σε αυτό το άρθρο, έχω συγκεντρώσει μια綜合ική λίστα με τα πιο δημοφιλή βENCHMARKS για την αξιολόγηση των LLM. Θα συζητήσουμε κάθε βENCHMARK σε λεπτομέρειες και θα δούμε πώς διαφορετικά LLM αντιμετωπίζουν τα κριτήρια αξιολόγησης. Αλλά πρώτα, ας κατανοήσουμε την αξιολόγηση των LLM σε περισσότερες λεπτομέρειες.

Τι είναι η Αξιολόγηση των LLM;

Όπως και άλλα μοντέλα AI, τα LLM χρειάζονται επίσης να αξιολογηθούν με βάση συγκεκριμένα βENCHMARKS που αξιολογούν διάφορους аспектους της απόδοσης του γλωσσικού μοντέλου: γνώση, ακρίβεια, αξιοπιστία και συνέπεια. Ο τυπικός τρόπος αξιολόγησης περιλαμβάνει:

  1. Κατανόηση των Ερωτημάτων του Χρήστη: Αξιολόγηση της ικανότητας του μοντέλου να κατανοήσει και να ερμηνεύσει ένα ευρύ φάσμα εισόδων του χρήστη.
  2. Επιβεβαίωση της Εξόδου: Επιβεβαίωση των απαντήσεων που παράγονται από το AI με βάση μια αξιόπιστη βάση γνώσεων για να διασφαλιστεί ότι είναι σωστές και σχετικές.
  3. Ρομποτική: Μέτρηση του πόσο καλά το μοντέλο εκτελείται με αμφίβολες, ελλιπείς ή θορυβώδεις εισόδους.

Η αξιολόγηση των LLM δίνει στους développers τη δύναμη να αναγνωρίσουν και να αντιμετωπίσουν τις περιορισμούς αποτελεσματικά, ώστε να μπορέσουν να βελτιώσουν την συνολική εμπειρία του χρήστη. Εάν ένα LLM αξιολογηθεί πλήρως, θα είναι ακριβές και ρομποτικό αρκετά για να χειριστεί διάφορες εφαρμογές του πραγματικού κόσμου, ακόμη και αυτές με αμφίβολες ή απροσδόκητες εισόδους.

ΒENCHMARKS

Τα LLM είναι ένα από τα πιο σύνθετα τεχνολογικά προϊόντα μέχρι σήμερα και μπορούν να υποστηρίξουν ακόμη και τις πιο περίπλοκες εφαρμογές. Έτσι, η διαδικασία αξιολόγησης πρέπει να είναι εξίσου περίπλοκη, δοκιμάζοντας τη σκέψη και την τεχνική ακρίβεια.

Ένα βENCHMARK χρησιμοποιεί συγκεκριμένα σύνολα δεδομένων, μετρήσεις και εργασίες αξιολόγησης για να δοκιμάσει την απόδοση των LLM. Αυτό επιτρέπει τη σύγκριση διαφορετικών LLM και τη μέτρηση της ακρίβειάς τους, οδηγώντας στην πρόοδο της βιομηχανίας μέσω της βελτίωσης της απόδοσης.

Αυτά είναι κάποια από τα πιο τυπικά χαρακτηριστικά της απόδοσης των LLM:

  • Γνώση: Η γνώση του μοντέλου πρέπει να δοκιμαστεί σε διάφορους τομείς. Αυτό είναι το που έρχεται το βENCHMARK της γνώσης. Αξιολογεί πόσο αποτελεσματικά το μοντέλο μπορεί να ανακαλέσει πληροφορίες από διάφορους τομείς, όπως Φυσική, Προγραμματισμός, Γεωγραφία, κ.λπ.
  • Λογική: Σκέψη: Αυτό σημαίνει δοκιμή της ικανότητας του μοντέλου να «σκέφτεται» βήμα προς βήμα και να εξάγει einen λογικό συμπέρασμα. Αυτά τα σενάρια απαιτούν από το μοντέλο να επιλέξει την πιο πιθανή συνέχεια ή εξήγηση με βάση την καθημερινή γνώση και τη λογική σκέψη.
  • Κατανόηση Κειμένου: Τα μοντέλα πρέπει να είναι εξαιρετικά καλά στην ερμηνεία της φυσικής γλώσσας και στη συνέχεια να παράγουν απαντήσεις ανάλογα. Η δοκιμή μοιάζει με απάντηση σε ερωτήσεις με βάση περικοπές για να αξιολογήσει την κατανόηση, την εύρεση και τη διατήρηση λεπτομερειών. Όπως μια σχολική δοκιμή ανάγνωσης.
  • Κατανόηση Κώδικα: Αυτό χρειάζεται για να μετρηθεί η ικανότητα του μοντέλου να κατανοήσει, να γράψει και να διορθώσει κώδικα. Αυτά τα βENCHMARKS δίνουν στο μοντέλο εργασίες προγραμματισμού ή προβλήματα που πρέπει να λύσει σωστά, συχνά καλύπτοντας eine σειρά γλωσσών προγραμματισμού και παραδειγμάτων.
  • Γνώση του Κόσμου: Για να αξιολογήσει την κατανόηση του μοντέλου για τη γενική γνώση του κόσμου. Αυτά τα σύνολα δεδομένων έχουν συνήθως ερωτήσεις που απαιτούν ευρεία, εγκυκλοπαιδική γνώση για να απαντηθούν σωστά, που τα κάνει διαφορετικά από πιο συγκεκριμένα και εξειδικευμένα βENCHMARKS γνώσης.

ΒENCHMARKS «Γνώση»

MMLU (Multimodal Language Understanding)

Αυτό το βENCHMARK σχεδιάστηκε για να δοκιμάσει την κατανόηση του LLM σε фактиκή γνώση σε διάφορους τομείς όπως οι ανθρωπιστικές επιστήμες, οι κοινωνικές επιστήμες, η ιστορία, η επιστήμη υπολογιστών και ακόμη και το δίκαιο. 57 ερωτήσεις και 15.000 εργασίες όλες κατευθυνόμενες προς την εξασφάλιση ότι το μοντέλο έχει εξαιρετικές ικανότητες σκέψης. Αυτό κάνει το MMLU ένα καλό εργαλείο για την αξιολόγηση της фактиικής γνώσης και της σκέψης του LLM σε διάφορους τομείς.

Πρόσφατα, έγινε ένα κλειδί βENCHMARK για την αξιολόγηση των LLM για τις παραπάνω περιοχές. Οι développers πάντα θέλουν να βελτιώσουν τα μοντέλα τους για να ξεπεράσουν τα άλλα σε αυτό το βENCHMARK, που το κάνει ένα de facto πρότυπο για την αξιολόγηση της προηγμένης σκέψης και γνώσης στα LLM. Μεγάλα επιχειρηματικά μοντέλα έχουν δείξει εντυπωσιακά αποτελέσματα σε αυτό το βENCHMARK, συμπεριλαμβανομένου του GPT-4-omni στο 88,7%, του Claude 3 Opus στο 86,8%, του Gemini 1.5 Pro στο 85,9% και του Llama-3 70B στο 82%. Τα μικρά μοντέλα δεν εκτελούνται συνήθως τόσο καλά σε αυτό το βENCHMARK, συνήθως δεν ξεπερνούν το 60-65%, αλλά η πρόσφατη απόδοση του Phi-3-Small-7b στο 75,3% είναι κάτι που πρέπει να σκεφτούμε.

Ωστόσο, το MMLU δεν είναι χωρίς μειονεκτήματα: έχει γνωστά προβλήματα όπως αμφίβολες ερωτήσεις, λανθασμένες απαντήσεις, και λείπουν contexto. Και, πολλοί πιστεύουν ότι κάποιες από τις εργασίες του είναι πολύ εύκολες για την σωστή αξιολόγηση των LLM.

Θέλω να τονίσω ότι τα βENCHMARKS σαν το MMLU δεν απεικονίζουν πλήρως τις πραγματικές σκηνές. Εάν ένα LLM επιτύχει ένα εξαιρετικό σκορ σε αυτό, δεν σημαίνει πάντα ότι έχει γίνει ένας ειδικός σε ένα θέμα. Τα βENCHMARKS είναι πραγματικά περιορισμένα σε εύρος και συχνά βασίζονται σε ερωτήσεις με πολλαπλά επιλογές, που δεν μπορούν να κατανοήσουν πλήρως τη σύνθετη και контекστοποιημένη φύση των αλληλεπιδράσεων του πραγματικού κόσμου. Η πραγματική κατανόηση απαιτεί γνώση και δυναμική εφαρμογή αυτής της γνώσης. Για τους λόγους αυτούς, τα LLM πρέπει να αναβαθμιστούν και να ενημερωθούν συνεχώς, ώστε το μοντέλο να διατηρεί την επικαιρότητα και την αποτελεσματικότητα του βENCHMARK.

GPQA (Graduate-Level Google-Proof Q&A Benchmark)

Αυτό το βENCHMARK αξιολογεί τα LLM στη λογική σκέψη χρησιμοποιώντας ένα σύνολο δεδομένων με 448 ερωτήσεις. Οι ειδικοί του τομέα ανέπτυξαν αυτό το σύνολο δεδομένων, το οποίο καλύπτει θέματα στη βιολογία, τη φυσική και τη χημεία.

Κάθε ερώτηση περνάει από τη διαδικασία επικύρωσης:

  1. Ένας ειδικός στον ίδιο τομέα απαντάει στην ερώτηση και παρέχει λεπτομερή σχόλια.
  2. Ο συγγραφέας της ερώτησης αναθεωρεί την ερώτηση με βάση αυτά τα σχόλια.
  3. Ένας δεύτερος ειδικός απαντάει στην αναθεωρημένη ερώτηση.

Αυτή η διαδικασία μπορεί πραγματικά να διασφαλίσει ότι οι ερωτήσεις είναι αντικειμενικές, ακριβείς και απαιτητικές για ένα γλωσσικό μοντέλο. Ακόμη και έμπειροι PhD φοιτητές επιτύχουν μόνο ακρίβεια 65% σε αυτές τις ερωτήσεις, ενώ το GPT-4-omni φτάνει μόνο στο 53,6%, υπογραμμίζοντας το χάσμα μεταξύ της ανθρώπινης και της μηχανικής νοημοσύνης.

Λόγω των υψηλών απαιτήσεων, το σύνολο δεδομένων είναι στην πραγματικότητα khá μικρό, που περιορίζει τη στατιστική του δύναμη για τη σύγκριση της ακρίβειας και απαιτεί μεγάλες επιδράσεις. Οι ειδικοί που δημιούργησαν και επικύρωσαν αυτές τις ερωτήσεις προέρχονταν από το Upwork, οπότε μπορεί να εισήγαγαν προκαταλήψεις με βάση την εμπειρία και τα θέματα που καλύπτουν.

ΒENCHMARKS Κώδικα

HumanEval

164 προβλήματα προγραμματισμού, μια πραγματική δοκιμή για τις ικανότητες κώδικα των LLM. Αυτό είναι το HumanEval. Σχεδιάστηκε για να δοκιμάσει τις βασικές ικανότητες προγραμματισμού των LLM. Χρησιμοποιεί το μέτρο pass@k για να αξιολογήσει την λειτουργική ακρίβεια του κώδικα που παράγεται, το οποίο εξόδους την πιθανότητα ότι τουλάχιστον ένα από τα πρώτα k δείγματα κώδικα LLM θα περάσουν τις δοκιμαστικές περιπτώσεις.

Ενώ το σύνολο δεδομένων HumanEval περιλαμβάνει υπογραφές συναρτήσεων, docstrings, σώματα κώδικα και πολλές μονάδες δοκιμών, δεν περιλαμβάνει το πλήρες φάσμα προβλημάτων προγραμματισμού του πραγματικού κόσμου, που δεν θα δοκιμάσει επαρκώς την ικανότητα του μοντέλου να παράγει σωστό κώδικα για διάφορες περιπτώσεις.

MBPP (Mostly Basic Python Programming)

Mbpp βENCHMARK αποτελείται από 1.000 ερωτήσεις προγραμματισμού Python που έχουν συλλεγεί από το κοινό. Αυτά είναι προβλήματα εισαγωγικού επιπέδου και εστιάζουν στις θεμελιώδεις ικανότητες προγραμματισμού. Χρησιμοποιεί προσεγγίσεις few-shot και fine-tuning για να αξιολογήσει την απόδοση του μοντέλου, με μεγαλύτερα μοντέλα που τυπικά εκτελούνται καλύτερα σε αυτό το σύνολο δεδομένων. Ωστόσο, поскольку το σύνολο δεδομένων περιέχει κυρίως προβλήματα εισαγωγικού επιπέδου, δεν αντιπροσωπεύει πλήρως τις сложκότητες και τις προκλήσεις των εφαρμογών του πραγματικού κόσμου.

ΒENCHMARKS Μαθηματικών

Ενώ τα περισσότερα LLM είναι πολύ καλά στην κατασκευή τυπικών απαντήσεων, η μαθηματική σκέψη είναι ένα πολύ μεγαλύτερο πρόβλημα για αυτά. Γιατί; Γιατί απαιτεί ικανότητες που σχετίζονται με την κατανόηση ερωτημάτων, μια βήμα προς βήμα λογική προσέγγιση με μαθηματική σκέψη και την εξαγωγή της σωστής απάντησης.

Η μέθοδος “Σχέδιο Σκέψης” (CoT) σχεδιάστηκε για να αξιολογήσει τα LLM σε μαθηματικά-σχετικά βENCHMARKS, που περιλαμβάνει την προώθηση των μοντέλων να εξηγήσουν τη διαδικασία σκέψης τους βήμα προς βήμα όταν λύνουν ένα πρόβλημα. Υπάρχουν πολλά πλεονεκτήματα σε αυτό. Κάνει τη διαδικασία σκέψης πιο διαφανή, βοηθά στην αναγνώριση των ελαττωμάτων στη λογική του μοντέλου και επιτρέπει μια πιο λεπτομερή αξιολόγηση των ικανοτήτων επίλυσης προβλημάτων. Βreaking down σύνθετα προβλήματα σε μια σειρά από απλούστερα βήματα, η CoT μπορεί να βελτιώσει την απόδοση του μοντέλου στα μαθηματικά βENCHMARKS και να παρέχει βαθύτερες εντυπώσεις στις ικανότητες σκέψης του.

GSM8K: Ένα Δημοφιλές Μαθηματικό ΒENCHMARK

Ένα από τα γνωστά βENCHMARKS για την αξιολόγηση των μαθηματικών ικανοτήτων των LLM είναι το σύνολο δεδομένων GSM8K. Το GSM8K αποτελείται από 8.500 μαθηματικά προβλήματα του μέσου σχολείου, που απαιτούν einige βήματα για να λυθούν, και οι λύσεις τους περιλαμβάνουν κυρίως την εκτέλεση μιας σειράς βασικών υπολογισμών. Τυπικά, μεγαλύτερα μοντέλα ή αυτά που έχουν εκπαιδευτεί ειδικά για μαθηματική σκέψη τείνουν να εκτελούνται καλύτερα σε αυτό το βENCHMARK, π.χ. τα μοντέλα GPT-4 έχουν einen σκορ 96,5%, ενώ το DeepSeekMATH-RL-7B είναι λίγο πίσω στο 88,2%.

Ενώ το GSM8K είναι χρήσιμο για την αξιολόγηση της ικανότητας του μοντέλου να χειρίζεται προβλήματα μαθηματικών του σχολείου, μπορεί να μην κατανοήσει πλήρως την ικανότητα του μοντέλου να λύσει πιο προηγμένα ή διαφορετικά μαθηματικά προβλήματα, οπότε περιορίζει την αποτελεσματικότητά του ως綜合ική μέτρηση της μαθηματικής ικανότητας.

Το Μαθηματικό Σύνολο Δεδομένων: Μια綜合ική Εναλλακτική

Το μαθηματικό σύνολο δεδομένων αντιμετώπισε τα ελαττώματα των βENCHMARKS σαν το GSM8K. Αυτό το σύνολο δεδομένων είναι πιο εκτενές, καλύπτοντας την στοιχειώδη αριθμητική μέχρι τα μαθηματικά του γυμνασίου και ακόμη και του κολλεγίου. Επίσης, συγκρίνεται με ανθρώπους, με ένα φοιτητή που δεν του αρέσουν τα μαθηματικά να επιτύχει ακρίβεια 40% και έναν χρυσοί νικητή να επιτύχει ακρίβεια 90%.

Παρέχει μια πιο綜合ική αξιολόγηση των μαθηματικών ικανοτήτων του LLM. Καλύπτει την ικανότητα του μοντέλου να είναι ικανό στη βασική αριθμητική και να είναι ικανό σε σύνθετους τομείς όπως η άλγεβρα, η γεωμετρία και η ανάλυση. Ωστόσο, η αυξημένη πολυπλοκότητα και ποικιλία των προβλημάτων μπορεί να κάνει δύσκολο για τα μοντέλα να επιτύχουν υψηλή ακρίβεια, ιδιαίτερα αυτά που δεν έχουν εκπαιδευτεί ειδικά σε ένα ευρύ φάσμα μαθηματικών εννοιών. Επίσης, οι ποικίλες μορφές προβλημάτων στο μαθηματικό σύνολο δεδομένων μπορούν να εισαγάγουν ασυνέπειες στην απόδοση του μοντέλου, που κάνει πιο δύσκολο να βγάλουμε σαφείς συμπεράσματα για την綜合ική μαθηματική ικανότητα του μοντέλου.

Η χρήση της μεθόδου CoT με το μαθηματικό σύνολο δεδομένων μπορεί να ενισχύσει την αξιολόγηση, αποκαλύπτοντας τις ικανότητες σκέψης του LLM σε ένα ευρύ φάσμα μαθηματικών προκλήσεων. Μια συνδυαστική προσέγγιση σαν αυτή διασφαλίζει μια πιο ρομποτική και λεπτομερή αξιολόγηση των πραγματικών μαθηματικών ικανοτήτων του LLM.

ΒENCHMARKS Κατανόησης Κειμένου

Μια αξιολόγηση κατανόησης κειμένου αξιολογεί την ικανότητα του μοντέλου να κατανοήσει και να επεξεργαστεί σύνθετο κείμενο, που είναι ιδιαίτερα σημαντικό για εφαρμογές όπως η υποστήριξη πελατών, η δημιουργία περιεχομένου και η ανάκτηση πληροφοριών. Υπάρχουν beberapa βENCHMARKS που σχεδιάστηκαν για να αξιολογήσουν αυτήν την ικανότητα, κάθε ένα με μοναδικά χαρακτηριστικά που συνεισφέρουν σε μια綜合ική αξιολόγηση των ικανοτήτων του μοντέλου.

RACE (Reading Comprehension dataset from Examinations)

Το RACE βENCHMARK έχει σχεδόν 28.000 περικοπές και 100.000 ερωτήσεις που συλλέχθηκαν από τις αγγλικές εξετάσεις για μαθητές του μέσου και του γυμνασίου στην Κίνα, ηλικίας 12 έως 18 ετών. Δεν περιορίζει τις ερωτήσεις και τις απαντήσεις να εξαχθούν από τις δοθείσες περικοπές, καθιστώντας τις εργασίες ακόμη πιο απαιτητικές.

Καλύπτει ένα ευρύ φάσμα θεμάτων και τύπων ερωτήσεων, που κάνει μια綜合ική αξιολόγηση και περιλαμβάνει ερωτήσεις σε διάφορα επίπεδα δυσκολίας. Επίσης, οι ερωτήσεις στο RACE είναι ειδικά σχεδιασμένες για να δοκιμάσουν τις ικανότητες ανάγνωσης των ανθρώπων και έχουν αναπτυχθεί από ειδικούς του τομέα.

Ωστόσο, το βENCHMARK έχει κάποια μειονεκτήματα.既然 έχει αναπτυχθεί με βάση υλικό εκπαίδευσης από την Κίνα, είναι ευάλωτο σε εισαγωγή πολιτισμικών προκαταλήψεων που δεν αντικατοπτρίζουν einen παγκόσμιο контекστο. Επίσης, το υψηλό επίπεδο δυσκολίας σε κάποιες ερωτήσεις δεν είναι πραγματικά αντιπροσωπευτικό των τυπικών εργασιών του πραγματικού κόσμου. Έτσι, οι αξιολογήσεις της απόδοσης possono να μην είναι ακριβείς.

DROP (Discrete Reasoning Over Paragraphs)

Μια άλλη σημαντική προσέγγιση είναι το DROP (Discrete Reasoning Over Paragraphs), που προκαλεί τα μοντέλα να εκτελέσουν rờiρες λογική πάνω από περικοπές. Έχει 96.000 ερωτήσεις για να δοκιμάσει τις ικανότητες σκέψης των LLM και οι ερωτήσεις έχουν εξαχθεί από το Wikipedia και έχουν συλλεγεί από το Amazon Mechanical Turk. Οι ερωτήσεις του DROP συχνά απαιτούν από τα μοντέλα να εκτελέσουν μαθηματικές εργασίες όπως πρόσθεση, αφαιρεση και σύγκριση με βάση πληροφορίες που διασκορπίζονται σε μια περικοπή.

Οι ερωτήσεις είναι απαιτητικές. Απαιτούν από τα LLM να εντοπίσουν πολλαπλά νούμερα στην περικοπή και να τα προσθέσουν ή να τα αφαιρέσουν για να λάβουν την τελική απάντηση. Μεγάλα μοντέλα όπως το GPT-4 και το palm επιτύχουν 80% και 85%, ενώ οι άνθρωποι επιτύχουν 96% στο σύνολο δεδομένων DROP.

ΒENCHMARKS Κοινής Λογικής

Η αξιολόγηση της κοινής λογικής στα γλωσσικά μοντέλα είναι ένα ενδιαφέρον ζήτημα, αλλά και κρίσιμο, επειδή αξιολογεί την ικανότητα του μοντέλου να κάνει κρίσεις και εικασίες που συμφωνούν με την ανθρώπινη σκέψη. Σε αντίθεση με τους ανθρώπους, που αναπτύσσουν ένα綜合ικό μοντέλο του κόσμου μέσω πρακτικών εμπειριών, τα γλωσσικά μοντέλα εκπαιδεύονται σε τεράστια σύνολα δεδομένων χωρίς να κατανοούν πραγματικά το контекστο. Αυτό σημαίνει ότι τα μοντέλα δυσκολεύονται με εργασίες που απαιτούν μια ενστικτική κατανόηση καθημερινών καταστάσεων, λογική σκέψη και πρακτική γνώση, που είναι πολύ σημαντικά για robust και αξιόπιστα AI εφαρμογές.

HellaSwag (Harder Endings, Longer contexts, and Low-shot Activities for Situations With Adversarial Generations)

Το HellaSwag έχει αναπτυχθεί από τον Rowan Zellers και τους συναδέλφους του στο Πανεπιστήμιο του Washington και το Allen Institute for Artificial Intelligence. Σχεδιάστηκε για να δοκιμάσει την ικανότητα του μοντέλου να προβλέψει την πιο πιθανή συνέχεια μιας δεδομένης σκηνής. Αυτό το βENCHMARK έχει κατασκευαστεί χρησιμοποιώντας Adversarial Filtering (AF), όπου μια σειρά από διακρίσεις επιλέγουν διαρκώς τις αντίθετες, μη σωστές απαντήσεις που παράγονται από μηχανές. Αυτή η μέθοδος δημιουργεί ένα σύνολο δεδομένων με εύκολες περιπτώσεις για τους ανθρώπους αλλά απαιτητικές για τα μοντέλα, οδηγώντας σε μια “Goldilocks” ζώνη δυσκολίας.

Ενώ το HellaSwag ήταν μια πρόκληση για τα προηγούμενα μοντέλα, τα state-of-the-art μοντέλα όπως το GPT-4 έχουν επιτύχει επίπεδα απόδοσης κοντά στην ανθρώπινη ακρίβεια, υποδεικνύοντας σημαντική πρόοδο στο πεδίο. Ωστόσο, αυτά τα αποτελέσματα υπογραμμίζουν την ανάγκη για συνεχώς εξελισσόμενα βENCHMARKS για να跟παθούν τις προόδους στις ικανότητες του AI.

Openbook

Το σύνολο δεδομένων Openbook αποτελείται από 5957 ερωτήσεις πολλαπλής επιλογής στο επίπεδο του δημοτικού. Οι ερωτήσεις έχουν συλλεγεί από ανοιχτά βιβλία εξετάσεων και έχουν αναπτυχθεί για να αξιολογήσουν την κατανόηση των ανθρώπων για το αντικείμενο.

Το βENCHMARK Openbook απαιτεί ικανότητα σκέψης πέρα από την ανάκτηση πληροφοριών. Το GPT-4 έχει επιτύχει την υψηλότερη ακρίβεια 95,9% μέχρι τώρα.

Το OpenbookQA έχει μοντελοποιηθεί με βάση ανοιχτά βιβλία εξετάσεων και αποτελείται από 5.957 ερωτήσεις πολλαπλής επιλογής στο επίπεδο του δημοτικού. Αυτές οι ερωτήσεις έχουν σχεδιαστεί για να διερευνήσουν την κατανόηση 1.326 βασικών επιστημονικών γεγονότων και την εφαρμογή τους σε νέες καταστάσεις.

Παρόμοια με το HellaSwag, τα προηγούμενα μοντέλα βρήκαν το OpenbookQA απαιτητικό, αλλά τα σύγχρονα μοντέλα όπως το GPT-4 έχουν επιτύχει επίπεδα απόδοσης κοντά στην ανθρώπινη ακρίβεια. Αυτή η πρόοδος υπογραμμίζει την σημαντικότητα της ανάπτυξης ακόμη πιο σύνθετων και νюανσμένων βENCHMARKS για να συνεχίσουν να ωθούν τα όρια της κατανόησης του AI.

Είναι τα ΒENCHMARKS Αρκετά για την Αξιολόγηση της Απόδοσης των LLM;

Ναι, ενώ παρέχουν μια τυποποιημένη προσέγγιση για την αξιολόγηση της απόδοσης των LLM, μπορούν επίσης να είναι παραπλανητικά. Η Οργάνωση Μεγάλων Μοντέλων Συστημάτων λέει ότι ένα καλό βENCHMARK για LLM πρέπει να είναι ευέλικτο, ικανό να αξιολογήσει νέα μοντέλα με σχετικά λίγες δοκιμές και να παρέχει μια μοναδική σειρά κατάταξης για όλα τα μοντέλα. Αλλά, υπάρχουν λόγοι για τους οποίους μπορεί να μην είναι αρκετά. Εδώ είναι κάποιοι:

Διαρροή ΒENCHMARK

Αυτό είναι ένα κοινό πρόβλημα και συμβαίνει όταν τα δεδομένα εκπαίδευσης перекриваются με τα δεδομένα δοκιμής, καθιστώντας την αξιολόγηση παραπλανητική. Εάν ένα μοντέλο έχει ήδη συναντήσει κάποιες ερωτήσεις δοκιμής κατά την εκπαίδευση, το αποτέλεσμα μπορεί να μην αντικατοπτρίζει ακριβώς τις πραγματικές ικανότητές του. Αλλά ένα ιδανικό βENCHMARK πρέπει να ελαχιστοποιήσει την απομνημόνευση και να αντικατοπτρίζει τις πραγματικές σκηνές.

Προκαταλήψεις Αξιολόγησης

Οι κατατάξεις των LLM σε βENCHMARKS χρησιμοποιούνται για να συγκρίνουν την απόδοση των LLM σε διάφορες εργασίες. Ωστόσο, η εξάρτηση από αυτές τις κατατάξεις για τη σύγκριση των μοντέλων μπορεί να είναι παραπλανητική. Απλές αλλαγές στις δοκιμές των βENCHMARKS, όπως η αλλαγή της σειράς των ερωτήσεων, μπορεί να μετατοπίσει την κατάταξη των μοντέλων μέχρι και οκτώ θέσεις. Επίσης, τα LLM μπορεί να εκτελούνται διαφορετικά ανάλογα με τις μεθόδους σκορ, υπογραμμίζοντας την σημαντικότητα της考虑 των προκαταλήψεων αξιολόγησης.

Ανοιχτή Σύνδεση

Οι αλληλεπιδράσεις του πραγματικού κόσμου με τα LLM περιλαμβάνουν την σχεδίαση προώθησεων για να παράγουν επιθυμητές εξόδους AI. Οι εξόδους των LLM εξαρτώνται από την αποτελεσματικότητα των προώθησεων, και τα βENCHMARKS έχουν σχεδιαστεί για να δοκιμάσουν την ευαισθησία του контекστο των LLM. Ωστόσο, τα βENCHMARKS δεν μεταφράζονται πάντα直接 στην απόδοση του πραγματικού κόσμου. Για παράδειγμα, ένα μοντέλο που επιτυγχάνει ένα σκορ 100% σε ένα σύνολο δεδομένων βENCHMARK, όπως το LSAT, δεν εγγυάται το ίδιο επίπεδο ακρίβειας σε πρακτικές εφαρμογές. Αυτό υπογραμμίζει την σημαντικότητα της考虑 της ανοιχτής σύνδεσης των εργασιών του πραγματικού κόσμου στην αξιολόγηση των LLM.

Εфективική Αξιολόγηση για Ρομποτικά LLM

Λοιπόν, τώρα γνωρίζετε ότι τα βENCHMARKS δεν είναι πάντα η καλύτερη επιλογή, επειδή δεν μπορούν πάντα να γενικευθούν σε όλα τα προβλήματα. Αλλά, υπάρχουν άλλες οδοί.

Ειδικά ΒENCHMARKS

Αυτά είναι ιδανικά για τη δοκιμή συγκεκριμένων συμπεριφορών και λειτουργιών σε σενάρια ειδικών εργασιών. Π.χ., εάν ένα LLM έχει σχεδιαστεί για ιατρικούς αξιωματούχους, τα σύνολα δεδομένων που συλλέγονται από ιατρικούς χώρους θα αντιπροσωπεύουν πραγματικές σκηνές. Αυτά τα ειδικά βENCHMARKS μπορούν να εστιάσουν στην κατανόηση της γλώσσας, την απόδοση και τις μοναδικές απαιτήσεις контекστο. Βάσει της ευθυγράμμισης των βENCHMARKS με πιθανές πραγματικές σκηνές, μπορείτε να διασφαλίσετε ότι το LLM εκτελείται καλά γενικά και εξέχει στις συγκεκριμένες εργασίες για τις οποίες έχει σχεδιαστεί. Αυτό μπορεί να βοηθήσει στην αναγνώριση και διόρθωση των κενών ή αδυναμιών στις ικανότητες του μοντέλου νωρίς.

Διαδικασία Ανίχνευσης Διαρροής Δεδομένων

Εάν θέλετε οι αξιολογήσεις σας να “δείχνουν” ακεραιότητα, είναι πολύ σημαντικό να έχετε μια διαδικασία βENCHMARK που είναι ελεύθερη από διαρροή δεδομένων. Η διαρροή δεδομένων συμβαίνει όταν τα δεδομένα βENCHMARK περιλαμβάνονται στο σύνολο δεδομένων εκπαίδευσης του μοντέλου, οδηγώντας σε искусτικά υψηλά σκορ απόδοσης. Για να αποφευχθεί αυτό, τα βENCHMARKS πρέπει να αναφερθούν στα δεδομένα εκπαίδευσης. Επίσης, πρέπει να ληφθούν βήματα για να αποφευχθεί οποιαδήποτε προηγουμένως vista πληροφορία. Αυτό μπορεί να περιλαμβάνει τη χρήση ιδιωτικών ή νεοσυλλεγμένων συνόλων δεδομένων που διατηρούνται ξεχωριστά από την πορεία εκπαίδευσης του μοντέλου – αυτό θα διασφαλίσει ότι τα μετρικά απόδοσης που λαμβάνετε αντικατοπτρίζουν την ικανότητα του μοντέλου να γενικεύσει καλά.

Αξιολόγηση από Ανθρώπους

Τα αυτόματα μετρικά δεν μπορούν να κατανοήσουν πλήρως το φάσμα της απόδοσης του μοντέλου, ιδιαίτερα όταν πρόκειται για πολύ λεπτομερείς και υποκειμενικές πτυχές της κατανόησης και γεννήσεως της γλώσσας. Εδώ, η αξιολόγηση από ανθρώπους παρέχει μια πολύ καλύτερη αξιολόγηση:

  • Εργασία Επαγγελματιών που μπορούν να παρέχουν λεπτομερείς και αξιόπιστες αξιολογήσεις, ιδιαίτερα για εξειδικευμένους τομείς.
  • Δημοκρατία! Πλατφόρμες όπως το Amazon Mechanical Turk επιτρέπουν τη συλλογή ποικίλων ανθρώπινων κρίσεων γρήγορα και με χαμηλό κόστος.
  • Ανταπόκριση της Κοινότητας: Η χρήση πλατφορμών όπως η LMSYS leaderboard arena, όπου οι χρήστες μπορούν να ψηφίσουν και να συγκρίνουν μοντέλα, προσθέτει ένα επιπλέον επίπεδο εντυπώσεων. Το LMSYS Chatbot Arena Hard, για παράδειγμα, είναι ιδιαίτερα αποτελεσματικό στο να υπογραμμίζει τις λεπτές διαφορές μεταξύ των κορυφαίων μοντέλων μέσω άμεσων αλληλεπιδράσεων και ψηφοφοριών χρηστών.

Συμπέρασμα

Χωρίς αξιολόγηση και βENCHMARKS, δεν θα είχαμε τρόπο να γνωρίζουμε αν η ικανότητα των LLM να χειρίζονται πραγματικές εργασίες είναι τόσο ακριβής και εφαρμόσιμη όσο νομίζουμε. Αλλά, όπως είπα, τα βENCHMARKS δεν είναι πάντα ο καλύτερος τρόπος για να ελέγξουμε αυτό, καθώς μπορούν να οδηγήσουν σε κενά στην απόδοση των LLM. Αυτό μπορεί επίσης να επιβραδύνει την ανάπτυξη των LLM που είναι πραγματικά robust για εργασία.

Αυτό είναι πώς πρέπει να είναι σε ένα ιδανικό κόσμο. Τα LLM κατανοούν τις ερωτήσεις του χρήστη, αναγνωρίζουν λάθη στις προωθήσεις, ολοκληρώνουν εργασίες όπως οδηγούνται, και παράγουν αξιόπιστες εξόδους. Τα αποτελέσματα είναι ήδη μεγάλα αλλά δεν είναι ιδανικά. Αυτό είναι όπου τα task-ειδικά βENCHMARKS αποδεικνύονται πολύ χρήσιμα, όπως και η αξιολόγηση από ανθρώπους και η ανίχνευση διαρροής βENCHMARK. Χρησιμοποιώντας αυτά, έχουμε την ευκαιρία να παράγουμε πραγματικά robust LLM.

Η Irina Barskaya, PhD, είναι ένα διακεκριμένος επιστήμονας δεδομένων με πάνω από μια δεκαετία εμπειρίας, που περιλαμβάνει τόσο την ανάλυση προϊόντων όσο και την ανάλυση για προηγμένα τεχνολογικά προϊόντα. Ηγήθηκε της δημιουργίας και ανάλυσης για το Yasmina, το πρώτο πλήρως λειτουργικό τοπικοποιημένο AI-βασισμένο ψηφιακό βοηθό για τη Σαουδική Αραβία, που χειρίζεται σύνθετη τοπικοποίηση δεδομένων και ετικέτες για τη Μοντέρνα Стандάρτ Αραβικά και τα διαλέκτους της Σαουδικής Αραβίας. Hiện tại, η Irina είναι επικεφαλής της ποιότητας ανάλυσης στο Yandex, που推動ει τις προόδους στις τεχνολογίες AI.