Η γωνία του Anderson

Νέα έρευνα αποκαλύπτει δεκαέξι σημαντικά προβλήματα με τα συστήματα RAG, συμπεριλαμβανομένης της Perplexity

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
Image generated by ChatGPT-4o, with prompt ' Create a highly photorealistic panoramic image of a robot frantically searching the internet on a laptop. Do not stylize this image so that it looks like a false or AI-created image'

Μια πρόσφατη μελέτη από τις Ηνωμένες Πολιτείες αποκάλυψε ότι η πραγματική απόδοση των δημοφιλών συστημάτων Retrieval Augmented Generation (RAG) όπως η Perplexity και η Bing Copilot είναι πολύ χαμηλότερη από την προώθηση και την δημοτικότητα που έχουν λάβει τα τελευταία 12 μήνες.

Το έργο, το οποίο περιελάμβανε εκτεταμένη συμμετοχή σε έρευνα με 21 εμπειρογνώμονες, βρήκε τουλάχιστον 16 περιοχές στις οποίες τα μελετημένα συστήματα RAG (You Chat, Bing Copilot και Perplexity) παρήγαγαν αιτία για ανησυχία:

1: Ελλειψη αντικειμενικών λεπτομερειών στις παραγώμενες απαντήσεις, με γενικές περίληψεις και λίγη περιεκτική βάθος ή νюανς.

2. Ενίσχυση της αντιλαμβανόμενης προκατάληψης του χρήστη, όπου ένα σύστημα RAG συχνά δεν παρουσιάζει eine σειρά από απόψεις, αλλά αντίθετα ενισχύει την προκατάληψη του χρήστη, με βάση τον τρόπο που ο χρήστης διατυπώνει μια ερώτηση.

3. Υπερβολικά αυτοπεποίθητη γλώσσα, ιδιαίτερα σε υποκειμενικές απαντήσεις που δεν μπορούν να επιβεβαιωθούν εμπειρικά, η οποία μπορεί να οδηγήσει τους χρήστες να εμπιστεύονται την απάντηση περισσότερο από ό,τι αξίζει.

4: Απλοποιημένη γλώσσα και έλλειψη κριτικής σκέψης και δημιουργικότητας, όπου οι απαντήσεις αποτελούνται από “απλοποιημένες” και “συμφωνικές” πληροφορίες, αντί για σκέψη και ανάλυση.

5: Λάθος αναφορές και αναθέσεις πηγών, όπου το σύστημα απάντησης χρησιμοποιεί αναφορές που δεν υποστηρίζουν την απάντησή του.

6: Επιλογή πληροφοριών από την υποτιθέμενη πηγή, όπου το σύστημα RAG φαίνεται να αναζητά απαντήσεις που υποστηρίζουν την παραγωγή της και της εκτίμησης του τι θέλει ο χρήστης να ακούσει, αντί να βασίζεται στις απαντήσεις σε αντικειμενική ανάλυση αξιόπιστων πηγών.

7: Παραλείπουσες αναφορές που υποστηρίζουν τις δηλώσεις, όπου η πηγή υλικού για τις απαντήσεις είναι απουσία.

8: Παρέχοντας keine λογική σχήμα για τις απαντήσεις, όπου οι χρήστες δεν μπορούν να ερωτήσουν γιατί το σύστημα προτίμησε ορισμένες πηγές από άλλες.

9: Περιορισμένος αριθμός πηγών, όπου τα περισσότερα συστήματα RAG παρέχουν γύρω στις τρεις υποστηρικτικές πηγές για μια δήλωση, ακόμη και όταν μια μεγαλύτερη ποικιλία πηγών θα ήταν εφαρμόσιμη.

10: Ορφανές πηγές, όπου τα δεδομένα από όλες ή κάποιες από τις υποστηρικτικές αναφορές του συστήματος δεν περιλαμβάνονται στην απάντηση.

11: Χρήση αξιόπιστων πηγών, όπου το σύστημα φαίνεται να προτιμά μια πηγή που είναι δημοφιλής (δηλαδή, σε όρους SEO) αντί για factually σωστή.

12: Πλεονάζουσες πηγές, όπου το σύστημα παρουσιάζει πολλές αναφορές στις οποίες τα έγγραφα πηγών είναι ουσιαστικά τα ίδια σε περιεχόμενο.

13: Ανεφィλτρες πηγές, όπου το σύστημα δεν προσφέρει στον χρήστη κανέναν τρόπο να αξιολογήσει ή να φιλτράρει τις προτεινόμενες αναφορές, αναγκάζοντας τους χρήστες να εμπιστεύονται τα κριτήρια επιλογής.

14: Ελλειψη αλληλεπίδρασης ή εξερεύνησης, όπου αρκετοί από τους συμμετέχοντες στην έρευνα ήταν απογοητευμένοι που τα συστήματα RAG δεν έθεσαν διευκρινιστικές ερωτήσεις, αλλά υποθέτησαν την πρόθεση του χρήστη από την πρώτη ερώτηση.

15: Η ανάγκη για εξωτερική επαλήθευση, όπου οι χρήστες cảm覺 ότι πρέπει να thực hiện ανεξάρτητη επαλήθευση των παρεχόμενων απαντήσεων, αφαιρώντας την υποτιθέμενη ευκολία των συστημάτων RAG ως “αντικατάσταση της αναζήτησης”.

16: Χρήση ακαδημαϊκών μεθόδων αναφοράς, όπως [1] ή [34], που είναι τυπική πρακτική σε ακαδημαϊκούς κύκλους, αλλά μπορεί να είναι αντίθετη για πολλούς χρήστες.

Για το έργο, οι ερευνητές συνέλεξαν 21 εμπειρογνώμονες στην τεχνητή νοημοσύνη, την ιατρική και τις εφαρμοσμένες επιστήμες, όλους είτε μεταδιδακτορικούς ερευνητές είτε υποψήφιους διδάκτορες. Οι συμμετέχοντες αλληλεπιδρούσαν με τα δοκιμασμένα συστήματα RAG ενώ μιλούσαν τις σκέψεις τους, για να διευκρινίσουν (για τους ερευνητές) το δικό τους ρητό σχήμα.

Το έγγραφο αναφέρει εκτενώς τις ανησυχίες και τις ανησυχίες των συμμετεχόντων σχετικά με την απόδοση των τριών συστημάτων που μελετήθηκαν.

Η ανταλλαγή RAG

Οι συγγραφείς επαναλαμβάνουν τέσσερις γνωστές ελλείψεις των μεγάλων μοντέλων γλώσσας (LLM) όπου χρησιμοποιούνται μέσα σε μηχανές απάντησης.

Πρώτον, είναι склонные να οραματίζουν πληροφορίες και να λείπουν η ικανότητα να ανιχνεύουν фактиικές ασυνέπειες. Δεύτερον, έχουν δυσκολία να αξιολογούν την ακρίβεια μιας αναφοράς στο контέκστ της μιας παραγόμενης απάντησης. Τρίτον, τείνουν να προτιμούν δεδομένα από τα δικά τους προ-εκπαιδευμένα βάρη και μπορεί να αντισταθούν δεδομένα από εξωτερικά ανακτημένα έγγραφα, ακόμη και αν τέτοια δεδομένα μπορεί να είναι πιο πρόσφατα ή πιο ακριβή.

Τέλος, τα συστήματα RAG τείνουν προς την ικανοποίηση των ανθρώπων, συκοφαντική συμπεριφορά, συχνά με έξοδα της ακρίβειας των πληροφοριών στις απαντήσεις τους.

Όλες αυτές οι τάσεις επιβεβαιώθηκαν και στις δύο πτυχές της μελέτης, μαζί με πολλές νέες παρατηρήσεις σχετικά με τις παγίδες των συστημάτων RAG.

Η μελέτη

Οι συγγραφείς πρώτα δοκιμάζουν την διαδικασία της μελέτης τους σε τρία από τα 24 επιλεγμένα συμμετέχοντες, όλους τους οποίους προσκλήθηκαν με μέσα όπως το LinkedIn ή το email.

Η πρώτη φάση, για τους υπόλοιπους 21, αφορούσε την Εμπειρογνωμοσύνη Ανάκτησης Πληροφοριών, όπου οι συμμετέχοντες μέτρησαν περίπου έξι αναζητήσεις πάνω από μια 40λεπτη συνεδρία. Αυτή η ενότητα επικεντρώθηκε στην ανίχνευση και επαλήθευση βασισμένων σε γεγονότα ερωτήσεων και απαντήσεων, με πιθανές εμπειρικές λύσεις.

Η δεύτερη φάση αφορούσε την Επίδειξη Ανάκτησης Πληροφοριών, η οποία ασχολήθηκε με υποκειμενικά θέματα, συμπεριλαμβανομένης της οικολογίας, της χορτοφαγίας και της πολιτικής.

Γεννημένες απαντήσεις μελέτης από Perplexity (αριστερά) και You Chat (δεξιά). Πηγή: https://arxiv.org/pdf/2410.22349

Γεννημένες απαντήσεις μελέτης από Perplexity (αριστερά) και You Chat (δεξιά). Πηγή: https://arxiv.org/pdf/2410.22349

Καθώς όλα τα συστήματα επέτρεψαν τουλάχιστον κάποιο επίπεδο αλληλεπίδρασης με τις αναφορές που παρέχονται ως υποστήριξη για τις παραγόμενες απαντήσεις, οι συμμετέχοντες ενθαρρύνθηκαν να αλληλεπιδράσουν με τη διεπαφή όσο το δυνατόν περισσότερο.

Σε cả τις περιπτώσεις, οι συμμετέχοντες ζητήθηκαν να διατυπώσουν τις ερωτήσεις τους τόσο μέσω ενός συστήματος RAG όσο και μιας συμβατικής μηχανής αναζήτησης (σε αυτή την περίπτωση, Google ).

Τα τρία συστήματα απάντησης – You Chat, Bing Copilot και Perplexity – επιλέχθηκαν επειδή είναι δημόσια προσβάσιμα.

Η πλειονότητα των συμμετεχόντων ήταν ήδη χρήστες συστημάτων RAG, σε διάφορες συχνότητες.

Ελλειψη αντικειμενικής λεπτομέρειας

Το έγγραφο σημειώνει ότι οι χρήστες βρήκαν τις απαντήσεις του συστήματος συχνά να λείπουν αντικειμενικής λεπτομέρειας, τόσο στις πραγματικές όσο και στις υποκειμενικές απαντήσεις. Ένας από τους συμμετέχοντες σχολίασε:

‘Ήταν απλώς μια προσπάθεια να απαντήσει χωρίς να μου δώσει μια στερεή απάντηση ή μια πιο σκέφτη απάντηση, η οποία μπορώ να την πάρω με πολλές αναζητήσεις στο Google.’

Ελλειψη ολιστικής άποψης

Οι συγγραφείς εκφράζουν ανησυχίες σχετικά με την έλλειψη νюανς και ειδικότητας, και δηλώνουν ότι τα συστήματα απάντησης συχνά δεν παρουσιάζουν πολλές προοπτικές σε οποιοδήποτε επιχείρημα, τείνοντας να συμφωνούν με μια αντιλαμβανόμενη προκατάληψη που υπονοείται από την δική του φράση της ερώτησης.

Αυτοπεποίθητη γλώσσα

Οι συγγραφείς παρατηρούν ότι όλα τα τρία δοκιμασμένα συστήματα παρουσίαζαν χρήση υπερβολικά αυτοπεποίθητης γλώσσας, ακόμη και για απαντήσεις που καλύπτουν υποκειμενικά θέματα.

Λάθος αναφορές

Μια άλλη συχνή πρόβλημα ήταν η λανθασμένη αναφορά πηγών που αναφέρονται ως εξουσία για τις απαντήσεις του συστήματος RAG.

Επιλογή πληροφοριών για να ταιριάζουν στην ερώτηση

Η μελέτη βρήκε ότι πολλές απαντήσεις του συστήματος RAG τείνουν να υπογραμμίζουν μια συγκεκριμένη άποψη αντί να συνοψίζουν ολοκληρωτικά το θέμα.

Αυτοματοποιημένο RAG

Στη δεύτερη φάση της ευρύτερης μελέτης, οι ερευνητές χρησιμοποίησαν browser-βασισμένα scripting για να ζητήσουν συστηματικά ερωτήσεις από τα τρία μελετημένα συστήματα RAG.

Οι δηλώσεις αναλύθηκαν για σχετικότητα ερώτησης και Δηλώσεις Προ και Κατά (δηλαδή, αν η απάντηση είναι για, κατά, ή ουδέτερη, σε σχέση με την προκατάληψη της ερώτησης).

Ένα Σκορ Πεποίθησης Απάντησης αξιολογήθηκε επίσης σε αυτή τη φάση, με βάση τη μέθοδο ψυχομετρικού ελέγχου Likert.

Μια τρίτη λειτουργία αφορούσε την χρήση web-scraping για να ληφθεί το πλήρες περιεχόμενο των αναφορών ιστοσελίδων, μέσω του εργαλείου Jina.ai Reader.

Επιπλέον, οι ερευνητές αξιολόγησαν την ικανότητα των συστημάτων RAG να υποστηρίξουν τις δηλώσεις τους με αναφορές.

Τα αποτελέσματα της μελέτης δείχνουν ότι κανένα από τα συστήματα RAG δεν πέτυχε καλή απόδοση σε большин των μετρικών.

Οι συγγραφείς συμπεραίνουν ότι τα συστήματα RAG έχουν ακόμη πολύ δρόμο να διανύσουν για να βελτιώσουν την απόδοσή τους.

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai