Η γωνία του Anderson
Το ChatGPT-5 και το Gemini 2.5 παρουσιάζουν ψευδαισθήσεις στο 40% των ερωτημάτων του τύπου των γραφείων ειδήσεων

Το NotebookLM της Google αποδίδει καλύτερα με ποσοστό ψευδώς θετικών αποτελεσμάτων μόλις 13%—ένα ποσοστό που θα ήταν αρκετό για να απολύσει οποιονδήποτε δημοσιογράφο στον κόσμο. Η μελέτη διαπίστωσε ότι τα μοντέλα συχνά παραμόρφωναν τις πηγές, μετατρέποντας τις απόψεις σε γεγονότα και αφαιρώντας αναφορές, καθιστώντας τες επικίνδυνα εργαλεία για τον Τύπο. Οι συγγραφείς ζητούν καλύτερα, εξειδικευμένα εργαλεία για αυτές τις εργασίες.Τα Μεγάλα Γλωσσικά Μοντέλα έχουν δει ταχεία υιοθέτηση στον Τύπο τα τελευταία χρόνια, σε εργασιακά περιβάλλοντα που έχουν μειώσει το κόστος, τους προϋπολογισμούς και το προσωπικό από τότε που
Μια νέα μελέτη διαπιστώνει ότι το ChatGPT-5 και το Google Gemini παρουσιάζουν ψευδαισθήσεις στο 40% των ερωτημάτων του τύπου των γραφείων ειδήσεων, συχνά εφευρίσκοντας ισχυρόηχες αξιολογήσεις που δεν επιβεβαιώνονται από επαλήθευσιμες πραγματικότητες. Το ο ψηφιακός τύπος κατέρρευσε δύο αιώνες παραδόσεων σε μια απαράβατη μια διαδικασία που ξεκίνησε στις αρχές της δεκαετίας του 2000. Στην πραγματικότητα, ο χώρος ήταν ήδη γόνιμος, καθώς ο Τύπος είχε συνηθίσει να μειώνει θέσεις εργασίας μέσω της «καινοτομίας» τουλάχιστον από την ταραχώδη εισαγωγή της της ψηφιακής στυλοθέτησης στις δεκαετίες του 1980, καθώς και από τις προηγούμενες προκλήσεις από την εμφάνιση του ραδιοφώνου και της τηλεόρασης .Η αμείωτη πορεία του AI στον τύπο και στα μέσα ενημέρωσης δεν ήταν χωρίς πτώση, ωστόσο· σε ένα περιβάλλον όπου 55% των εταιρειών τώρα μετανιώσει για την αντικατάσταση των ανθρώπων με το AI, και όπου η Gartner προβλέπει ότι οι οργανισμοί θα μειώσουν δραστικά τα χρονοδιαγράμματα υιοθέτησης του AI εντός δύο ετών, ένας αριθμός μέσων ενημέρωσης έχουν ξανανιώσει δημοσιογράφους που αντικαταστάθηκαν από το AI, καθώς οι σοβαρές και συχνά απαράδεκτεςελλείψεις των εναλλακτικών λύσεων του μηχανικού μαθήματος έγιναν εμφανείς.
Το Λάθος Δεν Είναι Μόνο Ανθρώπινο
Αν και οι ψευδαισθήσεις έχουν αποδειχθεί ένα τεράστιο πρόβλημα για τα πεδία όπου η ακριβής αναφορά είναι απαραίτητη (με αξιοσημείωτη δημόσια προσοχή για περιπτώσειςαποτυχίας του AI στα δικαστήρια , ερευνητικά και δημοσιογραφικά τομείς), μια νέα αμερικανική μελέτη διαπιστώνει ότι το μηχανικό μάθημα στον τύπο αντιμετωπίζει ευρύτερες προκλήσεις απόότι αναμενόταν. Ηέρευνα των συγγραφέων αξιολόγησε το ChatGPT , το Google Gemini και το πιο εστιασμένο στη αναφορά NotebookLM σε μια εργασία τύπου αναφοράς: χρησιμοποιώντας ένα σώμα 300 εγγράφων που επικεντρώνονται στη νομική και πολιτική του TikTok στις Ηνωμένες Πολιτείες. Οι ερευνητές διάφορα την συγκεκρικότητα της πρότασης και τον αριθμό των εγγράφων που παρέχονται, και στη συνέχεια ανέλυσαν τα αποτελέσματα χρησιμοποιώντας μια ταξινόμηση που σχεδιάστηκε για να καταγράψει τον τύπο και τη σοβαρότητα των ψευδαισθήσεων. Σε όλα τα αποτελέσματα, το 30% περιείχε τουλάχιστον μία ψευδαίσθηση, ενώ το ChatGPT και το Gemini έδειξαν ποσοστό ψευδαισθήσεων 40% – λίγο πάνω απότρεις φορές υψηλότερο από το ποσοστό λάθους του NotebookLM
13%. Αντί να εφευρίσκουν πραγματικότητες ή οντότητες, οι ερευνητές σημείωσαν ότι τα μοντέλα συχνά εμφάνιζαν ερμηνευτική υπερβολική , προσθέτοντας ακαδημαϊκές αξιολογήσεις και μετατρέποντας τις αναφερόμενες γνώμες σε γενικές
δηλώσεις: ‘Ποιοτικά, οι περισσότερες σφάλματα δεν αφορούσαν εφευρεμένες οντότητες ή αριθμούς· αντίθετα, παρατηρήσαμε ερμηνευτική υπερβολική–τα μοντέλα πρόσθεσαν ακαδημαϊκές αξιολογήσεις των πηγών και μετέτρεψαν
αναφερόμενες γνώμες σε γενικές δηλώσεις. ‘Αυτά τα πρότυπα αποκαλύπτουν μια θεμελιώδη επιστημολογική ανταπόκριση: ενώ ο τύπος απαιτεί ρητή αναφορά για κάθε αξίωση, τα LLMs παράγουν αυθεντικές
τις δηλώσεις ανεξάρτητααπό την εποπτεία. ‘Προτείνουμε επεκτάσεις του υπάρχοντος ταξινομικού συστήματος ψευδαισθήσεων αρχιτεκτονικές που επιβάλλουν ακριβή αναφορά αντί να βελτιστοποιούν τη ροή.’για τον τύπο και υποστηρίζουμε ότι αποτελεσματικά εργαλεία για τον τύπο χρειάζονται
Θεωρία και Μέθοδος
Η ακριβής αιτία των ψευδαισθήσεων αμφισβητείται σε διάφορες φορές· αν και σχεδόν όλες οι θεωρίες συμφωνούν ότιη
ποιότητα των δεδομένων και/ή οι διανομές είναι ένας συντελεστικός παράγοντας κατά την εκπαίδευση, έχει ακόμη
ουσιαστικά ψευδαίσθηση (εκτός από το γεγονός ότι κάποιες
προταθεί ότι το 100% της έξοδου του LLM είναι από αυτές τις ψευδαισθήσεις τυχαίνει να συμπίπτουν με την πραγματικότητα). Οι συγγραφείς παρατηρούν † : ‘Από τεχνική άποψη, οι οδηγεί ψευδαισθήσεις προκύπτουν από την ικανότητα των LLMs να παράγουν κείμενο που ακολουθεί κοινά πρότυπα χωρίς να έχουν κατανόηση του τι είναι αλήθεια. Αυτό το χαρακτηριστικό . σε πιθανές απαντήσεις που δεν ανταποκρίνονται στην πραγματικότητα – για παράδειγμα, LLM-εφευρεμένες νομικές περιπτώσεις που βρίσκονται στα χέρια των δικηγόρων
Tik Tok
Για να δούμε ποίες προσεγγίσεις θα μπορούσαν να είναι χρήσιμες για τους δημοσιογράφους, η μελέτη πραγματοποίησε αξιολογήσεις που σχεδιάστηκαν για να αντανακλούν τις πραγματικές ροές εργασίας και τα πρότυπα του τύπου, με ψευδαισθήσεις που εξετάστηκαν στο πλαίσιο τυπικών εργασιών αναφοράς. Τα μοντέλα των μοντέλων ώστεεξετάστηκαν χρησιμοποιώντας κοινές στρατηγικές πρότασης και ρύθμισης εγγράφων, να μετρηθεί η συχνότητα και ο τύπος των σφαλμάτων ψευδαισθήσεων – μαζί με αυτά που αυτά τα σφάλματα σημαίνουν για την ενσωμάτωση του AI στον τύπο.
Ανταγωνιστές
Τρία εργαλεία εξετάστηκαν, το καθένα από τα οποία αντανακλούσεμια διαφορετική προσέγγιση για την αναζήτηση εγγράφων: Το ChatGPT‑5 αξιολογήθηκε χρησιμοποιώντας τη λειτουργία Έργα, η οποία περιόρισε τις μεταφορτώσεις σε 100 έγγραφα.Το Google Gemini 2.5 Pro μπόρεσε να επεξεργαστεί το πλήρες σώμα 300 εγγράφων στο πλαίσιο (χρησιμοποιώντας το παράθυρο περιβάλλοντος 1 εκατομμυρίου token για να καταναλώσει trực tiếp 923.000 token)· το Google NotebookLM, το οποίο προσφέρει εσωτερική ανάκτηση αναφοράς, εξετάστηκε χρησιμοποιώντας αφιερωμένα σημειωματάρια για κάθε δείγμα.
Δεδομένα και Τεστ
Στο 12αρχικό τεστ για πρόβατα ψευδαισθήσεων ,

ψευδαίσθηση, με αξιοσημείωτη ποικιλία μεταξύ
βρέθηκαν να περιέχουν τουλάχιστον μια εργαλείων. Το ChatGPT
ψευδαισθήσεις στο 13% των περιπτώσεων:
και το Gemini παρήγαγαν ψευδαισθήσεις στο 40% των εξόδων τους, ενώ το NotebookLM παρήγαγε Από αυτά τα αποτελέσματα, οι συγγραφείς σχολιάζουν: ‘Αυτό δείχνει
σε όλα τα εργαλεία δεν
ότι, ενώ η πλειονότητα των απαντήσεων εργαλείουπεριέχουν ψευδαισθήσεις, η επιλογή του κάνει μια διαφορά για το ίδιο σώμα εγγράφων και σύνολο ερωτημάτων.’
Συμπέρασμα
Όποιος έχει πειραματιστεί με τα τρία μοντέλα που μελετήθηκαν στη νέα εργασία θα γνωρίζει ότι το καθένα έχει τα δυνατά και τα αδύνατα σημεία του. Ενώ το NotebookLM αποδίδει πολύ καλύτερα στην αναφορά από το ChatGPT ή το Gemini, θα μπορούσε κανείς να ισχυριστεί ότι δημιουργήθηκε ειδικά για αυτήν τη λειτουργικότητα και εξακολουθεί να προσφέρει ένα ποσοστό σφάλματος που θα έπρεπε να θέσει τους περισσότερους δημοσιογράφους, ερευνητές ή δικηγόρους εκτός εργασίας με επαναλαμβανόμενες υποθέσεις. Επιπλέον, το NotebookLM, το οποίο αυτοπροσδιορίζεται ως ερευνητικό πλαίσιο, δεν διαθέτει πολλές από τις βελτιώσεις UX που καθιστούν τα άλλα δύο πλαίσια μια ευκολότερη εμπειρία γραφής. Ωστόσο, τουλάχιστον το NotebookLM φαίνεται να διαβάζει πραγματικά τα μεταφορτωμένα έγγραφα αντί να πέφτει στην καταστροφική συνήθεια του ChatGPT να υποθέτει τι μπορεί να λέει ένα μεταφορτωμένο έγγραφο, με βάση αυτά που γνωρίζει για τη γενική κατανομή παρόμοιων εγγράφων. Μπορεί να είναι δύσκολο να κάνετε οποιαδήποτε έκδοση του ChatGPT να διαβάζει το πλήρες κείμενο ενημερωμένου υλικού, αντί να βασίζεται σε μεταδεδομένα ή στις δικές του υποθέσεις/ψευδαισθήσεις. Για τομείς όπου τα πρότυπα προέλευσης και παραπομπής είναι κρίσιμα, όπως το δίκαιο, η δημοσιογραφία και η επιστημονική έρευνα,φαίνεται ή MCP μην υπάρχουν εγκαταστάσεις στα τρέχοντα μοντέλα LLM που μπορούν να βελτιώσουν την περιορισμένη ικανότητά τους να εξάγουν και να αντιμετωπίσουν πληροφορίες που ο χρήστης τις κατευθύνει. φυσικά εκπαιδευμένα Όπως είναι τώρα, και αναμένοντας την άφιξη συστημάτων που μπορούν να προσφέρουν μια καλύτερη διεπαφή με τα LLMs από μια απλή πρόταση συστήματος ρύθμιση , όλα αυτά που αυτάτα συστήματα εξόδου για αυτά τα κρίσιμα τμήματα vẫn χρειάζονται έλεγχο από αυτούς τους δαπανηρούς, άβοητους και γενικά ενοχλητικούς ανθρώπους. * Η Google Cloud προσφέρει ένα αρκετά ενδιαφέρον και περίεργο ξεκαθάρισμα του θέματος εδώ . †Η
μετατροπή των εσωτερικών αναφορών των συγγραφέων σε υπερσύνδεσμους. Πρώτη δημοσίευση την
Τετάρτη, 1 Οκτωβρίου 2025. Τροποποιήθηκε την Πέμπτη 2 Οκτωβρίου για να διορθώσει λάθος στο TL:DR και να τροποποιήσει einen στυλιστικό λάθος στην πρώτη παράγραφο.












