Η γωνία του Anderson
Η Γλώσσα που Γεννιέται από τους Αλγορίθμους Αρχίζει να Μολύνει τη Επιστημονική Λογοτεχνία

Ερευνητές από τη Γαλλία και τη Ρωσία έχουν δημοσιεύσει μια μελέτη που υποδεικνύει ότι η χρήση αλγοριθμικών γεννητριών κειμένου με βάση την πιθανότητα, όπως το GPT-3, εισάγει ” basané γλώσσα”, παραπομπές σε μη υπαρκτά βιβλιογραφικά δεδομένα και ανεπίσημη, μη πιστωμένη επαναχρησιμοποίηση εικόνων σε προηγουμένως σεβαστές διευθύνσεις για τη δημοσίευση νέων επιστημονικών βιβλιογραφικών δεδομένων.
Πιθανότατα το πιο ανησυχητικό είναι ότι τα έγγραφα που μελετήθηκαν περιέχουν επιστημονικά ανακριβή ή μη αναπαραγώγιμα περιεχόμενα, παρουσιάζονται ως αποτέλεσμα αντικειμενικής και συστηματικής έρευνας, υποδεικνύοντας ότι τα μοντέλα γεννήτριας γλώσσας χρησιμοποιούνται όχι μόνο για να ενισχύσουν τις περιορισμένες γλωσσικές ικανότητες των συγγραφέων, αλλά και για να κάνουν τη δυσκολή δουλειά που εμπλέκει (και, αναπόφευκτα, να το κάνουν κακώς).
Η αναφορά, με τίτλο Τορτούρες φράσεων: Μια αμφίβολη γραπτή스타ση που εμφανίζεται στη επιστήμη, έχει συγγραφεί από ερευνητές από το Τμήμα Επιστήμης Υπολογιστών του Πανεπιστημίου του Τολουλού και τον ερευνητή Alexander Magazinov, που βρίσκεται σήμερα στο Πανεπιστήμιο του Τελ Αβίβ.
Η μελέτη επικεντρώνεται ιδιαίτερα στην αύξηση των ανοησίων επιστημονικών δημοσιεύσεων στο περιοδικό Elsevier Μικροεπεξεργαστές και Μικροσυστήματα.
Με Κάθε Άλλο Όνομα
Τα αυτοπαραγωγικά μοντέλα γλώσσας όπως το GPT-3 εκπαιδεύονται σε μεγάλους όγκους δεδομένων και σχεδιάζονται για να παραφράζουν, να συνθέτουν, να συλλέγουν και να ερμηνεύουν τα δεδομένα αυτά σε συνεκτικά μοντέλα γεννήτριας γλώσσας που μπορούν να αναπαράγουν φυσικά μοτίβα ομιλίας και γραπτής γλώσσας, διατηρώντας την αρχική πρόθεση των δεδομένων εκπαίδευσης.
Καθώς τέτοιες δομές τιμωρούνται συχνά στη φάση εκπαίδευσης του μοντέλου για την προσφορά άμεσης και “μη απορροφημένης” αναπαραγωγής των αρχικών δεδομένων, αναζητούν αναπόφευκτα συνώνυμα – ακόμη και για καλά καθορισμένες φράσεις.
Οι φαινομενικά δημιουργημένες/βοηθούμενες επιστημονικές υποβολές που ανακαλύφθηκαν από τους ερευνητές περιλαμβάνουν ένα εξαιρετικό αριθμό αποτυχημένων προσπαθειών για δημιουργικές συνώνυμα για γνωστές φράσεις στον τομέα της μηχανικής μάθησης:
Βαθύ Νευρωνικό Δίκτυο: Βαθύ Νευρωνικό Οργανισμό
Τεχνητό Νευρωνικό Δίκτυο: (Ψευδές | Counterfeit) Νευρωνικό Οργανισμό
Κινητό Δίκτυο: Εύκαμπτο Οργανισμό
Επίθεση Δικτύου: Οργανισμό (Επίθεση | Επίθεση)
Σύνδεση Δικτύου: Σύνδεση Οργανισμού
Μεγάλα Δεδομένα: (Τεράστια | Μεγάλα | Άπειρα | Κολοσσιαία) Πληροφορίες
Αποθήκη Δεδομένων: Πληροφορίες (Αποθήκη | Κέντρο Διανομής)
Τεχνητή Νοημοσύνη (AI): (Ψευδής | Ανθρωπογενής) Συνείδηση
Υψηλή Απόδοση Υπολογισμών: Ελίτ Υπολογισμοί
Υπολογισμοί Σύννεφου/Ομίχλης: Υπολογισμοί Ομίχλης
Επεξεργαστής Γραφικών (GPU): Μονάδα Προετοιμασίας Σχεδίων
Κεντρικός Επεξεργαστής (CPU): Κεντρική Μονάδα Προετοιμασίας
Μηχανή Ροής Εργασιών: Μηχανή Διαδικασίας Εργασιών
Αναγνώριση Προσώπου: Αναγνώριση Προσώπου
Αναγνώριση Φωνής: Αναγνώριση Λόγου
Μέσος Τετραγωνικός Σφάλμα: Μέσος Τετραγωνικός (Λάθος | Λάθος)
Μέσος Απόλυτο Σφάλμα: Μέσος (Απόλυτος | Υπέρτατος) (Λάθος | Λάθος)
Σήμα προς Θόρυβο: (Κίνηση | Σημαία | Δείκτης | Σημάδι | Σήμα) προς (Θόρυβο | Αναταραχή | Θόρυβος)
Παγκόσμιες Παραμέτρους: Παγκόσμιες Παραμέτρους
Τυχαία Πρόσβαση: (Τυχαία | Αναियमβάτου) Δικαίωμα Πρόσβασης
Τυχαία Δάσος: (Τυχαία | Αναियमβάτου) (Δάσος | Ξυλώδες Έδαφος | Λιβαδικό Έδαφος)
Τυχαία Τιμή: (Τυχαία | Αναियमβάτου) Τιμή
Κολόνη Μυρμήγκων: Υπόγειο Έντομο (Κράτος | Επαρχία | Περιοχή | Περιοχή | Οικισμός)
Κολόνη Μυρμήγκων: Υπόγειο Σαρανταποδαρικό (Κράτος | Επαρχία | Περιοχή | Περιοχή | Οικισμός)
Υπόλοιπη Ενέργεια: Υπόλοιπη Ζωτικότητα
Κινητική Ενέργεια: Κινητική Ζωτικότητα
Απλό Bayes: (Πιστός | Αθώος | Ευπιστός) Bayes
Προσωπικός Ψηφιακός Βοηθός (PDA): Ατομικός Υπολογιστής Βοηθός
Τον Μάιο του 2021, οι ερευνητές αναζήτησαν τον ακαδημαϊκό μηχανή αναζήτησης Dimensions, αναζητώντας αυτό το είδος διαστρεβλωμένης, αυτοματοποιημένης γλώσσας, φροντίζοντας να εξαιρεθούν έγκυρες φράσεις όπως “μεγάλη πληροφορία” (η οποία είναι μια έγκυρη φράση και όχι μια αποτυχημένη συνώνυμη για “μεγάλα δεδομένα”). Σε αυτό το σημείο, παρατήρησαν ότι το περιοδικό Μικροεπεξεργαστές και Μικροσυστήματα είχε τον υψηλότερο αριθμό περιπτώσεων κακοδιατυπωμένης παραφράσεως.
Σήμερα, είναι ακόμη δυνατό να ανακτηθεί (αρχείο σναπσότ, 15/07/2021) một αριθμό επιστημονικών εγγράφων για την ανοησία φράση “βαθύς νευρωνικός οργανισμός” (δηλ. “βαθύ νευρωνικό δίκτυο”), και άλλα στην παραπάνω λίστα δίνουν παρόμοια εύρεση.

Αποτελέσματα αναζήτησης για ‘βαθύ νευρωνικό οργανισμό’ (‘βαθύ νευρωνικό δίκτυο’) στο Dimensions. Πηγή: https://app.dimensions.ai/
Το περιοδικό Μικροεπεξεργαστές ιδρύθηκε το 1976 και μετονομάστηκε σε Μικροεπεξεργαστές και Μικροσυστήματα δύο χρόνια αργότερα.
Μια Αύξηση της Ανοησίας Γλώσσας
Οι ερευνητές μελέτησαν μια περίοδο που καλύπτει τον Φεβρουάριο του 2018 έως τον Ιούνιο του 2021 και παρατήρησαν μια απότομη αύξηση του όγκου των υποβολών τα τελευταία δύο χρόνια, και ιδιαίτερα τα τελευταία 6-8 μήνες:

Συσχέτιση ή αιτία; Η αύξηση των υποβολών στο περιοδικό Μικροεπεξεργαστές και Μικροσυστήματα φαίνεται να συμπίπτει με την αύξηση της ‘ανοησίας’ κειμένου και συνωνύμων σε φαινομενικά σεβαστές υποβολές. Πηγή: https://arxiv.org/pdf/2107.06751.pdf
Η τελική βάση δεδομένων που συλλέχθηκε από τους συνεργάτες περιλαμβάνει 1.078 πλήρους μήκους άρθρα που λήφθηκαν μέσω της συνδρομής του Πανεπιστημίου του Τολουλού στο Elsevier.
Μειούμενη Επεξεργασία για τα Κινεζικά Επιστημονικά Έγγραφα
Η μελέτη παρατηρεί ότι ο χρόνος που διατίθεται για την αξιολόγηση των υποβολών που σημειώθηκαν γίνεται δραματικά μικρότερος το 2021, πέφτοντας κάτω από 40 ημέρες. Μια εξαπλάσια μείωση του τυπικού χρόνου για την αξιολόγηση από ομότιμους, που είναι εμφανής από τον Φεβρουάριο του 2021.
Ο μεγαλύτερος αριθμός σημειωμένων εγγράφων προέρχεται από συγγραφείς με συσχετίσεις με την ηπειρωτική Κίνα: από 404 έγγραφα που αποκτήθηκαν σε λιγότερο από 30 ημέρες, το 97,5% είναι συσχετισμένα με την Κίνα. Αντίθετα, στις περιπτώσεις όπου η διαδικασία επεξεργασίας υπερέβη τις 40 ημέρες (615 έγγραφα), οι υποβολές της Κίνας αντιπροσώπευαν μόνο το 9,5% αυτής της κατηγορίας – μια δεκαπλάσια ανισορροπία.
Η αναφορά αποδίδει την εισβολή των σημειωμένων εγγράφων σε ελαττώματα της διαδικασίας επεξεργασίας και μια πιθανή έλλειψη πόρων μπροστά σε μια αυξανόμενη Zahl των υποβολών.
Οι ερευνητές υποθέτουν ότι τα μοντέλα γεννήτριας γλώσσας GPT-стиλ και παρόμοιου τύπου έχουν χρησιμοποιηθεί για την παραγωγή μεγάλου μέρους του κειμένου των σημειωμένων εγγράφων. Ωστόσο, ο τρόπος με τον οποίο ένα γεννητικό μοντέλο απομακρύνει τις πηγές του κάνει αυτό το γεγονός δύσκολο να αποδειχθεί, και η κύρια απόδειξη βρίσκεται σε μια συνετή αξιολόγηση των κακών και ανεπιθύμητων συνωνύμων και μια προσεκτική εξέταση της λογικής συνοχής της υποβολής.
Οι ερευνητές παρατηρούν επίσης ότι τα μοντέλα γεννήτριας γλώσσας που πιστεύουν ότι συμβάλλουν σε αυτήν την πλημμύρα ανοησίας είναι ικανά όχι μόνο να δημιουργούν τα προβληματικά κείμενα, αλλά και να αναγνωρίζουν και να σημειώνουν συστηματικά, με τον ίδιο τρόπο που οι ερευνητές έχουν κάνει χειροκίνητα. Το έργο περιλαμβάνει μια τέτοια εφαρμογή, χρησιμοποιώντας το GPT-2, και προσφέρει ένα πλαίσιο για μελλοντικά συστήματα για την ταυτοποίηση προβληματικών επιστημονικών υποβολών.
Η συχνότητα των “μολυσμένων” υποβολών είναι πολύ υψηλότερη στο περιοδικό Elsevier (72,1%) σε σύγκριση με άλλα περιοδικά που μελετήθηκαν (13,6% το μέγιστο).
Όχι Μόνο Σεμαντική
Οι ερευνητές τονίζουν ότι πολλά από τα περιοδικά που εξετάζονται δεν χρησιμοποιούν απλώς την λανθασμένη γλώσσα, αλλά περιέχουν επιστημονικά ανακριβείς δηλώσεις, υποδεικνύοντας την πιθανότητα ότι τα μοντέλα γεννήτριας γλώσσας δεν χρησιμοποιούνται μόνο για να βελτιώσουν τις περιορισμένες γλωσσικές ικανότητες των συντελεστών, αλλά μπορεί να χρησιμοποιούνται για να διατυπώσουν τουλάχιστον κάποια από τις βασικές θεωρίες και τα δεδομένα στο έγγραφο.
Σε άλλες περιπτώσεις, οι ερευνητές υποθέτουν μια αποτελεσματική “ανασύνθεση” ή “περιστροφή” της αφηρημένης (και ανώτερης) προηγούμενης εργασίας, για να ικανοποιήσουν τις πιέσεις της ακαδημαϊκής έρευνας “δημοσίευσε ή πεθάνεις”, και πιθανώς για να βελτιώσουν τις εθνικές κατατάξεις για την παγκόσμια υπεροχή στην έρευνα της τεχνητής νοημοσύνης, μέσω της纯ής ποσότητας.

Ανοητό περιεχόμενο σε μια υποβεβλημένη εργασία. Σε αυτή την περίπτωση, οι ερευνητές βρήκαν ότι το κείμενο έχει παραχθεί, ad hoc, από ένα άρθρο του EDN, από όπου και η συνοδευτική εικόνα π pilfered χωρίς αναφορά. Η αναγραφή του πρωτοτύπου περιεχομένου είναι τόσο ακραία που το καθιστά ανούσιο.
Αναλύοντας πολλά από τα υποβεβλημένα έγγραφα του Elsevier, οι ερευνητές βρήκαν προτάσεις για τις οποίες δεν μπόρεσαν να συναγάγουν κανένα νόημα. παραπομπές σε μη υπαρκτά βιβλιογραφικά δεδομένα. παραπομπές σε μεταβλητές και θεωρήματα σε τύποι που δεν εμφανίζονται στην υποστηρικτική ύλη (υποδεικνύοντας γλωσσική αφαίρεση ή “hallucination” φαινομενικά πραγματικών δεδομένων). και αναπαραγωγή εικόνων χωρίς αναγνώριση των πηγών τους (η οποία οι ερευνητές κριτικάρουν όχι από την πλευρά του πνευματικών δικαιωμάτων, αλλά ως δείκτη ανεπαρκούς επιστημονικής σχολαστικότητας).
Αποτυχίες Παραπομπών
Οι παραπομπές που προορίζονται για την υποστήριξη των επιχειρημάτων σε ένα επιστημονικό έγγραφο βρέθηκαν σε πολλά από τα σημειωμένα παραδείγματα να είναι “είτε σπασμένα ή οδηγούν σε μη σχετικές δημοσιεύσεις”.
Επιπλέον, οι παραπομπές σε “σχετική εργασία” φαίνεται να περιλαμβάνουν συχνά συγγραφείς που οι ερευνητές πιστεύουν ότι έχουν “hallucinated” από ένα σύστημα GPT-стиλ.
Πλανημένη Προσοχή
Μια άλλη ελαττώματα ακόμη και των πιο προηγμένων μοντέλων γλώσσας όπως το GPT-3 είναι η τάση τους να χάνουν την εστίαση σε μια μακρά ομιλία. Οι ερευνητές βρήκαν ότι τα σημειωμένα έγγραφα συχνά αναφέρουν ένα θέμα στο αρχικό μέρος του εγγράφου, το οποίο δεν επαναλαμβάνεται ποτέ μετά την αρχική του αναφορά σε προκαταρκτικές σημειώσεις ή αλλού.
Υποθέτουν επίσης ότι κάποια από τα χειρότερα παραδείγματα συμβαίνουν μέσω πολλαπλών διαδρομών του κειμένου πηγής μέσω μιας σειράς μηχανισμών μετάφρασης, κάθε ένας από τους οποίους διαστρεβλώνει το νόημα περαιτέρω.
Πηγές και Λόγοι
Σε μια προσπάθεια να κατανοήσουν τι βρίσκεται πίσω από αυτό το φαινόμενο, οι συγγραφείς της μελέτης προτείνουν μια σειρά από πιθανότητες: ότι περιεχόμενο από “χαρτοποιίες” χρησιμοποιείται ως υλικό πηγής, εισάγοντας ανακρίβειες πολύ νωρίς σε μια διαδικασία που θα οδηγήσει αναπόφευκτα σε περαιτέρω ανακρίβειες. ότι εργαλεία spinning άρθρων όπως το Spinbot χρησιμοποιούνται για να.mask την πλαγία. και ότι η υπερβολική πίεση για τακτική δημοσίευση οδηγεί τους υποεξοπλισμένους ερευνητές να χρησιμοποιούν συστήματα GPT-3-стиλ για να αυξήσουν ή να δημιουργήσουν entirely νέα ακαδημαϊκά έγγραφα.
Οι ερευνητές κλείνουν με ένα κάλεσμα για δράση για μεγαλύτερη εποπτεία και βελτιωμένα πρότυπα σε ένα τομέα της ακαδημαϊκής δημοσίευσης που φαίνεται να γίνεται, φαινομενικά, τροφή για το δικό του αντικείμενο – συστήματα μηχανικής μάθησης. họ cũng adjure Elsevier και άλλους εκδότες να εισαγάγουν πιο αυστηρές διαδικασίες ελέγχου και αναθεώρησης, και ευρέως κριτικάρουν τα τρέχοντα πρότυπα και τις πρακτικές σε αυτήν τη σχέση, υποδεικνύοντας ότι “η απάτη με συνθετικά κείμενα απειλεί την ακεραιότητα της επιστημονικής βιβλιογραφίας”.












