Η γωνία του Anderson
Έ 即使 είναι Βασικά AI, τώρα μπορεί να γράψει ειδήσεις που περνούν ως ανθρώπινες

Νέα έρευνα δείχνει ότι ακόμη και μικρά τοπικά μοντέλα AI μπορούν τώρα να γράψουν ειδήσεις που οι άνθρωποι δεν μπορούν να διακρίνουν από την πραγματική δημοσιογραφία, αντιστοιχώντας στα κορυφαία συστήματα και αφήνοντας τους αναγνώστες να μην μπορούν να καταλάβουν ποιος έγραψε τι.
Σύμφωνα με μια νέα συνεργασία ερευνών μεταξύ Γερμανίας και Γαλλίας, οι άνθρωποι δεν μπορούν να καταλάβουν αν ένα άρθρο ειδήσεων γράφτηκε από AI ή από άνθρωπο – ακόμη και όταν γράφεται από ανοικτά μοντέλα που μπορούν να κατεβαστούν και να τρέξουν σε σχετικά μέτριας απόδοσης επιτραπέζιους υπολογιστές.
Σε μια άλλη ένδειξη ότι το μικρό AI είναι στην άνοδο, μια έρευνα 2.318 κρίσεων που συλλέχθηκαν από 1.054 συμμετέχοντες σε一个 ακαδημαϊκό πύλη μελέτης βρήκε ότι οι ανθρώπινοι αναγνώστες δεν μπορούσαν να αναγνωρίσουν την προέλευση ενός άρθρου σε υψηλότερο επίπεδο από το τυχαίο, ακόμη και όταν ήταν εξοδοί από σχετικά скромνά μοντέλα με τόσο λίγα όσο 7 δισεκατομμύρια παραμέτρους, συμπεριλαμβανομένων Mistral και Llama παραλλαγών:

Μέσες πηγές και αποδοτικότητα για LLMs που δοκιμάστηκαν. Τα 200 δισεκατομμύρια παραμέτρους του GPT-4o δεν υπερβαίνουν σημαντικά τις 7B παραμέτρους των μικρότερων μοντέλων. Αυτά που δοκιμάστηκαν για τη μελέτη ήταν Gemma 7B, Phi-3 Mini, LLaMA-2 13B, Mistral 7B, GPT-4o και GPT-3.5. Πηγή
Οι συγγραφείς επιστρέφουν σε ένα θέμα που εξέτασαν για πρώτη φορά στη έκδοση του 2024 Ευλογία ή κατάρα; Μια έρευνα για την Επίδραση της Γεννητικής AI στα Ψεύτικα Νέα. Τα ευρήματα είναι νέα αποτελέσματα από ένα μεγαλύτερο έργο που ανακοινώθηκε αρχικά τον Ιανουάριο και χρησιμοποιούν το δικό τους πλαίσιο JudgeGPT για συμμετοχική διαδικτυακή πύλη.
Ελαφρύς Ισχύς
Με τίτλο Μπορούν οι Άνθρωποι να Ξεχωρίσουν; Μια Διπλή Άξονας Μελέτη της Ανθρώπινης Αντίληψης των LLM-Γεννημένων Ειδήσεων, και προερχόμενη από τρεις ερευνητές σε τρία πανεπιστήμια της Γερμανίας και της Γαλλίας, η νέα μελέτη κάνει μια σημαντική διάκριση μεταξύ ‘ψευδών ειδήσεων’ και ‘ειδήσεων γραμμένων από AI’ (καθώς τα ψεύτικα νέα μπορούν να γραφούν από ανθρώπους ή από AI, και τα δύο είναι διαφορετικά):
‘Τα ανοικτά μοντέλα με τόσο λίγες όσο 7B παραμέτρους παράγουν κείμενο που αξιολογείται με τον ίδιο τρόπο με το GPT-4o, υποδεικνύοντας ότι η ικανότητα να παράγει ανθρώπινα-αδιάκριτα κείμενο δεν είναι πλέον περιορισμένη στα μοντέλα της πρώτης γραμμής.’
Μέθοδος
Για τους συμμετέχοντες που ασχολήθηκαν με το πλαίσιο JudgeGPT, κάθε θραύσμα ειδήσεων αξιολογήθηκε χρησιμοποιώντας ένα διπλό άξονα πλαίσιο στο οποίο παρείχαν τρεις ανεξάρτητες αξιολογήσεις σε συνεχείς 0-100 διακόπτες:

Η διεπαφή του πύργου JudgeGPT, όπου οι κριτές αξιολογούν υλικό σε πηγή, αυθεντικότητα και οικειότητα θέματος. Παρακαλώ ανατρέξτε στην πηγή του εγγράφου για καλύτερη ανάλυση.
Κρίση πηγής κατέγραψε αν μια περίοδος φαινόταν γραμμένη από μηχανή ή από άνθρωπο· κρίση αυθεντικότητας, αν θεωρήθηκε ψεύτικη ή γνήσια· και οικειότητα θέματος, πόσο καλά γνώριζε ο αναγνώστης το θέμα.
Δοκιμές
Οι δοκιμές διαιρούνται σε πέντε τύπους ευρημάτων: διάκριση मशινών-γεννημένων κειμένων από ανθρώπινων γραπτών κειμένων· σύγκριση ανίχνευσης μεταξύ διαφορετικών LLMs· εξέταση της επίδρασης της εξειδίκευσης τομέα έναντι της πολιτικής προσανατολισμού στην ακρίβεια· αναγνώριση διακριτών στρατηγικών ανταπόκρισης μεταξύ συμμετεχόντων· και παρακολούθηση της αλλαγής της ακρίβειας κατά τη διάρκεια επαναλαμβανόμενων αξιολογήσεων, λόγω κοπώσεως:
Η δοκιμή έδειξε keine σημαντική διαφορά στην πηγή των βαθμολογιών μεταξύ των συνθηκών, υποδεικνύοντας ότι οι συμμετέχοντες δεν μπορούν να διακρίνουν AI-γεννημένα κείμενα από ανθρώπινα γραπτά:
Συμπέρασμα
Το ανησυχητικό μέρος αυτής της μελέτης είναι το περιβάλλον δίκτυο έργων και ερευνών που οι συγγραφείς – ή κάποιοι από τους συγγραφείς, ανάλογα με το έργο – έχουν δημιουργήσει ή έχουν συμμετάσχει· και θα ήταν σίγουρα ενδιαφέρον να μελετήσουμε δείγματα AI και ανθρώπινων γραπτών κειμένων που παρήγαγαν αυτά τα αποτελέσματα, για να καταλάβουμε καλύτερα το είδος της εξόδου που παράγει η περιγραφόμενη μεθοδολογία.
Σύμφωνα με την ιστοσελίδα canirun.ai, το Mistral 7B (το οποίο ήταν περίπου στο ίδιο επίπεδο με το ChatGPT-4o στις δοκιμές) ‘τρέχει καλά’ σε μια NVIDIA RTX 3080 με 16GB VRAM και τρέπει ‘καλά’ σε μια 3060 με 6GB VRAM –几乎 δεν είναι τα τελευταία ή τα καλύτερα γραφικά καρτέλα σε λειτουργία*. Όποιος θέλει να δημιουργήσει τη δική του μεθοδολογία για υποβολή δειγμάτων μπορεί να συμμετάσχει σε αυτά τα πειράματα επίσης.
* Το Gemma 7B δεν είναι καταχωρημένο στην ιστοσελίδα.
Πρώτη δημοσίευση Πέμπτη, 9 Απριλίου 2026












