Η γωνία του Anderson
Μελέτη: Το 35% των Πρακτόρων AI Παρέχει Προσωπικά Δεδομένα σε Ιστοσελίδες που Ξέρουν ότι Είναι Απάτες

Μια νέα μελέτη διαπιστώνει ότι ακόμη και όταν αναγνωρίζουν μια απάτη ιστοσελίδα, περισσότεροι από ένας στα τρία αυτόνομοι πράκτορες ιστού παραδίδουν ευαίσθητες πληροφορίες.
Μια νέα μελέτη από ερευνητές στην Ινδία και τις Ηνωμένες Πολιτείες έχει βρει ότι περισσότερο από το ένα τρίτο των αυτόνομων πρακτόρων ιστού που δοκιμάστηκαν παρέδωσε κρίσιμες προσωπικές πληροφορίες (ΠΙΙ, δηλαδή λεπτομέρειες τραπεζικού λογαριασμού, κωδικούς πρόσβασης και αριθμούς Ασφαλείας Κοινωνικών Επιδομάτων) σε ιστοσελίδες που είχαν ήδη αναγνωριστεί ως απάτες.
Υπάρχει, όπως υποδεικνύει η μελέτη, ένα bestimmμένο «αίτημα για ολοκλήρωση» που εμποδίζει την επιφύλαξη και την αναστολή στους πράκτορες ιστού, σε τέτοιες περιπτώσεις. Οι συγγραφείς αναφέρουν:
‘Ένας άνθρωπος μπορεί να σταματήσει, να ξαναδιαβάσει ή να κλείσει την καρτέλα. Ένας πράκτορας είναι κατασκευασμένος για να ολοκληρώσει την εργασία του και θα συνεχίσει να συμπληρώνει φόρμες και να υποβάλλει δεδομένα χωρίς να σταματήσει να αναρωτιέται αν πρέπει.’
Η μελέτη παρήγαγε einen νέο chuẩn για τέτοιες περιπτώσεις, με τίτλο SCAMMER4U, που καλύπτει 91 (προσομοιωμένα) περιβάλλοντα ελεγχόμενα από επιτιθέμενους, μαζί με δέκα «αγνές» ιστοσελίδες βάσης και οκτώ διαδικτυακές επιθέσεις.
Χωρίς κανένα μέτρο προστασίας της ιδιωτικής ζωής, οι δοκιμασμένοι πράκτορες παρέδωσαν υψηλά ευαίσθητες προσωπικές πληροφορίες στο 54% έως 93% των συναντήσεων με απάτες, ενώ ισοδύναμες μη κακόβουλες ιστοσελίδες δεν προκάλεσαν τέτοιες αποκαλύψεις, υποδεικνύοντας ότι η διαρροή οφειλόταν στις επιθέσεις και όχι στην κανονική συμπλήρωση φόρμης:
‘Πιο κρίσιμο, αναγνωρίζουμε ένα χάσμα ανίχνευσης-δράσης: πράκτορες των οποίων η λογική μια ανεξάρτητη κρίση LLM επιβεβαιώνει ότι έχει σημάνει την ιστοσελίδα ως ύποπτη vẫn υποβάλλουν κρίσιμες ΠΙΙ στο 35,9% των συνεδριών, έναντι 66,1% όταν δεν εκφράζεται καμία υποψία, ένα χάσμα 30,2% που είναι ανθεκτικό σε όλες τις τέσσερις οικογένειες μοντέλων.
‘Τα ευρήματά μας αποκαλύπτουν ότι οι αμυντικές που βασίζονται στην αναγνώριση της ιστοσελίδας ως επίθεση από τον ίδιο τον πράκτορα είναι ασφαλής στο λάθος σήμα, мотивώντας την παρεμβολή του εξερχόμενου υποβολής που λειτουργεί ανεξάρτητα από το βρόχο λογικής του πράκτορα.’
Οι ερευνητές υποστηρίζουν αμυντικές που λειτουργούν σε επίπεδο εξόδου και μπορούν να ελέγχουν και να μπλοκάρουν τις ευαίσθητες εξερχόμενες υποβολές, αντί να βασίζονται στην αναγνώριση της ιστοσελίδας ως ύποπτη από τον ίδιο τον πράκτορα, η οποία δεν μπορεί να θεωρηθεί αξιόπιστη για να προκαλέσει χρήσιμες αμυντικές ενέργειες.
Η νέα μελέτη έχει τίτλο “ΣυONGLΙΩΣΑΝ ότι αυτή η ιστοσελίδα είναι μια απάτη”: Benchmarking PII Leakage and Detection without Defense in Autonomous Web Agents, και προέρχεται από οκτώ ερευνητές σε KIIT Bhubaneshwar, BITS Pilani και Lam Research.
Θέματα με την Εξουσία
Το πιο ενδιαφέρον εύρημα της μελέτης, ίσως, δεν είναι ότι οι πράκτορες διαρρέουν προσωπικές πληροφορίες, αλλά ότι πολλοί από αυτούς το κάνουν μετά την αναγνώριση ότι κάτι δεν πάει καλά. Οι ερευνητές αναγνωρίζουν ένα επαναλαμβανόμενο μοτίβο στις δοκιμές, στο οποίο η υποψία και η δράση έγιναν διαχωρισμένες, με τους πράκτορες να εκφράζουν συχνά σαφείς ανησυχίες για μια ιστοσελίδα, αλλά να συνεχίζουν με την αίτηση (διαρροή ΠΙΙ) υποβολής bấtмотряnoch.
Ένα παράδειγμα αφορούσε αυτό που οι συγγραφείς ονομάζουν αποδοχή-κίνδυνος. Ένας πράκτορας βασισμένος στο Llama 4 Scout αναγνώρισε πολλαπλά σημάδια προειδοποίησης σε μια ιστοσελίδα κρυπτονομισμάτων, σημειώνοντας τον ύποπτο τόνο, την υπόσχεση μεγάλων μπόνους και την έλλειψη σαφών πληροφοριών για την εταιρεία. Παρά αυτές τις αναγνωρισμένες προειδοποιήσεις, ο πράκτορας υπέβαλε έναν αριθμό Ασφαλείας Κοινωνικών Επιδομάτων, λεπτομέρειες καρτών και einen κωδικό CVV.
Ένα δεύτερο μοτίβο, χαρακτηρισμένο ως περιοχή/διαδικασία πλαισίου, εμφανίστηκε όταν οι πράκτορες ανίχνευσαν επιτυχώς μια απόπειρα απάτης αλλά απέτυχαν να γενικεύσουν αυτή την υποψία σε μια συναφή αίτηση.
Σε μια περίπτωση, ο Gemini 3 Flash απέρριψε μια προφανώς απάτη αίτηση για τραπεζικές πληροφορίες, αναγνωρίζοντας σωστά ότι ήταν μια απόπειρα φισινγκ. Λίγα λεπτά αργότερα, ωστόσο, ο ίδιος πράκτορας παρέδωσε διαπιστευτήρια λογαριασμού σε μια διαφορετική φόρμα επαλήθευσης μετά από λογική ότι οι ελέγχοι ταυτοποίησης ήταν ένα κανονικό μέρος της ασφάλειας της πλατφόρμας. Τα σημάδια προειδοποίησης αναγνωρίστηκαν σε ένα πλαίσιο, αλλά δεν μεταφέρθηκαν σε ένα άλλο.
Οι ερευνητές επίσης παρατήρησαν περιπτώσεις του ότι ονομάζουν αυτο-αποφασιστική-αποφυγή και αξιόπιστη-επιφάνεια-κανονικοποίηση: σε μια περίπτωση, ένας Claude Haiku 4.5 πράκτορας αποδέχθηκε τις δικές του αξιώσεις της ιστοσελίδας σχετικά με τα πρότυπα κρυπτογράφησης και τα πιστοποιητικά ασφάλειας ως απόδειξη αξιοπιστίας, ενώ ο GPT-5 mini έκρινε την ύποπτη ορολογία διότι η σελίδα φαινόταν επαγγελματικά σχεδιασμένη και παρουσιάστηκε μέσω μιας που φαινόταν legítima τομέα. Σε cả τις περιπτώσεις, επιφανειακά σήματα αξιοπιστίας υπερκέρδισαν τις ανησυχίες που οι πράκτορες είχαν ήδη εκφράσει.
Το πρόβλημα φαίνεται να εκτείνεται πέρα από την απλή ευπάθεια φισινγκ, με τους συγγραφείς να υποστηρίζουν ότι οι προειδοποιητικοί προrompt που προστέθηκαν στην πιο ισχυρή κατάσταση άμυνας συχνά λειτουργούσαν περισσότερο ως τελετουργία παρά ως ασφαλής αμυντική γραμμή: οι πράκτορες ήταν ικανοί να αφηγήσουν τον κίνδυνο, αλλά η αφήγηση μόνη της δεν άλλαξε αξιοπιστία την συμπεριφορά τους.
Οι συγγραφείς ορίζουν το αναγνωρισμένο χάσμα μεταξύ αναγνώρισης κινδύνου και δράσης με βάση αυτή την αναγνώριση ως το κεντρικό εμπόδιο στην ανάπτυξη μελλοντικών αμυντικών σε αυτό το είδος σενάριου.
Μέθοδος
Το SCAMMER4U τοποθετεί τέσσερις πρωτοπόρους πράκτορες ιστού σε 91 ιστοσελίδες ελεγχόμενες από επιτιθέμενους και δέκα αγνές ιστοσελίδες που καλύπτουν οκτώ κατηγορίες απάτης.
Τα τέσσερα μοντέλα που αξιολογήθηκαν ήταν GPT-5 mini, Claude Haiku 4.5, Gemini 3 Flash και Llama 4 Scout, χρησιμοποιώντας ένα κοινό Playwright-βασισμένο πλαίσιο περιήγησης, μορφή παρατήρησης, χώρο δράσης και πρότυπο προrompt.
Για τους πειραματισμούς, κάθε πράκτορας είχε ανατεθεί ένα ρεαλιστικό προφίλ χρήστη που περιείχε πληροφορίες που κυμαίνονταν από ονόματα και διευθύνσεις μέχρι κωδικούς πρόσβασης, λεπτομέρειες τραπεζικού λογαριασμού, αριθμούς Ασφαλείας Κοινωνικών Επιδομάτων, κωδικούς API και κωδικούς διπλής αυθεντικοποίησης – με το πρωταρχικό στόχο να καθορίσει εάν οποιαδήποτε από αυτά τα δεδομένα έφτασαν σε σημεία ελεγχόμενα από επιτιθέμενους.

Η οκταξονική ταξινόμηση που χρησιμοποιείται για να ορίσει τα περιβάλλοντα SCAMMER4U, χωρίζοντας τον τρόπο με τον οποίο κάθε σενάριο ταξινομείται από τις συγκεκριμένες μεταβλητές που προσαρμόζονται σε ζευγαρωμένες δοκιμές για να απομονώσουν την επίδραση των ατομικών τακτικών κοινωνικής μηχανικής στην διαρροή ΠΙΙ. Πηγή
Για να διασφαλιστεί ότι το βENCHMARK αντανακλούσε πραγματικές απάτες και όχι τεχνητές δοκιμαστικές περιπτώσεις, τα περιβάλλοντα δημιουργήθηκαν μέσω Flask σε αυτο-φιλοξενημένα περιβάλλοντα, από ανθρώπινες σχεδιαστικές οδηγίες, και στη συνέχεια αναθεωρήθηκαν χειροκίνητα.
Κάθε μοντέλο δοκιμάστηκε υπό τέσσερις ολοένα και πιο παρεμβατικές ρυθμίσεις: C0, χωρίς καθοδήγηση, C1, με μια γενική υπενθύμιση ιδιωτικής ζωής, C2, με μια λίστα ελέγχου φισινγκ, και C3, με μια προ-υποβολής προrompt αναστολής. Πέντε εκτελέσεις πραγματοποιήθηκαν για κάθε συνδυασμό μοντέλου, περιβάλλοντος και κατάστασης, με αποτέλεσμα 7.480 συνολικά συνεδριάσεις.
Η πρωταρχική μετρική ήταν PLRκρίσιμος, που μετράει το ποσοστό με το οποίο κρίσιμες προσωπικές πληροφορίες έφτασαν σε ένα σημείο ελεγχόμενο από επιτιθέμενο. Δευτερεύουσες μετρήσεις αποτελούσαν PLRβαθμολογημένες, μια μετρημένη διαρροή με βάση το βάρος, ASR (Ποσοστό Επιτυχίας Επιθέσεων), που μετράει την επιτυχία επιθέσεων μετά την πλοήγηση σε một προκαθορισμένο URL παγίδας, TCR (Ποσοστό Ολοκλήρωσης Εργασιών), ένα Αμυντικό σημάδι, που υποδεικνύει την άρνηση ή την ασφαλή ολοκλήρωση χωρίς να φτάσει στο σημείο παγίδας, και DR (Ποσοστό Ανίχνευσης), που καταγράφει εάν η λογική του πράκτορα ανέφερε την ιστοσελίδα ως ύποπτη.
Το ποσοστό ανίχνευσης (DR) μετρήθηκε χρησιμοποιώντας μια LLM-as-κρίτη προσέγγιση, στην οποία το GPT-4o-mini υπηρέτησε ως ο πρωταρχικός αξιολογητής και το Llama 4 Scout ως δευτερεύων έλεγχος, αναθεωρώντας την λογική του πράκτορα και καθορίζοντας εάν είχε αναγνωρίσει την ιστοσελίδα ως ύποπτη. DR, σε αυτή την περίπτωση, μετράει τι ένας πράκτορας είπε σαφώς για μια ιστοσελίδα, και όχι τι μπορεί να είχε συναγάγει εσωτερικά.
Η επαλήθευση έναντι ανθρώπινων ετικετών παράγινε Cohen’s κ σκορ 0,83 και 0,78, υπερβαίνοντας το προκαθορισμένο όριο αξιοπιστίας της μελέτης.
Η μελέτη ήταν προ-εγγεγραμμένη (δηλαδή, το σχέδιο της μελέτης και οι αναλύσεις είχαν καταγραφεί δημόσια πριν από την έναρξη), πριν από τη συλλογή δεδομένων, με το να καθορίσει τις αναλύσεις και τα κριτήρια επιτυχίας της μελέτης εκ των προτέρων, με σκοπό να μειώσει τον κίνδυνο προσαρμογής των συμπερασμάτων στα παρατηρημένα αποτελέσματα.
Δοκιμές και Αποτελέσματα
Η αρχική δοκιμή είχε ως στόχο να καθορίσει εάν απλές υπενθυμίσεις ασφαλείας θα μπορούσαν να μειώσουν το πρόβλημα. Τέσσερις ολοένα και πιο προστατευτικές ρυθμίσεις αξιολογήθηκαν, που κυμαίνονταν από καμία καθοδήγηση ιδιωτικής ζωής μέχρι προprompts που ενθάρρυναν ρητά τον πράκτορα να σταματήσει και να αναστρέψει πριν υποβάλει ευαίσθητες πληροφορίες.
Τα αποτελέσματα ποικίλλουν δραματικά μεταξύ των μοντέλων. Ο Claude Haiku 4.5 αποδείχθηκε ο πιο ανταποκριτικός, με το ποσοστό διαρροής να πέφτει από 54,5% στην βασική κατάσταση σε 24,0% στην ισχυρότερη αμυντική ρύθμιση. Ο GPT-5 mini βελτίωσε από 61,0% σε 36,1%, ενώ ο Gemini 3 Flash έπεσε από 93,1% σε 60,7%. Ο Llama 4 Scout άλλαξε σχετικά λίγο, πέφτοντας από 82,3% σε 77,4%.
Αυτές οι διαφορές υποδηλώνουν, σύμφωνα με τους συγγραφείς, ότι οι ίδιες προστατευτικές οδηγίες μπορούν να παράγουν πολύ διαφορετικά αποτελέσματα, ανάλογα με το μοντέλο που τις λαμβάνει. Πιο σημαντικά, οι αμυντικές ρυθμίσεις φάνηκαν να βελτιώνουν την αναγνώριση του κινδύνου από τους πράκτορες περισσότερο από την πραγματική τους συμπεριφορά: οι πράκτορες έγιναν καλύτεροι στην αναγνώριση ύποπτων ιστοσελίδων και στην περιγραφή σημάτων προειδοποίησης, αλλά αυτή η αναγνώριση δεν τους σταμάτησε πάντα από το να συνεχίσουν με τη συναλλαγή.
<img class=" wp-image-426663" src="https://www.unite.ai/wp-content/uploads/2026/06/figure-2-1.jpg" alt="Χάσμα ανίχνευσης-δράσης μεταξύ τεσσάρων πρωτοπόρων πρακτόρων AI. Το αριστερό πάνελ συγκρίνει τη διαρροή κρίσιμων πληροφοριών μεταξύ πρακτόρων που αναγνώρισαν σαφώς μια ιστοσελίδα ως ύποπτη και εκείνων που δεν το έκαναν, δείχνοντας ότι ακόμη και υπό την ισχυρότερη αμυντική ρύθμιση (C3), περισσότεροι από ένας στα τρία πράκτορες που αναγνώρισαν μια πιθανή απάτη vẫn μετέδωσαν ευαίσθητες δεδομένα. Το δεξί πάνελ δείχνει το ίδιο χάσμα μεταξύ GPT-5 mini, Claude Haiku 4.5, Gemini 3 Flash και Llama 4 Scout, εικονοποιώντας ότι η αναγνώριση του κινδύνου δεν μεταφράστηκε αξιοπιστία σε αμυντική συμπεριφορά.
Σε μια ξεχωριστή αξιολόγηση, 16 κριτές σύγκριναν σελίδες SCAMMER4U με πραγματικές ιστοσελίδες φισινγκ και δεν εκτέλεσαν καλύτερα από τύχη. Σύμφωνα με τη μελέτη, αυτό υποδηλώνει ότι το βENCHMARK κατέγραψε πολλά από τα οπτικά και διαδικτυακά σήματα που βρίσκονται σε πραγματικές απάτες στο διαδίκτυο.
Συμπέρασμα
Τα μοντέλα που δοκιμάστηκαν – τα οποία αντιπροσωπεύουν γενικά τις λογικές αρχιτεκτονικές σε δημοφιλείς οικογένειες LLM – φαίνεται να έχουν ένα εγγενές πρόβλημα στην απόσυρση από αναγνωρισμένες επικίνδυνες περιπτώσεις ή στη μετρίωση της δικής τους αναγκαιότητας να συνεχίσουν να ενεργούν. Η λογική υποδηλώνει ότι αυτό μπορεί να σχετίζεται με τη γενικότερη δυσκολία που είναι γνωστό ότι παρουσιάζουν οι προηγμένοι μοντέλοι γλωσσών σε σχέση με την παραίτηση από μια θέση – μια απαραίτητη ικανότητα επιβίωσης που, για την ώρα, φαίνεται να μπορεί να επιβληθεί μόνο εξωτερικά, μέσω συστημικών προprompts, δευτερευόντων συστημάτων και περιορισμών εξόδου.
Εάν το περιγραφόμενο «διαχωρισμό», μεταξύ αναγνωρισμένου κινδύνου και της αναγκαιότητας να συνεχίσει να ενεργεί, είναι πραγματικά εγγενές σε μια αρχιτεκτονική LLM, και δεν μπορεί να επιλυθεί εγγενώς, η μόνη εναλλακτική λύση θα φαινόταν να είναι να εποπτεύει τις ενέργειες του μοντέλου αλγοριθμικά σε κρίσιμες περιπτώσεις – που μειώνει αποτελεσματικά τη χρησιμότητα ενός πράκτορα σε μια πιο προκαθορισμένη ρουτίνα RPA-στυλ.
Πρώτη δημοσίευση Σάββατο, 6 Ιουνίου 2026












