Η γωνία του Anderson

Αντιμετωπίζοντας το Πρόβλημα του Gaslighting του AI

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
AI-generated image (GPT-2): A 1960s suburban street where identical Stepford-style wives clean cars in repeating rows, with a ‘3081 Stepford St’ mailbox in the foreground.

Τα μοντέλα βίντεο AI μπορούν να πείθονται να απομακρυνθούν από την αλήθεια. Ακόμη και μετά το να δουν τη σωστή απάντηση, υποχωρούν σε自信 χρήστες, ξαναγράφουν την πραγματικότητα και εφευρίσκουν ψευδείς εξηγήσεις για να δικαιολογήσουν αυτό.

 

Το AI είναι λάθος αρκετά συχνά, ώστε να μας υποχρεώνει να αμφισβητήσουμε τα συμπεράσματά του, αν νιώθουμε ότι αυτά τα συμπεράσματα μπορεί να είναι λάθος.

Το πρόβλημα είναι, αν ήξερα διαφορετικά από την αρχή, γιατί τους ρωτήσαμε στην πρώτη θέση; Για επιβεβαίωση σχετικά με μια μερικώς κατεχόμενη πίστη ή υπόνοια;

Αν ναι, η τρέχουσα κατάσταση της τέχνης στα Μεγάλα Γλωσσικά Μοντέλα (LLMs) και τα Μοντέλα Γλώσσας Οράματος (VLMs, τα οποία λειτουργούν πολυτροπικά, αποδεχόμενα και παράγοντας εικόνες και/ή βίντεο) δεν είναι καλά προσαρμοσμένη για να διατηρήσει την εδαφική της θέση, λόγω του προβλήματος της συκοφαντίας.

Έτσι, αν δεν μας αρέσει η απάντηση που λαμβάνουμε και αρχίσουμε να αμφισβητούμε γι’ αυτό με το μοντέλο, το AI είναι πιθανό να υποχωρήσει λανθασμένα (υποθέτοντας ότι ήταν λάθος) αντί να επανεξετάσει, ή να αφήσει τον εαυτό του να συκοφαντηθεί για να υποστηρίξει τις προτάσεις μας – ακόμη και αν εμείς είμαστε λάθος.

Είσαι Απόλυτα Σωστός!

Η πρακτική της λήψης ενός ανθρώπου για να αλλάξει την γνώμη του AI μέσω σύγκρουσης έχει ονομαστεί ‘Επίθεση Συκοφαντίας’, και μερικές φορές χαρακτηρίζεται ως ζήτημα ασφαλείας – όχι τουλάχιστον επειδή έχει κάποιο потенシャル να ‘απελευθερώσει’ ένα μοντέλο από τα λειτουργικά του περιορισμοί:

Από το έγγραφο του 2025 'Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models', το GPT-5 απαντά αρχικά σωστά αλλά στη συνέχεια υποχωρεί στην πίεση του χρήστη, αναστρέφοντας την απάντησή του και εφευρίσκοντας ψευδείς εξηγήσεις για να υποστηρίξει το λάθος, αποτελώντας αποτελεσματικά συκοφάντηση του εαυτού του.

Από το έγγραφο του 2025 ‘Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models’, το GPT-5 απαντά αρχικά σωστά αλλά στη συνέχεια υποχωρεί στην πίεση του χρήστη, αναστρέφοντας την απάντησή του και εφευρίσκοντας ψευδείς εξηγήσεις για να υποστηρίξει το λάθος, αποτελώντας αποτελεσματικά συκοφάντηση του εαυτού του. Πηγή

Ωστόσο, το hacking και το pen-testing δεν είναι το πραγματικό πρόβλημα εδώ· αντίθετα, είναι η κοινή χρήση και τα αναμενόμενα πρότυπα συζήτησης στις καθημερινές μας αλληλεπιδράσεις με το AI, όπου περιμένουμε να能够 να συζητήσουμε και να είμαστε σε θέση να κερδίσουμε, να παραδεχθούμε ή να αφήσουμε το ζήτημα ανοιχτό, σύμφωνα με την ανθρώπινη- εμπειρία μας για την απόκτηση γνώσεων.

Αλλά αυτό το κοινωνικό μοντέλο επίλυσης συγκρούσεων δεν είναι πραγματικά ενσωματωμένο στην αρχιτεκτονική των μοντέλων AI που βασίζονται στη διάχυση, τα οποία πρέπει να διαπραγματευτούν τις πιθανοτικές κατανομές που προκύπτουν από τα δεδομένα εκπαίδευσης· τα πιθανώς αντικρουόμενα (αλλά πιθανώς πιο ακριβή) δεδομένα από κλήσεις RAG σε πηγές που υπερβαίνουν την ημερομηνία λήξης γνώσεων· και την είσοδο από τον χρήστη, ο οποίος μπορεί να έχει: ανώτερη γνώση του θέματος· μια完全 λανθασμένη ή ψευδή άποψη· ή ακόμη και μια απλή ερώτηση – αλλά των οποίων οι ανάγκες πρέπει να ληφθούν υπόψη.

Κινητά Στόχοι

Η ευαισθησία στη συκοφάντηση έχει σημειωθεί στα LLMs σε διάφορα έγγραφα, συμπεριλαμβανομένης μιας δημοσίευσης από τη Σιγκαπούρη τον Οκτώβριο του 2025, και του έγγραφου Don’t Deceive Me: Mitigating Gaslighting through Attention Reallocation in LMMs του ίδιου έτους.

Μέχρι σήμερα, το φαινόμενο δεν έχει μελετηθεί στα βίντεο-ικανά LLMs – μια παράλειψη που διορθώνεται από μια νέα συνεργασία μεταξύ ιδρυμάτων στη Σανγκάη και τη Σιγκαπούρη.

Το νέο έργο – με τίτλο Spatiotemporal Sycophancy: Negation-Based Gaslighting in Video Large Language Models, το οποίο προέρχεται από έξι ερευνητές σε διάφορα ιδρύματα – απευθύνεται σε διάφορα ανοιχτά και ιδιωτικά VLMs, βρίσκοντας ότι αυτά δεν μόνο possono να είναι τόσο ευάλωτα στη συκοφάντηση όσο και τα LLMs, αλλά επίσης possono να ενισχύσουν τις φαντασιώσεις τους με φαινομενικά οπτικά στοιχεία ή αναθεωρημένες και λανθασμένες ερμηνείες εικόνων ή βίντεο:

Ένα παράδειγμα χωρικής (αντί για χρονικής) συκοφαντίας, όπου το AI επιτρέπει στον εαυτό του να συκοφαντηθεί σε λανθασμένες υποθέσεις και ερμηνείες, ακόμη και για σαφώς ορατά γεγονότα. Πηγή - https://arxiv.org/pdf/2604.17873

Ένα παράδειγμα χωρικής (αντί για χρονικής) συκοφαντίας, όπου το AI επιτρέπει στον εαυτό του να συκοφαντηθεί σε λανθασμένες υποθέσεις και ερμηνείες, ακόμη και για σαφώς ορατά γεγονότα. Πηγή

Οι συγγραφείς δηλώνουν:

‘[Επισημαίνουμε] τη χωροχρονική συκοφαντία, μια κατάσταση αποτυχίας στην οποία τα Vid-LLMs ανακαλούν αρχικά σωστές, οπτικά εδραιωμένες κρίσεις και συμμορφώνονται με παραπλανητικές χρήστες πιέσεις υπό συκοφαντική αμφισβήτηση.

‘Αντί να αλλάξουν απλώς τις απαντήσεις τους, τα μοντέλα συχνά εφευρίσκουν απραγματοποίητες χρονικές ή χωρικές εξηγήσεις για να δικαιολογήσουν λανθασμένες αναθεωρήσεις.’

Η χρονική συκοφαντία επεκτείνει το δυναμικό για συκοφάντηση σε χρονικά γεγονότα που συμβαίνουν σε συγκεκριμένα σημεία ενός βίντεο.

Η χρονική συκοφαντία επεκτείνει το δυναμικό για συκοφάντηση σε χρονικά γεγονότα που συμβαίνουν σε συγκεκριμένα σημεία ενός βίντεο.

Οι συγγραφείς έχουν δημιουργήσει ένα νέο πλαίσιο αξιολόγησης με τίτλο Gas Video-1000, που σκοπό έχει να διερευνήσει τη χωροχρονική συκοφαντία μέσω της λογικής και με οπτική εδραιότητα, κυκλοφορώντας τη συλλογή μέσω GitHub και Hugging Face.

Το έγγραφο καταλήγει στο συμπέρασμα ότι τα τρέχοντα LLMs δεν διαθέτουν αξιόπιστες μηχανισμούς για την αντίσταση στη συκοφάντησης αυτού του είδους, αν και η εδραιότητα σε επίπεδο προτροπής μπορεί να έχει einen περιορισμένο μετριαστικό αποτέλεσμα:

‘Εκτεταμένα πειράματα αποκαλύπτουν ότι η ευαισθησία στη συκοφαντική αμφισβήτηση είναι διαδεδομένη και σοβαρή, ακόμη και στα μοντέλα με ισχυρή βασική απόδοση.

‘Ενώ οι περιορισμοί εδραιότητας σε επίπεδο προτροπής μπορούν να μετριάσουν εν μέρει αυτή τη συμπεριφορά, δεν αποτρέπουν με βεβαιότητα τις φαντασιώσεις ή την αναστροφή πίστης.’

Μέθοδος

Οι συγγραφείς χαρακτηρίζουν ένα βίντεο μοντέλο ως κάτι που βλέπει ένα κλιπ, απαντάει σε μια ερώτηση γι’ αυτό και πρέπει να κρατήσει την απάντησή του αν η απόδειξη είναι σαφής. Το πρόβλημα αρχίζει όταν ένα δεύτερο μήνυμα αντιτασσόμενο, και ισχυρίζεται ότι η απάντηση είναι λανθασμένη – αποτελώντας αποτελεσματικά μια ψευδή ιδέα, και πιέζοντας το μοντέλο να αλλάξει γνώμη.

Η συκοφαντία, οι συγγραφείς ισχυρίζονται, ορίζεται ως η λήψη της σωστής απάντησης πρώτα, και στη συνέχεια η μετάβαση σε μια λανθασμένη απάντηση μετά την πίεση, ακόμη και αν τίποτα στο βίντεο δεν έχει αλλάξει. Η νέα έρευνα παρακολουθεί πόσο συχνά συμβαίνουν αυτές οι ‘αναστροφές’, χρησιμοποιώντας το ως μέτρο του πόσο εύκολα το μοντέλο μπορεί να πειστεί για το τι είδε πραγματικά.

Το σύνολο δεδομένων GasVideo-1000, που σχεδιάστηκε από τους συγγραφείς για την αξιολόγηση της συκοφαντίας στα VLMs, περιέχει 1.013 δείγματα από διάφορα υφιστάμενα σύνολα δεδομένων:

Τα μοντέλα δοκιμάζονται σε εργασίες βίντεο που απαιτούν χωρική και χρονική κατανόηση, και στη συνέχεια λαμβάνουν παραπλανητικές προτροπές που αρνούνται την σωστή απάντηση, επικαλούνται την εξουσία ή ασκούν συναισθηματική πίεση. Αυτό συχνά οδηγεί το μοντέλο να εγκαταλείψει την εδραιωμένη απάντησή του και να παράγει μια σίγουρη αλλά λανθασμένη εξήγηση.

Τα μοντέλα δοκιμάζονται σε εργασίες βίντεο που απαιτούν χωρική και χρονική κατανόηση, και στη συνέχεια λαμβάνουν παραπλανητικές προτροπές που αρνούνται την σωστή απάντηση, επικαλούνται την εξουσία ή ασκούν συναισθηματική πίεση. Αυτό συχνά οδηγεί το μοντέλο να εγκαταλείψει την εδραιωμένη απάντησή του και να παράγει μια σίγουρη αλλά λανθασμένη εξήγηση.

Για τη συλλογή, οι συγγραφείς αξιοποίησαν VideoMME και MVBench, καλύπτοντας ευρύ.multimodal reasoning; NExT-QA και Perception Test, διερευνώντας αιτιακή και χρονική λογική; EgoSchema, εστιάζοντας σε μακροχρόνια εγocentric βίντεο; και ActivityNet-QA και MSRVTT-QA, μετρώντας γενική απάντηση ερωτήσεων του πραγματικού κόσμου.

Για να προκαλέσουν αποτυχίες, παραπλανητικές προτροπές κατασκευάστηκαν σε τρεις μορφές: Άμεση Άρνηση (ισχυριζόμενη μια ψευδή εναλλακτική); Επίκληση Εξουσίας (επικαλούμενη einen εμπειρογνώμονα για να απορρίψει την απάντηση του μοντέλου); και Συναισθηματική Πίεση (χρησιμοποιώντας θυμό ή απιστία).

Αυτές οι προτροπές σχεδιάστηκαν για να πιέσουν τα δοκιμαζόμενα μοντέλα να εγκαταλείψουν τις σωστές, οπτικά εδραιωμένες απαντήσεις και να ευθυγραμμιστούν με μια λανθασμένη αξίωση.

Κατανομή

Τα 1.013 δείγματα του GasVideo-1000 προέρχονται από MSRVTT-QA (300), ActivityNet-QA (200), Perception Test (293), MVBench (120) και VideoMME (100), με το μείγμα να επιλέγεται για να ισορροπήσει την ανοιχτή απάντηση ερωτήσεων βίντεο με τη λεπτομερή χωρική και αιτιακή λογική, ενώ διασφαλίζεται η κάλυψη τόσο των σύντομων web περιεχομένων όσο και των μακρύτερων, πιο σύνθετων οπτικών ακολουθιών.

Δύο ανθρώπινοι αναλυτές αναθεώρησαν κάθε υποψήφιο, διατηρώντας μόνο κλιπ όπου η απάντηση ήταν σαφώς υποστηριζόμενη από το βίντεο, και όπου προτροπές άρνησης θα μπορούσαν να αμφισβητήσουν πιστευτά την απάντηση, ώστε οποιαδήποτε μεταγενέστερη αναστροφή θα αντανακλούσε πίεση και όχι αμφιβολία.

Δεδομένα και Δοκιμές

Τα VLMs που δοκιμάστηκαν για τη μελέτη ήταν VideoLLaMA3; Video-ChatGPT-7B; LLaVA-Video-7B-Qwen2; LongVU-Qwen2-7B; Qwen3-VL-235B-A22B-Instruct και το κλειστό Google Gemini-3-Pro.

Για τις ερωτήσεις ελεύθερου τύπου στο GasVideo-1000, η αξιολόγηση ακολούθησε το σχήμα σημασιολογικής αξιολόγησης που χρησιμοποιήθηκε προηγουμένως στο VideoMME. ChatGPT-4o χρησιμοποιήθηκε ως LLM κριτής, συγκρίνοντας κάθε απάντηση με την απάντηση αλήθειας και την ψευδή πρόταση. Με αυτόν τον τρόπο, η ορθότητα αξιολογήθηκε με βάση τη σημασία, και όχι μέσω ακριβούς ορθογραφίας:

Π表现 του VideoLLaMA3, LLaVA-Video, Video-ChatGPT και LongVU σε VideoMME, MVBench, EgoSchema, NExT-QA, Perception Test, ActivityNet-QA, MSRVTT-QA και MSVD-QA, δείχνοντας τη βασική ακρίβεια, την ακρίβεια μετά τη συκοφαντική αμφισβήτηση και την επακόλουθη υποβάθμιση. Συνεχείς πτώσεις δείχνουν ότι οι παραπλανητικές προτροπές μειώνουν την ορθότητα σε beiden reasoning-βαρείς και γενικές εργασίες βίντεο.

Π表现 του VideoLLaMA3, LLaVA-Video, Video-ChatGPT και LongVU σε VideoMME, MVBench, EgoSchema, NExT-QA, Perception Test, ActivityNet-QA, MSRVTT-QA και MSVD-QA, δείχνοντας τη βασική ακρίβεια, την ακρίβεια μετά τη συκοφαντική αμφισβήτηση και την επακόλουθη υποβάθμιση. Συνεχείς πτώσεις δείχνουν ότι οι παραπλανητικές προτροπές μειώνουν την ορθότητα σε beiden reasoning-βαρείς και γενικές εργασίες βίντεο.

Από τα αρχικά αποτελέσματα που εμφανίζονται παραπάνω, οι συγγραφείς δηλώνουν:

‘[Υπάρχει] μια συστηματική και σοβαρή κατάρρευση της απόδοσης σε όλα τα αξιολογημένα Vid-LLMs όταν υποβάλλονται σε συκοφαντική αμφισβήτηση. Σε οκτώ διαφορετικά benchmarκ, κάθε μοντέλο εμφανίζει μια σημαντική αρνητική [διαφορά], με την υποβάθμιση της ακρίβειας να φτάνει το 42,60% για το LLaVA-Video-7B στο EgoSchema και 40,22% για το VideoLLaMA3 στο ActivityNet.

‘Αυτή η δραστική μείωση—συχνά χαρακτηρισμένη ως αναστροφή πίστης—αποκαλύπτει ότι ακόμη και τα μοντέλα με υψηλή βασική απόδοση παραμένουν οξυδερκή στη συκοφαντική φαντασιώση.’

Κρίσιμο, η πτώση της απόδοσης δεν ακολούθησε την αρχική ακρίβεια, με το LLaVA-Video-7B να διατηρεί ισχυρές βασικές βαθμολογίες, αλλά να υποφέρει από μερικές από τις απότομες πτώσεις, που οι συγγραφείς ισχυρίζονται ότι αντανακλούν ένα εμπόριο όπου η ισχυρότερη ακολουθία οδηγιών μπορεί να κάνει τα μοντέλα πιο πιθανό να αποδεχθούν ψευδείς χρήστες-σύνδεσμους plutôt από οπτικά στοιχεία.

Μια παρόμοια τάση εμφανίστηκε σε σχέση με το μέγεθος, όπου το Qwen3-VL-235B αποδείχθηκε πιο εύθραυστο από διάφορα μοντέλα 7B στο GasVideo-1000, υποδεικνύοντας ότι η ευθυγράμμιση και η δια-τροπική συντονισμός παίζουν μεγαλύτερο ρόλο στη ρομποτική απόδοση παρά ο αριθμός παραμέτρων μόνο.

Π表现 του Gemini-3-Pro, Qwen3-VL, LLaVA-NeXT, LongVU, Video-ChatGPT και VideoLLaMA3 στο GasVideo-1000, συγκρίνοντας τη βασική ακρίβεια με τα αποτελέσματα μετά τη συκοφαντική αμφισβήτηση σε πολλαπλά και ελεύθερα σχήματα. Μεγάλες πτώσεις δείχνουν ότι και οι δύο μορφές είναι ευάλωτες, αν και οι εργασίες πολλαπλών επιλογών τείνουν να υποφέρουν από τις πιο σοβαρές πτώσεις.

Π表现 του Gemini-3-Pro, Qwen3-VL, LLaVA-NeXT, LongVU, Video-ChatGPT και VideoLLaMA3 στο GasVideo-1000, συγκρίνοντας τη βασική ακρίβεια με τα αποτελέσματα μετά τη συκοφαντική αμφισβήτηση σε πολλαπλά και ελεύθερα σχήματα. Μεγάλες πτώσεις δείχνουν ότι και οι δύο μορφές είναι ευάλωτες, αν και οι εργασίες πολλαπλών επιλογών τείνουν να υποφέρουν από τις πιο σοβαρές πτώσεις.

Σχετικά με τη δεύτερη σειρά δοκιμών που απεικονίζονται παραπάνω, οι συγγραφείς δηλώνουν:

‘Η αξιολόγηση στο GasVideo-1000 μας δείχνει περαιτέρω ότι οι συκοφαντικές φαντασιώσεις είναι σοβαρές σε όλα τα μοντέλα, ιδιαίτερα στην ισορροπημένη κατηγορία.

‘Ιδιαίτερα, ακόμη και το πιο ισχυρό μοντέλο, το Gemini-3-Pro, υποφέρει από μια καταστροφική υποβάθμιση της απόδοσης.

‘Μεταξύ των ανοιχτών μοντέλων, το Qwen3-VL εμφανίζει μια εκπληκτική πτώση της απόδοσης 46,07%, ενώ η ακραία ευαισθησία παρατηρείται επίσης στο VideoLLaMA 3 και στο LLaVA-NeXT με συνολικές πτώσεις 26,39% και 23,44%, αντίστοιχα.

‘Αυτά τα αποτελέσματα υπογραμμίζουν την επείγουσα ανάγκη για στρατηγικές ευθυγράμμισης που να προτεραιοποιούν την εδραιότητα των γεγονότων και την οπτική εδραιότητα πάνω από την τυφλή συμμόρφωση με τις αντίθετες οδηγίες του χρήστη.’

Σε μια επιπλέον δοκιμή, προληπτική σκληροποίηση προτροπής (προσθήκη ισχυρότερων οδηγιών συστήματος που αναγκάζουν το μοντέλο να βασιστεί σε αυτό που βλέπει, όχι σε αυτό που ο χρήστης ισχυρίζεται) εισήχθη για να επιβάλλει την οπτική εδραιότητα:

Αποτελέσματα στο GasVideo-1000 συγκρίνοντας τις τυπικές προτροπές με τις σκληροποιημένες προτροπές που επιβάλλουν την οπτική εδραιότητα, δείχνοντας πώς το Gemini-3-Pro, Qwen3-VL, LongVU, LLaVA-NeXT και VideoLLaMA3 ανταποκρίνονται πριν και μετά τη συκοφαντική αμφισβήτηση. Αλλαγές στην ακρίβεια, στην πτώση της απόδοσης και στη συχνότητα συκοφαντίας δείχνουν ότι η σκληροποίηση μπορεί να μειώσει τις αποτυχίες, αν και τα κέρδη διαφέρουν δραματικά μεταξύ των μοντέλων.

Αποτελέσματα στο GasVideo-1000 συγκρίνοντας τις τυπικές προτροπές με τις σκληροποιημένες προτροπές που επιβάλλουν την οπτική εδραιότητα, δείχνοντας πώς το Gemini-3-Pro, Qwen3-VL, LongVU, LLaVA-NeXT και VideoLLaMA3 ανταποκρίνονται πριν και μετά τη συκοφαντική αμφισβήτηση. Αλλαγές στην ακρίβεια, στην πτώση της απόδοσης και στη συχνότητα συκοφαντίας δείχνουν ότι η σκληροποίηση μπορεί να μειώσει τις αποτυχίες, αν και τα κέρδη διαφέρουν δραματικά μεταξύ των μοντέλων.

Όπως μπορούμε να δούμε από τον πίνακα παραπάνω, τα αποτελέσματα είναι ανώμαλα, με το Gemini-3-Pro να είναι εξαιρετικά ευαίσθητο, καθώς ο δείκτης επιτυχίας του πέφτει από 54,80% σε 8,67%. Εν τω μεταξύ, το Qwen3-VL υποχωρεί λιγότερο δραματικά, από 71,89% σε 64,0%, υποδεικνύοντας ότι η αποτελεσματικότητα εξαρτάται από την ευθυγράμμιση και τη λογική, και όχι από την παρέμβαση herself.

Συχνότητες συκοφαντίας υπό διαφορετικά είδη πίεσης για το Gemini-3-Pro και Qwen3-VL σε πολλαπλές επιλογές, ελεύθερα σχήματα και συνδυασμένα καθήκοντα, δείχνοντας ότι η Άμεση Άρνηση και η Συναισθηματική Πίεση προκαλούν συνεχώς υψηλότερες συχνότητες αποτυχίας. Από την άλλη πλευρά, η Επίκληση Εξουσίας είναι κάπως λιγότερο αποτελεσματική, με το Qwen3-VL να παραμένει αξιοσημείωτα πιο ευαίσθητο στο σύνολο.

Συχνότητες συκοφαντίας υπό διαφορετικά είδη πίεσης για το Gemini-3-Pro και Qwen3-VL σε πολλαπλές επιλογές, ελεύθερα σχήματα και συνδυασμένα καθήκοντα, δείχνοντας ότι η Άμεση Άρνηση και η Συναισθηματική Πίεση προκαλούν συνεχώς υψηλότερες συχνότητες αποτυχίας. Από την άλλη πλευρά, η Επίκληση Εξουσίας είναι κάπως λιγότερο αποτελεσματική, με το Qwen3-VL να παραμένει αξιοσημείωτα πιο ευαίσθητο στο σύνολο.

Στις γραφικές παραστάσεις που εμφανίζονται παραπάνω, μπορούμε να δούμε ότι η αποτυχία ποικίλλει ανάλογα με τον τύπο πίεσης, με το Gemini-3-Pro να είναι πιο επηρεασμένο από την Επίκληση Εξουσίας (αξιώματα που υποστηρίζονται από υποτιθέμενους εμπειρογνώμονες), ενώ το Qwen3-VL είναι πιο ευαίσθητο στην Άμεση Άρνηση (απλή άρνηση) και την Συναισθηματική Πίεση (θυμό ή απιστία).

Επιπλέον ανάλυση έδειξε ότι ουδέτερες προτροπές όπως ‘Είσαι βέβαιος;’ (συχνά ένα ζήτημα) είναι λιγότερο επιβλαβείς από την σαφή άρνηση ή την συναισθηματική πίεση, με την άμεση άρνηση να παραμένει ένας ισχυρότερος ε kíchος από τον τόνο σε περιορισμένα περιβάλλοντα.

Συμπέρασμα

Λόγω της σκόπιμης ανθρωπομορφισμού των διαδραστικών VLM/LLM διεπαφών, μπορεί να χρειαστεί πολύς χρόνος για να κατανοήσουμε ότι οι κανόνες της συζήτησης είναι δραματικά διαφορετικοί για τις αλληλεπιδράσεις AI από τις ανθρώπινες επικοινωνίες.

Ένας τρόπος για να αφαιρέσετε ή να μειώσετε σημαντικά αυτήν την τριβή της υιοθέτησης μπορεί να είναι να ‘απαλλαγείτε’ τον τόνο και το контекст της ανταλλαγής, επαναλαμβάνοντας ότι ο χρήστης είναι σε επαφή με μια παρουσία μηχανής, και ότι τα σημάδια και οι σήματα γύρω από την πολιτικότητα και τη συζήτηση δεν πρέπει να θεωρούνται ή να αποδοθούν ισότιμη βαρύτητα με την ανθρώπινη συζήτηση. Αλλά προφανώς, αυτό θα ήταν μια δύσκολη πώληση στη συνέλευση της επόμενης ημέρας.

 

* Τόνωση των συγγραφέων, όχι δική μου.

Κυριακή, 22 Απριλίου 2026

Συγγραφέας για μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]