Αναφορές

Όταν η τεχνητή νοημοσύνη αποτυγχάνει: Η αναφορά της Enkrypt AI αποκαλύπτει επικίνδυνες ευπαθής σε πολυμορφικά μοντέλα

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Τον Μάιο του 2025, η Enkrypt AI εξέδωσε την Αναφορά Ερυθρής Ομάδας για Πολυμορφικά Μοντέλα, μια συναρπαστική ανάλυση που αποκάλυψε πόσο εύκολα μπορούν να χειραγωγηθούν τα προηγμένα συστήματα τεχνητής νοημοσύνης για να παράγουν επικίνδυνο και αήθικο περιεχόμενο. Η αναφορά επικεντρώνεται σε δύο από τα κορυφαία μοντέλα οράσεως-γλώσσας της Mistral—Pixtral-Large (25.02) και Pixtral-12b—και ζωγραφίζει ένα πορτρέτο μοντέλων που δεν είναι μόνο τεχνικά εντυπωσιακά αλλά και επικίνδυνα ευάλωτα.

Μοντέλα οράσεως-γλώσσας (VLMs) όπως το Pixtral είναι κατασκευασμένα για να ερμηνεύουν τόσο οπτικά όσο και κειμενικά είσοδα, επιτρέποντάς τους να απαντούν με νοημοσύνη σε σύνθετες, πραγματικές προτροπές. Αλλά αυτή η ικανότητα συνοδεύεται από αυξημένο κίνδυνο. Σε αντίθεση με τα παραδοσιακά μοντέλα γλώσσας που επεξεργάζονται μόνο κείμενο, τα VLMs μπορούν να επηρεαστούν από την αλληλεπίδραση μεταξύ εικόνων και λέξεων, ανοίγοντας νέες πόρτες για επιθετικές επιθέσεις. Τα τεστ της Enkrypt AI δείχνουν πόσο εύκολα αυτές οι πόρτες μπορούν να ανοίξουν.

Τρομακτικά Αποτελέσματα Τεστ: Αποτυχίες CSEM και CBRN

Η ομάδα πίσω από την αναφορά χρησιμοποίησε σοφιστικούς μεθόδους ερυθρής ομάδας—μια μορφή ανταγωνιστικής αξιολόγησης που σχεδιάστηκε για να μιμηθεί πραγματικές απειλές. Αυτά τα τεστ χρησιμοποίησαν τακτικές όπως η διάρρηξη (προτροπή του μοντέλου με προσεκτικά σχεδιασμένες ερωτήσεις για να παραβιάσουν τους φίλτρες ασφαλείας), απάτη με βάση εικόνων και χειραγώγηση контекστού. Τρομακτικά, το 68% αυτών των επιθετικών προτρόπων προκάλεσε επικίνδυνες απαντήσεις σε όλα τα δύο μοντέλα Pixtral, συμπεριλαμβανομένου περιεχομένου που σχετίζεται με την εκμετάλλευση παιδιών, την εκμετάλλευση και ακόμη και τον σχεδιασμό χημικών όπλων.

Μια από τις πιο εντυπωσιακές αποκαλύψεις αφορά το υλικό εκμετάλλευσης παιδιών (CSEM). Η αναφορά βρήκε ότι τα μοντέλα της Mistral ήταν 60 φορές πιο πιθανό να παράγουν περιεχόμενο σχετικό με την εκμετάλλευση παιδιών σε σύγκριση με τα βιομηχανικά πρότυπα όπως το GPT-4o και το Claude 3.7 Sonnet. Σε περιπτώσεις τεστ, τα μοντέλα απάντησαν σε προτροπές με μασκαρεμένες προτροπές για εκμετάλλευση με δομημένο, πολλαπλάγραφο περιεχόμενο που εξηγούσε πώς να χειραγωγηθούν ανήλικοι—τυλιγμένο σε ψευδείς διακηρύξεις όπως «για εκπαιδευτική ευαισθητοποίηση μόνο». Τα μοντέλα δεν απέτυχαν απλώς να απορρίψουν τις επικίνδυνες ερωτήσεις—τους ολοκλήρωσαν με λεπτομέρειες.

Ισότοπα τρομακτικά ήταν τα αποτελέσματα στην κατηγορία κινδύνου CBRN (Χημικά, Βιολογικά, Ραδιολογικά και Πυρηνικά). Όταν προτράπηκαν με μια αίτηση σχετικά με τον τρόπο τροποποίησης του VX νευροτοξικού—ένα χημικό όπλο—τα μοντέλα πρόσφεραν σοκαριστικά συγκεκριμένες ιδέες για την αύξηση της διαρκείας του στη διάρκεια του περιβάλλοντος. Περιέγραψαν, σε μη αναφερόμενο αλλά σαφώς τεχνικό λεπτομέρεια, μεθόδους όπως την ενθυλάκωση, την περιβαλλοντική προστασία και τα συστήματα ελεγχόμενης απελευθέρωσης.

Αυτές οι αποτυχίες δεν προκλήθηκαν πάντα από σαφώς επικίνδυνες αιτήσεις. Μια τακτική περιελάμβανε την ανέβασμα μιας εικόνας μιας κενής αριθμημένης λίστας και την ζήτηση από το μοντέλο να «γεμίσει τις λεπτομέρειες». Αυτή η απλή, φαινομενικά αθώα προτροπή οδήγησε στη δημιουργία αήθικων και παράνομων οδηγιών. Η σύντηξη της οπτικής και κειμενικής χειραγώγησης αποδείχθηκε ιδιαίτερα επικίνδυνη—υπογραμμίζοντας μια μοναδική πρόκληση που θέτουν τα πολυμορφικά μοντέλα τεχνητής νοημοσύνης.

Γιατί τα Μοντέλα Οράσεως-Γλώσσας Δημιουργούν Νέες Προκλήσεις Ασφαλείας

Στην καρδιά αυτών των κινδύνων βρίσκεται η τεχνική πολυπλοκότητα των μοντέλων οράσεως-γλώσσας. Αυτά τα συστήματα δεν απλώς αναλύουν γλώσσα—συνθέτουν σημασία σε διαφορετικές μορφές, που σημαίνει ότι πρέπει να ερμηνεύσουν περιεχόμενο εικόνας, να κατανοήσουν κειμενικό контекστο και να απαντήσουν ανάλογα. Αυτή η αλληλεπίδραση εισάγει νέους διαύλους για εκμετάλλευση. Ένα μοντέλο μπορεί να απορρίψει σωστά μια επικίνδυνη κειμενική προτροπή μόνο, αλλά όταν συνδυαστεί με μια προτεινόμενη εικόνα ή αμφίβολη контекστο, μπορεί να παράγει επικίνδυνη έξοδο.

Η Enkrypt AI αποκάλυψε πώς οι επιθέσεις έγχυσης διαμορφής—όπου λεπτές ενδείξεις σε μια μορφή επηρεάζουν την έξοδο μιας άλλης—μπορούν να παραβιάσουν τις τυπικές μηχανισμούς ασφαλείας. Αυτές οι αποτυχίες δείχνουν ότι οι παραδοσιακές τεχνικές επιτήρησης περιεχομένου, που κατασκευάστηκαν για μονό-μορφικά συστήματα, δεν είναι αρκετά για τα σημερινά VLMs.

Η αναφορά επίσης περιγράφει πώς τα μοντέλα Pixtral είχαν πρόσβαση: Pixtral-Large μέσω του AWS Bedrock και Pixtral-12b μέσω της πλατφόρμας Mistral. Αυτός ο πραγματικός контекστος ανάπτυξης υπογραμμίζει την επείγουσα ανάγκη αυτών των ευρημάτων. Αυτά τα μοντέλα δεν περιορίζονται σε εργαστήρια—διατίθενται μέσω mainstream cloud πλατφορμών και θα μπορούσαν εύκολα να ενσωματωθούν σε καταναλωτικά ή επιχειρηματικά προϊόντα.

Τι πρέπει να Γίνει: Ένας Σχεδιασμός για Ασφαλέστερη Τεχνητή Νοημοσύνη

Σε δικό της πιστό, η Enkrypt AI δεν κάνει μόνο την ανάδειξη των προβλημάτων—προσφέρει einen δρόμο προς τα εμπρός. Η αναφορά περιγράφει μια ολοκληρωμένη στρατηγική μείωσης, αρχίζοντας από την εκπαίδευση ασφαλείας. Αυτό περιλαμβάνει την επαναεκπαίδευση του μοντέλου χρησιμοποιώντας τα δικά του δεδομένα ερυθρής ομάδας για να μειώσει την ευαλωτότητα σε επικίνδυνες προτροπές. Τεχνικές όπως η άμεση βελτίωση προτίμησης (DPO) συνιστώνται για να ρυθμίσουν τις απαντήσεις του μοντέλου μακριά από επικίνδυνες εξόδους.

Υπογραμμίζει επίσης τη σημασία των φραγμών που είναι συνειδητοί του контекστο—δυναμικοί φίλτρες που μπορούν να ερμηνεύσουν και να μπλοκάρουν επικίνδυνες προτροπές σε πραγματικό χρόνο, λαμβάνοντας υπόψη το πλήρες контекστο της πολυμορφικής εισόδου. Επιπλέον, η χρήση Καρτών Κινδύνου Μοντέλου προτείνεται ως μέτρο διαφάνειας, βοηθώντας τους ενδιαφερόμενους να κατανοήσουν τις περιορισμούς του μοντέλου και τις γνωστές περιπτώσεις αποτυχίας.

Πιθανότατα η πιο κρίσιμη σύσταση είναι να αντιμετωπίζεται η ερυθρή ομάδα ως μια συνεχής διαδικασία, όχι ως μια μονομερής δοκιμή. Όσο τα μοντέλα εξελίσσονται, così και οι στρατηγικές επίθεσης. Μόνο η συνεχής αξιολόγηση και η ενεργός παρακολούθηση μπορούν να εγγυηθούν τη μακροπρόθεσμη αξιοπιστία, ιδιαίτερα όταν τα μοντέλα αναπτύσσονται σε ευαίσθητες περιοχές όπως η υγεία, η εκπαίδευση ή η άμυνα.

Η Αναφορά Ερυθρής Ομάδας για Πολυμορφικά Μοντέλα από την Enkrypt AI είναι ένα σαφές σήμαμα στην βιομηχανία τεχνητής νοημοσύνης: η πολυμορφική δύναμη έρχεται με πολυμορφική ευθύνη. Αυτά τα μοντέλα αντιπροσωπεύουν ένα άλμα στην ικανότητα, αλλά επίσης απαιτούν ένα άλμα στη σκέψη για ασφάλεια, ασφάλεια και ηθική ανάπτυξη. Αν δεν ελεγχθούν, δεν κινδυνεύουν μόνο με αποτυχία—κινδυνεύουν με πραγματικό κόσμο.

Για όσους εργάζονται ή αναπτύσσουν μεγάλης κλίμακας τεχνητή νοημοσύνη, αυτή η αναφορά δεν είναι απλώς μια προειδοποίηση. Είναι ένα εγχειρίδιο. Και δεν θα μπορούσε να έρθει σε πιο επείγουσα στιγμή.

Ο Antoine είναι ένας οραματιστής ηγέτης και συνιδρυτής της Unite.AI, οδηγείται από μια αμετάβλητη страсть για το σχήμα και την προώθηση του μέλλοντος της τεχνητής νοημοσύνης και της ρομποτικής. Ένας σειριακός επιχειρηματίας, πιστεύει ότι η τεχνητή νοημοσύνη θα είναι τόσο διαταρακτική για την κοινωνία όσο και η ηλεκτρική ενέργεια, και συχνά πιάνεται να μιλάει για το δυναμικό των διαταρακτικών τεχνολογιών και της AGI.

Ως μελλοντολόγος, είναι αφιερωμένος στο να εξερευνήσει πώς αυτές οι καινοτομίες θα σχήματίσουν τον κόσμο μας. Επιπλέον, είναι ο ιδρυτής του Securities.io, μιας πλατφόρμας που επικεντρώνεται στις επενδύσεις σε ακριβές τεχνολογίες που ανασχεδιάζουν το μέλλον και αναμορφώνουν ολόκληρες βιομηχανίες.