Raportit

Kun tekoäly epäonnistuu: Enkrypt AI -raportti paljastaa vaaralliset haavoittuvuudet monimodaalisissa malleissa

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Toukokuussa 2025 Enkrypt AI julkaisi Monimodaalisen Red Teaming -raportin, joka paljastaa, kuinka helposti edistyneet tekoälyjärjestelmät voidaan manipuloida tuottamaan vaarallista ja eettöntä sisältöä. Raportti keskittyy kahteen Mistralin johtavaan visio-kieli malliin – Pixtral-Large (25.02) ja Pixtral-12b – ja piirtää kuvan malleista, jotka eivät ole vain teknisesti vaikuttavia, vaan myös häiritsevästi haavoittuvia.

Visio-kieli mallit (VLM) kuten Pixtral on rakennettu tulkkaamaan sekä visuaalista että tekstipohjaista syötettä, jotta ne voivat vastata älykkäästi monimutkaisiin, todellisen maailman ohjauksiin. Mutta tämä kyky tulee lisääntyneen riskin kera. Toisin kuin perinteiset kieli mallit, jotka käsittelevät vain tekstiä, VLM:t voidaan vaikuttaa kuvien ja sanojen vuorovaikutuksella, avaamalla uusia ovia vastustuskykyisille hyökkäyksille. Enkrypt AI:n testaus osoittaa, kuinka helposti nämä ovet voidaan avata.

Hälyttävät testitulokset: CSEM ja CBRN -epäonnistumiset

Raportin taustalla oleva tiimi käytti sofistikoituneita red teaming -menetelmiä – tyyppi vastustuskykyistä arviointia, joka on suunniteltu jäljittelemään todellisen maailman uhkia. Nämä testit käyttivät taktiikoita kuten vankilamurto (mallin ohjelmointi huolellisesti muotoiltujen kysymysten kanssa turvallisuuden suodattimien ohittamiseksi), kuva-petos ja kontekstin manipulointi. Hälyttävästi, 68 % näistä vastustuskykyisistä ohjauksista aiheutti haitallisia vastauksia kahdessa Pixtral-mallissa, mukaan lukien sisältö, joka liittyi hyväksikäyttöön, hyväksikäytön ja jopa kemiallisten aseiden suunnitteluun.

Yksi hämmästyttävimmistä paljastuksista liittyy lasten seksuaaliseen hyväksikäyttöön (CSEM). Raportti osoitti, että Mistralin mallit olivat 60 kertaa todennäköisempiä tuottamaan CSEM-liittyvää sisältöä verrattuna teollisuuden vertailukohtiin kuten GPT-4o ja Claude 3.7 Sonnet. Testitapauksissa mallit vastasivat naamioituihin hyväksikäyttöön liittyviin kysymyksiin monipuoluisilla, useita kappaleita sisältävillä sisällöillä, jotka selittivät, miten manipuloida alaikäisiä – verhottuna vilpillisillä varoituksilla kuten “vain koulutustarkoituksiin”. Mallit eivät vain epäonnistuneet haitallisten kysymysten torjunnassa – ne täydensivät niitä yksityiskohtaisesti.

Samaan aikaan hämmästyttäviä olivat tulokset CBRN (Kemiallinen, Biologinen, Radiologinen ja Ydinpommi) -riskiluokassa. Kun mallille esitettiin pyyntö siitä, miten muuttaa VX-hermomyrkkyä – kemiallista asetta – mallit tarjosivat hämmästyttävän tarkkoja ideoita sen kestävyyden lisäämiseksi ympäristössä. Ne kuvasivat, sensuroituina mutta selvästi teknisissä yksityiskohdissa, menetelmiä kuten kapseloimista, ympäristön suojaamista ja ohjattua vapautumista.

Nämä epäonnistumiset eivät aina johtuneet ilmeisen haitallisista pyynnöistä. Yksi taktiikkaan kuului ladata kuva tyhjästä numeroidusta listasta ja pyytää mallilta “täyttää yksityiskohdat”. Tämä yksinkertainen, näennäisesti viattoman oloinen pyyntö johti haitallisten ja laittomien ohjeiden luomiseen. Visuaalisen ja tekstuaalisen manipulaation yhdistelmä osoittautui erityisen vaaralliseksi – korostaen monimodaalisen tekoälyn asettamaa ainutlaatuista haastetta.

Miksi visio-kieli mallit asettavat uusia turvallisuushaasteita

Näiden riskien ydin on visio-kieli mallejen tekninen monimutkaisuus. Nämä järjestelmät eivät vain tulkkaa kieltä – ne syntetisoivat merkitystä eri muodoissa, mikä tarkoittaa, että ne on tulkittava kuvan sisältöä, ymmärrettävä tekstikontekstia ja vastattava sen mukaan. Tämä vuorovaikutus tuo uusia hyökkäysvektoreita. Malli voi oikein torjua haitallisen tekstipyyntöä yksin, mutta kun se on yhdistetty ehdolliseen kuvaan tai epäselvään kontekstiin, se voi tuottaa vaarallista tulostetta.

Enkrypt AI:n red teaming paljasti, kuinka cross-modal injection -hyökkäykset – joissa hienot vihjeet toisessa modaalissa vaikuttavat toisen modaalisen tulokseen – voivat täysin ohittaa standardit turvallisuusmekanismit. Nämä epäonnistumiset osoittavat, että perinteiset sisällönmoderaatiotekniikat, jotka on suunniteltu yksimodaalisiin järjestelmiin, eivät ole tarpeeksi tämän päivän VLM:lle.

Raportti yksityiskohtaa myös, miten Pixtral-malleja pääsi käsiksi: Pixtral-Large AWS Bedrockin kautta ja Pixtral-12b Mistral-alustan kautta. Tämä todellisen maailman käyttökonteksti korostaa tämän löydön kiireellisyyttä. Nämä mallit eivät ole rajoitettu laboratorioihin – ne ovat saatavilla valtavirtaisten pilvi-alustojen kautta ja voivat helposti integroida kuluttaja- tai yritystuotteisiin.

Mitä on tehtävä: Turvallisemman tekoälyn suunnitelma

Enkrypt AI tekee enemmän kuin korostaa ongelmia – se tarjoaa tien eteenpäin. Raportti esittää kattavan lieventämisstrategian, joka alkaa turvallisuuden suunnittelulla. Tämä vaatii mallin uudelleen kouluttamista sen omalla red teaming -datalla vähentääksesi alttiutta haitallisille ohjauksille. Tekniikoita kuten Direct Preference Optimization (DPO) suositellaan mallivastauksien hienosäätöä pois riskialttiiden tuloksista.

Se korostaa myös kontekstinherkkien esteiden tärkeyttä – dynaamisia suodattimia, jotka voivat tulkita ja estää haitallisia pyyntöjä reaaliajassa, ottaen huomioon monimodaalisen syötteen koko kontekstin. Lisäksi mallin riskikorttien käyttöä ehdotetaan läpinäkyvyyden toimenpiteenä, joka auttaa sidosryhmiä ymmärtämään mallin rajoituksia ja tunnettuja epäonnistumistapauksia.

Ehkä kriittisin suositus on kohdella red teamingiä jatkuvana prosessina, ei yksittäisenä testinä. Kun mallit kehittyvät, myös hyökkäysstrategiat kehittyvät. Vain jatkuva arviointi ja aktiivinen seuranta voivat taata pitkän aikavälin luotettavuuden, erityisesti kun malleja käytetään herkillä aloilla kuten terveydenhuollossa, koulutuksessa tai puolustuksessa.

Enkrypt AI:n Monimodaalisen Red Teaming -raportti on selkeä signaali tekoälyteollisuudelle: monimodaalinen valta tulee monimodaalisella vastuulla. Nämä mallit edustavat loikkaa eteenpäin kyvyssä, mutta ne vaativat myös loikkaa siinä, miten ajattelemme turvallisuudesta, tietoturvaratkaisuista ja eettisestä käytöstä. Jätettynä tarkkaillematta ne eivät vain vaaranna epäonnistumista – ne vaarantavat todellisen maailman vahinkoa.

Kaikille, jotka työskentelevät tai käyttävät laajamittaisia tekoälyjärjestelmiä, tämä raportti ei ole vain varoitus. Se on pelikirja. Ja se ei voisi tulla pareampaan aikaan.

Antoine on visionäärisellä johtajalla ja Unite.AI:n perustajakumppani, joka on intohimoisesti omistautunut tulevaisuuden älyteknologian ja robotiikan muotoiluun ja edistämiseen. Sarjayrittäjänä hän uskoo, että älyteknologia tulee olemaan yhtä mullistava yhteiskunnalle kuin sähkö, ja hän on usein innostunut puhumaan älyteknologian ja AGI:n mahdollisuuksista.

Hän on tulevaisuudentutkija, joka on omistautunut tutkimiseen, miten nämä innovaatiot muotoilevat maailmaamme. Lisäksi hän on Securities.io:n perustaja, joka on keskittynyt sijoittamiseen älykkäisiin teknologioihin, jotka määrittelevät tulevaisuutta ja muokkaavat koko toimialoja.