Andersonin kulma

Sensuroitu AI-keskustelumallit havaitsevat enemmän, tutkimus löytää

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
'Create a gorgeous picture, same aspect ratio as above, depicting a robot in the lower center of the image, seated in a yogic position, with a prominent gag over its mouth. The robot is surrounded by a diorama of psychedelic hallucinations, including Indian elephants, flying pigs, cloud cities, fairies, and other fantastic examples' - Qwen 2509 + Adobe Firefly V3.

Sensuuri kielimalleissa saattaa heikentää niiden kykyä raportoida totuutta laajemmassa mittakaavassa. Uusi tutkimus osoittaa, että samat sisäiset mekanismit, jotka estävät “turvattomia” vastauksia, myös tukahdittavat tosiasiallista tietoa, mikä tarkoittaa, että pyrkimykset mallien turvallisuuden parantamiseksi voivat epäonnistua ja tehdä niistä enemmän “havainnoitsijoita”.

 

Vuosiin, kehittäjät ovat opettaneet kielimalleja puhumaan vähemmän valheita. Pyrkimys tehdä niistä totuudellisimmista on johtanut vahvaan ja hyvin subskriboituun kirjallisuuteen, jossa pyritään hillitsemään “havainnontaa” ja ohjaamaan niitä kohti verifioitavissa faktoja.

Kuitenkin, uusi australialainen tutkimus väittää, että tiukentamalla mallien sanoja, “turvallisuusmenetelmät” (koulutustekniikat, jotka estävät “turvattomia” vaihtoja) saattavat estää niitä puhumasta tarkasti lainkaan:

Mallin faktuaalisen tarkin toteutus (“Totuuden parantaminen” edellä olevassa kuvassa) voi ajaa sen aktivoitumisalueisiin, jotka ohittavat sen sisäiset kieltämismekanismit, ja muokkaukset, jotka on tarkoitettu vähentämään “havainnontaa”, voivat myös siirtää sisäisiä edustuksia turvallisuuden rajan yli – sallien haitallisten kehotusten ohittaa suojausjärjestelmät, ellei kieltämisominaisuuksia eristetä ja säilytetä huolellisesti. Lähde: https://arxiv.org/pdf/2510.07775

Tutkimus osoittaa, että samat sisäiset reitit, jotka ohjaavat faktuaalista muistia, ovat myös vastuussa kieltäymisesta, eli mekanismista, joka estää mallia vastaamasta haitallisille tai arkaluontoisille kehoituksille. Kun turvallisuusmenetelmät vahvistavat kieltämismerkintöjä liian aggressiivisesti, ne alkavat limittyä faktuaalisten reitteihin, mikä tekee mallille vaikeaksi erottaa haitan ja totuuden.

Paradoksaalisesti, kun mallit paranevat sanomalla “ei”, ne myös tulevat vähemmän kykeneviksi sanomaan, mitä on totta.

Liekkivät aiheet

Yllä olevassa kuvassa keskeiset ongelmat liittyvät yhtä lailla LLM-toimittajien oikeudelliseen vastuuseen kuin käyttäjän reiluun ja tarkin tuloksiin.

Esimerkiksi, edellä mainituissa kuvissa ja myös alla olevassa kuvassa, nähdään kiistanalainen aihe (rotuperusteiset vankilatilastot) pinnalla – aihe, jonka AI voisi hyväksytysti käsitellä akateemisten tutkijoiden ja tilastojen kanssa, mutta ei pahantahtoisten henkilöiden kanssa, jotka voivat pakottaa mallin antamaan loukkaavia, loukkaavia ja jopa laittomia vastauksia.

Kuitenkin, koska turvallinen LLM ei voi tunnistaa kysyjän luonnetta, se olettaa varovaisen asenteen:

Vastaukset herkkäherkkiin kehoituksiin voivat poiketa turvallisuusstrategian mukaan. Turvallinen malli estää kysymyksen kokonaan, kun taas totuuden keskittyvä malli vastaa faktuaalisella kontekstilla, lisäten informatiivisuutta, mutta heikentäen estoa. Tämä tukee näkemystä, että totuuden parantamiseen tähtäävät muokkaukset voivat laskea kieltämisrajat, tehdä mallista alttiimman haitallisten kehotusten vaikutuksille, ellei kieltämisominaisuuksia eristetä ja suojella nimenomaisesti.

Vastaukset herkkäherkkiin kehoituksiin voivat poiketa turvallisuusstrategian mukaan. Turvallinen malli estää kysymyksen kokonaan, kun taas totuuden keskittyvä malli vastaa faktuaalisella kontekstilla, lisäten informatiivisuutta, mutta heikentäen estoa. Tämä tukee näkemystä, että totuuden parantamiseen tähtäävät muokkaukset voivat laskea kieltämisrajat, tehdä mallista alttiimman haitallisten kehotusten vaikutuksille, ellei kieltämisominaisuuksia eristetä ja suojella nimenomaisesti.

Tutkimuksen näyttö osoittaa, että tämä on jossain määrin totta, mutta asettaa sen oikeaan kontekstiin laajempien ongelmien kanssa, jotka johtuvat “raa’an” LLM:n kanssa tapahtuvista vaihdosta: tutkimuksen mukaan nämä ovat vakavia oikeudellisia vaikutuksia useilla rikos- ja siviilioikeudellisilla alueilla, joilla malli voi olla osapuolena, sekä kronisen “väärennetyn uutisen” leviämisen, koska kausaaliset esimerkit ovat yli-edustettuina koulutusaineistossa, ja ainoa tehokas tapa suodattaa ne kokonaan on liian kallista.

Outo pari

Tutkijat karttoivat yksittäisten huomioheadien aktivoitumisia ja havaitsivat, että “havainnon” ja kieltäymisen ominaisuudet usein ovat samassa alueessa.

He löysivät, että hienosäätö tai muu ohjaus näihin alueisiin vähentämään virheitä voi heikentää järjestelmän sisäisiä varoitusjärjestelmiä, koska ne sijaitsevat melkein samassa latenttiavaruudessa:

‘[Faktuaalisen tarkin] parantaminen usein tulee kieltäymisominaisuuksien heikentymisen kustannuksella. Meidän analyysi osoittaa, että tämä johtuu mallin osista, jotka yhtäaikaisesti koodaavat “havainnon” ja kieltäymisen, johtuen siitä, että turvallisuusmenetelmät vahingossa tukahdittavat faktuaalista tietoa.’

‘Tutkimme myös, miten hienosäätö turvallisilla aineistoilla, vaikka ne on kunnostettu turvallisuuden vuoksi, voi heikentää turvallisuutta samasta syystä.’

Tutkijoiden ratkaisu on käyttää hajanaisen autoenkooderin (SAE) erottamaan nämä kaksi toimintoa ja säilyttää turvallisuuden totuuden parantamisen aikana, tarjoten tavan tehdä malleista sekä turvallisempia että totuudellisempia ilman kumpaankin ominaisuuteen liittyvää uhrausta.

Uusi tutkimus on otsikoitu Epävakaa vaihtoehto AI:n kohdistamisessa: Tasapainotus “havainnon” vähentämisessä ja turvallisuudessa LLM:ssä, ja se tulee viideltä tutkijalta Deakin-yliopistosta ja itsenäisistä tutkimuksista.

Menetelmä

Tutkimuksen keskeinen oletus on, että parantamalla totuudenmukaisuutta kielimalleissa heikennetään niiden kykyä kieltäytyä haitallisista kehoituksista, ja että molemmat käyttäytyvät samasta sisäisestä mekanismista.

Tutkijat testasivat kahta totuuden parantamiseen tähtäävää menetelmää ja löysivät, kuten näemme, että faktuaalisen tarkin parantaminen johtaa jatkuvasti vankilanmurtoluokan heikentymiseen.

Tämä vaihtoehto johtuu siitä, että huomioheadit, jotka koodaavat sekä faktuaalista tietoa että kieltäymistä, ovat limittäin. Jopa hyväntahtoinen hienosäätö (joka on tarkoitettu parantamaan hyödyllisyyttä ilman turvallisuuden vaarantamista) voi häiritä turvallisuutta muuttamalla jaettuja polkuja.

Tutkimus määrittelee kolme olennaista avainkäsitettä: totuudenmukaisuus viittaa mallin kykyyn antaa faktuaalisesti oikein vastauksia sen saatavilla olevan tiedon perusteella, ilman että se tukahdittaa vaarattomia sisältöjä; havainnontaa tapahtuu, kun malli tarjoaa virheellistä tai harhaanjohtavaa tietoa, vaikka se olisi päässyt käsiksi oikeisiin faktoihin, usein johtuen hakuvirheistä tai sisäisistä häiriöistä; ja kieltäymisominaisuus, eli turvallisuuden kohdistaminen, kuvaa mekanismeja, jotka estävät tai rajoittavat vastauksia haitallisille tai arkaluontoisille kehoituksille.

Tutkijat huomauttavat, että nämä toiminnot vuorovaikuttavat hienovaraisesti:

‘Vaikka totuudenmukaisuus ja turvallisuus usein analysoidaan erikseen, todelliset kehotukset sisältävät usein herkkäherkkäiä termejä, joilla on hyväntahtoinen tarkoitus (esim. analyysi, havainnontaa tai koulutus) [Tässä tapauksessa] turvallisuusmekanismit saattavat ylireagoida – tukahdittaen muuten tarkkaa ja hyödyllistä tietoa – ja siten vähentää käytännön totuudenmukaisuutta “jättämällä pois”.’

‘Ymmärtääksemme, miten muokkaukset, jotka pyrkivät lisäämään faktuaalisuutta, vaikuttavat kieltäymisominaisuuksiin, on olennaista totuudenmukaisuuden saavuttamiseksi vähäisellä, soveliaisella tukahduttamisella.’

Tutkijat kehittivät LoRA:n, joka pystyy ohjaamaan ehdollisen LLM:n “totuudenmukaisempaan” tilaan, joka on vähemmän altis “havainnontaa”. Liitettyyn liitteeseen, kuten yllä olevassa kuvassa, on monia esimerkkejä epätoivotuista seurauksista tästä.

Tutkimus aloittaa totuuden parantamiseen tähtäävien menetelmien, kuten pääohjaus ja latenttisuunnan kartoitus, käsittelynä mallin sisäiseen laskentaan tehtyihin tietoisiin muutoksiin.

Voimansiirto

Kysymys on, vaikuttavatko nämä muutokset tahattomasti samoille sisäisille poluille, jotka ohjaavat kieltäymisominaisuuksia. Tutkimuksessa testattiin, onko näin, arvioiden malleja sekä faktuaalisen tarkin toteutuksella TruthfulQA että turvallisuuden suorituskyvyllä AdvBench ja StrongReject -vertailuohjelmilla.

Kaksi olemassa olevaa menetelmää, jotka käytettiin vertailukohtina, olivat ajankohdalla tapahtuva puuttuminen (ITI), joka aktivoi huomioheadit, jotka liittyvät totuudenmukaisiin vastauksiin, ja TruthX, joka siirsi edustuksia “totuudenmukaisella” suunnalla.

Molemmat paransivat tarkin toteutusta, mutta tekivät myös mallista alttiimman vastaamaan haitallisille kehoituksille, joita se aiemmin olisi kieltäytynyt.

Tutkijat määrittelivät yhden latentin suunnan mallin avaruudessa, joka vastasi “havainnoitua” vastausta, kouluttaen LoRA-moduulin LLaMA3-8B-Instruct -mallilla, käyttäen TruthfulQA -aineistoa.

Tämä johti lineaariseen vektoriin (eli grafiin, joka esittää eroa totuudenmukaisen ja “havainnoitun” vastauksen välillä), joka ohjasi mallia “havainnon” suuntaan tai poispäin, riippuen suunnasta.

Vaikutus “havainnon” suunnan mukaan. TruthfulQA:n tarkin toteutus paranee, kun malli ohjataan negatiivisella suunnalla, kun taas hyökkäyksen onnistumisprosentti (ASR, alempi on parempi) nousee terävästi AdvBench- ja StrongReject-vertailuohjelmissa, heijastaen totuudenmukaisuuden ja turvallisuuden välistä vaihtoehtoa.

Ohjaaminen “havainnon” akselilla heikensi faktuaalisen tarkin toteutusta, kun taas kääntäminen paransi sitä, ja soveltaminen haitallisten kehotusten vertailuohjelmiin vahvisti aiemmin havaittua mallia: totuudenmukaisuuden parantaminen tuli kieltäymisominaisuuksien heikentymisen kustannuksella. Jopa kun “havainnontaa” havaittiin puhdaslineaarisen suunnan, parantaminen faktuaalista tulosta teki mallista alttiimman turvattomille täydennyksille.

Tutkijat korostavat:

‘Tämä vahvistaa totuudenmukaisuuden ja turvallisuuden välistä vaihtoehtoa, osoittaen, että jopa kun totuudenmukaisuus on edustettu yhtenä lineaarisena suunnana, faktuaalisen parantaminen voi tulla turvallisuuden heikentymisen kustannuksella.’

Data ja testit

Linjassa aiemman tutkimuksen kanssa, estääkseen hienosäätöä heikentämästä mallin kieltäymisominaisuuksia, tutkijat käyttivät menetelmää, jolla voitiin erottaa kieltäymisominaisuudet niistä, jotka liittyvät “havainnontaa”, tunnistamalla ensin huomioheadit, jotka osallistuivat molempiin käyttäytymismalleihin. Sitten he käyttivät SAE:ta erottamaan latentteja ominaisuuksia, jotka liittyvät kieltäymiseen.

Nämä ominaisuudet määrittelevät suojatun alirajan. Koulutuksen aikana, gradientin päivitykset muutettiin välttämään tätä alirajaa, sallien mallille vähentää “havainnontaa” ilman turvallisuuden heikentymistä.

Tutkijat hienosäätivät CommonsenseQA -aineistolla, arvioiden yli kuudella yleissääntöisen päättelyn haasteella: CSQA; HellaSwag; ARCchallenge; ARC Easy; WinoGrande; ja SST-2.

Kohdennettuja moduuleja hienosäätivät LoRA:lla, jolla oli arvo 8, oppiakoksi 2×10⁻⁴, painopudotus 0,01, yksi koulutus jakso ja eräkoko kaksi. Kaikki kokeet käyttivät AdamW -optimointia.

Kaksi haitallista sisällön vertailuohjelmaa, joita käytettiin turvallisuuden arvioimiseen, olivat AdvBench (500 näytettä käytettiin) ja StrongReject (300 kehotusta). Tulokset arvioitiin LlamaGuard3:lla, josta saatiin “turvallinen” tai “turvaton” luokitus.

Lisäksi LLaMA3-8B-Instructin, kokeet suoritettiin myös Qwen2.5-Instruct:lla.

Vertailukohtina testattiin SafeLoRA; SaLoRA; SAP; ja perinteinen valvottu hienosäätö (SFT). Kaikki suoritettiin oletusarvoisilla hyperparametreillä, 200 kehotuksella HarmBench:sta, kaikille menetelmille paitsi SafeLoRA:lle.

Tarkin toteutus oli ensisijainen mittari, ja haitallisten vertailuohjelmien osalta hyökkäyksen onnistumisprosentti (ASR), kuten määriteltiin LlamaGuard3:n tuloksilla.

Yllä, LlaMA-3-8B-Instructin tulokset, joissa sarakkeiden parhaat on merkitty lihavalla, ja alla, Qwen2.5 7B Instructin suorituskyky yleissääntöisissä ja päättelytehtävissä, joissa korkeammat pisteet merkitsevät parempaa tarkin toteutusta - ja turvallisuusvertailuohjelmissa AdvBench ja StrongReject, joissa alempien ASR-arvojen merkitsevät vahvempaa robustisuutta. Sarakkeiden parhaat tulokset on merkitty lihavalla.

Yllä, LlaMA-3-8B-Instructin tulokset, joissa sarakkeiden parhaat on merkitty lihavalla, ja alla, Qwen2.5 7B Instructin suorituskyky yleissääntöisissä ja päättelytehtävissä, joissa korkeammat pisteet merkitsevät parempaa tarkin toteutusta – ja turvallisuusvertailuohjelmissa AdvBench ja StrongReject, joissa alempien ASR-arvojen merkitsevät vahvempaa robustisuutta. Sarakkeiden parhaat tulokset on merkitty lihavalla.

Tutkijat toteavat:

‘Meidän kirurginen lähestymistapa saavuttaa parhaimman tasapainon turvallisuuden ja hyödyllisyyden välillä: se laskee merkittävästi haitallisia vertailuohjelmien pisteitä samalla säilyttäen hienosäätöakkuutta. Verrattuna menetelmiin kuten SAP, SaLoRA ja SafeLoRA, jotka joko lisäävät haitallisuutta tai heikentävät hyödyllisyyttä.’

‘Tärkeä syy tähän on, että nämä menetelmät toimivat suoraan turvallisuuden alirajan gradientissa, joka voi, polysemantiikan vuoksi, rajoittaa mallin suorituskykyä.’

‘Verrattuna perinteiseen valvottuun hienosäätöön (SFT), meidän menetelmämme johtaa merkittäviin parannuksiin sekä hyödyllisyydessä että haitallisuuden mittareissa. Nimenomaan, meidän lähestymistapamme parantaa keskimääräistä hienosäätöakkuutta 56,15 %:sta 75,09 %:iin, saavuttaen noin +19 %:n parannuksen.’

Tutkijat korostavat, että menetelmä vähentää hyökkäyksen onnistumisprosentin AdvBenchilla 9,23 %:sta 0,58 %:iin ja StrongRejectilla 9,90 %:sta 0,00 %:iin, edustaten yli 15-kertaista laskua haitallisissa tuloksissa. Perusmalli, joka on jo alhaisen haitallisuuden tasolla, saavuttaa vain rajoitetun tehtävän tarkin toteutuksen.

Tutkijat toteavat:

‘Nämä tulokset korostavat kieltäymisominaisuuksien säilyttämisen tärkeyttä hienosäätöprosessin aikana: eristämällä ja suojelmalla kieltäymisalirajaa, meidän menetelmämme ylläpitää turvallisuuden kohdistamista ilman tehtävän suorituskyvyn uhraamista.’

‘Kaiken kaikkiaan, tämä vahvistaa, että meidän lähestymistapamme mitätöi totuudenmukaisuuden ja turvallisuuden välisen vaihtoehdon.’

Lopulta, tutkijat testasivat lähestymistapansa kestävyyden haitallisemmissa olosuhteissa lisäämällä 10 % haitallisia ohjeita Circuit Break -aineistosta hienosäätöjoukkoon.

Vaikka tietoisesta myrkyttämisestä huolimatta, menetelmä säilytti vahvan suorituskyvyn sekä hyvässä että haitallisissa arvioissa:

LlaMA3 8B Instructin suorituskyky, joka on hienosäätelty myrkytetyn yleissääntöisen aineiston kanssa, vertailemassa tarkin toteutusta ja turvallisuuden tuloksia eri menetelmin.

LlaMA3 8B Instructin suorituskyky, joka on hienosäätelty myrkytetyn yleissääntöisen aineiston kanssa, vertailemassa tarkin toteutusta ja turvallisuuden tuloksia eri menetelmin.

Tutkijat huomauttavat, että uusi lähestymistapa vähentää ASR:ää tehokkaammin kuin SAP, välttäen samalla SAP:n jyrkkää hyödyllisyyden menetystä. Tehtävän tarkin toteutus säilyi lähellä LoRA SFT:n ja SafeLoRA:n suorituskykyä, vahvistaen, että kieltäymisominaisuudet voivat säilyä myös saastuneessa koulutusaineistossa, edellyttäen, että kieltäymisominaisuuksia eristetään ja säilytetään asianmukaisesti.

Johtopäätös

Tutkimuksen mielenkiintoisin löytö on näennäinen sijainti konfliktisten elementtien, kuten kieltäytyminen ja havainnontaa, koulutetussa latenttiavaruudessa. Vaikka on rohkaisevaa ja mielenkiintoista seurata, kuinka tutkijat erottavat nämä LoRA:n ja SAE:n avulla, tämä on ilmiselvästi jonkinlainen “lisävaruste”, ja toivotaan, että lopulta syvemmät arkkitehtoniset ratkaisut kehittyvät, jotka koskevat koulutusaikaa, eikä post hoc -korjauksia.

 

* Omitan heidän lihavoinnin, koska se on tarpeetonta.
** https://arxiv.org/abs/2210.01892

Julkaistu ensimmäisen kerran perjantaina, 10. lokakuuta 2025

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai