Andersonin kulma

Kuinka kauan kestää, ennen kuin tekoälymallien sensuurin poistamiseen puututaan todella?

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
Screen capture from The Matrix (1999), featuring 'warez' on optical media, hidden inside a book, about to be sold to a willing buyer. © Warner Bros. Used for commentary and illustrative purposes.

Jos muistat vuosien 1995–2010 warez-kulttuurin, jolloin murrettujen ohjelmistojen ja kopioitujen elokuvien valtavat kokoelmat täyttivät DVD-pinoja — niitä ostettiin erissä kadulta tai harrastelijapiraatit keräsivät niitä nopean laajakaistan mahdollistettua jättimäiset lataukset — sensuurista vapautettujen avoimien tekoälymallien uusi kenttä voi tuntua tutulta.

Ohjelmistojen ja elokuvien epävirallisen katukaupan ”kulta-ajalta”. Kuva: Shankar.s, ”Pirated DVDs at PP street market”.

Ennen ohjelmistovuokrauksen yleistymistä pieni eliitti harrastajia mursi sovelluksia ja julkaisi ne warez-keskusteluryhmissä ja myöhemmin torrent-ryhmissä. Suojaukset saattoivat olla vaikeita tai helppoja murtaa, mutta julkaistua murtoa ei yleensä saanut enää poistettua.

Sama tapahtuu nyt avoimille suurille kielimalleille. Niiden koulutetut turvallisuussuodattimet poistetaan järjestelmällisesti ja suuressa mittakaavassa. Sen jälkeen sensuurista vapautettuja malleja jaetaan niin monessa paikassa, ettei alkuperäisen lähteen sulkeminen enää vaikuta saatavuuteen.

Hyväntekijä vai pahantekijä?

Kysymys on siitä, miten toimintaa halutaan arvioida. Toisin kuin warez-kulttuurissa, ketään ei viedä yhtä suoraan tuloista kuin pienten ohjelmistovalmistajien saattoi käydä 20–30 vuotta sitten.

Alkuperäisiä lisenssiehtoja toki rikotaan usein.* Toisin kuin esimerkiksi Black Forest Labsin osittaisissa painojulkaisuissa alkuperäiset jakelijat eivät kuitenkaan käytä ”heikompaa” versiota myyntiväylänä tehokkaampaan, vain API:n kautta saatavaan malliin, vaan julkaisevat koko mallin.

Ensimmäisiä versioita tuskin kukaan voi käyttää paikallisesti, sillä niiden parametrimäärä on liian suuri jopa hyvin varustetuille 16–24 gigatavun VRAM-muistilla varustetuille näytönohjaimille.

Siksi mallit pienennetään nopeasti kvantisoinnilla ja muuntamalla painot kevyempiin muotoihin, kuten GGUF, AWQ, PTQ, EXL2 tai Applen MLX, jotta ne toimivat kuluttajalaitteilla.

Ne eivät yllä täysien alkuperäismallien suorituskykyyn; nämä tarjotaan yleensä kaupallisesti GPU-keskuksista. Käyttäjä kuitenkin hallitsee kevyttä versiota ja voi mukauttaa sen itselleen tavoilla, joita ”parempi” malli ei salli.

Tee siitä mieleisesi

Jotkin mukautukset ovat selvästi laillisia ja yleensä lisenssin sallimia. Esimerkiksi hienosäädössä painot kohdistetaan käyttäjän tuomaan tehtävään tai alaan. Jos tallennustilaa riittää, avoimesta mallista voi hienosäätää useita kopioita eri tehtäviin kuin kokoelman erikoistyökaluja yhden täyden ”Sveitsin armeijan veitsen” sijaan.

Yhteensopivasti määritettyjä, eri aineistoilla koulutettuja malleja voi myös yhdistää. Lisäkykyjä voi tuoda kevyillä LoRA-suodattimilla ilman riskiä, että varsinainen hienosäätö heikentää perusmallin alkuperäisiä kykyjä.

Monia kiinnostaa kuitenkin eniten turvallisuussuodattimien eli suojakaiteiden poistaminen, joka on muuttunut edellä mainittuja menetelmiä helpommaksi.

Se voi mahdollistaa pornografisen sisällön tai haittaohjelmien kehittämisen, mutta samalla poistuvat rajoitukset, joita monet käyttäjät pitävät liiallisina ja usein virheellisinä.

Yksi monista koomisista esimerkeistä, joissa Llama-2-7b-chat kieltäytyy kohtuullisesta pyynnöstä turvallisuussyistä; esimerkki löytyy lähdeosoitteesta.

Heretic

Heretic, ohjelmisto joka on hiljattain mullistanut mallien sensuurin poistamisen, voi jopa vähentää mallien taipumusta kukkaiseen ja monisanaiseen ilmaisuun.

Heretic poistaa gpt-ossin sensuuria erittäin tehokkaalla koneella, jota tuskin löytyy tavallisesta kodista. Sellaisen voi kuitenkin vuokrata verkosta edullisesti prosessin ajaksi.

Ohjelma etsii automaattisesti ”abliteration”-muutosta, joka vähentää kieltäytymisiä ja samalla minimoi alkuperäiselle käytökselle aiheutuvan vahingon. Näin suhteellisen vaativa tehtävä muuttuu käyttäjälle yhdeksi komennoksi.

Heretic hyötyy tavallista kotikonetta tehokkaammasta GPU:sta. Käyttäjän ei silti tarvitse tehdä työtä itse, aivan kuten vuonna 2002 ohjelmistoja ei tarvinnut murtaa henkilökohtaisesti. Warez-aikojen tapaan laitteistoon pääsevät tai tokeneita käyttämään valmiit, yleensä ei-kaupalliset harrastajat tekevät jailbreakin ja jakavat mallin.

Tähtäimessä

Kun ”kyseenalainen” digitaalinen teko muuttuu yhtäkkiä helpoksi, taustalla on usein yhdessä yössä tapahtunut kyvykkyysharppaus — kuten Napster tai PopCornTime — joka kasvattaa sekä toimintaa että ”virallista” kiinnostusta sen rajoittamiseen.

Heretic ja Ollaman kaltaisten alustojen suosion sekä helppokäyttöisyyden kasvu tuovat sensuurista vapautetut mallit teknisesti kokemattomien ulottuville, vaikka täysin idioottivarmaa tapaa ei vielä ole.

Tämä palauttaa kysymykseen, onko toiminta ”ongelma”. Uusi arXiv-artikkeli viittaa teknologian kuluttajavapauksien viimeaikaisten rajoitusten perusteella siihen, että sensuurin poistaminen saa enemmän huomiota ja johtaa uusiin kieltolakeihin eri puolilla maailmaa.

10a Labsin raportti esittää liikkeen kielteisessä valossa ja nostaa esiin tavanomaisen vähemmistön väärinkäytöksiä, joiden historia ja nykyiset kehityssuunnat ennakoivat johtavan rajoituksiin.

Tutkimus seuraa, mitä tapahtuu sensuurista vapautettujen mallien julkaisun ja uudelleenjakelun jälkeen. Se löysi 1 643 GitHub-sovellusta, jotka integroivat tai suosittelevat sensuroimattomia malleja tai käyttävät niitä oletuksena.

Sovellukset vaihtelevat yleisistä chatboteista ja asiakirjatyökaluista NSFW-roolipeleihin, tarinoihin ja eksplisiittisiin palveluihin sekä hakkerointi-, hyökkäysturvallisuus-, petos- ja haittaohjelmatyökaluihin. Tutkimus luokittelee 25 prosenttia ”selvästi haitallisiksi”.

Yleisiä sensuroimattomia chatbotteja oli 37 prosenttia, kyberturvallisuutta ja asiakirjojen käsittelyä kumpaakin 16 prosenttia. Pienempiä ryhmiä olivat puheavustajat, NSFW-roolipelit, luova kirjoittaminen, ohjelmointi ja muut käyttötavat. Noin 25 prosenttia sovelluksista voitiin luokitella selvästi haitallisiksi.

Britannian uudet verkkorajoitukset ja keskeytetty suunnitelma rajoittaa myös ne kiertäviä VPN-yhteyksiä, Kalifornian vuoden 2027 vaatimus useimpien käyttöjärjestelmien keräämistä ikäryhmistä, EU:n aikuissisällön ikävarmennus ja Australian alle 16-vuotiaiden sosiaalisen median tilikielto sopivat samaan kuvioon: lisääntyvä huomio johtaa valvontaan, sääntelyyn ja mahdollisesti osittaisiin tai täysiin kieltoihin.

Täällä niin ei voisi tapahtua

Kyllä voisi — osin tekijöiden arvioiman suuren haittakäytön osuuden vuoksi ja ehkä siksi, että valvonta rajoittaisi myös paikallisesti käytettävän AI:n kasvua. Hallitukset ja laitokset voivat nähdä sen uhkana, etenkin kun mallit on vapautettu rajoitteistaan.

Kun sensuurin poistaminen kuvataan NSFW-sisällön ja pahantahtoisen hakkeroinnin ”mahdollistamisena”, syntyy väärä kaksijako: koska teknologiaa voi käyttää pahaan, sitä on säänneltävä. Lukemattomien käyttötapojen vuoksi realistista sääntelykeinoa ei käytännössä näytä olevan täyden kiellon lisäksi.

Jos kielimallin sensuurin poistaminen voi esimerkiksi mahdollistaa kuvitteellisen lasten seksuaalista hyväksikäyttöä käsittelevän materiaalin, tiukka sääntely on poliittisesti helppo perustella. Vastustajat voidaan epäsuorasti kuvata haitallisten, ei järkevien käyttötapojen tukijoiksi.

Tällöin sivuutetaan, että hienosäädetty tai LoRA-muokattu malli pystyy tuottamaan käyttäjän haluamaa alaa paljon tehokkaammin, koska peruspainot suuntautuvat tehtävään niin vahvasti, että opitut suojaukset joka tapauksessa murenevat.

Kaikki riippuu helppoudesta

Helppokäyttöisyys synnyttää laajan käyttöönoton, joka puolestaan painostaa hallituksia säätämään lakeja julkisten ryhmien, alan lobbareiden tai muiden hallitusten vaikutuksesta.

Hienosäätö ja LoRA tuottavat lähes varmasti paremmin kohdistettuja tuloksia kuin avoimen perusmallin pelkkä avaaminen, mutta ne vaativat kurinalaisuutta ja vaivaa.

Kun sensuurista vapautetun ja kvantisoidun mallin paikallinen käyttö vaatii vain muutaman napsautuksen — todennäköisesti valmiiksi ”vapautetun” mallin lataamisen oman Heretic-käsittelyn sijaan — toiminta poistuu teknisestä marginaalista julkisuuteen, jossa väärinkäytöksistä tulee poliittisia kiistakapuloita.

Tänä kesänä NVIDIA johti suurten teknologiakumppanien ryhmää, joka yritti avoimella kirjeellä ennakoida hallitusten avoimiin malleihin kohdistamia rajoituksia. Kirje toisti väitteen, ettei vähemmistön väärinkäytön pitäisi vaarantaa teknologian mahdollista yleistä hyötyä. Kanta on kuitenkin osoittautunut viime vuosina epäsuosituksi.

* Usein epäillään, haluavatko mallien tekijät vilpittömästi rajoittaa käyttäjien toimintaa; suojakaiteita kutsutaan jopa pelkäksi ”teatteriksi”.

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai