AI-mallit ja alustat
Mitä ovat LLM-harhat? Syyt, eettinen huolenaihe ja ehkäisy
Laajat kielen mallit (LLM) ovat tekoälyjärjestelmiä, jotka pystyvät analysoimaan ja generoimaan ihmisen kaltaista tekstiä. Mutta niillä on ongelma – LLM:t harhailevat, eli keksivät asioita. LLM-harhat ovat saaneet tutkijat huolestumaan tämän alan edistymisestä, sillä jos tutkijat eivät voi hallita mallien tuloksia, he eivät voi rakentaa kriittisiä järjestelmiä palvelemaan ihmiskuntaa. Lisää tästä myöhemmin.
Yleensä LLM:t käyttävät valtavia määriä koulutusdataa ja monimutkaisia oppimisalgoritmeja luodakseen realistisia tuloksia. Joissakin tapauksissa kontekstipohjainen oppiminen käytetään kouluttamaan näitä malleja vain muutamalla esimerkillä. LLM:t ovat yhä suositumpia eri soveltamisaloilla, kuten konekäännöksessä, mielipideanalyysissä, virtuaalisessa AI-avustuksessa, kuva-analyysissä, luonnollisen kielen käsittelyssä jne.
Vaikka LLM:t ovat alan huipputeknologiaa, ne ovat silti alttiita harhaluuloille, virheille ja harhoille. Yann LeCun, Meta:n nykyinen päällikkö AI-tutkimuksessa, mainitsi äskettäin keskeisen virheen LLM:eissä, joka aiheuttaa harhoja: “Laajat kielen mallit eivät ole tietoisia todellisuudesta, jota kieli kuvailee. Nämä järjestelmät generoivat tekstiä, joka kuulostaa hyvältä, kieliopillisesti ja semanttisesti, mutta niillä ei ole objektiivista tavoitetta muuta kuin tyydyttää tilastollinen johdonmukaisuus aloitustekstiin”.
Harhat LLM:eissä

Kuva Gerd Altmann Pixabaysta
Harhat tarkoittavat mallin generoimia tuloksia, jotka ovat kieliopillisesti ja semanttisesti oikein, mutta eivät liity todellisuuteen ja perustuvat väärään oletukseen. Harha on yksi tärkeimmistä eettisistä huolenaiheista LLM:eissä, ja se voi johtaa haitallisiin seurauksiin, kun käyttäjät ilman riittävää alan tuntemusta alkavat luottaa yhä vakuuttavampiin kielen malleihin.
Tietty määrä harhailua on väistämätöntä kaikissa autoregressiivisissa LLM:eissä. Esimerkiksi malli voi liittää väärennetyn lainauksen julkkikseen, jota ei koskaan ole sanottu. Ne voivat väittää jotain tietystä aiheesta, joka on tosiasiallisesti väärä tai mainita olemattomia lähteitä tutkimusraporteissa, levittäen virheellistä tietoa.
Kuitenkin saada AI-mallit harhailemaan ei aina ole haitallista. Esimerkiksi uusi tutkimus osoittaa, että tutkijat ovat löytäneet “uusia proteiineja, joilla on rajaton määrä ominaisuuksia” harhailevien LLM:ien avulla.
Mikä aiheuttaa LLM-harhat?
LLM:t voivat harhailla monien tekijöiden vuoksi, kuten ylioppimisvirheiden, koodaus- ja dekoodausvirheiden ja koulutusvirheiden vuoksi.
Ylioppiminen

Kuva janjf93 Pixabaysta
Ylioppiminen on ongelma, jossa AI-malli sopeutuu koulutusdataan liian hyvin, mutta ei voi edustaa koko syötteen määrää, jota se voi kohtaamalla, eli se ei pysty yleistämään ennustevääntään uusiin, näkemättömiin tietoihin. Ylioppiminen voi johtaa mallin tuottamaan harhailuja.
Koodaus- ja dekoodausvirheet

Kuva geralt Pixabaysta
Jos koodauksessa ja dekoodauksessa tapahtuu virheitä, se voi myös aiheuttaa mallin tuottamaan järjettömiä ja virheellisiä tuloksia.
Koulutusvirhe

Kuva Quince Creative Pixabaysta
Toinen tekijä on tietynlainen koulutusdataan sisältyvä virhe, joka voi aiheuttaa mallin antavan tuloksia, jotka edustavat näitä virheitä eikä itse dataa. Tämä on samanlaista kuin koulutusdatan puute, joka rajoittaa mallin kykyä yleistää uusiin tietoihin.
LLM:ien monimutkainen rakenne tekee siitä hyvin haastavaa AI-tutkijoille ja käytännön soveltajille tunnistaa, tulkita ja korjata näiden harhailujen taustalla olevat syyt.
LLM-harhojen eettiset huolenaiheet
LLM:t voivat ylläpitää ja vahvistaa haitallisia virheitä harhailujen kautta ja voivat siten vaikuttaa negatiivisesti käyttäjiin ja aiheuttaa haitallisia sosiaalisia seurauksia. Jotkut näistä tärkeimmistä eettisistä huolenaiheista ovat lueteltu alla:
Syrjivä ja myrkyllinen sisältö

Kuva ar130405 Pixabaysta
Koska LLM:ien koulutusdata on usein täynnä sosio-kulttuurisia stereotypioita johtuen sisäänrakennetuista virheistä ja puutteista, LLM:t voivat tuottaa ja vahvistaa näitä haitallisia ideoita heikkojen ryhmien vastaisesti yhteiskunnassa.
Ne voivat generoida tätä syrjivää ja vihamielistä sisältöä rotuun, sukupuoleen, uskontoon, etnisyyteen jne. perustuen.
Yksityisyyden ongelmat

Kuva JanBaby Pixabaysta
LLM:t koulutetaan valtavalla koulutusaineistolla, joka usein sisältää yksityisiä tietoja. On ollut tapauksia, joissa nämä mallit loukkasivat ihmisten yksityisyyttä. Ne voivat vuotaa tiettyjä tietoja, kuten sosiaaliturvatunnuksia, kotiosoitteita, puhelinnumeroita ja lääketietoja.
Väärät tiedot ja disinformaatio

Kuva geralt Pixabaysta
Kielen mallit voivat tuottaa ihmisen kaltaista sisältöä, joka näyttää oikeudelta, mutta on itse asiassa väärä ja ei perustu empiirisiin todisteisiin. Tämä voi olla tahaton, johtaen väärään tietoon, tai siinä voi olla pahantahtainen tarkoitus levittää disinformaatiota. Jos tämä jätetään tarkkailtamatta, se voi luoda haitallisia sosiaalisia, kulttuurisia, taloudellisia ja poliittisia suuntauksia.
LLM-harhojen estäminen

Kuva athree23 Pixabaysta
Tutkijat ja käytännön soveltajat ovat ottaneet erilaisia lähestymistapoja LLM-harhojen ongelman ratkaisemiseksi. Niihin kuuluvat koulutusdatan monipuolisuuden parantaminen, sisäänrakennettujen virheiden poistaminen, parempien sääntötekniikoiden käyttäminen ja vastustuskykyisen koulutuksen sekä vahvistusoppimisen soveltaminen:
- Paras sääntötekniikka on avain LLM-harhojen ratkaisemiseen. Ne estävät ylioppimisen ja muita ongelmia, jotka aiheuttavat harhoja.
- Data-augmentaatio voi vähentää harhailujen määrää, kuten tutkimus osoittaa. Data-augmentaatio sisältää koulutusjoukon lisäämisen lisäämällä satunnaisen tokenin lauseen mihin tahansa kohtaan. Se kaksinkertaistaa koulutusjoukon koon ja aiheuttaa harhailujen määrän laskun.
- OpenAI ja Google DeepMind kehittivät tekniikan nimeltä vahvistusoppiminen ihmisten palautteen kanssa (RLHF) ratkaisemaan ChatGPT:n harhailuongelmaa. Se sisältää ihmisen arvioijan, joka tarkistaa mallin vastauksia säännöllisesti ja valitsee parhaan käyttäjän aloitustekstiin. Tätä palautetta käytetään sitten mallin käyttäytymisen säätämiseen. OpenAI:n pääjohtaja Ilya Sutskever mainitsi äskettäin, että tämä lähestymistapa voi ratkaista harhailuongelman ChatGPT:ssä: “Olen hyvin toiveikas, että parantamalla vain tätä jälkikäteen vahvistusoppimista ihmisten palautteen avulla voimme opettaa sen olemaan harhailematta”.
- Harhailun sisällön tunnistaminen ja sen käyttäminen tulevaisuuden koulutuksessa on myös menetelmä harhailujen torjumiseksi. Uusi tekniikka havaitsee harhailut tokenin tasolla ja ennustaa, onko jokainen token tulosteessa harhailu. Se sisältää myös menetelmän harhailujen havaitsemiseen valvomattomasti.
Yksinkertaisesti sanottuna, LLM-harhat ovat kasvava ongelma. Ja vaikka pyritään ratkaisemaan ongelmaa, vielä on paljon työtä tehtävänä. Näiden mallien monimutkaisuus tekee siitä haastavaa tutkijoille ja käytännön soveltajille tunnistaa ja korjata harhailujen taustalla olevat syyt oikein.
Kuitenkin jatkuvan tutkimuksen ja kehityksen ansiosta on mahdollista lieventää LLM-harhoja ja vähentää niiden eettisiä seurauksia.
Jos haluat tietää enemmän LLM:eistä ja ehkäisytekniikoista, joita kehitetään LLM-harhojen korjaamiseksi, tutustu unite.ai:iin laajentamaan tietojasi.













