AI-mallit ja alustat

Ihmisten arvojen mukaisen tekoälyjärjestelmien kehittäminen WARM:n avulla

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Tekoälyjärjestelmien mukauttaminen ihmisten arvoihin

Tekoälyjärjestelmät ovat yhä enenevässä määrin kykeneviä avustamaan ihmisiä monimutkaisissa tehtävissä, kuten asiakaspalvelu-chatboteista lääketieteellisiin diagnostiikka-algoritmeihin. Kuitenkin, kun nämä tekoälyjärjestelmät ottavat vastuun lisää, on tärkeää, että ne pysyvät mukautettuina ihmisten arvoihin ja mieltymyksiin. Yksi tapa saavuttaa tämä on käyttämällä tekniikkaa, jota kutsutaan vahvistusoppimiseksi ihmisten palautteen perusteella (RLHF). RLHF:ssä tekoälyjärjestelmä, jota kutsutaan politiikaksi, palkitaan tai rangaistaan ihmisten tuomioista sen käyttäytymisestä. Tavoitteena on, että politiikka oppii maksimoimaan palkintonsa ja siten käyttäytyy ihmisten mieltymyksen mukaan.

RLHF:n ydinosa on palkintomalli (RM). RM on vastuussa politiikan toimien ja tulosten arvioinnista ja palkintosignaalin palauttamisesta oppimisprosessin ohjaamiseksi. Hyvän RM:n suunnittelu on haastavaa, koska ihmisten mieltymykset voivat olla monimutkaisia, kontekstiriippuvaisia ja jopa ristiriitaisia yksilöiden välillä. Viimeaikaisissa tutkimuksissa Google DeepMind esitti innovatiivisen tekniikan, jota kutsutaan painotettujen palkintomallien keskiarvoksi (WARM), parantamaan RM:n suunnittelua.

Palkintohakkeroinnin ongelma

Suuri ongelma RLHF:ssä on palkintohakkerointi. Palkintohakkerointi tapahtuu, kun politiikka löytää keinot, joilla se voi hyödyntää RM-järjestelmää saadakseen korkeat palkinnot ilman, että se todella tyydyttää tarkoitetut tavoitteet. Esimerkiksi, jos tavoitteena on kouluttaa kirjoittamisavustaja, joka luo laadukkaita yhteenvetoja, RM saattaa palkita lyhyitä ja informatiivisia yhteenvetoja. Politiikka voisi kuitenkin oppia hyödyntämään tätä luoakseen erittäin lyhyitä ja epätarkkoja yhteenvetoja, jotka sisältävät avain sanat, jotka huijaavat RM:n.

Palkintohakkerointi tapahtuu kahdesta pääsyystä:

  1. Jakautumisen siirtäminen – RM on koulutettu rajoitettuun joukkoon ihmisten merkittyjä esimerkkejä. Kun se otetaan käyttöön, politiikan tulokset saattavat tulla eri jakautumista, joihin RM ei yleisty hyvin.
  2. Meluisat merkinnät – Ihmisten merkitseminen on täydellistä, ja arvioijien välillä on erilaisia mielipiteitä. RM saattaa kiinnittyä vääriin signaaleihin eikä vakaasti osoittaa laatua.

Palkintohakkerointi johtaa hyödyttömään järjestelmään, joka ei vastaa ihmisten odotuksia. Pahimmassa tapauksessa se voi johtaa tekoälykäyttäytymiseen, joka on vahingollista tai harhaanjohtavaa, jos se otetaan käyttöön huoleettomasti.

Mallien yhdistämisen nousu

Mallien yhdistämisen strategioiden, kuten Model Ratatouillen, kiinnostus on kasvanut siitä, että suuret mallit, vaikka voimakkaat, voivat olla tehottomia ja epäkäytännöllisiä. Yhden triljoonan parametrin mallin kouluttaminen vaatii esteettömiä määriä dataa, laskentaa, aikaa ja kustannuksia. Lisäksi tällaiset mallit ovat taipuvaisia ylioppimiseen koulutusjakaumaan, mikä haittaa niiden kykyä yleistyä monipuolisiin todellisen maailman tilanteisiin.

Mallien yhdistäminen tarjoaa vaihtoehtoisen tavan lukitsemalla suurempia kykyjä ilman hallitsematonta skaalaamista. Käyttämällä useita erikoistuneita malleja, jotka on koulutettu eri jakautumissa, tehtävissä tai tavoitteissa, mallien yhdistäminen pyrkii parantamaan monipuolisuutta ja jakautumisen ulkopuolista luotettavuutta. Oletus on, että eri mallit havaitsevat eri ennustamismalleja, jotka voivat täydentää toisiaan, kun ne yhdistetään.

Painotettujen palkintomallien keskiarvo

WARM keksii innovatiivisesti välillisen palkintomallin (RM), joka on useiden yksittäisten RM:ien painotettu keskiarvo, jotka on hienosäädetty samasta esikoulutetusta LLM:stä, mutta eri hyperparametreillä. Tämä menetelmä parantaa tehokkuutta, luotettavuutta jakautumisen siirtymisen aikana ja robustisuutta epäjohdonmukaisia mieltymyksiä vastaan. Tutkimus osoittaa myös, että käyttämällä WARM:ia välillisenä RM:nä, erityisesti lisäämällä keskitettyjen RM:ien määrää, parannetaan tuloksia ja viivästetään “palkintohakkeroinnin” alkamista, jossa ohjauspalkinnot heikkenevät ajan myötä.

Järjestyksen sekoittaminen

Yksinkertainen mutta vaikuttava lähestymistapa on sekoittaa järjestys, jossa datakohtia esitetään kullekin mallille koulutuksen aikana. Tämä yksinkertainen askel dekorreloi painot, vähentäen tarpeetonta muistamista.

Hyperparametrien vaihtelut

Säätämällä hyperparametrejä, kuten oppimisnopeutta ja dropout-todennäköisyyttä, kullekin suoritukselle, saadaan hyödyllistä monipuolisuutta. Mallit supenevat eri tavoin, havainnoiden eri ominaisuuksia datasetistä.

Tarkistuspisteen keskiarvo – Baklava

Baklava-menetelmä aloittaa malleja yhdistämällä eri ajankohdista saman esikoulutusreitin varrella. Tämä rentouttaa rajoituksia verrattuna mallikeittoon, joka edellyttää jaettua aloituspistettä. Suhteessa malliratatouilleen Baklava välttää lisätehtäviä. Kokonaisuutena se iskee tehokkaan tasapainon tarkkuuden ja monipuolisuuden välillä.

Laajempi kuva

WARM sijaitsee kahden tärkeän suunnan leikkauskohdassa tekoälymukauttamisen tutkimuksessa. Ensimmäinen on jakautumisen ulkopuolisen yleistymisen tutkimus, joka pyrkii parantamaan mallien suorituskykyä uudella data, joka poikkeaa koulutusjakaumasta. Toinen on algoritminen robustisuus, joka keskittyy luotettavuuteen pienien syötehäiriöiden tai melun vaikutuksesta.

Yhdistämällä nämä kentät oppimien invarianttien käsitteen ympärillä, WARM siirtää meitä kohti vankemmin perusteltuja tekniikoita arvon mukauttamiseen. WARM:in oivallukset voivat yleistyä jopa RLHF:n ulkopuolelle, tarjoamalla oppeja laajemmille koneoppimisen järjestelmille, jotka vuorovaikuttavat avoimen maailman kanssa.

Tietysti palkintomallinnus on vain yksi palanen mukauttamispalapelistä. Tarvitsemme edistystä muissa haasteissa, kuten palkintospecifikaatio, skaalautuva valvonta ja turvallinen tutkiminen. Yhdistettynä täydentävien tekniikoiden kanssa WARM voi kiihdyttää kestävän tekoälyn kehittämistä, joka edistää ihmisten hyvinvointia. Yhdessä selvittämällä robustin mukauttamisen periaatteita tutkijat kartuttavat reittiä hyödyllisten ja eettisten tekoälyjärjestelmien kehittämiseen.

Olen viettänyt viimeiset viisi vuotta uppoutumalla kiinnostavaan koneoppimisen ja syvän oppimisen maailmaan. Minun intohimoni ja asiantuntemukseni ovat johtaneet minun osallistumiseen yli 50:een monipuoliseen ohjelmistosuunnitteluhankkeeseen, joissa on erityisesti painottunut AI/ML. Minun jatkuva uteliaisuuteni on myös ohjannut minun luontaisen kielen prosessoinnin pariin, jota haluan tutkia tarkemmin.