AI-mallit ja alustat

EUREKA: Ihmisen tason palkkion suunnittelu koodaamalla suuria kielen malleja

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Suurten kielen mallien edetessä viime vuosina on odotettavissa, miksi nämä LLM-kehykset menestyvät semanttisina suunnittelijoina järjestelmällisissä päätöksenteon tehtävissä. Kehittäjät kuitenkin kohtaavat edelleen haasteita hyödyntääksesi suurten kielen mallien täysimääräistä potentiaalia monimutkaisten matalan tason manipulaatiotehtävien oppimisessa. Vaikka nykyiset suuret kielen mallit ovat tehokkaita, niiden käyttäminen edellyttää merkittävää alan ja aiheen asiantuntemusta jopa yksinkertaisten taitojen oppimiseksi tai tekstipohjaisen ohjauksen luomiseksi, mikä luo merkittävän aukon niiden suorituskyvyn ja ihmisen tason taituruuden välille.

Tässä artikkelissa tarkastelemme EUREKA-kehyksen kehittäjän näkökulmasta, tutkimalla sen kehystä, toimintaa ja saavutuksia palkkiofunktioiden luomisessa. Nämä funktiot, kehittäjien mukaan, ylittävät ihmisten luomat funktiot. Selvitämme myös, miten EUREKA-kehyksestä voi olla uuden lähestymistapan uudelleen vahvistavaan oppimiseen ihmisen palautteen avulla (RLHF) mahdollistaen gradientin vapaan oppimisen kontekstissa.

Tänään LLM-kehykset toimivat erinomaisesti semanttisina suunnittelijoina järjestelmällisissä päätöksenteon tehtävissä, mutta kehittäjät etsivät tapoja parantaa niiden suorituskykyä matalan tason manipulaatiotehtävissä. Lisäksi kehittäjät ovat havainneet, että vahvistuva oppiminen voidaan käyttää saavuttamaan kestäviä tuloksia dexterous-olosuhteissa ja muissa aloissa, jos palkkiofunktiot on suunniteltu huolellisesti ihmisten toimesta, ja nämä palkkiofunktiot pystyvät tarjoamaan oppimissignaaleja suotuisille käyttäytymisille. Kun verrataan todellisen maailman vahvistuvan oppimisen tehtäviin, jotka hyväksyvät harvassa palkkioita, muotoileminen näistä palkkioista tarjoaa välttämättömät askelkohtaiset oppimissignaaleja. Lisäksi palkkiofunktiot ovat erittäin haasteellisia suunnitella, ja alisuunnitellut funktiot johtavat usein ei-toivottuihin käyttäytymisiin.

Kuvassa 1 on esitetty yleiskatsaus EUREKA-kehyksestä, joka pyrkii tekemään seuraavat panostukset:
1. Saavuttamaan ihmisen tason suorituskyky palkkiofunktioiden suunnittelussa.
2. Ratkaisemaan manipulaatiotehtäviä ilman manuaalista palkkion suunnittelua.
3. Luomaan enemmän ihmisten mukaisia ja suorituskykyisiä palkkiofunktiota esittelemällä uuden gradientin vapaan oppimismenetelmän kontekstissa.

EUREKA-kehyksessä on kolme tärkeää algoritmista suunnitteluratkaisua: evoluutioon perustuva haku, ympäristö kontekstina ja palkkion heijastus. Ensinnäkin EUREKA-kehyksestä otetaan ympäristön lähdekoodi kontekstina luomaan suoritettavia palkkiofunktiota nollauslähestymisessä. Seuraavassa vaiheessa kehyksestä suoritetaan evoluutioon perustuva haku parantamaan palkkioiden laatua merkittävästi, ehdottaen palkkioehdokkaita kunkin iteroinnin tai episodin jälkeen ja jalostaen lupaavimmat. Kolmannessa ja viimeisessä vaiheessa kehyksestä käytetään palkkion heijastusmenetelmää tehostamaan palkkion parantamista kontekstissa, prosessi, joka lopulta auttaa kehyksestä ottamaan kohdennetun ja automaattisen palkkion muokkauksen käyttämällä palkkion laadun tekstuaalista yhteenvedon perusteella politiikan koulutusstatistiikkaa.

Seuraavassa kuvassa on havainnollistettu, miten EUREKA-kehyksestä toimii:

Kuvassa 2 on esitetty yksinkertainen kuvaus EUREKA-kehyksestä ja sen toiminnasta.

EUREKA-kehyksestä on kolme peruskomponenttia: evoluutioon perustuva haku, ympäristö kontekstina ja palkkion heijastus. Evoluutioon perustuva haku tarjoaa luonnollisen ratkaisun suboptimaalisiin haasteisiin ja virheisiin, jotka esiintyvät suorituksen aikana. Jokaisen iteroinnin tai episodin jälkeen kehyksestä tuottaa useita riippumattomia tuloksia suuresta kielen mallista, ja koska nämä tulokset ovat kaikki toisistaan riippumattomia, se vähentää eksponentiaalisesti palkkiofunktioiden virheiden todennäköisyyttä iteroinnin tai episodin edetessä.

Seuraavassa vaiheessa EUREKA-kehyksestä käytetään edellisen iteroinnin suoritettavia palkkiofunktiota suorittamaan kontekstissä palkkion muutos, ja sitten ehdottaa uutta ja parannettua palkkiofunktiota perustuen tekstuaaliseen palautteeseen. EUREKA-kehyksestä yhdistettynä kontekstissä parantavaan ja ohjeiden seuraamiseen suurten kielen mallien kanssa pystyy määrittämään muutosoperaattorin tekstipohjaisena ohjeistuksena ja ehdottaa menetelmää käyttääksesi tekstuaalista yhteenvedon politiikan koulutuksesta muokata olemassa olevia palkkiofunktiota.

Palkkion heijastus on tärkeä osa EUREKA-kehyksestä, joka arvioi luotujen palkkioiden laatua ja antaa tarkan ja yksityiskohtaisen palkkion diagnosoinnin. Kun tehtävän soveltamisfunktio toimii kokonaisvaltaisena mittarina todellisille palkkioille, se puuttuu krediittijakamiselta ja ei voi antaa arvokkaita tietoja siitä, miksi palkkiofunktio toimii tai miksi se ei toimi. Jotta voidaan tarjota kohdennettu ja yksityiskohtainen palkkiodiagnosointi, kehyksestä ehdottaa automaattisia palautteita yhteenvedon politiikan koulutusdynamiikkaa tekstinä.

Kuvassa 3 on esitetty yksinkertainen kuvaus palkkion heijastusprosessista.

Vaikka palkkiofunktioiden menettely on yksinkertainen, se on tärkeä algoritmisen riippuvainen palkkioita optimoimalla. Tämä tarkoittaa, että palkkiofunktion tehokkuus on suoraan vaikuttunut vahvistuvan oppimisen algoritmin valintaan, ja muutokset hyperparametreissä voivat aiheuttaa palkkion erilaisen suorituskyvyn, vaikka samaa optimoijaa käytetään. Tämän vuoksi EUREKA-kehyksestä pystyy muokkaamaan palkkiofunktiota tehokkaammin ja valikoivammin, ja syntetisoi palkkiofunktiota, jotka ovat paremmin yhtensopivia vahvistuvan oppimisen algoritmin kanssa.

Tulokset ja saavutukset
EUREKA-kehyksestä on arvioitu eri parametreillä, mukaan lukien sen suorituskyky verrattuna ihmisten palkkioihin, parannus tuloksissa ajan myötä, uusien palkkioiden luominen, kohdennettu parannus ja työskentely ihmisten palautteiden kanssa.

EUREKA ylittää ihmisten palkkioita
Seuraavassa kuvassa on esitetty yhteenveto tuloksista eri mittareilla, ja siitä voidaan selvästi nähdä, että EUREKA-kehyksestä ylittää tai suorittaa ihmisten tason palkkioita sekä Dexterity- että Issac-tehtävissä. Vertailussa L2R-baseline tarjoaa samanlaisen suorituskyvyn matalan dimensionalitehtävissä, mutta korkean dimensionalitehtävissä suorituskykyero on merkittävä.

Kuvassa 4 on esitetty tulos, josta voidaan nähdä, että EUREKA-kehyksestä parantaa jatkuvasti suorituskykyään ajan myötä.

Yksi EUREKA-kehyksestä tärkeimmistä ominaisuuksista on sen kyky parantaa jatkuvasti suorituskykyään ajan myötä. Tulokset osoittavat, että kehyksestä tuottaa parempia palkkioita jokaisen iteroinnin jälkeen ja ylittää lopulta ihmisten suorituskyvyn ansiosta evoluutioon perustuvasta palkkion hakumenetelmästä.

Uusien palkkioiden luominen
EUREKA-kehyksestä pystyy luomaan uusia palkkiofunktiota, jotka eivät ole vahvasti korreloivia ihmisten luotujen palkkioiden kanssa. Tämä voidaan arvioida laskemalla korrelaatio ihmisten ja EUREKA-palkkioiden välillä kaikissa Issac-tehtävissä.

Kuvassa 5 on esitetty tulos, josta voidaan nähdä, että EUREKA-kehyksestä pystyy luomaan uusia palkkiofunktiota, jotka ylittävät ihmisten luomat palkkiofunktiot.

Kohdennettu parannus
EUREKA-kehyksestä pystyy myös tarjoamaan kohdennetun parannuksen palkkiofunktioiden luomisessa. Tämä voidaan arvioida poistamalla palkkion heijastus kehyksestä ja verrata tuloksia alkuperäiseen kehyksestä.

Työskentely ihmisten palautteiden kanssa
EUREKA-kehyksestä pystyy myös työskentelemään ihmisten palautteiden kanssa. Tämä voidaan arvioida tutkimalla, miten kehyksestä pystyy hyödyntämään ihmisten palautteita palkkiofunktioiden luomisessa.

Lopputulet
Tässä artikkelissa olemme tarkastelleet EUREKA-kehyksestä, joka on suuren kielen mallin voimalla toimiva ihmisen tason suunnittelualgoritmi. Se pyrkii hyödyntämään suurten kielen mallien ominaisuuksia, kuten koodauksen, kontekstissä parantamisen ja nollauslähestymisen, jotta voidaan suorittaa ennenkokematon palkkiofunktioiden optimointi. Palkkiofunktiot yhdistettynä vahvistuvaan oppimiseen mahdollistavat kehyksestä oppia monimutkaisia taitoja tai suorittaa manipulaatiotehtäviä.

Yhteenvetona voidaan sanoa, että EUREKA-kehyksestä osoittaa merkittävää suorituskykyä ja joustavuutta, mikä viittaa siihen, että yhdistämällä evoluutioon perustuvat algoritmit suurten kielen mallien kanssa voidaan luoda skaalautuva ja yleinen lähestymistapa palkkiofunktioiden suunnitteluun, ja tämä näkemys voidaan soveltaa muihin avoimiin etsintäongelmiin.

Ammattina insinööri, sydämen vuoksi kirjailija. Kunal on tekninen kirjailija, jolla on syvä rakkaus ja ymmärrys AI: sta ja ML: stä, omistautunut yksinkertaistamaan monimutkaisia käsitteitä näissä aloissa hänen viihdyttävän ja informatiivisen dokumentaationsa kautta.