AI-mallit ja alustat

RAFT – Hienosäätö ja RAG-lähestymistapa alakohtaisiin kysymys-vastaus-tehtäviin

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Kun suurten kielen mallien soveltamiset laajenevat erikoistuneisiin aloihin, tarve tehokkaille ja vaikuttaville sopeutumistekniikoille tulee yhä tärkeämmäksi. Tässä astuu kuvaan RAFT (Retrieval Augmented Fine Tuning), uudenlainen lähestymistapa, joka yhdistää retrieval-augmented generation (RAG) ja hienosäätö, suunniteltu erityisesti alakohtaisiin kysymys-vastaus-tehtäviin.

Haaste alakohtaisessa sopeutumisessa

Vaikka suuret kielen mallit on koulutettu laajalle tietomäärälle, niiden kyky toimia hyvin erikoistuneissa aloissa, kuten lääketieteellisessä tutkimuksessa, oikeudellisissa asiakirjoissa tai yrityskohtaisissa tietopohjissa, on usein rajoitettu. Tämä rajoitus johtuu siitä, että koulutusdata ei välttämättä edusta kyseisten erikoistuneiden alojen nyansseja ja yksityiskohtia. Tähän haasteeseen tutkijat ovat perinteisesti käyttäneet kahta pääteknikkaa: retrieval-augmented generation (RAG) ja hienosäätö.

Retrieval-Augmented Generation (RAG)

RAG

RAG

RAG on tekniikka, joka mahdollistaa suurten kielen mallien pääsyn ja hyödyntämisen ulkoisia tietolähteitä johtoprosessin aikana.

Se saavuttaa tämän integroimalla reaaliaikaisen tietojen hakujen generoivan prosessin, mikä tekee mallin tulokset tarkemmiksi ja ajantasaisemmiksi. RAG koostuu kolmesta keskeisestä vaiheesta: hakemisesta, jossa kerätään asiaankuuluvia asiakirjoja; generoinnista, jossa malli tuottaa tuloksen haetuista tiedoista; ja täydentämisestä, joka viimeistelee tuloksen lisäämällä kontekstia tai säätämällä yhdenmukaisuutta ja asiaankuuluvuutta.

Hakuprosessi RAG:ssa alkaa käyttäjän kysymyksellä. Suuret kielen mallit analysoivat kysymyksen ja noutavat asiaankuuluvia tietoja ulkoisista tietokannoista, esittäen tietopoolin, josta malli voi piirtää johtopäätöksiään. Generointivaihe syntetisoi tämän syötteen yhtenäiseksi kertomukseksi tai vastaukseksi. Täydentämisvaihe viimeistelee generoinnin lisäämällä kontekstia tai säätämällä yhdenmukaisuutta ja asiaankuuluvuutta.

RAG-mallit voidaan arvioida monilla mittareilla, jotka arvioivat niiden kykyä tarjota tarkkaa, asiaankuuluvaa ja ajantasaista tietoa.

Hienosäätö

supervised-fine-tuning

supervised-fine-tuning

Hienosäätö taas käsittää esikoulutetun suuren kielen mallin sopeuttamisen tiettyyn tehtävään tai alaan kouluttamalla se pienemmällä, tehtäväkohtaisella aineistolla. Tämä lähestymistapa mahdollistaa mallin oppimisen tehtäväkohtaisia kuvioita ja säätää tuloksiaan toivotun tehtävän tai alan mukaisesti. Vaikka hienosäätö voi parantaa mallin suorituskykyä, se usein epäonnistuu ulkoisten tietolähteiden tehokkaassa hyödyntämisessä tai hakuvirheiden korjaamisessa johtoprosessin aikana.

RAFT-lähestymistapa

RAFT

RAFT

RAFT eli Retrieval-Aware Fine-Tuning on innovatiivinen koulutusmenetelmä, joka on suunniteltu kielen malleille parantamaan niiden suorituskykyä alakohtaisissa tehtävissä, erityisesti avoimissa kysymys-vastaus-tehtävissä. RAFT poikkeaa perinteisestä hienosäätöstä valmistamalla koulutusdataa, joka sisältää kysymyksiä sekä asiaankuuluvia että epäasiaankuuluvia asiakirjoja, sekä ketjuajattelutyyppisiä vastauksia, jotka on johdettu asiaankuuluvista teksteistä. Tämä menetelmä pyrkii parantamaan mallejen kykyä muistaa tietoa ja johtaa vastauksia annetuista asiakirjoista.

Olennaisesti RAFT hienosäätää kielen malleja, jotta ne ovat taitavampia tehtävissä, jotka vaativat lukemisen ymmärtämistä ja tietojen poimimista asiakirjoista. Kouluttamalla malleja sekä “oraakkeliasiakirjoilla” (joissa vastaus on) että “häiritsevillä asiakirjoilla” (joissa vastausta ei ole), malli oppii käyttämään relevanttia tietoa tehokkaammin.

Koulutusdatan valmistus

RAFTin koulutusprosessi sisältää osan dataa, joka koostuu oraakkeliasiakirjoista, jotka liittyvät suoraan vastauksiin, kun taas loput datasta koostuvat pelkästään häiritsevistä asiakirjoista. Hienosäätö rohkaisee mallia oppimaan, milloin luottaa sisäiseen tietämykseensä (kuin muistamiseen) ja milloin poimia tietoa annetusta kontekstista.

RAFTin koulutusohjelma korostaa myös johtoprosessien luomista, jotka auttavat vastauksen muodostumisessa ja viittaavat lähteisiin, samalla tavoin kuin ihminen perustelee vastauksensa viitatessaan lukemaansa materiaaliin. Tämä lähestymistapa palvelee useita tarkoituksia:

  1. Se kouluttaa mallin tunnistamaan ja käyttämään relevanttia tietoa annetusta kontekstista, jäljitellen avoimen kysymys-vastaus-tehtävän asetelmaa.
  2. Se parantaa mallin kykyä hävittää epärelevantti tieto, tärkeä taito tehokkaalle RAG:lle.
  3. Se altistaa mallin tilanteille, joissa vastaus ei ole kontekstissa, rohkaisen mallia luottamaan omaan tietämykseensä, kun tarpeen.

Toinen keskeinen RAFTin näkökohta on ketjuajattelun sisällyttäminen koulutusprosessiin. Sen sijaan, että vain kysymys-vastaus-parit annetaan, RAFT luo yksityiskohtaiset johtoprosessin selitykset, jotka sisältävät sana sanalta lainattuja viittauksia asiaankuuluvista asiakirjoista. Nämä selitykset, esitettynä ketjuajattelumuodossa, opastavat mallia loogisten askelten kautta, joilla voidaan saavuttaa oikea vastaus.

Kouluttamalla mallia näillä johtoprosessiketjuilla, RAFT edistää vahvojen johtoprosessitaitojen kehittymistä ja parantaa mallin ymmärtämistä siitä, miten hyödyntää ulkoisia tietolähteitä tehokkaasti.

Arviointi ja tulokset

RAFT-tutkimuksen tekijät suorittivat laajat arviointitutkimukset useilla eri aineistoilla, mukaan lukien PubMed (lääketieteellinen tutkimus), HotpotQA (avoimet kysymys-vastaus-tehtävät) ja Gorilla APIBench (koodin generointi). Heidän tuloksensa osoittivat, että RAFT ylitti johdonmukaisesti vertailukohteet, kuten alakohtaisen hienosäätön sekä suuremmat mallit kuten GPT-3.5 RAG:n kanssa.

RAFT improves RAG performance

RAFT parantaa RAG-suorituskykyä

Esimerkiksi HuggingFace-aineistolla RAFT saavutti 74%:n tarkkuuden, mikä merkitsi 31,41%:n parannusta alakohtaiseen hienosäätöön (DSF) verrattuna ja 44,92%:n parannusta GPT-3.5:een RAG:n kanssa. Vastaavasti HotpotQA-aineistolla RAFT näytti 28,9%:n tarkkuusparannuksen DSF:ään verrattuna.

Yksi RAFTin keskeisistä etuoikeuksista on sen robustius hakuvirheille. Kouluttamalla mallia sekä relevantin että epärelevantin asiakirjojen seoksella, RAFT parantaa mallin kykyä erottaa ja priorisoida relevanttia tietoa, jopa silloin, kun hakumoduuli palauttaa alentuvia tuloksia.

Tutkijat osoittivat, että hienosäätö pelkästään oraakkeliasiakirjoilla usein johtaa heikompiin tuloksiin verrattuna määrityksiin, jotka sisältävät häiritseviä asiakirjoja. Tämä havainto korostaa mallin altistamisen erilaisille hakutilanteille koulutuksen aikana, varmistaen sen valmiuden todellisiin sovelluksiin.

Käytännön sovellukset ja tulevaisuuden suunnat

RAFT-tekniikalla on merkittäviä vaikutuksia laajalle alueelle käytännön sovelluksia, mukaan lukien:

  1. Kysymys-vastaus-järjestelmät: RAFT voidaan käyttää rakentamaan tarkkoja ja alakohtaisia kysymys-vastaus-järjestelmiä, hyödyntäen sekä mallin oppimaan tietoa että ulkoisia tietolähteitä.
  2. Yritysten tietohallinta: Organisaatiot, joilla on laajat tietopohjat, voivat hyödyntää RAFTia kehittääkseen mukautettuja kysymys-vastaus-järjestelmiä, mahdollistaen työntekijöiden nopean pääsyn ja hyödyntämisen relevanttia tietoa.
  3. Lääketieteellinen ja tieteellinen tutkimus: RAFT voi olla erityisen arvokas aloilla, kuten biolääketieteellisessä tutkimuksessa, jossa pääsy viimeisimpiin löytöihin ja kirjallisuuteen on olennainen tieteellisen ymmärryksen edistämiseksi.
  4. Lakitoimi ja rahoituspalvelut: RAFT voi auttaa ammattilaisia näissä aloissa tarjoamalla tarkkoja ja kontekstiherkkäitä vastauksia perustuen relevantteihin oikeudellisiin asiakirjoihin tai rahoitusraportteihin.

Kun tutkimus tässä alueessa jatkuu, voidaan odottaa edelleen kehitystä ja tarkennuksia RAFT-tekniikkaan. Mahdollisia tulevaisuuden suuntia ovat:

  1. Tehokkaampien ja tehokkaampien hakumoduulien tutkiminen, suunniteltuina tiettyihin aloihin tai asiakirjarakenteisiin.
  2. Monitilaisten tietojen integrointi, kuten kuvia tai taulukoita, RAFT-kehykseen parantamaan kontekstin ymmärtämistä.
  3. Erikoistuneiden johtoprosessirakenteiden kehittäminen, jotka voivat paremmin hyödyntää koulutuksen aikana luotuja ketjuajatteluselityksiä.
  4. RAFTin sovittaminen muihin luonnollisen kielen tehtäviin kysymys-vastauksen ulkopuolella, kuten yhteenvetoihin, käännöksiin tai vuorovaikutteisiin järjestelmiin.

Johtopäätös

RAFT edustaa merkittävää askelta eteenpäin alakohtaisen kysymys-vastaus-tehtävien parissa kielen mallien kanssa. Yhdistämällä retrieval-augmented generationin ja hienosäätön vahvuudet, RAFT varustaa suuret kielen mallit kyvylle hyödyntää ulkoisia tietolähteitä ja säätää tuloksiaan alakohtaisten kuvioiden ja preferenssien mukaisesti.

Innovatiivisen koulutusdatan valmistuksensa, ketjuajattelun sisällyttämisen ja robustisuutensa hakuvirheille, RAFT tarjoaa voimakkaan ratkaisun organisaatioille ja tutkijoille, jotka etsivät avaimen suurten kielen mallien täydellisen potentiaalin avaamiseen erikoistuneissa aloissa.

Kun vaatimus alakohtaisiin luonnollisen kielen prosessointikapasiteeteista jatkuu kasvamassa, tekniikat kuten RAFT tulevat olemaan avainasemassa mahdollistaakseen tarkemmat, kontekstiherkät ja sopeutuvat kielen mallit, jotka avaavat tien kohti tulevaisuutta, jossa ihmisen ja koneen välinen viestintä on todella sujuvaa ja alakohtaisesti yleispätevää.

Olen viettänyt viimeiset viisi vuotta uppoutumalla kiinnostavaan koneoppimisen ja syvän oppimisen maailmaan. Minun intohimoni ja asiantuntemukseni ovat johtaneet minun osallistumiseen yli 50:een monipuoliseen ohjelmistosuunnitteluhankkeeseen, joissa on erityisesti painottunut AI/ML. Minun jatkuva uteliaisuuteni on myös ohjannut minun luontaisen kielen prosessoinnin pariin, jota haluan tutkia tarkemmin.