Prompt engineering
Koulutus Parannettuja Tekstiemuloita Suurilla Kielen Malleilla

Tekstiemuloitukset ovat vektorimuodot sanoista, lauseista, kappaleista tai asiakirjoista, jotka sisältävät niiden semanttisen merkityksen. Ne toimivat monien luonnollisen kielen prosessoinnin (NLP) sovellusten perusrakenteena tänään, mukaan lukien tietojen hakeminen, kysymysten vastaaminen, semanttinen hakeminen ja paljon muuta.
Viimeaikaiset edistysaskeleet suurissa kielen malleissa, kuten GPT-3, ovat osoittaneet vaikuttavat kykynsä vähäisinä harjoituksina ja luonnollisen kielen generoinnissa. Voimmeko hyödyntää suuria kielen malleja myös edistääksemme tekstiemuloitusten tilaa? Tutkijoiden artikkelissa “Parantaminen Tekstiemuloituksia Suurilla Kielen Malleilla” esitetään uusi menetelmä, joka saavuttaa erinomaiset tulokset generoimalla synteettistä koulutusdataa suurilla kielen malleilla ja hienosäätämällä sitä.
Haasteet Olemassa Olevilla Menetelmillä
Perinteiset tekstiemuloitusmenetelmät, kuten painotetut keskiarvot sanavektoreista tai TF-IDF, eivät pysty riittävästi havainnoimaan rikasta kontekstuaalista tietoa teksteissä. Uudempia menetelmiä, jotka perustuvat esikoulutettuihin kielen malleihin, kuten BERT, saavuttavat paljon paremmat kontekstiaavuttavat emuloitukset.
Niiden vaatii kuitenkin monimutkaiset monivaiheiset koulutusputket:
- Esikoulutus miljardeilla heikosti merkityillä tai keinotekoisilla tekstipareilla
- Hienosäätö rajoitettuilla, käsin kuratoiduilla tietokannoilla
Tämä vaatii massiivisia laskentaresursseja ja ihmisen ponnistelua datan keräämisessä. Koulutusdata on myös rajoitettu monipuolisuudessa ja kielikattavuudessa. Esimerkiksi BEIR-benchmark koostuu vain 15 hakutehtävän tietokannoista englanniksi.
Olemassa olevat menetelmät käyttävät pääasiassa pienempiä BERT-tyyppisiä arkkitehtuureja runkomallina. Ne eivät pysty hyödyntämään edistyneempiä suuria kielen malleja ja niihin liittyviä tekniikoita.
Menetelmä: Synteettisen Datan Generointi Suurilla Kielen Malleilla
Ylittääksemme nämä rajoitukset, tutkijat ehdottavat uutta yksivaiheista koulutuslähestymistapaa, joka hyödyntää suuria kielen malleja, kuten GPT-3 ja GPT-4, generoimaan monipuolista synteettistä koulutusdataa.
Avainaskeleet ovat:
- Tehtävän Luokittelu: Määritellä luokittelu, joka jakaa tekstiemuloitustehtäviä seuraaviin:
- Epäsymmetriset tehtävät (kysymys ja asiakirja eivät ole parafraseja, esim. hakeminen)
- Symmetriset tehtävät (kysymys ja asiakirja ovat parafraseja, esim. semanttinen samankaltaisuus)
- Ohjelmointitemplate: Luoda ohjelmointitemplateja, jotka on suunniteltu kullekin tehtävälle, ja ohjaavat suurta kielen mallia generoimaan merkityksellisiä koulutuseksemppeleitä.
- Synteettisen Datan Generointi: Ohjelmoida suurta kielen mallia ohjelmointitemplateilla generoimaan satoja tuhansia (kysymys, asiakirja) -pareja, jotka kattavat laajan valikoiman semanttisia tehtäviä 93 kielellä.
- Mallin Koulutus: Hienosäätää voimakasta avoimen lähdekoodin suurta kielen mallia, kuten Mistral, synteettisellä datalla kontrastiivisen menetelmän avulla.
Tämä menetelmä mahdollistaa koulutusdatan luomisen monipuolisille tehtäville useilla kielillä ilman ihmisen merkintätyötä. Hyödyntämällä jo suurten kielen mallien esikoulutuksessa olevaa tietoa, voidaan syntetisoida laadukkaita tietoja, jotka on tarkalleen suunniteltu tekstiemuloituksia varten.
Tutkijat osoittavat tämän 2-vaiheisen ohjelmointistrategian avulla:
- Ohjelmoida GPT-4 ehdottamaan potentiaalisia hakutehtäviä
- Ohjelmoida sitä uudelleen (kysymys, asiakirja) -esimerkkien luomiseksi ehdotettujen tehtävien perusteella
Jotkut ohjelmointitemplatejen avainaspektit:
- Luonnollisen kielen ohjelmointi intuitiivisille, ihmismäisille ohjeille
- Paikkamerkit rohkaisevaksi monimuotoisuudelle (esim. kysymyksen pituus, selkeys, asiakirjan pituus)
- Yhdistäminen useista templaateista saman tehtävän tyypille
- Kielen painotus resurssien saatavuuden perusteella
Kaiken kaikkiaan he pystyivät generoimaan 500 000 tekstiemuloituseksmpeliä laskennallisella kustannuksella 180M tokenia. Hallitseva kieli oli englanti (43 %), seurattuna puolaksi, japaniksi, italiaksi ja muilla.
Mallin koulutuksessa he valitsivat hienosäätämään avoimen lähdekoodin 7B parametrin Mistral -mallia pienempien BERT-tyyppisten arkkitehtuurien sijaan. Koska Mistral oli jo esikoulutettu massiivisilla tekstikorpuksilla, ei tarvittu lisää kontrastiivista esikoulutusta. Sen lisääminen tarjosi merkityksettömiä parannuksia.
Koko hienosäätö kesti vähemmän kuin 1k askelta, käyttäen sekä synteettistä että ihmisen merkittyä dataa. Tämä osoittaa ehdotetun lähestymistavan näytemäisen tehokkuuden.
Tulokset
Tutkijat arvioivat malliaan MTEB-benchmarkilla, joka kattaa monipuolisia tehtäviä luokittelun, ryhmittelyn, semanttisen samankaltaisuuden, yhteenvetoksen ja tietojen hakemisen osalta.
Heidän mallinsa ylitti edellisen huipputason 2,4 prosenttiyksiköllä keskimääräisessä pisteessä, asettamalla uudet ennätykset lähes jokaisessa luokassa:
| Malli | Edellinen Huipputaso | Ehdotettu Malli |
|---|---|---|
| Luokittelu | 76.0 | 78.5 |
| Ryhmittely | 46.1 | 50.3 |
| Parin Vertailu | 87.1 | 88.3 |
| Uudelleenjärjestäminen | 60.0 | 60.2 |
| Hakeminen | 54.3 | 56.9 |
| STS | 83.1 | 84.6 |
| Yhteenveto | 31.6 | 31.4 |
| Keskimäärin | 64.2 | 66.6 |
Hämmästyttävästi, vaikka ilman käyttämällä mitään merkittyä dataa ja kouluttamalla ainoastaan synteettisellä datalla, se saavutti kilpailevan tarkin – vain 3,5 pistettä täysin valvotun mallin takana. Tämä osoittaa synteettisen datan mahdollisuuden tekstiemuloitusten luomiseksi ilman ihmisen merkintätyötä.
Tutkijat arvioivat myös monikielisen MIRACL-benchmarkin, joka kattaa 18 kieltä. Heidän mallinsa ylitti edellisen parhaan tuloksen korkean resurssien kielillä, mutta oli heikompi matalan resurssien kielillä. He olettavat, että tämä voisi lieventyä esikouluttamalla suuria kielen malleja laajemmin matalan resurssien kielillä.
Yhteenvetona, tekstiemuloitukset, jotka on koulutettu suurten kielen mallien generoimalla synteettisellä datalla, asettavat uudet huipputason tulokset, samalla käyttäen yksinkertaisempaa ja tehokkaampaa koulutusprosessia kuin aiemmat monivaiheiset lähestymistavat. Jatkamalla tutkimusta ohjelmointi-insinööritieteessä ja synteettisen datan laadussa, tämä menetelmä voisi edistää merkittävästi monikielisiä tekstiemuloituksia.
Analyysi
Tämä työ tarjoaa useita arvokkaita opetuksia:
- Suuret kielen mallit, kuten GPT-3 ja GPT-4, ovat vaikuttavia kykyjä generoimaan laadukkaita synteettisiä koulutusdataa monipuolisille NLP-tehtäville, kun ne ohjelmoidaan oikein. Tämä voi vähentää riippuvuutta ihmisen merkityistä datasta.
- Tekstiemuloituksille kontrastiivinen esikoulutus tarjoaa merkityksettömiä parannuksia vain hienosäätämällä malleja, kuten Mistral, jotka on jo esikoulutettu massiivisilla tekstikorpuksilla. Tämä on tärkeä näkökulma koulutusprosessin tehokkuuteen.
- Hakemisen avustaminen generoimalla menetelmät mahdollistavat suurten kielen mallien dynaamisen pääsyn ulkoiseen tietoon. Parantaminen tekstiemuloituksia on tärkeää näiden suurten kielen mallien parantamiseksi.
- On edelleen merkittävää parantamisen varaa matalan resurssien kielillä. Monikieliset suuret kielen mallit, jotka on esikoulutettu edustavammilla datasta, voivat auttaa tämän aukon sulkemisessa.
- Käsitteellisesti, kielen mallinnus ja tekstiemuloitukset ovat kaksi puolta saman kolikon – kielen semantiikan ymmärtäminen. Synteettisen datan ohjelmoinnin avulla suuret kielen mallit voidaan hienosäätää luonnollisesti emuloijiksi ilman monimutkaisia putkistoja.
Jotkut lupaavat suunnat tulevaisuuden työlle:
- Hyödyntäminen avoimen lähdekoodin suuria kielen malleja, kuten GPT-Neox, synteettisen datan luomiseksi
- Tutkiminen kevyitä jälkikoulutusmenetelmiä sopeuttaa emuloijia pidemmille konteksteille
- Ohjelmointitekniikoiden kehittäminen laadun ja tehtävän kattavuuden hallitsemiseksi
- Menetelmien kehittäminen parantamaan inference-viiveä ja tallennuskustannuksia teollisessa käytössä
Vaikka rikkomalla benchmark-tuloksia, suurten kielen mallien käyttäminen tekstiemuloitusten parantamiseen avaa mielenkiintoisia mahdollisuuksia tulevaisuudelle. Kun suuret kielen mallit jatkavat kehittymistään luonnollisen kielen hallinnassa, heidän kykynsä generoimaan korkealaatuista synteettistä dataa on todennäköisesti paraneva.
Kuitenkin kriittiset tutkimussuunnat jäävät käännettyäksi todelliseksi vaikutukseksi.
Mukautuminen ja Ohjaus
Synteettisen datan avainhyöty on mahdollisuus ohjelmallisesti generoida esimerkkejä, jotka on suunniteltu tiettyihin tarpeisiin. Kuten artikkeli osoitti, ohjelmointi mahdollistaa koulutusdatan luomisen sadoille tuhansille upotus tehtäville.
Nykyiset ohjelmointipraktiikat ovat kuitenkin enemmän taidetta kuin tieteellistä tietoa. Kehittämällä järjestelmällisiä, toistettavissa olevia menetelmiä ohjata kontekstuaalisten ominaisuuksien generoimista, voidaan laajentaa tällaisen tekniikan soveltamista.
Esimerkiksi tekniikat säätääkseen tekijöitä, kuten monimuotoisuutta, epäselvyyttä ja uutuutta, voivat auttaa ratkaisemaan robustisuuden ongelmia alihankintatehtävissä. Dynaaminen ohjelmointi vastaamaan kehittyviä todellisen maailman jakautumia on toinen avoin haaste.
Koulutus Suuressa Mittakaavassa
Vaikka esikoulutetut suuret kielen mallit koodaavat jo merkittävää lingvististä tietoa, heidän datan generoimiskykynsä on todennäköisesti paraneva lisääntyneellä mittakaavalla. Mallit, kuten GPT-4, jotka on koulutettu triljoonilla tokenilla internetin tekstiä, osoittavat vahvaa vähäistä harjoitusta, mutta eivät ole optimoituja erityisesti koulutusdatan syntetisointiin.
Arkkitehtuureja ja objektiiveja, jotka on suunniteltu itseohjautuvan datan generoinnin käynnistämiseksi web-asteella, voivat edistää merkittävästi tämän menetelmän laatua ja tehokkuutta. Tehokas integrointi haettua tietoa täydentämään opittua tietoa on toinen lupaava suunta.
Monitehtäväinen ja Monikielinen
Kuten artikkeli mainitsi, parantaminen matalan resurssien kielten suorituskykyä on edelleen ongelma. Vaihtoehtona yhden massiivisen suuren kielen mallin esikoulutukselle on kouluttaa laivasto pienempiä asiantuntijamalleja, jotka erikoistuvat tiettyihin data-muotoihin tai kielialueisiin.
Tällainen laivasto-lähestymistapa voisi parantaa kattavuutta harvoille tehtäville ja kielille jakamalla edustettuja esityksiä asiantuntijoita välillä. Jatkuva oppiminen laajentamaan kielen ja tehtävän asiantuntemusta ajan myötä on myös mielenkiintoinen näkökulma.
Johtopäätöksessä, tämä artikkeli esittää innovatiivisen käsitteen synteettisen koulutusdatan generoimisesta suurilla kielen malleilla luodaksesi suorituskykyisiä tekstiemuloituksia. Heidän tuloksensa osoittavat tämän menetelmän tehokkuuden, ylittäen edelliset benchmark-tulokset. Kun suuret kielen mallit ja synteettiset datatekniikat edistyvät, niiden tietämyksen hyödyntäminen koulutus emuloijiksi voi tulla erittäin lupaavaksi suunnaksi.















