AI-mallit ja alustat
Suurten kielen mallien arviointi: Tekninen opas
Suuret kielen mallit (LLM) kuten GPT-4, Claude ja LLaMA ovat räjähtäneet suosioon. Kiitos heidän kyvystään generoida vaikuttavasti ihmismäisiä tekstejä, nämä tekoälyjärjestelmät ovat nyt käytössä kaikessa sisällön luomisesta asiakaspalvelu- chatboteihin.
Mutta miten tiedämme, ovatko nämä mallit todella hyviä? Uusia LLM-malleja ilmoitetaan jatkuvasti, ja kaikki väittävät olevansa suurempia ja parempia, miten arvioimme ja vertaamme heidän suorituskykyään?
Tässä kattavassa oppaassa tutkimme suurten kielen mallien arvioinnin johtavat tekniikat. Tarkastelemme kunkin lähestymistavan etuja ja haittoja, milloin niitä sovelletaan parhaiten ja miten voit hyödyntää niitä omissa LLM-testauksissasi.
Tehtävän mukaiset mittarit
Yksi suorin tapa arvioida LLM on testata sitä vakiintuneilla NLP-tehtävillä standardoitujen mittarien avulla. Esimerkiksi:
Yhteenveto
Yhteenveto-tehtävissä mittareita kuten ROUGE (Recall-Oriented Understudy for Gisting Evaluation) käytetään yleisesti. ROUGE vertaa mallin generoimaa yhteenvetoaan ihmisen kirjoittamaan “viite”-yhteenvetoaan, laskien sanien tai lauseiden päällekkäisyyden.
On useita ROUGE:n makuja, kullakin on omat etunsa ja haittansa:
- ROUGE-N: Vertaa n-grammien (N sanan jonojen) päällekkäisyyttä. ROUGE-1 käyttää yksittäisiä sanoja, ROUGE-2 käyttää bigrammeja jne. Etu on, että se ottaa huomioon sanajärjestyksen, mutta se voi olla liian tiukka.
- ROUGE-L: Perustuu pidentämään yhteiseen alijonoon (LCS). Joustavampi sanajärjestyksessä, mutta keskittyy pääkohtiin.
- ROUGE-W: Painottaa LCS-yhteyksiä niiden merkityksen mukaan. Yrittää parantaa ROUGE-L:ää.
Yleensä ROUGE-mittarit ovat nopeita, automaattisia ja toimivat hyvin järjestelmien yhteenvetojen arvioinnissa. Mutta ne eivät mittaa yhtenäisyyttä tai merkitystä. Yhteenveto voi saada korkean ROUGE-pistemäärän ja silti olla järjenvastainen.
ROUGE-N kaavan on:
ROUGE-N=∑∈{Reference Summaries}∑∑�∈{Reference Summaries}∑
Missä:
Count_{match}(gram_n)on n-grammien määrä sekä generoituissa että viite-yhteenvetoissa.Count(gram_n)on n-grammien määrä viite-yhteenvetossa.
Esimerkiksi ROUGE-1 (yksittäiset sanat):
- Generoitu yhteenveto: “Kissa istuu.”
- Viite-yhteenveto: “Kissa istuu matolla.”
- Päällekkäiset yksittäiset sanat: “Kissa”, “istuu”
- ROUGE-1-pistemäärä = 3/5 = 0,6
ROUGE-L käyttää pidentävää yhteistä alijonoa (LCS). Se on joustavampi sanajärjestyksessä. Kaava on:
ROUGE-L=���(generated,reference)max(length(generated), length(reference))
Missä LCS on pidentävän yhteisen alijonon pituus.
ROUGE-W painottaa LCS-yhteyksiä. Se ottaa huomioon kunkin yhteyden merkityksen.
Käännös
Konekäännös-tehtävissä BLEU (Bilingual Evaluation Understudy) on suosittu mittari. BLEU mittaa mallin tuottaman käännöksen ja ammattimaisen ihmisen käännöksen välisen samankaltaisuuden, käyttäen n-grammiin tarkkuutta ja lyhyyden rangaistusta.
Avainasioita siitä, miten BLEU toimii:
- Vertaa n-grammien päällekkäisyyttä n:n ollessa enintään 4 (yksittäiset sanat, bigrammit, trigrammit, 4-grammit).
- Laskee n-grammiin tarkkuuden geometrisen keskiarvon.
- Soveltaa lyhyyden rangaistusta, jos käännös on paljon lyhyempi kuin viite.
- Yleensä vaihtelee 0 ja 1 välillä, 1 ollen täydellinen vastaavuus viiteen.
BLEU korreloi kohtuullisesti ihmisten arvioilla käännöksen laadusta. Mutta sillä on rajoituksia:
- Mittaa vain tarkkuutta viiteisiin nähden, ei palautusarvoa tai F1.
- Kärsii luovista käännöksistä, joissa käytetään eri sanoja.
- Altis “kikkaamiseen” käännöstemppuilla.
Muut käännösmittarit, kuten METEOR ja TER, yrittävät parantaa BLEU:n heikkouksia. Mutta yleensä automaattiset mittarit eivät täysin kaappa käännöksen laatua.
Muut tehtävät
Lisäksi yhteenveto- ja käännös-tehtävistä, mittareita kuten F1, tarkkuus, MSE ja muut voidaan käyttää arvioimaan LLM:n suorituskykyä tehtävissä kuten:
- Tekstin luokittelu
- Tietojen poisto
- Kysymyksiin vastaaminen
- Tunteiden analyysi
- Kieliopillisten virheiden havaitseminen
Tehtävän mukaisen mittarin etu on, että arviointi voidaan tehdä täysin automaattisesti standardoitujen tietojoukkoihin käyttäen, kuten SQuAD:ia QA:lle ja GLUE-benchmarkia laajalle tehtävälle. Tulokset voidaan helposti seurata ajan myötä, kun mallit paranevat.
Mutta nämä mittarit ovat kapeasti keskittyneitä eivätkä voi mitata koko kielen laatua. LLM:t, jotka suorittavat hyvin yhden tehtävän mittareilla, voivat epäonnistua luomassa johdonmukaisia, logisia, hyödyllisiä tekstejä yleensä.
Tutkimusvertailut
Suosittu tapa arvioida LLM:ejä on testata niitä laajoilla tutkimusvertailuilla, jotka kattavat monia aiheita ja taitoja. Nämä vertailut sallivat mallien nopean testaamisen suuressa mittakaavassa.
Jotkut tunnetut vertailut ovat:
- SuperGLUE – Haastava joukko 11 monipuolista kielen tehtävää.
- GLUE – Kokoelma 9 lauseen ymmärtämistehtävää. Yksinkertaisempi kuin SuperGLUE.
- MMLU – 57 erilaista STEM-, sosiaalitieteellistä ja humanistista tehtävää. Testaa tietoa ja päättelykykyä.
- Winograd Schema Challenge – Pronominiresoluutio-ongelmat, jotka vaativat yleistä päättelykykyä.
- ARC – Haastavat luonnollisen kielen päättelytehtävät.
- Hellaswag – Yleisen päättelykyvyn tehtävät tilanteista.
- PIQA – Fysiikan kysymykset, jotka vaativat kaavioita.
Arvioimalla näillä vertailuilla tutkijat voivat nopeasti testata malleja niiden kyvyssä suorittaa matematiikkaa, logiikkaa, päättelyä, koodausta, yleistä päättelykykyä ja paljon muuta. Kysymysten oikein vastaamisen prosentti muodostaa vertailumittarin mallien vertaamiseksi.
Mutta yksi suuri ongelma vertailuissa on koulutusdatan saastuminen. Monet vertailut sisältävät esimerkkejä, jotka mallit ovat nähneet jo koulutuksen aikana. Tämä mahdollistaa mallien “muistamaan” tiettyjen kysymysten vastauksia ja suorittaa paremmin kuin heidän todellinen kykynsä.
Yritykset “puhdistaa” vertailut poistamalla päällekkäiset esimerkit. Mutta tämä on haastavaa, erityisesti kun mallit ovat saattaneet nähdä muunnettuja tai käännettyjä versioita kysymyksistä.
Joten vaikka vertailut voivat testata laajan joukon taitoja tehokkaasti, ne eivät voi luotettavasti mitata todellista päättelykykyä tai välttää pisteytysinflaatiota saastumisen vuoksi. Lisäarviointimenetelmiä tarvitaan.
LLM:n itsearviointi
Mielenkiintoinen lähestymistapa on antaa LLM:lle arvioida toisen LLM:n tuloksia. Idea on hyödyntää “helpomman” tehtävän käsitettä:
- Korkealaatuisen tuloksen tuottaminen voi olla haastavaa LLM:lle.
- Mutta määrittäminen, onko annettu tulos korkealaatuinen, voi olla helpompi tehtävä.
Esimerkiksi vaikka LLM voi kamppailla korkealaatuisen, loogisen ja kontekstuaalisen tekstin luomisella alusta alkaen, se voi helpommin arvioida, onko annettu teksti loogisesti johdonmukainen ja sopiva kontekstiin.
Prosessi on:
- Anna syötteen LLM:lle generoimaan tuloksen.
- Anna syöte + generoitu tulos toiselle “arvioijalle” LLM:lle.
- Kysy arvioijalta LLM:ltä kysymys tuloksen laadun arvioimiseksi. Esim. “Onko yllä oleva vastaus loogisesti johdonmukainen?”
Tämä lähestymistapa on nopea toteuttaa ja automatisoi LLM:n arvioinnin. Mutta siinä on joitakin haasteita:
- Suorituskyky riippuu voimakkaasti arvioijan LLM:n valinnasta ja syötteen sanamuodosta.
- Rajoitettu alkuperäisen tehtävän vaikeuden vuoksi. Monimutkaisen päättelykyvyn arviointi on edelleen haastavaa LLM:ille.
- Voi olla laskennallisesti kallista, jos käytetään API-pohjaisia LLM:ejä.
Itsearviointi on erityisen lupaava arvioimaan noudatettua tietoa RAG (noutamisella täydennettävässä generoinnissa) järjestelmissä. Lisäksi LLM-kyselyt voivat validoida, onko noudatettu konteksti käytetty soveltaen.
Kokonaisuutena itsearviointi näyttää lupaavalta, mutta vaatii huolellisuutta toteutuksessa. Se täydentää, eikä korvaa, ihmisen arvioinnin.
Ihmisen arviointi
Automaattisten mittarien ja vertailujen rajoitusten vuoksi ihmisen arviointi on edelleen kultakin standardi LLM:n laadun arvioinnissa.
Asiantuntijat voivat antaa yksityiskohtaiset laadulliset arviot:
- Tarkkuus ja faktuaalinen oikeellisuus
- Loogisuus, päättelykyky ja yleinen päättelykyky
- Yhtenäisyys, johdonmukaisuus ja lukukelpoisuus
- Sopivuus sävylle, tyylille ja äänelle
- Kieliopillisuus ja sujuvuus
- Luovuus ja hienovaraisuus
Arvioimaan mallia, ihmiset saavat joukon syötteitä ja LLM:n generoimia vastauksia. He arvioivat vastausten laatua, usein käyttäen arvosteluasteikkoja ja arviointikriteerejä.
Haitta on, että manuaalinen ihmisen arviointi on kallista, hidasta ja vaikeaa skaalata. Se vaatii myös kehittämään standardoidut kriteerit ja koulutusarvioijat soveltamaan niitä johdonmukaisesti.
Jotkut tutkijat ovat tutkineet luovia tapoja rahoittaa ihmisen LLM-arvioita turnaus-tyyppisillä järjestelmillä, joissa ihmiset veikkaavat ja arvioivat mallien välisiä otteluita. Mutta kattavuus on edelleen rajoitettu verrattuna täysiin manuaalisiin arvioihin.
Liiketoimintatapauksissa, joissa laatu on tärkeämpää kuin raaka skaala, asiantuntijoiden testaus on edelleen kultakin standardi, vaikka se on kallista. Tämä on erityisen totta riskialttiiden LLM-sovellusten kohdalla.
Johtopäätös
Suurten kielen mallien arvioinnin edellyttää monipuolisen työkalupakin käyttöä, eikä riipuvaisuutta yhdestä tekniikasta.
Yhdistämällä automaattiset lähestymistavat nopeuteen ja tarkkaan ihmisen valvontaan tarkkuuden vuoksi, voimme kehittää luotettavia testausmenetelmiä suurten kielen malleille. Vankkaan arviointiin luottamuksella voimme lukita suurten kielen mallien valtavan potentiaalin ja hallita niiden riskejä vastuullisesti.












