Andersonin kulma

GPT-tyyppisen kielen mallin luominen yhdelle kysymykselle

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Kiinalaiset tutkijat ovat kehittäneet taloudellisen menetelmän GPT-3-tyyppisten luonnollisen kielen prosessointijärjestelmien luomiseksi välttäen koulutuksen ajan ja rahan kasvavan kustannuksen, joka uhkaa lopulta siirtää tämän alan tekoälyä FAANG-pelaajille ja suurille sijoittajille.

Esitetty rakenne on nimeltään Tehtävän johtama kielen mallinnus (TLM). Sen sijaan, että koulutettaisiin valtava ja monimutkainen malli valtavalle korpukselle, joka sisältää miljardeja sanoja ja tuhansia merkintöjä ja luokkia, TLM kouluttaa paljon pienemmän mallin, joka sisältää kysymyksen suoraan malliin.

Vasemmalla, tyypillinen hyperskaalainen lähestymistapa suurvoluuminen kielen malleille; oikealla, TLM:n slimmallinen menetelmä tutkia suurta kielen korpuskua aihekohtaisesti tai kysymyskohtaisesti. Lähde: https://arxiv.org/pdf/2111.04130.pdf

Vasemmalla, tyypillinen hyperskaalainen lähestymistapa suurvoluuminen kielen malleille; oikealla, TLM:n slimmallinen menetelmä tutkia suurta kielen korpuskua aihekohtaisesti tai kysymyskohtaisesti. Lähde: https://arxiv.org/pdf/2111.04130.pdf

Tehtävänä on tuottaa yksilöllinen NLP-algoritmi tai malli yhden kysymyksen vastaamiseksi, sen sijaan, että luotaisiin valtava ja kömpelö yleinen kielen malli, joka voisi vastata laajempaan kysymysvalikoimaan.

TLM:n testaamisessa tutkijat totesivat, että uusi lähestymistapa saavuttaa tulokset, jotka ovat samanlaiset tai paremmat kuin esikoulutetut kielen mallit, kuten RoBERTa-Large, ja hyperskaalaiset NLP-järjestelmät, kuten OpenAI:n GPT-3, Google:n TRILLION Parametrin Switch Transformer Malli, Korean HyperClover, AI21 Labsin Jurassic 1 ja Microsoftin Megatron-Turing NLG 530B.

Kokeissa kahdeksalla luokitteludatasta neljällä alalla tutkijat totesivat myös, että järjestelmä vähentää koulutuksen FLOPsia (liukulaskuoperaatiot sekunnissa) kahdella kertaluokalla. Tutkijat toivovat, että TLM voi “demokratistaa” alan, josta tulee yhä elitistisempi, kun NLP-mallit ovat niin suuria, ettei niitä voida realistisesti asentaa paikallisesti, ja ne ovat sen sijaan OpenAI:n ja Microsoft Azuren kalliiden ja rajoitettujen API-rajapintojen takana.

Tutkijat toteavat, että koulutusajan lyhentäminen kahdella kertaluokalla vähentää koulutuskustannuksia yli 1 000 GPU:sta yhden päivän ajaksi ainoastaan 8 GPU:sta 48 tunniksi.

Uusi raportti on nimeltään NLP alkusta ilman laajamittaista esikoulutusta: Yksinkertainen ja tehokas rakenne, ja se on peräisin kolmelta Tsinghuan yliopiston tutkijalta Pekingistä ja yhdeltä Kiinan perustamalta tekoälykehitysyhtiö Recurrent AI:ltä.

Mahdottomat vastaukset

Tehtävänmukaisen kielen mallien koulutuksen kustannus on yhä enenevissä määrin luonnehdittu “termisesti” rajoituksena, joka rajoittaa tekoälyn ja tarkan NLP:n leviämistä kulttuurissa.

Tilastot NLP-mallirakenteiden kasvusta, A121 Labsin 2020 raportista. Lähde: https://arxiv.org/pdf/2004.08900.pdf

Tilastot NLP-mallirakenteiden kasvusta, A121 Labsin 2020 raportista. Lähde: https://arxiv.org/pdf/2004.08900.pdf

Vuonna 2019 tutkija laski, että XLNet-mallin kouluttaminen 2,5 päivässä 512 ytimellä 64 laitteessa maksaa 61 440 dollaria, kun taas GPT-3:n kouluttaminen on arvioitu maksavan 12 miljoonaa dollaria – 200 kertaa enemmän kuin edeltäjänsä, GPT-2 (vaikka uudet arviot väittävät, että se voisi kouluteta yhden päivän ajaksi ainoastaan 4,6 miljoonalla dollarilla edullisimmissa pilvipalveluissa).

Tiedon alijoukkoja kysymysten perusteella

Sen sijaan, että uusi arkkitehtuuri pyrkii saavuttamaan tarkan luokittelun, merkinnät ja yleistämisen käyttämällä kysymystä jonkinlaisena suodattimena määrittämään tietyn aiheen tiedon alijoukkoa suuresta kielen tietokannasta, joka koulutetaan yhdessä kysymyksen kanssa vastaamaan rajoitettuun aiheeseen liittyviä kysymyksiä.

Tutkijat toteavat:

‘TLM on motivoida kaksi avainidea. Ensinnäkin, ihmiset hallitsevat tehtävän käyttämällä vain pientä osaa maailman tietä (esim. opiskelijat tarvitsevat vain tarkastella muutamia lukuja kaikista maailman kirjoista kokeeseen valmistautuakseen). 

‘Oletamme, että suuressa korpuksessa on paljon turhautta tietyn tehtävän osalta. Toiseksi, koulutus valvotulla merkityllä datasta on paljon data-tehokkaampaa lopputuloksen kannalta kuin kielen mallinnuksen tavoitteen optimointi merkityttömällä datasta.  TLM käyttää tehtävätietoja kysymyksinä noutamaan pienen osan yleisestä korpuksesta.  Tämän jälkeen yhdistetään valvottu tehtävän tavoite ja kielen mallinnuksen tavoite käyttämällä sekä noutamaa dataa että tehtävätietoja.’

Lisäksi tehtävänmukaisen NLP-mallien koulutuksen tehokkuuden, tutkijat näkevät useita etuja tehtävänmukaisissa NLP-malleissa. Tutkijat voivat nauttia suuremmasta joustavuudesta, mukautettavilla strategioilla jonojen pituudelle, tokenisoinnille, hyperparametrien säätöön ja data-esityksiin.

Tutkijat ennustavat myös hybridijärjestelmien kehittymistä, jotka vaihtavat rajoitetun esikoulutuksen PLM:ää (jota ei odoteta tässä toteutuksessa) suurempaa joustavuutta ja yleistämistä koulutusajoja vastaan. He pitävät järjestelmää edistysaskelena alan kehittymiseksi.

Testaus ja tulokset

TLM testattiin kahdeksalla luokittelutehtävällä neljällä alalla – biolääketieteellisessä tieteessä, uutisissa, arvostelussa ja tietojenkäsittelytieteessä. Tehtävät jaettiin korkean resurssin ja matalan resurssin luokkiin. Korkean resurssin tehtävät sisälsivät yli 5 000 tehtävätietoa, kuten AGNews ja RCT, muun muassa; matalan resurssin tehtävät sisälsivät ChemProtin ja ACL-ARC:n sekä HyperPartisan -uutisten havaitsemisdatasta.

Tutkijat kehittivät kaksi koulutusjoukkoa, Corpus-BERT ja Corpus-RoBERTa, jälkimmäinen kymmenen kertaa suurempi kuin edellinen. Kokeet vertailivat yleisiä esikoulutettuja kielen malleja BERT (Google) ja RoBERTA (Facebook ) uuteen arkkitehtuuriin.

Raportti toteaa, että vaikka TLM on yleinen menetelmä, joka pitäisi olla rajoitettu ja soveltamiskykyisempi kuin laajemmat ja suuremmat valmiit mallit, se pystyy suorittamaan lähellä alakohtaisen hienosäätömenetelmän tasoa.

Tulokset TLM:n suorituskyvyn vertailusta BERT- ja RoBERTa-pohjaisiin joukkoihin. Tulokset listaavat keskimääräisen F1-pisteytyksen kolmen eri koulutusmittarin mukaan ja listaavat parametreja, kokonaisten koulutuslaskentojen (FLOPs) määrän ja koulutuskorpuksen koon.

Tulokset TLM:n suorituskyvyn vertailusta BERT- ja RoBERTa-pohjaisiin joukkoihin.

Tutkijat toteavat, että TLM pystyy saavuttamaan tulokset, jotka ovat vertailukelpoisia tai parempia kuin PLM:t, ja se tarvitsee vain 1/16-osan koulutusdatasta ja vähentää koulutuslaskentoja kahdella kertaluokalla. Keskimäärin TLM parantaa suorituskykyä 0,59 ja 0,24 pistettä, kun taas koulutusdatan koko vähenee kahdella kertaluokalla.

‘Nämä tulokset vahvistavat, että TLM on erittäin tarkin ja tehokkaampi kuin PLM:t. Lisäksi TLM saavuttaa enemmän etuja suuremmassa mittakaavassa. Tämä osoittaa, että suuremmat PLM:t saattavat olla koulutettu varastoimaan yleisempää tietoa, jota ei ole hyödyllistä tietyn tehtävän osalta.’

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai