AI-mallit ja alustat

Voitko luoda suuria kielen mallit kuten ChatGPT puoleen hintaan?

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Suuret kielen mallit (LLM) kuten GPT-3 ja ChatGPT ovat vallankin vallannut tekoälyalueen tarjoamalla luonnollisen kielen ymmärtämisen ja sisällön luomismahdollisuuksia. Mutta niiden kehittäminen tulee suurella kustannuksella, joka rajoittaa niiden saatavuutta ja edelleen tutkimusta. Tutkijat arvioivat, että GPT-3:n kouluttaminen maksoi OpenAI:lle noin 5 miljoonaa dollaria. Microsoft (MSFT ) kuitenkin tunnisti potentiaalin ja investoi 1 miljardi dollaria vuonna 2019 ja 10 miljardi dollaria vuonna 2023 OpenAI:n GPT-3- ja ChatGPT-hankkeeseen.

LLM:t ovat koneoppimismalleja, jotka on koulutettu laajoilla tekstuaalisilla tiedoilla NLP-sovelluksia varten. Ne perustuvat transformer-arkkitehtuuriin ja hyödyntävät huomiomekanismeja NLP-tehtävissä kuten kysymys-vastaus, konekäännös, mielipideanalyysi jne.

Kysymys on: voidaanko näiden suurten mallien tehokkuutta lisätä samalla vähentäen laskennallista kustannusta ja koulutusaikaa?

Useita lähestymistapoja, kuten Progressiiviset neuroniverkot, Verkkomorfismi, Intra-layer-malli-rinnakkaisuus, Tietäminen periytyminen jne., on kehitetty vähentämään neuroverkkojen koulutuksen laskennallista kustannusta. Uusi LiGO (Lineaarinen kasvutoiminto) -lähestymistapa, josta keskustelemme, asettaa uuden vertailukohdan. Se puolittaa LLM:n koulutuksen laskennallisen kustannuksen.

Ennen tämän tekniikan käsittelemistä on tärkeää tarkastella tekijöitä, jotka vaikuttavat LLM:n korkeaan hintaan.

Suurten kielen mallien rakentamisen kustannus

Kolme suurta kustannusta LLM:n kehittämisessä ovat seuraavat:

1. Laskennalliset resurssit

LLM:n rakentaminen vaatii massiivisia laskennallisia resursseja koulutuksen suorittamiseksi suurilla tietojoukoilla. Niiden on käsiteltävä miljardeja parametreja ja opittava monimutkaisia malleja suurista tekstuaalisista tiedoista.

Erityisen laitteiston, kuten grafiikkaprosessorien (GPU) ja tensor-prosessorien (TPU), investointi on tarpeen LLM:n rakentamiseen ja koulutukseen, jotta voidaan saavuttaa huipputason suorituskyky.

Esimerkiksi GPT-3 koulutettiin supertietokoneella, jossa oli 10 000 yritysluokan GPU:ta (H100 ja A100) ja 285 000 prosessoriydintä.

2. Energiankulutus

LLM:n rakentamiseen tarvittavat intensiiviset laskennalliset resurssit johtavat merkittäviin energiankulutukseen. Esimerkiksi 175 miljardin parametrin GPT-3:n koulutus kesti 14,8 päivää 10 000 V100 GPU:n avulla, mikä vastaa 3,55 miljoonaa GPU-tuntia. Tällaisen korkean energiankulutuksen on merkittäviä ympäristövaikutuksia.

3. Tiedon varastointi ja hallinta

LLM:t koulutetaan suurilla tietojoukoilla. Esimerkiksi GPT-3 koulutettiin laajalla tekstuaalisella datalla, joka sisälsi Common Crawl, WebText2, Books1, Books2 ja Wikipedia jne. Merkittävä infrastruktuurin investointi on tarpeen näiden tietojoukkojen keräämiseen, kuratointiin ja varastointiin.

Myös pilvitallennus on tarpeen tietojen varastointiin, ja ihmisten asiantuntemus tietojen esikäsittelyyn ja versiohallintaan. Lisäksi varmistaminen, että tietojen hallintastrategia noudattaa sääntöjä kuten GDPR:ää, lisää kustannuksia.

LiGO-tekniikka: Vähennä suurten kielen mallien rakentamisen kustannusta puoleen

LiGO (Lineaarinen kasvutoiminto) on uusi tekniikka, jonka tutkijat MIT:stä ovat kehittäneet vähentämään LLM:n koulutuksen laskennallista kustannusta 50 %. Menetelmässä käytetään pienempien esikoulutettujen mallien painoja suurempien mallien aloittamiseen, mikä mahdollistaa tehokkaan neuroverkkojen skaalautumisen.

Yoon Kim, artikkelin seniori, sanoo:

”On arvioitu, että mallien koulutus samassa mittakaavassa kuin ChatGPT:n oletetaan olevan, voi kestää miljoonia dollareita vain yhden koulutussession vuoksi. Voimmeko parantaa näiden koulutusmenetelmien tehokkuutta, jotta voimme saada hyviä malleja vähemmässä ajassa ja vähemmällä rahalla? Esitämme tämän tekemisen pienempien kielen mallien avulla, jotka on aiemmin koulutettu.”

Tämä menetelmä säilyttää suurempien mallien suorituskyvyn hyödyt vähentäen laskennallista kustannusta ja koulutusaikaa verrattuna siihen, että koulutetaan suuri malli alusta alkaen. LiGO käyttää dataohjattua lineaarista kasvutoimintoa, joka yhdistää syvyyden ja leveyden toimintoja optimaaliseen suorituskykyyn.

Artikkelissa käytettiin useita tietoja tekstin perustaisiin kokeisiin, mukaan lukien englanninkielinen Wikipedia-korpus BERT- ja RoBERTa-mallien koulutukseen ja C4-tieto GPT2-mallin koulutukseen.

LiGO-tekniikan kokeiluun kuului BERT-Small-mallin kasvattaminen BERT-Base-malliksi, BERT-Base-mallin kasvattaminen BERT-Large-malliksi, RoBERTaSmall-mallin kasvattaminen RoBERTa-Base-malliksi, GPT2-Base-mallin kasvattaminen GPT2-Medium-malliksi ja CaiT-XS-mallin kasvattaminen CaiT-S-malliksi.

Tutkijat vertailivat lähestymistapaansa useisiin muihin vertailukohteisiin, mukaan lukien koulutus alusta alkaen, progressiivinen koulutus, bert2BERT, ja KI.

LiGO-tekniikka tarjosi 44,7 %:n säästön laskentaoperaatioissa (FLOPs) ja 40,7 %:n säästön seinäajassa verrattuna BERT-Base-mallin koulutukseen alusta alkaen BERT-Small-mallin uudelleenkäytöllä. LiGO-kasvutoiminto suoriutui paremmin kuin StackBERT, MSLT, bert2BERT ja KI tehokkaassa koulutuksessa.

Hyödyt LiGO-koulutusoptimoimistekniikan käytöstä

LiGO on tehokas neuroverkkojen koulutusmenetelmä, jolla on useita hyötyjä:

1. Nopeampi koulutus

Kuten mainittiin aiemmin, nopeampi koulutus on LiGO-tekniikan pääetuoitus. Se kouluttaa LLM:t puolessa ajassa, lisäten tuottavuutta ja vähentäen kustannuksia.

2. Resurssitehokkuus

LiGO on resurssitehokas, koska se vähentää seinäaikaa ja laskentaoperaatioita, johtaen kustannustehokkaampaan ja ympäristöystävällisempään lähestymistapaan suurten transformer-mallien koulutukseen.

3. Yleistettävyys

LiGO-tekniikka on parantanut sekä kielen että näön transformer-mallien suorituskykyä, mikä viittaa siihen, että se on yleistettävä tekniikka, jota voidaan soveltaa moniin tehtäviin.

Kaupallisten tekoälytuotteiden rakentaminen on vain yksi osa kustannuksista, jotka liittyvät tekoälyjärjestelmiin. Toinen merkittävä kustannuskomponentti tulee päivittäisistä toiminnasta. Esimerkiksi OpenAI:lle maksaa noin 700 000 dollaria päivässä vastata kysymyksiin ChatGPT:n avulla. Tutkijat odotetaan jatkavan lähestymistapojen kehittämistä, jotka tekevät LLM:istä kustannustehokkaampia koulutuksen aikana ja helpommin saatavilla suoritusaikana.

Lisää tekoälyyn liittyvää sisältöä löytyy unite.ai:sta.

Haziqa on Data Scientist, jolla on laaja kokemus teknisen sisällön kirjoittamisesta AI- ja SaaS-yrityksille.