AI-mallit ja alustat
Google tekee tekoälykoulutuksesta 28% nopeamman käyttämällä SLM: iä opettajina
Suurten kielen mallien (LLM) koulutus on muodostunut useimpien organisaatioiden ulottumattomaksi. Kustannukset ovat miljoonien dollarien luokkaa, ja laskentavaatimukset ovat sellaiset, että ne saisivat superserverin hikoilemaan, ja tekoälykehitys on pysynyt lukittuna teknologiajättien oville. Mutta Google (GOOGL ) on juuri kääntänyt tämän tarinan päälaelleen lähestymistavalla, joka on niin yksinkertainen, että ihmettelee, miksi kukaan ei ole ajatellut sitä aikaisemmin: käyttämällä pienempiä tekoälymalleja opettajina.
Kuinka SALT toimii: Uusi lähestymistapa tekoälymallien koulutukseen
Viimeaikaisessa tutkimusartikkelissa, jonka otsikko on “A Little Help Goes a Long Way: Efficient LLM Training by Leveraging Small LMs,” Google Research ja DeepMind esittivät SALTin (Small model Aided Large model Training), joka on uudenlainen menetelmä, joka haastaa perinteisen lähestymistapamme suurten tekoälymallien koulutukseen.
Miksi tämä tutkimus on merkittävä? Tällä hetkellä suurten tekoälymallien koulutus on kuin yrittäisi opettaa jollekulle kaiken, mitä heidän tarvitsee tietää aiheesta kerran – se on tehokasta, kallista ja usein rajoitettu organisaatioille, joilla on valtavat laskentaresurssit. SALT ottaa toisen polun, jossa on kaksi vaihetta, jotka ovat sekä innovatiivisia että käytännöllisiä.
Miten SALT toimii oikeasti:
Vaihe 1: Tietäminen
- Pienempi kielen malli (SLM) toimii opettajana, joka jakaa ymmärryksensä suuremmalle mallille
- Pienempi malli keskittyy siirtämään “opittua tietoa” niin kutsutuilla “pehmeillä merkinnöillä”
- Ajattele sitä kuin opetusavustajaa, joka käsittelee perusasioita ennen kuin opiskelija siirtyy edistyneempiin aiheisiin
- Tämä vaihe on erityisen tehokas “helppojen” oppimisalueiden osalla – alueilla, joilla pienempi malli on vahva ennusteminen luottamus
Vaihe 2: Itseohjautuva oppiminen
- Suurempi malli siirtyy itsenäiseen oppimiseen
- Se keskittyy hallitsemaan monimutkaisia malleja ja haastavia tehtäviä
- Tässä vaiheessa malli kehittää kykyjä, jotka ovat sen pienemmän “opettajan” tarjoamia
- Vaiheiden siirtymiseen käytetään huolellisesti suunniteltuja strategioita, kuten lineaarista pienenemistä ja lineaarista suhdetta
Epäteknisissä termeissä, kuvittele, että pienempi tekoälymalli on kuin avustava opettaja, joka opastaa suurempaa mallia koulutuksen alkuvaiheessa. Tämä opettaja antaa lisätietoja vastauksiensa ohella, jotka kertovat, kuinka varma se on kustakin vastauksesta. Tämä lisätieto, jota kutsutaan “pehmeiksi merkinnöiksi”, auttaa suurempaa mallia oppimaan nopeammin ja tehokkaammin.
- Lineaarinen pieneneminen: Se on kuin hitaasti vaimentaa opettajan äänen. Opettajan ohjaus tulee vähemmän merkittäväksi kussakin vaiheessa, jolloin suurempi malli voi keskittyä enemmän oppimiseen itse asioiden perusteella.
- Lineaarinen suhde: Tämä on kuin säätää tasapainoa opettajan neuvon ja itse tehtävän välillä. Koulutuksen edetessä painopiste siirtyy enemmän alkuperäiseen tehtävään, kun taas opettajan syöte tulee vähemmän hallitsevaksi.
Tulokset ovat vakuuttavat. Kun Google-tutkijat testasivat SALTia käyttämällä 1,5 miljardin parametrin SLM:ää kouluttamaan 2,8 miljardin parametrin LLM:ää Pile-aineistossa, he havainnoivat:
- 28 %:n vähennys koulutusajassa verrattuna perinteisiin menetelmiin
- Merkitsevät suorituskyvyn parannukset hienosäätöä seuranneesti:
- Matemaattisten ongelmien tarkkuus hyppäsi 34,87 %:iin (vertailukohtana 31,84 % perusarvo)
- Lukutaidon tarkkuus saavutti 67 %:n tarkkuuden (63,7 %:sta)
Mutta mikä tekee SALTista aidosti innovatiivisen on sen teoreettinen viitekehys. Tutkijat havaitsivat, että jopa “heikompi” opettajamalli voi parantaa oppilaan suorituskykyä saavuttamalla niin kutsutun “edullisen bias-varianssi-kaupan”. Yksinkertaisemmin sanottuna, pienempi malli auttaa suurempaa mallia oppimaan peruskuviot tehokkaammin, luoden vahvemman perustan edistyneemmälle oppimiselle.
Miksi SALT voi muuttaa tekoälykehityksen pelikenttää
Muistatko, kun pilvilaskenta muutti sitä, kuka voi perustaa teknologiayrityksen? SALT saattaa tehdä saman tekoälykehitykselle.
Olen seurannut tekoälykoulutuksen innovaatioita vuosia, ja useimmat läpimurrot ovat hyödyttäneet lähinnä teknologiajättimiä. Mutta SALT on erilainen.
Tässä on, mitä se voi tarkoittaa tulevaisuudelle:
Rajoitettujen resurssien organisaatioille:
- Et enää tarvitse massiivisia laskentainfrastruktuureja kehittääksesi kykeneviä tekoälymalleja
- Pienemmät tutkimuslaboratoriot ja yritykset voivat kokeilla mukautettujen mallien kehittämistä
- 28 %:n vähennys koulutusajassa kääntyy suoraan alempiin laskentakustannuksiin
- Tärkeämpää on, että voit aloittaa vaatimattomin laskentaresurssein ja silti saavuttaa ammattimaiset tulokset
Tekoälykehityksen maisemalle:
- Lisää toimijoita voi tulla mukaan, mikä johtaa monipuolisempiin ja erikoistuneempiin tekoälyratkaisuihin
- Yliopistot ja tutkimuslaitokset voivat suorittaa enemmän kokeita olemassa olevilla resursseillaan
- Tekoälytutkimuksen kynnys laskee merkittävästi
- Saattaa nähdä uusia sovelluksia aloilla, jotka aiemmin eivät voineet maksaa tekoälykehitystä
Mikä tämä tarkoittaa tulevaisuudelle
Käyttämällä pienempiä malleja opettajina, emme ainoastaan tee tekoälykoulutuksesta tehokkaampaa, vaan myös muutamme perustavanlaatuisesti sitä, kuka pääsee osallistumaan tekoälykehitykseen. Vaikutukset ulottuvat paljon laajemmalle kuin pelkästään teknisiin parannuksiin.
Tärkeimmät asiat, jotka kannattaa pitää mielessä:
- Koulutusajan 28 %:n vähennys on se, mikä erottaa sen, aloitatko tekoälyprojektin vai pitäät sitä ulottumattomana
- Suorituskyvyn parannukset (34,87 % matematiikassa, 67 % lukemistehtävissä) osoittavat, että saatavuus ei aina tarkoita laadun uhraamista
- SALTin lähestymistapa osoittaa, että joskus parhaat ratkaisut tulevat perusasioiden uudelleenarvioinnista eikä pelkästään lisäämällä laskentatehoa
Mitä kannattaa seurata:
- Pitää silmällä pienempiä organisaatioita, jotka alkavat kehittää mukautettuja tekoälymalleja
- Seurata uusia sovelluksia aloilla, jotka aiemmin eivät voineet maksaa tekoälykehitystä
- Tutkia innovaatioita siinä, miten pienempiä malleja käytetään erityistehtäviin
Muista: SALTin todellinen arvo on siinä, miten se voi muuttaa sitä, kuka pääsee kehittämään tekoälyä. Olitpa sitten johtamassa tutkimuslaboratoriota, hallinnoimassa teknologiatiimiä tai yksinkertaisesti kiinnostunut tekoälykehityksestä, tämä läpimurto voi tehdä seuraavan suuren ideasi mahdolliseksi.
Ehkä kannattaa aloittaa se tekoälyprojekti, jonka luulit olevan ulottumattomissa. Se saattaa olla mahdollisempi, kuin kuvittelit.










