AI-mallit ja alustat

Pienien mallien kapina: Miksi pienet tekoälymallit pärjäävät jättiläismalleja vastaan

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Viime vuosina tekoäly on kehittynyt suurten mallien rakentamisen kilpailun myötä. Jokainen uusi julkaisu on mitattu parametreiden määrällä, koulutusdatan koolla ja taustalla olevan infrastruktuurin mittakaavalla. Suuremmat mallit ovat yleensä olleet parempia. Vaikka teknologiajätit jatkavat yhä suurempien kielimallien kehittämistä, joissa on satoja miljardeja parametreja, hiljainen vallankumous on tapahtumassa. Pienet tekoälymallit, usein tuhansia kertoja pienemmät kuin jättimäiset vastineensa, saavuttavat vertailukelpoista ja joskus jopa parempaa suorituskykyä tiettyjen tehtävien suorittamisessa. Tämä muutos haastaa kaiken, mitä olemme ajatelleet tekoälyn skaalautuvuudesta, ja avaa uusia mahdollisuuksia demokratisoituun, tehokkaaseen tekoälyyn.

Daavidin ja Goliatin tarina modernista tekoälystä

Vuosiin tekoälyala on toiminut oletuksella, jonka mukaan suuremmat mallit tarjoavat paremman suorituskyvyn. OpenAI:n GPT-sarja on kasvanut 117 miljoonasta parametrista yli 175 miljardiin. Google (GOOGL ) PaLM on saavuttanut 540 miljardin parametrin. Suuret teknologiajätit ovat investoineet miljardeja dollareita näiden mallien koulutukseen ja investoivat edelleen suurempien mallien kehittämiseen. Tässä tilanteessa, kun parametrilaskenta on tullut avaintekijäksi mallin kapasiteetin määrittelyssä ja tekoälyn kapasiteetin rakentaminen on tullut laskennallisten resurssien ja infrastruktuurin kilpailuksi, mielenkiintoinen ilmiö on alkanut tapahtua tutkimuslaboratorioissa ympäri maailmaa.

Insinöörit alkoivat havaita, että pienemmät, tarkoin suunnitellut mallit voivat vastata tai jopa ylittää jättimallien suorituskyvyn tiettyjen tehtävien suorittamisessa. Microsoftin Phi-sarja osoitti, että 2,7 miljardin parametrin malli voi kilpailla kymmenkertaisen kokonsa mallien kanssa. Metan LLaMA osoitti, että 7 miljardin parametrin malli voi tarjota poikkeuksellisia tuloksia, kun se on koulutettu oikein. Nämä kehityssuunnat edustavat perustavanlaatuista muutosta ymmärryksessämme tekoälyn tehokkuudesta.

Tämä paradigmamuutos on merkittäviä vaikutuksia siihen, miten tekoälyä käytetään ja operoidaan. Pienet mallit voivat toimia kuluttajien laitteilla, prosessoida pyynnöt nopeammin ja kuluttaa murto-osan siitä energiasta, jota suuret mallit vaativat. Ne tekevät tekoälystä saatavilla organisaatioille, jotka eivät voi maksaa massiivista laskennallista infrastruktuuria. Ennen kaikkea ne haastavat tekoälyn kehittämisen monopooliset tendenssit, joissa vain yritykset, joilla on valtavat resurssit, voivat kilpailla.

Tehokkaan tekoälyarkkitehtuurin nousu

Pienien mallien vallankumous perustuu sofistikoituneisiin insinööritieteellisiin lähestymistapoihin, jotka maksimoivat suorituskyvyn rajoitettujen parametrivarojen puitteissa. Nämä mallit käyttävät edistyneitä tekniikoita, kuten tietämyksen tiivistämistä, jossa pienemmät “oppilas” -mallit oppivat suuremmilta “opettaja” -malleilta, ja niiden avulla voidaan dramaattisesti vähentää laskennallisia vaatimuksia.

Microsoftin Phi-4-sarja edustaa tätä lähestymistapaa. Phi-4-päätöksentekomalli, jossa on vain 14 miljardia parametriä, kilpailee malleja, jotka ovat viisi kertaa suurempia, matemaattisessa päättelyssä ja loogisissa ongelmanratkaisuissa. Vastaavasti Google Gemma 3 270M -malli osoittaa, että 270 miljoonan parametrin malli voi tarjota vahvan ohjeiden seuraamisen kyvyn ja toimia erinomaisena perustana hienosäätöön.

Metan Llama 3.2 1B -malli on toinen merkittävä läpimurto pienien mallien tehokkuudessa. Strukturoidun lohkaisun ja tietämyksen tiivistämisen avulla suuremmista Llama-malleista se säilyttää merkittävän suorituskyvyn ja toimii tehokkaasti reunalaiteilla. Nämä mallit osoittavat, että arkkitehtuuri-innovaatiot ja koulutusmenetelmät ovat tärkeämpiä kuin parametrilaskenta monissa todellisissa sovelluksissa.

Asiantuntijoiden yhdistelmä -arkkitehtuuri on merkittävä läpimurto tehokkaassa tekoälysuunnittelussa. Sen sijaan, että kaikki parametrit käytetään jokaisessa tehtävässä, nämä mallit aktivoivat vain asiaankuuluvat erikoistuneet komponentit. Ne ohjaavat eri kyselyjä erikoistuneille aliverkkorakenteille, säilyttäen laajan kyvyn ja käyttäen vähemmän aktiivisia parametreja kulloisenkin tilanteen mukaan. Mistral AI:n Mixtral 8x7B -malli osoittaa tämän lähestymistavan tehokkaasti. Vaikka siinä on 47 miljardia parametriä yhteensä, se aktivoi vain 13 miljardia parametriä kunkin kyselyn yhteydessä, saavuttaen suorituskyvyn, joka on vertailukelpoinen suurempien tiheiden mallien kanssa, ja säilyttäen nopeamman inference-nopeuden.

Kvantisointitekniikat ovat myös vaikuttaneet merkittävästi pienien mallien tehokkuuden lisäämiseen. Mallipainojen edustamisella vähemmällä bittimäärällä tutkijat voivat kutistaa malleja säilyttäen tarkin. Nykyaikaiset kvantisointimenetelmät voivat vähentää mallin kokoa jopa 75 prosentilla vähäisellä suorituskyvyn menetyksellä. Microsoftin Phi-3-mini on osoittanut tämän lähestymistavan tehokkuuden. Kun se on kvantisoitu 4-bittisen tarkin, se säilyttää yli 95 prosenttia alkuperäisestä suorituskyvystään ja vähentää muistivaatimuksia 7 gigatavusta alle 2 gigatavuun, mikä tekee siitä käytännöllisen erityisesti mobiililaitteissa.

Erikoistuminen voittaa yleistymisen

Pienien mallien vallankumous on paljastanut tärkeän totuuden tekoälyn käytöstä. Useimmat todelliset sovellukset eivät tarvitse mallia, joka voi kirjoittaa runoa, ratkaista kalkyylia tai keskustella filosofiasta. Ne tarvitsevat malleja, jotka erinomaisesti suorittavat tiettyjä tehtäviä. Asiakaspalvelu- chatbotti ei tarvitse tietää Shakespearea. Koodin täydentämistyökalu ei tarvitse lääketieteellistä tietämystä. Tämä havainto on siirtänyt fokuksen yleisten mallien rakentamisesta erikoistuneiden mallien luomiseen.

Alaan kohdistuva koulutus sallii pienien mallien keskittää rajoitetun kapasiteettinsa asiaankuuluvaan tietämykseen. 3 miljardin parametrin malli, joka on koulutettu ainoastaan oikeudellisissa asiakirjoissa, voi ylittää 70 miljardin parametrin yleisen mallin oikeudellisissa tehtävissä. Erikoistunut malli oppii syvempiä kuvioita alallaan eikä jaksa kapasiteettiaan lukuisiin muuhun liittyviin aiheisiin. Se on kuin vertaaminen erikoislääkäriin yleislääkäriin monimutkaisten toimenpiteiden suorittamisessa.

Hienosäätöstrategiat ovat muodostuneet yhä sofistikoituneemmiksi. Sen sijaan, että mallit koulutettaisiin alusta alkaen, kehittäjät aloittavat pienillä perusmalleilla ja sovittavat niitä tiettyihin tarpeisiin. Tämä lähestymistapa vaatii vähän laskennallisia resursseja ja tuottaa erittäin kykeneviä erikoistuneita malleja. Organisaatiot voivat nyt luoda mukautettuja tekoälyratkaisuja ilman massiivisia infrastruktuurisijoituksia.

Murtaen suorituskyvyn katon

Viimeaikaiset benchmarkit paljastavat yllättäviä suorituskykyetuja pienille malleille tietyillä aloilla. AI2:n Olmo 2 1B -malli ylittää samankokoiset mallit suurista teknologiajäteistä luonnollisen kielen ymmärtämisessä. Microsoftin Phi-4-mini-flash-reasoning saavuttaa jopa kymmenkertaisen suorituskyvyn ja 2-3 kertaisen vähäisemmän viiveen verrattuna perinteisiin päätöksentekomalleihin, säilyttäen matemaattisen päätöksenteon kyvyn.

Suorituskykyero tulee vielä selkeämmin esiin, kun tarkastellaan tehtäväkohtaisia sovelluksia. Pienet mallit, jotka on hienosäätelty erityisille aloille, ylittävät johdonmukaisesti yleispätevät suuret mallit tarkin ja asiaankuuluvuuden suhteen. Terveydenhuollon sovellukset, oikeudellisten asiakirjojen analyysi ja asiakaspalvelun toteutukset osoittavat erityisesti vaikuttavia tuloksia, kun pienet mallit on koulutettu alakohtaisiin tietokantoihin.

Tämä suorituskykyetu johtuu kohdennetusta koulutuslähestymistavasta. Sen sijaan, että laaja mutta pintapuolinen tietämys opitaan lukuisilla aloilla, pienet mallit kehittävät syvää asiantuntemusta kohdennetuilla aloilla. Tuloksena on luotettavampia ja asiayhteyden mukaisia vastauksia tiettyihin käyttötarkoituksiin.

Nopeus- ja tehokkuusetu

Suorituskyky ei ole vain tarkkuuden asia. Se on myös nopeuden, kustannusten ja ympäristövaikutuksen asia. Pienet mallit menestyvät kaikissa näissä ulottuvuuksissa. Pieni malli voi tuottaa vastauksia millisekunneissa, kun suuret mallit vievät sekunteja. Tämä nopeusero voi vaikuttaa vähäiseksi, mutta se tulee kriittiseksi sovelluksissa, jotka vaativat reaaliaikaisia vuorovaikutuksia tai prosessointia miljoonille pyynnöille.

Energiankulutus on toinen kriittinen ulottuvuus. Suuret mallit vaativat massiivisia datakeskuksia ja monimutkaisia jäähdytysjärjestelmiä. Jokainen kysely kuluttaa merkittävän määrän sähköä. Pienet mallit voivat toimia standardilaitteilla tai jopa henkilökohtaisilla tietokoneilla, käyttäen murto-osan siitä energiasta. Kun organisaatiot kohtaavat paineita vähentää hiilijalanjälkeään, pienien mallien ympäristöetua tulee yhä tärkeämmäksi.

Reunatoteutus on ehkä pienien mallien muuntavin ominaisuus. Nämä mallit voivat toimia suoraan puhelimilla, kannettavilla tietokoneilla tai IoT-laitteilla ilman internetyhteyttä. Kuvittele lääketieteellisiä diagnostiikka-työkaluja, jotka toimivat etäisillä alueilla ilman internetyhteyttä, tai reaaliaikaisia käännöslaitteita, jotka eivät tarvitse pilvipalveluja. Pienet mallit tekevät nämä skenaariot mahdollisiksi ja tuovat tekoälyominaisuudet miljardeille laitteille maailmanlaajuisesti.

Tietosuojaa koskevat huolenaiheet suosivat myös pieniä malleja. Kun tekoäly toimii paikallisesti käyttäjän laitteilla, arkaluontoiset tiedot eivät koskaan jää laitteen ulkopuolelle. Terveydenhuollon tarjoajat voivat analysoida potilastietoja ilman, että heidän tarvitsee ladata niitä pilvipalveluihin. Rahoituslaitokset voivat prosessoida transaktioita ilman, että heidän tarvitsee altistaa asiakastietoja ulkoisille järjestelmille. Tämä paikallinen prosessointikapasiteetti ratkaisee yhden tekoälyn omaksumisen tärkeimmistä ongelmista herkillä aloilla.

Yhteenveto

Pienien tekoälymallien nousu haastaa uskomuksen, jonka mukaan suuremmat mallit aina tarjoavat paremman suorituskyvyn. Pienet, tiivisrakenteiset mallit, joissa on vähemmän parametreja, ovat nyt vertailukelpoisia tai jopa ylittävät suurempia malleja tiettyjen tehtävien suorittamisessa, käyttäen tekniikoita kuten tietämyksen tiivistämistä, kvantisointia ja erikoistumista. Tämä muutos tekee tekoälystä helpommin saatavilla nopeamman ja energiatehokkaamman käytön arkipäivän laitteilla. Se myös vähentää kustannuksia, alentaa ympäristövaikutusta ja parantaa tietosuojaa mahdollistaen paikallisen käytön. Keskittyessämme tehokkaisiin, tehtäväkohtaisiin malleihin massiivisten yleisten järjestelmien sijaan, tekoälystä tulee käytännöllisempää, edullisempaa ja hyödyllisempää sekä organisaatioille että yksilöille.

Tohtori Tehseen Zia on COMSATS University Islamabadin apulaisprofessori, joka on suorittanut AI-tutkinnon Wienin Teknillisen yliopiston, Itävallassa. Erityisalanaan ovat Tekoäly, Konenäkö, Data Science ja Machine Learning, ja hän on tehnyt merkittäviä töitä julkaisemalla artikkeleita arvostetuissa tieteellisissä lehdissä. Tohtori Tehseen on myös johtanut useita teollisuusprojekteja pää tutkijana ja toiminut AI-konsulttina.