AI-mallit ja alustat

Miksi AI-inferenssi, ei koulutus, on seuraava suuri insinÃķÃķrien haaste

mm
LisÃĪÃĪ Unite.AI suosikkilÃĪhteisiisi Google-palvelussa

Viimeisen vuosikymmenen ajan valokeila on ollut suunnattu tekoÃĪlyyn koulutuksessa. LÃĪpimurrot ovat suurelta osin tulleet massiivisista laskentaklustereista, triljoonaparametrisista malleista ja miljardeista dollareista, jotka on kÃĪytetty jÃĪrjestelmien “ajattelun” opettamiseen. Olemme kohdelleet tekoÃĪlykehyksen pÃĪÃĪosin rakennusprojektina: ÃĪlykkyyden pilvenpiirtÃĪjÃĪn rakentamisena. Mutta nyt, kun tÃĪmÃĪ pilvenpiirtÃĪjÃĪ on rakennettu, todellinen haaste on keino lÃķytÃĪÃĪ miljoonille, jotka tarvitsevat elÃĪÃĪ ja toimia siinÃĪ samanaikaisesti. TÃĪmÃĪ siirtÃĪÃĪ tekoÃĪlytutkijoiden ja insinÃķÃķrien fokuksen koulutuksesta (ÃĪlykkyyden luomisesta) inferenssiin (sen kÃĪyttÃĪmiseen). Koska koulutus on massiivinen, kertaluontoinen pÃĪÃĪomamenot (CapEx), inferenssi on jatkuva operaatiomenot (OpEx), joka jatkuu loputtomiin. Kun yritykset kÃĪyttÃĪvÃĪt agenteja, jotka palvelevat miljoonia kÃĪyttÃĪjiÃĪ ympÃĪri vuorokauden, he havaitsevat karun todellisuuden: inferenssi ei ole vain “koulutus toisin pÃĪin”. Se on perustavasti erilainen ja ehkÃĪ vaikeampi insinÃķÃķrien haaste.

Miksi inferenssikustannukset ovat tÃĪrkeÃĪmmÃĪt kuin koskaan

YmmÃĪrtÃĪÃĪksemme insinÃķÃķrien haasteen, on ensin ymmÃĪrrettÃĪvÃĪ perustavanlaatuinen taloudellinen vaatimus. Koulutusvaiheessa tehokkuus on siedettÃĪvÃĪÃĪ. Jos koulutuskesto kestÃĪÃĪ neljÃĪ viikkoa sen sijaan, ettÃĪ kolme viikkoa, se on harmi. InferenssissÃĪ kuitenkin tehokkuus voi olla katastrofaalinen liiketoiminnalle. Esimerkiksi eturintamalla olevan mallin koulutus voi maksaa 100 miljoonaa dollaria. Mutta kyseisen mallin kÃĪyttÃĪminen 10 miljoonan kyselyn vastaamiseen pÃĪivittÃĪin voi ylittÃĪÃĪ tÃĪmÃĪn kustannuksen muutamassa kuukaudessa, jos se ei ole optimoitu. TÃĪmÃĪn vuoksi todistamme markkinamuutosta, jossa inferenssisijoitukset on arvioitu ylittÃĪvÃĪn koulutussijoitukset.

InsinÃķÃķrien nÃĪkÃķkulmasta tÃĪmÃĪ siirtÃĪÃĪ maalitaulua. Emme enÃĪÃĪ optimoi lÃĪpÃĪisymÃĪÃĪrÃĪÃĪ (kuinka nopeasti voin prosessoida tÃĪmÃĪn massiivisen tietojoukon?). Optimoidaan viiveitÃĪ (kuinka nopeasti voin palauttaa yksittÃĪisen tokenin?) ja rinnakkaisuutta (kuinka monta kÃĪyttÃĪjÃĪÃĪ voin palvella yhdellÃĪ GPU:lla?). “Brute force” -lÃĪhestymistapa, joka hallitsi koulutusvaihetta lisÃĪÃĪmÃĪllÃĪ laskentaa, ei toimi tÃĪssÃĪ. Et voi heittÃĪÃĪ enemmÃĪn H100:ia viiveongelmaan, jos pullonkaula on muistin kaistanleveys.

MuistiseinÃĪ: Todellinen pullonkaula

VÃĪhÃĪn tunnettu totuus suurten kielen mallien (LLM) inferenssistÃĪ on, ettÃĪ se on harvoin rajoitettu laskennalla; se on rajoitettu muistilla. Koulutusvaiheessa prosessoidaan dataa massiivisissa erissÃĪ, pitÃĪen GPU:n laskentayksikÃķt tÃĪysin kÃĪytÃķssÃĪ. InferenssissÃĪ, erityisesti reaaliaikaisissa sovelluksissa kuten chatboteissa tai agenteissa, pyynnÃķt tulevat perÃĪkkÃĪin. Jokainen tokenin generoiminen edellyttÃĪÃĪ mallin lataamista miljardeista parametreistÃĪ suurta nopeutta tarjoavasta muistista (HBM) laskentaydin. TÃĪmÃĪ on “MuistiseinÃĪ”. Se on kuin Ferrarin moottori (GPU-ydin) jumissa ruuhkaliikenteessÃĪ (rajoitetussa muistikaistanleveydessÃĪ).

TÃĪmÃĪ haaste ajaa insinÃķÃķritiimejÃĪ uudelleenarvioimaan jÃĪrjestelmien arkkitehtuuriin asti. TÃĪmÃĪn vuoksi nÃĪemme Lineaarisia ProsessointiyksikÃķiden (LPU) kuten Groq:n ja erikoistuneiden HermoProsessointiyksikÃķiden (NPU) nousun. NÃĪmÃĪ piirit on suunniteltu ohittamaan HBM-pullonkaulan kÃĪyttÃĪmÃĪllÃĪ massiivisia mÃĪÃĪriÃĪ piirien sisÃĪistÃĪ SRAM:ia, kÃĪsitellessÃĪÃĪn muistiin pÃĪÃĪsyÃĪ jatkuvana datavirran sijaan yksinkertaisena nouto-operaationa. Ohjelmistosuunnittelijalle tÃĪmÃĪ merkitsee “oletusarvoisesti CUDA”-ajan loppua. MeidÃĪn on nyt kirjoitettava koodia, joka on laitteiston tuntemista, ymmÃĪrtÃĪen tarkalleen, miten data liikkuu langassa.

Uusi raja tekoÃĪlyn tehokkuudelle

Koska emme voi aina muuttaa laitteistoa, tuleva insinÃķÃķrien rintama on ohjelmistotehokkuuden parantamisessa. TÃĪssÃĪ tapahtuu joitakin innovatiivisimmista lÃĪpimurroista. Todistamme uuden aikakauden tekniikoita, jotka uudelleenmÃĪÃĪrittelevÃĪt, miten tietokoneet toteuttavat ja suorittavat neuroverkkoja.

  • Jatkuva erittely: Perinteinen erittely odottaa, kunnes “bussi” on tÃĪynnÃĪ, ennen kuin se lÃĪhtee, mikÃĪ aiheuttaa viiveitÃĪ. Jatkuva erittely (jota edellÃĪkÃĪvijÃĪkehykset kuten vLLM ovat kehittÃĪneet) toimii kuin metrojÃĪrjestelmÃĪ, sallien uusien pyyntÃķjen liittyÃĪ tai poistua GPU:n prosessoiden junasta kussakin iteroinnissa. Se maksimoi lÃĪpÃĪisymÃĪÃĪrÃĪn ilman viiveiden uhraamista, ratkaisemalla monimutkaisen aikataulutusongelman, joka vaatii syvÃĪÃĪ OS-tasolla olevaa asiantuntemusta.
  • Spekulatiivinen dekoodaus: TÃĪmÃĪ tekniikka kÃĪyttÃĪÃĪ pieniÃĪ, nopeita ja halpoja malleja luodakseen vastauksen luonnoksen, kun taas suurempi, hitaampi ja kyvykkÃĪÃĪmpi malli vahvistaa sen rinnalla. Se perustuu siihen, ettÃĪ tekstin vahvistaminen on paljon vÃĪhemmÃĪn laskennallisesti kallista kuin sen generointi.
  • Avain-arvomuistin hallinta: PitkissÃĪ keskusteluissa “historia” (avain-arvomuisti) kasvaa nopeasti, kuluttaen suuria mÃĪÃĪriÃĪ GPU-muistia. InsinÃķÃķrit ovat nyt toteuttamassa “Sivutettua huomiota”, tekniikkaa, joka on inspiroitu virtuaalimuistin sivutuksesta kÃĪyttÃķjÃĪrjestelmissÃĪ. TÃĪmÃĪ tekniikka jakaa muistin fragmentteihin ja hallitsee sitÃĪ epÃĪjatkuvasti.

Agenteille monimutkaisuus

Jos standardi-inferenssi on vaikea, agenteille se on eksponentiaalisesti vaikeampi. Standardi-chatbotti on tilaton: KÃĪyttÃĪjÃĪ kysyy, AI vastaa, prosessi pÃĪÃĪttyy. AI-agenteilla on kuitenkin silmukka. Se suunnittelee, suorittaa tyÃķkaluja, havaitsee tulokset ja toistaa. InsinÃķÃķrien nÃĪkÃķkulmasta tÃĪmÃĪ on painajainen. TÃĪmÃĪ arkkitehtoninen muutos esittÃĪÃĪ useita perustavanlaatuisia haasteita:

  1. Tilan hallinta: Inferenssimoottorin on yllÃĪpidettÃĪvÃĪ agentin “tila” ajatteluprosessin aikana useiden askelten ajan, usein jopa minuutteja.
  2. ÄÃĪrettÃķmÃĪt silmukat: Toisin kuin ennustettavissa eteenpÃĪin suuntautuvassa prosessissa, agentti voi jumiutua pÃĪÃĪttelysilmukkaan. Robustien “vahtien” ja “sirkkuleiden” kehittÃĪminen todennÃĪkÃķisyydelle perustuvassa koodissa on kokonaan uusi ala.
  3. Muuttuva laskenta: Yksi kÃĪyttÃĪjÃĪn pyyntÃķ voi laukaista yhden inferenssipyyntÃķ, kun taas toinen voi laukaista viisikymmentÃĪ. Kuormituksen hallinta ja autoskaalauksen infrastruktuurin hallinta, kun jokainen pyyntÃķ kantaa ÃĪÃĪrimmÃĪisen muuttableen muuttujan, vaatii kokonaan uuden luokan orkesterointilogiikkaa.

Emme siis siirry “mallien palvelusta” “kognitiivisten arkkitehtuurien orkesteroinnista”.

TekoÃĪly arkipÃĪivÃĪn laitteisiin

Lopulta, energian ja verkkoviiveen rajoitukset pakottavat inferenssin reunalle. Emme voi odottaa, ettÃĪ jokainen ÃĪlykÃĪs valosarja, itseohjautuva ajoneuvo tai tehdasteleohjattu robotti ohjaisi pyynnÃķt tietokeskuksen kautta. InsinÃķÃķrien haaste tÃĪssÃĪ on pakkaus. Miten saat mallin, joka on oppinut koko internetistÃĪ, pieneen siruun, joka on pienempi kuin sorminasti, ja joka toimii paristolla?

Tekniikat kuten kvantisaatio (tarkkuuden vÃĪhentÃĪminen 16-bittisestÃĪ 4-bittiseen tai jopa 1-bittiseen) ja mallin tislaus (opettaminen pienelle opetusmallille, jotta se matkii suuren opettajan mallia) ovat muodostumassa standardikÃĪytÃĪnnÃķksi. Mutta todellinen haaste on nÃĪiden mallien kÃĪyttÃķÃķnotto hajaantuneeseen ekosysteemiin, joka kÃĪsittÃĪÃĪ miljardeja laitteita, kuten Android, iOS, upotettu Linux, mukautetut anturit, joilla on omat laitteistorajoitukset. Se on “hajaantumisen painajainen” mobiilikehityksessÃĪ, moninkertaistettuna neuroverkkojen monimutkaisuudella.

Pohjimmiltaan

Olemme siirtymÃĪssÃĪ â€œPÃĪivÃĪ 2”:n aikakauteen generatiivisessa tekoÃĪlyssÃĪ. PÃĪivÃĪ 1 oli osoittaa, ettÃĪ tekoÃĪly voi kirjoittaa runoutta. PÃĪivÃĪ 2 on insinÃķÃķrien tyÃķtÃĪ, tehdÃĪkseen tÃĪmÃĪn kyvyn luotettavammaksi, edullisemmaksi ja yleisemmÃĪksi. InsinÃķÃķrit, jotka mÃĪÃĪrittelevÃĪt seuraavan vuosikymmenen, eivÃĪt vÃĪlttÃĪmÃĪttÃĪ ole niitÃĪ, jotka keksivÃĪt uusia mallirakenteita. He ovat jÃĪrjestelmÃĪinsinÃķÃķrit, ytimen hakkerit ja infrastruktuurin arkkitehdit, jotka voivat keksiÃĪ, miten palvella miljardi tokenia sekunnissa ilman, ettÃĪ se sulattaa sÃĪhkÃķverkon tai ajaa yrityksen konkurssiin. TekoÃĪly-inferenssi ei ole enÃĪÃĪ vain suoritusaikaisen yksityiskohta. Se on tuote. Ja sen optimointi on seuraava suuri insinÃķÃķrien haaste.

Tohtori Tehseen Zia on COMSATS University Islamabadin apulaisprofessori, joka on suorittanut AI-tutkinnon Wienin Teknillisen yliopiston, ItÃĪvallassa. Erityisalanaan ovat TekoÃĪly, KonenÃĪkÃķ, Data Science ja Machine Learning, ja hÃĪn on tehnyt merkittÃĪviÃĪ tÃķitÃĪ julkaisemalla artikkeleita arvostetuissa tieteellisissÃĪ lehdissÃĪ. Tohtori Tehseen on myÃķs johtanut useita teollisuusprojekteja pÃĪÃĪ tutkijana ja toiminut AI-konsulttina.