AI-mallit ja alustat
Miksi AI-inferenssi, ei koulutus, on seuraava suuri insinÃķÃķrien haaste
Viimeisen vuosikymmenen ajan valokeila on ollut suunnattu tekoÃĪlyyn koulutuksessa. LÃĪpimurrot ovat suurelta osin tulleet massiivisista laskentaklustereista, triljoonaparametrisista malleista ja miljardeista dollareista, jotka on kÃĪytetty jÃĪrjestelmien âajattelunâ opettamiseen. Olemme kohdelleet tekoÃĪlykehyksen pÃĪÃĪosin rakennusprojektina: ÃĪlykkyyden pilvenpiirtÃĪjÃĪn rakentamisena. Mutta nyt, kun tÃĪmÃĪ pilvenpiirtÃĪjÃĪ on rakennettu, todellinen haaste on keino lÃķytÃĪÃĪ miljoonille, jotka tarvitsevat elÃĪÃĪ ja toimia siinÃĪ samanaikaisesti. TÃĪmÃĪ siirtÃĪÃĪ tekoÃĪlytutkijoiden ja insinÃķÃķrien fokuksen koulutuksesta (ÃĪlykkyyden luomisesta) inferenssiin (sen kÃĪyttÃĪmiseen). Koska koulutus on massiivinen, kertaluontoinen pÃĪÃĪomamenot (CapEx), inferenssi on jatkuva operaatiomenot (OpEx), joka jatkuu loputtomiin. Kun yritykset kÃĪyttÃĪvÃĪt agenteja, jotka palvelevat miljoonia kÃĪyttÃĪjiÃĪ ympÃĪri vuorokauden, he havaitsevat karun todellisuuden: inferenssi ei ole vain âkoulutus toisin pÃĪinâ. Se on perustavasti erilainen ja ehkÃĪ vaikeampi insinÃķÃķrien haaste.
Miksi inferenssikustannukset ovat tÃĪrkeÃĪmmÃĪt kuin koskaan
YmmÃĪrtÃĪÃĪksemme insinÃķÃķrien haasteen, on ensin ymmÃĪrrettÃĪvÃĪ perustavanlaatuinen taloudellinen vaatimus. Koulutusvaiheessa tehokkuus on siedettÃĪvÃĪÃĪ. Jos koulutuskesto kestÃĪÃĪ neljÃĪ viikkoa sen sijaan, ettÃĪ kolme viikkoa, se on harmi. InferenssissÃĪ kuitenkin tehokkuus voi olla katastrofaalinen liiketoiminnalle. Esimerkiksi eturintamalla olevan mallin koulutus voi maksaa 100 miljoonaa dollaria. Mutta kyseisen mallin kÃĪyttÃĪminen 10 miljoonan kyselyn vastaamiseen pÃĪivittÃĪin voi ylittÃĪÃĪ tÃĪmÃĪn kustannuksen muutamassa kuukaudessa, jos se ei ole optimoitu. TÃĪmÃĪn vuoksi todistamme markkinamuutosta, jossa inferenssisijoitukset on arvioitu ylittÃĪvÃĪn koulutussijoitukset.
InsinÃķÃķrien nÃĪkÃķkulmasta tÃĪmÃĪ siirtÃĪÃĪ maalitaulua. Emme enÃĪÃĪ optimoi lÃĪpÃĪisymÃĪÃĪrÃĪÃĪ (kuinka nopeasti voin prosessoida tÃĪmÃĪn massiivisen tietojoukon?). Optimoidaan viiveitÃĪ (kuinka nopeasti voin palauttaa yksittÃĪisen tokenin?) ja rinnakkaisuutta (kuinka monta kÃĪyttÃĪjÃĪÃĪ voin palvella yhdellÃĪ GPU:lla?). âBrute forceâ -lÃĪhestymistapa, joka hallitsi koulutusvaihetta lisÃĪÃĪmÃĪllÃĪ laskentaa, ei toimi tÃĪssÃĪ. Et voi heittÃĪÃĪ enemmÃĪn H100:ia viiveongelmaan, jos pullonkaula on muistin kaistanleveys.
MuistiseinÃĪ: Todellinen pullonkaula
VÃĪhÃĪn tunnettu totuus suurten kielen mallien (LLM) inferenssistÃĪ on, ettÃĪ se on harvoin rajoitettu laskennalla; se on rajoitettu muistilla. Koulutusvaiheessa prosessoidaan dataa massiivisissa erissÃĪ, pitÃĪen GPU:n laskentayksikÃķt tÃĪysin kÃĪytÃķssÃĪ. InferenssissÃĪ, erityisesti reaaliaikaisissa sovelluksissa kuten chatboteissa tai agenteissa, pyynnÃķt tulevat perÃĪkkÃĪin. Jokainen tokenin generoiminen edellyttÃĪÃĪ mallin lataamista miljardeista parametreistÃĪ suurta nopeutta tarjoavasta muistista (HBM) laskentaydin. TÃĪmÃĪ on âMuistiseinÃĪâ. Se on kuin Ferrarin moottori (GPU-ydin) jumissa ruuhkaliikenteessÃĪ (rajoitetussa muistikaistanleveydessÃĪ).
TÃĪmÃĪ haaste ajaa insinÃķÃķritiimejÃĪ uudelleenarvioimaan jÃĪrjestelmien arkkitehtuuriin asti. TÃĪmÃĪn vuoksi nÃĪemme Lineaarisia ProsessointiyksikÃķiden (LPU) kuten Groq:n ja erikoistuneiden HermoProsessointiyksikÃķiden (NPU) nousun. NÃĪmÃĪ piirit on suunniteltu ohittamaan HBM-pullonkaulan kÃĪyttÃĪmÃĪllÃĪ massiivisia mÃĪÃĪriÃĪ piirien sisÃĪistÃĪ SRAM:ia, kÃĪsitellessÃĪÃĪn muistiin pÃĪÃĪsyÃĪ jatkuvana datavirran sijaan yksinkertaisena nouto-operaationa. Ohjelmistosuunnittelijalle tÃĪmÃĪ merkitsee âoletusarvoisesti CUDAâ-ajan loppua. MeidÃĪn on nyt kirjoitettava koodia, joka on laitteiston tuntemista, ymmÃĪrtÃĪen tarkalleen, miten data liikkuu langassa.
Uusi raja tekoÃĪlyn tehokkuudelle
Koska emme voi aina muuttaa laitteistoa, tuleva insinÃķÃķrien rintama on ohjelmistotehokkuuden parantamisessa. TÃĪssÃĪ tapahtuu joitakin innovatiivisimmista lÃĪpimurroista. Todistamme uuden aikakauden tekniikoita, jotka uudelleenmÃĪÃĪrittelevÃĪt, miten tietokoneet toteuttavat ja suorittavat neuroverkkoja.
- Jatkuva erittely: Perinteinen erittely odottaa, kunnes âbussiâ on tÃĪynnÃĪ, ennen kuin se lÃĪhtee, mikÃĪ aiheuttaa viiveitÃĪ. Jatkuva erittely (jota edellÃĪkÃĪvijÃĪkehykset kuten vLLM ovat kehittÃĪneet) toimii kuin metrojÃĪrjestelmÃĪ, sallien uusien pyyntÃķjen liittyÃĪ tai poistua GPU:n prosessoiden junasta kussakin iteroinnissa. Se maksimoi lÃĪpÃĪisymÃĪÃĪrÃĪn ilman viiveiden uhraamista, ratkaisemalla monimutkaisen aikataulutusongelman, joka vaatii syvÃĪÃĪ OS-tasolla olevaa asiantuntemusta.
- Spekulatiivinen dekoodaus: TÃĪmÃĪ tekniikka kÃĪyttÃĪÃĪ pieniÃĪ, nopeita ja halpoja malleja luodakseen vastauksen luonnoksen, kun taas suurempi, hitaampi ja kyvykkÃĪÃĪmpi malli vahvistaa sen rinnalla. Se perustuu siihen, ettÃĪ tekstin vahvistaminen on paljon vÃĪhemmÃĪn laskennallisesti kallista kuin sen generointi.
- Avain-arvomuistin hallinta: PitkissÃĪ keskusteluissa âhistoriaâ (avain-arvomuisti) kasvaa nopeasti, kuluttaen suuria mÃĪÃĪriÃĪ GPU-muistia. InsinÃķÃķrit ovat nyt toteuttamassa âSivutettua huomiotaâ, tekniikkaa, joka on inspiroitu virtuaalimuistin sivutuksesta kÃĪyttÃķjÃĪrjestelmissÃĪ. TÃĪmÃĪ tekniikka jakaa muistin fragmentteihin ja hallitsee sitÃĪ epÃĪjatkuvasti.
Agenteille monimutkaisuus
Jos standardi-inferenssi on vaikea, agenteille se on eksponentiaalisesti vaikeampi. Standardi-chatbotti on tilaton: KÃĪyttÃĪjÃĪ kysyy, AI vastaa, prosessi pÃĪÃĪttyy. AI-agenteilla on kuitenkin silmukka. Se suunnittelee, suorittaa tyÃķkaluja, havaitsee tulokset ja toistaa. InsinÃķÃķrien nÃĪkÃķkulmasta tÃĪmÃĪ on painajainen. TÃĪmÃĪ arkkitehtoninen muutos esittÃĪÃĪ useita perustavanlaatuisia haasteita:
- Tilan hallinta: Inferenssimoottorin on yllÃĪpidettÃĪvÃĪ agentin âtilaâ ajatteluprosessin aikana useiden askelten ajan, usein jopa minuutteja.
- ÃÃĪrettÃķmÃĪt silmukat: Toisin kuin ennustettavissa eteenpÃĪin suuntautuvassa prosessissa, agentti voi jumiutua pÃĪÃĪttelysilmukkaan. Robustien âvahtienâ ja âsirkkuleidenâ kehittÃĪminen todennÃĪkÃķisyydelle perustuvassa koodissa on kokonaan uusi ala.
- Muuttuva laskenta: Yksi kÃĪyttÃĪjÃĪn pyyntÃķ voi laukaista yhden inferenssipyyntÃķ, kun taas toinen voi laukaista viisikymmentÃĪ. Kuormituksen hallinta ja autoskaalauksen infrastruktuurin hallinta, kun jokainen pyyntÃķ kantaa ÃĪÃĪrimmÃĪisen muuttableen muuttujan, vaatii kokonaan uuden luokan orkesterointilogiikkaa.
Emme siis siirry âmallien palvelustaâ âkognitiivisten arkkitehtuurien orkesteroinnistaâ.
TekoÃĪly arkipÃĪivÃĪn laitteisiin
Lopulta, energian ja verkkoviiveen rajoitukset pakottavat inferenssin reunalle. Emme voi odottaa, ettÃĪ jokainen ÃĪlykÃĪs valosarja, itseohjautuva ajoneuvo tai tehdasteleohjattu robotti ohjaisi pyynnÃķt tietokeskuksen kautta. InsinÃķÃķrien haaste tÃĪssÃĪ on pakkaus. Miten saat mallin, joka on oppinut koko internetistÃĪ, pieneen siruun, joka on pienempi kuin sorminasti, ja joka toimii paristolla?
Tekniikat kuten kvantisaatio (tarkkuuden vÃĪhentÃĪminen 16-bittisestÃĪ 4-bittiseen tai jopa 1-bittiseen) ja mallin tislaus (opettaminen pienelle opetusmallille, jotta se matkii suuren opettajan mallia) ovat muodostumassa standardikÃĪytÃĪnnÃķksi. Mutta todellinen haaste on nÃĪiden mallien kÃĪyttÃķÃķnotto hajaantuneeseen ekosysteemiin, joka kÃĪsittÃĪÃĪ miljardeja laitteita, kuten Android, iOS, upotettu Linux, mukautetut anturit, joilla on omat laitteistorajoitukset. Se on âhajaantumisen painajainenâ mobiilikehityksessÃĪ, moninkertaistettuna neuroverkkojen monimutkaisuudella.
Pohjimmiltaan
Olemme siirtymÃĪssÃĪ âPÃĪivÃĪ 2â:n aikakauteen generatiivisessa tekoÃĪlyssÃĪ. PÃĪivÃĪ 1 oli osoittaa, ettÃĪ tekoÃĪly voi kirjoittaa runoutta. PÃĪivÃĪ 2 on insinÃķÃķrien tyÃķtÃĪ, tehdÃĪkseen tÃĪmÃĪn kyvyn luotettavammaksi, edullisemmaksi ja yleisemmÃĪksi. InsinÃķÃķrit, jotka mÃĪÃĪrittelevÃĪt seuraavan vuosikymmenen, eivÃĪt vÃĪlttÃĪmÃĪttÃĪ ole niitÃĪ, jotka keksivÃĪt uusia mallirakenteita. He ovat jÃĪrjestelmÃĪinsinÃķÃķrit, ytimen hakkerit ja infrastruktuurin arkkitehdit, jotka voivat keksiÃĪ, miten palvella miljardi tokenia sekunnissa ilman, ettÃĪ se sulattaa sÃĪhkÃķverkon tai ajaa yrityksen konkurssiin. TekoÃĪly-inferenssi ei ole enÃĪÃĪ vain suoritusaikaisen yksityiskohta. Se on tuote. Ja sen optimointi on seuraava suuri insinÃķÃķrien haaste.












