AI-mallit ja alustat

Miksi AI-inferenssi, ei koulutus, on seuraava suuri insinöörien haaste

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Viimeisen vuosikymmenen ajan valokeila on ollut suunnattu tekoälyyn koulutuksessa. Läpimurrot ovat suurelta osin tulleet massiivisista laskentaklustereista, triljoonaparametrisista malleista ja miljardeista dollareista, jotka on käytetty järjestelmien “ajattelun” opettamiseen. Olemme kohdelleet tekoälykehyksen pääosin rakennusprojektina: älykkyyden pilvenpiirtäjän rakentamisena. Mutta nyt, kun tämä pilvenpiirtäjä on rakennettu, todellinen haaste on keino löytää miljoonille, jotka tarvitsevat elää ja toimia siinä samanaikaisesti. Tämä siirtää tekoälytutkijoiden ja insinöörien fokuksen koulutuksesta (älykkyyden luomisesta) inferenssiin (sen käyttämiseen). Koska koulutus on massiivinen, kertaluontoinen pääomamenot (CapEx), inferenssi on jatkuva operaatiomenot (OpEx), joka jatkuu loputtomiin. Kun yritykset käyttävät agenteja, jotka palvelevat miljoonia käyttäjiä ympäri vuorokauden, he havaitsevat karun todellisuuden: inferenssi ei ole vain “koulutus toisin päin”. Se on perustavasti erilainen ja ehkä vaikeampi insinöörien haaste.

Miksi inferenssikustannukset ovat tärkeämmät kuin koskaan

Ymmärtääksemme insinöörien haasteen, on ensin ymmärrettävä perustavanlaatuinen taloudellinen vaatimus. Koulutusvaiheessa tehokkuus on siedettävää. Jos koulutuskesto kestää neljä viikkoa sen sijaan, että kolme viikkoa, se on harmi. Inferenssissä kuitenkin tehokkuus voi olla katastrofaalinen liiketoiminnalle. Esimerkiksi eturintamalla olevan mallin koulutus voi maksaa 100 miljoonaa dollaria. Mutta kyseisen mallin käyttäminen 10 miljoonan kyselyn vastaamiseen päivittäin voi ylittää tämän kustannuksen muutamassa kuukaudessa, jos se ei ole optimoitu. Tämän vuoksi todistamme markkinamuutosta, jossa inferenssisijoitukset on arvioitu ylittävän koulutussijoitukset.

Insinöörien näkökulmasta tämä siirtää maalitaulua. Emme enää optimoi läpäisymäärää (kuinka nopeasti voin prosessoida tämän massiivisen tietojoukon?). Optimoidaan viiveitä (kuinka nopeasti voin palauttaa yksittäisen tokenin?) ja rinnakkaisuutta (kuinka monta käyttäjää voin palvella yhdellä GPU:lla?). “Brute force” -lähestymistapa, joka hallitsi koulutusvaihetta lisäämällä laskentaa, ei toimi tässä. Et voi heittää enemmän H100:ia viiveongelmaan, jos pullonkaula on muistin kaistanleveys.

Muistiseinä: Todellinen pullonkaula

Vähän tunnettu totuus suurten kielen mallien (LLM) inferenssistä on, että se on harvoin rajoitettu laskennalla; se on rajoitettu muistilla. Koulutusvaiheessa prosessoidaan dataa massiivisissa erissä, pitäen GPU:n laskentayksiköt täysin käytössä. Inferenssissä, erityisesti reaaliaikaisissa sovelluksissa kuten chatboteissa tai agenteissa, pyynnöt tulevat peräkkäin. Jokainen tokenin generoiminen edellyttää mallin lataamista miljardeista parametreistä suurta nopeutta tarjoavasta muistista (HBM) laskentaydin. Tämä on “Muistiseinä”. Se on kuin Ferrarin moottori (GPU-ydin) jumissa ruuhkaliikenteessä (rajoitetussa muistikaistanleveydessä).

Tämä haaste ajaa insinööritiimejä uudelleenarvioimaan järjestelmien arkkitehtuuriin asti. Tämän vuoksi näemme Lineaarisia Prosessointiyksiköiden (LPU) kuten Groq:n ja erikoistuneiden HermoProsessointiyksiköiden (NPU) nousun. Nämä piirit on suunniteltu ohittamaan HBM-pullonkaulan käyttämällä massiivisia määriä piirien sisäistä SRAM:ia, käsitellessään muistiin pääsyä jatkuvana datavirran sijaan yksinkertaisena nouto-operaationa. Ohjelmistosuunnittelijalle tämä merkitsee “oletusarvoisesti CUDA”-ajan loppua. Meidän on nyt kirjoitettava koodia, joka on laitteiston tuntemista, ymmärtäen tarkalleen, miten data liikkuu langassa.

Uusi raja tekoälyn tehokkuudelle

Koska emme voi aina muuttaa laitteistoa, tuleva insinöörien rintama on ohjelmistotehokkuuden parantamisessa. Tässä tapahtuu joitakin innovatiivisimmista läpimurroista. Todistamme uuden aikakauden tekniikoita, jotka uudelleenmäärittelevät, miten tietokoneet toteuttavat ja suorittavat neuroverkkoja.

  • Jatkuva erittely: Perinteinen erittely odottaa, kunnes “bussi” on täynnä, ennen kuin se lähtee, mikä aiheuttaa viiveitä. Jatkuva erittely (jota edelläkävijäkehykset kuten vLLM ovat kehittäneet) toimii kuin metrojärjestelmä, sallien uusien pyyntöjen liittyä tai poistua GPU:n prosessoiden junasta kussakin iteroinnissa. Se maksimoi läpäisymäärän ilman viiveiden uhraamista, ratkaisemalla monimutkaisen aikataulutusongelman, joka vaatii syvää OS-tasolla olevaa asiantuntemusta.
  • Spekulatiivinen dekoodaus: Tämä tekniikka käyttää pieniä, nopeita ja halpoja malleja luodakseen vastauksen luonnoksen, kun taas suurempi, hitaampi ja kyvykkäämpi malli vahvistaa sen rinnalla. Se perustuu siihen, että tekstin vahvistaminen on paljon vähemmän laskennallisesti kallista kuin sen generointi.
  • Avain-arvomuistin hallinta: Pitkissä keskusteluissa “historia” (avain-arvomuisti) kasvaa nopeasti, kuluttaen suuria määriä GPU-muistia. Insinöörit ovat nyt toteuttamassa “Sivutettua huomiota”, tekniikkaa, joka on inspiroitu virtuaalimuistin sivutuksesta käyttöjärjestelmissä. Tämä tekniikka jakaa muistin fragmentteihin ja hallitsee sitä epäjatkuvasti.

Agenteille monimutkaisuus

Jos standardi-inferenssi on vaikea, agenteille se on eksponentiaalisesti vaikeampi. Standardi-chatbotti on tilaton: Käyttäjä kysyy, AI vastaa, prosessi päättyy. AI-agenteilla on kuitenkin silmukka. Se suunnittelee, suorittaa työkaluja, havaitsee tulokset ja toistaa. Insinöörien näkökulmasta tämä on painajainen. Tämä arkkitehtoninen muutos esittää useita perustavanlaatuisia haasteita:

  1. Tilan hallinta: Inferenssimoottorin on ylläpidettävä agentin “tila” ajatteluprosessin aikana useiden askelten ajan, usein jopa minuutteja.
  2. Äärettömät silmukat: Toisin kuin ennustettavissa eteenpäin suuntautuvassa prosessissa, agentti voi jumiutua päättelysilmukkaan. Robustien “vahtien” ja “sirkkuleiden” kehittäminen todennäköisyydelle perustuvassa koodissa on kokonaan uusi ala.
  3. Muuttuva laskenta: Yksi käyttäjän pyyntö voi laukaista yhden inferenssipyyntö, kun taas toinen voi laukaista viisikymmentä. Kuormituksen hallinta ja autoskaalauksen infrastruktuurin hallinta, kun jokainen pyyntö kantaa äärimmäisen muuttableen muuttujan, vaatii kokonaan uuden luokan orkesterointilogiikkaa.

Emme siis siirry “mallien palvelusta” “kognitiivisten arkkitehtuurien orkesteroinnista”.

Tekoäly arkipäivän laitteisiin

Lopulta, energian ja verkkoviiveen rajoitukset pakottavat inferenssin reunalle. Emme voi odottaa, että jokainen älykäs valosarja, itseohjautuva ajoneuvo tai tehdasteleohjattu robotti ohjaisi pyynnöt tietokeskuksen kautta. Insinöörien haaste tässä on pakkaus. Miten saat mallin, joka on oppinut koko internetistä, pieneen siruun, joka on pienempi kuin sorminasti, ja joka toimii paristolla?

Tekniikat kuten kvantisaatio (tarkkuuden vähentäminen 16-bittisestä 4-bittiseen tai jopa 1-bittiseen) ja mallin tislaus (opettaminen pienelle opetusmallille, jotta se matkii suuren opettajan mallia) ovat muodostumassa standardikäytännöksi. Mutta todellinen haaste on näiden mallien käyttöönotto hajaantuneeseen ekosysteemiin, joka käsittää miljardeja laitteita, kuten Android, iOS, upotettu Linux, mukautetut anturit, joilla on omat laitteistorajoitukset. Se on “hajaantumisen painajainen” mobiilikehityksessä, moninkertaistettuna neuroverkkojen monimutkaisuudella.

Pohjimmiltaan

Olemme siirtymässä “Päivä 2”:n aikakauteen generatiivisessa tekoälyssä. Päivä 1 oli osoittaa, että tekoäly voi kirjoittaa runoutta. Päivä 2 on insinöörien työtä, tehdäkseen tämän kyvyn luotettavammaksi, edullisemmaksi ja yleisemmäksi. Insinöörit, jotka määrittelevät seuraavan vuosikymmenen, eivät välttämättä ole niitä, jotka keksivät uusia mallirakenteita. He ovat järjestelmäinsinöörit, ytimen hakkerit ja infrastruktuurin arkkitehdit, jotka voivat keksiä, miten palvella miljardi tokenia sekunnissa ilman, että se sulattaa sähköverkon tai ajaa yrityksen konkurssiin. Tekoäly-inferenssi ei ole enää vain suoritusaikaisen yksityiskohta. Se on tuote. Ja sen optimointi on seuraava suuri insinöörien haaste.

Tohtori Tehseen Zia on COMSATS University Islamabadin apulaisprofessori, joka on suorittanut AI-tutkinnon Wienin Teknillisen yliopiston, Itävallassa. Erityisalanaan ovat Tekoäly, Konenäkö, Data Science ja Machine Learning, ja hän on tehnyt merkittäviä töitä julkaisemalla artikkeleita arvostetuissa tieteellisissä lehdissä. Tohtori Tehseen on myös johtanut useita teollisuusprojekteja pää tutkijana ja toiminut AI-konsulttina.