Ajatusjohtajat

Tekoäly-infra on rikki. Tokenit ovat uusi arvon mittari.

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Tekoäly-alalla on mittausongelma.

Vuosiin on määritelty menestys kuin pääsy laskentaan, kuten kuka on eniten GPU:ita, suurimmat klusterit tai nopeimmat koulutusajot. Miljardeja on vuodattu infrastruktuuriin voittamaan tämän kilpailun.

Mutta kun tekoäly siirtyy kokeilusta tuotantoon, tämä malli alkaa murtua.

Yritykset eivät osta GPU:ita. He eivät edes osta inference-kapasiteettia. He ostavat tuloksia kuten yhteenvetoja, suosituksia, päätöksiä, sisältöä. Toisin sanoen, he ostavat tokenia.

Mutta useimmat tekoäly-infrastruktuurit on edelleen suunniteltu kuin laskenta olisi lopputuote. Se ei ole.

Tekoälyn todellinen arvon yksikkö on tokeni. Ja yritykset, jotka tunnistavat tämän muutoksen aikaisin, määrittelevät seuraavan markkinan aikakauden.

Tekoäly-tokenitehtaan nousu

Jos tokenit ovat tuote, niin tekoäly-infrastruktuurin on käyttäydyttävä kuin tuotantojärjestelmä, ei tieteellisenä projektina. Tästä konseptista tekoäly-tokenitehdas syntyy.

Tekoäly-tokenitehdas ei ole vain ohjelmistokerros pinossa. Se on uudelleenajattelu itse pinosta. Sen sijaan, että optimoidaan erillisen mallin suorituskykyä tai raakaa laitteiston hyödyntämistä, se keskittyy yhteen tulos: tehokkaaseen tokenin tuotantoon suuressa mittakaavassa.

Tämä tarkoittaa infrastruktuurin monimutkaisuuden abstrahointia, työkuormien dynaamista jakoa heterogeenisissä ympäristöissä ja jatkuvaa optimointia läpi tuloksena, viiveenä, hyödyntämisenä ja tokenin kustannuksena.

Nykyinen malli on perustuu GPU-vuokraukseen, jossa lisätään ylimääräisiä askelia. Organisaatiot varustavat kalliita laitteita, ompelevat sirpaleisia työkaluja yhteen ja toivovat, että hyödyntäminen lopulta oikeuttaa sijoituksen.

Tokenitehdas kääntää tämän kaavan kokonaan. Se toimittaa tuloksia, ei infrastruktuuria, ja käsittelee tehokkuuden ydinsuunnitteluperiaatteena alusta alkaen. Tämä ei ole askel kohti paranemista. Se on siirtymä kapasiteetista tuotantoon.

Miksi vanha malli ei voi pitää

Nykyinen tekoäly-infrastruktuurin malli ei ole vain tehokas. Se on yhä epävakaa.

GPU-pula paljasti ensimmäiset halkeamat. Kysyntä jatkaa ylittämistä tarjontaa, mikä pakottaa organisaatiot jakautumaan useisiin toimittajiin. Se, mitä aluksi oli tilapäinen ratkaisu, on nopeasti muuttunut normiksi: heterogeeniset ympäristöt, joissa ei ole yhtenäistä toiminnallista kerrosta.

Ongelma on, että useimmat olemassa olevat pinot eivät ole koskaan suunniteltu tälle todellisuudelle. Ne eivät optimoi tehokkaasti arkkitehtuureja, sovella reaaliajassa tai tarjoa selkeää näkyvyyttä suorituskykyyn ja kustannuksiin.

Tuloksena monimutkaisuus kasvaa nopeammin kuin mittakaava.

Jokainen uusi malli, kehys, kiihdytin tai pilvi-alusta esittää toisen kerroksen toiminnallista ylituotantoa. Tiimit viettävät valtavasti aikaa hallitsemalla orkestraatiota, yhteensopivuutta, reititystä, aikataulutusta ja havainnollistamisen ongelmia sen sijaan, että parantaisivat tuloksia.

Se, mikä pitäisi olla skaalautumisen etu, muuttuu nopeasti koordinaatio-ongelmaksi.

Samaan aikaan taloudelliset seikat ovat muuttumassa yhä vaikeammaksi ignoreerata. Varhaiset tekoäly-käyttöönotot voivat peittää tehokkuuden puutteita kasvun ja kokeilun takia. Tämä aikakausi on päättymässä.

Johtajat kysyvät nyt vaikeampia kysymyksiä: Miksi inference-kustannukset ovat niin arvaamattomia? Miksi GPU-hyödyntäminen on edelleen niin alhainen? Miksi organisaatiot maksavat korkeita hintoja laitteista, jotka usein ovat käyttämättöminä? Miksi on niin vaikea sitoa infrastruktuurin kustannukset liiketoimintatuloksiin?

Vastaus on yksinkertainen: Järjestelmä suunniteltiin pääsyä varten, ei tehokkuutta.

Siirtyminen laskenta-keskeisestä token-keskeiseen arkkitehtuuriin

Siirtymä tokenitehtaisiin on sekä filosofinen että arkkitehtoninen.

Ensinnäkin, markkinat siirtyvät GPU-palvelusta tulokseen perustuvaan palveluun. Asiakkaat eivät halua hallita infrastruktuuria; he haluavat taata tulokset. Looginen lopputila on kulutus, joka perustuu tuloksiin, ei resursseihin.

Toiseksi, sirpaleiset pinot antavat tilaa yhtenäisille ohjauskerroksille. Heterogeenisissa ympäristöissä näkyvyys ja ohjaus ovat kaikkein tärkein. Tokenitehtaat tarjoavat reaaliaikaisen näkyvyyden käytöstä, kustannuksista ja suorituskyvystä sekä mahdollisuuden toimia sen mukaan. Organisaatioiden on ymmärrettävä: Kuka tuottaa tokenia? Mikä on kustannus? Mikä laitteisto? Mikä työkuorma? Ja mikä on tehokkuuden taso? Ilman näitä vastauksia optimointi muuttuu arvaukseksi.

Lopulta tekoäly-alalla keskitytään siirtymästä suorittamisesta jatkuvaan optimointiin. Haaste ei ole enää vain mallien suorittaminen, vaan niiden suorittaminen älykkäästi, kun organisaatiot määrittelevät: Mihin työkuormat kuuluvat mille laitteistoille? Miten saadaan maksimoitu läpi tuloksena hallittaessa kustannuksia? Miten estetään tokenin käytön päättymättömyys?

Tokenitehtaat käsittelevät nämä kysymykset ensisijaisina ongelmina, ei jälkikäteen.

Miksi nykyinen tekoäly-toimitusmalli ei riitä

Perinteinen tekoäly-pino (kattaa laitteiston toimittajat, pilvi-alustat, inference-palvelut) on rakennettu ensisijaisesti nopeaan kasvuun, ei järjestelmälliseen tehokkuuteen.

Jokainen kerros lisää arvoa, mutta myös kustannuksia, abstraktiota ja toiminnallista sirpaleisuutta. Tuloksena on järjestelmä, jossa on pinotut marginaalit, rajoitettu läpinäkyvyys ja kasvava toimittajan riippuvuus. Organisaatiot lopulta optimoivat siloissa, ei koko järjestelmässä.

Tokenitehtaat haastavat perustavasti tämän mallin.

Laitteiston ja arvon toimittamisen irti yhdistämisellä ne mahdollistavat päästä päähän optimoinnin. Työkuormat voivat liikkua sujuvasti ympäristöjen välillä. Arkkitehtuureja voidaan kehittää ilman massiivisia uudelleenkirjoituksia. Tehokkuus muuttuu mitattavaksi, hallittavaksi ja jatkuvasti parannettavaksi.

Tässä on, miten yritykset ja uudet pilvi-alustat voivat kilpailla tehokkaammin hyperskaleerien kanssa. Ei kokoamalla heidän mittakaavaansa, vaan ylittämällä heidät tehokkuudessa.

Kuka saa voittaa

Todennäköisesti häiritsevin asia tässä siirtymässä on se, ketkä sitä mahdollistavat. Et tarvitse omistaa datakeskusta tai edes GPU:ita toimimaan tokenitehtaana.

Se, mikä on tärkeää, on orkestraation, optimoinnin ja toimittamisen hallinta. Se avaa oven paljon laajemmalle joukolle pelaajia:

  • Yritykset, joilla on suuret, pysyvät tekoäly-työkuormat.
  • Uudet pilvi-alustat, jotka optimoivat tiettyjä pystyjä tai käyttötarkoituksia.
  • Laitteiston toimittajat, jotka siirtyvät ylöspäin pinossa.

Tässä mallissa kilpailuetu ei tule laskenta-varastoinnista. Se tulee tokenien tuottamisesta paremmin, nopeammin ja halvemmalla kuin kukaan muu.

Uusi taistelukenttä: Tokenin kustannus

Tekoäly-kilpailun seuraava vaihe ei voiteta pelkästään mallin laadulla. Se voitetaan tehokkuudella. Tarkemmin sanottuna, tokenin kustannuksella.

Kuka voi toimittaa vastaavan tai paremman tuloksen murto-osaan kustannuksista? Kuka voi skaalata ilman laitteiston kustannusten päättymättömyyttä? Kuka voi muuttaa tekoälyn ennustettavaksi, voitolliseksi liiketoiminnaksi?

Nämä eivät ole infrastruktuurikysymyksiä. Ne ovat tuotantokysymyksiä, jotka vaativat tuotantomielennäköä.

Tulevaisuus ei ole rakennettu GPU:iden varaan

GPU:t eivät katoa, mutta ne eivät ole enää tarina. Tokenit ovat.

Organisaatiot, jotka pysyvät laskentaan keskittyneinä, kohtaavat kasvavia kustannuksia ja vähenevää tuottavuutta. Ne, jotka siirtyvät token-keskeisiin järjestelmiin, lukitsevat perustavasti toisenlaisen mallin, joka luo yhteyden infrastruktuurin ja tuloksien sekä kustannusten ja arvon välille.

Tekoäly-tokenitehtaat eivät ole kaukainen konsepti. Ne ovat markkinan vääjäämätön kehitys. Ainoa oikea kysymys on, kuka rakentaa ne ensin ja kuka jää jälkeen.

Gaurav Shah on NeuRealityn liiketoimintakehitys- ja strategiavastaava, jossa hän johtaa asiakastyon ai-inferenssin vallankumoukseen ja nopeuttaa sen omaksumista eri aloilla, kuten rahoitus-, terveydenhuolto- ja hallintosektoreilla. Gauravilla on kolmen vuosikymmenen kokemus teknologia-alalta, ja hän on työskennellyt tuotemarkkinoinnin ja johtamistehtävissä NVIDIA, Marvell, Tenstorrent ja GlobalFoundries -yhtiöissä. Hän toimii San Franciscon lahden alueella.