Ajatusjohtajat
Miksi AI-suoritin kilpailu perustuu nyt ohjelmistoihin

Jokainen uusi AI-kiihdytin saapuu benchmarking-tarinan kanssa: huipputeho, teraoppija watin kohti, vaikuttavat numerot, jotka lupaavat, että tämä suoritin muuttaa kaiken. Mitä nuo numerot jättävät huomiotta, on se, voivatko asiakkaat käyttää suoritinta todellisuudessa tuotannossa. Useimmiten he eivät voi, ja se on todellinen tarina siitä, missä AI-laitteistoalan on tänään. Se kohtaa ohjelmistokypsyysongelman, ja useimmat yritykset eivät ole vielä valmiit sanomaan sitä julkisesti.
Kuilu, josta kukaan ei puhu
Piin kehityssykli kestää kaksi neljä vuotta, kun taas AI-mallimaiseman kehityssyklit kestävät kuukausia ja suuntautuvat kohti viikkoja. Tämän alla on arvoketjuongelma: lopputapausten, kuten ajoneuvojen, tehtaiden, sairaaloiden ja laitteiden, toiminnallinen kypsyys on lisääntynyt ja ne alkavat tuottaa mitattavissa olevaa P & L -vaikutusta. Tämä kypsyys ajaa ohjelmistosoitteiden kysyntää, mikä edellyttää laitteiston muutoksia. Nämä kolme kerrosta toimivat perustavanlaatuisesti eri nopeuksilla, ja tämä epäsovittuvuus on kitkan syynä, joka kasvaa markkinassa. Ohjelmistopino, joka tarvitaan suorittamaan suuria kielen mallien inferencea, eroaa perustavanlaatuisesti siitä, mitä aiemmin kehitettiin koneoppimisen työkuormille. Laitteiston kehitysaikataulut eivät ole supistuneet tämän syklin mukaisesti. Yritykset, jotka toimittavat uutta piitä tänään, antavat asiakkaille ohjelmistoa, joka ei voi täysin avata suorittimen ominaisuuksia, tuottaen kaavan, joka toistuu koko markkinalla: vaikuttava piiri, kehittymätön ohjelmisto, hitaasti omaksuminen ja menetetty liikevaihto. Suoritin tekee sen, mihin se on suunniteltu. Ongelma on, että asiakkaat eivät voi helposti käyttää sitä.
Mieti, mitä tapahtui autoteollisuudelle. Autot itsessään olivat suurelta osin ratkaistu ongelma 1900-luvun puolivälissä, mutta kun ohjelmistoista tuli erottautumista, yritykset, joilla oli syvin valmistusperintö, kamppailivat eniten sopeutumisessa. Ford ja GM tunsivat, miten rakentaa moottoreita, mutta heillä ei ollut lihaksia rakentamaan käyttöjärjestelmiä. AI-laitteistoalan elää saman kautta nyt, ja vertaus on epämukavasti tarkka. NVIDIA (NVDA ) toimii ohjelmistoyhtiönä, kun taas perinteiset puolijohdeyritykset yrittävät vielä keksiä, miten myydä kehittäjien ekosysteemejä piin rinnalla.
NVIDIA: n valtakunta ei ole lähes mitään tekemistä sen kanssa, että heillä on parhaat suorittimet. CUDA (Compute Unified Device Architecture) on 20 vuotta vanha, ja siinä on kaikki tekninen velka, joka siitä seuraa, mutta mitä NVIDIA todella rakensi, on AI-laskennan käyttöjärjestelmä: ennustettava, kypsyys ekosysteemi, jota kehittäjät ja OEM: t voivat luottaa tuotannossa.
Asiakkaat valitsevat alustoja ohjelmistokypsyys- ja integrointiriskin perusteella, joten kun uusi kiihdytin saapuu ilman tuotantokelpoista ohjelmistopinoa, kaupallinen keskustelu päättyy ennen kuin se edes alkaa.
Aika ensimmäiseen malliin, määriteltyä kuinka nopeasti asiakas saa todellisen AI-työkuorman suoritettua annetulla kiihdyttimellä, on paljon merkittävämpi kaupallinen mittari kuin huipputeho. Se on keskustelu, johon useimmat laitteistoyritykset ovat vähiten valmiit.
Todellinen markkina on inference
Liiketoiminnan luonnollinen kieli on P & L, ja jokaisen AI: n käyttävän yrityksen on vastattava samaan kysymykseen: missä on raha, ja mitä estää minua saamasta sitä? Koulutus on välttämätön askel, mutta kaupallinen AI elää inferenceissa, ja tämä markkina on vasta alkanut.
Mittakaavasymmetria tässä on hämmästyttävää. Koulutus kattaa yhden käyttötapauksen; inference kattaa äärettömän määrän. Jokainen teollisuuden, sairaalan, puhelimen tai varastoinferenssin soveltaminen vaatii inferencea. Suoritin, joka suorittaa turvajärjestelmiä autossa, ei voi käyttää datakeskuksen tehoa, ja laite, joka suorittaa reaaliaikaisen inferencea tehdasalueella, ei voi sietää korkeaa viivettä. Reunainferenssimarkkina vaatii piitä, joka on suunniteltu erityisesti tehokkuuden, fyysisten rajoitusten ja teollisuuden turvallisuus- ja luotettavuusvaatimusten mukaisesti.
Google:n äskettäinen päätös jakaa kahdeksas sukupolvensa TPU:aan kahteen erilliseen piiriin, yksi koulutukseen ja toinen inferenceen , on arvioitava. Tämä arkkitehtoninen valinta tunnustaa, että kaksi työkuormaa on eriytynyt niin paljon, että optimointi molemmille yhdessä suunnittelussa tarkoittaa nyt, että kumpikaan ei ole erinomainen. Kun yritys, joka pyörittää joitain suurimmista AI-infrastruktuureista, päättää, että erikoistuminen on tärkeämpää kuin konsolidointi, se merkitsee, mihin markkinat ovat menossa: tarkoitussuunniteltuun inference-piiriin, joka on käytössä reunassa, suuressa määrin, oikeilla maailman rajoituksilla, joita datakeskuksen benchmarkit eivät koskaan olleet suunniteltu mitata.
Olemme inference-kiirehdinnässä, kun suurin osa markkinoista on järjestetty koulutuksen ympärille.
Perintöjärjestelmien rakenteelliset rajoitukset
Yritykset, jotka ovat parhaiten asemoituneet valmistamaan suurten määrien, ovat rakenteellisesti kykenemättömiä palvelemaan markkinoita, joilla inference elää. Autonvalmistajat tarvitsevat toimittajia, jotka voivat taata komponenttien saatavuuden kymmenen vuoden ajan. Yleispätevät puolijohdeyritykset kuten Intel (INTC ) eivät suostu sitoutumaan siihen. Tämä rakenteellinen rajoitus jättää koko teollisuuden palvelemattomaksi, eikä mikään neuvottelu muuta sitä.
NVIDIA: n reunainferenssiplatformi on jo kohtaamassa haasteen PIN-yhteensopivien vaihtoehtojen muodossa , jotka tarjoavat paremman suorituskyvyn watin kohden ilman vaatimatta mitään muutoksia ohjelmistopinoon. Asiakas voi vaihtaa piirin ja pitää kaiken muun, mikä tekee siitä suoran kaupallisen hyökkäyksen NVIDIA: n reunan asemasta.
Yritykset, jotka osoittivat oivalluksensa CUDA: lle, ovat nyt keksimässä, että taloudellinen käyttöönotto suurten määrien edellyttää uudelleenarkkitehtuuria alempaan tehokkaampaan piiriin, koska kun organisaatiot ottavat käyttöön kymmeniä tuhansia laitteita, kustannus yksikkökohtaisesti ja energiankulutus tulevat ratkaiseviksi tekijöiksi. Järjestys, joka toistuu inference-markkinassa, on yksinkertainen: käytä jotain, mikä toimii, testaa sitä, sitten löydä tapa ottaa se taloudellisesti käyttöön, koska sinun on tehtävä rahaa siitä. AI: n omaksumisen tahdissa on aikaa perustaa ohjelmistojen ja ekosysteemien etu viimeistään neljännesvuosien kuluessa.
Insinöörien investointi, jota useimmat yritykset jättävät väliin
AI-laitteistoyritykset jatkavat voimakkaiden piirien toimittamista ohjelmistojen kanssa, jotka eivät voi suorittaa niitä täysin. Tuotantokelpoiset järjestelmäohjelmistot, jotka kattavat inference-ajat, kääntäjäoptimoituvuuden ja työkuormien mahdollistamisen, vaativat syvää, erikoistunutta insinöörintointa, jota useimmat laitteistoyritykset eivät ole taloudellisesti valmiit tekemään.
Rakentaa kykyä tarkoittaa palkata kääntäjäinsinöörejä ja ajonaikaisarkkitehteja, jotka voivat sulkea aukon siitä, mitä piiri on teoreettisesti kykenevä tekemään, ja mitä asiakas voi käytännössä ottaa käyttöön. Yritysten on myös investoida työkaluihin ennen kuin tulot perustelevat sitä, koska kun tulot saapuvat, ikkuna on jo sulkeutunut. Yritykset, jotka jättävät väliin tämän investoinnin, eivät vain jää jälkeen. He menettävät kaupat.
Suorittimet, jotka saavuttavat mittakaavan, ovat eniten käytettävissä olevia suorittimia, ja käytettävyys on ohjelmistojen laadun funktio. Suuret alihankkijat, hyperskaleerijat ja yritysasiakkaat ovat aiemmin kärsineet siitä, että piiri on benchmarkkaus, mutta integroituu huonosti. He valitsevat ekosysteemin kypsyys- ja integrointiriskin perusteella. Yritykset, jotka käsittelevät ohjelmistoa ensisijaisena insinöörintoina, muuttavat enemmän koekäyttöjä tuotantosopimuksiksi ja pääsevät nopeammin tuloihin. Ne, jotka käsittelevät sitä toimituksen jälkeen, katsovat, miten teknisesti ylempiarvoiset piirit menettävät kaupat heikompien piirien kanssa, jotka on taustatut kypsemmillä pinoin.
Kello on jo käynnissä
AI-laitteistoyritykset, jotka ovat asemassa saamaan merkittävän osuuden seuraavassa vaiheessa, rakentavat ekosysteemien etuja tänään, jotka ovat vaikeat jäljittäjiä. Ohjelmistojen joustavuus, kyky sopeutua uusiin mallirakenteisiin ilman odottamista seuraavaa tape-outia, erottaa suorittimet, jotka pysyvät kaupallisesti merkityksellisinä, suorittimista, jotka kierrättävät loputtomasti koekäyttöjä ilman, että ne koskaan tuottavat tarvittavaa tulotuloa seuraavan sukupolven rahoittamiseksi.
Päätökset, jotka tehdään juuri nyt, insinööritiimien, yhteistyösopimusten ja kaupallisten koekäyttöjen ympärillä AI-laitteistomaailmassa, määräävät, mitkä yritykset ovat edelleen merkittäviä vuonna 2028. CUDA: n 20-vuotinen etumatka on ekosysteemin syvyys, jota on rakennettu, mutta mikä tahansa yritys, joka on valmis käsittelemään ohjelmistoa jatkuvana insinöörintoina, voi rakentaa saman syvyyden ajan myötä.
Kysymys, johon teollisuuden on vastattava, on, mitkä yritykset liikkuvat tarpeeksi nopeasti rakentamaan ekosysteemien syvyyttä, joka tekee heidän piirinsä oletusvalinnaksi ennen kuin jonkun toisen piiri tulee liian vakiintuneeksi korvaamiseksi.












