Tankeledare

Den nya digitala klyftan i AI: VarfÃķr edge-klara, CPU-fÃķrst-modeller kommer att vinna kostnadskriget

mm
LÃĪgg till Unite.AI bland dina fÃķredragna kÃĪllor pÃĨ Google

Den globala artificiella intelligensmarknaden (AI) utvecklas i en hisnande takt. År 2024 var den vÃĪrderad till 257,68 miljarder dollar, med prognoser som placerar den pÃĨ 371,71 miljarder dollar vid slutet av 2025 och rusar till en Ãķgonblickande 2,4 biljoner dollar ÃĨr 2032. Det ÃĪr nÃĪstan en tiofaldig Ãķkning pÃĨ mindre ÃĪn ett decennium, en bana som rivaliserar med nÃĨgra av de mest omvÃĪlvande tekniska boomarna i modern historia.

Under det senaste decenniet har cirka 1 500 nyetablerade AI-fÃķretag var och en sÃĪkrat investeringar som Ãķverstiger 1,5 miljoner dollar, vilket signalerar inte bara en vÃĨg av innovation utan ocksÃĨ en stark nÃĪrvaro av hÃĪnsynslÃķs konkurrens. Etablerade fÃķretag sitter inte pÃĨ lÃĪktaren heller. Enligt en januari-rapport frÃĨn McKinsey, planerar en anmÃĪrkningsvÃĪrd 92% av organisationerna att Ãķka sina AI-utgifter under de kommande tre ÃĨren.

Men nÃĪr AI-anvÃĪndningen accelererar, visar den infrastruktur som stÃķder den tecken pÃĨ sprickor. Under de senaste tvÃĨ ÃĨren har AI gÃĨtt frÃĨn Ãķgonblickande demonstationer till bestÃĨende, realvÃĪrldens arbetsbelastningar.

Den verkliga flaskhalsen ÃĪr inte bara modellkvalitet, utan var och hur dessa modeller kÃķrs. En ny digital klyfta bildas, inte runt tillgÃĨng till data eller talang, utan runt berÃĪkningsstrategi. Organisationer stÃĨr infÃķr ett avgÃķrande vÃĪgskÃĪl: fortsÃĪtta att fÃķrlita sig pÃĨ grafikprocessorenhet (GPU) tunga, molnbaserade system, eller anta smalare, edge-klara, centralprocessorenhet (CPU) fÃķrsta arkitekturer som ÃĪr billigare att kÃķra i skala, lÃĪttare att distribuera i olika miljÃķer och bÃĪttre anpassade till sekretess- och latensbehov.

Dessa arkitekturval ÃĪr viktiga eftersom den verkliga belastningen inte ligger i att bygga modeller, utan i att kÃķra dem dag efter dag. Det ÃĪr hÃĪr inferenskostnaderna snabbt ÃķvertrÃĪffar utbildning och definierar AI-ekonomin i skala.

Inferens ÃĪter AI-budgetar

Medan rubrikerna ofta belyser den massiva utgiften fÃķr att trÃĪna frontmodeller, ÃĪr inferens den rÃĪkning som aldrig slutar. Stanfords 2025 AI-index noterar att snabba framsteg inom smÃĨ modeller har drivit ner kostnaden fÃķr att uppnÃĨ “GPT-3.5-nivÃĨ” prestanda med mer ÃĪn 280× mellan slutet av 2022 och slutet av 2024. ÄndÃĨ understryker samma rapport branschens besatthet av att optimera inferenseffektivitet.

Moln-GPU-prissÃĪttning har bara hÃķjt trycket. Att hyra hÃķgkvalitativa GPU-instanser kan, under en tre- till femÃĨrsperiod, kosta nÃĪstan dubbelt sÃĨ mycket som att ÃĪga samma hÃĨrdvara direkt. Elasticitet ÃĪr anvÃĪndbar fÃķr toppbelastningar, men lÃĨngvariga inferens “hyror” tyst blÃķder budgetar. Även NVIDIA, vars affÃĪrsverksamhet ÃĪr beroende av acceleratorer, har under det senaste ÃĨret aggressivt optimerat inferens Ãķver hela sin stack. Detta ÃĪr bevis pÃĨ att det verkliga slagfÃĪltet flyttar frÃĨn utbildningsprestanda till serveringsekonomi.

Denna framvÃĪxande kostnadskris innebÃĪr att organisationer som inte ÃĪr villiga eller ofÃķrmÃķgna att omprÃķva sin berÃĪkningsstrategi riskerar att bli lÃĪmnade efter.

VarfÃķr Edge (och CPUs) fÃķrÃĪndrar kostnadskurvan

Den hÃĨrda verkligheten ÃĪr att GPU-centrerad inferens skapar icke-hÃĨllbara ekonomier. Att kÃķra stora, realtids AI-arbetsbelastningar pÃĨ dyra GPUs inte bara driver upp kostnaderna utan accelererar ocksÃĨ hÃĨrdvarudepreciation. Innovationscyklerna rÃķr sig sÃĨ snabbt, ofta mindre ÃĪn 18 mÃĨnader mellan nya chipgenerationer, att infrastrukturinvesteringar fÃķrlorar vÃĪrde snabbt. Detta har lett till analytikers varningar om avskrivningskostnader kopplade till AI-chipkÃķp, eftersom de redan skÃĪr ner vinstestimat. Till exempel fÃķrvÃĪntas Alphabet absorbera 28 miljarder dollar i avskrivningskostnader till 2026.

Fabriker, kliniker, butiker och mobila enheter ÃĪr dÃĪr AI alltmer kommer att behÃķva fungera. Att skicka varje begÃĪran till en centraliserad GPU-kluster ÃĪr ofta fel verktyg fÃķr jobbet, eftersom det ÃĪr dyrt, energikrÃĪvande och benÃĪget fÃķr latens- och sekretessproblem.

Edge-miljÃķer ÃĪr inte homogena GPU-gÃĨrdar. De ÃĪr diversifierade flottor av CPUs: servrar, robusta datorer, bÃĪrbara datorer och handhÃĨllna enheter. Denna diversifiering gÃķr CPUs till en naturlig grund fÃķr kostnadseffektiv AI-distribution.

I detta nya landskap ÃĪr CPUs inte bara en reserv, de ÃĪr den kostnadsmedvetna vÃĪgen till skalbar, tillgÃĪnglig AI.

GPUs som “privatjet” fÃķr AI

NÃĪr modellerna blir stÃķrre och mer komplexa, krÃĪver de mer GPU-kraft, vilket inte bara driver upp infrastruktur- och energikostnader utan ocksÃĨ koncentrerar avancerad AI-kapacitet i hÃĪnderna pÃĨ dem som kan betala fÃķr dem.

Studier visar att stora, allmÃĪnna generativa modeller ofta anvÃĪnder avsevÃĪrt mer energi och genererar betydligt hÃķgre koldioxidutslÃĪpp per 1 000 inferenser jÃĪmfÃķrt med mindre, uppgiftsspecifika system. Även nÃĪr man kontrollerar parameterantalet, fÃķrstÃĪrker GPU-tunga arkitekturer bÃĨde finansiella och operativa hinder. Över tiden skapar detta en flaskhals, vilket gÃķr det oproportionerligt svÃĨrt fÃķr startups, forskare och underresurserade samhÃĪllen att fÃĨ tillgÃĨng till avancerade AI-verktyg.

Det ÃĪr ett exklusivitetsproblem: GPUs ÃĪr som privatjet fÃķr AI, de ÃĪr snabba och kraftfulla, men tillgÃĪngliga endast fÃķr en liten cirkel av vÃĪlfinansierade organisationer.

Men att erkÃĪnna dessa begrÃĪnsningar innebÃĪr inte att man avvisar GPUs helt. De fÃķrblir exceptionella fÃķr vissa modellklasser och genomstrÃķmningsmÃķnster. En CPU-fÃķrst-strategi ÃĪr inte anti-GPU. Det ÃĪr en kostnadsmedveten lÃķsning.

Denna strategi breddar tillgÃĨngen och sÃĪkerstÃĪller att AI-distributionen drivs av effektivitet, inte prestige. IstÃĪllet fÃķr en framtid som definieras av GPU-exklusivitet, Ãķppnar CPUs dÃķrren till skalbar, hÃĨllbar och inkluderande AI-distribution.

Den nÃķdvÃĪndiga omstÃĪllningen till CPU-drivna modeller

Om AI-ekonomin ska skalas hÃĨllbart, ÃĪr lÃķsningen att omprÃķva hur modeller utbildas och distribueras. En strategi ÃĪr att prioritera hÃķgentropidata och edgefall under utbildning. Dessa indata driver meningsfulla framsteg och kan minska behovet av stora datamÃĪngder, vilket gÃķr att modellerna kan kÃķras med fÃĪrre parametrar samtidigt som de fÃķrblir mycket effektiva.

Genom att vara kompakta nog att fungera pÃĨ kommersiella CPUs, antingen i bÃĪrbara datorer, smartphones, servrar eller Internet of Things (IoT)-enheter, minskar dessa modeller drastiskt inferenskostnaderna och energifÃķrbrukningen. De mÃķjliggÃķr ocksÃĨ realtidsbearbetning direkt pÃĨ enheten, vilket minskar latensen och fÃķrbÃĪttrar sekretessen genom att hÃĨlla kÃĪnsliga data lokalt.

Denna omstÃĪllning handlar inte bara om kostnad; det handlar ocksÃĨ om jÃĪmlikhet. I sektorer som hÃĪlsovÃĨrd, dÃĪr “Ãķknar” av tillgÃĨng redan existerar, kan edge-klar CPU-distribution Ãķverbrygga gapen genom att leverera avancerade AI-verktyg direkt till kliniker, kontaktcenter eller fÃĪltenheter utan beroende av sÃĪllsynta, centraliserade berÃĪkningar. Resultatet ÃĪr en bredare antagande, fÃķrbÃĪttrad motstÃĨndskraft och en mer inkluderande fÃķrdelning av AI-fÃķrdelar.

FrÃĨn kraft till tillgÃĨng: CPUs som den stora jÃĪmstÃĪllaren i AI

De kommande ÃĨren kommer inte bara att testa vem som kan bygga de kraftfullaste AI-modellerna, utan vem som kan leverera dem effektivt, hÃĨllbart och i skala. CPU-optimiserade, edge-klara modeller erbjuder en vÃĪg framÃĨt. Genom att mÃķjliggÃķra att AI kan kÃķras effektivt pÃĨ kommersiell hÃĨrdvara, sÃĪnker de barriÃĪrerna fÃķr startups och forskare, minskar beroendet av skÃķra leverantÃķrskedjor och fÃķr in avancerade tillÃĪmpningar i miljÃķer dÃĪr centraliserade GPU-kluster ÃĪr opraktiska.

Att utvÃĪrdera AI-infrastruktur genom mÃĨtt som total kostnad per transkriberad timme, distributionspoÃĪng och edge-beredskap sÃĪkerstÃĪller att lÃķsningarna bedÃķms inte bara av benchmark-precision, utan ocksÃĨ av deras fÃķrmÃĨga att skalas pÃĨ ett prisvÃĪrt och inkluderande sÃĪtt i den verkliga vÃĪrlden.

Insatserna ÃĪr hÃķga. Om branschen fortsÃĪtter att behandla GPUs som standard, kommer tillgÃĨngen att fÃķrbli exklusiv, innovationen kommer att koncentreras och spridningen till offentliga tjÃĪnster, hÃĪlsovÃĨrd och underbetjÃĪnade sektorer kommer att fÃķrsenas. Men om CPU-fÃķrst, edge-klara strategier tar fart, kan AI bli mer motstÃĨndskraftig, privat och hÃĨllbar. Detta inte bara nivellerar spelplanen, det omdefinierar den.

Ritu Mehrotra, grundare och VD fÃķr Shunya Labs ÃĪr en erfaren ledare inom konsumentteknik och AI, har skalat fÃķretag i Nordamerika, Asien och Europa. Som cancerÃķverlevare ÃĪr hon nu dedikerad till att fÃķrbÃĪttra den globala mentalhÃĪlsan genom att bryta ner barriÃĪrer fÃķr tillgÃĪnglighet, kvalitet och prisvÃĪrdhet.