Tankeledere

Forbedring af AI-inferens: Avancerede teknikker og bedste praksis

mm
FÃļj Unite.AI til dine foretrukne kilder pÃĨ Google

NÃĨr det kommer til realtids AI-drevne applikationer som selvkÃļrende biler eller sundhedsmonitorering, kan selv et ekstra sekund til at behandle en input have alvorlige konsekvenser. Realtime AI-applikationer krÃĶver pÃĨlidelige GPU’er og processorkraft, hvilket har vÃĶret meget dyrt og omkostningsprohibiterende for mange applikationer – indtil nu.

Ved at antage en optimeret inferensproces kan virksomheder ikke kun maksimere AI-effektivitet; de kan ogsÃĨ reducere energiforbrug og driftsomkostninger (op til 90%); forbedre privatliv og sikkerhed; og endda forbedre kundetilfredshed.

Almindelige inferensproblemer

Nogle af de mest almindelige problemer, som virksomheder stÃĨr over for, nÃĨr det kommer til at hÃĨndtere AI-effektivitet, omfatter underudnyttede GPU-kluster, standard til generelle formÃĨl modeller og mangel pÃĨ indsigt i tilhÃļrende omkostninger.

Holdene provisionerer ofte GPU-kluster for peak belastning, men mellem 70 og 80 procent af tiden er de underudnyttede pÃĨ grund af uregelmÃĶssige arbejdsprocesser.

Derudover vÃĶlger holdene standard til store generelle formÃĨl modeller (GPT-4, Claude) selv for opgaver, der kunne kÃļre pÃĨ mindre, billigere open source-modeller. Årsagen? Mangel pÃĨ viden og en stejl lÃĶringskurve med opbygning af brugerdefinerede modeller.

Endelig mangler ingeniÃļrerne typisk indsigt i den reelle omkostning for hver anmodning, hvilket fÃļrer til store regninger. VÃĶrktÃļjer som PromptLayer, Helicone kan hjÃĶlpe med at give denne indsigt.

Med mangel pÃĨ kontroller over modelvalg, batchning og udnyttelse kan inferensomkostninger stige eksponentielt (op til 10 gange), spilde ressourcer, begrÃĶnse nÃļjagtighed og formindske brugeroplevelsen. 

Energiforbrug og driftsomkostninger

KÃļrsel af stÃļrre LLM’er som GPT-4, Llama 3 70B eller Mixtral-8x7B krÃĶver betydeligt mere kraft pr. token. I gennemsnit udgÃļr 40 til 50 procent af den energi, der bruges af et datacenter, computing-udstyr, med yderligere 30 til 40 procent til afkÃļling af udstyret.

Derfor er det for en virksomhed, der kÃļrer rundt om uret for inferens i stor skala, mere fordelagtigt at overveje en on-premises-udbyder i stedet for en cloud-udbyder for at undgÃĨ at betale en premiumpris og forbruge mere energi.

Privatliv og sikkerhed

IfÃļlge Cisco’s 2025 Data Privacy Benchmark Study, “64% af respondentende bekymrer sig om ufrivilligt at dele fÃļlsomme oplysninger offentligt eller med konkurrenter, men nÃĶsten halvdelen indrÃļmmer at indtaste personlige medarbejder- eller ikke-offentlige data i GenAI-vÃĶrktÃļjer.” Dette Ãļger risikoen for non-compliance, hvis dataene ikke er logget eller cachelagt korrekt. 

En anden mulighed for risiko er at kÃļre modeller pÃĨ tvÃĶrs af forskellige kundeorganisationer pÃĨ en fÃĶlles infrastruktur; dette kan fÃļre til dataleaks og ydeevneproblemer, og der er en tilfÃļjet risiko for, at en brugers handlinger pÃĨvirker andre brugere. Derfor foretrÃĶkker virksomheder generelt tjenester, der er udviklet i deres eget cloud.

Kundetilfredshed

NÃĨr svarene tager mere end fÃĨ sekunder at dukke op, dropper brugerne typisk af, hvilket understÃļtter ingeniÃļrernes indsats for at overoptimerere for nul ventetid. Derudover prÃĶsenterer applikationerne “hinder sÃĨsom hallucinationer og ukorrekte oplysninger, der kan begrÃĶnse den bredere indvirkning og antagelse,” ifÃļlge en Gartner pressemeddelelse.

ForretningsmÃĶssige fordele ved at hÃĨndtere disse problemer

Optimering af batchning, valg af rette stÃļrrelse modeller (f.eks. skifte fra Llama 70B eller lukkede kilde modeller som GPT til Gemma 2B, hvor det er muligt) og forbedring af GPU-udnyttelse kan reducere inferensregninger med mellem 60 og 80 procent. Brug af vÃĶrktÃļjer som vLLM kan hjÃĶlpe, ligesom skift til en serverless pay-as-you-go-model for en spids arbejdsproces. 

Tag Cleanlab som eksempel. Cleanlab lancerede Trustworthy Language Model (TLM) for at tilfÃļje en tillidsscore til hver LLM-svar. Det er designet til hÃļjkvalitetsudgang og forbedret pÃĨlidelighed, hvilket er kritisk for virksomhedsapplikationer for at forhindre ukontrollerede hallucinationer. FÃļr Inferless oplevede Cleanlabs Ãļgede GPU-omkostninger, da GPU’er kÃļrte, selv nÃĨr de ikke var aktivt i brug. Deres problemer var typiske for traditionelle cloud GPU-udbydere: hÃļj ventetid, ineffektiv omkostningsstyring og et komplekst miljÃļ at styre. Med serverless inferens reducerede de omkostningerne med 90 procent, mens de opretholdt performancesniveauet. Endnu vigtigere var, at de gik live inden for to uger uden yderligere ingeniÃļrarbejdsomkostninger.

Optimering af modelarkitektur

Foundation-modeller som GPT og Claude er ofte trÃĶnet for almenhed, ikke effektivitet eller specifikke opgaver. Ved ikke at tilpasse open source-modeller til specifikke brugstilfÃĶlde spilder virksomheder hukommelse og beregnings tid for opgaver, der ikke krÃĶver den skala.

Nye GPU-chips som H100 er hurtige og effektive. Disse er isÃĶr vigtige, nÃĨr der kÃļres store skalaoperationer som video-generering eller AI-relaterede opgaver. Flere CUDA-kerner Ãļger proceshastigheden og overgÃĨr mindre GPU’er; NVIDIA’s Tensor-kerner er designet til at accelerere disse opgaver i stor skala.

GPU-hukommelse er ogsÃĨ vigtig for at optimere modelarkitektur, da store AI-modeller krÃĶver betydelig plads. Denne ekstra hukommelse giver GPU’en mulighed for at kÃļre stÃļrre modeller uden at gÃĨ pÃĨ kompromis med hastigheden. Omvendt lider performances af mindre GPU’er med mindre VRAM, da de flytter data til en langsommere systemhukommelse.

Flere fordele ved at optimere modelarkitektur omfatter tids- og pengebesparelse. FÃļrst kan skift fra tÃĶt transformer til LoRA-optimeret eller FlashAttention-baseret variant reducere svartiden med mellem 200 og 400 millisekunder pr. forespÃļrgsel, hvilket er afgÃļrende i chatbots og gaming, for eksempel. Derudover har kvantificerede modeller (som 4-bit eller 8-bit) mindre VRAM og kÃļrer hurtigere pÃĨ billigere GPU’er. 

PÃĨ lang sigt besparelse af modelarkitektur penge pÃĨ inferens, da optimerede modeller kan kÃļre pÃĨ mindre chip.

Optimering af modelarkitektur omfatter fÃļlgende trin:

  • Kvantificering — reducerer prÃĶcision (FP32 → INT4/INT8), besparelse af hukommelse og accelerere beregningstid
  • Pruning — fjernelse af mindre nyttige vÃĶgte eller lag (struktureret eller ustruktureret)
  • Distillation — trÃĶning af en mindre “elev”-model til at efterligne output fra en stÃļrre model 

Komprimering af modelstÃļrrelse

Mindre modeller betyder hurtigere inferens og mindre dyrt infrastruktur. Store modeller (13B+, 70B+) krÃĶver dyre GPU’er (A100s, H100s), hÃļj VRAM og mere kraft. Komprimering af dem giver mulighed for at kÃļre pÃĨ billigere hardware, som A10s eller T4s, med meget lavere ventetid. 

Komprimerede modeller er ogsÃĨ kritiske for at kÃļre pÃĨ enhed (mobiltelefoner, browsere, IoT) inferens, da mindre modeller giver mulighed for at betjene flere samtidige anmodninger uden at skalere infrastruktur. I en chatbot med mere end 1.000 samtidige brugere giver skift fra en 13B til en 7B komprimeret model en mulighed for at betjene mere end dobbelt sÃĨ mange brugere pr. GPU uden ventetids-spids.

Udnyttelse af specialiseret hardware

Almindelige formÃĨl CPU’er er ikke bygget til tensor-operationer. Specialiseret hardware som NVIDIA A100s, H100s, Google TPUs eller AWS Inferentia kan tilbyde hurtigere inferens (mellem 10 og 100 gange) for LLM’er med bedre energi-effektivitet. At reducere selv 100 millisekunder pr. anmodning kan gÃļre en forskel, nÃĨr der behandles millioner af anmodninger dagligt.

Overvej fÃļlgende hypotetisk eksempel:

Et hold kÃļrer LLaMA-13B pÃĨ standard A10 GPU’er for deres interne RAG-system. Ventetiden er omkring 1,9 sekunder, og de kan ikke batche meget pÃĨ grund af VRAM-begrÃĶnsninger. SÃĨ de skifter til H100s med TensorRT-LLM, aktiverer FP8 og optimerer attention-kernen, Ãļger batch-stÃļrrelsen fra otte til 64. Resultatet er at reducere ventetiden til 400 millisekunder med en femdobling af gennemlÃļb.
Derved kan de betjene anmodninger fem gange pÃĨ samme budget og frigÃļre ingeniÃļrer fra at navigere i infrastruktur-bottlenecks.

Evaluering af implementeringsmuligheder

Forskellige processer krÃĶver forskellige infrastrukturer; en chatbot med 10 brugere og en sÃļgemaskine, der betjener millioner af forespÃļrgsler pr. dag, har forskellige behov. At gÃĨ all-in pÃĨ cloud (f.eks. AWS Sagemaker) eller DIY GPU-servere uden at evaluere omkostnings-ydelsesforhold fÃļrer til spild af penge og dÃĨrlig brugeroplevelse. BemÃĶrk, at hvis du binder dig tidligt til en lukket cloud-udbyder, er det smertefuldt at migrere lÃļsningen senere. Men tidlig evaluering med en pay-as-you-go-struktur giver dig muligheder lÃĶngere nede ad vejen.

Evaluering omfatter fÃļlgende trin:

  • Benchmark model-ventetid og omkostning pÃĨ tvÃĶrs af platforme: KÃļr A/B-tests pÃĨ AWS, Azure, lokale GPU-kluster eller serverless-vÃĶrktÃļjer for at replikere.
  • MÃĨl kold start-performance: Dette er isÃĶr vigtigt for serverless eller event-drevne workloads, fordi modellerne loader hurtigere. 
  • Vurder overvÃĨgning og skaleringsbegrÃĶnsninger: EvaluÃĐr tilgÃĶngelige metrikker og identificer, hvad maksimum antal forespÃļrgsler pr. sekund er, fÃļr de degraderer.
  • Tjek omkostningsstÃļtte: Bestem, om du kan gennemtvinge geo-bundne dataregler eller audit-logs.
  • Estimer samlet ejeromkostning. Dette skal omfatte GPU-timer, lagring, bÃĨndbredde og overhead for hold.

Det endelige punkt

Inferens giver virksomheder mulighed for at optimere deres AI-ydelse, reducere energiforbrug og omkostninger, opretholde privatliv og sikkerhed og holde kunderne tilfredse.

Aishwarya Goel er medstifter og administrerende direktÃļr for Inferless, en stateful serverless platform, der hjÃĶlper udviklere med at implementere brugerdefinerede og open source-modeller med lave kolde start og effektiv autoskalering.