AI-modeller og plattformer

Cerebras Introduces Verdens Raskeste AI-Inferensløsning: 20 Ganger Raskere Til En Brøkdel Av Kostnaden

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Cerebras Systems (CBRS ), en pionér innen høy-ytelses AI-regning, har introdusert en banebrytende løsning som vil revolusjonere AI-inferens. Den 27. august 2024 annonserte selskapet lanseringen av Cerebras Inference, verdens raskeste AI-inferensetjeneste. Med ytelsesmetrikker som overgår de til tradisjonelle GPU-baserte systemer, leverer Cerebras Inference 20 ganger raskere ytelse til en brøkdel av kostnaden, og setter en ny standard for AI-regning.

Uforutsett Hastighet Og Kostnadseffektivitet

Cerebras Inference er designet for å levere eksepsjonell ytelse over forskjellige AI-modeller, særlig i den raskt utviklende segmentet av store språkmodeller (LLM). For eksempel prosesserer det 1 800 token per sekund for Llama 3.1 8B-modellen og 450 token per sekund for Llama 3.1 70B-modellen. Denne ytelsen er ikke bare 20 ganger raskere enn NVIDIA GPU-baserte løsninger, men kommer også til en betydelig lavere kostnad. Cerebras tilbyr denne tjenesten fra 10 cent per million token for Llama 3.1 8B-modellen og 60 cent per million token for Llama 3.1 70B-modellen, og representerer en 100-ganger forbedring av pris-ytelse sammenlignet med eksisterende GPU-baserte tilbud.

Vedlikeholde Nøyaktighet Samtidig Som Ytelse Forbedres

En av de mest imponerende aspektene ved Cerebras Inference er evnen til å vedlikeholde state-of-the-art nøyaktighet samtidig som det leverer ubeseiret hastighet. I motsetning til andre tilnærminger som ofrer nøyaktighet for hastighet, forblir Cerebras’ løsning innenfor 16-bit-domenet for hele inferensløpet. Dette sikrer at ytelsesforbedringene ikke skjer på bekostning av kvaliteten på AI-modellutdata, en kritisk faktor for utviklere som fokuserer på nøyaktighet.

Micah Hill-Smith, medgründer og CEO av Artificial Analysis, fremhevet betydningen av denne prestasjonen: “Cerebras leverer hastigheter som er en orden av størrelse raskere enn GPU-baserte løsninger for Meta’s Llama 3.1 8B og 70B AI-modeller. Vi måler hastigheter over 1 800 utgangstoken per sekund på Llama 3.1 8B, og over 446 utgangstoken per sekund på Llama 3.1 70B – en ny rekord i disse benchmarkene.

Den Økende Betydningen Av AI-Inferens

AI-inferens er det raskest voksende segmentet av AI-regning, og utgjør omtrent 40 % av det totale AI-hardwaremarkedet. Introduksjonen av høyhastighets AI-inferens, som den tilbudt av Cerebras, er lik introduksjonen av bredbånd – det åpner opp nye muligheter og innleder en ny æra for AI-applikasjoner. Med Cerebras Inference kan utviklere nå bygge neste generasjons AI-applikasjoner som krever kompleks, sanntidsprestasjon, som AI-agenter og intelligente systemer.

Andrew Ng, gründer av DeepLearning.AI, understreket betydningen av hastighet i AI-utvikling: “DeepLearning.AI har flere agente arbeidsflyter som krever å trigge en LLM gjentatte ganger for å få en result. Cerebras har bygget en imponerende rask inferenskapasitet som vil være svært nyttig for slike arbeidsflyter.

Bred Industriell Støtte Og Strategiske Partnerskap

Cerebras har samlet sterk støtte fra industriledere og har etablert strategiske partnerskap for å akselerere utviklingen av AI-applikasjoner. Kim Branson, SVP of AI/ML at GlaxoSmithKline, en tidlig Cerebras-kunde, betonet den transformative potensialet til denne teknologien: Hastighet og skala endrer alt.

Andre selskaper, som LiveKit, Perplexity og Meter, har også uttrykt entusiasme for impulsen som Cerebras Inference vil ha på deres operasjoner. Disse selskapene utnytter kraften til Cerebras’ regnekapasiteter for å skape mer responsive, menneskelignende AI-erfaringer, forbedre brukerinteraksjon i søkemotorer og forbedre nettverksledningssystemer.

Cerebras Inference: Nivåer Og Tilgjengelighet

Cerebras Inference er tilgjengelig over tre konkurranseprisede nivåer: Gratis, Utvikler og Bedrift. Gratisnivået tilbyr gratis API-tilgang med generøse bruksbegrensninger, og gjør det tilgjengelig for en bred rekke brukere. Utviklernivået tilbyr en fleksibel, serverløs distribusjonsmulighet, med Llama 3.1-modeller priset til 10 cent og 60 cent per million token. Bedriftsnivået er rettet mot organisasjoner med varige arbeidsflyter, og tilbyr tilpassede modeller, kundespesifikke serviceavtaler og dedikert støtte, med priser tilgjengelig på forespørsel.

Drivkraften Bak Cerebras Inference: Wafer Scale Engine 3 (WSE-3)

I hjertet av Cerebras Inference ligger Cerebras CS-3-systemet, drevet av den bransjeledende Wafer Scale Engine 3 (WSE-3). Denne AI-prosessoren er ubeseiret i størrelse og hastighet, og tilbyr 7 000 ganger mer minnehastighet enn NVIDIA’s H100. WSE-3s massive skala muliggjør håndtering av mange samtidige brukere, og sikrer en ubeseiret hastighet uten å gå på bekostning av ytelsen. Denne arkitekturen tillater Cerebras å unngå kompromissene som vanligvis plager GPU-baserte systemer, og tilbyr beste-klasse-ytelse for AI-arbeidsflyter.

Seamless Integrering Og Utviklervennlig API

Cerebras Inference er designet med utviklere i mente. Det har et API som er fullt kompatibelt med OpenAI Chat Completions API, og muliggjør enkelt migrering med minimale kodeendringer. Denne utviklervennlige tilnærmingen sikrer at integrering av Cerebras Inference i eksisterende arbeidsflyter er så enkelt som mulig, og muliggjør rask distribusjon av høy-ytelses AI-applikasjoner.

Cerebras Systems: Driver Innovasjon Over Bransjer

Cerebras Systems er ikke bare en leder innen AI-regning, men også en nøkkelaktør over flere bransjer, inkludert helse, energi, regjering, vitenskapelig regning og finansielle tjenester. Selskapets løsninger har vært instrumental i å drive gjennombrudd i institusjoner som National Laboratories, Aleph Alpha, The Mayo Clinic og GlaxoSmithKline.

Ved å tilby ubeseiret hastighet, skala og nøyaktighet, muliggjør Cerebras at organisasjoner over disse sektorene kan takle noen av de mest utfordrende problemene i AI og utenfor. Uansett om det er å akselerere legemiddelforskning i helse eller å forbedre beregningskapasiteter i vitenskapelig forskning, er Cerebras i forkant av å drive innovasjon.

Konklusjon: En Ny Æra For AI-Inferens

Cerebras Systems setter en ny standard for AI-inferens med lanseringen av Cerebras Inference. Ved å tilby 20 ganger raskere ytelse enn tradisjonelle GPU-baserte systemer til en brøkdel av kostnaden, gjør Cerebras ikke bare AI mer tilgjengelig, men baner også vei for neste generasjons AI-applikasjoner. Med sin banebrytende teknologi, strategiske partnerskap og forpliktelse til innovasjon, er Cerebras godt posisjonert til å lede AI-industrien inn i en ny æra med ubeseiret ytelse og skala.

For mer informasjon om Cerebras Systems og å prøve Cerebras Inference, besøk www.cerebras.ai.

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.