AI-modeller og platforme

Cerebras Introducerer Verdens Hurtigste AI-Inferensløsning: 20 Gange Hurtigere Til En Brøkdel Af Omkostningerne

mm
Føj Unite.AI til dine foretrukne kilder på Google

Cerebras Systems (CBRS ), en pioner inden for high-performance AI-computering, har introduceret en banebrydende løsning, der er klar til at revolutionere AI-inferens. Den 27. august 2024 annoncerede virksomheden lanceringen af Cerebras Inference, verdens hurtigste AI-inferensservice. Med ydelsestall, der overgår dem fra traditionelle GPU-baserede systemer, leverer Cerebras Inference 20 gange hurtigere ydelse til en brøkdel af omkostningerne, og sætter dermed en ny standard for AI-computering.

Ubegrænset Hastighed Og Omkostningseffektivitet

Cerebras Inference er designet til at levere ekstraordinær ydelse på tværs af forskellige AI-modeller, især i den hurtigt udviklende sektor for store sprogmodeller (LLM’er). For eksempel behandler det 1.800 tokens per sekund for Llama 3.1 8B-modellen og 450 tokens per sekund for Llama 3.1 70B-modellen. Denne ydelse er ikke kun 20 gange hurtigere end NVIDIA’s GPU-baserede løsninger, men kommer også til en betydelig lavere omkostning. Cerebras tilbyder denne service fra kun 10 cent per million tokens for Llama 3.1 8B-modellen og 60 cent per million tokens for Llama 3.1 70B-modellen, hvilket repræsenterer en 100-gange forbedring af pris-ydelse i forhold til eksisterende GPU-baserede tilbud.

Opretholdelse Af Nøjagtighed Samtidig Med At Udvide Grænserne For Hastighed

En af de mest imponerende aspekter ved Cerebras Inference er dens evne til at opretholde state-of-the-art-nøjagtighed samtidig med, at den leverer ubesvaret hastighed. I modsætning til andre tilgange, der ofrer præcision for hastighed, forbliver Cerebras’ løsning inden for 16-bit-domænet for hele inferensløbet. Dette sikrer, at ydelseforbedringerne ikke kommer på bekostning af kvaliteten af AI-modellens output, en afgørende faktor for udviklere, der fokuserer på præcision.

Micah Hill-Smith, medstifter og administrerende direktør for Artificial Analysis, fremhævede betydningen af denne præstation: “Cerebras leverer hastigheder, der er en størrelsesorden hurtigere end GPU-baserede løsninger for Meta’s Llama 3.1 8B- og 70B-AI-modeller. Vi måler hastigheder over 1.800 output-tokens per sekund på Llama 3.1 8B, og over 446 output-tokens per sekund på Llama 3.1 70B – en ny rekord i disse benchmarks.

Den Voksende Betydning Af AI-Inferens

AI-inferens er den hurtigst voksende sektor inden for AI-computering og udgør cirka 40% af det samlede AI-hardwaremarked. Introduktionen af højhastigheds-AI-inferens, som den tilbudt af Cerebras, ligner introduktionen af bredbåndsinternet – det åbner nye muligheder og markerer en ny æra for AI-applikationer. Med Cerebras Inference kan udviklere nu bygge næste generations AI-applikationer, der kræver komplekse, realtidspræstationer, såsom AI-agenter og intelligente systemer.

Andrew Ng, grundlægger af DeepLearning.AI, understregede betydningen af hastighed i AI-udvikling: “DeepLearning.AI har flere agente arbejdsgange, der kræver, at en LLM gentagne gange gives en resultat. Cerebras har bygget en imponerende hurtig inferenskapacitet, der vil være meget nyttig for sådanne arbejdsgange.

Bred Industriel Støtte Og Strategiske Partnerskaber

Cerebras har opnået stærk støtte fra industriledere og har dannet strategiske partnerskaber for at accelerere udviklingen af AI-applikationer. Kim Branson, SVP of AI/ML at GlaxoSmithKline, en tidlig Cerebras-kunde, fremhævede den transformative potentiale for denne teknologi: “Hastighed og skala ændrer alt.”

Andre virksomheder, såsom LiveKit, Perplexity og Meter, har også udtrykt begejstring for den indvirkning, som Cerebras Inference vil have på deres drift. Disse virksomheder udnytter kraften fra Cerebras’ beregningskapaciteter til at skabe mere responsive, menneskelignende AI-oplevelser, forbedre brugerinteraktion i søgemaskiner og forbedre netværksstyringssystemer.

Cerebras Inference: Niveauer Og Tilgængelighed

Cerebras Inference er tilgængelig på tre konkurrencedygtige niveauer: Gratis, Udvikler og Enterprise. Det gratis niveau tilbyder gratis API-adgang med generøse brugsgrænser, hvilket gør det tilgængeligt for en bred vifte af brugere. Udvikler-niveauet tilbyder en fleksibel, serverless implementeringsmulighed, hvor Llama 3.1-modellerne koster 10 cent og 60 cent per million tokens. Enterprise-niveauet er rettet mod organisationer med vedvarende arbejdsmængder og tilbyder finjusterede modeller, brugerdefinerede service niveau-aftaler og dedikeret support, med priser til rådighed efter anmodning.

Drivkraft Bag Cerebras Inference: Wafer Scale Engine 3 (WSE-3)

I hjertet af Cerebras Inference ligger Cerebras CS-3-systemet, drevet af den brancheførende Wafer Scale Engine 3 (WSE-3). Denne AI-processor er ubesvaret i størrelse og hastighed og tilbyder 7.000 gange mere hukommelsesbåndbredde end NVIDIA’s H100. WSE-3’s massive skala muliggør, at den kan håndtere mange samtidige brugere, hvilket sikrer en ubesvaret hastighed uden at gå på kompromis med ydelsen. Denne arkitektur tillader Cerebras at undgå de kompromiser, der normalt plager GPU-baserede systemer, og tilbyder en verdensklasse-ydelse til AI-arbejdsmængder.

Ubemærket Integration Og Udviklervenlig API

Cerebras Inference er designet med udviklere i mente. Den indeholder en API, der er fuldt kompatibel med OpenAI Chat Completions API, hvilket muliggør en let migration med minimale kodeændringer. Denne udviklervenlige tilgang sikrer, at integrationen af Cerebras Inference i eksisterende arbejdsgange er så ubemærket som muligt, og muliggør en hurtig implementering af high-performance AI-applikationer.

Cerebras Systems: Driver Innovation På Tværs Af Brancher

Cerebras Systems er ikke kun en leder inden for AI-computering, men også en nøgleaktør på tværs af forskellige brancher, herunder sundhedsvesen, energi, regering, videnskabelig computering og finansielle tjenester. Virksomhedens løsninger har været afgørende for at drive gennembrud på institutioner som National Laboratories, Aleph Alpha, The Mayo Clinic og GlaxoSmithKline.

Ved at tilbyde en ubesvaret hastighed, skala og nøjagtighed muliggør Cerebras, at organisationer på tværs af disse sektorer kan tackle nogle af de mest udfordrende problemer inden for AI og ud over. Uanset om det handler om at accelerere lægemiddelforskning i sundhedssektoren eller forbedre beregningskapaciteter i videnskabelig forskning, er Cerebras i frontlinjen for at drive innovation.

Konklusion: En Ny Æra For AI-Inferens

Cerebras Systems sætter en ny standard for AI-inferens med lanceringen af Cerebras Inference. Ved at tilbyde 20 gange hurtigere ydelse end traditionelle GPU-baserede systemer til en brøkdel af omkostningerne åbner Cerebras ikke kun op for AI for en bredere kreds, men baner også vejen for den næste generation af AI-applikationer. Med sin banebrydende teknologi, strategiske partnerskaber og engagement i innovation er Cerebras parat til at lede AI-industrien ind i en ny æra med en hidtil uset ydelse og skala.

For mere information om Cerebras Systems og for at prøve Cerebras Inference, besøg www.cerebras.ai.

Antoine er en visionær leder og medstifter af Unite.AI, drevet af en urokkelig passion for at forme og fremme fremtiden for AI og robotteknologi. En serieiværksætter, han tror, at AI vil være lige så omvæltende for samfundet som elektricitet, og han bliver ofte fanget i at tale om potentialet for omvæltende teknologier og AGI.

Som en futurist, er han dedikeret til at udforske, hvordan disse innovationer vil forme vores verden. Derudover er han grundlægger af Securities.io, en platform, der fokuserer på at investere i skarp teknologi, der gendefinerer fremtiden og omformer hele sektorer.