KI-Modelle und Plattformen
Cerebras stellt weltweit schnellste AI-Inferenzlösung vor: 20-mal höhere Geschwindigkeit bei einem Bruchteil der Kosten

Cerebras Systems (CBRS ), ein Pionier im Bereich Hochleistungs-AI-Computing, hat eine bahnbrechende Lösung vorgestellt, die den Bereich der AI-Inferenz revolutionieren wird. Am 27. August 2024 kündigte das Unternehmen den Start von Cerebras Inference an, dem schnellsten AI-Inferenzdienst der Welt. Mit Leistungsmerkmalen, die die traditionellen GPU-basierten Systeme übertrumpfen, bietet Cerebras Inference 20-mal höhere Geschwindigkeit bei einem Bruchteil der Kosten und setzt damit einen neuen Standard im Bereich des AI-Computings.
Unvergleichliche Geschwindigkeit und Kosteneffizienz
Cerebras Inference ist darauf ausgelegt, außergewöhnliche Leistungen bei verschiedenen AI-Modellen zu erzielen, insbesondere im Bereich der großen Sprachmodelle (LLMs). So verarbeitet es beispielsweise 1.800 Token pro Sekunde für das Llama 3.1 8B-Modell und 450 Token pro Sekunde für das Llama 3.1 70B-Modell. Diese Leistung ist nicht nur 20-mal höher als die von NVIDIA-GPU-basierten Lösungen, sondern auch bei einem deutlich niedrigeren Preis. Cerebras bietet diesen Dienst ab 10 Cent pro Million Token für das Llama 3.1 8B-Modell und 60 Cent pro Million Token für das Llama 3.1 70B-Modell an, was einer 100-fachen Verbesserung der Preis-Leistungs-Verhältnisse im Vergleich zu bestehenden GPU-basierten Angeboten entspricht.
Genauigkeit bewahren, während die Grenzen der Geschwindigkeit ausgereizt werden
Einer der beeindruckendsten Aspekte von Cerebras Inference ist die Fähigkeit, den aktuellen Stand der Technik in puncto Genauigkeit beizubehalten, während gleichzeitig eine unübertroffene Geschwindigkeit erzielt wird. Im Gegensatz zu anderen Ansätzen, die Präzision für Geschwindigkeit opfern, bleibt Cerebras’ Lösung im 16-Bit-Bereich für die gesamte Inferenzlaufzeit. Dies stellt sicher, dass die Leistungssteigerungen nicht auf Kosten der Qualität der AI-Modellausgaben erfolgen, ein entscheidender Faktor für Entwickler, die sich auf Präzision konzentrieren.
Micah Hill-Smith, Mitgründer und CEO von Artificial Analysis, hob die Bedeutung dieser Leistung hervor: „Cerebras erreicht Geschwindigkeiten, die um ein Vielfaches höher sind als die von GPU-basierten Lösungen für Meta’s Llama 3.1 8B- und 70B-AI-Modelle. Wir messen Geschwindigkeiten von über 1.800 Ausgabe-Token pro Sekunde bei Llama 3.1 8B und über 446 Ausgabe-Token pro Sekunde bei Llama 3.1 70B – ein neuer Rekord in diesen Benchmarks.“
Die wachsende Bedeutung von AI-Inferenz
AI-Inferenz ist der am schnellsten wachsende Bereich des AI-Computings und macht etwa 40 % des gesamten AI-Hardware-Marktes aus. Die Einführung von Hochgeschwindigkeits-AI-Inferenz, wie sie von Cerebras angeboten wird, ist vergleichbar mit der Einführung von Breitband-Internet – sie schafft neue Möglichkeiten und markiert eine neue Ära für AI-Anwendungen. Mit Cerebras Inference können Entwickler nun Anwendungen der nächsten Generation erstellen, die komplexe, Echtzeit-Leistung erfordern, wie z. B. AI-Agents und intelligente Systeme.
Andrew Ng, Gründer von DeepLearning.AI, unterstrich die Bedeutung von Geschwindigkeit in der AI-Entwicklung: “DeepLearning.AI hat mehrere agentic Workflows, die das wiederholte Abrufen eines LLM erfordern, um ein Ergebnis zu erhalten. Cerebras hat eine beeindruckend schnelle Inferenzfähigkeit entwickelt, die für solche Workloads sehr nützlich sein wird.”

Breite Branchenunterstützung und strategische Partnerschaften
Cerebras hat starke Unterstützung von Branchenführern erhalten und hat strategische Partnerschaften geschlossen, um die Entwicklung von AI-Anwendungen zu beschleunigen. Kim Branson, SVP von AI/ML bei GlaxoSmithKline, einem frühen Cerebras-Kunden, betonte das transformative Potenzial dieser Technologie: „Geschwindigkeit und Skalierbarkeit ändern alles.“
Andere Unternehmen, wie LiveKit, Perplexity und Meter, haben ebenfalls ihre Begeisterung für die Auswirkungen ausgedrückt, die Cerebras Inference auf ihre Betriebe haben wird. Diese Unternehmen nutzen die Leistungsfähigkeit von Cerebras’ Rechenkapazitäten, um responsivere, menschenähnlichere AI-Erlebnisse zu schaffen, die Benutzerinteraktion in Suchmaschinen zu verbessern und Netzwerkmanagementsysteme zu optimieren.
Cerebras Inference: Stufen und Zugänglichkeit
Cerebras Inference ist in drei wettbewerbsfähigen Stufen verfügbar: Free, Developer und Enterprise. Die Free-Stufe bietet kostenlosen API-Zugang mit großzügigen Nutzungsbeschränkungen, was sie für eine breite Palette von Benutzern zugänglich macht. Die Developer-Stufe bietet eine flexible, serverlose Bereitstellungsoption, bei der Llama 3.1-Modelle für 10 Cent und 60 Cent pro Million Token angeboten werden. Die Enterprise-Stufe richtet sich an Organisationen mit anhaltenden Arbeitslasten und bietet fein abgestimmte Modelle, benutzerdefinierte Service-Level-Vereinbarungen und dedizierten Support, wobei die Preise auf Anfrage erhältlich sind.
Die Wafer Scale Engine 3 (WSE-3) als Herzstück von Cerebras Inference
Im Herzen von Cerebras Inference befindet sich das Cerebras CS-3-System, das von der branchenführenden Wafer Scale Engine 3 (WSE-3) angetrieben wird. Dieser AI-Prozessor ist in seiner Größe und Geschwindigkeit unübertroffen und bietet 7.000-mal mehr Speicherbandbreite als NVIDIAs H100. Die massive Skalierbarkeit der WSE-3 ermöglicht es, viele gleichzeitige Benutzer zu bedienen, was für atemberaubende Geschwindigkeiten ohne Leistungsverlust sorgt. Diese Architektur ermöglicht es Cerebras, die Kompromisse zu umgehen, die typischerweise GPU-basierte Systeme plagen, und bietet damit eine Spitzenleistung für AI-Arbeitslasten.
Nahtlose Integration und entwicklerfreundliche API
Cerebras Inference ist für Entwickler konzipiert. Es verfügt über eine API, die vollständig mit der OpenAI Chat Completions API kompatibel ist, was einen einfachen Übergang mit minimalen Codeänderungen ermöglicht. Dieser entwicklerfreundliche Ansatz stellt sicher, dass die Integration von Cerebras Inference in bestehende Workflows so reibungslos wie möglich ist und ermöglicht so die schnelle Bereitstellung von Hochleistungs-AI-Anwendungen.
Cerebras Systems: Innovationen in verschiedenen Branchen
Cerebras Systems ist nicht nur ein Leader im Bereich des AI-Computings, sondern auch ein wichtiger Akteur in verschiedenen Branchen, darunter Gesundheitswesen, Energie, Regierung, wissenschaftliches Computing und Finanzdienstleistungen. Die Lösungen des Unternehmens haben bahnbrechende Durchbrüche in Institutionen wie den National Laboratories, Aleph Alpha, The Mayo Clinic und GlaxoSmithKline ermöglicht.
Durch die Bereitstellung unübertroffener Geschwindigkeit, Skalierbarkeit und Genauigkeit ermöglicht Cerebras es Organisationen in diesen Sektoren, einige der größten Herausforderungen im Bereich der AI und darüber hinaus zu meistern. Ob es darum geht, die Arzneimittelentwicklung im Gesundheitswesen zu beschleunigen oder die Rechenkapazitäten in der wissenschaftlichen Forschung zu verbessern, Cerebras ist an der Spitze der Innovation.
Fazit: Eine neue Ära für AI-Inferenz
Cerebras Systems setzt mit dem Start von Cerebras Inference einen neuen Standard für AI-Inferenz. Durch die Bereitstellung von 20-mal höherer Geschwindigkeit als traditionelle GPU-basierte Systeme bei einem Bruchteil der Kosten macht Cerebras nicht nur AI zugänglicher, sondern ebnet auch den Weg für die nächste Generation von AI-Anwendungen. Mit seiner SpitzenTechnologie, strategischen Partnerschaften und seinem Engagement für Innovation ist Cerebras bestens gerüstet, die AI-Branche in eine neue Ära unübertroffener Leistung und Skalierbarkeit zu führen.
Für weitere Informationen über Cerebras Systems und um Cerebras Inference auszuprobieren, besuchen Sie www.cerebras.ai.












