Моделі та платформи ШІ
Cerebras представляє найшвидшу у світі систему інференсу штучного інтелекту: 20 разів швидше за традиційні системи на основі GPU при значно нижчій вартості

Cerebras Systems (CBRS ), піонер у сфері високопродуктивних обчислень штучного інтелекту, представляє революційне рішення, яке змінить індустрію інференсу штучного інтелекту. 27 серпня 2024 року компанія оголосила про запуск Cerebras Inference, найшвидшої системи інференсу штучного інтелекту у світі. З показниками продуктивності, які значно перевищують традиційні системи на основі GPU, Cerebras Inference забезпечує швидкість у 20 разів вище при значно нижчій вартості, встановлюючи новий стандарт у сфері обчислень штучного інтелекту.
Безпрецедентна швидкість і ефективність витрат
Cerebras Inference розроблена для забезпечення виняткової продуктивності при роботі з різними моделями штучного інтелекту, особливо у швидко розвивається сегменті більших мовних моделей (LLM). Наприклад, вона обробляє 1800 токенів за секунду для моделі Llama 3.1 8B і 450 токенів за секунду для моделі Llama 3.1 70B. Ця продуктивність не тільки у 20 разів вища, ніж у систем на основі GPU від NVIDIA (NVDA ), але також коштує значно менше. Cerebras пропонує цю послугу, починаючи з 10 центів за мільйон токенів для моделі Llama 3.1 8B і 60 центів за мільйон токенів для моделі Llama 3.1 70B, що представляє собою 100-разове покращення ціни й продуктивності порівняно з існуючими системами на основі GPU.
Збереження точності при підвищенні швидкості
Одним з найбільш вражаючих аспектів Cerebras Inference є її здатність зберегти найвищу точність при забезпеченні неперевершеної швидкості. На відміну від інших підходів, які жертвують точністю заради швидкості, рішення Cerebras залишається у 16-розрядному домені протягом усього процесу інференсу. Це забезпечує те, що підвищення швидкості не відбувається за рахунок якості виходу моделей штучного інтелекту, що є важливим фактором для розробників, які зосереджені на точності.
Майк Гілл-Сміт, співзасновник і генеральний директор компанії Artificial Analysis, підкреслив значення цього досягнення: “Cerebras забезпечує швидкість, у порядку величини вищу, ніж у систем на основі GPU для моделей Llama 3.1 8B і 70B. Ми реєструємо швидкість понад 1800 виходів токенів за секунду для Llama 3.1 8B і понад 446 виходів токенів за секунду для Llama 3.1 70B – новий рекорд у цих бенчмарках.”
Розростання важливості інференсу штучного інтелекту
Інференсу штучного інтелекту є найшвидше зростаючим сегментом обчислень штучного інтелекту, який становить близько 40% всього ринку апаратного забезпечення штучного інтелекту. Поява високошвидкісного інференсу штучного інтелекту, такого як той, який пропонує Cerebras, подібна до появи широкосмугового інтернету – вона відкриває нові можливості і знаменує собою нову еру для застосунків штучного інтелекту. З допомогою Cerebras Inference розробники можуть тепер створювати наступне покоління застосунків штучного інтелекту, які вимагають складної, реальної продуктивності, таких як агенти штучного інтелекту і інтелектуальні системи.
Ендрю Нг, засновник DeepLearning.AI, підкреслив важливість швидкості у розробці штучного інтелекту: “DeepLearning.AI має кілька агентських робочих процесів, які вимагають повторного запитування великої мовної моделі для отримання результату. Cerebras створила вражаючу можливість інференсу, яка буде дуже корисною для таких робочих процесів.“

Широка підтримка індустрії і стратегічні партнерства
Cerebras здобула сильну підтримку лідерів індустрії і створила стратегічні партнерства для прискорення розробки застосунків штучного інтелекту. Кім Брансон, старший віце-президент з питань штучного інтелекту і машинного навчання у GlaxoSmithKline, одному з перших клієнтів Cerebras, підкреслив трансформаційну потенціал цієї технології: “Швидкість і масштаб змінюють все.”
Інші компанії, такі як LiveKit, Perplexity і Meter, також висловили ентузіазм щодо впливу, який матиме Cerebras Inference на їхніх операціях. Ці компанії використовують потужність обчислювальних можливостей Cerebras для створення більш реагуючих, подібних до людини застосунків штучного інтелекту, покращення взаємодії користувачів у пошукових системах і вдосконалення систем управління мережею.
Cerebras Inference: рівні і доступність
Cerebras Inference доступна у трьох конкурентоспроможних рівнях: Безкоштовно, Розробник і Підприємство. Безкоштовний рівень пропонує безкоштовний доступ до API з щедрими лімітами використання, що робить його доступним для широкого кола користувачів. Рівень Розробник пропонує гнучкий, безсерверний варіант розгортання, з моделями Llama 3.1, ціновими у 10 центів і 60 центів за мільйон токенів. Рівень Підприємство орієнтований на організації з тривалими робочими процесами, пропонуючи налаштовані моделі, індивідуальні угоди про рівень обслуговування і समरкування, з ціною, доступною за запитом.
Потужність Cerebras Inference: Wafer Scale Engine 3 (WSE-3)
У серці Cerebras Inference лежить система Cerebras CS-3, потужністю якої є лідируючий у галузі Wafer Scale Engine 3 (WSE-3). Цей процесор штучного інтелекту безпрецедентний за розміром і швидкістю, пропонуючи у 7000 разів більшу пропускну здатність пам’яті, ніж NVIDIA H100. Масштабна конструкція WSE-3 дозволяє йому обробляти багато одночасних користувачів, забезпечуючи блискавичну швидкість без компромісу продуктивності. Ця архітектура дозволяє Cerebras уникнути компромісів, які зазвичай супроводжують системи на основі GPU, забезпечуючи найвищу продуктивність для робочих процесів штучного інтелекту.
Безшовна інтеграція і дружній API для розробників
Cerebras Inference розроблена з урахуванням потреб розробників. Вона пропонує API, повністю сумісний з OpenAI Chat Completions API, що дозволяє легко міґрувати з мінімальними змінами коду. Цей підхід забезпечує безшовну інтеграцію Cerebras Inference у існуючі робочі процеси, дозволяючи швидко розгортати високопродуктивні застосунки штучного інтелекту.
Cerebras Systems: рухова сила інновацій у різних галузях
Cerebras Systems не тільки лідер у сфері обчислень штучного інтелекту, але також ключовий гравець у різних галузях, таких як охорона здоров’я, енергетика, уряд, наукові обчислення і фінансові послуги. Рішення компанії стали інструментом для проривів у таких установах, як Національні лабораторії, Aleph Alpha, Mayo Clinic і GlaxoSmithKline.
Відповідно до наданої інформації, Cerebras забезпечує неперевершену швидкість, масштабованість і точність, дозволяючи організаціям у цих галузях вирішувати деякі з найскладніших проблем у сфері штучного інтелекту і за його межами. Чи то прискорення відкриття ліків у сфері охорони здоров’я, чи вдосконалення обчислювальних можливостей у наукових дослідженнях, Cerebras знаходиться на передовій лінії розвитку інновацій.
Висновок: нова ера інференсу штучного інтелекту
Cerebras Systems встановлює новий стандарт для інференсу штучного інтелекту з запуском Cerebras Inference. Запропонувавши у 20 разів вищу швидкість традиційних систем на основі GPU при значно нижчій вартості, Cerebras не тільки робить штучний інтелект більш доступним, але також прокладає шлях для наступного покоління застосунків штучного інтелекту. З її передовими технологіями, стратегічними партнерствами і зобов’язанням інновацій, Cerebras готова очолити індустрію штучного інтелекту у нову еру неперевершеної продуктивності і масштабованісті.
Для отримання більшої інформації про Cerebras Systems і спробу Cerebras Inference відвідайте www.cerebras.ai.












