Модели и платформы ИИ
Cerebras Представляет Самое Быстрое Решение для Инференции ИИ: 20-кратная Скорость при Дробной Части Затрат

Cerebras Systems (CBRS ), пионер в области высокопроизводительных вычислений ИИ, представил революционное решение, которое изменит инференцию ИИ. 27 августа 2024 года компания объявила о запуске Cerebras Inference, самого быстрого сервиса инференции ИИ в мире. С показателями производительности, которые намного превосходят традиционные системы на основе GPU, Cerebras Inference обеспечивает 20-кратную скорость при дробной части затрат, устанавливая новый стандарт в вычислениях ИИ.
Непрецедентная Скорость и Эффективность Затрат
Cerebras Inference предназначен для обеспечения исключительной производительности на различных моделях ИИ, особенно в быстро развивающемся сегменте больших языковых моделей (LLM). Например, он обрабатывает 1800 токенов в секунду для модели Llama 3.1 8B и 450 токенов в секунду для модели Llama 3.1 70B. Эта производительность не только в 20 раз быстрее, чем у решений на основе GPU от NVIDIA (NVDA ), но также имеет значительно более низкую стоимость. Cerebras предлагает этот сервис, начиная с 10 центов за миллион токенов для модели Llama 3.1 8B и 60 центов за миллион токенов для модели Llama 3.1 70B, что представляет собой 100-кратное улучшение соотношения цены и производительности по сравнению с существующими решениями на основе GPU.
Сохранение Точности при Расширении Границ Скорости
Одним из наиболее впечатляющих аспектов Cerebras Inference является его способность сохранять передовую точность при обеспечении беспрецедентной скорости. В отличие от других подходов, которые жертвуют точностью ради скорости, решение Cerebras остается в 16-битном домене на протяжении всего процесса инференции. Это гарантирует, что прирост производительности не происходит за счет качества выходных данных моделей ИИ, что является важным фактором для разработчиков, ориентированных на точность.
Майк Хилл-Смит, сооснователь и генеральный директор Artificial Analysis, подчеркнул значение этого достижения: «Cerebras обеспечивает скорость, которая в 10 раз быстрее решений на основе GPU для моделей ИИ Llama 3.1 8B и 70B от Meta. Мы измеряем скорость выше 1800 выходных токенов в секунду на Llama 3.1 8B и выше 446 выходных токенов в секунду на Llama 3.1 70B – новый рекорд в этих бенчмарках.»
Растущая Важность Инференции ИИ
Инференция ИИ является самым быстрорастущим сегментом вычислений ИИ, занимающим примерно 40% общего рынка аппаратного обеспечения ИИ. Введение высокоскоростной инференции ИИ, такой как предложенная Cerebras, аналогично введению широкополосного интернета – открывает новые возможности и знаменует новую эру для приложений ИИ. С помощью Cerebras Inference разработчики могут теперь создавать приложения ИИ следующего поколения, требующие сложных, реальных производительностей, таких как агенты ИИ и интеллектуальные системы.
Эндрю Нг, основатель DeepLearning.AI, подчеркнул важность скорости в разработке ИИ: “DeepLearning.AI имеет несколько агентских рабочих процессов, которые требуют повторного запроса LLM для получения результата. Cerebras создал впечатляюще быструю возможность инференции, которая будет очень полезна для таких рабочих процессов.”

Широкая Поддержка Промышленности и Стратегические Партнерства
Cerebras получил сильную поддержку от лидеров промышленности и сформировал стратегические партнерства для ускорения разработки приложений ИИ. Ким Брансон, старший вице-президент по ИИ/МЛ в GlaxoSmithKline, ранний клиент Cerebras, подчеркнул трансформирующий потенциал этой технологии: «Скорость и масштаб меняют все».
Другие компании, такие как LiveKit, Perplexity и Meter, также выразили энтузиазм по поводу влияния, которое Cerebras Inference окажет на их операции. Эти компании используют мощность вычислительных возможностей Cerebras для создания более отзывчивых, похожих на человека опытов ИИ, улучшения взаимодействия пользователя в поисковых системах и повышения эффективности сетевых систем управления.
Cerebras Inference: Уровни и Доступность
Cerebras Inference доступен на трех конкурентоспособных уровнях: Бесплатно, Разработчик и Корпорация. Бесплатный уровень предоставляет бесплатный доступ к API с щедрыми ограничениями использования, что делает его доступным для широкого круга пользователей. Уровень разработчика предлагает гибкий, безсерверный вариант развертывания, с моделями Llama 3.1, цена которых составляет 10 центов и 60 центов за миллион токенов. Уровень корпорации предназначен для организаций с устойчивыми рабочими нагрузками, предлагая тонко настроенные модели, индивидуальные соглашения об уровне обслуживания и специализированную поддержку, цена которой доступна по запросу.
Обеспечение Cerebras Inference: Процессор Wafer Scale Engine 3 (WSE-3)
В основе Cerebras Inference лежит система Cerebras CS-3, работающая на процессоре Wafer Scale Engine 3 (WSE-3). Этот процессор ИИ не имеет аналогов по размеру и скорости, предлагая 7000 раз больше пропускной способности памяти, чем NVIDIA H100. Огромный масштаб WSE-3 позволяет ему обрабатывать множество одновременных пользователей, обеспечивая молниеносную скорость без компромисса производительности. Эта архитектура позволяет Cerebras избежать компромиссов, которые обычно преследуют системы на основе GPU, обеспечивая лучшую производительность для рабочих нагрузок ИИ.
Бесшовная Интеграция и Дружественный API для Разработчиков
Cerebras Inference разработан с учетом потребностей разработчиков. Он имеет API, полностью совместимый с OpenAI Chat Completions API, что позволяет легко перенести его с минимальными изменениями кода. Этот дружественный подход обеспечивает, что интеграция Cerebras Inference в существующие рабочие процессы будет как можно более бесшовной, что позволяет быстро развертывать высокопроизводительные приложения ИИ.
Системы Cerebras: Стимулирование Инноваций во Всех Отраслях
Cerebras Systems не только лидер в области вычислений ИИ, но и ключевой игрок во многих отраслях, включая здравоохранение, энергию, государственный сектор, научные вычисления и финансовые услуги. Решения компании сыграли важную роль в стимулировании прорывов в учреждениях, таких как Национальные лаборатории, Aleph Alpha, Mayo Clinic и GlaxoSmithKline.
Обеспечивая беспрецедентную скорость, масштабируемость и точность, Cerebras позволяет организациям в этих секторах решать некоторые из самых сложных проблем в ИИ и за его пределами. Будь то ускорение открытия лекарств в здравоохранении или повышение вычислительных возможностей в научных исследованиях, Cerebras находится на переднем крае стимулирования инноваций.
Вывод: Новая Эра для Инференции ИИ
Cerebras Systems устанавливает новый стандарт для инференции ИИ с запуском Cerebras Inference. Предлагая 20-кратную скорость традиционных систем на основе GPU при дробной части затрат, Cerebras не только делает ИИ более доступным, но и открывает путь для следующего поколения приложений ИИ. С помощью своей передовой технологии, стратегических партнерств и приверженности инновациям Cerebras готов возглавить отрасль ИИ в новую эру беспрецедентной производительности и масштабируемости.
Для получения более подробной информации о системах Cerebras и для использования Cerebras Inference посетите www.cerebras.ai.












