Интервью
Эндрю Фельдман, сооснователь и генеральный директор Cerebras Systems – Интервью

Эндрю является сооснователем и генеральным директором Cerebras Systems (CBRS ). Он является предпринимателем, посвятившим себя расширению границ в области вычислений. До Cerebras он соосновал и был генеральным директором SeaMicro, пионера в области энергоэффективных, высокопроизводительных микросерверов. SeaMicro была приобретена AMD в 2012 году за $357M. До SeaMicro Эндрю был вице-президентом по управлению продуктами, маркетингу и бизнес-развитию в Force10 Networks, которая позже была продана Dell Computing за $800M. До Force10 Networks Эндрю был вице-президентом по маркетингу и корпоративному развитию в RiverStone Networks с момента основания компании до ее первичного публичного предложения в 2001 году. Эндрю имеет степень бакалавра и магистра делового администрирования в Стэнфордском университете.
Cerebras Systems разрабатывает новый класс компьютерных систем, спроектированных с нуля для единственной цели – ускорения ИИ и изменения будущего работы ИИ.
Расскажите нам о истории создания Cerebras Systems?
Мои сооснователи и я все работали вместе в предыдущей компании, которую мой технический директор Гэри и я основали в 2007 году, под названием SeaMicro (которая была продана AMD в 2012 году за $334 миллиона). Мои сооснователи – это некоторые из ведущих компьютерных архитекторов и инженеров в отрасли – Гэри Лотербах, Шон Ли, Джей Пи Фрикер и Майкл Джеймс. Когда мы собрались вместе в 2015 году, мы написали две вещи на доске – что мы хотим работать вместе и что мы хотим построить что-то, что изменит отрасль и будет в Музее компьютерной истории, который является эквивалентом Зала славы вычислений. Нас почетно, когда Музей компьютерной истории признал наши достижения и добавил процессор WSE-2 в свою коллекцию в прошлом году, сославшись на то, как он изменил ландшафт искусственного интеллекта.
Cerebras Systems – это команда пионерских компьютерных архитекторов, компьютерных ученых, исследователей глубокого обучения и инженеров всех типов, которые любят делать бесстрашную инженерию. Наша миссия, когда мы собрались вместе, заключалась в том, чтобы построить новый класс компьютеров для ускорения глубокого обучения, которое стало одним из наиболее важных рабочих нагрузок нашего времени.
Мы поняли, что глубокое обучение имеет уникальные, массивные и растущие вычислительные требования. И оно не хорошо сочетается с устаревшими машинами, такими как графические процессоры (GPU), которые были фундаментально спроектированы для другой работы. В результате ИИ сегодня ограничен не приложениями или идеями, а доступностью вычислений. Тестирование одного нового гипотезы – обучение новой модели – может занять дни, недели или даже месяцы и стоить сотен тысяч долларов в вычислительном времени. Это серьезное препятствие для инноваций.
Итак, генезис Cerebras заключался в том, чтобы построить новый тип компьютера, оптимизированного исключительно для глубокого обучения, начиная с чистого листа бумаги. Чтобы удовлетворить огромные вычислительные требования глубокого обучения, мы спроектировали и изготовили самый большой чип, когда-либо построенный – Wafer-Scale Engine (WSE). При создании первого в мире процессора на уровне晶лощадки мы преодолели проблемы в области проектирования, производства и упаковки – все, что считалось невозможным за всю 70-летнюю историю компьютеров. Каждый элемент WSE предназначен для обеспечения исследований глубокого обучения на беспрецедентных скоростях и масштабах, питая самый быстрый суперкомпьютер ИИ в отрасли, Cerebras CS-2.
С каждым компонентом, оптимизированным для работы ИИ, CS-2 обеспечивает более высокую производительность вычислений при меньшем пространстве и меньшей мощности, чем любая другая система. Он делает это, радикально снижая сложность программирования, время вычислений и время решения. В зависимости от рабочей нагрузки, от ИИ до высокопроизводительных вычислений, CS-2 обеспечивает производительность, в сотни или тысячи раз превышающую производительность устаревших альтернатив. CS-2 обеспечивает вычислительные ресурсы для глубокого обучения, эквивалентные сотням GPU, при этом обеспечивая легкость программирования, управления и развертывания одного устройства.
За последние несколько месяцев Cerebras Systems, кажется, находится во всех новостях, что вы можете рассказать нам о новом суперкомпьютере ИИ Andromeda?
Мы объявили об Andromeda в ноябре прошлого года, и это один из самых крупных и мощных суперкомпьютеров ИИ, когда-либо построенных. Обеспечивая более 1 ЭксаФЛОПС вычислений ИИ и 120 Петафлопс плотных вычислений, Andromeda имеет 13,5 миллиона ядер по 16 системам CS-2 и является единственным суперкомпьютером ИИ, который когда-либо демонстрировал почти идеальное линейное масштабирование на рабочих нагрузках крупных языковых моделей. Он также очень прост в использовании.
Для сравнения, самый большой суперкомпьютер на Земле – Frontier – имеет 8,7 миллиона ядер. По количеству ядер Andromeda более чем в полтора раза больше. Он выполняет другую работу, конечно, но это дает представление о масштабе: почти 100 терабит внутренней полосы пропускания, почти 20 000 ядер AMD Epyc питают его, и – в отличие от гигантских суперкомпьютеров, которые занимают годы на развертывание – мы развернули Andromeda за три дня и сразу после этого он обеспечивал почти идеальное линейное масштабирование ИИ.
Национальная лаборатория энергетических технологий была нашим первым клиентом, который использовал Andromeda, и они применили ее к проблеме, которая ломала их кластер из 2000 GPU под названием Polaris. Проблема заключалась в запуске очень крупных, генеративных моделей GPT-3XL, помещая всю геному Covid в окно последовательности, так что можно проанализировать каждый ген в контексте всей геномы Covid. Andromeda запустила уникальную генетическую рабочую нагрузку с длинными последовательностями (MSL 10K) на 1, 2, 4, 8 и 16 узлах, с почти идеальным линейным масштабированием. Линейное масштабирование является одним из наиболее востребованных характеристик крупного кластера. Andromeda обеспечила 15,87-кратный пропускной канал на 16 системах CS-2 по сравнению с одной системой CS-2 и снижение времени обучения до соответствия.
Можете ли вы рассказать нам о партнерстве с Jasper, которое было объявлено в конце ноября, и что оно значит для обеих компаний?
Jasper – это очень интересная компания. Они являются лидерами в области генеративного ИИ-контента для маркетинга, и их продукты используются более чем 100 000 клиентов по всему миру для написания копий для маркетинга, рекламы, книг и многое другое. Это, очевидно, очень интересная и быстро растущая область сейчас. В прошлом году мы объявили о партнерстве с ними для ускорения принятия и улучшения точности генеративного ИИ в корпоративных и потребительских приложениях. Jasper использует наш суперкомпьютер Andromeda для обучения своих чрезвычайно вычислительно интенсивных моделей за долю времени. Это позволит распространить модели генеративного ИИ на массы.
С помощью мощности суперкомпьютера Cerebras Andromeda Jasper может значительно продвинуть работу ИИ, включая обучение сетей GPT для соответствия выходам ИИ всем уровням сложности и детализации конечных пользователей. Это улучшает контекстную точность генеративных моделей и позволит Jasper персонализировать контент по нескольким классам клиентов быстро и легко.
Наше партнерство позволяет Jasper изобрести будущее генеративного ИИ, делая вещи, которые являются непрактичными или просто невозможными с традиционной инфраструктурой, и ускорять потенциал генеративного ИИ, принося его выгоды нашей быстро растущей клиентской базе по всему миру.
В недавнем пресс-релизе Национальная лаборатория энергетических технологий и Центр суперкомпьютерных вычислений Питтсбурга объявили о первой компьютерной симуляции гидродинамики на процессоре Cerebras Wafer-Scale. Можете ли вы описать, что именно является процессором Wafer-Scale и как он работает?
Наш процессор Wafer-Scale Engine (WSE) – это революционный процессор ИИ для нашей системы глубокого обучения, CS-2. В отличие от устаревших, общего назначения процессоров, WSE был построен с нуля для ускорения глубокого обучения: он имеет 850 000 ядер, оптимизированных для операций с разреженными тензорами, огромную высокопроизводительную память на кристалле и соединения, которые на несколько порядков быстрее, чем традиционный кластер мог бы достичь. Все вместе это дает вам вычислительные ресурсы для глубокого обучения, эквивалентные кластеру устаревших машин, все в одном устройстве, легко программируемом как один узел – радикально снижая сложность программирования, время вычислений и время решения.
Наш второй поколение WSE-2, которое питает нашу систему CS-2, может решать проблемы чрезвычайно быстро. Достаточно быстро, чтобы позволить реальные, высококачественные модели спроектированных систем. Это редкий пример успешного “сильного масштабирования”, которое является использованием параллелизма для снижения времени решения с фиксированным размером проблемы.
И это то, для чего Национальная лаборатория энергетических технологий и Центр суперкомпьютерных вычислений Питтсбурга используют его. Мы только что объявили о некоторых очень интересных результатах компьютерной симуляции гидродинамики, состоящей из примерно 200 миллионов ячеек, на почти реальных скоростях. Этот видео показывает высокоразрешающую симуляцию конвекции Рейли-Бенара, которая возникает, когда слой жидкости нагревается снизу и охлаждается сверху. Эти термически обусловленные потоки жидкости встречаются повсюду – от ветреных дней до снежных бурь, от движения магмы в ядре Земли до плазменного движения в Солнце. Как говорит рассказчик, это не только визуальная красота симуляции, которая важна: это скорость, с которой мы можем рассчитать ее. Впервые, используя наш процессор Wafer-Scale, NETL может манипулировать сеткой из почти 200 миллионов ячеек в почти реальном времени.
Какой тип данных симулируется?
Тестируемая рабочая нагрузка была термически обусловленными потоками жидкости, также известными как естественная конвекция, которая является применением компьютерной гидродинамики (CFD). Потоки жидкости возникают естественным образом повсюду – от ветреных дней до снежных бурь, от движения тектонических плит. Эта симуляция, состоящая из примерно 200 миллионов ячеек, фокусируется на явлении, известном как “конвекция Рейли-Бенара”, которое возникает, когда жидкость нагревается снизу и охлаждается сверху. В природе это явление может привести к сильным погодным явлениям, таким как спусковые потоки, микробурсты и derechos. Это также ответственность за движение магмы в ядре Земли и плазменное движение в Солнце.
В ноябре 2022 года NETL представила новый API-модели поля, питаемый системой CS-2, который был до 470 раз быстрее, чем было возможно на суперкомпьютере NETL Joule. Это означает, что он может обеспечить скорости, которые не могут достичь кластеры любого количества CPU или GPU. Используя простой Python API, который позволяет обрабатывать данные на уровне晶лощадки для большей части вычислительной науки, WFA обеспечивает выигрыши в производительности и удобстве использования, которые не могут быть получены на традиционных компьютерах и суперкомпьютерах – фактически, он превосходит OpenFOAM на суперкомпьютере NETL Joule 2.0 более чем в два порядка в времени решения.
Благодаря простоте API WFA результаты были достигнуты всего за несколько недель и продолжают тесное сотрудничество между NETL, PSC и Cerebras Systems.
Преобразуя скорость CFD (которая всегда была медленной, офлайн-задачей) на нашем WSE, мы можем открыть целый ряд новых, реальных случаев использования для этого и многих других основных приложений высокопроизводительных вычислений. Наша цель заключается в том, чтобы, обеспечивая больше вычислительной мощности, наши клиенты смогут проводить больше экспериментов и изобретать лучшую науку. Директор лаборатории NETL Брайан Андерсон сказал нам, что это значительно ускорит и улучшит процесс проектирования для некоторых очень крупных проектов, над которыми работает NETL, связанных с смягчением последствий изменения климата и обеспечением безопасного энергетического будущего – проектов, таких как улавливание углерода и производство синего водорода.
Cerebras Systems последовательно превосходит конкурентов в выпуске суперкомпьютеров, какие есть проблемы за строительством суперкомпьютеров нового поколения?
Иронично, одной из самых сложных задач большого ИИ является не сам ИИ. Это распределенные вычисления.
Для обучения современных нейронных сетей исследователи часто используют сотни или тысячи графических процессоров (GPU). И это не легко. Масштабирование обучения крупных языковых моделей на кластере GPU требует распределения рабочей нагрузки по многим небольшим устройствам, борьбы с ограничениями размера устройства и пропускной способности памяти, а также тщательного управления накладными расходами на связь и синхронизацию.
Мы выбрали совершенно другой подход к проектированию наших суперкомпьютеров через разработку кластера Cerebras Wafer-Scale и режима выполнения Cerebras Weight Streaming. С помощью этих технологий Cerebras решает новую проблему масштабирования на основе трех ключевых моментов:
Замена процессоров CPU и GPU на процессоры на уровне晶лощадки, такие как система Cerebras CS-2. Это изменение снижает количество необходимых единиц вычислений для достижения приемлемой скорости вычислений.
Для решения проблемы размера модели мы используем систему архитектуры, которая разделяет вычисления и хранилище модели. Сервис вычислений, основанный на кластере систем CS-2 (предоставляющий достаточную пропускную способность вычислений), тесно связан с сервисом памяти (с большой емкостью памяти), который предоставляет части модели кластеру вычислений по требованию. Как обычно, сервис данных обслуживает партии обучающих данных для сервиса вычислений по мере необходимости.
Инновационная модель для планирования и координации обучения по кластеру CS-2, которая использует параллелизм данных, обучение слоя за слоем с разреженными весами, передаваемыми по требованию, и сохранение активаций в сервисе вычислений.
Были опасения по поводу конца закона Мура уже почти десятилетие, сколько еще лет отрасль может выжать и какие инновации необходимы для этого?
Я думаю, что вопрос, с которым мы все боремся, заключается в том, является ли закон Мура – как написано Муром – мертвым. Это не занимает два года, чтобы получить больше транзисторов. Теперь это занимает четыре или пять лет. И эти транзисторы не приходят по той же цене – они приходят по значительно более высокой цене. Итак, вопрос становится, получаем ли мы все еще те же выгоды от перехода от семи до пяти до трех нанометров? Выгоды меньше, и они стоят больше, и поэтому решения становятся более сложными, чем просто чип.
Джек Донгарра, ведущий компьютерный архитектор, недавно прочитал лекцию и сказал: “Мы стали намного лучше в производстве ФЛОПС и в производстве ввода/вывода”. Это действительно так. Наша способность перемещать данные вне чипа отстает от нашей способности увеличивать производительность на чипе на большую величину. В Cerebras мы были счастливы, когда он сказал это, потому что это подтверждает наш выбор сделать более крупный чип и переместить меньше вещей вне чипа. Это также дает некоторое руководство для будущих способов сделать системы с чипами работать лучше. Там есть работа, которую нужно сделать, не только в сжатии ФЛОПС, но и в техниках их перемещения и перемещения данных с чипа на чип – даже с очень большого чипа на очень большой чип.
Есть ли что-то еще, что вы хотели бы поделиться о Cerebras Systems?
Для лучше или хуже, люди часто помещают Cerebras в эту категорию “парней с очень большим чипом”. Мы смогли предоставить убедительные решения для очень крупных нейронных сетей, тем самым исключив необходимость в болезненном распределенном вычислении. Я считаю, что это чрезвычайно интересно и является сердцем того, почему наши клиенты любят нас. Интересная область для 2023 года будет заключаться в том, как делать большие вычисления на более высоком уровне точности, используя меньше ФЛОПС.
Наша работа по разреженности обеспечивает чрезвычайно интересный подход. Мы не делаем работу, которая не приближает нас к финишной черте, и умножение на ноль – это плохая идея. Мы скоро выпустим очень интересную статью о разреженности, и я думаю, что будет больше усилий, направленных на то, как мы доберемся до этих эффективных точек, и как мы сделаем это для меньшей мощности. И не только для меньшей мощности и обучения; как мы минимизируем стоимость и мощность, используемую в выводе? Я думаю, что разреженность помогает на обоих фронтах.
Спасибо за эти глубокие ответы, читатели, которые хотят узнать больше, должны посетить Cerebras Systems.












