Інтерв’ю

Ендрю Фелдман, співзасновник та генеральний директор Cerebras Systems – Серія інтерв’ю

mm
Додайте Unite.AI до бажаних джерел у Google

Ендрю є співзасновником і генеральним директором Cerebras Systems (CBRS ). Він є підприємцем, який присвячений розширенню меж у сфері обчислень. До Cerebras він був співзасновником і генеральним директором SeaMicro, піонером у сфері енергоефективних, високопродуктивних мікросерверів. SeaMicro була придбана компанією AMD у 2012 році за 357 мільйонів доларів. До SeaMicro Ендрю був віце-президентом з управління продуктами, маркетингу та бізнес-розвитку в компанії Force10 Networks, яка пізніше була продана компанії Dell Computing за 800 мільйонів доларів. До Force10 Networks Ендрю був віце-президентом з маркетингу та корпоративного розвитку в компанії RiverStone Networks з моменту її заснування до виходу на біржу у 2001 році. Ендрю має ступінь бакалавра та магістра ділового адміністрування в Стенфордському університеті.

Cerebras Systems будує новий клас комп’ютерних систем, розроблених з нуля для однієї мети – прискорення штучного інтелекту та зміни майбутнього роботи зі штучним інтелектом.

Чи можете Ви розповісти про походження Cerebras Systems?

Мої співзасновники та я всі працювали разом у попередньому стартапі, який мій технічний директор Гері та я заснували у 2007 році, під назвою SeaMicro (яка була продана компанії AMD у 2012 році за 334 мільйони доларів). Мої співзасновники – це деякі з провідних комп’ютерних архітекторів та інженерів у галузі – Гері Лотербах, Шон Лай, Джей Пі Фрікер та Майкл Джеймс. Коли ми знову зібралися у 2015 році, ми написали дві речі на дошці – що ми хочемо працювати разом, і що ми хочемо будувати щось, що змінить галузь і буде в Комп’ютерному музеї історії, який є еквівалентом до Зали слави обчислень. Нас вшанували, коли Комп’ютерний музей історії визнав наші досягнення та додав процесор WSE-2 до своєї колекції минулого року, зазначивши, як він змінив ландшафт штучного інтелекту.

Cerebras Systems – це команда піонерських комп’ютерних архітекторів, комп’ютерних вчених, дослідників глибокого навчання та інженерів усіх типів, які люблять безстрашну інженерію. Наша мета, коли ми зібралися, полягала у створенні нового класу комп’ютера для прискорення глибокого навчання, яке стало одним з найважливіших завдань нашого часу.

Ми зрозуміли, що глибоке навчання має унікальні, масивні та зростаючі обчислювальні вимоги. І воно не добре підходить для спадкових машин, таких як графічні процесори (GPU), які були фундаментально розроблені для іншої роботи. В результаті штучний інтелект сьогодні обмежений не застосуваннями або ідеями, а наявністю обчислень. Перевірка однієї нової гіпотези – навчання нової моделі – може зайняти дні, тижні або навіть місяці та коштувати сотень тисяч доларів у часі обчислень. Це велика перешкода для інновацій.

Отже, походження Cerebras полягало у створенні нового типу комп’ютера, оптимізованого виключно для глибокого навчання, починаючи з чистого аркуша паперу. Для задоволення величезних обчислювальних вимог глибокого навчання ми розробили та виготовили найбільший чіп, який коли-небудь був побудований – Wafer-Scale Engine (WSE). При створенні першого у світі чіпа рівня пластини ми подолали виклики у сфері дизайну, виготовлення та упаковки – всі з яких вважалися неможливими для всієї 70-річної історії комп’ютерів. Кожен елемент WSE розроблений для забезпечення дослідження глибокого навчання на безпрецедентних швидкостях та масштабах, що забезпечує найшвидший суперкомп’ютер галузі – Cerebras CS-2.

З кожним компонентом, оптимізованим для роботи зі штучним інтелектом, CS-2 забезпечує більшу обчислювальну продуктивність при меншому просторі та меншій потужності, ніж будь-яка інша система. Він робить це, радикально скорочуючи складність програмування, час обчислень та час до рішення. В залежності від завдання, від штучного інтелекту до високопродуктивних обчислень, CS-2 забезпечує сотні або тисячі разів більшу продуктивність, ніж спадкові альтернативи. CS-2 забезпечує обчислювальні ресурси для глибокого навчання, еквівалентні сотням графічних процесорів, забезпечуючи легкість програмування, управління та розгортання одного пристрою.

За останні кілька місяців Cerebras здавався всюди у новинах, що Ви можете розповісти нам про новий суперкомп’ютер Andromeda?

Ми оголосили про Andromeda у листопаді минулого року, і це один з найбільших та найпотужніших суперкомп’ютерів, які коли-небудь були побудовані. Надавши понад 1 ексафлоп обчислювальної потужності штучного інтелекту та 120 петафлопс густої обчислювальної потужності, Andromeda має 13,5 мільйона ядер по 16 системам CS-2, і це єдиний суперкомп’ютер штучного інтелекту, який коли-небудь демонстрував майже ідеальне лінійне масштабування на великих завданнях моделей мови. Він також дуже простий у використанні.

Для нагадування, найбільший суперкомп’ютер на Землі – Frontier – має 8,7 мільйона ядер. За кількістю ядер Andromeda більш ніж у півтора рази більша. Він робить іншу роботу, очевидно, але це дає уявлення про масштаб: майже 100 терабіт внутрішньої смуги пропускання, майже 20 000 ядер AMD Epyc живлять його, і, на відміну від гігантських суперкомп’ютерів, які потребують років для розгортання, ми розгорнули Andromeda за три дні, і відразу після цього він забезпечував майже ідеальне лінійне масштабування штучного інтелекту.

Лабораторія Національного енергетичного технологічного центру була нашим першим клієнтом, який використав Andromeda, і вони застосували його до завдання, яке ламало їхній кластер з 2000 графічних процесорів під назвою Polaris. Завданням було виконання дуже великих, генеративних моделей GPT-3XL, розміщуючи весь геном Covid у вікні послідовності, так що можна було проаналізувати кожен ген у контексті всього генома Covid. Andromeda виконав унікальне генетичне завдання з довгими довжинами послідовності (MSL 10K) на 1, 2, 4, 8 та 16 вузлах, з майже ідеальним лінійним масштабуванням. Лінійне масштабування є одним з найбільш бажаних характеристик великого кластера. Andromeda забезпечила 15,87-кратне пропускання по 16 системам CS-2 порівняно з однією системою CS-2, і скорочення часу навчання до відповідного рівня.

Чи можете Ви розповісти нам про партнерство з Jasper, яке було оголошено наприкінці листопада, і що це означає для обох компаній?

Jasper – це дуже цікава компанія. Вони є лідерами у сфері генеративного штучного інтелекту для маркетингу, і їхні продукти використовуються понад 100 000 клієнтів по всьому світу для написання копій для маркетингу, реклам, книг тощо. Це очевидно дуже цікава та швидко зростаюча галузь зараз. У минулому році ми оголосили про партнерство з ними для прискорення прийняття та поліпшення точності генеративного штучного інтелекту у сфері підприємства та споживчих застосунків. Jasper використовує наш суперкомп’ютер Andromeda для навчання своїх обчислень інтенсивних моделей за частину часу. Це розширить сферу застосування моделей генеративного штучного інтелекту для мас.

З потужністю суперкомп’ютера Cerebras Andromeda Jasper може суттєво просунути роботу зі штучним інтелектом, включаючи навчання мереж GPT для підгонки виходів штучного інтелекту до всіх рівнів складності та деталізації кінцевих користувачів. Це покращить контекстну точність генеративних моделей і дозволить Jasper персоналізувати контент по декілька класів клієнтів швидко та легко.

Наше партнерство дозволяє Jasper винаходити майбутнє генеративного штучного інтелекту, роблячи речі, які є непрактичними або просто неможливими з традиційною інфраструктурою, і прискорювати потенціал генеративного штучного інтелекту, привнося його вигоди до нашої швидко зростаючої клієнтської бази по всьому світу.

У недавньому прес-релізі Національна лабораторія енергетичних технологій та Піттсбурзький суперкомп’ютерний центр оголосили про першу у світі комп’ютерну симуляцію динаміки рідини на чіпі рівня пластини Cerebras. Чи можете Ви описати, що саме є чіпом рівня пластини та як він працює?

Наш чіп рівня пластини (WSE) – це революційний процесор штучного інтелекту для нашої комп’ютерної системи глибокого навчання, CS-2. На відміну від спадкових процесорів загального призначення, WSE був побудований з нуля для прискорення глибокого навчання: він має 850 000 оптимізованих для штучного інтелекту ядер для операцій зріджених тензорів, велику внутрішню пам’ять з високою пропускною здатністю та з’єднання, яке на кілька порядків швидше, ніж традиційний кластер міг би досягти. Все це разом забезпечує обчислювальні ресурси для глибокого навчання, еквівалентні кластеру спадкових машин у одному пристрої, легкому для програмування як один вузол – радикально скорочуючи складність програмування, час обчислень та час до рішення.

Наш другий чіп WSE-2, який живить нашу систему CS-2, може розв’язувати завдання дуже швидко. Достатньо швидко, щоб дозволити моделі реального часу з високою точністю для інженерних систем інтересу. Це рідкісний приклад успішного “сильного масштабування”, яке полягає у використанні паралелізму для скорочення часу розв’язування з фіксованим розміром завдання.

І це саме те, для чого Національна лабораторія енергетичних технологій та Піттсбурзький суперкомп’ютерний центр використовують його. Ми щойно оголосили про дуже цікаві результати комп’ютерної симуляції динаміки рідини, яка складається з близько 200 мільйонів клітин, на майже реальному рівні. Цей відеоролик показує високоємнісну симуляцію конвекції Рейлі-Бенара, яка відбувається, коли шар рідини нагрівається знизу та охолоджується зверху. Ці термічно викликані потоки рідини є всюди навколо нас – від вітряних днів до снігових бурь, до руху магми в ядрі Землі та плазми на Сонці. Як говорить оповідач, це не тільки візуальна краса симуляції, яка важлива: це швидкість, з якою ми можемо її розрахувати. Вперше, використовуючи наш чіп рівня пластини, Національна лабораторія енергетичних технологій може маніпулювати сіткою майже 200 мільйонів клітин майже в реальному часі.

Який тип даних симулюється?

Оброблений обсяг роботи був термічно викликаними потоками рідини, також відомими як природна конвекція, яка є застосуванням комп’ютерної динаміки рідини (CFD). Потоки рідини відбуваються природно всюди навколо нас – від вітряних днів до снігових бурь, до руху тектонічних плит. Ця симуляція, яка складається з близько 200 мільйонів клітин, фокусується на явищі, відомому як “конвекція Рейлі-Бенара”, яке відбувається, коли рідину нагрівають знизу та охолоджують зверху. У природі це явище може привести до серйозних погодних подій, таких як зсуви, мікробури та derecho. Це також відповідає за рух магми в ядрі Землі та плазми на Сонці.

У листопаді 2022 року Національна лабораторія енергетичних технологій представила новий API-модель рівня поля, який працює на системі CS-2, який був до 470 разів швидшим, ніж те, що було можливо на суперкомп’ютері Joule Національної лабораторії енергетичних технологій . Це означає, що він міг забезпечувати швидкості, які перевищують те, що могли забезпечити кластери будь-якої кількості процесорів або графічних процесорів. Використовуючи простий Python API, який дозволяє обробку рівня пластини для більшості обчислювальної науки, WFA забезпечує вигоди у продуктивності та зручності використання, яких не можна було досягти на традиційних комп’ютерах та суперкомп’ютерах – насправді, він перевершив OpenFOAM на суперкомп’ютері Joule 2.0 Національної лабораторії енергетичних технологій більш ніж на два порядки за часом до рішення.

Через простоту API WFA результати були досягнуті всього за кілька тижнів і продовжують тісну співпрацю між Національною лабораторією енергетичних технологій, Піттсбурзьким суперкомп’ютерним центром та Cerebras Systems.

Отже, перетворивши швидкість CFD (яка завжди була повільною, офлайн-задачею) на нашому чіпі рівня пластини, ми можемо відкрити цілий ряд нових завдань у реальному часі для цього та багатьох інших основних застосунків високопродуктивних обчислень. Наша мета полягає у тому, щоб, забезпечуючи більшу обчислювальну потужність, наші клієнти могли проводити більше експериментів та винаходити краще науку. Директор лабораторії Національної лабораторії енергетичних технологій Браян Андерсон сказав нам, що це суттєво прискорить та покращить процес проектування для деяких великих проектів, над якими Національна лабораторія енергетичних технологій працює щодо пом’якшення зміни клімату та забезпечення безпечної енергетичної майбутнього – таких як вуглець та виробництво синього водню.

Cerebras постійно перевершує конкурентів у сфері випуску суперкомп’ютерів, які є деякими з викликів при будівництві суперкомп’ютерів останнього покоління?

Іронічно, одним з найважчих викликів великого штучного інтелекту не є штучний інтелект. Це розподілений обчислення.

Для навчання сучасних моделей нейронних мереж державного рівня дослідники часто використовують сотні до тисяч графічних процесорів. І це не легко. Масштабування навчання великих мовних моделей по кластеру графічних процесорів вимагає розподілу завдання по багатьох малих пристроях, боротьби з обмеженнями розміру пам’яті пристрою та пропускної здатності пам’яті, а також уважного управління комунікацією та синхронізацією.

Ми підходимо до цього зовсім інакше, розробляючи свої суперкомп’ютери через розвиток кластера рівня пластини Cerebras та режиму виконання Cerebras Weight Streaming. За допомогою цих технологій Cerebras пропонує новий спосіб масштабування на основі трьох ключових моментів:

Заміна процесорів CPU та GPU на прискорювачі рівня пластини, такі як система Cerebras CS-2. Ця зміна зменшує кількість обчислювальних одиниць, необхідних для досягнення прийнятної обчислювальної швидкості.

Для задоволення виклику розміру моделі ми використовуємо систему архітектури, яка роз’єднує обчислення від зберігання моделі. Служба обчислень, заснована на кластері систем CS-2 (який забезпечує достатню обчислювальну смугу пропускання), тісно пов’язана зі службою пам’яті (яка має велику ємність пам’яті) та забезпечує підмножини моделі кластеру обчислень по вимозі. Як зазвичай, служба даних підтримує партії навчальних даних для служби обчислень по вимозі.

Інноваційний модель для планування та координації навчання по кластеру CS-2, який використовує паралелізм даних, навчання за шаром зріджених ваг, введених по вимозі, та збереження активацій у службі обчислень.

Є побоювання щодо кінця закону Мура вже майже десятиліття, скільки ще років можна вичавити з галузі та які інновації потрібні для цього?

Я думаю, що питання, з яким ми всі боремося, полягає в тому, чи закон Мура – як написаний Муром – мертвий. Це не займає два роки, щоб отримати більше транзисторів. Тепер це займає чотири або п’ять років. І ці транзистори не приходять за ту саму ціну – вони приходять за значно вищу ціну. Отже, питання стає, чи ми все ще отримуємо ті самі вигоди від переходу з семи до п’яти до трьох нанометрів? Вигоди менші, і вони коштують більше, і тому рішення стають складнішими, ніж просто чіп.

Джек Донгарра, провідний комп’ютерний архітектор, дав виступ недавно та сказав: “Ми стали значно краще у створенні ФЛОПС та у створенні входу/виходу”. Це действительно правда. Наша здатність переміщувати дані поза чіпом відстає від нашої здатності збільшувати продуктивність на чіпі на велику міру. У Cerebras ми були раді, коли він сказав це, оскільки це підтверджує наш вибір створення більшого чіпа та переміщення меншої кількості даних поза чіпом. Це також надає деякі вказівки щодо майбутніх способів зробити системи з чіпами працювати краще. Є робота, яка повинна бути зроблена, не тільки у витягуванні більшої кількості ФЛОПС, але також у техніках їх переміщення та переміщення даних з чіпа на чіп – навіть з дуже великого чіпа на дуже великий чіп.

Чи є щось ще, що Ви хотіли б поділитися про Cerebras Systems?

Для кращого чи гіршого людей часто ставлять Cerebras у категорію “дуже великих чіпів”. Ми змогли забезпечити переконливі рішення для дуже великих нейронних мереж, тим самим усунувши потребу у болісному розподілених обчисленнях. Я вважаю, що це надзвичайно цікаво та є в самому серці того, чому наші клієнти нас люблять. Цікавою областю для 2023 року буде те, як зробити великі обчислення на вищому рівні точності, використовуючи менше ФЛОПС.

Наша робота над зрідженістю забезпечує надзвичайно цікавий підхід. Ми не робимо роботи, яка не рухає нас до лінії воріт, і множення на нуль – це погана ідея. Ми випустимо дуже цікаву статтю про зрідженість скоро, і я думаю, що буде більше зусиль у тому, щоб подивитися, як ми доходимо до цих ефективних точок, і як ми робимо це за меншу потужність. І не тільки за меншу потужність та навчання; як ми мінімізуємо вартість та потужність, використану в інференції? Я думаю, що зрідженість допомагає на обох фронтах.

Дякую за ці глибокі відповіді, читачам, які бажають дізнатися більше, слід відвідати Cerebras Systems.

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.