Лідери думок

Майбутнє генеративного штучного інтелекту – це край

mm
Додайте Unite.AI до бажаних джерел у Google

Поява ChatGPT та генеративного штучного інтелекту загалом є поворотним моментом в історії технологій, подібним до появи Інтернету та смартфонів. Генеративний штучний інтелект продемонстрував безмежний потенціал у своїй здатності проводити розумні розмови, проходити іспити, генерувати складні програми/код та створювати привабливі зображення та відео. Хоча більшість моделей Генеративного штучного інтелекту використовують графічні процесори в хмарі – як для навчання, так і для висновку – це не є довгостроковим масштабованим рішенням, особливо для висновку, через фактори, які включають вартість, потужність, затримку, конфіденційність та безпеку. Ця стаття розглядає кожен з цих факторів разом з мотивуючими прикладами для перенесення завдань Генеративного штучного інтелекту на край.

Більшість застосунків працюють на високопродуктивних процесорах – або на пристрої (наприклад, смартфонах, настільних комп’ютерах, ноутбуках) або в центрах даних. Коли частка застосунків, які використовують штучний інтелект, розширюється, ці процесори з лише центральними процесорами є недостатніми. Крім того, швидке розширення Генеративного штучного інтелекту призводить до експоненційного зростання попиту на сервери з штучним інтелектом з дорогими, енергозатратними графічними процесорами, що в свою чергу підвищує витрати на інфраструктуру. Ці сервери з штучним інтелектом можуть коштувати в 7 разів більше, ніж звичайний сервер, а графічні процесори становлять 80% цієї додаткової вартості.

Крім того, хмарний сервер споживає 500 Вт до 2000 Вт, тоді як сервер з штучним інтелектом споживає від 2000 Вт до 8000 Вт – в 4 рази більше! Для підтримки цих серверів центри даних потребують додаткових модулів охолодження та оновлень інфраструктури – які можуть бути навіть вищими, ніж інвестиції в обчислення. Центри даних вже споживають 300 ТВт·год на рік, 几乎 1% від загального світового споживання енергії. Якщо тенденції прийняття штучного інтелекту продовжаться, то до 2030 року центри даних можуть споживати до 5% світового споживання енергії. Крім того, відбувається безпрецедентна інвестиція в центри даних Генеративного штучного інтелекту. Оцінюється, що центри даних будуть споживати до 500 мільярдів доларів капітальних витрат до 2027 року, в основному через вимоги інфраструктури штучного інтелекту.

Споживання електроенергії центрами даних, яке вже становить 300 ТВт·год, значно збільшиться з прийняттям генеративного штучного інтелекту.

Витрати на обчислення штучного інтелекту, а також споживання енергії, завадять масовому прийняттю Генеративного штучного інтелекту. Виклики масштабування можна подолати, перенесши завдання штучного інтелекту на край та використовуючи рішення для обробки, оптимізовані для завдань штучного інтелекту. З цим підходом клієнти також отримують інші переваги, включаючи затримку, конфіденційність, надійність, а також підвищення можливостей.

Обчислення слідують за даними на край

Від часу появи штучного інтелекту з академічного світу навчання та висновок моделей штучного інтелекту відбувалися в хмарі/центрі даних. Оскільки більша частина даних генерується та споживається на краю – особливо відео – було логічно перенести висновок даних на край, тим самим покращуючи загальну вартість володіння (TCO) для підприємств через зменшення мережевих та обчислювальних витрат. Хоча витрати на висновок штучного інтелекту в хмарі є постійними, вартість висновку на краю є одноразовими витратами на апаратне забезпечення. По суті, доповнення системи процесором штучного інтелекту на краю знижує загальні операційні витрати. Як і у випадку з традиційними завданнями штучного інтелекту (наприклад, пристрої, апаратурою), завдання Генеративного штучного інтелекту будуть слідувати цьому прикладу. Це принесе значні заощадження підприємствам та споживачам.

Перенесення на край разом з ефективним прискорювачем штучного інтелекту для виконання завдань висновку надає інші переваги. Передусім серед них є затримка. Наприклад, у ігрових застосунках неігрові персонажі (NPC) можна контролювати та доповнювати за допомогою генеративного штучного інтелекту. Використовуючи моделі LLM, що працюють на прискорювачах штучного інтелекту на краю в ігровій консолі або на комп’ютері, гравці можуть давати цим персонажам конкретні цілі, щоб вони могли значуще брати участь у сюжеті. Низька затримка від локального висновку на краю дозволить персонажам штучного інтелекту та рухам реагувати на команди та дії гравців в режимі реального часу. Це надасть високоіммерсивний ігровий досвід економічно ефективним та енергоефективним способом.

У застосунках, таких як охорона здоров’я, конфіденційність та надійність є надзвичайно важливими (наприклад, оцінка пацієнтів, рекомендації щодо ліків). Дані та пов’язані з ними моделі Генеративного штучного інтелекту повинні знаходитися локально, щоб захистити дані пацієнтів (конфіденційність), а будь-які мережеві збої, які блокують доступ до моделей штучного інтелекту в хмарі, можуть бути катастрофічними. Прискорювач штучного інтелекту на краю, що працює з моделлю Генеративного штучного інтелекту, спеціально створеною для кожного підприємства-клієнта – в цьому випадку постачальника медичних послуг – може безшовно вирішити питання конфіденційності та надійності, забезпечуючи при цьому нижчу затримку та вартість.

Генеративний штучний інтелект на пристроях на краю забезпечить низьку затримку в іграх та збереже дані пацієнтів і покращить надійність для охорони здоров’я.

Багато моделей Генеративного штучного інтелекту, що працюють в хмарі, можуть бути близько до трильйона параметрів – ці моделі можуть ефективно відповідати на загальні запитання. Однак підприємства-специфічні застосунки вимагають, щоб моделі надавали результати, які є актуальними для випадку використання. Взявши приклад асистента на основі Генеративного штучного інтелекту, створеного для прийому замовлень у фаст-фуді – для цього системи необхідно, щоб модель була навчена на пунктах меню ресторану, а також знала про алергени та інгредієнти. Розмір моделі можна оптимізувати, використовуючи надмножину великих мовних моделей (LLM), щоб навчати відносно невелику модель з 10-30 мільярдами параметрів, а потім використовувати додаткове тонке налаштування з даними клієнта. Така модель може надати результати з підвищеною точністю та можливостями. І оскільки розмір моделі менший, її можна ефективно розгорнути на прискорювачі штучного інтелекту на краю.

Генеративний штучний інтелект переможе на краю

Завжди буде існувати потреба в Генеративному штучному інтелекті, що працює в хмарі, особливо для загальних застосунків, таких як ChatGPT та Claude. Але коли мова йде про підприємства-специфічні застосунки, такі як генеративне заповнення Adobe Photoshop або Github Copilot, Генеративний штучний інтелект на краю не тільки майбутнє, а й сьогодення. Спеціально створені прискорювачі штучного інтелекту є ключем до реалізації цього. особливо для загальних застосунків, таких як ChatGPT і Claude. Але коли мова йде про підприємства-специфічні застосунки, такі як генеративне заповнення Adobe Photoshop або Github Copilot, Генеративний штучний інтелект на краю не тільки майбутнє, а й сьогодення. Purpose-орієнтовані прискорювачі штучного інтелекту є ключем до реалізації цього.

Як ветеран Кремнієвої долини, та генеральний директор Kinara Inc, Ravi Annavajjhala має понад 20 років досвіду, що охоплює розвиток бізнесу, маркетинг та інженерію, створення передових технологічних продуктів та виведення їх на ринок. На своїй поточній посаді генерального директора Deep Vision, Ravi є членом ради директорів та зібрав 50 млн доларів, перевівши процесор Ara-1 компанії з до-krемнієвої стадії до повномасштабного виробництва та розгорнув у великих обсягах 2-й покоління процесора, Ara-2. До того, як приєднатися до Deep Vision, Ravi обіймав виконавчі керівні посади в Intel та SanDisk, де він відігравав ключову роль у стимулюванні зростання доходів, розвитку стратегічних партнерств та створенні дорожніх карт продуктів, які лідирували в галузі з передовими функціями та можливостями.