Інтерв’ю

Кірілл Солодських, співзасновник і генеральний директор TheStage AI – Серія інтерв’ю

mm
Додайте Unite.AI до бажаних джерел у Google

Кірілл Солодських, PhD, є співзасновником і генеральним директором TheStage AI, а також досвідченим дослідником і підприємцем у сфері штучного інтелекту з понад десятирічним досвідом оптимізації нейронних мереж для реальних бізнес-застосувань. У 2024 році він став співзасновником TheStage AI, яке отримало фінансування у розмірі 4,5 мільйона доларів для повної автоматизації прискорення нейронних мереж на будь-якій апаратній платформі.

Раніше, як керівник команди в Huawei, Кірілл очолював прискорення застосунків штучного інтелекту для камер Qualcomm (QCOM ) NPUs, що сприяло підвищенню продуктивності смартфонів P50 і P60, а також отримав кілька патентів на свої інновації. Його дослідження були представлені на провідних конференціях, таких як CVPR і ECCV , де вони отримали нагороди та визнання в галузі. Він також веде подкаст про оптимізацію штучного інтелекту та висновок.

Що надихнуло вас стати співзасновником TheStage AI, і як ви перейшли від академії та досліджень до оптимізації висновку як засновник стартапу?

Основи того, що згодом стало TheStage AI, почалися з моєї роботи в Huawei, де я займався автоматизацією розгортання та оптимізацією нейронних мереж. Ці ініціативи стали основою для деяких наших революційних інновацій, і саме там я побачив справжню проблему. Навчання моделі – це одне, але зробити її ефективною в реальному світі та зробити її доступною для користувачів – це зовсім інше. Розгортання – це瓶нем, яке стримує багато гарних ідей від реалізації. Щоб зробити щось так просто у використанні, як ChatGPT, потрібно багато задніх проблем. З технічної точки зору оптимізація нейронних мереж полягає в мінімізації параметрів, зберігаючи при цьому високу продуктивність. Це складна математична проблема з великим потенціалом для інновацій.

Ручна оптимізація висновку давно є瓶нем у штучному інтелекті. Чи можете ви пояснити, як TheStage AI автоматизує цей процес і чому це революційний крок?

TheStage AI вирішує одну з найбільших проблем штучного інтелекту: ручне стиснення та прискорення нейронних мереж. Нейронні мережі мають мільярди параметрів, і визначення тих, які потрібно видалити для кращої продуктивності, майже неможливо зробити вручну. ANNA (Автоматичний аналіз нейронних мереж) автоматизує цей процес, визначаючи, які шари потрібно виключити з оптимізації, подібно до того, як ZIP-стиснення було вперше автоматизовано.

Це змінює гру, роблячи прийняття штучного інтелекту швидшим і дешевшим. Замість того, щоб покладатися на дорогі ручні процеси, стартапи можуть оптимізувати моделі автоматично. Технологія дає підприємствам чітке уявлення про продуктивність і вартість, забезпечуючи ефективність і масштабованість без здогадок.

TheStage AI стверджує, що зменшує витрати на висновок до 5 разів – що робить вашу технологію оптимізації так ефективною порівняно з традиційними методами?

TheStage AI зменшує витрати на висновок до 5 разів завдяки підходу до оптимізації, який виходить за рамки традиційних методів. Замість застосування одного алгоритму до всієї нейронної мережі, ANNA розбиває її на менші шари та вирішує, який алгоритм застосувати до кожної частини, щоб досягти бажаного стиснення, зберігаючи при цьому якість моделі. Об’єднавши розумні математичні евристики з ефективними апроксимаціями, наш підхід дуже масштабний і робить прийняття штучного інтелекту легшим для підприємств усіх розмірів. Ми також інтегруємо гнучкі налаштування компілятора для оптимізації мереж для конкретної апаратури, наприклад, iPhone або NVIDIA GPU. Це дає нам більше контролю для тонкої настройки продуктивності, збільшуючи швидкість без втрати якості.

Як прискорення висновку TheStage AI порівнюється з вбудованим компілятором PyTorch, і які переваги воно пропонує розробникам штучного інтелекту?

TheStage AI прискорює висновок значно далі, ніж вбудований компілятор PyTorch. PyTorch використовує метод компіляції “just-in-time”, який компілює модель кожен раз, коли вона запускається. Це призводить до довгих часів запуску, іноді триваючи хвилинами або навіть довше. У масштабних середовищах це може створити неефективності, особливо коли нові GPU потрібно підключити для обробки збільшеного навантаження користувачів, що призводить до затримок, які впливають на досвід користувача.

Натомість TheStage AI дозволяє моделям бути попередньо скомпільованими, тому як тільки модель готова, її можна розгорнути миттєво. Це призводить до швидших розгортань, покращення ефективності служби та економії коштів. Розробники можуть розгортати та масштабувати моделі штучного інтелекту швидше, без瓶нем традиційної компіляції, роблячи це більш ефективним і реактивним для випадків високого попиту.

Чи можете ви розповісти більше про інструментарій QLIP TheStage AI та про те, як він покращує продуктивність моделі, зберігаючи при цьому якість?

QLIP, інструментарій TheStage AI, є бібліотекою Python, яка забезпечує необхідний набір примітивів для швидкої побудови нових алгоритмів оптимізації, адаптованих до різних апаратних засобів, таких як GPU та NPUs. Інструментарій включає компоненти, такі як квантова обробка, обрізання, специфікація, компіляція та надання послуг, усі критично важливі для розробки ефективних та масштабних систем штучного інтелекту.

Що відрізняє QLIP, так це його гнучкість. Він дозволяє інженерам штучного інтелекту прототипувати та реалізовувати нові алгоритми за допомогою лише декількох рядків коду. Наприклад, недавня стаття про квантові нейронні мережі на конференції з штучного інтелекту може бути перетворена в робочий алгоритм за допомогою примітивів QLIP за кілька хвилин. Це робить його легким для розробників інтегрувати останні дослідження в свої моделі без обмежень жорсткими рамками.

На відміну від традиційних відкритих рамок, які обмежують вас фіксованим набором алгоритмів, QLIP дозволяє будь-кому додати нові техніки оптимізації. Ця адаптивність допомагає командам залишатися на чолі швидко еволюціонуючого ландшафту штучного інтелекту, покращуючи продуктивність, зберігаючи при цьому гнучкість для майбутніх інновацій.

Ви внесли свій внесок у рамки кванталізації штучного інтелекту, використані в камерах Huawei P50 та P60. Як цей досвід сформував ваш підхід до оптимізації штучного інтелекту?

Мій досвід роботи з рамками кванталізації штучного інтелекту для камер Huawei P50 та P60 дав мені цінні знання про те, як оптимізацію можна оптимізувати та масштабувати. Коли я вперше почав працювати з PyTorch, робота з повним графом виконання нейронних мереж була жорсткою, а алгоритми кванталізації потрібно було реалізовувати вручну, шар за шаром. В Huawei я побудував рамку, яка автоматизувала цей процес. Ви просто вводили модель, і вона автоматично генерувала код для кванталізації, усуваючи ручну роботу.

Це привело мене до розуміння того, що автоматизація оптимізації штучного інтелекту полягає в забезпеченні швидкості без жертвування якістю. Один з алгоритмів, який я розробив і запатентував, став важливим для Huawei, особливо коли їм потрібно було перейти від процесорів Kirin до Qualcomm через санкції. Це дозволило команді швидко адаптувати нейронні мережі до архітектури Qualcomm без втрати продуктивності чи точності.

Отримавши швидкість та ефективність процесу, ми скоротили час розробки з більш ніж року до декількох місяців. Це зробило великий вплив на продукт, який використовувався мільйонами, і сформувало мій підхід до оптимізації, зосереджуючись на швидкості, ефективності та мінімальних втратах якості. Це саме той настрій, який я привношу в ANNA сьогодні.

Ваші дослідження були представлені на CVPR та ECCV – які з них є найбільшими проривами в ефективності штучного інтелекту, яких ви найбільш горді?

Коли мене запитують про мої досягнення в ефективності штучного інтелекту, я завжди повертаюся до нашої статті, яка була вибрана для усного повідомлення на CVPR 2023. Бути обраним для усного повідомлення на такій конференції – це рідкість, оскільки тільки 12 статей обираються. Це додається до того факту, що генеративний штучний інтелект зазвичай домінує в центрі уваги, а наша стаття зайняла інший підхід, зосередившись на математичній стороні, зокрема аналізі та стисненні нейронних мереж.

Ми розробили метод, який допоміг нам зрозуміти, скільки параметрів нейронна мережа насправді потребує для ефективної роботи. Застосовуючи техніки з функціонального аналізу та переходячи від дискретної до безперервної формули, ми змогли досягти добрих результатів стиснення, зберігаючи при цьому можливість інтегрувати ці зміни назад у модель. Стаття також представила кілька нових алгоритмів, яких не використовувала спільнота, і знайшла подальше застосування.

Це була одна з моїх перших статей у сфері штучного інтелекту, і, що важливо, це був результат колективних зусиль нашої команди, включаючи моїх співзасновників. Це був значний рубіж для всіх нас.

Чи можете ви пояснити, як працюють Інтегральні Нейронні Мережі (INN) та чому вони є важливою інновацією в глибокому навчанні?

Традиційні нейронні мережі використовують фіксовані матриці, подібні до таблиць Excel, де розмір і параметри заздалегідь визначені. INN, однак, описують мережі як безперервні функції, пропонуючи значно більше гнучкості. Подумайте про це, як про ковдру з шпильками на різних висотах, і це представляє безперервну хвилю.

Що робить INN цікавими, так це їхня здатність динамічно “стискати” або “розширювати” залежно від доступних ресурсів, подібно до того, як аналоговий сигнал дискретизується в звук. Ви можете звузити мережу без втрати якості, і коли потрібно, розширити її назад без повторної навчальної.

Ми протестували це, і хоча традиційні методи стиснення призводять до значної втрати якості, INN зберігають якість, близьку до оригінальної, навіть під екстремальним стисненням. Математика за цим більш незвичайна для спільноти штучного інтелекту, але справжня цінність полягає в її здатності забезпечувати солідні, практичні результати з мінімальними зусиллями.

TheStage AI працював над алгоритмами квантового аналізу – як ви бачите роль квантових обчислень в оптимізації штучного інтелекту в найближчому майбутньому?

Коли мова йде про квантові обчислення та їхню роль в оптимізації штучного інтелекту, головний висновок полягає в тому, що квантові системи пропонують зовсім інший підхід до вирішення проблем, таких як оптимізація. Хоча ми не винайшли алгоритми квантового аналізу з нуля, компанії, такі як D-Wave, пропонують бібліотеки Python для побудови квантових алгоритмів конкретно для дискретних завдань оптимізації, які ідеально підходять для квантових комп’ютерів.

Ідея полягає в тому, що ми не завантажуємо нейронну мережу безпосередньо в квантовий комп’ютер. Це не можливо з поточною архітектурою. Замість цього ми апроксимуємо, як нейронні мережі поводяться під різними типами деградації, роблячи їх придатними для системи, яку квантовий чіп може обробити.

В майбутньому квантові системи могли б масштабувати та оптимізувати мережі з точністю, яку традиційні системи важко досягнути. Перевага квантових систем полягає в їхньому вбудованому паралелізмі, чого класичні системи можуть лише симулювати за допомогою додаткових ресурсів. Це означає, що квантові обчислення могли б значно прискорити процес оптимізації, особливо коли ми розберемся, як ефективно моделювати великі та складні мережі.

Справжній потенціал полягає в використанні квантових обчислень для вирішення масштабних та складних завдань оптимізації та розбиття параметрів на менші, більш керчні групи. З технологіями, такими як квантові та оптичні обчислення, існують величезні можливості для оптимізації штучного інтелекту, які далеко виходять за рамки того, що можуть традиційні обчислення.

Яка ваша довгострокова візія для TheStage AI? Куди ви бачите оптимізацію висновку в наступні 5-10 років?

В довгостроковій перспективі TheStage AI має на меті стати глобальним Хабом Моделей, де будь-хто може легко отримати доступ до оптимізованої нейронної мережі з бажаними характеристиками, незалежно від того, чи це смартфон, чи інша апаратура. Метою є пропозиція досвіду “перетягування та скидання”, де користувачі вводять свої параметри, а система автоматично генерує мережу. Якщо мережа ще не існує, вона буде створена автоматично за допомогою ANNA.

Наша мета – зробити нейронні мережі працювати безпосередньо на пристроях користувачів, скорочуючи витрати на 20-30 разів. В майбутньому це може майже повністю усунути витрати, оскільки пристрій користувача буде обробляти обчислення, а не покладатися на сервери в хмарі. Це, у поєднанні з досягненнями в стисненні моделей та апаратному прискоренні, могло б зробити розгортання штучного інтелекту значно більш ефективним.

Ми також плануємо інтегрувати нашу технологію з апаратними рішеннями, такими як сенсори, чіпи та робототехніка, для застосувань у галузях, таких як автономне водіння та робототехніка. Наприклад, ми плануємо побудувати камери штучного інтелекту, здатні функціонувати в будь-якому середовищі, незалежно від того, чи це космос, чи екстремальні умови, такі як темнота чи пил. Це зробило б штучний інтелект придатним для широкого спектра застосувань і дозволило б нам створювати спеціальні рішення для конкретної апаратури та випадків використання.

Дякую за велике інтерв’ю. Читачам, які бажають дізнатися більше, рекомендуємо відвідати TheStage AI.

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.