Інтерв’ю

Джеронімо Де Леон, Старший менеджер продукту штучного інтелекту в Backblaze – Серія інтерв’ю

mm
Додайте Unite.AI до бажаних джерел у Google

Джеронімо Де Леон – досвідчений лідер у сфері управління продуктами з більш ніж 10-річним досвідом у сфері штучного інтелекту в корпоративних та стартап- середовищах. Наразі він обіймає посаду Старшого менеджера продукту штучного інтелекту в компанії Backblaze, де очолює розробку функцій штучного інтелекту/ машинного навчання, зосереджується на тому, як Backblaze покращує життєвий цикл даних штучного інтелекту для архітектур MLOps клієнтів, та реалізує інструменти та агенти штучного інтелекту для оптимізації внутрішніх операцій.

Backblaze – це хмарне сховище та компанія резервного копіювання, яка надає необмежені автоматичні резервні копії комп’ютерів для окремих осіб та підприємств, а також масштабовані рішення для сховища об’єктів для корпоративних, медіа- та застосункових навантажень. Її послуги зосереджені на доступності, безпеці даних, легкій відновлюваності та безперебійній сумісності з існуючими системами.

Ви маєте понад десятирічний досвід у сфері управління продуктами, пов’язаними зі штучним інтелектом – від роботи з великими мовними моделями в Intelas та RAG у Welcome.AI до запуску чат-бота Bloomberg та зараз керування зусиллями штучного інтелекту в Backblaze. Як ці досвіди сформували ваше бачення ролі хмарного сховища у масштабуванні робочих процесів штучного інтелекту/ машинного навчання?

Від початку роботи над проектами штучного інтелекту в IBM Watson, я бачу, як темп інновацій драматично прискорився. Що раніше займало роки, щоб перейти від дослідження до виробництва, тепер відбувається за місяці. Однак фундаментальні інфраструктурні проблеми залишаються тими ж: де знаходяться дані, де ми їх зберігаємо та як до них доступ ourselves?

Раніше обмеження були обчислювальними потужностями та моделями, але тепер у нас є надлишок попередньо натренованих моделей, і є багато постачальників обчислювальних потужностей. Однак, коли ми починали проект раніше, нам зазвичай доводилося починати з проекту збору та обробки даних, це все ще так і сьогодні. Постійно бачу, як організації натрапляють на ту ж саму瓶 cổ в консолідації даних з різних джерел. Організації, які успішно розв’язують цю проблему, створюють основу, яка масштабується з їхньою зрілістю штучного інтелекту. Ваша архітектура сховища визначає, як швидко ви можете перейти до навчання моделей та інновацій.

Де ви бачите хмарне сховище, яке грає найкритичнішу роль у життєвому циклі штучного інтелекту – від прийому та обробки даних до навчання, тонкої настройки, висновку та моніторингу?

Хмарне сховище є критичним на всіх етапах життєвого циклу штучного інтелекту, з ключовими етапами у зборі, обробці, навчанні та висновку. На початку систематичне консолідація, каталогізація та забезпечення безпеки архівів прискорює початок нових проектів та полегшує тестування нових моделей. Чисті, добре оброблені дані часто перемагають наявність великої кількості даних, що робить сховище центральним як для якості, так і для масштабу. Одне з моїх улюблених висловів Backblaze – “Це не накопичення, якщо це дані”. Ви ніколи не знаєте, наскільки цінними вони можуть бути, тому організації повинні зібрати якомога більше даних. Під час навчання масштабоване сховище забезпечує пропускну здатність великих наборів даних, а під час висновку захоплення вихідних даних прогнозів та зворотного зв’язку користувачів дозволяє безперервну ітерацію. В кінцевому підсумку сховище є основою, яка визначає, як швидко ви можете інноваційно використовувати штучний інтелект.

Які найбільші перешкоди, з якими організації стикаються при масштабуванні сховища для штучного інтелекту, і як ці перешкоди відрізняються між меншими стартапами та великими підприємствами?

Найбільші перешкоди при масштабуванні сховища для штучного інтелекту – це вартість, управління даними та доступність. Зберігання великих обсягів даних – це лише частина проблеми; воно також повинно бути організовано, доступно та керовано з правильними засобами контролю. Чисті, добре структуровані дані часто є більш цінними, ніж просто наявність великої кількості даних.

Для стартапів першим викликом є отримання достатньої кількості даних для навчання та уточнення їхніх моделей. Як тільки вони це мають, вартість та архітектура стають наступними бар’єрами.

Для великих підприємств викликом є складність. Їхні дані є численними, але фрагментованими по сховищах, спадкових системах та режимах відповідності, що робить консолідацію та доступність складною.

Організації, які успішно розв’язують цю проблему, розглядають сховище як стратегічний засіб, який масштабується за вартістю, продуктивністю та доступністю разом з їхньою зрілістю штучного інтелекту.

Серед вартості, затримки, безпеки та відповідності, яку ви бачите як найбільш гостру перешкоду для масштабування штучного інтелекту сьогодні, і як організації повинні пріоритезувати розв’язання цієї проблеми?

Серед вартості, затримки, безпеки та відповідності затримка є однією з найбільш гострих перешкод. Вона безпосередньо впливає на навчання моделей та висновок, а висновок, зокрема, формує досвід користувача. Організації роблять усе можливе, щоб зменшити затримку на цьому етапі, оскільки затримки у наданні прогнозів можуть підірвати прийняття.

Вартість залишається постійним викликом, оскільки обсяги даних зростають, а відповідність стає більш критичною, оскільки організації зростають, особливо у галузях, що підлягають регулюванню. Стартапи часто зосереджуються спочатку на вартості та затримці, тоді як підприємства повинні балансувати затримку з вимогами управління та регулювання.

Пріоритетом повинно бути створення сховища, яке мінімізує затримку для навчання та висновку, залишаючись при цьому ефективним за вартістю та відповідним під час розширення прийняття штучного інтелекту.

Для підприємств, які підкреслюють необхідність гнучкості та легкого доступу до даних для стимулювання інновацій штучного інтелекту, що таке справжня гнучкість у доступі до даних з вашої точки зору, і чому це так важливо?

У своїй недавній доповіді я підкреслив ідею розумного архівування. Справжня гнучкість у доступі до даних починається з централізації інформації у структурованому, пошуковому архіві. Це означає уніфікацію різних форматів, нормалізацію та тегування для узгодженості, а також забезпечення індексації для майбутніх запитів. Цій підхід забезпечує, що дані не тільки зберігаються, а й робляться корисними.

Це важливо, оскільки воно закладає основу для аналізу та моделювання. Коли дані структуровані та пошукові, команди можуть рухатися швидше, експериментувати більш вільно та зменшувати затримку як у навчанні, так і у висновку. Без такого роду гнучкості сховище швидко стає瓶 cổ замість засобу для інновацій штучного інтелекту.

Чи можете ви поділитися реальними випадками – такими, як з клієнтами Decart AI або Wynd Labs – які демонструють, як правильний підхід до хмарного сховища може безпосередньо дозволити інновації штучного інтелекту?

Це два великих приклади того, як правильний підхід до хмарного сховища безпосередньо дозволяє інновації штучного інтелекту. Decart зосередився на навчанні моделей, де ефективне переміщення даних до обчислювальних ресурсів було критичним. З допомогою Backblaze B2 вони масштабувалися до 16 ПБ за 90 днів, навчалися на декількох кластерах GPU без витрат на виведення даних та досягли ефективності в 10 разів більше, ніж у конкурентів. Ця надійність та ефективність дозволили їм інноваційно рухатися швидше.

Wynd Labs зосередився на доступі клієнтів до даних. Вони приймають петабайти даних щодня та обслуговують десятки петабайт щомісяця. З допомогою високопродуктивного сховища Backblaze та безкоштовного виведення даних вони могли масштабуватися до корпоративного попиту та reinvestувати ресурси у розвиток продукту. Ця можливість надавати доступ до даних у масштабі розблокувала нові можливості для їхньої платформи.

У обидніх випадках правильна стратегія сховища перетворила інфраструктуру з обмеження на засіб, який дозволяє інноваційно рухатися, дозволяючи компаніям зосередитися на інноваціях штучного інтелекту, а не на управлінні вартістю та складністю.

Як моделі та набори даних штучного інтелекту стають все більш складними, яку пораду ви дали б організаціям, які намагаються балансувати продуктивність сховища з ефективністю вартості?

Організації повинні думати про свій довгостроковий використання даних з урахуванням їхнього продукту. Збір, обробка, переміщення та виконання висновків щодо даних будуть усією основою того, як їхній продукт розвиватиметься. Якщо вони не врахують це зараз, витрати та проблеми сховища тільки збільшаться з часом. Оскільки штучний інтелект буде центральною частиною їхнього продукту та організації, сховище повинно бути спроектовано з самого початку, щоб балансувати продуктивність з ефективністю вартості, щоб воно могло масштабуватися гладко, коли вони зростатимуть.

Безпека та відповідність особливо важливі у галузях, що підлягають регулюванню. Як ви бачите еволюцію хмарного сховища для підтримки потреб з управлінням, одночасно дозволяючи командам інноваційно рухатися?

Управління є ключовою частиною сховища. Упрощення доступу з міцною основою для того, як дані керуються, захищаються та аудитуються, є критичним. Я бачу, як хмарне сховище еволюціонує з більш сильними вбудованими засобами контролю, такими як шифрування за замовчуванням, тонкі дозволи, аудиторські сліди та варіанти резиденції даних. Не менш важливим є лінія даних. У штучному інтелекті знання того, звідки походять дані, як вони були оброблені та як вони впливають на моделі, є важливим як для відповідності, так і для довіри.

Одночасно з цим платформи сховища покращують зручність використання, щоб команди могли рухатися швидко. Коли управління, лінія даних та доступність працюють разом, організації можуть відповідати нормативним вимогам, продовжуючи інноваційно рухатися з штучним інтелектом на швидкості.

Для організацій, які оцінюють або мігрують до B2, яку пораду або рекомендацію ви надаєте щодо реалізації – зокрема щодо міграції даних, інтеграції з існуючими стеками MLOps або обчислювальними засобами, або оптимізації для пропускної здатності та виведення?

Оскільки B2 є сумісним з S3, воно інтегрується безпосередньо в існуючі стеки MLOps та обчислювальні засоби без зміни архітектури. Ми часто працюємо з клієнтами над доказом концепції для підтвердження міграції, продуктивності та інтеграції перед масштабуванням. Відтоді увага зосереджується на оптимізації пропускної здатності, переміщення даних та оркеструванні даних, щоб команди могли навчатися на кластерах, виконувати висновок та ітеруватися швидко без сповільнення інфраструктурними瓶 cổ.

Як штучний інтелект продовжує зростати – особливо з трендами навколо великих мовних моделей, наборів даних у масштабі ексабайтів та гібридних або мультихмарних стратегій – як Backblaze еволюціонує свої пропозиції сховища, щоб задовольнити ці нові потреби?

У Backblaze ми зосереджені не тільки на тому, як дані використовуються сьогодні, а й на тому, як вони будуть оркестровані в майбутньому. Сховище вже не тільки архів, а стає інструментом, який дозволяє швидкий доступ, ефективне переміщення та надійне оркестрування даних у середовищах. З великими мовними моделями та наборами даних у масштабі ексабайтів ця основа легкого доступу та високої пропускної здатності буде критичною не тільки для навчання та висновку, а й для нового класу агентів штучного інтелекту, які покладаються на дані для автоматизації процесів. Результатом є основа сховища, яка дозволяє інновації зараз і готує організації до того, що прийде далі.

Дякую за велике інтерв’ю, читачам, які бажають дізнатися більше, слід відвідати Backblaze

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.