Інтерв’ю
Доктор Ставрос Пападопулос, засновник і генеральний директор TileDB – Інтерв’ю

TileDB – це сучасна база даних, яка інтегрує всі модальності даних, код і обчислення в одному продукті. TileDB була створена в травні 2017 року в результаті співпраці між MIT і Intel (INTC ) Labs.
До заснування TileDB, Inc. у лютому 2017 року доктор Ставрос Пападопулос був старшим науковим співробітником в Intel Parallel Computing Lab та членом Intel Science and Technology Center for Big Data в MIT CSAIL протягом трьох років. Він також провів близько двох років як запрошений асистент-професор на кафедрі комп’ютерних наук і техніки Гонконзького університету науки і технологій (HKUST). Ставрос отримав ступінь доктора філософії з комп’ютерних наук в HKUST під керівництвом професора Дімітріса Пападіаса, а також займав посаду постдокторанта в Китайському університеті Гонконгу під керівництвом професора Юфея Тао.
Ви раніше були старшим науковим співробітником в Intel Parallel Computing Lab, і членом Intel Science and Technology Center (ISTC) для Big Data в MIT CSAIL протягом трьох років. Чи можете Ви поділитися з нами деякими ключовими моментами з цього періоду Вашого життя?
Під час моєї роботи в Intel Labs і MIT, я мав унікальну можливість співпрацювати з відомими вченими в двох різних наукових галузях: високопродуктивні обчислення (в Intel) і бази даних (в MIT). Знання і досвід, які я здобув, стали ключовими у формуванні моєї бачення створення нового типу бази даних, яку я згодом створив як дослідницький проєкт в рамках ISTC і виокремив у те, що стало TileDB.
Чи можете Ви пояснити бачення, яке лежить в основі TileDB, і як воно має революціонізувати сучасний ландшафт баз даних?
За останні кілька років відбувся величезний зріст використання машинного навчання та генеративних моделей AI, які допомагають організаціям приймати кращі рішення. Кожного дня організації відкривають нові закономірності в своїх даних, а потім використовують цю інформацію, щоб досягти конкурентної переваги. Ці закономірності виникають з все зростального спектру модальностей даних, які повинні бути розміщені та керовані, щоб бути використаними. Від традиційних таблиць до більш складних джерел даних, таких як соціальні пости, електронна пошта, зображення, відео та дані з датчиків, можливість вивести значення з даних вимагає аналізу в агрегаті. По мірі зростання кількості типів даних ця задача стає все більш трудомісткою, вимагаючи нового типу бази даних. Саме тому була створена TileDB.
Чому організації повинні пріоритетно займатися своєю інфраструктурою даних перед розробкою передових аналітичних і машинних можливостей?
Серед ентузіазму щодо прийняття AI є критична і часто непомічена істина – успіх будь-якої ініціативи AI тісно пов’язаний з якістю та продуктивністю базової інфраструктури даних.
Проблема полягає в тому, що складні дані, які не представлені у вигляді таблиць, вважаються “неструктурованими” і зазвичай або зберігаються як плоскі файли в спеціалізованих форматах даних, або керуються окремими, спеціально розробленими базами даних. Спеціалісти з даних витрачають величезну кількість часу на обробку даних, щоб консолідувати їх. За оцінками, 80-90 відсотків часу спеціалістів з даних витрачається на очистку даних і підготовку їх до злиття. Це сповільнює час підготовки алгоритмів машинного навчання та отримання прогностичних можливостей. Крім того, це означає, що лише 10-20 відсотків часу спеціалістів з даних витрачається на створення інсайтів.
Які спільні помилки організації допускають, коли вони фокусуються більше на додатках AI і ML за рахунок надійної інфраструктури баз даних?
Організації схильні фокусуватися на нових технологіях. Великі мовні моделі, векторні бази даних та генеративні додатки AI, побудовані на основі інфраструктури даних, є поточними прикладами, за рахунок чого не звертають увагу на базову інфраструктуру даних, яка є критичною для аналітичного успіху. Просто кажучи, якщо ваша організація робить це, ви можете витратити величезну кількість часу на складання своєї інфраструктури даних і затримати або зовсім пропустити можливості для отримання інсайтів.
Чи можете Ви роз’яснити, що робить базу даних “адаптивною” і чому ця адаптивність є важливою для сучасної аналітики даних?
Адаптивна база даних – це така, яка може змінювати свою форму, щоб розміщувати всі дані – незалежно від їх модальності – і зберігати їх разом у єдиному вигляді. Адаптивна база даних надає структуру даним, які інакше вважаються “неструктурованими”. За оцінками, 80 відсотків або більше світових даних є нетабличними, або неструктурованими, і більшість моделей AI/ML (включаючи LLM) тренуються на цьому типі даних.
TileDB структурує дані у багатовимірних масивах. Як цей формат покращує продуктивність і ефективність порівняно з традиційними базами даних?
Основна сила багатовимірної бази даних масивів полягає в тому, що вона може змінювати свою форму, щоб розміщувати практично будь-який тип даних і застосунку. Вектор, наприклад, є просто одновимірним масивом. Надавши структуру цьому “неструктурованому” даному, ви можете консолідувати свою інфраструктуру даних, суттєво зменшити витрати, ліквідувати сховища, збільшити продуктивність та покращити безпеку. Крім того, коли інфраструктура обчислень поєднується з інфраструктурою керування даними, ви можете витягнути миттєву цінність з ваших даних.
Які деякі відомі випадки використання TileDB, які суттєво покращили керування даними та аналітику?
Перший випадок використання TileDB був пов’язаний з зберіганням, керуванням та аналізом величезних геномних даних, які дуже складно і дорого моделювати та зберігати в традиційній табличній базі даних. Ми спостерігали феноменальні підвищення продуктивності (в порядку 100 разів швидше в багатьох випадках порівняно з іншими базами даних та спеціалізованими рішеннями). Однак наша багатовимірна модель масиву є універсальною і може ефективно обробляти інші модальності даних. Наприклад, TileDB є чудовим інструментом для обробки біомедичних зображень, супутникових зображень, транскриптоміки окремих клітин та даних з лідару та сонару.
TileDB пропонує відкриті інструменти для взаємодії. Як підхід відкритого джерела вигідно впливає на наукові та дані спільноти?
Ми є великими прихильниками відкритого джерела в TileDB. Основна бібліотека та специфікація формату даних є відкритими. Крім того, наші пропозиції для життєвих наук, побудовані на основі основної бібліотеки масивів, також є відкритими. Це включає TileDB-SOMA, пакет для ефективного та масштабованого керування даними окремих клітин, який був створений у співпраці з фундацією Чана Цукерберга та підтримує CELLxGENE Discover Census – найбільшу у світі повністю кураторську базу даних окремих клітин. Це також є відкритим джерелом і використовується академічними закладами та великими фармацевтичними компаніями по всьому світу.
Які майбутні тенденції керування даними Ви бачите?
По мірі того, як дані стають багатшими, додатки AI стають розумнішими. Великі мовні моделі стають все більш потужними, використовуючи кілька модальностей даних, а інтеграція цих моделей з різними наборами даних відкриває новий фронтір у галузі AI, відомий як багатомодальна AI.
Практично кажучи, багатомодальна AI означає, що користувачі не обмежені одним типом вводу та одного типу виводу та можуть ініціювати модель практично будь-яким типом вводу, щоб генерувати практично будь-який тип вмісту. Ми бачимо TileDB як ідеальну базу даних для підтримки багатомодальної AI, побудованої для підтримки будь-яких нових та різних типів даних, які можуть з’явитися.
Дякуємо за чудовий огляд, читачам, які бажають дізнатися більше, слід відвідати TileDB.












