Интервью
Доктор Ставрос Пападопулос, Основатель и Генеральный Директор TileDB – Интервью

TileDB – это современная база данных, которая интегрирует все модальности данных, код и вычисления в одном продукте. TileDB была создана в мае 2017 года на основе технологий MIT и Intel (INTC ) Labs.
До основания TileDB, Inc. в феврале 2017 года доктор Ставрос Пападопулос был старшим исследователем в Intel Parallel Computing Lab и членом Intel Science and Technology Center for Big Data в MIT CSAIL в течение трех лет. Он также провел около двух лет в качестве приглашенного профессора на кафедре компьютерных наук и инженерии Гонконгского университета науки и технологий (HKUST). Ставрос получил степень доктора философии в области компьютерных наук в HKUST под руководством профессора Димитриса Пападиаса и занимал должность постдокторанта в Китайском университете Гонконга с профессором Юфей ТAO.
Вы ранее были старшим исследователем в Intel Parallel Computing Lab и членом Intel Science and Technology Center (ISTC) для Big Data в MIT CSAIL в течение трех лет. Можете ли вы поделиться с нами некоторыми ключевыми моментами из этого периода вашей жизни?
Во время моего пребывания в Intel Labs и MIT у меня была уникальная возможность сотрудничать с известными учеными в двух разных научных областях: высокопроизводительных вычислениях (в Intel) и базах данных (в MIT). Знания и опыт, которые я получил, стали ключевыми в формировании моего видения создания нового типа базы данных, который я в конечном итоге построил как исследовательский проект в ISTC и выделил в то, что стало TileDB.
Можете ли вы объяснить свое видение TileDB и то, как она стремится революционизировать современный ландшафт баз данных?
За последние несколько лет наблюдается огромный рост интереса к приложениям машинного обучения и генеративного ИИ, которые помогают организациям принимать лучшие решения. Каждый день организации открывают новые закономерности в своих данных и используют эту информацию для получения конкурентного преимущества. Эти закономерности возникают из все более широкого спектра модальностей данных, которые должны быть размещены и управляемы для их использования. От традиционных табличных данных до более сложных источников данных, таких как социальные посты, электронная почта, изображения, видео и данные с датчиков, возможность извлечения смысла из данных требует анализа в совокупности. По мере увеличения количества типов данных эта задача становится все более трудной, требуя нового типа базы данных. Именно поэтому была создана TileDB.
Почему важно, чтобы организации отдали приоритет своей инфраструктуре данных перед развитием передовых аналитических и машинных возможностей?
Среди энтузиазма по принятию ИИ есть критический и часто упускаемый из виду факт – успех любой инициативы ИИ тесно связан с качеством и производительностью основной инфраструктуры данных.
Проблема заключается в том, что сложные данные, которые не представлены в виде таблиц, считаются “неструктурированными” и обычно либо хранятся как плоские файлы в специальных форматах данных, либо управляются отдельными, специально созданными базами данных. Ученые-исследователи тратят огромное количество времени на обработку данных, чтобы консолидировать их. Оценивается, что 80-90 процентов времени ученых-исследователей тратится на очистку данных и подготовку их для объединения. Это замедляет время обучения алгоритмов ИИ и достижения прогностических возможностей. Кроме того, это означает, что только 10-20 процентов времени ученых-исследователей тратится на создание выводов.
Какие общие ловушки организации сталкиваются, когда они фокусируются на приложениях ИИ и МО более, чем на прочной базе данных?
Организации склонны фокусироваться на новых блестящих вещах. Большие языковые модели, векторные базы данных и генеративные приложения ИИ, построенные на основе инфраструктуры данных, являются текущими примерами, за счет решения основной инфраструктуры данных, которая имеет решающее значение для аналитического успеха. Просто говоря, если ваша организация делает это, вы можете тратить непомерное количество времени на сборку своей инфраструктуры данных и задерживать или вообще упускать возможности для получения выводов.
Можете ли вы подробнее рассказать о том, что делает базу данных “адаптивной” и почему эта адаптивность необходима для современной аналитики данных?
Адаптивная база данных – это та, которая может менять форму, чтобы вместить все данные – независимо от их модальности – и хранить их вместе в унифицированном виде. Адаптивная база данных придает структуру данным, которые в противном случае считаются “неструктурированными”. Оценивается, что 80 процентов или более мировых данных являются нетабличными, или неструктурированными, и большинство моделей ИИ/МО (включая БЯМ) обучаются на этом типе данных.
TileDB структурирует данные в многомерных массивах. Как этот формат улучшает производительность и экономическую эффективность по сравнению с традиционными базами данных?
Основная сила многомерной базы данных массивов заключается в том, что она может менять форму, чтобы вместить практически любую модальность данных и приложение. Вектор, например, является просто одномерным массивом. Придавая структуру этому “неструктурированному” данным, вы можете консолидировать свою инфраструктуру данных, значительно сократить затраты, устранить изоляцию, повысить производительность и повысить безопасность. Далее, когда вычислительная инфраструктура объединяется с инфраструктурой управления данными, вы можете извлечь мгновенную ценность из своих данных.
Можете ли вы привести некоторые заметные примеры использования TileDB, которые значительно улучшили управление данными и производительность аналитики?
Первым случаем использования TileDB было хранение, управление и анализ огромных геномных данных, которые очень трудно и дорого моделировать и хранить в традиционной табличной базе данных. Мы наблюдали феноменальные показатели производительности (в порядке 100 раз быстрее в многих случаях над другими базами данных и специальными решениями). Однако наша модель многомерного массива является универсальной и может эффективно захватывать другие модальности данных. Например, TileDB отлично подходит для обработки биомедицинских изображений, спутниковых изображений, транскриптомики отдельных клеток и данных точечных облаков, таких как LiDAR и SONAR.
TileDB предлагает открытое программное обеспечение для обеспечения совместимости. Как подход открытого источника выгоден для научного и аналитического сообществ?
Мы являемся сторонниками открытого программного обеспечения в TileDB. Основная библиотека и спецификация формата данных являются открытыми. Кроме того, наши предложения в области наук о жизни, построенные на основе основной библиотеки массивов, также являются открытыми. Это включает в себя TileDB-SOMA, пакет для эффективного и масштабируемого управления данными отдельных клеток, который был создан в сотрудничестве с Фондом Чана Цукерберга и поддерживает CELLxGENE Discover Census – самую большую в мире полностью курированную базу данных отдельных клеток. Это также является открытым и используется академическими учреждениями и крупными фармацевтическими компаниями по всему миру.
Что вы видите как будущие тенденции в управлении данными?
По мере того, как данные становятся богаче, приложения ИИ становятся умнее. Большие языковые модели становятся все более и более мощными, используя несколько модальностей данных, и интеграция этих моделей с различными наборами данных открывает новую границу в ИИ, известную как многомодальный ИИ.
Практически говоря, многомодальный ИИ означает, что пользователи не ограничены одним входом и одним типом выхода и могут запрашивать модель с практически любым входом, чтобы сгенерировать практически любой тип контента. Мы видим TileDB как идеальную базу данных для поддержки многомодального ИИ, построенную для поддержки любых новых и различных типов данных, которые могут появиться.
Благодарим за отличный обзор, читатели, которые хотят узнать больше, должны посетить TileDB.












