Entretiens

Dr. Stavros Papadopoulos, Fondateur et PDG, TileDB – Série d’entretiens

mm
Ajouter Unite.AI à vos sources préférées sur Google

TileDB est la base de données moderne qui intègre toutes les modalités de données, le code et le calcul dans un seul produit. TileDB a été créé à partir du MIT et des laboratoires Intel (INTC ) en mai 2017.

Auparavant, avant de fonder TileDB, Inc. en février 2017, le Dr Stavros Papadopoulos était chercheur principal au laboratoire de calcul parallèle d’Intel et membre du centre de science et de technologie Intel pour les grandes données au MIT CSAIL pendant trois ans. Il a également passé environ deux ans en tant que professeur assistant invité au département d’informatique et de génie de l’Université des sciences et de la technologie de Hong Kong (HKUST). Stavros a obtenu son doctorat en informatique à l’HKUST sous la supervision du professeur Dimitris Papadias et a occupé un poste de chercheur postdoctoral à l’Université chinoise de Hong Kong avec le professeur Yufei Tao.

Vous étiez précédemment chercheur principal au laboratoire de calcul parallèle d’Intel et membre du centre de science et de technologie Intel pour les grandes données au MIT CSAIL pendant trois ans. Pouvez-vous partager avec nous quelques points forts de cette période de votre vie ?

Pendant mon temps à Intel Labs et au MIT, j’ai eu l’opportunité unique de collaborer avec des personnalités éminentes de deux secteurs scientifiques différents : le calcul haute performance (chez Intel) et les bases de données (au MIT). Les connaissances et l’expertise que j’ai acquises sont devenues essentielles pour façonner ma vision de créer un nouveau type de système de base de données, que j’ai finalement construit comme un projet de recherche au sein de l’ISTC et qui est devenu TileDB.

Pouvez-vous expliquer la vision derrière TileDB et comment elle vise à révolutionner le paysage des bases de données modernes ?

Au cours des dernières années, il y a eu une prise en main massive des applications d’apprentissage automatique et d’IA générative qui aident les organisations à prendre de meilleures décisions. Chaque jour, les organisations découvrent de nouveaux modèles dans leurs données et utilisent ensuite ces informations pour obtenir un avantage concurrentiel. Ces modèles émergent d’un spectre de données de plus en plus large qui doivent être hébergées et gérées pour être exploitables. Des données tabulaires traditionnelles à des sources de données plus complexes telles que les publications sur les réseaux sociaux, les e-mails, les images, les vidéos et les données de capteurs, la capacité à dériver un sens des données nécessite une analyse globale. À mesure que les types de données augmentent, cette tâche devient de plus en plus ardue, exigeant un nouveau type de base de données. C’est exactement pourquoi TileDB a été créé.

Pourquoi est-il crucial pour les organisations de donner la priorité à leur infrastructure de données avant de développer des capacités d’analyse avancées et d’apprentissage automatique ?

Au milieu de l’enthousiasme pour adopter l’IA, il y a une vérité critique et souvent négligée – le succès de toute initiative d’IA est intrinsèquement lié à la qualité et aux performances de l’infrastructure de données sous-jacente.

Le problème est que les données complexes qui ne sont pas naturellement représentées sous forme de tableaux sont considérées comme « non structurées » et sont généralement stockées sous forme de fichiers plats dans des formats de données personnalisés ou gérées par des bases de données spécialisées et distinctes. Les data scientists passent énormément de temps à manipuler les données pour les consolider. On estime que 80-90 pour cent du temps des data scientists est consacré au nettoyage de leurs données et à leur préparation pour les fusionner. Cela ralentit le temps nécessaire pour former les algorithmes d’IA et atteindre les capacités prédictives. De plus, cela signifie que seulement 10-20 pour cent du temps des data scientists est consacré à la création d’informations.

Quels sont les pièges courants que les organisations rencontrent lorsqu’elles se concentrent davantage sur les applications d’IA et d’apprentissage automatique au détriment d’une infrastructure de base de données robuste ?

Les organisations ont tendance à se concentrer sur les choses brillantes. Les grands modèles de langage, les bases de données vectorielles et les applications d’IA générative construites sur une infrastructure de données sont des exemples actuels, au détriment de la résolution de l’infrastructure de données sous-jacente qui est cruciale pour le succès analytique. Simplement dit, si votre organisation fait cela, vous risquez de passer une quantité considérable de temps à bricoler votre infrastructure de données et à retarder ou à manquer complètement des opportunités pour obtenir des informations.

Pouvez-vous élaborer sur ce qui fait qu’une base de données est « adaptable » et pourquoi cette adaptabilité est essentielle pour l’analyse de données moderne ?

Une base de données adaptable est celle qui peut se métamorphoser pour accueillir toutes les données – quelle que soit leur modalité – et les stocker ensemble de manière unifiée. Une base de données adaptable apporte une structure aux données qui sont autrement considérées comme « non structurées ». On estime que 80 pour cent ou plus des données du monde sont non tabulaires, ou non structurées, et que la plupart des modèles d’IA/ML (y compris les LLM) sont formés sur ce type de données.

TileDB structure les données en tableaux multidimensionnels. Comment ce format améliore-t-il les performances et l’efficacité coût-efficacité par rapport aux bases de données traditionnelles ?

La force fondamentale d’une base de données de tableau multidimensionnel est qu’elle peut se transformer pour accueillir pratiquement n’importe quelle modalité de données et application. Un vecteur, par exemple, n’est qu’un tableau à une dimension. En apportant une structure à ces données « non structurées », vous pouvez consolider votre infrastructure de données, réduire considérablement les coûts, éliminer les silos, augmenter la productivité et améliorer la sécurité. En allant plus loin, lorsque l’infrastructure de calcul est couplée à l’infrastructure de gestion des données, vous pouvez extraire instantanément de la valeur de vos données.

Quels sont quelques cas d’utilisation notables où TileDB a considérablement amélioré la gestion et les performances des analyses de données ?

Le premier cas d’utilisation de TileDB était le stockage, la gestion et l’analyse de vastes données génomiques, qui sont très difficiles et coûteuses à modéliser et à stocker dans une base de données tabulaire traditionnelle. Nous avons observé des gains de performances phénoménaux (dans l’ordre de 100 fois plus rapide dans de nombreux cas par rapport à d’autres bases de données et solutions personnalisées). Cependant, notre modèle de tableau multidimensionnel est universel et peut capturer efficacement d’autres modalités de données. Par exemple, TileDB est excellent pour gérer l’imagerie biomédicale, l’imagerie par satellite, la transcriptomique à cellule unique et les données de nuage de points telles que LiDAR et SONAR.

TileDB propose des outils open source pour l’interopérabilité. Comment une approche open source profite-t-elle aux communautés scientifiques et de data science ?

Nous sommes de grands partisans de l’open source chez TileDB. La bibliothèque principale et la spécification de format de données sont toutes deux open source. De plus, nos offres de sciences de la vie, construites sur la bibliothèque de tableaux de base, sont également open source. Cela inclut TileDB-SOMA, un package pour la gestion efficace et scalable des données à cellule unique, qui a été construit en collaboration avec la Fondation Chan Zuckerberg et alimente le CELLxGENE Discover Census – la plus grande base de données de cellules uniques entièrement annotée au monde. Cela est également open source et est utilisé par des institutions universitaires et des entreprises pharmaceutiques majeures dans le monde entier.

Quels sont les tendances futures que vous voyez dans la gestion des données ?

À mesure que les données deviennent plus riches, les applications d’IA deviennent plus intelligentes. Les grands modèles de langage sont de plus en plus puissants, en exploitant plusieurs modalités de données, et l’intégration de ces LLM avec divers ensembles de données ouvre un nouveau front dans l’IA connu sous le nom d’IA multimodale.

Pratiquement parlant, l’IA multimodale signifie que les utilisateurs ne sont pas limités à un seul type d’entrée et de sortie et peuvent solliciter un modèle avec pratiquement n’importe quelle entrée pour générer virtuellement n’importe quel type de contenu. Nous voyons TileDB comme la base de données idéale pour supporter l’IA multimodale, conçue pour supporter n’importe quel nouveau type de données qui pourrait émerger.

Merci pour cette grande revue, les lecteurs qui souhaitent en savoir plus peuvent visiter TileDB.

Antoine est un leader visionnaire et associé fondateur d'Unite.AI, animé par une passion inébranlable pour façonner et promouvoir l'avenir de l'IA et de la robotique. Un entrepreneur en série, il croit que l'IA sera aussi perturbatrice pour la société que l'électricité, et se fait souvent prendre en train de vanter le potentiel des technologies perturbatrices et de l'AGI.

En tant que futuriste, il se consacre à explorer comment ces innovations vont façonner notre monde. En outre, il est le fondateur de Securities.io, une plateforme axée sur l'investissement dans les technologies de pointe qui redéfinissent l'avenir et remodelent des secteurs entiers.