Interviews

Dr. Stavros Papadopoulos, Oprichter en CEO, TileDB – Interviewreeks

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

TileDB is de moderne database die alle gegevensmodaliteiten, code en berekeningen in één product integreert. TileDB is in mei 2017 uit MIT en Intel (INTC ) Labs voortgekomen.

Voor het oprichten van TileDB, Inc. in februari 2017, was Dr. Stavros Papadopoulos Senior Research Scientist bij het Intel Parallel Computing Lab en lid van het Intel Science and Technology Center voor Big Data bij MIT CSAIL gedurende drie jaar. Hij bracht ook ongeveer twee jaar door als Visiting Assistant Professor bij de afdeling Computer Science and Engineering van de Hong Kong University of Science and Technology (HKUST). Stavros behaalde zijn PhD in Computer Science aan HKUST onder supervisie van Prof. Dimitris Papadias en had een postdoc-fellow-positie aan de Chinese University of Hong Kong met Prof. Yufei Tao.

U was eerder Senior Research Scientist bij het Intel Parallel Computing Lab en lid van het Intel Science and Technology Center (ISTC) voor Big Data bij MIT CSAIL gedurende drie jaar. Kunt u enkele belangrijke hoogtepunten uit deze periode in uw leven delen?

Tijdens mijn tijd bij Intel Labs en MIT had ik de unieke kans om samen te werken met toonaangevende figuren in twee verschillende wetenschappelijke sectoren: high-performance computing (bij Intel) en databases (bij MIT). De kennis en expertise die ik verwierf, werden essentieel om mijn visie te vormen voor het creëren van een nieuw type databasesysteem, dat ik uiteindelijk als onderzoeksproject binnen ISTC ontwikkelde en uitbouwde tot wat TileDB is geworden.

Kunt u de visie achter TileDB uitleggen en hoe het de moderne databaselandscap wil revolutioneren?

De afgelopen jaren is er een enorme toename geweest in machine learning- en Generative AI-toepassingen die organisaties helpen betere beslissingen te nemen. Elke dag ontdekken organisaties nieuwe patronen in hun gegevens en gebruiken deze informatie om een concurrentievoordeel te behalen. Deze patronen ontstaan uit een steeds groter spectrum aan gegevensmodaliteiten die moeten worden ondergebracht en beheerd om te kunnen worden benut. Van traditionele tabelgegevens tot complexe gegevensbronnen zoals sociale berichten, e-mail, afbeeldingen, video’s en sensordata, is de mogelijkheid om betekenis uit gegevens te halen afhankelijk van gegevensanalyse in bulk. Naarmate gegevenstypen toenemen, wordt deze taak steeds moeilijker, waardoor een nieuwe soort database nodig is. Dit is precies waarom TileDB is gecreëerd.

Waarom is het cruciaal voor organisaties om hun gegevensinfrastructuur te prioriteren voordat ze geavanceerde analytics- en machine learning-capaciteiten ontwikkelen?

Midden in de drang om AI te omarmen, is er een kritische en vaak over het hoofd gezien feit: het succes van elke AI-initiatief is intrinsiek verbonden met de kwaliteit en prestaties van de onderliggende gegevensinfrastructuur.

Het probleem is dat complexe gegevens die niet van nature als tabellen worden weergegeven, worden beschouwd als “ongestructureerd” en worden meestal opgeslagen als platte bestanden in maatwerkgegevensformaten of beheerd door afzonderlijke, speciaal ontworpen databases. Datawetenschappers besteden enorm veel tijd aan het wringen van gegevens om ze te consolideren. Het wordt geschat dat 80-90 procent van de tijd van datawetenschappers wordt besteed aan het schoonmaken van hun gegevens en het voorbereiden ervan voor samenvoeging. Dat vertraagt de tijd tot het trainen van AI-algoritmen en het bereiken van predictieve capaciteiten. Bovendien betekent dit dat slechts 10-20 procent van de tijd van datawetenschappers wordt besteed aan het creëren van inzichten.

Wat zijn de veelvoorkomende valkuilen waar organisaties mee te maken krijgen wanneer ze meer focussen op AI- en ML-toepassingen ten koste van een robuuste database-infrastructuur?

Organisaties hebben de neiging om zich te focussen op glanzende nieuwe dingen. Large Language Models, vector-databases en generatieve AI-apps gebouwd op een gegevensinfrastructuur zijn huidige voorbeelden, ten koste van het aanpakken van de onderliggende gegevensinfrastructuur die essentieel is voor analytisch succes. Simpel gezegd, als uw organisatie dit doet, kunt u enorm veel tijd besteden aan het in elkaar zetten van uw gegevensinfrastructuur en vertragen of helemaal missen kansen om inzichten te verkrijgen.

Kunt u toelichten wat een database ‘adaptief’ maakt en waarom deze adaptiviteit essentieel is voor moderne data-analyse?

Een adaptieve database is een database die kan veranderen om alle gegevens – ongeacht de modaliteit – te accommoderen en ze samen in een geünificeerde manier op te slaan. Een adaptieve database brengt structuur aan in gegevens die anders als “ongestructureerd” worden beschouwd. Het wordt geschat dat 80 procent of meer van de wereldgegevens niet-tabulair is, of “ongestructureerd”, en dat de meeste AI/ML-modellen (inclusief LLM’s) worden getraind op dit type gegevens.

TileDB structureert gegevens in multidimensionale arrays. Hoe verbetert deze indeling de prestaties en kosten-efficiëntie in vergelijking met traditionele databases?

De fundamentale kracht van een multidimensionale array-database is dat deze kan veranderen om praktisch elke gegevensmodaliteit en toepassing te accommoderen. Een vector is bijvoorbeeld eenvoudigweg een één-dimensionale array. Door structuur aan te brengen in deze “ongestructureerde” gegevens, kunt u uw gegevensinfrastructuur consolideren, kosten aanzienlijk verlagen, silo’s elimineren, productiviteit verhogen en beveiliging verbeteren. Als compute-infrastructuur wordt gekoppeld aan de gegevensbeheer-infrastructuur, kunt u instant waarde uit uw gegevens halen.

Wat zijn enkele opvallende use cases waarin TileDB de gegevensbeheer- en analysepresetaties aanzienlijk heeft verbeterd?

De eerste TileDB-use case was de opslag, het beheer en de analyse van uitgebreide genoomgegevens, wat zeer moeilijk en duur is om te modelleren en op te slaan in een traditionele, tabelvormige database. We zagen fenomenale prestatieverbeteringen (in de orde van 100x sneller in veel gevallen dan andere databases en maatwerkoplossingen). Echter, ons multidimensionale array-model is universeel en kan andere gegevensmodaliteiten efficiënt vastleggen. Bijvoorbeeld, TileDB is uitstekend in het omgaan met biomedische beeldvorming, satellietbeelden, single-cell transcriptomics en puntwolkgegevens zoals LiDAR en SONAR.

TileDB biedt open-source tools voor interoperabiliteit. Hoe profiteren de wetenschappelijke en data science-gemeenschappen van een open source-benadering?

We zijn grote voorstanders van open source bij TileDB. De core-bibliotheek en de gegevensformaat-specificatie zijn beide open source. Bovendien zijn onze life sciences-aanbod, gebouwd op de core-array-bibliotheek, ook open source. Dit omvat TileDB-SOMA, een pakket voor efficiënte en schaalbare single-cell gegevensbeheer, dat is gebouwd in samenwerking met de Chan Zuckerberg Foundation en de CELLxGENE Discover Census – de grootste volledig gecuratede single-cell dataset ter wereld – aandrijft. Dit is ook open source en wordt gebruikt door academische instellingen en grote farmaceutische bedrijven over de hele wereld.

Wat ziet u als toekomstige trends in gegevensbeheer?

Naarmate gegevens rijker worden, worden AI-toepassingen slimmer. Large Language Models worden steeds krachtiger, maken gebruik van meerdere gegevensmodaliteiten en de integratie van deze LLM’s met diverse gegevenssets opent een nieuwe frontier in AI genaamd multimodale AI.

Praktisch gezien betekent multimodale AI dat gebruikers niet beperkt zijn tot één invoer- en uitvoertype en een model kunnen aanzetten met vrijwel elke invoer om vrijwel elk inhoudstype te genereren. We zien TileDB als de ideale database voor het ondersteunen van multimodale AI, gebouwd om elke nieuwe en verschillende soorten gegevens te ondersteunen die kunnen ontstaan.

Bedankt voor de geweldige review, lezers die meer willen leren, moeten TileDB bezoeken.

Antoine is een visionaire leider en medeoprichter van Unite.AI, gedreven door een onwankelbare passie voor het vormgeven en promoten van de toekomst van AI en robotica. Een serieondernemer, hij gelooft dat AI net zo disruptief voor de samenleving zal zijn als elektriciteit, en wordt vaak betrapt op het prijzen van de potentie van disruptieve technologieën en AGI.

Als een futurist, hij is toegewijd aan het onderzoeken van hoe deze innovaties onze wereld zullen vormgeven. Bovendien is hij de oprichter van Securities.io, een platform dat zich richt op het investeren in cutting-edge technologieën die de toekomst herdefiniëren en hele sectoren herschikken.