Intervjuer
Dr. Stavros Papadopoulos, Grunnlegger og Administrerende Direktør, TileDB – Intervju-serie

TileDB er den moderne databasen som integrerer alle data-modus, kode og beregning i ett enkelt produkt. TileDB ble spunnet ut fra MIT og Intel (INTC ) Labs i mai 2017.
Før han grunnla TileDB, Inc. i februar 2017, var Dr. Stavros Papadopoulos Senior Research Scientist ved Intel Parallel Computing Lab, og medlem av Intel Science and Technology Center for Big Data ved MIT CSAIL i tre år. Han tilbrakte også omtrent to år som Visiting Assistant Professor ved Department of Computer Science and Engineering ved Hong Kong University of Science and Technology (HKUST). Stavros mottok sin PhD-grad i datavitenskap ved HKUST under veiledning av Prof. Dimitris Papadias, og hadde en postdoktor-stilling ved Chinese University of Hong Kong med Prof. Yufei Tao.
Du var tidligere Senior Research Scientist ved Intel Parallel Computing Lab, og medlem av Intel Science and Technology Center (ISTC) for Big Data ved MIT CSAIL i tre år. Kan du dele noen nøkkelhøydepunkter fra denne perioden i ditt liv?
Under min tid ved Intel Labs og MIT, hadde jeg den unike muligheten til å samarbeide med fremtredende personer i to forskjellige vitenskapelige sektorer: høy-ytelses databehandling (ved Intel) og databaser (ved MIT). Kunnskapen og ekspertisen jeg tilegnet meg, ble avgjørende for å forme min visjon om å skape et nytt type database-system, som jeg til slutt bygget som et forskningsprosjekt innen ISTC og spunnet ut til det som ble TileDB.
Kan du forklare visjonen bak TileDB og hvordan det har som mål å revolusjonere det moderne database-landskapet?
De siste årene har det vært en enorm økning i maskinlæring og Generativ AI-applikasjoner som hjelper organisasjoner med å ta bedre beslutninger. Hver dag oppdager organisasjoner nye mønster i deres data, og så bruker denne informasjonen for å oppnå en konkurransefordel. Disse mønstrene oppstår fra en stadig voksende spekter av data-modus, som må huskes og håndteres for å kunne utnyttes. Fra tradisjonelle tabell-data til mer komplekse data-kilder som sosiale innlegg, e-post, bilder, video og sensor-data, krever evnen til å trekke ut mening fra data en analyse i aggregat. Ettersom data-typene øker, blir denne oppgaven mye mer vanskelig, og krever en ny type database. Dette er nettopp hvorfor TileDB ble skapt.
Hvorfor er det avgjørende for organisasjoner å prioritere deres data-infrastruktur før de utvikler avanserte analytiske og maskinlærings-kapasiteter?
Midt i all fermenten rundt å adoptere AI, er det en kritisk og ofte overseen sannhet – suksessen med noen AI-initiativ er ubrytelig knyttet til kvaliteten og ytelsen til den underliggende data-infrastrukturen.
Problemet er at kompleks data som ikke naturlig representeres som tabeller, betraktes som “ustrukturert”, og lagres vanligvis enten som flate filer i spesialiserte data-formater eller håndteres av separate, spesialiserte databaser. Data-vitenskapsmenn tilbringer enorme mengder tid med å håndtere data for å konsolidere den. Det estimeres at 80-90 prosent av data-vitenskapsmenns tid brukes på å rense deres data og forberede den for å slå sammen. Dette forsinker tiden til å trene AI-algoritmer og oppnå prediktive kapasiteter. Videre betyr dette at bare 10-20 prosent av data-vitenskapsmenns tid brukes på å skape innsikt.
Hva er de vanlige fallgruvene organisasjoner møter når de fokuserer mer på AI- og ML-applikasjoner på bekostning av en robust database-infrastruktur?
Organisasjoner tenderer til å fokusere på nye og skinnende ting. Store språkmodeller, vektor-databaser og generative AI-applikasjoner bygget på toppen av en data-infrastruktur er nåværende eksempler, på bekostning av å håndtere den underliggende data-infrastrukturen som er avgjørende for analytisk suksess. Enkelt sagt, hvis din organisasjon gjør dette, kan du bli sittende og bruke en uforholdsmessig lang tid på å sammenføye din data-infrastruktur og forsinke eller gå glipp av muligheter til å skaffe innsikt.
Kan du utdype hva som gjør en database ‘adaptiv’ og hvorfor denne adaptiviteten er essensiell for moderne data-analyse?
En adaptiv database er en som kan endre form for å huske alle data – uavhengig av dens modus – og lagre det sammen på en forent måte. En adaptiv database bringer struktur til data som ellers betraktes som “ustrukturert”. Det estimeres at 80 prosent eller mer av verdens data er ikke-tabellformet, eller ustrukturert, og de fleste AI/ML-modellene (inkludert LLM-er) er trent på denne type data.
TileDB strukturerer data i flerdimensjonale arrayer. Hvordan forbedrer denne formatet ytelse og kostnadseffektivitet sammenlignet med tradisjonelle databaser?
Den grunnleggende styrken til en flerdimensjonal array-database er at den kan endre form for å huske praktisk talt alle data-modus og applikasjoner. En vektor, for eksempel, er bare en en-dimensjonal array. Ved å bringe struktur til denne “ustrukturerte” data, kan du konsolidere din data-infrastruktur, redusere kostnader betydelig, eliminere siloer, øke produktivitet og forbedre sikkerheten. Et skritt videre, når beregnings-infrastruktur er koblet med data-håndtering-infrastruktur, kan du trekke ut verdi fra dine data med en gang.
Hva er noen bemerkelsesverdige brukstilfeller hvor TileDB har forbedret data-håndtering og analytisk ytelse?
Det første TileDB-brukstilfellet var lagring, håndtering og analyse av enorme genetiske data, som er svært vanskelig og dyrt å modellere og lagre i en tradisjonell, tabellformet database. Vi observerte fenomenale ytelsesforbedringer (i størrelsesorden 100 ganger raskere i mange tilfeller enn andre databaser og spesialiserte løsninger). Imidlertid er vårt flerdimensjonale array-modell universelt og kan effektivt fange andre data-modus, også. For eksempel, er TileDB utmerket til å håndtere biomedisinske bilder, satellitt-bilder, enkelt-celle-transkriptomik og punkt-sky-data som LiDAR og SONAR.
TileDB tilbyr åpne verktøy for interoperabilitet. Hvordan kan en åpen kilde-tilnærming være til fordel for det vitenskapelige og data-vitenskapelige samfunnet?
Vi er store tilhengere av åpen kilde ved TileDB. Kjerne-biblioteket og data-format-specifikasjonen er begge åpen kilde. I tillegg er våre life sciences-tilbud, bygget på toppen av kjerne-array-biblioteket, også åpen kilde. Dette inkluderer TileDB-SOMA, en pakke for effektiv og skalerbar enkelt-celle-data-håndtering, som ble bygget i samarbeid med Chan Zuckerberg Foundation og driver CELLxGENE Discover Census – verdens største fullstendig kurerte enkelt-celle-datasett. Dette er også åpen kilde og brukes av akademiske institusjoner og store farmasøytiske selskaper over hele verden.
Hva ser du som fremtidige trender i data-håndtering?
Som data blir rikere, blir AI-applikasjoner smartere. Store språkmodeller blir mer og mer kraftfulle, og utnytter multiple data-modus, og integrasjonen av disse LLM-ene med ulike data-samlinger åpner opp en ny front i AI kjent som multimodal AI.
Praktisk talt betyr multimodal AI at brukerne ikke er begrenset til én inn-data-type og én ut-data-type, og kan prompte en modell med praktisk talt hvilken som helst inn-data for å generere hvilken som helst innholdstype. Vi ser TileDB som den ideelle databasen for å støtte multimodal AI, bygget for å støtte enhver ny og forskjellig type data som kan oppstå.
Takk for den flotte anmeldelsen, lesere som ønsker å lære mer bør besøke TileDB.












