Rozhovory

Dr. Stavros Papadopoulos, zakladatel a generální ředitel, TileDB – rozhovor

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

TileDB je moderní databáze, která integruje všechny datové modality, kód a výpočetní prostředky do jednoho produktu. TileDB byl vyvinut v MIT a Intel (INTC ) Labs v květnu 2017.

Předtím, než založil TileDB, Inc. v únoru 2017, byl Dr. Stavros Papadopoulos seniorním výzkumným pracovníkem v Intel Parallel Computing Lab a členem Intel Science and Technology Center for Big Data at MIT CSAIL po dobu tří let. Strávil také zhruba dva roky jako hostující asistent profesora na katedře počítačových věd a inženýrství na Hong Kong University of Science and Technology (HKUST). Stavros získal doktorát v oboru počítačových věd na HKUST pod vedením profesora Dimitrise Papadiase a držel pozici postdoktorálního výzkumníka na Chinese University of Hong Kong s profesorem Yufeim Tao.

Vous jste dříve pracoval jako seniorní výzkumný pracovník v Intel Parallel Computing Lab a jako člen Intel Science and Technology Center (ISTC) pro Big Data at MIT CSAIL po dobu tří let. Můžete sdílet s námi některé klíčové okamžiky z tohoto období vašeho života?

Během mého působení v Intel Labs a MIT jsem měl jedinečnou příležitost spolupracovat s významnými osobnostmi ve dvou různých vědeckých oblastech: high-performance computing (v Intelu) a databáze (v MIT). Získané znalosti a odborné znalosti se staly klíčovými pro vytvoření nové koncepce databázového systému, který jsem nakonec vyvinul jako výzkumný projekt v rámci ISTC a který se stal TileDB.

Můžete vysvětlit vizi za TileDB a jak se snaží revolucionizovat moderní databázový trh?

V posledních letech došlo k obrovskému rozvoji aplikací strojového učení a generativního umělého inteligence, které pomáhají organizacím učinit lepší rozhodnutí. Každý den organizace objevují nové vzorce ve svých datech a poté je používají k získání konkurenční výhody. Tyto vzorce vznikají z neustále se rozšiřujícího spektra datových modalit, které je třeba uložit a spravovat, aby je bylo možné využít. Od tradičních tabulkových dat po složitější datové zdroje, jako jsou sociální příspěvky, e-maily, obrázky, videa a senzorová data, je schopnost získat smysl z dat vyžaduje agregaci. S rostoucím množstvím datových typů se tato úloha stává stále náročnější, což vyžaduje novou typ databáze. Právě z tohoto důvodu byl vytvořen TileDB.

Proč je důležité, aby organizace prioritizovaly svou datovou infrastrukturu před vývojem pokročilých analytických a strojových učících se schopností?

Uprostřed nadšení pro přijetí umělé inteligence je kritický a často přehlížený fakt – úspěch každé iniciativy umělé inteligence je intrinsicky spojen s kvalitou a výkonem podkladové datové infrastruktury.

Problém spočívá v tom, že komplexní data, která nejsou přirozeně reprezentována jako tabulky, jsou považována za “nestrukturovaná” a jsou obvykle uložena jako ploché soubory v speciálních formátech nebo spravována samostatnými, účelově vytvořenými databázemi. Datoví vědci tráví obrovské množství času přípravou a konsolidací dat. Odhaduje se, že 80-90 procent času datových vědců je stráveno čištěním a přípravou dat pro sloučení. To zpomaluje čas potřebný pro výuku algoritmů umělé inteligence a dosažení prediktivních schopností. Kromě toho to znamená, že pouze 10-20 procent času datových vědců je stráveno vytvářením poznatků.

Jaké jsou běžné pasti, kterým organizace čelí, když se soustředí více na aplikace umělé inteligence a strojového učení na úkor robustní datové infrastruktury?

Organizace se často soustředí na nové a lesknoucí se věci. Velké jazykové modely, vektorové databáze a generativní aplikace umělé inteligence postavené na datové infrastruktuře jsou aktuálními příklady, na úkor řešení podkladové datové infrastruktury, která je zásadní pro analytický úspěch. Jednoduše řečeno, pokud vaše organizace postupuje tímto způsobem, můžete strávit nepřiměřené množství času sestavováním své datové infrastruktury a zmeškat nebo úplně vynechat příležitosti k získání poznatků.

Můžete vysvětlit, co dělá databázi “adaptivní” a proč je tato adaptabilita nezbytná pro moderní datové analýzy?

Adaptivní databáze je taková, která se může přizpůsobit všem datům – bez ohledu na jejich modalitu – a uložit je společně v ujednoceném tvaru. Adaptivní databáze přidává strukturu dat, která jsou jinak považována za “nestrukturovaná”. Odhaduje se, že 80 procent nebo více světových dat je netabulková, nebo nestrukturovaná, a většina modelů umělé inteligence (včetně LLM) je trénována na tomto typu dat.

TileDB strukturuje data do vícerozměrných polí. Jak tento formát zlepšuje výkon a nákladovou efektivitu ve srovnání s tradičními databázemi?

Základní síla vícerozměrné pole databáze spočívá v tom, že se může přizpůsobit prakticky jakémukoliv datovému modulu a aplikaci. Vektor, například, je jednoduše jednorozměrné pole. Přidáním struktury k těmto “nestrukturovaným” datům můžete konsolidovat svou datovou infrastrukturu, výrazně snížit náklady, eliminovat sila, zvýšit produktivitu a zlepšit bezpečnost. Když je výpočetní infrastruktura spojena s datovou infrastrukturou, můžete okamžitě získat hodnotu ze svých dat.

Jaké jsou některé pozoruhodné případy, ve kterých TileDB výrazně zlepšil datovou správu a analytický výkon?

Prvním případem použití TileDB byla úložiště, správa a analýza rozsáhlých genomických dat, která jsou velmi obtížná a nákladná na modelování a uložení v tradiční tabulkové databázi. Zaznamenali jsme fenomenální zlepšení výkonu (v řádu 100x rychlejší ve mnoha případech než ostatní databáze a speciální řešení). Naše vícerozměrná pole model je však univerzální a může efektivně zachytit i jiná datová modality. Například TileDB je excelente pro zpracování biomedicínského zobrazování, satelitního zobrazování, single-cell transcriptomiky a bodového oblaku dat, jako je LiDAR a SONAR.

TileDB nabízí open-source nástroje pro interoperabilitu. Jaký je přínos open-source přístupu pro vědeckou a datovou komunitu?

Jsme velkými zastánci open-source v TileDB. Jádro knihovny a specifikace datového formátu jsou open-source. Kromě toho jsou naše nabídky pro life sciences, postavené na jádru pole, také open-source. To zahrnuje TileDB-SOMA, balíček pro efektivní a škálovatelnou správu single-cell dat, který byl vyvinut ve spolupráci s Chan Zuckerberg Foundation a který pohání CELLxGENE Discover Census – největší plně kurátorovaný dataset single-cell dat na světě. To je také open-source a je používáno akademickými institucemi a významnými farmaceutickými společnostmi po celém světě.

Jaké trendy vidíte v budoucnosti datové správy?

Jakmile se data stanou bohatšími, aplikace umělé inteligence se stanou chytřejšími. Velké jazykové modely se stávají stále více výkonnými, využívají více datových modalit a integrace těchto modelů s různými datovými sadami otevírá novou frontu v oblasti umělé inteligence, známou jako multimodální umělé inteligence.

Prakticky řečeno, multimodální umělé inteligence znamená, že uživatelé nejsou omezeni na jeden vstup a jeden typ výstupu a mohou vyvolat model s prakticky jakýmkoliv vstupem a vygenerovat prakticky jakýkoliv typ obsahu. Vidíme TileDB jako ideální databázi pro podporu multimodální umělé inteligence, postavenou na podporu jakýchkoliv nových a odlišných typů dat, které se mohou objevit.

Děkuji za skvělou recenzi, čtenáři, kteří si chtějí dozvědět více, by měli navštívit TileDB.

Antoine je vizionářský líder a spoluzakladatel Unite.AI, který je poháněn neotřesitelnou vášní pro formování a propagaci budoucnosti umělé inteligence a robotiky. Jako sériový podnikatel věří, že umělá inteligence bude mít na společnost stejně disruptivní vliv jako elektřina, a často se chvála na potenciál disruptivních technologií a AGI.