Interviuri

Dr. Stavros Papadopoulos, Fondator și CEO, TileDB – Seria de interviuri

mm
Adaugă Unite.AI la sursele tale preferate pe Google

TileDB este baza de date modernă care integrează toate modalitățile de date, cod și calcul într-un singur produs. TileDB a fost creată în mai 2017, ca o spin-off a MIT și Intel (INTC ) Labs.

Înainte de a fonda TileDB, Inc. în februarie 2017, Dr. Stavros Papadopoulos a fost cercetător științific senior la Intel Parallel Computing Lab și membru al Intel Science and Technology Center for Big Data la MIT CSAIL, timp de trei ani. De asemenea, a petrecut aproximativ doi ani ca profesor asistent la Departamentul de Informatică și Inginerie de la Universitatea Științifică și Tehnică din Hong Kong (HKUST). Stavros a obținut doctoratul în Informatică la HKUST, sub îndrumarea profesorului Dimitris Papadias, și a deținut o poziție de cercetător postdoctoral la Universitatea Chineză din Hong Kong, sub îndrumarea profesorului Yufei Tao.

Ați fost anterior cercetător științific senior la Intel Parallel Computing Lab și membru al Intel Science and Technology Center (ISTC) pentru Big Data la MIT CSAIL, timp de trei ani. Puteți împărtăși cu noi câteva aspecte cheie din această perioadă a vieții dvs.?

În timpul meu la Intel Labs și MIT, am avut oportunitatea unică de a colabora cu personalități din două sectoare științifice diferite: calcul de înaltă performanță (la Intel) și baze de date (la MIT). Cunoștințele și expertiza pe care le-am dobândit au devenit cheia care mi-a permis să creez un nou tip de sistem de baze de date, pe care l-am dezvoltat ca proiect de cercetare în cadrul ISTC și l-am transformat în ceea ce a devenit TileDB.

Puteți explica viziunea din spatele TileDB și cum își propune să revoluționeze peisajul modern al bazelor de date?

În ultimii ani, a existat o creștere uriașă a aplicațiilor de învățare automată și Inteligență Artificială Generativă care ajută organizațiile să ia decizii mai bune. Fiecare zi, organizațiile descoperă noi tipare în datele lor și folosesc aceste informații pentru a obține un avantaj competitiv. Aceste tipare provin dintr-un spectru în continuă creștere de modalități de date care trebuie să fie gestionate și stocate pentru a putea fi valorificate. De la date tabulare tradiționale la surse de date mai complexe, cum ar fi postări sociale, e-mail, imagini, videoclipuri și date de senzori, capacitatea de a extrage înțeles din date necesită analize agregate. Pe măsură ce tipurile de date cresc, această sarcină devine mult mai dificilă, cerând o nouă bază de date. Acesta este exact motivul pentru care a fost creată TileDB.

De ce este esențial pentru organizații să prioritizeze infrastructura de date înainte de a dezvolta capacități avansate de analize și învățare automată?

În mijlocul entuziasmului de a adopta Inteligența Artificială, există o adevăr critic și adesea ignorat – succesul oricărei inițiative de Inteligență Artificială este în mod intrinsec legat de calitatea și performanța infrastructurii de date subiacente.

Problema este că datele complexe care nu sunt reprezentate în mod natural sub formă de tabele sunt considerate “nestructurate” și sunt stocate de obicei sub formă de fișiere plate în formate de date personalizate sau gestionate de baze de date specializate și separate. Oamenii de știință din domeniul datelor petrec o cantitate enormă de timp pentru a consolida datele. Se estimează că 80-90 la sută din timpul oamenilor de știință din domeniul datelor este petrecut pentru curățarea datelor și pregătirea lor pentru a fi unite. Acest lucru întârzie timpul necesar pentru a antrena algoritmii de Inteligență Artificială și pentru a obține capacități predictive. Mai mult, acest lucru înseamnă că doar 10-20 la sută din timpul oamenilor de știință din domeniul datelor este petrecut pentru a crea insight-uri.

Care sunt capcanele comune cu care se confruntă organizațiile atunci când se concentrează mai mult pe aplicațiile de Inteligență Artificială și învățare automată, în detrimentul unei infrastructuri de date robuste?

Organizațiile tind să se concentreze pe lucrurile noi și strălucitoare. Modelele de limbaj mari, bazele de date vectoriale și aplicațiile de Inteligență Artificială Generativă construite pe o infrastructură de date sunt exemple actuale, în detrimentul abordării infrastructurii de date subiacente, care este esențială pentru succesul analitic. Pur și simplu spus, dacă organizația dvs. face acest lucru, vă puteți găsi petrecând o cantitate imensă de timp pentru a reuni infrastructura de date și pentru a întârzia sau pentru a pierde complet oportunități de a obține insight-uri.

Puteți explica ce face o bază de date “adaptivă” și de ce această adaptabilitate este esențială pentru analiza modernă a datelor?

O bază de date adaptivă este una care poate să se schimbe pentru a se potrivi tuturor datelor – indiferent de modalitatea lor – și pentru a le stoca împreună într-o manieră unitară. O bază de date adaptivă aduce structură datelor care altfel ar fi considerate “nestructurate”. Se estimează că 80 la sută sau mai mult din datele lumii sunt netabulare, sau “nestructurate”, și majoritatea modelelor de Inteligență Artificială și învățare automată (inclusiv LLM-urile) sunt antrenate pe acest tip de date.

TileDB structurează datele sub formă de matrice multidimensionale. Cum îmbunătățește acest format performanța și eficiența costurilor în comparație cu bazele de date tradiționale?

Forța fundamentală a unei baze de date de matrice multidimensionale constă în faptul că poate să se schimbe pentru a se potrivi practic oricărui tip de date și aplicație. Un vector, de exemplu, este doar o matrice unidimensională. Prin aducerea de structură în aceste date “nestructurate”, puteți consolida infrastructura de date, reduce semnificativ costurile, elimina silozurile, crește productivitatea și îmbunătăți securitatea. Dacă infrastructura de calcul este cuplată cu infrastructura de gestionare a datelor, puteți extrage valoare instantanee din datele dvs.

Care sunt câteva exemple notabile în care TileDB a îmbunătățit semnificativ gestionarea și analiza datelor?

Primul caz de utilizare al TileDB a fost stocarea, gestionarea și analiza datelor genetice masive, care este foarte dificilă și costisitoare de modelat și stocat într-o bază de date tabulară tradițională. Am observat creșteri fenomenale de performanță (de până la 100 de ori mai rapid în multe cazuri față de alte baze de date și soluții personalizate). Cu toate acestea, modelul nostru de matrice multidimensională este universal și poate captura eficient alte modalități de date, de asemenea. De exemplu, TileDB este excelent pentru gestionarea imaginilor biomedicale, imaginilor satelitare, transcriptomiei celulare unice și datelor de puncte cloud, cum ar fi LiDAR și SONAR.

TileDB oferă instrumente open-source pentru interoperabilitate. Cum beneficiază abordarea open-source comunitățile științifice și de știință a datelor?

Noi suntem mari susținători ai open-source la TileDB. Biblioteca de bază și specificația formatului de date sunt ambele open-source. În plus, ofertele noastre pentru științele vieții, construite pe baza bibliotecii de matrice, sunt de asemenea open-source. Acest lucru include TileDB-SOMA, un pachet pentru gestionarea eficientă și scalabilă a datelor celulare unice, care a fost construit în colaborare cu Fundația Chan Zuckerberg și alimentează Censusul CELLxGENE Discover – cel mai mare set de date complet curat și unic din lume. Acesta este, de asemenea, open-source și este utilizat de instituții academice și companii farmaceutice majore din întreaga lume.

Ce tendințe viitoare vedeți în gestionarea datelor?

Pe măsură ce datele devin mai bogate, aplicațiile de Inteligență Artificială devin mai inteligente. Modelele de limbaj mari devin tot mai puternice, valorificând multiple modalități de date, și integrarea acestor modele cu seturi de date diverse deschide un nou front în Inteligența Artificială, cunoscut sub numele de Inteligență Artificială multimodală.

În practică, Inteligența Artificială multimodală înseamnă că utilizatorii nu sunt limitați la un singur tip de intrare și ieșire și pot solicita un model cu practic orice intrare pentru a genera practic orice tip de conținut. Noi vedem TileDB ca o bază de date ideală pentru a susține Inteligența Artificială multimodală, construită pentru a susține orice tip nou și diferit de date care ar putea apărea.

Mulțumim pentru această recenzie, cititorilor care doresc să afle mai multe despre TileDB.

Antoine este un lider vizionar și partener fondator al Unite.AI, condus de o pasiune neclintită pentru modelarea și promovarea viitorului inteligenței artificiale și roboticii. Un întreprinzător serial, el crede că inteligența artificială va fi la fel de disruptivă pentru societate ca și electricitatea și este adesea prins vorbind entuziast despre potențialul tehnologiilor disruptive și AGI.

Ca futurist, el este dedicat explorării modului în care aceste inovații vor modela lumea noastră. În plus, el este fondatorul Securities.io, o platformă axată pe investiții în tehnologii de ultimă generație care redefinesc viitorul și reshapă întregi sectoare.