Haastattelut

Tohtori Stavros Papadopoulos, TileDB:n perustaja ja toimitusjohtaja – Haastattelusarja

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

TileDB on moderni tietokanta, joka yhdistää kaikki datatyypit, koodin ja laskennan yhteen tuotteeseen. TileDB perustettiin MIT:stä ja Intel (INTC ) Labsista toukokuussa 2017.

Ennen kuin hän perusti TileDB Inc.:in helmikuussa 2017, tohtori Stavros Papadopoulos oli vanhempi tutkimustieteilijä Intelin rinnakkaislaskennan laboratoriossa ja jäsen Intelin tieteen ja teknologian keskuksessa suurten tietojen parissa MIT CSAIL:ssa kolmen vuoden ajan. Hän oli myös noin kaksi vuotta vieraileva apulaisprofessorina Hongkongin tiede- ja teknologian yliopiston tietojenkäsittelytieteen ja -tekniikan osastolla (HKUST). Stavros suoritti tohtorintutkinnon tietojenkäsittelytieteestä HKUST:ssa professori Dimitris Papadiaksen johdolla ja oli postdoc-tutkijana Kiinan yliopistossa Hongkongissa professori Yufei Taon johdolla.

Olit aiemmin vanhempi tutkimustieteilijä Intelin rinnakkaislaskennan laboratoriossa ja jäsen Intelin tieteen ja teknologian keskuksessa suurten tietojen parissa MIT CSAIL:ssa kolmen vuoden ajan. Voitko kertoa meille joistakin keskeisistä korkeakohdista tästä elämäsi jaksosta?

Aikana, jolloin olin Intel Labsissa ja MIT:ssä, minulla oli ainutlaatuinen mahdollisuus tehdä yhteistyötä kirkkaimpien tieteilijöiden kanssa kahdessa eri tieteellisessä alalla: korkean suorituskyvyn laskennassa (Intel) ja tietokannoissa (MIT). Tietämys ja asiantuntemus, jonka hankkin, muodostuivat avainasiaksi visioni muodostumisessa uudenlaisen tietokantajärjestelmän luomiseksi, jonka lopulta rakensin tutkimushankkeena ISTC:ssa ja irtautuminen johti siihen, mitä TileDB:stä tuli.

Voitko selittää vision taakse TileDB:hen ja miten se pyrkii vallankumoukseen nykyaikaisessa tietokantamaailmassa?

Viime vuosina on ollut valtava kasvu koneoppimisessa ja generatiivisissa tekoälysovelluksissa, jotka auttavat organisaatioita tekemään parempia päätöksiä. Jokaisena päivänä organisaatiot löytävät uusia kuvioita omista tiedoistaan ja käyttävät tätä tietoa saavuttaakseen kilpailuetua. Nämä kuviot syntyvät jatkuvasti laajenevasta datatyypin spektristä, joka on hallittava ja hallinnoitava, jotta niistä voidaan hyötyä. Perinteisestä taulukkomuotoisesta datasta monimutkaisempiin tietolähteisiin, kuten sosiaalisiin viesteihin, sähköposteihin, kuviin, videoihin ja anturidataan, tiedon merkityksen saavuttamiseksi vaaditaan yhteenvetoista analyysiä. Mitä enemmän datatyyppejä on, sitä vaativampaa tämä tehtävä on, ja se vaatii uudenlaisen tietokannan. Tämän vuoksi TileDB luotiin.

Miksi on äärimmäisen tärkeää, että organisaatiot priorisoivat tietoinfrastruktuurinsa ennen edistyneiden analytiikka- ja koneoppimisominaisuuksien kehittämistä?

Teckoälyn omaksumisen intohimon keskellä on kriittinen ja usein huomioimaton totuus – minkä tahansa tekoälyhankkeen onnistuminen on luonnollisesti sidottu taustalla olevan tietoinfrastruktuurin laatuun ja suorituskykyyn.

Ongelma on, että monimutkainen data, jota ei luonnostaan esitetä taulukkomuodossa, katsotaan “rakenteettomaksi” ja tallennetaan yleensä joko tiettyihin tiedostomuotoihin tai hallitaan erillisten, tarkoitukseen suunniteltujen tietokantojen avulla. Data-analyytikot joutuvat viettämään valtavasti aikaa datan käsittelyyn, jotta he voivat konsolidoida sitä. On arvioitu, että 80-90 prosenttia data-analyytikoiden ajasta kuluu datan puhdistamiseen ja valmisteluun yhdistämistä varten. Se hidastaa aikaa, joka kuluu tekoälyalgoritmien kouluttamiseen ja ennustavien kykyjen saavuttamiseen. Lisäksi se tarkoittaa, että vain 10-20 prosenttia data-analyytikoiden ajasta kuluu oivallusten luomiseen.

Mitkä ovat yleiset ansat, joihin organisaatiot joutuvat, kun ne keskittyvät enemmän tekoäly- ja koneoppimissovelluksiin tietoinfrastruktuurin kustannuksella?

Organisaatiot keskittyvät usein uusiin, loistaviin juttuihin. Suuret kielimallit, vektortietokannat ja generatiivinen tekoäly, joka on rakennettu tietoinfrastruktuurin päälle, ovat nykyisiä esimerkkejä, joissa tietoinfrastruktuurin kehittämistä laiminlyödään. Yksinkertaisesti sanottuna, jos organisaatiosi tekee tämän, sinun saatat joutua viettämään valtavasti aikaa tietoinfrastruktuurin kokoamiseen ja hidastamaan tai kokonaan menettämään mahdollisuuksia saada oivalluksia.

Voitko selittää, mitä tarkoittaa “sopeutuva” tietokanta ja miksi tämä sopeutuvuus on välttämätöntä modernille data-analytiikalle?

Sopeutuva tietokanta on sellainen, joka voi muuttaa muotoaan minkä tahansa datan mukana – riippumatta sen tyypistä – ja tallentaa sen yhdenmukaisesti. Sopeutuva tietokanta antaa rakenteen sille datalle, jota muutoin pidetään “rakenteettomana”. On arvioitu, että 80 prosenttia tai enemmän maailman datasta on ei-taulukkomuotoista eli rakenteetonta, ja useimmat tekoäly-/koneoppimismallit (mukaan lukien LLM:t) koulutetaan tällaisella datalla.

TileDB järjestää datan moniulotteisissa taulukoissa. Miten tämä muoto parantaa suorituskykyä ja kustannustehokkuutta verrattuna perinteisiin tietokantoihin?

Moniulotteisen taulukon tietokannan perusratkaisu on, että se voi muuttaa muotoaan käytännössä minkä tahansa datatyypin ja sovelluksen mukana. Esimerkiksi vektori on yksinkertaisesti yhdenulotteinen taulukko. Antamalla rakenteen tälle “rakenteettomalle” datalle voit konsolidoida tietoinfrastruktuurisi, laskea kustannuksia merkittävästi, poistaa silot, lisätä tuottavuutta ja parantaa turvallisuutta. Kun laskenta-infrastruktuuri yhdistetään tietohallinta-infrastruktuuriin, voit saada välittömästi arvoa tiedoistasi.

Mitkä ovat joitakin merkittäviä käyttötapoja, joissa TileDB on parantanut merkittävästi datahallintaa ja -analytiikkaa?

Ensimmäinen TileDB-käyttötapaus oli laajan genomitiedon tallennus, hallinta ja analyysi, mikä on hyvin vaikeaa ja kallista mallintaa ja tallentaa perinteiseen taulukkomuotoiseen tietokantaan. Havaitsemme fantastisia suorituskyvyn parannuksia (useissa tapauksissa jopa 100-kertaisia muita tietokantoja ja räätälöityjä ratkaisuja vastaan). Mutta moniulotteinen taulukkomalli on universaali ja voi tehokkaasti käsitellä muita datatyyppejä. Esimerkiksi TileDB on erinomainen biolääketieteellisen kuvantamisen, satelliittikuvien, yksisolujen transkriptiikan ja pistepilviaineistojen, kuten LiDAR- ja SONAR-tiedon, käsittelyssä.

TileDB tarjoaa avoimen lähdekoodin työkalut yhteensopivuuden mahdollistamiseksi. Miten avoimen lähdekoodin lähestymistapa hyödyttää tieteellistä ja data-analytiikkaa harjoittavaa yhteisöä?

Olemme suuria avoimen lähdekoodin kannattajia TileDB:ssä. Ydin kirjasto ja tietomäärittely ovat molemmat avoimen lähdekoodin. Lisäksi elintieteelliset tarjoamme, jotka on rakennettu ydinarray-kirjastoon, ovat myös avoimen lähdekoodin. Tähän kuuluu TileDB-SOMA, paketti tehokkaaseen ja skaalautuvaan yksisoludatan hallintaan, joka on kehitetty yhteistyössä Chan Zuckerberg -säätiön kanssa ja jota käytetään CELLxGENE Discover Census -tietokannassa, joka on maailman suurin täysin kuratoitu yksisoludatasetti. Tämä on myös avoimen lähdekoodin ja sitä käyttävät akateemiset laitokset ja suuret lääketeollisuusyhtiöt ympäri maailmaa.

Mitkä ovat tulevaisuuden suuntaukset datahallinnassa?

Kun data muuttuu rikkaammaksi, tekoälysovellukset tulevat älykkäämmiksi. Suuret kielimallit tulevat yhä voimakkaammiksi, hyödyntäen useita datatyyppejä, ja näiden LLM:ien yhdistäminen moninaisiin tietojoukkoihin avaa uuden eturintaman tekoälyssä, jota kutsutaan monitietoisuudeksi.

Käytännössä monitietoinen tekoäly tarkoittaa, ettei käyttäjien tarvitse rajoittua yhteen syöte- ja yhteen tulostetyyppiin, vaan he voivat ohjata mallia käytännössä minkä tahansa syötteen avulla ja luoda käytännössä minkä tahansa sisällön tyypin. Me näemme TileDB:n ihanteellisena tietokantana monitietoisen tekoälyn tukemiseksi, joka on rakennettu tukemaan mitä tahansa uusia ja erilaisia datatyyppejä, jotka saattavat tulevaisuudessa ilmestyä.

Kiitos loistavasta arvostelusta. Lukijat, jotka haluavat oppia lisää, voivat vierailla TileDB:ssä.

Antoine on visionäärisellä johtajalla ja Unite.AI:n perustajakumppani, joka on intohimoisesti omistautunut tulevaisuuden älyteknologian ja robotiikan muotoiluun ja edistämiseen. Sarjayrittäjänä hän uskoo, että älyteknologia tulee olemaan yhtä mullistava yhteiskunnalle kuin sähkö, ja hän on usein innostunut puhumaan älyteknologian ja AGI:n mahdollisuuksista.

Hän on tulevaisuudentutkija, joka on omistautunut tutkimiseen, miten nämä innovaatiot muotoilevat maailmaamme. Lisäksi hän on Securities.io:n perustaja, joka on keskittynyt sijoittamiseen älykkäisiin teknologioihin, jotka määrittelevät tulevaisuutta ja muokkaavat koko toimialoja.