Haastattelut
Jeronimo De Leon, Backblazen AI:n tuotejohtaja – Haastattelusarja

Jeronimo De Leon on kokenut tuotejohtaja, jolla on yli 10 vuoden kokemus AI-vetoinen innovaatioiden johtamisesta sekä suurissa yrityksissä että startup-ympäristössä. Hän toimii tällä hetkellä Backblazen AI:n tuotejohtajana, johtaa AI/ML-ominaisuuksien kehittämistä ja keskittyy siihen, miten Backblaze parantaa asiakkaiden MLOps-arkkitehtuureiden AI-datalifecycleä. Hän myös toteuttaa AI-työkaluja ja -agenteja optimoimaan sisäisiä prosesseja.
Backblaze on pilvitallennus- ja varmuuskopioyhtiö, joka tarjoaa rajattomat, automaattiset tietokoneen varmuuskopiot sekä yksityishenkilöille että yrityksille, sekä skaalautuvat objektitallennusratkaisut yrityksille, medialle ja sovelluskuormituksille. Heidän palvelunsa keskittyvät edullisuuteen, tietoturvaan, helppoon palautukseen ja nahtavaan yhteensopivuuteen olemassa olevien järjestelmien kanssa.
Yli kymmenen vuoden kokemuksesi AI-vetoisesta tuotejohtamisesta – työskennellessäsi LLM:ien parissa Intelassa ja RAG:issa Welcome.AI:ssa, sekä käynnistäessäsi Bloombergin chatbotin ja johtaessasi nyt Backblazen AI-pyrinnöt – miten nämä kokemukset ovat muovanneet näkemyksesi pilvitallennuksen roolista AI/ML-työn prosessien skaalauksessa?
IBM Watsonin AI-projektien parissa aloittamisesta lähtien olen nähnyt, miten innovaation tahti on kiihtynyt dramaattisesti. Se, mikä aiemmin kesti vuosia siirtymiseen tutkimuksesta tuotantoon, tapahtuu nyt kuukausissa. Perussäännölliset infrastruktuurin haasteet kuitenkin säilyvät: missä data sijaitsee, missä me sen säilytämme ja miten pääsemme siihen tehokkaasti?
Aiemmin rajoitukset olivat laskenta ja mallit, mutta nyt meillä on runsaasti esikoulutettuja malleja ja paljon laskentapalveluja. Kuitenkin kun aloitimme projektin silloin, meidän piti yleensä aloittaa datan keräämis- ja prosessointiprojektista, mikä on edelleen sama tänään. Näen jatkuvasti, miten organisaatiot törmävät samaan pullonkaulaan, joka liittyy datan konsolidointiin eri lähteistä. Onnistuneet organisaatiot ovat ne, jotka ratkaisevat datan saatavuuden ongelman aikaisin ja luovat perustan, joka skaalautuu heidän AI-kypsymisen kanssa. Teidän tallennusarkkitehtuurin valintanne määrittää, kuinka nopeasti voitte siirtyä mallin harjoitteluun ja innovointiin.
Missä näette pilvitallennuksen pelaavan tärkeintä roolia AI- elinkaaren eri vaiheissa – datan imuroinnissa ja prosessoinnissa, koulutuksessa, hienosäätelyssä, inferenceissä ja seurannassa?
Pilvitallennus on kriittinen koko AI- elinkaaren ajan, ja sillä on tärkeitä rooleja datan keräämisessä, prosessoinnissa, koulutuksessa ja inferenceissä. Alussa järjestelmällinen datan konsolidointi, katalogointi ja turvallisuus nopeuttavat uusien projektien käynnistystä ja tekevät helpoksi uusien mallien testaamisen. Puhdas, hyvin prosessoitu data usein voittaa sen, että on vain enemmän dataa, mikä tekee tallennuksesta sekä laadun että skaalan kannalta keskeisen. Yksi lempisitaattejani Backblazesta on: “Se ei ole hamstraamista, jos se on data.” Et voi koskaan tietää, kuinka arvokasta se on, joten organisaatioiden tulisi kerätä niin paljon kuin mahdollista. Koulutuksen aikana skaalautuva tallennus varmistaa massiivisten tietojoukkojen läpipääsy, ja inference-vaiheessa ennusteen tulosten ja käyttäjäpalautteen tallentaminen mahdollistaa jatkuvan iteroinnin. Lopulta tallennus on perusta, joka määrittää, kuinka nopeasti voitte innovoida AI:n avulla.
Mitkä ovat suurimmat esteet, joita organisaatiot kohtaavat skaalatessaan tallennusta AI:lle, ja miten nämä haasteet eroavat pienemmistä startup-yrityksistä ja suurista yrityksistä?
Suurimmat esteet AI-tallennuksen skaalauksessa ovat kustannukset, datan hallinta ja saatavuus. Suurten datamäärien tallentaminen on vain osa haasteesta; se on myös järjestettävä, haettavissa oleva ja hallittava oikeiden valvontamekanismien avulla. Puhdas, hyvin järjestetty data on usein arvokkaampaa kuin vain enemmän dataa.
Pienille startup-yrityksille alkuvaiheen haaste on riittävän datan hankkiminen mallien kouluttamiseksi ja hienosäätelyksi. Kun heillä on se, kustannukset ja arkkitehtuuri muodostuvat seuraaviksi esteiksi.
Suurille yrityksille haaste on monimutkaisuus. Heidän data on runsasta, mutta se on fragmentoitu eri siloihin, vanhoihin järjestelmiin ja säätelyvaatimuksiin, mikä tekee konsolidoinnin ja saatavuuden haasteelliseksi.
Onnistuneet organisaatiot kohdellaan tallennusta strategisena mahdollistajana, joka skaalautuu kustannuksissa, suorituskyvyssä ja saatavuudessa heidän AI-kypsymisensä rinnalla.
Mistä näette latenssin, turvallisuuden, yhdenmukaisuuden ja kustannuksen välillä olevan suurimman esteen AI:n skaalauksessa tällä hetkellä, ja miten organisaatioiden tulisi priorisoida sen ratkaiseminen?
Latenssi on yksi suurimmista esteistä AI:n skaalauksessa. Se vaikuttaa suoraan sekä mallin koulutukseen että inferenceen, ja erityisesti inference-vaiheessa se muokkaa käyttökokemusta. Organisaatiot tekevät kaikkensa vähentääksesi latenssia tässä vaiheessa, koska viiveet ennusteiden toimittamisessa voivat heikentää omaksumista.
Kustannukset ovat edelleen jatkuva haaste, kun datamäärät kasvavat, ja yhdenmukaisuus tulee tärkeämmäksi, kun organisaatiot laajenevat, erityisesti säänneltyjen alojen yrityksissä. Pienet yritykset keskittyvät usein ensin kustannuksiin ja latenssiin, kun taas suuret yritykset on tasapainotettava latenssia hallinnollisten ja sääntelyvaatimusten kanssa. Prioriteetti tulisi olla rakentaa tallennus, joka minimoi latenssin koulutuksessa ja inferenceissä, samalla ollen kustannustehokas ja yhdenmukainen AI:n omaksumisen laajentuessa.
Yritykset korostavat usein joustavuuden ja helpon datan saatavuuden tarvetta AI-innovaatioiden ajamiseksi. Mitä joustavuus datan saatavuudessa tarkoittaa teidän näkökulmasta, ja miksi se on niin olennainen?
Äskettäin pitämässäni esitelmässä korostin älykkään arkistoinnin idean. Joustavuus datan saatavuudessa alkaa keskitettynä tietojen arkistoinnista, joka on järjestetty, haettavissa ja indeksoitu tulevia kyselyjä varten. Tämä lähestymistapa varmistaa, että data ei ole vain tallennettu, vaan myös tehty käytettäväksi.
Se on olennainen, koska se luo perustan analytiikalle ja mallinnukselle. Kun data on järjestetty ja haettavissa, tiimit voivat liikkua nopeammin, kokeilla enemmän ja vähentää latenssia sekä koulutuksessa että inferenceissä. Ilman tällaista joustavuutta tallennus muuttuu helposti pullonkaulaksi AI-innovaatioiden sijaan.
Voitteko jakaa todellisia esimerkkejä, kuten Decart AI:n tai Wynd Labsin kanssa, joissa oikea pilvitallennuslähestymistapa voi suoraan mahdollistaa AI-innovaatiota?
Nämä ovat kaksi erinomaista esimerkkiä siitä, miten oikea pilvitallennuslähestymistapa voi suoraan mahdollistaa AI-innovaatiota. Decart keskittyi mallin koulutukseen, jossa datan siirtäminen laskentaan oli kriittistä. Backblazen B2:n avulla he skaalautuivat 16 PB:hen 90 päivässä, kouluttivat useiden GPU-klustereiden yli ilman egress-kustannuksia ja saavuttivat kymmenkertaisen tehokkuuden kilpailijoihinsa verrattuna. Tämä luotettavuus ja tehokkuus antoi heille vapauden innovoida nopeammin.
Wynd Labs keskittyi asiakkaiden datan saatavuuteen. He keräävät päivittäin petatavu ja palvelevat kymmeniä petatavu kuukaudessa. Backblazen korkean suorituskyvyn ja ilman egress-kustannuksia ansiosta he pystyivät skaalautumaan yritystason kysyntään ja uudelleeninvestoimaan resursseja tuotekehitykseen. Kyky toimittaa dataa skaalautuvasti avasi heille uusia mahdollisuuksia heidän alustalleen.
Molemmissa tapauksissa oikea tallennusstrategia muutti infrastruktuurin esteestä mahdollistajaksi, jolloin yritykset voivat keskittyä AI-innovaatioihin sen sijaan, että hallitsevat kustannuksia ja monimutkaisuutta.
Kun AI-mallit ja tietojoukot kasvavat monimutkaisemmiksi, mitä ohjeita antaisitte organisaatioille, jotka yrittävät tasapainottaa tallennuksen suorituskyvyn ja kustannustehokkuuden?
Organisaatioiden tulisi ajatella heidän pitkän aikavälin datan käyttöä heidän tuotteidensa kehittymisen näkökulmasta. Datan kerääminen, prosessointi, siirtäminen ja suorittaminen ovat kaikki olennaisia heidän tuotteidensa kehittymiselle. Jos he eivät huomioi tätä nyt, kustannukset ja tallennus haasteet vain kasvavat ajan myötä. Koska AI on tärkeä osa heidän tuotteitaan ja organisaatiotaan, tallennuksen on suunniteltava etukäteen tasapainottelemaan suorituskykyä ja kustannustehokkuutta, jotta se voi skaalautua heidän kasvaessaan.
Turvallisuus ja yhdenmukaisuus ovat erityisen tärkeitä säännellyissä aloissa. Miten näette pilvitallennuksen kehittyvän tukemaan hallinnollisia tarpeita samalla, kun se sallii tiimien nopean innovaation?
Hallinnollinen valvonta on tärkeä osa tallennusta. Pääsyä yksinkertaistamalla vankalla perustalla, jolla dataa hallitaan, turvataan ja auditoidaan, on kriittistä. Näen pilvitallennuksen kehittyvän vahvemmilla sisäänrakennetuilla valvontamekanismeilla, kuten oletusarvoisella salauksella, hienorakeisilla käyttöoikeuksilla, auditinraideilla ja datan sijaintivaihtoehdoilla. Yhtä tärkeää on datan polku. AI:ssa on tärkeää tietää, mistä data tulee, miten se on prosessoitu ja miten se syötetään malleihin, sekä yhdenmukaisuuden että luottamuksen kannalta.
Samaan aikaan tallennusjärjestelmät parantavat käytettävyyttä, jotta tiimit voivat edelleen liikkua nopeasti. Kun hallinnollinen valvonta, polku ja saatavuus toimivat yhdessä, organisaatiot voivat täyttää sääntelyvaatimukset samalla, kun ne voivat jatkaa AI-innovaatiota nopeasti.
Mitä neuvoja tai ohjeita antaisitte organisaatioille, jotka arvioivat tai siirtävät B2:hen, erityisesti datan siirtämisen, integroinnin olemassa oleviin MLOps- tai laskentapinoihin ja optimoinnin läpipääsy- ja egress-suorituskyvyn osalta?
Koska B2 on S3-yhteensopiva, se integroituu suoraan olemassa oleviin MLOps- ja laskentapinoihin ilman uudelleenarkkitehtuuria. Usein työskentelemme asiakkaiden kanssa todistuskohteessa, jotta voimme vahvistaa siirtymisen, suorituskyvyn ja integroinnin ennen skaalautumista. Tästä eteenpäin fokus on optimoida läpipääsy, datan siirto ja datan orkestraatio, jotta tiimit voivat kouluttaa useiden klustereiden yli, suorittaa inferenceä ja iteroida nopeasti ilman, että infrastruktuurin pullotkaulat hidastavat heitä.
Kun AI-työkuormat jatkavat kasvamistaan – erityisesti LLM-trendien, exabyte-luokan tietojoukkojen ja hybridi- tai monipilvi-strategioiden kanssa – miten Backblaze kehittää tallennuspalvelujaan tukemaan näitä uusia tarpeita?
Backblazessa keskitymme siihen, miten dataa käytetään tänään, mutta myös siihen, miten sitä orkesteroidaan tulevaisuudessa. Tallennus ei ole enää vain arkisto, vaan se on työkalu, joka mahdollistaa nopean pääsyn, tehokkaan siirron ja luotettavan orkestraation dataa eri ympäristöissä. LLM:ien ja exabyte-luokan tietojoukkojen kanssa tämä perusta nopeasta pääsystä ja korkeasta läpipääsystä on kriittinen sekä koulutukselle, inferenceille että nouseville AI-agentteille, jotka luottavat dataan prosessien autonomian tekemiseksi. Tuloksena on tallennusperusta, joka mahdollistaa innovaation nyt ja valmistaa organisaatioita tuleviin haasteisiin.
Kiitos haastattelusta. Lukijat, jotka haluavat oppia lisää, voivat vierailla Backblazen sivustolla.












