Intervjuer

Jeronimo De Leon, Senior Produktleder for AI i Backblaze – Intervju-serie

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Jeronimo De Leon er en erfaren produktleder med over 10 års erfaring med å drive AI-drevet innovasjon i både bedrifter og startup-miljøer. For tiden er han Senior Produktleder for AI i Backblaze, der han leder utviklingen av AI/ML-funksjoner, fokuserer på hvordan Backblaze forbedrer AI-data-livsløpet for kundenes MLOps-arkitekturer og implementerer AI-verktøy og -agenter for å optimalisere interne operasjoner.

Backblaze er et cloud-lagring- og backup-selskap som tilbyr ubegrenset, automatisk datamaskinbackup for enkelpersoner og bedrifter, samt skalerbare objektlagringløsninger for bedrifter, medie- og applikasjonsarbeidslast. Deres tjenester fokuserer på rimelighet, datasikkerhet, enkel gjenoppretting og sømløs kompatibilitet med eksisterende systemer.

Med over et tiår med erfaring i AI-drevet produktledelse – fra å arbeide med LLM-er hos Intelas og RAG hos Welcome.AI til å lansere Bloombergs chatbot og nå lede AI-ansattene i Backblaze. Hvordan har disse erfaringene formet din syn på rollen til cloud-lagring i å skalerer AI/ML-arbeidsflyter?

Siden jeg startet på AI-prosjekter hos IBM Watson, har jeg sett innovasjonstempoet dramatisk akselerere. Det som tidligere tok år å gå fra forskning til produksjon, skjer nå på måneder. Imidlertid forblir de grunnleggende infrastruktur-utfordringene de samme: Hvor er dataene, hvor lagrer vi dem, og hvordan får vi tilgang til dem effektivt?

Tidligere var begrensningene beregning og modeller, men nå har vi et overflod av forhånds trenede modeller og det finnes mange beregningsleverandører. Likevel, når man starter et prosjekt, må man vanligvis begynne med et datainnsamling- og prosesseringsprosjekt, og det er fremdeles det samme i dag. Jeg ser jevnt og jevnt at organisasjoner møter samme flaskehalser ved å konsolidere data fra ulike kilder. Organisasjonene som lykkes er de som løser data-tilgjengelighet tidlig, og skaper en basis som skalerer med deres AI-mognhet. Din lagringsarkitektur-beslutninger bestemmer hvor raskt du kan komme til modell-trening og innovasjon.

Hvor ser du cloud-lagring spille den mest kritiske rollen over AI-livsløpet – fra datainnsamling og prosessering til trening, finjustering, inferens og overvåking?

Cloud-lagring er kritisk over hele AI-livsløpet, med nøkkelstadier i data-samling, prosessering, trening og inferens. I begynnelsen konsoliderer, katalogiserer og sikrer arkiver hastighet opp nye prosjekter og gjør det enkelt å teste nye modeller. Rent, godt prosessert data slår ofte bare å ha mer data, noe som gjør lagring sentral både for kvalitet og skala. En av mine favoritt-Backblaze-uttrykk er: “Det er ikke hamstring hvis det er data.” Du vet aldri hvor verdifullt det vil være, så organisasjoner bør samle inn så mye som mulig. Under trening sikrer skalerbar lagring gjennomstrømming av store datasett, og under inferens muliggjør fanging av prediksjonsutdata og bruker-tilbakemelding kontinuerlig iterasjon. Til slutt er lagring fundamentet som bestemmer hvor raskt du kan innovere med AI.

Hva er de største hindringene organisasjoner møter når de skal skalerer lagring for AI, og hvordan forskjeller disse utfordringene seg mellom mindre startup-bedrifter og store bedrifter?

De største hindringene i å skalerer lagring for AI er kostnad, datahåndtering og tilgjengelighet. Å lagre store volumer med data er bare en del av utfordringen; det må også organiseres, gjøres tilgjengelig og styres med riktige kontroller. Rent, godt strukturert data er ofte mer verdifullt enn bare å ha mer av det.

For startup-bedrifter er den første utfordringen å skaffe nok data til å trene og finjustere modellene. Når de har det, blir kostnad og arkitektur de neste barrierene.

For store bedrifter er utfordringen kompleksitet. Deres data er overflod, men fragmentert over siloer, legacy-systemer og overholdelsesregimer, noe som gjør konsolidering og tilgjengelighet vanskelig.

Organisasjonene som lykkes behandler lagring som en strategisk muliggjører som skalerer i kostnad, ytelse og tilgjengelighet sammen med deres AI-mognhet.

Blant kostnad, latency, sikkerhet og overholdelse, hvilken ser du som den mest presserende barrieren for å skalerer AI i dag, og hvordan bør organisasjoner prioritere å løse den?

Blant kostnad, latency, sikkerhet og overholdelse er latency en av de mest presserende barrierene. Den påvirker direkte både modell-trening og inferens, og inferens i særlig grad former brukeropplevelsen. Organisasjoner gjør så mye som mulig for å redusere latency på dette stadiet, da forsinkelser i å levere prediksjoner kan undergrave adopsjon.

Kostnad forblir en konstant utfordring ettersom data-volumer vokser, og overholdelse blir mer kritisk ettersom organisasjoner skalerer, spesielt i regulerte industrier. Startup-bedrifter fokuserer ofte først på kostnad og latency, mens bedrifter må balansere latency med styring og reguleringer. Prioriteten bør være å bygge lagring som minimerer latency for trening og inferens, samtidig som den er kostnadseffektiv og overholdt mens AI-adoptsjon utvides.

Bedrifter betoner ofte behovet for fleksibilitet og enkel tilgang til data for å drive AI-innovasjon. Fra din synsvinkel, hva ser sant fleksibilitet i data-tilgang ut som, og hvorfor er det så essensielt?

I en nylig tale jeg holdt, understreket jeg konseptet med smart arkivering. Sant fleksibilitet i data-tilgang starter med å sentralisere informasjon i en strukturert, søkbar arkiv. Det betyr å unifisere ulike formater, normalisere og merke for konsistens, og aktivere indeksering for fremtidig spørring. Denne tilnærmingen sikrer at data ikke bare lagres, men gjøres brukbar.

Det er essensielt fordi det legger grunnlaget for analyse og modellering. Når data er strukturert og søkbar, kan team flytte raskere, eksperimentere mer fritt og redusere latency både i trening og inferens. Uten denne type fleksibilitet blir lagring raskt en flaskehalset i stedet for en muliggjører for AI-innovasjon.

Kan du dele virkelige brukstilfeller – som med kunder som Decart AI eller Wynd Labs – som demonstrerer hvordan riktig cloud-lagring-tilnærming kan direkte muliggjøre AI-innovasjon?

Dette er to gode eksempler på hvordan riktig cloud-lagring-tilnærming direkte muliggjør AI-innovasjon. Decart fokuserte på modell-trening, der å flytte data til beregning effektivt var kritisk. Med Backblaze B2 skalerte de til 16 PB på 90 dager, trenet over flere GPU-kluster uten avgift for utgang, og oppnådde ti ganger effektiviteten til konkurrentene. Den påliteligheten og effektiviteten frigjorde dem til å innovere raskere.

Wynd Labs fokuserte på kundens tilgang til data. De innhenter petabyte daglig og serverer titalls petabyte månedlig. Med Backblazes høye ytelse og gratis utgang kunne de skalerer til bedrifts-krav og gjeninvestere ressurser i produktutvikling. Den evnen til å levere data-tilgang i skala låste opp nye muligheter for deres plattform.

I begge tilfeller transformerte riktig lagringsstrategi infrastrukturen fra en begrensning til en muliggjører, og lot bedriftene fokusere på å innovere i AI i stedet for å håndtere kostnad og kompleksitet.

Når AI-modeller og datasett blir mer komplekse, hva råd ville du gi organisasjoner som prøver å balansere lagringsytelse med kostnadseffektivitet?

Organisasjoner må tenke på sin langtids data-bruk med produktet sitt i mente. Å samle inn, prosessere, flytte og kjøre inferens på data vil alle være kjernepunkter for hvordan produktet utvikler seg. Hvis de ikke tar hensyn til det nå, vil kostnadene og lagrings-utfordringene bare øke over tid. Ettersom AI vil være en sentral del av produktet og organisasjonen, må lagring være designet tidlig for å balansere ytelse med kostnadseffektivitet, så den kan skalerer jevnt mens de vokser.

Sikkerhet og overholdelse er spesielt presserende i regulerte industrier. Hvordan ser du cloud-lagring utvikle seg for å støtte styringsbehov mens team samtidig kan innovere raskt?

Styring er en viktig del av lagring. Å strømlinjeforme tilgang med en solid basis for hvordan data håndteres, sikres og auditeres er kritisk. Jeg ser cloud-lagring utvikle seg med sterkere innebygde kontroller som kryptering som standard, finekornede tillatelser, audit-spor og data-residens-valg. Like viktig er data-avstamning. I AI er det å vite hvor data kommer fra, hvordan det har blitt prosessert og hvordan det mates inn i modeller essensielt for både overholdelse og tillit.

Samtidig forbedrer lagringsplattformene brukervennligheten, så team kan flytte raskt. Når styring, avstamning og tilgjengelighet fungerer sammen, kan organisasjoner møte reguleringer mens de fortsatt kan innovere i AI med hastighet.

For organisasjoner som vurderer eller migrerer til B2, hva råd eller veiledning gir du i forhold til implementering – spesielt når det gjelder data-migrering, integrasjon med eksisterende MLOps- eller beregnings-stacker, eller optimalisering for gjennomstrømming og utgang?

Ettersom B2 er S3-kompatibelt, integrerer det direkte i eksisterende MLOps- og beregnings-stacker uten om-arkitektur. Vi arbeider ofte med kunder på en proof-of-concept for å validere migrering, ytelse og integrasjon før skaleringsfasen. Deretter fokuserer vi på å optimalisere gjennomstrømming, data-bevegelse og data-orkestrering, så team kan trene over kluster, kjøre inferens og iterere raskt uten å bli hindret av infrastruktur-bottlenecks.

Når AI-arbeidslast skalerer – spesielt med trender rundt LLM-er, exabyte-skala datasett og hybrid- eller multi-cloud-strategier – hvordan utvikler Backblaze sine lagrings-tilbud for å møte disse nye behovene?

Hos Backblaze fokuserer vi ikke bare på hvordan data brukes i dag, men også hvordan det vil bli orkestrert i fremtiden. Lagring er ikke lenger bare et arkiv, men blir et verktøy som muliggjør rask tilgang, effektiv bevegelse og pålitelig orkestrering av data over miljøer. Med LLM-er og exabyte-skala datasett vil denne grunnlaget for enkel tilgang og høy gjennomstrømming være kritisk ikke bare for trening og inferens, men også for den nye klassen av AI-agenter som avhenger av data for å gjøre prosesser mer autonome. Resultatet er et lagringsgrunnlag som muliggjør innovasjon nå og forbereder organisasjoner på hva som kommer neste.

Takk for det flotte intervjuet, lesere som ønsker å lære mer bør besøke Backblaze

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.