Interviuri
Jeronimo De Leon, Senior Product Manager de IA la Backblaze – Seria de interviuri

Jeronimo De Leon este un lider experimentat în managementul produselor, cu peste 10 ani de experiență în conducerea inovației bazate pe IA în medii enterprise și startup. În prezent, ocupă funcția de Senior Product Manager, IA la Backblaze, unde conduce dezvoltarea funcțiilor de IA/ML, se concentrează pe modul în care Backblaze îmbunătățește ciclul de viață al datelor de IA pentru arhitecturile MLOps ale clienților și implementează instrumente și agenți de IA pentru a optimiza operațiunile interne.
Backblaze este o companie de stocare și backup în cloud care oferă backup-uri automate și nelimitate pentru computere pentru persoane fizice și întreprinderi, precum și soluții de stocare de obiecte scalabile pentru sarcini de lucru enterprise, media și aplicații. Serviciile sale se concentrează pe accesibilitate, securitate a datelor, recuperare ușoară și compatibilitate perfectă cu sistemele existente.
Aduceți peste un deceniu de experiență în managementul produselor bazate pe IA – de la lucru cu LLM la Intelas și RAG la Welcome.AI, până la lansarea chatbot-ului Bloomberg și acum conducerea eforturilor de IA la Backblaze. Cum au influențat aceste experiențe perspectiva dvs. asupra rolului stocării în cloud în scalarea fluxurilor de lucru de IA/ML?
De când am început să lucrez la proiecte de IA la IBM Watson, am văzut că ritmul inovației s-a accelerat dramatic. Ceea ce obișnuia să dureze ani pentru a trece de la cercetare la producție se întâmplă acum în luni. Cu toate acestea, provocările fundamentale de infrastructură rămân aceleași: unde sunt datele, unde le stocăm și cum le accesăm eficient?
Înainte, constrângerile erau compute și modele, dar acum avem o abundență de modele preantrenate și există mulți furnizori de compute. Cu toate acestea, atunci când am început un proiect în trecut, de obicei trebuia să începem cu un proiect de colectare și prelucrare a datelor, ceea ce este încă valabil și astăzi. Văd în mod constant organizații care se confruntă cu același blocaj al consolidării datelor din surse disparate. Organizațiile care reușesc sunt cele care rezolvă accesibilitatea datelor de la început, creând o fundație care se extinde odată cu maturitatea lor de IA. Deciziile dvs. privind arhitectura de stocare determină cu câtă rapiditate puteți ajunge la antrenarea modelului și inova.
Unde vedeți stocarea în cloud jucând rolurile cele mai critice de-a lungul ciclului de viață al IA – de la ingestia și prelucrarea datelor la antrenare, finisare, inferență și monitorizare?
Stocarea în cloud este critică de-a lungul ciclului de viață al IA, cu etape cheie în agregarea, prelucrarea, antrenarea și inferența datelor. La început, consolidarea sistematică, catalogarea și securizarea arhivelor accelerează noile proiecte și facilitează testarea modelelor emergente. Datele curate și bine prelucrate de obicei bat doar cantitatea de date, ceea ce face stocarea centrală pentru calitate, precum și pentru scară. Una dintre expresiile mele favorite de la Backblaze este: „Nu este o încălzire dacă este date.” Nu știți niciodată cât de valoroase vor fi, așa că organizațiile ar trebui să colecteze cât mai mult posibil. În timpul antrenării, stocarea scalabilă asigură debitul de seturi de date masive, iar la inferență, capturarea ieșirilor de predicție și a feedback-ului utilizatorului permite iterarea continuă. În final, stocarea este fundația care determină cu câtă rapiditate puteți inova cu IA.
Care sunt cele mai mari obstacole cu care se confruntă organizațiile atunci când scalează stocarea pentru IA și cum se diferențiază aceste provocări între startup-urile mai mici și întreprinderile mari?
Obstacolele principale în scalarea stocării pentru IA sunt costul, gestionarea datelor și accesibilitatea. Stocarea unor volume mari de date este doar o parte a provocării; acestea trebuie, de asemenea, să fie organizate, recuperabile și guvernate cu controalele potrivite. Datele curate și bine structurate sunt adesea mai valoroase decât simpla posedare a unor cantități mai mari de date.
Pentru startup-uri, provocarea inițială constă în obținerea suficientelor date pentru a antrena și rafina modelele. Odată ce le au, costul și arhitectura devin următoarele bariere.
Pentru întreprinderile mari, provocarea constă în complexitate. Datele lor sunt abundente, dar fragmentate în silozuri, sisteme legacy și regimuri de conformitate, ceea ce face consolidarea și accesibilitatea dificilă.
Organizațiile care reușesc tratează stocarea ca un factor strategic care se extinde în cost, performanță și accesibilitate alături de maturitatea lor de IA.
Dintre cost, latență, securitate și conformitate, care considerați a fi cel mai presant obstacol pentru scalarea IA în prezent și cum ar trebui organizațiile să prioritizeze abordarea acestei provocări?
Între cost, latență, securitate și conformitate, latența este unul dintre cele mai presante obstacole. Acesta afectează direct atât antrenarea, cât și inferența modelului, iar inferența, în special, modelează experiența utilizatorului. Organizațiile fac tot posibilul pentru a reduce latența în acest stadiu, deoarece întârzierile în furnizarea predicțiilor pot submina adoptarea.
Costul rămâne o provocare constantă pe măsură ce volumele de date cresc, iar conformitatea devine mai critică pe măsură ce organizațiile se extind, în special în industriile reglementate. Startup-urile se concentrează adesea mai întâi pe cost și latență, în timp ce întreprinderile trebuie să echilibreze latența cu guvernanța și cerințele reglementare. Prioritatea ar trebui să fie construirea unei stocări care minimizează latența pentru antrenare și inferență, fiind în același timp eficientă din punct de vedere al costurilor și conformă pe măsură ce adoptarea IA se extinde.
Întreprinderile subliniază adesea nevoia de flexibilitate și acces ușor la date pentru a stimula inovația în IA. Din perspectiva dvs., ce înseamnă adevărata flexibilitate în accesul la date și de ce este atât de esențială?
Într-o prezentare recentă pe care am ținut-o, am subliniat conceptul de arhivare inteligentă. Adevărata flexibilitate în accesul la date începe cu centralizarea informațiilor într-un arhiv structurat și căutabil. Acest lucru înseamnă unificarea formatelor diverse, normalizarea și etichetarea pentru consistență și permiterea indexării pentru interogări viitoare. Abordarea aceasta asigură că datele nu sunt doar stocate, ci și facute utilizabile.
Este esențială deoarece fundamentează analitica și modelarea. Când datele sunt structurate și căutabile, echipele pot lucra mai rapid, pot experimenta mai liber și pot reduce latența atât în antrenare, cât și în inferență. Fără acest tip de flexibilitate, stocarea devine rapid un blocaj în loc de un factor care stimulează inovația în IA.
Puteți împărtăși cazuri reale de utilizare – cum ar fi cele cu clienți precum Decart AI sau Wynd Labs – care demonstrează cum abordarea corectă a stocării în cloud poate permite direct inovația în IA?
Acestea sunt două exemple excelente de modul în care abordarea corectă a stocării în cloud poate permite direct inovația în IA. Decart s-a concentrat pe antrenarea modelului, unde mutarea datelor către compute a fost critică. Cu Backblaze B2, au scalat la 16 PB în 90 de zile, au antrenat pe multiple cluster de GPU fără cost de egress și au obținut de zece ori eficiența concurenților. Acea fiabilitate și eficiență le-au permis să inoveze mai rapid.
Wynd Labs s-a concentrat pe accesul clienților la date. Ei ingerează petabiți zilnic și servesc zeci de petabiți lunar. Cu performanța ridicată a Backblaze și egress gratuit, au putut scala la cererea enterprise și să reinvestească resursele în dezvoltarea produsului. Acea capacitate de a furniza acces la date la scară a deblocat oportunități noi pentru platforma lor.
În ambele cazuri, strategia corectă de stocare a transformat infrastructura de la o constrângere la un factor care permite inovația, permițând companiilor să se concentreze pe inovarea în IA, mai degrabă decât pe gestionarea costurilor și complexității.
Pe măsură ce modelele și seturile de date de IA devin mai complexe, ce sfaturi ați oferi organizațiilor care încearcă să echilibreze performanța stocării cu eficiența costurilor?
Organizațiile trebuie să gândească despre utilizarea pe termen lung a datelor lor, ținând cont de produs. Colectarea, prelucrarea, mutarea și rularea inferenței pe date vor fi fundamentale pentru evoluția produsului lor. Dacă nu iau în considerare acest lucru acum, costurile și provocările de stocare se vor multiplica în timp. Deoarece IA va fi o parte centrală a produsului și organizației lor, stocarea trebuie proiectată de la început pentru a echilibra performanța cu eficiența costurilor, astfel încât să poată scala în mod neted pe măsură ce cresc.
Securitatea și conformitatea sunt în special presante în industriile reglementate. Cum vedeți stocarea în cloud evoluând pentru a sprijini nevoile de guvernanță, permițând în același timp echipelor să inoveze rapid?
Guvernanța este o parte cheie a stocării. Simplificarea accesului cu o bază solidă pentru modul în care datele sunt gestionate, securizate și auditate este critică. Văd stocarea în cloud evoluând cu controale încorporate mai puternice, cum ar fi criptarea implicită, permisiuni fine, urme de audit și opțiuni de reședință a datelor. La fel de importantă este linia de proveniență a datelor. În IA, știind de unde provin datele, cum au fost prelucrate și cum alimentează modelele este esențial atât pentru conformitate, cât și pentru încredere.
În același timp, platformele de stocare îmbunătățesc ușurința de utilizare, astfel încât echipele să poată lucra rapid. Când guvernanța, linia de proveniență și accesibilitatea lucrează împreună, organizațiile pot îndeplini cerințele reglementare, continuând să inoveze cu IA la viteza dorită.
Pentru organizații care evaluează sau migrează către B2, ce sfaturi sau îndrumări oferiți în ceea ce privește implementarea – în special cu privire la migrarea datelor, integrarea cu stivele MLOps sau compute existente sau optimizarea pentru debit și egress?
Deoarece B2 este compatibil cu S3, se integrează direct în stivele MLOps și compute existente fără a necesita o re-arhitecturare. Adesea lucrăm cu clienții pe un concept de dovadă pentru a valida migrarea, performanța și integrarea înainte de a scala. De acolo, accentul se pune pe optimizarea debitului, a mutării datelor și a orchestrierii datelor, astfel încât echipele să poată antrena pe cluster, rula inferență și itera rapid, fără a fi încetinite de blocajele infrastructurii.
Pe măsură ce sarcinile de lucru de IA continuă să se extindă – în special cu tendințele din jurul LLM, seturi de date de scară exabyte și strategii hibride sau multi-cloud – cum evoluează Backblaze ofertele sale de stocare pentru a răspunde acestor nevoi emergente?
La Backblaze, ne concentrăm nu doar pe modul în care datele sunt utilizate astăzi, ci și pe modul în care vor fi orchestrate în viitor. Stocarea nu mai este doar un arhiv, ci devine un instrument care permite accesul rapid, mutarea eficientă și orchestrarea fiabilă a datelor în traversul mediilor. Cu LLM și seturi de date de scară exabyte, această fundație de acces ușor și debit ridicat va fi critică nu doar pentru antrenare și inferență, ci și pentru clasa emergentă de agenți de IA care se bazează pe date pentru a face procesele mai autonome. Rezultatul este o fundație de stocare care permite inovația acum și pregătește organizațiile pentru ceea ce urmează.
Mulțumim pentru acest interviu minunat; cititorii care doresc să afle mai multe trebuie să viziteze Backblaze.












