Interviuri
Jay Mishra, COO al Astera Software – Seria de interviuri

Jay Mishra este directorul operativ (COO) la Astera Software, un furnizor în creștere rapidă de soluții de date pentru întreprinderi. Ei ajută utilizatorii de afaceri să acopere decalajul dintre date și informații cu o suită de soluții de extragere a datelor, calitate a datelor, integrare a datelor, depozitare a datelor și schimb de date electronice, care sunt utilizate atât de companiile de dimensiuni medii, cât și de cele din Fortune 500, dintr-o varietate de industrii.
Ce v-a atras inițial către știința calculatoarelor?
Am avut întotdeauna o pasiune profundă pentru matematică, iar călătoria mea în știința calculatoarelor a fost o extensie naturală a acesteia. Educația mea de licență a fost în matematică și știința calculatoarelor, și a fost progresia logică din lumea matematicii către domeniul științei calculatoarelor care m-a fascinat. Ceea ce m-a atras în mod special a fost funcționarea intricată a algoritmilor și a proceselor algoritmice avansate, ceea ce m-a determinat să urmez o specializare în algoritmi în timpul masterului în știința calculatoarelor. De atunci, legătura mea cu știința calculatoarelor a rămas puternică, și mă strădui în mod constant să rămân la curent cu ultimele dezvoltări în domeniu.
Sunteți în prezent directorul operativ al Astera, puteți să ne spuneți ce implică rolul dvs. zilnic?
Ca director operativ al Astera, rolul meu este multifacetat, reflectând natura dinamică a companiei noastre. Am fost la Astera de la începuturile sale, și responsabilitățile mele au acoperit diverse domenii ale organizației. Acest lucru include totul, de la contribuția activă la dezvoltarea și codificarea produselor noastre până la asigurarea că funcțiile noastre se aliniază cu nevoile în schimbare ale clienților noștri. Colaborăm îndeaproape cu clienții noștri, lucrând în tandem cu ei pentru a rafina soluțiile noastre. Rolul meu se extinde dincolo de dezvoltarea produsului pentru a include vânzări și marketing, unde aducem ofertele noastre pe piață.
Deoarece ne aflăm într-o fază de creștere, am preluat responsabilități suplimentare, inclusiv supravegherea obiectivelor noastre de venituri și extinderea strategică a portofoliului nostru de produse pentru a ajunge la noi piețe. În esență, am o mână în aproape fiecare aspect al operațiunilor noastre, asigurându-mă că nu numai că construim produse excepționale, dar și le aducem cu succes pe piață și îndeplinim obiectivele noastre de afaceri.
Pentru cititorii care nu sunt familiari cu acest termen, ce este depozitarea datelor?
Depozitarea datelor este un model arhitectural utilizat pentru a consolida toate datele dvs. de întreprindere într-un depozit centralizat care va servi ca bază pentru generarea diverselor tipuri de analize, rapoarte și tablouri de bord care vor prezenta imaginea reală a afacerii dvs. și vor prognoza cum va evolua afacerea în viitor. Pentru a face toate acestea, aduceți datele dvs. împreună într-un anumit mod, și această arhitectură se numește depozit de date.
Termenul este de fapt preluat dintr-un depozit real, unde produsele dvs. sunt stocate pe rafturi organizate. Dar atunci când vine vorba de lumea datelor, aduceți datele dvs. de la diverse surse. Aduceți datele dvs. de la producție, site-ul dvs. web, clienții dvs., vânzări și marketing, finanțe și departamentul dvs. de resurse umane. Aduceți toate datele împreună, aduceți-le într-un singur loc, și acela va fi numit depozit de date și este proiectat într-un anumit mod, astfel încât raportarea, în special pe baza cronologiei, va fi ușoară. Acesta este scopul principal al unui depozit de date.
Care sunt unele dintre tendințele cheie în depozitarea datelor în prezent?
Depozitarea datelor a evoluat foarte mult în ultimii 20-25 de ani. Aproximativ cu un deceniu în urmă, am asistat la apariția depozitării automate a datelor, o schimbare de paradigmă care a accelerat procesul de creare a modelelor de date și a depozitelor de date. Recent, automatizarea a devenit o prioritate. Aceasta abordează natura repetitivă a sarcinilor de depozitare a datelor, simplificând procesele pentru a economisi timp și resurse.
Produsul nostru, Astera Data Warehouse Builder, de exemplu, oferă o abordare holistică a automatizării în depozitarea datelor. Acesta acoperă totul, de la automatizarea conductelor ETL (Extrage, Transformă, Încarcă) și modelarea datelor până la încărcarea automată a datelor în structuri precum schemele stea sau depozitele de date. Mai mult, acesta menține eficient aceste structuri prin mecanisme de capturare a datelor modificate (CDC). Această automatizare cuprinzătoare a apărut ca o tendință cheie în peisajul depozitării datelor.
În plus, cea mai recentă tendință este fuziunea dintre depozitarea datelor și inteligența artificială (IA). În special, IA generativă a dus automatizarea la noi înălțimi. Nu numai că automatizează sarcinile, dar ajută și utilizatorii în procesul de luare a deciziilor.
Configurarea componentelor de depozitare a datelor, conducte și puncte de decizie poate fi ghidată de IA, făcând depozitarea datelor mai puternică și eficientă ca niciodată. În esență, aceasta este automatizarea pe steroizi, și este transformativă pentru peisajul depozitării datelor. Intersecția dintre IA și depozitarea datelor este o tendință care promite mult pentru viitor.
Care sunt cele patru principii fundamentale pe care companiile ar trebui să le ia în considerare pentru dezvoltarea depozitului de date?
1. Definirea obiectivelor clare
Este esențial să începeți prin a înțelege exact ce aveți nevoie de la depozitul dvs. de date. Evitați capcana comună de a colecta date excesive fără un scop clar. În schimb, identificați obiectivele specifice pe care le doriți să le atingeți cu depozitul dvs. de date. Care sunt rapoartele și insight-urile pe care le căutați? Prin concentrarea asupra obiectivelor dvs., vă asigurați că aduceți doar datele relevante, în loc să acumulați cantități mari de informații. Având în vedere scăderea costurilor de stocare și puterea de calcul, este crucial să utilizați aceste resurse în mod inteligent și etic.
2. Alegerea modelului arhitectural corect
Modelele arhitecturale sunt foarte importante. Ele decid dacă soluția dvs. de depozitare a datelor va fi de succes sau nu. Există diverse opțiuni, de la depozitarea datelor în stil Inmon până la schemele stea ale lui Ralph Kimball, precum și modele mai noi precum Data Vault și abordarea unei singure tabele, promovată de furnizorii de baze de date columna. Nu toate modelele vor fi potrivite pentru fiecare scenariu.
Vedem în principal o combinație de scheme stea așezate deasupra unui Data Vault. Deci, o combinație de Data Vault și schemă stea este încă cea mai utilizată. Dar, așa cum am spus, pentru fiecare cerință sau pentru fiecare scenariu, va exista un răspuns diferit. Așa că, treceți-l prin experți, vedeți care model arhitectural este potrivit pentru scenariul dvs.
3. Selectarea instrumentelor corecte
Ele sunt foarte importante și fac o mare diferență din nou asupra timpului și resurselor necesare pentru a construi o soluție și, de asemenea, asupra acurateței și calității soluției dvs., care este determinată de produsele pe care le utilizați pentru a construi și menține depozitul dvs. de date. Atenționați-vă la capacitățile produsului și priviți produsele care pot aduce cele mai multe cerințe sub o singură umbrelă. Există anumite domenii, cum ar fi ETL (Extrage, Transformă, Încarcă), calitatea datelor, modelarea datelor, încărcarea datelor și publicarea datelor, care joacă un rol semnificativ. Dacă încercați să utilizați produse multiple pentru fiecare dintre aceste domenii, va fi dificil. Așa că, priviți produsele care pot fi utilizate pentru a face majoritatea, dacă nu toate, componentele diferite.
4. Echipa dvs.
Ultimul, dar nu cel mai puțin important, echipa de oameni pe care o adunați pentru a construi soluția dvs. de depozitare a datelor este cea mai importantă parte. Recomandăm să aveți pe cineva cu o puternică bază în modele arhitecturale de date. În ceea ce privește compoziția echipei, echipele transfuncționale sunt cel mai bun mod de a aborda acest lucru, unde aveți o combinație de utilizatori de afaceri și oameni cu o anumită experiență în programare sau cel puțin experiență în date și aveți o strânsă colaborare între custodii dvs. de date, oamenii care sunt responsabili de date și, desigur, afaceri. Prin promovarea unei strânse colaborări între aceste diverse facetă ale organizației dvs., puteți crea o echipă coerentă și eficientă responsabilă cu construirea și menținerea soluției dvs. de depozitare a datelor.
Succesul în depozitarea datelor se bazează pe atingerea unui echilibru între aceste patru principii. Aceste principii, atunci când sunt urmate cu atenție, s-au dovedit a fi o rețetă pentru succes în experiența noastră.
De ce au nevoie companiile de o stivă de date modernă?
Depinde de modul în care definim “modern” și acest lucru se schimbă adesea, uneori de la an la an, de la lună la lună și chiar de la o zi la alta. Trebuie să luăm în considerare seturile de instrumente moderne proiectate cu schimbarea peisajului datelor în minte. În ultimii ani, au existat schimbări semnificative în natura și volumul datelor. Apariția Big Data a transformat peisajul datelor, cu date care curg din surse precum site-urile de comerț electronic, bazele de date de producție și diverse părți ale afacerii dvs. Aceste date se schimbă nu numai în volum, ci și în natura lor.
În trecut, datele erau în mare parte structurate, dar acum datele nestructurate joacă un rol semnificativ. În plus, viteza cu care datele sunt generate și puse la dispoziție pentru utilizare a crescut. Având în vedere aceste schimbări în date, trebuie să evaluăm și să adaptăm în mod constant setul nostru de instrumente pentru a aborda eficient aceste provocări de date în schimbare.
Stiva de date modernă este proiectată pentru a gestiona toate variațiile în structurile și viteza datelor și este bine echipată pentru a se adapta la modelele arhitecturale emergente care au evoluat în ultimii ani. Prin urmare, dacă doriți să faceți cel mai bun uz de datele dvs., trebuie să priviți modernizarea stivei dvs. de date. Acesta este singurul mod de a ține pasul cu noile provocări de date.
Am văzut că companiile se agață de soluții existente care par să funcționeze. Este crucial să recunoaștem că datele însele sunt în mod inerent dinamice. Ele se schimbă în mod constant, prezentând noi provocări și oportunități. Soluțiile existente nu pot fi echipate pentru a se adapta la aceste schimbări. Prin urmare, pentru a valorifica pe deplin potențialul datelor lor, companiile trebuie să adopte conceptul de modernizare a stivei de date. Nu este vorba despre a rupe ceea ce funcționează; este vorba despre a rămâne agil și receptiv la natura în schimbare a datelor. Prin evaluarea și integrarea continuă a progreselor în tehnologia datelor, afacerile pot rămâne competitive și lua decizii informate într-o lume din ce în ce mai condusă de date.
Care sunt unele dintre provocările actuale de gestionare a datelor care se observă în industrie?
1. Viteza și integrarea datelor
Una dintre provocările majore cu care ne confruntăm astăzi este volumul uriaș de date care curg din diverse aplicații. Dacă luați o organizație IT tipică, aceasta se confruntă cu aplicații noi care apar în mod constant – zeci, uneori chiar sute pe an, în special în organizațiile de dimensiuni medii.
Acum, toate aceste aplicații generează date, și aceste date conțin insight-uri valoroase. Principala preocupare aici este capacitatea de a integra rapid aceste noi surse de date în conductele de date existente și de a le consolida într-o vedere unificată. Viteza cu care organizațiile pot adapta și încorpora aceste noi fluxuri de date este cea mai mare provocare pe care o vedem.
2. Formate de date variate
O altă provocare critică provine din natura datelor însele, în special din creșterea prevalenței datelor nestructurate. Cu date nestructurate, există, desigur, diferite școli de gândire despre cum să le gestionați.
Organizațiile trebuie să decidă dacă să stocheze aceste date direct în lacuri de date pentru utilizare ulterioară sau să le extragă și să le transforme într-un format mai structurat pentru consum imediat. Provocarea de a gestiona date nestructurate rămâne, și vedem că chiar și companiile de dimensiuni medii sau mici sunt afectate de aceasta. Prin urmare, este esențial să dezvoltați strategii eficiente pentru gestionarea datelor nestructurate.
Care sunt unele moduri în care Astera a integrat IA în fluxul de lucru al clienților?
Noi privim IA intersectându-se cu gestionarea datelor în două moduri distincte.
1. Îmbunătățirea ușurinței de utilizare cu IA generativă
Angajamentul nostru profund față de ușurința de utilizare este o piatră de temelie a filozofiei noastre de dezvoltare a produsului. De-a lungul ultimilor 12-13 ani, am construit o reputație puternică pentru proiectarea produselor cu o curbă de învățare scurtă, făcându-le accesibile chiar și utilizatorilor non-tehnici. Cu doar o cantitate modestă de instruire, indivizii pot utiliza eficient produsele noastre pentru a efectua sarcini semnificative cu datele lor.
Cu introducerea IA generative, Astera a dus ușurința de utilizare la un nivel superior. Am utilizat IA generativă pentru a crea o interfață de utilizator care permite clienților să interacționeze cu produsul utilizând comenzi de limbaj natural. Această interfață condusă de IA simplifică sarcinile de configurare, făcându-le mai intuitive și mai eficiente pentru utilizatori.
În plus, Astera a integrat automatizarea alimentată de IA pentru a gestiona sarcinile care anterior necesitau câteva ore de muncă manuală, în special în configurarea produselor de gestionare a datelor. Cel mai mare factor de cost al construirii unei soluții de gestionare a datelor nu a fost doar cumpărarea unui produs, ci timpul și efortul cheltuit pentru configurarea acestuia. Am încercat să abordăm acest lucru cu IA. Această abordare reduce semnificativ timpul și resursele tradiționale cheltuite pentru configurarea produsului.
De exemplu, produsul nostru, ReportMiner, simplifică extragerea datelor din documente nestructurate, permițând utilizatorilor să creeze șabloane de extragere bazate pe reguli. IA poate genera șablonul inițial în doar câteva secunde, o sarcină care anterior necesita 2-3 ore pentru un utilizator tipic. Prima versiune a șablonului generat de IA nu poate fi perfectă, dar acoperă aproximativ 90% din volumul de muncă, permițând utilizatorilor să facă ajustări rapide și să finalizeze sarcina în minute, nu ore. Această abordare este doar un exemplu de modul în care Astera valorifică IA pentru a îmbunătăți ușurința de utilizare în toate produsele noastre.
Care sunt unele dintre cele mai bune practici pentru a valorifica IA și modelele de învățare automată în gestionarea datelor pentru companiile mari?
1. Rămâneți în fruntea dezvoltărilor de IA și învățare automată
Domeniul modelelor de limbaj mare este în evoluție rapidă. Pentru a obține un avantaj competitiv, companiile mari ar trebui să rămână informate despre ultimele progrese. Astera, de exemplu, a fost un adoptator timpuriu al IA generative, utilizând modele precum OpenAI și LAMA. Monitorizarea continuă a tehnologiilor emergente vă asigură că sunteți bine pregătiți pentru a le valorifica eficient.
2. Experimentați cu multiple modele și configurații
Utilizând reglarea fină a modelelor de limbaj mare, am reușit să implementăm dimensiuni mici, de 8-13 miliarde de parametri, și să le implementăm local. Acest lucru a funcționat foarte bine pentru noi, și ceea ce recomandăm este să încercați diferite modele de bază și configurații diferite și să vedeți care funcționează pentru dvs.
Modelele de limbaj mare vin în diverse arome, fiecare cu capacități unice. Creați o configurație care vă permite să alegeți dintr-o gamă largă de opțiuni, reflectând ceea ce fac dezvoltatorii și oamenii de știință în călătoria lor de știință a datelor. Scopul nostru a fost să integrăm aceste opțiuni în mod fluent în produsul nostru, facilitând o experiență dinamică și adaptabilă pentru utilizatori.
3. Prioritizați implementarea locală înaintea API-urilor
Când lucrați cu produse axate pe date, reducerea întârzierilor este crucială. A depinde doar de API-uri pentru accesul la modele de IA și învățare automată poate introduce întârzieri inacceptabile, în special atunci când se lucrează cu volume mari de date. Este recomandat să prioritizați implementarea modelelor reglate fin local, dedicate scenariului dvs. specific. Această abordare poate îmbunătăți semnificativ timpii de răspuns și performanța generală.
De ce este Astera o soluție superioară față de platformele concurente?
- Soluțiile Astera au o interfață vizuală intuitivă, fără cod, împreună cu o ușurință de utilizare îmbunătățită de IA, ceea ce face ușor pentru toți utilizatorii să execute procese de date complexe, indiferent de capacitățile lor tehnice.
- Funcțiile de automatizare ale stivei noastre de date reduc sarcinile repetitive manuale și economisesc timp și resurse de dezvoltare.
- Platforma noastră unificată poate ajuta utilizatorii să execute procese de date de la capăt la capăt fără a trebui să schimbe soluții. Acest lucru elimină cheltuielile cu învățarea și gestionarea mai multor sisteme izolate. Mulțumim pentru acest interviu minunat, cititorilor care doresc să afle mai multe despre Astera Software.
Mulțumim pentru acest interviu minunat, cititorilor care doresc să afle mai multe despre Astera Software.












