Interviews
Jay Mishra, COO af Astera Software – Intervju-serie

Jay Mishra er Chief Operating Officer (COO) i Astera Software, en hurtigt voksende leverandør af enterprise-klare data-løsninger. De hjælper forretningsbrugere med at brobygge mellem datagap og indsigt med en samling af brugervenlige, men højpræstationsdata-udtræk, datakvalitet, dataintegration, datawarehouse og elektronisk dataproduktion, som bruges af både mellemstore og Fortune 500-virksomheder på tværs af en række brancher.
Hvad var det, der oprindeligt tiltrak dig til datalogi?
Jeg har altid haft en dyb passion for matematik, og min rejse ind i datalogi var en naturlig udvidelse af det. Min bacheloruddannelse var i matematik og datalogi, og det var den logiske udvikling fra matematik til datalogi, der fascinerede mig. Det, der især tiltrak min opmærksomhed, var de komplekse arbejder med algoritmer og avancerede algoritmiske processer, som fik mig til at søge speciale i algoritmer under min masteruddannelse i datalogi. Siden da har min forbindelse til datalogi været stærk, og jeg stræber efter at følge med i de seneste udviklinger i feltet.
Du er i øjeblikket COO i Astera, kan du dele med os, hvad din dag-til-dag rolle omfatter?
Som COO i Astera er min rolle multifacetteret, hvilket afspejler vores virksomheds dynamiske natur. Jeg har været i Astera siden dens grundlæggelse, og mine ansvarsområder har spændt over forskellige områder af organisationen. Dette inkluderer alt fra aktivt bidrag til udvikling og kodning af vores produkter til sikring af, at vores funktioner er i overensstemmelse med vores kunders udviklende behov. Jeg samarbejder tæt med vores kunder, arbejder sammen med dem for at finpudse vores løsninger. Min rolle strækker sig ud over blot produktudvikling til at omfatte salg og marketing, hvor vi bringer vores tilbud på markedet.
Da vi er i en vækstfase, har jeg påtaget mig yderligere ansvar, herunder overvågning af vores omsætningsmål og strategisk udvidelse af vores produktportefølje for at nå nye markeder. I bund og grund har jeg en finger med i næsten alle aspekter af vores drift, sikrer, at vi ikke blot bygger exceptionelle produkter, men også med succes bringer dem på markedet og opfylder vores forretningsmæssige mål.
For læsere, der er ukendte med denne betegnelse, hvad er data-warehousing?
Data-warehousing er en arkitektonisk mønster, der bruges til at konsolidere alle virksomhedens data i en centraliseret repository, som vil fungere som grundlag for, at generere forskellige typer af analyser, rapporter og dashboard, der vil præsentere det sande billede af, hvor virksomheden er, og også forudsige, hvordan virksomheden vil fungere i fremtiden. For at imødekomme alt dette bringer du dine data sammen på en bestemt måde, og den arkitektur kaldes en data-warehouse.
Begrebet er faktisk taget fra et virkeligt lager, hvor dine produkter er lagret på organiserede hylder. Men når du kommer til dataverden, bringer du dine data fra forskellige kilder. Du bringer dine data fra produktion, din website, dine kunder, salg og marketing, finans og din HR-afdeling. Du bringer alle data sammen, bringer dem til et sted, og det er, hvad der vil blive kaldt en data-warehouse, og det er designet på en bestemt måde, så rapportering, især baseret på tidsramme, er let. Det er formålet med en data-warehouse.
Hvad er nogle af de vigtigste tendenser i data-warehousing i dag?
Data-warehousing har udviklet sig betydeligt i de sidste 20-25 år. For cirka et årti siden oplevede vi opkomsten af automatiseret data-warehousing, en paradigmeskift, der accelererede processen med at bygge data-modeller og data-warehouses. For nylig har automation fået centerpladsen. Det adresserer den gentagne natur af data-warehousing-opgaver, strømliner processer for at spare tid og ressourcer.
Vores produkt, Astera Data Warehouse Builder, tilbyder for eksempel en holistisk tilgang til automation i data-warehousing. Det dækker alt fra automation af ETL (Extract, Transform, Load)-pipelines og data-modellering til automatisk indlæsning af data i strukturer som star-schemas eller data-vaults. Desuden vedligeholder det disse strukturer effektivt gennem Change Data Capture (CDC)-mekanismer. Denne altomfattende automation er opstået som en vigtig tendens i data-warehousing-landskabet.
Hvad er de fire grundlæggende principper, som virksomheder skal overveje for deres data-warehouse-udvikling?
1. Definere klare mål
Det er essentiel at starte med at forstå præcis, hvad du har brug for fra din data-warehouse. Undgå den almindelige fælde af at indsamle for meget data uden en klar formål. I stedet identificerer du de specifikke mål, du ønsker at opnå med din data-warehouse. Hvilke rapporter og indsigt søger du? Ved at fokusere på dine mål kan du sikre, at du kun indsamler de data, der er relevante, i stedet for at indsamle store mængder information uden formål. Givet de faldende omkostninger til lagring og beregningskraft er det vigtigt at bruge disse ressourcer intelligent og etisk.
2. Vælge det rette arkitektoniske mønster
Arkitektoniske mønstre er meget vigtige. De afgør, om din data-warehousing-løsning vil være succesfuld eller ej. Der er forskellige muligheder, fra Inmon-stil data-warehousing til Ralph Kimballs star-schemas, samt nye mønstre som Data Vault og den ene store tabel-tilgang, som columna database-vendorer foreslår. Ikke alle mønstre vil være egnet for hver scenario.
Vi ser mest en kombination af star-schema, der sidder oven på en data-vault. Så en kombination af Data Vault og Star Schema er stadig det mest bredt anvendte mønster. Men, som jeg sagde, for hvert krav eller til hvert scenario vil der være et andet svar. Så kør det igennem eksperter, se, hvilket arkitektonisk mønster er en god fit for dit scenario.
3. Vælge de rette værktøjer
De er meget vigtige og de gør en stor forskel igen på den tid og ressourcer, der er nødvendige for at bygge en løsning, og også på nøjagtigheden og kvaliteten af din løsning, som bestemmes af de produkter, du vil bruge til at bygge og vedligeholde din data-warehouse. Betragt produktets evne og se på produkter, der kan bringe de fleste krav under én paraply. Der er visse områder som ETL (Extract, Transform, Load), datakvalitet, data-modellering, data-indlæsning og data-publicering, der alle spiller en betydelig rolle. Hvis du prøver at bruge multiple produkter til hvert af disse områder, vil det være svært. Så se på produkter, der kan bruges til at gøre de fleste, hvis ikke alle, af de forskellige bestanddele.
4. Dit team
Sidst, men ikke mindst, er teamet af mennesker, du samler for at bygge din data-warehouse-løsning, den vigtigste del. Vi anbefaler at have nogen med en stærk baggrund i data-arkitektoniske mønstre. I forhold til team-sammensætning er tværfaglige teams den bedste måde at gå til det på, hvor du har en blanding af forretningsbrugere og mennesker med nogen programmeringsbaggrund eller i hvert fald data-ekspertise og har tæt samarbejde mellem dine data-forvaltere, de mennesker, der er ansvarlige for data, og selvfølgelig forretningsfolkene. Ved at fremme tæt samarbejde mellem disse forskellige aspekter af din organisation kan du skabe en samlet og effektiv team, der er ansvarlig for at bygge og vedligeholde din data-warehousing-løsning.
Success i data-warehousing afhænger af at opnå en balance mellem disse fire principper. Disse principper, når de følges omhyggeligt, har vist sig at være en opskrift på succes i vores erfaring.
Hvorfor har virksomheder brug for en moderne data-stack?
Det afhænger af, hvordan vi definerer “moderne”, og det ændrer sig hele tiden, nogle gange årligt, månedligt og endda dagligt. Vi må overveje moderne værktøjs-sæt, der er designet med det ændrede landskab af data i mente. I de seneste år har der været betydelige ændringer i naturen og mængden af data. Opkomsten af Big Data har forvandlet data-landskabet, med data, der strømmer ind fra kilder som e-handels-websteder, produktions-databaser og forskellige dele af din forretning. Denne data ændrer ikke kun i mængde, men også i sin egen natur.
I fortiden var data mest struktureret, men nu spiller ustruktureret data en betydelig rolle. Desuden er hastigheden, hvormed data genereres og gjort tilgængeligt for brug, øget. Givet disse ændringer i data må vi hele tiden evaluere og tilpasse vores værktøjs-sæt for at effektivt imødekomme disse udviklende data-udfordringer.
Den moderne data-stack er designet til at håndtere alle variationer i strukturer og hastighed af data og er godt udstyret til at tilpasse sig de opståede arkitektoniske mønstre, der er udviklet i de seneste år. Derfor, hvis du ønsker at udnytte dine data bedst muligt, må du se på at modernisere din data-stack. Det er den eneste måde at følge med de nye data-udfordringer.
Vi har set, at virksomheder holder fast i eksisterende løsninger, der synes at fungere. Det er vigtigt at erkende, at data i sig selv er indreibt dynamisk. Det udvikler sig hele tiden, præsenterer nye udfordringer og muligheder. Eksisterende løsninger kan ikke være i stand til at tilpasse sig disse ændringer. Derfor må virksomheder omfavne begrebet om at modernisere deres data-stack for at udnytte fuldt ud deres datas potentiale. Det handler ikke om at bryde, hvad der fungerer, men om at blive agile og responsiv over for den udviklende natur af data. Ved at hele tiden evaluere og integrere fremskridt i data-teknologi kan virksomheder forblive konkurrencedygtige og træffe informerede beslutninger i en verden, der er mere og mere data-dreven.
Hvad er nogle af de nuværende data-styrings-udfordringer, der ses i branchen?
1. Data-hastighed og integration
En af de store udfordringer, vi står overfor i dag, er den enorme mængde af data, der strømmer ind fra forskellige applikationer. Hvis du tager en typisk IT-organisation, har de at gøre med nye apps, der dukker op hele tiden – dusinvis, nogle gange endda hundredvis om året, især i mellemstore organisationer.
Alle disse apps genererer data, og den data indeholder værdifulde indsigt. Den primære bekymring her er evnen til hurtigt at integrere disse nye data-kilder i eksisterende data-pipelines og konsolidere dem i en samlet visning. Hastigheden, hvormed organisationer kan tilpasse sig og inkorporere disse nye data-strømme, er den største udfordring, vi ser.
2. Forskellige data-formater
En anden kritisk udfordring stammer fra data selv, især den øgede forekomst af ustruktureret data. Med ustruktureret data er der, naturligvis, forskellige tanker om, hvordan man håndterer det.
Virksomheder må beslutte, om de skal lagre denne data direkte i data-søer til senere brug eller om de skal udtrække og omdanne den til en mere struktureret format for umiddelbar forbrug. Udfordringen med, hvordan man håndterer ustruktureret data, består, og vi ser, at selv mellemstore eller små virksomheder påvirkes af det. Så udvikling af effektive strategier for håndtering af ustruktureret data er afgørende.
3. Data-publicering og deling
mens data-integration og konsolidering er afgørende, er evnen til at dele data effektivt lige så vigtig. Virksomheder har brug for mekanismer for at publicere og distribuere data til interne afdelinger, tredjeparts-leverandører, partnere og andre interessenter. Denne udfordring strækker sig ud over blot at gøre data tilgængeligt; det handler om at sikre data-sikkerhed, privatliv og overholdelse af regler. Da data-delning bliver en nødvendighed for virksomheder af alle størrelser, udvikler teknologier og produkter i dette område sig hurtigt for at imødekomme efterspørgslen.
Hvad er nogle måder, hvorpå Astera har integreret AI i kundernes arbejdsgang?
Vi ser på AI, der krydser data-styring på to forskellige måder.
1. Forbedring af brugervenlighed med generativ AI
Vores dybe engagement i brugervenlighed er en hjørnesten i vores produktudviklingsfilosofi. I de sidste 12-13 år har vi bygget en stærk rygte for at designe produkter med en kort læringskurve, hvilket gør dem tilgængelige, selv for ikke-tekniske brugere. Med blot en beskeden mængde træning kan personer effektivt bruge vores produkter til at udføre meningsfulde opgaver med deres data.
Med introduktionen af generativ AI har Astera taget brugervenlighed til det næste niveau. Vi har brugt generativ AI til at skabe en brugerflade, der tillader kunder at interagere med produktet ved hjælp af naturlige sprog-kommandoer. Denne AI-drevne brugerflade simplificerer konfigurationsopgaver, gør det mere intuitivt og effektivt for brugere.
2. AI-funktionalitet som et værktøjs-sæt
Astera tilbyder en samlet data-stack, der dækker forskellige aspekter af data-styring, herunder indtag, transformation, datakvalitet, data-warehousing, API’er og data-publicering. Virksomheden erkender vigtigheden af at give AI-funktionalitet som et fleksibelt værktøjs-sæt for sine brugere. Inden for dette værktøjs-sæt kan Astera-kunderne få adgang til AI på tværs af data-science-spektret, fra opbygning og implementering af machine learning-modeller til håndtering af ML Ops (Machine Learning Operations). Astera understøtter også brugen af open-source-baserede modeller, herunder store sprog-modeller (LLM’er), og faciliterer finjustering til bestemte anvendelsesområder.
Hvad er nogle af de bedste praksis for at udnytte AI og ML-modeller i data-styring for store virksomheder?
1. Forbliv i frontlinjen for AI- og ML-udviklinger
Området for store sprog-modeller udvikler sig hurtigt. For at opnå en konkurrencemæssig fordel skal store virksomheder holde sig informerede om de seneste fremskridt. Astera var for eksempel en tidlig adopter af generativ AI, der anvender modeller som OpenAI og LAMA. Kontinuerlig overvågning af opståede teknologier sikrer, at du er godt forberedt på at udnytte dem effektivt.
2. Eksperimenter med multiple modeller og konfigurationer
Med finjustering af LLM’er var vi i stand til at implementere små størrelser, som 8-13 milliarder parameter-modeller, og implementere dem lokalt. Det er noget, der har virket rigtig godt for os, og hvad vi anbefaler, er, at i stedet for kun at bruge en versus den anden, prøv forskellige grund-modeller og konfigurationer og se, hvilken der fungerer for dig.
Store sprog-modeller kommer i forskellige “smagsretninger”, hver med sine unikke evner. Opret en konfiguration, der giver dig mulighed for at vælge mellem et bredt udvalg af muligheder, svarende til, hvad udviklere og data-videnskabsmænd gør i deres data-drevne eventyr. Vores mål har været at integrere disse muligheder i vores produkt, så det giver en dynamisk og tilpasningsdygtig oplevelse for brugerne.
3. Prioriter lokal implementering over API’er
Når det handler om data-centrerede produkter, er det vigtigt at reducere forsinkelser. At afhænge kun af API’er til adgang til AI- og ML-modeller kan introducere uacceptable forsinkelser, især når der håndteres store mængder data. Det er rådeligt at prioritere implementering af finjusterede modeller lokalt, dedikeret til dit specifikke scenario. Dette kan betydeligt forbedre respons-tider og generel præstation.
Hvorfor er Astera en overlegen løsning end konkurrerende platforme?
- Asteras løsninger har en kode-fri, intuitiv, visuel brugerflade samt forbedret brugervenlighed, der er drevet af AI, hvilket gør det let at udføre komplekse data-processer for alle brugere, uanset deres tekniske evner.
- Automations-funktionerne i vores data-stack reducerer gentagne manuelle opgaver og sparer tid og udviklingsressourcer.
- Vores samlede platform kan hjælpe brugere med at udføre end-to-end data-processer uden at skifte løsninger. Dette eliminerer omkostningerne ved at lære og styre multiple, isolerede systemer.
Tak for det gode interview, læsere, der ønsker at lære mere, skal besøge Astera Software.












