Intervjuer

Jay Mishra, COO i Astera Software – Intervju-serie

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Jay Mishra er Chief Operating Officer (COO) i Astera Software, en raskt voksende leverandør av bedriftsklare data-løsninger. De hjelper bedriftsbrukere med å brygge gapet mellom data og innsikt med en samling av brukervennlige, men høy-ytelses data-utvinning, data-kvalitet, data-integrasjon, data-warehouse og elektronisk data-utveksling løsninger, som brukes av både mellomstore og Fortune 500-selskaper over en rekke bransjer.

Hva var det som opprinnelig tiltalte deg til datavitenskap?

Jeg har alltid hatt en dyp rotfestet lidenskap for matematikk, og min reise inn i datavitenskap var en naturlig utvidelse av det. Min bachelor-utdanning var i matematikk og datavitenskap, og det var den logiske utviklingen fra matematikkens verden til datavitenskapens rike som fascinerte meg. Det som særlig fanget min oppmerksomhet var de intrikate arbeidene med algoritmer og avanserte algoritmiske prosesser, som ledet meg til å søke spesialisering i algoritmer under min master i datavitenskap. Siden da har min tilknytning til datavitenskap vært sterk, og jeg streber kontinuerlig å holde meg oppdatert på de siste utviklingene i feltet.

Du er nå COO i Astera, kan du dele med oss hva din dag-til-dag rolle omfatter?

Som COO i Astera er min rolle flerfoldig, og reflekterer selskapets dynamiske natur. Jeg har vært med Astera siden oppstarten, og mine ansvarsområder har spennt over ulike deler av organisasjonen. Dette inkluderer alt fra å bidra aktivt til utviklingen og kodningen av våre produkter til å sikre at våre funksjoner er i tråd med kundenes evoluerende behov. Jeg samarbeider nært med våre kunder, og arbeider sammen med dem for å finjustere våre løsninger. Min rolle går utover produktutvikling til å omfatte salg og markedsføring, hvor vi bringer våre tilbud til markedet.

Da vi er i en vekstfase, har jeg overtatt ytterligere ansvar, inkludert å overvåke våre inntektsmål og strategisk utvide vårt produktportefølje for å nå nye markeder. Essensielt har jeg en hånd i nesten alle aspekter av våre operasjoner, og sikrer at vi ikke bare bygger eksepsjonelle produkter, men også suksessfullt bringer dem til markedet og møter våre forretningsmål.

Hva er data-warehouse for de som ikke er kjent med denne betegnelsen?

Data-warehouse er en arkitektonisk mønster brukt til å konsolidere all bedriftens data i en sentralisert repository som vil tjene som en basis for å generere ulike typer analyser, rapporter og dashboards som vil presentere det sanne bildet av hvor bedriften er og også forutsi hvordan bedriften vil være i fremtiden. For å møte alle disse behovene bringer du dataene sammen på en bestemt måte, og den arkitekturen kalles et data-warehouse.

Begrepet er faktisk tatt fra et virkelig lager hvor produktene dine lagres på organiserte hyller. Men når du kommer til data-verdenen, bringer du dataene dine fra ulike kilder. Du bringer dataene dine fra produksjon, nettsted, kunder, salg og markedsføring, finans og HR-avdeling. Du bringer alle dataene sammen, og det kalles et data-warehouse, og er designet på en bestemt måte så at rapportering, spesielt basert på tidsline, blir enkelt. Det er hovedformålet med et data-warehouse.

Hva er noen av de viktigste trendene i data-warehouse i dag?

Data-warehouse har utviklet seg mye de siste 20-25 årene. For omtrent ett tiår siden så vi oppblomstringen av automatisert data-warehouse, en paradigmeskifte som akselererte prosessen med å bygge data-modeller og data-warehouse. Nylig har automatisering fått en sentral rolle. Den addreserer den repetitive naturen til data-warehouse-oppgaver, og strømlinjeformer prosesser for å spare tid og ressurser.

Vårt produkt, Astera Data Warehouse Builder, tilbyr for eksempel en helhetlig tilnærming til automatisering i data-warehouse. Det dekker alt fra automatisering av ETL-pipelines og data-modellering til automatisk lasting av data i strukturer som stjerneskjema eller data-vault. Videre vedlikeholder det disse strukturene gjennom Change Data Capture-mekanismer. Denne allomfattende automatiseringen har oppstått som en viktig trend i data-warehouse-landskapet.

Fortsatt er den nyeste trenden fusjonen mellom data-warehouse og kunstig intelligens (AI). Spesielt har generativ AI ført automatisering til nye høyder. Den automatiserer ikke bare oppgaver, men hjelper også brukerne i beslutningsprosessen.

Konfigurasjon av data-warehouse-komponenter, pipelines og beslutningspunkter kan bli guidet av AI, og gjør data-warehouse mer kraftfull og effektiv enn noen gang før. I essensen er dette automatisering på steroider, og det transformerer data-warehouse-landskapet. Interseksjonen mellom AI og data-warehouse er en trend som holder stor løfte for fremtiden.

Hva er de fire grunnleggende prinsippene som bedrifter bør vurdere for sin data-warehouse-utvikling?

1. Definere klare mål

Det er essensielt å begynne med å forstå nøyaktig hva du trenger fra ditt data-warehouse. Unngå den vanlige fella av å samle inn for mye data uten en klar hensikt. Isteden, identifiser de spesifikke målene du ønsker å oppnå med ditt data-warehouse. Hvilke rapporter og innsikter søker du? Ved å fokusere på dine mål, kan du sikre at du bare bringer inn relevante data, og ikke samler inn store mengder informasjon uten noen formål. Gitt de synkende kostnadene for lagring og beregningskraft, er det viktig å bruke disse resursene intelligent og etisk.

2. Velge riktig arkitektonisk mønster

Arkitektoniske mønster er veldig viktig. De bestemmer om ditt data-warehouse-løsning vil være suksessfull eller ikke. Det finnes ulike alternativer, fra Inmon-stil data-warehouse til Ralph Kimballs stjerneskjema, samt nye mønster som Data Vault og den ene store tabell-tilnærmingen som forkastes av columna database-leverandører. Ikke alle mønster vil være egnet for hver scenario.

Vi ser mest en kombinasjon av stjerneskjema som sitter øverst på en data-vault. Så en kombinasjon av Data Vault og Star Schema er fortsatt det mest brukte mønsteret. Men, som jeg sa, for hvert krav eller hver scenario vil det være et annet svar. Så kjør det gjennom eksperter, se hvilket arkitektonisk mønster som er en god passform for ditt scenario.

3. Velge riktig verktøy

De er veldig viktig og de gjør en stor forskjell igjen på tiden og resursene som trengs for å bygge en løsning, og også på nøyaktigheten og kvaliteten på din løsning, som bestemmes av produktene du vil bruke til å bygge og vedlikeholde ditt data-warehouse. Legg mye merke til produktets evner og se på produktene som kan bringe inn de fleste krav under ett paraply. Det finnes visse områder som ETL, data-kvalitet, data-modellering, data-lasting og data-publikasjon som alle spiller en betydelig rolle. Hvis du prøver å bruke flere produkter for hvert av disse områdene, vil det bli vanskelig. Så se på produktene som kan brukes til å gjøre de fleste, om ikke alle, av disse bestanddelene.

4. Ditt team

Sist, men ikke minst, er teamet av menneskene du samler for å bygge din data-warehouse-løsning det viktigste delen. Vi anbefaler å ha noen med en sterk bakgrunn i data-arkitektoniske mønster. I forhold til team-sammensetning er tverrfaglige teamer den beste måten å gå frem på, hvor du har en blanding av bedriftsbrukere og mennesker med noe programmeringsbakgrunn eller i det minste data-ekspertise og har tett samarbeid mellom dine data-forvaltere, de som er ansvarlige for data, og bedriftsbrukerne. Ved å fremme tett samarbeid mellom disse ulike delene av din organisasjon, kan du skape en samlet og effektiv team som er ansvarlig for å bygge og vedlikeholde din data-warehouse-løsning.

Suksess i data-warehouse henger av å oppnå en balanse mellom disse fire prinsippene. Disse prinsippene, når de følges nøye, har vist seg å være en oppskrift for suksess i vår erfaring.

Hvorfor trenger bedrifter en moderne data-stack?

Det avhenger av hvordan vi definerer “moderne” og det endrer seg, noen ganger årlig, månedlig og selv daglig. Vi må vurdere moderne verktøysett designet med den endrede datalandskapet i tankene. De siste årene har det vært betydelige endringer i naturen og volumet av data. Oppblomstringen av Big Data har forandret datalandskapet, med data som strømmer inn fra kilder som e-handels-nettsteder, produksjons-databaser og ulike deler av din bedrift. Denne dataen endrer ikke bare volum, men også sin egen natur.

I fortiden var dataen mest strukturert, men nå spiller ustrukturert data en betydelig rolle. I tillegg har hastigheten som data genereres og gjøres tilgjengelig for bruk økt. Gitt disse endringene i data, må vi kontinuerlig evaluere og tilpasse vårt verktøysett for å effektivt møte disse evoluerende data-utfordringene.

Den moderne data-staken er designet for å håndtere alle variasjonene i struktur og hastighet, og den er godt utstyrt for å tilpasse seg de nye arkitektoniske mønsterene som har utviklet seg de siste årene. Derfor, hvis du ønsker å gjøre best bruk av din data, må du se på å modernisere din data-stack. Det er den eneste måten å holde tritt med de nye data-utfordringene.

Vi har sett at bedrifter holder fast ved eksisterende løsninger som ser ut til å fungere. Det er viktig å erkjenne at dataen i seg selv er innebygget dynamisk. Den utvikler seg kontinuerlig, og presenterer nye utfordringer og muligheter. Eksisterende løsninger kan ikke være utstyrt for å tilpasse seg disse endringene. Derfor må bedrifter omfavne konseptet om å modernisere sin data-stack for å utnytte fullt potensialet av sin data. Det handler ikke om å bryte det som fungerer, men om å holde seg smidig og responsiv til den evoluerende naturen av data. Ved å kontinuerlig evaluere og integrere fremgang i data-teknologi, kan bedrifter forbli konkurransedyktige og ta informerte beslutninger i en stadig mer data-drevet verden.

Hva er noen av de nåværende data-håndtering-utfordringene som sees i industrien?

1. Data-hastighet og -integrasjon

En av de største utfordringene vi møter i dag er det enorme volumet av data som strømmer inn fra ulike applikasjoner. Hvis du tar en typisk IT-organisasjon, har de å gjøre med nye apper som dukker opp hele tiden – titalls, noen ganger endat hundrevis hvert år, spesielt i mellomstore organisasjoner.

Nå, all denne dataen inneholder verdifulle innsikter. Den primære bekymringen her er evnen til å raskt integrere disse nye data-kildene i eksisterende data-pipelines og konsolidere dem i en samlet visning. Hastigheten som organisasjoner kan tilpasse seg og inkorporere disse nye data-strømmene er den største utfordringen vi ser.

2. Varierte data-formater

En annen kritisk utfordring stammer fra dataens egen natur, spesielt den økende forekomsten av ustrukturert data. Med ustrukturert data er det, naturligvis, ulike skoler av tanker om hvordan å håndtere det.

Organisasjoner må avgjøre om de skal lagre denne dataen direkte i data-sjøer for senere bruk eller om de skal ekstrahere og transformere den til en mer strukturert format for umiddelbar forbruk. Utfordringen med å håndtere ustrukturert data består, og vi ser at selv mellomstore eller små selskaper blir berørt av det. Så å utvikle effektive strategier for å håndtere ustrukturert data er essensielt.

3. Data-publikasjon og -deling

Mens data-integrasjon og -konsolidering er kritiske, er evnen til å dele data effektivt like viktig. Organisasjoner trenger mekanismer for å publisere og distribuere data til interne avdelinger, tredjeparts-leverandører, partnere og andre interessenter. Denne utfordringen strekker seg utover å gjøre data tilgjengelig; den handler om å sikre data-sikkerhet, personvern og overholdelse av regler. Ettersom data-delingsbehovet blir en nødvendighet for bedrifter av alle størrelser, utvikler teknologiene og produktene i dette området seg raskt for å møte etterspørselen.

Hva er noen måter Astera har integrert AI i kundens arbeidsflyt?

Vi ser på AI som møter data-håndtering på to distinkte måter.

1. Forbedring av brukervennlighet med generativ AI

Vår dyptgående forpliktelse til brukervennlighet er en hjørnesten i vår produktutviklingsfilosofi. Over de siste 12-13 årene har vi bygget en sterk reputasjon for å designe produkter med en kort læringskurve, som gjør dem tilgjengelige selv for ikke-tekniske brukere. Med bare en beskjeden mengde trening kan individer effektivt bruke våre produkter til å utføre meningsfulle oppgaver med sine data.

Med introduksjonen av generativ AI har Astera tatt brukervennlighet til et nytt nivå. Vi har brukt generativ AI til å skape en brukergrensesnitt som tillater kunder å interagere med produktet ved hjelp av naturlig språk-kommandoer. Dette AI-drevne grensesnitt forenkler konfigurasjonsoppgaver og gjør det mer intuitivt og effektivt for brukerne.

2. AI-funksjonalitet som et verktøysett

Astera tilbyr en samlet data-stack som dekker ulike aspekter av data-håndtering, inkludert innsamling, transformasjon, data-kvalitet, data-warehouse, API-er og data-publikasjon. Selskapet erkjenner viktigheten av å tilby AI-funksjonalitet som et fleksibelt verktøysett for sine brukere. Innenfor dette verktøysettet kan Astera-kunder få tilgang til AI over hele data-vitenskaps-spekteret, fra å bygge og deployere maskinlæringsmodeller til å håndtere ML-Operasjoner. Astera støtter også bruk av åpne kilde-baserte modeller, inkludert store språk-modeller, og fasiliteter for finjustering for spesifikke brukstilfeller.

Hva er noen av de beste praksisene for å utnytte AI og ML-modeller i data-håndtering for store selskaper?

1. Hold deg foran AI- og ML-utviklingene

Feltet av store språk-modeller utvikler seg raskt. For å få en konkurransefordel bør store selskaper holde seg informert om de siste fremgangene. Astera, for eksempel, var en tidlig adoptør av generativ AI, og brukte modeller som OpenAI og LAMA. Kontinuerlig overvåking av nye teknologier sikrer at du er godt forberedt på å utnytte dem effektivt.

2. Eksperiment med flere modeller og konfigurasjoner

Med finjustering av store språk-modeller har vi kunnet deployere små størrelser, som 8 til 13 milliarder parameter-modeller, og deployere dem lokalt. Det har fungert svært godt for oss, og det vi anbefaler er at i stedet for å bare bruke en versus en annen, prøv ut ulike basis-modeller og ulike konfigurasjoner og se hvilken som fungerer best for deg.

Store språk-modeller kommer i ulike smaker, hver med sine unike evner. Skap en konfigurasjon som tillater deg å velge fra et bredt utvalg av alternativer, tilsvarende hva utviklere og data-vitenskapsmenn gjør i sine data-drevne prosjekter.

3. Prioriter lokal deployering over API-er

Når du håndterer data-sentriske produkter er det viktig å redusere forsinkelser. Å være avhengig bare av API-er for AI- og ML-modell-tilgang kan introdusere uakseptable forsinkelser, spesielt når du håndterer store volumer av data. Det er råd å prioritere deployering av finjusterte modeller lokalt, dedikert til ditt spesifikke scenario. Dette kan betydelig forbedre respons-tidene og den overordnede ytelsen.

Hvorfor er Astera en overlegen løsning enn konkurrerende plattformer?

  • Asteras løsninger har et kode-fritt, intuitivt og visuelt grensesnitt samt forbedret brukervennlighet drevet av AI, som gjør det enkelt å utføre komplekse data-prosesser for alle brukere, uavhengig av deres tekniske evner.
  • Automatiseringsfunksjonene i vår data-stack kutte ned på gjentakende manuelle oppgaver og spare tid og utviklingsressurser.
  • Vår samlede plattform kan hjelpe brukere med å utføre end-to-end data-prosesser uten å bytte løsninger. Dette eliminerer utgiftene med å lære og håndtere multiple, isolerte systemer.

Takk for det flotte intervjuet, lesere som ønsker å lære mer bør besøke Astera Software.

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.