Interviews
Jay Mishra, COO van Astera Software – Interview Series

Jay Mishra is de Chief Operating Officer (COO) bij Astera Software, een snelgroeiende aanbieder van ondernemingsklare datasystemen. Zij helpen bedrijfsgebruikers de kloof tussen data en inzicht te overbruggen met een reeks gebruikersvriendelijke, maar hoogwaardige datasystemen voor data-extractie, datakwaliteit, data-integratie, datawarehousing en elektronische gegevensuitwisseling, die worden gebruikt door zowel middelgrote als Fortune 500-bedrijven in een breed scala aan industrieën.
Wat trok je aanvankelijk aan tot informatica?
Ik heb altijd een diepe passie gehad voor wiskunde, en mijn reis naar informatica was een logische uitbreiding daarvan. Mijn undergraduate-opleiding was in wiskunde en informatica, en het was de logische voortzetting van de wereld van wiskunde naar het domein van informatica dat me fascineerde. Wat me in het bijzonder trok, waren de ingewikkelde werkingen van algoritmen en geavanceerde algoritmische processen, die me ertoe brachten om me te specialiseren in algoritmen tijdens mijn master in informatica. Sindsdien is mijn verbinding met informatica sterk gebleven, en ik streef ernaar om altijd op de hoogte te blijven van de laatste ontwikkelingen in het veld.
Je bent momenteel de COO van Astera, kun je ons vertellen wat je dagelijkse rol inhoudt?
Als COO van Astera is mijn rol multifacet, wat de dynamische aard van ons bedrijf weerspiegelt. Ik ben bij Astera sinds de oprichting, en mijn verantwoordelijkheden hebben verschillende gebieden van de organisatie omvat. Dit omvat alles, van actief bijdragen aan de ontwikkeling en codering van onze producten tot ervoor zorgen dat onze functies aansluiten bij de evoluerende behoeften van onze klanten. Ik werk nauw samen met onze klanten, samen met hen om onze oplossingen te verfijnen. Mijn rol gaat verder dan alleen productontwikkeling en omvat verkoop en marketing, waar we onze aanbiedingen op de markt brengen.
Terwijl we in een groeifase zitten, heb ik extra verantwoordelijkheden op me genomen, waaronder het toezicht op onze omzetdoelen en het strategisch uitbreiden van ons productportfolio om nieuwe markten te bereiken. In wezen heb ik een hand in bijna elk aspect van onze operaties, ervoor zorgend dat we niet alleen uitzonderlijke producten bouwen, maar ze ook met succes op de markt brengen en onze bedrijfsdoelstellingen bereiken.
Wat is datawarehousing voor lezers die onbekend zijn met deze term?
Datawarehousing is een architectuurpatroon dat wordt gebruikt om alle ondernemingsdata te consolideren in een centraal repository dat zal dienen als basis voor het genereren van verschillende soorten analyses, rapporten en dashboards die een waarheidsgetrouw beeld zullen geven van de staat van uw bedrijf en ook een prognose zullen geven van hoe het bedrijf in de toekomst zal presteren. Om al dit te ondersteunen, brengt u uw data samen op een bepaalde manier, en die architectuur wordt een datawarehouse genoemd en is ontworpen op een manier die rapportage, met name op basis van tijdslijnen, gemakkelijk maakt. Dat is het hoofddoel van een datawarehouse.
De term is eigenlijk overgenomen uit een echte opslagruimte waar uw producten op georganiseerde planken worden opgeslagen. Maar wanneer u naar de wereld van data gaat, haalt u uw data uit verschillende bronnen. U haalt uw data uit productie, uw website, uw klanten, verkoop en marketing, financiën en uw personeelsafdeling. U brengt al uw data samen, brengt het naar één plek, en dat is wat een datawarehouse wordt genoemd en is ontworpen op een manier die rapportage, vooral op basis van tijdslijnen, gemakkelijk maakt. Dat is het hoofddoel van een datawarehouse.
Wat zijn enkele van de belangrijkste trends in datawarehousing vandaag?
Datawarehousing is de afgelopen 20-25 jaar aanzienlijk geëvolueerd. Ongeveer een decennium geleden zagen we de opkomst van geautomatiseerd datawarehousing, een paradigma-shift die het proces van het bouwen van datamodellen en datawarehouses versnelde. Onlangs heeft automatisering centraal gestaan. Het adresseert de repetitieve aard van datawarehouse-taken, processen stroomlijnt om tijd en middelen te besparen.
Ons product, Astera Data Warehouse Builder, biedt bijvoorbeeld een holistische benadering van automatisering in datawarehousing. Het omvat alles, van het automatiseren van ETL-pijplijnen (Extract, Transform, Load) en datamodellering tot het automatisch laden van data in structuren zoals sterrenschema’s of data-vaults. Bovendien onderhoudt het deze structuren efficiënt via Change Data Capture (CDC)-mechanismen. Deze allesomvattende automatisering is een van de belangrijkste trends in het datawarehouse-landschap.
Voorts is de meest recente trend de fusie tussen datawarehousing en kunstmatige intelligentie (AI). In het bijzonder heeft generatieve AI automatisering naar nieuwe hoogtes gebracht. Het automatiseert niet alleen taken, maar helpt ook gebruikers bij het nemen van beslissingen.
De configuratie van datawarehouse-componenten, pijplijnen en beslissingspunten kan worden geleid door AI, waardoor datawarehousing krachtiger en efficiënter wordt dan ooit tevoren. In wezen is dit automatisering op steroïden, en het verandert het landschap van datawarehousing. Het snijvlak tussen AI en datawarehousing is een trend die veelbelovend is voor de toekomst.
Wat zijn de vier fundamentele principes die bedrijven in overweging moeten nemen voor hun datawarehouse-ontwikkeling?
1. Duidelijke doelstellingen definiëren
Het is essentieel om te beginnen met het begrijpen van wat u precies van uw datawarehouse nodig heeft. Vermijd de veelvoorkomende valkuil van het verzamelen van overtollige data zonder een duidelijk doel. Identificeer in plaats daarvan de specifieke doelstellingen die u met uw datawarehouse wilt bereiken. Welke rapporten en inzichten zoekt u? Door u te concentreren op uw doelstellingen, kunt u ervoor zorgen dat u alleen de data verzamelt die relevant is, in plaats van grote hoeveelheden informatie te verzamelen. Gezien de dalende kosten van opslag en rekenkracht is het cruciaal om deze middelen intelligent en ethisch te gebruiken.
2. Het kiezen van het juiste architectuurpatroon
Architectuurpatronen zijn zeer belangrijk. Zij bepalen of uw datawarehouse-oplossing succesvol zal zijn of niet. Er zijn verschillende opties, variërend van Inmon-stijl datawarehousing tot Ralph Kimballs sterrenschema’s, evenals nieuwere patronen zoals Data Vault en de one big table-benadering die wordt bepleit door columna-databaseleveranciers. Niet alle patronen zullen geschikt zijn voor elke situatie.
We zien meestal een combinatie van sterrenschema’s die bovenop een data-vault zitten. Dus een combinatie van Data Vault en Star Schema is nog steeds het meest gebruikt patroon. Maar, zoals ik zei, voor elke vereiste of elke situatie zal er een ander antwoord zijn. Dus laat het door experts onderzoeken, zie welk architectuurpatroon een goede pasvorm is voor uw situatie.
3. Het selecteren van de juiste tools
Zij zijn zeer belangrijk en maken een groot verschil, zowel in de tijd als de bronnen die nodig zijn om een oplossing te bouwen, en ook de nauwkeurigheid en kwaliteit van uw oplossing, die wordt bepaald door de producten die u gebruikt om uw datawarehouse te bouwen en te onderhouden. Let goed op de mogelijkheden van de producten en kijk naar producten die de meeste vereisten onder één paraplu kunnen brengen. Er zijn bepaalde gebieden, zoals ETL (Extract, Transform, Load), datakwaliteit, datamodellering, dataladen en datapublicatie, die allemaal een significante rol spelen. Als u meerdere producten voor elk van deze gebieden gebruikt, wordt het moeilijk. Kijk dus naar producten die kunnen worden gebruikt om de meeste, zo niet alle, verschillende onderdelen te doen.
4. Uw team
Laatste maar niet de minste, het team van mensen dat u samenstelt om uw datawarehouse-oplossing te bouwen, is het belangrijkste onderdeel. We raden aan iemand te hebben met een sterke achtergrond in data-architectuurpatronen. Wat betreft team samenstelling, cross-functionele teams zijn de beste manier om het te doen, waar u een mix heeft van bedrijfsgebruikers en mensen met enige programmeerachtergrond of tenminste data-expertise, en nauwe samenwerking tussen uw data-custodians, de mensen die verantwoordelijk zijn voor data, en natuurlijk het bedrijf. Door nauwe samenwerking tussen deze verschillende facetten van uw organisatie te stimuleren, kunt u een samenhangend en effectief team creëren dat verantwoordelijk is voor het bouwen en onderhouden van uw datawarehouse-oplossing.
Succes in datawarehousing hangt af van het bereiken van een balans tussen deze vier principes. Deze principes, wanneer zorgvuldig gevolgd, zijn bewezen een recept voor succes in onze ervaring.
Waarom hebben bedrijven een modern data-stack nodig?
Het hangt af van hoe we “modern” definiëren, en dat verandert voortdurend, soms per jaar, maand en zelfs per dag. We moeten moderne toolsets overwegen die zijn ontworpen met het oog op de veranderende landschappen van data. In de afgelopen jaren zijn er significante verschuivingen geweest in de aard en het volume van data. De opkomst van Big Data heeft het datalandschap getransformeerd, met data die van bronnen zoals e-commerce-websites, productiedatabases en verschillende delen van uw bedrijf komt. Deze data verandert niet alleen in volume, maar ook in zijn aard.
In het verleden was data meestal gestructureerd, maar nu speelt ongestructureerde data een significante rol. Bovendien is de snelheid waarmee data wordt gegenereerd en beschikbaar wordt gesteld voor gebruik toegenomen. Gezien deze veranderingen in data, moeten we onze toolset voortdurend evalueren en aanpassen om deze evoluerende data-uitdagingen effectief aan te pakken.
De moderne data-stack is ontworpen om alle variaties in structuren en snelheid van data aan te kunnen en is goed uitgerust om te adapteren aan de opkomende architectuurpatronen die de afgelopen jaren zijn geëvolueerd. Daarom, als u het beste uit uw data wilt halen, moet u uw data-stack moderniseren. Dat is de enige manier om bij te blijven met de nieuwe data-uitdagingen.
We hebben gezien dat bedrijven vasthouden aan bestaande oplossingen die lijken te werken. Het is cruciaal om te erkennen dat data van nature dynamisch is. Het evolueert voortdurend, waardoor nieuwe uitdagingen en kansen ontstaan. Bestaande oplossingen kunnen niet zijn uitgerust om deze veranderingen aan te pakken. Daarom moeten bedrijven het concept van moderniseren van hun data-stack omarmen. Het gaat niet om het breken van wat werkt; het gaat om blijven in een staat van paraatheid en responsiviteit voor de evoluerende aard van data. Door voortdurend de vooruitgang in datatechnologie te evalueren en te integreren, kunnen bedrijven concurrerend blijven en geïnformeerde beslissingen nemen in een steeds meer data-gedreven wereld.
Wat zijn enkele van de huidige data-management-uitdagingen die in de industrie worden gezien?
1. Data-snelheid en -integratie
Een van de grote uitdagingen waar we vandaag mee worden geconfronteerd, is het enorme volume aan data dat vanuit verschillende toepassingen binnenkomt. Als u een typische IT-organisatie neemt, heeft u te maken met nieuwe apps die voortdurend verschijnen – tientallen, soms zelfs honderden per jaar, vooral in middelgrote organisaties.
Al deze apps genereren data, en die data bevat waardevolle inzichten. De belangrijkste zorg hier is de capaciteit om deze nieuwe gegevensbronnen snel in bestaande datapijplijnen te integreren en te consolideren in een uniform beeld. De snelheid waarmee organisaties kunnen aanpassen en deze nieuwe gegevensstromen integreren, is de grootste uitdaging die we zien.
2. Uiteenlopende dataformaten
Een andere kritieke uitdaging komt voort uit de aard van data zelf, met name de toenemende prevalentie van ongestructureerde data. Met ongestructureerde data zijn er, natuurlijk, verschillende meningen over hoe deze te behandelen.
Organisaties moeten beslissen of ze deze data rechtstreeks in data-lakes opslaan voor later gebruik of deze omzetten in een meer gestructureerd formaat voor onmiddellijk gebruik. De uitdaging van het omgaan met ongestructureerde data blijft bestaan, en we zien dat zelfs middelgrote bedrijven of kleine bedrijven hierdoor worden getroffen. Dus, het ontwikkelen van effectieve strategieën voor het omgaan met ongestructureerde data is essentieel.
3. Data-publicatie en -deling
Terwijl data-integratie en -consolidatie cruciaal zijn, is de capaciteit om data effectief te delen even belangrijk. Organisaties hebben mechanismen nodig voor het publiceren en distribueren van data naar interne afdelingen, derde partijen, partners en andere stakeholders. Deze uitdaging gaat verder dan alleen het maken van data toegankelijk; het omvat ook het waarborgen van gegevensbeveiliging, -privacy en -compliance met regelgeving. Aangezien data-delingsmogelijkheden voor bedrijven van alle maten een noodzaak worden, evolueren de technologieën en producten in deze ruimte snel om aan de vraag te voldoen.
Op welke manieren heeft Astera AI geïntegreerd in de workflow van klanten?
We kijken naar AI die op twee verschillende manieren met data-management samenkomen.
1. Gebruikersgemak verbeteren met generatieve AI
Ons diepe engagement voor gebruikersgemak is een hoeksteen van onze productontwikkelingsfilosofie. In de afgelopen 12 tot 13 jaar hebben we een sterke reputatie opgebouwd voor het ontwerpen van producten met een korte leertijd, waardoor ze toegankelijk zijn voor niet-technische gebruikers. Met slechts een matige hoeveelheid training kunnen individuen onze producten effectief gebruiken om significante taken met hun data uit te voeren.
Met de introductie van generatieve AI heeft Astera gebruikersgemak naar een hoger niveau getild. We hebben generatieve AI gebruikt om een gebruikersinterface te creëren die klanten in staat stelt om met het product te communiceren met behulp van natuurlijke taalopdrachten. Deze AI-gestuurde interface vereenvoudigt configuratietaken, waardoor het voor gebruikers intuïtiever en efficiënter wordt.
Bovendien heeft Astera automatisering gestimuleerd door AI om taken te verwerken die eerder enkele uren handmatig werk vereisten, vooral bij de configuratie van data-managementproducten. De grootste kostenfactor bij het bouwen van een data-managementoplossing was niet alleen het kopen van een product, maar ook de tijd en moeite die werden besteed aan het configureren ervan. We hebben dit aangepakt met AI. Deze benadering vermindert de tijd en middelen die traditioneel worden besteed aan productconfiguratie aanzienlijk.
Als voorbeeld vereenvoudigt Astera’s product, ReportMiner, het extraheren van data uit ongestructureerde documenten door gebruikers in staat te stellen extractie-sjablonen te maken op basis van regels. AI kan nu het initiële sjabloon in enkele seconden genereren, een taak die eerder twee tot drie uur duurde voor een typische gebruiker. Het eerste ontwerp van een AI-gegenereerd sjabloon is misschien niet perfect, maar het behandelt ongeveer 90% van de workload, waardoor gebruikers snelle aanpassingen kunnen maken en de taak in enkele minuten in plaats van uren kunnen voltooien. Deze benadering is slechts een voorbeeld van hoe Astera AI gebruikt om gebruikersgemak in al zijn producten te verbeteren.
We doen soortgelijke dingen in onze gehele data-stack, waar we een aanzienlijke verbetering van gebruikersgemak zien met kunstmatige intelligentie.
2. AI-functionaliteit als toolset
Astera biedt een geïntegreerde data-stack die verschillende aspecten van data-management omvat, waaronder ingestie, transformatie, datakwaliteit, datawarehousing, API’s en datapublicatie. Het bedrijf erkent het belang van het bieden van AI-functionaliteit als een veelzijdige toolset voor zijn gebruikers. Binnen deze toolset kunnen klanten van Astera toegang krijgen tot AI over het gehele dataspectrum, van het bouwen en implementeren van machine learning-modellen tot het afhandelen van ML Ops (Machine Learning Operations). Astera ondersteunt ook het gebruik van open-source-modellen, waaronder grote taalmodellen (LLM’s), en vergemakkelijkt het fijn afstemmen voor specifieke use-cases.
Deze bredere AI-functionaliteit stelt gebruikers van Astera in staat om AI te gebruiken voor verschillende data-gerelateerde taken, waaronder het implementeren van machine learning-modellen, ML Ops, en het fijn afstemmen van open-source-modellen. Bovendien werkt Astera voortdurend aan het uitbreiden van zijn AI-ondersteuning, waaronder gebieden zoals vector-databases, overeenkomstige zoekopdrachten, embeddings en meer.
Wat zijn enkele van de beste praktijken om AI en ML-modellen in data-management te benutten voor grote bedrijven?
1. Blijf op de hoogte van AI- en ML-ontwikkelingen
Het veld van grote taalmodellen evolueert snel. Om een concurrentievoordeel te behalen, moeten grote bedrijven op de hoogte blijven van de laatste ontwikkelingen. Astera, bijvoorbeeld, was een vroege aanvaarder van generatieve AI, die modellen zoals OpenAI en LAMA gebruikte. Voortdurend toezicht houden op opkomende technologieën zorgt ervoor dat u goed bent voorbereid om deze effectief te benutten.
2. Experimenteer met meerdere modellen en configuraties
Met het fijn afstemmen van LLM’s konden we kleine maten implementeren, zoals 8 tot 13 miljard parametermodellen, en deze lokaal implementeren. Het is iets dat goed voor ons heeft gewerkt en wat we aanbevelen, is dat in plaats van alleen een te gebruiken, u verschillende basismodellen en configuraties moet proberen en zien welke het beste voor u werkt.
Grote taalmodellen komen in verschillende smaken, elk met zijn unieke capaciteiten. Maak een configuratie die u in staat stelt om te kiezen uit een breed scala aan opties, net zoals ontwikkelaars en datawetenschappers doen in hun data-gedreven ondernemingen. Ons doel is om deze opties naadloos in ons product te integreren, waardoor gebruikers een dynamische en aanpasbare ervaring hebben.
3. Prioriteit geven aan lokale implementatie boven API’s
Wanneer u met data-gerichte producten werkt, is het verminderen van vertragingen van cruciaal belang. Alleen te vertrouwen op API’s voor toegang tot AI- en ML-modellen kan onaanvaardbare vertragingen introduceren, vooral bij het omgaan met grote hoeveelheden data. Het is aan te raden om prioriteit te geven aan het implementeren van fijn afgestemde modellen lokaal, gewijd aan uw specifieke scenario. Deze benadering kan de responstijden en de algehele prestaties aanzienlijk verbeteren.
Waarom is Astera een superieure oplossing in vergelijking met concurrerende platforms?
- Astera’s oplossingen hebben een codevrije, intuïtieve, visuele interface, evenals verbeterd gebruikersgemak dat wordt aangedreven door AI, waardoor het gemakkelijk is om complexe dataprocessen uit te voeren voor alle gebruikers, ongeacht hun technische vaardigheden.
- De automatiseringsfuncties van onze data-stack verminderen herhaalbare handmatige taken en besparen tijd en ontwikkelingsmiddelen.
- Ons geïntegreerde platform kan gebruikers helpen om eind-tot-eind dataprocessen uit te voeren zonder oplossingen te hoeven wisselen. Dit elimineert de kosten van het leren en beheren van meerdere, geïsoleerde systemen.
Bedankt voor het geweldige interview, lezers die meer willen leren, moeten Astera Software bezoeken.












