Intervjuer

Jay Mishra, COO på Astera Software – Intervjuserie

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Jay Mishra är Chief Operating Officer (COO) på Astera Software, en snabbt växande leverantör av företagsklara data Lösningar. De hjälper företagsanvändare att överbrygga gapet mellan data och insikt med en svit av användarvänliga men högpresterande dataextraktion, datakvalitet, dataintegration, datawarehousing och elektronisk datautbyte-lösningar, som används av både medelstora och Fortune 500-företag inom en rad branscher.

Vad var det som initialt drog dig till datavetenskap?

Jag har alltid haft ett djupt rotat intresse för matematik, och min resa inom datavetenskap var en naturlig förlängning av detta. Min grundutbildning var i matematik och datavetenskap, och det var den logiska utvecklingen från matematikens värld till datavetenskapens sfär som fascinerade mig. Vad som särskilt fångade min uppmärksamhet var de intrikata funktionerna i algoritmer och avancerade algoritmiska processer, vilket ledde mig att söka specialisering inom algoritmer under min masterutbildning i datavetenskap. Sedan dess har min koppling till datavetenskap förblivit stark, och jag strävar kontinuerligt efter att hålla mig à jour med de senaste utvecklingarna inom området.

Du är för närvarande COO på Astera, kan du berätta för oss vad din dagliga roll innebär?

Som COO på Astera är min roll mångfacetterad, vilket speglar företagets dynamiska natur. Jag har varit med Astera sedan dess begynnelse, och mina ansvarsområden har omfattat olika delar av organisationen. Detta inkluderar allt från att aktivt bidra till utveckling och kodning av våra produkter till att säkerställa att våra funktioner motsvarar kundernas föränderliga behov. Jag samarbetar nära med våra kunder, arbetar tillsammans med dem för att finslipa våra lösningar. Min roll sträcker sig bortom produktutveckling till att omfatta försäljning och marknadsföring, där vi tar våra erbjudanden till marknaden.

Som vi befinner oss i en tillväxtfas har jag tagit på mig ytterligare ansvar, inklusive att övervaka våra intäktsmål och strategiskt expandera vår produktportfölj för att nå nya marknader. I grund och botten har jag ett finger med i nästan alla aspekter av vår verksamhet, för att säkerställa att vi inte bara bygger exceptionella produkter utan också framgångsrikt tar dem till marknaden och uppfyller våra affärsmål.

För läsare som är ovana vid denna term, vad är datawarehousing?

Datawarehousing är en arkitektonisk modell som används för att konsolidera all er företagsdata i ett centraliserat repository som kommer att fungera som en grund från vilken ni kan generera olika typer av analyser, rapporter och instrumentpaneler som kommer att presentera den sanna bilden av var ert företag befinner sig och också förutsäga hur företaget kommer att utvecklas i framtiden. För att tillgodose allt detta samlar ni in er data på ett visst sätt och den arkitekturen kallas för ett datawarehouse.

Termen är faktiskt tagen från en verklig lagerbyggnad där era produkter lagras på organiserade hyllor. Men när ni kommer in i data-världen samlar ni in er data från olika källor. Ni samlar in er data från produktion, er webbplats, era kunder, försäljning och marknadsföring, finans och er personalavdelning. Ni samlar all data i en plats, och det är vad som kommer att kallas ett datawarehouse och är utformat på ett visst sätt så att rapportering, särskilt baserat på tidsaxel, kommer att vara enkel. Det är det primära syftet med ett datawarehouse.

Vilka är några av de viktigaste trenderna inom datawarehousing idag?

Datawarehousing har utvecklats ganska mycket under de senaste 20-25 åren. För ungefär ett decennium sedan såg vi uppkomsten av automatiserat datawarehousing, en paradigmskiftning som accelererade processen att bygga datamodeller och datawarehouses. Nyligen har automation hamnat i fokus. Det tar itu med den repetitiva naturen hos datawarehousing-uppgifter, strömlinjeformar processer för att spara tid och resurser.

Vår produkt, Astera Data Warehouse Builder, till exempel erbjuder en holistisk approach till automation inom datawarehousing. Den täcker allt från automatisering av ETL (Extract, Transform, Load)-pipelines och datamodellering till automatisk inläsning av data i strukturer som stjärnscheman eller data vaults. Dessutom underhåller den effektivt dessa strukturer genom Change Data Capture (CDC)-mekanismer. Denna allomfattande automation har framträtt som en viktig trend inom datawarehousing-landskapet.

Det senaste är fusionen mellan datawarehousing och artificiell intelligens (AI). Specifikt har genererande AI tagit automation till nya höjder. Den automatiserar inte bara uppgifter utan hjälper också användare i beslutsfattandet.

Konfiguration av datawarehousing-komponenter, pipelines och beslutsfattandepunkter kan vägledas av AI, vilket gör datawarehousing mer kraftfullt och effektivt än någonsin tidigare. I själva verket är detta automation på steroider, och det förändrar datawarehousing-landskapet. Intersektionen mellan AI och datawarehousing är en trend som bär stort löfte för framtiden.

Vilka är de fyra grundläggande principerna som företag bör överväga för sin datawarehouse-utveckling?

1. Definiera tydliga mål

Det är viktigt att börja med att förstå exakt vad ni behöver från ert datawarehouse. Undvik den vanliga fällan att samla in för mycket data utan ett tydligt syfte. Istället identifiera de specifika mål ni vill uppnå med ert datawarehouse. Vilka rapporter och insikter söker ni? Genom att fokusera på era mål kan ni säkerställa att ni bara tar in den data som är relevant, snarare än att samla in stora mängder information utan syfte. Med tanke på den minskande kostnaden för lagring och beräkningskraft är det viktigt att använda dessa resurser på ett intelligent och etiskt sätt.

2. Välj rätt arkitektonisk modell

Arkitektoniska modeller är mycket viktiga. De bestämmer om er datawarehousing-lösning kommer att vara framgångsrik eller inte. Det finns olika alternativ, från Inmon-stil datawarehousing till Ralph Kimballs stjärnscheman, samt nya mönster som Data Vault och en stor tabell-approach som förespråkas av columna-databasleverantörer. Inte alla mönster kommer att passa varje scenario.

Vi ser mestadels en kombination av stjärnschema som sitter ovanpå en data vault. Så en kombination av Data Vault och Star Schema är fortfarande den mest använda modellen. Men, som jag sa, för varje krav eller scenario kommer det att finnas ett annat svar. Så kör det genom experter, se vilken arkitektonisk modell som passar för ert scenario.

3. Välj rätt verktyg

De är mycket viktiga och de gör en enorm skillnad igen på den tid och de resurser som behövs för att bygga en lösning och också kvaliteten på er lösning, som bestäms av de produkter ni använder för att bygga och underhålla ert datawarehouse. Lägg stor vikt vid produktens förmåga och titta på produkter som kan ta in de flesta kraven under ett och samma paraply. Det finns vissa områden som ETL (Extract, Transform, Load), datakvalitet, datamodellering, datainläsning och datapublicering som alla spelar en betydande roll. Om ni försöker använda flera produkter för var och en av dessa områden kommer det att bli svårt. Så titta på produkter som kan användas för att göra de flesta, om inte alla, av de olika beståndsdelarna.

4. Ert team

Sist men inte minst, teamet av människor som ni samlar för att bygga er datawarehouse-lösning är den viktigaste delen. Vi rekommenderar att ha någon med en stark bakgrund inom data-arkitektoniska mönster. När det gäller team-sammansättning är tvärfunktionella team det bästa sättet att gå tillväga, där ni har en mix av affärsanvändare och personer med viss programmeringsbakgrund eller åtminstone dataexperter och ha nära samarbete mellan era dataförvaltare, de som är ansvariga för data och naturligtvis affären. Genom att främja nära samarbete mellan dessa olika aspekter av er organisation kan ni skapa ett sammanhållet och effektivt team som ansvarar för att bygga och underhålla er datawarehousing-lösning.

Lyckande inom datawarehousing hänger på att uppnå en balans mellan dessa fyra principer. Dessa principer, när de följs noggrant, har visat sig vara en recept för framgång i vår erfarenhet.

Varför behöver företag ett modernt datastack?

Det beror på hur vi definierar “modernt” och det förändras ständigt, ibland per år, månad och till och med per dag. Vi måste överväga moderna verktygssatser som är utformade med den föränderliga data-landskapet i åtanke. Under de senaste åren har det skett betydande förändringar i data-landskapet, med data som strömmar in från källor som e-handelswebbplatser, produktionsdatabaser och olika delar av er verksamhet. Denna data förändras inte bara i volym utan också i sin natur.

I det förflutna var data mestadels strukturerad, men nu spelar ostrukturerad data en betydande roll. Dessutom har hastigheten med vilken data genereras och görs tillgängligt för användning ökat. Med tanke på dessa förändringar i data måste vi kontinuerligt utvärdera och anpassa vår verktygssats för att effektivt hantera dessa föränderliga data-utmaningar.

Den moderna datastacken är utformad för att hantera alla variationer i datastrukturer och hastighet, och den är välutrustad för att anpassa sig till de framväxande arkitektoniska mönstren som har utvecklats under de senaste åren. Därför, om ni vill göra bästa möjliga användning av er data, måste ni se till att modernisera er datastack. Det är det enda sättet att hålla jämna steg med de nya data-utmaningarna.

Vi har sett att företag håller fast vid befintliga lösningar som verkar fungera. Det är viktigt att erkänna att data i sig är inneboende dynamiskt. Det förändras kontinuerligt, presenterar nya utmaningar och möjligheter. Befintliga lösningar kanske inte är utrustade för att anpassa sig till dessa förändringar. Därför, för att utnyttja full potentialen av sin data, måste företag anta konceptet att modernisera sin datastack. Det handlar inte om att bryta det som fungerar; det handlar om att förbli agila och responsiva till data-landskapets förändringar. Genom att kontinuerligt utvärdera och integrera framsteg inom data-teknologi kan företag förbli konkurrenskraftiga och fatta informerade beslut i en alltmer data-driven värld.

Vilka är några av de nuvarande datahanteringsutmaningarna som ses inom branschen?

1. Datahastighet och integration

En av de stora utmaningarna vi står inför idag är den enorma mängden data som strömmar in från olika applikationer. Om ni tar en typisk IT-organisation, hanterar de nya appar som dyker upp hela tiden – dussintals, ibland till och med hundratals varje år, särskilt i medelstora organisationer.

Nu genererar alla dessa appar data, och den datan innehåller värdefulla insikter. Det primära problemet här är förmågan att snabbt integrera dessa nya datakällor i befintliga data-pipelines och konsolidera dem i en enhetlig vy. Förmågan hos organisationer att anpassa sig till och inkorporera dessa nya dataströmmar är den största utmaningen vi ser.

2. Varierande dataformat

En annan kritisk utmaning härrör från datans natur, särskilt den ökande förekomsten av ostrukturerad data. Med ostrukturerad data finns det, naturligtvis, olika skolor av tankar om hur man hanterar den.

Organisationer måste bestämma om de ska lagra denna data direkt i data-sjöar för senare användning eller omvandla och transformera den till en mer strukturerad format för omedelbar konsumtion. Utmaningen med att hantera ostrukturerad data kvarstår, och vi ser att även medelstora företag eller små företag påverkas av det. Så, att utveckla effektiva strategier för att hantera ostrukturerad data är avgörande.

3. Datapublicering och delning

Medan dataintegration och konsolidering är avgörande, är förmågan att dela data effektivt lika viktig. Organisationer behöver mekanismer för att publicera och distribuera data till interna avdelningar, tredjepartsleverantörer, partners och andra intressenter. Denna utmaning sträcker sig bortom att bara göra data tillgänglig; det handlar om att säkerställa data-säkerhet, sekretess och regelefterlevnad. När data-delning blir en nödvändighet för företag av alla storlekar, utvecklas teknologierna och produkterna i detta område snabbt för att möta efterfrågan.

Vilka är några sätt som Astera har integrerat AI i kundernas arbetsflöde?

Vi ser på AI som möter datahantering på två distinkta sätt.

1. Förbättrar användbarheten med genererande AI

Vår djupa engagemang för användbarhet är en hörnsten i vår produktutvecklingsfilosofi. Under de senaste 12-13 åren har vi byggt ett starkt rykte för att designa produkter med en kort inlärningskurva, vilket gör dem tillgängliga även för icke-tekniska användare. Med bara en måttlig mängd utbildning kan individer effektivt använda våra produkter för att utföra meningsfulla uppgifter med sin data.

Med introduktionen av genererande AI har Astera tagit användbarheten till en ny nivå. Vi har använt genererande AI för att skapa ett användargränssnitt som tillåter kunder att interagera med produkten med hjälp av naturliga språkkommandon. Detta AI-drivna gränssnitt förenklar konfigurationsuppgifter, vilket gör det mer intuitivt och effektivt för användare.

Dessutom har Astera integrerat automation som drivs av AI för att hantera uppgifter som tidigare krävde flera timmars manuellt arbete, särskilt vid konfiguration av datahanteringsprodukter. Den största kostnadsfaktorn för att bygga en datahanteringslösning var inte bara att köpa en produkt, utan den tid och ansträngning som lades på konfigurationen. Vi har försökt att adressera detta med AI. Detta tillvägagångssätt minskar avsevärt den tid och de resurser som traditionellt spenderas på produktkonfiguration.

Som exempel förenklar Asteras produkt, ReportMiner, extrahering av data från ostrukturerade dokument genom att tillåta användare att skapa extraheringsmallar baserade på regler. AI kan nu generera den första mallen på bara några sekunder, en uppgift som tidigare tog två till tre timmar för en genomsnittsanvändare. Den första versionen av en AI-genererad mall kanske inte är perfekt, men den hanterar cirka 90% av arbetsbördan, vilket gör det möjligt för användare att göra snabba justeringar och slutföra uppgiften på några minuter istället för timmar. Detta tillvägagångssätt är bara ett exempel på hur Astera använder AI för att förbättra användbarheten i sina produkter.

Vi gör liknande saker i hela vår datastack, där vi får en betydande förbättring av användbarheten med artificiell intelligens.

2. AI-funktionalitet som en verktygssats

Astera erbjuder en enhetlig datastack som täcker olika aspekter av datahantering, inklusive inmatning, transformation, datakvalitet, datawarehousing, API:er och datapublicering. Företaget erkänner vikten av att tillhandahålla AI-funktionalitet som en mångsidig verktygssats för sina användare. Inom denna verktygssats kan Asteras kunder komma åt AI över hela data-vetenskaps-spektrumet, från att bygga och distribuera maskinlärningsmodeller till att hantera ML-åtgärder (Machine Learning Operations). Astera stöder också användningen av öppen källkods-baserade modeller, inklusive stora språkmodeller (LLM), och underlättar finjustering för specifika användningsfall.

Denna breda AI-funktionalitet ger Asteras användare möjlighet att utnyttja AI för olika data-relaterade uppgifter, inklusive distribution av maskinlärningsmodeller, implementering av ML-åtgärder och finjustering av öppen källkods-modeller. Dessutom arbetar Astera kontinuerligt med att expandera sitt AI-stöd, som omfattar områden som vektordatabaser, likhets-sökningar, inbäddningar och mer.

Vilka är några av de bästa metoderna för att utnyttja AI och ML-modeller i datahantering för stora företag?

1. Håll er à jour med AI- och ML-utvecklingar

Området för stora språkmodeller utvecklas snabbt. För att få en konkurrensfördel bör stora företag hålla sig informerade om de senaste framstegen. Astera, till exempel, var en tidig adopterare av genererande AI, som använder modeller som OpenAI och LAMA. Kontinuerlig övervakning av framväxande teknologier säkerställer att ni är väl förberedda på att utnyttja dem effektivt.

2. Experimentera med flera modeller och konfigurationer

Användning av finjustering av LLM, kunde vi distribuera små storlekar, som 8 till 13 miljarder parametermodeller, och distribuera dem lokalt. Det är något som har fungerat riktigt bra för oss, och vad vi rekommenderar är att istället för att bara använda en versus den andra, prova olika basmodeller och konfigurationer och se vilken som fungerar för er.

Stora språkmodeller kommer i olika smaker, var och en med sina unika förmågor. Skapa en konfiguration som tillåter er att välja mellan ett brett utbud av alternativ, liknande vad utvecklare och data-vetare gör i sina data-vetenskapsliga resor.

För att ge användarna möjlighet har vi skapat ett konfigurationssystem som erbjuder ett omfattande urval av alternativ, liknande vad utvecklare och data-vetare möter när de arbetar med öppen källkods-bibliotek i sina data-drivna företag. Vårt mål har varit att integrera dessa alternativ i vår produkt på ett smidigt och anpassningsbart sätt för användarna.

3. Prioritera lokal distribution framför API:er

När det gäller data-centrerade produkter är det viktigt att minska fördröjningar. Att enbart förlita sig på API:er för AI- och ML-modellåtkomst kan introducera oacceptabla fördröjningar, särskilt när man hanterar stora mängder data. Det är rekommenderat att prioritera distribution av finjusterade modeller lokalt, dedikerade till er specifika scenario. Detta tillvägagångssätt kan förbättra svarstider och övergripande prestanda avsevärt.

Varför är Astera en överlägsen lösning jämfört med konkurrerande plattformar?

  • Asteras lösningar har ett kodfritt, intuitivt och visuellt gränssnitt tillsammans med förbättrad användbarhet som drivs av AI, vilket gör det enkelt att utföra komplexa data-processer för alla användare, oavsett deras tekniska färdigheter.
  • Automationsfunktionerna i vår datastack minskar återkommande manuella uppgifter och sparar tid och utvecklingsresurser.
  • Vår enhetliga plattform kan hjälpa användare att utföra slut-till-slut-data-processer utan att byta lösningar. Detta eliminerar kostnaden för att lära sig och hantera flera, isolerade system.

Tack för den underbara intervjun, läsare som vill lära sig mer bör besöka Astera Software.

Antoine är en visionär ledare och medgrundare av Unite.AI, driven av en outtröttlig passion för att forma och främja framtidens AI och robotik. En serieentreprenör, han tror att AI kommer att vara lika störande för samhället som elektricitet, och han fångas ofta i att prata om potentialen för störande teknologier och AGI.

Som en futurist är han dedikerad till att utforska hur dessa innovationer kommer att forma vår värld. Dessutom är han grundare av Securities.io, en plattform som fokuserar på att investera i banbrytande teknologier som omdefinierar framtiden och omformar hela sektorer.