Rozhovory

Jay Mishra, COO společnosti Astera Software – Interview Series

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Jay Mishra je provozní ředitel (COO) společnosti Astera Software, která je rychlý růst poskytovatele podnikových řešení pro zpracování dat. Pomáhají uživatelům překlenout mezеру mezi daty a poznatky pomocí sady uživatelsky přívětivých, ale zároveň vysoce výkonných řešení pro extrakci dat, kvalitu dat, integraci dat, datové sklady a elektronickou výměnu dat, která jsou používána středními a společnostmi Fortune 500 napříč různými odvětvími.

Co vás původně přitáhlo k informatice?

Vždy jsem měl hluboce zakořeněnou vášeň pro matematiku a moje vstup do informatiky byl přirozeným pokračováním toho. Moje vysokoškolské vzdělání bylo v oboru Matematika a Informatika a bylo to logické pokračování ze světa matematiky do oblasti informatiky, co mě fascinovalo. Co mě zvlášť upoutalo, byly intrikované fungování algoritmů a pokročilých algoritmických procesů, které mě vedly k tomu, abych se specializoval na algoritmy během svého magisterského studia v oboru Informatika. Od té doby můj vztah k informatice zůstal silný a neustále se snažím být v obraze posledních trendů v tomto oboru.

Jste aktuálně provozním ředitelem Astery, můžete nám říci, co vaše denní role zahrnuje?

Jako provozní ředitel Astery je moje role multifacetová, což odráží dynamickou povahu naší společnosti. Jsem u Astery od jejího založení a moje odpovědnosti zahrnovaly různé oblasti organizace. To zahrnuje vše od aktivní účasti na vývoji a kódování našich produktů až po zajištění toho, aby naše funkce odpovídaly měnícím se potřebám našich zákazníků. Úzce spolupracuji se našimi zákazníky, pracuji s nimi ruku v ruce, abychom našimi řešeními mohli jemně doladit. Moje role přesahuje produktový vývoj a zahrnuje také prodej a marketing, kde naše nabídky přinášíme na trh.

Jelikož jsme ve fázi růstu, jsem převzal další odpovědnosti, včetně dohledu nad našimi cíli výnosů a strategického rozšíření našeho produktového portfolia, abychom mohli dosáhnout nových trhů. V podstatě, mám účast v téměř všech aspektech našich operací, abychom nejenom vytvořili výjimečné produkty, ale také je úspěšně uvedli na trh a dosáhli našich obchodních cílů.

Pro čtenáře, kteří nejsou seznámeni s tímto termínem, co je datové skladiště?

Datové skladiště je architektonický vzor, který se používá ke konsolidaci všech vašich podnikových dat do centralizovaného úložiště, které bude sloužit jako základ pro generování různých typů analýz, zpráv a dashboardů, které budou prezentovat skutečný obraz toho, kde je vaše podnikání, a také předpovídat, jak bude vaše podnikání fungovat v budoucnu. Abyste toho dosáhli, budete muset svá data shromáždit určitým způsobem a tato architektura se nazývá datové skladiště.

Pojem je vlastně převzat z reálného skladu, kde jsou vaše produkty uloženy na organizovaných policích. Ale když přejdete do světa dat, budete shromažďovat svá data z různých zdrojů. Budete shromažďovat svá data z produkce, vaší webové stránky, zákazníků, prodeje a marketingu, financí a lidských zdrojů. Shromáždíte všechna data dohromady, přenesete je na jedno místo, a to se bude nazývat datové skladiště a je navrženo určitým způsobem, aby bylo možné snadno generovat zprávy, zejména na základě časové osy. To je hlavní účel datového skladiště.

Jaké jsou některé z hlavních trendů v datové skladišti dnes?

Datové skladiště se vyvinulo bastante za posledních 20 – 25 let. Před zhruba deseti lety jsme byli svědky vzniku automatizovaného datové skladiště, což byla paradigmatická změna, která urychlila proces budování datových modelů a datových skladišť. Nedávno se automatizace stala středem pozornosti. Řeší repetitivní povahu úkolů datové skladiště, streamlinuje procesy, aby ušetřily čas a zdroje.

Náš produkt, Astera Data Warehouse Builder, například nabízí holistický přístup k automatizaci v datové skladišti. Pokrývá vše od automatizace ETL (Extract, Transform, Load) potrubí a datového modelování až po automatické načítání dat do struktur, jako jsou hvězdicové schéma nebo datové skladiště. Kromě toho účinně udržuje tyto struktury prostřednictvím mechanismů Change Data Capture (CDC). Tato komplexní automatizace se stala klíčovým trendem v datové skladišti.

Další nejnovější trend je fúze mezi datovým skladištěm a umělou inteligencí (AI). Konkrétně, generativní AI vzala automatizaci na novou úroveň. Nejenom automatizuje úkoly, ale také pomáhá uživatelům při rozhodování.

Konfigurace komponent datové skladiště, potrubí a rozhodovacích bodů může být vedena AI, což dělá datové skladiště účinnějším než kdykoli předtím. V podstatě, je to automatizace na steroidích a mění krajinu datové skladiště. Průnik mezi AI a datovým skladištěm je trend, který slibuje mnoho pro budoucnost.

Jaké jsou čtyři základní principy, které by společnosti měly zvážit pro vývoj svého datové skladiště?

1. Definice jasných cílů

Je důležité začít tím, že přesně pochopíte, co potřebujete od svého datové skladiště. Vyhněte se běžné pasti shromažďování nadbytečných dat bez jasných cílů. Místo toho identifikujte konkrétní cíle, které chcete s datovým skladištěm dosáhnout. Jaké zprávy a poznatky hledáte? Soustředěním se na vaše cíle můžete zajistit, že budete shromažďovat pouze relevantní data, místo aby jste nahromadili velké množství informací. Vzhledem k klesajícím nákladům na úložiště a výpočetní sílu je důležité tyto zdroje využívat inteligentně a eticky.

2. Výběr správného architektonického vzoru

Architektonické vzory jsou velmi důležité. Rozhodují, zda bude vaše datové skladiště úspěšné nebo ne. Existuje několik možností, od stylu Inmon až po Ralph Kimballův hvězdicový schéma, a také novější vzory, jako je Data Vault a přístup jednoho velkého stolu, který podporují dodavatelé columnových databází. Ne všechny vzory budou vhodné pro každou situaci.

Vidíme, že většina z nich kombinuje hvězdicový schéma s datovým skladištěm. Takže kombinace Data Vault a Star Schema je stále nejčastěji používaným vzorem. Ale, jak jsem řekl, pro každou situaci bude existovat jiný odpověď. Proto je důležité projít to s odborníky a zjistit, který architektonický vzor je pro vaši situaci nejvhodnější.

3. Výběr správných nástrojů

Ty jsou také velmi důležité a dělají velký rozdíl v čase a zdrojích potřebných pro vybudování řešení a také v kvalitě vašeho řešení, které je určeno produkty, které budete používat k vybudování a údržbě vašeho datové skladiště. Věnujte velkou pozornost schopnostem produktů a podívejte se na produkty, které mohou splnit většinu požadavků pod jednou střechou. Existují určitá oblast, jako je ETL (Extract, Transform, Load), kvalita dat, datové modelování, načítání dat a publikování dat, které hrají významnou roli. Pokud budete používat několik produktů pro každou z těchto oblastí, bude to obtížné. Proto se podívejte na produkty, které mohou dělat většinu, ne-li všechny, různých součástí.

4. Váš tým

Poslední, ale nejméně důležitý, je tým lidí, které shromáždíte k vybudování vašeho datové skladiště. Doporučujeme mít někoho se silným zázemím v architektonických vzorech dat. Co se týče složení týmu, nejlepší je mít multifunkční týmy, kde máte mix obchodních uživatelů a lidí se некоторým programátorským zázemím nebo alespoň s odbornými znalostmi dat. Mějte blízkou spolupráci mezi vašimi datovými správci, lidmi, kteří jsou zodpovědní za data, a samozřejmě obchodem. Tímto způsobem můžete vytvořit soudržný a efektivní tým, který bude zodpovědný za vybudování a údržbu vašeho datové skladiště.

Úspěch v datové skladišti závisí na nalezení rovnováhy mezi těmito čtyřmi principy. Tyto principy, když jsou pečlivě dodržovány, se ukázaly být receptem na úspěch v našich zkušenostech.

Proč společnosti potřebují moderní datové skladiště?

Závisí na tom, jak definujeme „moderní“. To se mění, někdy i během roku, měsíce nebo dokonce dne. Musíme zohlednit moderní nástroje navržené s ohledem na měnící se krajinu dat. V posledních letech došlo k významným posunům v povaze a objemu dat. Vzestup Big Data transformoval krajinu dat, s daty proudícími z zdrojů, jako jsou e-commerce webové stránky, produkční databáze a různé části vašeho podnikání. Tato data se mění nejenom množstvím, ale také svou povahou.

V minulosti byla data většinou strukturovaná, ale nyní hraje významnou roli i nestrukturovaná data. Kromě toho se zvyšuje rychlost, s jakou jsou data generována a zpřístupněna pro použití. Vzhledem k těmto změnám v datech musíme neustále vyhodnocovat a přizpůsobovat náš nástrojový set, abychom účinně řešili tyto měnící se datové výzvy.

Moderní datové skladiště je navrženo tak, aby zvládlo všechny variace ve struktuře a rychlosti dat, a je dobře vybaveno pro adaptaci na vznikající architektonické vzory, které se vyvinuly v posledních letech. Proto, pokud chcete využít své data co nejlépe, musíte se podívat na modernizaci svého datové skladiště. To je jediný způsob, jak zůstat v souladu s novými datovými výzvami.

Vidíme, že společnosti zůstávají u stávajících řešení, která se zdají fungovat. Je důležité rozpoznat, že data sama o sobě jsou inherentně dynamická. Kontinuálně se vyvíjí, představují nové výzvy a příležitosti. Stávající řešení nemusí být vybavena pro adaptaci na tyto změny. Proto, aby společnosti využily plný potenciál svých dat, musí přijmout koncept modernizace svého datové skladiště. Není to o tom, že bychom měli rozbít to, co funguje; je to o tom, abychom zůstali agilní a reagovali na měnící se povahu dat. Kontinuálním vyhodnocováním a integrací pokroků v datových technologiích mohou podniky zůstat konkurenceschopné a činit informovaná rozhodnutí v stále více datově řízeném světě.

Jaké jsou některé z aktuálních výzev v řízení dat, které se vyskytují v odvětví?

1. Rychlost a integrace dat

Jedna z největších výzev, se kterými se setkáváme dnes, je obrovské množství dat proudících z různých aplikací. Pokud vezmete typickou IT organizaci, musíte se vypořádat s novými aplikacemi, které neustále vznikají – desítky, někdy i stovky ročně, zejména ve středně velkých organizacích.

Všechny tyto aplikace generují data, a tato data obsahují cenné poznatky. Hlavní obavou je schopnost rychle integrovat tyto nové datové zdroje do stávajících datových potrubí a zkonsolidovat je do jednotného pohledu. Rychlost, s jakou organizace mohou adaptovat a začlenit tyto nové datové proudy, je největší výzvou, kterou vidíme.

2. Různé formáty dat

Další kritickou výzvou je povaha dat samotných, zejména rostoucí prevalence nestrukturovaných dat. S nestrukturovanými daty existují, samozřejmě, různé školy myšlení o tom, jak je zpracovat.

Organizace musí rozhodnout, zda budou tato data ukládat přímo do datových jezer pro pozdější použití, nebo zda je budou extrahovat a transformovat do více strukturovaného formátu pro okamžitou spotřebu. Výzvou je, jak zpracovat nestrukturovaná data, a vidíme, že i středně velké nebo malé společnosti jsou touto výzvou zasaženy. Proto je důležité vyvinout efektivní strategie pro zpracování nestrukturovaných dat.

3. Publikování a sdílení dat

Zatímco integrace a konsolidace dat jsou kritické, schopnost sdílet data účinně je stejně důležitá. Organizace potřebují mechanismy pro publikování a distribuci dat vnitřním oddělením, třetím stranám, partnerům a jiným zúčastněným stranám. Tato výzva přesahuje pouze zpřístupnění dat; zahrnuje také zajištění bezpečnosti dat, ochrany soukromí a dodržování předpisů. Jak se sdílení dat stává nezbytností pro podniky všech velikostí, technologie a produkty v tomto prostoru se rychle vyvíjejí, aby splnily poptávku.

Jakým způsobem Astera integrovala umělou inteligenci do workflow zákazníků?

Díváme se na umělou inteligenci, která se protíná s řízením dat dvěma rozdílnými způsoby.

1. Zlepšení uživatelské přívětivosti pomocí generativní AI

Náš hluboký závazek k uživatelské přívětivosti je kamenem našeho produktového vývoje. Během posledních 12 až 13 let jsme vybudovali silnou pověst pro navrhování produktů s krátkou křivkou učení, což z nich dělá dostupné i pro ne-technické uživatele. S pouze malým množstvím školení mohou jednotlivci účinně využívat naše produkty k provedení významných úkolů se svými daty.

S příchodem generativní AI vzala Astera uživatelskou přívětivost na novou úroveň. Utilizujeme generativní AI k vytvoření uživatelského rozhraní, které umožňuje zákazníkům interagovat s produktem pomocí přirozených jazykových příkazů. Toto AI poháněné rozhraní zjednodušuje konfigurační úkoly, dělá je intuitivnějšími a efektivnějšími pro uživatele.

Kromě toho Astera integrovala automatizaci poháněnou AI pro úkoly, které dříve vyžadovaly několik hodin ruční práce, zejména při konfiguraci produktů pro řízení dat. Největší nákladový faktor při budování řešení pro řízení dat nebyl pouze nákup produktu, ale čas a úsilí vynaložené na jeho konfiguraci. Snažíme se to vyřešit pomocí AI. Tento přístup výrazně snižuje čas a zdroje tradičně vynaložené na konfiguraci produktu.

Jako příklad, produkt Astery, ReportMiner, zjednodušuje extrakci dat z nestrukturovaných dokumentů, umožňuje uživatelům vytvářet extrakční šablony založené na pravidlech. AI může nyní vygenerovat počáteční šablonu během několika sekund, úkol, který dříve trval typickému uživateli 2 až 3 hodiny. První verze AI vygenerované šablony nemusí být dokonalá, ale zvládne asi 90 % pracovního zatížení, umožňující uživatelům provést rychlé úpravy a dokončit úkol během několika minut místo hodin. Tento přístup je pouze jedním z příkladů, jak Astera využívá AI k zlepšení uživatelské přívětivosti napříč svými produkty.

2. Funkce AI jako nástrojový set

Astera nabízí sjednocený datový stack, který pokrývá různé aspekty řízení dat, včetně ingestování, transformace, kvality dat, datové skladiště, API a publikování dat. Společnost rozpoznává důležitost poskytování funkcí AI jako univerzálního nástrojového setu pro své uživatele. V rámci tohoto nástrojového setu mohou zákazníci Astery přístup k AI napříč spektrem datové vědy, od budování a nasazování modelů strojového učení až po zpracování operací strojového učení (ML Ops). Astera také podporuje použití open-source založených modelů, včetně velkých jazykových modelů (LLM), a usnadňuje jemné doladění pro konkrétní použití.

Tato širší funkčnost AI umožňuje uživatelům Astery využívat AI pro různé datové úkoly, včetně nasazování modelů strojového učení, implementace ML Ops a jemného doladění open-source modelů. Kromě toho Astera neustále pracuje na rozšíření své podpory AI, zahrnující oblasti, jako jsou vektorové databáze, podobnostní vyhledávání, vkládání a další.

Jaké jsou některé z nejlepších postupů pro využití AI a modelů strojového učení v řízení dat pro velké společnosti?

1. Zůstat v čele vývoje AI a ML

Obor velkých jazykových modelů se rychle vyvíjí. Aby velké společnosti získaly konkurenční výhodu, měly by zůstat informovány o nejnovějších pokrocích. Astera, například, byla ranou adoptérkou generativní AI, využívající modely, jako je OpenAI a LAMA. Kontinuální monitoring vznikajících technologií zajišťuje, že jste dobře připraveni je účinně využít.

2. Experimentovat s různými modely a konfiguracemi

Používáním jemného doladění LLM jsme byli schopni nasadit malé velikosti, jako jsou 8 až 13 miliard parametrů modelů, a nasadit je místně. To fungovalo opravdu dobře pro nás a co doporučujeme, je místo toho, abyste používali pouze jeden versus druhý, vyzkoušet různé základní modely a konfigurace a vidět, který z nich funguje pro vás.

Velké jazykové modely přicházejí v různých variantách, každá s vlastními schopnostmi. Vytvořte konfiguraci, která vám umožňuje vybrat si z široké škály možností, podobně jako to, co dělají vývojáři a datoví vědci ve svých datově řízených aktivitách. Naším cílem bylo integrovat tyto možnosti do našeho produktu, aby uživatelé měli dynamickou a přizpůsobitelnou zkušenost.

3. Prioritizace místního nasazení před API

Při práci s datově orientovanými produkty je snižování zpoždění zásadní. Používání pouze API pro přístup k modelům AI a ML může zavést nepřijatelná zpoždění, zejména při manipulaci s velkými objemy dat. Je doporučeno priorizovat nasazení jemně doladěných modelů místně, vyhrazených pro vaši konkrétní situaci. Tento přístup může výrazně zlepšit odezvu a celkový výkon.

Proč je Astera lepší řešení než konkurenční platformy?

  • Asterina řešení má kódově volitelné, intuitivní a vizuální rozhraní spolu s vylepšenou uživatelskou přívětivostí poháněnou AI, což usnadňuje provádění komplexních datových procesů pro všechny uživatele, bez ohledu na jejich technické schopnosti.
  • Automatizační funkce našeho datového stacku snižují opakující se manuální úkoly a ušetří čas a vývojové zdroje.
  • Náš sjednocený platforma může pomoci uživatelům provádět koncové datové procesy bez přepínání řešení. To eliminuje náklady na učení a správu více izolovaných systémů.

Děkuji za skvělý rozhovor, čtenáři, kteří chtějí se dozvědět více, by měli navštívit Astera Software.

Antoine je vizionářský líder a spoluzakladatel Unite.AI, který je poháněn neotřesitelnou vášní pro formování a propagaci budoucnosti umělé inteligence a robotiky. Jako sériový podnikatel věří, že umělá inteligence bude mít na společnost stejně disruptivní vliv jako elektřina, a často se chvála na potenciál disruptivních technologií a AGI.