Wywiady
Jay Mishra, COO Astera Software – Wywiad

Jay Mishra jest Dyrektorem Operacyjnym (COO) w Astera Software, dynamicznie rozwijającym się dostawcą gotowych do użycia w przedsiębiorstwach rozwiązań danych. Pomagają one użytkownikom biznesowym przekraczać lukę między danymi a wglądem za pomocą zestawu przyjaznych dla użytkownika, a jednocześnie o wysokiej wydajności rozwiązań do ekstrakcji danych, jakości danych, integracji danych, magazynowania danych i elektronicznej wymiany danych, które są używane przez średnie i firmy z listy Fortune 500 z różnych branż.
Czym pierwotnie zainteresował się pan komputerami?
Zawsze miałem głęboko zakorzenioną pasję do matematyki, a moja podróż do informatyki była naturalnym rozszerzeniem tego. Moja edukacja na poziomie licencjata była z matematyki i informatyki, a było to logiczne przejście ze świata matematyki do królestwa informatyki, co mnie fascynowało. To, co szczególnie zwróciło moją uwagę, to było intrukcyjne działanie algorytmów i zaawansowanych procesów algorytmicznych, co skłoniło mnie do podjęcia specjalizacji w algorytmach podczas mojego magisterium z informatyki. Od tego czasu moje połączenie z informatyką pozostało silne, a ja stale staram się być na bieżąco z najnowszymi rozwojami w tej dziedzinie.
Jesteś obecnie COO Astera, mogłby pan opowiedzieć nam, co obejmuje pana codzienna rola?
Jako COO Astera, moja rola jest wielowątkowa, odzwierciedlając dynamiczną naturę naszej firmy. Byłem z Astera od samego początku, a moje odpowiedzialności rozciągały się na różne obszary organizacji. Obejmuje to wszystko, od aktywnego udziału w tworzeniu i kodowaniu naszych produktów po zapewnienie, że nasze funkcje są zgodne z ewoluującymi potrzebami naszych klientów. Współpracuję ściśle z naszymi klientami, pracując wraz z nimi, aby udoskonalić nasze rozwiązania. Moja rola wykracza poza sam rozwój produktu, aby objąć sprzedaż i marketing, gdzie wprowadzamy nasze oferty na rynek.
Ponieważ znajdujemy się w fazie wzrostu, podjąłem dodatkowe odpowiedzialności, w tym nadzorowanie naszych celów przychodów oraz strategiczne rozszerzanie naszego portfolio produktów, aby dotrzeć do nowych rynków. Podstawą jest to, że mam wpływ na niemal każdy aspekt naszych operacji, zapewniając, że nie tylko budujemy wyjątkowe produkty, ale także skutecznie wprowadzamy je na rynek i osiągamy nasze cele biznesowe.
Dla czytelników, którzy nie znają tego terminu, co to jest magazynowanie danych?
Magazynowanie danych to wzorzec architektoniczny służący do konsolidacji wszystkich danych przedsiębiorstwa w scentralizowanym repozytorium, które posłuży jako podstawa do generowania różnych typów analiz, raportów i pulpitów, które będą prezentować prawdziwy obraz, gdzie znajduje się biznes i jak będzie się rozwijał w przyszłości. Aby sprostać wszystkiemu temu, łączymy dane w określony sposób, a ta architektura nazywa się magazynem danych.
Termin ten jest zaczerpnięty z życia codziennego, gdzie produkty są przechowywane na zorganizowanych półkach. Ale gdy przychodzi do świata danych, łączymy dane z różnych źródeł. Łączymy dane z produkcji, strony internetowej, klientów, sprzedaży i marketingu, finansów oraz zasobów ludzkich. Łączymy wszystkie dane w jedno miejsce, i to jest to, co nazywa się magazynem danych i jest zaprojektowane w określony sposób, aby raportowanie, szczególnie oparte na czasie, było łatwe. To jest podstawowy cel magazynu danych.
Jakie są niektóre z kluczowych trendów w magazynowaniu danych dzisiaj?
Magazynowanie danych ewoluowało znacznie w ciągu ostatnich 20-25 lat. Około dekadę temu byliśmy świadkami pojawienia się zautomatyzowanego magazynowania danych, co było przełomem, który przyspieszył proces tworzenia modeli danych i magazynów danych. Ostatnio automatyzacja zajęła centralne miejsce. Rozwiązuje ona powtarzalny charakter zadań związanych z magazynowaniem danych, usprawniając procesy, aby zaoszczędzić czas i zasoby.
Nasz produkt, Astera Data Warehouse Builder, na przykład, oferuje holistyczne podejście do automatyzacji w magazynowaniu danych. Obejmuje ono wszystko, od automatyzacji potoków ETL (Extract, Transform, Load) i modelowania danych po automatyczne ładowanie danych do struktur, takich jak schematy gwiazdowe lub magazyny danych. Ponadto efektywnie utrzymuje te struktury za pomocą mechanizmów Change Data Capture (CDC). Ta wszystkoobejmująca automatyzacja wyłoniła się jako kluczowy trend w krajobrazie magazynowania danych.
Najnowszy trend to połączenie magazynowania danych i sztucznej inteligencji (AI). Konkretnie, generatywna AI podniosła automatyzację na nowy poziom. Nie tylko automatyzuje zadania, ale także pomaga użytkownikom w podejmowaniu decyzji.
Konfiguracja składników magazynowania danych, potoków i punktów decyzyjnych może być kierowana przez AI, czyniąc magazynowanie danych bardziej potężnym i efektywnym niż kiedykolwiek wcześniej. W istocie jest to automatyzacja na sterydach, i zmienia krajobraz magazynowania danych. Przecięcie AI i magazynowania danych to trend, który ma ogromne perspektywy na przyszłość.
Jakie są cztery fundamentalne zasady, które firmy powinny wziąć pod uwagę przy tworzeniu swojego magazynu danych?
1. Definiowanie wyraźnych celów
Jest niezwykle ważne, aby zrozumieć dokładnie, czego potrzebujesz od swojego magazynu danych. Unikaj powszechnego błędu polegającego na zbieraniu nadmiaru danych bez wyraźnego celu. Zamiast tego, określ konkretny cel, jaki chcesz osiągnąć za pomocą swojego magazynu danych. Jakie raporty i wglądy szukasz? Koncentrując się na swoich celach, możesz upewnić się, że wprowadzasz tylko dane, które są istotne, zamiast gromadzić ogromne ilości informacji. Biorąc pod uwagę malejące koszty przechowywania i mocy obliczeniowej, jest niezwykle ważne, aby wykorzystywać te zasoby w sposób inteligentny i etyczny.
2. Wybór odpowiedniego wzorca architektonicznego
Wzorce architektoniczne są niezwykle ważne. Decydują one, czy Twoje rozwiązanie magazynowania danych będzie udane, czy nie. Istnieją różne opcje, od magazynowania danych w stylu Inmon do schematów gwiazdowych autorstwa Ralpha Kimballa, a także nowsze wzorce, takie jak Data Vault i podejście jednej dużej tabeli promowane przez dostawców bazy danych columna. Nie wszystkie wzorce będą odpowiednie dla każdej sytuacji.
Widzimy głównie połączenie schematu gwiazdowego umieszczonego na szczycie Data Vault. Więc połączenie Data Vault i schematu gwiazdowego jest nadal najczęściej używanym wzorcem. Ale, jak powiedziałem, dla każdego wymagania lub sytuacji będzie inna odpowiedź. Więc przejdź przez ekspertów, zobacz, jaki wzorzec architektoniczny jest dobrym dopasowaniem dla Twojej sytuacji.
3. Wybór odpowiednich narzędzi
Są one niezwykle ważne i robią ogromną różnicę ponownie na czas i źródła potrzebne do budowy rozwiązania, a także na dokładność i jakość rozwiązania, które jest określone przez produkty, które będą używane do budowy i utrzymania magazynu danych. Zwróć dużą uwagę na możliwości produktu i spójrz na produkty, które mogą spełnić najwięcej wymagań pod jednym parasolem. Istnieją pewne obszary, takie jak ETL (Extract, Transform, Load), jakość danych, modelowanie danych, ładowanie danych i publikowanie danych, które odgrywają znaczącą rolę. Jeśli spróbujesz użyć wielu produktów dla każdego z tych obszarów, będzie to trudne. Spójrz na produkty, które mogą być używane do wykonania większości, jeśli nie wszystkich, różnych składników.
4. Twój zespół
Ostatnie, ale nie mniej ważne, zespół ludzi, których gromadzisz, aby zbudować swoje rozwiązanie magazynowania danych, jest najważniejszą częścią. Zalecamy posiadanie kogoś z silnym doświadczeniem w wzorcach architektonicznych danych. W kwestii składu zespołu zespoły wielofunkcyjne są najlepszym sposobem, aby to zrobić, gdzie masz mieszankę użytkowników biznesowych i ludzi z pewnym doświadczeniem programistycznym lub przynajmniej ekspertyzą danych i bliską współpracę między Twoimi opiekunami danych, ludźmi odpowiedzialnymi za dane, a także biznesem. Poprzez wspieranie bliskiej współpracy między tymi różnymi aspektami Twojej organizacji, możesz stworzyć spójny i skuteczny zespół odpowiedzialny za budowę i utrzymanie swojego rozwiązania magazynowania danych.
Sukces w magazynowaniu danych zależy od osiągnięcia równowagi między tymi czterema zasadami. Te zasady, gdy są starannie przestrzegane, okazały się przepisem na sukces w naszym doświadczeniu.
Dlaczego firmy potrzebują nowoczesnego stosu danych?
Zależy to od tego, jak definiujemy „nowoczesny” i to się zmienia, czasem z roku na rok, miesiąc na miesiąc, a nawet z dnia na dzień. Musimy brać pod uwagę nowoczesne zestawy narzędzi zaprojektowane z myślą o zmieniającym się krajobrazie danych. W ciągu ostatnich kilku lat nastąpiły znaczące zmiany w naturze i objętości danych. Wzrost Big Data przekształcił krajobraz danych, z danymi płynącymi z źródeł, takich jak strony internetowe e-commerce, bazy danych produkcyjnych i różnych części Twojego biznesu. Te dane nie tylko zmieniają się pod względem objętości, ale także pod względem ich natury.
W przeszłości dane były w większości ustrukturyzowane, ale teraz nieustrukturyzowane dane odgrywają znaczącą rolę. Ponadto prędkość, z jaką dane są generowane i udostępniane do użycia, wzrosła. Biorąc pod uwagę te zmiany w danych, musimy nieustannie oceniać i dostosowywać nasz zestaw narzędzi, aby skutecznie rozwiązywać ewoluujące wyzwania związane z danymi.
Nowoczesny stos danych jest zaprojektowany, aby obsłużywać wszystkie zmiany w strukturach i prędkości danych, i jest dobrze wyposażony, aby dostosować się do pojawiających się wzorców architektonicznych, które ewoluowały w ciągu ostatnich kilku lat. Dlatego, jeśli chcesz wykorzystać swoje dane w najlepszy możliwy sposób, musisz zmodernizować swój stos danych. To jedyny sposób, aby nadążyć za nowymi wyzwaniami związanymi z danymi.
Widzieliśmy, że firmy trzymają się istniejących rozwiązań, które wydają się działać. Jest niezwykle ważne, aby rozpoznać, że same dane są wewnętrznie dynamiczne. Ciągle ewoluują, prezentując nowe wyzwania i możliwości. Istniejące rozwiązania mogą nie być w stanie dostosować się do tych zmian. Dlatego, aby wykorzystać pełny potencjał swoich danych, firmy muszą zaakceptować koncepcję modernizacji swojego stosu danych. To nie jest o tym, aby złamać to, co działa; to jest o pozostaniu elastycznym i reagowaniu na ewoluującą naturę danych. Poprzez ciągłe ocenianie i integrowanie postępów w technologii danych, firmy mogą pozostać konkurencyjne i podejmować świadome decyzje w coraz bardziej danych świecie.
Jakie są niektóre z obecnych wyzwań związanych z zarządzaniem danymi, które są widoczne w branży?
1. Prędkość i integracja danych
Jednym z największych wyzwań, z którymi mamy do czynienia dzisiaj, jest ogromna objętość danych płynących z różnych aplikacji. Jeśli weźmiemy typową organizację IT, mają one do czynienia z nowymi aplikacjami pojawiającymi się cały czas – dziesiątki, czasem nawet setki każdego roku, szczególnie w średnich organizacjach.
Teraz, wszystkie te aplikacje generują dane, a te dane posiadają cenne wglądy. Głównym problemem jest tutaj zdolność do szybkiej integracji tych nowych źródeł danych do istniejących potoków danych i skonsolidowania ich w zjednoczonym widoku. Szybkość, z jaką organizacje mogą dostosować się do i włączyć te nowe strumienie danych, jest największym wyzwaniem, które widzimy.
2. Różne formaty danych
Innym krytycznym wyzwaniem jest natura danych, szczególnie rosnąca popularność nieustrukturyzowanych danych. Z nieustrukturyzowanymi danymi są, oczywiście, różne szkoły myślenia o tym, jak je obsłużywać.
Organizacje muszą zdecydować, czy przechowywać te dane bezpośrednio w jeziorach danych do późniejszego użycia, czy wyodrębnić i przekształcić je w bardziej ustrukturyzowany format do natychmiastowego użycia. Wyzwaniem pozostaje, jak obsłużyć nieustrukturyzowane dane, i widzimy, że nawet średnie firmy lub małe firmy są dotknięte tym. Więc opracowanie skutecznych strategii dotyczących nieustrukturyzowanych danych jest niezwykle ważne.
3. Publikowanie i udostępnianie danych
Podczas gdy integracja i konsolidacja danych są kluczowe, możliwość skutecznego udostępniania danych jest równie ważna. Organizacje potrzebują mechanizmów do publikowania i dystrybucji danych do wewnętrznych departamentów, dostawców zewnętrznych, partnerów i innych interesariuszy. To wyzwanie wykracza poza samo udostępnianie danych; obejmuje ono zapewnienie bezpieczeństwa danych, prywatności i zgodności z przepisami. Ponieważ udostępnianie danych staje się koniecznością dla firm wszystkich rozmiarów, technologie i produkty w tym obszarze ewoluują szybko, aby sprostać popytowi.
Jakie są niektóre sposoby, w jakie Astera zintegrowała AI z przepływem pracy klienta?
Spójrzmy na AI, która przecina zarządzanie danymi na dwa odrębne sposoby.
1. Ulepszanie użyteczności za pomocą generatywnej AI
Nasz głęboki zobowiązanie do użyteczności jest kamieniem węgielnym naszej filozofii rozwoju produktu. Przez ostatnie 12-13 lat zbudowaliśmy silną reputację, projektując produkty o krótkim czasie nauki, czyniąc je dostępnymi nawet dla użytkowników niebędących specjalistami technicznymi. Zaledwie niewielka ilość szkolenia pozwala osobom na efektywne korzystanie z naszych produktów do wykonywania znaczących zadań z danymi.
Z wprowadzeniem generatywnej AI, Astera podniosła użyteczność na nowy poziom. Wykorzystaliśmy generatywną AI, aby stworzyć interfejs użytkownika, który pozwala klientom na interakcję z produktem za pomocą poleceń języka naturalnego. Ten interfejs AI upraszcza zadania konfiguracyjne, czyniąc je bardziej intuicyjnymi i wydajnymi dla użytkowników.
Ponadto Astera zintegrowała automatyzację napędzaną przez AI, aby obsłużyć zadania, które wcześniej wymagały kilku godzin pracy ręcznej, szczególnie w konfiguracji produktów zarządzania danymi. Największy czynnik kosztowy budowy rozwiązania zarządzania danymi nie był tylko kupnem produktu, ale czasem i wysiłkiem poświęconym na jego konfigurację. Staramy się rozwiązać to za pomocą AI. To podejście znacznie redukuje czas i zasoby tradycyjnie wydatkowane na konfigurację produktu.
Na przykład, produkt Astera, ReportMiner, upraszcza ekstrakcję danych z nieustrukturyzowanych dokumentów, pozwalając użytkownikom tworzyć szablony ekstrakcji oparte na regułach. AI może teraz wygenerować początkowy szablon w ciągu kilku sekund, zadanie, które wcześniej zajmowało typowemu użytkownikowi od dwóch do trzech godzin. Pierwsza wersja szablonu wygenerowanego przez AI może nie być idealna, ale obsługuje około 90% pracy, pozwalając użytkownikom na szybkie dostosowanie i ukończenie zadania w minutach zamiast godzin. To podejście jest tylko jednym z przykładów, w jaki Astera wykorzystuje AI, aby poprawić użyteczność we wszystkich swoich produktach.
Robimy podobne rzeczy w całym naszym stosie danych, gdzie uzyskujemy znaczną poprawę użyteczności dzięki sztucznej inteligencji.
2. Funkcjonalność AI jako zestaw narzędzi
Astera oferuje zintegrowany stos danych, który obejmuje różne aspekty zarządzania danymi, w tym pobieranie, transformację, jakość danych, magazynowanie danych, API i publikowanie danych. Firma uznaje wagę zapewnienia funkcjonalności AI jako wszechstronnego zestawu narzędzi dla swoich użytkowników. W ramach tego zestawu narzędzi klienci Astera mogą uzyskać dostęp do AI w całym spektrum nauki o danych, od budowy i wdrażania modeli uczenia maszynowego do obsługi ML Ops (Machine Learning Operations). Astera wspiera również użycie modeli open-source, w tym dużych modeli językowych (LLM), i ułatwia ich dostosowanie do konkretnych przypadków użycia.
Ta szersza funkcjonalność AI upoważnia użytkowników Astera do wykorzystania AI do różnych zadań związanych z danymi, w tym wdrażania modeli uczenia maszynowego, implementowania ML Ops i dostosowywania modeli open-source. Ponadto Astera nieustannie pracuje nad rozszerzaniem swojego wsparcia AI, obejmując obszary, takie jak bazy danych wektorowych, wyszukiwania podobieństwa, osadzania i wiele więcej.
Jakie są niektóre z najlepszych praktyk, aby wykorzystać AI i modele ML w zarządzaniu danymi dla dużych firm?
1. Pozostawaj na czele rozwoju AI i ML
Dziedzina dużych modeli językowych ewoluuje w szybkim tempie. Aby uzyskać przewagę konkurencyjną, duże firmy powinny pozostawać na bieżąco z najnowszymi postępami. Na przykład, Astera była wczesnym adopterem generatywnej AI, wykorzystując modele takie jak OpenAI i LAMA. Ciągłe monitorowanie pojawiających się technologii zapewnia, że jesteś dobrze przygotowany do ich skutecznego wykorzystania.
2. Eksperymentuj z wieloma modelami i konfiguracjami
Wykorzystując dostosowanie dużych modeli językowych, byliśmy w stanie wdrożyć małe rozmiary, takie jak modele 8-13 miliardów parametrów, i wdrożyć je lokalnie. To coś, co działało naprawdę dobrze dla nas, i co zalecamy, to spróbować różnych modeli bazowych i konfiguracji, i zobaczyć, który z nich działa dla Ciebie.
Duże modele językowe występują w różnych wersjach, każdy z nich ma unikalne możliwości. Utwórz konfigurację, która pozwala wybierać spośród szerokiej gamy opcji, odzwierciedlającej to, co robią deweloperzy i uczeni danych w swoich podróżach z danymi.
Aby umożliwić użytkownikom wybór, stworzyliśmy system konfiguracyjny, który oferuje szeroką gamę opcji, podobną do tej, z którą spotykają się deweloperzy i uczeni danych, pracując z bibliotekami open-source w swoich projektach z danymi. Naszym celem było płynne zintegrowanie tych opcji z naszym produktem, ułatwiając dynamiczne i dostosowujące się do potrzeb doświadczenie dla użytkowników.
3. Priorytetem jest wdrożenie lokalne nad API
Podczas pracy z produktami związanymi z danymi, redukowanie opóźnień jest niezwykle ważne. Poleganie wyłącznie na API dla dostępu do modeli AI i ML może wprowadzić nieakceptowalne opóźnienia, szczególnie przy obsłudze dużych ilości danych. Zalecane jest priorytetowe wdrożenie dostosowanych modeli lokalnie, dedykowanych do Twojej konkretnych sytuacji. To podejście może znacznie poprawić czasy odpowiedzi i ogólną wydajność.
Dlaczego Astera jest lepszym rozwiązaniem niż platformy konkurencyjne?
- Rozwiązania Astera mają interfejs bez kodu, intuicyjny i wizualny, wraz z ulepszoną użytecznością napędzaną przez AI, co ułatwia wykonywanie złożonych procesów danych dla wszystkich użytkowników, niezależnie od ich umiejętności technicznych.
- Funkcje automatyzacji naszego stosu danych redukują powtarzalne zadania ręczne i oszczędzają czas oraz zasoby rozwojowe.
- Nasza zintegrowana platforma pozwala użytkownikom na wykonywanie procesów danych od końca do końca bez konieczności przełączania się między rozwiązaniami. To eliminuje wydatek na uczenie się i zarządzanie wieloma rozproszonymi systemami.
Dziękujemy za wspaniały wywiad, czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić Astera Software.












