Rozhovory
Saket Saurabh, generální ředitel a spoluzakladatel Nexla – rozhovor

Saket Saurabh, generální ředitel a spoluzakladatel Nexla, je podnikatel s hlubokou vášní pro data a infrastrukturu. Věnuje se vývoji nové generace automatizované platformy pro inženýrství dat, která má přinést škálovatelnost a rychlost těm, kteří pracují s daty.
Předtím Saurabh založil úspěšný mobilní startup, který dosáhl významných milníků, včetně akvizice, IPO a růstu do multi-milionového podniku. Přispěl také k několika inovativním produktům a technologiím během svého působení v Nvidia (NVDA ).
Nexla umožňuje automatizaci inženýrství dat, aby data mohla být připravena k použití. Tohoto cíle dosahuje pomocí jedinečného přístupu Nexsets – datových produktů, které usnadňují integraci, transformaci, doručování a monitorování dat.
Co Vás inspirovalo k založení Nexla a jak Vaše zkušenosti s inženýrstvím dat utvořily Vaši vizi pro společnost?
Před založením Nexla jsem začal svou cestu v inženýrství dat v Nvidia, kde jsem budoval vysoce škálovatelnou, high-end technologii na straně výpočtu. Poté jsem vedl svůj předchozí startup prostřednictvím akvizice a IPO v oblasti mobilní reklamy, kde velké množství dat a strojové učení byly klíčovou součástí naší nabídky, zpracovávající asi 300 miliard záznamů dat denně.
Pohled na krajinu v roce 2015 po veřejné nabídce mé předchozí společnosti mě vedl k hledání další velké výzvy, která mě bavila. Přicházející z obou těchto prostředí, bylo mi jasné, že výzvy v datech a výpočtech se sbližují, protože průmysl se přesouvá k pokročilejším aplikacím poháněným daty a umělou inteligencí.
Zatímco jsme nevěděli v té době, že Generativní umělá inteligence (GenAI) pokročí tak rychle, jak se stalo, bylo zřejmé, že strojové učení a umělá inteligence budou základem pro využití dat. Začal jsem tedy uvažovat o tom, jaký druh infrastruktury je potřebný pro to, aby lidé mohli být úspěšní při práci s daty, a jak můžeme učinit data dostupnými a přístupnými pro širší okruh uživatelů, nejen pro inženýry. Mé zkušenosti se stavbou škálovatelných systémů a aplikací poháněly tuto vizi demokratizovat přístup k datům prostřednictvím automatizace a zjednodušení.
Jak Nexsets představují misi Nexla, aby data byla připravena k použití pro každého, a proč je tato inovace zásadní pro moderní podniky?
Nexsets představují misi Nexla, aby data byla připravena k použití pro každého, řešením základního problému dat. 3V dat – objem, rychlost a variabilita – byly trvalým problémem. Průmysl udělal nějaký pokrok v řešení problémů s objemem a rychlostí. Nicméně variabilita dat zůstala významnou překážkou, protože proliferace nových systémů a aplikací vedla k neustále se zvyšující rozmanitosti datových struktur a formátů.
Přístup Nexla spočívá v automatickém modelování a propojování dat z různých zdrojů do konzistentní, balené entity, datového produktu, který nazýváme Nexset. To umožňuje uživatelům přístup a práci s daty bez nutnosti porozumět základní složitosti různých datových zdrojů a struktur. Nexset funguje jako brána, poskytující jednoduchý, přímý interface k datům.
To je zásadní pro moderní podniky, protože umožňuje více lidem, nejen inženýrům, využít data ve své denní práci. Abstrahováním rozmanitosti a složitosti dat Nexsets ermögňují business uživatelům, analytikům a dalším přímo interagovat s daty, která potřebují, bez nutnosti rozsáhlých technických znalostí.
Co dělá data “GenAI-připravená” a jak Nexla účinně řeší tyto požadavky?
Odpověď částečně závisí na tom, jak používáte GenAI. Většina společností implementuje GenAI Retrieval Augmented Generation (RAG). To vyžaduje přípravu a kódování dat pro načtení do vektorové databáze a poté načtení dat prostřednictvím vyhledávání jako kontextu pro vstup do Large Language Model (LLM), který nebyl vyškolen pomocí těchto dat. Data tedy musí být připravena tak, aby fungovala dobře pro vektorové vyhledávání a pro LLM.
Nezávisle na tom, zda používáte RAG, Retrieval Augmented Fine-Tuning (RAFT) nebo provádíte školení modelu, existují beberapa klíčových požadavků:
- Formát dat: GenAI LLM často funguje nejlépe s daty ve specifickém formátu. Data musí být strukturována tak, aby modely je mohly snadno ingestovat a zpracovat. Měla by být také “chunkována” tak, aby LLM lépe využila data.
- Připojení: GenAI LLM potřebují dynamicky přistupovat k relevantním datovým zdrojům, místo aby se spoléhaly na statické datové sady. To vyžaduje neustálé připojení k různým podnikovým systémům a datovým úložištím.
- Zabezpečení a správa: Při použití citlivých podnikových dat je kritické mít robustní zabezpečovací a správní kontroly. Přístup a použití dat musí být zabezpečeny a v souladu s existujícími organizačními zásadami. Je také nutné spravovat data používaná LLM, aby se předešlo únikům dat.
- Škálovatelnost: GenAI LLM mohou být datově a výpočetně náročné, takže podkladová datová infrastruktura musí být schopna škálovat, aby splnila požadavky těchto modelů.
Nexla řeší tyto požadavky pro přípravu dat pro GenAI několika způsoby:
- Dynamický přístup k datům: Platforma pro integraci dat Nexla poskytuje jednotný způsob připojení k stovkám zdrojů a používá různé styly integrace a rychlosti dat, spolu s orchestrací, aby poskytla GenAI LLM nejaktuálnější data, kdykoli je potřebují, místo aby se spoléhaly na statické datové sady.
- Příprava dat: Nexla má schopnost extrahovat, transformovat a připravovat data ve formátech optimalizovaných pro každou případovou použití GenAI, včetně vestavěné chunkování a podpory pro více kódovacích modelů.
- Samoopsluha a spolupráce: S Nexla mohou spotřebitelé dat nejen přistupovat k datům a budovat Nexsets a toky. Mohou také spolupracovat a sdílet svou práci prostřednictvím tržiště, které zajišťuje, že data jsou ve správném formátu a zlepšuje produktivitu prostřednictvím opakovaného použití.
- Automatická generace: Integrace a GenAI jsou obě náročné. Nexla automaticky generuje mnoho kroků potřebných na základě voleb spotřebitele dat – pomocí AI a dalších technik – aby uživatelé mohli sami provádět práci.
- Správa a zabezpečení: Nexla zahrnuje robustní správní a zabezpečovací kontroly po celou dobu, včetně spolupráce, aby se zajistilo, že citlivá podniková data jsou přístupná a používána v zabezpečené a souladné formě.
- Škálovatelnost: Platforma Nexla je navržena tak, aby škálovala a zvládala nároky GenAI úloh, poskytující nezbytnou výpočetní sílu a elastickou škálovatelnost.
Jak rozmanité typy a zdroje dat přispívají k úspěchu modelů GenAI a jaká je role Nexla v zjednodušení procesu integrace?
Modely GenAI potřebují přístup ke všem druhům informací, aby poskytly nejlepší přehledy a generovaly relevantní výstupy. Pokud jim tyto informace neposkytnete, nemůžete očekávat dobré výsledky. Je to stejné jako u lidí.
Modely GenAI potřebují být školeny na širokém spektru dat, od strukturovaných databází po nestrukturované dokumenty, aby vytvořily komplexní pochopení světa. Různé datové zdroje, jako jsou články, finanční zprávy a zákaznické interakce, poskytují cenné kontextuální informace, které tyto modely mohou využít. Expozice rozmanitým datům také umožňuje modelům GenAI stát se flexibilnějšími a adaptabilnějšími, umožňující jim zvládat širší spektrum dotazů a úkolů.
Nexla abstrahuje rozmanitost všech těchto dat pomocí Nexsets a usnadňuje přístup téměř k jakémukoli zdroji, poté extrahuje, transformuje, orchestruje a načítá data, aby spotřebitelé dat mohli soustředit pouze na data a na to, aby je učinili GenAI-připravenými.
Jaké trendy formují ekosystém dat v roce 2025 a dále, zejména s růstem GenAI?
Společnosti se většinou soustředily na používání GenAI k budování asistentů nebo kopií, které pomáhají lidem najít odpovědi a učinit lepší rozhodnutí. Agentic AI, agenti, kteří automatizují úkoly bez zapojení lidí, je určitě rostoucí trend, když se pohybujeme do roku 2025. Agenti, stejně jako kopiloti, potřebují integraci, aby zajistili, že data proudí bezproblémově – nejen v jednom směru, ale také při umožnění AI, aby jednala na základě těchto dat.
Jedním z dalších hlavních trendů pro rok 2025 je rostoucí složitost AI systémů. Tyto systémy se stávají sofistikovanějšími kombinací komponent z různých zdrojů, aby vytvořily koherentní řešení. Je to podobné tomu, jak lidé spoléhají na různé nástroje po celý den, aby dokončili úkoly. Empowered AI systémy budou následovat tento přístup, orchestrace několika nástrojů a komponent. Tato orchestrace představuje významnou výzvu, ale také klíčovou oblast rozvoje.
Z pohledu trendů vidíme tlak na generativní AI, aby pokročila za jednoduché rozpoznávání vzorců až k skutečnému rozumu. Existuje spousta technologického pokroku v tomto prostoru. Ačkoli tyto pokroky nemusí být plně přeloženy do komerční hodnoty v roce 2025, představují směr, kterým se pohybujeme.
Jedním z dalších klíčových trendů je zvýšené použití urychlených technologií pro AI inferencing, zejména u společností jako Nvidia. Tradičně se GPU používaly hlavně pro školení AI modelů, ale runtime inferencing – bod, ve kterém je model aktivně používán – se stává stejně důležitým. Můžeme očekávat pokroky v optimalizaci inferencing, což z něj činí více efektivní a působivé.
Dále existuje uvědomění, že dostupná školicí data byla z velké části maximálně využita. To znamená, že další zlepšení modelů nebudou pocházet z přidání více dat během školení, ale z toho, jak modely fungují během inferencing. Během runtime je využití nových informací pro zlepšení výsledků modelů stává kritickou prioritou.
Zatímco některé zajímavé technologie začínají dosahovat svých limitů, nové přístupy budou pokračovat, nakonec zdůrazňující důležitost agility pro organizace, které přijímají AI. Co funguje dobře dnes, může se stát zastaralým do šesti měsíců nebo roku, takže je důležité být připraven přidat nebo nahradit datové zdroje a jakékoli komponenty AI potrubí. Zůstávání adaptabilní a otevřené ke změnám je kritické pro udržení kroků s rychle se vyvíjející krajinou.
Jaké strategie mohou organizace přijmout, aby rozložily datové sila a zlepšily tok dat napříč svými systémy?
Nejprve lidé potřebují přijmout, že datové sila budou vždy existovat. To bylo vždy případ. Mnoho organizací se snaží centralizovat všechna svá data na jednom místě, věříce, že tím vytvoří ideální nastavení a odemknou významnou hodnotu, ale to se ukazuje jako téměř nemožné, zejména pro velké podniky.
Takže realita je, že datové sila jsou zde, aby zůstala. Jakmile to přijmeme, otázka se stává: Jak můžeme pracovat s datovými silami efektivněji?
Pomáhá si představit velké společnosti. Žádná významná korporace nefunguje z jediného úřadu, kde všichni pracují společně globálně. Místo toho se dělí na hlavní sídlo a několik kanceláří. Cílem není odporovat tomuto přirozenému rozdělení, ale zajistit, aby tyto kanceláře mohly spolupracovat efektivně. To je důvod, proč investujeme do produktivních nástrojů, jako je Zoom nebo Slack, aby propojily lidi a umožnily bezproblémové pracovní postupy napříč lokalitami.
Podobně datové sila jsou fragmentované systémy, které budou vždy existovat napříč týmy, divizemi nebo jinými hranicemi. Klíčem není je eliminovat, ale učinit je pracovat společně hladce. Můžeme se soustředit na technologie, které usnadňují tyto spojení.
Například technologie, jako jsou Nexsets, poskytují společný interface nebo abstrakční vrstvu, která funguje napříč různými datovými zdroji. Jako brána k datovým silám zjednodušují proces interoperability s daty rozloženými napříč různými silami. To vytváří efektivitu a minimalizuje negativní dopady sil.
V podstatě by strategie měla být o zlepšení spolupráce mezi silami, spíše než o jejich odporování. Mnoho podniků dělá chybu, když se snaží konsolidovat vše do velké datové louže. Ale upřímně řečeno, je to téměř nevyhnutelná bitva.
Jak moderní datové platformy zvládají výzvy, jako je rychlost a škálovatelnost, a co odlišuje Nexla při řešení těchto otázek?
Jak to vidím, mnoho nástrojů v moderní datové skladbě bylo původně navrženo se zaměřením na snadné použití a rychlost vývoje, což pocházelo z toho, že nástroje byly více přístupné – umožňovaly marketingovým analytikům přesunout svá data z marketingové platformy přímo do nástroje pro visualizaci, například.
Když mluvíme o škálovatelnosti, lidé často myslí na škálování ve smyslu zvládání větších objemů dat. Ale skutečná výzva škálovatelnosti pochází ze dvou hlavních faktorů: Zvyšujícího se počtu lidí, kteří potřebují pracovat s daty, a rostoucí variety systémů a typů dat, které organizace potřebují spravovat.
Moderní nástroje, siendo vysoce specializované, řeší pouze malou část těchto problémů. V důsledku toho organizace končí s použitím více nástrojů, každý řešící jeden problém, což nakonec vytváří své vlastní problémy, jako je přetížení nástroji a neefektivita.
Nexla řeší tuto otázku tím, že nachází pečlivou rovnováhu mezi snadným použitím a flexibilitou. Na jedné straně poskytujeme jednoduchost prostřednictvím funkcí, jako jsou šablony a uživatelsky přívětivé rozhraní. Na druhé straně nabízíme flexibilitu a vývojářsky přívětivé schopnosti, které umožňují týmům kontinuálně vylepšovat platformu. Vývojáři mohou přidat nové funkce do systému, ale tyto vylepšení zůstávají přístupné jako jednoduché tlačítka a kliky pro netechnické uživatele. Tento přístup se vyhýbá pasti vysoce specializovaných nástrojů, zatímco dodává širokou škálu podnikových funkcí.
Co skutečně odlišuje Nexla je její schopnost spojit snadné použití se škálovatelností a šíří vyžadovanou organizacemi. Naše platforma spojuje tyto dva světy bezproblémově, umožňující týmům pracovat efektivně bez kompromisů v oblasti síly nebo flexibility.
Jedna z hlavních sil Nexla spočívá v její abstraktní architektuře. Zatímco uživatelé mohou vizuálně navrhnout datový potok, způsob, jakým potok funguje, je vysoce adaptabilní. V závislosti na požadavcích uživatele – jako je zdroj, destinace nebo zda data potřebují být v reálném čase – platforma automaticky mapuje potok na jednu ze šesti různých motorů. To zajišťuje optimální výkon bez nutnosti, aby uživatelé ručně spravovali tyto složitosti.
Platforma je také volně spojená, což znamená, že zdrojové systémy a systémy destinace jsou odděleny. To umožňuje uživatelům snadno přidávat více destinací k existujícím zdrojům, přidávat více zdrojů k existujícím destinacím a umožňovat oboustranné integrace mezi systémy.
Důležitým je, že Nexla abstrahuje návrh potoků, aby uživatelé mohli zvládat dávková data, streamovaná data a data v reálném čase bez změny svých pracovních postupů nebo návrhů. Platforma se automaticky přizpůsobuje těmto potřebám, což usnadňuje uživatelům pracovat s daty v jakémkoli formátu nebo rychlosti. To je více o promyšleném designu než o specifikách programovacího jazyka, zajišťujícím bezproblémový zážitek.
Všechno toto ilustruje, že jsme Nexla navrhli s ohledem na konečné spotřebitele dat. Mnoho tradičních nástrojů bylo navrženo pro ty, kteří produkují data nebo spravují systémy, ale my se soustředíme na potřeby spotřebitelů dat, kteří chtějí konzistentní, přímé rozhraní pro přístup k datům, bez ohledu na jejich zdroj. Priorita zkušeností spotřebitele nám umožnila navrhnout platformu, která zjednodušuje přístup k datům, zatímco zachovává flexibilitu potřebnou pro podporu různých případů použití.
Můžete sdílet příklady, jak funkce no-code a low-code transformovaly inženýrství dat pro Vaše zákazníky?
Funkce no-code a low-code transformovaly proces inženýrství dat na skutečně colaborativní zkušenost pro uživatele. Například v minulosti tým účetních operací DoorDash , který spravoval data pro obchodníky, potřeboval poskytnout požadavky inženýrskému týmu. Inženýři poté stavěli řešení, vedoucí k iterativnímu procesu, který spotřeboval hodně času.
Nyní s funkcemi no-code a low-code se tato dynamika změnila. Tým denních operací může použít low-code interface pro zpracování svých úkolů přímo. Zatímco inženýrský tým může rychle přidávat nové funkce a schopnosti prostřednictvím stejné low-code platformy, umožňující okamžité aktualizace. Tým operací může poté bezproblémově používat tyto funkce bez zpoždění.
Tato změna proměnila proces na colaborativní úsilí, spíše než na tvořivé úzké místo, vedoucí k významným úsporám času. Zákazníci hlásili, že úkoly, které dříve trvaly dva nebo tři měsíce, mohou být nyní dokončeny za méně než dva týdny – 5x až 10x zlepšení rychlosti.
Jak se role inženýrství dat vyvíjí, zejména s rostoucí adopcí AI?
Inženýrství dat se vyvíjí rychle, poháněno automatizací a pokroky, jako je GenAI. Mnoho aspektů oboru, jako je generování kódu a tvorba konektorů, se stává rychlejšími a efektivnějšími. Například s GenAI se tempo, ve kterém lze generovat, testovat a nasazovat konektory, dramaticky zlepšilo. Ale tento pokrok také přináší nové výzvy, včetně zvýšené složitosti, bezpečnostních obav a potřeby robustní správy.
Jedním z naléhavých problémů je potenciální zneužití podnikových dat. Společnosti se obávají, že jejich proprietární data budou náhodně použita k výcviku AI modelů a ztratí tak svou konkurenční výhodu nebo zažijí únik dat, protože data jsou zpřístupněna jiným.
Rostoucí složitost systémů a obrovské množství dat vyžadují, aby týmy inženýrství dat přijaly širší perspektivu, zaměřenou na nadřazené systémové problémy, jako je zabezpečení, správa a zajištění integrity dat. Tyto výzvy nemohou být vyřešeny pouze pomocí AI.
Zatímco generativní AI může automatizovat nižší úrovně úkolů, role inženýrství dat se posouvá směrem k orchestraci širšího ekosystému. Inženýři dat nyní fungují více jako dirigenti, spravující řadu propojených komponent a procesů, jako je nastavení záruk proti chybám nebo neoprávněnému přístupu, zajištění souladu s normami správy a monitorování, jak jsou AI-generované výstupy použity v obchodních rozhodnutích.
Chyby a chyby v těchto systémech mohou být nákladné. Například AI systémy mohou načíst zastaralé politické informace, vedoucí k nesprávným odpovědím, jako je slibování refundace zákazníkovi, když není povolena. Tyto typy problémů vyžadují přísnou kontrolu a dobře definované postupy, aby se chyby odhalily a vyřešily, než ovlivní podnik.
Další klíčovou odpovědností pro týmy inženýrství dat je adaptace na posun v uživatelské demografii. Nástroje AI již nejsou omezeny na analytiky nebo technické uživatele, kteří mohou zpochybnit platnost zpráv a dat. Tyto nástroje jsou nyní používány jednotlivci na okrajích organizace, jako jsou agenti zákaznické podpory, kteří nemusí mít odborné znalosti, aby zpochybnili nesprávné výstupy. Tato širší demokratizace technologií zvyšuje odpovědnost týmů inženýrství dat za zajištění přesnosti a spolehlivosti dat.
Co nového lze očekávat od Nexla, když se oblast inženýrství dat bude dále vyvíjet?
Soustředíme se na několik pokroků, aby se řešily vznikající výzvy a příležitosti, jak se inženýrství dat bude dále vyvíjet. Jedním z nich je AI-poháněná řešení pro řešení rozmanitosti dat. Jednou z hlavních výzev v inženýrství dat je zvládání rozmanitosti dat z různých zdrojů, takže se snažíme využít AI k zjednodušení tohoto procesu. Například, když obdržíme data od stovek různých obchodníků, systém může automaticky mapovat je do standardní struktury. Dnes tento proces často vyžaduje významný lidský vstup, ale AI-poháněné schopnosti Nexla mají minimalizovat ruční úsilí a zlepšit efektivitu.
Dále rozvíjíme naše technologie konektorů, aby podpořily novou generaci datových pracovních postupů, včetně snadné generace nových agentů. Tyto agenti umožňují bezproblémové připojení k novým systémům a umožňují uživatelům provádět specifické akce v těchto systémech. To je zejména zaměřeno na rostoucí potřeby uživatelů GenAI a usnadňuje integraci a interakci s různými platformami.
Třetím aspektem je, že pokračujeme v inovacích v oblasti vylepšené monitorování a zajištění kvality. Jak více uživatelů spotřebuje data napříč různými systémy, důležitost monitorování a zajištění kvality dat rostla významně. Naším cílem je poskytnout robustní nástroje pro monitorování systémů a zajištění kvality, aby data zůstala spolehlivá a použitelná, i když se používání rozšiřuje.
Nakonec Nexla také podniká kroky k otevření některých našich základních schopností jako open-source. Myšlenka je, že sdílením naší technologie s širší komunitou, můžeme umožnit více lidem využít pokročilá nástroje a řešení pro inženýrství dat, což最終ně odráží náš závazek k podpoře inovací a spolupráce v oboru.
Děkuji za skvělé odpovědi, čtenáři, kteří chtějí se dozvědět více, by měli navštívit Nexla.












