Rozhovory
Anthony Deighton, CEO společnosti Tamr – Interview Series

Anthony Deighton je CEO společnosti Tamr. Má 20 let zkušeností s budováním a škálováním podnikových softwarových společností. V poslední době strávil dva roky jako Chief Marketing Officer ve společnosti Celonis, kde zavedl jejich vedení v kategorii softwaru pro Process Mining a vytvořil programy pro generování poptávky, které vedly ke 130% růstu ARR. Předtím pracoval 10 let ve společnosti Qlik, kde ji rozvíjel z neznámé švédské softwarové společnosti na veřejnou společnost – ve funkcích od produktového vedení, produktového marketingu a nakonec jako CTO. Svoji kariéru začal ve společnosti Siebel Systems, kde se naučil, jak budovat podnikový software v různých produktových rolích.
Můžete sdílet některé klíčové milníky z vaší cesty v odvětví podnikového softwaru, zejména z vašeho času ve společnostech Qlik a Celonis?
Začal jsem svou kariéru v podnikovém softwaru ve společnosti Siebel Systems a naučil jsem se mnoho o budování a škálování podnikových softwarových společností od vedení tam. Připojil jsem se k Qlik, když to byla malá, neznámá švédská softwarová společnost s 95% malé 60členné týmu umístěného v Lundu, Švédsku. Žertuji, že既然 jsem nebyl inženýr nebo prodejce, byl jsem jmenován do marketingu. Postavil jsem marketingový tým tam, ale postupem času se můj zájem a příspěvky přesunuly směrem k produktovému managementu, a nakonec jsem se stal Chief Product Officer. Vynesli jsme Qlik na burzu v roce 2010 a pokračovali jako úspěšná veřejná společnost. Poté jsme chtěli učinit einige akvizice, takže jsem založil tým pro fúze a akvizice. Po dlouhém a poměrně úspěšném běhu jako veřejná společnost jsme nakonec prodali Qlik soukromé kapitálové firmě Thoma Bravo. Bylo to, jak rádi říkám, celý životní cyklus podnikové softwarové společnosti. Po odchodu z Qliku jsem se připojil k Celonis, malé německé softwarové společnosti, která se snažila získat úspěch prodejem v USA. Opět jsem vedl marketing jako CMO. Rychle jsme rostli a vytvořili velmi úspěšnou globální marketingovou funkci.
Obojí, Celonis i Qlik, se zaměřovaly na přední část výzvy datové analýzy – jak vidět a pochopit data? V případě Qliku to byly dashboardy; v případě Celonis to byly obchodní procesy. Ale společnou výzvou pro obě společnosti byla data za těmito visualizacemi. Mnozí zákazníci si stěžovali, že data jsou špatná: duplikátní záznamy, neúplné záznamy, chybějící sila dat. To je to, co mě přitáhlo k Tamr, kde jsem cítil, že poprvé můžeme vyřešit výzvu znečištěných podnikových dat. První 15 let mé kariéry v podnikovém softwaru jsem strávil visualizací dat, doufám, že příštích 15 let bude strávit čištěním těchto dat.
Jak vaše rané zkušenosti ovlivnily váš přístup k budování a škálování podnikových softwarových společností?
Jedna důležitá lekce, kterou jsem se naučil při přechodu ze Siebelu na Qlik, byla síla jednoduchosti. Siebel byl velmi výkonný software, ale byl zabit na trhu Salesforce.com, který vytvořil CRM s mnoha méně funkcemi („hračka“ Siebel to nazýval), ale zákazníci mohli získat jej rychleji, protože byl dodán jako SaaS řešení. Zdá se to dnes zřejmé, ale v té době se věřilo, že zákazníci kupují funkce, ale co jsme se naučili, je, že zákazníci investují do řešení, která řeší jejich obchodní problémy. Pokud váš software řeší jejich problém rychleji, vyhráváte. Qlik byl jednoduchým řešením problému datové analýzy, ale byl radikálně jednodušší. Jako výsledek jsme mohli porazit více funkcemi bohaté konkurenty, jako jsou Business Objects a Cognos.
Druhá důležitá lekce, kterou jsem se naučil, byla v mém kariérním přechodu z marketingu na produkt. Myšlenka, že tyto domény jsou odlišné. V mé kariéře jsem našel, že se pohybuji snadno mezi produktem a marketingem. Existuje úzký vztah mezi tím, jaký produkt postavíte, a jak jej popisujete potenciálním zákazníkům. A existuje stejně důležitý vztah mezi tím, co zákazníci požadují, a tím, jaký produkt bychom měli postavit. Schopnost pohybovat se mezi těmito rozhovory je kritickým úspěchem pro jakoukoli podnikovou softwarovou společnost. Společný důvod selhání startupu je víra, že „Pokud to postavíte, přijdou“. To je společné přesvědčení, že pokud postavíte pouze cool software, lidé se budou frontovat, aby jej koupili. To nikdy nefunguje, a řešení je robustní marketingový proces spojený s procesem vývoje softwaru.
Poslední myšlenka, kterou chci sdílet, spojuje mou akademickou práci s mou profesionální prací. Měl jsem příležitost na obchodní škole absolvovat kurz o teorii Claye Christensena o disruptivní inovaci. V mé profesionální práci jsem měl příležitost zažít obě strany – být disruptorem a být disruptován. Klíčová lekce, kterou jsem se naučil, je, že každá disruptivní inovace je výsledkem exogenní platformové změny, která činí nemožné konečně možným. V případě Qliku to byla dostupnost velkých serverů s pamětí, která umožnila Qliku narušit tradiční reporting založený na kostkách. U Tamr je to dostupnost strojového učení v měřítku, která umožňuje narušit ruční pravidla založená na MDM ve prospěch AI-založeného přístupu. Je důležité vždy zjistit, jaká platformová změna pohání naši disruptivní inovaci.
Co inspirovalo vývoj AI-rodného Master Data Management (MDM), a jak se liší od tradičních MDM řešení?
Vývoj Tamr vzešel z akademické práce na MIT (Massachusetts Institute of Technology) kolem entity resolution. Pod vedením Turingova oceněného Michaela Stonebrakera se tým ptal: „Mohli bychom propojit datové záznamy napříč stovkami tisíc zdrojů a miliony záznamů?“ Na první pohled to vypadá jako nepřevoditelná výzva, protože čím více záznamů a zdrojů, tím více záznamů je třeba porovnat. Počítačoví vědci to nazývají „n-squared problém“, protože problém roste geometricky se škálou.
Tradiční MDM systémy se snaží vyřešit tento problém pomocí pravidel a velkého množství manuální datové kúry. Pravidla nefungují, protože nikdy nemůžete napsat dostatek pravidel, aby pokryly každý rohový případ, a správa tisíců pravidel je technickou nemožností. Manuální kúra je extrémně drahá, protože závisí na lidech, kteří se snaží projít miliony možných záznamů a porovnání. Vezmeme-li to dohromady, vysvětluje to špatné přijetí tradičních MDM (Master Data Management) řešení. Upřímně řečeno, nikdo nemá rád tradiční MDM.
Jednoduchá myšlenka Tamr byla naučit AI dělat práci zdrojového příjmu, záznamového párování a hodnoty řešení. Velké věci o AI je, že nejí, nespí ani neberou dovolenou; je také vysoce paralelizovatelná, takže může zpracovat obrovské objemy dat a neustále je zlepšovat. Kde MDM dříve bylo nemožné, je konečně možné dosáhnout čistých, konsolidovaných a aktuálních dat (viz výše).
Jaké jsou největší výzvy, kterým čelí společnosti s jejich správou dat, a jak Tamr řeší tyto problémy?
První a možná nejdůležitější výzvou, které čelí společnosti ve správě dat, je, že jejich obchodní uživatelé nepoužívají data, která generují. Jinými slovy, pokud datové týmy nevytvářejí vysoce kvalitní data, která jejich organizace používají k řešení analytických otázek nebo optimalizaci obchodních procesů, pak plýtvají časem a penězi. Primárním výstupem Tamr je 360 stránka pro každou entitní záznam (myslete si: zákazník, produkt, část, atd.), která kombinuje všechna podkladová 1. a 3. strany dat, aby obchodní uživatelé mohli vidět a poskytovat zpětnou vazbu na data. Jako wiki pro vaše entitní data. Tato 360 stránka je také vstupem do konverzačního rozhraní, které umožňuje obchodním uživatelům klást a odpovídat na otázky s daty. Takže, první práce je dát uživateli data.
Proč je tak obtížné pro společnosti dát uživatelům data, která milují? Protože existují tři primární tvrdé problémy, které podléhají tomuto cíli: načtení nového zdroje, párování nových záznamů do existujících dat a opravování hodnot/polí v datech. Tamr usnadňuje načtení nových zdrojů dat, protože jeho AI automaticky mapuje nová pole do definovaného entitního schématu. To znamená, že bez ohledu na to, co nový datový zdroj nazývá konkrétní pole (například „cust_name“), je mapováno na centrální definici této entity (například „jméno zákazníka“). Další výzvou je propojit duplikátní záznamy. Duplikát v tomto kontextu znamená, že záznamy jsou ve skutečnosti stejnou reálnou entitou. AI Tamr to dělá a dokonce používá externí 3. strany zdroje jako „ground truth“ pro řešení společných entit, jako jsou společnosti a lidé. Dobrým příkladem by bylo propojení všech záznamů napříč mnoha zdroji pro důležitou společnost, jako je „Dell Computer“. Nakonec, pro každý záznam může být pole, které je prázdné nebo nesprávné. Tamr může odvodit správné hodnoty polí z interních a 3. stran zdrojů.
Můžete sdílet úspěch, kde Tamr významně zlepšil správu dat a obchodní výsledky společnosti?
CHG Healthcare je významným hráčem v oblasti zdravotnického personálu, který spojuje zkušené zdravotnické profesionály se zařízeními, která je potřebují. Bez ohledu na to, zda se jedná o dočasné lékaře prostřednictvím Locums, sestry s RNnetwork nebo širší řešení prostřednictvím CHG, poskytují přizpůsobená personální řešení, aby pomohly zdravotnickým zařízením fungovat hladce a poskytovat kvalitní péči pacientům.
<p Jejich základní hodnotová nabídka spočívá v propojení správných zdravotnických poskytovatelů se správným zařízením ve správný čas. Jejich výzvou bylo, že neměli přesný, sjednocený pohled na všechny poskytovatele ve své síti. Vzhledem k jejich rozsahu (7,5 milionu+ poskytovatelů) bylo nemožné udržet svá data přesná pomocí tradičních, pravidla řízených přístupů bez rozbití banku na lidské kurátory. Nemohli také ignorovat problém, protože jejich personální rozhodnutí závisela na tom. Špatná data pro ně mohla znamenat, že poskytovatel dostane více směn, než zvládne, což by vedlo k vyhoření.
Použitím pokročilých AI/ML schopností Tamr snížil počet duplikátních záznamů o 45% a téměř úplně odstranil manuální přípravu dat, která byla prováděna vzácnými datovými a analytickými zdroji. A co je nejdůležitější, díky tomu, že měli důvěryhodný a přesný pohled na poskytovatele, CHG může optimalizovat personál, aby mohl poskytovat lepší zákaznickou zkušenost.
Jaké jsou některé běžné mýty o AI ve správě dat, a jak Tamr pomáhá vyvrátit tyto mýty?
Běžným mýtem je, že AI musí být „dokonalé“, nebo že pravidla a lidská kúra jsou v kontrastu s AI dokonalé. Realita je, že pravidla selhávají neustále. A co je důležitější, když pravidla selhávají, jediné řešení je více pravidel. Takže máte neříditelnou situaci s pravidly. A lidská kúra je také omylná. Lidé mohou mít dobré úmysly (i když ne vždy), ale nejsou vždy správní. Co je horší, někteří lidské kurátoři jsou lepší než ostatní, nebo prostě dělají různé rozhodnutí než ostatní. AI, na druhé straně, je pravděpodobnostní povahy. Můžeme ověřit statisticky, jak přesné jsou tyto techniky, a když to uděláme, zjistíme, že AI je méně nákladná a přesnější než jakákoli konkurenční alternativa.
Tamr kombinuje AI s lidskou rafinací pro přesnost dat. Můžete vysvětlit, jak tato kombinace funguje v praxi?
Lidé poskytují AI něco výjimečně důležitého – poskytují školení. AI je ve skutečnosti o škálování lidských úsilí. Co Tamr hledá u lidí, je malý počet příkladů („školících štítků“), které stroj může použít k nastavení modelových parametrů. V praxi to vypadá tak, že lidé stráví malou část času s daty a poskytují Tamr příklady chyb a nesrovnalostí v datech, a AI běží tyto lekce napříč celým datovým souborem. Kromě toho, když jsou přidána nová data nebo se data změní, AI může povrchovat instance, kde se snaží s jistotou rozhodnout („nízké důvěryhodné shody“), a požádat člověka o vstup. Tento vstup, samozřejmě, jde na rafinaci a aktualizaci modelů.
Jakou roli hrají velké jazykové modely (LLM) v procesech kvality a obohacení dat Tamr?
Nejdříve je důležité být jasný o tom, co jsou LLM dobré. Základní LLM jsou o jazyku. Produkují řetězce textu, které něco znamenají, a mohou „porozumět“ významu textu, který je jim dán. Takže můžete říci, že jsou jazykovými stroji. Takže pro Tamr, kde je jazyk důležitý, používáme LLM. Jeden zřejmý příklad je v našem konverzačním rozhraní, které sedí na našem entitním datu, které jsme rádi nazývají naším virtuálním CDO. Když mluvíte se svým reálným CDO, rozumí vám a odpovídají pomocí jazyka, který chcete. To je přesně to, co bychom očekávali od LLM, a to je přesně to, jak je používáme v této části našeho softwaru. Co je cenné na Tamr v tomto kontextu je, že používáme entitní data jako kontext pro konverzaci s naším vCDO. Je to jako vaše reálné CDO má všechna vaše nejlepší podniková data na dosah, když odpovídá na vaše otázky – nebylo by to skvělé!
Kromě toho existují instance, kdy je třeba použít jazykové interpretace vstupních hodnot pro nalezení nebo opravu chybějící hodnoty. Například můžete ze textu „5mm kuličkový ložisko“ zeptat, jaká je velikost dílu, a LLM (nebo osoba) by správně odpověděla „5mm“.
Nakonec, pod LLM jsou modely, které kódují jazykový význam do tokenů (myslete si na slova). Tyto mohou být velmi užitečné pro výpočet lingvistické srovnání. Takže, zatímco „5“ a „pět“ sdílejí žádnou společnou znak v rámci, jsou velmi blízko v lingvistickém významu. Takže můžeme použít tuto informaci pro propojení záznamů.
Jak vidíte budoucnost správy dat, zejména s pokroky v AI a strojovém učení?
Éra „Big Data“ na počátku roku 2000 by měla být zapamatována jako éra „Malých dat“. Ačkoli bylo vytvořeno mnoho dat za posledních 20+ let, umožněno komoditizací úložiště a výpočtu, většina dat, která měla dopad v podniku, je relativně malého rozsahu – základní prodejní a zákaznické zprávy, marketingová analýza a další datové sady, které by mohly být snadno zobrazeny v dashboardu. Výsledek je, že mnoho nástrojů a procesů používaných ve správě dat je optimalizováno pro „malá data“, což je důvod, proč logika založená na pravidlech, doplněná lidskou kúrou, je stále tak prominentní ve správě dat.
Způsob, jakým lidé chtějí používat data, se fundamentálně mění s pokroky v AI a strojovém učení. Nápad „AI agentů“, kteří mohou autonomně vykonávat významnou část práce člověka, funguje pouze tehdy, pokud mají agenti data, která potřebují. Pokud očekáváte, že AI agent bude sloužit na frontě zákaznické podpory, ale máte pět reprezentací „Dell Computer“ ve vašem CRM a není propojeno s produkčními informacemi ve vašem ERP, jak můžete očekávat, že poskytnou vysokou kvalitu služby, když někdo z Dellu se ozve?
Implikace této skutečnosti je, že naše nástroje a procesy správy dat musí evolovat, aby zvládly škálovatelnost, což znamená přijetí AI a strojového učení pro automatizaci více činností čištění dat. Lidé budou stále hrát velkou roli v dohledu nad procesem, ale fundamentálně musíme požádat stroje, aby udělali více, aby nebylo pouze data v jednom dashboardu přesná a úplná, ale aby většina dat v podniku byla přesná a úplná.
Jaké jsou největší příležitosti pro podniky dnes, pokud jde o využití svých dat efektivněji?
Zvýšení počtu způsobů, jak mohou lidé spotřebovávat data. Není pochyb o tom, že zlepšení nástrojů pro datové visualizace činí data mnohem přístupnějšími po celém podniku. Nyní musí lídři dat a analýz hledat způsoby, jak dodávat hodnotu s daty za hranice dashboardu. Rozhraní, jako jsou interní 360 stránky, znalostní grafy a konverzační asistenti, jsou umožněny novými technologiemi a poskytují potenciálním spotřebitelům dat více způsobů, jak používat data ve své denní pracovní činnosti. Je to zvláště účinné, když jsou tyto funkce zabudovány do systémů, které lidé již používají, jako jsou CRM a ERP. Nejrychlejší způsob, jak vytvořit více hodnoty z dat, je přinést data lidem, kteří je mohou použít.
Děkuji za skvělý rozhovor, čtenáři, kteří chtějí se dozvědět více, by měli navštívit Tamr.












