Interviews
Anthony Deighton, CEO af Tamr – Interview Serie

Anthony Deighton er CEO af Tamr. Han har 20 års erfaring med at bygge og skala enterprise software-virksomheder. Senest tilbragte han to år som Chief Marketing Officer i Celonis, hvor han etablerede deres lederskab i Process Mining software-kategorien og skabte efterspørgselsgenereringsprogrammer, der resulterede i 130% ARR-vækst. Før det havde han været i mere end 10 år i Qlik, hvor han voksede det fra en ukendt svensk software-virksomhed til en børsnoteret virksomhed — i roller fra produktledelse, produktmarkedsføring og til sidst som CTO. Han startede sin karriere i Siebel Systems, hvor han lærte, hvordan man bygger enterprise software-virksomheder i en række produktroller.
Kan du dele nogle nøglemilepæle fra din rejse i enterprise software-industrien, især din tid i Qlik og Celonis?
Jeg startede min karriere i enterprise software hos Siebel Systems og lærte meget om, hvordan man bygger og skalerer enterprise software-virksomheder fra ledelsesholdet der. Jeg sluttede mig til Qlik, da det var en lille, ukendt, svensk software-virksomhed med 95% af det lille 60-mands hold beliggende i Lund, Sverige. Jeg joke, at da jeg ikke var ingeniør eller salgsmand, blev jeg sat i charge af marketing. Jeg byggede marketingholdet der, men over tid blev mine interesser og bidrag rettet mod produktledelse, og til sidst blev jeg Chief Product Officer. Vi tog Qlik offentligt i 2010, og vi fortsatte som en succesfuld offentlig virksomhed. Efter det ville vi gøre nogle opkøb, så jeg startede en M&A-hold. Efter en lang og rimelig succesfuld løbetid som offentlig virksomhed solgte vi Qlik til en privat kapitalfond ved navn Thoma Bravo. Det var, som jeg gerne siger, den fulde livscyklus for en enterprise software-virksomhed. Efter at have forladt Qlik sluttede jeg mig til Celonis, en lille tysk software-virksomhed, der forsøgte at opnå succes med salg i USA. Atter engagerede jeg mig i marketing som CMO. Vi voksede meget hurtigt og byggede en meget succesfuld global markedsføringsfunktion.
Både Celonis og Qlik var fokuseret på frontenden af data analytics-udfordringen – hvordan ser jeg og forstår data? I Qliks tilfælde var det dashboards; i Celonis’ tilfælde var det forretningsprocesser. Men en fælles udfordring på tværs af begge var dataene bag disse visualiseringer. Mange kunder klagede over, at dataene var forkerte: duplikerede poster, ufuldstændige poster, manglende data siloer. Dette er, hvad der tiltrak mig til Tamr, hvor jeg følte, at vi for første gang måske kunne løse udfordringen med beskidte enterprise-data. De første 15 år af min enterprise software-karriere blev tilbragt med at visualisere data; jeg håber, at de næste 15 kan blive tilbragt med at rydde op i dataene.
Hvordan formede dine tidlige erfaringer din tilgang til at bygge og skala enterprise software-virksomheder?
En vigtig lære, jeg lærte under skiftet fra Siebel til Qlik, var kraften af simplicitet. Siebel var meget kraftfuld software, men det blev slået på markedet af Salesforce.com, som lavede en CRM med mange færre funktioner (“en legetøj” kaldte Siebel det), men kunderne kunne få det op at køre hurtigt, fordi det blev leveret som en SaaS-løsning. Det synes åbenlyst i dag, men på det tidspunkt var visdommen, at kunder købte funktioner, men det, vi lærte, var, at kunder investerer i løsninger til at løse deres forretningsproblemer. Hvis din software løser deres problem hurtigere, vinder du. Qlik var en simpel løsning til data analytics-problemet, men det var radikalt enklere. Som følge heraf kunne vi slå mere funktionelle konkurrenter som Business Objects og Cognos.
Den anden vigtige lære, jeg lærte, var under min karriereovergang fra marketing til produkt. Vi tænker på disse domæner som distinkte. I min karriere har jeg fundet, at jeg kan bevæge mig flydende mellem produkt og marketing. Der er en intim forbindelse mellem det produkt, du bygger, og hvordan du beskriver det til potentielle kunder. Og der er en lige så vigtig forbindelse mellem, hvad kunderne kræver, og hvad produktet bør bygge. Evnen til at bevæge sig mellem disse samtaler er en kritisk succesfaktor for enhver enterprise software-virksomhed. En almindelig årsag til, at en startup fejler, er, at man tror, “hvis du bygger det, kommer de”. Dette er den almindelige tro, at hvis du bare bygger cool software, vil folk stille op for at købe det. Det virker aldrig, og løsningen er en robust markedsføringsproces forbundet med din softwareudviklingsproces.
Den sidste idé, jeg vil dele, forbinder min akademiske arbejde med min professionelle arbejde. Jeg havde muligheden på business school at tage en klasse om Clay Christensens teori om disruptiv innovation. I mit professionelle arbejde har jeg haft muligheden for at opleve både at være disruptoren og at blive disrupteret. Den vigtigste lære, jeg har lært, er, at enhver disruptiv innovation er et resultat af en eksogen platformskift, der gør det umulige muligt. I Qliks tilfælde var det platformtilgængeligheden af store memory-servere, der tillod Qlik at disruptere traditionel cube-baseret rapportering. Hos Tamr er platformtilgængeligheden af machine learning i stor skala, der tillader os at disruptere manuel regelbaseret MDM til fordel for en AI-baseret tilgang. Det er vigtigt at altid finde ud af, hvilket platformskift der driver din disruption.
Hvad inspirerede udviklingen af AI-naturlig Master Data Management (MDM), og hvordan adskiller det sig fra traditionelle MDM-løsninger?
Udviklingen af Tamr kom ud af akademisk arbejde på MIT (Massachusetts Institute of Technology) omkring entity resolution. Under den akademiske ledelse af Turing Award-vinderen Michael Stonebraker var spørgsmålet, teamet undersøgte, “kan vi link data poster på tværs af hundredtusinder af kilder og millioner af poster”. På overfladen er dette en uovervindelig udfordring, fordi der er flere poster og kilder, jo flere poster hver mulig match skal sammenlignes med. Computerforskere kalder dette et “n-kvadratisk problem”, fordi problemet øger geometrisk med skalaen.
Traditionelle MDM-systemer forsøger at løse dette problem med regler og store mængder manuel data-curation. Regler skalerer ikke, fordi du aldrig kan skrive nok regler til at dække hver enkelt hjørne tilfælde, og håndtering af tusinder af regler er en teknisk umulighed. Manuel curation er ekstremt dyrt, fordi det afhænger af mennesker, der skal forsøge at arbejde igennem millioner af mulige poster og sammenligninger. Taget sammen forklarer dette den dårlige markedsaccept af traditionelle MDM-løsninger (Master Data Management). Ærligt sagt, kan ingen lide traditionel MDM.
Tamrs simple idé var at træne en AI til at udføre arbejdet med kilde-indtagelse, post-sammenligning og værdi-opløsning. Det store ved AI er, at det ikke spiser, sover eller tager ferie; det er også højst paralleliserbart, så det kan tage på enorme mængder af data og bearbejde det for at gøre det bedre. Så, hvor MDM tidligere var umuligt, er det nu muligt at opnå rent, konsolideret og opdateret data (se ovenfor).
Hvad er de største udfordringer, virksomheder står over for med deres data management, og hvordan løser Tamr disse problemer?
Den første og måske vigtigste udfordring, virksomheder står over for i data management, er, at deres forretningsbrugere ikke bruger de data, de genererer. Eller sagt på en anden måde, hvis data teams ikke producerer højkvalitetsdata, som deres organisationer kan bruge til at besvare analytiske spørgsmål eller strømline forretningsprocesser, så spilder de tid og penge. En primær output fra Tamr er en 360-side for hver entitetspost (tænk: kunde, produkt, del, osv.), der kombinerer alle de underliggende 1. og 3. partsdata, så forretningsbrugere kan se og give feedback på dataene. Som en wiki for dine entitetsdata. Denne 360-side er også input til en konversationsinterface, der tillader forretningsbrugere at stille og besvare spørgsmål med dataene. Så, job nummer ét er at give brugeren dataene.
Hvorfor er det så svært for virksomheder at give brugerne data, de elsker? Fordi der er tre primære hårde problemer underliggende dette mål: indlæsning af en ny kilde, sammenligning af de nye poster med de eksisterende data og rettelse af værdier/felter i data. Tamr gør det let at indlæse nye kilder af data, fordi dens AI automatisk mapper nye felter til en defineret entitetsskema. Dette betyder, at uanset hvad en ny datakilde kalder et bestemt felt (eksempel: cust_name), bliver det kortlagt til den rette centrale definition af den entitet (eksempel: “kunde navn”). Den næste udfordring er at link poster, der er duplikater. Duplikation i denne kontekst betyder, at posterne i virkeligheden er den samme virkelige entitet. Tamrs AI gør dette og bruger endda eksterne 3. parts kilder som “ground truth” til at løse fælles entiteter som virksomheder og personer. Et godt eksempel på dette ville være at link alle poster på tværs af mange kilder for en vigtig kunde som “Dell Computer”. Til sidst kan der for en given post være felter, der er tomme eller forkerte. Tamr kan imputere de korrekte feltværdier fra interne og 3. parts kilder.
Kan du dele en succes historie, hvor Tamr betydeligt forbedrede en virksomheds data management og forretningsresultater?
CHG Healthcare er en stor spiller i sundhedspleje-industrien, der forbinder dygtige sundhedsfaglige med faciliteter, der har brug for dem. Enten det er midlertidige læger gennem Locums, sygeplejersker med RNnetwork eller bredere løsninger gennem CHG selv, tilbyder de tilpassede rekrutteringsløsninger til at hjælpe sundhedsfaciliteterne med at fungere glat og levere kvalitetspleje til patienterne.
Deres grundlæggende værdiproposition er at forbinde de rette sundhedsudbydere med den rette facilitet på det rette tidspunkt. Deres udfordring var, at de ikke havde en præcis, samlet vy over alle udbyderne i deres netværk. Givet deres skala (7,5 millioner+ udbydere), var det umuligt at holde deres data nøjagtig med legacy, regel-drevne tilgange uden at bryde banken på menneskelige kuratorer. De kunne heller ikke ignorere problemet, da deres rekrutteringsbeslutninger afhang af det. Dårlige data for dem kunne betyde, at en udbyder får flere vagter, end de kan klare, hvilket fører til udbrændthed.
Med Tamrs avancerede AI/ML-kapaciteter reducerede CHG Healthcare duplikerede lægeposter med 45% og eliminerede næsten fuldstændigt den manuelle dataforberedelse, der blev udført af sjældne data- og analyticsressourcer. Og det vigtigste er, at ved at have en pålidelig og nøjagtig vy over udbydere, kan CHG optimere rekruttering, hvilket muliggør, at de kan levere en bedre kundeoplevelse.
Hvad er nogle almindelige misforståelser om AI i data management, og hvordan hjælper Tamr med at afklare disse myter?
En almindelig misforståelse er, at AI skal være “perfekt”, eller at regler og menneskelig curation er perfekte i modsætning til AI. Virkeligheden er, at regler fejler hele tiden. Og vigtigere endnu er, at når regler fejler, er den eneste løsning flere regler. Så du har en ustyrlig rod af regler. Og menneskelig curation er fejlig også. Mennesker kan have gode intentioner (om end ikke altid), men de er ikke altid rette. Hvad er værre, er, at nogle menneskelige kuratorer er bedre end andre, eller blot kan træffe forskellige beslutninger end andre. AI, til gengæld, er probabilistisk af natur. Vi kan validere gennem statistik, hvor nøjagtigt disse teknikker er, og når vi gør, finder vi, at AI er mindre dyrt og mere nøjagtigt end enhver anden konkurrerende løsning.
Tamr kombinerer AI med menneskelig raffinering for data nøjagtighed. Kan du uddybe, hvordan denne kombination fungerer i praksis?
Mennesker giver noget exceptionelt vigtigt til AI – de giver træningen. AI handler virkelig om at skala menneskelige bestræbelser. Det, Tamr søger hos mennesker, er det lille antal eksempler (“træningsmærker”), som maskinen kan bruge til at sætte modelparametrene. I praksis ser dette ud som mennesker, der bruger en lille mængde tid med dataene, giver Tamr eksempler på fejl og fejl i dataene, og AI kører disse lektioner over det fulde datasæt. Derudover, når nye data tilføjes eller data ændres, kan AI overflade eksempler, hvor det kæmper for at træffe beslutninger med tillid (“lavt tillidsniveau matcher”), og bede mennesker om input. Dette input, naturligvis, går til at raffinere og opdatere modellerne.
Hvad rolle spiller store sprogmodeller (LLM’er) i Tamrs datakvalitets- og berigelsesprocesser?
Først og fremmest er det vigtigt at være klart om, hvad LLM’er er gode til. Grundlæggende er LLM’er om sprog. De producerer tekststreng, der betyder noget, og de kan “forstå” betydningen af tekst, der gives til dem. Så kan man sige, at de er sprogmaskiner. Så for Tamr, hvor sprog er vigtigt, bruger vi LLM’er. Et åbenlyst eksempel er i vores konversationsinterface, der sidder på toppen af vores entitetsdata, som vi kærtegner vores virtuelle CDO. Når du taler med din rigtige CDO, forstår de dig og responderer ved hjælp af sprog, du forstår. Dette er præcis, hvad vi forventer af en LLM, og det er præcis, hvordan vi bruger det i denne del af vores software. Det, der er værdifuldt om Tamr i denne kontekst, er, at vi bruger entitetsdataene som kontekst for samtalen med vores vCDO. Det er som din rigtige CDO har alle dine bedste enterprise-data til rådighed, når de responderer på dine spørgsmål – ville det ikke være dejligt!
I tillæg er der tilfælde, hvor vi i rensning af data værdier eller imputering af manglende værdier ønsker at bruge en sprog-baseret fortolkning af input-værdier til at finde eller korrigere en manglende værdi. For eksempel kan du spørge fra teksten “5mm bold-bearing” hvad størrelsen på delen er, og en LLM (eller en person) ville korrekt svare “5mm”.
Sidst, men ikke mindst, er der underliggende LLM’er indlejring modeller, der kodificerer sprog betydning til tokens (tænk ord). Disse kan være meget nyttige til at beregne lingvistisk sammenligning. Så, mens “5” og “five” deler ingen karakterer fælles, er de meget tæt på i lingvistisk betydning. Så kan vi bruge denne information til at link poster sammen.
Hvordan ser du fremtiden for data management udvikle sig, især med fremskridt i AI og machine learning?
“Big Data”-æraen i begyndelsen af 2000’erne skal huskes som “Small Data”-æraen. Mens en masse data er blevet skabt over de sidste 20+ år, muliggjort af kommodificeringen af lagring og beregning, er det meste af data, der har haft en impact i virksomheden, relativt småskala – grundlæggende salgs- og kunde-rapporter, marketing-analytik og andre datasæt, der let kan afbildes i et dashboard. Resultatet er, at mange af de værktøjer og processer, der bruges i data management, er optimeret til ‘small data’, hvilket er, hvorfor regel-baseret logik, suppleret med menneskelig curation, stadig er så fremherskende i data management.
Måden, mennesker vil bruge data på, ændrer sig fundamentalt med fremskridt i AI og machine learning. Ideen om “AI-agenter”, der kan uafhængigt udføre en betydelig del af en persons job, fungerer kun, hvis agenten har de data, de behøver. Hvis du forventer, at en AI-agent skal fungere på frontlinjen af kunde-support, men du har fem repræsentationer af “Dell Computer” i din CRM, og det er ikke forbundet med produktinformation i din ERP, hvordan kan du forvente, at de kan levere højkvalitets service, når nogen fra Dell kontakter?
Implikationen heraf er, at vores data management-værktøj og -processer vil neede at udvikle sig for at håndtere skala, hvilket betyder, at vi skal acceptere AI og machine learning for at automatisere mere data-rensningsaktiviteter. Mennesker vil stadig spille en stor rol i at overvåge processen, men grundlæggende behøver vi at bede maskinerne om at gøre mere, så det ikke kun er data i et enkelt dashboard, der er nøjagtig og fuldstændig, men det er det meste af data i virksomheden.
Hvad er de største muligheder for virksomheder i dag, når det kommer til at udnytte deres data mere effektivt?
At øge antallet af måder, hvorpå mennesker kan forbruge data på. Der er ingen tvivl om, at forbedringer i data visualisering-værktøjer har gjort data meget mere tilgængeligt i hele virksomheden. Nu skal data- og analytics-ledere se beyond dashboardet for måder at levere værdi med data på. Interfaces som interne 360-sider, viden grafer og konversationsassistenter bliver muliggjort af nye teknologier og giver potentielle data-forbrugere flere måder at bruge data i deres dag-til-dag workflow. Det er særligt kraftfuldt, når disse er integreret i systemerne, som mennesker allerede bruger, såsom CRMs og ERPs. Den hurtigste måde at skabe mere værdi fra data er ved at bringe data til mennesker, der kan bruge det.
Tak for det fantastiske interview, læsere, der ønsker at lære mere, skal besøge Tamr.












