Interviews
Anthony Deighton, CEO van Tamr – Interviewreeks

Anthony Deighton is CEO van Tamr. Hij heeft 20 jaar ervaring met het opbouwen en schalen van enterprise softwarebedrijven. Recentelijk bracht hij twee jaar door als Chief Marketing Officer bij Celonis, waar hij het leiderschap van het bedrijf in de Process Mining softwarecategorie vestigde en vraaggeneratieprogramma’s creëerde die leidden tot een omzetgroei van 130%. Voordat hij bij Celonis kwam, werkte hij meer dan 10 jaar bij Qlik, waar hij het bedrijf van een onbekend Zweeds softwarebedrijf naar een beursgenoteerd bedrijf groeide – in functies variërend van productleiderschap, productmarketing en uiteindelijk als CTO. Hij begon zijn carrière bij Siebel Systems, waar hij leerde hoe hij enterprise softwarebedrijven kon opbouwen in verschillende productfuncties.
Kunt u enkele belangrijke mijlpalen uit uw carrière in de enterprise software-industrie delen, met name uw tijd bij Qlik en Celonis?
Ik begon mijn carrière in enterprise software bij Siebel Systems en leerde veel over het opbouwen en schalen van enterprise softwarebedrijven van het leiderschapsteam daar. Ik sloot me aan bij Qlik toen het een klein, onbekend Zweeds softwarebedrijf was met 95% van het kleine team van 60 personen gevestigd in Lund, Zweden. Ik maak een grapje dat omdat ik geen ingenieur of verkoper was, ik de marketing moest doen. Ik bouwde het marketingteam op, maar na verloop van tijd verplaatsten mijn interesse en bijdragen zich naar productmanagement, en uiteindelijk werd ik Chief Product Officer. We namen Qlik publiek in 2010 en bleven een succesvol beursgenoteerd bedrijf. Daarna wilden we enkele overnames doen, dus startte ik een M&A-team. Na een lange en redelijk succesvolle periode als beursgenoteerd bedrijf, verkochten we Qlik uiteindelijk aan een private equity-firma genaamd Thoma Bravo. Het was, zoals ik het graag zeg, de volledige levenscyclus van een enterprise softwarebedrijf. Na mijn vertrek bij Qlik sloot ik me aan bij Celonis, een klein Duits softwarebedrijf dat succes wilde behalen in de VS. Opnieuw leidde ik de marketing als CMO. We groeiden heel snel en bouwden een zeer succesvolle wereldwijde marketingfunctie op.
Beide Celonis en Qlik richtten zich op het front-end van de data-analyse-uitdaging – hoe zie ik en begrijp ik data? In het geval van Qlik was dit dashboards; in het geval van Celonis was het bedrijfsprocessen. Maar een gemeenschappelijke uitdaging voor beide was de data achter deze visualisaties. Veel klanten klaagden dat de data verkeerd was: dubbele records, onvolledige records, ontbrekende data-silos. Dit is wat me aangetrokken heeft tot Tamr, waar ik voor het eerst dacht dat we misschien de uitdaging van rommelige enterprise-data konden oplossen. De eerste 15 jaar van mijn carrière in enterprise software werden besteed aan het visualiseren van data; ik hoop dat de volgende 15 jaar kunnen worden besteed aan het opschonen van die data.
Hoe hebben uw vroege ervaringen uw aanpak beïnvloed voor het opbouwen en schalen van enterprise softwarebedrijven?
Een belangrijke les die ik leerde bij de overgang van Siebel naar Qlik was de kracht van eenvoud. Siebel was zeer krachtige software, maar het werd op de markt gedood door Salesforce.com, dat een CRM maakte met veel minder functies (“een speeltje” noemde Siebel het), maar klanten konden het snel in gebruik nemen omdat het werd geleverd als een SaaS-oplossing. Het lijkt vandaag de dag vanzelfsprekend, maar op dat moment was de wijsheid dat klanten functies kochten, maar wat we leerden is dat klanten investeren in oplossingen om hun bedrijfsproblemen op te lossen. Dus, als uw software hun probleem sneller oplost, wint u. Qlik was een eenvoudige oplossing voor het data-analyseprobleem, maar het was radicaal eenvoudiger. Als gevolg daarvan konden we concurrerende partijen met meer functies, zoals Business Objects en Cognos, verslaan.
De tweede belangrijke les die ik leerde was in mijn carrièreovergang van marketing naar product. We denken aan deze domeinen als afzonderlijk. In mijn carrière heb ik ontdekt dat ik vloeiend beweeg tussen product en marketing. Er is een intieme link tussen het product dat u bouwt en hoe u het beschrijft aan potentiële klanten. En er is een even belangrijke link tussen wat prospects eisen en wat product we moeten bouwen. De mogelijkheid om tussen deze gesprekken te bewegen is een kritieke succesfactor voor elk enterprise softwarebedrijf. Een veelvoorkomende reden voor het falen van een startup is het geloof dat “als je het bouwt, zullen ze komen”. Dit is het veelvoorkomende geloof dat als je alleen maar cool software bouwt, mensen in de rij zullen staan om het te kopen. Dit werkt nooit, en de oplossing is een robuust marketingproces dat is verbonden met uw software-ontwikkelingsproces.
De laatste gedachte die ik wil delen verbindt mijn academische werk met mijn professionele werk. Ik had de kans om op de business school een klas te volgen over Clay Christensen’s theorie van disruptieve innovatie. In mijn professionele werk heb ik de kans gehad om zowel de disruptor als de disruptie te ervaren. De belangrijkste les die ik heb geleerd is dat elke disruptieve innovatie het resultaat is van een exogene platformverschuiving die het onmogelijke eindelijk mogelijk maakt. In het geval van Qlik was dit de beschikbaarheid van grote geheugenservers die Qlik in staat stelde om traditionele cube-gebaseerde rapportage te doorbreken. Bij Tamr maakt de beschikbaarheid van machine learning op grote schaal het mogelijk om handmatige regelgebaseerde MDM te doorbreken in favoor van een AI-gebaseerde benadering. Het is belangrijk om altijd te begrijpen welke platformverschuiving uw disruptie aandrijft.
Wat inspireerde de ontwikkeling van AI-native Master Data Management (MDM), en hoe verschilt het van traditionele MDM-oplossingen?
De ontwikkeling van Tamr kwam voort uit academisch onderzoek aan het MIT (Massachusetts Institute of Technology) naar entiteitsresolutie. Onder het academische leiderschap van de Turing Award-winnaar Michael Stonebraker onderzocht het team de vraag “kunnen we gegevensrecords koppelen over honderdduizenden bronnen en miljoenen records?” Op het eerste gezicht is dit een onoverkomelijke uitdaging omdat het aantal records en bronnen toeneemt, het aantal mogelijke overeenkomsten dat moet worden vergeleken ook toeneemt. Computerwetenschappers noemen dit een “n-gekwadrateerd probleem” omdat het probleem meetkundig toeneemt met de schaal.
Traditionele MDM-systemen proberen dit probleem op te lossen met regels en grote hoeveelheden handmatige gegevenscuratie. Regels schalen niet omdat u nooit genoeg regels kunt schrijven om elke hoekcase te dekken en het beheren van duizenden regels is een technische onmogelijkheid. Handmatige curatie is extreem duur omdat het afhankelijk is van mensen die proberen om miljoenen mogelijke records en vergelijkingen te doorwerken. Samen genomen, verklaart dit de slechte marktadoptie van traditionele MDM-oplossingen (Master Data Management). Om eerlijk te zijn, houdt niemand van traditionele MDM.
Tamr’s eenvoudige idee was om een AI te trainen om de werkzaamheden van broninname, recordkoppeling en waarde-oplossing te doen. Het grote voordeel van AI is dat het niet eet, slaapt of vakantie neemt; het is ook zeer parallelleerbaar, dus het kan grote hoeveelheden gegevens verwerken en ze verbeteren. Dus, waar MDM vroeger onmogelijk was, is het nu eindelijk mogelijk om schoon, geconsolideerd en up-to-date gegevens te verkrijgen (zie boven).
Wat zijn de grootste uitdagingen waar bedrijven mee te maken krijgen bij hun datamanagement, en hoe lost Tamr deze problemen op?
De eerste, en mogelijk de belangrijkste uitdaging die bedrijven tegenkomen bij datamanagement, is dat hun businessgebruikers de gegenereerde gegevens niet gebruiken. Of, zoals het ook kan worden gezegd, als datateams geen hoogwaardige gegevens produceren die hun organisaties gebruiken om analytische vragen te beantwoorden of bedrijfsprocessen te stroomlijnen, dan verspillen ze tijd en geld. Een primaire output van Tamr is een 360-pagina voor elke entiteitsrecord (denk aan: klant, product, onderdeel, enz.) die alle onderliggende 1e en 3e partijengegevens combineert, zodat businessgebruikers de gegevens kunnen zien en feedback kunnen geven op de gegevens. Zoals een wiki voor uw entiteitsgegevens. Deze 360-pagina is ook de invoer voor een conversatieinterface die businessgebruikers in staat stelt om vragen te stellen en te beantwoorden met de gegevens. Dus, taak één is om de gebruiker de gegevens te geven.
Waarom is het zo moeilijk voor bedrijven om gebruikers gegevens te geven die ze leuk vinden? Omdat er drie primaire harde problemen onderliggen aan dit doel: het laden van een nieuwe bron, het koppelen van de nieuwe records aan de bestaande gegevens en het corrigeren van de waarden/velden in de gegevens. Tamr maakt het gemakkelijk om nieuwe gegevensbronnen te laden omdat de AI automatisch nieuwe velden in een gedefinieerd entiteitschema toewijst. Dit betekent dat, ongeacht hoe een nieuwe gegevensbron een bepaald veld noemt (bijv. “klant_naam”), het wordt toegewezen aan de juiste centrale definitie van die entiteit (bijv. “klantnaam”). De volgende uitdaging is om records te koppelen die duplicaten zijn. Duplicatie in deze context betekent dat de records in feite dezelfde werkelijke entiteit zijn. Tamr’s AI doet dit en gebruikt zelfs externe 3e partijbronnen als “ground truth” om gemeenschappelijke entiteiten zoals bedrijven en personen op te lossen. Een goed voorbeeld hiervan zou zijn om alle records over een belangrijke klant zoals “Dell Computer” in meerdere bronnen te koppelen. Ten slotte kan voor elk record een veld leeg of onjuist zijn. Tamr kan de juiste veldwaarden imputeren uit interne en 3e partijbronnen.
Kunt u een succesverhaal delen waarin Tamr het datamanagement en de bedrijfsresultaten van een bedrijf aanzienlijk verbeterd heeft?
CHG Healthcare is een belangrijke speler in de gezondheidszorguitzendmarkt, die gekwalificeerde gezondheidszorgprofessionals verbindt met instellingen die ze nodig hebben. Of het nu gaat om tijdelijke artsen via Locums, verpleegkundigen met RNnetwork of bredere oplossingen via CHG zelf, ze bieden aangepaste uitzendoplossingen om gezondheidszorginstellingen soepel te laten draaien en kwaliteitszorg te bieden aan patiënten.
Hun fundamentele waardepropositie is het verbinden van de juiste gezondheidszorgverleners met de juiste instelling op het juiste moment. Hun uitdaging was dat ze geen nauwkeurig, geïntegreerd beeld hadden van alle zorgverleners in hun netwerk. Gezien hun omvang (7,5 miljoen+ zorgverleners) was het onmogelijk om hun gegevens nauwkeurig te houden met legacy, regelgebaseerde benaderingen zonder een fortuin uit te geven aan menselijke curators. Ze konden het probleem ook niet negeren, omdat hun uitzendbeslissingen ervan afhankelijk waren. Slechte gegevens konden ertoe leiden dat een zorgverlener meer diensten kreeg dan hij aankon, waardoor hij uitgeput raakte.
Met behulp van Tamr’s geavanceerde AI/ML-mogelijkheden reduceerde CHG Healthcare het aantal dubbele artsrecords met 45% en elimineerde het bijna volledig de handmatige gegevensvoorbereiding die werd uitgevoerd door schaarse gegevens- en analyticsbronnen. En het belangrijkste is dat, door een betrouwbaar en nauwkeurig beeld van zorgverleners te hebben, CHG in staat is om uitzendingen te optimaliseren, waardoor ze een betere klantbeleving kunnen bieden.
Wat zijn enkele veelvoorkomende misverstanden over AI in datamanagement, en hoe helpt Tamr deze mythen te weerleggen?
Een veelvoorkomende misvatting is dat AI “perfect” moet zijn, of dat regels en menselijke curatie perfect zijn in tegenstelling tot AI. De realiteit is dat regels vaak falen. En, belangrijker nog, wanneer regels falen, is de enige oplossing meer regels. Dus, u heeft een onbeheersbaar aantal regels. En menselijke curatie is ook feilbaar. Mensen kunnen goede bedoelingen hebben (hoewel niet altijd), maar ze zijn niet altijd juist. Wat erger is, sommige menselijke curators zijn beter dan anderen, of maken gewoon andere beslissingen dan anderen. AI, daarentegen, is van nature probabilistisch. We kunnen valideren via statistieken hoe nauwkeurig deze technieken zijn, en wanneer we dat doen, komen we tot de conclusie dat AI minder duur en nauwkeuriger is dan elke concurrerende optie.
Tamr combineert AI met menselijke verfijning voor gegevensnauwkeurigheid. Kunt u uitleggen hoe deze combinatie in de praktijk werkt?
Mensen bieden iets uitzonderlijk belangrijks aan AI – ze bieden de training. AI is eigenlijk het schalen van menselijke inspanningen. Wat Tamr van mensen vraagt, is een klein aantal voorbeelden (“trainingslabels”) die de machine kan gebruiken om de modelparameters in te stellen. In de praktijk ziet dit eruit als mensen die een kleine hoeveelheid tijd doorbrengen met de gegevens, voorbeelden van fouten en fouten in de gegevens geven aan Tamr, en de AI loopt deze lessen over de volledige gegevensset(s). Bovendien, wanneer nieuwe gegevens worden toegevoegd of gegevens veranderen, kan de AI instanties oppervlakken waar het moeite heeft om beslissingen te nemen met vertrouwen (“lage vertrouwenswaarde-overeenkomsten”) en vraagt het de mens om input. Deze input, natuurlijk, gaat naar het verfijnen en updaten van de modellen.
Wat is de rol van grote taalmodellen (LLM’s) in Tamr’s gegevenskwaliteit- en verrijkingprocessen?
Ten eerste is het belangrijk om duidelijk te zijn over waar LLM’s goed in zijn. Fundamenteel zijn LLM’s gericht op taal. Ze produceren tekstreeksen die iets betekenen en kunnen de betekenis van tekst begrijpen die aan hen wordt gegeven. Dus, je zou kunnen zeggen dat ze taalmachines zijn. Dus, voor Tamr, waar taal belangrijk is, gebruiken we LLM’s. Een voorbeeld is onze conversatieinterface die bovenop onze entiteitsgegevens zit, die we onze virtuele CDO noemen. Wanneer u met uw echte CDO spreekt, begrijpt hij u en reageert hij met taal die u begrijpt. Dit is precies wat we van een LLM verwachten en zo gebruiken we het in die deel van onze software. Wat waardevol is aan Tamr in deze context is dat we de entiteitsgegevens gebruiken als context voor het gesprek met onze vCDO. Het is alsof uw echte CDO alle beste ondernemingsgegevens tot zijn beschikking heeft wanneer hij uw vragen beantwoordt – zou dat niet geweldig zijn!
Daarnaast zijn er gevallen waarin we bij het schoonmaken van gegevenswaarden of het imputeren van ontbrekende waarden taalgebaseerde interpretatie van invoerwaarden willen gebruiken om een ontbrekende waarde te vinden of te corrigeren. Bijvoorbeeld, u kunt vragen van de tekst “5mm balbearing” wat de grootte van het onderdeel is, en een LLM (of een persoon) zou correct antwoorden “5mm”.
Ten slotte zijn er onderliggende LLM’s embeddingmodellen die taalbetekenis coderen naar tokens (denk aan woorden). Deze kunnen zeer nuttig zijn voor het berekenen van linguïstische vergelijking. Dus, terwijl “5” en “vijf” geen letters gemeen hebben, zijn ze zeer dicht bij elkaar in linguïstische betekenis. Dus, we kunnen deze informatie gebruiken om records samen te voegen.
Hoe ziet u de toekomst van datamanagement evolueren, met name met de vooruitgang in AI en machine learning?
De “Big Data”-era van het begin van de jaren 2000 zou moeten worden herinnerd als de “Small Data”-era. Terwijl er veel gegevens zijn gegenereerd in de afgelopen 20+ jaar, mogelijk gemaakt door de commodificatie van opslag en berekeningen, heeft de meeste gegevens die een impact hebben gehad in het bedrijfsleven een relatief kleine omvang – basisverkoop- en klantrapporten, marketinganalyse en andere datasets die gemakkelijk in een dashboard kunnen worden weergegeven. Het resultaat is dat veel van de tools en processen die worden gebruikt in datamanagement geoptimaliseerd zijn voor “kleine gegevens”, wat de reden is dat regelgebaseerde logica, aangevuld met menselijke curatie, nog steeds zo prominent is in datamanagement.
De manier waarop mensen gegevens willen gebruiken, verandert fundamenteel met de vooruitgang in AI en machine learning. Het idee van “AI-agents” die een aanzienlijk deel van iemands werk kunnen uitvoeren, werkt alleen als de agents de gegevens hebben die ze nodig hebben. Als u verwacht dat een AI-agent op de frontlinie van klantenservice staat, maar u hebt vijf vertegenwoordigingen van “Dell Computer” in uw CRM en het is niet verbonden met productinformatie in uw ERP, hoe kunt u dan verwachten dat ze hoge kwaliteit service leveren wanneer iemand van Dell contact opneemt?
De implicatie hiervan is dat onze datamanagementtooling en -processen moeten evolueren om schaal te hanteren, wat betekent dat we AI en machine learning moeten omarmen om meer gegevensschoonmaakactiviteiten te automatiseren. Mensen zullen nog steeds een belangrijke rol spelen in het toezicht op het proces, maar fundamenteel moeten we de machines vragen om meer te doen, zodat het niet alleen de gegevens in één dashboard zijn die nauwkeurig en volledig zijn, maar de meeste gegevens in het bedrijf.
Wat zijn de grootste kansen voor bedrijven vandaag om hun gegevens effectiever te gebruiken?
Het aantal manieren waarop mensen gegevens kunnen consumeren vergroten. Er is geen twijfel dat verbeteringen in datavisualisatietools gegevens veel toegankelijker hebben gemaakt in het hele bedrijf. Nu moeten daten en analyticsleiders kijken naar manieren om waarde te bieden met gegevens buiten het dashboard. Interfaces zoals interne 360-pagina’s, kennisgraphen en conversatieassistenten worden mogelijk gemaakt door nieuwe technologieën en geven potentiële gegevensconsumenten meer manieren om gegevens te gebruiken in hun dagelijkse workflow. Het is bijzonder krachtig wanneer deze zijn ingebed in de systemen die mensen al gebruiken, zoals CRMs en ERPs. De snelste manier om meer waarde te creëren uit gegevens is door de gegevens naar de mensen te brengen die ze kunnen gebruiken.
Bedankt voor het geweldige interview, lezers die meer willen leren, moeten Tamr bezoeken.












