Интервью
Антони Дейтон, генеральный директор Tamr – Интервью

Антони Дейтон является генеральным директором Tamr. Он имеет 20 лет опыта построения и масштабирования компаний по разработке программного обеспечения для предприятий. В последние два года он работал в качестве главного маркетингового директора в Celonis, где установил лидерство компании в категории программного обеспечения для Process Mining и создал программы генерации спроса, в результате чего выросла выручка на 130%. До этого он работал более 10 лет в Qlik, где вырос из небольшой неизвестной шведской компании до публичной компании – в ролях от лидерства продукта, маркетинга продукта и, наконец, в качестве технического директора. Он начал свою карьеру в Siebel Systems, где учился строить компании по разработке программного обеспечения для предприятий в различных ролях продукта.
Можете ли вы поделиться некоторыми ключевыми вехами из вашего пути в индустрии программного обеспечения для предприятий, особенно вашего времени в Qlik и Celonis?
Я начал свою карьеру в программном обеспечении для предприятий в Siebel Systems и многое узнал о построении и масштабировании компаний по разработке программного обеспечения для предприятий от команды лидеров там. Я присоединился к Qlik, когда это была небольшая, неизвестная шведская компания с 95% небольшой команды из 60 человек, расположенной в Лунде, Швеция. Я шучу, что поскольку я не был инженером или продажником, меня поставили во главе маркетинга. Я построил команду маркетинга там, но со временем мой интерес и вклад сместились в сторону управления продуктом, и в конечном итоге я стал главным по продукту. Мы вывели Qlik на биржу в 2010 году, и мы продолжили как успешная публичная компания. После этого мы хотели сделать некоторые приобретения, поэтому я создал команду по слияниям и поглощениям. После долгого и относительно успешного периода в качестве публичной компании мы в конечном итоге продали Qlik частной инвестиционной фирме под названием Thoma Bravo. Это было, как я люблю говорить, полный жизненный цикл компании по разработке программного обеспечения для предприятий. После ухода из Qlik я присоединился к Celonis, небольшой немецкой компании по разработке программного обеспечения, которая пыталась добиться успеха на рынке США. Снова я руководил маркетингом в качестве главного маркетингового директора. Мы выросли очень быстро и построили очень успешную глобальную маркетинговую функцию.
И Celonis, и Qlik были сосредоточены на переднем крае проблемы анализа данных – как мне увидеть и понять данные? В случае Qlik это были панели приборов; в случае Celonis это были бизнес-процессы. Но общей проблемой для обоих было то, что данные за этими визуализациями были неверными: дублирующиеся записи, неполные записи, отсутствующие silos данных. Это то, что привлекло меня к Tamr, где я чувствовал, что впервые мы можем решить проблему беспорядочных данных предприятия. Первые 15 лет моей карьеры в программном обеспечении для предприятий были потрачены на визуализацию данных, я надеюсь, что следующие 15 лет можно будет потратить на очистку этих данных.
Как ваши ранние переживания сформировали ваш подход к построению и масштабированию компаний по разработке программного обеспечения для предприятий?
Одним из важных уроков, который я выучил в переходе от Siebel к Qlik, была сила простоты. Siebel было очень мощным программным обеспечением, но оно было убито на рынке Salesforce.com, который сделал CRM с гораздо меньшим количеством функций (“игрушкой”, как называло Siebel), но клиенты могли быстро его запустить, потому что оно было доставлено в качестве решения SaaS. Казалось, что это очевидно сегодня, но в то время мудростью было то, что клиенты покупают функции, но то, что мы узнали, это то, что клиенты инвестируют в решения для решения своих бизнес-проблем. Итак, если ваше программное обеспечение решает их проблему быстрее, вы выигрываете. Qlik было простым решением проблемы анализа данных, но оно было радикально проще. В результате мы могли победить более функциональных конкурентов, таких как Business Objects и Cognos.
Вторым важным уроком, который я выучил, было в моем переходе от маркетинга к продукту. Мы думаем об этих доменах как о различных. В моей карьере я обнаружил, что я легко перемещаюсь между продуктом и маркетингом. Есть интименная связь между тем, какой продукт вы строите, и тем, как вы его описываете потенциальным клиентам. И есть равно важная связь между тем, чего требуют клиенты, и тем, какой продукт вы должны построить. Способность перемещаться между этими разговорами является критическим фактором успеха для любой компании по разработке программного обеспечения для предприятий. Обычной причиной неудачи стартапа является убеждение в том, что “если вы построите это, они придут”. Это обычное убеждение в том, что если вы просто построите крутую программу, люди выстроятся, чтобы купить ее. Это никогда не работает, и решение заключается в прочном маркетинговом процессе, связанном с вашим процессом разработки программного обеспечения.
Последняя идея, которую я хочу поделиться, связывает мою академическую работу с моей профессиональной работой. У меня была возможность в бизнес-школе посетить класс о теории деструктивного инноваций Клея Кристенсена. В моей профессиональной работе у меня была возможность испытать на себе и быть деструктором, и быть деструктированным. Ключевым уроком, который я выучил, является то, что любая деструктивная инновация является результатом внешнего сдвига платформы, который делает невозможное наконец возможным. В случае Qlik это была доступность платформы больших серверов памяти, которая позволила Qlik деструктировать традиционный отчетный куб. В Tamr доступность платформы машинного обучения в масштабе позволяет нам деструктировать ручные правила, основанные на MDM, в пользу подхода, основанного на ИИ. Важно всегда выяснять, какой сдвиг платформы стимулирует вашу деструкцию.
Что вдохновило разработку AI-родного Master Data Management (MDM), и как оно отличается от традиционных решений MDM?
Разработка Tamr возникла из академической работы в MIT (Массачусетском технологическом институте) вокруг entity resolution. Под академическим руководством лауреата премии Тьюринга Майкла Стоунбрейкера команда исследовала вопрос “можем ли мы связать записи данных через сотни тысяч источников и миллионы записей”. На первый взгляд, это кажется непреодолимой проблемой, потому что чем больше записей и источников, тем больше записей необходимо сравнить. Компьютерные ученые называют это “n-квадратной проблемой”, потому что проблема увеличивается геометрически с масштабом.
Традиционные системы MDM пытаются решить эту проблему с помощью правил и большого количества ручной обработки данных. Правила не масштабируются, потому что вы никогда не можете написать достаточно правил, чтобы покрыть каждый угловой случай, и управление тысячами правил является технической невозможностью. Ручная обработка очень дорогая, потому что она полагается на людей, которые пытаются работать через миллионы возможных записей и сравнений. В совокупности это объясняет плохое принятие традиционных решений MDM на рынке. Честно говоря, никто не любит традиционное MDM.
Простая идея Tamr заключалась в том, чтобы обучить ИИ выполнять работу по ингестии источников, сопоставлению записей и разрешению значений. Отлично то, что ИИ не ест, не спит и не берет отпуск; он также высокопараллелен, поэтому он может справиться с огромными объемами данных и работать над их улучшением. Итак, где MDM раньше было невозможно, теперь оно наконец возможно получить чистые, консолидированные и актуальные данные (см. выше).
Какие самые большие проблемы компаний сталкиваются с управлением данными, и как Tamr решает эти проблемы?
Первая, и, возможно, самая важная проблема, с которой сталкиваются компании в управлении данными, заключается в том, что их бизнес-пользователи не используют данные, которые они генерируют. Или, иначе говоря, если команды данных не производят высококачественные данные, которые их организации используют для ответа на аналитические вопросы или оптимизации бизнес-процессов, то они тратят время и деньги впустую. Основным выводом Tamr является 360-страница для каждой записи сущности (подумайте: клиент, продукт, деталь и т. д.), которая объединяет все основные и третьи данные, чтобы бизнес-пользователи могли увидеть и предоставить обратную связь по данным. Как вики для ваших данных сущности. Эта 360-страница также является входом для разговорного интерфейса, который позволяет бизнес-пользователям задавать и отвечать на вопросы с помощью данных. Итак, работа номер один – дать пользователю данные.
Почему так трудно для компаний дать пользователям данные, которые они любят? Потому что есть три основных трудных проблемы, лежащих в основе этой цели: загрузка нового источника, сопоставление новых записей в существующие данные и исправление значений/полей в данных. Tamr делает легко загружать новые источники данных, потому что его ИИ автоматически сопоставляет новые поля в определенной схеме сущности. Это означает, что независимо от того, как новый источник данных называет определенное поле (например, cust_name), оно сопоставляется с правильной центральной определением этой сущности (например, “имя клиента”). Следующая проблема заключается в том, чтобы связать записи, которые являются дубликатами. Дубликат в этом контексте означает, что записи на самом деле являются одной и той же реальной сущностью. ИИ Tamr делает это, и даже использует внешние третьи источники в качестве “эталона” для разрешения общих сущностей, таких как компании и люди. Хороший пример этого будет связывание всех записей по многим источникам для важного клиента, такого как “Dell Computer”. Наконец, для любой данной записи могут быть поля, которые пусты или неверны. Tamr может заполнить правильные значения полей из внутренних и третьих источников.
Можете ли вы поделиться историей успеха, где Tamr значительно улучшил управление данными и бизнес-результаты компании?
CHG Healthcare является крупным игроком в индустрии здравоохранения, соединяя квалифицированных специалистов здравоохранения с учреждениями, которым они нужны. Независимо от того, является ли это временными врачами через Locums, медсестрами с RNnetwork или более широкими решениями через CHG itself, они предоставляют индивидуальные решения по подбору персонала, чтобы помочь учреждениям здравоохранения работать гладко и предоставлять качественную помощь пациентам.
Их фундаментальная ценностная пропозиция заключается в том, чтобы соединить правильных специалистов здравоохранения с правильным учреждением в правильное время. Их проблема заключалась в том, что у них не было точного, объединенного представления всех специалистов в их сети. Учитывая их масштаб (7,5 миллионов+ специалистов), было невозможно поддерживать их данные точно с помощью устаревших, основанных на правилах подходов без разорения на человеческих кураторах. Они также не могли игнорировать проблему, поскольку их решения по подбору персонала зависели от этого. Плохие данные для них могли означать, что специалист получает больше смен, чем он может справиться, что приводит к выгоранию.
Используя передовые возможности ИИ/МЛ Tamr, CHG Healthcare сократила дублирующие записи врачей на 45% и почти полностью исключила ручную подготовку данных, которая выполнялась редкими ресурсами данных и аналитики. И, что самое главное, имея доверенную и точную картину специалистов, CHG может оптимизировать подбор персонала, что позволяет им предоставлять лучший опыт для клиентов.
Какие есть распространенные заблуждения об ИИ в управлении данными, и как Tamr помогает развеять эти мифы?
Распространенное заблуждение заключается в том, что ИИ должен быть “идеальным” или что правила и ручная обработка являются идеальными по сравнению с ИИ. Реальность заключается в том, что правила часто терпят неудачу. И, что более важно, когда правила терпят неудачу, единственное решение – еще больше правил. Итак, у вас есть неуправляемый беспорядок правил. А ручная обработка также ошибочна. Люди могут иметь хорошие намерения (хотя не всегда), но они не всегда правы. Что хуже, некоторые человеческие кураторы лучше, чем другие, или могут принимать разные решения, чем другие. ИИ, с другой стороны, является вероятностным по своей природе. Мы можем проверить статистически, насколько точны эти методы, и когда мы это делаем, мы обнаруживаем, что ИИ менее дорогой и более точный, чем любой конкурирующий аналог.
Tamr объединяет ИИ с человеческим совершенствованием для точности данных. Можете ли вы подробнее рассказать о том, как это сочетание работает на практике?
Люди предоставляют что-то исключительно важное для ИИ – они предоставляют обучение. ИИ на самом деле является масштабированием человеческих усилий. То, чего Tamr требует от людей, это небольшое количество примеров (“меток обучения”), которые машина может использовать для установки параметров модели. На практике это означает, что люди тратят небольшое количество времени на данные, предоставляя Tamr примеры ошибок и ошибок в данных, и ИИ запускает эти уроки на весь набор данных. Кроме того, когда добавляются новые данные или данные меняются, ИИ может выделить случаи, когда он испытывает трудности с уверенным принятием решений (“слабые совпадения”), и попросить человека о входных данных. Эти входные данные, конечно, идут на совершенствование и обновление моделей.
Какую роль играют большие языковые модели (LLM) в процессах качества и обогащения данных Tamr?
Прежде всего, важно быть ясным о том, что LLM хороши. Основательно, LLM являются о языке. Они производят строки текста, которые имеют значение, и они могут “понимать” значение текста, который передан им. Итак, можно сказать, что они являются языковыми машинами. Итак, для Tamr, где язык важен, мы используем LLM. Один из очевидных примеров – это наш разговорный интерфейс, который находится поверх наших данных сущности, который мы ласково называем нашим виртуальным CDO. Когда вы говорите с вашим реальным CDO, они понимают вас и отвечают на языке, который вы понимаете. Это именно то, чего мы ожидаем от LLM, и это именно то, как мы используем его в этом phần программного обеспечения. То, что ценно в Tamr в этом контексте, заключается в том, что мы используем данные сущности в качестве контекста для разговора с нашим виртуальным CDO. Это как если бы ваш реальный CDO имел все ваши лучшие корпоративные данные у себя под рукой, когда он отвечает на ваши вопросы – не было бы это здорово!
Кроме того, есть случаи, когда при очистке значений данных или заполнении пропущенных значений мы хотим использовать языковую интерпретацию входных значений, чтобы найти или исправить пропущенное значение. Например, вы можете спросить из текста “5 мм шарикоподшипник”, какой размер детали, и LLM (или человек) правильно ответит “5 мм”.
Наконец, лежащие в основе LLM являются моделями вложения, которые кодируют значение языка в токены (думайте: слова). Эти могут быть очень полезными для расчета лингвистического сравнения. Итак, хотя “5” и “пять” не имеют общих символов, они очень близки по лингвистическому значению. Итак, мы можем использовать эту информацию, чтобы связать записи вместе.
Как вы видите будущее управления данными, особенно с учетом достижений в области ИИ и машинного обучения?
Эра “Больших данных” начала 2000-х годов должна быть запомнена как эра “Малых данных”. Хотя за последние 20+ лет было создано много данных, обусловленное коммодитизацией хранилищ и вычислений, большинство данных, которые оказали влияние на предприятия, относительно маломасштабны – основные отчеты о продажах и клиентах, маркетинговая аналитика и другие наборы данных, которые можно легко изобразить на панели. Результатом является то, что многие инструменты и процессы, используемые в управлении данными, оптимизированы для “малых данных”, поэтому правила, основанные на логике, дополненные ручной обработкой, все еще так распространены в управлении данными.
Способ, которым люди хотят использовать данные, фундаментально меняется с достижениями в области ИИ и машинного обучения. Идея “агентов ИИ”, которые могут автономно выполнять значительную часть работы человека, работает только в том случае, если агенты имеют данные, которые им нужны. Если вы ожидаете, что агент ИИ будет работать на переднем крае поддержки клиентов, но у вас есть пять представлений “Dell Computer” в вашей CRM и оно не связано с информацией о продукте в вашем ERP, как вы можете ожидать, что они предоставят высококачественную услугу, когда кто-то из Dell обратится?
Вывод из этого заключается в том, что наше инструментарий и процессы управления данными должны эволюционировать, чтобы справиться с масштабом, что означает принятие ИИ и машинного обучения для автоматизации более данных. Люди все еще будут играть большую роль в надзоре за процессом, но фундаментально мы должны просить машины делать больше, чтобы не только данные на одной панели были точными и полными, но и большинство данных в предприятии.
Какие самые большие возможности для бизнеса сегодня, когда речь идет о более эффективном использовании своих данных?
Увеличение количества способов, которыми люди могут потреблять данные. Нет сомнений в том, что улучшения в инструментах визуализации данных сделали данные гораздо более доступными на протяжении всего предприятия. Теперь лидеры данных и аналитики должны смотреть за пределы панели для того, чтобы доставить ценность с помощью данных. Интерфейсы, такие как внутренние 360-страницы, графы знаний и разговорные помощники, становятся возможными благодаря новым технологиям и дают потенциальным потребителям данных больше способов использовать данные в своей повседневной работе. Это особенно мощно, когда они встроены в системы, которые люди уже используют, такие как CRM и ERP. Быстрейший способ создать больше ценности из данных – это доставить данные людям, которые могут их использовать.
Спасибо за отличное интервью, читателям, которые хотят узнать больше, следует посетить Tamr.












