Інтерв’ю
Ксав’є Конорт, співзасновник і технічний директор FeatureByte – Серія інтерв’ю

Ксав’є Конорт – видатний вчений-даних з більш ніж 25-річним досвідом роботи з даними. Він розпочав свою кар’єру як актуарій в страховій галузі, а потім перейшов до науки про дані. Він є одним з найкращих учасників конкурсу Kaggle і був головним вченим-даними в DataRobot до того, як став співзасновником FeatureByte.
FeatureByte має на меті масштабувати корпоративний штучний інтелект, радикально спрощуючи та індустріалізуючи дані штучного інтелекту. Платформа інженерії та управління особливостями дозволяє вченим-даним створювати та обмінюватися особливостями та готовими до виробництва даними за лічені хвилини – замість тижнів чи місяців.
Ви розпочали свою кар’єру як актуарій у сфері страхування, а потім перейшли до науки про дані. Що стало причиною цього переходу?
Визначальним моментом стало перемога в конкурсі GE Flight Quest, організованому компанією GE з призовим фондом у 250 тисяч доларів, де учасники мали передбачити затримки внутрішніх рейсів США. Я зобов’язаний частиною цього успіху цінному досвіду в галузі страхування: двостадійному моделюванні. Цей підхід допомагає контролювати упередженість у особливостях, які не мають достатнього представлення у доступних навчальних даних. Разом з іншими перемогами на Kaggle, це досягнення переконало мене в тому, що мій досвід актуарія дає мені конкурентну перевагу в галузі науки про дані.
Під час моєї участі в Kaggle я також мав можливість познайомитися з іншими ентузіастами науки про дані, включаючи Джеремі Ачіна та Тома де Годоя, які пізніше стали співзасновниками DataRobot. Ми мали спільний досвід роботи в галузі страхування та досягли помітних успіхів на Kaggle. Коли вони запустили DataRobot, компанію, що спеціалізується на AutoML, вони запросили мене приєднатися до них як головного вченого-даних. Їхня мета об’єднання найкращих практик з галузі страхування з можливостями машинного навчання надихнула мене, відкривши можливість створити щось інноваційне та впливове.
У DataRobot ви були одним з тих, хто створив дорожню карту науки про дані. Які були найбільшими викликами, з якими ви зустрілись?
Найбільшою проблемою, з якою ми зіткнулись, була різна якість даних, наданих як вхідні дані для нашого рішення AutoML. Ця проблема часто призводила до тривалих спільних робіт між нашою командою та клієнтами або до розчарувальних результатів у виробництві, якщо не були належним чином вирішені. Проблеми з якістю даних походили з кількох джерел, які вимагали нашої уваги.
Однією з основних проблем було використання інструментів бізнес-аналітики для підготовки та управління даними. Хоча ці інструменти цінні для генерації інсайтів, вони не мають можливостей, необхідних для забезпечення точності даних у момент часу для підготовки даних машинного навчання. В результаті це могло привести до витоку даних під час навчання, що призводило до надмірного підгонки та неточної продуктивності моделі.
Недорозуміння між вченими-даними та інженерами-даними було ще однією проблемою, яка вплинула на точність моделей під час виробництва. Несумісності між фазами навчання та виробництва, що виникли через недорозуміння між цими двома командами, могли вплинути на продуктивність моделі в реальному середовищі.
Які були деякими з основних висновків з цього досвіду?
Мій досвід у DataRobot підкреслив значення підготовки даних у машинному навчанні. Розглянувши виклики створення навчальних даних моделей, таких як точність у момент часу, пробіли в експертизі, знання галузі, обмеження інструментів та масштабованість, ми можемо покращити точність та надійність моделей машинного навчання. Я дійшов висновку, що спрощення процесу підготовки даних та впровадження інноваційних технологій будуть інструментальними у розблокуванні повного потенціалу штучного інтелекту та виконання його обіцянок.
Ми також чули від вашого співзасновника Разі Разіуддіна про історію створення FeatureByte, можете.tell нам свою версію цих подій?
Коли я обговорював свої спостереження та інсайти з моїм співзасновником Разі Разіуддіном, ми зрозуміли, що ми маємо спільне розуміння викликів у підготовці даних для машинного навчання. Під час наших обговорень я поділився з Разі своїми інсайтами щодо недавніх досягнень у спільноті MLOps. Я міг спостерігати появу магазинів особливостей та платформ особливостей, які компанії, орієнтовані на штучний інтелект, впроваджують для зниження затримки подачі особливостей, заохочення повторного використання особливостей або спрощення матеріалізації особливостей у навчальні дані, забезпечуючи при цьому узгодженість навчання та обслуговування. Однак було очевидно, що все ще існує розрив у задоволенні потреб вчених-даних. Разі поділився зі мною свої інсайти щодо того, як сучасний стек даних революціонізував бізнес-аналітику та аналіз, але не був повністю використаний для штучного інтелекту.
Стало очевидним, що і Разі, і я мали можливість зробити суттєвий вплив, радикально спрощуючи процес інженерії особливостей та надаючи вченим-даним та інженерам-машинному навчанню правильні інструменти та досвід користування для безперешкодної експериментації з особливостями та подачі особливостей.
Які були деякими з ваших найбільших викликів при переході від вченого-даних до підприємця?
Перехід від вченого-даних до підприємця вимагав від мене зміни з технічної точки зору на більш широкий бізнес-орієнтований погляд. Хоча у мене була сильна основа для розуміння болючих точок, створення дорожньої карти, виконання планів, будівництва команди та управління бюджетом, я виявив, що створення правильного повідомлення, яке справді резонує з нашою цільовою аудиторією, було однією з моїх найбільших перешкод.
Як вчений-даних, моя основна увага завжди була зосереджена на аналізі та інтерпретації даних для отримання цінних інсайтів. Однак як підприємцю мені потрібно було змінити свій погляд на ринок, клієнтів та загальний бізнес.
На щастя, я зміг подолати цю перешкоду, використовуючи досвід людини, як мій співзасновник Разі.
Ми чули від Разі про те, чому інженерія особливостей така складна. З вашої точки зору, що робить її такою складною?
Інженерія особливостей має дві основні складності:
- Трансформація існуючих стовпців: це涉лює перетворення даних у відповідний формат для алгоритмів машинного навчання. Використовуються техніки, такі як one-hot кодування, масштабування особливостей та просунуті методи, такі як перетворення тексту та зображень. Створення нових особливостей з існуючих, таких як особливості взаємодії, може суттєво покращити продуктивність моделі. Популярні бібліотеки, такі як scikit-learn та Hugging Face, надають широкий спектр підтримки для цього типу інженерії особливостей. Рішення AutoML також спрямовані на спрощення цього процесу.
- Виокремлення нових стовпців з історичних даних: історичні дані мають важливе значення в таких галузях, як системи рекомендацій, маркетинг, виявлення шахрайства, страхові тарифи, кредитний скорінг, прогнозування попиту та обробка даних з датчиків. Виокремлення інформативних стовпців з цих даних є складним завданням. Прикладами можуть бути час з моменту останньої події, агрегації за останніми подіями та вкладення з послідовностей подій. Цей тип інженерії особливостей вимагає знань галузі, експериментів, сильних навичок програмування та глибоких знань науки про дані. Фактори, такі як витік часу, обробка великих наборів даних та ефективне виконання коду, також потребують уваги.
Загалом, інженерія особливостей вимагає знань, експериментів та побудови складних спеціальних конвеєрів даних у відсутність інструментів, спеціально призначених для цього.
Чи можете ви розповісти, як FeatureByte надає можливість вченим-даним спрощувати конвеєри особливостей?
FeatureByte надає можливість вченим-даним, спрощуючи весь процес інженерії особливостей. З допомогою інтуїтивної бібліотеки Python SDK, вона дозволяє швидко створювати та витягувати особливості з великих таблиць подій та товарів. Обчислення ефективно обробляються за рахунок масштабованості платформ даних, таких як Snowflake, DataBricks та Spark. Ноутбуки полегшують експерименти, а спільне використання та повторне використання особливостей економлять час. Аудит забезпечує точність особливостей, а негайне розгортання усуває головні болі конвеєра.
Крім цих можливостей, які надаються нашою відкритою бібліотекою, наше корпоративне рішення надає комплексну основу для управління та організації операцій штучного інтелекту у масштабі, включаючи робочі потоки управління та інтерфейс користувача для каталогу особливостей.
Яка ваша мета для майбутнього FeatureByte?
Наша кінцева мета для FeatureByte полягає в тому, щоб революціонізувати галузь науки про дані та машинного навчання, надавши користувачам можливість розблокувати весь свій творчий потенціал та витягнути безпрецедентну цінність з їхніх активів даних.
Ми особливо зацікавлені в швидкому прогресі генерації штучного інтелекту та трансформерів, який відкриває світ можливостей для наших користувачів. Крім того, ми присвячені демократизації інженерії особливостей. Генерація штучного інтелекту має потенціал знизити бар’єр входу для творчої інженерії особливостей, роблячи її більш доступною для ширшої аудиторії.
Під час підсумку, наша мета для майбутнього FeatureByte полягає в безперервній інновації, використанні сили генерації штучного інтелекту та демократизації інженерії особливостей. Ми ставимо за мету бути платформою, яка дозволяє фахівцям-даним перетворювати сирі дані на діючий вхід для машинного навчання, що призводить до проривів та досягнень у різних галузях.
Чи маєте ви поради для майбутніх підприємців штучного інтелекту?
Визначте свою сферу діяльності, залишаються сфокусованими та вітайте новизну.
Визначивши сферу діяльності, яку ви хочете володіти, ви можете відрізнити себе та створити сильну присутність у цій галузі. Дослідіть ринок, зрозумійте потреби та болючі точки потенційних клієнтів та спрямуйтеся на надання унікального рішення, яке ефективно вирішує ці виклики.
Визначте свою довгострокову мету та встановіть чіткі короткострокові цілі, які узгоджуються з цією метою. Зосередьтеся на будівництві сильної основи та наданні цінності у вашій обраній сфері діяльності.
Нарешті, хоча залишається важливим залишатися сфокусованим, не відхиляйтесь від вітання новизни та дослідження нових ідей у вашій визначеній сфері діяльності. Галузь штучного інтелекту постійно еволюціонує, а інноваційні підходи можуть відкрити нові можливості.
Дякуємо за велике інтерв’ю, читачам, які бажають дізнатися більше, слід відвідати FeatureByte.












