Wywiady
Xavier Conort, Współzałożyciel i CPO FeatureByte – Seria wywiadów

Xavier Conort to wizjonerski naukowiec danych z ponad 25-letnim doświadczeniem w dziedzinie danych. Rozpoczął swoją karierę jako aktuarium w branży ubezpieczeniowej, zanim przeszedł do nauki o danych. Jest czołowym konkurentem Kaggle i był Chief Data Scientistem w DataRobot przed założeniem FeatureByte.
FeatureByte ma na celu skalowanie sztucznej inteligencji w przedsiębiorstwach, poprzez radykalne uproszczenie i zunifikowanie danych AI. Platforma inżynierii i zarządzania cechami umożliwia naukowcom danych tworzenie i udostępnianie najnowocześniejszych cech i gotowych do produkcji potoków danych w ciągu kilku minut – zamiast tygodni lub miesięcy.
Zacznijmy od Twojej kariery. Rozpocząłeś ją jako aktuarium w branży ubezpieczeniowej, zanim przeszedł do nauki o danych. Co spowodowało tę zmianę?
Decydującym momentem było wygranie konkursu GE Flight Quest, zorganizowanego przez GE z pulą nagród w wysokości 250 000 dolarów, w którym uczestnicy musieli przewidzieć opóźnienia lotów krajowych w Stanach Zjednoczonych. Wiązałem część tego sukcesu z cenną praktyką ubezpieczeniową: modelem 2-etapowym. Ten podejście pomaga kontrolować stronniczość w cechach, które nie mają wystarczającej reprezentacji w dostępnych danych szkoleniowych. Wraz z innymi zwycięstwami na Kaggle, to osiągnięcie przekonało mnie, że mój aktuarialny background daje mi przewagę konkurencyjną w dziedzinie nauki o danych.
Podczas mojej podróży z Kaggle, miałem również przywilej połączenia się z innymi entuzjastami nauki o danych, w tym z Jeremy Achin i Tom De Godoy, którzy później założyli DataRobot. Podzieliliśmy wspólny background w ubezpieczeniach i osiągnęliśmy znaczące sukcesy na Kaggle. Kiedy ostatecznie uruchomili DataRobot, firmę specjalizującą się w AutoML, zaprosili mnie do dołączenia do nich jako Chief Data Scientist. Ich wizja łączenia najlepszych praktyk z branży ubezpieczeniowej z mocą uczenia maszynowego zachęciła mnie, przedstawiając okazję do stworzenia czegoś nowatorskiego i wpływowego.
W DataRobot byłeś odpowiedzialny za budowę drogi rozwoju nauki o danych. Jakie wyzwania związane z danymi spotkałeś?
Największym wyzwaniem, z którym się zetknęliśmy, była zmieniająca się jakość danych dostarczanych jako dane wejściowe do naszego rozwiązania AutoML. Ten problem często prowadził do czasochłonnej współpracy między naszym zespołem a klientami lub do rozczarowujących wyników w produkcji, jeśli nie został odpowiednio rozwiązany. Problemy z jakością pochodziły z kilku źródeł, które wymagały naszej uwagi.
Jednym z głównych wyzwań była ogólna używalność narzędzi business intelligence do przygotowania i zarządzania danymi. Chociaż te narzędzia są cenne do generowania wglądów, nie posiadają one funkcjonalności niezbędnych do zapewnienia poprawności w czasie dla przygotowania danych do uczenia maszynowego. W wyniku tego mogły wystąpić wycieki w danych szkoleniowych, prowadzące do nadmiernego dopasowania i nieprecyzyjnego działania modelu.
Nieporozumienia między naukowcami danych a inżynierami danych były kolejnym wyzwaniem, które wpływało na dokładność modeli podczas produkcji. Niespójności między fazami szkolenia i produkcji, wynikające z niezgodności między tymi dwoma zespołami, mogły wpłynąć na działanie modelu w środowisku rzeczywistym.
Jakie były najważniejsze wnioski z tego doświadczenia?
Moje doświadczenie w DataRobot podkreśliło znaczenie przygotowania danych w uczeniu maszynowym. Poprzez rozwiązanie wyzwań związanych z generowaniem danych szkoleniowych modeli, takich jak poprawność w czasie, luki wiedzy, wiedza branżowa, ograniczenia narzędzi i skalowalność, możemy poprawić dokładność i niezawodność modeli uczenia maszynowego. Doszedłem do wniosku, że uproszczenie procesu przygotowania danych i wdrożenie innowacyjnych technologii będzie instrumentalne w odblokowaniu pełnego potencjału sztucznej inteligencji i spełnieniu jej obietnic.
Również usłyszeliśmy od Twojego współzałożyciela Razi Raziuddin o historii powstania FeatureByte, czy mógłbyś nam opowiedzieć o swojej wersji tych wydarzeń?
Kiedy omawiałem swoje obserwacje i spostrzeżenia z moim współzałożycielem Razi Raziuddin, zrealizowaliśmy, że dzielimy wspólne zrozumienie wyzwań w przygotowaniu danych do uczenia maszynowego. Podczas naszych dyskusji, podzieliłem się z Razi moimi spostrzeżeniami na temat ostatnich postępów w społeczności MLOps. Mogłem zaobserwować pojawienie się sklepów z cechami i platform cech, które firmy zorientowane na AI wdrożyły w celu zmniejszenia opóźnień podczas obsługi cech, zachęcenia do ponownego wykorzystania cech lub uproszczenia materializacji cech do danych szkoleniowych, przy jednoczesnym zapewnieniu spójności między szkoleniem a obsługą. Jednak było dla nas oczywiste, że nadal istnieje luka w spełnianiu potrzeb naukowców danych.
Razi podzielił się ze mną swoimi spostrzeżeniami na temat tego, jak nowoczesny stos danych rewolucjonizuje BI i analitykę, ale nie jest w pełni wykorzystywany dla AI.
Stało się dla nas oczywiste, że mamy okazję do zrobienia czegoś znaczącego, radykalnie upraszczając proces inżynierii cech i zapewniając naukowcom danych i inżynierom AI odpowiednie narzędzia i środowisko do bezproblemowej eksperymentacji i obsługi cech.
Jakie były Twoje największe wyzwania w przejściu od naukowca danych do przedsiębiorcy?
Przejście od naukowca danych do przedsiębiorcy wymagało ode mnie zmiany perspektywy z technicznej na bardziej biznesową. Chociaż miałem silne podstawy w zrozumieniu bolączek, tworzeniu mapy drogowej, wykonywaniu planów, budowaniu zespołu i zarządzaniu budżetami, odkryłem, że tworzenie odpowiedniego przekazu, który naprawdę rezonuje z naszą docelową publicznością, było jednym z moich największych przeszkód.
Jako naukowiec danych, moim głównym celem było zawsze analizowanie i interpretowanie danych w celu wyprowadzenia cennych wniosków. Jednak jako przedsiębiorca, musiałem skierować swoje myślenie w stronę rynku, klientów i ogólnego biznesu.
Na szczęście, był w stanie pokonać tę przeszkodę, wykorzystując doświadczenie kogoś takiego jak mój współzałożyciel Razi.
Razi powiedział nam, że inżynieria cech jest trudna. Twoim zdaniem, co ją utrudnia?
Inżynieria cech ma dwa główne wyzwania:
- Transformacja istniejących kolumn: polega na konwersji danych do odpowiedniego formatu dla algorytmów uczenia maszynowego. Techniki takie jak one-hot encoding, skalowanie cech i zaawansowane metody, takie jak transformacje tekstu i obrazu, są wykorzystywane. Tworzenie nowych cech z istniejących, takich jak cechy interakcji, może znacznie poprawić wydajność modelu. Popularne biblioteki, takie jak scikit-learn i Hugging Face, zapewniają obszerny wsparcie dla tego rodzaju inżynierii cech. Rozwiązania AutoML mają na celu uproszczenie tego procesu.
- Wydobywanie nowych kolumn z historycznych danych: dane historyczne są kluczowe w dziedzinach, takich jak systemy rekomendacji, marketing, wykrywanie oszustw, ubezpieczenia, kredytowanie, prognozowanie popytu i przetwarzanie danych sensorycznych. Wydobywanie informacyjnych kolumn z tych danych jest wyzwaniem. Przykłady obejmują czas od ostatniego zdarzenia, agregacje nad ostatnimi zdarzeniami i osadzanie sekwencji zdarzeń. Ten rodzaj inżynierii cech wymaga wiedzy branżowej, eksperymentowania, silnych umiejętności kodowania i inżynierii danych, oraz głębokiej wiedzy z dziedziny nauki o danych. Czynniki, takie jak wyciek czasu, obsługa dużych zbiorów danych i wydajna wykonywalność kodu, również wymagają uwzględnienia.
Ogólnie, inżynieria cech wymaga wiedzy, eksperymentowania i konstrukcji złożonych, ad-hoc potoków danych w przypadku braku narzędzi specjalnie zaprojektowanych do tego celu.
Czy mógłbyś opowiedzieć, jak FeatureByte upraszcza potoki cech i daje naukowcom danych więcej mocy?
FeatureByte upraszcza cały proces inżynierii cech. Z intuicyjnym SDK Python, umożliwia szybkie tworzenie i wydobywanie cech z XLarge Event i Item Tables. Obliczenia są wykonywane wydajnie, wykorzystując skalowalność platform danych, takich jak Snowflake, DataBricks i Spark. Notesy ułatwiają eksperymentowanie, a udostępnianie i ponowne wykorzystywanie cech oszczędza czas. Audyt zapewnia dokładność cech, a natychmiastowe wdrożenie eliminuje problemy z zarządzaniem potokami.
Ponadto, nasze rozwiązanie enterprise zapewnia kompleksowy framework do zarządzania i organizacji operacji AI w skali, w tym governance workflows i interfejs użytkownika do katalogu cech.
Jakie masz wizje na przyszłość FeatureByte?
Nasza ostateczna wizja dla FeatureByte jest rewolucjonizacja dziedziny nauki o danych i sztucznej inteligencji, poprzez umożliwienie użytkownikom wykorzystania pełnego potencjału i wyprowadzenia bezprecedensowej wartości z ich aktywów danych.
Jesteśmy szczególnie podekscytowani szybkim postępem w dziedzinie Generative AI i transformatorów, który otwiera świat możliwości dla naszych użytkowników. Ponadto, jesteśmy poświęceni demokratyzacji inżynierii cech. Generative AI ma potencjał, aby obniżyć barierę wejścia do kreatywnej inżynierii cech, czyniąc ją bardziej dostępną dla szerszego grona odbiorców.
Podsumowując, nasza wizja na przyszłość FeatureByte kręci się wokół ciągłej innowacji, wykorzystania mocy Generative AI i demokratyzacji inżynierii cech. Naszym celem jest być platformą, która umożliwia profesjonalistom danych transformowanie surowych danych w dane wejściowe dla uczenia maszynowego, napędzając przełomy i postępy w różnych branżach.
Czy masz jakieś porady dla aspirujących przedsiębiorców AI?
Określ swoją przestrzeń, pozostań skupiony i witaj nowości.
Poprzez określenie przestrzeni, którą chcesz posiadać, możesz się różnicować i ustanowić silną obecność w tej dziedzinie. Zbadaj rynek, zrozum potrzeby i ból klientów, i staraj się zapewnić unikalne rozwiązanie, które skutecznie rozwiązuje te wyzwania.
Określ swoją długoterminową wizję i ustaw wyraźne krótkoterminowe cele, które są zgodne z tą wizją. Skoncentruj się na budowaniu silnych podstaw i dostarczaniu wartości w swojej wybranej przestrzeni.
Wreszcie, chociaż ważne jest, aby pozostać skupionym, nie bój się przyjmowania nowości i eksplorowania nowych pomysłów w ramach swojej określonej przestrzeni. Dziedzina AI jest w ciągłej ewolucji, a innowacyjne podejścia mogą otworzyć nowe możliwości.
Dziękujemy za wspaniały wywiad, czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić FeatureByte.












