Interviews

Xavier Conort, mede-oprichter en CPO van FeatureByte – Interviewreeks

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Xavier Conort is een visionaire datawetenschapper met meer dan 25 jaar ervaring in data. Hij begon zijn carrière als actuaris in de verzekeringsindustrie voordat hij overstapte naar datawetenschap. Hij is een top-ranked Kaggle-deelnemer en was de Chief Data Scientist bij DataRobot voordat hij FeatureByte mede-oprichtte.

FeatureByte heeft als missie om enterprise AI te schalen door AI-gegevens radicaal te vereenvoudigen en te industrialiseren. Het platform voor functie-engineering en -beheer stelt datawetenschappers in staat om state-of-the-art-functies en productieklare datapipelines in minuten te creëren – in plaats van weken of maanden.

U bent uw carrière begonnen als actuaris in de verzekeringsindustrie voordat u overstapte naar datawetenschap, wat was de aanleiding voor deze overstap?

Een belangrijk moment was het winnen van de GE Flight Quest, een wedstrijd georganiseerd door GE met een prijzengeld van $250.000, waarbij deelnemers de vertragingen van binnenlandse vluchten in de VS moesten voorspellen. Ik dank een deel van dit succes aan een waardevolle verzekeringspraktijk: de 2-stappenmodellering. Deze aanpak helpt bij het controleren van vooroordelen in functies die onvoldoende vertegenwoordigd zijn in de beschikbare trainingsgegevens. Naast andere overwinningen op Kaggle, overtuigde deze prestatie me ervan dat mijn actuariale achtergrond me een concurrentievoordeel gaf in het veld van datawetenschap.

Tijdens mijn Kaggle-reis had ik ook het voorrecht om in contact te komen met andere enthousiaste datawetenschappers, waaronder Jeremy Achin en Tom De Godoy, die later de oprichters van DataRobot zouden worden. We deelden een gemeenschappelijke achtergrond in de verzekeringsindustrie en hadden opvallende successen behaald op Kaggle. Toen ze uiteindelijk DataRobot lanceerden, een bedrijf dat zich specialiseerde in AutoML, nodigden ze me uit om me bij hen te voegen als Chief Data Scientist. Hun visie om de beste praktijken uit de verzekeringsindustrie te combineren met de kracht van machine learning, boeide me en bood de kans om iets innovatief en impactvol te creëren.

Bij DataRobot was u instrumental in het opstellen van hun Data Science-roadmap. Wat voor soort data-uitdagingen bent u tegengekomen?

De grootste uitdaging die we tegenkwamen, was de variabele kwaliteit van de gegevens die als invoer voor onze AutoML-oplossing werden geleverd. Dit probleem leidde vaak tot tijdrovende samenwerking tussen ons team en klanten of teleurstellende resultaten in productie als het niet op de juiste manier werd aangepakt. De kwaliteitsproblemen kwamen voort uit meerdere bronnen die onze aandacht vereisten.

Een van de primaire uitdagingen was het algemene gebruik van business intelligence-tools voor gegevensvoorbereiding en -beheer. Hoewel deze tools waardevol zijn voor het genereren van inzichten, ontbreken ze de capaciteiten om point-in-time-correctheid voor machine learning-gegevensvoorbereiding te garanderen. Als gevolg hiervan konden lekken in trainingsgegevens optreden, waardoor overfitting en onnauwkeurige modelprestaties ontstonden.

Verkeerde communicatie tussen datawetenschappers en data-engineers was een andere uitdaging die de nauwkeurigheid van modellen tijdens productie beïnvloedde. Inconsistenties tussen de trainings- en productiefasen, die voortkwamen uit een misalignement tussen deze twee teams, konden de modelprestaties in een reële omgeving beïnvloeden.

Wat waren enkele van de belangrijkste inzichten uit deze ervaring?

Mijn ervaring bij DataRobot benadrukte het belang van gegevensvoorbereiding in machine learning. Door de uitdagingen van het genereren van modeltrainingsgegevens aan te pakken, zoals point-in-time-correctheid, expertise-gaten, domeinkennis, toolbeperkingen en schaalbaarheid, kunnen we de nauwkeurigheid en betrouwbaarheid van machine learning-modellen verbeteren. Ik kwam tot de conclusie dat het stroomlijnen van het gegevensvoorbereidingsproces en het incorporeren van innovatieve technologieën essentieel zal zijn om het volledige potentieel van AI te ontsluiten en de beloften van AI waar te maken.

We hebben ook gehoord van uw mede-oprichter Razi Raziuddin over het verhaal achter de oprichting van FeatureByte, kunnen we uw versie van de gebeurtenissen horen?

Toen ik mijn observaties en inzichten met mijn mede-oprichter Razi Raziuddin besprak, realiseerden we ons dat we een gemeenschappelijk begrip hadden van de uitdagingen in gegevensvoorbereiding voor machine learning. Tijdens onze discussies deelde ik mijn inzichten met Razi over de recente ontwikkelingen in de MLOps-gemeenschap. Ik kon de opkomst van functieopslag en -platforms waarnemen die AI-first-techbedrijven implementeerden om de latentie van functieaanbod te verminderen, functiehergebruik te stimuleren of de materialisatie van functies in trainingsgegevens te vereenvoudigen, terwijl ze garant stonden voor trainings-dienstconsistentie. Het was echter duidelijk voor ons dat er nog een lacune bestond in het vervullen van de behoeften van datawetenschappers. Razi deelde met mij zijn inzichten over hoe de moderne datastack BI en analytics had gerevolutioneerd, maar niet volledig werd benut voor AI.

Het werd duidelijk voor zowel Razi als mij dat we de kans hadden om een significante impact te maken door het functie-engineeringsproces radicaal te vereenvoudigen en datawetenschappers en ML-engineers de juiste tools en gebruikerservaring te bieden voor naadloze functie-experimentatie en -aanbod.

Wat waren enkele van uw grootste uitdagingen bij de overstap van datawetenschapper naar ondernemer?

De overstap van datawetenschapper naar ondernemer vereiste van mij dat ik van een technisch perspectief naar een breder, business-georiënteerd perspectief overstapte. Hoewel ik een sterke basis had in het begrijpen van pijnlijke punten, het creëren van een roadmap, het uitvoeren van plannen, het opbouwen van een team en het beheren van budgetten, vond ik dat het creëren van de juiste boodschap die echt resoneerde met ons doelpubliek een van mijn grootste obstakels was.

Als datawetenschapper was mijn primaire focus altijd gericht op het analyseren en interpreteren van gegevens om waardevolle inzichten te verkrijgen. Als ondernemer moest ik mijn denken echter richten op de markt, klanten en het algemene bedrijf.

Gelukkig kon ik deze uitdaging overwinnen door de ervaring van iemand als mijn mede-oprichter Razi te benutten.

We hebben gehoord van Razi over waarom functie-engineering zo moeilijk is, wat maakt het in uw ogen zo uitdagend?

Functie-engineering heeft twee belangrijke uitdagingen:

  1. Bestaande kolommen transformeren: Dit omvat het converteren van gegevens naar een geschikt formaat voor machine learning-algoritmen. Technieken zoals one-hot-encoding, functieschaal en geavanceerde methoden zoals tekst- en afbeeldingstransformaties worden gebruikt. Het creëren van nieuwe functies uit bestaande, zoals interactiefuncties, kan de modelprestaties aanzienlijk verbeteren. Populaire bibliotheken zoals scikit-learn en Hugging Face bieden uitgebreide ondersteuning voor dit type functie-engineering. AutoML-oplossingen proberen het proces te vereenvoudigen.
  2. Nieuwe kolommen extraheren uit historische gegevens: Historische gegevens zijn cruciaal in probleemdomeinen zoals aanbevelingssystemen, marketing, fraude detectie, verzekeringsprijzen, kredietwaardigheid, vraagvoorspelling en sensorgegevensverwerking. Het extraheren van informatieve kolommen uit deze gegevens is uitdagend. Voorbeelden zijn de tijd sinds het laatste evenement, aggregaties over recente evenementen en embeddings uit sequenties van evenementen. Dit type functie-engineering vereist domeinexpertise, experimenten, sterke coderings- en data-engineeringvaardigheden en diepgaande datawetenschappelijke kennis. Factoren zoals tijdlek, het omgaan met grote datasets en efficiënte code-uitvoering moeten ook in overweging worden genomen.

Algemeen gesproken vereist functie-engineering expertise, experimenten en de constructie van complexe ad-hoc datapipelines in de afwezigheid van specifiek voor dit doel ontworpen tools.

Kunt u delen hoe FeatureByte datawetenschappers empowerd en functiepijplijnen vereenvoudigt?

FeatureByte empowerd datawetenschappers door het hele proces in functie-engineering te vereenvoudigen. Met een intuïtieve Python-SDK maakt het snelle functiecreatie en -extractie uit XLarge Event- en Item-tabellen mogelijk. Berekeningen worden efficiënt afgehandeld door de schaalbaarheid van data-platforms zoals Snowflake, DataBricks en Spark te benutten. Notebooks faciliteren experimenten, terwijl functiedeling en -hergebruik tijd besparen. Auditing garandeert functienauwkeurigheid, terwijl onmiddellijke implementatie pijplijnbeheerhoofdpijn elimineert.

Naast deze mogelijkheden die worden aangeboden door onze open-source-bibliotheek, biedt onze enterprise-oplossing een uitgebreid kader voor het beheren en organiseren van AI-operaties op schaal, inclusief governance-workflows en een gebruikersinterface voor de functiecatalogus.

Wat is uw visie voor de toekomst van FeatureByte?

Onze uiteindelijke visie voor FeatureByte is om het veld van datawetenschap en machine learning te revolutioneren door gebruikers in staat te stellen hun volledige creatieve potentieel te ontsluiten en ongekende waarde uit hun data-activa te halen.

We zijn in het bijzonder enthousiast over de snelle vooruitgang in Generative AI en transformers, die een wereld van mogelijkheden voor onze gebruikers opent. Bovendien zijn we toegewijd aan het democratiseren van functie-engineering. Generative AI heeft het potentieel om de drempel voor creatieve functie-engineering te verlagen, waardoor het toegankelijker wordt voor een bredere doelgroep.

Samenvattend draait onze visie voor de toekomst van FeatureByte om voortdurende innovatie, het benutten van de kracht van Generative AI en het democratiseren van functie-engineering. We streven ernaar om het go-to-platform te zijn dat data-professionals in staat stelt om ruwe gegevens om te zetten in actiegerichte input voor machine learning, waardoor doorbraken en vooruitgang in verschillende industrieën worden gestimuleerd.

Heeft u enig advies voor aspirant-AI-ondernemers?

Definieer uw ruimte, blijf gefocust en verwelkom nieuwheid.

Door de ruimte te definiëren die u wilt bezetten, kunt u uzelf onderscheiden en een sterke aanwezigheid in dat gebied vestigen. Onderzoek de markt, begrijp de behoeften en pijnlijke punten van potentiële klanten en streef ernaar om een unieke oplossing te bieden die effectief deze uitdagingen aanpakt.

Definieer uw langetermijnvisie en stel duidelijke korte-termijndoelen die in overeenstemming zijn met die visie. Concentreer u op het opbouwen van een solide basis en het leveren van waarde in uw gekozen ruimte.

Uiteindelijk, terwijl het belangrijk is om gefocust te blijven, moet u niet terugschrikken voor het omarmen van nieuwheid en het verkennen van nieuwe ideeën binnen uw gedefinieerde ruimte. Het AI-veld evolueert voortdurend, en innovatieve benaderingen kunnen nieuwe kansen openen.

Bedankt voor het geweldige interview, lezers die meer willen leren, kunnen FeatureByte bezoeken.

Antoine is een visionaire leider en medeoprichter van Unite.AI, gedreven door een onwankelbare passie voor het vormgeven en promoten van de toekomst van AI en robotica. Een serieondernemer, hij gelooft dat AI net zo disruptief voor de samenleving zal zijn als elektriciteit, en wordt vaak betrapt op het prijzen van de potentie van disruptieve technologieën en AGI.

Als een futurist, hij is toegewijd aan het onderzoeken van hoe deze innovaties onze wereld zullen vormgeven. Bovendien is hij de oprichter van Securities.io, een platform dat zich richt op het investeren in cutting-edge technologieën die de toekomst herdefiniëren en hele sectoren herschikken.