Interviews
Xavier Conort, medstifter og CPO af FeatureByte – Intervjuerækken

Xavier Conort er en visionær datavidenskabsmand med mere end 25 års erfaring inden for data. Han startede sin karriere som aktuar i forsikringsindustrien, før han skiftede til datavidenskab. Han er en topplaceret Kaggle-deltager og var Chief Data Scientist i DataRobot, før han co-foundede FeatureByte.
FeatureByte har til formål at skabe enterprise AI ved at radikalt simplificere og industrialisere AI-data. Platformen for funktionsteknik og -styring giver datavidenskabsmænd mulighed for at oprette og dele funktioner og produktionsklare data-pipelines på få minutter – i stedet for uger eller måneder.
I begyndelsen af din karriere var du aktuar i forsikringsindustrien, før du skiftede til datavidenskab. Hvad var årsagen til denne ændring?
Et afgørende øjeblik var, da jeg vandt GE Flight Quest, en konkurrence arrangeret af GE med en præmie på 250.000 dollars, hvor deltagere skulle forudsige forsinkelser af indenlandske fly i USA. Jeg skylder en del af denne succes til en værdifuld forsikringspraksis: de to stadier af modellering. Denne tilgang hjælper med at kontrollere bias i funktioner, der mangler tilstrækkelig repræsentation i den tilgængelige træningsdata. Sammen med andre sejre på Kaggle overbeviste dette mig om, at min baggrund som aktuar gav mig en konkurrencemæssig fordel i datavidenskab.
Under min Kaggle-rejse havde jeg også privileget at møde andre entusiastiske datavidenskabsmænd, herunder Jeremy Achin og Tom De Godoy, der senere blev grundlæggere af DataRobot. Vi delte en fælles baggrund i forsikring og havde opnået bemærkelsesværdige succeser på Kaggle. Da de senere lancerede DataRobot, et selskab, der specialiserer sig i AutoML, inviterede de mig til at slutte mig til dem som Chief Data Scientist. Deres vision om at kombinere de bedste praksisser fra forsikringsindustrien med kraften fra maskinlæring begejstrede mig og gav mig mulighed for at skabe noget nyt og betydningsfuldt.
På DataRobot var du med til at bygge deres datavidenskabs-vejviser. Hvad for slags dataudfordringer mødte du?
Den største udfordring, vi mødte, var den varierende kvalitet af data, der blev leveret som input til vores AutoML-løsning. Dette problem resulterede ofte i tidskrævende samarbejde mellem vores team og kunder eller skuffende resultater i produktion, hvis det ikke blev behandlet på en passende måde. Kvalitetsproblemerne stammede fra flere kilder, der krævede vores opmærksomhed.
En af de primære udfordringer opstod fra den generelle brug af business intelligence-værktøjer til dataforberedning og -styring. Mens disse værktøjer er værdifulde til at generere indsigt, mangler de de nødvendige funktioner til at sikre punkt-i-tiden-korrekthed for maskinlæring-dataforberedning. Dette resulterede i, at der kunne opstå lækager i træningsdata, hvilket kunne føre til overfitting og ukorrekt modelpræstation.
Misforståelser mellem datavidenskabsmænd og dataingeniører var en anden udfordring, der påvirkede modellens nøjagtighed under produktion. Inkonsistenser mellem trænings- og produktionsfaser, der opstod på grund af misforståelser mellem disse to teams, kunne have indvirkning på modelpræstationen i en reel verden.
Hvad var nogle af de vigtigste erfaringer fra denne oplevelse?
Min oplevelse på DataRobot fremhævede betydningen af dataforberedning i maskinlæring. Ved at løse udfordringerne i forbindelse med at generere træningsdata til modeller, såsom punkt-i-tiden-korrekthed, ekspertglækker, domæneviden, værktøjsbegrænsninger og skalerbarhed, kan vi forbedre nøjagtigheden og pålideligheden af maskinlæringsmodeller. Jeg kom til den konklusion, at det at strømline dataforberedningsprocessen og inkorporere innovative teknologier vil være afgørende for at låse det fulde potentiale af AI og opfylde dets løfter.
Vi hørte også fra din medstifter Razi Raziuddin om FeatureBytes oprindelseshistorie. Kan vi få din version af begivenhederne?
Da jeg diskuterede mine observationer og indsigt med min medstifter Razi Raziuddin, indså vi, at vi delte en fælles forståelse af udfordringerne i dataforberedning til maskinlæring. Under vores diskussioner delte jeg mine indsigt i de seneste fremskridt i MLOps-fællesskabet. Jeg kunne observere opkomsten af funktioner og funktioner, der blev sat i værk af AI-først-teknologivirksomheder for at reducere ventetiden for funktionstjenester, opmuntre funktionsgenbrug eller simplificere funktionsmaterialisering til træningsdata, samtidig med at de sikrede trænings-tjeneste-konsistens. Det var dog tydeligt for os, at der stadig var et hul i at imødekomme datavidenskabsmænds behov. Razi delte sin indsigt i, hvordan den moderne datastack havde revolutioneret BI og analytics, men ikke fuldt ud var blevet udnyttet til AI.
Det blev tydeligt for både Razi og mig, at vi havde mulighed for at gøre en betydelig indvirkning ved at radikalt simplificere funktionsteknikprocessen og give datavidenskabsmænd og ML-ingeniører de rigtige værktøjer og brugeroplevelse til problemfri funktionseksperimentation og funktionstjeneste.
Hvad var nogle af dine største udfordringer i overgangen fra datavidenskabsmand til iværksætter?
Overgangen fra datavidenskabsmand til iværksætter krævede, at jeg skiftede fra et teknisk perspektiv til et bredere forretningsorienteret mindset. Mens jeg havde en stærk grundlag i at forstå smertepunkter, oprette en vejviser, udføre planer, bygge et team og styre budgetter, fandt jeg, at det at skabe den rigtige besked, der virkelig resonerer med vores målgruppe, var en af mine største hindringer.
Som datavidenskabsmand havde jeg altid fokuseret på at analysere og fortolke data for at udlede værdifulde indsigt. Som iværksætter måtte jeg dog rette min tankegang mod markedet, kunderne og det overordnede forretningsaspekt.
Heldigvis kunne jeg overvinde denne udfordring ved at udnytte erfaringen fra en person som min medstifter Razi.
Vi hørte fra Razi om, hvorfor funktionsteknik er så svær. I din mening, hvad gør det så udfordrende?
Funktionsteknik har to primære udfordringer:
- Transformering af eksisterende kolonner: Dette indebærer konvertering af data til en egnet format for maskinlæringsalgoritmer. Teknikker som one-hot-encoding, funktionsskala og avancerede metoder som tekst- og billedtransformeringer bruges. Oprettelse af nye funktioner fra eksisterende, som interaktionsfunktioner, kan stærkt forbedre modelpræstationen. Populære biblioteker som scikit-learn og Hugging Face giver omfattende støtte til denne type funktionsteknik. AutoML-løsninger sigter også til at simplificere processen.
- Ekstraktion af nye kolonner fra historisk data: Historisk data er afgørende i problemområder som anbefalingsystemer, marketing, svindelopdækkelse, forsikringsprisfastsættelse, kreditscoring, efterspørgselsprognose og sensor-data-behandling. Ekstraktion af informative kolonner fra denne data er udfordrende. Eksempler inkluderer tid siden sidste begivenhed, aggregationer over seneste begivenheder og indlejring fra sekvenser af begivenheder. Denne type funktionsteknik kræver domæneekspertise, eksperimentering, stærke kodnings- og dataingeniør-færdigheder samt dyb datavidenskabskundskab. Faktorer som tidslækage, håndtering af store datasæt og effektiv kodekørsel kræver også overvejelse.
Samlet set kræver funktionsteknik ekspertise, eksperimentering og opbygning af komplekse ad-hoc-data-pipelines i mangelen på værktøjer, der specifikt er designet til det.
Kan du dele, hvordan FeatureByte giver datavidenskabsprofessionelle mulighed for at forenkle funktionspipelines?
FeatureByte giver datavidenskabsprofessionelle mulighed for at forenkle hele processen i funktionsteknik. Med en intuitiv Python-SDK giver det mulighed for hurtig funktionsskabelse og -ekstraktion fra store begivenheds- og varetabeller. Beregning håndteres effektivt ved at udnytte skalerbarheden af data-platforme som Snowflake, DataBricks og Spark. Notebooks muliggør eksperimentering, mens funktionsskabelse og -genbrug sparer tid. Revision sikrer funktionssikkerhed, mens øjeblikkelig udrulning eliminerer pipeline-styrings-problemer.
Ud over disse funktioner, der tilbydes af vores open-source-bibliotek, giver vores enterprise-løsning en omfattende ramme for at styre og organisere AI-operationer i stor skala, herunder styreprocesser og en brugerflade til funktionskataloget.
Hvad er din vision for FeatureBytes fremtid?
Vores ultimative vision for FeatureByte er at revolutionere feltet datavidenskab og maskinlæring ved at give brugerne mulighed for at udnytte deres fulde kreative potentiale og udlede hidtil usete værdi fra deres dataaktiver.
Vi er særligt begejstrede over de hurtige fremskridt i Generative AI og transformers, der åbner op for en verden af muligheder for vores brugere. Desuden er vi dedikeret til at demokratisere funktionsteknik. Generative AI har potentialet til at sænke barrieren for kreativ funktionsteknik og gøre det mere tilgængeligt for en bredere publikum.
Sammenfattet drejer vores vision for FeatureBytes fremtid sig om kontinuerlig innovation, udnyttelse af Generative AI og demokratisering af funktionsteknik. Vi sigter mod at være den gå-to-platform, der giver datafagfolk mulighed for at omdanne rådata til handlebare input til maskinlæring, og drive gennembrud og fremskridt på tværs af brancher.
Har du nogen råd til aspirerende AI-iværksættere?
Definer din plads, bliv fokuseret og velkommen nytænkning.
Ved at definere den plads, du ønsker at eje, kan du differentiere dig selv og etablere en stærk tilstedeværelse i det område. Forsk i markedet, forstå behov og smertepunkter hos potentielle kunder, og stræb efter at levere en unik løsning, der effektivt løser disse udfordringer.
Definer din langsigtede vision og sæt klare, korte mål, der er i tråd med den vision. Koncentrer dig om at bygge en stærk grundlag og levere værdi i dit valgte område.
Til sidst, mens det er vigtigt at blive fokuseret, skal du ikke være bange for at omfavne nytænkning og udforske nye ideer inden for dit definerede område. AI-feltet udvikler sig konstant, og innovative tilgange kan åbne op for nye muligheder.
Tak for det gode interview. Læsere, der ønsker at lære mere, kan besøge FeatureByte.












