Intervjuer
Xavier Conort, medgrundare och CPO på FeatureByte – Intervjuserie

Xavier Conort är en visionär dataforskare med mer än 25 års erfarenhet av data. Han började sin karriär som aktuarie inom försäkringsbranschen innan han övergick till dataforskning. Han är en topprankad Kaggle-tävlande och var chefsdataforskare på DataRobot innan han co-founding FeatureByte.
FeatureByte är på en mission att skala upp företags AI genom att radikalt förenkla och industrialisera AI-data. Plattformen för funktionshantering och -utveckling ger dataforskare möjlighet att skapa och dela toppmoderna funktioner och produktionsklara data pipelines på bara några minuter – istället för veckor eller månader.
Du började din karriär som aktuarie inom försäkringsbranschen innan du övergick till dataforskning, vad orsakade denna förändring?
Ett avgörande ögonblick var när jag vann GE Flight Quest, en tävling som anordnades av GE med en prispott på 250 000 dollar, där deltagarna skulle förutsäga förseningar av inrikesflyg i USA. Jag är tacksam för den här framgången till min värdefulla erfarenhet av försäkringspraxis: den tvåstegsmodelleringen. Detta tillvägagångssätt hjälper till att kontrollera bias i funktioner som saknar tillräcklig representation i den tillgängliga träningsdatan. Tillsammans med andra segrar på Kaggle, övertygade den här prestationen mig om att min aktuariebakgrund gav mig en konkurrensfördel inom dataforskning.
Under min Kaggle-resa hade jag också privilegiet att koppla samman med andra entusiastiska dataforskare, inklusive Jeremy Achin och Tom De Godoy, som senare skulle bli grundarna av DataRobot. Vi delade en gemensam bakgrund inom försäkringar och hade uppnått betydande framgångar på Kaggle. När de slutligen lanserade DataRobot, ett företag som specialiserade sig på AutoML, bjöd de in mig att ansluta mig till dem som chefsdataforskare. Deras vision om att kombinera de bästa metoderna från försäkringsbranschen med kraften från maskinlärning exciterade mig, och gav mig möjlighet att skapa något innovativt och betydelsefullt.
På DataRobot var du instrumental i att bygga deras data science-roadmap. Vilka typer av datautmaningar mötte du?
Den största utmaningen vi mötte var den varierande kvaliteten på data som tillhandahölls som indata till vår AutoML-lösning. Detta problem ledde ofta till antingen tidskrävande samarbete mellan vårt team och kunder eller besvikna resultat i produktion om det inte hanterades på rätt sätt. Kvalitetsproblemen härrörde från flera källor som krävde vår uppmärksamhet.
En av de primära utmaningarna uppstod från det allmänna användandet av business intelligence-verktyg för dataförberedelse och -hantering. Medan dessa verktyg är värdefulla för att generera insikter, saknar de de funktioner som krävs för att säkerställa punkt-i-tiden-korrekthet för maskinlärningsdataförberedelse. Som ett resultat kunde läckage i träningsdata uppstå, vilket ledde till överanpassning och ofullständig modellprestanda.
Misskommunikation mellan dataforskare och dataingenjörer var en annan utmaning som påverkade modellens noggrannhet under produktion. Inkonsistenser mellan tränings- och produktionsfaserna, som uppstod på grund av missförstånd mellan dessa två team, kunde påverka modellens prestanda i en verklig miljö.
Vilka var några av de viktigaste lärdomarna från den här erfarenheten?
Min erfarenhet på DataRobot betonade betydelsen av dataförberedelse inom maskinlärning. Genom att hantera utmaningarna med att generera modellträningsdata, såsom punkt-i-tiden-korrekthet, expertklyftor, domänkunskap, verktygsbegränsningar och skalbarhet, kan vi förbättra noggrannheten och tillförlitligheten hos maskinlärningsmodeller. Jag drog slutsatsen att att förenkla dataförberedelseprocessen och införa innovativa teknologier kommer att vara avgörande för att låsa upp maskinlärningens fulla potential och infria dess löften.
Vi hörde också från din medgrundare Razi Raziuddin om FeatureBytes ursprungshistoria, kan vi få din version av händelserna?
När jag diskuterade mina observationer och insikter med min medgrundare Razi Raziuddin, insåg vi att vi delade en gemensam förståelse av utmaningarna inom dataförberedelse för maskinlärning. Under våra diskussioner delade jag med Razi mina insikter om de senaste framstegen inom MLOps-samhället. Jag kunde observera uppkomsten av funktionsshoppar och funktionplattformar som AI-först företag införde för att minska fördröjningen av funktionstjänster, uppmuntra funktionåteranvändning eller förenkla funktionsmaterialisering till träningsdata medan man säkerställde tränings-tjänstekonsekvens. Men det var uppenbart för oss att det fortfarande fanns ett gap i att tillgodose dataforskarnas behov. Razi delade med mig sina insikter om hur den moderna datastacken har revolutionerat BI och analyser, men inte fullt utnyttjats för AI.
Det blev tydligt för både Razi och mig att vi hade möjlighet att göra en betydande inverkan genom att radikalt förenkla funktionshanteringprocessen och ge dataforskare och ML-ingenjörer rätt verktyg och användarupplevelse för smidig funktionsexperiment och funktionstjänst.
Vilka var några av dina största utmaningar när du gick från att vara dataforskare till att bli entreprenör?
Att gå från att vara dataforskare till att bli entreprenör krävde att jag bytte från ett tekniskt perspektiv till ett bredare affärsinriktat tankesätt. Medan jag hade en stark grund i att förstå smärtstillande punkter, skapa en roadmap, genomföra planer, bygga ett team och hantera budgetar, fann jag att att skapa rätt budskap som verkligen resonera med vår målgrupp var en av mina största hinder.
Som dataforskare hade mitt primära fokus alltid varit på att analysera och tolka data för att dra värdefulla slutsatser. Men som entreprenör behövde jag rikta mitt tänkande mot marknaden, kunderna och det övergripande företaget.
Luckligtvis kunde jag övervinna den här utmaningen genom att utnyttja erfarenheten av någon som min medgrundare Razi.
Vi hörde från Razi om varför funktionshantering är så svår, i din åsikt vad gör det så utmanande?
Funktionshantering har två huvudsakliga utmaningar:
- Att omvandla befintliga kolumner: Detta innebär att konvertera data till ett lämpligt format för maskinlärningsalgoritmer. Tekniker som one-hot-encoding, funktionsskalning och avancerade metoder som text- och bildomvandling används. Att skapa nya funktioner från befintliga, som interaktionsfunktioner, kan förbättra modellens prestanda avsevärt. Populära bibliotek som scikit-learn och Hugging Face erbjuder omfattande stöd för den här typen av funktionshantering. AutoML-lösningar syftar till att förenkla processen också.
- Att extrahera nya kolumner från historiska data: Historiska data är avgörande i problemområden som rekommendationssystem, marknadsföring, bedrägeridetektering, försäkringsprissättning, kreditvärdering, efterfråganprognos och sensordatahantering. Att extrahera informativa kolumner från den här datan är utmanande. Exempel inkluderar tid sedan den senaste händelsen, aggregeringar över nyliga händelser och inbäddningar från sekvenser av händelser. Den här typen av funktionshantering kräver domänkunskap, experiment, starka programmeringsfärdigheter och djup dataforskning. Faktorer som tidsläckage, hantering av stora datamängder och effektiv kodkörning kräver också hänsyn.
Sammanfattningsvis kräver funktionshantering expertis, experiment och konstruktion av komplexa ad-hoc datapipelines i avsaknad av verktyg som är specifikt utformade för det.
Kan du dela hur FeatureByte ger dataforskare möjlighet att förenkla funktionshantering?
FeatureByte ger dataforskare möjlighet att förenkla hela processen i funktionshantering. Med en intuitiv Python-SDK möjliggör det snabb funktionsskapande och extrahering från stora händelse- och artabeller. Beräkningar hanteras effektivt genom att utnyttja skalbarheten hos dataplattformar som Snowflake, DataBricks och Spark. Anteckningsböcker möjliggör experiment, medan funktionssdelning och återanvändning sparar tid. Revisionshantering säkerställer funktionens noggrannhet, medan omedelbar distribution eliminerar pipelinehanteringshuvudvärk.
Utöver de här funktionerna som erbjuds av vår öppna källkodsplattform, erbjuder vår företagslösning en omfattande ram för att hantera och organisera AI-åtgärder i skala, inklusive styrningsarbetsflöden och en användargränssnitt för funktionskatalogen.
Vad är din vision för FeatureBytes framtid?
Vår ultimata vision för FeatureByte är att revolutionera området dataforskning och maskinlärning genom att ge användarna möjlighet att utnyttja sin fulla kreativa potential och dra otroligt värde från sina dataresurser.
Vi är särskilt entusiastiska över den snabba utvecklingen inom generativ AI och transformer, som öppnar upp en värld av möjligheter för våra användare. Dessutom är vi dedikerade till att demokratisera funktionshantering. Generativ AI har potentialen att sänka tröskeln för kreativ funktionshantering, vilket gör det mer tillgängligt för en bredare publik.
Sammanfattningsvis kretsar vår vision för FeatureBytes framtid kring kontinuerlig innovation, att utnyttja kraften från generativ AI och att demokratisera funktionshantering. Vi syftar till att vara den plattform som möjliggör för dataforskare att omvandla rådata till handlingsbara indata för maskinlärning, vilket driver genombrott och framsteg över hela branschen.
Har du några råd till blivande AI-entreprenörer?
Definiera din plats, stanna fokuserad och välkommen nyhet.
Genom att definiera den plats som du vill äga, kan du differentiera dig och etablera en stark närvaro inom det området. Forska marknaden, förstå behoven och smärtstillande punkterna hos potentiella kunder och sträva efter att tillhandahålla en unik lösning som effektivt hanterar dessa utmaningar.
Definiera din långsiktiga vision och sätt tydliga kortfristiga mål som är i linje med den visionen. Koncentrera dig på att bygga en stark grund och leverera värde inom ditt valda område.
Till sist, medan det är viktigt att stanna fokuserad, ska du inte vara rädd för att omfamna nyhet och utforska nya idéer inom ditt definierade område. AI-området utvecklas ständigt, och innovativa tillvägagångssätt kan öppna upp nya möjligheter.
Tack för den underbara intervjun, läsare som vill lära sig mer kan besöka FeatureByte.












