Intervjuer

Xavier Conort, medgrunnlegger og CPO av FeatureByte – Intervju-serie

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Xavier Conort er en visjonær dataforsker med over 25 års erfaring med data. Han startet sin karriere som aktuar i forsikringsbransjen før han gikk over til datavitenskap. Han er en topprangert Kaggle-konkurrent og var sjefsforsker ved DataRobot før han var med å grunnlegge FeatureByte.

FeatureByte har som mål å skalerer bedrifts-AI ved å radikalt forenkle og industrialisere AI-data. Plattformen for funksjonsingeniøri og -styring gir dataforskere mulighet til å lage og dele state-of-the-art-funksjoner og produksjonsklare data-pipelines på minutter – i stedet for uker eller måneder.

Du startet din karriere som aktuar i forsikringsbransjen før du gikk over til datavitenskap, hva var årsaken til denne endringen?

Et avgjørende øyeblikk var å vinne GE Flight Quest, en konkurranse arrangert av GE med en premie på 250 000 dollar, der deltakerne måtte forutsi forsinkelser av innenlandske flyreiser i USA. Jeg skylder en del av denne suksessen til en verdifull forsikringspraksis: den to-stegs modelleringen. Denne tilnærmingen hjelper med å kontrollere forvrengning i funksjoner som mangler tilstrekkelig representasjon i den tilgjengelige treningsdataen. I tillegg til andre seire på Kaggle, overbeviste denne prestasjonen meg om at min aktuarbakgrunn ga meg en konkurransefordel i datavitenskapfeltet.

Under min Kaggle-reise hadde jeg også privileget til å koble meg med andre entusiastiske dataforskere, inkludert Jeremy Achin og Tom De Godoy, som senere skulle bli grunnleggerne av DataRobot. Vi delte en felles bakgrunn fra forsikringsbransjen og hadde oppnådd bemerkelsesverdige suksesser på Kaggle. Når de til slutt lanserte DataRobot, et selskap som spesialiserte seg på AutoML, inviterte de meg til å bli med dem som sjefsforsker. Deres visjon om å kombinere de beste praksisene fra forsikringsbransjen med kraften fra maskinlæring, begeistrte meg, og ga meg en mulighet til å skape noe innovativt og betydningsfullt.

På DataRobot var du med å bygge deres dataforsknings-veikart. Hva slags data-utfordringer møtte du?

Den største utfordringen vi møtte, var den varierte kvaliteten på dataene som ble levert som inndata til vår AutoML-løsning. Dette problemet resulterte ofte i tidskrevende samarbeid mellom vårt team og kunder, eller skuffende resultater i produksjon hvis det ikke ble håndtert på riktig måte. Kvalitetsproblemer oppstod fra flere kilder som krevde vår oppmerksomhet.

En av de primære utfordringene oppstod fra den generelle bruken av business-intelligens-verktøy for data-forberedelse og -styring. Mens disse verktøyene er verdifulle for å generere innsikt, mangler de evnen til å sikre punkt-i-tiden-korrekt for maskinlæring-dataforberedelse. Dette resulterte i at det kunne oppstå lekkasjer i treningsdata, noe som kunne føre til overfitting og uakkurat modell-ytelse.

Misforståelser mellom dataforskere og data-ingeniører var en annen utfordring som påvirkte modell-ytelsen under produksjon. Uoverensstemmelser mellom trenings- og produksjonsfasene, som oppstod fra misforståelser mellom disse to teamene, kunne påvirke modell-ytelsen i en virkelig verden.

Hva var noen av de viktigste lærdommene fra denne erfaringen?

Min erfaring på DataRobot viste meg betydningen av data-forberedelse i maskinlæring. Ved å håndtere utfordringene med å generere modell-treningsdata, som punkt-i-tiden-korrekt, ekspertglapp, domenekunnskap, verktøybegrensninger og skalerbarhet, kan vi forbedre nøyaktigheten og påliteligheten til maskinlæringsmodellene. Jeg kom til slutsatsen om at å forenkle data-forberedelsesprosessen og innføre innovative teknologier vil være avgjørende for å låse opp det fulle potensialet til AI og levere på dens løfter.

Vi hørte også fra din medgrunnlegger Razi Raziuddin om opphavet til FeatureByte, kunne du gi oss din versjon av hendelsene?

Når jeg diskuterte mine observasjoner og innsikter med min medgrunnlegger Razi Raziuddin, innsett vi at vi delte en felles forståelse av utfordringene i data-forberedelse for maskinlæring. Under våre diskusjoner delte jeg mine innsikter i de nyeste fremstegene i MLOps-samfunnet med Razi. Jeg kunne observere oppkomsten av funksjonsbutikker og funksjonsplattformer som AI-først-teknologiselskaper satte i verk for å redusere latentheten i funksjonstjenester, oppmuntre til funksjons-gjenbruk eller forenkle funksjonsmaterialisering til treningsdata samtidig som de sikret trenings-tjeneste-konsistens. Det var imidlertid tydelig for oss at det fortsatt var et gap i å møte behovene til dataforskere. Razi delte sine innsikter med meg om hvordan den moderne data-stakken hadde revolusjonert BI og analytics, men ikke ble fullt utnyttet for AI.

Det ble tydelig for både Razi og meg at vi hadde en mulighet til å gjøre en betydelig innvirkning ved å radikalt forenkle funksjonsingeniøri-prosessen og gi dataforskere og ML-ingeniører de riktige verktøyene og brukeropplevelsen for å kunne eksperimentere med funksjoner og tjenestefunksjoner uten problemer.

Hva var noen av dine største utfordringer i å gå over fra dataforsker til gründer?

Overgangen fra dataforsker til gründer krevde at jeg endret perspektivet mitt fra et teknisk til et bredere forretnings-orientert syn. Mens jeg hadde en sterk bakgrunn i å forstå smertepunkter, lage en veikart, gjennomføre planer, bygge et team og håndtere budsjetter, fant jeg at å forme den riktige meldingen som virkelig resonnerte med vårt målpublikum, var en av mine største hindringer.

Som dataforsker hadde mitt primære fokus alltid vært på å analysere og tolke data for å kunne trekke verdifulle innsikter. Men som gründer, måtte jeg rette tenkningen min mot markedet, kundene og det overordnede forretningsperspektivet.

Lykkeligvis kunne jeg overvinne denne utfordringen ved å utnytte erfaringen til noen som min medgrunnlegger Razi.

Vi hørte fra Razi om hvorfor funksjonsingeniøri er så vanskelig, i din mening hva gjør det så utfordrende?

Funksjonsingeniøri har to hovedutfordringer:

  1. Transformere eksisterende kolonner: Dette innebærer å konvertere data til en passende format for maskinlæringsalgoritmer. Teknikker som one-hot-encoding, funksjonsskaling og avanserte metoder som tekst- og bilde-transformasjoner brukes. Å lage nye funksjoner fra eksisterende, som interaksjonsfunksjoner, kan forbedre modell-ytelsen betydelig. Populære biblioteker som scikit-learn og Hugging Face gir omfattende støtte for denne type funksjonsingeniøri. AutoML-løsninger prøver å forenkle prosessen også.
  2. Ekstrahere nye kolonner fra historiske data: Historiske data er avgjørende i problemområder som anbefalings-systemer, markedsføring, svindel-avdekking, forsikringsprising, kreditvurdering, etterspørsels-prognose og sensor-data-prosessering. Å ekstrahere informasjon fra disse dataene er utfordrende. Eksempler inkluderer tid siden siste hendelse, aggregasjoner over nylige hendelser og innkapslinger fra hendelses-sekvenser. Denne type funksjonsingeniøri krever domenekunnskap, eksperimentering, sterk kode- og data-ingeniør-ferdigheter og dyp data-vitenskapelig kunnskap. Faktorer som tid-lekkasje, håndtering av store datasett og effektiv kode-eksekvering må også tas i betraktning.

I alt krever funksjonsingeniøri ekspertise, eksperimentering og konstruksjon av komplekse ad-hoc data-pipelines i fravær av verktøy spesifikt designet for det.

Kunne du dele hvordan FeatureByte gir dataforskere mulighet til å forenkle funksjons-pipelines?

FeatureByte gir dataforskere mulighet til å forenkle hele prosessen i funksjonsingeniøri. Med en intuitiv Python-SDK, muliggjør det rask funksjons-opprettelse og -ekstraksjon fra store hendelses- og element-tabeller. Beregning håndteres effektivt ved å utnytte skalerbarheten til data-plattformer som Snowflake, DataBricks og Spark. Notebook-fasiliteter muliggjør eksperimentering, mens funksjons-delings- og -gjenbruk mulighetene sparer tid. Revisjon sikrer funksjons-nøyaktighet, mens umiddelbar distribusjon eliminerer pipeline-håndtering-problemer.

I tillegg til disse evnene som vårt åpne bibliotek tilbyr, gir vår bedriftsløsning en omfattende ramme for å håndtere og organisere AI-operasjoner i skala, inkludert styrings-workflows og en brukergrensesnitt for funksjons-katalogen.

Hva er din visjon for fremtiden til FeatureByte?

Vår ultimate visjon for FeatureByte er å revolusjonere feltet data-vitenskap og maskinlæring ved å gi brukerne mulighet til å løse ut deres fulle kreative potensiale og trekke ut uventet verdi fra deres data-aktiva.

Vi er spesielt begeistret over den raske fremgangen i Generative AI og transformers, som åpner opp en verden av muligheter for våre brukere. Videre er vi dedikert til å demokratisere funksjonsingeniøri. Generative AI har potensialet til å senke terskelen for kreativ funksjonsingeniøri, og gjøre det mer tilgjengelig for et bredere publikum.

I sammenfatning dreier vår visjon for fremtiden til FeatureByte seg om kontinuerlig innovasjon, å utnytte kraften fra Generative AI og å demokratisere funksjonsingeniøri. Vi har som mål å bli den gå-to-plattformen som muliggjør at data-folk kan omdanne rå-data til handle-rett inndata for maskinlæring, og drive gjennombrudd og fremgang over hele industrien.

Har du noen råd for aspirerende AI-gründere?

Definer din plass, hold fokus og velkommen nyskaping.

Ved å definere plassen du ønsker å eie, kan du differensiere deg selv og etablere en sterk tilstedeværelse i det området. Forsk i markedet, forstå behovene og smertepunktene til potensielle kunder, og streb etter å levere en unik løsning som møter disse utfordringene effektivt.

Definer din langtids-visjon og sett klare korttids-mål som sammenfaller med den visjonen. Konsentrer deg om å bygge en sterk grunn og levere verdi i ditt valgte område.

Til slutt, mens det er viktig å holde fokus, skal du ikke sky away fra å omfavne nyskaping og utforske nye ideer innenfor din definerte plass. AI-feltet utvikler seg konstant, og innovative tilnærminger kan åpne opp nye muligheter.

Takk for det flotte intervjuet, lesere som ønsker å lære mer kan besøke FeatureByte.

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.