Interviuri

Xavier Conort, Co-Fondator și CPO al FeatureByte – Seria de Interviuri

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Xavier Conort este un vizionar în domeniul științei datelor, cu peste 25 de ani de experiență în domeniu. A început cariera sa ca actuar în industria asigurărilor, înainte de a trece la știința datelor. El este un competitor de top pe platforma Kaggle și a fost șeful departamentului de știință a datelor la DataRobot, înainte de a co-fonda FeatureByte.

FeatureByte are misiunea de a scala inteligența artificială a întreprinderilor, prin simplificarea radicală și industrializarea datelor de inteligență artificială. Platforma de inginerie și management al caracteristicilor împuternicește oamenii de știință a datelor să creeze și să partajeze caracteristici de ultimă generație și pipeline-uri de date gata de producție în minute – și nu în săptămâni sau luni.

Ați început cariera dvs. ca actuar în industria asigurărilor, înainte de a trece la știința datelor. Ce a determinat această schimbare?

Un moment definitoriu a fost câștigarea concursului GE Flight Quest, organizat de GE, cu un premiu de 250.000 de dolari, în care participanții trebuiau să prevadă întârzierile zborurilor interne din Statele Unite. Îi datorez o parte a acestui succes unei practici valoroase din asigurări: modelarea în două etape. Acest abordaj ajută la controlul bias-ului în caracteristici care nu au o reprezentare suficientă în datele de antrenare disponibile. Împreună cu alte victorii pe Kaggle, acest realizare m-a convins că background-ul meu actuarial îmi oferă un avantaj competitiv în domeniul științei datelor.

În timpul călătoriei mele pe Kaggle, am avut și privilegiul de a mă conecta cu alți entuziaști oameni de știință a datelor, inclusiv Jeremy Achin și Tom De Godoy, care ulterior au devenit fondatorii DataRobot. Am împărtășit un background comun în asigurări și am obținut succese notabile pe Kaggle. Când au lansat DataRobot, o companie specializată în AutoML, m-au invitat să li se alăture ca șef al departamentului de știință a datelor. Viziunea lor de a combina cele mai bune practici din industria asigurărilor cu puterea învățării automate m-a entuziasmat, prezentând o oportunitate de a crea ceva inovator și impactant.

La DataRobot, ați fost instrumental în construirea drumului științific al datelor. Ce tip de provocări ale datelor ați întâmpinat?

Provocarea cea mai semnificativă pe care am întâmpinat-o a fost calitatea variabilă a datelor furnizate ca intrare pentru soluția noastră AutoML. Această problemă a dus adesea la colaborări consumatoare de timp între echipa noastră și clienți sau la rezultate dezamăgitoare în producție, dacă nu erau abordate corespunzător. Problemele de calitate proveneau din multiple surse care necesitau atenția noastră.

Una dintre principalele provocări a apărut din utilizarea generală a instrumentelor de business intelligence pentru pregătirea și gestionarea datelor. Deși aceste instrumente sunt valoroase pentru generarea de insight-uri, ele lipsesc de capacitățile necesare pentru a asigura corectitudinea la momentul potrivit pentru pregătirea datelor de învățare automată. Ca urmare, puteau apărea scurgeri de date în timpul antrenării, ducând la suprainvățare și performanță inexactă a modelului.

Comunicarea defectuoasă între oamenii de știință a datelor și inginerii de date a fost o altă provocare care a afectat acuratețea modelelor în timpul producției. Inconsistențele dintre fazele de antrenare și producție, care apăreau din neconcordanța dintre aceste două echipe, puteau impacta performanța modelului într-un mediu real.

Care au fost unele dintre principalele concluzii din această experiență?

Experiența mea la DataRobot a subliniat importanța pregătirii datelor în învățarea automată. Prin abordarea provocărilor generării datelor de antrenare a modelului, cum ar fi corectitudinea la momentul potrivit, lacunele de expertiză, cunoașterea domeniului, limitările instrumentelor și scalabilitatea, putem îmbunătăți acuratețea și fiabilitatea modelelor de învățare automată. Am ajuns la concluzia că simplificarea procesului de pregătire a datelor și integrarea tehnologiilor inovatoare vor fi instrumentale în deblocarea întregului potențial al inteligenței artificiale și în îndeplinirea promisiunilor sale.

Am aflat de la Co-Fondatorul dvs., Razi Raziuddin, despre povestea de fond a FeatureByte, ne puteți spune versiunea dvs. a evenimentelor?

Când am discutat observațiile și insight-urile mele cu Co-Fondatorul meu, Razi Raziuddin, am realizat că împărtășim o înțelegere comună a provocărilor din pregătirea datelor pentru învățarea automată. În timpul discuțiilor noastre, i-am împărtășit lui Razi insight-urile mele despre progresele recente din comunitatea MLOps. Am putut observa apariția magazinelor de caracteristici și a platformelor de caracteristici pe care companiile care pun inteligența artificială pe primul loc le-au implementat pentru a reduce latența servirii caracteristicilor, pentru a încuraja reutilizarea caracteristicilor sau pentru a simplifica materializarea caracteristicilor în date de antrenare, asigurând în același timp coerența între antrenare și servire. Cu toate acestea, a fost evident pentru noi că exista încă un gol în îndeplinirea nevoilor oamenilor de știință a datelor. Razi mi-a împărtășit insight-urile sale despre modul în care stiva modernă de date a revoluționat BI și analitica, dar nu este pe deplin exploatată pentru inteligența artificială.

A devenit evident pentru Razi și pentru mine că avem oportunitatea de a avea un impact semnificativ prin simplificarea radicală a procesului de inginerie a caracteristicilor și prin oferirea oamenilor de știință a datelor și inginerilor de inteligență artificială a unor instrumente și experiențe de utilizator potrivite pentru experimentarea și servirea caracteristicilor.

Care au fost unele dintre cele mai mari provocări cu care v-ați confruntat în timpul tranziției de la om de știință a datelor la antreprenor?

Tranziția de la om de știință a datelor la antreprenor a necesitat o schimbare de perspectivă de la una tehnică la una mai largă, orientată spre business. Deși aveam o bază solidă în înțelegerea punctelor slabe, crearea unui plan de drum, executarea planurilor, construirea unei echipe și gestionarea bugetelor, am găsit că crearea mesajului potrivit care să rezonate cu adevărat cu publicul nostru țintă a fost una dintre cele mai mari obstacole.

Ca om de știință a datelor, focusul meu principal a fost întotdeauna analiza și interpretarea datelor pentru a obține insight-uri valoroase. Cu toate acestea, ca antreprenor, trebuia să îmi reorientez gândirea către piață, clienți și business-ul în ansamblu.

În mod fericit, am putut depăși această provocare prin a profita de experiența cuiva ca Co-Fondatorul meu, Razi.

Am aflat de la Razi despre motivul pentru care ingineria caracteristicilor este atât de dificilă. În opinia dvs., ce face ca aceasta să fie atât de provocatoare?

Ingineria caracteristicilor are două provocări principale:

  1. Transformarea coloanelor existente: Acest proces implică convertirea datelor într-un format potrivit pentru algoritmi de învățare automată. Se utilizează tehnici precum codificarea cu un singur bit, scalarea caracteristicilor și metode avansate, cum ar fi transformările de text și imagine. Crearea de noi caracteristici din cele existente, cum ar fi caracteristicile de interacțiune, poate îmbunătăți semnificativ performanța modelului. Biblioteci populare precum scikit-learn și Hugging Face oferă suport extins pentru acest tip de inginerie a caracteristicilor. Soluțiile AutoML își propun să simplifice acest proces.
  2. Extracția de noi coloane din datele istorice: Datele istorice sunt cruciale în domenii precum sistemele de recomandare, marketing, detectarea fraudelor, stabilirea prețurilor asigurărilor, scorarea creditului, previziunea cererii și procesarea datelor de senzori. Extracția de coloane informative din aceste date este o provocare. Exemple includ timpul scurs de la ultimul eveniment, agregări pe evenimente recente și încorporări din secvențe de evenimente. Acest tip de inginerie a caracteristicilor necesită expertiză în domeniu, experimentare, abilități puternice de codare și inginerie a datelor, precum și cunoașterea profundă a științei datelor. Factori precum scurgerile de timp, gestionarea seturilor de date mari și execuția eficientă a codului necesită, de asemenea, considerație.

În general, ingineria caracteristicilor necesită expertiză, experimentare și construirea unor pipeline-uri de date complexe și ad-hoc, în absența unor instrumente special concepute pentru aceasta.

Ne puteți spune cum FeatureByte împuternicește profesioniștii din domeniul științei datelor, în timp ce simplifică pipeline-urile de caracteristici?

FeatureByte împuternicește profesioniștii din domeniul științei datelor prin simplificarea întregului proces de inginerie a caracteristicilor. Cu un SDK Python intuitiv, permite crearea rapidă a caracteristicilor și extragerea lor din tabele mari de evenimente și articole. Calculul este gestionat eficient prin exploatarea scalabilității platformelor de date, cum ar fi Snowflake, DataBricks și Spark. Notebook-urile facilitează experimentarea, în timp ce partajarea și reutilizarea caracteristicilor economisesc timp. Auditarea asigură acuratețea caracteristicilor, în timp ce implementarea imediată elimină durerile de cap legate de gestionarea pipeline-urilor.

În plus față de aceste capacități oferite de biblioteca noastră open-source, soluția noastră enterprise oferă un cadru cuprinzător pentru gestionarea și organizarea operațiunilor de inteligență artificială la scară, incluzând fluxuri de lucru de guvernanță și o interfață de utilizator pentru catalogul de caracteristici.

Care este viziunea dvs. pentru viitorul FeatureByte?

Viziunea noastră finală pentru FeatureByte este de a revoluționa domeniul științei datelor și al învățării automate, prin împuternicirea utilizatorilor de a-și debloca întregul potențial creativ și de a extrage valoare fără precedent din activele lor de date.

Suntem în special entuziasmați de progresul rapid înregistrat în domeniul inteligenței artificiale generative și al transformatorilor, care deschide o lume de posibilități pentru utilizatorii noștri. Mai mult, ne dedicăm democratizării ingineriei caracteristicilor. Inteligența artificială generativă are potențialul de a reduce bariera de intrare pentru ingineria creativă a caracteristicilor, făcând-o mai accesibilă unui public mai larg.

În sinteză, viziunea noastră pentru viitorul FeatureByte se învârte în jurul inovării continue, a exploatarii puterii inteligenței artificiale generative și a democratizării ingineriei caracteristicilor. Ne propunem să devenim platforma de referință care permite profesioniștilor din domeniul datelor să transforme datele brute în intrări actionabile pentru învățarea automată, conducând la progrese și avansări în toate industriile.

Aveți vreun sfat pentru antreprenorii aspiranți în domeniul inteligenței artificiale?

Definiți-vă spațiul, rămâneți concentrați și îmbrățișați noutatea.

Prin definirea spațiului pe care doriți să-l dețineți, puteți să vă diferențiați și să stabiliți o prezență puternică în acel domeniu. Cercetați piața, înțelegeți nevoile și punctele slabe ale clienților potențiali și străduiți-vă să oferiți o soluție unică care să abordeze eficient aceste provocări.

Definiți-vă viziunea pe termen lung și stabiliți obiective pe termen scurt care se aliniază cu acea viziune. Concentrați-vă pe construirea unei baze solide și pe livrarea de valoare în spațiul dvs. ales.

În final, deși este important să rămâneți concentrați, nu ezitați să îmbrățișați noutatea și să explorați idei noi în spațiul dvs. definit. Domeniul inteligenței artificiale evoluează constant, iar abordările inovatoare pot deschide noi oportunități.

Mulțumim pentru acest interviu minunat; cititorii care doresc să afle mai multe pot vizita FeatureByte.

Antoine este un lider vizionar și partener fondator al Unite.AI, condus de o pasiune neclintită pentru modelarea și promovarea viitorului inteligenței artificiale și roboticii. Un întreprinzător serial, el crede că inteligența artificială va fi la fel de disruptivă pentru societate ca și electricitatea și este adesea prins vorbind entuziast despre potențialul tehnologiilor disruptive și AGI.

Ca futurist, el este dedicat explorării modului în care aceste inovații vor modela lumea noastră. În plus, el este fondatorul Securities.io, o platformă axată pe investiții în tehnologii de ultimă generație care redefinesc viitorul și reshapă întregi sectoare.