Haastattelut

Xavier Conort, FeatureByten perustaja ja CPO – Haastattelusarja

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Xavier Conort on visionäärisiä data scientist, jolla on yli 25 vuoden kokemus data-alalta. Hän aloitti uransa vakuutusalan aktuaarina, mutta siirtyi myöhemmin data scienceen. Hän on yksi parhaimmista Kaggle-kilpailijista ja toimi aiemmin DataRobotin päätieteilijänä ennen FeatureByten perustamista.

FeatureByte on tehtävänään skaalata yritysten käyttämää tekoälyä radikaalisti yksinkertaistamalla ja teollistamalla tekoälyn dataa. FeatureByten ominaisuus- ja hallintaplatfrom mahdollistaa data- tutkijoiden luoda ja jakaa huipputason ominaisuuksia ja valmiita data-pipelineja muutamassa minuutissa – ei viikoissa tai kuukausissa.

Mistä johtui siirtymäsi vakuutusalan aktuaarista data scienceen?

Merkittävä hetki oli voitto GE Flight Quest -kilpailussa, jossa osallistujien piti ennustaa Yhdysvaltain kotimaan lentojen viivästymisiä. Olen osittain kiitollinen tästä menestyksestä vakuutusalan käytännöille, kuten 2-vaiheisen mallinnuksen menetelmälle. Tämä lähestymistapa auttaa hallitsemaan harhan varhaisessa vaiheessa, kun koulutusdatasta puuttuu riittävästi edustavia piirteitä. Kaggle-voittojen myötä, tämä saavutus vakuutti minulle, että minun vakuutusalan taustani antoi minulle kilpailuedun data-tieteessä.

Kaggle-matkan aikana, minulla oli myös etuoikeus tutustua muihin innostuneisiin data-tutkijoihin, kuten Jeremy Achiniin ja Tom De Godoyhin, jotka myöhemmin perustivat DataRobotin. Meillä oli yhteinen tausta vakuutusalan parissa ja olimme saavuttaneet merkittäviä voittoja Kagglissa. Kun he lopulta perustivat DataRobotin, yhtiön, joka erikoistui AutoML:ään, he kutsuivat minut liittymään heidän joukkoihinsa päätieteilijänä. Heidän visio heidän yhdistää parhaat käytännöt vakuutusalan parissa koneoppimisen voiman kanssa, innosti minua luomaan jotain uutta ja vaikuttavaa.

Mitä haasteita kohtasit DataRobotissa data-tieteellisessä tiellä?

Yksi merkittävin haaste, jota kohtasimme, oli syötteenä annetun datan laatu. Tämä ongelma johti usein joko aikaa vievään yhteistyöhön tiimimme ja asiakkaiden kanssa tai pettymykseen tuotannossa, jos sitä ei oikein huomioitu. Laatuongelmat johtuivat useista lähteistä, joihin meidän piti kiinnittää huomiota.

Yksi tärkeimmistä haasteista oli liiketoimintatiedon työkalujen yleinen käyttö datan esikäsittelyssä ja hallinnassa. Vaikka nämä työkalut ovat arvokkaita tietojen luomiseksi, ne eivät tarjoa vaadittuja ominaisuuksia koneoppimisen datan esikäsittelyyn. Tämä johti usein vuotoihin koulutusdataan, mikä aiheutti ylioppimista ja epätarkkaa mallin suorituskykyä.

Data-tutkijoiden ja data-insinöörien välinen viestintäongelma oli toinen haaste, joka vaikutti mallien tarkinnaiseen tarkkuuteen tuotannossa. Epäjohdonmukaisuudet koulutus- ja tuotantovaiheiden välillä, jotka johtuivat näiden kahden tiimin välistä epäsopua, voivat vaikuttaa mallin suorituskykyyn todellisessa ympäristössä.

Mitä olivat johtopäätöksiä tästä kokemuksesta?

Kokemukseni DataRobotissa korosti datan esikäsittelyn merkitystä koneoppimisessa. Osoittamalla datan esikäsittelyn haasteita, kuten aikapisteen oikeellisuuden, asiantuntijuuden aukkoja, alan tietämystä, työkalujen rajoituksia ja skaalautuvuutta, voimme parantaa koneoppimismallien tarkkuutta ja luotettavuutta. Päättelin, että datan esikäsittelyprosessin yksinkertaistaminen ja innovatiivisten teknologioiden käyttöönotto olisi avainasemassa tekoälyn lupausten toteuttamisessa.

Kerroimme jo aiemmin haastattelussa Razi Raziuddinista, FeatureByten toisesta perustajasta. Kerro nyt omasi version tapahtumista.

Kun keskustelin havaintojani ja oivalluksiani Razi Raziuddinin kanssa, tajusimme, että meillä oli yhteinen ymmärrys datan esikäsittelyn haasteista koneoppimisessa. Keskustellessamme, jaan Razi minun havaintojani MLOps-yhteisön viimeaikaisista edistysaskelista. Havainnoimme feature-kauppojen ja -alustojen syntymistä, joita tekoälyyn keskittyneet teknologiayritykset ottivat käyttöön vähentämään ominaisuuksien palvelun viivästystä, edistämään ominaisuuksien uudelleenkäyttöä tai yksinkertaistamaan ominaisuuksien materiaalista koulutusdataan samalla varmistamalla koulutuksen ja palvelun yhdenmukaisuuden. Mutta meille oli selvää, että data-tutkijoilla oli edelleen tarve.

Razi ja minä ymmärsimme, että meillä oli mahdollisuus tehdä merkittävä vaikutus radikaalisti yksinkertaistamalla ominaisuuden suunnitteluprosessia ja tarjoamalla data-tutkijoille ja koneoppimisen insinööreille oikeat työkalut ja käyttöliittymä ominaisuuden kokeiluun ja palveluun.

Mitä olivat suurimmat haasteet siirtymässäsi data-tutkijasta yrittäjäksi?

Siirtyminen data-tutkijasta yrittäjäksi vaati minulta laajempaa liiketoimintaa orientoitunutta ajattelutapaa. Vaikka minulla oli vankka perusta ymmärtää kipupisteitä, luoda tiestöjä, toteuttaa suunnitelmia, rakentaa tiimejä ja hallita budjetteja, löysin, että oikean viestin löytäminen, joka todella resonoi kohderyhmämme kanssa, oli yksi suurimmista esteistäni.

Data-tutkijana, päähuomioni oli aina ollut datan analysointi ja tulkinta, jotta voisin johtaa arvokkaita oivalluksia. Mutta yrittäjänä, minun piti kohdistaa ajatteluni markkinoihin, asiakkaisiin ja liiketoimintaan.

Onneksi minulla oli mahdollisuus hyödyntää Razi- perustajani kokemusta.

Razi kertoi meille, miksi ominaisuuden suunnittelu on niin haasteellista. Miten sinä näet tämän?

Ominaisuuden suunnittelussa on kaksi päähaasteita:

  1. Olemassa olevien sarakkeiden muuntaminen: Tämä vaatii datan muuttamista koneoppimisalgoritmeille sopivaan muotoon. Tekniikoita, kuten yksi-kuumaa koodausta, ominaisuus skaalausta ja edistyneitä menetelmiä, kuten teksti- ja kuvanmuunnoksia, käytetään. Uusien ominaisuuksien luominen olemassa olevista ominaisuuksista, kuten vuorovaikutusominaisuuksista, voi parantaa merkittävästi mallin suorituskykyä. Suositut kirjastot, kuten scikit-learn ja Hugging Face, tarjoavat laajaa tukea tällaiselle ominaisuuden suunnittelulle. AutoML-ratkaisut pyrkivät yksinkertaistamaan prosessia.
  2. Uusien sarakkeiden poistaminen historiallisesta datasta: Historiallinen data on äärimmäisen tärkeää ongelmien ratkaisemisessa, kuten suositusjärjestelmissä, markkinoinnissa, petosten havaitsemisessa, vakuutus hinnoittelussa, luottoluokituksessa, kysynnän ennustamisessa ja anturidatakäsittelyssä. Tiedon sisältävien sarakkeiden poistaminen tästä datasta on haasteellista. Esimerkkejä ovat aika viime tapahtumasta, aggregaatiot viimeaikaisista tapahtumista ja upottamiset tapahtumien sarjoista. Tällainen ominaisuuden suunnittelu vaatii alan tietämystä, kokeilua, vahvaa koodaustaitoa ja syvää data-tieteellistä tietämystä. Tekijöitä, kuten aikaviive, suurten tietojoukkojen käsittely ja tehokas koodin suoritus, on myös otettava huomioon.

Yleisesti ottaen, ominaisuuden suunnittelu vaatii asiantuntemusta, kokeilua ja monimutkaisten ad-hoc -dataputkien rakentamista ilman siihen tarkoitettuja työkaluja.

Miten FeatureByte mahdollistaa data-tutkijoiden työn helpottamisen ja ominaisuusputkien yksinkertaistamisen?

FeatureByte mahdollistaa data-tutkijoiden työn helpottamisen yksinkertaistamalla koko ominaisuuden suunnitteluprosessia. Intuitiivisen Python-SDK:n avulla se mahdollistaa nopean ominaisuuden luomisen ja poistamisen XLarge-tapahtuma- ja kohteiden taulukoista. Laskenta käsitellään tehokkaasti hyödyntämällä data-alustojen, kuten Snowflaken, DataBricksin ja Sparkin, skaalautuvuutta. Muistikirjat mahdollistavat kokeilun, kun taas ominaisuuden jakaminen ja uudelleenkäyttö säästävät aikaa. Tarkastus varmistaa ominaisuuden tarkin, kun taas välitön käyttöönotto poistaa putkien hallinnan päänvaivat.

Lisäksi avoimen lähdekoodin kirjastomme tarjoaa kattavan kehyksen AI-toimintojen hallintaan ja järjestämiseen suuressa mittakaavassa, mukaan lukien hallintoprosessit ja käyttöliittymä ominaisuusluettelolle.

Mikä on visiosi FeatureByten tulevaisuudelle?

Visiomme FeatureBytelle on vallankumous data-tieteen ja tekoälyn alalla mahdollistamalla käyttäjien vapauttaminen täyden luovan potentiaalinsa ja saada ennenkokematon arvo heidän data-omaisuuksistaan.

Olemme erityisen innostuneita nopeasta edistymisestä generatiivisessa tekoälyssä ja transformerssä, mikä avaa maailman mahdollisuuksia käyttäjillemme. Lisäksi olemme sitoutuneita demokratisoimaan ominaisuuden suunnittelun. Generatiivinen tekoäly voi alentaa kynnyksen luovalle ominaisuuden suunnittelulle, tehdä sen helpommin saataville laajemmalle yleisölle.

Yhteenvetona, visiomme FeatureByten tulevaisuudelle kiertää jatkuvan innovaation, generatiivisen tekoälyn voiman hyödyntämisen ja ominaisuuden suunnittelun demokratisoinnin. Pyrimme olemaan käyttäjien käyttöön platform, joka mahdollistaa raakadatan muuttamisen toimivaksi syötteeksi tekoälyyn, ajamalla läpi läpimurtoja ja edistystä eri aloilla.

Onko sinulla neuvoja tekoäly-yrittäjille?

Määrittele tilasi, pysy keskittyneenä ja tervetulleeksi uudelleen.

Määrittele tila, jonka haluat omistaa, voit erottautua ja vakiinnuttaa vahvan läsnäolon siinä. Tutki markkinaa, ymmärrä potentiaalisten asiakkaiden tarpeita ja kipupisteitä, ja pyri tarjoamaan yksilöllisen ratkaisun, joka ratkaisee nämä haasteet tehokkaasti.

Määrittele pitkän aikavälin visiosi ja aseta selkeät lyhyen aikavälin tavoitteet, jotka ovat linjassa visiosi kanssa. Keskity vahvan perustan rakentamiseen ja arvon tarjoamiseen valitsemassasi tilassa.

Lopulta, vaikka on tärkeää pysyä keskittyneenä, älä pelkää uuden idean omaksumista määritellyssä tilassasi. Tekoälykenttä kehittyy jatkuvasti, ja innovatiiviset lähestymistavat voivat avata uusia mahdollisuuksia.

Kiitos haastattelusta, lukijat, jotka haluavat oppia lisää, voivat vierailla FeatureBytessä.

Antoine on visionäärisellä johtajalla ja Unite.AI:n perustajakumppani, joka on intohimoisesti omistautunut tulevaisuuden älyteknologian ja robotiikan muotoiluun ja edistämiseen. Sarjayrittäjänä hän uskoo, että älyteknologia tulee olemaan yhtä mullistava yhteiskunnalle kuin sähkö, ja hän on usein innostunut puhumaan älyteknologian ja AGI:n mahdollisuuksista.

Hän on tulevaisuudentutkija, joka on omistautunut tutkimiseen, miten nämä innovaatiot muotoilevat maailmaamme. Lisäksi hän on Securities.io:n perustaja, joka on keskittynyt sijoittamiseen älykkäisiin teknologioihin, jotka määrittelevät tulevaisuutta ja muokkaavat koko toimialoja.