Rozhovory
Xavier Conort, spoluzakladatel a CPO FeatureByte – Interview Series

Xavier Conort je vizionářský datový vědec s více než 25 lety zkušeností s daty. Začal svou kariéru jako aktuár v pojišťovacím průmyslu, než přešel do datové vědy. Je špičkovým soutěžícím na Kaggle a byl hlavním datovým vědcem v DataRobot, než se stal spoluzakladatelem FeatureByte.
FeatureByte má za cíl škálovat podnikový AI tím, že radikálně zjednoduší a industrializuje AI data. Platforma pro feature engineering a management umožňuje datovým vědcům vytvářet a sdílet špičkové funkce a připravené datové potrubí v minutách – místo týdnů nebo měsíců.
Začali jste svou kariéru jako aktuár v pojišťovacím průmyslu, než jste přešli do datové vědy, co způsobilo tuto změnu?
Definujícím okamžikem byla výhra v soutěži GE Flight Quest, kde účastníci museli předpovědět zpoždění domácích letů v USA. Částečně jsem této výhry dosáhl díky cenné praxi v pojišťovnictví: dvoufázovému modelování. Tento přístup pomáhá kontrolovat zkreslení ve funkcích, které postrádají dostatečné zastoupení v dostupných trénovacích datech. Kromě dalších výher na Kaggle mě tato výhra přesvědčila, že má mou aktuarální zkušenost竞etivní výhodu v oblasti datové vědy.
Během své cesty na Kaggle jsem také měl možnost spojit se s dalšími nadšenci pro datovou vědu, včetně Jeremyho Achina a Toma De Godoye, kteří později založili DataRobot. Sdíleli jsme společný背景 v pojišťovnictví a dosáhli jsme pozoruhodných úspěchů na Kaggle. Když nakonec spustili DataRobot, společnost specializující se na AutoML, pozvali mě, abych se k nim připojil jako hlavní datový vědec. Jejich vize spojení nejlepších praktik z pojišťovnictví s mocí strojového učení mě nadchla, protože to představovalo příležitost vytvořit něco inovativního a významného.
V DataRobot jste byliinstrumentální při budování jejich roadmapy datové vědy. Jaké datové výzvy jste čelili?
Největší výzvou, které jsme čelili, byla proměnlivá kvalita dat, která byla poskytována jako vstup do našeho AutoML řešení. Tento problém často vedl k časově náročné spolupráci mezi našim týmem a klienty nebo k zklamáním výsledků v produkci, pokud nebyla tato otázka řešena vhodně. Problémy s kvalitou dat pocházely z více zdrojů, které vyžadovaly naši pozornost.
Jednou z hlavních výzev byla obecná používání nástrojů pro obchodní inteligenci pro přípravu a správu dat. Zatímco tyto nástroje jsou cenné pro generování přehledů, postrádají schopnosti, které jsou nezbytné pro zajištění bodové správnosti pro přípravu dat pro strojové učení. V důsledku toho mohlo dojít ke únikům v trénovacích datech, což vedlo k přeučení a nesprávnému výkonu modelu.
Jaké byly některé z hlavních poznatků z této zkušenosti?
Má zkušenost v DataRobot upozornila na význam příprav dat pro strojové učení. Rešením problémů s přípravou dat pro strojové učení, jako je bodová správnost, mezery v odborných znalostech, doménové znalosti, omezení nástrojů a škálovatelnost, můžeme zlepšit přesnost a spolehlivost modelů strojového učení. Došel jsem k závěru, že zjednodušení procesu přípravy dat a začlenění inovativních technologií budeinstrumentální při odemknutí plného potenciálu AI a splnění jeho slibů.
Také jsme slyšeli od vašeho spoluzakladatele Razi Raziuddina o původu FeatureByte, mohli byste nám říci svou verzi událostí?
Když jsem diskutoval o svých pozorováních a poznatcích s mým spoluzakladatelem Razi Raziuddinem, uvědomili jsme si, že sdílíme společné pochopení problémů v přípravě dat pro strojové učení. Během našich diskusí jsem sdílel s Razim své poznatky o nedávných pokrocích v komunitě MLOps. Mohl jsem pozorovat vznik funkcionalit a funkcionalit, které AI-first technologie zavedly, aby snížily latenci funkcionalit, povzbudily funkci opětovného použití nebo zjednodušily funkcionalitu do trénovacích dat, zatímco zajišťovaly konzistenci trénování a služby. Nicméně, bylo zřejmé, že stále existuje mezera ve splnění potřeb datových vědců. Razi sdílel se mnou své poznatky o tom, jak moderní datový sklad revolucionizoval obchodní inteligenci a analytiku, ale není plně využíván pro AI.
Jaké byly některé z vašich největších výzev při přechodu z datové vědy na podnikání?
Přechod z datové vědy na podnikání vyžadoval, abych změnil svůj pohled z technického na širší obchodní orientovaný. Zatímco jsem měl silný základ pro pochopení bolestivých míst, vytváření roadmap, provádění plánů, budování týmu a správu rozpočtů, zjistil jsem, že vytváření správného sdělení, které skutečně rezonuje s našimi cílovými uživateli, bylo jednou z mých největších překážek.
Slyšeli jsme od Raziho o tom, proč je feature engineering tak obtížný, z vašeho pohledu, co ho činí tak náročným?
Feature engineering má dvě hlavní výzvy:
- Přeměna existujících sloupců: To zahrnuje převod dat do vhodného formátu pro algoritmy strojového učení. Používají se techniky, jako je one-hot encoding, feature scaling a pokročilé metody, jako je transformace textu a obrázků. Vytvoření nových funkcí z existujících, jako jsou interakční funkce, může výrazně zlepšit výkon modelu. Populární knihovny, jako je scikit-learn a Hugging Face, poskytují rozsáhlou podporu pro tento typ feature engineeringu. Řešení AutoML také usilují o zjednodušení tohoto procesu.
- Extrahování nových sloupců z historických dat: Historická data jsou zásadní v problémech, jako jsou systémy doporučení, marketing, detekce podvodů, pojištění, úvěrové skóre, předpověď poptávky a zpracování dat ze senzorů. Extrahování informativních sloupců z těchto dat je náročné. Příklady zahrnují dobu od posledního události, agregace nad nedávnými událostmi a vložené hodnoty z posloupností událostí. Tento typ feature engineeringu vyžaduje odborné znalosti, experimentování, silné kodovací a datové inženýrské dovednosti a hluboké znalosti datové vědy. Faktory, jako je únik času, zpracování velkých dat a efektivní výkon kódu, také vyžadují pozornost.
Celkově feature engineering vyžaduje odborné znalosti, experimentování a konstrukci komplexních ad-hoc datových potrubí v nepřítomnosti nástrojů speciálně navržených pro něj.
Můžete sdílet, jak FeatureByte posiluje profesionály v oblasti datové vědy, zatímco zjednodušuje funkční potrubí?
FeatureByte posiluje profesionály v oblasti datové vědy tím, že zjednodušuje celý proces feature engineeringu. S intuitivním Python SDK umožňuje rychlé vytváření a extrahování funkcí z XLarge Event a Item Tables. Výpočet je efektivně zpracován pomocí škálovatelnosti datových platforem, jako jsou Snowflake, DataBricks a Spark. Poznámky usnadňují experimentování, zatímco sdílení a opětovné použití funkcí šetří čas. Auditing zajišťuje přesnost funkcí, zatímco okamžitá nasazení eliminuje potíže s řízením potrubí.
Jaký je váš výhled do budoucna pro FeatureByte?
Náš konečný výhled pro FeatureByte je revolucionalizovat oblast datové vědy a strojového učení tím, že uživatelům umožní využít svůj plný tvůrčí potenciál a získat bezprecedentní hodnotu z jejich datových aktiv.
Máte nějaké rady pro ambiciózní AI podnikatele?
Definujte svůj prostor, zůstaňte soustředění a vítají novinky.
Děkuji za skvělý rozhovor, čtenáři, kteří si chtějí dozvědět více, by měli navštívit FeatureByte.












