인터뷰
Xavier Conort, FeatureByte의 공동 창립자 및 CPO – 인터뷰 시리즈

Xavier Conort는 25년 이상의 데이터 경험을 가진 비전 있는 데이터 과학자입니다. 그는 보험 산업에서 보험 수리사로 경력을 시작하여 데이터 과학으로 전환했습니다. 그는 최고의 Kaggle 경쟁자이며 DataRobot의 Chief Data Scientist로 일하기 전에 FeatureByte를 공동 창립했습니다.
FeatureByte는 기업의 AI를 확장하기 위해 데이터 과학을 혁신적으로 단순화하고 산업화하는 것을 목표로 합니다. 기능 엔지니어링 및 관리 플랫폼은 데이터 과학자들이 최신 기능과 프로덕션 준비된 데이터 파이프라인을 몇 분 만에 생성하고 공유할 수 있도록 합니다.
보험 산업에서 보험 수리사로 경력을 시작하여 데이터 과학으로 전환한 이유는 무엇인가?
한 가지 결정적인 순간은 GE Flight Quest, GE에서 주최한 25만 달러의 상금을 놓고 참가자가 미국 국내 비행의 지연을 예측해야 하는 경쟁에서 우승한 것이었습니다. 이 성공의 일부는 2단계 모델링이라는 귀중한 보험 관행 덕분입니다. 이 접근 방식은 훈련 데이터에 충분한 표현이 없는 기능에서 편향을 제어하는 데 도움이 됩니다. Kaggle에서 다른 승리와 함께 이 성과는 데이터 과학 분야에서 경쟁적인优势을 제공한다는 것을 확신시켰습니다.
Kaggle에서 저는 또한 Jeremy Achin과 Tom De Godoy를 포함한 다른熱心한 데이터 과학자들과 연결할 수 있는 특권을 가졌습니다. 그들은 나중에 DataRobot의 창립자가 될 것입니다. 우리는 보험 분야의 공통된 배경을 공유하며 Kaggle에서 주목할만한 성공을 거두었습니다. 그들이 DataRobot을 출시했을 때, 저를 Chief Data Scientist로 초대했습니다. 그들의 비전은 보험 산업의 최고의 관행과 기계 학습의 힘을 결합하여 혁신적이고 영향력 있는 것을 창조하는 기회를 제시했습니다.
DataRobot에서 데이터 과학 로드맵을 구축하는 데 중요한 역할을 했습니다. 어떤 데이터 과제를 직면했나요?
우리가 직면한 가장 큰 과제는 우리의 AutoML 솔루션에 입력으로 제공되는 데이터의 품질이 다양했습니다. 이 문제는 종종 우리 팀과 고객 간의 시간이 걸리는 협력이나 적절하게 해결되지 않으면 생산에서 실망스러운 결과로 이어졌습니다. 품질 문제는 우리의 주의를 필요로 하는 여러 출처에서 발생했습니다.
한 가지 주요 과제는 비즈니스 인텔리전스 도구를 사용하여 데이터 준비와 관리하는 것이었습니다. 이러한 도구는 통찰력을 생성하는 데 유용하지만 기계 학습 데이터 준비를 위해 필요한 기능을 제공하지 못합니다. 결과적으로 훈련 데이터에 누출이 발생하여 과적합과 모델 성능의 불일치로 이어질 수 있습니다.
데이터 과학자와 데이터 엔지니어 간의 의사소통 불일치는 생산 단계에서 모델의 정확도를影响하는 또 다른 과제였습니다. 훈련과 생산 단계 간의 불일치는 두 팀 간의 불일치로 인해 실제 환경에서 모델 성능에 영향을 미칠 수 있습니다.
이 경험에서 어떤 주요 교훈을 얻었나요?
DataRobot에서 얻은 경험은 기계 학습에서 데이터 준비의 중요성을 강조했습니다. 모델 훈련 데이터 생성의 과제를 해결함으로써, 즉 시점 정확성, 전문가 격차, 도메인 지식, 도구 제한, 확장성 등, 우리는 기계 학습 모델의 정확성과 신뢰성을 향상시킬 수 있습니다. 데이터 준비 과정을 간소화하고 혁신적인 기술을 도입하면 AI의 전체 잠재력을 해방하고 약속을 지킬 수 있을 것입니다.
우리는 또한 FeatureByte의 공동 창립자 Razi Raziuddin으로부터 FeatureByte의 기원 이야기를 들었습니다. 여러분의 버전은 무엇인가?
저는 제 관찰과 통찰을 Razi Raziuddin과 공유했을 때, 우리는 데이터 과학에서 데이터 준비의 과제를 공유한다는 것을 깨달았습니다. 저는 MLOps 커뮤니티의 최근 발전에 대해 Razi와 обсужд했습니다. 기능 저장소와 기능 플랫폼의 출현을 관찰할 수 있었는데, 이는 AI-최초 기술 회사에서 기능 제공의 지연을 줄이고 기능 재사용을 장려하거나 기능 물화화를 훈련 데이터로簡化하기 위해 구축된 것입니다. 그러나 데이터 과학자들의 요구를 충족하는 데 여전히 격차가 존재한다는 것이 명백했습니다.
나와 Razi는 기능 엔지니어링 과정을 혁신적으로 단순화하고 데이터 과학자와 ML 엔지니어에게 무결한 기능 실험과 기능 제공을 위한 올바른 도구와 사용자 경험을 제공할 수 있는 기회를 가졌습니다.
데이터 과학자에서 기업가로 전환하는 데 가장 큰 과제는 무엇인가?
데이터 과학자에서 기업가로 전환하는 것은 기술적인 관점에서 비즈니스 지향적인 관점으로의 전환을 필요로 했습니다. 비즈니스에 대한 통찰력을 제공하고, 로드맵을 구축하고, 계획을 실행하고, 팀을 구축하고, 예산을 관리하는 데 강한 기반을 가지고 있지만, 우리의 타겟 오디언스와 진정으로 공鳴하는 올바른 메시지를 제작하는 것이 저의 가장 큰 장애물이었습니다.
幸い, 저는 Razi와 같은 사람의 경험을 활용할 수 있었습니다.
우리는 Razi로부터 기능 엔지니어링이 왜 어려운지에 대해 들었습니다. 여러분의 관점에서 기능 엔지니어링이 어려운 이유는 무엇인가?
기능 엔지니어링에는 두 가지 주요 과제가 있습니다:
- 기존 열을 변환하는 것: 이것은 기계 학습 알고리즘에 적합한 형식으로 데이터를 변환하는 것을 포함합니다. 원-핫 인코딩, 기능 스케일링, 텍스트 및 이미지 변환과 같은 고급 방법을 사용합니다. 기존 기능에서 새로운 기능을 생성하여 모델 성능을 크게 향상시킬 수 있습니다. scikit-learn 및 Hugging Face와 같은 라이브러리는 이러한 유형의 기능 엔지니어링을 위한 광범위한 지원을 제공합니다. AutoML 솔루션은 또한 이 과정을 간소화하려고 합니다.
- 역사적 데이터에서 새로운 열을 추출하는 것: 역사적 데이터는 추천 시스템, 마케팅, 사기 탐지, 보험 가격, 신용 평가, 수요 예측, 센서 데이터 처리와 같은 문제 도메인에서 중요합니다. 이러한 데이터에서 정보를 추출하는 것은 어려운 일입니다. 예를 들어, 마지막 이벤트 이후의 시간, 최근 이벤트에 대한 집계, 이벤트 시퀀스에서 임베딩이 포함됩니다. 이 유형의 기능 엔지니어링은 도메인 전문 지식, 실험, 강한 코딩 및 데이터 엔지니어링 기술, 심층적인 데이터 과학 지식이 필요합니다. 시간 누출, 대규모 데이터 세트 처리, 효율적인 코드 실행과 같은 요인도 고려해야 합니다.
전반적으로, 기능 엔지니어링은 전문 지식, 실험, 복잡한 임시 데이터 파이프라인의 구축을 필요로 하는데, 이러한 작업을 위해 특별히 설계된 도구가 없습니다.
FeatureByte가 데이터 과학 전문가를 어떻게 강화하고 기능 파이프라인을 단순화하는지 설명해 주시겠습니까?
FeatureByte는 기능 엔지니어링의 전체 과정을 단순화함으로써 데이터 과학 전문가를 강화합니다. 직관적인 Python SDK를 통해 기능을 빠르게 생성하고 추출할 수 있습니다. 대형 이벤트 및 항목 테이블에서 계산은 Snowflake, DataBricks, Spark와 같은 데이터 플랫폼의 확장성을 활용하여 효율적으로 처리됩니다. 노트북은 실험을 용이하게 하며, 기능 공유와 재사용은 시간을 절약합니다. 감사는 기능 정확성을 보장하며, 즉시 배포는 파이프라인 관리의 고민을 없앱니다.
오픈 소스 라이브러리가 제공하는 기능 외에, 우리의 엔터프라이즈 솔루션은 규정 워크플로우와 기능 카탈로그를 위한 사용자 인터페이스를 포함하여 규모에 따라 AI 작업을 관리하고 조직하는ための 포괄적인 프레임워크를 제공합니다.
FeatureByte의 미래에 대한 비전은 무엇인가?
FeatureByte의 궁극적인 비전은 데이터 과학과 기계 학습 분야를 혁신하여 사용자가 데이터 자산에서 이전에 예상치 못한 가치를 추출하고 창의적인 잠재력을 해방하는 것입니다.
우리는 특히 생성적 AI와 트랜스포머의 빠른 발전에 대해 매우 흥奮합니다. 이것은 우리 사용자에게 새로운 가능성을 열어줍니다. 또한, 우리는 기능 엔지니어링을 민주화하는 데 헌신하고 있습니다. 생성적 AI는 기능 엔지니어링의 진입 장벽을 낮추어 보다广い 대중에게 더 쉽게 접근할 수 있도록 할 수 있습니다.
요약하면, FeatureByte의 미래에 대한 비전은 지속적인 혁신, 생성적 AI의 힘을 활용하고, 기능 엔지니어링을 민주화하는 데 있습니다. 우리는 데이터 전문가가 원시 데이터를 기계 학습을 위한 작동 가능한 입력으로 변환할 수 있도록 해주는 플랫폼이 되기를 목표로 합니다. 이를 통해 다양한 산업에서 획기적이고 발전된 성과를 달성할 수 있습니다.
추가적인 조언이나 메시지가 있으면 부탁드립니다.
자신의 공간을 정의하고, 집중하고, 새로운 아이디어를 환영하십시오.
자신의 공간을 정의함으로써, 자신을 차별화하고 해당 분야에서 강한 존재감을 확립할 수 있습니다. 시장에 대한 연구를 수행하고, 잠재적인 고객의 필요와 고통을 이해하고, 효과적으로 해결하는 고유한 솔루션을 제공하려고 노력하십시오.
장기적인 비전을 정의하고, 그 비전과 일치하는 명확한 단기 목표를 설정하십시오. 강한 기반을 구축하고, 선택한 공간에서 가치를 제공하는 데 집중하십시오.
마지막으로, 집중하는 것이 중요하지만, 자신이 정의한 공간 내에서 새로운 아이디어를 탐색하고, 혁신적인 접근 방식을 받아들이는 것을 주저하지 마십시오. AI 분야는 끊임없이 발전하고 있으며, 혁신적인 접근 방식은 새로운 기회를 열어줄 수 있습니다.
감사합니다. 더 많은 정보를 원하는 독자는 FeatureByte를 방문하십시오.












