مقابلات
كزافييه كونورت، المؤسس المشارك و رئيس قسم المنتجات في FeatureByte – سلسلة المقابلات

كزافييه كونورت هو عالم بيانات رؤية مع أكثر من 25 عامًا من خبرة في مجال البيانات. بدأ مسيرته المهنية كمتخصص في التأمين قبل أن ينتقل إلى مجال العلوم البياناتية. وهو من بين أفضل المنافسين في منصة كاغل و شغل منصب رئيس قسم العلوم البياناتية في شركة DataRobot قبل أن يصبح مؤسسًا مشاركًا لشركة FeatureByte.
FeatureByte تهدف إلى توسيع نطاق تطبيقات الذكاء الاصطناعي في الشركات من خلال تبسيط وتحويل عملية إعداد البيانات اللازمة للذكاء الاصطناعي. منصة FeatureByte تتيح للمختصين في علوم البيانات إنشاء ومشاركة الميزات المتقدمة وخطوط أنابيب البيانات الجاهزة للانتاج في دقائق بدلاً من الأسابيع أو الأشهر.
كيف بدأت مسيرتك المهنية كمتخصص في التأمين قبل أن تنتقل إلى علوم البيانات؟
كان هناك لحظة محورية هي فوزي في مسابقة GE Flight Quest، وهي مسابقة نظمتها شركة GE مع جائزة قدرها 250 ألف دولار، حيث كان على المشاركين توقع تأخيرات الرحلات الجوية المحلية في الولايات المتحدة. أعتقد أن جزءًا من هذا النجاح يعود إلى ممارسة قيمة في مجال التأمين: نموذج المراحل الثلاث. هذا النهج يساعد في التحكم في الانحياز في الميزات التي تفتقر إلى التمثيل الكافي في البيانات المتاحة للتدريب. إلى جانب الانتصارات الأخرى على منصة كاغل، أقنعتني هذه الإنجازات بأن خلفيتي في التأمين أمنحتني ميزة تنافسية في مجال علوم البيانات.
خلال رحلتي على منصة كاغل، كان لي شرف التواصل مع علماء بيانات متحمسين آخرين، بما في ذلك جيريمي أتشين وتوم دي جودوي، الذين أصبحوا فيما بعد مؤسسين لشركة DataRobot. كنا نمتلك خلفية مشتركة في مجال التأمين ونجاحات ملحوظة على منصة كاغل. عندما أطلقوا فيما بعد شركة DataRobot، وهي شركة متخصصة في تكنولوجيا الذكاء الاصطناعي الآلي، دعوني للانضمام إليهم كchief data scientist. رؤيتهم لدمج أفضل الممارسات من صناعة التأمين مع قوة الذكاء الاصطناعي ألهمتني، حيث رأيت فرصة لخلق شيء جديد ومؤثر.
ما كانت بعض التحديات التي واجهتها في بناء خارطة علوم البيانات في شركة DataRobot؟
كان التحدي الأكبر الذي واجهناه هو جودة البيانات المختلفة التي تم توفيرها كمدخلات لsolution AutoML الخاصة بنا. هذا القضية غالبًا ما أدت إلى تعاون مطول بين فريقنا و عملائنا أو نتائج مخيبة للآمال في الإنتاج إذا لم تتم معالجتها بشكل مناسب. كانت مشاكل الجودة ناتجة عن مصادر متعددة التي تتطلب انتباهنا.
كان أحد التحديات الرئيسية ينتج عن استخدام أدوات ذكاء الأعمال لتحضير و إدارة البيانات. في حين أن هذه الأدوات قيمة لإنشاء رؤى، فإنها تفتقر إلى القدرات اللازمة لضمان صحة البيانات في الوقت المناسب لتحضير بيانات الذكاء الاصطناعي. أدت هذه المشكلة إلى حدوث تسربات في بيانات التدريب، مما أدى إلى تعلم زائد و أداء غير دقيق للنموذج.
كانت سوء الفهم بين علماء البيانات و مهندسي البيانات تحديًا آخر ảnh hưởng على دقة النماذج خلال مرحلة الإنتاج. كانت هناك اختلافات بين مراحل التدريب و الإنتاج، ناتجة عن عدم التزام بين هذين الفريقين، مما يمكن أن يؤثر على أداء النموذج في بيئة حقيقية.
ما كانت بعض النتائج المهمة من هذه التجربة؟
أظهر لي تجربتي في شركة DataRobot أهمية تحضير البيانات في الذكاء الاصطناعي. من خلال معالجة تحديات توليد بيانات التدريب، مثل دقة الوقت، و فجوات الخبرة، و المعرفة بال领域، و قيود الأدوات، و القدرة على التوسع، يمكننا تعزيز دقة و موثوقية نماذج الذكاء الاصطناعي. توصلت إلى استنتاج مفاده أن تبسيط عملية تحضير البيانات و دمج التكنولوجيا الجديدة سيكون حاسمًا في解 锁 كامل إمكانات الذكاء الاصطناعي و تحقيق وعوداته.
كما سمعنا من مؤسسك المشارك رازي رازيو الدين عن قصة نشأة FeatureByte، هل يمكن أن تحكي لنا versiónك من الأحداث؟
عندما ناقشت ملاحظاتي و رؤيتي مع رازي، أدركنا أننا نشترك فهمًا مشتركًا للتحديات في تحضير البيانات للذكاء الاصطناعي. خلال مناقشاتنا، شاركت مع رازي رؤيتي حول التطورات الحديثة في مجتمع MLOps. لاحظت ظهور مخازن الميزات و منصات الميزات التي تضعها شركات الذكاء الاصطناعي الأولى لخفض زمن وصول الميزات، و تشجيع إعادة استخدام الميزات، و تبسيط إنشاء الميزات في بيانات التدريب مع ضمان الاتساق بين التدريب و الخدمة. ومع ذلك، كان واضحًا لنا أن هناك masih فجوة في تلبية احتياجات علماء البيانات.
أصبح واضحًا لنا أننا لدينا فرصة لتحقيق تأثير كبير من خلال تبسيط عملية هندسة الميزات و توفير أدوات و تجربة مستخدم phù hợpة ل科学ي البيانات و مهندسي الذكاء الاصطناعي لاختبار الميزات و تقديمها بسهولة.
ما كانت بعض أكبر التحديات التي واجهتها في الانتقال من عالم العلوم البياناتية إلى ريادة الأعمال؟
تطلب مني الانتقال من عالم العلوم البياناتية إلى ريادة الأعمال تغييرًا من منظور تقني إلى منظور أوسع يركز على الأعمال. على الرغم من أنني كان لديّ أساس قوي في فهم النقاط العريضة، و إنشاء خارطة طريق، و تنفيذ خطط، و بناء فريق، و إدارة الميزانيات، وجدت أن صياغة الرسالة الصحيحة التي تتوافق حقًا مع جمهورنا المستهدف كانت واحدة من أكبر عقباتي.
كعالم بيانات، كان تركيزي الرئيسي دائمًا على تحليل و تفسير البيانات لاستخراج رؤى قيمة. ومع ذلك، كريادي أعمال، كنت بحاجة إلى توجيه تفكيري نحو السوق، و العملاء، و الأعمال بشكل عام.
幸运ًا، تمكنت من التغلب على هذا التحدي بالاستفادة من خبرة شخص مثل رازي، مؤسسي المشارك.
سمعنا من رازي عن سبب صعوبة هندسة الميزات، ما رأيك في هذا الموضوع؟
توجد تحديان رئيسيان في هندسة الميزات:
- تحويل الأعمدة الحالية: يتضمن ذلك تحويل البيانات إلى صيغة مناسبة لخوارزميات الذكاء الاصطناعي. يتم استخدام تقنيات مثل التشفير بالاختيار، و معايرة الميزات، و طرق متقدمة مثل تحويلات النص و الصور. يمكن إنشاء ميزات جديدة من الميزات الحالية، مثل ميزات التفاعل، و التي يمكن أن تحسن أداء النموذج بشكل كبير. توفر المكتبات الشهيرة مثل scikit-learn و Hugging Face دعمًا واسعًا لهذا النوع من هندسة الميزات. تهدف حلول AutoML إلى تبسيط العملية أيضًا.
- استخراج أعمدة جديدة من البيانات التاريخية: البيانات التاريخية حاسمة في مجالات مثل أنظمة التوصية، و التسويق، و الكشف عن الاحتيال، و تسعير التأمين، و تقييم الائتمان، و التنبؤ بالطلب، و معالجة بيانات الحس. استخراج أعمدة معلوماتية من هذه البيانات هو تحدي. الأمثلة تشمل الوقت منذ الحدث الأخير، و التجميع على أحداث最近، و التضمين من تسلسلات الأحداث. يتطلب هذا النوع من هندسة الميزات خبرة في المجال، و تجربة، و مهارات قوية في البرمجة و هندسة البيانات، و معرفة عميقة بعلوم البيانات. يجب أيضًا考虑 عوامل مثل تسرب الوقت، و التعامل مع مجموعات بيانات كبيرة، و تنفيذ الكود بفعالية.
بشكل عام، تتطلب هندسة الميزات خبرة، و تجربة، و بناء أنابيب بيانات معقدة و محددة في غياب أدوات مصممة خصيصًا لها.
كيف تمكن FeatureByte من تمكين أخصائيي علوم البيانات و تبسيط خطوط أنابيب الميزات؟
تمكن FeatureByte من تمكين أخصائيي علوم البيانات من خلال تبسيط عملية هندسة الميزات. مع واجهة برمجة تطبيقات Python البسيطة، يُمكن إنشاء الميزات بسرعة و استخراجها من جداول الأحداث و العناصر الكبيرة. يتم التعامل مع الحساب بفعالية من خلال الاستفادة من قابلية توسيع منصات البيانات مثل Snowflake، و DataBricks، و Spark. تسهل المذكرات التجربة، في حين أن مشاركة الميزات و إعادة استخدامها توفر الوقت. و يضمن التدقيق دقة الميزات، في حين أن النشر الفوري يلغي مشاكل إدارة الأنابيب.
إلى جانب هذه القدرات التي تقدمها مكتبتنا المفتوحة المصدر، تقدم حلنا المؤسسي إطارًا شاملاً لإدارة و تنظيم عمليات الذكاء الاصطناعي على نطاق واسع، بما في ذلك سير عمل الحوكمة و واجهة مستخدم لكتالوج الميزات.
ما هو رؤيتك للمستقبل في FeatureByte؟
رؤيتنا النهائية لشركة FeatureByte هي ثورة مجال علوم البيانات و الذكاء الاصطناعي من خلال تمكين المستخدمين من إطلاق إمكانياتهم الإبداعية الكاملة و استخراج قيمة غير مسبوقة من أصول البيانات الخاصة بهم.
نحن متحمسون بشكل خاص للتقدم السريع في الذكاء الاصطناعي التوليدي و تحويلاتها، التي تفتح عالمًا من الإمكانيات لمستخدمينا. بالإضافة إلى ذلك، نحن ملتزمون بدمقرطة هندسة الميزات. الذكاء الاصطناعي التوليدي له القدرة على خفض حاجز الدخول للهندسة المبدعة للميزات، مما يجعلها أكثر سهولة لجمهور أوسع.
باختصار، تركز رؤيتنا للمستقبل على الابتكار المستمر، و استغلال قوة الذكاء الاصطناعي التوليدي، و دمقرطة هندسة الميزات. نهدف إلى أن نصبح المنصة الأساسية التي تمكن أخصائيي البيانات من تحويل البيانات الخام إلى مدخلات قابلة للعمل للذكاء الاصطناعي، مما يدفع التطورات و التقدم في جميع القطاعات.
هل لديك أي نصائح لأصحاب المشاريع الناشئة في مجال الذكاء الاصطناعي؟
حدد مساحة عملك، و ابق متocused، و استقبل الابتكار.
من خلال تحديد المساحة التي تريد أن تملكها، يمكنك التميز عن نفسك و إنشاء وجود قوي في ذلك المجال. أبحث عن السوق، و افهم احتياجات و نقاط الألم المحتملة للعملاء، و اسعَ لتقديم حل فريد يعالج تلك التحديات بشكل فعال.
حدد رؤيتك على المدى الطويل، و ضع أهداف قصيرة المدى واضحة تتوافق مع تلك الرؤية. ركز على بناء أساس قوي و تقديم قيمة في مساحة عملك.
أخيرًا، و مع أن من المهم البقاء مركزًا، لا تتردد في استقبال الابتكار و استكشاف أفكار جديدة في مساحة عملك. مجال الذكاء الاصطناعي يتطور باستمرار، و يمكن أن تفتح النهج المبتكرة فرصًا جديدة.
شكرًا على المقابلة الرائعة، و يرجى زيارة FeatureByte لمعرفة المزيد.












