مقابلات

أنايس دوتيس-جورجيو، مدافع عن المطورين في InfluxData – سلسلة المقابلات

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

أنايس دوتيس-جورجيو هي مدافع عن المطورين في InfluxData مع شغف بالجعل البيانات جميلة باستخدام تحليل البيانات والذكاء الاصطناعي وتعلم الآلة. وهي تأخذ البيانات التي تجمعها وتقوم بمزيج من البحث والاستكشاف والهندسة لترجمة البيانات إلى شيء ذي وظيفة وقيمة وجمال. عندما لا تكون خلف الشاشة، يمكنك العثور عليها خارجًا ترسم وتمدد وتتزلج أو تلاحق كرة القدم.

InfluxData هي الشركة التي تبني InfluxDB، قاعدة البيانات المفتوحة للمسلسلات الزمنية التي يستخدمها أكثر من مليون مطور حول العالم. مهمتهم هي مساعدة المطورين على بناء أنظمة ذكية ووقت حقيقي باستخدام بياناتهم الزمنية.

يمكنك مشاركة قصة رحلتك من كونك مساعد بحث إلى أن أصبحت مدافعًا رئيسيًا عن المطورين في InfluxData؟ كيف ساهم خلفيتك في تحليل البيانات وتعلم الآلة في دورك الحالي؟

حصلت على شهادة البكالوريوس في الهندسة الكيميائية مع تركيز على الهندسة الحيوية ودرست في المختبرات التي تقوم بتطوير اللقاحات واكتشاف التوحد قبل الولادة. ثم بدأت في برمجة الروبوتات التي تتعامل مع السوائل ومساعدة علماء البيانات على فهم المعايير لاكتشاف الشذوذ، مما جعلني أكثر اهتمامًا بالبرمجة.

ثم أصبحت ممثلًا لتنمية المبيعات في Oracle (ORCL ) ودركت أنني بحاجة إلى التركيز على البرمجة. درست دورة برمجة في جامعة تكساس في تحليل البيانات وتمكنت من دخول مجال التكنولوجيا، خاصة علاقات المطورين.

جئت من خلفية تقنية، لذلك ساعد ذلك في تشكيل دوري الحالي. على الرغم من أنني لم أكن لديها خبرة في التطوير، إلا أنني يمكنني أن أتعلق وأتعاطف مع الأشخاص الذين لديهم خلفية هندسية وذكاء اصطناعي يحاولون تعلم البرمجيات. لذلك، عندما قمت بإنشاء محتوى أو دروس تقنية، تمكنت من مساعدة المستخدمين الجدد على التغلب على التحديات التقنية مع وضع المحادثة في سياق ذي صلة ومثير لهم.

يبدو أن عملك يجمع بين الإبداع والخبرة التقنية. كيف تدمج شغفك بجعل البيانات “جميلة” في عملك اليومي في InfluxData؟

في الآونة الأخيرة، ركزت أكثر على هندسة البيانات من تحليل البيانات. على الرغم من أنني لا أركّز على تحليل البيانات كما كنت أفعل في السابق، إلا أنني ما زلت أستمتع بالرياضيات – أعتقد أن الرياضيات جميلة، وسأقفز على فرصة لشرح الرياضيات وراء الخوارزمية.

InfluxDB كان ركنًا أساسيًا في مجال البيانات الزمنية. كيف ترى تأثير المجتمع المفتوح على تطوير وتطور InfluxDB؟

InfluxData ملتزمة ببناء البنية المفتوحة لمجتمع Apache. في العام الماضي، أعلنا عن InfluxDB 3.0، النواة الجديدة ل InfluxDB مكتوبة بلغة Rust ومتوافقة مع Apache Flight و DataFusion و Arrow و Parquet – ما نسميه مجموعة FDAP. مع استمرار مهندسي InfluxData في المساهمة في هذه المشاريع المفتوحة، يستمر المجتمع في النمو، وتزداد مجموعة مشاريع Apache Arrow سهولة الاستخدام وميزاتها ووظائفها، وتوسع توافقها.

ما هي بعض المشاريع أو المساهمات المفتوحة الأكثر إثارة للاهتمام التي رأيتها مؤخرًا في سياق البيانات الزمنية والذكاء الاصطناعي؟

من المثير أن نرى إضافة نماذج LLMs التي تم إعادة توجيهها أو تطبيقها على البيانات الزمنية للتنبؤات بدون تدريب. Autolab لديها مجموعة من نماذج اللغة المفتوحة للبيانات الزمنية، و TimeGPT هو مثال آخر رائع.

بالإضافة إلى ذلك، هناك مكتبات معالجة تدفق مفتوحة مثل Bytewax و Mage.ai التي تسمح للمستخدمين بالاستفادة من دمج النماذج من Hugging Face، وهي مثيرة للاهتمام.

كيف تضمن InfluxData أن مبادراتها المفتوحة تبقى ذا صلة وفائدة للمجتمع المطور، خاصة مع التطورات السريعة في الذكاء الاصطناعي وتعلم الآلة؟

مبادرات InfluxData تبقى ذا صلة وفائدة من خلال التركيز على المساهمة في المشاريع المفتوحة التي تستفيد منها الشركات المخصصة للذكاء الاصطناعي. على سبيل المثال، كل مرة تساهم فيها InfluxDB في Apache Arrow أو Parquet أو DataFusion، فإنها تفيد كل شركة تقنية أخرى تستخدمها، بما في ذلك Apache Spark و DataBricks و Rapids.ai و Snowflake و BigQuery و HuggingFace وغيرها.

النماذج اللغوية الزمنية تصبح أكثر أهمية في التحليلات التنبؤية. هل يمكنك توضيح كيف تتطور هذه النماذج في التنبؤ بالبيانات الزمنية واكتشاف الشذوذ؟

النماذج اللغوية الزمنية تتفوق على النماذج الخطية والإحصائية وتوفر التنبؤ بدون تدريب. هذا يعني أنك لا تحتاج إلى تدريب النموذج على بياناتك قبل استخدامها. كما لا تحتاج إلى ضبط نموذج إحصائي، الذي يتطلب خبرة عميقة في إحصاءات البيانات الزمنية.

然而، على عكس معالجة اللغة الطبيعية، فإن مجال البيانات الزمنية يفتقر إلى مجموعات بيانات كبيرة ومفتوحة الوصول. معظم النماذج المسبقة للبيانات الزمنية يتم تدريبها على عينات صغيرة الحجم، تحتوي على بضع آلاف أو ربما مئات العينات فقط. على الرغم من أن مجموعات البيانات هذه كانت أداة في تقدم مجتمع البيانات الزمنية، إلا أن حجم العينة المحدود وعدم العمومية يطرح تحديات لتدريب نماذج تعلم الآلة العميقة.

هذا ما أعتقد أنه يجعل النماذج اللغوية الزمنية المفتوحة صعبة العثور عليها. تم تدريب نماذج مثل TimesFM من Google (GOOGL ) و Tiny Time Mixers من IBM على مجموعات بيانات ضخمة تحتوي على مئات المليارات من النقاط البيانية. مع TimesFM، على سبيل المثال، يتم إجراء عملية التدريب المسبق باستخدام Google Cloud TPU v3-256، الذي يتكون من 256 نواة TPU وإجمالي 2 تيرابايت من الذاكرة. تستغرق عملية التدريب المسبق حوالي عشرة أيام وتنتج نموذجًا يحتوي على 1.2 مليار معامل. ثم يتم ضبط النموذج المسبق على مهام ومجموعات بيانات محددة باستخدام معدل تعلم أقل وعدد أقل من الحقبات.

من المحتمل أن هذه التحولات تعني أن المزيد من الناس يمكنهم إجراء تنبؤات دقيقة بدون معرفة عميقة بالمجال. ومع ذلك، يتطلب الأمر الكثير من العمل لتحديد موازنة بين الفوائد والتكاليف لاستخدام نماذج حسابية مكلفة مثل النماذج اللغوية الزمنية من الناحية المالية والبيئية.

توجد في منشور مدونة Hugging Face مثال آخر رائع للتنبؤ بالبيانات الزمنية.

ما هي المزايا الرئيسية لاستخدام النماذج اللغوية الزمنية على الطرق التقليدية، خاصة فيما يتعلق بمعالجة الأنماط المعقدة والأداء بدون تدريب؟

الميزة الحاسمة هي عدم الحاجة إلى تدريب وإعادة تدريب نموذج على بياناتك الزمنية. هذا يلغي مشكلة التعلم المباشر لمراقبة انحراف النموذج وإعادة تدريبه، مما يلغي تعقيد خط أنابيب التنبؤ.

كما لا تحتاج إلى النضال من أجل تقدير الارتباطات بين السلاسل أو العلاقات لموديلات إحصائية متعددة المتغيرات. thường يضيف التباين الناتج عن التقديرات ضررًا للتنبؤات الناتجة ويمكن أن يسبب نموذج التعلم الارتباطات الزائفة.

هل يمكنك تقديم بعض الأمثلة العملية لتنفيذ نماذج مثل TimesFM من Google و TinyTimeMixer من IBM و MOMENT من Autolab في سيناريوهات حقيقية؟

من الصعب الإجابة على هذا السؤال؛ لأن هذه النماذج في مرحلة مبكرة، قليلاً ما يعرف عن كيفية استخدامها في السيناريوهات الحقيقية.

في تجربتك، ما هي التحديات التي تواجهها المنظمات عادة عند دمج النماذج اللغوية الزمنية في بنية بياناتهم الحالية، وكيف يمكنهم التغلب عليها؟

النماذج اللغوية الزمنية جديدة جدًا، لذلك لا أعرف التحديات المحددة التي تواجهها المنظمات. ومع ذلك، أعتقد أنهم سوف يواجهون نفس التحديات التي تواجهها عند دمج أي نموذج ذكاء اصطناعي في خط أنابيب البيانات. هذه التحديات تشمل:

  • مشاكل توافق البيانات وتكاملها: النماذج اللغوية الزمنية غالبًا ما تتطلب تنسيقات بيانات محددة وتimestamping متسقة وفترات منتظمة، ولكن بنية البيانات الحالية قد تحتوي على بيانات زمنية غير منسقة أو غير متسقة موزعة عبر أنظمة مختلفة، مثل قواعد بيانات قديمة أو تخزين سحابي أو تدفقات زمنية حقيقية. لذلك، يجب على الفرق تنفيذ خطوط أنابيب ETL قوية لتحويل وتنظيف وترتيب بيانات الزمنية.
  • ماسحية النموذج والأداء: النماذج اللغوية الزمنية، خاصة نماذج التعلم العميق مثل المحولات، يمكن أن تكون مكلفة من حيث الموارد، تتطلب موارد حسابية وذاكرة كبيرة لمعالجة كميات كبيرة من البيانات الزمنية في الوقت الحقيقي أو الوقت الفعلي. هذا يتطلب من الفرق نشر النماذج على منصات قابلة للتوسيع مثل Kubernetes أو خدمات التعلم الاصطناعي المدارة سحابيًا، واستخدام تسريع GPU عند الحاجة، وتنفيذ إطارات معالجة موزعة مثل Dask أو Ray لتحويل استدلال النموذج.
  • الوضوح والموثوقية: النماذج اللغوية الزمنية، خاصة النماذج المعقدة، يمكن أن تظهر كـ “صندوق أسود”، مما يجعل من الصعب تفسير التنبؤات. هذا يمكن أن يكون مشكلة خاصة في الصناعات المنظمة مثل المالية أو الصحة.
  • أمان البيانات وسرية البيانات: التعامل مع البيانات الزمنية غالبًا ما يتضمن معلومات حساسة، مثل بيانات المستشعرات أو معاملات مالية، لذلك من المهم ضمان أمان البيانات والامتثال لأفضل الممارسات الأمنية، بما في ذلك التشفير ومراقبة الوصول، وتنفيذ النماذج في بيئات آمنة ومعزولة.

متى نتطلع إلى المستقبل، كيف تتخيل دور النماذج اللغوية الزمنية في مجال التحليلات التنبؤية والذكاء الاصطناعي؟ هل هناك أي اتجاهات أو تكنولوجيات ناشئة تثيرك特别؟

خطوة可能 في تطور النماذج اللغوية الزمنية قد تكون إدخال أدوات تمكن المستخدمين من نشر واستخدام هذه النماذج بسهولة أكبر. العديد من النماذج اللغوية الزمنية التي استخدمتها تتطلب بيئات محددة وتنقصها مجموعة واسعة من البرامج التعليمية والوثائق. في النهاية، هذه المشاريع في مراحلها الأولى، ولكن سيكون من المثير رؤية كيف تتطور في الأشهر والسنوات القادمة.

شكرًا على المقابلة الرائعة، القراء الذين يرغبون في معرفة المزيد يمكنهم زيارة InfluxData.

أنطوان هو قائد رؤيوي وشريك مؤسس في Unite.AI، مدفوعًا برغبة لا تكل في تشكيل وتعزيز مستقبل الذكاء الاصطناعي والروبوتات. وهو رائد أعمال متسلسل، يعتقد أن الذكاء الاصطناعي سيكون مدمرًا للمجتمع مثل الكهرباء، وغالبًا ما يُقبض عليه وهو يثرثر عن إمكانات التكنولوجيا المثيرة للدهشة والذكاء الاصطناعي العام.

كما أنه مستقبلي، فهو مخصص لاستكشاف كيف ستشكل هذه الابتكارات العالم. بالإضافة إلى ذلك، فهو مؤسس Securities.io، وهي منصة تركز على الاستثمار في التكنولوجيا المتقدمة التي تعيد تعريف المستقبل وتعيد تشكيل القطاعات بأكملها.