مقابلات

تشارلز شي، المؤسس والرئيس التنفيذي لشركة Zilliz – سلسلة المقابلات

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

تشارلز شي هو المؤسس والرئيس التنفيذي لشركة Zilliz، حيث يركز على بناء قواعد بيانات وجدول بحث من الجيل التالي لتطبيقات الذكاء الاصطناعي واللغات. في Zilliz، اخترع أيضًا Milvus، وهو أكثر قاعدة بيانات متجهة مفتوحة المصدر شعبية للآي في الإنتاج. وهو حاليًا عضو مجلس إدارة مؤسسة LF AI & Data وخدم كرئيس مجلس الإدارة في عامي 2020 و 2021. عمل تشارلز سابقًا في Oracle (ORCL ) كمهندس مؤسس لمشروع قاعدة بيانات Oracle 12c السحابية. يحمل تشارلز درجة الماجستير في علوم الحاسوب من جامعة ويسكونسن-ماديسون.

Zilliz هي الفريق وراء LF AI Milvus، وهو قاعدة بيانات متجهة مفتوحة المصدر على نطاق واسع. تركز الشركة على تبسيط إدارة بنية البيانات، معهدفًا جعل الذكاء الاصطناعي أكثر سهولة للشركات والمنظمات والأفراد على حد سواء.

يمكنك مشاركة القصة وراء تأسيس Zilliz وما الذي ألهمك لتطوير Milvus والتركيز على قواعد البيانات المتجهة؟

رحلتي في مجال قواعد البيانات تستمر لمدة 15 عامًا، بما في ذلك ست سنوات كمهندس برمجيات في Oracle، حيث كنت عضوًا مؤسسًا في فريق قاعدة بيانات Oracle 12c المتعددة المستأجرين. خلال هذا الوقت، لاحظت 한 制限ًا رئيسيًا: في حين تم إدارة البيانات المهيكلة جيدًا، ظلت البيانات غير المهيكلة – التي تمثل 90٪ من جميع البيانات – في الغالب غير مستغلة، مع تحليل فقط 1٪ منها بشكل معنوي.

في عام 2017، أصبحت القدرة المتزايدة للذكاء الاصطناعي على معالجة البيانات غير المهيكلة نقطة تحول. أظهرت التطورات في معالجة اللغة الطبيعية كيف يمكن تحويل البيانات غير المهيكلة إلى تمثيلات متجهة، مما يفتح معناها الدلالي. هذا ألهمني لتأسيس Zilliz، مع رؤية لإدارة “ملايين البيانات”. أصبحت التمثيلات المتجهة حجر الزاوية للجسر بين البيانات غير المهيكلة والاستخبارات القابلة للتنفيذ. قمنا بتطوير Milvus كقاعدة بيانات متجهة مخصصة لجعل هذه الرؤية حقيقة.

على مدار السنوات القليلة الماضية، صدقت الصناعة على هذا النهج، معترفة بقواعد البيانات المتجهة كأساس لتدبير البيانات غير المهيكلة. بالنسبة لنا، لا يتعلق الأمر بالتكنولوجيا فقط – بل يتعلق بتمكين البشرية من استغلال إمكانات البيانات غير المهيكلة في عصر الذكاء الاصطناعي.

كيف تطورت رحلة Zilliz منذ تأسيسها قبل ست سنوات، وما هي التحديات الرئيسية التي واجهتها أثناء رائد قواعد البيانات المتجهة؟

الرحلة كانت تحولية. عندما بدأنا Zilliz قبل سبع سنوات، لم يكن التحدي الحقيقي هو جمع التمويل أو التوظيف – بل كان بناء منتج في منطقة غير مكتشفة تمامًا. بدون خرائط طريق موجودة أو ممارسات أفضل أو توقع مستخدمي معين، كنا مجبورين على رسم مسارنا الخاص.

كان اختراقنا مع إطلاق Milvus كقاعدة بيانات متجهة مفتوحة المصدر. من خلال خفض الحواجز أمام اعتمادها وتعزيز المشاركة المجتمعية، حصلنا على ردود فعل قيمة من المستخدمين لتطوير المنتج وتحسينه. عندما أطلقنا Milvus في عام 2019، كنا لدينا حول 30 مستخدمًا بنهاية العام. هذا نمو إلى أكثر من 200 في عام 2020 وقريبًا إلى ما يقرب من 1000.

اليوم، انتقلت قواعد البيانات المتجهة من مفهوم جديد إلى بنية تحتية أساسية في عصر الذكاء الاصطناعي، مما يؤكد الرؤية التي بدأنا بها.

كشركة لقواعد البيانات المتجهة، ما هي القدرات الفنية الفريدة التي تقدمها Zilliz لدعم بحث المتجهات المتعددة في تطبيقات الذكاء الاصطناعي الحديثة؟

Zilliz طورت قدرات فنية متقدمة لدعم بحث المتجهات المتعددة:

  1. البحث الهجين: نتمكن من إجراء عمليات بحث متزامنة عبر أنماط مختلفة، مثل الجمع بين الميزات البصرية لصورة مع وصفها النصي.
  2. الخوارزميات المُحسّنة: تقنيات الكمية المملوكة توازن بين دقة الاسترجاع وفعاليّة الذاكرة للبحث عبر الأنماط.
  3. المعالجة في الوقت الفعلي والتعامل غير المتزامن: نظامنا المزدوج يدعم كتابة في الوقت الفعلي منخفضة التأخير وimports غير متزامنة عالية الإنتاجية، مما يضمن свежة البيانات.
  4. الكفاءة التكلفة: مثيلات السعة الممتدة لدينا تستفيد من التخزين المتدرج الذكي لتقليل تكاليف التخزين بشكل كبير مع الحفاظ على الأداء العالي.
  5. النماذج الذكية المضمنة: من خلال دمج نماذج التضمين والترتيب المتعددة، خفضنا حاجز تنفيذ تطبيقات البحث المعقدة.

تسمح هذه القدرات للمطورين بمعالجة أنواع بيانات متنوعة بفعالية، مما يجعل تطبيقات الذكاء الاصطناعي الحديثة أكثر متانة وتنوعًا.

كيف ترى تقدم Multimodal RAG في تعزيز قدرة الذكاء الاصطناعي على التعامل مع بيانات العالم الحقيقي المعقدة مثل الصور والصوت والفيديوهات جنبًا إلى جنب مع النص؟

تمثل Multimodal RAG (الاسترجاع المعزز بالتوليد) تطورًا حاسمًا في الذكاء الاصطناعي. في حين كانت RAG القائمة على النص بارزة، فإن معظم بيانات الشركات تتراوح بين الصور والفيديوهات والصوت. القدرة على دمج هذه التنسيقات المتنوعة في سير عمل الذكاء الاصطناعي أمر بالغ الأهمية.

هذا التحول يتم في الوقت المناسب، حيث يُناقش مجتمع الذكاء الاصطناعي حدود بيانات الإنترنت النصية المتاحة للتدريب. في حين أن بيانات النص محدودة، تظل بيانات المتعددة غير مستغلة على نطاق واسع – تتراوح بين مقاطع فيديو الشركات إلى أفلام هوليوود وتسجيلات صوتية.

Multimodal RAG يفتح هذا الخزان غير المستغل، مما يسمح لأنظمة الذكاء الاصطناعي بمعالجة واستغلال هذه أنواع البيانات الغنية. لا يتعلق الأمر بتعزيز نقص البيانات فقط – بل يتعلق بتوسيع حدود قدرات الذكاء الاصطناعي لفهم العالم الحقيقي وتفاعله بشكل أفضل.

كيف تتميز Zilliz عن منافسيها في سوق قواعد البيانات المتجهة الذي ينمو بسرعة؟

Zilliz تبرز من خلال عدة جوانب فريدة:

  1. الهوية المزدوجة: نحن شركة ذكاء اصطناعي وشركة قواعد بيانات، مما يدفع حدود إدارة البيانات وتكامل الذكاء الاصطناعي.
  2. التصميم السحابي الأصيل: كانت Milvus 2.0 أول قاعدة بيانات متجهة موزعة اعتمدت هيكل تخزين ومعالجة منفصل، مما يسمح بال鱗ية والتكلفة الفعالة لأكثر من 100 مليار متجه.
  3. التحسينات المملوكة: محرك Cardinal يصل إلى ثلاثة أضعاف الأداء من Milvus مفتوح المصدر و10 أضعاف من منافسينا. كما نقدم فهرسة على القرص وتخزين متدرج ذكي للتوسع بتكلفة فعالة.
  4. الابتكار المستمر: من قدرات البحث الهجين إلى أدوات الهجرة مثل VTS، نحن دائمًا ما نتقدم في تقنية قواعد البيانات المتجهة.

التزامنا بالبرمجيات مفتوحة المصدر يضمن المرونة، بينما يوفر خدمتنا المُدارة، Zilliz Cloud، أداءً من الدرجة الأولى مع تعقيد تشغيلي قليل.

يمكنك توضيح أهمية Zilliz Cloud ودورها في ديمقراطية الذكاء الاصطناعي وجعل خدمات البحث المتجهة متاحة للمطورين الصغيرين والشركات على حد سواء؟

تم استخدام بحث المتجهات من قبل العمالقة التكنولوجية منذ عام 2015، لكن التنفيذات المملوكة قيدت انتشارها على نطاق أوسع. في Zilliz، نحن نديمقرطة هذه التكنولوجيا من خلال نهجين متكاملين:

  1. مفتوح المصدر: Milvus يسمح للمطورين ببناء وامتلاك بنية تحتية للبحث المتجه، مما يخفض الحواجز الفنية.
  2. الخدمة المُدارة: Zilliz Cloud يزيل العبء التشغيلي، ويقدم حلًا بسيطًا واقتصاديًا للأعمال لتبني بحث المتجهات دون الحاجة إلى مهندسين متخصصين.

ينجح هذا النهج المزدوج في جعل بحث المتجهات متاحًا للمطورين والشركات على حد سواء، مما يسمح لهم بالتركيز على بناء تطبيقات ذكاء اصطناعي مبتكرة.

مع تقدم النماذج اللغوية الكبيرة والأساسية، ما الذي تعتقد أنه سيكون التغيير الكبير التالي في بنية بيانات الذكاء الاصطناعي؟

سيكون التغيير الكبير التالي تحولًا شاملًا لبنية بيانات الذكاء الاصطناعي لمعالجة البيانات غير المهيكلة، التي تشكل 90٪ من جميع البيانات. الأنظمة الحالية، المصممة للبيانات المهيكلة، غير مجهزة لهذا التحول.

سيتأثر هذا التحول بكل層 من chồng البيانات، من الأنظمة الأساسية لقواعد البيانات إلى بروتوكولات الأمان ونظم الرصد. لا يتعلق الأمر بتحديثات متدرجة – بل يتعلق بإنشاء أنماط جديدة مخصصة لتعقيدات البيانات غير المهيكلة.

سيتأثر هذا التحول بكل جانب من جوانب chồng البيانات:

  • نظم قواعد البيانات الأساسية
  • أنابيب البيانات وعمليات ETL
  • آليات تنظيف البيانات وتحويلها
  • بروتوكولات الأمان والتشفير
  • إطارات الامتثال والحوكمة
  • نظم رصد البيانات

لا نتحدث فقط عن تحديث الأنظمة الحالية – بل نتحدث عن بناء أنماط جديدة تمامًا. إنه مثل الانتقال من عالم مُحسّن لتنظيم الكتب في مكتبة إلى عالم يحتاج إلى إدارة وفهم ومعالجة كل الإنترنت. هذا التحول يمثل عالمًا جديدًا تمامًا، حيث قد تحتاج كل مكونة من مكونات بنية البيانات إلى إعادة تخيلها من الصفر.

سيتحول هذا الثورة إلى تعريف جديد لكيفية تخزيننا وإدارة ومعالجة البيانات، مفتوحًا فرصًا هائلة لابتكارات الذكاء الاصطناعي.

كيف أثرت دمج وحدات معالجة الرسومات من NVIDIA (NVDA ) على أداء ومقياس بحث المتجهات؟

أثرت دمج وحدات معالجة الرسومات من NVIDIA بشكل كبير على أداء بحث المتجهات في两个 مجالات رئيسية.

أولاً، في بناء الفهرسة، وهو أحد أكثر العمليات حوسبة في قواعد البيانات المتجهة. بالمقارنة مع فهرسة قواعد البيانات التقليدية، يتطلب بناء فهرسة المتجهات عدة أوامر من القوة الحوسبية. من خلال استغلال تسريع الرسومات، قللنا بشكل كبير من وقت بناء الفهرسة، مما يسمح بدخول البيانات بشكل أسرع وتحسين رؤية البيانات.

ثانيًا، كانت الرسومات حاسمة لケースات الاستعلام عالية الإنتاجية. في التطبيقات مثل التجارة الإلكترونية، حيث يحتاج النظام إلى معالجة آلاف أو حتى عشرات الآلاف من الاستفسارات في الثانية (QPS)، أثبتت قدرات المعالجة المتوازية للرسومات قيمتها. من خلال استخدام تسريع الرسومات، يمكننا معالجة عمليات بحث المتجهات المتعددة بفعالية مع الحفاظ على انخفاض التأخير.

منذ عام 2021، كنا نتعاون مع NVIDIA لتحسين خوارزمياتنا لمعمارية الرسومات، كما طوّرنا نظامنا لدعم الحوسبة الهجينة عبر معماريات المعالج المختلفة. هذا يعطي عملائنا مرونة في اختيار البنية التحتية الأفضل لمتطلباتهم الخاصة.

كما أن قواعد البيانات المتجهة تلعب دورًا حاسمًا في الذكاء الاصطناعي، هل ترى تطبيقها يتجاوز الحالات التقليدية مثل أنظمة التوصية والبحث إلى صناعات مثل الرعاية الصحية؟

تتوسع قواعد البيانات المتجهة بسرعة إلى ما وراء التطبيقات التقليدية مثل أنظمة التوصية والبحث، وتدخل صناعات لم نتصورها من قبل. دعني أشارك بعض الأمثلة.

في مجال الرعاية الصحية والبحوث الصيدلانية، تقوم قواعد البيانات المتجهة بثورة في اكتشاف الأدوية. يمكن تمثيل الجزيئات على أنها متجهات بناءً على خصائصها الوظيفية، ويمكن للباحثين استخدام ميزات مثل بحث النطاق لاكتشاف جميع المرشحين المحتملين الذين قد يعالجون أمراضًا أو أعراضًا محددة. على عكس عمليات البحث الأعلى من ك، يحدد بحث النطاق جميع الجزيئات داخل مسافة معينة من الهدف، مما يوفر نظرة شاملة على المرشحين المحتملين.

في مجال السيارات ذاتية القيادة، تقوم قواعد البيانات المتجهة بتحسين سلامة المركبات وأدائها. أحد التطبيقات المثيرة للاهتمام هو في التعامل مع الحالات الحدية – عندما تواجه النظام سيناريوهات غير عادية، يمكنه البحث بسرعة في قواعد بيانات ضخمة من سيناريوهات مماثلة لfinding بيانات تدريب ذات صلة لتعديل نماذج القيادة الذاتية.

نحن نشهد أيضًا تطبيقات مبتكرة في الخدمات المالية لاكتشاف الاحتيال، والأمان السيبراني لاكتشاف التهديدات، والإعلان المستهدف لتحسين تفاعل العملاء. على سبيل المثال، في البنوك، يمكن تمثيل المعاملات على أنها متجهات ومقارنتها بالأنماط التاريخية لتحديد الأنشطة المحتملة غير المشروعة.

قوة قواعد البيانات المتجهة تكمن في khảيته لفهم ومعالجة التشابه في أي مجال – سواء كانت هياكل جزيئية أو سيناريوهات قيادة أو أنماط مالية أو تهديدات أمنية. مع استمرار تطور الذكاء الاصطناعي، نحن نلمس فقط ما هو ممكن. القدرة على معالجة وكشف الأنماط في كميات هائلة من البيانات غير المهيكلة تفتح إمكانيات نحن نبدأ فقط في استكشافها.

كيف يمكن للمطورين والشركات أفضل互одействة مع Zilliz و Milvus لاستغلال تقنية قواعد البيانات المتجهة في مشاريع الذكاء الاصطناعي؟

هناك طريقتان رئيسيتان لاستغلال تقنية قواعد البيانات المتجهة مع Zilliz و Milvus، كل واحدة منهما تتوافق مع احتياجات ومقاييس مختلفة. إذا كنت تقدر المرونة والتعديل، فإن Milvus، وهو حل مفتوح المصدر، هو الخيار الأفضل لك. مع Milvus، يمكنك:

  • التجربة بحرية وتعلم التكنولوجيا بسرعة.
  • تعديل الحل لتلبية متطلباتك المحددة.
  • المساهمة في التطوير وتعديل قاعدة الشفرة.
  • الحفاظ على السيطرة الكاملة على بنيتك التحتية.

ومع ذلك، إذا كنت ترغب في التركيز على بناء تطبيقك دون إدارة البنية التحتية، فإن Zilliz Cloud هو الخيار الأمثل. يوفر:

  • حلاً جاهزًا مع تثبيت بضغطة زر واحدة.
  • أمان وامتثال من الدرجة الأولى.
  • توافر عالي وثبات.
  • أداء محسّن دون عبء تشغيلي.

فكر في الأمر على هذا النحو: إذا كنت تستمتع “بالتحسين” وترغب في المرونة القصوى، اختر Milvus. إذا كنت ترغب في تقليل التعقيد التشغيلي والبدء في بناء تطبيقك، اختر Zilliz Cloud.

كلا الطريقين سيوصلك إلى وجهتك – الأمر يعتمد على مقدار السيطرة التي تريد الحفاظ عليها مقابل السرعة التي تحتاجها للوصول.

شكرًا على المقابلة الرائعة، القراء الذين يرغبون في التعلم أكثر يمكنهم زيارة Zilliz أو Milvus.

أنطوان هو قائد رؤيوي وشريك مؤسس في Unite.AI، مدفوعًا برغبة لا تكل في تشكيل وتعزيز مستقبل الذكاء الاصطناعي والروبوتات. وهو رائد أعمال متسلسل، يعتقد أن الذكاء الاصطناعي سيكون مدمرًا للمجتمع مثل الكهرباء، وغالبًا ما يُقبض عليه وهو يثرثر عن إمكانات التكنولوجيا المثيرة للدهشة والذكاء الاصطناعي العام.

كما أنه مستقبلي، فهو مخصص لاستكشاف كيف ستشكل هذه الابتكارات العالم. بالإضافة إلى ذلك، فهو مؤسس Securities.io، وهي منصة تركز على الاستثمار في التكنولوجيا المتقدمة التي تعيد تعريف المستقبل وتعيد تشكيل القطاعات بأكملها.