قادة الفكر

تكلفة البيانات القذرة العالية في تطوير الذكاء الاصطناعي

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

من غير المخفي أن هناك حمى ذهبية moderne تحدث في تطوير الذكاء الاصطناعي. وفقًا لمؤشر مايكروسوفت و لينكد إن ، يتوقع أكثر من 40٪ من قادة الأعمال إعادة تصميم عمليات أعمالهم بالكامل باستخدام الذكاء الاصطناعي في السنوات القليلة القادمة. هذا التحول الجيوسي ليس مجرد ترقية تكنولوجية ، بل تحول أساسي في كيفية عمل الشركات و اتخاذ القرارات و التفاعل مع العملاء. هذا التطور السريع يؤدي إلى زيادة الطلب على البيانات وأدوات إدارة البيانات الأولية. وفقًا لـ فورستر ، يخطط 92٪ من قادة التكنولوجيا لزيادة ميزانيات إدارة البيانات و الذكاء الاصطناعي في عام 2024.

(MSFT )

في أحدث استطلاع مكنزي العالمي حول الذكاء الاصطناعي ، أشار 65٪ من المستجيبين إلى أن منظماتهم تستخدم تكنولوجيا الذكاء الاصطناعي التوليدي بانتظام. في حين أن هذا التحول يعني قفزة كبيرة إلى الأمام ، إلا أنه يبرز أيضًا تحديًا حاسمًا: جودة البيانات التي تغذي هذه الأنظمة. في صناعة حيث يكون الذكاء الاصطناعي الفعال جيدًا مثل البيانات التي يتم تدريبه عليها ، فإن الحصول على بيانات موثوقة و دقيقة يصبح أكثر صعوبة.

تكلفة البيانات القذرة العالية

البيانات القذرة ليست مشكلة جديدة ، ولكن تأثيرها يضخّم في عصر الذكاء الاصطناعي. في عام 2017 ، قدرت دراسة من معهد ماساتشوستس للتكنولوجيا أن البيانات القذرة تكلف الشركات ما بين 15٪ و 25٪ من إيراداتها. في عام 2021 ، قدر جارتнер أن البيانات الرديئة تكلف المنظمات ما متوسطه 12.9 مليون دولار في السنة.

البيانات القذرة – البيانات التي هي غير كاملة أو غير دقيقة أو غير متسقة – يمكن أن يكون لها تأثير متسلسل على أنظمة الذكاء الاصطناعي. عندما يتم تدريب نماذج الذكاء الاصطناعي على بيانات منخفضة الجودة ، فإن النتائج والتنبؤات الناتجة تكون أساسًا معيبة. هذا لا يؤثر فقط على فعالية تطبيقات الذكاء الاصطناعي ، بل ي представляет أيضًا مخاطر كبيرة للأعمال التي تعتمد على هذه التكنولوجيا لاتخاذ القرارات الحاسمة.

هذا يخلق مشكلة كبيرة لفريق العلوم البيانات لدى الشركات ، الذين اضطروا إلى التركيز بشكل متزايد على الموارد المحدودة لتنظيف وتنظيم البيانات. في تقرير حديث عن حالة الهندسة التحليلية الذي أجراه دي بي تي ، أشار 57٪ من محترفي العلوم البيانات إلى أن جودة البيانات الرديئة هي مشكلة سائدة في عملهم.

الآثار على نماذج الذكاء الاصطناعي

تظهر تأثيرات البيانات القذرة على تطوير الذكاء الاصطناعي في ثلاث طرق رئيسية:

  1. ال精度 و الموثوقية المنخفضة: نماذج الذكاء الاصطناعي ت茁ر على الأنماط والارتباطات المستمدة من البيانات. عندما تكون البيانات المدخلة ملوثة ، فإن النماذج تنتج مخرجات غير موثوقة ؛ المعروفة باسم “هلوسات الذكاء الاصطناعي”. هذا يمكن أن يؤدي إلى استراتيجيات خاطئة و فشل المنتجات و فقدان ثقة العملاء.
  2. تعزيز الانحياز: البيانات القذرة غالبًا ما تحتوي على انحيازات التي ، إذا تم تجاهلها ، يتم دمجها في خوارزميات الذكاء الاصطناعي. هذا يمكن أن يؤدي إلى ممارسات تمييزية ، خاصة في المجالات الحساسة مثل التوظيف و الإقراض و إنفاذ القانون. على سبيل المثال ، إذا تم تدريب أداة التوظيف بالذكاء الاصطناعي على بيانات توظيف历史ية متحيزة ، فقد تفضل بعض الجماعات على حساب الأخرى.
  3. زيادة التكاليف التشغيلية: أنظمة الذكاء الاصطناعي المعيبة تتطلب تعديلات و تدريبات مستمرة ، مما يستهلك وقتًا و موارد إضافية. قد تجد الشركات نفسها في دورة متواصلة من исправ الخطأ بدلاً من الابتكار و التحسين.

الdatapocalypse القادمة

“نحن نقترب بسرعة من نقطة التحول – حيث سيتجاوز المحتوى غير المنشأ من قبل البشر كمية المحتوى المنشأ من قبل البشر. التقدم في الذكاء الاصطناعي نفسه يوفر أدوات جديدة لتنظيف و التحقق من البيانات. ومع ذلك ، فإن كمية المحتوى المنشأ من قبل الذكاء الاصطناعي على الويب تزداد بشكل كبير.

随着 نشر المزيد من المحتوى المنشأ من قبل الذكاء الاصطناعي على الويب ، و هذا المحتوى يتم إنشاؤه بواسطة نماذج لغة كبيرة تم تدريبها على محتوى منشأ من قبل الذكاء الاصطناعي ، نحن ننظر إلى مستقبل حيث تصبح البيانات الأولية و الموثوقة سلعًا نادرة و قيمة.

تحديات تخفيف البيانات

تخلق انتشار المحتوى المنشأ من قبل الذكاء الاصطناعي عدة تحديات كبيرة للصناعة:

  • مراقبة الجودة: يصبح من الصعب التمييز بين البيانات المنشأة من قبل البشر و البيانات المنشأة من قبل الذكاء الاصطناعي ، مما يجعل من الصعب ضمان جودة و موثوقية البيانات المستخدمة لتدريب نماذج الذكاء الاصطناعي.
  • مخاوف تتعلق بالملكية الفكرية: عندما تعلم نماذج الذكاء الاصطناعي من المحتوى المنشأ من قبل الذكاء الاصطناعي ، تطرح أسئلة حول ملكية و حقوق البيانات ، مما قد يؤدي إلى تعقيدات قانونية.
  • الآثار الأخلاقية: عدم الشفافية حول أصل البيانات يمكن أن يؤدي إلى قضايا أخلاقية ، مثل انتشار المعلومات الخاطئة أو تعزيز الانحيازات.

بيانات كخدمة تصبح أساسية

يتم البحث بشكل متزايد عن حلول بيانات كخدمة (DaaS) لتعزيز و تحسين البيانات الأولية لأغراض التدريب. القيمة الحقيقية ل DaaS هي البيانات نفسها التي تم تطبيعها و تنظيفها و تقييمها لاستخدامات مختلفة و تطبيقات تجارية ، بالإضافة إلى معايير Processes لتناسب النظام الذي يستهلك البيانات. مع نضج هذه الصناعة ، أتوقع أن نرى هذه المعايير عبر صناعة البيانات. نحن نرى بالفعل هذا الدفع نحو التوحيد في قطاع وسائل الإعلام التجزئة.

随着 استمرار الذكاء الاصطناعي في اختراق مختلف الصناعات ، سوف تزداد أهمية جودة البيانات. الشركات التي تضع جودة البيانات في أولوياتها سوف تحصل على ميزة تنافسية ، بينما تلك التي تهملها سوف تفقد المبادرة بسرعة.

تكلفة البيانات القذرة في تطوير الذكاء الاصطناعي هي قضية حاسمة لا يمكن تجاهلها. جودة البيانات الرديئة تؤثر على أساس أنظمة الذكاء الاصطناعي ، مما يؤدي إلى رؤى معيبة و زيادة التكاليف و مخاطر أخلاقية محتملة. من خلال اعتماد استراتيجيات إدارة البيانات الشاملة و تعزيز ثقافة تقدر سلامة البيانات ، يمكن للمنظمات التخفيف من هذه المخاطر.

في عصر حيث البيانات هي النفط الجديد ، فإن ضمان نقاوتها ليس فقط ضرورة تقنية ، بل أيضًا ضرورة استراتيجية. الشركات التي تستثمر في بيانات نظيفة اليوم سوف تكون تلك التي تقود طليعة الابتكار غدًا.

إلي غودمان هو الرئيس التنفيذي ومؤسس مشارك في Datos، شركة Semrush. مع أكثر من 25 عامًا من الخبرة في الفضاء الرقمي والبيانات، شغل إلي مناصب قيادية في مجموعة متنوعة من شركات البيانات البديلة، بما في ذلك مسيرة 9 سنوات في ComScore.