نماذج ومنصات الذكاء الاصطناعي
مجموعات البيانات المُحسنة من الويب والمحفوظات: لماذا يستحق CommonPool النظر

الذكاء الاصطناعي (AI) أصبح جزءًا من الحياة اليومية. إنه مرئي في المحادثات الطبية التي توجيه المرضى وفي الأدوات التوليدية التي تساعد الفنانين والكتاب والمطورين. هذه الأنظمة تبدو متقدمة، ومع ذلك، فإنها تعتمد على مورد أساسي واحد: البيانات.
معظم البيانات المستخدمة لتدريب أنظمة الذكاء الاصطناعي تأتي من الإنترنت العام. البرامج الآلية تجمع كميات كبيرة من النصوص والصور والصوت من المنصات على الإنترنت. هذه المجموعات تشكل أساسًا لنموذجات معروفة مثل GPT-4 و Stable Diffusion وغيرها. ومع ذلك، فإن هذه المجموعة الكبيرة تثير مخاوف غير محلولة حول الخصوصية والملكية والموافقة المستنيرة.
سوق مجموعات البيانات التدريبية يعكس حجم هذه النشاط. في الوقت الحالي، تقدر القيمة العالمية لمجموعات البيانات للذكاء الاصطناعي بحوالي 3.2 مليار دولار. وفقًا للتنبؤات، قد تصل إلى 16.3 مليار دولار بحلول عام 2034، بمعدل نمو سنوي يبلغ 20.5 في المائة. وراء هذه الأرقام تقع تحديات هامة. جزء كبير من المواد المجمعة يتم الحصول عليها بدون إذن صريح. غالبًا ما تحتوي على بيانات شخصية وأعمال محمية بحقوق الطبع والنشر ومحتوى حساس آخر لم يكن من المفترض أن يستخدم في أنظمة الذكاء الاصطناعي.
في استجابة لهذه القضايا، يتم استكشاف نهج بديلة ل治理 البيانات. واحد من الأمثلة هو CommonPool، الذي تم إطلاقه في أبريل 2023 كجزء من معيار DataComp. إنه مجموعة بيانات كبيرة تضم 12.8 مليار زوج من الصور والنصوص المصممة لأبحاث الذكاء الاصطناعي المتعدد الوسائط. على عكس الجهود التقليدية للاستخلاص، يطبق طرق التصفية ويشدد على الشفافية ويضم المشاركة المجتمعية في تطوره. على الرغم من أنه لا يزال موضوع نقاش، يُظهر CommonPool محاولة لإنشاء ممارسات أكثر مسؤولية ويمكن مساءلتها لبيانات التدريب للذكاء الاصطناعي. هذه المبادرات تسلط الضوء على الحاجة إلى معايير أخلاقية في مستقبل الذكاء الاصطناعي.
دور البيانات المُحسنة من الويب في تعزيز الذكاء الاصطناعي
البيانات هي أساسية للذكاء الاصطناعي، حيث ترتبط أداء النظام ارتباطًا وثيقًا بكمية وتنوع المعلومات المتاحة للتدريب. في السنوات الأخيرة، أصبحت استخلاص البيانات من الويب طريقة قياسية لجمع مجموعات بيانات كبيرة النطاق. من خلال جمع المحتوى المتاح علنًا على الإنترنت، حصل الباحثون والمطورون على موارد بيانات واسعة ومتنوعة.
مثال شائع هو Common Crawl، الذي بحلول عام 2025، قام بتخزين بيتابايت من النصوص المجمعة من خلال استكشافات شهرية تزيد على 250 تيرابايت كل منها. يتم استخدام هذه المجموعة البيانية على نطاق واسع لتدريب نماذج الذكاء الاصطناعي القائمة على النص. مثال آخر هو LAION-5B، الذي يحتوي على حوالي 5.85 مليار زوج من الصور والنصوص. لعب دورًا هامًا في تطبيقات مثل Stable Diffusion، الذي يمكنه إنشاء صور واقعية من العبارات المكتوبة.
تعد هذه المجموعات البيانية قيمة لأنها تزيد من دقة النماذج وتحسن من التعميم من خلال المحتوى المتنوع، وتسمح للمجموعات الصغيرة، بما في ذلك الجامعات، بالمشاركة في تطوير الذكاء الاصطناعي. مؤشر ستانفورد للذكاء الاصطناعي لعام 2025 يُظهر أن معظم النماذج المتقدمة لا تزال تعتمد على بيانات مُحسنة، مع نمو مجموعات البيانات بسرعة في الحجم. هذا الطلب دفع أيضًا الاستثمارات الكبيرة، حيث بلغت أكثر من 57 مليار دولار في عام 2024 لمراكز البيانات والقوة الحاسوبية.
في الوقت نفسه، لا تخلو استخلاص البيانات من الويب من التحديات. إنه يثير أسئلة حول الخصوصية والملكية والحقوق القانونية، حيث أن جزءًا كبيرًا من المحتوى المجمع لم يُنشأ في الأصل للاستخدام الآلي. تُظهر القضايا القضائية والمناقشات السياسية أن هذه التحديات أصبحت أكثر إلحاحًا. مستقبل جمع بيانات الذكاء الاصطناعي سيعتمد على إيجاد توازن بين التقدم والمسؤولية الأخلاقية.
مشكلة الخصوصية مع البيانات المُحسنة
أدوات استخلاص البيانات من الويب تجمع المعلومات بدون فصل واضح بين المحتوى العام والتفاصيل الحساسة. إلى جانب النصوص والصور، غالبًا ما يتم التقاط معلومات تعريف شخصية (PII) مثل الأسماء وعناوين البريد الإلكتروني والصور الشخصية.
تم الكشف عن تدقيق لمجموعة بيانات CommonPool في يوليو 2025، وأظهر أن حتى بعد التصفية، ما يزال هناك 0.1% من العينات تحتوي على وجوه غير محجوبة وأوراق هوية ووثائق مثل السيرة الذاتية والجوازات. على الرغم من أن النسبة المئوية تبدو صغيرة، عند مستوى مليارات السجلات، فإنها تترجم إلى مئات الملايين من الأفراد المتأثرين. تؤكد المراجعات ومدققي السلامة أن وجود هذا النوع من المواد ليس غير عادي، ويتضمن مخاطر مثل سرقة الهوية والتنمر المستهدف والكشف غير المرغوب فيه عن البيانات الشخصية.
تزداد أيضًا النزاعات القانونية مع تزايد القلق حول ملكية البيانات والاستخدام العادل. بين عامي 2023 و2024، واجهت شركات مثل OpenAI وStability AI دعاوى قضائية لاستخدام بيانات شخصية ومحمية بحقوق الطبع والنشر بدون موافقة. في فبراير 2025، حكمت محكمة اتحادية أمريكية أن تدريب الذكاء الاصطناعي على معلومات شخصية غير مرخصة يُعد انتهاكًا لحقوق الطبع والنشر. هذا القرار شجع على المزيد من الدعاوى الجماعية. حقوق الطبع والنشر هي قضية أخرى كبرى. تحتوي العديد من مجموعات البيانات المُحسنة على كتب ومقالات وفن ورمز. يجادل الكتاب والفنانون بأن أعمالهم يتم استخدامها بدون موافقة أو دفع.
استمرار عدم وجود موافقة في تدريب الذكاء الاصطناعي قد أضعف الثقة العامة. يكتشف العديد من الناس أن مدوناتهم أو أعمالهم الإبداعية أو رمزهم البرمجي يتم تضمينها في مجموعات البيانات بدون معرفتهم. هذا أثار مخاوف أخلاقية ودعوات إلى مزيد من الشفافية. في الاستجابة، تتحرك الحكومات نحو الرقابة الأشد من خلال قوانين تعزز تطوير نماذج الذكاء الاصطناعي بعناية واستخدام بيانات مسؤول.
لماذا مجموعات البيانات المُحسنة صعبة الاستبدال
حتى مع القلق حول الخصوصية والموافقة، لا تزال مجموعات البيانات المُحسنة ضرورية لتدريب الذكاء الاصطناعي. السبب هو الحجم. تحتاج نماذج الذكاء الاصطناعي الحديثة إلى تريليونات من الرموز من النصوص والصور والوسائط الأخرى. بناء مجموعات بيانات مثل هذه فقط من خلال مصادر مرخصة أو منقحة سيكون مكلفًا بمئات الملايين من الدولارات. هذا ليس عمليًا لمعظم الشركات الناشئة أو الجامعات.
ال تكلفة العالية ليست التحدي الوحيد مع مجموعات البيانات المنقحة. غالبًا ما تفتقر إلى التنوع وتتركز على لغات أو مناطق أو مجتمعات معينة. هذا التغطية الضيقة يجعل نماذج الذكاء الاصطناعي أقل توازنًا. في المقابل، تُظهر البيانات المُحسنة، على الرغم من كونها صاخبة وغير كاملة، نطاقًا أوسع من الثقافات والمواضيع والآراء. هذا التنوع يسمح لأنظمة الذكاء الاصطناعي بالعمل بشكل أفضل عند تطبيقها على الواقع.
然而، يوجد خطر أن تقييدات صارمة قد تُحد من الوصول إلى البيانات المُحسنة. إذا حدث ذلك، قد تواجه المنظمات الصغيرة صعوبات في المنافسة. الشركات الكبيرة ذات مجموعات البيانات الخاصة أو المملوكة، مثل جوجل أو ميتا، ستستمر في التقدم. هذا الخلل يمكن أن يقلل من المنافسة ويبطئ الابتكار المفتوح في الذكاء الاصطناعي.
في الوقت الحالي، مجموعات البيانات المُحسنة لا تزال مركزية لأبحاث الذكاء الاصطناعي. في الوقت نفسه، مشاريع مثل CommonPool تُبحث في طرق لبناء مجموعات بيانات شاملة ومصدرة أخلاقيًا. هذه الجهود ضرورية للحفاظ على نظام الذكاء الاصطناعي أكثر انفتاحًا وعدلًا ومسؤولية.
CommonPool: نحو هندسة بيانات كبيرة النطاق المسؤولة
CommonPool هي واحدة من الجهود الأكثر طموحًا تقنيًا لبناء مجموعة بيانات مفتوحة كبيرة النطاق متعددة الوسائط. مع ما يقرب من 12.8 مليار زوج من الصور والنصوص، تتماشى مع حجم LAION-5B ولكنها تدمج آليات هندسة بيانات وحوكمة أقوى. كان الهدف الرئيسي من التصميم ليس فقط تحقيق الحجم الأقصى ولكن أيضًا التزام بمبادئ الإعادة الإنتاجية وبراءة الأصل والامتثال التنظيمي.
بناء مجموعة بيانات CommonPool يتبع трубة من ثلاث مراحل. المرحلة الأولى تتضمن استخراج العينات الخام من صور Common Crawl المأخوذة بين عامي 2014 و2022. يتم جمع الصور والنصوص المرتبطة بها، مثل العناوين أو الفقرات المحيطة. يتم تطبيق تقييمات التشابه القائمة على CLIP لتقدير الانسجام السيميائي، مع إهمال الأزواج ذات الانسجام الضعيف بين الصور والنصوص. هذه الخطوة الأولى في التصفية تقلل بشكل كبير من الضوضاء مقارنة بالأنابيب التقليدية للاستخلاص.
في المرحلة الثانية، تخضع المجموعة البيانية إلى إزالة التكرارات على نطاق واسع. يتم استخدام تقنيات التجزئة الحسية وMinHash لتحديد وإزالة الصور المتكررة، ومنع التكرار من السيطرة على تدريب النماذج. يتم تطبيق مرشحات إضافية لإزالة الملفات التالفة والروابط المكسورة والصور منخفضة الدقة. في هذه المرحلة، يتم أيضًا تضمين تنسيق النص وتحديد اللغة تلقائيًا، مما يسمح بإنشاء مجموعات فرعية محددة بال 领域 أو اللغة للاستخدام في الأبحاث المستهدفة.
تركز المرحلة الثالثة على السلامة والامتثال. يتم تطبيق الكشف الآلي عن الوجوه وتعتيمها، في حين يتم إزالة الصور المتعلقة بالأطفال والمعرفات الشخصية مثل الأسماء وعناوين البريد الإلكتروني وعناوين البريد. كما يحاول الأنبوب الكشف عن المواد المحمية بحقوق الطبع والنشر. على الرغم من أن أي طريقة آلية لا يمكن أن تضمن التصفية الكاملة على مستوى الويب، فإن هذه الحوافز تمثل تحسنًا تقنيًا كبيرًا مقارنة ب LAION-5B، حيث كانت التصفية محدودة بشكل رئيسي بالمحتوى الإلكتروني والسمية.
خارج معالجة البيانات، يقدم CommonPool نموذجًا للحوكمة يُميزه عن إصدارات مجموعات البيانات الثابتة. يتم صيانته ك مجموعة بيانات حية مع إصدارات مصفوفة وبيانات وصفية ودوائر تحديث وثائقية. تحتوي كل عينة على معلومات الترخيص حيثما كان ذلك متاحًا، مما يدعم الامتثال لتنظيمات حقوق الطبع والنشر. يسمح بروتوكول الإزالة للأفراد والمؤسسات بطلب إزالة المحتوى الحساس، مما يعالج المخاوف المثارة بواسطة قانون الاتحاد الأوروبي للذكاء الاصطناعي والاطار التنظيمي المرتبط. تُحسن البيانات الوصفية مثل عناوين URL ونتائج التصفية من الشفافية والإعادة الإنتاجية، مما يسمح للباحثين بمتابعة قرارات الإدراج والإستبعاد.
تُظهر نتائج البenchmark من مبادرة DataComp التأثيرات الفنية لهذه الخيارات التصميمية. عند تدريب هياكل رؤية-لغة متطابقة على LAION-5B وCommonPool، أنتجت الأخيرة نماذج بأداء أكثر استقرارًا في المهام التنافسية الدقيقة والتصنيف بدون شوط. هذه النتائج تشير إلى أن جودة الانسجام الأعلى في CommonPool تعوض عن بعض مزايا الحجم في مجموعات البيانات الأقل تصفية. ومع ذلك، كشفت التدقيقات المستقلة في عام 2025 عن مخاطر متبقية: حوالي 0.1% من المجموعة البيانية لا تزال تحتوي على وجوه غير محجوبة ووثائق شخصية وحساسة وأوراق هوية. هذا يُظهر حدود حتى الأنابيب التصفية الآلية المتقدمة.
بشكل عام، يمثل CommonPool تحولًا في هندسة مجموعات البيانات من الأولوية للحجم الخام إلى توازن بين الحجم والجودة والامتثال. لأبحاث الذكاء الاصطناعي، يوفر أساسًا يمكن إعادة إنتاجه ويعتبر أكثر أمانًا نسبيًا للتدريب المسبق على نطاق واسع. للمشرعين، يُظهر أن آليات الخصوصية ومساءلة يمكن دمجها مباشرة في بناء المجموعة البيانية. على عكس LAION، يُظهر CommonPool كيف يمكن أن تحول أنابيب التصفية وممارسات الحوكمة وأطر البenchmark مجموعات البيانات الكبيرة من الويب إلى مورد أكثر متانة وفضيلة أخلاقيًا للذكاء الاصطناعي المتعدد الوسائط.
مقارنة CommonPool مع مجموعات البيانات التقليدية المُحسنة من الويب
على عكس مجموعات البيانات الكبيرة المُحسنة من الويب التقليدية مثل LAION-5B (5.85 مليار عينة) وCOYO-700M (700 مليون عينة) وWebLI (400 مليون عينة)، يُشدد CommonPool على الهيكلة والإعادة الإنتاجية والحوكمة. يحتفظ بالبيانات الوصفية مثل عناوين URL وتاريخ الزمن، مما يدعم التتبع والتحقق الجزئي للتراخيص. بالإضافة إلى ذلك، يُطبق تصفية سيميائية قائمة على CLIP لإزالة أزواج الصور والنصوص ذات الجودة المنخفضة أو الانسجام الضعيف، مما يؤدي إلى تحسين جودة البيانات.
بالمقارنة، تم تجميع LAION-5B وCOYO من Common Crawl مع تصفية محدودة وبدون توثيق ترخيص مفصل. تحتوي هذه المجموعات البيانية غالبًا على مواد حساسة، بما في ذلك السجلات الطبية ووثائق الهوية والوجوه غير المحجوبة. كما يفتقر WebLI إلى الشفافية، حيث لم يتم إطلاقه أبدًا للاستعراض الخارجي أو التكرار.
يُحاول CommonPool معالجة هذه القضايا من خلال استبعاد معلومات التعريف الشخصية ومحتوى NSFW، مع الاعتراف بأن الموافقة الكاملة لا تزال غير محلولة. هذا يجعلها أكثر موثوقية ومتوافقة أخلاقيًا مقارنة بالبديل السابق.
الخلاصة
تُظهر تطوير CommonPool تحولًا هامًا في كيفية تصور مجموعات البيانات الكبيرة للذكاء الاصطناعي ومaintenanceها. في حين أن المجموعات السابقة مثل LAION-5B وCOYO أ gave الأولوية للحجم مع الرقابة المحدودة، يُظهر CommonPool أن الشفافية والتصفية والحوكمة يمكن دمجها في بناء المجموعة البيانية دون المساس bằng إمكانية استخدامها لأبحاث الذكاء الاصطناعي.
من خلال الحفاظ على البيانات الوصفية وتطبيق فحص الانسجام السيميائي ودمج حماية الخصوصية، يوفر موردًا أكثر إعادة إنتاجية ومساءلة. في الوقت نفسه، تُذكرنا التدقيقات المستقلة بأن الحوافز الآلية لا يمكن أن تُزيل المخاطر完全ًا، مما يُبرز الحاجة إلى استمرار اليقظة.












