نماذج ومنصات الذكاء الاصطناعي

DataGen تامن 18 مليون دولار في الاستثمارات لإنشاء بيانات اصطناعية لبرامج الذكاء الاصطناعي

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

raised شركة DataGen الإسرائيلية حديثًا 18.5 مليون دولار لتمويل إنشاء منصة مخصصة لإنتاج بيانات اصطناعية لشركات الذكاء الاصطناعي.

تواجه كل شركة ذكاء اصطناعي تحديًا أساسيًا ، وهو جمع البيانات اللازمة لتدريب نماذج الذكاء الاصطناعي. إن الحاجة إلى بيانات تدريب عالية الجودة كبيرة لدرجة أنها أدت إلى Appearance صناعة فرعية مخصصة لتزويد شركات الذكاء الاصطناعي بالبيانات التي تحتاجها لتدريب نماذجها. دائمًا ما تبحث شركات الذكاء الاصطناعي وشركات الذكاء الاصطناعي ذات الصلة عن طرق جديدة للحصول على البيانات التي تحتاجها. أحد الطرق للحصول على هذه البيانات التدريبية هو ببساطة التخيل أو إنشاء البيانات.

كما ذكرت مجلة Fortune ، تتخصص DataGen في استخدام نماذج التعلم الآلي الخاصة بها لإنشاء بيانات اصطناعية لشركات أخرى لتدريب نماذجها ، خاصة البيانات الصورية والفيديوية. يتم استخدام البيانات التي تم إنشاؤها بواسطة الشركة من قبل عملائها لتدريب نماذج الذكاء الاصطناعي الخاصة بهم. وفقًا لما قالته Ofir Chakon ، الرئيس التنفيذي ومؤسس DataGen ، يمكن للشركة إنشاء مجموعة بيانات اصطناعية كاملة لشركة عميل في غضون بضع ساعات. هذا أسرع بكثير من الوقت الذي يُستغرق عادةً لتحضير مجموعة بيانات للاستخدام ، والذي غالبًا ما يكون أسابيع أو أشهر من وضع علامات على البيانات.

هناك أسباب أخرى تجعل البيانات الاصطناعية جذابة للشركات ، بخلاف السرعة النسبية التي يمكن إعدادها بها. لا تأتي البيانات الاصطناعية مع aynı المخاوف المتعلقة بالخصوصية مثل البيانات الحقيقية. مع إنشاء المزيد من القوانين لحماية خصوصية البيانات ، تصبح البيانات التدريبية الاصطناعية أكثر جاذبية. يتنبأ أحد التقديرات المقدمة من شركة تحليلات التكنولوجيا Gartner بأن حوالي 65٪ من سكان العالم سيكونون محميين بقانون بعض أنواع خصوصية البيانات بحلول عام 2023.

على الرغم من أن البيانات الاصطناعية ليست dựa على أشخاص حقيقيين ، إلا أنها يمكن أن تكون متحيزة. سيكون للبيانات التي يتم إنشاؤها بواسطة نموذج البيانات الاصطناعية نفس الأنماط التي كان نموذج التدريب الأصلي عليها ، مما يعني أنه إذا كان مجموعة البيانات متحيزة ، فإن التحيزات نفسها سوف توجد في البيانات الجديدة التي تم إنشاؤها. لدى DataGen استراتيجيات لتقليل تحيز البيانات في البيانات التي تم إنشاؤها. أحد الطرق لتقليل التحيز في البيانات الاصطناعية هو زيادة معدل حدوث الأحداث النادرة ، مما يعني أنه إذا كانت فئة واحدة في مجموعة البيانات تمثيلها أقل ، يمكن تعزيز معدل حدوثها إلى شيء أكثر مساواة.

تعتبر تقنية تعزيز حدوث الأحداث النادرة مهمة جدًا عند إنشاء مجموعات بيانات تتضمن سيناريوهات محتملة الخطورة. افكر في مجموعة بيانات تستخدم لتدريب مركبة ذاتية القيادة. يجب أن يستجيب المركب بشكل موثوق به لالأحداث النادرة ، مثل انفتاح حفرة في الطريق. ومع ذلك ، هذه الأحداث نادرة جدًا ، والحصول على بيانات تدريبية لهذه الأحداث صعب. لهذا السبب ، غالبًا ما تحتاج بيانات التدريب لهذه الأحداث النادرة إلى إنشائها.

كما أشار Chakon من خلال Fortune:

“لدينا عملاء لديهم سيطرة كاملة على جميع المعاملات التي تدخل في البيانات التي يخلقونها. التأثير الحقيقي هو أنه بمجرد النشر ، يمكنك أن تكون متأكدًا من أنها ستعمل جيدًا في مجالات مختلفة ، مع أعراق مختلفة ، في مواقع جغرافية مختلفة أو أي بيئة يمكنك تخيلها.”

تستخدم DataGen شبكات المنافسة التوليدية (GANs) لإنشاء محاكاة واقعية للعناصر والأحداث في العالم الحقيقي. أشار Chakon إلى أن الشركة يمكنها إنشاء أمثلة واقعية لجميع الأشياء التي تتضمن بيئات داخلية أو إدراكًا بشريًا. على سبيل المثال ، يمكن أن تحتوي مجموعة بيانات الصور التي تم إنشاؤها بواسطة DataGen على أمثلة للأشياء المستخدمة لتدريب ذراع اختيار آلي يستخدم لوجستيات المستودعات ، مع أن الصور المُنشأة تبدو لا تختلف عن الحقيقية. يمكن لبرنامج DataGen إنشاء كائنات ثلاثية الأبعاد عن طريق الجمع بين شبكة بصرية ونظام محاكاة فيزيائية.

يضم مستثمرو DataGen مجموعة متنوعة من الأفراد والشركات ذوي الشهرة العالية. يشمل المستثمرون مديري قسم البحث والتطوير في Nvidia (NVDA ) و Max Plank Institute for Intelligent Systems ، بالإضافة إلى Anthony Goldbloom ، الرئيس التنفيذي لشركة Kaggle.

مدون وبرمجي متخصص في مواضيع Machine Learning و Deep Learning. يأمل دانيال في مساعدة الآخرين على استخدام قوة الذكاء الاصطناعي من أجل الخير الاجتماعي.