نماذج ومنصات الذكاء الاصطناعي
إطلاق Quantum Stat لبيانات “قاعدة بيانات NLP السيئة”

أطلقت Quantum Stat “قاعدة بيانات NLP السيئة” في خطوة كبيرة نحو تقدم معالجة اللغة الطبيعية (NLP). وتحتوي القاعدة على مئات من مجموعات البيانات المختلفة لاستخدام مطوري التعلم الآلي.
وفقًا للشركة، توفر حلولًا لمبادرات NLP وذكاء اصطناعي. وتقوم بذلك من خلال خدمات مثل المعالجة المسبقة إلى تطوير التطبيقات على الويب، وهي نهج متعدد الأوجه يتضمن التعلم الآلي والشبكات العصبية العميقة وإدارة المحادثة وال聊بوت وقاعدة بيانات NLP الجديدة.
كما تقوم الشركة بإجراء بحث أولي وثانوي لمساعدة الأفراد على تحليل التطورات داخل الصناعات.
المركز الرئيسي لبيانات NLP
جاءت فكرة إنشاء القاعدة من الحاجة إلى مركز رئيسي لبيانات NLP. وهدف الشركة إلى جعلها أكثر سهولة في الوصول إليها والبحث عنها مقارنة بالبديل الذي يحتاج الباحثون إلى البحث في مكتبات ثالثة متعددة.
لقد كانت الشركة تعمل على تطوير القاعدة لعدد من الأسابيع؛ وهي تحتوي حاليًا على حوالي 200 مجموعة بيانات. وهناك مجموعة متنوعة من مجموعات البيانات المختلفة، وليس فقط الكلاسيكية. وقد أدرجت الشركة تلك مثل CommonCrawl وPenn Treebank.
إلى جانب مجموعة من قواعد البيانات المختلفة تأتي مهام NLP المختلفة. وهناك مهام تركز على التصنيف والإجابة على الأسئلة، ولكن هناك أيضًا مجموعات بيانات لتحويل النص إلى SQL والتعرف على الكلام والطريقة المتعددة.
تريد Quantum Stat أن تكون القاعدة مدفوعة بالمجتمع مع مساهمات من المستخدمين. وقد فتحت الشركة أبوابها لأي شخص لإرسال مجموعة بيانات جديدة أو توصية بالتغييرات.
التركيز الآخر هو إضافة مجموعات بيانات لتتنوع اللغة، مبتعدة عن كونها مقتصرة على اللغة الإنجليزية فقط. والهدف هو جعل المكتبة أكثر عالمية وسهولة الوصول إليها للآخرين.
عند الدخول إلى “قاعدة بيانات NLP السيئة”، سيواجه المستخدم تخطيطًا نظيفًا ومنظمًا. يتم سرد اسم مجموعة البيانات، يليها اللغة ووصف مفصل. كما أنها تسرد الحالات والتنسيق والمهمة وسنة الإنشاء والمنشئ. وتحتوي كل قاعدة بيانات على رابط لتحميلها.
قواعد بيانات مختلفة
ستجد قواعد بيانات مثل Historical Newspapers Daily World Time Series، التي تحتوي على محتوى يومي من الصحف في الولايات المتحدة والمملكة المتحدة من 1836 إلى 1922؛ وSciQ Dataset، التي تحتوي على 13679 سؤال اختبار علوم تم جمعه من خلال الحشد في مجالات الفيزياء والأحياء والكيمياء؛ وCommonCrawl، التي تحتوي على بيانات من 25 مليار صفحة ويب؛ وMovieLens، وهي قاعدة بيانات تحتوي على 22000000 تقييم و580000 علامة ل33000 فيلم من قبل 240000 مستخدم.
تأتي قاعدة بيانات Quantum Stat الرائعة في وقت يحتاج فيه الباحثون إلى مجموعات بيانات أكبر وأكثر تنوعًا بسبب التطورات في التعلم العميق. وبسبب الكم الهائل من البيانات الموجودة في اللغة البشرية، فإن كل مجموعة بيانات فريدة تجعل من عملية معالجة اللغة أسهل قليلاً. ويعتمد تقدم NLP على هذه القواعد البيانية، وقد ساهمت Quantum Stat في تعجيل هذا التقدم من خلال جمع العديد من مجموعات البيانات في مساحة واحدة.
ستكون NLP مهمة في العديد من جوانب المجتمع. يمكنها مساعدة في التنبؤ بالأمراض بناءً على السجلات الصحية الإلكترونية وخطاب المريض، ومساعدة الشركات على معرفة ما يقوله العملاء عن منتج، وتحديد الأخبار الكاذبة في عالم ينتشر فيه الكذب.
تتقدم التكنولوجيا بسرعة كبيرة، ولن يكون طويلاً قبل أن تكون قادرة على التعامل مع هذه التطبيقات المعقدة.












