โมเดลและแพลตฟอร์ม AI

Quantum Stat เปิดตัว “Big Bad NLP Database”

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

Quantum Stat ได้เปิดตัว “Big Bad NLP Database” ซึ่งเป็นขั้นตอนสำคัญสำหรับการประมวลผลภาษาธรรมชาติ (NLP) ฐานข้อมูลนี้มีหลายร้อยชุดข้อมูลสำหรับนักพัฒนาการเรียนรู้ของเครื่อง

ตามที่บริษัทระบุว่า พวกเขามอบโซลูชันสำหรับ NLP และ AI โดยให้บริการตั้งแต่การประมวลผลข้อมูลเบื้องต้นไปจนถึงการพัฒนาเว็บแอป โดยใช้แนวทางที่หลากหลาย รวมถึงการเรียนรู้ของเครื่องและเครือข่ายประสาทลึก การจัดการแชทบอทและการสนทนา และฐานข้อมูล NLP ใหม่

บริษัทยังดำเนินการวิจัยเบื้องต้นและเบื้องต้นเพื่อช่วยให้บุคคลสามารถวิเคราะห์การพัฒนาภายในอุตสาหกรรม

ศูนย์กลางข้อมูล NLP

การตัดสินใจในการสร้างฐานข้อมูล ซึ่งเป็นห้องสมุดข้อมูลที่ใหญ่ที่สุดในโลกสำหรับการประมวลผลภาษาธรรมชาติ เกิดจากความจำเป็นในการมีศูนย์กลางสำหรับข้อมูล NLP บริษัทมีเป้าหมายที่จะทำให้ข้อมูลนี้สามารถเข้าถึงและค้นหาได้ง่ายกว่าในทางเลือกอื่น ๆ ซึ่งมักต้องค้นหาในห้องสมุดของบุคคลที่สามหลายแห่ง

บริษัทได้พัฒนาฐานข้อมูลนี้เป็นเวลาหลายสัปดาห์ และปัจจุบันมีฐานข้อมูลประมาณ 200 ชุด มีหลายประเภทของฐานข้อมูล ไม่ใช่แค่คลาสสิกเท่านั้น บริษัทได้เพิ่มฐานข้อมูล เช่น CommonCrawl และ Penn Treebank

ร่วมกับฐานข้อมูลที่หลากหลาย มีงาน NLP ที่หลากหลาย เช่น การจัดประเภทและการตอบคำถาม แต่ยังมีฐานข้อมูลสำหรับข้อความไปยัง SQL การรู้จำเสียง และแบบหลายรูปแบบ

Quantum Stat ต้องการให้ฐานข้อมูลนี้เป็นฐานข้อมูลที่ขับเคลื่อนด้วยชุมชน โดยมีส่วนร่วมจากผู้ใช้ บริษัทได้เปิดโอกาสให้ทุกคนสามารถส่งฐานข้อมูลใหม่หรือแนะนำการเปลี่ยนแปลง

จุดมุ่งเน้นอีกประการหนึ่งคือการเพิ่มฐานข้อมูลที่มีภาษาที่หลากหลาย โดยไม่จำกัดเฉพาะภาษาอังกฤษเท่านั้น เป้าหมายคือการทำให้ห้องสมุดนี้เป็นแบบโลกและสามารถเข้าถึงได้โดยผู้คนจากทั่วโลก

เมื่อเข้าไปใน “Big Bad NLP Database” ผู้ใช้จะพบกับหน้าจอที่เรียบง่ายและจัดระเบียบ ชื่อของฐานข้อมูลจะแสดงตามด้วยภาษาและคำอธิบายที่ละเอียด รวมถึงจำนวนรายการ รูปแบบ งาน ปีที่สร้าง และผู้สร้าง แต่ละฐานข้อมูลมีลิงก์สำหรับการดาวน์โหลด

ฐานข้อมูลต่าง ๆ

ผู้ใช้จะพบฐานข้อมูล เช่น Historical Newspapers Daily World Time Series dataset ซึ่งมีเนื้อหาวันละของหนังสือพิมพ์ในสหรัฐอเมริกาและอังกฤษตั้งแต่ปี 1836 ถึง 1922; SciQ Dataset ซึ่งมีคำถามวิทยาศาสตร์ 13,679 คำถามที่รวบรวมจากแหล่งต่าง ๆ ในสาขาฟิสิกส์ ชีววิทยา และเคมี; CommonCrawl ซึ่งมีข้อมูลจาก 25 พันล้านหน้าเว็บ; และ MovieLens ซึ่งเป็นฐานข้อมูลที่มีการให้คะแนน 22 ล้านครั้งและแท็ก 580,000 รายการสำหรับภาพยนตร์ 33,000 เรื่องโดยผู้ใช้ 240,000 คน

ฐานข้อมูลที่น่าประทับใจของ Quantum Stat เกิดขึ้นในช่วงเวลาที่นักวิจัยต้องการฐานข้อมูลที่ใหญ่ขึ้นและหลากหลายขึ้น เนื่องจากความก้าวหน้าในการเรียนรู้ลึก เนื่องจากภาษามนุษย์มีข้อมูลจำนวนมาก แต่ละฐานข้อมูลจึงช่วยให้การประมวลผลง่ายขึ้น ความก้าวหน้าของ NLP ขึ้นอยู่กับฐานข้อมูลเหล่านี้ และ Quantum Stat ได้ช่วยเร่งความก้าวหน้านี้โดยรวบรวมฐานข้อมูลหลายร้อยชุดในพื้นที่เดียว

NLP จะมีความสำคัญในหลายด้านของสังคม สามารถช่วยให้สามารถคาดการณ์โรคได้โดยอาศัยบันทึกสุขภาพอิเล็กทรอนิกส์และคำพูดของผู้ป่วย ช่วยให้บริษัทต่างๆ รู้ว่าลูกค้ากำลังพูดถึงผลิตภัณฑ์ของตนอย่างไร และสามารถระบุข่าวปลอมในโลกที่ข่าวปลอมแพร่กระจาย

เทคโนโลยีนี้กำลังก้าวหน้าอย่างรวดเร็ว และจะไม่นานก่อนที่จะสามารถจัดการกับแอปพลิเคชันที่ซับซ้อนเหล่านี้ได้

Alex McFarland เป็นนักข่าวและนักเขียน AI ที่สำรวจการพัฒนาล่าสุดในด้านปัญญาประดิษฐ์ เขาได้ร่วมงานกับสตาร์ทอัพ AI และสื่อสิ่งพิมพ์ต่างๆ ทั่วโลก