Modele și platforme AI

Quantum Stat lansează „Big Bad NLP Database”

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Quantum Stat a lansat „Big Bad NLP Database” într-un pas important pentru procesarea limbajului natural (NLP). Baza de date conține sute de seturi de date diferite pentru dezvoltatorii de învățare automată.

Conform companiei, aceasta oferă soluții pentru inițiativele NLP și AI. Acest lucru se realizează prin servicii precum preprocesarea datelor, dezvoltarea de aplicații web, abordări multifacetate care includ învățarea automată și rețelele neuronale profunde, gestionarea chatbot-urilor și a dialogului, precum și noua bază de date NLP.

Compania efectuează, de asemenea, cercetări primare și secundare pentru a ajuta indivizii să analizeze evoluțiile din industrii.

Centrul central al datelor NLP

Decizia de a crea baza de date, care este cea mai mare bibliotecă de date din procesarea limbajului natural, a apărut din nevoia unui centru central care să conțină datele NLP. Compania a urmărit să o facă mai ușor accesibilă și căutabilă decât alternativa, care adesea necesită ca cercetătorii să caute prin multiple biblioteci terțe.

Compania a dezvoltat baza de date timp de câteva săptămâni; în prezent, aceasta are aproximativ 200 de seturi de date. Există o varietate de seturi de date diferite, nu doar clasicele. Compania a inclus seturi de date precum CommonCrawl și Penn Treebank.

Împreună cu o gamă largă de baze de date diferite vin și sarcini NLP diferite. Există sarcini care se concentrează pe clasificare și răspunsuri la întrebări, dar există și seturi de date pentru text-to-SQL, recunoașterea vorbirii și multimodal.

Quantum Stat dorește ca baza de date să fie condusă de comunitate, cu contribuții de la utilizatori. Compania și-a deschis porțile pentru oricine să trimită un nou set de date sau să recomande modificări.

Un alt accent este pus pe adăugarea de seturi de date care diversifică limba, îndepărtându-se de limba engleză. Scopul lor este de a face biblioteca mai globală și mai accesibilă pentru alții.

La intrarea în „Big Bad NLP Database”, un utilizator va fi întâmpinat de un layout curat și organizat. Numele setului de date este listat, urmat de limba și o descriere detaliată. De asemenea, listează instanțe, format, sarcină, anul creației și creatorul. Fiecare bază de date are un link de descărcare.

Diverse baze de date

Se vor întâlni baze de date precum Historical Newspapers Daily World Time Series, care conține conținutul zilnic al ziarelor din SUA și Regatul Unit din 1836 până în 1922; SciQ Dataset, care conține 13.679 de întrebări de examen științific crowdsourcete în domeniile Fizicii, Biologiei și Chimiei; CommonCrawl, care conține date de pe 25 de miliarde de pagini web; și MovieLens, o bază de date care conține 22.000.000 de evaluări și 580.000 de etichete pentru 33.000 de filme de către 240.000 de utilizatori.

Baza de date impresionantă a Quantum Stat apare într-un moment în care cercetătorii necesită seturi de date mai mari și mai diverse datorită progreselor învățării profunde. Din cauza cantității masive de date conținute în limbajul uman, fiecare set de date unic face procesarea un pic mai ușoară. Progresul NLP se bazează pe aceste baze de date, iar Quantum Stat a contribuit la accelerarea acestui progres prin adunarea atâtor seturi de date într-un singur spațiu.

NLP va fi important în multe aspecte ale societății. Acesta poate ajuta la predicția bolilor pe baza înregistrărilor medicale electronice și a vorbirii pacientului, ajută companiile să afle ce spun clienții despre un produs și identifică știrile false într-o lume în care acestea proliferează.

Tehnologia avansează extrem de rapid, și nu va dura mult până când va fi capabilă să abordeze aceste aplicații complexe.

Alex McFarland este un jurnalist și scriitor de inteligență artificială, care explorează cele mai recente dezvoltări în domeniul inteligenței artificiale. El a colaborat cu numeroase startup-uri de inteligență artificială și publicații din întreaga lume.