Modele i platformy AI

Quantum Stat wydaje „Big Bad NLP Database”

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Quantum Stat wydał swój „Big Bad NLP Database”, co jest dużym krokiem naprzód dla przetwarzania języka naturalnego (NLP). Baza danych zawiera setki różnych zestawów danych dla deweloperów machine learning.

Według firmy, świadczą usługi związane z NLP i inicjatywami AI. Robią to poprzez usługi takie jak preprocessing, rozwój aplikacji internetowych, wieloaspektowe podejście, które obejmuje machine learning i głębokie sieci neuronowe, zarządzanie czatbotami i dialogami, oraz nową bazę danych NLP.

Firma prowadzi również badania podstawowe i wtórne, aby pomóc osobom analizować rozwój w branży.

Centralny hub danych NLP

Decyzja o stworzeniu bazy danych, która jest największą biblioteką danych w przetwarzaniu języka naturalnego, wynikła z potrzeby stworzenia centralnego hubu do przechowywania danych NLP. Firma miała na celu uczynienie go bardziej dostępnym i przeszukiwalnym niż alternatywa, która często wymaga od badaczy przeszukiwania wielu bibliotek trzecich.

Firma rozwijała bazę danych przez wiele tygodni; obecnie mają około 200 zestawów danych. Jest wiele różnych zestawów danych, nie tylko tych klasycznych. Firma uwzględniła takie jak CommonCrawl i Penn Treebank.

Wraz z różnymi bazami danych pojawiają się różne zadania NLP. Są takie, które koncentrują się na klasyfikacji i odpowiedziach na pytania, ale są również zestawy danych dla text-to-SQL, rozpoznawania mowy i multimodalnych.

Quantum Stat chce, aby baza danych była napędzana przez społeczność, z wkładem od użytkowników. Firma otworzyła swoje drzwi dla każdego, kto chce wysłać nowy zestaw danych lub polecić zmiany.

Innym celem jest dodanie zestawów danych, które zróżnicują język, oddalając się od ograniczenia do języka angielskiego. Ich celem jest uczynienie biblioteki bardziej globalną i dostępną dla innych.

Po wejściu do „Big Bad NLP Database” użytkownik zostanie skonfrontowany z czystym i zorganizowanym układem. Nazwa zestawu danych jest wymieniona, po której następuje język i szczegółowy opis. Wyświetla również instancje, format, zadanie, rok utworzenia i twórcę. Każda baza danych ma link do pobrania.

Różne bazy danych

Można spotkać bazy danych takie jak Historical Newspapers Daily World Time Series, zawierające codzienne treści gazet w USA i Wielkiej Brytanii z 1836 do 1922; SciQ Dataset, zawierający 13 679 crowdsourced pytań egzaminacyjnych z dziedziny fizyki, biologii i chemii; CommonCrawl, zawierający dane z 25 miliardów stron internetowych; oraz MovieLens, zestaw danych zawierający 22 000 000 ocen i 580 000 tagów dla 33 000 filmów od 240 000 użytkowników.

Impresyjna baza danych Quantum Stat pojawia się w momencie, gdy badacze wymagają większych i bardziej zróżnicowanych zestawów danych z powodu postępów w głębokim uczeniu. Z powodu ogromnej ilości danych zawartych w języku ludzkim, każdy unikalny zestaw danych sprawia, że jest nieco łatwiej go przetwarzać. Rozwój NLP opiera się na tych bazach danych, a Quantum Stat przyczynił się do przyspieszenia tego rozwoju, gromadząc wiele zestawów danych w jednym miejscu.

NLP będzie istotne w wielu aspektach społeczeństwa. Może pomóc w przewidywaniu chorób na podstawie elektronicznych kart zdrowia i mowy pacjenta, pomóc firmom dowiedzieć się, co klienci mówią o produkcie, oraz identyfikować fałszywe wiadomości w świecie, w którym się one rozpowszechniają.

Technologia ta rozwija się niezwykle szybko i nie minie dużo czasu, zanim będzie w stanie poradzić sobie z tymi złożonymi aplikacjami.

Alex McFarland jest dziennikarzem i pisarzem zajmującym się sztuczną inteligencją, który bada najnowsze rozwoje w dziedzinie sztucznej inteligencji. Współpracował z licznymi startupami i wydawnictwami związanymi z sztuczną inteligencją na całym świecie.