Modely a platformy AI
Quantum Stat vydal „Velkou špatnou NLP databázi“

Quantum Stat vydal svou „Velkou špatnou NLP databázi“ , což je velký krok vpřed pro zpracování přirozeného jazyka (NLP). Databáze obsahuje stovky různých datových sad pro vývojáře strojového učení.
Podle společnosti poskytuje řešení pro iniciativy NLP a AI. To dělají prostřednictvím služeb, jako je předzpracování až po vývoj webových aplikací, mnohostranný přístup, který zahrnuje strojové učení a hluboké neuronové sítě, správu chatbotů a dialogů a jejich novou NLP databázi.
Společnost také provádí primární a sekundární výzkum, aby pomohla jednotlivcům analyzovat vývoj v odvětvích.
Centrální hub NLP dat
Rozhodnutí vytvořit databázi, která je největší knihovnou dat v oblasti zpracování přirozeného jazyka, vyplynulo z potřeby centrálního hubu pro uchování NLP dat. Společnost se snažila učinit ji lépe přístupnou a vyhledatelnou než alternativy, které často vyžadují, aby výzkumníci procházeli multiple třetí strany knihovny.
Společnost vyvíjela databázi po několik týdnů; v současné době má kolem 200 datových sad. Existuje řada různých datových sad, nejen klasických. Společnost zahrnula datové sady, jako je CommonCrawl a Penn Treebank.
Spolu s různými databázemi přicházejí různé NLP úkoly. Existují ty, které se zaměřují na klasifikaci a zodpovězení otázek, ale existují také datové sady pro text-to-SQL, rozpoznávání řeči a multimodální.
Quantum Stat chce, aby byla databáze komunitně řízená s příspěvky od uživatelů. Společnost otevřela své dveře pro každého, kdo může poslat novou datovou sadu nebo doporučit změny.
Dalším zaměřením je přidání datových sad, které diverzifikují jazyk, odcházející od striktní angličtiny. Jejich cílem je učinit knihovnu více globální a přístupnou ostatním.
Po vstupu do „Velké špatné NLP databáze“ se uživatel setká s čistým a organizovaným rozložením. Jména datových sad jsou uvedena, následovaná jazykem a podrobným popisem. Také jsou uvedeny instance, formát, úkol, rok vytvoření a tvůrce. Každá databáze má odkaz ke stažení.
Různé databáze
Jedna se setká s databázemi, jako je Historical Newspapers Daily World Time Series dataset, obsahující denní obsah novin ve Spojených státech a Velké Británii z roku 1836 až 1922; SciQ Dataset, obsahující 13 679 crowdsourcovaných vědeckých otázek z oblastí fyziky, biologie a chemie; CommonCrawl, obsahující data z 25 miliard webových stránek; a MovieLens, dataset obsahující 22 000 000 hodnocení a 580 000 tagů pro 33 000 filmů od 240 000 uživatelů.
Impozantní databáze Quantum Stat přichází v době, kdy výzkumníci vyžadují větší a rozmanitější datové sady kvůli pokrokům v hlubokém učení. Vzhledem k obrovskému množství dat obsažených v lidském jazyce každá jedinečná datová sada usnadňuje zpracování. Pokrok v NLP závisí na těchto databázích a Quantum Stat přispěl k urychlení tohoto pokroku shromážděním mnoha datových sad na jednom místě.
NLP bude důležitý v mnoha aspektech společnosti. Může pomoci předpovídat nemoci na základě elektronických zdravotních záznamů a řeči pacienta, pomoci společnostem zjistit, co zákazníci říkají o produktu, a identifikovat falešné zprávy ve světě, kde se rozmáhají.
Technologie se vyvíjí extrémně rychle a nebude trvat dlouho, než bude schopna řešit tyto komplexní aplikace.












