AI-modellen en platforms
Quantum Stat lanceert “Big Bad NLP Database”

Quantum Stat heeft hun “Big Bad NLP Database” gelanceerd, een grote stap voorwaarts voor natuurlijke taalverwerking (NLP). De database bevat honderden verschillende datasets voor machine learning-ontwikkelaars om te gebruiken.
Volgens het bedrijf biedt het oplossingen voor NLP- en AI-initiatieven. Ze doen dit door middel van diensten zoals voorverwerking tot webapplicatie-ontwikkeling, een multifacetteerde aanpak die machine learning en diepe neurale netwerken, chatbot- en dialoogbeheer en hun nieuwe NLP-database omvat.
Het bedrijf voert ook primair en secundair onderzoek uit om individuen te helpen bij het analyseren van de ontwikkelingen binnen de industrie.
Centraal knooppunt van NLP-gegevens
De beslissing om de database te creëren, die de grootste gegevensbibliotheek in natuurlijke taalverwerking ter wereld is, kwam voort uit de behoefte aan een centraal knooppunt om NLP-gegevens te bevatten. Het bedrijf streefde ernaar om het gemakkelijker toegankelijk en doorzoekbaar te maken dan de alternatieven, die vaak vereisen dat onderzoekers door meerdere derdepartijbibliotheken zoeken.
Het bedrijf werkt al enkele weken aan de database; ze hebben momenteel ongeveer 200 datasets. Er zijn verschillende soorten datasets, niet alleen de klassiekers. Het bedrijf heeft onder andere CommonCrawl en Penn Treebank opgenomen.
Naast een reeks verschillende databases komen verschillende NLP-taken. Er zijn die welke zich richten op classificatie en vraagbeantwoording, maar er zijn ook datasets voor tekst-naar-SQL, spraakherkenning en multimodaal.
Quantum Stat wil dat de database community-gedreven is met bijdragen van gebruikers. Het bedrijf heeft zijn deuren geopend voor iedereen om een nieuwe dataset te sturen of wijzigingen voor te stellen.
Een andere focus is om datasets toe te voegen die de taal diversifiëren, weggaand van het strikt Engels. Hun doel is om de bibliotheek wereldwijd toegankelijker te maken voor anderen.
Wanneer je de “Big Bad NLP Database” betreedt, word je geconfronteerd met een schone en georganiseerde lay-out. De naam van de dataset wordt vermeld, gevolgd door de taal en een gedetailleerde beschrijving. Het vermeldt ook instanties, formaat, taak, jaar van creatie en de maker. Elke database heeft een downloadlink om te volgen.
Verschillende databases
Je zult databases tegenkomen zoals de Historical Newspapers Daily World Time Series-dataset, die de dagelijkse inhoud van kranten in de VS en het VK van 1836 tot 1922 bevat; de SciQ-dataset, die 13.679 crowdsourced wetenschappelijke examenvragen in de vakken Fysica, Biologie en Scheikunde bevat; CommonCrawl, die gegevens van 25 miljard webpagina’s bevat; en MovieLens, een dataset die 22.000.000 beoordelingen en 580.000 tags voor 33.000 films van 240.000 gebruikers bevat.
De indrukwekkende database van Quantum Stat komt op een moment dat onderzoekers grotere en meer diverse datasets nodig hebben vanwege de vooruitgang in diepe leertheorie. Vanwege de enorme hoeveelheid gegevens in de menselijke taal maakt elke unieke dataset het een beetje gemakkelijker om te verwerken. De vooruitgang van NLP is afhankelijk van deze databases, en Quantum Stat heeft bijgedragen aan het versnellen van die vooruitgang door zo veel datasets in één ruimte te verzamelen.
NLP zal belangrijk zijn in veel aspecten van de samenleving. Het kan helpen bij het voorspellen van ziektes op basis van elektronische gezondheidsdossiers en een patiëntenspraak, helpen bedrijven ontdekken wat klanten over een product zeggen, en nepnieuws identificeren in een wereld waarin het overal aanwezig is.
De technologie ontwikkelt zich extreem snel, en het zal niet lang duren voordat het in staat is om deze complexe toepassingen aan te pakken.












