AI-modeller og platforme

Quantum Stat udgiver “Big Bad NLP Database”

mm
Føj Unite.AI til dine foretrukne kilder på Google

Quantum Stat har udgivet deres “Big Bad NLP Database”, hvilket er et stort skridt fremad for naturlig sprogbehandling (NLP). Databasen indeholder hundredvis af forskellige datasæt, som maskinlæringsudviklere kan benytte. 

Ifølge virksomheden tilbyder de løsninger til NLP- og AI-initiativer. De gør dette gennem tjenester som forarbejdning til webapp-udvikling, en multifacetteret tilgang, der inkluderer maskinlæring og dybe neurale netværk, chatbot- og dialogstyring samt deres nye NLP-database. 

Virksomheden udfører også primær og sekundær forskning for at hjælpe personer med at analysere udviklingen inden for brancherne. 

Centralt Hub for NLP-Data

Beslutningen om at oprette databasen, der er verdens største datalager for naturlig sprogbehandling, kom af behovet for et centralt hub til at holde NLP-data. Virksomheden havde til formål at gøre det mere let tilgængeligt og søgbart end alternativet, der ofte kræver, at forskere søger gennem multiple tredjepartsbiblioteker. 

Virksomheden har været i gang med at udvikle databasen i flere uger; de har i øjeblikket omkring 200 datasæt. Der er en række forskellige datasæt, ikke kun klassikerne. Virksomheden har inkluderet datasæt som CommonCrawl og Penn Treebank. 

Sammen med en række forskellige databaser følger forskellige NLP-opgaver. Der er dem, der fokuserer på klassificering og spørgsmålssvarelse, men der er også datasæt for tekst-til-SQL, talegenkendelse og multimodal. 

Quantum Stat ønsker, at databasen skal være community-dreven med bidrag fra brugere. Virksomheden har åbnet dørene for, at alle kan sende et nyt datasæt eller anbefale ændringer. 

Et andet fokus er at tilføje datasæt, der diversificerer sprog, og bevæger sig væk fra kun at være engelsk. Deres mål er at gøre biblioteket mere globalt og tilgængeligt for andre. 

Når man går ind i “Big Bad NLP Database”, konfronteres man med en ren og organiseret layout. Navnet på datasættet er listet, efterfulgt af sprog og en detaljeret beskrivelse. Det lister også instanser, format, opgave, år skabt og skaberen. Hver database har en download-link til at følge. 

Forskellige Databaser

Man vil møde databaser som Historical Newspapers Daily World Time Series-datasæt, der indeholder daglige indhold af aviser i USA og Storbritannien fra 1836 til 1922; SciQ-datasæt, der indeholder 13.679 crowdsourced videnskabsprøvespørgsmål inden for fagene fysik, biologi og kemi; CommonCrawl, der indeholder data fra 25 milliarder websteder; og MovieLens, et datasæt, der indeholder 22.000.000 vurderinger og 580.000 tags for 33.000 film af 240.000 brugere. 

Quantum Stats imponerende database kommer på et tidspunkt, hvor forskere kræver større og mere diverse datasæt på grund af fremskridt i dyb læring. På grund af den massive mængde data, der er indeholdt i menneskesprog, gør hver enkelt datasæt det lidt lettere at bearbejde. Fremgangen i NLP afhænger af disse databaser, og Quantum Stat har bidraget til at fremskynde denne fremgang ved at samle så mange datasæt på ét sted. 

NLP vil være vigtigt i mange aspekter af samfundet. Det kan hjælpe med at forudsige sygdomme baseret på elektroniske sundhedsjournaler og en patients tale, hjælpe virksomheder med at finde ud af, hvad kunder siger om et produkt, og identificere falske nyheder i en verden, hvor det er meget udbredt. 

Teknologien udvikler sig ekstremt hurtigt, og det vil ikke være længe, før den er i stand til at tackle disse komplekse anvendelser. 

Alex McFarland er en AI-journalist og forfatter, der udforsker de seneste udviklinger inden for kunstig intelligens. Han har samarbejdet med talrige AI-startups og publikationer verden over.