AI-modeller og plattformer

Quantum Stat lanserer “Big Bad NLP Database”

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Quantum Stat har lansert sin “Big Bad NLP Database” i et stort skritt fremover for naturlig språkbehandling (NLP). Databasen inneholder hundrevis av ulike datasett for maskinlæringsutviklere å bruke.

Ifølge selskapet tilbyr de løsninger for NLP- og AI-initiativer. De gjør dette gjennom tjenester som forbehandling til webapplikasjonsutvikling, en multifaset tilnærming som inkluderer maskinlæring og dypt neuralt nettverk, chatbot og dialogstyring, og deres nye NLP-database.

Selskapet utfører også primær og sekundær forskning for å hjelpe enkeltpersoner med å analysere utviklingen innen bransjene.

Sentral hub for NLP-data

Beslutningen om å lage databasen, som er verdens største datalibrer i naturlig språkbehandling, kom ut av behovet for en sentral hub å holde NLP-data. Selskapet ønsket å gjøre det mer lett tilgjengelig og søkbart enn alternativet, som ofte krever at forskere søker gjennom flere tredjepartsbiblioteker.

Selskapet har utviklet databasen i flere uker; de har for øyeblikket rundt 200 datasett. Det er en rekke ulike datasett, ikke bare klassikerne. Selskapet har inkludert slike som CommonCrawl og Penn Treebank.

I tillegg til en rekke ulike databaser kommer ulike NLP-oppdrag. Det er de som fokuserer på klassifisering og spørsmålssvar, men det er også datasett for tekst-til-SQL, talegjenkjenning og multimodal.

Quantum Stat ønsker at databasen skal være samfunnsdrevet med bidrag fra brukerne. Selskapet har åpnet dørene for at noen kan sende inn et nytt datasett eller anbefale endringer.

En annen fokus er å legge til datasett som diversifiserer språk, og gå bort fra å være strengt engelsk. Deres mål er å gjøre biblioteket mer globalt og tilgjengelig for andre.

Ved å gå inn i “Big Bad NLP Database” vil en bruker bli konfrontert med en ren og organisert layout. Navnet på datasettet er listet, fulgt av språk og en detaljert beskrivelse. Det lister også instanser, format, oppdrag, år opprettet og skaperen. Hver database har en nedlastingslenke å følge.

Ulike databaser

En vil møte databaser som Historical Newspapers Daily World Time Series dataset, som inneholder daglige innhold av aviser i USA og Storbritannia fra 1836 til 1922; SciQ Dataset, som inneholder 13 679 crowdsourced vitenskapsprøver i fagene fysikk, biologi og kjemi; CommonCrawl, som inneholder data fra 25 milliarder nettsider; og MovieLens, en dataset som inneholder 22 000 000 vurderinger og 580 000 merker for 33 000 filmer av 240 000 brukere.

Quantum Stats imponerende database kommer på et tidspunkt når forskere trenger større og mer diverse datasett på grunn av fremgangen i dyp læring. På grunn av den massive mengden data som er inneholdt i menneskelig språk, gjør hver enkelt datasett det litt enklere å prosessere. Fremgangen i NLP avhenger av disse databasene, og Quantum Stat har bidratt til å påskynde denne fremgangen ved å samle så mange datasett på ett sted.

NLP vil være viktig i mange aspekter av samfunnet. Det kan hjelpe med å forutsi sykdommer basert på elektroniske helsejournaler og en pasients tale, hjelpe selskaper med å finne ut hva kunder sier om et produkt, og identifisere falske nyheter i en verden hvor det er vanlig.

Teknologien utvikler seg ekstremt raskt, og det vil ikke være lenge før det er i stand til å håndtere disse komplekse applikasjonene.

Alex McFarland er en AI-journalist og forfatter som utforsker de nyeste utviklingene innen kunstig intelligens. Han har samarbeidet med tallrike AI-startups og publikasjoner verden over.