AI-modeller och plattformar
Quantum Stat släpper “Big Bad NLP Database”

Quantum Stat har släppt sin “Big Bad NLP Database” i ett stort steg framåt för naturlig språkbehandling (NLP). Databasen innehåller hundratals olika datamängder för maskinläringsutvecklare att använda.
Enligt företaget erbjuder de lösningar för NLP- och AI-initiativ. De gör detta genom tjänster som förbehandling till webbapputveckling, en multifacetterad approach som inkluderar maskinlärning och djupa neurala nätverk, chatbot- och dialoghantering, och deras nya NLP-databas.
Företaget genomför också primär och sekundär forskning för att hjälpa individer att analysera utvecklingen inom branscherna.
Central Nav för NLP Data
Beslutet att skapa databasen, som är världens största datalager för naturlig språkbehandling, kom ur behovet av en central nav för att hålla NLP-data. Företaget syftade till att göra det mer lättillgängligt och sökbart än alternativen, som ofta kräver att forskare söker igenom flera tredjepartsbibliotek.
Företaget har utvecklat databasen under flera veckor; de har för närvarande runt 200 datamängder. Det finns en mängd olika datamängder, inte bara klassikerna. Företaget har inkluderat sådana som CommonCrawl och Penn Treebank.
Tillsammans med en mängd olika databaser kommer olika NLP-uppgifter. Det finns de som fokuserar på klassificering och frågesvar, men det finns också datamängder för text-till-SQL, taligenkänning och multimodal.
Quantum Stat vill att databasen ska vara community-driven med bidrag från användare. Företaget har öppnat sina dörrar för alla att skicka in en ny datamängd eller rekommendera ändringar.
En annan fokus är att lägga till datamängder som diversifierar språk, bort från att vara strikt engelska. Deras mål är att göra biblioteket mer globalt och tillgängligt för andra.
När man går in i “Big Bad NLP Database” kommer en användare att konfronteras med en ren och organiserad layout. Namnet på datamängden listas, följt av språk och en detaljerad beskrivning. Det listar också instanser, format, uppgift, år skapad och skapare. Varje databas har en länk för nedladdning.
Olka Databaser
Man kommer att stöta på databaser som Historical Newspapers Daily World Time Series dataset, som innehåller dagliga innehåll av tidningar i USA och Storbritannien från 1836 till 1922; SciQ Dataset, som innehåller 13 679 crowdsourcade vetenskapsprovfrågor inom fysik, biologi och kemi; CommonCrawl, som innehåller data från 25 miljarder webbsidor; och MovieLens, en datamängd som innehåller 22 000 000 betyg och 580 000 taggar för 33 000 filmer av 240 000 användare.
Quantum Stats imponerande databas kommer vid en tidpunkt då forskare kräver större och mer varierade datamängder på grund av framsteg inom djupinlärning. På grund av den enorma mängden data som finns inom mänskligt språk, gör varje unik datamängd det lite enklare att bearbeta. Utvecklingen av NLP är beroende av dessa databaser, och Quantum Stat har bidragit till att påskynda denna utveckling genom att samla så många datamängder på en plats.
NLP kommer att vara viktigt i många aspekter av samhället. Det kan hjälpa till att förutsäga sjukdomar baserat på elektroniska hälsoregister och en patients tal, hjälpa företag att ta reda på vad kunder säger om en produkt, och identifiera falska nyheter i en värld där de sprids i allt högre grad.
Teknologin utvecklas extremt snabbt, och det kommer inte att dröja länge innan den är kapabel att hantera dessa komplexa tillämpningar.












