Modelli e piattaforme di IA

Quantum Stat Rilascia “Big Bad NLP Database”

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Quantum Stat ha rilasciato il suo “Big Bad NLP Database” in quello che è un grande passo avanti per l’elaborazione del linguaggio naturale (NLP). Il database contiene centinaia di diversi set di dati per gli sviluppatori di apprendimento automatico. 

Secondo l’azienda, forniscono soluzioni per le iniziative NLP e AI. Ciò avviene attraverso servizi come la pre-elaborazione, lo sviluppo di web app, un approccio multifacético che include l’apprendimento automatico e le reti neurali profonde, la gestione dei chatbot e del dialogo, e il loro nuovo database NLP. 

L’azienda conduce anche ricerche primarie e secondarie per aiutare gli individui ad analizzare gli sviluppi all’interno dei settori. 

Centro Centrale dei Dati NLP

La decisione di creare il database, che è la più grande libreria di dati nel mondo dell’elaborazione del linguaggio naturale, è nata dalla necessità di un centro centrale per contenere i dati NLP. L’azienda ha mirato a renderlo più facilmente accessibile e ricercabile rispetto all’alternativa, che spesso richiede ai ricercatori di cercare attraverso molte librerie di terze parti. 

L’azienda sta sviluppando il database da diverse settimane; attualmente hanno circa 200 set di dati. Ci sono una varietà di diversi set di dati, non solo i classici. L’azienda ha incluso quelli come CommonCrawl e Penn Treebank. 

Insieme a una gamma di diversi database, ci sono diversi compiti NLP. Ci sono quelli che si concentrano sulla classificazione e sulle risposte alle domande, ma ci sono anche set di dati per il testo-to-SQL, il riconoscimento vocale e il multi-modale. 

Quantum Stat vuole che il database sia guidato dalla comunità con contributi degli utenti. L’azienda ha aperto le sue porte a chiunque per inviare un nuovo set di dati o raccomandare modifiche. 

Un altro obiettivo è quello di aggiungere set di dati che diversificano la lingua, allontanandosi dall’essere strettamente inglese. Il loro obiettivo è quello di rendere la libreria più globale e accessibile agli altri. 

Entrando nel “Big Bad NLP Database”, un utente sarà confrontato con un layout pulito e organizzato. Il nome del set di dati è elencato, seguito dalla lingua e da una descrizione dettagliata. Elenca anche istanze, formato, compito, anno di creazione e creatore. Ogni database ha un link di download da seguire. 

Database Vari

Si incontreranno database come Historical Newspapers Daily World Time Series, contenente i contenuti quotidiani dei giornali negli Stati Uniti e nel Regno Unito dal 1836 al 1922; SciQ Dataset, contenente 13.679 domande di esami scientifici crowdsourced nei campi di Fisica, Biologia e Chimica; CommonCrawl, contenente i dati di 25 miliardi di pagine web; e MovieLens, un set di dati contenente 22.000.000 di valutazioni e 580.000 tag per 33.000 film di 240.000 utenti. 

Il database impressionante di Quantum Stat arriva in un momento in cui i ricercatori richiedono set di dati più grandi e più diversificati a causa degli avanzamenti dell’apprendimento profondo. A causa della grande quantità di dati contenuti nel linguaggio umano, ogni set di dati unico rende un po’ più facile l’elaborazione. L’avanzamento dell’NLP dipende da questi database e Quantum Stat ha contribuito ad accelerare quell’avanzamento raccogliendo così tanti set di dati in un unico spazio. 

L’NLP sarà importante in molti aspetti della società. Può aiutare a prevedere le malattie in base ai registri sanitari elettronici e al discorso di un paziente, aiutare le aziende a scoprire cosa i clienti stanno dicendo di un prodotto e identificare le notizie false in un mondo in cui sono molto diffuse. 

La tecnologia sta avanzando estremamente rapidamente e non sarà lungo tempo prima che sia in grado di affrontare queste applicazioni complesse. 

Alex McFarland è un giornalista e scrittore di intelligenza artificiale che esplora gli ultimi sviluppi nel campo dell'intelligenza artificiale. Ha collaborato con numerose startup di intelligenza artificiale e pubblicazioni in tutto il mondo.