Modelos y plataformas de IA

Quantum Stat lanza “Big Bad NLP Database”

mm
Añade Unite.AI a tus fuentes preferidas en Google

Quantum Stat ha lanzado su “Big Bad NLP Database” en lo que es un gran paso adelante para el procesamiento de lenguaje natural (NLP). La base de datos contiene cientos de conjuntos de datos diferentes para que los desarrolladores de aprendizaje automático los utilicen.

Según la empresa, proporcionan soluciones a las iniciativas de NLP y AI. Lo hacen a través de servicios como el preprocesamiento hasta el desarrollo de aplicaciones web, un enfoque multifacético que incluye aprendizaje automático y redes neuronales profundas, gestión de chatbots y diálogos, y su nueva base de datos de NLP.

La empresa también realiza investigaciones primarias y secundarias para ayudar a las personas a analizar los desarrollos dentro de las industrias.

Centro central de datos de NLP

La decisión de crear la base de datos, que es la biblioteca de datos más grande del mundo en procesamiento de lenguaje natural, surgió de la necesidad de un centro central para contener los datos de NLP. La empresa buscaba hacer que fuera más fácilmente accesible y searchable que la alternativa, que a menudo requiere que los investigadores busquen a través de múltiples bibliotecas de terceros.

La empresa ha estado desarrollando la base de datos durante varias semanas; actualmente tienen alrededor de 200 conjuntos de datos. Hay una variedad de conjuntos de datos diferentes, no solo los clásicos. La empresa ha incluido aquellos como CommonCrawl y Penn Treebank.

Junto con una variedad de bases de datos diferentes, vienen diferentes tareas de NLP. Hay aquellas que se centran en la clasificación y la respuesta a preguntas, pero también hay conjuntos de datos para text-to-SQL, reconocimiento de voz y multimodal.

Quantum Stat quiere que la base de datos sea impulsada por la comunidad con contribuciones de los usuarios. La empresa ha abierto sus puertas para que cualquier persona envíe un nuevo conjunto de datos o recomiende cambios.

Otro enfoque es agregar conjuntos de datos que diversifiquen el lenguaje, alejándose de ser estrictamente inglés. Su objetivo es hacer que la biblioteca sea más global y accesible para otros.

Al ingresar a la “Big Bad NLP Database”, un usuario se encontrará con un diseño limpio y organizado. El nombre del conjunto de datos se lista, seguido del lenguaje y una descripción detallada. También enumera instancias, formato, tarea, año de creación y creador. Cada base de datos tiene un enlace de descarga para seguir.

Varías bases de datos

Uno encontrará bases de datos como el conjunto de datos de periódicos históricos Daily World Time Series, que contiene los contenidos diarios de periódicos en EE. UU. y Reino Unido desde 1836 hasta 1922; el conjunto de datos SciQ, que contiene 13,679 preguntas de exámenes científicos crowdsourced en los campos de Física, Biología y Química; CommonCrawl, que contiene los datos de 25 mil millones de páginas web; y MovieLens, un conjunto de datos que contiene 22 millones de calificaciones y 580,000 etiquetas para 33,000 películas de 240,000 usuarios.

La impresionante base de datos de Quantum Stat llega en un momento en que los investigadores requieren conjuntos de datos más grandes y diversos debido a los avances en el aprendizaje profundo. Debido a la cantidad masiva de datos contenida en el lenguaje humano, cada conjunto de datos único hace que sea un poco más fácil procesar. El avance de NLP depende de estas bases de datos, y Quantum Stat ha contribuido a acelerar ese avance al reunir tantos conjuntos de datos en un solo espacio.

NLP será importante en muchos aspectos de la sociedad. Puede ayudar a predecir enfermedades basadas en registros de salud electrónicos y el habla de un paciente, ayudar a las empresas a descubrir lo que los clientes están diciendo sobre un producto, e identificar noticias falsas en un mundo donde abundan.

La tecnología está avanzando extremadamente rápido, y no pasará mucho tiempo antes de que sea capaz de abordar estas aplicaciones complejas.

Alex McFarland es un periodista y escritor de inteligencia artificial que explora los últimos desarrollos en inteligencia artificial. Ha colaborado con numerosas startups y publicaciones de inteligencia artificial en todo el mundo.