Модели и платформы ИИ

Quantum Stat выпускает «Большую Плохую Базу Данных NLP»

mm
Добавьте Unite.AI в избранные источники в Google

Quantum Stat выпустила свою «Большую Плохую Базу Данных NLP» в рамках большого шага вперед в области обработки естественного языка (NLP). База данных содержит сотни различных наборов данных для разработчиков машинного обучения.

По словам компании, они предоставляют решения для инициатив NLP и ИИ. Они делают это через услуги, такие как предварительная обработка, разработка веб-приложений, многофакторный подход, который включает машинное обучение и глубокие нейронные сети, управление чат-ботами и диалогами, а также свою новую базу данных NLP.

Компания также проводит первичные и вторичные исследования, чтобы помочь людям анализировать развитие отраслей.

Центральный Хаб Данных NLP

Решение создать базу данных, которая является крупнейшей библиотекой данных в области обработки естественного языка, было принято из-за необходимости в центральном хабе для хранения данных NLP. Компания стремилась сделать его более доступным и поисковым, чем альтернативные варианты, которые часто требуют от исследователей поиска через множество библиотек третьих лиц.

Компания разрабатывала базу данных в течение нескольких недель; в настоящее время у них около 200 наборов данных. Существует множество различных наборов данных, не только классических. Компания включила такие наборы данных, как CommonCrawl и Penn Treebank.

Вместе с разнообразными базами данных приходят различные задачи NLP. Существуют задачи, которые фокусируются на классификации и ответах на вопросы, но также существуют наборы данных для текста в SQL, распознавания речи и многофакторных задач.

Quantum Stat хочет, чтобы база данных была ориентирована на сообщество с вкладом пользователей. Компания открыла двери для всех, кто хочет отправить новый набор данных или порекомендовать изменения.

Еще одним направлением является добавление наборов данных, которые диверсифицируют язык, уходя от строго английского. Цель компании – сделать библиотеку более глобальной и доступной для других.

При входе в «Большую Плохую Базу Данных NLP» пользователь столкнется с чистым и организованным макетом. Название набора данных указано, за которым следует язык и подробное описание. Также указаны экземпляры, формат, задача, год создания и создатель. Каждая база данных имеет ссылку для скачивания.

Различные Базы Данных

Одна из встречаемых баз данных – Historical Newspapers Daily World Time Series, содержащая ежедневные материалы газет в США и Великобритании с 1836 по 1922 год; SciQ Dataset, содержащая 13 679 краудсорсинговых научных экзаменационных вопросов в области физики, биологии и химии; CommonCrawl, содержащая данные с 25 миллиардов веб-страниц; и MovieLens, набор данных, содержащий 22 000 000 рейтингов и 580 000 тегов для 33 000 фильмов от 240 000 пользователей.

Впечатляющая база данных Quantum Stat появляется в момент, когда исследователям требуются более крупные и разнообразные наборы данных из-за достижений в области глубокого обучения. Из-за огромного количества данных, содержащихся в человеческом языке, каждый уникальный набор данных делает его немного проще для обработки. Развитие NLP зависит от этих баз данных, и Quantum Stat внесла свой вклад в ускорение этого развития, собрав так много наборов данных в одном пространстве.

NLP будет важна во многих аспектах общества. Она может помочь предсказать заболевания на основе электронных медицинских записей и речи пациента, помочь компаниям узнать, что клиенты говорят о продукте, и выявить фальшивые новости в мире, где они распространяются повсеместно.

Технология развивается чрезвычайно быстро, и не пройдет много времени, прежде чем она сможет решать эти сложные задачи.

Алекс Макфарленд - журналист и писатель в области искусственного интеллекта, исследующий последние разработки в этой области. Он сотрудничал с многочисленными стартапами и изданиями в области искусственного интеллекта во всем мире.