Моделі та платформи ШІ

Quantum Stat випускає «Біг Бед НЛП Базу Даних»

mm
Додайте Unite.AI до бажаних джерел у Google

Quantum Stat випускає свою «Біг Бед НЛП Базу Даних» в тому, що є великим кроком вперед для обробки природної мови (НЛП). База даних містить сотні різних наборів даних для розробників машинного навчання.

За словами компанії, вони надають рішення для ініціатив НЛП та штучного інтелекту. Вони роблять це через послуги, такі як попередня обробка до розробки веб-додатків, багаторівневий підхід, який включає машинне навчання та глибокі нейронні мережі, управління чат-ботами та діалогами, а також свою нову базу даних НЛП.

Компанія також проводить первинні та вторинні дослідження, щоб допомогти людям аналізувати розвиток у галузях.

Центральний Хаб НЛП Даних

Рішення про створення бази даних, яка є найбільшим у світі бібліотекою даних обробки природної мови, виникла з необхідності центрального хабу для зберігання даних НЛП. Компанія мала на меті зробити її більш доступною та пошуковою, ніж альтернативу, яка часто вимагає від дослідників пошуку в декількох третіх бібліотеках.

Компанія розробляла базу даних протягом декількох тижнів; вони зараз мають близько 200 наборів даних. Є різноманітні різні набори даних, не тільки класичні. Компанія включила такі, як CommonCrawl та Penn Treebank.

Разом з різними базами даних приходять різні завдання НЛП. Є ті, що фокусуються на класифікації та відповідях на питання, але є також набори даних для тексту до SQL, розпізнавання мови та багатомодального.

Quantum Stat хоче, щоб база даних була орієнтована на спільноту з внесками користувачів. Компанія відкрила свої двері для будь-кого, хто хоче надіслати новий набір даних або порекомендувати зміни.

Іншим напрямком є додавання наборів даних, які диверсифікують мову, рухаючись від строго англійської. Їхня мета полягає в тому, щоб зробити бібліотеку більш глобальною та доступною для інших.

При вході в «Біг Бед НЛП Базу Даних» користувач буде зустріти чистий та організований макет. Назва набору даних перераховується, за нею мова та детальний опис. Там також перераховуються інстанси, формат, завдання, рік створення та творець. Кожна база даних має посилання для завантаження.

Різноманітні Бази Даних

Одна зустріне бази даних, такі як Historical Newspapers Daily World Time Series, що містить щоденні вмісти газет у США та Великій Британії з 1836 по 1922 рік; SciQ Dataset, що містить 13 679 краудсорсингових наукових екзаменаційних питань у галузі фізики, біології та хімії; CommonCrawl, що містить дані з 25 мільярдів веб-сторінок; та MovieLens, набір даних, що містить 22 мільйони рейтингів та 580 000 тегів для 33 000 фільмів від 240 000 користувачів.

Вражаюча база даних Quantum Stat з’являється в той час, коли дослідникам потрібні більші та більш різноманітні набори даних через розвиток глибокого навчання. Через величезну кількість даних, що містяться в людській мові, кожен унікальний набір даних робить його трохи легшим для обробки. Розробка НЛП залежить від цих баз даних, і Quantum Stat внесла свій внесок у прискорення цього розвитку, зібравши так багато наборів даних в одному просторі.

НЛП буде важливим у багатьох аспектах суспільства. Вона може допомогти передбачити захворювання на основі електронних медичних записів та мови пацієнта, допомогти компаніям дізнатися, що клієнти говорять про продукт, та ідентифікувати фейкові новини у світі, де вони поширюються.

Технологія розвивається дуже швидко, і не мине багато часу, поки вона не буде здатна впоратися з цими складними застосуваннями.

Алекс Макфарленд - журналіст та письменник з питань штучного інтелекту, який досліджує останні розробки в галузі штучного інтелекту. Він співпрацював з численними стартапами та виданнями з штучного інтелекту у світі.