AI 모델 및 플랫폼
Quantum Stat, “Big Bad NLP Database” 출시

Quantum Stat는 자연어 처리(NLP) 분야에서 큰 발전을 이루는 “Big Bad NLP Database”를 출시했다. 이 데이터베이스에는 기계 학습 개발자가 사용할 수 있는 수백 개의 다양한 데이터셋이 포함되어 있다.
회사는 NLP 및 AI 이니셔티브에 대한 솔루션을 제공한다. 이를 위해 전처리에서 웹 앱 개발까지 多面적인 접근 방식을 사용하며, 기계 학습 및 딥 뉴럴 네트워크, 챗봇 및 대화 관리, 새로운 NLP 데이터베이스가 포함된다.
회사는 또한 산업 내의 발전을 분석하기 위해 1차 및 2차 연구를 수행한다.
NLP 데이터의 중앙 허브
NLP 데이터를 보관하는 중앙 허브의 필요성으로 인해 데이터베이스가 생성되었다. 회사는 이를 더 쉽게 접근하고 검색할 수 있도록 하였다. 기존의 대안은 연구자들이 여러 第三方 라이브러리를 검색해야 하는 경우가 많았다.
회사는 수 주 동안 데이터베이스를 개발해 왔으며, 현재 약 200개의 데이터셋을 보유하고 있다. 다양한 데이터셋이 포함되어 있으며, CommonCrawl 및 Penn Treebank와 같은 클래식 데이터셋도 포함되어 있다.
다양한 데이터베이스가 있는 만큼, 다양한 NLP 작업도 존재한다. 분류 및 질문 답변에 중점을 둔 작업도 있지만, 텍스트-SQL, 음성 인식, 멀티모달과 같은 데이터셋도 있다.
Quantum Stat는 데이터베이스가 커뮤니티 주도형으로 개발되기를 원한다. 회사는 사용자로부터 새로운 데이터셋을 제출하거나 변경을 제안할 수 있도록 문을 열었다.
또 다른重点은 언어를 다양화하여Strictly 영어만 사용하지 않는 것이다. 목표는 라이브러리를 더 글로벌하게 만들고 다른 사람들에게 접근할 수 있도록 하는 것이다.
“Big Bad NLP Database”에 들어가면, 사용자는 깨끗하고 조직적인 레이아웃을 볼 수 있다. 데이터셋 이름, 언어,詳細한 설명, 인스턴스, 형식, 작업, 생성 년도, 생성자가 나열되어 있다. 각 데이터베이스에는 다운로드 링크도 있다.
다양한 데이터베이스
사용자는 Historical Newspapers Daily World Time Series 데이터셋, SciQ 데이터셋, CommonCrawl, MovieLens와 같은 데이터베이스를遇할 수 있다. Historical Newspapers Daily World Time Series 데이터셋에는 1836년부터 1922년까지의 미국 및 영국 신문 일일 내용이 포함되어 있다. SciQ 데이터셋에는 물리학, 생물학, 화학 분야의 13,679개의 크라우드소싱 과학 시험 문제가 포함되어 있다. CommonCrawl에는 25억 개의 웹 페이지 데이터가 포함되어 있다. MovieLens에는 22,000,000개의 평가 및 580,000개의 태그가 포함되어 있다.
Quantum Stat의 데이터베이스는 딥 러닝의 발전으로 인해 더 큰 및 다양한 데이터셋이 필요한 연구자들에게 큰 도움이 된다. 인간 언어에는大量의 데이터가 포함되어 있기 때문에, 각 고유한 데이터셋은 처리를 조금 더 쉽게 만들어 준다. NLP의 발전은 이러한 데이터베이스에 달려 있으며, Quantum Stat는 많은 데이터셋을 한 곳에 모음으로써 이러한 발전을 가속화했다.
NLP는 사회의 많은 측면에서 중요할 것이다. 전자 건강 기록 및 환자의 말에 기반한 질병 예측, 고객이 제품에 대해 말하는 것을 회사에서 알 수 있게 해주며, 가짜 뉴스를 식별하는 데 도움이 될 수 있다.
이 기술은 매우 빠르게 발전하고 있으며, 이러한 복잡한 응용 프로그램을 처리할 수 있게 될 때까지 오래 지남이 없다.












