AIモデルとプラットフォーム
Quantum Stat、自然言語処理のための「Big Bad NLP Database」をリリース

Quantum Statは、自然言語処理(NLP)における大きなステップとなる「Big Bad NLP Database」をリリースしました。このデータベースには、機械学習開発者が利用できる数百の異なるデータセットが含まれています。
同社によると、NLPおよびAIイニシアチブに対するソリューションを提供しています。これには、前処理からウェブアプリ開発まで、機械学習やディープニューラルネットワーク、チャットボットやダイアログ管理、そして新しいNLPデータベースが含まれる、マルチファセットアプローチが含まれます。
同社はまた、業界内の動向を分析するために、一次調査と二次調査を行っています。
NLPデータの中心ハブ
NLPデータを保持するための中心ハブを作成する必要性から、データベースの作成が行われました。同社は、代替手段では、研究者が複数の第三者ライブラリを検索する必要があることが多いため、よりアクセスしやすく検索可能なものを作ることを目指しました。
同社は数週間にわたってデータベースを開発しており、現在約200のデータセットを保有しています。データセットは、クラシックだけではなく、CommonCrawlやPenn Treebankなどのさまざまなものが含まれています。
さまざまなデータベースが存在することから、さまざまなNLPタスクが存在します。分類や質問回答に焦点を当てたものもあれば、テキストからSQL、音声認識、またはマルチモーダルへの変換に焦点を当てたものもあります。
Quantum Statは、データベースをコミュニティ主導で運営し、ユーザーの貢献を受け付けたいと考えています。同社は、新しいデータセットを送付したり、変更を提案したりするための門戸を開けています。
別の焦点は、英語だけではなく、言語を多様化することです。同社の目標は、ライブラリをよりグローバル化し、他の人々にもアクセスしやすくすることです。
「Big Bad NLP Database」に入ると、ユーザーはクリーンで整理されたレイアウトに出会います。データセットの名前、言語、詳細な説明が記載されています。また、インスタンス、形式、タスク、作成年、作成者も記載されています。各データベースにはダウンロードリンクが付いています。
さまざまなデータベース
Historical Newspapers Daily World Time Seriesデータセット(1836年から1922年までの米国と英国での新聞の日刊コンテンツを含む)、SciQデータセット(物理学、生物学、化学の分野で13,679のクラウドソーシングされた科学試験問題を含む)、CommonCrawl(250億ページのウェブデータを含む)、MovieLens(240,000人のユーザーによる33,000本の映画に対する220万件の評価と58万件のタグを含む)などのデータベースに出会うことができます。
Quantum Statの印象的なデータベースは、ディープラーニングの進歩により、研究者がより大規模で多様なデータセットを必要とする時代に登場しました。人間の言語の中にある大量のデータにより、各ユニークなデータセットは言語を処理することを少し容易にします。NLPの進歩はこれらのデータベースに依存しており、Quantum Statは多くのデータセットを一つの空間で集めたことで、その進歩を促進しています。
NLPは、社会の多くの側面で重要になります。電子ヘルスレコードと患者さんの発言に基づいて疾患を予測するのに役立ち、企業が製品について顧客が何を言っているかを知るのに役立ち、でたらめなニュースが蔓延する世界で偽ニュースを特定するのに役立ちます。
この技術は非常に急速に進化しており、これらの複雑なアプリケーションに対処できるようになるまであと長くはありません。












