Model dan platform AI

Quantum Stat Merilis “Big Bad NLP Database”

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Quantum Stat telah merilis “Big Bad NLP Database” dalam langkah besar untuk pengolahan bahasa alami (NLP). Database ini berisi ratusan dataset yang berbeda untuk digunakan oleh pengembang pembelajaran mesin.

Menurut perusahaan, mereka menyediakan solusi untuk inisiatif NLP dan AI. Mereka melakukan ini melalui layanan seperti pra-pengolahan hingga pengembangan aplikasi web, pendekatan multi-faset yang mencakup pembelajaran mesin dan jaringan saraf dalam, pengelolaan chatbot dan dialog, dan database NLP baru mereka.

Perusahaan juga melakukan penelitian primer dan sekunder untuk membantu individu menganalisis perkembangan dalam industri.

Pusat Data NLP Terpusat

Keputusan untuk membuat database, yang merupakan perpustakaan data terbesar di dunia dalam pengolahan bahasa alami, muncul dari kebutuhan akan pusat data NLP terpusat. Perusahaan bertujuan untuk membuatnya lebih mudah diakses dan dicari daripada alternatif, yang sering memerlukan peneliti untuk mencari melalui perpustakaan pihak ketiga yang berbeda.

Perusahaan telah mengembangkan database selama beberapa minggu; mereka saat ini memiliki sekitar 200 dataset. Ada berbagai dataset yang berbeda, tidak hanya klasik. Perusahaan telah memasukkan dataset seperti CommonCrawl dan Penn Treebank.

Bersama dengan berbagai database yang berbeda, ada tugas NLP yang berbeda pula. Ada yang fokus pada klasifikasi dan menjawab pertanyaan, tetapi ada juga dataset untuk teks-ke-SQL, pengenalan suara, dan multi-modal.

Quantum Stat ingin database ini menjadi komunitas-penggerak dengan kontribusi dari pengguna. Perusahaan telah membuka pintu untuk siapa saja untuk mengirimkan dataset baru atau merekomendasikan perubahan.

Fokus lainnya adalah menambahkan dataset yang membedakan bahasa, menjauh dari bahasa Inggris saja. Tujuan mereka adalah membuat perpustakaan lebih global dan dapat diakses oleh orang lain.

Saat memasuki “Big Bad NLP Database”, pengguna akan dihadapkan pada tata letak yang rapi dan terorganisir. Nama dataset terdaftar, diikuti oleh bahasa dan deskripsi rinci. Ini juga mencantumkan instance, format, tugas, tahun dibuat, dan pembuat. Setiap database memiliki tautan unduh untuk diikuti.

Berbagai Database

Anda akan menemukan database seperti Historical Newspapers Daily World Time Series dataset, yang berisi konten harian surat kabar di AS dan Inggris dari 1836 hingga 1922; SciQ Dataset, yang berisi 13.679 pertanyaan ujian sains yang dikumpulkan dari crowdsourcing di bidang Fisika, Biologi, dan Kimia; CommonCrawl, yang berisi data dari 25 miliar halaman web; dan MovieLens, dataset yang berisi 22.000.000 peringkat dan 580.000 tag untuk 33.000 film oleh 240.000 pengguna.

Database impresif Quantum Stat hadir pada saat peneliti memerlukan dataset yang lebih besar dan lebih beragam karena kemajuan dalam pembelajaran dalam. Karena jumlah data yang sangat besar dalam bahasa manusia, setiap dataset unik membuatnya sedikit lebih mudah untuk diproses. Kemajuan NLP bergantung pada database ini, dan Quantum Stat telah berkontribusi pada percepatan kemajuan tersebut dengan mengumpulkan banyak dataset dalam satu ruang.

NLP akan sangat penting dalam banyak aspek masyarakat. Ini dapat membantu memprediksi penyakit berdasarkan catatan kesehatan elektronik dan ucapan pasien, membantu perusahaan mengetahui apa yang dikatakan pelanggan tentang suatu produk, dan mengidentifikasi berita palsu di dunia di mana itu merajalela.

Teknologi ini berkembang sangat cepat, dan tidak akan lama sebelum dapat menangani aplikasi yang kompleks ini.

Alex McFarland adalah seorang jurnalis dan penulis AI yang menjelajahi perkembangan terbaru dalam kecerdasan buatan. Ia telah berkolaborasi dengan berbagai startup dan publikasi AI di seluruh dunia.