Mô hình và nền tảng AI

Quantum Stat Phát Hành “Bộ Dữ Liệu NLP Lớn La”

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Quantum Stat đã phát hành “Bộ Dữ Liệu NLP Lớn La” của họ, một bước tiến lớn cho quá trình xử lý ngôn ngữ tự nhiên (NLP). Cơ sở dữ liệu này chứa hàng trăm tập dữ liệu khác nhau cho các nhà phát triển học máy để sử dụng.

Theo công ty, họ cung cấp giải pháp cho các sáng kiến NLP và AI. Họ thực hiện điều này thông qua các dịch vụ như tiền xử lý đến phát triển ứng dụng web, một cách tiếp cận đa diện bao gồm học máy và mạng nơ-ron sâu, quản lý trò chuyện và hội thoại, và cơ sở dữ liệu NLP mới của họ.

Công ty cũng tiến hành nghiên cứu sơ cấp và thứ cấp để giúp các cá nhân phân tích sự phát triển trong các ngành công nghiệp.

Trung Tâm Dữ Liệu NLP

Quyết định tạo ra cơ sở dữ liệu, vốn là thư viện dữ liệu lớn nhất về xử lý ngôn ngữ tự nhiên trên thế giới, xuất phát từ nhu cầu về một trung tâm để chứa dữ liệu NLP. Công ty nhằm mục đích làm cho nó dễ dàng truy cập và tìm kiếm hơn so với phương án thay thế, thường yêu cầu các nhà nghiên cứu tìm kiếm qua nhiều thư viện của bên thứ ba.

Công ty đã phát triển cơ sở dữ liệu trong vài tuần; hiện tại họ có khoảng 200 tập dữ liệu. Có nhiều loại tập dữ liệu khác nhau, không chỉ là những tập dữ liệu kinh điển. Công ty đã bao gồm những tập dữ liệu như CommonCrawl và Penn Treebank.

Cùng với sự đa dạng của các cơ sở dữ liệu khác nhau là các nhiệm vụ NLP khác nhau. Có những nhiệm vụ tập trung vào phân loại và trả lời câu hỏi, nhưng cũng có các tập dữ liệu cho văn bản-sang-SQL, nhận dạng giọng nói và đa phương tiện.

Quantum Stat muốn cơ sở dữ liệu được dẫn dắt bởi cộng đồng với sự đóng góp từ người dùng. Công ty đã mở cửa cho bất kỳ ai gửi một tập dữ liệu mới hoặc đề xuất thay đổi.

Một焦 điểm khác là thêm các tập dữ liệu đa dạng hóa ngôn ngữ, rời bỏ việc chỉ tập trung vào tiếng Anh. Mục tiêu của họ là làm cho thư viện trở nên toàn cầu và dễ tiếp cận hơn với những người khác.

Khi vào “Bộ Dữ Liệu NLP Lớn La“, người dùng sẽ được chào đón bởi một bố cục sạch sẽ và tổ chức. Tên của tập dữ liệu được liệt kê, tiếp theo là ngôn ngữ và mô tả chi tiết. Nó cũng liệt kê các thể hiện, định dạng, nhiệm vụ, năm tạo và người tạo. Mỗi cơ sở dữ liệu có một liên kết tải xuống để theo dõi.

Các Cơ Sở Dữ Liệu Khác Nhau

Một sẽ gặp phải các cơ sở dữ liệu như Historical Newspapers Daily World Time Series dataset, chứa nội dung hàng ngày của các tờ báo ở Mỹ và Anh từ năm 1836 đến 1922; SciQ Dataset, chứa 13,679 câu hỏi khoa học được tạo bởi cộng đồng trong các lĩnh vực Vật lý, Sinh học và Hóa học; CommonCrawl, chứa dữ liệu từ 25 tỷ trang web; và MovieLens, một tập dữ liệu chứa 22.000.000 xếp hạng và 580.000 thẻ cho 33.000 bộ phim bởi 240.000 người dùng.

Cơ sở dữ liệu ấn tượng của Quantum Stat đến vào thời điểm khi các nhà nghiên cứu cần các tập dữ liệu lớn hơn và đa dạng hơn do sự tiến bộ của học sâu. Vì lượng dữ liệu khổng lồ trong ngôn ngữ của con người, mỗi tập dữ liệu độc nhất làm cho việc xử lý trở nên dễ dàng hơn một chút. Sự phát triển của NLP phụ thuộc vào những cơ sở dữ liệu này, và Quantum Stat đã góp phần đẩy nhanh sự phát triển đó bằng cách thu thập nhiều tập dữ liệu trong một không gian.

NLP sẽ quan trọng trong nhiều khía cạnh của xã hội. Nó có thể giúp dự đoán bệnh tật dựa trên hồ sơ sức khỏe điện tử và lời nói của bệnh nhân, giúp các công ty tìm hiểu những gì khách hàng đang nói về một sản phẩm, và xác định tin giả trong một thế giới mà tin giả lan rộng.

Công nghệ đang phát triển cực kỳ nhanh, và nó sẽ không mất nhiều thời gian trước khi nó có khả năng giải quyết những ứng dụng phức tạp này.

Alex McFarland là một nhà báo và nhà văn về trí tuệ nhân tạo, khám phá những phát triển mới nhất trong lĩnh vực trí tuệ nhân tạo. Ông đã hợp tác với nhiều công ty khởi nghiệp và xuất bản về trí tuệ nhân tạo trên toàn thế giới.