Yapay zeka modelleri ve platformları

Quantum Stat “Büyük Kötü NLP Veritabanı”nı Yayınladı

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Quantum Stat, doğal dil işleme (NLP) için büyük bir adım olan “Büyük Kötü NLP Veritabanı”nı yayınladı. Veritabanı, makine öğrenimi geliştiricilerinin kullanabileceği yüzlerce farklı veri setini içerir.

Şirket, NLP ve yapay zeka girişimlerine çözümler sunar. Bu, ön işleme, web uygulaması geliştirmeye, çok yönlü bir yaklaşım olan makine öğrenimi ve derin sinir ağları, sohbet botu ve diyalog yönetimi ve yeni NLP veritabanını içerir.

Şirket ayrıca, endüstrilerdeki gelişmeleri analiz etmek için bireylerin yardımına yönelik birincil ve ikincil araştırmalar yürütür.

NLP Veri Merkezi

Veritabanının oluşturulma kararı, NLP verilerini tutmak için merkezi bir hub oluşturma ihtiyacından kaynaklandı. Şirket, bu verilerin daha kolay erişilebilir ve aranabilir olmasını hedefledi.

Şirket, veritabanını birkaç hafta boyunca geliştirdi ve şu anda yaklaşık 200 veri setine sahiptir. Farklı veri setleri vardır, sadece klasik olanlar değil. Şirket, CommonCrawl ve Penn Treebank gibi veri setlerini de dahil etti.

Farklı veritabanları ile farklı NLP görevleri gelir. Bunların arasında sınıflandırma ve soru cevaplama görevleri vardır, ancak metin-den-sql, konuşma tanıma ve çok modlu veri setleri de vardır.

Quantum Stat, veritabanının topluluk tarafından yönetilmesini ve kullanıcı katkıları ile büyümesini istiyor. Şirket, yeni veri setleri veya değişiklik önerileri için kapılarını açtı.

Diğer bir odak noktası, dili çeşitlendiren veri setleri eklemektir, sadece İngilizce ile sınırlı kalmaktan uzaklaşarak kütüphaneyi daha küresel ve erişilebilir hale getirmektir.

“Büyük Kötü NLP Veritabanı”na giren bir kullanıcı, temiz ve organize bir düzenle karşılaşacaktır. Veri setinin adı, dil ve ayrıntılı bir açıklama listelenir. Ayrıca örnekler, format, görev, oluşturulma yılı ve oluşturucu listelenir. Her veritabanı için bir indirme bağlantısı bulunur.

Çeşitli Veritabanları

Tarihsel Gazeteler Günlük Dünya Zaman Serisi veritabanı, 1836-1922 yılları arasında ABD ve İngiltere’deki gazetelerin günlük içeriklerini içeren bir veritabanı; SciQ Veritabanı, Fizik, Biyoloji ve Kimya alanlarında 13.679 crowdsourced bilim sınav sorusu içeren bir veritabanı; CommonCrawl, 25 milyar web sayfasının verilerini içeren bir veritabanı ve MovieLens, 240.000 kullanıcı tarafından 33.000 film için 22.000.000 puanlama ve 580.000 etiket içeren bir veritabanı gibi veritabanları ile karşılaşacaksınız.

Quantum Stat’ın etkileyici veritabanı, derin öğrenme alanında ilerlemeler nedeniyle daha büyük ve çeşitli veri setlerine ihtiyaç duyulduğu bir zamanda ortaya çıktı. İnsan dilindeki büyük veri miktarı nedeniyle, her benzersiz veri seti dil işlemenin biraz daha kolaylaştırılmasını sağlıyor. NLP’nin gelişmesi bu veritabanlarına bağlıdır ve Quantum Stat, birçok veri setini bir araya getirerek bu gelişmeyi hızlandırmıştır.

NLP, toplumun birçok alanında önemli olacaktır. Elektronik sağlık kayıtları ve bir hastanın konuşması temelinde hastalıkları öngörmede, şirketlerin bir ürün hakkında müşterilerin neler dediğini öğrenmelerinde ve yalan haberleri tespit etmede yardımcı olacaktır.

Teknoloji非常 hızlı bir şekilde ilerlemektedir ve bu karmaşık uygulamaları ele alabilecek hale gelmesi uzun sürmeyecektir.

Alex McFarland yapay zeka muhabiri ve yazarıdır ve yapay zekadaki son gelişmeleri araştırıyor. Birçok yapay zeka başlangıç şirketi ve dünya çapındaki yayınlarda işbirliği yaptı.