Yapay zeka modelleri ve platformları

Appen Limited Çeşitli Veri Eğitim Setlerini NLP için Başlatıyor

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Appen Limited, şirketlerin büyük ölçekli AI sistemleri oluşturmak için yüksek kaliteli eğitim verisi sağlayan önde gelen bir sağlayıcı, doğal dil işleme (NLP) girişimlerinde çeşitli eğitim veri setlerini başlatıyor. Bu veri setleri, son kullanıcıların dil çeşidi, lehçe, etnik lehçe, aksan, ırk veya cinsiyetinden bağımsız olarak aynı deneyimi almalarını sağlayacaktır.

PNAS’ın Mart 2020’de yayınladığı bir rapora göre, popüler otomatik konuşma tanıma (ASR) sistemleri, özellikle sanal asistanlar, kapalı alt yazılar ve eller serbest bilgisayar kullanımı için kullanılanlar, performans açısından ırksal farklılıklar göstermektedir. Bunun büyük kısmı, sistemlerin önyargılı veya eksik verilere dayandığından kaynaklanmaktadır ve bu nedenle çeşitli eğitim setleri geliştirmek çok önemlidir.

Yeni lansman ile Appen, performans farklılıklarını azaltmayı ve konuşma tanıma teknolojisi için daha kapsayıcı bir ortam oluşturmayı hedeflemektedir. Aynı tür zorluklar dil yorumlama ve NLP sistemlerinde de mevcuttur.

Mark Brayan, Appen CEO’sudur.

“Eğitim verisinin kalitesi ve çeşitliliği, AI modellerindeki performans ve önyargıları doğrudan etkiler” dedi Brayan. “Bir veri ortağı olarak, birçok kullanım durumu için eksiksiz eğitim verisi sağlayabilir ve AI modellerinin herkes için çalışmasını sağlayabiliriz. Verileri üretmek, etiketlemek ve doğrulamak için çeşitli bir grup bireyi dahil etmemiz çok önemlidir, böylece eğitilen model sadece adil değil, aynı zamanda sorumlu bir şekilde inşa edilmiş olur.”

Appen Dili Projeleri

Appen, çeşitli projeler ve ortaklıklar aracılığıyla, farklı dillerde ve lehçelerde kapsayıcı bir AI ortamı oluşturmaya çalışmaktadır:

  • Sınır Tanımayan Çevirmenler (TWB) ortaklığı: Appen, TWB, Amazon (AMZN ), Carnegie Mellon Üniversitesi, Facebook (META ), Google (GOOGL ), Johns Hopkins Üniversitesi, Microsoft (MSFT ) ve Translated ile ortaklık kurdu. Ortaklık, COVID-19 için Çeviri Girişimi (TICO-19)’ne katıldı, bu da dil teknolojisinin çok sayıda dilde geliştirilmesini destekleyerek COVID-19 bilgisine erişimi genişletmeye çalıştı. Bunlar arasında Kongo Swahili, Tigrinya ve Nijerya Fulfulde gibi gelişmekte olan ülkelerin dilleri de yer alıyor.
  • Kanada Fransızcası çevirisi projesi: Appen, Microsoft Translator’da “Kanada Fransızcası” dil seçeneğini eklemesine yardımcı oldu, bu da yerli dil danışmanları ile koordinasyon sonucu gerçekleşti.
  • Inuktitut çevirisi projesi: Appen, Nunavut Hükümeti ile işbirliği yaptı ve bu, Microsoft’un Microsoft Translator’da Inuktitut’u eklemesine yol açtı. Bu yerli dil, Kanada Arktika’sında konuşulmaktadır.
  • Afrika Amerikan Varyant İngilizce (AAVE) hazır veri setleri: Appen, AAVE konuşmacıları ile çalışarak ve çeşitli konulardaki konuşmalar hakkında veri toplamak için bir hazır veri seti oluşturmaya çalışmaktadır.

Dr. Judith Bishop, Appen’de AI Uzmanları Kıdemli Direktörüdür.

“Önyargılı AI verisi, beklenen iş sonuçlarını sağlayamayan ve aslında yarar sağlamayı amaçladığı kişilerine zarar veren projelere yol açabilir” dedi Dr. Bishop. “AI projelerinin ölçeği ve karmaşıklığı, çoğu şirketin önyargısız, yüksek kaliteli veri elde etmesini without AI veri uzmanı ile ortaklık kurmadan imkansız kılmaktadır. Appen’in en çeşitli ve uzman veri annotatörü geliştirme taahhüdü, endüstriye adil ve etik AI projeleri oluşturmak için net bir şekilde farklılaştırılmış bir kaynak sağlar.”

Appen, 170’den fazla ülkeden eğitim veri annotatörleri ile desteklenmekte ve dil temsilleri 235 benzersiz dil ve 395 lehçeyi içermektedir. Ayrıca, şirketlerin AI projeleri için yüksek kaliteli eğitim verisi elde etmelerini daha nhanh bir şekilde sağlayan hazır (OTS) veri setleri sunmaktadır.

Alex McFarland yapay zeka muhabiri ve yazarıdır ve yapay zekadaki son gelişmeleri araştırıyor. Birçok yapay zeka başlangıç şirketi ve dünya çapındaki yayınlarda işbirliği yaptı.