Моделі та платформи ШІ

Appen Limited запускає різноманітні навчальні набори даних для NLP

mm
Додайте Unite.AI до бажаних джерел у Google

Appen Limited, провідний постачальник високоякісних навчальних даних для компаній, які хочуть будувати системи штучного інтелекту у великому масштабі, запускає нові різноманітні навчальні набори даних для ініціатив природної мови (NLP). Ці набори даних дозволять кінцевим користувачам отримувати однаковий досвід незалежно від мовної різноманітності, діалекту, етнолекту, акценту, раси чи статі. 

За даними звіту PNAS у березні 2020 року, популярні системи автоматичного розпізнавання мови (ASR), особливо ті, які використовуються для віртуальних помічників, закритого субтитрування та безрукого комп’ютера, часто демонструють расові диспропорції у продуктивності. Багато з цього пов’язано з тим, що ці системи базуються на упередженій або неповній інформації, і саме тому так важливо розробляти різноманітні навчальні набори. 

З новим запуском Appen спрямована на зменшення розриву у продуктивності та створення більш інклюзивної середовищі для технології розпізнавання мови. Аналогічні виклики присутні в системах інтерпретації мови та NLP. 

Марк Брайан є генеральним директором Appen. 

«Якість і різноманітність навчальних даних безпосередньо впливають на продуктивність та упередженість моделей штучного інтелекту», – сказав Брайан. «Як партнер з даних, ми можемо постачати повні навчальні дані для багатьох випадків використання, щоб забезпечити роботу моделей штучного інтелекту для всіх. Це критично важливо, щоб ми залучили різноманітну групу осіб для виробництва, маркування та верифікації даних, щоб забезпечити, що модель, яку тренують, не лише справедлива, але й побудована відповідально». 

Проекти мови Appen

Appen намагається створити різноманітне середовище штучного інтелекту через свої різні проекти та партнерства, включаючи: 

  • Партнерство з Translators without Borders (TWB): Appen партнерує з TWB, Amazon (AMZN ), Carnegie Mellon University, Facebook (META ), Google (GOOGL ), Johns Hopkins University, Microsoft (MSFT ) та Translated. Партнерство приєдналося до ініціативи з перекладу для COVID-19 (TICO-19), яка намагалася розширити доступ до інформації про COVID-19, підтримуючи розвиток мовної технології у декількох мовах. До них належать країни, що розвиваються, такі як Конголезький суахілі, Тигринья та Німецька Фульфульде.

  • Проект перекладу канадської французької мови: Appen допоміг Microsoft додати «канадську французьку» мову до Microsoft Translator після координації з консультантами рідної мови.
  • Проект перекладу інуктитутської мови: Appen співпрацює з урядом Нунавуту, що допомогло Microsoft додати інуктитутську мову до Microsoft Translator. Корінна мова поширена в канадській Арктиці.

  • Набори даних афроамериканської різноманітної англійської мови (AAVE): Працюючи з носіями AAVE та збираючи дані для набору OTS на основі розмов на різні теми, Appen намагається створити нові навчальні набори даних, які представляють AAVE. 

Доктор Джудіт Бішоп є старшим директором спеціалістів штучного інтелекту в Appen.

«Упереджені дані штучного інтелекту призводять до проектів, які можуть не дати очікуваних результатів бізнесу та нашкодити людям, яким вони повинні допомагати», – сказала доктор Бішоп. «Масштаб і складність проектів штучного інтелекту роблять неможливим для більшості компаній придбати достатньо необмежених високоякісних даних без партнерства з експертом з даних штучного інтелекту. Зобов’язання Appen щодо розробки найбільш різноманітного та експертного колективу анотаторів даних надає галузі чітко відмінний ресурс для побудови справедливих та етичних проектів штучного інтелекту». 

Appen допомагають анотатори навчальних даних з понад 170 країн, а мовні представлення включають 235 унікальних мов та 395 діалектів. Також пропонуються готові набори даних (OTS), які дозволяють підприємствам швидше придбати високоякісні навчальні дані для своїх проектів штучного інтелекту.

Алекс Макфарленд - журналіст та письменник з питань штучного інтелекту, який досліджує останні розробки в галузі штучного інтелекту. Він співпрацював з численними стартапами та виданнями з штучного інтелекту у світі.