Моделі та платформи ШІ
Speechmatics Запускає Автономне Розпізнавання Мови
Лідер серед технологічних стартапів зі розпізнавання мови Speechmatics запустив своє програмне забезпечення «Автономне Розпізнавання Мови», яке використовує останні техніки глибокого навчання та проривні самонавчальні моделі. Система продемонструвала здатність перевершити Amazon (AMZN ), Google (GOOGL ) та Microsoft.
Набори Даних Стенфордського Університету
Speechmatics заснований на наборах даних, знайдених у дослідженні Стенфордського університету «Расові Нерівності у Розпізнаванні Мови», і досягнув загальної точності 82,8% для голосів афроамериканців. Для порівняння, Google досягла точності лише 68,7%, тоді як Amazon – 68,6%.
Рівень точності відповідає зниженню помилок розпізнавання мови на 45%, що еквівалентно трьом словам у середньому реченні. Новий системі Speechmatics не тільки точний у цьому відношенні, але також продемонстрував покращення точності серед акцентів, віку, діалектів та інших соціально-демографічних характеристик.
Часто трапляється недорозуміння у розпізнаванні мови через обмежену кількість позначених даних, які алгоритми можуть використовувати для навчання. Позначені дані потрібно класифікувати вручну людьми, що призводить до меншої кількості даних, доступних для цих систем. Це також обмежує представництво всіх голосів, що створює новий набір проблем.
Навчання на Непозначених Даних
Speechmatics робить великий прогрес у цьому напрямку, оскільки його технологія навчена на величезних кількостях непозначених даних, отриманих безпосередньо з Інтернету. Дані походять з таких джерел, як контент соціальних мереж та подкасти.
Самонавчальне навчання дозволило системі бути навченою на 1,1 мільйоні годин аудіо, що є збільшенням порівняно з попередніми 30 000 годин. Це дозволяє їй мати набагато ширше представництво голосів та допомагає зменшити помилки та упередженість штучного інтелекту у розпізнаванні мови.
Коли мова йде про голоси дітей, Speechmatics також продемонстрував здатність перевершити конкурентів. Голоси дітей складно розпізнавати за допомогою традиційної технології розпізнавання мови, але Speechmatics вдалося досягти точності 91,8%. Google змогла досягти лише 83,4%, а Deepgram – 82,3%.
Кеті Вігдаль – генеральний директор Speechmatics.
«Ми на місії доставити наступне покоління можливостей машинного навчання та, завдяки цьому, пропонувати більш інклюзивну та доступну технологію мови. Це оголошення – величезний крок до досягнення цієї мети.»
«Наш фокус на подоланні упередженості штучного інтелекту привів до цього монументального кроку вперед у галузі розпізнавання мови, а ефект буде мати наслідки у багатьох різних сценаріях,» продовжила Вігдаль. «Підумайте про неправильні субтитри, які ми бачимо у соціальних мережах, судові слухання, де слова неправильно транскрибуються, та електронні платформи навчання, які боролися з голосами дітей протягом пандемії. Помилки, які люди мали прийняти до цього часу, можуть мати відчутний вплив на їхнє повсякденне життя.»
Аллісон Чжу Кунеке – провідний автор дослідження Стенфордського університету щодо розпізнавання мови.
«Критично важливо вивчати та покращувати справедливість систем розпізнавання мови, враховуючи потенційний нерівний вплив на окремих осіб через різні галузі, починаючи від охорони здоров’я та закінчуючи системою правосуддя.»












