Лідери думок

Чому загальне мовне штучне інтелект не підходить для дітей

mm
Додайте Unite.AI до бажаних джерел у Google

Ви знаєте, що розлади мови у дітей підвищилися більш ніж у два рази після пандемії? В той же час Національна оцінка освітніх досягнень показала, що рівень читання знизився на два бали, незважаючи на введення різних ініціатив для боротьби з втратами навчання, фінансуванням яких займається федеральний уряд. В результаті попит на раннє втручання ніколи не був таким високим, і багато хто звертається до штучного інтелекту та технологій за допомогою. Адже інструменти розпізнавання мови є всюди – від віртуальних помічників до програмного забезпечення для класної кімнати. Але ось проблема: багато з цих інструментів були створені тільки для дорослих голосів.

Сучасні системи автоматичного розпізнавання мови (ASR) зазвичай тренуються на даних дорослих мовців, часто англійських мовців із чіткими та послідовними мовними патернами. Тому, коли дитина говорить, ці моделі часто неправильно інтерпретують їхні слова або взагалі не реагують. Це не просто технічна помилка. Коли штучний інтелект не розуміє, що говорить дитина, це втрачена можливість підтримати навчання, виявити потенційні проблеми розвитку або надати своєчасне втручання.

Хороша новина? Це розв’язна проблема. Але спочатку нам потрібно зрозуміти, чому ці прогалини існують і що потрібно зробити, щоб їх ліквідувати.

Чому мова дітей плутає штучний інтелект

Мова дітей фундаментально відрізняється від мови дорослих, якщо враховувати, що манери дитини можуть бути менш передбачуваними і часто наповнені граматичними несувісностями або неправильною вимовою. На відміну від дорослих, діти часто переривають речення або використовують словарний запас, який ще розвивається – створюючи варіативність, яку штучний інтелект важче обробляти. За даними Національної бібліотеки медицини, системи розпізнавання мови мають рівень помилок у словах, який у двох-чотирьох разів вищий у дітей, ніж у дорослих, через відмінності у висоті звуку, артикуляційній варіативності та несхожості голосових шляхів.

І не тільки те, як діти говорять, але й де вони говорять. Записи голосу дітей часто відбуваються в умовах, таких як класні кімнати або дитячі садки, де голоси багатьох людей перекривають один одного, а фоновий шум постійний. Стандартні моделі ASR важко ізолюють окремого мовця в таких умовах, не кажучи вже про точну транскрипцію їхніх слів. Навіть такі просунуті методи, як діаризація мовців, які полягають у визначенні, який голос належить дитині, вчителеві або репетитору, часто не справляються, коли застосовуються до сценаріїв з кількома мовцями та високим рівнем шуму. Без цього системи ризикують помилково приписати мовлення, ще більше знижуючи точність та придатність.

Іншим ключовим викликом є відсутність транскрипції на рівні фонем у багатьох системах ASR. Розбивка мови на окремі звуки дозволяє моделям відстежувати неправильну вимову, коливання та поточність із значно вищою точністю. Цей детальний підхід особливо цінний у освітніх та терапевтичних умовах, де розуміння тонких відмінностей у мові може інформувати втручання.

Ці особливості працюють найкраще, коли їх використовують разом. Вони не замінюють загальні моделі мови, а дофінують їх етично отриманими, дитячими даними для точної роботи в ситуаціях, де це найважливіше.

Дефіцит даних і чому великі технологічні компанії не розв’язують цю проблему

Корінь проблеми лежить у даних – або їх відсутності. Оскільки більшість моделей мови тренуються на наборах даних, що домінують дорослі голоси, голоси дітей, особливо тих, що походять з різних лінгвістичних та культурних середовищ, майже забуті. Збір високоякісних, репрезентативних даних голосу дітей, необхідних для тренування моделей штучного інтелекту, є внутрішньо складним, і з хорошої причини. Регулятори, такі як COPPA (Закон про захист конфіденційності дітей в Інтернеті), накладають суворі обмеження на компанії, які намагаються зібрати та проаналізувати дані дітей молодших 13 років. Хоча ці регулятори критично важливі для захисту конфіденційності дітей, вони ненавмисно створюють бар’єри для розвитку штучного інтелекту.

Для багатьох технологічних компаній аналіз витрат і вигод та сприйнята ринкова можливість не виправдовують інвестицій. Підтримка розпізнавання мови для дітей часто розглядається як високоефективне, низькорентабельне завдання. Ринок менший порівняно з корпоративними та орієнтованими на дорослих рішеннями, а регуляторні бар’єри роблять його ще менш привабливим. В результаті покращення ASR для дітей рідко потрапляє до верхньої частини списку пріоритетів.

Чому точний і етичний штучний інтелект важливий для рівних результатів грамотності

Незважаючи на ці виклики, штучний інтелект відіграє життєво важливу роль у класних кімнатах та терапевтичних сесіях – для оцінок читання, ранніх програм грамотності та навіть скринінгів на порушення навчання. Але точність має значення. В одному дослідженні найкраща система ASR транскрибувала лише 18% слів 5-річних дітей правильно. Помилки розпізнавання можуть спотворити дані, на які покладаються педагогами та спеціалісти. Це потенційно може привести до недооцінки рівня читання дитини або затримки у виявленні можливих мовних або навчальних труднощів

Коли штучний інтелект не спрацьовує, це впливає не тільки на результати навчання. Це розширює розрив у рівності. Діти з різними акцентами, нейрорізноманітними учнями та багатомовними студентами непропорційно постраждали від неточностей ASR. Ці групи вже перебувають у групі високого ризику бути неправильно зрозумілими загальними моделями, а коли штучний інтелект не спрацьовує, це може посилити існуючі диспропорції в освіті та охороні здоров’я. Для практиків штучного інтелекту це підкреслює необхідність проектування систем, які не тільки точні, але й рівні.

Етичні міркування є рівнозначними. Дані дітей надзвичайно чутливі та повинні оброблятися з піклуванням та прозорими намірами. Багато існуючих інструментів покладаються на сервери третіх сторін для обробки даних мови – практика, яка може бути достатньою для чат-бота клієнтського обслуговування, але цілком неприйнятна для молодих учнів. На щастя, локальна та обробка даних на місці виникає як найкраща практика, оскільки вона гарантує, що дані ніколи не покидають пристрій, що відповідає законам, які обмежують збір, цільову рекламу та зберігання даних.

Закриття прогалини за допомогою спеціально створених інструментів

Щоб真正 підтримати дітей, штучний інтелект від мови повинен вийти за рамки базової транскрипції та бути спеціально створеним для реальних складностей класних кімнат, клінік та інших динамічних середовищ навчання. Його роль повинна полягати у посиленні, а не заміні, людського досвіду. Найефективніші системи не просто присвоюють оцінки або мітки; вони забезпечують детальні, дієвані висновки через такі особливості, як таймстемпи, транскрипції на рівні фонем та індикатори коливань.

Озброївши педагогів та терапевтів нюансованими, надійними даними, штучний інтелект може дати фахівцям можливість приймати обґрунтовані рішення, адаптовані до потреб кожної дитини. Коли штучний інтелект проектується вдумливо та етично, він стає більше, ніж просто інструментом. Він стає довіреним партнером у розвитку грамотності, рівності та значимих результатів навчання для кожної дитини.

Богдан Хомич є керівником напрямку досліджень та розробки продукції у компанії SoftServe, провідному постачальнику ІТ-консультінгових та цифрових послуг. Він тісно співпрацює з вченими для дослідження, розробки та комерціалізації нових технологій, спрямованих на розвиток людства. Його сфера інтересів охоплює агентів штучного інтелекту, генеративний інтелект, квантові обчислення, біоінновації та високопродуктивні обчислення. Богдан має ступені у галузі управління технологіями в Українському католицькому університеті та кіберінженерії в Київському національному університеті.