Моделі та платформи ШІ
Наушники з штучним штучним слухом дозволяють слухати одну людину у натовпі
У переповненому, шумному середовищі, чи колись ви бажали б ви могли вимкнути весь фоновий шум і зосередитися виключно на людині, яку ви намагаєтеся слухати? Хоча шумопоглинаючі наушники зробили великі кроки у створенні аудіо-чистого аркуша, вони все ще борються з тим, щоб дозволити певні звуки з навколишнього середовища слухача проходити через них. Але що, якщо ваші наушники могли б бути навчені виявляти і посилювати голос однієї людини, навіть якщо ви рухаєтеся кімнатою, наповненою іншими розмовами?
Target Speech Hearing (TSH), революційна система штучного інтелекту, розроблена дослідниками Університету Вашингтона, робить прогрес у цій галузі.
Як працює Target Speech Hearing
Для використання TSH людина, яка носить спеціально обладнані наушники, просто повинна подивитися на людину, яку вона хоче слухати, протягом декількох секунд. Цей короткий “запис” дозволяє системі штучного інтелекту вивчити і схопити унікальні голосові закономірності цільової людини.
Ось як це працює під капотом:
- Користувач натискає кнопку, спрямовуючи голову у бік бажаної людини на 3-5 секунд.
- Мікрофони на обох сторонах навушників одночасно приймають звукові хвилі від голосу людини (з похибкою 16 градусів).
- Навушники передають цей аудіосигнал до вбудованого комп’ютера.
- Програмне забезпечення машинного навчання аналізує голос і створює модель особливих голосових характеристик людини.
- Система штучного інтелекту використовує цю модель для ізоляції і посилення голосу зареєстрованої людини в реальному часі, навіть якщо користувач рухається у шумному середовищі.
Чим довше цільова людина говорить, тим більше тренувальних даних система отримує, що дозволяє їй краще зосередитися і очистити бажаний голос. Цей інноваційний підхід до “вибіркового слуху” відкриває світ можливостей для покращення спілкування і доступності у складних аудіо-середовищах.
Shyam Gollakota є старшим автором статті і професором Університету Вашингтона в школі комп’ютерних наук та інженерії
“Ми звикли думати про штучний інтелект зараз як веб-орієнтовані чат-боти, які відповідають на питання. Але в цьому проекті ми розробляємо штучний інтелект для зміни аудіо-вражень будь-кого, хто носить наушники, згідно з їхніми уподобаннями. З нашими пристроями ви можете тепер чути одного людину чітко, навіть якщо ви знаходитеся в шумному середовищі з багатьма іншими людьми, які говорять.” – Голлакота
Тестування наушників штучного інтелекту з TSH
Для того, щоб протестувати Target Speech Hearing, дослідницька команда провела дослідження з 21 учасником. Кожен учасник носив наушники з TSH і зареєстрував цільову людину у шумному середовищі. Результати були вражаючими – у середньому користувачі оцінили чіткість голосу зареєстрованої людини майже вдвічі вище порівняно з необробленим аудіо-сигналом.
Цей прорив будується на попередній роботі команди над “семантичним слухом”, який дозволяв користувачам фільтрувати своє аудіо-середовище на основі попередньо визначених звукових класифікацій, таких як птахи, що співають, або людські голоси. TSH розширює цю концепцію на一步 далі, дозволяючи вибіркове посилення голосу конкретної людини.
Вплив це має значний, від покращення особистих розмов у гучних умовах до покращення доступності для людей з порушеннями слуху. По мірі розвитку технології вона могла б фундаментально змінити, як ми переживаємо і взаємодіємо з нашим аудіо-світом.
Покращення наушників штучного інтелекту і подолання обмежень
Хоча Target Speech Hearing представляє собою великий крок вперед у аудіо-штучному інтелекті, система має деякі обмеження у своєму поточному вигляді:
- Реєстрація одного мовця: Наразі TSH може бути навчена фокусуватися лише на одному мовці одночасно. Реєстрація декількох мовців одночасно ще не можлива.
- Перешкоди від подібних аудіо-джерел: Якщо інший гучний голос лунає з того ж напрямку, що і цільова людина під час реєстрації, система може боротися з ізоляцією бажаних голосових закономірностей.
- Ручна реєстрація: Якщо користувач не задоволений якістю аудіо після початкової обробки, він повинен вручну зареєструвати цільову людину, щоб покращити чіткість.
Незважаючи на ці обмеження, команда Університету Вашингтона активно працює над удосконаленням і розширенням можливостей TSH. Одним з їхніх основних цілей є мініатюризація технології, що дозволить їй бути безшовно інтегрованою у споживчі продукти, такі як наушники і слухові апарати.
По мірі того, як дослідники продовжують розширювати межі того, що можливо з аудіо-штучним інтелектом, потенційні застосування є величезними, від покращення продуктивності у відволікаючих офісних умовах до забезпечення чіткої комунікації для перших респондентів і військовослужбовців у високих ставках ситуаціях. Майбутнє вибіркового слуху виглядає яскраво, і Target Speech Hearing готується зіграти ключову роль у формуванні його.












