Модели и платформы ИИ

Наушники с ИИ позволяют слушать одного человека в толпе

mm
Добавьте Unite.AI в избранные источники в Google

В многолюдном, шумном окружении, вы когда-нибудь хотели отключить все фоновый шум и сосредоточиться исключительно на человеке, которого вы пытаетесь слушать? Хотя наушники с шумоподавлением сделали большие шаги в создании звукового чистого листа, они все еще испытывают трудности с пропусканием конкретных звуков из окружения носителя. Но что, если ваши наушники могли бы быть обучены уловить и усилить голос одного человека, даже когда вы перемещаетесь по комнате, заполненной другими разговорами?

Target Speech Hearing (TSH), революционная система ИИ, разработанная исследователями Университета Вашингтона, делает прогресс в этой области.

Как работает Target Speech Hearing

Чтобы использовать TSH, человек, носящий специально оборудованные наушники, просто нужно посмотреть на человека, которого он хочет услышать, в течение нескольких секунд. Этот краткий “регистрационный” период позволяет системе ИИ научиться и захватить уникальные вокальные паттерны целевого диктора.

Вот как это работает под капотом:

  1. Пользователь нажимает кнопку, направляя голову к желаемому диктору в течение 3-5 секунд.
  2. Микрофоны на обеих сторонах гарнитуры улавливают звуковые волны от голоса диктора одновременно (с погрешностью 16 градусов).
  3. Наушники передают этот аудиосигнал встроенному компьютеру.
  4. Программное обеспечение машинного обучения анализирует голос и создает модель характерных вокальных особенностей диктора.
  5. Система ИИ использует эту модель для изоляции и усиления голоса зарегистрированного диктора в режиме реального времени, даже когда пользователь перемещается в шумной среде.

Чем дольше говорит целевой диктор, тем больше обучающих данных получает система, что позволяет ей лучше сосредоточиться и прояснить желаемый голос. Этот инновационный подход к “селективному слуху” открывает мир возможностей для улучшения коммуникации и доступности в сложных слуховых средах.

Shyam Gollakota является старшим автором статьи и профессором Университета Вашингтона в школе компьютерных наук и инженерии имени Пола Г. Аллена

“Мы склонны думать об ИИ сейчас как о веб-чатботах, которые отвечают на вопросы. Но в этом проекте мы разработали ИИ, чтобы изменить слуховое восприятие любого, кто носит наушники, исходя из его предпочтений. С нашими устройствами вы теперь можете услышать одного диктора четко, даже если вы находитесь в шумной среде с множеством других людей, которые говорят.” – Голлакота

Тестирование наушников с ИИ с TSH

Чтобы проверить Target Speech Hearing, исследовательская команда провела исследование с 21 участником. Каждый участник носил наушники с TSH и зарегистрировал целевого диктора в шумной среде. Результаты были впечатляющими – в среднем, пользователи оценили ясность голоса зарегистрированного диктора почти в два раза выше по сравнению с нефильтрованным аудиопотоком.

Этот прорыв основан на предыдущей работе команды по “семантическому слуху”, которая позволяла пользователям фильтровать свою слуховую среду на основе предварительно определенных классификаций звуков, таких как птичье пение или человеческие голоса. TSH делает еще один шаг вперед, позволяя селективно усиливать голос конкретного человека.

Последствия значительны, от улучшения личных разговоров в громких условиях до повышения доступности для людей с нарушениями слуха. По мере развития технологии она может фундаментально изменить, как мы воспринимаем и взаимодействуем со своей слуховой средой.

Улучшение наушников с ИИ и преодоление ограничений

Хотя Target Speech Hearing представляет собой значительный шаг вперед в слуховом ИИ, система имеет некоторые ограничения в своей текущей форме:

  • Регистрация одного диктора: Пока что, TSH может быть обучена сосредоточиться только на одном дикторе одновременно. Регистрация нескольких дикторов одновременно пока не возможна.
  • Помехи от подобных аудиоисточников: Если другой громкий голос исходит из того же направления, что и целевой диктор во время процесса регистрации, система может испытывать трудности с изоляцией вокальных паттернов желаемого диктора.
  • Ручная повторная регистрация: Если пользователь не удовлетворен качеством аудио после первоначальной тренировки, он должен вручную повторно зарегистрировать целевого диктора, чтобы улучшить ясность.

Несмотря на эти ограничения, команда Университета Вашингтона активно работает над усовершенствованием и расширением возможностей TSH. Одной из их основных целей является миниатюризация технологии, что позволит интегрировать ее в потребительские продукты, такие как наушники и слуховые аппараты.

По мере того, как исследователи продолжают расширять границы того, что возможно с помощью слухового ИИ, потенциальные применения огромны, от повышения производительности в отвлекающих офисных средах до обеспечения более четкой коммуникации для первых респондентов и военнослужащих в высокорисковых ситуациях. Будущее селективного слуха выглядит перспективным, и Target Speech Hearing готова сыграть ключевую роль в формировании его.

Алекс Макфарленд - журналист и писатель в области искусственного интеллекта, исследующий последние разработки в этой области. Он сотрудничал с многочисленными стартапами и изданиями в области искусственного интеллекта во всем мире.