Модели и платформы ИИ

Как ИИ решает проблему «коктейльной вечеринки» и ее влияние на будущие аудиотехнологии

mm
Добавьте Unite.AI в избранные источники в Google

Представьте, что вы находитесь на многолюдном мероприятии, окруженном голосами и фоновым шумом, но вы все равно способны сосредоточиться на разговоре с человеком, стоящим прямо перед вами. Эта способность изолировать конкретный звук среди шумного фона известна как проблема коктейльной вечеринки, термин, впервые введенный британским ученым Колином Черри в 1958 году для описания этой замечательной способности человеческого мозга. Эксперты по ИИ десятилетиями пытались воспроизвести эту человеческую способность с помощью машин, но это остается сложной задачей. Однако recent достижения в области искусственного интеллекта открывают новые возможности для решения этой проблемы, что создает предпосылки для трансформационного сдвига в аудиотехнологиях. В этой статье мы исследуем, как ИИ продвигается в решении проблемы коктейльной вечеринки и потенциал, который она имеет для будущих аудиотехнологий. Прежде чем приступить к описанию того, как ИИ решает эту проблему, нам необходимо сначала понять, как люди решают ее.

Как люди решают проблему коктейльной вечеринки

Люди обладают уникальной слуховой системой, которая помогает нам ориентироваться в шумных средах. Наш мозг обрабатывает звуки бинаурально, то есть мы используем входные данные от обоих ушей для обнаружения небольших различий во времени и громкости, что помогает нам обнаружить местоположение звуков. Эта способность позволяет нам ориентироваться на голос, который мы хотим услышать, даже когда другие звуки конкурируют за внимание.

Помимо слуха, наши когнитивные способности еще больше усиливают этот процесс. Селективное внимание помогает нам фильтровать нерелевантные звуки, позволяя нам сосредоточиться на важной информации. Тем временем, контекст, память и визуальные подсказки, такие как чтение по губам, помогают нам разделить речь от фонового шума. Эта сложная сенсорная и когнитивная система обработки информации невероятно эффективна, но воспроизведение ее в машинном интеллекте остается сложной задачей.

Почему это остается сложной задачей для ИИ?

От виртуальных помощников, которые распознают наши команды в многолюдном кафе, до слуховых аппаратов, которые помогают пользователям сосредоточиться на одном разговоре, исследователи ИИ постоянно работают над воспроизведением способности человеческого мозга решить проблему коктейльной вечеринки. Это стремление привело к разработке методов, таких как разделение источников с слепым обучением (BSS) и анализ независимых компонентов (ICA), предназначенных для выявления и изоляции отдельных источников звука для индивидуальной обработки. Хотя эти методы показали перспективы в контролируемых средах, где источники звука предсказуемы и не перекрываются по частоте, они испытывают трудности при различении перекрывающихся голосов или изоляции одного источника звука в реальном времени, особенно в динамических и непредсказуемых условиях. Это в основном связано с отсутствием сенсорной и контекстной глубины, которую люди естественным образом используют. Без дополнительных подсказок, таких как визуальные сигналы или знакомство с конкретными тонами, ИИ сталкивается с трудностями в управлении сложной и хаотичной смесью звуков, встречающихся в повседневных средах.

Как WaveSciences использовала ИИ для решения проблемы

В 2019 году WaveSciences, американская компания, основанная электроинженером Китом Макэлвином в 2009 году, сделала прорыв в решении проблемы коктейльной вечеринки. Их решение, Spatial Release from Masking (SRM), использует ИИ и физику распространения звука для изоляции голоса говорящего от фонового шума. Как и человеческая слуховая система обрабатывает звук из разных направлений, SRM использует несколько микрофонов для захвата звуковых волн, когда они распространяются через пространство.

Одной из критических задач в этом процессе является то, что звуковые волны постоянно отражаются и смешиваются в окружающей среде, что делает трудным изоляцию конкретных голосов математически. Однако, используя ИИ, WaveSciences разработала метод для определения источника каждого звука и фильтрации фонового шума и окружающих голосов на основе их пространственного положения. Эта адаптивность позволяет SRM справляться с изменениями в реальном времени, такими как движущийся говорящий или введение новых звуков, что делает ее значительно более эффективной, чем более ранние методы, которые испытывали трудности с непредсказуемой природой реальных аудио-сред.

Достижения в методах ИИ

Recent прогресс в искусственном интеллекте, особенно в глубоких нейронных сетях, значительно улучшил способность машин решать проблему коктейльной вечеринки. Алгоритмы глубокого обучения, обученные на больших наборах смешанных аудиосигналов, отлично выявляют и разделяют разные источники звука, даже в перекрывающихся голосовых сценариях. Проекты, такие как BioCPPNet, успешно продемонстрировали эффективность этих методов, изолируя вокализации животных, что указывает на их применимость в различных биологических контекстах, выходящих за рамки человеческой речи. Исследователи показали, что методы глубокого обучения могут адаптировать разделение голосов, изученное в музыкальных средах, к новым ситуациям, что повышает устойчивость модели в различных условиях.

Нейронная формирование луча еще больше усиливает эти возможности, используя несколько микрофонов для концентрации на звуках из конкретных направлений, минимизируя фоновый шум. Этот метод уточняется динамическим调ством фокуса на основе аудио-среды. Кроме того, модели ИИ используют маскирование во времени и частоте для различения аудио-источников по их уникальным спектральным и временным характеристикам. Продвинутые системы идентификации говорящих изолируют голоса и отслеживают отдельных говорящих, облегчая организованные разговоры. ИИ может более точно изолировать и усиливать конкретные голоса, включая визуальные подсказки, такие как движения губ, вместе с аудио-данными.

Реальные применения проблемы коктейльной вечеринки

Эти разработки открыли новые возможности для продвижения аудиотехнологий. Некоторые реальные применения включают:

  • Форензическая аналитика: Согласно отчету BBC, технология распознавания и манипуляции речью (SRM) была использована в судах для анализа аудио-доказательств, особенно в случаях, когда фоновый шум осложняет идентификацию говорящих и их диалога. Часто записи в таких сценариях становятся непригодными в качестве доказательств. Однако SRM оказалась бесценной в форензических контекстах, успешно декодируя критические аудио-данные для представления в суде.
  • Наушники с шумоподавлением: Исследователи разработали прототип системы ИИ под названием Target Speech Hearing для наушников с шумоподавлением, которая позволяет пользователям выбрать конкретный голос, который должен остаться слышимым, в то время как другие звуки подавляются. Система использует методы, основанные на проблеме коктейльной вечеринки, для эффективной работы на наушниках с ограниченной вычислительной мощностью. Это пока концепция, но создатели ведут переговоры с брендами наушников о потенциальном включении этой технологии.
  • Слуховые аппараты: Современные слуховые аппараты часто испытывают трудности в шумных средах, не в состоянии изолировать конкретные голоса от фоновых звуков. Хотя эти устройства могут усиливать звук, они не имеют продвинутых фильтров, которые позволяют человеческим ушам сосредоточиться на одном разговоре среди конкурирующих шумов. Это ограничение особенно сложно в многолюдных или динамических условиях, где перекрывающиеся голоса и колеблющиеся уровни шума преобладают. Решения проблемы коктейльной вечеринки могут улучшить слуховые аппараты, изолируя желаемые голоса и минимизируя окружающий шум.
  • Телекоммуникации: В телекоммуникациях ИИ может улучшить качество звонков, фильтруя фоновый шум и подчеркивая голос говорящего. Это приводит к более четкой и надежной связи, особенно в шумных средах, таких как многолюдные улицы или офисы.
  • Голосовые помощники: Голосовые помощники, работающие на ИИ, такие как Amazon (AMZN ) Alexa и Apple Siri, могут стать более эффективными в шумных средах и решать проблему коктейльной вечеринки более эффективно. Эти достижения позволяют устройствам точно понимать и реагировать на команды пользователя, даже на фоне фоновых разговоров.
  • Аудиозапись и редактирование: Технологии, основанные на ИИ, могут помочь аудио-инженерам в пост-продакшене, изолируя отдельные источники звука в записанных материалах. Эта возможность позволяет получить более чистые треки и более эффективное редактирование.

Вывод

Проблема коктейльной вечеринки, значительная задача в обработке аудио, увидела замечательные достижения благодаря технологиям ИИ. Инновации, такие как Spatial Release from Masking (SRM) и алгоритмы глубокого обучения, переопределяют, как машины изолируют и разделяют звуки в шумных средах. Эти прорывы улучшают повседневный опыт, такой как более четкие разговоры в многолюдных условиях и улучшенная функциональность для слуховых аппаратов и голосовых помощников. Однако они также имеют трансформационный потенциал для форензической аналитики, телекоммуникаций и аудио-производственных приложений. По мере того, как ИИ продолжает эволюционировать, его способность имитировать человеческие слуховые возможности приведет к еще более значительным достижениям в аудиотехнологиях, в конечном итоге меняя, как мы взаимодействуем со звуком в нашей повседневной жизни.

Доктор Техсин Зия является доцентом в университете COMSATS в Исламабаде, имеющим степень PhD в области ИИ в Венском техническом университете, Австрия. Специализируясь в области искусственного интеллекта, машинного обучения, науки о данных и компьютерного зрения, он внес значительный вклад с публикациями в авторитетных научных журналах. Доктор Техсин также возглавлял различные промышленные проекты в качестве основного исследователя и служил консультантом по ИИ.