Modele i platformy AI

Jak AI rozwiązuje problem “Cocktail Party” i jego wpływ na przyszłe technologie audio

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Wyobraź sobie, że jesteś na zatłoczonym wydarzeniu, otoczony głosami i hałasem tła, a jednak potrafisz się skoncentrować na rozmowie z osobą stojącą przed tobą. Ta zdolność do izolacji konkretnego dźwięku wśród głośnego tła jest znana jako problem “Cocktail Party”, termin po raz pierwszy wprowadzony przez brytyjskiego naukowca Colina Cherry’ego w 1958 roku, aby opisać tę niezwykłą zdolność ludzkiego mózgu. Ekspertom od AI od dziesięcioleci próbowali naśladować tę ludzką zdolność za pomocą maszyn, ale nadal jest to wyzwanie. Jednak ostatnie postępy w sztucznej inteligencji przełamują nowe granice, oferując skuteczne rozwiązania problemu. To stwarza podstawę dla przełomowej zmiany w technologii audio. W tym artykule eksplorujemy, jak AI postępuje w rozwiązywaniu problemu “Cocktail Party” i potencjał, jaki ma dla przyszłych technologii audio. Przed tym, jak AI rozwiązuje ten problem, musimy najpierw zrozumieć, jak ludzie rozwiązują ten problem.

Jak ludzie rozwiązują problem “Cocktail Party”

Ludzie posiadają unikalny system słuchowy, który pomaga nam nawigować w głośnych środowiskach. Nasze mózgi przetwarzają dźwięki binauralnie, co oznacza, że używamy danych z obu uszu, aby wykryć niewielkie różnice w czasie i głośności, co pomaga nam wykryć położenie dźwięków. Ta zdolność pozwala nam skierować się w stronę głosu, który chcemy usłyszeć, nawet gdy inne dźwięki konkurują o uwagę.

Poza słuchem, nasze zdolności poznawcze dodatkowo wzmacniają ten proces. Selekcja uwagi pomaga nam filtrować nieistotne dźwięki, pozwalając nam się skoncentrować na ważnych informacjach. Kontekst, pamięć i wskazówki wizualne, takie jak czytanie z ust, pomagają w rozdzieleniu mowy od hałasu tła. Ten złożony system sensoryczny i poznawczy jest niezwykle wydajny, ale replikowanie go w inteligencji maszynowej pozostaje wyzwaniem.

Dlaczego nadal jest to wyzwanie dla AI?

Od wirtualnych asystentów rozpoznających nasze polecenia w zajętym kawiarni do aparatów słuchowych, które pomagają użytkownikom się skoncentrować na jednej rozmowie, badacze AI od dawna próbowali naśladować zdolność ludzkiego mózgu do rozwiązywania problemu “Cocktail Party”. To poszukiwanie doprowadziło do rozwoju takich technik, jak separacja źródeł dźwięku (BSS) i analiza składowych niezależnych (ICA), zaprojektowanych do identyfikacji i izolacji odrębnych źródeł dźwięku do indywidualnej obróbki. Chociaż te metody wykazały obietnicę w kontrolowanych środowiskach – gdzie źródła dźwięku są przewidywalne i nie nakładają się znacząco w częstotliwości – mają trudności z różnicowaniem nakładających się głosów lub izolowaniem jednego źródła dźwięku w czasie rzeczywistym, szczególnie w dynamicznych i nieprzewidywalnych ustawieniach. Jest to głównie spowodowane brakiem sensorycznej i kontekstowej głębi, której ludzie naturalnie używają. Bez dodatkowych wskazówek, takich jak sygnały wizualne lub znajomość konkretnych tonów, AI stoi przed wyzwaniami w zarządzaniu złożonym, chaotycznym mieszaniną dźwięków spotykanych w codziennych środowiskach.

Jak WaveSciences użyło AI do rozwiązania problemu

W 2019 roku WaveSciences, amerykańska firma założona przez inżyniera elektrycznego Keitha McElveena w 2009 roku, dokonała przełomu w rozwiązywaniu problemu “Cocktail Party”. Ich rozwiązanie, Spatial Release from Masking (SRM), wykorzystuje AI i fizykę propagacji dźwięku, aby izolować głos mówcy od hałasu tła. Podobnie jak ludzki system słuchowy przetwarza dźwięki z różnych kierunków, SRM wykorzystuje wiele mikrofonów do przechwytywania fal dźwiękowych, gdy przemieszczają się one przez przestrzeń.

Jednym z krytycznych wyzwań w tym procesie jest to, że fale dźwiękowe ciągle odbijają się i mieszają w środowisku, co utrudnia izolowanie konkretnych głosów w sposób matematyczny. Jednak dzięki AI WaveSciences opracowało metodę, aby wskazać pochodzenie każdego dźwięku i wyfiltrować hałas tła oraz głosy otoczenia na podstawie ich położenia przestrzennego. Ta adaptacyjność pozwala SRM radzić sobie ze zmianami w czasie rzeczywistym, takimi jak poruszający się mówca lub wprowadzenie nowych dźwięków, co czyni ją znacznie bardziej skuteczną niż wcześniejsze metody, które miały trudności z nieprzewidywalną naturą rzeczywistych ustawień audio. Ten postęp nie tylko poprawia zdolność do koncentrowania się na rozmowach w głośnych środowiskach, ale także otwiera drogę do przyszłych innowacji w technologii audio.

Postępy w technice AI

Ostatnie postępy w sztucznej inteligencji, szczególnie w głębokich sieciach neuronowych, znacznie poprawiły możliwości maszyn w rozwiązywaniu problemu “Cocktail Party”. Algorytmy głębokiego uczenia, wytrenowane na dużych zbiorach danych mieszanego sygnału audio, są doskonałe w identyfikowaniu i rozdzielaniu różnych źródeł dźwięku, nawet w przypadku nakładających się głosów. Projekty takie jak BioCPPNet udowodniły skuteczność tych metod, izolując wokalizacje zwierząt, co wskazuje na ich przydatność w różnych kontekstach biologicznych poza ludzką mową. Badacze wykazali, że techniki głębokiego uczenia mogą adaptować separację głosów nauczoną w środowiskach muzycznych do nowych sytuacji, zwiększając wytrzymałość modelu w różnych ustawieniach.

Neuralne kształtowanie wiązki dalej zwiększa te możliwości, wykorzystując wiele mikrofonów do koncentrowania się na dźwiękach z konkretnych kierunków, jednocześnie minimalizując hałas tła. Ta technika jest udoskonalana przez dynamiczne dostosowanie focusu w zależności od środowiska audio. Ponadto modele AI wykorzystują maskowanie czasowo-częstotliwościowe, aby różnicować źródła audio według ich unikalnych cech widmowych i czasowych. Zaawansowane systemy diarizacji mówców izolują głosy i śledzą poszczególnych mówców, ułatwiając zorganizowane rozmowy. AI może daha dokładnie izolować i wzmocnić konkretny głos, łącząc wskazówki wizualne, takie jak ruchy ust, z danymi audio.

Rzeczywiste zastosowania problemu “Cocktail Party”

Te rozwoje otworzyły nowe drogi do rozwoju technologii audio. Niektóre rzeczywiste zastosowania obejmują:

  • Analiza sądowa: Według raportu BBC, technologia rozpoznawania i manipulacji mową (SRM) została zastosowana w sądach do analizy dowodów audio, szczególnie w przypadkach, w których hałas tła utrudnia identyfikację mówców i ich dialogów. Często nagrania w takich sytuacjach stają się nieprzydatne jako dowody. Jednak SRM okazała się niezwykle przydatna w kontekstach sądowych, udanie odszyfrowując krytyczne nagrania audio do przedstawienia w sądzie.
  • Słuchawki redukujące hałas: Badacze opracowali prototyp systemu AI o nazwie Target Speech Hearing dla słuchawek redukujących hałas, który pozwala użytkownikom wybrać konkretny głos, aby pozostał słyszalny, podczas gdy inne dźwięki są redukowane. System wykorzystuje techniki związane z problemem “Cocktail Party”, aby działać wydajnie na słuchawkach z ograniczoną mocą obliczeniową. Jest to obecnie pojęcie dowodowe, ale twórcy są w rozmowach z markami słuchawek, aby potencjalnie zintegrować tę technologię.
  • Aparaty słuchowe: Współczesne aparaty słuchowe często mają trudności w głośnych środowiskach, nie potrafiąc izolować konkretnych głosów od hałasu tła. Chociaż te urządzenia mogą wzmocnić dźwięk, brakuje im zaawansowanych mechanizmów filtrujących, które umożliwiają ludzkim uszom koncentrować się na jednej rozmowie wśród konkurencyjnych dźwięków. To ograniczenie jest szczególnie wyzwaniem w zatłoczonych lub dynamicznych ustawieniach, gdzie nakładające się głosy i fluktuujące poziomy hałasu dominują. Rozwiązania problemu “Cocktail Party” mogą poprawić aparaty słuchowe, izolując pożądane głosy i minimalizując hałas otoczenia.
  • Telekomunikacja: W telekomunikacji AI może poprawić jakość połączeń, filtrując hałas tła i podkreślając głos mówcy. To prowadzi do jaśniejszej i bardziej niezawodnej komunikacji, szczególnie w głośnych środowiskach, takich jak zajęte ulice lub zatłoczone biura.
  • Asystenci głosowi: Asystenci głosowi oparci na AI, tacy jak Amazon (AMZN ) Alexa i Apple Siri, mogą stać się bardziej skuteczni w głośnych środowiskach i rozwiązywać problem “Cocktail Party” bardziej efektywnie. Te postępy umożliwiają urządzeniom dokładne zrozumienie i odpowiedź na polecenia użytkowników, nawet podczas tła rozmów.
  • Nagrywanie i edycja audio:Technologie napędzane przez AI mogą pomóc inżynierom dźwięku w postprodukcji, izolując poszczególne źródła dźwięku w nagranych materiałach. Ta zdolność pozwala na czystsze ścieżki i bardziej efektywną edycję.

Podsumowanie

Problem “Cocktail Party”, znaczące wyzwanie w przetwarzaniu audio, doświadczył znaczących postępów dzięki technologiom AI. Innowacje takie jak Spatial Release from Masking (SRM) i algorytmy głębokiego uczenia przełamują nowe granice w izolowaniu i separacji dźwięków w głośnych środowiskach. Te przełomy poprawiają codzienne doświadczenia, takie jak jaśniejsze rozmowy w zatłoczonych miejscach i poprawioną funkcjonalność aparatów słuchowych i asystentów głosowych. Nadal jednak one mają potencjał transformacyjny dla analizy sądowej, telekomunikacji i aplikacji produkcyjnych audio. W miarę ewolucji AI, jej zdolność do naśladowania ludzkich zdolności słuchowych doprowadzi do jeszcze bardziej znaczących postępów w technologii audio, ostatecznie zmieniając sposób, w jaki interaktywnie korzystamy z dźwięku w naszym codziennym życiu.

Dr. Tehseen Zia jest profesorem nadzwyczajnym w COMSATS University Islamabad, posiada tytuł doktora w dziedzinie sztucznej inteligencji na Vienna University of Technology, Austria. Specjalizując się w sztucznej inteligencji, uczeniu maszynowym, nauce o danych i widzeniu komputerowym, wniósł znaczący wkład poprzez publikacje w renomowanych czasopismach naukowych. Dr. Tehseen Zia również kierował różnymi projektami przemysłowymi jako główny badacz i pełnił funkcję konsultanta ds. sztucznej inteligencji.