Modely a platformy AI

Sluchátka s umělou inteligencí umožňují poslouchat jednu osobu v davu

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

V přeplněném, hlučném prostředí jste někdy přáli, abyste mohli vytěsnit všechny pozadí a soustředit se pouze na osobu, kterou se snažíte poslouchat? Zatímco sluchátka s rušením hluku udělala velké pokroky v vytváření zvukové blanky, stále zápasí s tím, aby umožnila specifické zvuky z okolí nositele projít. Ale co kdyby vaše sluchátka mohla být trénována na zachycení a zesílení hlasu jedné osoby, i když se pohybujete po místnosti plné jiných rozhovorů?

Target Speech Hearing (TSH), průlomový systém umělé inteligence vyvinutý výzkumníky na University of Washington, činí pokroky v této oblasti.

Jak funguje Target Speech Hearing

Abyste mohli použít TSH, musí osoba nosící speciálně vybavená sluchátka prostě pohlédnout na osobu, kterou chce slyšet, po několik sekund. Tato krátká “registrace” umožňuje systému umělé inteligence naučit se a zachytit jedinečné hlasové vzory cílového mluvčího.

Zde je, jak to funguje pod kapotou:

  1. Uživatel stiskne tlačítko, zatímco směruje hlavu směrem k požadovanému mluvčímu po 3-5 sekund.
  2. Mikrofony na obou stranách sluchátek zachycují zvukové vlny z hlasu mluvčího současně (s 16stupňovou marží chyby).
  3. Sluchátka přenášejí tento audio signál na vestavěný počítač.
  4. Software strojového učení analyzuje hlas a vytváří model distinctivních hlasových charakteristik mluvčího.
  5. Systém umělé inteligence používá tento model k izolaci a zesílení hlasu registrovaného mluvčího v reálném čase, i když se uživatel pohybuje v hlučném prostředí.

Čím déle cílový mluvčí mluví, tím více trénovacích dat systém obdrží, což mu umožňuje lépe se soustředit na a zjasnit požadovaný hlas. Tento inovativní přístup k “selektivnímu slyšení” otevírá svět možností pro zlepšení komunikace a přístupnosti v náročných zvukových prostředích.

Shyam Gollakota je hlavní autor článku a profesor na University of Washington v Paul G. Allen School of Computer Science & Engineering

“Máme tendenci myslet na umělou inteligenci nyní jako na webové chatboty, které odpovídají na otázky. Ale v tomto projektu vyvíjíme umělou inteligenci, která modifikuje zvukovou percepci každého, kdo nosí sluchátka, podle jejich preferencí. S našimi zařízeními můžete nyní slyšet jednoho mluvčího jasně, i když jste v hlučném prostředí s mnoha jinými lidmi, kteří mluví.” – Gollakota

Testování sluchátek s umělou inteligencí s TSH

Abyste mohli otestovat Target Speech Hearing, provedl výzkumný tým studii se 21 účastníky. Každý účastník nosil sluchátka s TSH a zaregistroval cílového mluvčího v hlučném prostředí. Výsledky byly působivé – v průměru uživatelé ohodnotili jasnost hlasu registrovaného mluvčího jako téměř dvojnásobnou ve srovnání s nefiltrovaným audio signálem.

Tento průlom staví na předchozí práci týmu na “sémantickém slyšení”, které umožňovalo uživatelům filtrovat jejich zvukové prostředí na základě předem definovaných zvukových klasifikací, jako jsou ptáci nebo lidské hlasy. TSH jde dále tím, že umožňuje selektivní zesílení hlasu konkrétní osoby.

Dopady jsou významné, od zlepšení osobních rozhovorů v hlučných prostředích až po zlepšení přístupnosti pro lidi se sluchovými vadami. Jak se technologie vyvíjí, mohla by fundamentálně změnit, jak prožíváme a interagujeme se svým zvukovým světem.

Zlepšování sluchátek s umělou inteligencí a překonávání omezení

Zatímco Target Speech Hearing představuje velký pokrok v oblasti umělé inteligence, systém má einige omezení ve své současné formě:

  • Registrování jednoho mluvčího: V současné době může TSH být trénován pouze na jednoho mluvčího najednou. Registrování více mluvčích současně není zatím možné.
  • Rušení z podobných audio zdrojů: Pokud jiný hlasitý hlas pochází ze stejného směru jako cílový mluvčí během registračního procesu, systém může mít potíže s izolací požadovaných hlasových vzorů.
  • Ruční pře-registrování: Pokud uživatel není spokojen s kvalitou audio signálu po počátečním tréninku, musí ručně pře-registrovat cílového mluvčího, aby zlepšil jasnost.

Navzdory těmto omezením tým na University of Washington aktivně pracuje na zlepšování a rozšiřování možností TSH. Jedním z jejich hlavních cílů je miniaturizovat technologii, aby mohla být integrována do spotřebních produktů, jako jsou earbudy a sluchadla.

Jak výzkumníci pokračují v rozšiřování hranic toho, co je možné s umělou inteligencí, potenciální aplikace jsou rozsáhlé, od zlepšení produktivity v rušivých kancelářských prostředích až po usnadnění jasnější komunikace pro první respondenty a vojenské osoby v kritických situacích. Budoucnost selektivního slyšení vypadá jasně, a Target Speech Hearing je připraven hrát zásadní roli v jejím formování.

Alex McFarland je AI novinář a spisovatel, který zkoumá nejnovější vývoj v oblasti umělé inteligence. Spolupracoval s mnoha AI startupy a publikacemi po celém světě.