AI-modeller og platforme

AI-hovedtelefoner kan få dig til at lytte til én person i en menneskemængde

mm
Føj Unite.AI til dine foretrukne kilder på Google

I en overfyldt, støjende omgang, har du nogensinde ønsket, at du kunne udelukke al baggrundsstøj og kun fokusere på den person, du forsøger at lytte til? Mens støjreducerende hovedtelefoner har gjort store fremskridt i at skabe en auditiv blanko, kæmper de stadig for at lade bestemte lyde fra brugerens omgivelser filtrere igennem. Men hvad hvis dine hovedtelefoner kunne trænes til at opfange og forstærke stemmen fra en enkelt person, selv når du bevæger dig rundt i et rum fyldt med andre samtaler?

Target Speech Hearing (TSH), et banebrydende AI-system udviklet af forskere ved University of Washington, gør fremskridt på dette område.

Hvordan Target Speech Hearing fungerer

For at bruge TSH skal en person, der bærer specieludstyrede hovedtelefoner, blot se på den person, de vil høre, i nogle få sekunder. Denne korte “tilmeldingsperiode” giver AI-systemet mulighed for at lære og fastgøre sig til den enkelte talers unikke vokalpatroner.

Her er, hvordan det fungerer under overfladen:

  1. Brugeren trykker på en knap, mens de retter hovedet mod den ønskede taler i 3-5 sekunder.
  2. Mikrofoner på begge sider af hovedtelefonen optager lydbølgerne fra talerens stemme samtidig (med en 16-graders fejlmargin).
  3. Hovedtelefonen sender denne lydsignal til en indbygget computer.
  4. Maskinlæringssoftware analyserer stemmen og opretter en model af talerens distinkte vokalpatroner.
  5. AI-systemet bruger denne model til at isolere og forstærke den tilmeldte talers stemme i realtid, selv når brugeren bevæger sig rundt i en støjende omgang.

Jo længere den ønskede taler taler, jo mere træningsdata modtager systemet, og det kan bedre fokusere på og klargøre den ønskede stemme. Denne innovative tilgang til “selektiv hørelse” åbner op for en verden af muligheder for forbedret kommunikation og tilgængelighed i udfordrende akustiske omgivelser.

Shyam Gollakota er seniorforfatter på artiklen og en UW-professor på Paul G. Allen School of Computer Science & Engineering

“Vi tenderer til at tænke på AI nu som webbaserede chatbots, der besvarer spørgsmål. Men i dette projekt udvikler vi AI til at modificere den auditive perception af enhver, der bærer hovedtelefoner, givet deres præferencer. Med vores enheder kan du nu høre en enkelt taler tydeligt, selv hvis du er i en støjende omgang med mange andre mennesker, der taler.” – Gollakota

Test af AI-hovedtelefoner med TSH

For at teste Target Speech Hearing gennemførte forskerholdet en studie med 21 deltagere. Hver deltager bar TSH-aktiverede hovedtelefoner og tilmeldte en ønsket taler i en støjende omgang. Resultaterne var imponerende – i gennemsnit vurderede brugerne klarheden af den tilmeldte talers stemme til at være næsten dobbelt så høj i forhold til den ufiltrede lydstrøm.

Denne gennembrud bygger på holdets tidligere arbejde på “semantisk hørelse”, der tillod brugere at filtrere deres akustiske omgivelser baseret på foruddefinerede lydklassificeringer, såsom fuglesang eller menneskestemmer. TSH tager dette koncept et skridt videre ved at aktivere selektiv forstærkning af en bestemt persons stemme.

Konsekvenserne er betydelige, fra at forbedre personlige samtaler i høje omgivelser til at forbedre tilgængelighed for mennesker med hørelseproblemer. Da teknologien udvikles, kan den fundamentalt ændre, hvordan vi oplever og interagerer med vores akustiske verden.

Forbedring af AI-hovedtelefoner og overvindelse af begrænsninger

Selvom Target Speech Hearing repræsenterer et stort skridt fremad i auditiv AI, har systemet nogle begrænsninger i sin nuværende form:

  • Enkelt taler-tilmelding: For nu kan TSH kun trænes til at fokusere på en taler ad gangen. Tilmelding af multiple talere samtidig er ikke mulig endnu.
  • Interferens fra lignende lydkilder: Hvis en anden høj stemme kommer fra samme retning som den ønskede taler under tilmeldingsprocessen, kan systemet kæmpe for at isolere den ønskede persons vokalpatroner.
  • Manuel gen-tilmelding: Hvis brugeren er utilfreds med lydkvaliteten efter den første træning, skal de manuelt gen-tilmelde den ønskede taler for at forbedre klarheden.

Trods disse begrænsninger arbejder University of Washington-holdet aktivt på at forfine og udvide TSH’s kapaciteter. En af deres primære mål er at miniaturisere teknologien, så den kan integreres i forbrugerprodukter som ørepropper og hørelæsser.

Da forskerne fortsætter med at udvide, hvad der er muligt med auditiv AI, er de potentielle anvendelser enorme, fra at forbedre produktivitet i distraherende kontormiljøer til at facilitere klarere kommunikation for førstehjælpere og militærpersonale i højrisikosituationer. Fremtiden for selektiv hørelse ser lys ud, og Target Speech Hearing er parat til at spille en afgørende rolle i at forme den.

Alex McFarland er en AI-journalist og forfatter, der udforsker de seneste udviklinger inden for kunstig intelligens. Han har samarbejdet med talrige AI-startups og publikationer verden over.