AI-modeller og plattformer

AI-hodetelefoner lar deg lytte til én person i en folkemengde

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

I en travelt, støyende omgivelse, har du noen gang ønsket å kunne tune ut all bakgrunnsstøyen og fokusere kun på personen du prøver å lytte til? Mens støykanselleringshodetelefoner har gjort store fremskritt i å skape en auditiv blank vegg, sliter de fortsatt med å la spesifikke lyder fra brukerens omgivelse filtere gjennom. Men hva hvis hodetelefonene dine kunne bli trenet til å plukke opp og forsterke stemmen til en enkelt person, selv når du beveger deg rundt i et rom fylt med andre samtaler?

Target Speech Hearing (TSH), et banebrytende AI-system utviklet av forskere ved University of Washington, gjør fremgang i dette området.

Hvordan Target Speech Hearing fungerer

For å bruke TSH, trenger personen som bærer spesialutstyrte hodetelefoner bare å se på den personen de ønsker å høre i noen sekunder. Denne korte “registreringsperioden” lar AI-systemet lære og feste seg til de unike vokalpatronene til målpersonen.

Her er hvordan det fungerer under panseret:

  1. Brukeren trykker på en knapp mens de retter hodet mot den ønskede taleren i 3-5 sekunder.
  2. Mikrofoner på begge sider av hodetelefonen plukker opp lydbølgene fra talerens stemme samtidig (med en 16-graders margin for feil).
  3. Hodetelefonen sender denne lydsignalet til en innbygd datamaskin.
  4. Maskinlæringsprogramvaren analyserer stemmen og lager en modell av talerens distinkte vokale karakteristika.
  5. AI-systemet bruker denne modellen til å isolere og forsterke den registrerte talerens stemme i sanntid, selv når brukeren beveger seg rundt i en støyende omgivelse.

Jo lenger målpersonen snakker, jo mer treningdata mottar systemet, og det lar det fokusere bedre på og klargjøre den ønskede stemmen. Denne innovative tilnærmingen til “selektiv høring” åpner opp en verden av muligheter for bedret kommunikasjon og tilgjengelighet i utfordrende auditoriske omgivelser.

Shyam Gollakota er seniorforfatter av artikkelen og en UW-professor i Paul G. Allen School of Computer Science & Engineering

“Vi tenderer til å tenke på AI nå som web-baserte chatboter som svarer på spørsmål. Men i dette prosjektet utvikler vi AI for å modifisere den auditoriske persepsjonen til noen som bærer hodetelefoner, gitt deres preferanser. Med våre enheter kan du nå høre en enkelt person tydelig, selv om du er i en støyende omgivelse med mange andre mennesker som snakker.” – Gollakota

Testing AI-hodetelefoner med TSH

For å teste Target Speech Hearing, gjennomførte forskningsteamet en studie med 21 deltakere. Hver deltaker bar TSH-aktiverede hodetelefoner og registrerte en målperson i en støyende omgivelse. Resultatene var imponerende – i gjennomsnitt vurderer brukerne tydeligheten av målpersonens stemme som nesten dobbelt så høy sammenlignet med den ufiltrede lydstrømmen.

Denne gjennombruddet bygger på teamets tidligere arbeid på “semantisk høring”, som tillot brukerne å filtere deres auditoriske omgivelse basert på forhåndsdefinerte lydklassifiseringer, som fuglesang eller menneskestemmer. TSH tar dette konseptet et skritt videre ved å aktivere selektiv forsterking av en bestemt persons stemme.

Konsekvensene er betydelige, fra å forbedre personlige samtaler i høye omgivelser til å forbedre tilgjengelighet for de som har hørselshemninger. Ettersom teknologien utvikles, kan den fundamentalt endre hvordan vi opplever og interagerer med vår auditoriske verden.

Forbedring av AI-hodetelefoner og overvinning av begrensninger

Selv om Target Speech Hearing representerer et stort sprang fremover i auditorisk AI, har systemet noen begrensninger i sin nåværende form:

  • Enkelt talerregistrering: For tiden kan TSH bare bli trenet til å fokusere på en taler om gangen. Registrering av flere talere samtidig er ikke mulig.
  • Forstyrrelser fra lignende lydkilder: Hvis en annen høy stemme kommer fra samme retning som målpersonen under registreringsprosessen, kan systemet slite med å isolere den ønskede personens vokale mønster.
  • Manuell gjenregistrering: Hvis brukeren er misfornøyd med lydkvaliteten etter den første treningen, må de manuelt gjenregistrere målpersonen for å forbedre tydeligheten.

Til tross for disse begrensningene, arbeider University of Washington-teamet aktivt med å forfine og utvide TSHs muligheter. En av deres primære mål er å miniaturisere teknologien, slik at den kan integreres i forbrukerprodukter som ørepropper og hørselsapparater.

Ettersom forskerne fortsetter å presse grensene for hva som er mulig med auditorisk AI, er de potensielle anvendelsene enorme, fra å forbedre produktivitet i distraherende kontormiljøer til å fasilitere tydeligere kommunikasjon for førstehjelpere og militærpersonell i høyrisikosituationer. Fremtiden for selektiv høring ser lys ut, og Target Speech Hearing er godt posisjonert til å spille en nøkkelrolle i å forme den.

Alex McFarland er en AI-journalist og forfatter som utforsker de nyeste utviklingene innen kunstig intelligens. Han har samarbeidet med tallrike AI-startups og publikasjoner verden over.