AI-modeller og plattformer

Hvordan AI løser «Cocktail Party Problem» og dens innvirkning på fremtidens lytteknologi

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Forestill deg å være på et trangt arrangement, omgitt av stemmer og bakgrunnsstøy, og likevel klarer å fokusere på samtalen med personen rett foran deg. Denne evnen til å isolere en bestemt lyd blant den støyende bakgrunnen er kjent som «Cocktail Party Problem», en betegnelse som først ble brukt av den britiske vitenskapsmannen Colin Cherry i 1958 for å beskrive denne bemerkelsesverdige evnen til det menneskelige hjernen. AI-eksperter har i årevis forsøkt å etterligne denne menneskelige evnen med maskiner, men det har vært en vanskelig oppgave. Likevel har nyere fremgang i kunstig intelligens åpnet nye muligheter for å løse problemet. Dette åpner opp for en transformasjon i lytteknologien. I denne artikkelen utforsker vi hvordan AI utvikler seg i å løse «Cocktail Party Problem» og potensialet det har for fremtidens lytteknologi. Før vi dykker ned i hvordan AI løser problemet, må vi først forstå hvordan mennesker løser det.

Hvordan mennesker dekoder «Cocktail Party Problem»

Mennesker har en unik lyttesystem som hjelper oss å navigere i støyende miljøer. Våre hjerner prosesserer lyder binauralt, det vil si at vi bruker innputt fra begge ører for å detektere små forskjeller i tid og volum, noe som hjelper oss å detektere lydens plassering. Denne evnen lar oss orientere oss mot stemmen vi vil høre, selv når andre lyder konkurrerer om oppmerksomheten.

Foruten hørselen, forbedrer også våre kognitive evner denne prosessen. Selektiv oppmerksomhet lar oss filtrere ut irrelevante lyder, noe som lar oss fokusere på viktig informasjon. I tillegg hjelper kontekst, minne og visuelle signaler, som lese på leppene, å skille tale fra bakgrunnsstøy. Dette komplekse sanse- og kognitive prosesseringsystemet er usedvanlig effektivt, men å replikere det i maskintelligens forblir en vanskelig oppgave.

Hvorfor det fortsatt er utfordrende for AI?

Fra virtuelle assistenter som gjenkjenner våre kommandoer i en travelt kafé til hørselsapparater som hjelper brukerne å fokusere på en enkelt samtale, har AI-forskere kontinuerlig arbeidet for å replikere evnen til det menneskelige hjernen til å løse «Cocktail Party Problem». Dette har ført til utviklingen av tekniker som blind kilde-separasjon (BSS) og uavhengig komponentanalyse (ICA), designet for å identifisere og isolere distinkte lydkilder for individuell prosessering. Mens disse metodene har vist løfte i kontrollerte miljøer – hvor lydkilder er forutsigbare og ikke overlapper mye i frekvens – sliter de når de skal skille overlappende stemmer eller isolere en enkelt lydkilde i sanntid, spesielt i dynamiske og uforutsigbare miljøer. Dette skyldes i hovedsak mangelen på den sanse- og kontekstuelle dybden mennesker naturlig utnytter. Uten ekstra signaler som visuelle signaler eller kjennskap til bestemte toner, møter AI utfordringer i å håndtere den komplekse og kaotiske blandingen av lyder i hverdagsmiljøer.

Hvordan WaveSciences brukte AI for å løse problemet

I 2019 gjorde WaveSciences, et amerikansk selskap grunnlagt av elektroingeniør Keith McElveen i 2009, et gjennombrudd i å løse «Cocktail Party Problem». Deres løsning, Spatial Release from Masking (SRM), bruker AI og fysikken til lydutbredelse for å isolere en talers stemme fra bakgrunnsstøy. Likesom det menneskelige lyttesystemet prosesserer lyd fra forskjellige retninger, bruker SRM flere mikrofoner for å fange lydbølger mens de beveger seg gjennom rommet.

En av de kritiske utfordringene i denne prosessen er at lydbølger konstant reflekterer og blandes i miljøet, noe som gjør det vanskelig å isolere bestemte stemmer matematisk. Likevel har WaveSciences, ved hjelp av AI, utviklet en metode for å bestemme opphavet til hver lyd og filtrere ut bakgrunnsstøy og omgivende stemmer basert på deres romlige plassering. Denne tilpasningen lar SRM håndtere endringer i sanntid, som en flyttende taler eller innføringen av nye lyder, og gjør det betraktelig mer effektivt enn tidligere metoder som slitet med den uforutsigbare naturen til sanntidslydmiljøer. Dette fremgangen ikke bare forbedrer evnen til å fokusere på samtaler i støyende miljøer, men åpner også opp for fremtidige innovasjoner i lytteknologien.

Fremgang i AI-teknikker

Nyere fremgang i kunstig intelligens, spesielt i dype neurale nettverk, har betydelig forbedret maskiners evne til å løse «Cocktail Party Problem». Dyplæringsalgoritmer, trent på store datasett av blandede lydsignaler, excellerer i å identifisere og skille forskjellige lydkilder, selv i overlappende stemmescenarier. Prosjekter som BioCPPNet har vist effektiviteten av disse metodene ved å isolere dyrelyder, og indikerer deres anvendelighet i biologiske sammenhenger utenfor menneskelig tale. Forskere har vist at dyplærings-teknikker kan tilpasse stemmeseparasjon lært i musikalske miljøer til nye situasjoner, og forbedre modellens robusthet over diverse settinger.

Neurale stråleformings-teknikker forbedrer disse evnene ytterligere ved å bruke flere mikrofoner for å konsentrere seg om lyder fra bestemte retninger mens de minimiserer bakgrunnsstøy. Denne teknikken blir finjustert ved å dynamisk justere fokuset basert på lydmiljøet. I tillegg bruker AI-modeller tid-frekvens-masking for å skille lydkilder basert på deres unike spektrale og tidsmessige egenskaper. Avanserte tale-diariérings-systemer isolerer stemmer og sporer enkeltstående talere, og muliggjør organiserte samtaler. AI kan mer nøyaktig isolere og forbedre bestemte stemmer ved å inkorporere visuelle signaler, som lese på leppene, sammen med lyddata.

Reelle anvendelser av «Cocktail Party Problem»

Disse utviklingene har åpnet nye veier for fremgang i lytteknologien. Noen reelle anvendelser inkluderer:

  • Rettsmedisinsk analyse: Ifølge en BBC-rapport har talegjenkjenning og -manipulering (SRM) teknologi blitt brukt i rettssaker for å analysere lydbevis, spesielt i saker hvor bakgrunnsstøy kompliserer identifiseringen av talere og deres dialog. Ofte blir slike opptak i slike scenarioer ubrukelige som bevis. Likevel har SRM vist seg å være uvurderlig i rettsmedisinske sammenhenger, og har vellykket dekodet kritisk lyd for presentasjon i retten.
  • Støymøllerhoder: Forskere har utviklet en prototype AI-system kalt Target Speech Hearing for støymøllerhoder som lar brukerne velge en bestemt persons stemme for å forbli hørbar mens de kansellerer ut andre lyder. Systemet bruker «Cocktail Party Problem»-baserte teknikker for å kjøre effektivt på hoder med begrensede beregningsressurser. Det er for tiden et bevis på konsept, men skaperne er i samtaler med hodetelefonmerker for å potensielt inkorporere teknologien.
  • Hørselsapparater: Moderne hørselsapparater sliter ofte i støyende miljøer, og klarer ikke å isolere bestemte stemmer fra bakgrunnslyder. Mens disse enhetene kan forsterke lyd, mangler de avanserte filtermekanismer som lar menneskelige ører fokusere på en enkelt samtale blant konkurrerende lyder. Dette begrensningen er spesielt utfordrende i trange eller dynamiske settinger, hvor overlappende stemmer og fluktuerte lydnivåer råder. Løsninger på «Cocktail Party Problem» kan forbedre hørselsapparater ved å isolere ønskede stemmer mens de minimiserer omgivende støy.
  • Telekommunikasjon: I telekommunikasjon kan AI forbedre samtalekvalitet ved å filtrere ut bakgrunnsstøy og betone talerens stemme. Dette fører til klarere og mer pålitelig kommunikasjon, spesielt i støyende miljøer som travle gater eller trange kontorer.
  • Taleassistenter: AI-drevne taleassistenter, som Amazons Alexa og Apples Siri, kan bli mer effektive i støyende miljøer og løse «Cocktail Party Problem» mer effektivt. Disse fremgangene muliggjør at enheter kan nøyaktig forstå og respondere på brukerens kommandoer, selv under bakgrunnsstøy.
  • Lydropptak og -redigering: AI-drevne teknologier kan assistere lydingeniører i postproduksjon ved å isolere enkeltstående lydkilder i opptak. Denne evnen lar til renere spor og mer effektiv redigering.

Det siste ord

«Cocktail Party Problem», en betydelig utfordring i lytteknologi, har sett bemerkelsesverdige fremgang gjennom AI-teknologier. Innovasjoner som Spatial Release from Masking (SRM) og dyplæringsalgoritmer omdefinerer hvordan maskiner isolerer og skiller lyder i støyende miljøer. Disse gjennombruddene forbedrer hverdagsopplevelser, som klarere samtaler i trange miljøer og forbedret funksjonalitet for hørselsapparater og taleassistenter. Likevel holder de også transformasjonspotensiale for rettsmedisinsk analyse, telekommunikasjon og lydropptaksapplikasjoner. Ettersom AI fortsetter å utvikle seg, vil dens evne til å etterligne menneskelige høreevner føre til enda mer betydelige fremgang i lytteknologi, og endelig omdefinere hvordan vi interagerer med lyd i våre daglige liv.

Dr. Tehseen Zia er en fast ansatt associate professor ved COMSATS University Islamabad, med en PhD i AI fra Vienna University of Technology, Østerrike. Som spesialist i kunstig intelligens, maskinlæring, datavitenskap og datavisjon, har han gjort betydelige bidrag med publikasjoner i anerkjente vitenskapelige tidsskrifter. Dr. Tehseen har også ledet flere industriprosjekter som hovedundersøker og tjenestegjort som AI-konsulent.