AI-mallit ja alustat

Älykuulokkeet mahdollistavat yhden henkilön kuuntelemisen joukossa

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Täydellä ja meluisalla paikalla oletko koskaan toivonut, että voit sulkea pois kaikki taustamelun ja keskittyä vain siihen henkilöön, jonka yrität kuunnella? Vaikka melunvaimennuskuulokkeet ovat tehneet suuria edistysaskelia luomalla äänittömän tyhjiön, ne kamppailevat edelleen sallimaan tiettyjen äänien pääsyn kuulokkeiden läpi. Mutta mitä jos kuulokkeesi voisi kouluttaa tunnistamaan ja vahvistamaan yhden henkilön äänen, vaikka liikuskelisit huoneessa täydellä keskustelulla?

Target Speech Hearing (TSH), uraauurtava älyjärjestelmä, jonka kehittivät tutkijat Washingtonin yliopistossa, tekee edistystä tässä suhteessa.

Kohdennettu puhekuuntelu toimii

Käyttääksesi TSH:ta, henkilön, joka käyttää erityisvarusteltuja kuulokkeita, on vain tarpeen tarkastaa henkilö, jonka haluaa kuulla, muutaman sekunnin ajan. Tämä lyhyt “rekisteröintijakso” antaa älyjärjestelmän oppia ja tarttua kohdepuhujan ainutlaatuisiin äänimalleihin.

Tässä on, miten se toimii sisäpuolelta:

  1. Käyttäjä painaa painiketta ja suuntaa päätään halutun puhujan suuntaan 3-5 sekunnin ajan.
  2. Mikrofonit kuulokkeiden molemmin puolin vastaanottavat ääniaallot puhujan äänestä samanaikaisesti (16 asteen virhemarginaalilla).
  3. Kuulokkeet lähettävät tämän äänisignaalin sisäiseen upotettuun tietokoneeseen.
  4. Konemäinen oppimisohjelmisto analysoi ääntä ja luo mallin puhujan erityisistä äänipiirteistä.
  5. Älyjärjestelmä käyttää tätä mallia erottamaan ja vahvistamaan rekisteröidyn puhujan äänen reaaliajassa, vaikka käyttäjä liikkuu meluisassa ympäristössä.

Mitä kauemmin kohdepuhuja puhuu, sitä enemmän koulutusdataa järjestelmä saa, mikä mahdollistaa sen paremman keskittymisen ja selkeyttämisen toivottua ääntä. Tämä innovatiivinen lähestymistapa “valikoivaan kuulemiseen” avaa mahdollisuuksia parantaa viestintää ja saavutettavuutta haastavissa ääniympäristöissä.

Shyam Gollakota on tutkimuksen senior tekijä ja UW:n professori Paul G. Allenin tietokoneiden ja insinööritieteiden koulussa

“Me ajattelemme älyä nykyään verkkopohjaisina chatboteina, jotka vastaavat kysymyksiin. Mutta tässä projektissa kehitämme älyä muokkaamaan kuulokkeiden käyttäjän äänittömän havainnon heidän mieltymyksensä mukaan. Laitteillamme voit nyt kuulla yhden puhujan selvästi, vaikka olisit meluisassa ympäristössä, jossa on paljon muita puhujia.” – Gollakota

Älykuulokkeiden testaaminen TSH:llä

Kokeillakseen Target Speech Hearingiä, tutkimusryhmä suoritti tutkimuksen 21 osanottajalla. Jokainen osanottaja käytti TSH-toiminnolla varustettuja kuulokkeita ja rekisteröi kohdepuhujan meluisassa ympäristössä. Tulokset olivat vaikuttavia – keskimäärin käyttäjät arvioivat rekisteröidyn puhujan äänen selkeyden lähes kaksi kertaa korkeammaksi verrattuna suodattamattomaan ääniin.

Tämä läpimurto perustuu ryhmän aiempaan työhön “semanttisesta kuulemisesta”, joka mahdollisti käyttäjille äänien suodattamisen ennalta määritettyjen ääniluokkien perusteella, kuten linnunlaulua tai ihmisen ääniä. TSH vie tämän konseptin askelen eteenpäin mahdollistaen yksittäisen henkilön äänen valikoivan vahvistamisen.

Vaikutukset ovat merkittäviä, henkilökohtaisten keskustelujen parantamisesta meluisissa ympäristöissä kuulovammaisten saavutettavuuden parantamiseen. Teknologian kehittyessä se voi perustavasti muuttaa, miten kohtaamme ja vuorovaikutamme äänimaailmamme kanssa.

Älykuulokkeiden parantaminen ja rajoitusten ylittäminen

Vaikka Target Speech Hearing edustaa suurta edistystä älykuulokkeissa, järjestelmällä on joitakin rajoituksia nykyisessä muodossaan:

  • Yhden puhujan rekisteröinti: Tällä hetkellä TSH voidaan kouluttaa vain yhden puhujan äänen tunnistamiseen kerrallaan. Useiden puhujien rekisteröinti ei ole vielä mahdollista.
  • Samankaltaisten äänilähteiden häiriö: Jos toinen kovaa ääntä tulee samasta suunnasta kuin kohdepuhuja rekisteröintiprosessin aikana, järjestelmä saattaa kamppailla kohdehenkilön äänen erottamisessa.
  • Manuaalinen uudelleenrekisteröinti: Jos käyttäjä ei ole tyytyväinen äänilaatuun alkuvaiheen jälkeen, heidän on manuaalisesti rekisteröitävä kohdepuhuja uudelleen äänenselektiivisyyden parantamiseksi.

Näistä rajoituksista huolimatta Washingtonin yliopiston tiimi työskentelee aktiivisesti TSH:n ominaisuuksien tarkentamiseksi ja laajentamiseksi. Yksi heidän tärkeimmistä tavoitteistaan on teknologian pienentäminen, jotta se voidaan sulauttaa kuluttajatuotteisiin, kuten korvakuulokkeisiin ja kuulokojeisiin.

Kun tutkijat jatkavat älykuulokkeiden mahdollisuuksien tutkimista, sovellukset ovat laajat, tuottavuuden parantamisesta häiriintyneissä toimistoympäristöissä selkeämmän viestinnän mahdollistamiseen ensivastejoukoille ja sotilashenkilöstölle korkean panoksen tilanteissa. Valikoivan kuulemisen tulevaisuus näyttää valoisalta, ja Target Speech Hearing on valmis muokkaamaan sitä.

Alex McFarland on AI-toimittaja ja kirjailija, joka tutkii viimeisimpiä kehityksiä tekoälyssä. Hän on tehnyt yhteistyötä useiden AI-startup-yritysten ja julkaisujen kanssa maailmanlaajuisesti.