AI-modeller och plattformar
AI-hörlurar låter dig lyssna på en person i en folksamling
I en trång, bullrig miljö, har du någonsin önskat att du kunde stänga ute all bakgrundsprat och fokusera enbart på den person du försöker lyssna på? Medan brusreducerande hörlurar har gjort stora framsteg i att skapa en auditiv tom sida, kämpar de fortfarande för att låta specifika ljud från bärarens omgivning filtrera igenom. Men vad om dina hörlurar kunde tränas för att uppfatta och förstärka rösten från en enskild person, även när du rör dig runt i ett rum fyllt med andra samtal?
Target Speech Hearing (TSH), ett banbrytande AI-system utvecklat av forskare vid University of Washington, gör framsteg inom detta område.
Hur Target Speech Hearing fungerar
För att använda TSH behöver en person som bär särskilt utrustade hörlurar bara titta på den person de vill höra i några sekunder. Denna korta “registreringsperiod” tillåter AI-systemet att lära sig och fästa sig vid den målspakens unika röstmönster.
Här är hur det fungerar under huven:
- Användaren trycker på en knapp medan de riktar huvudet mot den önskade talaren i 3-5 sekunder.
- Mikrofoner på båda sidor av hörlurarna plockar upp ljudvågorna från talarens röst samtidigt (med en 16-graders felmarginal).
- Hörlurarna sänder denna ljudsignal till en inbyggd dator.
- Maskinlärningsprogramvaran analyserar rösten och skapar en modell av talarens distinkta röstegenskaper.
- AI-systemet använder denna modell för att isolera och förstärka den registrerade talarens röst i realtid, även när användaren rör sig runt i en bullrig miljö.
Ju längre den målspaken talar, desto mer träningsdata får systemet, vilket gör att det kan bättre fokusera på och klargöra den önskade rösten. Detta innovativa tillvägagångssätt för “selektivt lyssnande” öppnar upp en värld av möjligheter för förbättrad kommunikation och tillgänglighet i utmanande auditiva miljöer.
Shyam Gollakota är senior författare till artikeln och en UW-professor i Paul G. Allen School of Computer Science & Engineering
“Vi tenderar att tänka på AI nu som webbaserade chattbotar som svarar på frågor. Men i detta projekt utvecklar vi AI för att modifiera den auditiva perceptionen av vem som helst som bär hörlurar, givet deras preferenser. Med våra enheter kan du nu höra en enskild talare tydligt även om du är i en bullrig miljö med många andra människor som pratar.” – Gollakota
Testning av AI-hörlurar med TSH
För att testa Target Speech Hearing genomförde forskarteamet en studie med 21 deltagare. Varje deltagare bar TSH-aktiverade hörlurar och registrerade en målspak i en bullrig miljö. Resultaten var imponerande – i genomsnitt bedömde användarna tydligheten av den registrerade talarens röst som nästan dubbelt så hög jämfört med den ofiltrerade ljudsignalen.
Denna genombrott bygger på teamets tidigare arbete på “semantiskt lyssnande”, som tillät användare att filtrera sin auditiva miljö baserat på fördefinierade ljudklassificeringar, såsom fågelsång eller mänskliga röster. TSH tar detta koncept ett steg längre genom att möjliggöra selektiv förstärkning av en specifik individs röst.
Implikationerna är betydande, från att förbättra personliga samtal i bullriga miljöer till att förbättra tillgängligheten för personer med hörselskador. När tekniken utvecklas kan den fundamentalt förändra hur vi upplever och interagerar med vår auditiva värld.
Att förbättra AI-hörlurar och övervinna begränsningar
Medan Target Speech Hearing representerar ett stort steg framåt i auditiv AI, har systemet vissa begränsningar i dess nuvarande form:
- Enkel talareregistrering: För närvarande kan TSH bara tränas för att fokusera på en talare åt gången. Att registrera flera talare samtidigt är inte möjligt.
- Störningar från liknande ljudkällor: Om en annan hög röst kommer från samma riktning som den målspaken under registreringsprocessen, kan systemet kämpa för att isolera den önskade individens röstegenskaper.
- Manuell omregistrering: Om användaren är missnöjd med ljudkvaliteten efter den initiala träningen, måste de manuellt omregistrera den målspaken för att förbättra tydligheten.
Trots dessa begränsningar arbetar University of Washington-teamet aktivt med att förbättra och utöka TSH:s funktioner. Ett av deras primära mål är att miniaturisera tekniken, vilket gör det möjligt att integreras i konsumentprodukter som hörlurar och hörapparater.
När forskarna fortsätter att utmana gränserna för vad som är möjligt med auditiv AI, är de potentiella tillämpningarna omfattande, från att förbättra produktiviteten i distraherande kontorsmiljöer till att underlätta tydligare kommunikation för räddningstjänstpersonal och militär personal i högriskssituationer. Framtiden för selektivt lyssnande ser ljus ut, och Target Speech Hearing är redo att spela en avgörande roll i att forma den.












