Modele și platforme AI
Căștile cu Inteligență Artificială Vă Permit Să Ascultați O Persoană într-o Mulțime
Într-un mediu aglomerat și zgomotos, ați dorit vreodată să puteți scoate din funcțiune toate vorbirile de fond și să vă concentrați exclusiv asupra persoanei pe care încercați să o ascultați? În timp ce căștile cu anulare a zgomotului au făcut progrese semnificative în crearea unui spațiu auditiv gol, ele încă se luptă să permită anumite sunete din jurul purtătorului să treacă prin ele. Dar ce se întâmplă dacă căștile dvs. ar putea fi antrenate să detecteze și să amplifice vocea unei singure persoane, chiar și atunci când vă deplasați printr-o cameră plină de alte conversații?
Auzul Țintit de Vorbe (TSH), un sistem de inteligență artificială revoluționar, dezvoltat de cercetători de la Universitatea din Washington, face progrese în acest domeniu.
Cum Funcționează Auzul Țintit de Vorbe
Pentru a utiliza TSH, o persoană care poartă căști special echipate trebuie doar să se uite la individul pe care dorește să-l audă pentru câteva secunde. Această perioadă scurtă de “înscriere” permite sistemului de inteligență artificială să învețe și să se prindă de modelele vocale unice ale vorbitorului țintă.
Iată cum funcționează sub capotă:
- Utilizatorul apasă un buton în timp ce își îndreaptă capul spre vorbitorul dorit pentru 3-5 secunde.
- Microfoanele de pe ambele părți ale căștilor captură undele sonore ale vocii vorbitorului în același timp (cu o marjă de eroare de 16 grade).
- Căștile transmit acest semnal audio unui computer încorporat.
- Software-ul de învățare automată analizează vocea și creează un model al caracteristicilor vocale distincte ale vorbitorului.
- Sistemul de inteligență artificială utilizează acest model pentru a izola și amplifica vocea vorbitorului înregistrat în timp real, chiar și atunci când utilizatorul se deplasează într-un mediu zgomotos.
Cu cât vorbitorul țintă vorbește mai mult, cu atât sistemul primește mai multe date de antrenament, permițându-i să se concentreze mai bine și să clarifice vocea dorită. Această abordare inovatoare a “auzului selectiv” deschide o lume de posibilități pentru o comunicare îmbunătățită și accesibilitate în medii auditive provocatoare.
Shyam Gollakota este autorul principal al lucrării și profesor la Școala de Științe și Inginerie a Calculatoarelor Paul G. Allen de la Universitatea din Washington
“Tendința noastră este să gândim inteligența artificială acum ca fiind bazată pe web și să răspundă la întrebări. Dar în acest proiect, dezvoltăm inteligență artificială pentru a modifica percepția auditivă a oricui poartă căști, în funcție de preferințele sale. Cu dispozitivele noastre, puteți auzi acum o singură persoană clar, chiar și într-un mediu zgomotos cu multe alte persoane care vorbesc.” – Gollakota
Testarea Căștilor cu Inteligență Artificială cu TSH
Pentru a testa Auzul Țintit de Vorbe, echipa de cercetare a efectuat un studiu cu 21 de participanți. Fiecare subiect a purtat căștile TSH și a înregistrat un vorbitor țintă într-un mediu zgomotos. Rezultatele au fost impresionante – în medie, utilizatorii au evaluat claritatea vocii vorbitorului înregistrat ca fiind de aproape două ori mai mare în comparație cu fluxul de audio nefiltrat.
Această descoperire se bazează pe lucrarea anterioară a echipei cu privire la “auzul semantic”, care a permis utilizatorilor să filtreze mediul auditiv în funcție de clasificări predefinite de sunete, cum ar fi păsări care cântă sau voci umane. TSH duce acest concept mai departe, permițând amplificarea selectivă a vocii unei persoane specifice.
Implicațiile sunt semnificative, de la îmbunătățirea conversațiilor personale în medii zgomotoase la îmbunătățirea accesibilității pentru persoanele cu deficiențe de auz. Pe măsură ce tehnologia se dezvoltă, ea ar putea schimba fundamental modul în care experimentăm și interacționăm cu lumea noastră auditivă.
Îmbunătățirea Căștilor cu Inteligență Artificială și Depășirea Limitărilor
Deși Auzul Țintit de Vorbe reprezintă un salt major înainte în domeniul inteligenței artificiale auditive, sistemul are unele limitări în forma sa actuală:
- Înregistrarea unui singur vorbitor: În prezent, TSH poate fi antrenat să se concentreze doar asupra unui vorbitor odată. Înregistrarea mai multor vorbitori simultan nu este încă posibilă.
- Interferența din surse audio similare: Dacă o altă voce puternică vine din aceeași direcție ca vorbitorul țintă în timpul procesului de înregistrare, sistemul poate avea dificultăți în a izola modelele vocale distincte ale individului dorit.
- Reînregistrarea manuală: Dacă utilizatorul nu este mulțumit de calitatea audio după antrenamentul inițial, el trebuie să reînregistreze manual vorbitorul țintă pentru a îmbunătăți claritatea.
În ciuda acestor limitări, echipa de la Universitatea din Washington lucrează activ la rafinarea și extinderea capacităților TSH. Unul dintre obiectivele lor principale este miniaturizarea tehnologiei, permițând integrarea ei în produse de consum precum căști și dispozitive de asistență auditivă.
Pe măsură ce cercetătorii continuă să împingă limitele a ceea ce este posibil cu inteligența artificială auditivă, aplicațiile potențiale sunt vaste, de la îmbunătățirea productivității în medii de birou distractive la facilitarea unei comunicări mai clare pentru personalul de intervenție și militar în situații cu riscuri ridicate. Viitorul auzului selectiv arată promițător, iar Auzul Țintit de Vorbe este pregătit să joace un rol cheie în modelarea lui.












