Modèles et plateformes d’IA
Les casques audio intelligents vous permettent d’écouter une personne dans une foule
Dans un environnement bruyant et bondé, avez-vous déjà souhaité pouvoir faire taire tout le bavardage de fond et vous concentrer uniquement sur la personne que vous essayez d’écouter ? Alors que les casques anti-bruit ont fait des progrès considérables pour créer une toile de fond auditive vierge, ils ont encore du mal à laisser passer des sons spécifiques de l’environnement de l’utilisateur. Mais qu’est-ce que vos casques pourraient être formés pour détecter et amplifier la voix d’une seule personne, même si vous vous déplacez dans une pièce remplie d’autres conversations ?
Target Speech Hearing (TSH), un système d’intelligence artificielle révolutionnaire développé par des chercheurs de l’Université de Washington, fait des progrès dans ce domaine.
Comment fonctionne Target Speech Hearing
Pour utiliser TSH, une personne portant des casques spécialement équipés n’a qu’à regarder l’individu qu’elle veut entendre pendant quelques secondes. Cette brève période d'”inscription” permet au système d’intelligence artificielle d’apprendre et de se fixer sur les modèles vocaux uniques du locuteur cible.
Voici comment cela fonctionne sous le capot:
- L’utilisateur appuie sur un bouton tout en dirigeant sa tête vers le locuteur désiré pendant 3-5 secondes.
- Les microphones des deux côtés du casque capturent les ondes sonores de la voix du locuteur en même temps (avec une marge d’erreur de 16 degrés).
- Les casques transmettent ce signal audio à un ordinateur intégré.
- Le logiciel d’apprentissage automatique analyse la voix et crée un modèle des caractéristiques vocales distinctes du locuteur.
- Le système d’intelligence artificielle utilise ce modèle pour isoler et amplifier la voix du locuteur inscrit en temps réel, même si l’utilisateur se déplace dans un environnement bruyant.
Plus le locuteur cible parle, plus le système reçoit de données de formation, lui permettant de mieux se concentrer et de clarifier la voix souhaitée. Cette approche innovante de “l’écoute sélective” ouvre un monde de possibilités pour améliorer la communication et l’accessibilité dans des environnements auditifs difficiles.
Shyam Gollakota est l’auteur principal de l’article et un professeur de l’Université de Washington à l’école d’informatique et de génie électrique Paul G. Allen
“Nous avons tendance à penser que l’IA est maintenant basée sur des chatbots web qui répondent aux questions. Mais dans ce projet, nous développons l’IA pour modifier la perception auditive de quiconque porte des casques, en fonction de ses préférences. Avec nos appareils, vous pouvez maintenant entendre un seul locuteur clairement, même si vous êtes dans un environnement bruyant avec beaucoup d’autres personnes qui parlent.” – Gollakota
Test des casques audio intelligents avec TSH
Pour mettre Target Speech Hearing à l’épreuve, l’équipe de recherche a mené une étude avec 21 participants. Chaque sujet a porté les casques TSH et a inscrit un locuteur cible dans un environnement bruyant. Les résultats étaient impressionnants – en moyenne, les utilisateurs ont évalué la clarté de la voix du locuteur inscrit comme presque deux fois plus élevée par rapport au flux audio non filtré.
Cette avancée s’appuie sur le travail précédent de l’équipe sur l'”écoute sémantique”, qui permettait aux utilisateurs de filtrer leur environnement auditif en fonction de classifications de sons prédéfinies, telles que les oiseaux qui chantent ou les voix humaines. TSH va plus loin en permettant l’amplification sélective de la voix d’un individu spécifique.
Les implications sont importantes, allant de l’amélioration des conversations personnelles dans des environnements bruyants à l’amélioration de l’accessibilité pour les personnes ayant des troubles de l’audition. À mesure que la technologie se développe, elle pourrait fondamentalement changer la façon dont nous expérimentons et interagissons avec notre monde auditif.
Amélioration des casques audio intelligents et surmontage des limites
Bien que Target Speech Hearing représente un grand pas en avant dans l’intelligence artificielle auditive, le système a certaines limites dans sa forme actuelle:
- Inscription d’un seul locuteur: Pour l’instant, TSH ne peut être formé que pour se concentrer sur un locuteur à la fois. L’inscription de plusieurs locuteurs simultanément n’est pas encore possible.
- Interférence avec des sources audio similaires: Si une autre voix forte vient de la même direction que le locuteur cible pendant le processus d’inscription, le système peut avoir du mal à isoler les modèles vocaux de l’individu souhaité.
- Réinscription manuelle: Si l’utilisateur n’est pas satisfait de la qualité audio après la formation initiale, il doit réinscrire manuellement le locuteur cible pour améliorer la clarté.
Malgré ces contraintes, l’équipe de l’Université de Washington travaille activement à affiner et à étendre les capacités de TSH. L’un de leurs objectifs principaux est de miniaturiser la technologie, permettant ainsi de l’intégrer de manière transparente dans des produits grand public tels que les écouteurs et les appareils auditifs.
À mesure que les chercheurs continuent de repousser les limites de ce qui est possible avec l’intelligence artificielle auditive, les applications potentielles sont vastes, allant de l’amélioration de la productivité dans des environnements de bureau distrayants à la facilitation d’une communication plus claire pour les premiers intervenants et le personnel militaire dans des situations à haut risque. L’avenir de l’écoute sélective s’annonce radieux, et Target Speech Hearing est prêt à jouer un rôle clé dans sa formation.












