- Une équipe de recherche de l’université de Washington a développé Target Speech Hearing, un système qui enregistre un locuteur si l’utilisateur le regarde parler pendant seulement 3 à 5 secondes et permet ensuite d’entendre sa voix en temps réel, même dans un environnement bruyant
- Les microphones des deux côtés d’un casque existant fonctionnent avec un ordinateur embarqué intégré, et lorsque l’utilisateur appuie sur un bouton en se tournant vers le locuteur, le logiciel de machine learning apprend les caractéristiques de sa voix
- Après l’enregistrement, le système continue de suivre cette voix même si l’auditeur ou le locuteur bouge, et plus le locuteur parle, plus les données d’entraînement augmentent, ce qui améliore la capacité à se concentrer sur le locuteur cible
- Lors d’un test mené auprès de 21 personnes, les participants ont évalué la clarté vocale du locuteur enregistré comme étant en moyenne presque deux fois supérieure à celle d’un audio non filtré
- Pour l’instant, une seule personne peut être enregistrée à la fois, et si une voix forte se mêle depuis la même direction, l’enregistrement devient difficile, si bien que l’extension aux écouteurs intra-auriculaires et aux appareils auditifs reste un objectif futur
Fonctionnement de Target Speech Hearing
- Target Speech Hearing de l’université de Washington est un système d’IA qui permet, avec un casque à réduction de bruit, de sélectionner et d’écouter uniquement la voix d’une personne précise
- L’utilisateur porte un casque existant équipé de microphones, tourne la tête vers la personne qui parle, puis appuie sur un bouton
- Les ondes sonores du locuteur cible doivent atteindre en même temps les deux microphones du casque
- La marge d’erreur autorisée est de 16 degrés
- Le casque envoie les signaux collectés à un ordinateur embarqué intégré, et le logiciel de machine learning apprend les caractéristiques vocales du locuteur souhaité
- Une fois l’enregistrement terminé, le système réduit les autres sons ambiants et restitue en temps réel uniquement la voix du locuteur enregistré
- Il continue de suivre la voix enregistrée même si l’auditeur et le locuteur se déplacent
- Si le locuteur continue de parler, les données d’entraînement augmentent, ce qui permet de mieux se concentrer sur le locuteur cible
- L’équipe a présenté les résultats le 14 mai à l’ACM CHI Conference on Human Factors in Computing Systems
- Le code du dispositif de preuve de concept est disponible sur LookOnceToHear
- Ce système n’est pas encore un produit commercial
Résultats de l’expérience et limites actuelles
- Lors d’un test mené auprès de 21 personnes, les participants ont évalué la clarté du locuteur enregistré comme étant en moyenne presque deux fois supérieure à celle d’un audio non filtré
- Cette recherche s’appuie sur des travaux antérieurs sur la semantic hearing, qui éliminaient les autres sons de l’environnement lorsque l’utilisateur choisissait la catégorie de son qu’il voulait entendre
- Le système précédent permettait de sélectionner une classe de sons précise, comme les oiseaux ou les voix
- TSH se concentre non pas sur une catégorie de sons, mais sur un seul locuteur enregistré
- Actuellement, TSH ne peut enregistrer qu’un seul locuteur à la fois
- Si une autre voix forte provient de la même direction que le locuteur cible, il est impossible d’enregistrer ce locuteur
- Si l’utilisateur n’est pas satisfait de la qualité audio, il peut relancer le processus d’enregistrement pour le même locuteur afin d’améliorer la clarté
- L’équipe prévoit à l’avenir d’étendre le système aux écouteurs intra-auriculaires et aux appareils auditifs
1 commentaires
Avis sur Hacker News
Si cela pouvait être réduit à la taille de petits bouchons d’oreille, j’aurais envie d’en porter même sans être malentendant
Au moins d’après le diagnostic, on m’a dit que je n’avais pas de déficience auditive, mais je ne sais plus si c’est la méthode de test qui est mauvaise, si c’est moi qui suis normal, ou si les autres font simplement mieux semblant de bien entendre
Avec des amis ou en groupe, on finit forcément dans des restaurants ou des bars bruyants, et c’est toujours frustrant de devoir demander qu’on répète parce que je n’ai pas entendu, pour qu’on me répète ensuite avec la même voix basse et que je n’entende toujours pas
Rater une blague ou une remarque lancée en passant, c’est encore pire, et on se retrouve dans des situations du genre : « Pourquoi vous riez ? Je n’ai pas entendu, tu peux me le répéter encore trois fois ? »
Pourtant, chaque spécialiste de l’audition que j’ai consulté m’a dit que mon audition était normale, et j’ai fini par obtenir un rendez-vous chez le spécialiste réputé le meilleur de la grande métropole, après un an d’attente
Après une journée entière de tests, le spécialiste m’a dit qu’il avait « une bonne nouvelle, une mauvaise nouvelle, et une nouvelle à la fois bonne et mauvaise » : la bonne, c’est que mon audition était exceptionnelle, au niveau d’un enfant de 5 ans ; la mauvaise, c’est que j’entends trop bien pour pouvoir distinguer les sons
Ce n’est pas mon audition qui s’est dégradée, c’est mon cerveau qui distingue moins bien les sons, et la bonne-mauvaise nouvelle, c’est que mon audition finira par décliner comme celle de tout le monde, donc pendant quelques années je pourrai mieux entendre dans les lieux publics
À mon avis, si ce problème s’est aggravé, c’est aussi parce que les concepteurs de restaurants et d’espaces publics ne se soucient plus de l’environnement sonore
La plupart des bars ouverts ces 15 dernières années ont un sol en ciment, presque aucune absorption acoustique, et semblent conçus avec l’idée qu’on ne passe pas un bon moment tant que les oreilles ne sifflent pas
On ne peut littéralement pas y tenir une conversation, donc je n’y vais plus
Plutôt que de régler ça avec un appareil, je recommande de regarder le problème en face et de le résoudre à l’ancienne, avec quelque chose comme : « Je n’ai rien entendu, et vous non plus probablement. C’est idiot, on s’en va »
Ces lieux sont souvent conçus pour vous faire souffrir à moins de crier en permanence ou d’être insensible à ce qui vous entoure
Je ne comprends pas pourquoi les gens y vont et dépensent de l’argent, et même si on me payait je crois que je n’irais pas
Je n’ai pas envie de remplacer le respect des limites de chacun par des appareils IA
On peut garder les oreilles ouvertes tout en entendant le son du casque, et si on a besoin d’entendre plus clairement, comme lors d’un appel dans un endroit bondé, il suffit de se boucher les oreilles avec les doigts
Cela crée alors une sorte d’effet de caisse de résonance dans l’oreille, ce qui enrichit le son de la conduction osseuse tout en bloquant le bruit extérieur
Si l’on veut une qualité vraiment proche d’un casque complet, il suffit de mettre des bouchons d’oreille, et en plus c’est petit et discret
Ce n’est pas parfait, mais j’aime le fait de pouvoir passer en douceur de « j’écoute le casque en gardant les oreilles ouvertes » à « je bloque le son extérieur et j’entends le casque de façon très nette » avec seulement les doigts ou des bouchons d’oreille
En y ajoutant un micro canon sur le côté, ce serait vraiment génial — si c’est bien comme ça qu’on appelle un micro à angle de directivité étroit
https://www.flareaudio.com/pages/earhd
Si je vois les lèvres, même sans savoir lire sur les lèvres, cela m’aide à interpréter beaucoup plus précisément ce qui est dit
Chaque fois que je me suis renseigné là-dessus, je suis tombé sur des liens avec l’autisme ou le TDAH, et en 2008, comme je n’avais pas encore été diagnostiqué, j’ai un peu ignoré cette piste
Aujourd’hui, j’ai reçu un diagnostic d’AuDHD
Ce que les lecteurs de HN doivent savoir, c’est à quel point les aides auditives sont chères et médiocres
Si vous regardez les prix, même des aides auditives basiques qui se contentent de « rendre le son plus fort » coûtent extrêmement cher
Le pire, c’est qu’en intervenant au niveau de l’oreille, elles font facilement perdre la capacité à « orienter » l’audition
Autrement dit, il devient plus difficile de filtrer les autres conversations ou les bruits ambiants
Un bon sous-produit du fait que Facebook a dépensé des milliards de dollars dans ce qui est probablement une quasi-impasse, en disant vouloir trouver une AR pratique et grand public, c’est https://www.projectaria.com/glasses/
C’est une plateforme relativement abordable pour expérimenter des interactions de type AR, et avec le suivi du regard, un réseau de micros et une caméra frontale, on peut l’adapter assez facilement en micro directionnel
Mes aides auditives Phonak changent de programme plus ou moins automatiquement, et l’application associée permet aussi des réglages fins
Elles fonctionnent dans une certaine mesure même dans des environnements bruyants et me permettent d’avoir des conversations, ce qui aurait été impossible avec des aides auditives d’il y a une dizaine d’années, donc j’en suis vraiment reconnaissant
Une paire coûte environ 20 dollars et, heureusement, c’est couvert par le système national de santé, donc je ne paie qu’environ 50 dollars tous les cinq ans. Bien sûr, c’est aussi financé par les impôts
J’espère qu’avec les progrès de l’« IA », on pourra aller au-delà de la simple amplification et du filtrage, pour séparer, renforcer ou reconstruire les voix dans les environnements bruyants
Par ailleurs, j’aimerais vraiment que disparaisse la mode qui consiste à mettre la musique de plus en plus fort dans les cafés, restaurants et bars. C’est un cauchemar d’accessibilité, surtout pour les personnes malentendantes, mais aussi pour tout le monde
0: https://www.socialstyrelsen.se/en/about-us/healthcare-for-vi...
1: https://www.vox.com/2018/4/18/17168504/restaurants-noise-lev...
Un petit cartel contrôle l’offre, ce qui crée une incitation à maximiser les profits plutôt qu’à rivaliser avec de meilleures technologies
(0) https://www.thebignewsletter.com/p/silencing-the-competition...
C’est comme ça qu’on obtient les aides auditives les mieux adaptées, les moins chères et les plus fiables
Sinon, à cause de la perte sensorielle, les problèmes de filtrage de l’attention mentionnés plus haut commencent à apparaître
Plus on évite longtemps la correction auditive après le début de la baisse d’audition, plus il faut ensuite des aides auditives complexes et coûteuses pour compenser
Les aides auditives coûteuses essaient maladroitement d’approximer ce que le cerveau et le cortex auditif faisaient avant la perte sensorielle
Attendez, il faut que j’aille prendre rendez-vous pour un test auditif
Quand elle était encore en vie, en essayant de lui parler lors d’événements familiaux ou dans des lieux publics, j’ai déjà pensé à fabriquer quelque chose de ce genre
Si c’est cher, c’est probablement à cause des relations avec les entreprises du médical et de la santé, ainsi que des coûts de conformité réglementaire
Par exemple, un même écran peut coûter plusieurs fois plus cher dès qu’il est certifié pour un usage en établissement médical
Mes aides auditives Widex sont excellentes. La qualité sonore est fantastique dans les situations normales
Mon seul vrai reproche, c’est qu’elles ne sont pas totalement étanches, donc quand je sors sous la pluie il faut juste prévoir un peu plus
En tant que personne souffrant de déficience auditive, ce genre de fonctionnalité ressemble vraiment à un cadeau tombé du ciel
Il faut intégrer ça dans les aides auditives le plus vite possible. Taisez-vous, non en fait continuez à parler, je paierai
Si on peut isoler la voix d’une personne, on pourrait aussi la transmettre à un système de reconnaissance vocale pour ajouter des sous-titres à la conversation réelle. Ce serait utile quand l’audition se dégrade davantage, voire disparaît complètement
En revanche, la latence aller-retour vers le cloud peut fortement réduire l’utilité, voire rendre le tout inutilisable, donc il faut vraiment des appareils mobiles capables de traiter cela en local
Le produit n’est plus commercialisé, mais on peut encore trouver des modèles reconditionnés
Les lunettes connectées sont assez prometteuses pour le cas d’usage mentionné, parce qu’elles évitent l’encombrement et l’impression d’impolitesse qu’on peut donner en portant un casque pendant une conversation avec quelqu’un
Dans une version plus avancée que celle-ci, ça pourrait aussi beaucoup aider pour mes acouphènes
Quand une seule personne parle, même si elle parle doucement ou de loin, je l’entends bien, mais dès que plusieurs personnes parlent ou qu’il y a de la musique, je n’entends plus rien
Quand je suis assis dans un bar bruyant, il m’est presque impossible de comprendre autre chose que les deux personnes les plus proches
Les conversations dans des environnements ordinaires ne me posent généralement pas de problème
Donc une fonction qui renforcerait la parole de la personne que je regarde serait vraiment géniale
Les Apple AirPods ont déjà des fonctions de réglage du son qui réagissent à l’environnement et au mode, et ils prennent aussi en charge le renforcement d’une voix spécifique quand on place le téléphone devant l’interlocuteur
Si, comme dans cette recherche, ils prenaient directement en charge le renforcement directionnel de la voix dans les AirPods, cela aiderait énormément les interactions sociales dans les lieux bruyants
Code : https://github.com/vb000/LookOnceToHear
L’usage inverse semble avoir de bien meilleures chances de succès commercial.
Imaginez pouvoir mettre en sourdine juste cette personne qui parle beaucoup trop fort avec une voix insupportable en pleine soirée.
En concert, on porte souvent des bouchons d’oreilles pour ne pas se ruiner l’ouïe ; imaginez les remplacer par des écouteurs intra-auriculaires qui filtrent tout sauf le concert et les voix de la famille ou des amis.
On pourrait aussi régler le volume, de sorte que si votre conjoint parle, sa voix seule soit amplifiée au-dessus des autres sons, tout en conservant le bruit de foule pour l’ambiance et en supprimant les conversations ordinaires des personnes autour.
Je ne suis pas spécialiste du machine learning ni de l’IA, mais d’après ce que je comprends, ce n’est pas impossible avec la technologie actuelle.
Il y aurait bien sûr des contraintes de batterie et de consommation, mais pour un concert, des écouteurs avec un arceau passant derrière la tête, qui les maintient en place et évite de les perdre s’ils tombent, auraient du sens.
Il faudrait sans doute un apprentissage de « ta voix », mais si Alexa peut le faire en 10 secondes, une app mobile devrait pouvoir le faire aussi.
Si ça sortait pour le cinéma à moins de 200 euros, j’en achèterais tout de suite et j’irais peut-être de nouveau au cinéma.
Les gens portent des écouteurs en soirée ?
S’il existait un moyen de filtrer ce genre de personne, j’en serais clairement reconnaissant.
J’ai travaillé autrefois chez Sonos, bien avant le désastre actuel de la mise à jour de l’app et bien avant la sortie de leurs casques.
Lors de la première tentative de développement, finalement abandonnée, d’un produit casque audio, nous avions étudié une fonction conceptuelle similaire consistant à laisser passer sélectivement la voix d’une personne donnée via un chipset de réduction active du bruit.
Je ne me souviens plus exactement de l’approche utilisée par les équipes DSP. J’étais plus proche du matériel de réduction active du bruit.
Mais en pratique, la seule chose qu’ils arrivaient réellement à isoler, c’était la propre voix de l’utilisateur, simplement parce que ce signal était plus fort que tous les autres.
C’est vraiment génial. Je me demande encore quelles autres choses amusantes on pourra faire avec des casques audio.
Les chipsets de réduction active du bruit sont incroyablement puissants, et je pense qu’on est encore loin d’avoir exploité tout leur potentiel.
Je n’ai toujours pas trouvé de produit satisfaisant.
La réduction du bruit côté écoute semble à peu près réglée avec l’isolation et l’ANC, mais ce serait formidable de voir apparaître une combinaison matériel-logiciel capable d’isoler uniquement ma voix pour l’interlocuteur, de bloquer le bruit ambiant et de rendre le vrai télétravail possible.
Les produits Sonos ont globalement des problèmes de base, par exemple ils n’arrivent pas à se reconnecter quand le Wi‑Fi coupe puis revient, surtout si le canal Wi‑Fi a changé entre-temps.
La solution « technique », c’est de débrancher puis rebrancher pour redémarrer, et on ne peut même pas le faire à distance.
L’appareil est bien connecté au Wi‑Fi, mais comme Spotify Connect chez Sonos est absurdement bugué, il devient impossible de le redémarrer même quand on en a envie.
Même avec un esp ou un module TI du même genre, on peut maintenir la connexion Wi‑Fi et forcer une reconnexion permanente ; est-ce vraiment si difficile pour les développeurs firmware de Sonos de gérer ce genre de bases ?
On dépend toujours de la condition selon laquelle il ne doit pas y avoir de son ou de voix concurrente au même endroit que le locuteur cible.
Le code open source est sur https://github.com/vb000/LookOnceToHear et l’article est sur https://arxiv.org/abs/2405.06289.
Donc, comme beaucoup d’articles de vulgarisation, ce n’est peut-être pas quelque chose d’aussi lointain que ça.
Si quelqu’un arrive à le faire fonctionner de manière indépendante, j’aimerais bien connaître les résultats.
Dans une pièce animée, j’ai du mal à entendre quelqu’un parler, sans doute parce que mon esprit essaie de capter tous les sons, donc cela pourrait vraiment beaucoup m’aider. Je pense que c’est probablement lié à mon TDAH.
S’il existait un moyen de fortement réduire tous les sons autres que la voix de mon interlocuteur, ce serait incroyable.
J’aimerais que ce ne soit qu’une question de temps avant qu’AirPods puisse faire ça.
Une telle fonction serait une bénédiction pour moi.
Aux tests auditifs où il faut entendre de petits bips, je m’en sors bien, mais j’ai énormément de mal à traiter ce que disent les gens, surtout dans les environnements bondés.
Mon père a le même problème.
Une fonctionnalité potentielle dont je ne savais pas que j’avais besoin.
Je porte en permanence des casques à réduction active du bruit à la maison, et ce serait vraiment utile s’ils laissaient automatiquement passer uniquement la voix de mon partenaire.
Probablement pas son partenaire, mais peut-être…
Si la voix de votre partenaire semble atténuée et vous parvient mal, c’est sans doute à cause de l’isolation passive du casque.
Ou alors, c’est simplement la musique que vous écoutez qui couvre sa voix.
La réduction active du bruit ne bloquerait la voix de votre partenaire que si cette voix se mélangeait au bruit de fond avec une hauteur et un volume similaires, devenant comme un bruit blanc ou coloré, et que l’ANC pouvait alors supprimer l’ensemble.