1 points par GN⁺ 2024-05-30 | 1 commentaires | Partager sur WhatsApp
  • Une équipe de recherche de l’université de Washington a développé Target Speech Hearing, un système qui enregistre un locuteur si l’utilisateur le regarde parler pendant seulement 3 à 5 secondes et permet ensuite d’entendre sa voix en temps réel, même dans un environnement bruyant
  • Les microphones des deux côtés d’un casque existant fonctionnent avec un ordinateur embarqué intégré, et lorsque l’utilisateur appuie sur un bouton en se tournant vers le locuteur, le logiciel de machine learning apprend les caractéristiques de sa voix
  • Après l’enregistrement, le système continue de suivre cette voix même si l’auditeur ou le locuteur bouge, et plus le locuteur parle, plus les données d’entraînement augmentent, ce qui améliore la capacité à se concentrer sur le locuteur cible
  • Lors d’un test mené auprès de 21 personnes, les participants ont évalué la clarté vocale du locuteur enregistré comme étant en moyenne presque deux fois supérieure à celle d’un audio non filtré
  • Pour l’instant, une seule personne peut être enregistrée à la fois, et si une voix forte se mêle depuis la même direction, l’enregistrement devient difficile, si bien que l’extension aux écouteurs intra-auriculaires et aux appareils auditifs reste un objectif futur

Fonctionnement de Target Speech Hearing

  • Target Speech Hearing de l’université de Washington est un système d’IA qui permet, avec un casque à réduction de bruit, de sélectionner et d’écouter uniquement la voix d’une personne précise
  • L’utilisateur porte un casque existant équipé de microphones, tourne la tête vers la personne qui parle, puis appuie sur un bouton
    • Les ondes sonores du locuteur cible doivent atteindre en même temps les deux microphones du casque
    • La marge d’erreur autorisée est de 16 degrés
  • Le casque envoie les signaux collectés à un ordinateur embarqué intégré, et le logiciel de machine learning apprend les caractéristiques vocales du locuteur souhaité
  • Une fois l’enregistrement terminé, le système réduit les autres sons ambiants et restitue en temps réel uniquement la voix du locuteur enregistré
    • Il continue de suivre la voix enregistrée même si l’auditeur et le locuteur se déplacent
    • Si le locuteur continue de parler, les données d’entraînement augmentent, ce qui permet de mieux se concentrer sur le locuteur cible
  • L’équipe a présenté les résultats le 14 mai à l’ACM CHI Conference on Human Factors in Computing Systems
  • Le code du dispositif de preuve de concept est disponible sur LookOnceToHear
  • Ce système n’est pas encore un produit commercial

Résultats de l’expérience et limites actuelles

  • Lors d’un test mené auprès de 21 personnes, les participants ont évalué la clarté du locuteur enregistré comme étant en moyenne presque deux fois supérieure à celle d’un audio non filtré
  • Cette recherche s’appuie sur des travaux antérieurs sur la semantic hearing, qui éliminaient les autres sons de l’environnement lorsque l’utilisateur choisissait la catégorie de son qu’il voulait entendre
    • Le système précédent permettait de sélectionner une classe de sons précise, comme les oiseaux ou les voix
    • TSH se concentre non pas sur une catégorie de sons, mais sur un seul locuteur enregistré
  • Actuellement, TSH ne peut enregistrer qu’un seul locuteur à la fois
  • Si une autre voix forte provient de la même direction que le locuteur cible, il est impossible d’enregistrer ce locuteur
  • Si l’utilisateur n’est pas satisfait de la qualité audio, il peut relancer le processus d’enregistrement pour le même locuteur afin d’améliorer la clarté
  • L’équipe prévoit à l’avenir d’étendre le système aux écouteurs intra-auriculaires et aux appareils auditifs

1 commentaires

 
GN⁺ 2024-05-30
Avis sur Hacker News
  • Si cela pouvait être réduit à la taille de petits bouchons d’oreille, j’aurais envie d’en porter même sans être malentendant
    Au moins d’après le diagnostic, on m’a dit que je n’avais pas de déficience auditive, mais je ne sais plus si c’est la méthode de test qui est mauvaise, si c’est moi qui suis normal, ou si les autres font simplement mieux semblant de bien entendre
    Avec des amis ou en groupe, on finit forcément dans des restaurants ou des bars bruyants, et c’est toujours frustrant de devoir demander qu’on répète parce que je n’ai pas entendu, pour qu’on me répète ensuite avec la même voix basse et que je n’entende toujours pas
    Rater une blague ou une remarque lancée en passant, c’est encore pire, et on se retrouve dans des situations du genre : « Pourquoi vous riez ? Je n’ai pas entendu, tu peux me le répéter encore trois fois ? »

    • Dans les endroits bondés, je n’arrivais à comprendre personne, et en vieillissant je pensais que mon audition avait baissé
      Pourtant, chaque spécialiste de l’audition que j’ai consulté m’a dit que mon audition était normale, et j’ai fini par obtenir un rendez-vous chez le spécialiste réputé le meilleur de la grande métropole, après un an d’attente
      Après une journée entière de tests, le spécialiste m’a dit qu’il avait « une bonne nouvelle, une mauvaise nouvelle, et une nouvelle à la fois bonne et mauvaise » : la bonne, c’est que mon audition était exceptionnelle, au niveau d’un enfant de 5 ans ; la mauvaise, c’est que j’entends trop bien pour pouvoir distinguer les sons
      Ce n’est pas mon audition qui s’est dégradée, c’est mon cerveau qui distingue moins bien les sons, et la bonne-mauvaise nouvelle, c’est que mon audition finira par décliner comme celle de tout le monde, donc pendant quelques années je pourrai mieux entendre dans les lieux publics
      À mon avis, si ce problème s’est aggravé, c’est aussi parce que les concepteurs de restaurants et d’espaces publics ne se soucient plus de l’environnement sonore
      La plupart des bars ouverts ces 15 dernières années ont un sol en ciment, presque aucune absorption acoustique, et semblent conçus avec l’idée qu’on ne passe pas un bon moment tant que les oreilles ne sifflent pas
      On ne peut littéralement pas y tenir une conversation, donc je n’y vais plus
    • Ce n’est pas un problème individuel. Le groupe a choisi de converser dans un environnement où l’on s’entend à peine
      Plutôt que de régler ça avec un appareil, je recommande de regarder le problème en face et de le résoudre à l’ancienne, avec quelque chose comme : « Je n’ai rien entendu, et vous non plus probablement. C’est idiot, on s’en va »
      Ces lieux sont souvent conçus pour vous faire souffrir à moins de crier en permanence ou d’être insensible à ce qui vous entoure
      Je ne comprends pas pourquoi les gens y vont et dépensent de l’argent, et même si on me payait je crois que je n’irais pas
      Je n’ai pas envie de remplacer le respect des limites de chacun par des appareils IA
    • J’utilise beaucoup trop des écouteurs à conduction osseuse, et c’est impressionnant de voir à quel point ils sont polyvalents dans ce genre de situation
      On peut garder les oreilles ouvertes tout en entendant le son du casque, et si on a besoin d’entendre plus clairement, comme lors d’un appel dans un endroit bondé, il suffit de se boucher les oreilles avec les doigts
      Cela crée alors une sorte d’effet de caisse de résonance dans l’oreille, ce qui enrichit le son de la conduction osseuse tout en bloquant le bruit extérieur
      Si l’on veut une qualité vraiment proche d’un casque complet, il suffit de mettre des bouchons d’oreille, et en plus c’est petit et discret
      Ce n’est pas parfait, mais j’aime le fait de pouvoir passer en douceur de « j’écoute le casque en gardant les oreilles ouvertes » à « je bloque le son extérieur et j’entends le casque de façon très nette » avec seulement les doigts ou des bouchons d’oreille
      En y ajoutant un micro canon sur le côté, ce serait vraiment génial — si c’est bien comme ça qu’on appelle un micro à angle de directivité étroit
    • Il existe ce type de bouchons d’oreille directionnels passifs
      https://www.flareaudio.com/pages/earhd
    • J’ai un trouble du traitement auditif, donc mon audition elle-même est vraiment bonne, mais j’ai l’impression que lorsqu’on me parle, ce son reçoit une priorité d’interprétation bien plus faible que n’importe quel bruit ambiant
      Si je vois les lèvres, même sans savoir lire sur les lèvres, cela m’aide à interpréter beaucoup plus précisément ce qui est dit
      Chaque fois que je me suis renseigné là-dessus, je suis tombé sur des liens avec l’autisme ou le TDAH, et en 2008, comme je n’avais pas encore été diagnostiqué, j’ai un peu ignoré cette piste
      Aujourd’hui, j’ai reçu un diagnostic d’AuDHD
  • Ce que les lecteurs de HN doivent savoir, c’est à quel point les aides auditives sont chères et médiocres
    Si vous regardez les prix, même des aides auditives basiques qui se contentent de « rendre le son plus fort » coûtent extrêmement cher
    Le pire, c’est qu’en intervenant au niveau de l’oreille, elles font facilement perdre la capacité à « orienter » l’audition
    Autrement dit, il devient plus difficile de filtrer les autres conversations ou les bruits ambiants
    Un bon sous-produit du fait que Facebook a dépensé des milliards de dollars dans ce qui est probablement une quasi-impasse, en disant vouloir trouver une AR pratique et grand public, c’est https://www.projectaria.com/glasses/
    C’est une plateforme relativement abordable pour expérimenter des interactions de type AR, et avec le suivi du regard, un réseau de micros et une caméra frontale, on peut l’adapter assez facilement en micro directionnel

    • Les aides auditives modernes sont plutôt impressionnantes. Elles embarquent énormément de fonctions dans un format minuscule, et même avec le Bluetooth, la batterie tient une semaine
      Mes aides auditives Phonak changent de programme plus ou moins automatiquement, et l’application associée permet aussi des réglages fins
      Elles fonctionnent dans une certaine mesure même dans des environnements bruyants et me permettent d’avoir des conversations, ce qui aurait été impossible avec des aides auditives d’il y a une dizaine d’années, donc j’en suis vraiment reconnaissant
      Une paire coûte environ 20 dollars et, heureusement, c’est couvert par le système national de santé, donc je ne paie qu’environ 50 dollars tous les cinq ans. Bien sûr, c’est aussi financé par les impôts
      J’espère qu’avec les progrès de l’« IA », on pourra aller au-delà de la simple amplification et du filtrage, pour séparer, renforcer ou reconstruire les voix dans les environnements bruyants
      Par ailleurs, j’aimerais vraiment que disparaisse la mode qui consiste à mettre la musique de plus en plus fort dans les cafés, restaurants et bars. C’est un cauchemar d’accessibilité, surtout pour les personnes malentendantes, mais aussi pour tout le monde
      0: https://www.socialstyrelsen.se/en/about-us/healthcare-for-vi...
      1: https://www.vox.com/2018/4/18/17168504/restaurants-noise-lev...
    • Si c’est cher, ce n’est pas un problème technologique mais un problème d’antitrust
      Un petit cartel contrôle l’offre, ce qui crée une incitation à maximiser les profits plutôt qu’à rivaliser avec de meilleures technologies
      (0) https://www.thebignewsletter.com/p/silencing-the-competition...
    • Le seul conseil que j’ai au sujet des aides auditives, c’est que si vous en avez besoin, il faut faire diagnostiquer et intervenir tôt
      C’est comme ça qu’on obtient les aides auditives les mieux adaptées, les moins chères et les plus fiables
      Sinon, à cause de la perte sensorielle, les problèmes de filtrage de l’attention mentionnés plus haut commencent à apparaître
      Plus on évite longtemps la correction auditive après le début de la baisse d’audition, plus il faut ensuite des aides auditives complexes et coûteuses pour compenser
      Les aides auditives coûteuses essaient maladroitement d’approximer ce que le cerveau et le cortex auditif faisaient avant la perte sensorielle
      Attendez, il faut que j’aille prendre rendez-vous pour un test auditif
    • Ma grand-mère avait tout ça, elle aussi
      Quand elle était encore en vie, en essayant de lui parler lors d’événements familiaux ou dans des lieux publics, j’ai déjà pensé à fabriquer quelque chose de ce genre
      Si c’est cher, c’est probablement à cause des relations avec les entreprises du médical et de la santé, ainsi que des coûts de conformité réglementaire
      Par exemple, un même écran peut coûter plusieurs fois plus cher dès qu’il est certifié pour un usage en établissement médical
    • Oui, c’est cher. Mes aides auditives m’ont coûté environ 200 dollars canadiens par oreille, mais dire que les aides auditives sont médiocres ne correspond pas à mon expérience
      Mes aides auditives Widex sont excellentes. La qualité sonore est fantastique dans les situations normales
      Mon seul vrai reproche, c’est qu’elles ne sont pas totalement étanches, donc quand je sors sous la pluie il faut juste prévoir un peu plus
  • En tant que personne souffrant de déficience auditive, ce genre de fonctionnalité ressemble vraiment à un cadeau tombé du ciel
    Il faut intégrer ça dans les aides auditives le plus vite possible. Taisez-vous, non en fait continuez à parler, je paierai

    • Si l’on vit assez longtemps, la plupart d’entre nous finiront par se retrouver là où vous êtes aujourd’hui
      Si on peut isoler la voix d’une personne, on pourrait aussi la transmettre à un système de reconnaissance vocale pour ajouter des sous-titres à la conversation réelle. Ce serait utile quand l’audition se dégrade davantage, voire disparaît complètement
      En revanche, la latence aller-retour vers le cloud peut fortement réduire l’utilité, voire rendre le tout inutilisable, donc il faut vraiment des appareils mobiles capables de traiter cela en local
    • J’ai aussi une surdité de perception, et les Bose Hearphones ont des fonctions similaires comme la réduction de bruit directionnelle, ce qui m’aide pas mal
      Le produit n’est plus commercialisé, mais on peut encore trouver des modèles reconditionnés
    • Il vaudrait la peine de regarder ce que fait Luxottica dans ce domaine
      Les lunettes connectées sont assez prometteuses pour le cas d’usage mentionné, parce qu’elles évitent l’encombrement et l’impression d’impolitesse qu’on peut donner en portant un casque pendant une conversation avec quelqu’un

      https://www.cnet.com/health/medical/what-did-you-say-these-e...

  • Dans une version plus avancée que celle-ci, ça pourrait aussi beaucoup aider pour mes acouphènes
    Quand une seule personne parle, même si elle parle doucement ou de loin, je l’entends bien, mais dès que plusieurs personnes parlent ou qu’il y a de la musique, je n’entends plus rien

    • Moi aussi, c’est assez similaire. J’ai un léger acouphène qui ressemble à un grésillement radio dans les basses fréquences, et j’ai du mal à suivre une conversation dans les endroits bruyants avec beaucoup de bruit de fond et de discussions
      Quand je suis assis dans un bar bruyant, il m’est presque impossible de comprendre autre chose que les deux personnes les plus proches
      Les conversations dans des environnements ordinaires ne me posent généralement pas de problème
      Donc une fonction qui renforcerait la parole de la personne que je regarde serait vraiment géniale
      Les Apple AirPods ont déjà des fonctions de réglage du son qui réagissent à l’environnement et au mode, et ils prennent aussi en charge le renforcement d’une voix spécifique quand on place le téléphone devant l’interlocuteur
      Si, comme dans cette recherche, ils prenaient directement en charge le renforcement directionnel de la voix dans les AirPods, cela aiderait énormément les interactions sociales dans les lieux bruyants
  • Code : https://github.com/vb000/LookOnceToHear

  • L’usage inverse semble avoir de bien meilleures chances de succès commercial.
    Imaginez pouvoir mettre en sourdine juste cette personne qui parle beaucoup trop fort avec une voix insupportable en pleine soirée.

    • Si on pense à quelque chose qui pourrait réellement se vendre en masse, il faut peut-être voir la « soirée » à plus grande échelle.
      En concert, on porte souvent des bouchons d’oreilles pour ne pas se ruiner l’ouïe ; imaginez les remplacer par des écouteurs intra-auriculaires qui filtrent tout sauf le concert et les voix de la famille ou des amis.
      On pourrait aussi régler le volume, de sorte que si votre conjoint parle, sa voix seule soit amplifiée au-dessus des autres sons, tout en conservant le bruit de foule pour l’ambiance et en supprimant les conversations ordinaires des personnes autour.
      Je ne suis pas spécialiste du machine learning ni de l’IA, mais d’après ce que je comprends, ce n’est pas impossible avec la technologie actuelle.
      Il y aurait bien sûr des contraintes de batterie et de consommation, mais pour un concert, des écouteurs avec un arceau passant derrière la tête, qui les maintient en place et évite de les perdre s’ils tombent, auraient du sens.
      Il faudrait sans doute un apprentissage de « ta voix », mais si Alexa peut le faire en 10 secondes, une app mobile devrait pouvoir le faire aussi.
      Si ça sortait pour le cinéma à moins de 200 euros, j’en achèterais tout de suite et j’irais peut-être de nouveau au cinéma.
    • La fonction permettant de mettre certaines personnes en sourdine est apparue dans quelques épisodes de Black Mirror.
    • C’est peut-être le plus grand moment de « ah, ça y est, je vieillis » que j’aie connu.
      Les gens portent des écouteurs en soirée ?
    • Quand quelqu’un rit si fort que ça fait mal même à 15 pieds de distance, et qu’il recommence trois fois par minute, c’est vraiment insupportable.
      S’il existait un moyen de filtrer ce genre de personne, j’en serais clairement reconnaissant.
    • Des usages criminels, comme écouter en douce les conversations des gens, pourraient aussi être assez utiles.
  • J’ai travaillé autrefois chez Sonos, bien avant le désastre actuel de la mise à jour de l’app et bien avant la sortie de leurs casques.
    Lors de la première tentative de développement, finalement abandonnée, d’un produit casque audio, nous avions étudié une fonction conceptuelle similaire consistant à laisser passer sélectivement la voix d’une personne donnée via un chipset de réduction active du bruit.
    Je ne me souviens plus exactement de l’approche utilisée par les équipes DSP. J’étais plus proche du matériel de réduction active du bruit.
    Mais en pratique, la seule chose qu’ils arrivaient réellement à isoler, c’était la propre voix de l’utilisateur, simplement parce que ce signal était plus fort que tous les autres.
    C’est vraiment génial. Je me demande encore quelles autres choses amusantes on pourra faire avec des casques audio.
    Les chipsets de réduction active du bruit sont incroyablement puissants, et je pense qu’on est encore loin d’avoir exploité tout leur potentiel.

    • Une fois par an environ, je perds une journée entière à chercher des écouteurs capables de me laisser travailler dans un environnement bruyant sans que ce bruit ne passe dans mes appels ou réunions téléphoniques.
      Je n’ai toujours pas trouvé de produit satisfaisant.
      La réduction du bruit côté écoute semble à peu près réglée avec l’isolation et l’ANC, mais ce serait formidable de voir apparaître une combinaison matériel-logiciel capable d’isoler uniquement ma voix pour l’interlocuteur, de bloquer le bruit ambiant et de rendre le vrai télétravail possible.
    • Je ne voudrais surtout pas de prothèses auditives Sonos.
      Les produits Sonos ont globalement des problèmes de base, par exemple ils n’arrivent pas à se reconnecter quand le Wi‑Fi coupe puis revient, surtout si le canal Wi‑Fi a changé entre-temps.
      La solution « technique », c’est de débrancher puis rebrancher pour redémarrer, et on ne peut même pas le faire à distance.
      L’appareil est bien connecté au Wi‑Fi, mais comme Spotify Connect chez Sonos est absurdement bugué, il devient impossible de le redémarrer même quand on en a envie.
      Même avec un esp ou un module TI du même genre, on peut maintenir la connexion Wi‑Fi et forcer une reconnexion permanente ; est-ce vraiment si difficile pour les développeurs firmware de Sonos de gérer ce genre de bases ?
    • En lisant l’article, on voit que rien n’a vraiment changé.
      On dépend toujours de la condition selon laquelle il ne doit pas y avoir de son ou de voix concurrente au même endroit que le locuteur cible.
  • Le code open source est sur https://github.com/vb000/LookOnceToHear et l’article est sur https://arxiv.org/abs/2405.06289.
    Donc, comme beaucoup d’articles de vulgarisation, ce n’est peut-être pas quelque chose d’aussi lointain que ça.
    Si quelqu’un arrive à le faire fonctionner de manière indépendante, j’aimerais bien connaître les résultats.

  • Dans une pièce animée, j’ai du mal à entendre quelqu’un parler, sans doute parce que mon esprit essaie de capter tous les sons, donc cela pourrait vraiment beaucoup m’aider. Je pense que c’est probablement lié à mon TDAH.
    S’il existait un moyen de fortement réduire tous les sons autres que la voix de mon interlocuteur, ce serait incroyable.

    • Si c’était proposé dans un format discret, peu visible, comme des AirPods, je serais prêt à payer cher.
      J’aimerais que ce ne soit qu’une question de temps avant qu’AirPods puisse faire ça.
    • J’ai le même problème. Mon audition est bonne, mais discuter avec des gens dans un club ou un café bondé est presque impossible.
      Une telle fonction serait une bénédiction pour moi.
    • Je ne connais pas très bien le TDAH ni l’autisme, mais je pense avoir moi-même certains traits autistiques, et ce problème est vraiment grave.
      Aux tests auditifs où il faut entendre de petits bips, je m’en sors bien, mais j’ai énormément de mal à traiter ce que disent les gens, surtout dans les environnements bondés.
      Mon père a le même problème.
  • Une fonctionnalité potentielle dont je ne savais pas que j’avais besoin.
    Je porte en permanence des casques à réduction active du bruit à la maison, et ce serait vraiment utile s’ils laissaient automatiquement passer uniquement la voix de mon partenaire.

    • L’inverse serait bien aussi : une fonction qui rende silencieuse une source précise.
      Probablement pas son partenaire, mais peut-être…
    • La réduction active du bruit ne bloque pas les voix.
      Si la voix de votre partenaire semble atténuée et vous parvient mal, c’est sans doute à cause de l’isolation passive du casque.
      Ou alors, c’est simplement la musique que vous écoutez qui couvre sa voix.
      La réduction active du bruit ne bloquerait la voix de votre partenaire que si cette voix se mélangeait au bruit de fond avec une hauteur et un volume similaires, devenant comme un bruit blanc ou coloré, et que l’ANC pouvait alors supprimer l’ensemble.
    • J’ai l’impression qu’à force d’abuser de la réduction active du bruit, il y aura tôt ou tard des effets secondaires physiques ou physiologiques.