16 points par khj6051 2026-06-13 | 12 commentaires | Partager sur WhatsApp

Bonjour, j’ai créé un modèle, je l’ai publié en open source, et je voulais le partager.

Avez-vous déjà eu besoin d’un son précis pour créer une vidéo ou un jeu ?

Vous savez exactement quel son vous avez en tête, mais vous ne savez probablement pas comment l’exprimer ni comment le rechercher.

C’est pour cette raison que, si vous assistez à une réunion sur le son dans un studio de jeux, vous entendrez souvent plus de bruitages que de conversation.

« Plutôt que fiu fiu, ce serait mieux en fiyou↘︎fiyou↘︎ »

Alors je l’ai créé !

Le modèle que j’ai développé fonctionne ainsi : vous imitez avec votre bouche le son souhaité, puis vous l’entrez dans le modèle avec du texte en input, et il génère l’effet sonore correspondant. (Cela a demandé pas mal de temps et de données.)

repo: https://github.com/thxxx/VTS
demo: https://spicy-pufferfish-699.notion.site/VTS-347cf95761f480f19dc0eb790…

(Si vous allez sur le lien de démo et que vous écoutez, vous comprendrez beaucoup mieux ce que cela veut dire.)

12 commentaires

 
humblebee 2026-06-18

C’est vraiment un projet formidable !
« Comment expliquer facilement à un agent d’IA ce que je veux ? »
Je pense que c’est un enjeu vraiment crucial en ce moment, et un domaine qui demande beaucoup de réflexion.

Comme nous avons vu se développer le champ de l’UI/UX dans les services IT, l’expérience utilisateur autour de l’IA va elle aussi désormais s’accumuler, et j’ai hâte de voir émerger de nombreuses discussions sur ce qui est réellement efficace et important.

 
illiil1lii 2026-06-18

Ça semble idéal pour une utilisation sur des travaux de SFX pour le cinéma.

 
solvewithit 2026-06-17

C’est vraiment super drôle haha

 
khj6051 2026-06-18

Merci haha

 
mssmss 2026-06-22

C’est sympa hahaha, ça marche vraiment. Je me demande comment vous avez entraîné le modèle.

 
bichi 2026-06-18

Mais dans la démo, ce qui est fait à la bouche est encore plus cool en tant qu'effet sonore.

 
khj6051 2026-06-18

À force de faire des tests, je me suis rodé.

 
dukes123 2026-06-17

C’est fascinant. Est-ce que ça pourrait aussi gérer en entrée, pas seulement la voix, mais aussi des sons du genre Pokémon ? R2D2 ?

 
khj6051 2026-06-17

Non, l’apprentissage lui-même n’a pas été fait à partir de la voix, donc j’ai l’impression que toutes les conversions Sound-to-Sound devraient être possibles. Cela dit, je n’ai encore jamais testé avec des sons de Pokémon haha.

 
dukes123 2026-06-18

Oh, dans ce cas, un LLM pourrait générer quelque chose comme des formules pour moduler l’intensité et produire des sons électroniques, puis les fournir en entrée avec le texte pour générer des effets sonores ; on pourrait alors obtenir des effets sonores adaptés à chaque situation. C’est génial.

 
m00nlygreat 2026-06-13

C'est marrant, ça haha

 
khj6051 2026-06-15

Merci haha