Bonjour, j’ai créé un modèle, je l’ai publié en open source, et je voulais le partager.
Avez-vous déjà eu besoin d’un son précis pour créer une vidéo ou un jeu ?
Vous savez exactement quel son vous avez en tête, mais vous ne savez probablement pas comment l’exprimer ni comment le rechercher.
C’est pour cette raison que, si vous assistez à une réunion sur le son dans un studio de jeux, vous entendrez souvent plus de bruitages que de conversation.
« Plutôt que fiu fiu, ce serait mieux en fiyou↘︎fiyou↘︎ »
Alors je l’ai créé !
Le modèle que j’ai développé fonctionne ainsi : vous imitez avec votre bouche le son souhaité, puis vous l’entrez dans le modèle avec du texte en input, et il génère l’effet sonore correspondant. (Cela a demandé pas mal de temps et de données.)
repo: https://github.com/thxxx/VTS
demo: https://spicy-pufferfish-699.notion.site/VTS-347cf95761f480f19dc0eb790…
(Si vous allez sur le lien de démo et que vous écoutez, vous comprendrez beaucoup mieux ce que cela veut dire.)
12 commentaires
C’est vraiment un projet formidable !
« Comment expliquer facilement à un agent d’IA ce que je veux ? »
Je pense que c’est un enjeu vraiment crucial en ce moment, et un domaine qui demande beaucoup de réflexion.
Comme nous avons vu se développer le champ de l’UI/UX dans les services IT, l’expérience utilisateur autour de l’IA va elle aussi désormais s’accumuler, et j’ai hâte de voir émerger de nombreuses discussions sur ce qui est réellement efficace et important.
Ça semble idéal pour une utilisation sur des travaux de SFX pour le cinéma.
C’est vraiment super drôle haha
Merci haha
C’est sympa hahaha, ça marche vraiment. Je me demande comment vous avez entraîné le modèle.
Mais dans la démo, ce qui est fait à la bouche est encore plus cool en tant qu'effet sonore.
À force de faire des tests, je me suis rodé.
C’est fascinant. Est-ce que ça pourrait aussi gérer en entrée, pas seulement la voix, mais aussi des sons du genre Pokémon ? R2D2 ?
Non, l’apprentissage lui-même n’a pas été fait à partir de la voix, donc j’ai l’impression que toutes les conversions Sound-to-Sound devraient être possibles. Cela dit, je n’ai encore jamais testé avec des sons de Pokémon haha.
Oh, dans ce cas, un LLM pourrait générer quelque chose comme des formules pour moduler l’intensité et produire des sons électroniques, puis les fournir en entrée avec le texte pour générer des effets sonores ; on pourrait alors obtenir des effets sonores adaptés à chaque situation. C’est génial.
C'est marrant, ça haha
Merci haha