- Une expérience visant à redonner aux chansons parodiques de Weird Al Yankovic la voix des interprètes originaux montre que le clonage vocal n’est pas simplement une technologie qui remplace la voix : il révèle aussi la prononciation, l’intonation et les habitudes de chant
- La communauté des reprises A.I., structurée autour de A.I. Hub Discord et de Hugging Face, échange modèles, outils et conseils, et croît rapidement à l’intersection d’expérimentations non commerciales et d’une zone grise juridique autour du droit d’auteur
- Même en utilisant des modèles de Michael Jackson, Madonna, Kurt Cobain, Lady Gaga ou Lorde, la tessiture de la voix d’entrée et la diction exagérée propre à Weird Al restent perceptibles, si bien que le résultat ressemble moins aux artistes d’origine qu’à l’ombre de Weird Al
- Google Colab et AICoverGen permettent même aux utilisateurs sans GPU de créer des reprises A.I., tandis que des apps comme Kits AI, Voicify AI, Voiceflip, voicemy.ai et covers.ai abaissent la barrière d’usage
- La pression exercée par la RIAA sur le droit d’auteur et le bannissement définitif de A.I. Hub par Discord montrent que le clonage vocal dépasse le simple amusement expérimental sur Internet et devient un conflit juridique touchant la gestion des communautés et l’industrie musicale
Expérience : rendre les chansons de Weird Al à leurs interprètes originaux
- En partant du postulat du film Weird: The Al Yankovic Story, l’auteur imagine que les chansons parodiques de Weird Al Yankovic seraient les originales et que les chanteurs initiaux en feraient des reprises, puis teste cette idée avec du clonage vocal par IA
- Le premier essai consistait à faire chanter “Eat It” par Michael Jackson
- L’original de Michael Jackson est accordé plus bas que la parodie de Weird Al, tandis que la voix y est chantée plus haut ; l’auteur a donc tenté de relever la voix d’une octave et d’abaisser l’ensemble du morceau d’un demi-ton
- Même en faisant abstraction des artefacts, le résultat sonnait plus comme un Michael Jackson imitant Weird Al que comme Michael Jackson lui-même, avec une diction exagérée destinée à faire ressortir les punchlines
- Six modèles de voix IA de Michael Jackson ont été testés, sans grandes différences de résultat
- La voix et la prononciation si particulières de Weird Al ne disparaissent pas facilement, même recouvertes par une autre voix générée par IA, laissant tout au long de l’expérience une rémanence étrange
La communauté des reprises A.I. et la circulation des modèles
- Au cœur de la communauté des reprises A.I. se trouvait le Discord A.I. Hub, qui rassemblait plus de 500 000 membres échangeant conseils, outils, techniques et liens vers chansons originales et reprises
- La communauté ajoutait chaque jour des centaines de nouveaux modèles vocaux à sa base de données de fils Discord
- Les catégories populaires ne se limitaient pas aux musiciens, mais incluaient aussi personnages virtuels, personnages d’anime, YouTubers, streamers et célébrités
- Parmi les exemples récents figuraient Françoise Hardy, Donald Duck, tous les membres de VCHA, Markiplier, Tom Waits, LeBron James, Knuckles et Adolf Hitler
- Les discussions et liens sur les modèles circulaient sur Discord, mais les fichiers eux-mêmes étaient presque tous hébergés sur Hugging Face
- En août 2023, Hugging Face a levé 235 millions de dollars lors d’un tour de table de série D auquel participaient notamment Google, Amazon, Nvidia, Salesforce, AMD, Intel, IBM et Qualcomm, pour une valorisation de 4,5 milliards de dollars
- A.I. Hub exigeait des liens Hugging Face pour référencer les modèles, et AICoverGen recommandait aussi, dans son interface et ses exemples, d’utiliser directement des liens vers des modèles Hugging Face
- Certains utilisateurs rassemblaient des centaines, voire des milliers, de modèles créés par d’autres dans d’immenses dépôts
- Un compte hébergeait ainsi près de 4 000 modèles vocaux couvrant célébrités, musiciens, personnages de dessin animé et personnalités de YouTube
Pression sur le droit d’auteur et blocage de A.I. Hub
- La RIAA connaissait l’existence de A.I. Hub et contestait la mise en ligne de jeux de données dérivés d’œuvres protégées, utilisés pour entraîner les modèles vocaux
- En juin 2023, la RIAA a demandé à Discord de fermer A.I. Hub, de supprimer les liens vers les fichiers litigieux et de révéler l’identité des uploaders
- Par la suite, A.I. Hub a instauré des règles strictes concernant les liens vers des jeux de données protégés, en particulier les fichiers de séparation vocale traités par IA servant à entraîner de nouveaux modèles
- Au moment de la publication, aucun cas d’action engagée par la RIAA directement contre les modèles d’IA eux-mêmes ou leurs créateurs n’avait été confirmé
- Deux jours après la publication de l’article, Discord a banni définitivement A.I. Hub
- Ernesto Van der Sar, de TorrentFreak, a été le premier à le signaler
- Selon des informations non vérifiées en provenance d’un nouveau serveur, quelqu’un aurait modifié un message pour y ajouter un lien vers du contenu protégé, laissant à Discord peu d’autre choix qu’un traitement DMCA
Le résultat des reprises Weird Al générées avec plusieurs modèles de chanteurs
- Pour faire chanter Madonna sur “Like A Surgeon”, l’auteur a utilisé un modèle entraîné pendant 500 epochs sur 13 minutes d’acapellas studio propres issus de l’album Like a Virgin de 1984
- La tessiture vocale de Madonna étant bien plus haute que celle de Weird Al, un pitch shift d’une octave a été appliqué
- Le résultat sonne comme une voix féminine, mais ne rappelle que très vaguement Madonna dans les années 1980
- Pour faire chanter Kurt Cobain sur “Smells Like Nirvana”, plusieurs modèles ont été testés, le meilleur étant un modèle créé par le YouTuber @Cleberslk
- Son créateur précise l’avoir « fabriqué à la va-vite sur son téléphone »
- Le résultat mêle un accent européen difficile à expliquer
- Pour faire chanter Lady Gaga sur “Perform This Way”, l’auteur a utilisé un modèle RVC créé par @udrivemecrazy
- Ce modèle n’utilisait que 5 minutes de « très belles acapellas propres »
- Une expérience a aussi été menée avec Lorde sur “Foil”
- Ce morceau figure sur Mandatory Fun, le quatorzième et dernier album studio de Weird Al
- Le résultat faisait partie des rares essais jugés réellement satisfaisants, même si l’auteur admet que son jugement était peut-être brouillé
Outils de production et baisse des barrières à l’usage
- En local, l’inférence de ces modèles nécessite en général un PC doté d’un GPU adapté, mais Google Colab permet aussi à des utilisateurs sans GPU compatible, ou rebutés par le terminal, d’exécuter des workflows d’IA générative sur des serveurs distants
- Les Mac ne disposant pas du GPU Nvidia requis pour cette inférence, l’auteur a utilisé le notebook Colab de AICoverGen
- AICoverGen est un package qui prend en charge les étapes nécessaires pour générer des reprises A.I. à partir de modèles existants, avec une interface web
- Le démarrage prenait quelques minutes et la génération de chaque morceau moins d’une minute
- Colab et les WebUI pouvant rester intimidants pour un public non technique, plusieurs startups proposent la génération de reprises vocales par IA et l’entraînement de modèles sous forme d’apps simplifiées
- Parmi les exemples cités : Kits AI, Voicify AI, Voiceflip, voicemy.ai et covers.ai
- Le musicien de Dallas Dustin Ballard, connu pour sa chaîne There I Ruined It, compte 3,1 millions d’abonnés sur TikTok et 700 000 sur YouTube, et expérimente le clonage vocal depuis 4 mois
- Parmi ses exemples : une vidéo où les Beach Boys chantent “Hurt” de Nine Inch Nails sur la mélodie de “Surfin’ USA”, une version façon Hank Williams de “Straight Outta Compton”, et une relecture de “Snow (Hey Oh)” des Red Hot Chili Peppers
- Ballard enregistre lui-même une nouvelle piste vocale, en imitant dans une certaine mesure la tessiture et le style de chaque chanteur, puis applique ensuite le clonage vocal par IA
- Cette méthode se prête mieux aux travaux qui modifient fortement les paroles, la mélodie, le rythme et l’intonation par rapport à l’original
- Avec la technologie actuelle, pour rendre le projet Weird Al crédible, il vaudrait mieux que quelqu’un chante d’abord les paroles de Weird Al dans la tessiture et le style de l’artiste parodié, puis applique le clonage vocal par-dessus
- La Singing Voice Synthesis et la Singing Voice Conversion sont des domaines de recherche qui progressent rapidement
- so-vits-svc, utilisé par Ghostwriter en avril 2023 pour imiter Drake et The Weeknd dans “Heart on My Sleeve”, a déjà été archivé par le propriétaire du dépôt, tandis que RVC est devenu l’outil le plus répandu
- Les chercheurs montrent qu’il devient possible d’« embellir » le timbre et l’intonation d’un chant, de synthétiser naturellement une nouvelle voix à partir de texte ou de la transférer dans le style d’un autre artiste
Parodie de style et modèles absents
- Weird Al Yankovic est célèbre comme chanteur parodique et accordéoniste, mais c’est aussi un compositeur original
- Beaucoup de ses morceaux préférés ne parodient pas directement une chanson précise, mais riffent sur le style d’autres artistes : ce sont des parodies de style
- L’auteur aimerait aussi entendre des versions synthétiques où Mark Mothersbaugh de Devo chanterait “Dare to Be Stupid”, David Byrne “Dog Eat Dog” ou James Taylor “Good Old Days”, mais aucun modèle IA existant de ces chanteurs n’était présent sur A.I. Hub
- Après un certain temps passé sur A.I. Hub, l’impression générale est celle d’une communauté plutôt jeune, où certains artistes plus anciens apparaissent peu dans les modèles, les reprises ou les demandes
- L’essentiel de l’activité sur A.I. Hub reste non commercial
- Les modèles sont distribués gratuitement
- Les gens continuent de partager sur YouTube leurs reprises A.I.
- Cela dit, dans le canal #request-a-model, certains proposent d’entraîner des modèles vocaux contre rémunération
Les conflits éthiques et juridiques autour du clonage vocal
- Comme dans les débats sur l’IA générative, les outils de clonage vocal échappent difficilement aux questions d’éthique et de légalité
- Les artistes ont des positions divergentes
- Holly Herndon se montre favorable à l’usage de sa voix de cette manière
- Grimes autorise même un usage commercial s’il y a partage des revenus
- D’autres artistes n’en veulent pas, même gratuitement
- En avril 2020, Jay-Z a demandé à YouTube de retirer plusieurs parodies audio deepfake utilisant sa voix
- À l’époque, il s’agissait de parodies ouvertement assumées, mais faire dire sans autorisation à Jay-Z qu’il participe à un nouveau single ou recommande un produit dans une publicité pourrait relever d’une atteinte au droit d’auteur ou au droit à l’image
- Des créateurs anonymes comme Ghostwriter utilisent le nom et la voix d’artistes célèbres pour attirer l’attention sur leurs morceaux, sans connaissance, consentement ni rémunération des artistes concernés
- À propos de “Heart on My Sleeve”, l’industrie musicale a demandé un retrait sur l’ensemble des plateformes de streaming
- Ghostwriter a ensuite publié sur X et TikTok un autre morceau utilisant des versions IA de Travis Scott et 21 Savage ; TikTok l’a rapidement supprimé, mais il restait en ligne sur X
- L’industrie du disque continuera probablement à réprimer l’usage commercial des voix IA, mais il semble plus difficile d’empêcher la création même de voix IA
1 commentaires
Avis de Hacker News
C’est assez étonnant que ces outils transfèrent à chaque exécution une copie du modèle. Que ce soit dans un notebook Google Colab ou sur une machine locale, si c’est pareil, les coûts de bande passante de Hugging Face doivent être énormes ; je me demande si quelque chose m’échappe.
Ils ont peut-être des accords de peering, ou bien ils utilisent le cache de manière très agressive.
Pour le prix de 100 To de transfert sortant sur AWS, on peut maintenir 10 Gbit/s en continu 24 h/24, ce qui dépasse 3 Po par mois à 100 % d’utilisation. La bande passante a toujours été ridiculement bon marché.
Mieux encore, j’aimerais qu’on me demande d’abord où stocker le modèle.
Cet article ne traite que de l’aspect musical du clonage vocal par IA, mais le domaine le plus complexe est le remplacement des comédiens de doublage ordinaires dans les films, les jeux et l’animation. Par exemple : https://www.axios.com/2023/07/24/ai-voice-actors-victoria-at...
Pour remplacer un chanteur, il faut beaucoup de post-traitement, et les chanteurs ont aussi assez d’argent et de poids juridique pour ne pas être trop durement touchés par la concurrence. Les comédiens de doublage, c’est différent. Avec les réglages par défaut d’ElevenLabs ou d’alternatives open source comme Bark et VALL-E X, on peut déjà les cloner à peu près correctement ; ils sont déjà mal payés, travaillent sous contrat, et n’ont aucun droit légal de propriété sur leur voix. Le travail des comédiens de doublage appartient généralement au client, et ce client peut n’avoir que peu de raisons de défendre activement la protection de leur voix.
J’aimerais écrire un billet de blog sur l’effet de la culture des comédiens de Persona 5 et Genshin Impact, mais je doute que la plupart des lecteurs de Hacker News s’y intéressent.
Plus discrètement, elles pourraient proposer un assistant vocal et glisser dans les conditions d’utilisation que « nous pouvons utiliser une copie de votre voix à n’importe quelle fin ». Les comédiens de doublage existants perdront leur emploi, et il ne restera qu’un petit groupe de clients qui veulent de vraies voix humaines. Pour certains projets, cela n’aura pas d’importance, donc ça risque de devenir assez chaotique.
En tout cas, j’aimerais le lire.
Les chanteurs ne voulaient pas être répliqués par logiciel, mais les voix des comédiens de doublage ont été traitées comme quelque chose qu’on pouvait utiliser librement.
Ce marché s’ouvrira probablement aux petites entreprises qui n’ont pas les moyens d’embaucher des comédiens de doublage professionnels. L’IA ouvre un nouveau marché ; je ne pense pas qu’elle tue vraiment les emplois des personnes réellement talentueuses.
Waouh, je viens de réaliser que n’importe qui peut maintenant garder les paroles de Weird Al et les refaire avec la voix du chanteur original. D’ici l’heure du déjeuner, on pourra peut-être entendre Michael Jackson chanter Just Eat It.
Je suis toujours surpris par les usages possibles des nouvelles technologies d’IA. Bien sûr, ce serait probablement illégal au regard du droit d’auteur dans la plupart des pays.
Weird Al demande lui-même l’autorisation, mais il est bien établi que la parodie n’est pas une violation du droit d’auteur. Avec un bon avocat pour le défendre, il devrait y avoir une marge de manœuvre pour une performance parodique avec voix IA.
Parmi les usages de cette technologie que j’ai vus jusqu’ici, mon préféré est The Beach Boys chantant Hurt. C’est la première fois que je ne perçois presque pas d’artefacts de façon sérieuse, et même si, sur le papier, cette combinaison n’a aucun sens, ça fonctionne incroyablement bien
À écouter : https://youtu.be/gmNSFqyg_Z8
Cela dit, je suis curieux de voir si une IA pourra bientôt synthétiser le style des Beach Boys sur les vrais accords et la mélodie originale de NIN, avec en plus une petite touche de gravité à la Johnny Cash
Si les droits des artistes, des compositeurs, etc. étaient tous réglés, on pourrait voir ce genre de chose comme un usage « acceptable » de l’IA. C’est toujours plus amusant quand des gens talentueux s’amusent eux-mêmes avec ça, mais un album de mashups aussi étrange, je l’écouterais clairement
L’extrait vocal ne ressemble ni à Michael Jackson ni à Weird Al. C’est une bonne tentative, mais un imitateur vocal professionnel aurait probablement fait mieux dans l’un ou l’autre cas
Les reprises chantées par IA sont incroyables. Ça va de Goku chantant Don't Stop Me Now au casting de SpongeBob chantant Ocean Man
https://www.youtube.com/watch?v=CkQ-44PvTs8
https://www.youtube.com/watch?v=tJjhObngcxI
Je ne savais pas ça. « Le centre de la communauté des reprises IA est un Discord de plus de 500 000 membres appelé A.I. Hub, où les membres échangent de nouvelles astuces, des outils, des techniques, ainsi que des liens vers les morceaux originaux et les reprises »
Si 500 000 personnes étaient réunies dans la rue, on le remarquerait forcément, mais en ligne, d’immenses communautés comme celle-ci peuvent exister sans qu’on en sache rien jusqu’à ce qu’on tombe dessus par hasard ou que quelqu’un nous en parle
Même Reddit est moins populaire que Discord ou TikTok chez la Gen-Z, et en lisant /r/LocalLLMs, on sent tout de suite qu’une bonne partie de cette communauté est mineure. Pour être clair, je pense que c’est une bonne chose
Il y a eu une génération qui préférait les mailing lists, une autre qui préférait IRC et les BBS, et ma génération aime les forums et les longs fils de commentaires. Ce serait naïf de croire que notre façon actuelle de faire va durer éternellement
Les critiques visant Discord, en particulier les problèmes de recherche et de découvrabilité, sont très réelles, mais à ce stade, les dés semblent jetés. Les jeunes ont déjà fait leur choix
Cela dit, je ne sais pas si c’est une limite de la technologie ou simplement le fait que « le matériau source est trop inintéressant ». Il y a énormément de choses du genre « morceau classique chanté par un rappeur populaire actuel », et en tant que vieux fan de hip-hop, je dirais qu’il n’y a presque rien d’intéressant dans les voix des artistes hip-hop populaires d’aujourd’hui
Voici un article d’il y a un an sur le fait que la voix de Darth Vader sera désormais générée par IA
https://arstechnica.com/information-technology/2022/09/james...
Pour une « imitation de voix de célébrité », écoutez Light My Fire sur YouTube Music
https://music.youtube.com/watch?v=lN3v3EfA6_A&si=_hcG3Wjakxd...