1 points par GN⁺ 2024-09-19 | 1 commentaires | Partager sur WhatsApp
  • wordfreq est un instantané des usages linguistiques observés dans plusieurs sources en ligne jusqu’en 2021, et il a été figé sur sa dernière version, car une mise à jour des données risquerait au contraire d’en dégrader la qualité
  • Depuis 2021, le Web public a été largement envahi par des textes générés par IA qui ressemblent à des écrits humains, ce qui rend difficile la mesure de la fréquence des mots à partir de l’usage réel de la langue par des humains
  • Les données existantes contenaient déjà du spam, mais celui-ci restait en général identifiable et gérable ; en revanche, les sorties d’IA générative, comme dans le cas de “delve” avec ChatGPT, peuvent faire grimper anormalement la fréquence de certains mots
  • L’accès aux données de Twitter et de Reddit, qui constituaient des sources importantes de langue conversationnelle, a disparu ou est devenu coûteux, et les anciennes données de Twitter ne pouvaient de toute façon pas être redistribuées en externe selon leurs conditions de diffusion
  • À mesure que le traitement automatique du langage s’est orienté vers l’IA générative et la dépendance à des données fermées, le développeur ne souhaite pas que wordfreq aide l’IA générative ni qu’il soit confondu avec ce type de travail

Complément de septembre 2024

  • Le document annonçant l’arrêt des mises à jour de wordfreq a suscité beaucoup d’intérêt, et le développeur estime que les gens ont globalement compris sa position
  • Il n’a pas cessé de travailler sur les bibliothèques open source en général, et continue notamment de maintenir ftfy, un outil polyvalent de correction Unicode
  • Le gel des données n’est pas forcément une mauvaise fin
    • Beaucoup de personnes ont trouvé wordfreq utile, et sa version la plus récente ne va pas disparaître
    • S’il n’est plus mis à jour, c’est parce qu’une mise à jour risquerait de rendre les données moins bonnes
    • Avec le temps, elles vieilliront, mais elles ne se dégraderont pas activement

Un instantané des usages linguistiques jusqu’en 2021

  • Les données de wordfreq sont un instantané des usages linguistiques que l’on pouvait observer dans plusieurs sources en ligne jusqu’en 2021
  • Les raisons de l’arrêt des mises à jour tiennent à la fois à la contamination des données, au coût d’accès et à l’évolution du domaine du traitement automatique du langage

Le Web public contaminé par l’IA générative

  • Depuis 2021, il estime qu’il est difficile d’obtenir des informations fiables sur la langue réellement utilisée par les humains
  • Le Web public, qui était l’une des sources de données de wordfreq, était exploité via OSCAR
  • Aujourd’hui, le Web au sens large contient beaucoup de textes générés par de grands modèles de langage, et les inclure fausserait les fréquences de mots
  • Les anciennes sources de données contenaient déjà du spam, mais celui-ci restait souvent gérable et identifiable
  • Les grands modèles de langage produisent des textes qui ressemblent à une langue porteuse d’une intention réelle, et leurs sorties se diffusent partout
  • Selon ce billet sur delve de Philip Shapira, ChatGPT a utilisé “delve” de manière obsessionnelle, différemment de l’usage humain, et en a fait exploser la fréquence globale d’un order of magnitude

Les données conversationnelles disparues ou devenues chères

  • wordfreq ne traitait pas seulement des mots issus d’un langage imprimé formel, mais collectait aussi des usages plus conversationnels, en particulier sur Twitter et Reddit
  • Twitter et X

    • La base de données issue de Twitter a toujours été instable
    • Même à l’époque où Twitter autorisait un accès gratuit à une partie du “firehose”, les conditions d’utilisation interdisaient de redistribuer hors de Luminoso les données collectées
    • wordfreq contient des valeurs de fréquence produites à partir de ces données, mais les données collectées elles-mêmes n’appartenaient pas au développeur et ne sont plus conservées
    • Aujourd’hui, Twitter a disparu, l’API publique a été fermée et le site a été remplacé par X
    • Même si X fournissait un flux de données brutes, il estime qu’on n’y trouverait plus d’informations utiles
  • Reddit

    • Reddit a lui aussi cessé de fournir des archives de données publiques
    • Désormais, Reddit vend ses archives, à un prix qu’il décrit comme accessible seulement à OpenAI

Pourquoi prendre ses distances avec l’IA générative

  • wordfreq se situait à l’origine à l’intersection de la linguistique de corpus et des outils de traitement automatique du langage
  • Le domaine du “natural language processing” que le développeur connaissait est devenu difficile à retrouver, et il estime que l’IA générative l’a largement absorbé
  • D’autres approches existent toujours, mais l’IA générative capte l’essentiel de l’attention et des financements
  • Il estime qu’il est rare de voir des recherches en NLP qui ne dépendent pas de données fermées contrôlées par OpenAI et Google
  • Un travail comme wordfreq, qui consiste à collecter beaucoup de textes dans de nombreuses langues, paraissait autrefois tout à fait raisonnable
  • Aujourd’hui, les outils de collecte de textes servent surtout à l’entraînement de l’IA générative, et il considère comme légitime que les gens réagissent de manière défensive à cela
  • Si l’on collecte tous les textes de livres, d’articles, de sites Web et de publications publiques, il est fort probable, selon lui, que ce soit pour construire une machine à plagiat capable de faire passer la parole des autres pour la sienne

Conclusion de l’arrêt des mises à jour

  • Le développeur ne veut pas travailler sur quelque chose qui pourrait être confondu avec l’IA générative ou lui être utile
  • Il affirme qu’OpenAI et Google doivent collecter eux-mêmes leurs données et en payer le prix fort
  • wordfreq ne sera plus mis à jour, mais sa dernière version existante reste disponible

1 commentaires

 
GN⁺ 2024-09-19
Commentaires sur Hacker News
  • Je suis globalement d’accord, mais le web était déjà pollué par les règles SEO officieuses de Google
    Avec des paragraphes d’une seule phrase, la répétition de mots-clés et une priorité donnée à « l’indexabilité » plutôt qu’à la lisibilité, le web n’était déjà pas une source idéale pour ce type d’analyse avant les LLM
    C’était pareil pour les données d’entraînement, et au final les LLM ont grandi en se nourrissant de textes écrits non pas pour des humains, mais pour Googlebot

    • Le spam de blogs était en grande partie écrit par des humains et, même s’il était mauvais pour d’autres raisons, il semblait convenable pour mesurer la fréquence des mots de base dans des textes rédigés par des humains
      Il y aura toujours un biais dans les fréquences, mais c’est vrai de la plupart des textes, et dans un manuel d’entretien de carburateurs, le mot « carburetor » apparaîtra forcément bien plus souvent que la moyenne
      Tant qu’on a un mélange sain de livres, d’articles de presse et de blogs, ça va. En revanche, le contenu produit par les LLM ressemble davantage à un serpent qui se mord la queue : on essaie de fabriquer un modèle statistique de distribution des mots à partir de la sortie d’un autre modèle de distribution des mots
    • À un certain stade, il faut aussi reconnaître que certains usages de la langue sont une caractéristique du média lui-même dans lequel on compte les fréquences des mots
      Les journaux, les romans ou les e-mails envoyés à son supérieur ont eux aussi des styles propres, avec des longueurs de phrases et de paragraphes typiques, des répétitions inutiles et une importance accordée à d’autres critères que la lisibilité
      Au moins, si le texte est écrit par un humain en gardant à l’esprit qu’un autre humain pourrait le lire, on peut y voir un usage de la langue bien plus légitime que dans un texte généré par une machine
    • Cela donne l’impression d’un deuxième Eternal September, mais à une échelle bien plus grande
      Je ne sais pas combien de temps Internet pourra encore supporter ça, et mon usage a déjà nettement diminué par rapport à 2018. Il est devenu trop difficile de trouver des choses valables à lire, donc je finis par passer beaucoup de temps ici
    • Cela dit, ce n’est pas aussi extrême que ce qui est suggéré. Les données d’entraînement sont pondérées à l’aide d’indicateurs de qualité, et les textes écrits par des journalistes ou des contributeurs de Wikipedia ont plus de poids qu’une recette de brownies de tante ou du spam de blog d’entreprise
    • Avant Google, il y avait Altavista, et à l’époque il était extrêmement courant de bourrer le bas des pages de centaines de mots-clés en blanc sur fond blanc
      Le spam SEO n’a rien de nouveau, seule sa forme a changé
  • En 2023, j’ai créé https://lowbackgroundsteel.ai/ comme espace pour rassembler des références de jeux de données non contaminés
    Je compte aussi y ajouter wordfreq, donc n’hésitez pas à m’envoyer des ressources via Tumblr

    • Félicitations pour le « lancement ». Moi aussi, j’avais presque exactement ce site en projet de fond depuis quelque temps. Je me demande où vous placez la date de référence
      Voici la liste utile que j’ai constituée pendant mes recherches : invention de l’architecture Transformer en 2017, GPT-1 en juin 2018, GPT-2 en février 2019, GPT-3 en juin 2020, GPT-3.5 en mars 2022, ChatGPT en novembre 2022
      Ce serait aussi bien d’ajouter les archives kiwix antérieures à la date retenue. On peut les trouver sur Internet Archive, et elles couvrent Wikipedia, Stack Overflow, Wikisource, Wikibooks ainsi que plusieurs versions de wikis
    • Le nom est malin. J’aime bien la métaphore
    • J’y vois exactement l’inverse de ce que voulait l’auteur. L’auteur ne veut plus faire partie de ce chaos
      Rassembler ce type de sources ne fait que faciliter le travail des grandes entreprises technologiques qui veulent aspirer encore plus de données
    • Pour référence, mes jeux de données DebateSum et OpenDebateEvidence/OpenCaseList entrent dans cette catégorie, puisqu’ils s’arrêtent au plus tard en 2022 dans leur forme actuelle
    • Je ne sais pas si on peut faire confiance à un site contaminé par des graphismes IA /s
  • Il est regrettable que l’OP en soit venu à être déçu par la communauté du traitement automatique du langage naturel à laquelle j’appartiens, et même si c’est une mode qui frôle presque la surchauffe, j’aimerais dire que « nous ne sommes pas tous comme ça »
    Le problème de la pollution du web par du contenu artificiel est très actuel, et il y a eu des précédents, comme les fermes de spam qui cherchaient à manipuler PageRank
    C’est pourquoi des listes de sites web de haute qualité, soigneusement sélectionnés à la main — ce qu’on appelle le « petit web » — pourraient retrouver de la valeur
    Chaque génération du web a eu besoin de techniques pour dépasser les mécanismes adverses de son époque, et le web actuel ne fait pas exception
    Quand Eric Arthur Blair a écrit 1984 sous le pseudonyme de « George Orwell », il a anticipé un monde où le public consommerait du contenu généré automatiquement de manière à s’éloigner de l’esprit critique. C’est ce qui se passe aujourd’hui, mais la technologie critiquée peut aussi être utilisée à bon escient, et c’est ce que mon équipe de recherche en NLP essaie de faire. Au final, le bien l’emportera

    • Est-ce que le « bon » petit web a déjà vraiment gagné un jour ?
      IRC, Usenet, Reddit, Facebook, Geocities, Yahoo, les webrings : quel que soit le système de contenu, dès qu’il atteint un usage grand public, il semble être pollué par le bruit
      Même les options petites et sélectionnées finissent, si elles grossissent suffisamment, par devenir victimes de leur propre succès et par être submergées par le spam
      C’est toujours une course aux armements entre qualité et quantité, et au bout du compte les curateurs n’arrivent plus à suivre le volume écrasant
    • Les gens qui évitent la pensée critique le faisaient déjà avant l’arrivée du contenu IA, et continueront à le faire avec ou sans lui
    • L’idée que « le bien finit toujours par l’emporter » est dangereuse. Elle peut au contraire retarder les actions décisives qui seront probablement nécessaires pour que cela arrive réellement
    • Petite digression, mais Marx avait aussi prédit en 1894 l’existence des cryptomonnaies et des NFT https://www.marxists.org/archive/marx/works/1894-c3/ch25.htm
      Ce qui est étrange, c’est avec quelle désinvolture nous continuons à franchir ce genre de « lignes rouges ». C’est comme dans ce mème : l’auteur de science-fiction disait « j’ai créé Torment Nexus comme un récit d’avertissement », et l’entreprise technologique répond « nous avons créé le Torment Nexus du roman classique de SF “Ne créez pas le Torment Nexus” »
    • Et si la manière dont le bien l’emporte consistait à rejeter des technologies et des croyances devenues destructrices ?
  • Pour être clair, le Web est mort. Grâce à l’« IA », il faut désormais plus de temps qu’en 2005 à fouiller les moteurs de recherche pour trouver quelque chose d’utile
    Et les sites qu’on finit par trouver sont généralement nuls
    Par exemple, même pour trouver une paire d’écouteurs sans fil connue, alors que je connais déjà l’entreprise, son site et le vendeur, il me faut au moins 10 minutes. C’est enfoui sous tout un tas de déchets
    Mon laptop a un i7 8 cœurs « ancien » et 16 Go de RAM, et pourtant il peine sur les sites « modernes » bourrés de graphismes. Les anciens sites étaient simples, fonctionnaient bien, et permettaient de chercher et d’acheter rapidement un produit ; hier soir, même ajouter au panier et payer a été une vraie corvée
    Je déteste le Web, les navigateurs, le web design, le SEO, la recherche, la publicité, et tous les gadgets bas de gamme qui vont avec. C’est fini. S’il existe un moyen d’acheter quelque chose sans passer par le Web, je le ferai. Je ne déteste pas totalement la technologie en soi, mais le Web est devenu un œuf pourri

    • Sur Amazon, on pouvait autrefois chercher directement dans les avis et les Q&A avec la barre de recherche, et c’était extrêmement utile
      Maintenant, cette barre envoie d’abord la requête à un LLM, vous fait attendre 10 à 15 secondes, puis affiche un résumé inutile du genre « certains avis disaient ceci ou cela »
      Ce n’est qu’ensuite qu’on peut cliquer sur un bouton pour voir, dans les vrais avis et questions, les éléments contenant le mot que je cherchais. Ça risque de me faire abandonner Amazon. S’il existe encore un moyen de faire une recherche directe, je veux bien qu’on me le dise
    • Globalement, rien à redire
      Avant, si je cherchais un hanger de dérailleur Trek, le premier résultat était celui que je voulais. Maintenant, il faut d’abord passer 5 pubs me disant d’acheter un vélo neuf, puis un lien tiers cassé, et avec un peu de chance le lien vers la page de la pièce apparaît tout en bas de la première page
      L’enshittification du Web est bien réelle
    • On dirait que ton laptop est complètement dépassé. Il faut acheter sur Amazon un portable nouvelle génération capable d’encaisser la charge SEO moderne
      Le produit recommandé est le LEEZWOO 15.6" Laptop - 16GB RAM 512GB SSD PC Laptop, Quad-Core N95 Processor Up to 3.1GHz, Laptop Computers with Touch ID, WiFi, BT4.2, for Students/Business
      Ça se prononce avec une fluidité remarquable, non
    • Il existe une startup qui vend une meilleure recherche comme produit. La fonction clé, c’est que comme je paie, je ne suis pas le produit : https://kagi.com/welcome
    • Depuis 10 ans, je me détache progressivement du Web. Ces jours-ci, je fais surtout des apps hors ligne en technologies natives
      Ces compétences existent toujours. Elles avaient seulement trop reculé un temps, à cause de la pollution des barres d’outils et des malwares, et maintenant que les malwares sont passés de l’autre côté, les apps natives sont redevenues cool. Il suffit de savoir où regarder
      Ma vitrine est ici : https://akkartik.name/freewheeling-apps
      Cela dit, ici, « le Web » semble ne désigner que ce à quoi on accède via les moteurs de recherche. Il existe toujours aussi l’ancien Web, celui qui n’est pas médié par des services agrégateurs à des milliards d’utilisateurs mais par les relations et la réputation. Comme le lien ci-dessus, ou ce site héroïquement modéré que nous utilisons en ce moment
  • Je suis d’accord avec l’idée que « depuis 2021, personne ne dispose d’informations fiables sur l’usage humain de la langue »
    Le texte a déjà dépassé son point de bascule depuis un moment, mais pour la vidéo, on a l’impression que nous sommes au moment charnière
    Les jeunes enfants, en particulier, ont peu d’intuition sur ce qui est réel ou non. Si on me demande si la personne dans une vidéo est réelle, je réponds encore avec une certaine assurance, mais cette assurance diminue chaque jour
    La technologie est clairement prête, et même si la majorité des contenus vidéo n’est pas encore touchée, je pense que ça va changer bientôt

    • Il y a ce genre de quiz : https://www.nytimes.com/interactive/2024/09/09/technology/ai-video-deepfake-runway-kling-quiz.html
      https://www.nytimes.com/interactive/2024/01/19/technology/artificial-intelligence-image-generators-faces-quiz.html
      C’est un peu injuste dans la mesure où l’on compare des exemples soigneusement sélectionnés, mais même des experts auraient du mal à réussir souvent ce genre de test. La technologie ne va que dans un sens, et le rythme semble s’accélérer
      Ce qui est frappant, c’est la vitesse du progrès. L’humanité existe depuis près de 3 millions d’années, Homo sapiens depuis environ 300 000 ans, les villes, l’agriculture et la civilisation depuis environ 10 000 ans, les métaux depuis environ 4 000 ans, la révolution industrielle depuis 500 ans, la démocratie depuis 200 ans, et l’informatique depuis 50 à 100 ans
      L’intervalle entre les révolutions se raccourcit presque de façon exponentielle
      Quand je compare le monde d’aujourd’hui à mon enfance, l’une des révolutions encore en train d’être absorbées est la fabrication automatisée. Sur AliExpress, tant de choses sont pratiquement gratuites. J’ai acheté un chargeur 5 ports 120W pour moins de 2 minutes de mon temps, et le temps passé à le trouver a été plus court que le temps nécessaire pour gagner cet argent
      Je ne sais pas vraiment où tout cela nous mène
    • Je n’ai plus vraiment confiance dans ma capacité à identifier une vraie personne
      Il m’arrive souvent de classer comme « à moitié faux » de vraies personnes qui ont adopté les codes de comportement des créateurs TikTok, Instagram ou YouTube
      Ma barbe a aussi grisonné, mais dans une vidéo de présentation en 2020, je me moquais déjà du visage de miniature YouTube. L’IA capte très vite et très fortement ce genre de schémas comportementaux « semi-humains »
      Je vois passer des vidéos avec deux jeunes femmes tenant des pancartes « This is real » / « This is not real », et il se peut que les deux mentent complètement, sans que je puisse faire la différence. Elles ont toutes des comportements un peu « étranges », mais cohérents avec le petit nombre de vidéos d’influenceurs que j’ai vues
    • On peut repérer les mauvaises générations, mais comment savoir qu’on ne se fait pas berner par les bonnes
    • Je n’y avais jamais pensé. Ce serait effrayant si les humains perdaient la capacité de distinguer les contenus IA de la réalité
  • « Maintenant, l’ensemble du web est rempli de bouillie produite par des grands modèles de langage, que personne n’a écrite et qui ne transmet rien » est une formule juste et exacte
    Même dans le meilleur des cas, la personne qui a fait tourner le modèle n’a pas écrit ce texte, et cette salade de mots ne parvient pas à transmettre ce qu’elle voulait dire
    Dans bien des cas, le contenu est simplement déversé pour le SEO, sans intention qu’il ait la moindre valeur pour qui que ce soit

    • Cette phrase m’a vraiment frappé moi aussi, elle est très puissante
  • Peut-être que les livres papier d’avant 2020 deviendront des objets précieux d’ici 10 à 20 ans
    Quand Internet sera rempli de bouillie et que même les livres papier de l’époque susciteront la méfiance
    Et il y aura aussi des humains jouant les têtes parlantes en prétendant être les auteurs de livres écrits par une IA très intelligente. Sérieusement, qu’est-ce qu’on est en train de faire ?

    • Sans doute pour porter aux nues de célèbres « philanthropes » comme Sam Altman ou Mark Zuckerberg. Beaucoup de gens ici les considèrent comme des héros
    • Je pensais qu’accumuler plein de livres sans presque les lire relevait d’un trouble mental, mais maintenant je vais devoir le faire encore plus
    • Ou alors ce pourrait être une tête parlante IA prétendant être l’auteur d’un livre écrit par une IA https://youtu.be/pAPGRGTqIgI
      Avertissement : IA de désinformation soutenue par un État
  • J’ai des sentiments très partagés sur cette question
    D’un côté, je suis entièrement d’accord avec Robyn Speer. Le web ouvert est mort, et le web est dans un état vraiment triste. Il y a quelques jours, j’ai décidé de mettre mon blog personnel sur gopher. Simplement parce qu’il y a beaucoup moins de déchets sur gopher, ce qui ne veut évidemment pas dire que gopher soit la solution
    Mais il y a quelques semaines, j’ai dû envoyer un fichier vidéo au grand-père de ma femme, âgé de 97 ans, vivant dans un autre pays et n’utilisant ni ordinateur ni téléphone portable. J’ai fini par vérifier qu’il avait bien un lecteur DVD, puis j’ai utilisé x264 pour convertir une vidéo 4K HDR récente dans un format lisible par n’importe quel vieux lecteur DVD, tout en essayant de préserver au maximum la qualité d’image
    Le problème, c’est qu’il n’y a pas de documentation pour x264. Contrairement à x265, qui avait des sponsors d’entreprise capables de payer une vraie documentation, x264 a essentiellement été développé par tâtonnements par des membres du forum doom9. Il existe des centaines de flags obscurs, et certains ne fonctionnent plus comme il y a 20 ans
    J’aurais pu passer au crible des dizaines de fils vieux de 20 ans sur doom9 pour comprendre à quoi servait chaque flag, mais en pratique j’ai demandé à un LLM, en l’occurrence Claude
    Claude n’a pas été parfait, et a mélangé quelques flags ffmpeg avec des flags x264, mais avec un peu de recherche traditionnelle et de tâtonnement en plus, j’ai pu terminer le travail en environ 30 minutes. La qualité du résultat m’a plutôt satisfait, et la vidéo passait même sur un très vieux lecteur DVD
    Avant les LLM, je n’aurais pas engagé un expert x264 pour ça. J’y aurais passé quelques heures de plus, ou plus probablement, ce monsieur de 97 ans n’aurait pas pu voir sa arrière-petite-fille danser. On m’a dit que cette vidéo lui avait apporté un très grand sourire
    Les LLM ne sont qu’un outil, comme tout ce qui les a précédés. Ils ne sont ni bons ni mauvais par essence. Ce qui compte, c’est ce que nous faisons et la manière dont nous les utilisons

    • La plupart des logiciels de gravure DVD d’autrefois n’intégraient-ils pas par défaut une fonction de conversion vidéo ?
      À l’époque, on aurait utilisé Nero Burning ROM ou Handbrake. La qualité n’aurait peut-être pas été optimisée au niveau souhaité, mais pour des yeux de 97 ans, le résultat aurait été largement regardable
  • Nous, les humains, avons-nous tellement pollué Internet avec l’IA qu’il est désormais presque inutilisable ?
    À mon avis, on peut considérer Internet comme un environnement naturel, un espace où les gens partagent, se rencontrent et discutent
    C’est frappant de voir qu’après avoir pollué l’environnement naturel, nous avons maintenant pollué Internet

    • Si ce n’est pas encore le cas, ça le sera très bientôt. Il y a bien des gens qui travaillent sur ce problème, mais j’ai l’impression que nous approchons maintenant d’un moment de boucle de rétroaction très imminent
      La plupart des informations produites par les humains ont été numérisées, et une grande partie d’entre elles génère désormais du contenu non humain à une vitesse énorme. En d’autres termes, nous avons injecté une quantité énorme de bruit dans les données que nous pouvons utiliser
      Je ne sais pas si la réponse consiste à produire davantage de contenu humain ou un nouveau contenu généré, mais cette phase de transition va poser des défis à moyen terme
      J’aimerais penser que l’époque où plus il y avait de tokens dans les LLM, mieux c’était, touche à sa fin, et qu’on va plutôt vers une meilleure exploitation des données existantes, mais en réalité nous sommes à l’approche d’un tournant important
    • Il existe encore de petites communautés fermées qui ont beaucoup de valeur. L’endroit où j’écris en ce moment en fait partie
      Mais l’Internet ouvert est désormais fondamentalement devenu inutile, et la cause profonde, c’est le modèle économique fondé sur la publicité
    • La tragédie des biens communs détruit tout ce qu’elle touche autour d’elle
    • Oui. Voici aussi un guide pratique pour transformer Internet en une décharge encore plus grande https://www.youtube.com/watch?v=endHz0jo9Ck
      On dirait presque une loi de la nature : toute nouvelle technologie finit par servir à amplifier le SEO. L’IA est devenue l’épandeur à fumier Degelman M34 d’Internet https://degelman.com/products/manure-spreaders
    • Bonne analogie. Heureusement, en ligne, il est plus facile de créer de l’« immobilier » à partir de rien. Cela dit, nous avons tout de même perdu en partie certains espaces précieux comme Twitter et Reddit
  • Pour les auteurs qui vont bientôt perdre leur emploi, ou l’ont déjà perdu, et qui ont en pratique peu de chances d’être embauchés grâce à leurs travaux précédents, il faut que les très grands acteurs de l’IA les paient pour écrire n’importe quoi
    Il n’y a qu’une seule condition : pas une seule phrase de ces productions ne doit être générée par une IA
    Au départ, j’allais dire que « le gouvernement devrait payer », mais ce serait socialiser les pertes, et on a déjà largement donné par le passé

    • Il existe déjà quelques entreprises qui font ce genre de choses. Moi aussi, je fais parfois du travail en freelance pour certaines d’entre elles, et la rémunération dépasse parfois largement ce qu’un auteur moyen peut espérer ailleurs
      Cela dit, la plupart des auteurs n’ont jamais vécu de leur plume. La barrière à l’entrée de l’écriture est bien trop basse, il y a beaucoup trop de gens qui aiment écrire, et la plupart des gens ne lisent presque rien
    • Qui programme encore sur bande ? https://en.wikipedia.org/wiki/Profession_(novella)
    • Les entreprises d’IA embauchent effectivement ce type de personnes pour créer des données d’entraînement sur mesure
    • Cela fait déjà plus de 10 ans que des gens produisent du bruit et sont payés pour ça. Garbage in, garbage out a toujours été vrai
      Trouver le token suivant est un problème résolu. La pensée nouvelle est quelque chose que les humains peuvent résoudre, et que l’IA pourra peut-être bientôt résoudre aussi, mais ajouter davantage de déchets dans les données n’améliore rien
    • Tu as déjà lu l’histoire des États-Unis, lol