4 points par GN⁺ 2023-07-23 | 1 commentaires | Partager sur WhatsApp
  • La communauté World of Warcraft a volontairement inventé une mise à jour Glorbo inexistante, et zleague.gg, qui retraitait automatiquement des posts Reddit, l’a publiée comme s’il s’agissait d’une vraie information
  • zleague.gg fonctionnait en résumant avec l’IA des discussions Reddit pour produire de longs articles avec des « points clés » et des paragraphes standardisés, dans une logique visant à capter de la visibilité sur Google
  • Les utilisateurs de r/WoW ont mélangé inventions et déformations — allusion à Hearthstone en 1994, Klikclac, Halfhill Market, race jouable Klaxxi — afin de piéger le bot
  • L’article généré automatiquement, intitulé « World of Warcraft Players Excited For Glorbo’s Introduction », a ensuite été supprimé, mais un miroir d’archive est toujours disponible
  • Cela montre que, même en citant Reddit comme source, le fait d’injecter des posts de communauté dans une IA pour les transformer directement en contenu se fait avec très peu de supervision et de garde-fous

Un site de scraping IA piégé par la fausse mise à jour Glorbo

  • Les utilisateurs du subreddit World of Warcraft r/WoW ont remarqué que zleague.gg récupérait des posts Reddit, les résumait avec une IA, puis les publiait sous forme d’articles de blog
  • L’activité principale de zleague.gg semble être une app de jeu, avec un blog annexe qui produisait des articles à partir de discussions Reddit
  • Pour tromper le bot, les utilisateurs ont rédigé un long fil affirmant que Glorbo allait être introduit dans le jeu
    • Glorbo n’est pas une vraie fonctionnalité de World of Warcraft
    • Le post incluait un faux contexte du type « annoncé depuis 1994 dans Hearthstone »
    • Il mélangeait de vrais noms liés au jeu comme Dragonflight, Chen Stormstout et Karazhan pour paraître crédible

Fictions reprises dans l’article automatique et problèmes de fonctionnement

  • À partir de ce faux fil, zleague.gg a publié automatiquement un article intitulé « World of Warcraft Players Excited For Glorbo’s Introduction »
  • Le résumé publié contenait plusieurs éléments faux
    • L’idée que les joueurs attendaient avec impatience l’arrivée de Glorbo et son impact sur le jeu
    • L’affirmation selon laquelle l’objet indispensable Klikclac pourrait affecter les joueurs occasionnels
    • La rumeur selon laquelle Stormsong Valley deviendrait le nouveau lieu de Halfhill Market et d’un mini-jeu de simulation agricole
    • Une réaction positive à de précédents changements comme l’ajout des Klaxxi en tant que race jouable
  • L’article est resté en ligne un moment avant d’être supprimé, et peut encore être consulté via un miroir d’archive
  • Tous les noms d’auteur du site semblent être faux, et l’ensemble du fonctionnement paraît se faire sans presque aucune supervision
  • Même si le site cite les posts Reddit et mentionne leurs auteurs, le fait d’alimenter automatiquement une IA avec des messages de communauté pour publier directement le résultat pose un problème distinct
  • Ces sites cherchent à capter du trafic depuis Google, et ils auront du mal à disparaître tant que Google ne rétrogradera pas ou n’interdira pas les sites alimentés par l’IA

1 commentaires

 
GN⁺ 2023-07-23
Commentaires sur Hacker News
  • Je joue très peu et la seule console que j’ai est une Nintendo Switch, mais quand je suis bloqué dans le nouveau Zelda, je finis par chercher en ligne.
    J’ai vu que la dizaine de premiers sites dans les résultats de recherche publient des articles presque tous au même format, et partagent même les mêmes erreurs dans les réponses.
    La plupart des sites d’astuces ou de FAQ pour Zelda ne semblent pas proposer de contenu original, mais plutôt former un webring de déchets où chacun régurgite l’autre avec de l’IA.
    Au moins, avec un bloqueur de pubs et le blocage de JavaScript, je ne leur rapporte pas de revenus publicitaires.

    • Les wikis de jeux et les sites de soluces sont devenus depuis un moment une décharge d’optimisation pour les moteurs de recherche.
      Sans doute parce qu’il y a des revenus publicitaires à la clé.
      Il est difficile de croire que Google n’ait pas les données nécessaires pour savoir à quels sites attribuer de l’autorité de domaine, mais je comprends que ce soit une lutte hostile et permanente entre le spam SEO et les moteurs de recherche.
    • C’est aussi amusant de voir que, quand ChatGPT répond à des questions sur les jeux, il est bizarrement verbeux et ajoute un paragraphe d’introduction étonnamment long avant de répondre à une question simple.
      C’est très similaire à ces sites publicitaires qui collent un énorme bloc d’introduction étrange avant d’arriver enfin à la réponse.
    • C’est un peu hors sujet, mais lié. ToTK est vraiment mauvais en matière d’accessibilité, surtout sur les aspects cognitifs et sensoriels.
      Je me retrouve malgré moi à utiliser souvent la carte de ZD TotK : https://www.zeldadungeon.net/tears-of-the-kingdom-interactiv...
      Se souvenir de l’endroit où se trouve tel ou tel ennemi n’a rien d’amusant. Est-ce que quelqu’un trouve ça fun ? L’encyclopédie ne note pas l’emplacement des ennemis combattus, alors même qu’ils réapparaissent à chaque lune de sang.
      Il me faut un Savage Lynel Bow de plus, mais je ne me souviens pas où j’ai vu un Silver Lynel. Je n’ai pas envie de fouiller toute la carte en me fiant seulement au signal vague du capteur du Purah Pad, qui ne se déclenche vraiment que quand on est déjà presque dessus. Est-ce que je suis censé prendre des notes à part ?
      L’idée de la fonction d’historique est bonne, mais elle laisse passer beaucoup de choses. Les descriptions de quêtes sont souvent insuffisantes, et les marqueurs indiquent souvent l’emplacement de la personne qui a donné la quête, ce qui n’aide pas beaucoup.
      Les sous-titres sont appréciables, mais je ne comprends pas pourquoi autant de passages se déroulent sans voix.
      Comme j’y joue sur PC, cela ne me concerne pas personnellement, mais je me demande aussi pourquoi il n’y a pas de remappage des boutons.
      Même en désactivant le FSR interne et l’AA pour éviter que l’image ne tombe parfois dans une bouillie floue, il peut être difficile de repérer des objets, même avec une bonne vue, si l’on ne sait pas clairement où regarder. La lueur d’Ultrahand aide, mais c’est une solution médiocre.
      Il n’y a pas non plus de paramètres pour les troubles de la vision des couleurs. Franchement, qu’est-ce qu’ils font ?
      Ils ont manqué tellement d’occasions de rendre cet excellent jeu beaucoup plus accessible. Nintendo a clairement montré que l’accessibilité ne l’intéressait pas, et c’est vraiment dommage, surtout parce que l’accessibilité améliore l’expérience pour tout le monde.
    • Sur Kagi, ce genre de sites poubelles est assez évident, donc je les bloque simplement.
      Dans ce domaine, les sources à peu près fiables étaient GameFAQs, IGN et les magazines de jeux vidéo.
    • C’est vraiment tragique. Quand j’étais enfant, GameFAQs était pratiquement la seule source, j’y allais souvent, et ses guides ressortaient bien aussi sur Google.
      Le site existe toujours, mais maintenant Google affiche d’abord 20 sites saturés de pubs où, pour lire une soluce d’un passage de 5 minutes, il faut cliquer sans cesse sur de nouvelles pages comme dans un article en liste.
  • Haha, j’ai créé https://meat-gpt.sonnet.io. C’est un site conçu pour se moquer des startups IA nulles, mais je ne vais pas spoiler comment.
    Ces temps-ci, l’une de mes principales sources de trafic, parfois jusqu’à 70 à 80 %, vient de médiocres catalogues d’applications IA. Non seulement ils incluent mon MeatGPT, mais ils hallucinent aussi des descriptions magnifiquement idiotes de ce que le service est censé faire.
    Honnêtement, je ne vois pas comment ça pourrait mieux fonctionner. C’est comme s’ils prenaient le morceau de viande juteux de mon site, se frappaient le visage avec en continu et criaient « encore ».
    J’aime l’art génératif et j’ai même créé ma propre ferme à contenu médiéval auto-éditée[1], mais là, le texte s’écrit tout seul, sur plusieurs sites.
    [1] https://tidings.potato.horse

    • Je suis désormais totalement convaincu qu’il existe un problème d’alignement
  • Le point clé, c’est cette phrase :

    But again, there’s nothing to stop this. These subreddits can’t only fill themselves with joke articles to screw up a site like this, even if this one specific example is good for a laugh.
    La plupart des fils seront des conversations ordinaires, et un site de discussion comme Reddit peut devenir une source simple pour résumer et générer « gratuitement » de l’actualité.
    Je me dis que HN pourrait aussi servir de source d’actualité tech. Il suffirait de résumer l’article visé, puis d’ajouter un résumé des meilleurs commentaires du fil et de l’ambiance générale.
    Je ne dis pas que je vais le faire, mais si l’idée m’est venue, il y a de fortes chances que quelqu’un l’ait déjà tentée avec beaucoup d’avance.

    • Sur HN et dans la vraie vie, j’entends souvent ce genre de discours, mais du point de vue d’un journaliste, je pense qu’il passe un peu à côté en oubliant la valeur du reportage.
      Certaines infos peuvent sans doute être produites simplement en scrapant des fils Reddit, mais l’essentiel du bon journalisme implique un travail de reportage qui fait émerger de nouvelles informations à partir de sources fiables.
      Même sans reportage, si un article ne peut pas contribuer au réservoir de connaissances du monde, il n’a pas de valeur pour les consommateurs ni pour les annonceurs. C’est aussi vrai dans l’univers du spam d’optimisation pour les moteurs de recherche. Il faut faire un effort pour se distinguer de la concurrence si l’on veut arriver dans les premiers résultats.
      Les fils Reddit sont souvent remplis de réactions émotionnelles à des articles déjà produits de cette manière. À un moment, un humain doit sortir parler à d’autres humains, trouver un nouvel angle ou une nouvelle thèse, suivre des questions, relier des points que personne n’avait encore reliés. C’est ça, l’actualité, pas un résumé d’attitudes existantes.
    • J’ai créé un site web qui fonctionne comme ça : il choisit des posts HN à plus de 400 votes, rassemble la liste des titres, demande à l’IA de filtrer les éléments sans rapport avec la tech, comme les sujets sur la Bay Area ou la politique, puis scrape les articles sélectionnés, en rédige un résumé et les publie sous forme de site statique.
      Comme autres sources, j’utilise des subreddits Reddit et des flux RSS, des blogs officiels de langages, ainsi que des pages de releases GitHub.
      L’IA se fait berner assez facilement. On peut l’éviter en lui donnant plus de contexte et en ajoutant une étape de relecture pour vérifier que les règles éditoriales sont respectées.
      Une autre option à laquelle je réfléchis consiste à faire rédiger les articles par un modèle moins cher, comme gpt-turbo-3.5, puis à les faire relire par un modèle plus sophistiqué, comme gpt4.
    • Même si l’on ne veut pas simplement résumer les commentaires, la plupart des sections de commentaires d’articles peuvent être vues comme une enquête crowdsourcée sur le sujet.
      Après avoir lu une discussion intéressante ici, on repart facilement avec une courte liste d’articles, de livres, etc. associés, et souvent avec des explications vivantes venant directement de personnes concernées.
    • J’écris anonymement. Des startups font réellement ce genre de choses, et je ne dois pas entrer dans les détails.
      L’information veut être libre. Pour l’instant, c’est un plugin de navigateur qui peut lire le DOM et poser des tags, et ce travail humain alimente un système d’apprentissage.
      L’idée est partie de Twitter Community Notes transformé en plugin de navigateur indépendant, puis s’est étendue à l’entraînement de modèles qui semblent lire le DOM pendant que l’utilisateur navigue sur le web.
      Comme ça ne tape pas dans l’API, il n’y a pas non plus de frais, non ? C’est l’utilisateur qui choisit les interactions.
      Le seul moyen de défense contre une IA entraînée à ressembler à du doom scrolling semble être la limitation de débit.
    • On ne pourra pas publier uniquement ce genre de textes, mais on peut faire honte à quelqu’un qui présente un auteur IA comme un humain.
      Au minimum, il faudrait indiquer d’une manière ou d’une autre que le texte a été écrit par une IA. Sinon, ce genre de piège pourrait servir à embarrass une personne que l’on croyait être l’auteur humain.
  • Ce genre de choses se produit sur beaucoup de sites d’actualité jeu vidéo, pas seulement sur ce site.
    Dans mon flux Google News, je vois régulièrement des articles qui résument des fils Reddit, avec une précision journalistique douteuse et des textes manifestement générés par IA.
    Malgré tout, quand ça fonctionne correctement, c’est assez utile et opportun.
    Un an environ après avoir vu apparaître de bonnes IA génératives de texte, j’en viens à imaginer le jour où, sans me connecter à Internet depuis un appareil, j’appellerai une voix IA au téléphone pour savoir s’il y a des e-mails urgents ou pour entendre uniquement les résumés d’actualité qui m’intéressent vraiment.
    Le web est passé de quelque chose que j’aimais sincèrement à une relation abusive tellement profondément ancrée dans le quotidien qu’on ne peut plus la rompre.
    J’accueille volontiers un intermédiaire IA qui lira à ma place le spam d’optimisation pour les moteurs de recherche, les titres putaclic et les commentaires absurdes, en subira la pénibilité, puis synthétisera utilement seulement ce qui compte pour moi.

    • Se connecter en ligne sans agent IA deviendra comparable au fait de se promener sans masque pendant le COVID.
  • Intéressant. Ça ressemble beaucoup à l’expérience contre-culturelle que j’ai vécue comme hacker dans les années 80.
    La sensation de lutter contre « The Man » pourrait maintenant se prolonger contre « The AI ». Bien joué, les geeks du jeu vidéo.

    • Je pense que ce genre d’événement finit surtout par révéler à quel point les créateurs de l’objet, cette fois les créateurs d’IA, n’ont pas respecté la possibilité que le grand public en abuse.
      Le public ne se soucie pas de la manière dont les développeurs veulent qu’il l’utilise. Il s’intéresse à ce qu’il peut lui faire faire.
      Il suffit de regarder les hot rods, l’overclocking et d’innombrables autres exemples.
    • On dirait que cela se répète à chaque fois qu’un outil nouveau et suffisamment puissant apparaît.
      Les personnes moins enfermées dans des structures hiérarchiques peuvent avancer vite, et elles le font. Quand un grand changement arrive, elles peuvent s’engouffrer dans les brèches et causer des dégâts assez importants, tandis que les grandes organisations rattrapent leur retard et consacrent ensuite des ressources à renforcer ce qu’elles considèrent comme des failles, généralement tout ce qui réduit leur contrôle sur un système ou sur ses pièces d’interconnexion.
      J’espère que la suite sera plus rapide et plus chaotique encore. Les meilleurs résultats arrivent quand des personnes nouvellement habilitées se jettent dans la mêlée par affection, et non pour l’argent.
  • Pour un site de spam qui doit être désespérément en quête de trafic, supprimer un post devenu viral est une décision un peu étrange.

    • Oui. Mais d’un autre côté, c’est du contenu fait pour la pub (MFA).
      Le pire, ici, ce n’est pas la mauvaise réputation, c’est d’être mis sur liste noire par Google ou par le marché de la publicité programmatique. Le premier vous coupe le trafic, le second vous coupe la monétisation.
      Ironiquement, la guerre contre le contenu IA pourri semble devoir être menée par des entreprises d’adtech qui doivent pouvoir affirmer de façon crédible que leurs clients ne gaspillent pas leur argent dans de l’inventaire publicitaire sans valeur.
    • Quelle que soit la manière dont ils gagnent de l’argent, les visiteurs arrivés dans ce contexte ont peu de chances de convertir.
      Retirer l’article réduit au moins un peu les dégâts de réputation.
  • Hier, en cherchant l’option de stabilisation vidéo sous Linux, je suis tombé sur un article qui décrivait avec beaucoup d’assurance un outil prétendument maintenu par les « auteurs » de ffmpeg, ce qui m’a surpris.
    J’ai donc cherché, mais je n’ai rien trouvé ; en recherchant le nom entre guillemets, il n’était mentionné que dans trois articles écrits par la même entreprise.

    • Ça a vraiment commencé à se produire. Du contenu généré par des LLM et rempli d’hallucinations est en train de recouvrir le web.
      Si le rapport signal/bruit s’effondre au point qu’il devient pratiquement impossible de séparer le bon grain de l’ivraie, Internet deviendra bientôt totalement inutile.
      Ce papier sur les transformeurs d’IA était vraiment une boîte de Pandore.
  • J’aimerais que les développeurs de Warcraft appellent désormais Glorbo l’un des vrais ajouts à venir.

    • Si Blizzard fait encore des blagues de poisson d’avril, le sujet de l’an prochain est déjà tout trouvé.
  • Je le prédis maintenant : Glorbo sera dans le prochain patch.

  • Cet article est littéralement la même camelote que les posts IA dont il se plaint.
    Ce n’est qu’un article de presse basé sur un fil reddit.