1 points par GN⁺ 2023-10-21 | 1 commentaires | Partager sur WhatsApp
  • Wikipédia abrite à la fois des articles populaires qui reçoivent des millions de vues par semaine et, parmi plus de 6 millions d’articles, des articles extrêmement impopulaires qui ne sont lus qu’un nombre de fois à un chiffre par an
  • Dans un échantillon d’environ 32 000 articles en 2021, le bas du classement était largement composé de pages d’homonymie ; en les excluant, de courtes ébauches sur des espèces de papillons de nuit et de mouches, des villages iraniens ou des noms de famille plafonnaient à 7 à 9 vues par an
  • Le bouton « Random article » fait varier la probabilité de sélection selon le random gap entre la valeur page_random de chaque article et la valeur précédente, si bien que certains articles sont beaucoup moins exposés que la moyenne
  • En limitant le périmètre aux 600 000 articles dont le gap est inférieur ou égal à environ 1/10 du gap moyen, les articles les moins consultés en 2021 ont été Trichromia phaeocrota et Opharus corticea, avec chacun 3 vues estimées humaines
  • Parmi les 500 derniers articles figuraient beaucoup de taxons d’insectes, quelques gastéropodes et champignons, des formes géographiques et des articles de type set index ; les articles sur des espèces et des lieux habités restent souvent en ligne avec des sources faibles en raison de critères d’admissibilité peu stricts

Caractéristiques des articles impopulaires révélées par l’échantillon

  • Wikipédia compte plus de 6 millions d’articles, et les articles populaires reçoivent des millions de vues par semaine
  • À l’inverse, certains articles sont consultés à peine quelques fois par jour, par exemple :
  • Parmi les articles créés par l’auteur, le moins populaire est Sunday reading periodical, consacré à un genre de magazines de l’époque victorienne, avec environ 12 vues par mois en moyenne
  • Les données de consultation de Wikipédia sont publiques sous forme de dumps bruts et via une API, mais il n’existe pas de méthode simple pour trier directement les articles les moins consultés

Analyse d’un échantillon aléatoire de 32 000 articles

  • Les données de consultation de 2021 ont été collectées sur un échantillon d’environ 32 000 articles Wikipédia
  • La médiane annuelle des vues dans l’échantillon est légèrement inférieure à 1 000, tandis que la moyenne est d’environ 13 000 à cause de la longue traîne
  • L’échantillon contenait près de 100 articles dont le total de vues en 2021 était à un chiffre
  • Toutefois, les 50 derniers étaient tous des pages d’homonymie, qui ne sont pas considérées comme de « vrais articles » dans l’analyse
  • En excluant les pages d’homonymie, les articles à un chiffre de vues annuelles se limitent à quelques ébauches dans une fourchette de 7 à 9 vues

Le bouton « Random article » et le random gap

  • Les nombres de vues extrêmement faibles peuvent être le résultat d’arrivées d’utilisateurs via le bouton Random article
  • Depuis 2015, le bouton Random article est implémenté de manière à ignorer les pages d’homonymie, ce qui peut expliquer pourquoi celles-ci se concentrent parmi les plus faibles nombres de vues de l’échantillon
  • Lorsqu’un article Wikipédia est créé, il reçoit une valeur aléatoire entre 0 et 1, appelée page_random
  • Lorsqu’une requête Random article arrive, le serveur génère un nombre aléatoire entre 0 et 1 et renvoie l’article dont le page_random est le plus proche parmi ceux qui sont supérieurs à cette valeur
  • Cette méthode n’est pas parfaitement équitable
    • La probabilité qu’un article soit sélectionné est égale à la taille du random gap, c’est-à-dire l’écart entre la valeur page_random de cet article et celle de l’article immédiatement précédent
    • Plus le gap d’un article est petit, plus sa probabilité d’être sélectionné par Random article est faible

Relation entre le plancher de vues et le random gap

  • Si Wikipédia compte environ 6 millions d’articles, le random gap moyen est d’environ 1/6,000,000, soit 1.67e-7
  • Dans l’échantillon, la valeur page_random de Erygia sigillata, l’article le moins consulté, est 0.500764585777, tandis que celle de l’article immédiatement précédent, Katherine Hanley, est 0.500764582314
  • La différence entre les deux valeurs est d’environ 3e-9, soit 98 % de moins que le random gap moyen, et l’article a 50 fois moins de chances d’être sélectionné par Random article qu’un article moyen
  • Les random gaps de cinq autres articles à un chiffre de vues annuelles sont également 3e-9, 9e-9, 8e-9, 4e-9, 8e-9 et 2e-8, tous environ un ordre de grandeur inférieurs à la moyenne
  • Sur l’ensemble de l’échantillon de 32 000 articles, la relation entre random gap et nombre de vues n’est pas nette
    • Mais elle devient plus visible dans des ensembles dont l’intérêt semble faible au départ, comme les articles à moins de 200 vues annuelles ou les quelque 1 500 articles de Category:Phaegopterina stubs

Les articles les moins consultés en 2021

  • L’article le moins consulté doit non seulement porter sur un sujet suscitant peu d’intérêt du grand public, mais aussi avoir un random gap très petit
  • L’analyse a été limitée aux articles dont le gap est inférieur ou égal à 1.7e-8, soit environ 1/10 du gap moyen, afin d’examiner les 600 000 articles les « moins chanceux »
  • Même ces 600 000 articles ont tous été consultés au moins quelques fois en 2021
  • Les articles les moins consultés en 2021 sont deux ex æquo, avec 3 vues estimées comme humaines
  • Les deux articles portent sur des espèces de papillons de nuit

Motifs récurrents parmi les 500 derniers articles

  • La liste des 500 derniers articles est disponible dans Least viewed articles in 2021
  • La répartition des sujets est très cohérente
    • Une part importante concerne des espèces d’insectes ou d’autres taxons d’insectes
    • Elle inclut aussi 17 gastéropodes et un champignon, Harknessiella
    • La catégorie suivante la plus fréquente est celle des formes géographiques, avec en particulier de nombreux villages d’Iran et du Sri Lanka
    • On y trouve aussi de courts articles géographiques comme Kälberbuckel
  • Une autre catégorie récurrente est celle des articles de type set index
  • Les set index articles ressemblent à des pages d’homonymie et fonctionnent de façon similaire, mais ne sont pas classés comme pages d’homonymie par Wikipédia
  • Quelques articles rappellent aussi les anciens critères d’admissibilité plus souples de Wikipédia, comme DMZ//38 ou EuroNanoForum 2009

Pourquoi y a-t-il autant de papillons de nuit ?

  • Wikipédia applique des exigences strictes en matière de sources pour des sujets comme les personnes vivantes, les entreprises ou les groupes de musique
  • Ces sujets pouvant être détournés à des fins de promotion, d’intérêt personnel ou de conflit, une simple vérification par des sources primaires ne suffit pas à rendre un article admissible : il faut une couverture significative par plusieurs sources secondaires indépendantes
  • Les sujets qui satisfont à ces exigences ont donc de bonnes chances d’intéresser d’autres personnes que les utilisateurs de Random article, et apparaissent rarement dans les 500 derniers
  • À l’inverse, les articles sur les espèces et les articles sur les lieux habités ne sont généralement pas supprimés
    • Ils restent souvent en ligne même lorsque le sujet est faiblement sourcé
    • Beaucoup d’articles en bas de classement reposent sur une seule source, comme une base de données, un dictionnaire géographique ou une brève mention dans un livre ou une revue scientifique
  • En raison de ces critères peu stricts, certains articles ressemblent à des ébauches générées mécaniquement
    • Pottallinda est une ébauche de 12 mots qui a été consultée 5 fois en 2021
    • Elle a été créée le 18 janvier 2011 par User:Ser Amantio di Nicolao, qui a créé en moins de 60 secondes de nombreux articles similaires comme Polmalagama, Polommana, Polpitiya et Polwatta
  • Ces micro-articles impopulaires peuvent décevoir les utilisateurs de Random article, mais ils peuvent aussi servir de travail de base que d’autres contributeurs pourront développer par la suite

Données et code

  • Les données de consultation ainsi que le code de scraping et d’analyse sont disponibles dans le dépôt GitHub wiki-pageview-floor

1 commentaires

 
GN⁺ 2023-10-21
Avis sur Hacker News
  • La raison pour laquelle ce genre de choses arrive sur Wikipedia ne tient pas à la monétisation ni à des points de vue controversés, mais au fait que le critère de notoriété, fondé sur la nature et la qualité des sources citées, est ce qui sert le plus souvent à décider d’une suppression.
    Autrefois, il existait une recommandation selon laquelle une personne ayant participé à une compétition sportive de niveau international était généralement notable ; ainsi, même un footballeur n’ayant joué qu’un seul match en équipe nationale pouvait éviter la suppression avec des sources assez faibles.
    Mais cette recommandation a disparu et l’on est revenu aux critères généraux de notoriété (GNG) : pour une personne, il faut désormais une couverture biographique substantielle par des médias grand public fiables d’envergure nationale ; les comptes rendus de match, les interviews locales et les médias de fans sont en général exclus.
    Résultat : des centaines d’ébauches et des dizaines d’articles complets sur des footballeuses internationales ne remplissaient pas les GNG, même pour des championnes du monde, faute d’une couverture relativement suffisante dans les médias grand public ; et lorsqu’un éditeur a proposé massivement ces articles à la suppression cet été, après le début de la Coupe du monde féminine, presque tous ont été supprimés.
    Donc si les articles sur les papillons de nuit ou les lieux restent, ce n’est pas à cause de la monétisation ou de leur caractère polémique, mais parce que des critères de notoriété totalement différents s’appliquent aux objets et aux lieux, qui ne peuvent pas poursuivre les éditeurs de Wikipedia pour diffamation.

    • Ce matin encore, en lisant l’article sur l’Interstate 94, je suis arrivé jusqu’à US Roads, le WikiProject qui le gère, et j’ai vu qu’il y a un mois ils avaient écrit une lettre ouverte annonçant qu’ils quittaient Wikipedia pour créer leur propre wiki, à cause de la douleur provoquée par la suppression d’articles au nom de critères de notoriété arbitraires.
      https://en.wikipedia.org/wiki/Wikipedia:WikiProject_U.S._Roads/Newsletter/Issues/Volume10/Issue01
    • J’ai écrit l’article sur The Mexican Runner, un personnage assez de niche, et j’ai dû un peu me battre pour convaincre les autres éditeurs qu’il était notable.
      Comme il y avait des articles de Polygon et de Kotaku, je trouvais que c’était suffisant, mais au début ça a été difficile.
      Une personne qui appuie très vite sur des boutons est-elle vraiment une personnalité notable ?
    • Y a-t-il quelqu’un qui pense vraiment que le critère des « sources grand public fiables d’envergure nationale » est appliqué de façon cohérente dans les faits ?
      J’ai l’impression qu’il existe d’innombrables articles Wikipedia sur des personnes ayant divers rôles et fonctions dans la tech, le monde universitaire, la politique locale, etc., qui ne satisferaient pas ce critère.
    • Wikipedia n’est pas une entité unique ; ici il s’agit sans doute de la Wikipedia en anglais, mais il me semble que les Wikipedias dans d’autres langues ont leurs propres exigences de notoriété, parfois assez différentes.
    • Les critères de notoriété de Wikipedia sont beaucoup trop stricts depuis très longtemps.
      Je me souviens être resté sidéré en voyant que même un webcomic assez populaire ne pouvait pas avoir d’article wiki.
  • L’une des meilleures fonctionnalités méconnues de Wikipedia, à mon avis, ce sont les boîtes de navigation repliées tout en bas de chaque article.
    Elles sont excellentes pour prendre de la hauteur sur un sujet complexe et voir où un élément s’insère dans une hiérarchie compliquée.
    Certaines ressemblent à de petites œuvres d’art qu’on aurait presque envie d’accrocher un jour au mur.
    https://imgur.com/gallery/ILp6TtA
    Je comprends pourquoi elles doivent être repliées par défaut, mais avec un userjs je les déplace en haut de page, les laisse dépliées et les utilise pour naviguer.
    Pour qu’elles ne prennent pas trop de place, j’ai réglé le zoom CSS sur 0.3.

    • C’est intéressant que tu trouves ça séduisant en tant qu’« art », mais je ne le vois pas du tout comme ça.
  • La façon de choisir un article au hasard est choquante
    Elle introduit un biais permanent dans la randomisation, et la probabilité qu’un article donné soit sélectionné ne peut qu’être fortement dépendante du chemin suivi au fil du temps
    Tirer un entier aléatoire entre 1 et N, ce n’est pas sorcier
    Je me demande même s’il n’y aurait pas une pondération intentionnelle, du genre laisser de l’espace vide avant certains articles favorisés pour qu’ils sortent plus souvent

    • C’est choquant, oui, mais ce qui l’est encore plus, c’est que le faire correctement ressemble assez à de la science des fusées
      MySQL n’est vraiment pas conçu pour choisir une ligne réellement aléatoire avec de bonnes performances
      Une approche naïve comme ORDER BY RAND() LIMIT 1 a des performances désastreuses, et LIMIT 0 OFFSET RAND() * row_count est tout aussi mauvaise
      Si l’on utilise une méthode performante comme WHERE id >= RAND() * max_id ORDER BY id LIMIT 1, on retombe sur le même problème : les trous dans les ID dus aux articles supprimés font que certains articles sont tirés plus souvent
      Il n’y a que deux bonnes solutions : tirer un ID aléatoire et réessayer s’il n’est pas valide, ou maintenir une colonne/table séparée contenant tous les articles valides sous forme de suite d’entiers consécutifs
      La première rend les performances difficiles à prévoir, car selon la rareté des ID il peut parfois falloir réessayer 20 fois ; la seconde oblige, à chaque suppression d’article, à recalculer et réécrire en moyenne la moitié de la colonne d’entiers
      Au final, pour une fonctionnalité qui tient presque du gadget, l’approche de Wikipedia est « suffisamment correcte », et recalculer les nombres aléatoires via un traitement batch quotidien/hebdomadaire ou à chaque modification d’article permettrait d’en réduire les défauts
      On peut aussi l’améliorer nettement en ne prenant pas seulement l’article le plus proche avec la méthode actuelle, mais en choisissant environ 50 articles avant et 50 après, puis en retirant au hasard parmi ces 100 articles
      C’est un bricolage complet, mais en pratique ce serait toujours très rapide
    • Que faire si l’on ne sait pas à l’avance quels articles ont été supprimés ?
      Si l’on choisit un entier aléatoire entre 1 et N, il y a une probabilité d’obtenir un mauvais résultat
      Avec le spam, il n’est pas invraisemblable qu’il y ait plus de mauvaises pages que de bonnes, et il faudra alors retirer plusieurs fois
      Je pense que le retirage est une stratégie correcte, mais il est difficile d’imaginer que tout le monde acceptera simplement de faire confiance à ces probabilités
      En pratique, si l’on crée un wiki avec 99 mauvaises pages et 1 bonne page, le bouton Article au hasard ne fonctionnera presque jamais
      On pourrait aussi tirer entre 1 et M, où M est le nombre d’articles valides, mais il reste le même problème : comment mapper ce nombre vers un véritable ID d’article
      Cette méthode peut être biaisée, mais elle a des performances en temps constant
      Personnellement, je préférerais garder tous les articles valides en mémoire et en choisir un parmi eux
      En octobre, il n’y en avait que 7 millions, et même en incluant les articles supprimés, probablement autour de 70 millions, soit un ordre de grandeur similaire au nombre total d’éléments sur HN
      Même créer un fichier par article valide sur disque, lancer find . -type f | shuf -n 1 pour en choisir un au hasard, puis mettre le résultat en cache toutes les quelques secondes ne me semblerait pas si mauvais, même si cela introduit aussi ses propres biais
    • S’ils sont allés jusque-là, c’est probablement parce que sélectionner une ligne aléatoire dans une base de données est effectivement une opération lente
      C’est une fonctionnalité purement ludique, donc ce n’est pas très grave si les poids ne sont pas identiques, et MariaDB ferait un scan complet de la table avec ORDER BY RAND() LIMIT 1
    • S’il existe une base de données d’articles avec des ID, supprimés ou non, que chaque serveur applicatif connaît la plage d’ID, et qu’on veut tirer au hasard un article non supprimé, je ferais sans doute comme ceci
      1. mettre en place un cache distant pour les articles supprimés et 2) chaque fois qu’un serveur applicatif tire un article supprimé, l’ajouter à ce cache distant
        Le cache distant serait local au datacenter, adossé à un stockage persistant, avec un TTL long
        Pendant la durée du TTL du cache, il se peut qu’un article restauré ne puisse pas être tiré, mais ce n’est pas grave
        La localité au niveau du datacenter garantit une certaine tolérance aux pannes et une faible latence, tandis que le stockage persistant réduit le problème du cache froid au redémarrage
        Le watermark maximal de la plage d’ID peut être mis à jour de façon asynchrone, et ce n’est pas grave si les nouveaux articles restent invisibles un court moment
    • J’avais pensé que les poids différents pouvaient être intentionnels, parce que cela me faisait penser au codage arithmétique
      Il s’avère que ce n’était qu’une coïncidence
      L’implémentation actuelle fait que, plus le nombre d’articles augmente, plus les poids deviennent à peu près similaires ; et comme un utilisateur individuel reçoit de toute façon un seul article au hasard, il y a de fortes chances qu’il ne se soucie pas vraiment de l’équité, donc ça se tient
  • Pouvoir trouver au même endroit des informations sur un papillon péruvien quelconque, un petit village iranien quelconque, ou des lectures dominicales de l’Angleterre victorienne, c’est vraiment formidable
    Avant Internet, ce genre de contenu n’aurait même pas valu le coût du papier pour l’imprimer ; désormais, comme le coût du stockage cloud est pratiquement proche de zéro, on obtient une information de longue traîne extrêmement précieuse
    Merci aux personnes qui contribuent à ces contenus et les maintiennent
    Au passage, ce serait vraiment chouette de pouvoir laisser sur une page une note du type « j’ai visité cette page et j’aimerais entrer en contact avec d’autres personnes intéressées par le papillon péruvien Foovius Barivius Moth »

    • J’aime vraiment Wikipedia tel qu’il est aujourd’hui, mais j’aspire à un retour à l’ancienne politique inclusionniste
      https://gwern.net/inclusionism
    • À propos du dernier ajout, j’ai toujours pensé que ce serait un projet personnel amusant d’appliquer à Wikipedia les techniques de très fort engagement utilisées par les apps de réseaux sociaux
      Par exemple, on pourrait avoir un fil vertical à la TikTok qui trouve les articles que l’utilisateur est susceptible de consulter le plus longtemps, et WikiScroll va déjà un peu dans cette direction
      On pourrait aussi ajouter une salle de chat à chaque article pour que les gens discutent, ou une fonction de DM qui ne permettrait d’envoyer que des liens Wikipedia
      L’idée de Wikipedia comme catalyseur social est vraiment fascinante
      https://wikiscroll.blankenship.io/
    • Auto-promo très éhontée concernant le dernier « Edit », mais l’extension web que j’ai créée fait exactement ça : https://webcursors.click/
      Si vous laissez une note sur une page, d’autres personnes ayant installé la même extension peuvent la voir, et avec un peu de chance, elles peuvent vous contacter
    • Je suis vraiment reconnaissant envers Wikipedia
      À mon avis, c’est ce qu’Internet a de meilleur
  • On peut démontrer mathématiquement qu’il n’y a aucun article inintéressant sur Wikipedia
    Il suffit de le démontrer par raisonnement par l’absurde
    Si l’on attribue un score d’intérêt à tous les articles, puis qu’on les trie et qu’on regarde la valeur la plus basse, il existe forcément un article le moins intéressant
    Mais le simple fait que cet article soit le plus inintéressant de tout Wikipedia le rend intéressant
    De même, j’imagine que les articles cités dans ce billet comme ayant le moins de vues ont probablement déjà perdu ce statut

    • Bien sûr, il existe aussi un article Wikipedia à ce sujet : https://en.wikipedia.org/wiki/Interesting_number_paradox
    • Je doute que cette preuve soit valide
      Elle semble supposer qu’il existe exactement un seul article le moins intéressant
      Mais il pourrait y avoir des centaines d’articles avec le même niveau d’intérêt minimal, et dans ce cas ces centaines-là devraient être considérés comme inintéressants
    • À strictement parler, l’article s’intéresse en fait aux documents les moins consultés en 2021
    • L’intérêt que confère le fait d’être l’article le moins intéressant doit être assez grand pour combler l’écart entre l’article le moins intéressant et le deuxième moins intéressant
      Il faut aussi tenir compte de l’intérêt lié au fait d’être le deuxième moins intéressant
      C’est probablement vrai, donc CQFD
    • Il faut vraiment le découvrir
      Tant que quelqu’un n’a pas trouvé l’article le moins intéressant et n’y a pas pensé, cet article n’est pas intéressant
      Les propriétés mathématiques sont éternelles et existent, que quelqu’un les observe ou non
  • Ça me fait penser à la série de Geoff Marshall sur les Least Used Stations du Network Rail britannique
    https://www.youtube.com/playlist?list=PLt4q5oaptyI9U2zddss8dm8srzuJj6nRz
    https://www.youtube.com/@geofftech2

    • Chaîne et vidéos vraiment réjouissantes, merci pour le lien
  • Les administrateurs de Wikipedia sont prompts à supprimer les articles qu’ils jugent non importants, donc j’imagine que l’article le moins consulté change assez souvent

    • L’article Carrier_IQ que j’avais écrit a été supprimé comme « non notable » pour des raisons politiques évidentes, puis recréé quelques années plus tard, une fois la bataille d’opinion autour de l’entreprise retombée
      Il y a peut-être aussi eu quelques manœuvres du côté des services de renseignement
      C’est une très bonne manière d’effacer des faits historiques gênants
      Désormais, ce n’est plus qu’une petite histoire amusante sur un rootkit, sans le moindre complot politique particulier
    • C’est vrai, mais d’après mon expérience cela s’applique davantage aux personnes qu’à certains des sujets abordés dans l’article
      Par exemple, il me semble difficile de trouver une ville, un bourg, un village ou un petit hameau américain qui n’ait pas d’article Wikipedia
      Jack Wade, en Alaska, figure sur Wikipedia alors qu’on voit à peu près 8 maisons sur Google Maps
      Je ne pense pas non plus qu’un article sur une espèce rare de papillon de nuit serait supprimé
      Cela dit, il faut bien une politique pour éviter que chaque individu sur Terre ait son article Wikipedia
      Google Maps : https://www.google.com/maps/place/Jack+Wade,+AK+99732/@64.1519419,-141.4630071,448a,35y,3.16t/data=!3m1!1e3!4m6!3m5!1s0x5149e998873be075:0x2f1a9ca47f03bf1b!8m2!3d64.1526072!4d-141.4604683!16s%2Fm%2F0480bm5?entry=ttu
      Wikipedia : https://en.wikipedia.org/wiki/Jack_Wade,_Alaska
    • L’auteur aborde effectivement ce point, et ces articles semblent peu susceptibles d’être supprimés
      Sauf peut-être en cas de dégradations provoquées par la révélation de ce statut particulier
      Pour ceux que ça intéresse, c’est peut-être un sous-produit du jeu de données utilisé par l’auteur, mais l’un des points communs des articles les moins consultés est que leur sujet appartient à des catégories qui, selon les règles de contenu de Wikipedia, ne sont généralement pas candidates à la suppression
  • L’auteur disait qu’un article sur un papillon de nuit avait peu de chances d’offrir l’occasion de pousser un point de vue controversé, mais l’historique des modifications montre qu’il y a eu, au début de l’année, un désaccord sur l’envergure de Scrobipalpula crustaria
    11–13 mm ou 10–13 mm ?
    Les gens prennent ce genre de choses très à cœur

  • Si l’on trouve et publie le nom de l’article Wikipedia le moins consulté, ses vues augmentent, et la raison même pour laquelle on l’avait trouvé disparaît

    • On dirait l’effet d’observateur
      https://en.m.wikipedia.org/wiki/Observer_effect_(physics)
    • Je ne vois pas très bien quelle était censée être la raison initiale
      Est-ce un problème ?
      Pour être juste, comme il s’agit d’une analyse du jeu de données de 2021, elle n’est évidemment pas affectée
    • La quête des hapax legomena sur Internet connaît un problème similaire, en pire
      Même si vous en trouvez un, il est détruit au moment où vous révélez son existence
      Il suffit de regarder quizzaciously
  • Même avec plus de 6 millions d’articles, 6,0e6 est un nombre qu’on peut traiter par force brute depuis des décennies
    Une recherche linéaire aurait peut-être pris moins de temps que la lecture de l’article, et presque certainement moins que sa rédaction
    Bien sûr, si l’auteur avait fait ainsi, ce n’aurait pas été aussi amusant ni aussi malin, mais le bon engineering ressemble presque toujours à ça