À la recherche des articles les moins consultés de Wikipédia (2022)
(colinmorris.github.io)- Wikipédia abrite à la fois des articles populaires qui reçoivent des millions de vues par semaine et, parmi plus de 6 millions d’articles, des articles extrêmement impopulaires qui ne sont lus qu’un nombre de fois à un chiffre par an
- Dans un échantillon d’environ 32 000 articles en 2021, le bas du classement était largement composé de pages d’homonymie ; en les excluant, de courtes ébauches sur des espèces de papillons de nuit et de mouches, des villages iraniens ou des noms de famille plafonnaient à 7 à 9 vues par an
- Le bouton « Random article » fait varier la probabilité de sélection selon le random gap entre la valeur
page_randomde chaque article et la valeur précédente, si bien que certains articles sont beaucoup moins exposés que la moyenne - En limitant le périmètre aux 600 000 articles dont le gap est inférieur ou égal à environ 1/10 du gap moyen, les articles les moins consultés en 2021 ont été Trichromia phaeocrota et Opharus corticea, avec chacun 3 vues estimées humaines
- Parmi les 500 derniers articles figuraient beaucoup de taxons d’insectes, quelques gastéropodes et champignons, des formes géographiques et des articles de type set index ; les articles sur des espèces et des lieux habités restent souvent en ligne avec des sources faibles en raison de critères d’admissibilité peu stricts
Caractéristiques des articles impopulaires révélées par l’échantillon
- Wikipédia compte plus de 6 millions d’articles, et les articles populaires reçoivent des millions de vues par semaine
- À l’inverse, certains articles sont consultés à peine quelques fois par jour, par exemple :
- Parmi les articles créés par l’auteur, le moins populaire est Sunday reading periodical, consacré à un genre de magazines de l’époque victorienne, avec environ 12 vues par mois en moyenne
- Les données de consultation de Wikipédia sont publiques sous forme de dumps bruts et via une API, mais il n’existe pas de méthode simple pour trier directement les articles les moins consultés
Analyse d’un échantillon aléatoire de 32 000 articles
- Les données de consultation de 2021 ont été collectées sur un échantillon d’environ 32 000 articles Wikipédia
- La médiane annuelle des vues dans l’échantillon est légèrement inférieure à 1 000, tandis que la moyenne est d’environ 13 000 à cause de la longue traîne
- L’échantillon contenait près de 100 articles dont le total de vues en 2021 était à un chiffre
- Weimer Township : 3 vues
- Goleh-ye Cheshmeh : 4 vues
- Governor Terry : 4 vues
- Toutefois, les 50 derniers étaient tous des pages d’homonymie, qui ne sont pas considérées comme de « vrais articles » dans l’analyse
- En excluant les pages d’homonymie, les articles à un chiffre de vues annuelles se limitent à quelques ébauches dans une fourchette de 7 à 9 vues
- Erygia sigillata : espèce de papillon de nuit
- Hilarigona obscurata : espèce de mouche
- Loxocrambus hospition : papillon de nuit
- Makhoshin : village iranien
- Bojerud : nom de famille
- Scrobipalpula crustaria : papillon de nuit
Le bouton « Random article » et le random gap
- Les nombres de vues extrêmement faibles peuvent être le résultat d’arrivées d’utilisateurs via le bouton Random article
- Depuis 2015, le bouton Random article est implémenté de manière à ignorer les pages d’homonymie, ce qui peut expliquer pourquoi celles-ci se concentrent parmi les plus faibles nombres de vues de l’échantillon
- Lorsqu’un article Wikipédia est créé, il reçoit une valeur aléatoire entre 0 et 1, appelée
page_random - Lorsqu’une requête Random article arrive, le serveur génère un nombre aléatoire entre 0 et 1 et renvoie l’article dont le
page_randomest le plus proche parmi ceux qui sont supérieurs à cette valeur - Cette méthode n’est pas parfaitement équitable
- La probabilité qu’un article soit sélectionné est égale à la taille du random gap, c’est-à-dire l’écart entre la valeur
page_randomde cet article et celle de l’article immédiatement précédent - Plus le gap d’un article est petit, plus sa probabilité d’être sélectionné par Random article est faible
- La probabilité qu’un article soit sélectionné est égale à la taille du random gap, c’est-à-dire l’écart entre la valeur
Relation entre le plancher de vues et le random gap
- Si Wikipédia compte environ 6 millions d’articles, le random gap moyen est d’environ
1/6,000,000, soit1.67e-7 - Dans l’échantillon, la valeur
page_randomde Erygia sigillata, l’article le moins consulté, est0.500764585777, tandis que celle de l’article immédiatement précédent, Katherine Hanley, est0.500764582314 - La différence entre les deux valeurs est d’environ
3e-9, soit 98 % de moins que le random gap moyen, et l’article a 50 fois moins de chances d’être sélectionné par Random article qu’un article moyen - Les random gaps de cinq autres articles à un chiffre de vues annuelles sont également
3e-9,9e-9,8e-9,4e-9,8e-9et2e-8, tous environ un ordre de grandeur inférieurs à la moyenne - Sur l’ensemble de l’échantillon de 32 000 articles, la relation entre random gap et nombre de vues n’est pas nette
- Mais elle devient plus visible dans des ensembles dont l’intérêt semble faible au départ, comme les articles à moins de 200 vues annuelles ou les quelque 1 500 articles de Category:Phaegopterina stubs
Les articles les moins consultés en 2021
- L’article le moins consulté doit non seulement porter sur un sujet suscitant peu d’intérêt du grand public, mais aussi avoir un random gap très petit
- L’analyse a été limitée aux articles dont le gap est inférieur ou égal à
1.7e-8, soit environ 1/10 du gap moyen, afin d’examiner les 600 000 articles les « moins chanceux » - Même ces 600 000 articles ont tous été consultés au moins quelques fois en 2021
- Les articles les moins consultés en 2021 sont deux ex æquo, avec 3 vues estimées comme humaines
- Trichromia phaeocrota : random gap
4e-9 - Opharus corticea : random gap
1e-9
- Trichromia phaeocrota : random gap
- Les deux articles portent sur des espèces de papillons de nuit
Motifs récurrents parmi les 500 derniers articles
- La liste des 500 derniers articles est disponible dans Least viewed articles in 2021
- La répartition des sujets est très cohérente
- Une part importante concerne des espèces d’insectes ou d’autres taxons d’insectes
- Elle inclut aussi 17 gastéropodes et un champignon, Harknessiella
- La catégorie suivante la plus fréquente est celle des formes géographiques, avec en particulier de nombreux villages d’Iran et du Sri Lanka
- On y trouve aussi de courts articles géographiques comme Kälberbuckel
- Une autre catégorie récurrente est celle des articles de type set index
- Les set index articles ressemblent à des pages d’homonymie et fonctionnent de façon similaire, mais ne sont pas classés comme pages d’homonymie par Wikipédia
- Quelques articles rappellent aussi les anciens critères d’admissibilité plus souples de Wikipédia, comme DMZ//38 ou EuroNanoForum 2009
Pourquoi y a-t-il autant de papillons de nuit ?
- Wikipédia applique des exigences strictes en matière de sources pour des sujets comme les personnes vivantes, les entreprises ou les groupes de musique
- Ces sujets pouvant être détournés à des fins de promotion, d’intérêt personnel ou de conflit, une simple vérification par des sources primaires ne suffit pas à rendre un article admissible : il faut une couverture significative par plusieurs sources secondaires indépendantes
- Les sujets qui satisfont à ces exigences ont donc de bonnes chances d’intéresser d’autres personnes que les utilisateurs de Random article, et apparaissent rarement dans les 500 derniers
- À l’inverse, les articles sur les espèces et les articles sur les lieux habités ne sont généralement pas supprimés
- Ils restent souvent en ligne même lorsque le sujet est faiblement sourcé
- Beaucoup d’articles en bas de classement reposent sur une seule source, comme une base de données, un dictionnaire géographique ou une brève mention dans un livre ou une revue scientifique
- En raison de ces critères peu stricts, certains articles ressemblent à des ébauches générées mécaniquement
- Pottallinda est une ébauche de 12 mots qui a été consultée 5 fois en 2021
- Elle a été créée le 18 janvier 2011 par User:Ser Amantio di Nicolao, qui a créé en moins de 60 secondes de nombreux articles similaires comme Polmalagama, Polommana, Polpitiya et Polwatta
- Ces micro-articles impopulaires peuvent décevoir les utilisateurs de Random article, mais ils peuvent aussi servir de travail de base que d’autres contributeurs pourront développer par la suite
Données et code
- Les données de consultation ainsi que le code de scraping et d’analyse sont disponibles dans le dépôt GitHub wiki-pageview-floor
1 commentaires
Avis sur Hacker News
La raison pour laquelle ce genre de choses arrive sur Wikipedia ne tient pas à la monétisation ni à des points de vue controversés, mais au fait que le critère de notoriété, fondé sur la nature et la qualité des sources citées, est ce qui sert le plus souvent à décider d’une suppression.
Autrefois, il existait une recommandation selon laquelle une personne ayant participé à une compétition sportive de niveau international était généralement notable ; ainsi, même un footballeur n’ayant joué qu’un seul match en équipe nationale pouvait éviter la suppression avec des sources assez faibles.
Mais cette recommandation a disparu et l’on est revenu aux critères généraux de notoriété (GNG) : pour une personne, il faut désormais une couverture biographique substantielle par des médias grand public fiables d’envergure nationale ; les comptes rendus de match, les interviews locales et les médias de fans sont en général exclus.
Résultat : des centaines d’ébauches et des dizaines d’articles complets sur des footballeuses internationales ne remplissaient pas les GNG, même pour des championnes du monde, faute d’une couverture relativement suffisante dans les médias grand public ; et lorsqu’un éditeur a proposé massivement ces articles à la suppression cet été, après le début de la Coupe du monde féminine, presque tous ont été supprimés.
Donc si les articles sur les papillons de nuit ou les lieux restent, ce n’est pas à cause de la monétisation ou de leur caractère polémique, mais parce que des critères de notoriété totalement différents s’appliquent aux objets et aux lieux, qui ne peuvent pas poursuivre les éditeurs de Wikipedia pour diffamation.
https://en.wikipedia.org/wiki/Wikipedia:WikiProject_U.S._Roads/Newsletter/Issues/Volume10/Issue01
Comme il y avait des articles de Polygon et de Kotaku, je trouvais que c’était suffisant, mais au début ça a été difficile.
Une personne qui appuie très vite sur des boutons est-elle vraiment une personnalité notable ?
J’ai l’impression qu’il existe d’innombrables articles Wikipedia sur des personnes ayant divers rôles et fonctions dans la tech, le monde universitaire, la politique locale, etc., qui ne satisferaient pas ce critère.
Je me souviens être resté sidéré en voyant que même un webcomic assez populaire ne pouvait pas avoir d’article wiki.
L’une des meilleures fonctionnalités méconnues de Wikipedia, à mon avis, ce sont les boîtes de navigation repliées tout en bas de chaque article.
Elles sont excellentes pour prendre de la hauteur sur un sujet complexe et voir où un élément s’insère dans une hiérarchie compliquée.
Certaines ressemblent à de petites œuvres d’art qu’on aurait presque envie d’accrocher un jour au mur.
https://imgur.com/gallery/ILp6TtA
Je comprends pourquoi elles doivent être repliées par défaut, mais avec un userjs je les déplace en haut de page, les laisse dépliées et les utilise pour naviguer.
Pour qu’elles ne prennent pas trop de place, j’ai réglé le
zoomCSS sur 0.3.La façon de choisir un article au hasard est choquante
Elle introduit un biais permanent dans la randomisation, et la probabilité qu’un article donné soit sélectionné ne peut qu’être fortement dépendante du chemin suivi au fil du temps
Tirer un entier aléatoire entre 1 et N, ce n’est pas sorcier
Je me demande même s’il n’y aurait pas une pondération intentionnelle, du genre laisser de l’espace vide avant certains articles favorisés pour qu’ils sortent plus souvent
MySQL n’est vraiment pas conçu pour choisir une ligne réellement aléatoire avec de bonnes performances
Une approche naïve comme
ORDER BY RAND() LIMIT 1a des performances désastreuses, etLIMIT 0 OFFSET RAND() * row_countest tout aussi mauvaiseSi l’on utilise une méthode performante comme
WHERE id >= RAND() * max_id ORDER BY id LIMIT 1, on retombe sur le même problème : les trous dans les ID dus aux articles supprimés font que certains articles sont tirés plus souventIl n’y a que deux bonnes solutions : tirer un ID aléatoire et réessayer s’il n’est pas valide, ou maintenir une colonne/table séparée contenant tous les articles valides sous forme de suite d’entiers consécutifs
La première rend les performances difficiles à prévoir, car selon la rareté des ID il peut parfois falloir réessayer 20 fois ; la seconde oblige, à chaque suppression d’article, à recalculer et réécrire en moyenne la moitié de la colonne d’entiers
Au final, pour une fonctionnalité qui tient presque du gadget, l’approche de Wikipedia est « suffisamment correcte », et recalculer les nombres aléatoires via un traitement batch quotidien/hebdomadaire ou à chaque modification d’article permettrait d’en réduire les défauts
On peut aussi l’améliorer nettement en ne prenant pas seulement l’article le plus proche avec la méthode actuelle, mais en choisissant environ 50 articles avant et 50 après, puis en retirant au hasard parmi ces 100 articles
C’est un bricolage complet, mais en pratique ce serait toujours très rapide
Si l’on choisit un entier aléatoire entre 1 et N, il y a une probabilité d’obtenir un mauvais résultat
Avec le spam, il n’est pas invraisemblable qu’il y ait plus de mauvaises pages que de bonnes, et il faudra alors retirer plusieurs fois
Je pense que le retirage est une stratégie correcte, mais il est difficile d’imaginer que tout le monde acceptera simplement de faire confiance à ces probabilités
En pratique, si l’on crée un wiki avec 99 mauvaises pages et 1 bonne page, le bouton Article au hasard ne fonctionnera presque jamais
On pourrait aussi tirer entre 1 et M, où M est le nombre d’articles valides, mais il reste le même problème : comment mapper ce nombre vers un véritable ID d’article
Cette méthode peut être biaisée, mais elle a des performances en temps constant
Personnellement, je préférerais garder tous les articles valides en mémoire et en choisir un parmi eux
En octobre, il n’y en avait que 7 millions, et même en incluant les articles supprimés, probablement autour de 70 millions, soit un ordre de grandeur similaire au nombre total d’éléments sur HN
Même créer un fichier par article valide sur disque, lancer
find . -type f | shuf -n 1pour en choisir un au hasard, puis mettre le résultat en cache toutes les quelques secondes ne me semblerait pas si mauvais, même si cela introduit aussi ses propres biaisC’est une fonctionnalité purement ludique, donc ce n’est pas très grave si les poids ne sont pas identiques, et MariaDB ferait un scan complet de la table avec
ORDER BY RAND() LIMIT 1Le cache distant serait local au datacenter, adossé à un stockage persistant, avec un TTL long
Pendant la durée du TTL du cache, il se peut qu’un article restauré ne puisse pas être tiré, mais ce n’est pas grave
La localité au niveau du datacenter garantit une certaine tolérance aux pannes et une faible latence, tandis que le stockage persistant réduit le problème du cache froid au redémarrage
Le watermark maximal de la plage d’ID peut être mis à jour de façon asynchrone, et ce n’est pas grave si les nouveaux articles restent invisibles un court moment
Il s’avère que ce n’était qu’une coïncidence
L’implémentation actuelle fait que, plus le nombre d’articles augmente, plus les poids deviennent à peu près similaires ; et comme un utilisateur individuel reçoit de toute façon un seul article au hasard, il y a de fortes chances qu’il ne se soucie pas vraiment de l’équité, donc ça se tient
Pouvoir trouver au même endroit des informations sur un papillon péruvien quelconque, un petit village iranien quelconque, ou des lectures dominicales de l’Angleterre victorienne, c’est vraiment formidable
Avant Internet, ce genre de contenu n’aurait même pas valu le coût du papier pour l’imprimer ; désormais, comme le coût du stockage cloud est pratiquement proche de zéro, on obtient une information de longue traîne extrêmement précieuse
Merci aux personnes qui contribuent à ces contenus et les maintiennent
Au passage, ce serait vraiment chouette de pouvoir laisser sur une page une note du type « j’ai visité cette page et j’aimerais entrer en contact avec d’autres personnes intéressées par le papillon péruvien Foovius Barivius Moth »
https://gwern.net/inclusionism
Par exemple, on pourrait avoir un fil vertical à la TikTok qui trouve les articles que l’utilisateur est susceptible de consulter le plus longtemps, et WikiScroll va déjà un peu dans cette direction
On pourrait aussi ajouter une salle de chat à chaque article pour que les gens discutent, ou une fonction de DM qui ne permettrait d’envoyer que des liens Wikipedia
L’idée de Wikipedia comme catalyseur social est vraiment fascinante
https://wikiscroll.blankenship.io/
Si vous laissez une note sur une page, d’autres personnes ayant installé la même extension peuvent la voir, et avec un peu de chance, elles peuvent vous contacter
À mon avis, c’est ce qu’Internet a de meilleur
On peut démontrer mathématiquement qu’il n’y a aucun article inintéressant sur Wikipedia
Il suffit de le démontrer par raisonnement par l’absurde
Si l’on attribue un score d’intérêt à tous les articles, puis qu’on les trie et qu’on regarde la valeur la plus basse, il existe forcément un article le moins intéressant
Mais le simple fait que cet article soit le plus inintéressant de tout Wikipedia le rend intéressant
De même, j’imagine que les articles cités dans ce billet comme ayant le moins de vues ont probablement déjà perdu ce statut
Elle semble supposer qu’il existe exactement un seul article le moins intéressant
Mais il pourrait y avoir des centaines d’articles avec le même niveau d’intérêt minimal, et dans ce cas ces centaines-là devraient être considérés comme inintéressants
Il faut aussi tenir compte de l’intérêt lié au fait d’être le deuxième moins intéressant
C’est probablement vrai, donc CQFD
Tant que quelqu’un n’a pas trouvé l’article le moins intéressant et n’y a pas pensé, cet article n’est pas intéressant
Les propriétés mathématiques sont éternelles et existent, que quelqu’un les observe ou non
Ça me fait penser à la série de Geoff Marshall sur les Least Used Stations du Network Rail britannique
https://www.youtube.com/playlist?list=PLt4q5oaptyI9U2zddss8dm8srzuJj6nRz
https://www.youtube.com/@geofftech2
Les administrateurs de Wikipedia sont prompts à supprimer les articles qu’ils jugent non importants, donc j’imagine que l’article le moins consulté change assez souvent
Il y a peut-être aussi eu quelques manœuvres du côté des services de renseignement
C’est une très bonne manière d’effacer des faits historiques gênants
Désormais, ce n’est plus qu’une petite histoire amusante sur un rootkit, sans le moindre complot politique particulier
Par exemple, il me semble difficile de trouver une ville, un bourg, un village ou un petit hameau américain qui n’ait pas d’article Wikipedia
Jack Wade, en Alaska, figure sur Wikipedia alors qu’on voit à peu près 8 maisons sur Google Maps
Je ne pense pas non plus qu’un article sur une espèce rare de papillon de nuit serait supprimé
Cela dit, il faut bien une politique pour éviter que chaque individu sur Terre ait son article Wikipedia
Google Maps : https://www.google.com/maps/place/Jack+Wade,+AK+99732/@64.1519419,-141.4630071,448a,35y,3.16t/data=!3m1!1e3!4m6!3m5!1s0x5149e998873be075:0x2f1a9ca47f03bf1b!8m2!3d64.1526072!4d-141.4604683!16s%2Fm%2F0480bm5?entry=ttu
Wikipedia : https://en.wikipedia.org/wiki/Jack_Wade,_Alaska
Sauf peut-être en cas de dégradations provoquées par la révélation de ce statut particulier
Pour ceux que ça intéresse, c’est peut-être un sous-produit du jeu de données utilisé par l’auteur, mais l’un des points communs des articles les moins consultés est que leur sujet appartient à des catégories qui, selon les règles de contenu de Wikipedia, ne sont généralement pas candidates à la suppression
L’auteur disait qu’un article sur un papillon de nuit avait peu de chances d’offrir l’occasion de pousser un point de vue controversé, mais l’historique des modifications montre qu’il y a eu, au début de l’année, un désaccord sur l’envergure de Scrobipalpula crustaria
11–13 mm ou 10–13 mm ?
Les gens prennent ce genre de choses très à cœur
Si l’on trouve et publie le nom de l’article Wikipedia le moins consulté, ses vues augmentent, et la raison même pour laquelle on l’avait trouvé disparaît
https://en.m.wikipedia.org/wiki/Observer_effect_(physics)
Est-ce un problème ?
Pour être juste, comme il s’agit d’une analyse du jeu de données de 2021, elle n’est évidemment pas affectée
Même si vous en trouvez un, il est détruit au moment où vous révélez son existence
Il suffit de regarder
quizzaciouslyMême avec plus de 6 millions d’articles, 6,0e6 est un nombre qu’on peut traiter par force brute depuis des décennies
Une recherche linéaire aurait peut-être pris moins de temps que la lecture de l’article, et presque certainement moins que sa rédaction
Bien sûr, si l’auteur avait fait ainsi, ce n’aurait pas été aussi amusant ni aussi malin, mais le bon engineering ressemble presque toujours à ça