Lauréats du bounty de visualisation des ISBN à 10 k$
(annas-archive.org)- Il y a quelques mois, Anna’s Archive a annoncé une récompense de 10a0000a0$ pour la personne qui visualiserait le mieux l’espace ISBN à partir des données d’Anna’s Archive
- Cette visualisation montre les fichiers déjà archivés et ceux qui ne le sont pas encore, et inclut un jeu de données indiquant le nombre de bibliothèques possédant chaque ISBN
- Beaucoup de personnes ont participé et proposé des idées créatives. La passion et l’énergie autour de ce projet ont été impressionnantes
- L’objectif est de déterminer combien de livres existant dans le monde sont déjà archivés, et quels livres devront être priorisés à l’avenir
Visualisation de base
- Une image de moins de 300a0kb résume de manière concise le plus grand «a0catalogue de livresa0» de l’histoire de l’humanité.
- Différentes sources de données sont inclusesa0: All ISBNs, Anna’s Archive, Google Books, Internet Archive, etc.
Défi et lauréats
- Il était prévu d’attribuer un 1er prix de 6a0000a0$, un 2e prix de 3a0000a0$ et un 3e prix de 1a0000a0$. En raison du grand nombre de participations, il a été décidé d’attribuer quatre 3es prix de 500a0$ chacun.
- 1er prix 6a0000a0$: phiresky - Ses options de visualisation flexibles et son implémentation rapide et fluide se distinguent.
- 2e prix 3a0000a0$: hypha - Sa visualisation à l’échelle macro est impressionnante et elle propose une UI conviviale.
- 3e prix 500a0$ #1: maxlion - Les différentes vues sont remarquables, en particulier les vues de comparaison et par éditeur.
- 3e prix 500a0$ #2: abetusk - Excellente fonctionnalité de comparaison.
- 3e prix 500a0$ #3: conundrumer0 - Outil de visualisation impressionnant par sa flexibilité.
- 3e prix 500a0$ #4: charelf - Propose des fonctionnalités simples mais efficaces.
Idées notables
- BWV_1011: gratte-ciel pour représenter la rareté
- robingchan: statistiques en temps réel
- reguster: annotations et statistiques en temps réel
- orangereporter: vue cartographique unique et filtres
- joe.davis: superbe palette de couleurs de base et carte thermique
- timharding: bascule simple pour comparer rapidement les jeux de données
- j1618: jolies étiquettes
- immartian: barre d’échelle affichant le nombre de livres
- backrndsource: de nombreux curseurs pour comparer les jeux de données comme un DJ
Conclusion
- La première œuvre lauréate sera intégrée au site web principal, et les autres œuvres sont également à l’étude.
- Une réflexion est en cours sur la manière d’organiser le processus d’identification, de vérification et d’archivage des livres rares.
- Merci à toutes les personnes ayant participé, et merci à toutes celles qui ont montré de l’intérêt pour ce projet.
1 commentaires
Avis de Hacker News
Le projet gagnant était la visualisation dont HN avait aussi parlé récemment.
Elle est impressionnante à la fois par ses choix techniques et par son design graphique, et visualise élégamment 2 milliards de livres comme s’ils étaient sur des étagères.
Discussion HN associée : https://news.ycombinator.com/item?id=42897120
J’ai été un peu surpris que mon œuvre arrive 3e. Ils ont probablement apprécié sa simplicité et sa visualisation.
Elle est encore visible sur https://isbnviz.pages.dev
Pour être honnête, je trouve que les deux œuvres ci-dessous sont meilleures : https://bwv-1011.github.io/isbn-viewer/, https://anna.candyland.page/map-sample.html
En particulier, le projet de bwv est techniquement similaire, mais globalement bien meilleur que le mien, et plus proche de ce que j’aurais voulu créer.
Cela dit, si l’on compare ton projet et celui de bwv, je ne suis pas d’accord pour dire que bwv est techniquement supérieur sur tous les plans.
Il lui manque la fonction de comparaison, la sélection d’ISBN et la génération de liens ; bwv semble s’être concentré sur une fonction mettant en avant les livres rares, au détriment d’autres exigences qu’Anna’s Archive recherchait.
De l’extérieur, cela semblait être l’objectif principal de cette tentative.
Vraiment superbe. J’ai toutefois remarqué quelque chose d’étrange.
Quand j’ai cherché « Stubborn Attachments », le résultat est bien apparu, et il y avait plusieurs livres de Stripe Press sur la même étagère.
Parmi eux se trouve un livre de Stephanie Friedman intitulé « Zero to One Hundred », mais quand on le cherche sur Amazon, le titre affiché est différent. Comme il n’est pas encore publié, le titre n’est peut-être pas définitif, donc je peux comprendre : https://a.co/d/bQX5CNf
Ce qui est étrange, c’est qu’en cherchant le titre affiché sur l’étagère, « Zero to One Hundred », il n’apparaît pas, alors qu’il apparaît en recherchant l’ISBN, et le nom du résultat de recherche s’affiche encore avec un autre titre.
Donc le même emplacement sur l’étagère apparaît différemment selon ce que l’on a recherché. Je n’ai pas encore lu le billet de blog expliquant le fonctionnement de cette visualisation, donc je ne sais pas quelle en est la cause.
Quand on cherche l’ISBN sur le web, « Zero to One Hundred » apparaît avec la couverture de « Built to Grow », et inversement.
On trouve aussi « Experiment, Build, Scale » avec le même ISBN associé aux deux titres précédents, et c’est ce livre qui apparaît dans la visualisation.
Parmi les livres de Stephanie, il semble que seul « Experiment, Build, Scale » soit dans Google Books, tandis que WorldCat contient « Zero to One Hundred » avec la couverture de « Built to Grow ».
La plupart des librairies en ligne étant embrouillées de cette façon, cela ressemble plutôt à un problème de qualité des données en amont, et il est difficile d’en vouloir à l’outil.
Intéressant. En zoomant sur https://archive.anarchy.cool/maps/isbn.html, on voit toutes sortes de choses. Dommage qu’il ne semble pas y avoir de lien direct vers des coordonnées ou un niveau de zoom.
À l’est de la section germanophone, on trouve des éditeurs comme Hueber Verlag, avec un motif qui donne l’impression que les numéros ISBN ont été dispersés à des intervalles d’environ 1 360 000.
Je sais que les ISBN comportent une somme de contrôle, ce qui crée des cases vides entre les numéros, mais cela produit un motif répétitif avec beaucoup d’espace vide, et semble gaspiller une grande partie de la plage importante détenue par l’éditeur.
N’existe-t-il pas de règles sur la manière dont un éditeur doit attribuer les numéros ? Ce serait bien de permettre de restituer les blocs inutilisés dont on n’a plus besoin.
Je me dis aussi que si l’on publie du matériel pédagogique dans 30 langues, plusieurs « idées » peuvent venir en tête pour l’attribution des ISBN : https://de.wikipedia.org/wiki/Hueber_Verlag
Parmi les visualisations de grands jeux de données, celles qui veulent que l’utilisateur « explore » par lui-même me semblent généralement jolies, mais pas particulièrement éclairantes.
Plutôt que de transmettre un message ou un récit précis, elles invitent simplement à se promener ; ces visualisations-ci me donnent particulièrement cette impression.
S’il ne s’agit pas de modéliser un volume réellement tridimensionnel, comme en imagerie médicale ou en CAD, l’« exploration forcée » ajoutée par la 3D ne fait que masquer les intuitions.
C’est toute l’information transmise, et il n’y a pas de structure hiérarchique qui aide à faire des découvertes ou à organiser le contenu.
De plus, un même texte peut apparaître plusieurs fois sous différentes reliures, ce qui, du point de vue des ebooks, est une distinction assez insignifiante.
Le problème plus important est qu’« Anna’s Archive » n’est pas un dépôt légal de livres, mais un site pirate, et ce qu’ils montrent est une exhibition ostentatoire de l’exhaustivité du vol, ainsi que de l’absence de rémunération qui en découle.
Cela aurait été bien plus intéressant s’il s’agissait d’une interface fondée sur un système hiérarchique comme la LoC, donnant accès à des livres légaux effectivement accessibles sur https://www.gutenberg.org/, à des livres mis en ligne sur http://onlinebooks.library.upenn.edu/ ou à des livres en cours d’élaboration sur https://www.wikibooks.org/.
Dès que j’ai vu l’image tout en haut, j’ai eu le réflexe d’avoir envie de lancer un programme de défragmentation de disque
Participer a été vraiment très amusant, et félicitations à toutes les personnes impliquées
Pour les curieux, ma contribution est encore en ligne : https://d199hl4t3ts6d9.cloudfront.net/
Toute mon affection sincère à toutes les bibliothèques fantômes. Elles font vraiment un travail divin
En regardant les « étagères » de mon pays, j’ai été triste de voir autant de titres manquants
Au point d’avoir envie d’aller moi-même à la bibliothèque locale pour numériser de vieux livres épuisés et désormais introuvables
Trop de savoir est en train de disparaître
Je me demande pourquoi on ne voit pas de monde hispanophone clairement identifiable dans cette visualisation des ISBN
L’anglais occupe 2 cases, la France, l’Allemagne, le Japon, l’Union soviétique, la Chine, etc. ont de grandes zones, mais l’Espagne n’en a pas
Y a-t-il vraiment si peu de livres en espagnol ? Ou bien la distribution est-elle surtout biaisée vers le monde anglophone ?
Ayant grandi avec des bibliothèques et des librairies en espagnol, entouré de livres en espagnol, je trouve un peu étrange que notre part paraisse si petite sur cette carte du monde
Les ISBN et les titres sont extraits des jeux de données de https://annas-archive.li/datasets, qui comprennent principalement des revues et des livres en chinois, en anglais et en français
Par exemple, l’Allemagne publie 5 fois plus de livres que les Pays-Bas, et l’Espagne en publie 2 fois plus que les Pays-Bas : https://internationalpublishers.org/wp-content/uploads/2023/11/IPA-Nielsen-BookData-IPA-Full-Report-23022024.pdf
Mais dans la visualisation, l’Allemagne semble comparable aux Pays-Bas, et l’Espagne comme le Mexique ne correspondent pas bien aux libellés principaux : https://software.annas-archive.li/AnnaArchivist/annas-archive/-/issues/244#note_2913
Il y a un grand bloc qui ressemble à l’Argentine ou au Pérou, et les titres se trouvent sur les bords de ce grand bloc
Contrairement aux autres grands blocs, il n’a pas de nom au centre et reste vide ; si l’ensemble était l’Argentine, je serais un peu surpris, mais si ce bloc correspondait au monde hispanophone, ce serait assez logique
L’œuvre gagnante ressemble un peu au gestionnaire de fichiers Eagle mode, où l’on zoome pour voir les fichiers dans un répertoire, puis on continue à zoomer pour accéder aux sous-répertoires
https://eaglemode.sourceforge.net/emvideo.html