Linear Book Scanner : scanner de livres automatique open source (2014)
(linearbookscanner.org)- Linear Book Scanner est un scanner de livres open source à bas coût qui automatise le changement de page et la numérisation
- Pendant que le livre se déplace d’avant en arrière sur l’appareil, le changement de page et la numérisation s’effectuent successivement
- À chaque déplacement, une aspiration sous vide transfère une page d’un côté à l’autre
- Les pages sont numérisées en passant devant deux capteurs d’imagerie
- Un logiciel dédié transforme les résultats de numérisation en PDF interrogeables, ce qui en améliore l’utilité
Une structure qui numérise en tournant les pages
- Le Linear Book Scanner a été conçu comme un scanner de livres à changement de page à bas coût
- Sa conception est publiée en open source, ce qui permet à chacun de le fabriquer lui-même
- Le livre se déplace d’avant en arrière sur la machine et, à chaque passage, le vide aspire une page pour la faire passer d’un côté à l’autre
Résultats de numérisation
- Les pages sont numérisées pendant leur passage devant deux capteurs d’imagerie
- Le logiciel génère le livre numérisé sous forme de PDF interrogeable
1 commentaires
Avis sur Hacker News
Il existe une communauté autour de ce sujet sur https://diybookscanner.org/
Il y a quelques années, j’ai créé en Java un petit outil appelé bookbuilder : après avoir tourné les pages à la main et pris des photos, il pouvait traiter automatiquement toutes les images pour produire un PDF interrogeable.
J’utilisais une bibliothèque de vision par ordinateur entièrement en Java appelée https://boofcv.org/, qui existe toujours et reste assez rapide.
Il pouvait tout automatiser : détection des contours des pages, correction de l’inclinaison, aplatissement de l’image, suppression des contours de doigts par correspondance des tons de peau, puis création d’un PDF avec une couche OCR invisible, sans intervention de l’utilisateur.
Je me souviens aussi avoir travaillé sur la détection de l’inclinaison des lignes avec une sorte d’algorithme de watershed pour améliorer l’aplatissement.
C’était un projet amusant, et je me demande si le code source existe encore quelque part. La page de téléchargement a elle aussi disparu, et à l’époque je ne pensais pas que ce genre de petit projet annexe pouvait intéresser quelqu’un, donc c’était avant que je le publie en open source.
J’ai fabriqué l’une des premières versions vues sur le site, et il y a quelques années, j’ai rencontré par hasard Jonathon Duerig et effectué pour lui des découpes au jet d’eau.
La première fois que j’ai vu le scanner de livres linéaire, j’ai eu l’impression qu’il était à l’envers. Si la structure était suspendue et pouvait se déplacer d’elle-même, on éviterait d’avoir à connaître la masse du livre ou à gérer les problèmes de frottement.
Avec un contrepoids, on pourrait maintenir une force constante, et quel que soit le livre scanné, il suffirait de déplacer une masse connue.
Je regrette de ne pas l’avoir connu avant aujourd’hui ; si je l’avais su, j’aurais sans doute pris le temps de l’apprendre et d’y contribuer. C’est peut-être encore possible, mais en le regardant maintenant, il semble déjà couvrir presque toutes les fonctionnalités dont j’ai entendu parler, et bien plus encore.
J’ai passé 30 minutes à parcourir les exemples un par un.
Il existe des scanners commerciaux similaires [1] [2] ; celui-ci utilise aussi une conception en V, mais inversée pour scanner par le dessus.
Comme c’est le scanner qui bouge et non le livre, le traitement du livre est beaucoup plus doux.
C’est très réjouissant de voir se développer une alternative open source de ce type.
[1] https://www.treventus.com
[2] https://youtu.be/SdipuAuWsEs?si=dFWRtva5gO2oM91o
Car, dans les deux cas, aucune information tarifaire n’est publiée : on vous demande seulement de remplir un formulaire de contact.
https://youtu.be/4JuoOaL11bw?si=do1qet5Kq_WErQgz&t=162
Après cela, la douceur du traitement n’a plus vraiment d’importance.
Cela peut éventuellement convenir si l’on prévoit de relier à nouveau les pages restantes pour en faire un nouveau livre.
J’aime l’idée, mais pour de la conservation ou pour des livres de valeur, je m’inquiète un peu du risque de déchirer des pages.
Dans ces cas-là, je préférerais de toute façon scanner à la main, mais j’ai souvent eu envie d’avoir un appareil de ce genre pour numériser trop de livres.
D’après l’explication de la FAQ sur la fréquence des pages déchirées :
Un bénévole tournait les pages à la main, abaissait puis relevait deux plaques de verre pour presser délicatement les pages, pendant que deux appareils DSLR montés en biais prenaient les photos.
L’ensemble n’est pas entièrement automatique, mais il se manipule facilement à la main.
https://blog.archive.org/2021/02/09/meet-eliza-zhang-book-sc...
https://www.diybookscanner.org/en/intro.html
Il faut 0 page déchirée.
Avant les ordinateurs, il n’existait pas non plus de copie électronique.
Dans ce domaine, le logiciel n’a pas encore rattrapé ce qui est possible, si bien que des gens traitent par le matériel des choses qui pourraient l’être par logiciel
Avec deux photos ou plus, ou des images stéréo — par exemple issues d’un nouvel iPhone — on pourrait estimer par triangulation une page aplatie et produire une image qui ressemble à une page découpée dans un scanner à plat
Ensuite, il suffirait de payer correctement quelqu’un en Éthiopie pour tourner les pages avec précaution, sans abîmer le livre
Comme tout chercheur le sait, les bibliothèques numériques actuelles accumulent un siècle de numérisations à la qualité douteuse
L’IA peut estimer des scans difficiles à distinguer du format original de polices vectorielles sur un écran 8K
Autrefois, à propos des guerres des polices des années 1980, j’ai été consultant sur la conversion d’anciens formats et de scans numériques en polices PostScript et TrueType
À l’époque, c’était difficile, mais quand le logiciel aura rattrapé son retard, cela sera compris comme la bonne façon de numériser du texte
La littérature scientifique a besoin de quelque chose comme ChatGPT capable de reconstituer le source LaTeX permettant de reproduire chaque page. En réalité, il faudrait vraiment un successeur de LaTeX, moins obscur, qui permette d’écrire du texte fixe et du texte fluide avec la même facilité
J’ai participé à un projet de conservation et scanné vraiment beaucoup de magazines ; en général, le fait de les poser ou non sur une vitre à plat n’avait pas grande importance. De toute façon, tourner les pages à la main prend du temps
Il existe déjà une méthode connue pour scanner très rapidement des magazines et des livres : couper la reliure au dos et mettre les pages dans un scanner automatique
Bien sûr, si l’on veut aussi conserver l’objet après numérisation, ce n’est pas applicable, puisque l’exemplaire est détruit
Au final, la meilleure façon d’automatiser la numérisation sans abîmer l’objet doit combiner une caméra au-dessus et une machine à tourner les pages. Je pense que le grand projet de numérisation de Google fonctionnait ainsi
On pourrait peut-être aussi « scanner » certains livres aux rayons X sans tourner les pages, mais j’imagine que cela créerait de nouveaux problèmes
Le problème n’est pas tant que le logiciel corrige mal les distorsions, mais plutôt qu’une fois qu’on a fait toute la préparation nécessaire pour scanner un livre, il vaut mieux utiliser un dispositif qui n’a pas besoin de correction de distorsion
On peut voir ici comment fonctionne l’aplatissement. Cette partie était prise en charge par une bibliothèque, donc il n’y avait pas besoin d’écrire de code spécifique
https://youtu.be/DPu0iJtK2sI?t=1542
Il y a aussi des fonctions pour indiquer qu’il faut tourner la page, détecter qu’elle a été tournée et prendre la photo. En arrière-plan, les photos sont aplaties, les pages sont séparées et l’OCR est effectué
Avec un peu d’habitude, on peut scanner et faire l’OCR d’un livre à raison de 1 à 5 secondes par page
https://youtu.be/DPu0iJtK2sI?t=1909
Ensuite, le livre OCRisé est enregistré et peut être lu à voix haute quand on le souhaite
https://news.ycombinator.com/item?id=29223815
Le risque de résultats plausibles mais faux suscitait déjà des inquiétudes avant l’IA
Celui-ci paraît beaucoup plus sûr
https://www.inforum.com/newsmd/ndsu-students-book-scanner-in...
http://diybookscanner.org
Ce projet tente de résoudre ce problème, mais il faudrait le faire de manière beaucoup plus douce pour ne pas endommager les livres
Une fois le scan effectué, tout le contenu est au format numérique ; je me demande donc pourquoi dérelier les livres en feuilles séparées avant de les scanner ne serait pas un modèle scalable
Est-ce pour éviter le travail supplémentaire de désassemblage ?
Scanner un livre ne donne que des images optiques. Dans le cas d’un manuscrit médiéval, par exemple, une page peut avoir été effacée puis réécrite
Si l’on se contente de scanner le livre puis de détruire l’exemplaire physique, on perd ce genre de preuve
Cela dit, pour un livre bon marché de grande diffusion, je pense que la plupart des archivistes ne se soucieraient pas beaucoup de détruire un exemplaire parmi des millions pour préserver l’œuvre
Cela ne devient un vrai problème que pour des œuvres très anciennes et très rares
Le moindre livre un peu abîmé risque de se faire déchiqueter
J’ai pas mal de vieux livres que j’aimerais numériser, mais la plupart des scanners de livres courants exigent au minimum d’ouvrir complètement le livre, ce qui peut le déchirer comme tu le dis
Et ces appareils n’incluent même pas une aspiration, un déplacement le long d’arêtes vives et des moteurs pas à pas
Si l’on regarde la deuxième question de https://linearbookscanner.org/faq/:
Cela dit, s’il y a des montagnes de livres à scanner et qu’une machine comme celle-ci peut traiter la majorité d’entre eux, en ne réservant un traitement plus soigneux qu’aux cas particuliers, c’est un gain
Google a déjà scanné à peu près tous les livres. Le problème, c’étaient le droit d’auteur et les ayants droit.
Pour tourner les pages, ils ont eu recours à de la main-d’œuvre peu payée. Si personne ne poste le lien avant moi, je l’enverrai plus tard.
De retour chez moi, je vois que c’est cet article : https://www.theatlantic.com/technology/archive/2017/04/the-t...
Ça a vraiment l’air génial. Non seulement on peut numériser des livres, mais en plus il les déchiquette gratuitement.
C’est une assez bonne offre 2-en-1.
Je suis allergique aux acariens, et quand un livre reste environ six mois sur une étagère, le simple fait de le toucher déclenche une réaction allergique.
Le dépoussiérer en surface ou passer l’aspirateur ne sert à rien.
Cet appareil pourrait servir à débarrasser les livres des acariens pour les rendre lisibles.