“ J'étais content de moi, ayant trouvé sur Internet Archive un fac-simile de 1884 avec un OCR d'excellente qualité. Le temps de le charger et de créer le Livre: , une bonne volonté avait splitté dessus le texte existant (l'édition de Classiques des sciences sociales 1967, quelque peu massacrée par le contributeur et sans les notes de bas de page) , rendant l'OCR inaccessible. J'ai fini le travail en copiant-collant les notes depuis le "texte intégral", et en corrigeant le reste. Personnellement, je crois qu'il n'est pas nécessaire d'entourer l'affaire d'un nuage de modèles. ”
OCR
Définition et enjeux
Citations sur “OCR”
“ OCR automatisé Bonjour, je suis fière de vous annoncer une nouvelle version de mon script d’OCR : celui-ci fonctionne maintenant de cette manière : il télécharge le fichier djvu, fait l’OCR avec Tessseract, ajoute l’OCR en couche texte au djvu et envoie la nouvelle version sur commons. Il faut donc être connecté à un compte utilisateur commons et non pas wikisource. ”
“ Le problème à mon avis vient d'adapter les niveaux lorsque l'on travaille sur un texte scanné et océarisé. En effet, lorsque j'édite un texte à partir d'un OCR, le texte est complet. Il est donc de base à 50%. Le formatage est assez facile à réaliser (formatage = mettre en paragraphe, mettre les apostrophes courbes, les italiques, ...) Et pourtant, le texte reste à 50%, car je me vois mal le mettre à 75% alors qu'il y a encore des erreurs d'OCR. Lorsque je corrige les erreurs d'OCR, je compare la plupart du temps ligne par ligne avec le fichier source image. ”
Marie Lebert, Le Projet Gutenberg (1971-2008…
“ Quand le volontaire se connecte au site, il sélectionne le livre de son choix à partir d’une liste donnée. Une page du livre choisi apparaît simultanément en deux versions: d’une part l’image scannée, d’autre part le texte issu de cette image, produit par un logiciel OCR. Le relecteur compare les deux versions et corrige les différences. Un logiciel OCR étant fiable à 99%, ceci représente une moyenne de dix erreurs à corriger par page. La page est ensuite sauvegardée. Le relecteur peut soit cesser le travail, soit opter pour la correction d’une autre page. ”
Marie Lebert, Le Projet Gutenberg (1971-2005…
“ Le Projet Gutenberg insiste régulièrement sur la nécessité de la relecture, qu'il juge essentielle. Utiliser directement des livres scannés puis convertis au format texte par un logiciel OCR, sans relecture, donne un résultat de bien moindre qualité, avec une fiabilité de 99% dans le meilleur des cas. ”
“ Les pages tranclues (ou transcluses ?) en OCR brut ou à peine corrigées ne manquent pas dans l’espace principal, avec un effet garanti de fuite du lecteur non averti, je le sais pour l’avoir expérimenté moi-même et par les retours de ceux à qui je conseillais WS. La gravité dont je parle, c'est pour l’image de WS à l’extérieur de la communauté. Trouves-tu que ça n’a pas d’importance ? Si tu ne déments pas la note de LBE, le comité allemand décide bel et bien aussi en fonction de l’intérêt du scan, ce qui justifie l’appellation de "comité de lecture". ”
Marie Lebert, Booknologie: Le livre numérique…
“ La numérisation en mode texte consiste à scanner le livre en mode image, puis à le convertir en texte grâce à un logiciel OCR (Optical Character Recognition) , avec relecture éventuelle à l'écran pour corriger le texte obtenu puisqu'un bon logiciel OCR serait fiable à 99%. La version informatique du livre ne conserve pas la présentation originale du livre ou de la page. (2) La numérisation en mode image correspond à la photographie du livre page après page, la version informatique étant le fac-similé numérique de la version imprimée. ”
“ C'est très gratifiant de faire la première correction ou l'on apporte un vrai plus par rapport à l'OCR, a contrario, repasser une page entière et ne rien avoir à corriger parce que le premier a tout fait c'est moins évident de comprendre le plus apporté. Voilà cela fait 2 difficultés... créer le modèle qui soit acceptable pour wikipedia, pouvoir pointer vers un ocr vierge d'une œuvre à chaque clic. ”
Jean Racine,
Livre:Racine - Œuvres, Didot, 1854…
“ Par exemple, User:Herisson a passé beaucoup de temps à corriger Mme Bovary, Les Misérables et le recueil Boule de Suif, en mode page. Pour cela elle a utilisé le gadget d’OCR à la demande. Ces trois livres existaient déjà en mode texte, et auraient pu être transférés avec le robot, ça lui aurait épargné beaucoup de travail. Ce ne fut pas le cas. Elle a effectué 1076 requêtes d’OCR pour ces trois seuls livres, pour ensuite corriger ces pages. C’est dommage; c’est beaucoup de temps perdu. En ce moment, Natireland est en train de corriger les Contes des Mille et Une Nuits. ”
“ Exemple de relecture sur Wikisource = les étapes de correction d'une page : Clic sur le bouton "Modifier", corriger le texte obtenu par OCR (reconnaissance automatique de caractères) , puis correction de erreurs d'OCR, passage à l'état "corrigé" et la prévisualisation et les boutons "couleurs de relecture". Pour toute question à la communauté : page Scriptorium. Finir avec cette invitation à rejoindre la communauté : « Si partants, vous pouvez essayer, et même faire : création du compte Wikipédia/Wikisource. » ”
Marie Lebert, Le Projet Gutenberg (1971-2008…
“ Il consiste ensuite à relire le contenu du fichier texte au regard de l’original (image scannée ou livre imprimé) en corrigeant les erreurs, à savoir dix erreurs par page en moyenne quand le logiciel OCR est de qualité.Le livre est relu et corrigé à deux reprises par deux personnes différentes. Les livres anciens sont parfois saisis ligne après ligne si le texte original manque de clarté. Certains volontaires préfèrent taper eux-mêmes des textes courts ou des oeuvres qu’ils aiment particulièrement. Mais les livres sont le plus souvent scannés et OCRisés, puis relus et corrigés. ”
“ Tout est dans le indistinctement, je ne pense pas qu'il soit judicieux d'automatiser à l'aveugle. La qualité de l'OCR de base est un critère essentiel. Quel avantage? Pour accéder au contenu j'ai besoin de faire un sommaire énorme. Et la transclusion d'une page non encore corrigé permet de faciliter la mise en sommaire ET donc au lecteur d'accéder au contenu qui l'intéresse. Puis ce même lecteur pourra corriger l'article et le mettre en jaune "Le texte de cette page a été corrigée et est conforme au fac-similé." Le processus de correction s'ouvre à ceux qui sont intéressé par le dictionnaire. ”
“ Lettres de Madame de Sévigné, tome 10 : moi qui connais par cœur l’orthographe de tous les noms, cela me prend quand même une heure (au moins) pour corriger cette page, avant même de formater la table des matières ; si on se reporte à l’original pour recopier chaque nom un à un on y met encore plus de temps ; or, j’entends dire de tous côtés qu’un logiciel d’OCR meilleur a été installé sur le serveur : est-ce que cela dépend d’un gadget ? Des wikisourciens compétents peuvent-ils créer ce gadget ? Il est attendu avec beaucoup d’intérêt... ”
“ Un script OCR pour pywikipedia Je me suis rédigé hier un petit script OCR pour Wikisource qui fonctionne avec pywikipedia. Il récupère le fichier djvu sur commons, fait l’ocr des pages demandés et crées les pages avec l’OCR sur Wikisource. Il permet ainsi de faire facilement l’OCR de livres qui sont déjà postés sur commons mais qui ne possède pas de couche texte. Son défaut principal est de créer les pages qu’il OCRise. Il est aussi assez lent (il télécharge l’intégralité du djvu, extrait les pages demandés en tiff puis les donnes à l’OCR) . ”
“ Je propose ce « projet » (ou quoi qu'il en sortira) , non pas par amusement, mais un peu par énervement : l'énervement de voir des textes, bien corrigés et préparés, découpés aveuglément (parfois avec un scan d'une édition différente de celle indiquée) et laissés marqués "non corrigés" comme s'ils étaient de simples ocr. Son but serait simplement de mettre ces textes en avant (je ne crois pas, hélas, que les petites fourmis soient si nombreuses que cela et que ces textes pourtant corrigés resteront très longtemps non corrigés, et tout futur utilisateur croira qu'il s'agit d'un ocr) . ”
Dictionnaire bilingue wikisourcien-français
“ Technologie permettant à un logiciel de reconnaître, dans un fichier au format d'image, de caractères alphanumériques. Le résultat peut être exploité par un logiciel de traitement de texte. Les logiciels OCR sont habituellement vendus avec les scanners. ”
Frédéric Bastiat,
Sophismes économiques
“ Si je comprend bien, c'était une bonne chose que le texte était déjà là; le bot "match" l'ancien texte avec le fac-similé, le "split", puis remplace l'OCR qui est certainement pire que l'ancien texte écrit "avant"? C'est ça? Est-ce que le match3split est juste pour les poèmes? En tous cas, je vais me caler dans mon siège et regarder un peu Zyephyrus travailler... j’apprends vraiment plus vite ainsi. ”
“ Il ne faut pas être trop gourmand et tenter d’identifier tous les caractères de façon précise ; certaines erreurs fréquentes de FineReader seront justement très faciles à corriger à l’étape 3, par des « Rechercher / Remplacer ».4 — OCR (Phase 2) : sélection des zones de textes (colonnes) Si la détection automatique des zones de texte est relativement efficace sur des ouvrages modernes ne présentant pas d’originalité de mise en page, la chose est différente pour des ouvrages du XVIIIe siècle. ”
Jules Verne,
Cinq Semaines en ballon
“ Comment utiliser un fac-similé dans Wikisource ? Vous avez maintenant importé un fac-similé avec une OCR, il vous reste, avant de passer à la relecture, à organiser l’édition, ce qui se fait dans les espaces « Livre » et « Page ».Créer l’index d’un fichier Aide détaillée : Espace « Livre » Quand le fichier DjVu est sur Commons, il peut être utilisé sur tous les projets de Wikimedia. ”
Émile Nelligan,
Émile Nelligan et son œuvre
“ Pour récupérer la couche OCR brute (sans l'intervention des utilisateurs de Wikisource) , tout dépend du résultat que vous souhaitez mais voici déjà une première approche : À partir du fichier source sur IA. Le Livre:Revue des Deux Mondes - 1829 - tome 1.djvu provient de IA (Internet Archive) accessible à cette adresse. Il est possible à partir de ce site de récupérer la couche OCR brute en cliquant sur le lien « FULL TEXT ». ”
Jean Racine,
Livre:Racine - Œuvres, Didot, 1854…
“ Pour être vraiment valables, il faudrait utiliser le même scan. Yann (d) 23 juin 2010 à 09:35 (UTC) Je suis certes d’accord avec ce que tu dis ; mais j’aimerais que nos choix ne soient pas bridés par la qualité des scans ; que si nous trouvons un livre intéressant avec un scan peu satisfaisant et pas d’autre source, ou avec d’autres sources dont le scan est bon mais la fiabilité approximative ou incertaine, que nous puissions compter aussi dans nos outils un bon logiciel d’OCR , qui permette de publier avec la qualité Wikisource des documents eux aussi de haute qualité. ”
“ J'aime bien valider en lisant un livre qui m'intéresse. Mais marquer "corrigé" des centaines de page est moins gratifiant. --Wuyouyuan - discuter 18 mars 2011 à 15:26 (UTC) Je pense qu’il faudrait réussir à inventer une signalétique harmonieuse et compréhensible qui différencierait les textes OCR brut illisibles d’une part, les textes importés et non relus par nous d’autre part ; tout en conservant le rose qui indique que le texte n’a à aucun moment été confronté ligne à ligne au texte vérifiable sur Wikisource parce que ce rose est un message intéressant les correcteurs. ”
“ Sinon, prendre le texte ( est-ce http://gallica.bnf.fr/ark:/12148/bpt6k5742939c/ ? ) et le répartir patiemment entre les 404 pages tout en faisant une première correction avant de passer le programme Split (c'est ce que je fais en ce moment sur la Bible de Sacy, à partir du "texte brut" de Google; une fois organisé, ça va vite.) Mais il y a sûrement un programme libre sur Linux qui fait l'OCR et produit un PDF ou DJVU avec couche texte. --Nyapa (d) 6 avril 2011 à 03:13 (UTC) A relire le problème, quelque chose m'échappe: Le volume 6 indiqué a une couche texte. ”
“ Après (dans 1 semaine, quand on a sélectionné 50 livres) , on les met en ligne et on commence on transmet la liste à la BNF, et on espère pouvoir commencer bientôt. [Je mets ici ce rappel pour ne pas l'oublier : il me semble qu'on leur a demandé que les OCR comportent des marques de sauts de pages repérables par les bots car ces marques nous permettront de récupérer les textes directement en face des fac-similés, est-ce un faux souvenir ? --Zyephyrus 19 juin 2009 à 14:15 (UTC) ] J'ai rien oublié ? ”
“ Merci , Bgeslin, mille fois ! --Zyephyrus (d) 6 novembre 2010 à 10:39 (UTC) Dans le même ordre d’idées : pdf2djvu convertit un fichier pdf en fichier djvu. Prérequis : il faut savoir cliquer sur le bouton pour lancer l’opération ! --Zyephyrus (d) 6 novembre 2010 à 10:46 (UTC) Le programme est dans les dépôts d’Ubuntu. Marc (d) 6 novembre 2010 à 16:44 (UTC) À mettre en forme, sur Aide:Créer un fichier DjVu/Linux. Piero (d) 14 novembre 2010 à 07:01 (UTC) Activer l'OCR Bonjour,Je voudrais activer l'OCR pour des pages de l'Encyclopédie de Diderot, par exemple la page 41 du tome 3. ”
Eugène Hatin,
Histoire politique et littéraire de la presse en France
“ Sinon si tu veux corriger toi même, il suffit de reprendre le fichier OCR de google (de faire quelques améliorations typographiques) et de coller corriger les pages une par une.Sapcal22 (d) 3 mai 2011 à 15:43 (UTC) Très bien. Actuellement je pratique le copier-coller, avec corrections des scannilles (la 2de méthode) . Pikinez (d) 3 mai 2011 à 15:54 (UTC) Merci. Pikinez (d) 3 mai 2011 à 12:47 (UTC) Split Je suis en train d'essayer de répartir un texte avec un fichier stocké dans Utilisateur:Wuyouyuan/robot. Ca ne marche pas. ”
Paul Otlet,
Traité de documentation
“ Le livre tout entier est formé d’éléments graphiques : écriture, notation, illustration. Tout ce qui touche à la langue, à l’alphabet, à l’orthographe, à la forme de l’écriture, à la disposition des textes, largeur de lignes, marges, blancs, facilite ou retarde la lecture, doit par conséquent être retenu comme facteur du progrès bibliographique. Et à côté du texte, il y a l’image. ”
auteur:Paul Otlet, Manuel de la bibliothèque publique
“ Histoire de la Bibliographie. Il y eut, dès la haute antiquité, des listes du contenu des Bibliothèques et des relations parlant des livres. Avant l’imprimerie, les ouvrages étaient désignés par les premiers mots du texte. C’est plus tard qu’on donne de l’importance au nom d’auteur ; on commence même, dans l’ordre alphabétique, par ne tenir compte que des prénoms. Lorsque paraît l’imprimerie, on voit bientôt les imprimeurs et les libraires eux-mêmes établir des catalogues dans un but mercantile. ”
Louis Emmanuel Brossard, Le Correcteur typographe
“ Les signatures de feuilles (texte et numération) se composent en petits caractères [5] , généralement de corps 6 ou 7, plus rarement de 8 ; le texte se fait en petites capitales, en lettres bas de casse, d’italique ou de romain, fort rarement en grandes capitales. 13. Une signature se place toujours en pied de page, c’est-à-dire au delà de la dimension normale de la page, que celle-ci soit constituée entièrement de texte ou qu’elle comporte une fin en blanc. ”
Louis Emmanuel Brossard, Le Correcteur typographe
“ VIII. Si l’on ne peut solliciter d’un auteur qu’il accepte toutes les modifications apportées au manuscrit par le correcteur dans un but de réglementation et d’harmonie, il est, par contre, indispensable d’exiger, de la part du correcteur de secondes, le respect de l’orthographe d’usage établie par le correcteur de premières. L’un et l’autre doivent suivre la même voie, se conformer à la même règle ; le travail de plusieurs doit avoir l’apparence d’être exécuté par un seul. ”
Jésuites et imprimeurs de Trévoux, Dictionnaire de Trévoux/6e édition…
“ Charles VI, par son édit de l’an 1410, créa deux correcteurs, pour la révision & correction des comptes. On en a depuis fort augmenté le nombre. Voyez le Guidon des financiers, & les Annotations du correcteur Gelée. L’emploi de correcteur des comptes n’étoit d’abord qu’une commission. Ensuite il a été érigé en titre d’office. Correcteur d’Imprimerie est celui qui relit & qui corrige les épreuves des livres qu’on imprime. Corrector, emendator. L’avantage d’un livre est de passer par les mains d’un bon correcteur. ”
