OCR

Définition et enjeux

Portrait de Cicéron Cicéron,  Œuvres complètes

“ J'étais content de moi, ayant trouvé sur Internet Archive un fac-simile de 1884 avec un OCR d'excellente qualité. Le temps de le charger et de créer le Livre: , une bonne volonté avait splitté dessus le texte existant (l'édition de Classiques des sciences sociales 1967, quelque peu massacrée par le contributeur et sans les notes de bas de page) , rendant l'OCR inaccessible. J'ai fini le travail en copiant-collant les notes depuis le "texte intégral", et en corrigeant le reste. Personnellement, je crois qu'il n'est pas nécessaire d'entourer l'affaire d'un nuage de modèles. ”
Source : Wikisource

Scriptorium/Septembre 2011

“ OCR automatisé Bonjour, je suis fière de vous annoncer une nouvelle version de mon script d’OCR : celui-ci fonctionne maintenant de cette manière : il télécharge le fichier djvu, fait l’OCR avec Tessseract, ajoute l’OCR en couche texte au djvu et envoie la nouvelle version sur commons. Il faut donc être connecté à un compte utilisateur commons et non pas wikisource. ”
Source : Wikisource

Scriptorium/Juillet 2007

“ Le problème à mon avis vient d'adapter les niveaux lorsque l'on travaille sur un texte scanné et océarisé. En effet, lorsque j'édite un texte à partir d'un OCR, le texte est complet. Il est donc de base à 50%. Le formatage est assez facile à réaliser (formatage = mettre en paragraphe, mettre les apostrophes courbes, les italiques, ...) Et pourtant, le texte reste à 50%, car je me vois mal le mettre à 75% alors qu'il y a encore des erreurs d'OCR. Lorsque je corrige les erreurs d'OCR, je compare la plupart du temps ligne par ligne avec le fichier source image. ”
Source : Wikisource

Chaque jour avec Kwize, l'actualité mise en perspective par la littérature