Points clés
Extraire du texte d'un PDF scanné nécessite l'OCR, ou reconnaissance optique de caractères : un logiciel qui analyse les formes des lettres dans une image et les associe à des caractères, transformant l'image plate d'une page en texte que vous pouvez rechercher, sélectionner et modifier.
Un PDF scanné ou la photo d'un document ne sont, pour un ordinateur, qu'une grille de pixels. Il n'existe aucune notion sous-jacente de « lettres » ou de « mots » dans le fichier, seulement des couleurs et des formes. Le logiciel d'OCR traite cette image par étapes. D'abord, il analyse la mise en page générale, en identifiant les zones qui sont des blocs de texte, celles qui sont des tableaux et celles qui sont des images ou des espaces vides. Ensuite, il segmente ces blocs de texte en lignes, puis en mots, puis en caractères individuels. Enfin, il compare la forme de chaque caractère à un modèle entraîné représentant l'aspect des lettres et des chiffres, dans les polices et styles sur lesquels il a été entraîné, et produit la meilleure correspondance sous forme de texte réel.
Ce résultat est généralement superposé à l'image d'origine, chaque mot reconnu étant associé à sa position sur la page. C'est pourquoi un PDF scanné traité par OCR ressemble toujours à un document scanné, mais vous pouvez désormais sélectionner et rechercher le texte qui y est superposé.
Les anciens systèmes d'OCR reposaient sur la comparaison des caractères avec une bibliothèque fixe de formes de polices, ce qui fonctionnait bien pour du texte imprimé propre et standard, mais échouait facilement avec des polices inhabituelles ou des scans bruités. L'OCR moderne utilise des modèles d'apprentissage automatique entraînés sur de très vastes ensembles d'images de texte réel, ce qui le rend nettement plus tolérant aux polices variées, à certaines distorsions et aux différents types de documents.
Un PDF scanné est essentiellement une photo d'une page, sans données de texte sous-jacentes, tandis qu'un PDF texte stocke de véritables caractères qui peuvent être sélectionnés, recherchés et copiés sans avoir besoin d'OCR.
L'OCR peut tenter de lire l'écriture manuscrite, mais il s'agit d'une tâche distincte et moins fiable que la reconnaissance du texte imprimé, car l'écriture manuscrite varie bien plus d'un individu à l'autre que les polices standardisées.
Les caractères visuellement similaires, comme la lettre O et le chiffre zéro, ou la lettre l et le chiffre un, sont une source fréquente d'erreurs d'OCR, en particulier sur des scans à faible résolution.
Cela dépend du logiciel. Certains outils d'OCR traitent les images entièrement sur l'appareil, tandis que d'autres envoient l'image à un serveur pour la reconnaissance, ce qui nécessite une connexion pendant le traitement.
Edit, scan, and convert on the go — free to start.
Convert PDF pages into JPG images by choosing the required pages, setting suitable resolution, and checking small text before export.
Combine PDFs by selecting the source files, arranging them in the correct order, removing duplicates, and exporting one verified document.
Reduce PDF size by optimizing images, removing unnecessary pages, and choosing balanced compression. Always verify small text and signatures before sharing.
Sur un scan propre de texte imprimé standard dans une langue bien prise en charge, la précision de l'OCR est très élevée, souvent proche de la perfection caractère par caractère. Sur une entrée dégradée, comme une photo basse résolution, une page mal alignée ou des notes manuscrites, la précision baisse nettement, et le résultat nécessite généralement une relecture manuelle pour repérer les erreurs avant de s'y fier.
Contrôlez en priorité les parties d'un document où une erreur compte le plus : les chiffres, les noms, les dates et les codes de compte ou de référence. Un caractère mal lu dans un nom ou un numéro de compte coûte bien plus cher qu'une coquille dans un paragraphe de texte courant, et ce sont aussi les détails que l'OCR a statistiquement le plus de chances de mal lire, car un chiffre mal interprété ne « semble » pas toujours faux comme peut le sembler un mot mal orthographié.
Reconnaître l'écriture manuscrite est un problème différent et plus difficile que reconnaître le texte imprimé. Les caractères imprimés sont cohérents et prévisibles ; l'écriture manuscrite varie énormément d'une personne à l'autre, et même au sein de l'écriture d'une seule personne. La reconnaissance de l'écriture manuscrite s'est améliorée grâce aux modèles d'apprentissage automatique modernes, mais elle reste nettement moins fiable que la reconnaissance du texte imprimé propre, en particulier avec une écriture cursive ou rapide et informelle.
Le texte extrait constitue également la base d'autres tâches documentaires, comme l'extraction de données structurées telles que des tableaux à partir d'un rapport scanné, une fois les caractères sous-jacents reconnus.
L'OCR de Smart PDF s'appuie sur des modèles d'IA couvrant plus de 50 langues, transformant les pages scannées et les photos en texte que vous pouvez rechercher, copier et modifier, avec un traitement entièrement chiffré de bout en bout afin que les fichiers restent liés uniquement à votre compte.