Points clés
Extraire un tableau d'un PDF vers Excel nécessite un logiciel capable de détecter les lignes et colonnes du tableau à partir d'indices visuels, comme les lignes, l'espacement et l'alignement, plutôt qu'en lisant une grille enregistrée, puisque les PDF n'enregistrent pas les tableaux comme des données structurées de la façon dont le font les tableurs.
Un PDF stocke la position absolue de chaque portion de texte et de chaque ligne sur la page. Il n'a aucune notion de « ceci est un tableau avec ces lignes et ces colonnes », contrairement à un fichier tableur natif ou à un objet tableau de Word. Extraire un tableau d'un PDF revient à reconstituer cette structure par rétro-ingénierie, uniquement à partir de la disposition visuelle des éléments : en détectant les lignes horizontales et verticales, ou en remarquant des espaces blancs constants qui indiquent où une colonne se termine et où la suivante commence. Si le PDF source est un scan plutôt que du texte réel, il n'y a encore aucun texte avec lequel travailler, et il faut d'abord l'OCR avant que la détection de structure puisse même commencer.
Edit, scan, and convert on the go — free to start.
Convert PDF pages into JPG images by choosing the required pages, setting suitable resolution, and checking small text before export.
Combine PDFs by selecting the source files, arranging them in the correct order, removing duplicates, and exporting one verified document.
Reduce PDF size by optimizing images, removing unnecessary pages, and choosing balanced compression. Always verify small text and signatures before sharing.
La plupart des outils fonctionnent en plusieurs étapes. D'abord, l'analyse de mise en page parcourt la page à la recherche de lignes droites marquant les bordures du tableau. Là où les lignes manquent, l'outil se rabat sur la recherche de motifs semblables à des colonnes dans les espaces blancs et sur la façon dont le texte s'aligne sur de nombreuses lignes, afin de déduire où les colonnes commencent et se terminent. Le texte situé dans une plage verticale similaire sur la page est regroupé en une ligne. La première ligne est souvent traitée comme un en-tête si elle paraît visuellement distincte, par exemple en gras ou ombrée différemment des lignes suivantes. Les meilleurs outils produisent également une sorte de signal de confiance, indiquant effectivement quelles cellules ou colonnes sont moins certaines, afin que vous sachiez où vérifier le résultat de plus près.
Avant d'utiliser un tableau extrait pour quoi que ce soit d'important :
Si le document source est un scan, lancez d'abord un OCR de bonne qualité, car un scan flou ou mal aligné dégrade la détection des tableaux tout comme il dégrade la reconnaissance de texte simple. Sur des pages contenant plusieurs tableaux côte à côte, extraire un tableau à la fois donne généralement des résultats plus propres que d'essayer de tout capturer d'un coup. Pour un tableau que vous allez réutiliser souvent, l'extraire une fois puis nettoyer manuellement le résultat est généralement plus rapide que de répéter l'extraction à chaque légère modification du format du document source.
Pour de très petits tableaux, comptant une poignée de lignes et de colonnes, il est parfois réellement plus rapide de retaper les données que de les extraire puis de corriger les inévitables petites erreurs. Consultez PDF, Word ou Google Docs pour en savoir plus sur les cas où travailler directement dans un format modifiable a plus de sens que de convertir.
Smart PDF détecte automatiquement les tableaux dans les PDF et les extrait vers Excel en conservant la mise en forme, en traitant aussi bien les tableaux PDF natifs que les tableaux scannés grâce à son OCR intégré, afin que les états financiers, rapports et formulaires n'aient pas à être retapés à la main.
Un PDF n'a aucun marqueur explicite indiquant qu'une cellule s'étend sur plusieurs colonnes, donc le logiciel d'extraction doit déduire les cellules fusionnées à partir de l'espacement et du centrage, ce qui est l'un des points les plus courants où l'extraction échoue.
Oui, mais seulement après y avoir appliqué un OCR au préalable. Un tableau scanné est une image sans texte sous-jacent, donc les caractères doivent être reconnus avant que toute structure de lignes ou de colonnes puisse être détectée.
Les symboles monétaires, les appels de note de bas de page ou le contenu multiligne d'une cellule peuvent être mal lus comme faisant partie d'un nombre ou comme une colonne séparée, c'est pourquoi les colonnes numériques et les lignes de totaux méritent d'être vérifiées de près après l'extraction.
Commencez par vérifier le nombre de lignes et de colonnes par rapport à la source, puis concentrez-vous sur les en-têtes et les lignes de totaux, car ce sont les endroits où les erreurs d'extraction sont les plus courantes et les plus conséquentes.