Pontos-chave
Extrair uma tabela de um PDF para o Excel requer um software que detecte as linhas e colunas da tabela a partir de pistas visuais, como linhas, espaçamento e alinhamento, em vez de ler uma grade armazenada, já que os PDFs não salvam tabelas como dados estruturados da forma como as planilhas fazem.
Um PDF armazena a posição absoluta de cada trecho de texto e de cada linha na página. Ele não tem o conceito de "isto é uma tabela com estas linhas e estas colunas" da forma como um arquivo de planilha nativo ou um objeto de tabela do Word têm. Extrair uma tabela de um PDF significa fazer engenharia reversa dessa estrutura unicamente a partir de como as coisas estão dispostas visualmente: detectando linhas horizontais e verticais, ou percebendo espaços em branco consistentes que indicam onde uma coluna termina e a próxima começa. Se o PDF de origem for um escaneamento em vez de texto real, ainda não há nenhum texto para trabalhar, e é necessário OCR antes que a detecção de estrutura possa sequer começar.
A maioria das ferramentas funciona em algumas etapas. Primeiro, a análise de layout examina a página em busca de linhas retas que marquem as bordas da tabela. Onde faltam linhas, ela recorre a procurar padrões semelhantes a colunas em espaços em branco e em como o texto se alinha ao longo de muitas linhas, para inferir onde as colunas começam e terminam. O texto dentro de uma faixa vertical semelhante na página é agrupado em uma linha. A primeira linha é frequentemente tratada como cabeçalho se parecer visualmente diferente, por exemplo, em negrito ou sombreada de forma distinta das linhas abaixo dela. Ferramentas melhores também produzem uma espécie de sinal de confiança, sinalizando efetivamente quais células ou colunas elas têm menos certeza, para que você saiba onde vale a pena verificar o resultado com mais cuidado.
Um PDF não tem nenhum marcador explícito de que uma célula abrange várias colunas, então o software de extração precisa inferir as células mescladas a partir do espaçamento e da centralização, o que é um dos pontos mais comuns em que a extração dá errado.
Sim, mas somente depois que o OCR for executado nele primeiro. Uma tabela escaneada é uma imagem sem texto subjacente, então os caracteres precisam ser reconhecidos antes que qualquer estrutura de linhas ou colunas possa ser detectada.
Símbolos de moeda, marcadores de nota de rodapé ou conteúdo de célula em várias linhas podem ser lidos incorretamente como parte de um número ou como uma coluna separada, por isso vale a pena verificar de perto colunas numéricas e linhas de totais depois da extração.
Comece verificando o número de linhas e colunas em relação à origem, depois concentre-se em cabeçalhos e linhas de totais, já que são os pontos onde os erros de extração são mais comuns e mais relevantes.
Edit, scan, and convert on the go — free to start.
Convert PDF pages into JPG images by choosing the required pages, setting suitable resolution, and checking small text before export.
Combine PDFs by selecting the source files, arranging them in the correct order, removing duplicates, and exporting one verified document.
Reduce PDF size by optimizing images, removing unnecessary pages, and choosing balanced compression. Always verify small text and signatures before sharing.
Antes de usar uma tabela extraída para algo importante:
Se o documento de origem for um escaneamento, execute o OCR com boa qualidade primeiro, já que um escaneamento borrado ou torto degrada a detecção de tabelas da mesma forma que degrada o reconhecimento de texto simples. Em páginas com várias tabelas lado a lado, extrair uma tabela de cada vez geralmente produz resultados mais limpos do que tentar capturar tudo de uma só vez. Para uma tabela que você vai reutilizar com frequência, extraí-la uma vez e limpar o resultado manualmente costuma ser mais rápido do que repetir a extração toda vez que o formato do documento de origem muda ligeiramente.
Para tabelas muito pequenas, com poucas linhas e colunas, às vezes é genuinamente mais rápido redigitar os dados do que extraí-los e corrigir os pequenos erros inevitáveis. Veja PDF vs. Word vs. Google Docs para saber mais sobre quando trabalhar diretamente em um formato editável faz mais sentido do que converter.
O Smart PDF detecta tabelas automaticamente em PDFs e as extrai para o Excel com a formatação intacta, lidando tanto com tabelas nativas de PDF quanto com tabelas escaneadas graças ao seu OCR integrado, para que demonstrativos financeiros, relatórios e formulários não precisem ser redigitados manualmente.