Pontos-chave
Extrair texto de um PDF escaneado requer OCR, ou reconhecimento óptico de caracteres: um software que analisa o formato das letras em uma imagem e as compara com caracteres, transformando a imagem plana de uma página em texto que você pode pesquisar, selecionar e editar.
Um PDF escaneado ou a foto de um documento é, para um computador, apenas uma grade de pixels. Não existe nenhum conceito subjacente de "letras" ou "palavras" no arquivo, apenas cores e formas. O software de OCR processa essa imagem em etapas. Primeiro, ele analisa o layout geral da página, identificando quais regiões são blocos de texto, quais são tabelas e quais são imagens ou espaço em branco. Depois, segmenta esses blocos de texto em linhas, depois em palavras e depois em caracteres individuais. Por fim, compara o formato de cada caractere com um modelo treinado de como as letras e os números se parecem, nas fontes e estilos com os quais foi treinado, e retorna a melhor correspondência como texto de verdade.
Esse resultado costuma ser sobreposto de volta à imagem original, combinando cada palavra reconhecida com sua posição na página. É por isso que um PDF escaneado processado com OCR ainda parece um documento escaneado, mas agora você pode selecionar e pesquisar o texto por cima dele.
Os sistemas de OCR mais antigos dependiam de comparar caracteres com uma biblioteca fixa de formatos de fonte, o que funcionava bem para texto impresso limpo e padrão, mas falhava facilmente com fontes incomuns ou escaneamentos com ruído. O OCR moderno usa modelos de aprendizado de máquina treinados com conjuntos muito grandes de imagens de texto do mundo real, o que o torna consideravelmente mais tolerante a fontes variadas, alguma distorção e diferentes tipos de documento.
Um PDF escaneado é essencialmente uma foto de uma página, sem dados de texto subjacentes, enquanto um PDF de texto armazena caracteres de verdade que podem ser selecionados, pesquisados e copiados sem precisar de OCR.
O OCR pode tentar ler escrita à mão, mas é uma tarefa separada e menos confiável do que reconhecer texto impresso, já que a escrita à mão varia muito mais entre indivíduos do que fontes padronizadas.
Caracteres visualmente parecidos, como a letra O e o dígito zero, ou a letra l e o número um, são uma fonte comum de erros de OCR, especialmente em escaneamentos de resolução mais baixa.
Isso depende do software. Algumas ferramentas de OCR processam as imagens inteiramente no dispositivo, enquanto outras enviam a imagem para um servidor para o reconhecimento, o que exige conexão durante o processamento.
Edit, scan, and convert on the go — free to start.
Convert PDF pages into JPG images by choosing the required pages, setting suitable resolution, and checking small text before export.
Combine PDFs by selecting the source files, arranging them in the correct order, removing duplicates, and exporting one verified document.
Reduce PDF size by optimizing images, removing unnecessary pages, and choosing balanced compression. Always verify small text and signatures before sharing.
Em um escaneamento limpo de texto impresso padrão em um idioma bem suportado, a precisão do OCR é muito alta, muitas vezes próxima da perfeição caractere por caractere. Em entradas degradadas, como uma foto de baixa resolução, uma página torta ou anotações manuscritas, a precisão cai visivelmente, e o resultado geralmente precisa de uma revisão manual para identificar erros antes de confiar nele.
Verifique com atenção as partes de um documento onde um erro pesa mais: números, nomes, datas e códigos de conta ou de referência. Um caractere lido incorretamente em um nome ou número de conta é muito mais custoso do que um erro de digitação em um parágrafo de texto corrido, e esses também são os detalhes que o OCR estatisticamente tem mais chance de errar, já que um dígito lido incorretamente nem sempre parece "errado" da forma como uma palavra mal escrita parece.
Reconhecer escrita à mão é um problema diferente e mais difícil do que reconhecer texto impresso. Caracteres impressos são consistentes e previsíveis; a escrita à mão varia enormemente entre pessoas e até mesmo dentro da escrita da mesma pessoa. O reconhecimento de escrita à mão melhorou com os modelos modernos de aprendizado de máquina, mas continua sendo visivelmente menos confiável do que o reconhecimento de texto impresso limpo, especialmente com letra cursiva ou escrita rápida e informal.
O texto extraído também é a base para outras tarefas com documentos, como extrair dados estruturados, como tabelas, de um relatório escaneado depois que os caracteres subjacentes foram reconhecidos.
O OCR do Smart PDF é baseado em modelos de IA que cobrem mais de 50 idiomas, convertendo páginas escaneadas e fotos em texto que você pode pesquisar, copiar e editar, com processamento tratado com criptografia de ponta a ponta para que os arquivos permaneçam vinculados apenas à sua conta.