Puntos clave
Extraer texto de un PDF escaneado requiere OCR, o reconocimiento óptico de caracteres: un software que analiza las formas de las letras en una imagen y las compara con caracteres conocidos, convirtiendo la imagen plana de una página en texto que puedes buscar, seleccionar y editar.
Un PDF escaneado o una foto de un documento son, para un ordenador, simplemente una cuadrícula de píxeles. No existe ningún concepto subyacente de "letras" o "palabras" en el archivo, solo colores y formas. El software de OCR procesa esa imagen por etapas. Primero, analiza el diseño general de la página, identificando qué zonas son bloques de texto, cuáles son tablas y cuáles son imágenes o espacio en blanco. Después, segmenta esos bloques de texto en líneas, luego en palabras y luego en caracteres individuales. Por último, compara la forma de cada carácter con un modelo entrenado de cómo se ven las letras y los números, en las fuentes y estilos con los que ha sido entrenado, y produce como resultado la mejor coincidencia en forma de texto real.
Ese resultado suele superponerse de nuevo sobre la imagen original, haciendo coincidir cada palabra reconocida con su posición en la página. Por eso un PDF escaneado procesado con OCR sigue pareciendo un documento escaneado, pero ahora puedes seleccionar y buscar el texto que está por encima.
Los sistemas de OCR más antiguos se basaban en comparar caracteres con una biblioteca fija de formas tipográficas, lo que funcionaba bien con texto impreso limpio y estándar, pero fallaba fácilmente con fuentes poco habituales o escaneos con ruido. El OCR moderno usa modelos de aprendizaje automático entrenados con conjuntos muy grandes de imágenes de texto del mundo real, lo que lo hace considerablemente más tolerante a fuentes variadas, cierta distorsión y distintos tipos de documentos.
Un PDF escaneado es básicamente una foto de una página, sin datos de texto subyacentes, mientras que un PDF de texto almacena caracteres reales que se pueden seleccionar, buscar y copiar sin necesidad de OCR.
El OCR puede intentar leer la escritura a mano, pero es una tarea aparte y menos fiable que reconocer texto impreso, ya que la escritura a mano varía mucho más entre personas que las fuentes estandarizadas.
Los caracteres que se parecen visualmente, como la letra O y el dígito cero, o la letra l y el número uno, son una fuente común de errores de OCR, especialmente en escaneos de baja resolución.
Depende del software. Algunas herramientas de OCR procesan las imágenes completamente en el dispositivo, mientras que otras envían la imagen a un servidor para el reconocimiento, lo que requiere conexión durante el procesamiento.
Edit, scan, and convert on the go — free to start.
Convert PDF pages into JPG images by choosing the required pages, setting suitable resolution, and checking small text before export.
Combine PDFs by selecting the source files, arranging them in the correct order, removing duplicates, and exporting one verified document.
Reduce PDF size by optimizing images, removing unnecessary pages, and choosing balanced compression. Always verify small text and signatures before sharing.
En un escaneo limpio de texto impreso estándar en un idioma bien soportado, la precisión del OCR es muy alta, a menudo cercana a la perfección carácter por carácter. En entradas degradadas, como una foto de baja resolución, una página torcida o notas manuscritas, la precisión baja notablemente, y el resultado suele necesitar una revisión manual para detectar errores antes de confiar en él.
Revisa con atención las partes de un documento donde un error importa más: números, nombres, fechas y códigos de cuenta o de referencia. Un carácter mal leído en un nombre o en un número de cuenta es mucho más costoso que una errata en un párrafo de texto corrido, y también son los detalles que el OCR tiene estadísticamente más probabilidades de leer mal, ya que un dígito mal interpretado no siempre parece "incorrecto" como sí lo parece una palabra mal escrita.
Reconocer la escritura a mano es un problema distinto y más difícil que reconocer el texto impreso. Los caracteres impresos son consistentes y predecibles; la escritura a mano varía enormemente entre personas e incluso dentro de la escritura de una misma persona. El reconocimiento de escritura a mano ha mejorado con los modelos modernos de aprendizaje automático, pero sigue siendo notablemente menos fiable que el reconocimiento de texto impreso limpio, especialmente con letra cursiva o escritura rápida e informal.
El texto extraído también es la base para otras tareas con documentos, como extraer datos estructurados, como tablas, de un informe escaneado una vez que se han reconocido los caracteres subyacentes.
El OCR de Smart PDF funciona con modelos de IA que cubren más de 50 idiomas, convirtiendo páginas escaneadas y fotos en texto que puedes buscar, copiar y editar, con un procesamiento cifrado de extremo a extremo para que los archivos permanezcan vinculados únicamente a tu cuenta.