Kernpunkte
Um Text aus einem gescannten PDF zu extrahieren, ist OCR nötig â optische Zeichenerkennung: Software, die die Formen von Buchstaben in einem Bild analysiert und mit Zeichen abgleicht, wodurch aus dem flachen Bild einer Seite Text wird, den du durchsuchen, markieren und bearbeiten kannst.
Ein gescanntes PDF oder das Foto eines Dokuments ist fĂŒr einen Computer schlicht ein Raster aus Pixeln. Es gibt in der Datei kein zugrunde liegendes Konzept von âBuchstabenâ oder âWörternâ, nur Farben und Formen. OCR-Software verarbeitet dieses Bild in mehreren Schritten. ZunĂ€chst analysiert sie das allgemeine Seitenlayout und bestimmt, welche Bereiche Textblöcke, welche Tabellen und welche Bilder oder leerer Raum sind. AnschlieĂend zerlegt sie diese Textblöcke in Zeilen, dann in Wörter, dann in einzelne Zeichen. SchlieĂlich vergleicht sie die Form jedes Zeichens mit einem trainierten Modell dafĂŒr, wie Buchstaben und Zahlen aussehen â in den Schriftarten und Stilen, auf die sie trainiert wurde â, und gibt die beste Ăbereinstimmung als tatsĂ€chlichen Text aus.
Dieses Ergebnis wird meist wieder ĂŒber das Originalbild gelegt, wobei jedes erkannte Wort seiner Position auf der Seite zugeordnet wird. Deshalb sieht ein per OCR verarbeitetes gescanntes PDF weiterhin wie ein gescanntes Dokument aus, aber du kannst jetzt den darĂŒberliegenden Text markieren und durchsuchen.
Ăltere OCR-Systeme verglichen Zeichen mit einer festen Bibliothek von Schriftformen, was bei sauberem, standardmĂ€Ăig gedrucktem Text gut funktionierte, bei ungewöhnlichen Schriftarten oder verrauschten Scans jedoch leicht versagte. Moderne OCR nutzt Machine-Learning-Modelle, die mit sehr groĂen Mengen realer Textbilder trainiert wurden, wodurch sie deutlich toleranter gegenĂŒber unterschiedlichen Schriftarten, gewissen Verzerrungen und verschiedenen Dokumenttypen sind.
Ein gescanntes PDF ist im Grunde ein Foto einer Seite ohne zugrunde liegende Textdaten, wÀhrend ein Text-PDF tatsÀchliche Zeichen speichert, die ausgewÀhlt, durchsucht und kopiert werden können, ohne dass OCR nötig ist.
OCR kann versuchen, Handschrift zu lesen, aber das ist eine separate und weniger zuverlÀssige Aufgabe als die Erkennung von gedrucktem Text, da Handschrift zwischen Personen weit stÀrker variiert als standardisierte Schriftarten.
Zeichen, die visuell Àhnlich aussehen, wie der Buchstabe O und die Ziffer Null oder der Buchstabe l und die Ziffer Eins, sind eine hÀufige Fehlerquelle bei OCR, besonders bei Scans mit niedrigerer Auflösung.
Das hÀngt von der Software ab. Manche OCR-Tools verarbeiten Bilder vollstÀndig auf dem GerÀt, wÀhrend andere das Bild zur Erkennung an einen Server senden, was wÀhrend der Verarbeitung eine Verbindung erfordert.
Edit, scan, and convert on the go â free to start.
Convert PDF pages into JPG images by choosing the required pages, setting suitable resolution, and checking small text before export.
Combine PDFs by selecting the source files, arranging them in the correct order, removing duplicates, and exporting one verified document.
Reduce PDF size by optimizing images, removing unnecessary pages, and choosing balanced compression. Always verify small text and signatures before sharing.
Bei einem sauberen Scan von standardmĂ€Ăig gedrucktem Text in einer gut unterstĂŒtzten Sprache ist die OCR-Genauigkeit sehr hoch, oft nahezu perfekt auf Zeichenebene. Bei verschlechterter Eingabe, etwa einem niedrig aufgelösten Foto, einer schiefen Seite oder handschriftlichen Notizen, sinkt die Genauigkeit spĂŒrbar, und das Ergebnis braucht in der Regel eine manuelle Durchsicht, um Fehler zu erkennen, bevor man sich darauf verlĂ€sst.
PrĂŒfe gezielt die Teile eines Dokuments, bei denen ein Fehler am meisten zĂ€hlt: Zahlen, Namen, Daten sowie Konto- oder Referenznummern. Ein falsch erkanntes Zeichen in einem Namen oder einer Kontonummer ist weit teurer als ein Tippfehler in einem FlieĂtextabsatz, und genau das sind auch die Details, bei denen OCR statistisch gesehen eher Fehler macht, da eine falsch gelesene Ziffer nicht immer so âfalschâ aussieht wie ein falsch geschriebenes Wort.
Handschrift zu erkennen ist ein anderes, schwierigeres Problem als gedruckten Text zu erkennen. Gedruckte Zeichen sind konsistent und vorhersehbar; Handschrift variiert enorm zwischen verschiedenen Personen und sogar innerhalb der Schrift derselben Person. Die Handschrifterkennung hat sich mit modernen Machine-Learning-Modellen verbessert, bleibt aber deutlich weniger zuverlÀssig als die Erkennung von sauberem gedrucktem Text, besonders bei Schreibschrift oder schneller, informeller Handschrift.
Extrahierter Text ist auch die Grundlage fĂŒr andere Dokumentaufgaben, etwa das Herausziehen strukturierter Daten wie Tabellen aus einem gescannten Bericht, sobald die zugrunde liegenden Zeichen erkannt wurden.
Die OCR von Smart PDF basiert auf KI-Modellen, die mehr als 50 Sprachen abdecken, und wandelt gescannte Seiten und Fotos in Text um, den du durchsuchen, kopieren und bearbeiten kannst â die Verarbeitung erfolgt Ende-zu-Ende-verschlĂŒsselt, sodass Dateien ausschlieĂlich mit deinem Konto verknĂŒpft bleiben.