أهم النقاط
يتطلب استخراج النص من ملف PDF ممسوح ضوئيًا تقنية OCR، أي التعرف الضوئي على الحروف: وهو برنامج يحلل أشكال الحروف في الصورة ويطابقها مع أحرف حقيقية، محولاً صورة مسطحة للصفحة إلى نص يمكنك البحث فيه وتحديده وتعديله.
بالنسبة للحاسوب، فإن ملف PDF الممسوح ضوئيًا أو صورة المستند ليسا سوى شبكة من البكسلات. لا يوجد في الملف مفهوم أساسي لـ"الحروف" أو "الكلمات"، بل ألوان وأشكال فقط. يعالج برنامج OCR تلك الصورة على مراحل. أولاً، يحلل تخطيط الصفحة بشكل عام، محددًا أي المناطق هي كتل نصية، وأيها جداول، وأيها صور أو مساحات فارغة. بعد ذلك، يقسّم تلك الكتل النصية إلى أسطر، ثم كلمات، ثم أحرف مفردة. وأخيرًا، يقارن شكل كل حرف بنموذج مُدرَّب على شكل الحروف والأرقام، وفق الخطوط والأنماط التي دُرِّب عليها، ويُخرج أفضل تطابق كنص فعلي.
يُعاد وضع هذا النص عادة كطبقة فوق الصورة الأصلية، بحيث تتطابق كل كلمة تم التعرف عليها مع موضعها على الصفحة. لهذا السبب يبقى ملف PDF الممسوح ضوئيًا والمُعالَج بتقنية OCR يبدو وكأنه مستند ممسوح ضوئيًا، لكن يمكنك الآن تحديد النص والبحث فيه فوقه.
كانت أنظمة OCR القديمة تعتمد على مطابقة الأحرف مع مكتبة ثابتة من أشكال الخطوط، وهو ما كان يعمل جيدًا مع النصوص المطبوعة النظيفة والقياسية لكنه كان يفشل بسهولة مع الخطوط غير المألوفة أو المسح الضوئي المشوّش. أما تقنية OCR الحديثة فتستخدم نماذج تعلم آلي مدرَّبة على مجموعات كبيرة جدًا من صور النصوص الواقعية، مما يجعلها أكثر تحملاً بكثير للخطوط المتنوعة، وبعض التشوه، وأنواع المستندات المختلفة.
على مسح ضوئي نظيف لنص مطبوع قياسي بلغة مدعومة جيدًا، تكون دقة OCR عالية جدًا، وغالبًا ما تقترب من الكمال على مستوى كل حرف. أما على المُدخلات المتدهورة، مثل صورة منخفضة الدقة، أو صفحة منحرفة، أو ملاحظات مكتوبة بخط اليد، فتنخفض الدقة بشكل ملحوظ، وعادة ما تحتاج النتيجة إلى مراجعة يدوية لالتقاط الأخطاء قبل الاعتماد عليها.
ملف PDF الممسوح ضوئيًا هو في الأساس صورة للصفحة، دون أي بيانات نصية أساسية، بينما يخزّن ملف PDF النصي أحرفًا حقيقية يمكن تحديدها والبحث فيها ونسخها دون الحاجة إلى OCR.
يمكن لتقنية OCR محاولة قراءة الخط اليدوي، لكنها مهمة منفصلة وأقل موثوقية من التعرف على النص المطبوع، لأن الخط اليدوي يتفاوت بين الأفراد أكثر بكثير من الخطوط الموحدة.
الأحرف التي تبدو متشابهة بصريًا، مثل الحرف O والرقم صفر، أو الحرف l والرقم واحد، تُعد مصدرًا شائعًا لأخطاء OCR، خصوصًا في المسح الضوئي منخفض الدقة.
يعتمد ذلك على البرنامج. بعض أدوات OCR تعالج الصور بالكامل على الجهاز نفسه، بينما ترسل أدوات أخرى الصورة إلى خادم للتعرف عليها، وهو ما يتطلب اتصالاً بالإنترنت أثناء المعالجة.
Edit, scan, and convert on the go — free to start.
Convert PDF pages into JPG images by choosing the required pages, setting suitable resolution, and checking small text before export.
Combine PDFs by selecting the source files, arranging them in the correct order, removing duplicates, and exporting one verified document.
Reduce PDF size by optimizing images, removing unnecessary pages, and choosing balanced compression. Always verify small text and signatures before sharing.
راجع بشكل عشوائي الأجزاء من المستند التي يكون فيها الخطأ الأكثر أهمية: الأرقام، والأسماء، والتواريخ، وأكواد الحسابات أو المراجع. فالحرف الذي يُقرأ بشكل خاطئ في اسم أو رقم حساب أكثر تكلفة بكثير من خطأ إملائي في فقرة نثرية، وهذه أيضًا هي التفاصيل التي يُرجَّح إحصائيًا أن يخطئ فيها OCR، لأن رقمًا واحدًا مقروءًا بشكل خاطئ لا يبدو دائمًا "خاطئًا" بالطريقة التي تبدو بها كلمة مكتوبة بشكل خاطئ.
التعرف على الخط اليدوي مشكلة مختلفة وأصعب من التعرف على النص المطبوع. فالأحرف المطبوعة ثابتة ويمكن التنبؤ بها؛ أما الخط اليدوي فيتفاوت بشكل كبير بين الأشخاص، بل وحتى ضمن كتابة الشخص نفسه. تحسّن التعرف على الخط اليدوي مع نماذج التعلم الآلي الحديثة، لكنه يبقى أقل موثوقية بشكل ملحوظ من التعرف على النص المطبوع النظيف، خصوصًا مع الخط المتصل أو الكتابة السريعة وغير الرسمية.
يُعد النص المستخرج أيضًا الأساس لمهام أخرى تتعلق بالمستندات، مثل استخراج بيانات منظمة كـالجداول من تقرير ممسوح ضوئيًا بمجرد التعرف على الأحرف الأساسية.
تعمل تقنية OCR في Smart PDF بواسطة نماذج ذكاء اصطناعي تغطي أكثر من 50 لغة، وتحوّل الصفحات والصور الممسوحة ضوئيًا إلى نص يمكنك البحث فيه ونسخه وتعديله، مع معالجة مشفرة بالكامل من طرف إلى طرف بحيث تبقى الملفات مرتبطة بحسابك فقط.