أهم النقاط
يتطلب استخراج جدول من ملف PDF إلى إكسل برنامجًا يكشف صفوف الجدول وأعمدته من إشارات بصرية، مثل الخطوط والمسافات والمحاذاة، بدلاً من قراءة شبكة مخزّنة، لأن ملفات PDF لا تحفظ الجداول كبيانات منظمة بالطريقة التي تفعلها جداول البيانات.
يخزّن ملف PDF الموضع المطلق لكل قطعة نص وكل خط على الصفحة. وليس لديه مفهوم "هذا جدول بهذه الصفوف وهذه الأعمدة" بالطريقة التي يمتلكها ملف جدول بيانات أصلي أو كائن جدول في Word. استخراج جدول من ملف PDF يعني إعادة هندسة تلك البنية اعتمادًا فقط على كيفية ترتيب العناصر بصريًا: كشف الخطوط الأفقية والعمودية، أو ملاحظة فجوات بيضاء متسقة تشير إلى مكان انتهاء عمود وبداية التالي. وإذا كان ملف PDF المصدر عبارة عن مسح ضوئي بدلاً من نص حقيقي، فلا يوجد نص على الإطلاق للعمل عليه بعد، ويحتاج إلى تقنية التعرف الضوئي على الحروف قبل أن يتمكن أي نظام من بدء كشف البنية.
تعمل معظم الأدوات عبر عدة مراحل. أولاً، يفحص تحليل التخطيط الصفحة بحثًا عن خطوط مستقيمة تحدد حدود الجدول. وحيثما تكون الخطوط مفقودة، يعود النظام إلى البحث عن أنماط شبيهة بالأعمدة في المسافات البيضاء وكيفية محاذاة النص عبر العديد من الأسطر، لاستنتاج أين تبدأ الأعمدة وأين تنتهي. يُجمَّع النص ضمن نطاق رأسي متشابه على الصفحة في صف واحد. وغالبًا ما يُعامل الصف الأول كرأس إذا بدا مميزًا بصريًا، كأن يكون غامقًا أو مظللاً بشكل مختلف عن الصفوف التي تليه. كما تنتج الأدوات الأفضل شكلاً من إشارة الثقة، تُشير فعليًا إلى الخلايا أو الأعمدة التي تكون أقل تأكدًا منها، حتى تعرف أين تحتاج إلى مراجعة مضاعفة للنتيجة.
قبل استخدام جدول مستخرج لأي أمر مهم:
لا يحتوي ملف PDF على أي إشارة صريحة بأن خلية تمتد عبر أعمدة متعددة، لذا يتعين على برنامج الاستخراج استنتاج الخلايا المدمجة من المسافات والتوسيط، وهو أحد أكثر الأماكن شيوعًا التي يخطئ فيها الاستخراج.
نعم، لكن فقط بعد تشغيل OCR عليه أولاً. الجدول الممسوح ضوئيًا هو صورة دون نص أساسي، لذا يجب التعرف على الأحرف أولاً قبل أن يتمكن أي نظام من كشف بنية الصفوف أو الأعمدة.
يمكن قراءة رموز العملات، أو علامات الحواشي، أو محتوى الخلية متعدد الأسطر بشكل خاطئ كجزء من رقم أو كعمود منفصل، لهذا السبب تستحق الأعمدة الرقمية وصفوف الإجماليات فحصًا دقيقًا بعد الاستخراج.
ابدأ بالتحقق من عدد الصفوف والأعمدة مقارنة بالمصدر، ثم ركّز على الرؤوس وصفوف الإجماليات، لأن هذه هي الأماكن التي تكون فيها أخطاء الاستخراج الأكثر شيوعًا والأكثر تأثيرًا.
Edit, scan, and convert on the go — free to start.
Convert PDF pages into JPG images by choosing the required pages, setting suitable resolution, and checking small text before export.
Combine PDFs by selecting the source files, arranging them in the correct order, removing duplicates, and exporting one verified document.
Reduce PDF size by optimizing images, removing unnecessary pages, and choosing balanced compression. Always verify small text and signatures before sharing.
إذا كان المستند المصدر عبارة عن مسح ضوئي، شغّل OCR بجودة جيدة أولاً، لأن المسح الضوئي الضبابي أو المنحرف يضعف كشف الجداول بنفس الطريقة التي يضعف بها التعرف على النص العادي. وفي الصفحات التي تحتوي على جداول متعددة جنبًا إلى جنب، فإن استخراج جدول واحد في كل مرة ينتج عادة نتائج أنظف من محاولة التقاط كل شيء دفعة واحدة. أما بالنسبة لجدول ستعيد استخدامه كثيرًا، فإن استخراجه مرة واحدة وتنظيف النتيجة يدويًا يكون عادة أسرع من تكرار الاستخراج في كل مرة يتغير فيها تنسيق المستند المصدر قليلاً.
بالنسبة للجداول الصغيرة جدًا، التي تحتوي على عدد قليل من الصفوف والأعمدة، قد يكون إعادة كتابة البيانات فعليًا أسرع أحيانًا من استخراجها وإصلاح الأخطاء الصغيرة الحتمية. راجع PDF مقابل Word مقابل مستندات Google لمزيد من المعلومات حول متى يكون العمل مباشرة بتنسيق قابل للتعديل أكثر منطقية من التحويل.
يكتشف Smart PDF تلقائيًا الجداول في ملفات PDF ويستخرجها إلى إكسل مع الحفاظ على التنسيق سليمًا، ويتعامل مع كل من جداول PDF الأصلية والممسوحة ضوئيًا باستخدام تقنية OCR المدمجة فيه، بحيث لا تحتاج البيانات المالية والتقارير والنماذج إلى إعادة كتابتها يدويًا.