Poin penting
Mengekstrak tabel dari PDF ke Excel memerlukan perangkat lunak yang mendeteksi baris dan kolom tabel dari petunjuk visual, seperti garis, jarak, dan perataan, alih-alih membaca kisi yang tersimpan, karena PDF tidak menyimpan tabel sebagai data terstruktur seperti yang dilakukan spreadsheet.
PDF menyimpan posisi absolut setiap potongan teks dan setiap garis di halaman. Ia tidak memiliki konsep "ini adalah tabel dengan baris dan kolom ini" seperti yang dimiliki file spreadsheet asli atau objek tabel Word. Mengekstrak tabel dari PDF berarti merekayasa balik struktur tersebut murni dari cara segala sesuatu disusun secara visual: mendeteksi garis horizontal dan vertikal, atau memperhatikan celah spasi kosong yang konsisten yang menunjukkan di mana satu kolom berakhir dan kolom berikutnya dimulai. Jika PDF sumber adalah hasil pindaian, bukan teks sungguhan, maka belum ada teks sama sekali untuk diolah, dan diperlukan OCR sebelum deteksi struktur apa pun bisa dimulai.
Sebagian besar alat bekerja melalui beberapa tahap. Pertama, analisis tata letak memindai halaman untuk mencari garis lurus yang menandai batas tabel. Ketika garis tidak ada, alat tersebut beralih mencari pola menyerupai kolom dalam spasi kosong dan bagaimana teks sejajar di banyak baris, untuk menyimpulkan di mana kolom dimulai dan berakhir. Teks dalam rentang vertikal yang serupa di halaman dikelompokkan menjadi satu baris. Baris pertama sering dianggap sebagai header jika terlihat berbeda secara visual, misalnya dengan huruf tebal atau bayangan berbeda dari baris-baris di bawahnya. Alat yang lebih baik juga menghasilkan semacam sinyal keyakinan, yang secara efektif menandai sel atau kolom mana yang kurang mereka yakini, sehingga Anda tahu bagian mana yang perlu diperiksa ulang.
PDF tidak memiliki penanda eksplisit bahwa sebuah sel membentang di beberapa kolom, sehingga perangkat lunak ekstraksi harus menyimpulkan sel yang digabung dari jarak dan penataan tengah, yang merupakan salah satu tempat paling umum terjadinya kesalahan ekstraksi.
Bisa, tetapi hanya setelah OCR dijalankan terlebih dahulu. Tabel hasil pindaian adalah gambar tanpa teks yang mendasarinya, sehingga karakternya perlu dikenali sebelum struktur baris atau kolom apa pun dapat dideteksi.
Simbol mata uang, penanda catatan kaki, atau konten sel multibaris bisa salah dibaca sebagai bagian dari angka atau sebagai kolom terpisah, itulah sebabnya kolom angka dan baris total layak diperiksa dengan saksama setelah ekstraksi.
Mulailah dengan memeriksa jumlah baris dan kolom terhadap sumbernya, lalu fokus pada header dan baris total, karena di situlah kesalahan ekstraksi paling umum terjadi dan paling berdampak.
Edit, scan, and convert on the go โ free to start.
Convert PDF pages into JPG images by choosing the required pages, setting suitable resolution, and checking small text before export.
Combine PDFs by selecting the source files, arranging them in the correct order, removing duplicates, and exporting one verified document.
Reduce PDF size by optimizing images, removing unnecessary pages, and choosing balanced compression. Always verify small text and signatures before sharing.
Sebelum menggunakan tabel hasil ekstraksi untuk sesuatu yang penting:
Jika dokumen sumber adalah hasil pindaian, jalankan OCR dengan kualitas baik terlebih dahulu, karena pindaian yang buram atau miring menurunkan kualitas deteksi tabel dengan cara yang sama seperti menurunkan kualitas pengenalan teks biasa. Pada halaman dengan beberapa tabel berdampingan, mengekstrak satu tabel dalam satu waktu umumnya menghasilkan hasil yang lebih bersih daripada mencoba menangkap semuanya sekaligus. Untuk tabel yang akan sering Anda gunakan kembali, mengekstraknya sekali lalu membersihkan hasilnya secara manual biasanya lebih cepat daripada mengulangi ekstraksi setiap kali format dokumen sumber sedikit berubah.
Untuk tabel yang sangat kecil, dengan beberapa baris dan kolom saja, terkadang benar-benar lebih cepat mengetik ulang datanya daripada mengekstraknya dan memperbaiki kesalahan kecil yang pasti muncul. Lihat PDF vs. Word vs. Google Docs untuk penjelasan lebih lanjut tentang kapan bekerja langsung dalam format yang bisa diedit lebih masuk akal daripada mengonversi.
Smart PDF secara otomatis mendeteksi tabel dalam PDF dan mengekstraknya ke Excel dengan format yang tetap utuh, menangani baik tabel PDF asli maupun hasil pindaian menggunakan OCR bawaannya, sehingga laporan keuangan, laporan, dan formulir tidak perlu diketik ulang secara manual.