Poin penting
Mengekstrak teks dari PDF hasil pindaian memerlukan OCR, atau pengenalan karakter optik: perangkat lunak yang menganalisis bentuk huruf dalam sebuah gambar dan mencocokkannya dengan karakter, mengubah gambar datar sebuah halaman menjadi teks yang bisa Anda cari, pilih, dan edit.
Bagi komputer, PDF hasil pindaian atau foto sebuah dokumen hanyalah kumpulan piksel. Tidak ada konsep dasar "huruf" atau "kata" dalam file tersebut, hanya warna dan bentuk. Perangkat lunak OCR memproses gambar itu dalam beberapa tahap. Pertama, ia menganalisis tata letak halaman secara keseluruhan, mengidentifikasi bagian mana yang berupa blok teks, mana yang berupa tabel, dan mana yang berupa gambar atau ruang kosong. Selanjutnya, ia membagi blok teks tersebut menjadi baris, lalu kata, lalu karakter individual. Terakhir, ia membandingkan bentuk setiap karakter dengan model terlatih tentang seperti apa huruf dan angka terlihat, dalam berbagai font dan gaya yang telah dilatihkan padanya, dan menghasilkan kecocokan terbaik sebagai teks sebenarnya.
Hasil tersebut biasanya dilapiskan kembali ke gambar asli, mencocokkan setiap kata yang dikenali dengan posisinya di halaman. Inilah sebabnya PDF hasil pindaian yang diproses dengan OCR masih terlihat seperti dokumen hasil pindaian, tetapi sekarang Anda bisa memilih dan mencari teks di atasnya.
Sistem OCR yang lebih lama mengandalkan pencocokan karakter dengan pustaka bentuk font yang tetap, yang bekerja dengan baik untuk teks cetak standar yang bersih tetapi mudah gagal dengan font yang tidak biasa atau pindaian yang berisik. OCR modern menggunakan model machine learning yang dilatih pada kumpulan gambar teks dunia nyata yang sangat besar, yang membuatnya jauh lebih toleran terhadap font yang beragam, distorsi tertentu, dan berbagai jenis dokumen.
PDF hasil pindaian pada dasarnya adalah foto sebuah halaman, tanpa data teks yang mendasarinya, sementara PDF teks menyimpan karakter sebenarnya yang bisa dipilih, dicari, dan disalin tanpa memerlukan OCR.
OCR bisa mencoba membaca tulisan tangan, tetapi ini adalah tugas terpisah yang kurang andal dibandingkan mengenali teks cetak, karena tulisan tangan jauh lebih bervariasi antarindividu dibandingkan font yang terstandardisasi.
Karakter yang terlihat mirip secara visual, seperti huruf O dan angka nol, atau huruf l dan angka satu, adalah sumber umum kesalahan OCR, terutama pada pindaian beresolusi rendah.
Ini tergantung pada perangkat lunaknya. Beberapa alat OCR memproses gambar sepenuhnya di perangkat, sementara yang lain mengirim gambar ke server untuk dikenali, yang memerlukan koneksi selama pemrosesan.
Edit, scan, and convert on the go โ free to start.
Convert PDF pages into JPG images by choosing the required pages, setting suitable resolution, and checking small text before export.
Combine PDFs by selecting the source files, arranging them in the correct order, removing duplicates, and exporting one verified document.
Reduce PDF size by optimizing images, removing unnecessary pages, and choosing balanced compression. Always verify small text and signatures before sharing.
Pada pindaian bersih dari teks cetak standar dalam bahasa yang didukung dengan baik, akurasi OCR sangat tinggi, sering kali mendekati sempurna pada tingkat karakter demi karakter. Pada input yang kualitasnya menurun, seperti foto beresolusi rendah, halaman yang miring, atau catatan tulisan tangan, akurasi turun secara nyata, dan hasilnya biasanya perlu diperiksa secara manual untuk menangkap kesalahan sebelum Anda mengandalkannya.
Periksa secara acak bagian-bagian dokumen di mana kesalahan paling berarti: angka, nama, tanggal, serta kode akun atau referensi. Karakter yang salah dibaca pada nama atau nomor akun jauh lebih merugikan daripada salah ketik dalam sebuah paragraf prosa, dan ini juga merupakan detail yang secara statistik lebih rentan salah dibaca oleh OCR, karena satu angka yang salah dibaca tidak selalu terlihat "salah" seperti halnya kata yang salah eja.
Mengenali tulisan tangan adalah masalah yang berbeda dan lebih sulit dibandingkan mengenali teks cetak. Karakter cetak konsisten dan bisa diprediksi; tulisan tangan sangat bervariasi antarindividu, bahkan dalam tulisan orang yang sama. Pengenalan tulisan tangan telah membaik dengan model machine learning modern, tetapi tetap jauh lebih kurang andal dibandingkan pengenalan teks cetak yang bersih, terutama dengan tulisan sambung atau tulisan tangan yang cepat dan tidak formal.
Teks yang diekstrak juga menjadi dasar bagi tugas dokumen lainnya, seperti menarik data terstruktur seperti tabel dari laporan hasil pindaian setelah karakter yang mendasarinya berhasil dikenali.
OCR Smart PDF didukung oleh model AI yang mencakup lebih dari 50 bahasa, mengonversi halaman dan foto hasil pindaian menjadi teks yang bisa Anda cari, salin, dan edit, dengan pemrosesan yang dienkripsi end-to-end sehingga file tetap hanya terkait dengan akun Anda.