CanDoYa
MS

PDF ke Teks

Berjalan sepenuhnya dalam pelayar anda - tanpa muat naik, tanpa pendaftaran.

Pilih PDF digital untuk mengekstrak teks boleh pilih.

Kongsi alat ini

Macam mana nak tukar PDF ke teks?

Gunakan penukar PDF ke teks ini untuk mengekstrak teks boleh pilih yang sudah tersimpan dalam PDF digital, kemudian salin atau muat turun sebagai fail TXT. Pemprosesan berjalan dalam pelayar anda, jadi dokumen tidak dimuat naik. PDF imbasan yang hanya mengandungi imej perlu OCR, dan alat ini tidak melakukan OCR.

Cara guna

  1. 1Pilih PDF digital. Lepaskan satu PDF ke dalam alat ini atau pilih dari peranti anda. Untuk hasil terbaik, pastikan anda boleh memilih perkataan dalam pembaca PDF biasa anda.
  2. 2Ekstrak lapisan teks. Klik Ekstrak teks. PDF.js membaca setiap halaman secara setempat dan memaparkan kemajuan tanpa menghantar fail ke pelayan.
  3. 3Semak teks biasa. Bandingkan perenggan, lajur, jadual, dan simbol dengan asal. Urutan bacaan PDF boleh berbeza daripada susunan visual halaman.
  4. 4Salin atau muat turun. Sunting hasil jika perlu, salin ke papan klip, atau simpan sebagai fail TXT UTF-8.

Untuk siapa

Penukar ini menggunakan Mozilla PDF.js untuk membaca lapisan teks sedia ada pada setiap halaman di peranti anda. Ia mengekalkan susunan halaman dan pemisahan baris yang dilaporkan, kemudian memberikan anda satu hasil teks biasa yang boleh disunting. Imej, fon, lajur, jadual, dan pemformatan visual tidak dikekalkan dalam output TXT.

Ada sempadan penting: PDF digital menyimpan aksara yang boleh dipilih dan dicari oleh perisian. Imbasan pula mungkin hanya menyimpan foto halaman. Mengekstrak jenis yang pertama ialah penghuraian teks; membaca jenis yang kedua memerlukan pengecaman aksara optik. Alat ini hanya melakukan tugas yang pertama.

Soalan lazim

Adakah fail PDF saya dimuat naik ke pelayan?

Tidak. Pelayar anda membaca PDF yang dipilih secara setempat dengan PDF.js, dan fail itu tidak dihantar ke CanDoYa. Kod enjin PDF mungkin dimuat turun apabila anda mula menggunakan alat ini, tetapi dokumen anda bukan sebahagian daripada permintaan itu.

Adakah penukar PDF ke teks ini percuma?

Ya. Anda boleh mengekstrak, menyunting, menyalin, dan memuat turun teks tanpa akaun, tera air, atau bayaran. Kerja ini berjalan pada peranti anda, jadi tiada giliran penukaran di pelayan atau fail yang dimuat naik untuk diambil kemudian.

Apakah had saiz dan halaman PDF?

Alat ini menerima satu PDF sehingga 100 MB dan 2,000 halaman. Memori yang ada dan kelajuan peranti boleh mengenakan had praktikal yang lebih rendah, terutama pada telefon. Bahagikan dokumen yang sangat besar kepada PDF yang lebih kecil jika pelayar tidak dapat menyelesaikannya.

Bolehkah alat ini mengekstrak teks daripada PDF yang diimbas?

Tidak jika imbasan itu hanya mengandungi imej halaman. Penukar ini membaca teks boleh pilih sedia ada dan tidak melakukan OCR. PDF yang diimbas memerlukan alat OCR yang mengenal aksara daripada piksel. Sesetengah PDF campuran mengandungi teks boleh pilih pada halaman tertentu tetapi bukan semua; hasil akan menandakan halaman tanpa teks.

Mengapa teks yang diekstrak tersusun dalam urutan yang salah?

Halaman PDF meletakkan fragmen teks pada koordinat dan mungkin tidak menyimpan susunan perenggan atau lajur yang jelas. PDF.js mengikuti item teks dan pemisahan baris dokumen, yang boleh berbeza daripada susunan bacaan visual dalam susun atur berbilang lajur, jadual, pengepala, atau borang yang kompleks.

Adakah PDF ke teks mengekalkan format dan imej?

Tidak. Fail TXT hanya mengandungi aksara biasa, jadi fon, warna, imej, pautan, lajur, dan sempadan jadual tidak dikekalkan. Pemisahan baris datang daripada lapisan teks PDF dan mungkin perlu disunting selepas ekstraksi.

Mengapa PDF yang dilindungi kata laluan ditolak?

Pelayar tidak boleh membaca dokumen yang disulitkan tanpa kata laluannya. Buka PDF dalam pembaca yang dipercayai, masukkan kata laluan, dan simpan salinan yang tidak berkunci jika anda mempunyai kebenaran. Kemudian tambah salinan itu ke penukar.

Bahasa apa yang boleh diekstrak daripada PDF?

Penghurai ini tidak terikat pada satu bahasa. Ia boleh mengembalikan teks Unicode dalam apa jua skrip apabila PDF mengandungi peta aksara yang betul dan teks yang boleh dipilih. Jika dokumen menggunakan pemetaan fon yang hilang atau tersuai, aksara yang disalin masih boleh tidak lengkap atau tidak tepat.