CanDoYa
ID

PDF ke Teks

Berjalan sepenuhnya di browser Anda - tanpa unggah, tanpa daftar.

Pilih PDF digital untuk mengekstrak selectable text.

Bagikan tool ini

Bagaimana cara ubah PDF ke teks?

Pakai alat PDF ke teks ini untuk mengambil selectable text yang sudah tersimpan di PDF digital, lalu salin atau unduh sebagai file TXT. Proses berjalan di browser Anda, jadi dokumen tidak diunggah. PDF hasil scan yang hanya berisi gambar butuh OCR, dan alat ini memang tidak menjalankan OCR.

Cara pakai

  1. 1Pilih PDF digital. Tarik satu PDF ke alat ini atau pilih dari perangkat Anda. Untuk hasil terbaik, pastikan kata-katanya memang bisa dipilih di viewer PDF biasa.
  2. 2Ekstrak text layer. Klik Ekstrak teks. PDF.js membaca setiap halaman secara lokal dan menampilkan progres tanpa mengirim file ke server.
  3. 3Periksa teks polosnya. Cocokkan paragraf, kolom, tabel, dan simbol dengan dokumen asli. Urutan baca PDF bisa berbeda dari urutan visual di halaman.
  4. 4Salin atau unduh. Edit hasilnya jika perlu, salin ke clipboard, atau simpan sebagai file TXT UTF-8.

Cocok untuk siapa

Alat ini memakai Mozilla PDF.js untuk membaca text layer yang sudah ada di tiap halaman di perangkat Anda. Urutan halaman dan pemenggalan baris yang terbaca dipertahankan, lalu hasilnya ditampilkan sebagai satu teks polos yang bisa diedit. Gambar, font, kolom, tabel, dan format visual tidak dipertahankan di output TXT.

Ini batas pentingnya: PDF digital menyimpan karakter yang bisa dipilih dan dicari oleh software. Hasil scan bisa saja hanya menyimpan foto halaman. Mengambil teks dari jenis pertama adalah parsing teks; membaca jenis kedua butuh optical character recognition. Alat ini hanya mengerjakan yang pertama.

Tanya jawab

Apakah file PDF saya diunggah ke server?

Tidak. Browser Anda membaca PDF yang dipilih secara lokal dengan PDF.js, dan file tidak dikirim ke CanDoYa. Kode engine PDF mungkin diunduh saat pertama kali Anda memakai alat ini, tetapi dokumen Anda tidak ikut dalam permintaan itu.

Apakah PDF ke teks ini gratis?

Ya. Anda bisa mengekstrak, mengedit, menyalin, dan mengunduh teks tanpa akun, watermark, atau pembayaran. Proses berjalan di perangkat Anda, jadi tidak ada antrean konversi di server dan tidak ada file yang harus diambil belakangan.

Berapa batas ukuran dan jumlah halaman PDF?

Alat ini menerima satu PDF sampai 100 MB dan 2.000 halaman. Memori yang tersedia dan kecepatan perangkat bisa memberi batas praktis yang lebih rendah, terutama di ponsel. Jika dokumennya terlalu besar, pecah dulu jadi PDF yang lebih kecil bila browser tidak bisa menyelesaikannya.

Bisakah alat ini mengekstrak teks dari PDF hasil scan?

Tidak jika hasil scan itu hanya berisi gambar halaman. Konverter ini membaca selectable text yang sudah ada dan tidak menjalankan OCR. PDF hasil scan membutuhkan alat OCR yang mengenali karakter dari piksel. Beberapa PDF campuran punya teks yang bisa dipilih di halaman tertentu tapi tidak di halaman lain; hasilnya akan menandai halaman tanpa teks.

Kenapa teks hasil ekstraksi urutannya salah?

Halaman PDF menempatkan fragmen teks pada koordinat tertentu dan mungkin tidak menyimpan urutan paragraf atau kolom yang jelas. PDF.js mengikuti item teks dan pemenggalan baris dari dokumen, yang bisa berbeda dari urutan baca visual pada tata letak multi-kolom, tabel, header, atau formulir kompleks.

Apakah PDF ke teks mempertahankan format dan gambar?

Tidak. File TXT hanya berisi karakter polos, jadi font, warna, gambar, tautan, kolom, dan garis tabel tidak dipertahankan. Pemenggalan baris berasal dari text layer PDF dan mungkin perlu diedit setelah ekstraksi.

Kenapa PDF yang diproteksi password ditolak?

Browser tidak bisa membaca dokumen terenkripsi tanpa password. Buka PDF di viewer tepercaya, masukkan password, lalu simpan salinan tanpa kunci jika Anda memang berwenang. Setelah itu tambahkan salinan itu ke konverter.

Bahasa apa saja yang bisa diekstrak dari PDF?

Parser-nya tidak terikat ke satu bahasa. Alat ini bisa mengembalikan teks Unicode dalam skrip apa pun selama PDF punya character map yang benar dan selectable text. Jika dokumen memakai pemetaan font yang hilang atau khusus, karakter hasil salin tetap bisa tidak lengkap atau salah.