CanDoYa
TH

แปลง PDF เป็นข้อความ

ทำงานในเบราว์เซอร์ทั้งหมด ไม่ต้องอัปโหลด ไม่ต้องสมัครสมาชิก

เลือก PDF แบบดิจิทัลเพื่อดึงข้อความที่เลือกได้

แชร์เครื่องมือนี้

จะแปลง PDF เป็นข้อความได้อย่างไร

ใช้เครื่องมือนี้เพื่อดึงข้อความที่เลือกได้ซึ่งมีอยู่แล้วใน PDF แบบดิจิทัล จากนั้นคัดลอกหรือดาวน์โหลดเป็นไฟล์ TXT การประมวลผลทำงานในเบราว์เซอร์ของคุณเอง ไฟล์จึงไม่ถูกอัปโหลด ถ้าเป็น PDF สแกนที่เก็บเป็นรูปภาพล้วน ต้องใช้ OCR และเครื่องมือนี้ไม่ทำ OCR

วิธีใช้งาน

  1. 1เลือก PDF แบบดิจิทัล. ลาก PDF ไฟล์เดียวมาวางในเครื่องมือ หรือเลือกจากอุปกรณ์ของคุณ ถ้าอยากให้ได้ผลดี ควรทดสอบว่าคุณสามารถเลือกข้อความในโปรแกรมอ่าน PDF ที่ใช้อยู่ได้
  2. 2ดึง text layer. กด แปลงข้อความ จากนั้น PDF.js จะอ่านแต่ละหน้าภายในเครื่องและแสดงความคืบหน้า โดยไม่ส่งไฟล์ไปยังเซิร์ฟเวอร์
  3. 3ตรวจทานข้อความธรรมดา. เช็กย่อหน้า คอลัมน์ ตาราง และสัญลักษณ์เทียบกับต้นฉบับ ลำดับการอ่านใน PDF อาจไม่ตรงกับลำดับที่เห็นบนหน้า
  4. 4คัดลอกหรือดาวน์โหลด. แก้ไขผลลัพธ์ได้ตามต้องการ แล้วคัดลอกไปคลิปบอร์ดหรือบันทึกเป็นไฟล์ TXT แบบ UTF-8

เหมาะกับใคร

เครื่องมือนี้ใช้ Mozilla PDF.js เพื่ออ่าน text layer ที่มีอยู่แล้วในแต่ละหน้า บนอุปกรณ์ของคุณเอง โดยจะคงลำดับหน้าและบรรทัดตามที่ไฟล์รายงานไว้ แล้วแสดงผลเป็นข้อความธรรมดาแบบแก้ไขได้หนึ่งชุด รูปภาพ ฟอนต์ คอลัมน์ ตาราง และรูปแบบการจัดวางเชิงภาพจะไม่ถูกรักษาไว้ในผลลัพธ์ TXT

มีข้อจำกัดสำคัญอยู่ข้อหนึ่ง - PDF แบบดิจิทัลจะเก็บอักขระที่ซอฟต์แวร์เลือกและค้นหาได้ ส่วนไฟล์สแกนอาจเก็บเพียงภาพถ่ายของหน้าเอกสาร การดึงแบบแรกคือการแยกข้อความ ส่วนแบบหลังต้องใช้ optical character recognition หรือ OCR เครื่องมือนี้ทำได้เฉพาะงานแรกเท่านั้น

คำถามที่พบบ่อย

ไฟล์ PDF ของฉันถูกอัปโหลดไปเซิร์ฟเวอร์หรือไม่

ไม่ ไฟล์จะถูกอ่านในเบราว์เซอร์ของคุณเองด้วย PDF.js และไม่ถูกส่งออกไปยัง CanDoYa เอนจิน PDF อาจดาวน์โหลดเมื่อคุณเริ่มใช้เครื่องมือครั้งแรก แต่เอกสารของคุณไม่รวมอยู่ในคำขอนั้น

เครื่องมือแปลง PDF เป็นข้อความนี้ใช้ฟรีหรือไม่

ใช่ คุณสามารถดึง แก้ไข คัดลอก และดาวน์โหลดข้อความได้โดยไม่ต้องมีบัญชี ไม่มีลายน้ำ การประมวลผลทำงานบนอุปกรณ์ของคุณ จึงไม่มีคิวแปลงบนเซิร์ฟเวอร์หรือไฟล์ที่ต้องอัปโหลดค้างไว้

มีข้อจำกัดขนาดไฟล์หรือจำนวนหน้าหรือไม่

รองรับ PDF ไฟล์เดียว ขนาดไม่เกิน 100 MB และไม่เกิน 2,000 หน้า อย่างไรก็ตาม หน่วยความจำและความเร็วของอุปกรณ์อาจทำให้ข้อจำกัดจริงต่ำกว่านี้ โดยเฉพาะบนมือถือ ถ้าเอกสารใหญ่มาก ให้แบ่งเป็นไฟล์ย่อยก่อนลองใหม่

เครื่องมือนี้ดึงข้อความจาก PDF สแกนได้ไหม

ไม่ได้ หากการสแกนมีแต่รูปภาพของหน้าเอกสาร เครื่องมือนี้อ่านได้เฉพาะข้อความที่เลือกได้ที่มีอยู่แล้ว และไม่ทำ OCR PDF ที่สแกนมาจะต้องใช้เครื่องมือ OCR ที่รู้จำอักขระจากพิกเซล PDF แบบผสมบางไฟล์อาจมีข้อความเลือกได้เฉพาะบางหน้า ผลลัพธ์จะแจ้งหน้าที่ไม่มีข้อความไว้

ทำไมข้อความที่ดึงออกมาถึงเรียงลำดับผิด

PDF วางชิ้นส่วนข้อความตามพิกัดและอาจไม่ได้เก็บลำดับย่อหน้าหรือคอลัมน์ไว้อย่างชัดเจน PDF.js จะตามรายการ text items และบรรทัดที่เอกสารระบุ ซึ่งอาจต่างจากลำดับการอ่านจริงบนหน้า โดยเฉพาะเอกสารหลายคอลัมน์ ตาราง หัวกระดาษ หรือฟอร์มที่ซับซ้อน

PDF to text รักษารูปแบบและรูปภาพไว้ไหม

ไม่ TXT มีเฉพาะตัวอักษรธรรมดาเท่านั้น จึงไม่เก็บฟอนต์ สี รูปภาพ ลิงก์ คอลัมน์ หรือเส้นตาราง การขึ้นบรรทัดใหม่มาจาก text layer ใน PDF และอาจต้องแก้ไขหลังดึงข้อความเสร็จ

ทำไม PDF ที่ตั้งรหัสผ่านไว้ถึงถูกปฏิเสธ

เบราว์เซอร์ไม่สามารถอ่านเอกสารที่เข้ารหัสได้หากไม่มีรหัสผ่าน เปิด PDF ด้วยโปรแกรมอ่านที่เชื่อถือได้ กรอกรหัสผ่าน และบันทึกสำเนาที่ปลดล็อกแล้ว หากคุณมีสิทธิ์ จากนั้นค่อยนำสำเนานั้นเข้ามาในเครื่องมือนี้

แปลงข้อความจาก PDF ได้กับภาษาใดบ้าง

ตัว parser ไม่ได้ผูกกับภาษาใดภาษาหนึ่ง มันสามารถส่งกลับ Unicode text ในสคริปต์ใดก็ได้ ถ้า PDF มี character map ที่ถูกต้องและมี selectable text หากเอกสารใช้งาน mapping ของฟอนต์ที่หายไปหรือกำหนดเอง ตัวอักษรที่คัดลอกได้ก็อาจยังไม่ครบหรือไม่ถูกต้อง