CanDoYa
VI

PDF sang văn bản

Chạy hoàn toàn trên trình duyệt của bạn - không tải lên, không cần đăng ký.

Chọn một PDF số để trích xuất phần chữ có thể chọn.

Chia sẻ công cụ này

Làm sao để chuyển PDF sang văn bản?

Dùng công cụ PDF sang văn bản này để trích xuất phần chữ có thể chọn đã có sẵn trong PDF số, rồi sao chép hoặc tải về file TXT. Xử lý diễn ra ngay trong trình duyệt nên tài liệu không được tải lên. PDF ảnh quét chỉ chứa hình ảnh thì cần OCR, và công cụ này không thực hiện OCR.

Cách dùng

  1. 1Chọn một PDF số. Kéo thả một file PDF vào công cụ hoặc chọn từ thiết bị của bạn. Để có kết quả tốt nhất, hãy kiểm tra xem bạn có chọn được chữ trong trình xem PDF thường dùng hay không.
  2. 2Trích xuất lớp văn bản. Bấm Trích xuất văn bản. PDF.js đọc từng trang cục bộ và hiển thị tiến trình mà không gửi file lên máy chủ.
  3. 3Rà soát văn bản thuần. Kiểm tra đoạn văn, cột, bảng và ký hiệu so với bản gốc. Thứ tự đọc trong PDF có thể khác với thứ tự nhìn thấy trên trang.
  4. 4Sao chép hoặc tải xuống. Nếu cần, hãy chỉnh sửa kết quả, sao chép vào clipboard hoặc lưu dưới dạng file TXT UTF-8.

Dành cho ai

Công cụ này dùng Mozilla PDF.js để đọc lớp văn bản sẵn có của từng trang ngay trên thiết bị của bạn. Nó giữ nguyên thứ tự trang và ngắt dòng mà PDF ghi nhận, rồi trả về một kết quả văn bản thuần có thể chỉnh sửa. Ảnh, font, cột, bảng và định dạng hiển thị không được giữ lại trong đầu ra TXT.

Có một ranh giới rất quan trọng: PDF số lưu ký tự mà phần mềm có thể chọn và tìm kiếm. PDF quét có thể chỉ là ảnh chụp một trang. Trích xuất kiểu thứ nhất là phân tích văn bản, còn đọc kiểu thứ hai cần nhận dạng ký tự quang học. Công cụ này chỉ làm kiểu thứ nhất.

Câu hỏi thường gặp

File PDF của tôi có bị tải lên máy chủ không?

Không. Trình duyệt của bạn đọc file PDF đã chọn cục bộ bằng PDF.js, và tài liệu không được gửi đi đâu cả. Mã bộ máy PDF có thể được tải khi bạn dùng công cụ lần đầu, nhưng file của bạn không nằm trong yêu cầu đó.

Công cụ PDF sang văn bản này có miễn phí không?

Có. Bạn có thể trích xuất, chỉnh sửa, sao chép và tải văn bản mà không cần tài khoản, watermark hay thanh toán. Công việc chạy trên thiết bị của bạn nên không có hàng đợi chuyển đổi trên máy chủ hay file nào phải chờ lấy lại sau.

Giới hạn dung lượng và số trang là bao nhiêu?

Công cụ chấp nhận một file PDF tối đa 100 MB và 2.000 trang. Bộ nhớ khả dụng và tốc độ thiết bị có thể tạo ra giới hạn thực tế thấp hơn, nhất là trên điện thoại. Hãy tách tài liệu quá lớn thành các PDF nhỏ hơn nếu trình duyệt không xử lý xong.

Công cụ này có trích xuất được PDF scan không?

Không, nếu bản scan chỉ chứa ảnh của từng trang. Công cụ này đọc phần chữ có thể chọn sẵn và không thực hiện OCR. PDF scan cần một công cụ OCR để nhận diện ký tự từ pixel. Một số PDF hỗn hợp có thể có văn bản chọn được ở vài trang nhưng không có ở trang khác; kết quả sẽ đánh dấu các trang không có chữ.

Vì sao văn bản trích xuất bị sai thứ tự?

PDF đặt các mảnh chữ theo tọa độ và có thể không lưu rõ thứ tự đoạn văn hay cột. PDF.js đi theo các mục văn bản và ngắt dòng của tài liệu, nên có thể khác thứ tự đọc trên các bố cục nhiều cột, bảng, đầu trang hoặc biểu mẫu phức tạp.

PDF sang văn bản có giữ định dạng và ảnh không?

Không. File TXT chỉ chứa ký tự thuần, nên font, màu sắc, hình ảnh, liên kết, cột và đường viền bảng không được giữ lại. Ngắt dòng lấy từ lớp văn bản của PDF và có thể cần chỉnh sau khi trích xuất.

Vì sao PDF có mật khẩu bị từ chối?

Trình duyệt không thể đọc tài liệu mã hóa nếu không có mật khẩu. Hãy mở PDF trong trình xem đáng tin cậy, nhập mật khẩu và lưu một bản đã mở khóa nếu bạn có quyền. Sau đó thêm bản đó vào công cụ.

Có thể trích xuất những ngôn ngữ nào từ PDF?

Bộ phân tích không gắn với riêng một ngôn ngữ nào. Nó có thể trả về văn bản Unicode ở bất kỳ bộ chữ nào khi PDF có bảng ánh xạ ký tự đúng và lớp chữ có thể chọn. Nếu tài liệu dùng font bị thiếu hoặc ánh xạ tự tạo, ký tự sao chép vẫn có thể thiếu hoặc sai.