CanDoYa
EL

PDF σε κείμενο

Λειτουργεί εξ ολοκλήρου στον browser σας - χωρίς μεταφόρτωση, χωρίς εγγραφή.

Επιλέξτε ένα ψηφιακό PDF για να εξαγάγετε το επιλέξιμο κείμενο.

Κοινοποιήστε αυτό το εργαλείο

Πώς μετατρέπω PDF σε κείμενο;

Χρησιμοποιήστε αυτό το εργαλείο PDF σε κείμενο για να εξαγάγετε το επιλέξιμο κείμενο που υπάρχει ήδη μέσα σε ένα ψηφιακό PDF και μετά να το αντιγράψετε ή να κατεβάσετε ένα αρχείο TXT. Η επεξεργασία γίνεται μέσα στον browser σας, οπότε το έγγραφο δεν ανεβαίνει πουθενά. Τα σαρωμένα PDF που περιέχουν μόνο εικόνα χρειάζονται OCR, και αυτό το συγκεκριμένο εργαλείο δεν κάνει OCR.

Πώς λειτουργεί

  1. 1Επιλέξτε ένα ψηφιακό PDF. Σύρετε ένα PDF στο εργαλείο ή επιλέξτε το από τη συσκευή σας. Για καλύτερο αποτέλεσμα, βεβαιωθείτε ότι μπορείτε να επιλέξετε λέξεις στο συνηθισμένο PDF viewer σας.
  2. 2Εξαγάγετε το κείμενο. Πατήστε Εξαγωγή κειμένου. Το PDF.js διαβάζει κάθε σελίδα τοπικά και δείχνει την πρόοδο χωρίς να στέλνει το αρχείο σε server.
  3. 3Ελέγξτε το απλό κείμενο. Ελέγξτε παραγράφους, στήλες, πίνακες και σύμβολα σε σχέση με το πρωτότυπο. Η σειρά ανάγνωσης στο PDF μπορεί να διαφέρει από τη οπτική σειρά της σελίδας.
  4. 4Αντιγράψτε ή κατεβάστε. Επεξεργαστείτε το αποτέλεσμα αν χρειάζεται, αντιγράψτε το στο πρόχειρο ή αποθηκεύστε το ως αρχείο TXT με κωδικοποίηση UTF-8.

Σε ποιους απευθύνεται

Αυτός ο μετατροπέας χρησιμοποιεί το Mozilla PDF.js για να διαβάσει το υπάρχον text layer κάθε σελίδας στη συσκευή σας. Διατηρεί τη σειρά των σελίδων και τα line breaks που αναφέρει το PDF, και μετά σας δίνει ένα επεξεργάσιμο αποτέλεσμα απλού κειμένου. Εικόνες, γραμματοσειρές, στήλες, πίνακες και η οπτική μορφοποίηση δεν διατηρούνται στο TXT.

Υπάρχει ένα βασικό όριο: ένα ψηφιακό PDF αποθηκεύει χαρακτήρες που μπορούν να επιλεγούν και να αναζητηθούν. Ένα scan μπορεί να αποθηκεύει μόνο μια φωτογραφία της σελίδας. Η εξαγωγή του πρώτου τύπου είναι parsing κειμένου - η ανάγνωση του δεύτερου απαιτεί οπτική αναγνώριση χαρακτήρων. Αυτό το εργαλείο κάνει μόνο το πρώτο.

Συχνές ερωτήσεις

Τα PDF μου ανεβαίνουν σε server;

Όχι. Ο browser σας διαβάζει το επιλεγμένο PDF τοπικά με το PDF.js και το αρχείο δεν στέλνεται στη CanDoYa. Ο κώδικας της μηχανής PDF μπορεί να ληφθεί όταν χρησιμοποιήσετε πρώτη φορά το εργαλείο, αλλά το έγγραφό σας δεν περιλαμβάνεται σε αυτό το αίτημα.

Είναι δωρεάν αυτό το PDF σε κείμενο;

Ναι. Μπορείτε να εξαγάγετε, να επεξεργαστείτε, να αντιγράψετε και να κατεβάσετε κείμενο χωρίς λογαριασμό, υδατογράφημα ή πληρωμή. Η επεξεργασία γίνεται στη συσκευή σας, οπότε δεν υπάρχει ουρά μετατροπής σε server ούτε αρχείο που πρέπει να ανακτήσετε αργότερα.

Ποιο είναι το όριο μεγέθους και σελίδων για τα PDF;

Το εργαλείο δέχεται ένα PDF έως 100 MB και 2.000 σελίδες. Η διαθέσιμη μνήμη και η ταχύτητα της συσκευής μπορεί να επιβάλουν χαμηλότερο πρακτικό όριο, ειδικά σε κινητά. Χωρίστε ένα πολύ μεγάλο έγγραφο σε μικρότερα PDF αν ο browser δεν ολοκληρώνει.

Μπορεί αυτό το εργαλείο να εξαγάγει κείμενο από σαρωμένο PDF;

Όχι όταν το scan περιέχει μόνο εικόνες σελίδων. Αυτός ο μετατροπέας διαβάζει το υπάρχον επιλέξιμο κείμενο και δεν κάνει OCR. Ένα σαρωμένο PDF χρειάζεται εργαλείο OCR που αναγνωρίζει χαρακτήρες από pixels. Κάποια μικτά PDF έχουν επιλέξιμο κείμενο σε ορισμένες σελίδες αλλά όχι σε άλλες - το αποτέλεσμα επισημαίνει σελίδες χωρίς κείμενο.

Γιατί το εξαγόμενο κείμενο βγαίνει σε λάθος σειρά;

Οι σελίδες PDF τοποθετούν τμήματα κειμένου σε συντεταγμένες και μπορεί να μην αποθηκεύουν καθαρή σειρά παραγράφων ή στηλών. Το PDF.js ακολουθεί τα text items και τα line endings του εγγράφου, κάτι που μπορεί να διαφέρει από την οπτική σειρά ανάγνωσης σε διατάξεις πολλών στηλών, πίνακες, κεφαλίδες ή σύνθετες φόρμες.

Το PDF σε κείμενο διατηρεί μορφοποίηση και εικόνες;

Όχι. Τα TXT περιέχουν μόνο απλοί χαρακτήρες, οπότε γραμματοσειρές, χρώματα, εικόνες, links, στήλες και περιγράμματα πινάκων δεν διατηρούνται. Τα line breaks προέρχονται από το text layer του PDF και μπορεί να χρειαστούν επεξεργασία μετά την εξαγωγή.

Γιατί απορρίπτεται ένα PDF με κωδικό πρόσβασης;

Ο browser δεν μπορεί να διαβάσει ένα κρυπτογραφημένο έγγραφο χωρίς τον κωδικό του. Ανοίξτε το PDF σε αξιόπιστο viewer, πληκτρολογήστε τον κωδικό και αποθηκεύστε ένα ξεκλείδωτο αντίγραφο, αν έχετε άδεια. Έπειτα προσθέστε αυτό το αντίγραφο στον μετατροπέα.

Ποιες γλώσσες μπορούν να εξαχθούν από ένα PDF;

Ο parser δεν περιορίζεται σε μία γλώσσα. Μπορεί να επιστρέψει Unicode κείμενο σε οποιοδήποτε script, όταν το PDF περιέχει σωστό character map και επιλέξιμο κείμενο. Αν ένα έγγραφο χρησιμοποιεί ελλιπείς ή προσαρμοσμένους font mappings, οι αντιγραμμένοι χαρακτήρες μπορεί να παραμείνουν ελλιπείς ή λανθασμένοι.