CanDoYa
SK

PDF na text

Beží celý vo vašom prehliadači - bez nahrávania, bez registrácie.

Vyberte digitálne PDF na extrakciu vyberateľného textu.

Zdieľať tento nástroj

Ako prevediem PDF na text?

Použite tento nástroj PDF na text na extrakciu vyberateľného textu, ktorý je už uložený v digitálnom PDF, a potom ho skopírujte alebo stiahnite ako TXT súbor. Spracovanie prebieha vo vašom prehliadači, takže dokument sa nenahráva. Naskenované PDF len ako obrázok potrebujú OCR a tento konkrétny nástroj OCR nerobí.

Ako na to

  1. 1Vyberte digitálne PDF. Presuňte do nástroja jedno PDF alebo ho vyberte zo zariadenia. Pre najlepší výsledok si overte, že v bežnom PDF prehliadači viete označiť slová.
  2. 2Extrahujte textovú vrstvu. Kliknite na Extrahovať text. PDF.js číta každú stranu lokálne a priebeh zobrazuje bez odosielania súboru na server.
  3. 3Skontrolujte obyčajný text. Porovnajte odseky, stĺpce, tabuľky a symboly s originálom. Poradie čítania v PDF sa môže líšiť od vizuálneho poradia na strane.
  4. 4Skopírujte alebo stiahnite. Ak treba, výsledok upravte, skopírujte do schránky alebo uložte ako TXT súbor v kódovaní UTF-8.

Pre koho je nástroj určený

Tento prevodník používa Mozilla PDF.js na čítanie existujúcej textovej vrstvy každej strany priamo vo vašom zariadení. Zachová poradie strán a hlásené zalomenia riadkov a potom vám dá jeden upraviteľný výsledok v obyčajnom texte. Obrázky, fonty, stĺpce, tabuľky ani vizuálne formátovanie sa do výstupu TXT neprenášajú.

Je tu dôležitá hranica: digitálne PDF obsahuje znaky, ktoré sa dajú označiť a vyhľadať. Sken môže obsahovať len fotografiu strany. Extrakcia prvého typu je parsovanie textu, čítanie druhého typu vyžaduje optické rozpoznávanie znakov. Tento nástroj robí iba prvú úlohu.

Časté otázky

Odovzdávajú sa moje PDF súbory na server?

Nie. Váš prehliadač číta vybrané PDF lokálne cez PDF.js a súbor sa neposiela na CanDoYa. Kód PDF enginu sa môže stiahnuť pri prvom použití nástroja, ale váš dokument nie je súčasťou tejto požiadavky.

Je tento prevodník PDF na text zadarmo?

Áno. Text môžete extrahovať, upraviť, skopírovať aj stiahnuť bez účtu, vodoznaku alebo platby. Práca beží na vašom zariadení, takže tu nie je serverové spracovanie v rade ani nahraný súbor, ktorý by ste museli neskôr vyzdvihovať.

Aké sú limity veľkosti PDF a počtu strán?

Nástroj prijíma jedno PDF do 100 MB a do 2 000 strán. Dostupná pamäť a rýchlosť zariadenia môžu v praxi nastaviť nižší limit, najmä na telefónoch. Ak prehliadač nedokáže dokončiť spracovanie, rozdeľte veľmi veľký dokument na menšie PDF.

Dokáže tento nástroj extrahovať text zo skenovaného PDF?

Nie, ak sken obsahuje iba obrázky strán. Tento prevodník číta existujúci vyberateľný text a OCR nerobí. Naskenované PDF potrebuje OCR nástroj, ktorý rozpoznáva znaky z pixelov. Niektoré zmiešané PDF môžu mať vyberateľný text len na niektorých stranách; výsledok označí strany bez textu.

Prečo je extrahovaný text v nesprávnom poradí?

PDF umiestňuje textové úlomky na súradnice a nemusí ukladať jasné poradie odsekov alebo stĺpcov. PDF.js sa riadi textovými položkami a zalomeniami riadkov dokumentu, čo sa môže líšiť od vizuálneho poradia čítania pri viacstĺpcových rozloženiach, tabuľkách, hlavičkách alebo zložitých formulároch.

Zachová PDF na text formátovanie a obrázky?

Nie. Súbory TXT obsahujú iba obyčajné znaky, takže fonty, farby, obrázky, odkazy, stĺpce a okraje tabuliek sa nezachovajú. Zalomenia riadkov vychádzajú z textovej vrstvy PDF a po extrakcii ich možno bude treba upraviť.

Prečo je PDF chránené heslom odmietnuté?

Prehliadač nevie prečítať zašifrovaný dokument bez hesla. Otvorte PDF v dôveryhodnom prehliadači, zadajte heslo a ak máte oprávnenie, uložte odomknutú kópiu. Potom do prevodníka pridajte túto kópiu.

Aké jazyky sa dajú z PDF extrahovať?

Parser nie je viazaný na jeden jazyk. Vie vrátiť Unicode text v ľubovoľnom písme, ak PDF obsahuje správnu mapu znakov a vyberateľný text. Ak dokument používa chýbajúce alebo vlastné mapovanie fontu, skopírované znaky môžu byť aj tak neúplné alebo nesprávne.