CanDoYa
CS

PDF do textu

Běží celé ve vašem prohlížeči - nic se nenahrává, žádná registrace.

Vyberte digitální PDF, ze kterého chcete vytáhnout selektivní text.

Sdílet tento nástroj

Jak převést PDF do textu?

Použijte tento převodník PDF do textu k extrakci selektivního textu, který už je uložený v digitálním PDF, a pak ho zkopírujte nebo stáhněte jako TXT. Zpracování běží přímo v prohlížeči, takže se dokument nikam nenahrává. Naskenovaná PDF jen jako obrázek potřebují OCR, a tenhle nástroj OCR neprovádí.

Jak na to

  1. 1Vyberte digitální PDF. Přetáhněte do nástroje jedno PDF nebo ho vyberte ze zařízení. Pro nejlepší výsledek si ověřte, že ve svém běžném PDF prohlížeči můžete slova označit.
  2. 2Extrahujte textovou vrstvu. Klikněte na Extrahovat text. PDF.js čte každou stránku lokálně a zobrazuje průběh bez odesílání souboru na server.
  3. 3Zkontrolujte prostý text. Porovnejte odstavce, sloupce, tabulky a symboly s originálem. Pořadí čtení v PDF se může lišit od vizuálního pořadí na stránce.
  4. 4Zkopírujte nebo stáhněte. Výsledek případně upravte, zkopírujte do schránky nebo uložte jako TXT v kódování UTF-8.

Pro koho je nástroj

Tento převodník používá Mozilla PDF.js k přečtení existující textové vrstvy každé stránky přímo ve vašem zařízení. Zachová pořadí stránek i hlášené zalomení řádků a nabídne vám jeden editovatelný výsledek v prostém textu. Obrázky, písma, sloupce, tabulky ani vizuální formátování se do výstupu TXT nepřenášejí.

Je tu důležitá hranice: digitální PDF ukládá znaky, které lze označit a vyhledávat. Sken může obsahovat jen fotografii stránky. První případ je parsování textu, druhý vyžaduje optické rozpoznávání znaků. Tento nástroj umí jen první z nich.

Časté dotazy

Nahrávají se moje PDF soubory na server?

Ne. Váš prohlížeč čte vybrané PDF lokálně pomocí PDF.js a soubor se neposílá nikam jinam. Kód PDF enginu se může stáhnout při prvním použití nástroje, ale váš dokument není součástí této požadavky.

Je tento převodník PDF do textu zdarma?

Ano. Text můžete extrahovat, upravit, zkopírovat i stáhnout bez účtu, vodoznaku nebo platby. Práce běží na vašem zařízení, takže tu není žádná serverová fronta ani nutnost později vyzvedávat nahraný soubor.

Jaké jsou limity velikosti a počtu stránek PDF?

Nástroj přijímá jedno PDF do 100 MB a 2 000 stránek. Dostupná paměť a rychlost zařízení mohou v praxi znamenat nižší limit, hlavně na telefonech. U opravdu velkých dokumentů soubor rozdělte na menší PDF, pokud prohlížeč nestačí dokončit zpracování.

Umí tento nástroj vytáhnout text z naskenovaného PDF?

Ne, pokud sken obsahuje jen obrázky stránek. Tento převodník čte existující selektivní text a OCR neprovádí. Naskenované PDF potřebuje OCR nástroj, který rozpoznává znaky z pixelů. Některá smíšená PDF mohou mít na části stran selektivní text a jinde ne - výsledek označí stránky bez textu.

Proč je extrahovaný text ve špatném pořadí?

Stránky PDF umisťují textové fragmenty do souřadnic a nemusí ukládat jasné pořadí odstavců nebo sloupců. PDF.js sleduje textové položky dokumentu a zalomení řádků, což se může lišit od vizuálního pořadí čtení u vícesloupcových rozvržení, tabulek, záhlaví nebo složitých formulářů.

Zachová PDF do textu formátování a obrázky?

Ne. Soubory TXT obsahují jen prosté znaky, takže písma, barvy, obrázky, odkazy, sloupce ani okraje tabulek se nezachovají. Zalomení řádků pochází z textové vrstvy PDF a po extrakci je možná bude potřeba upravit.

Proč je PDF chráněné heslem odmítnuto?

Prohlížeč neumí přečíst šifrovaný dokument bez hesla. Otevřete PDF v důvěryhodném prohlížeči, zadejte heslo a uložte odemčenou kopii, pokud k tomu máte oprávnění. Pak do převodníku přidejte tuto kopii.

Jaké jazyky lze z PDF extrahovat?

Parser není vázaný na jeden jazyk. Dokáže vracet Unicode text v libovolném písmu, pokud PDF obsahuje správnou mapu znaků a selektivní text. Když dokument používá chybějící nebo vlastní mapování písem, mohou být zkopírované znaky stále neúplné nebo nesprávné.