CanDoYa
FIL

PDF sa Text

Tumatakbo nang buo sa iyong browser - walang upload, walang sign-up.

Pumili ng digital PDF para i-extract ang selectable text.

Ibahagi ang tool na ito

Paano i-convert ang PDF sa text?

Gamitin ang PDF sa text na ito para kunin ang selectable text na nakaimbak na sa digital PDF, tapos i-copy mo o i-download bilang TXT file. Sa browser mo lang tumatakbo ang proseso, kaya hindi ina-upload ang dokumento. Kung scanned o image-only ang PDF, kailangan iyon ng OCR, at ang tool na ito ay hindi OCR.

Paano gamitin

  1. 1Pumili ng digital PDF. I-drop ang isang PDF sa tool o pumili mula sa device mo. Para sa pinakamainam na resulta, tiyaking naa-select mo ang mga salita sa karaniwang PDF viewer mo.
  2. 2I-extract ang text layer. I-click ang Extract text. Babasahin ng PDF.js ang bawat page nang lokal at magpapakita ng progress nang hindi ipinapadala ang file sa server.
  3. 3Suriin ang plain text. I-check ang mga paragraph, column, table, at symbol laban sa orihinal. Puwedeng iba ang PDF reading order sa visual na ayos ng page.
  4. 4I-copy o i-download. I-edit ang result kung kailangan, i-copy sa clipboard, o i-save bilang UTF-8 TXT file.

Para kanino ito

Gumagamit ang converter na ito ng Mozilla PDF.js para basahin sa device mo ang existing text layer ng bawat page. Pinananatili nito ang pagkakasunod ng pages at ang mga line ending na nire-report, tapos ibinibigay sa iyo ang isang nae-edit na plain-text result. Hindi napapanatili sa TXT output ang mga image, font, column, table, at visual formatting.

May mahalagang hangganan ito: ang digital PDF ay naglalaman ng mga character na puwedeng i-select at i-search ng software. Ang scan ay puwedeng larawan lang ng page ang laman. Ang pagkuha sa unang uri ay text parsing; ang pagbasa sa ikalawa ay nangangailangan ng optical character recognition. Ang tool na ito ay para lang sa unang trabaho.

FAQ

Ina-upload ba sa server ang mga PDF file ko?

Hindi. Binabasa ng browser mo ang napiling PDF nang lokal gamit ang PDF.js, at hindi ipinapadala ang file sa CanDoYa. Maaaring mag-download ang PDF engine code kapag unang ginamit mo ang tool, pero hindi kasama ang dokumento mo sa request na iyon.

Libre ba ang PDF sa text converter na ito?

Oo. Puwede kang mag-extract, mag-edit, mag-copy, at mag-download ng text nang walang account, watermark, o bayad. Sa device mo tumatakbo ang trabaho, kaya walang server conversion queue o uploaded file na kailangang kunin pa mamaya.

Ano ang PDF size at page limit?

Tumatanggap ang tool ng isang PDF hanggang 100 MB at 2,000 pages. Ang available memory at bilis ng device ay puwedeng magpababa sa praktikal na limit, lalo na sa phone. I-split ang napakalaking dokumento sa mas maliliit na PDF kung hindi matapos ng browser.

Puwede bang mag-extract ng text mula sa scanned PDF?

Hindi kung page image lang ang laman ng scan. Binabasa ng converter na ito ang existing selectable text at hindi ito nag-o-OCR. Ang scanned PDF ay nangangailangan ng OCR tool na nakikilala ang mga character mula sa pixels. May ilang mixed PDF na may selectable text sa ilang page pero wala sa iba; minamarkahan ng result ang mga page na walang text.

Bakit mali ang pagkakasunod ng na-extract na text?

Ang mga PDF page ay naglalagay ng text fragment sa coordinates at puwedeng walang malinaw na paragraph o column order. Sinusundan ng PDF.js ang text items at line endings ng dokumento, na puwedeng iba sa visual reading order sa multi-column layout, table, header, o complex form.

Napananatili ba ng PDF sa text ang formatting at mga image?

Hindi. Plain characters lang ang laman ng TXT file, kaya hindi napapanatili ang font, kulay, image, link, column, at table border. Ang line break ay galing sa PDF text layer at puwedeng kailangan pang i-edit pagkatapos ng extraction.

Bakit nire-reject ang password-protected na PDF?

Hindi mababasa ng browser ang encrypted na dokumento kung wala ang password nito. Buksan ang PDF sa trusted viewer, ilagay ang password, at mag-save ng unlocked copy kung may permiso ka. Pagkatapos, iyon ang i-add sa converter.

Aling mga wika ang puwedeng i-extract mula sa PDF?

Hindi nakatali sa isang wika ang parser. Kaya nitong maglabas ng Unicode text sa anumang script kapag ang PDF ay may tamang character map at selectable text. Kung may nawawala o custom font mapping ang isang dokumento, puwede pa ring hindi kumpleto o mali ang mga nakokopyang character.