CanDoYa
LV

PDF uz tekstu pārveidotājs

Darbojas tikai tavā pārlūkā - bez augšupielādes un reģistrācijas.

Izvēlieties digitālu PDF, lai izvilktu atlasāmo tekstu.

Kopīgot šo rīku

Kā pārvērst PDF uz tekstu?

Izmantojiet šo PDF uz tekstu pārveidotāju, lai izvilktu atlasāmo tekstu, kas jau ir saglabāts digitālā PDF, un pēc tam to nokopētu vai lejupielādētu TXT failā. Apstrāde notiek jūsu pārlūkā, tāpēc dokuments netiek augšupielādēts. Skenētiem PDF, kuros ir tikai attēli, vajadzīgs OCR, un šis rīks OCR neveic.

Kā lietot

  1. 1Izvēlieties digitālu PDF. Ievelciet vienu PDF rīkā vai izvēlieties to no savas ierīces. Lai iegūtu labāko rezultātu, pārliecinieties, ka vārdus varat atlasīt parastajā PDF skatītājā.
  2. 2Izvelciet teksta slāni. Noklikšķiniet uz Izvilkt tekstu. PDF.js lokāli nolasa katru lapu un parāda progresu, nesūtot failu uz serveri.
  3. 3Pārskatiet vienkāršo tekstu. Salīdziniet rindkopas, kolonnas, tabulas un simbolus ar oriģinālu. PDF lasīšanas kārtība var atšķirties no vizuālās lapas kārtības.
  4. 4Kopējiet vai lejupielādējiet. Ja vajag, rediģējiet rezultātu, kopējiet to starpliktuvē vai saglabājiet kā UTF-8 TXT failu.

Kam noder

Šis pārveidotājs izmanto Mozilla PDF.js, lai jūsu ierīcē nolasītu katras lapas esošo teksta slāni. Tas saglabā lapu secību un norādītos rindu pārnesumus, pēc tam izveido vienu rediģējamu vienkārša teksta rezultātu. TXT izvadē netiek saglabāti attēli, fonti, kolonnas, tabulas vai vizuālais noformējums.

Šeit ir svarīga robeža: digitāls PDF satur rakstzīmes, ko programmatūra var atlasīt un meklēt. Skenējums var saturēt tikai lapas fotogrāfiju. Pirmā veida izvilkšana ir teksta parsēšana, bet otrajam vajadzīga optiskā rakstzīmju atpazīšana. Šis rīks veic tikai pirmo darbu.

Biežāk uzdotie jautājumi

Vai mani PDF faili tiek augšupielādēti serverī?

Nē. Jūsu pārlūkprogramma nolasa izvēlēto PDF lokāli ar PDF.js, un fails netiek nosūtīts uz serveri. PDF dzinēja kods var tikt lejupielādēts, kad rīku lietojat pirmo reizi, taču jūsu dokuments šajā pieprasījumā nav iekļauts.

Vai šis PDF uz tekstu pārveidotājs ir bez maksas?

Jā. Varat izvilkt, rediģēt, kopēt un lejupielādēt tekstu bez konta, ūdenszīmes vai maksājuma. Darbs notiek jūsu ierīcē, tāpēc nav servera rindas vai vēlāk atkal jāielādēts fails.

Kādi ir PDF izmēra un lapu limiti?

Rīks pieņem vienu PDF līdz 100 MB un 2,000 lapām. Pieejamā atmiņa un ierīces ātrums var noteikt zemāku praktisko limitu, īpaši telefonos. Ja pārlūks nevar pabeigt darbu, sadaliet ļoti lielu dokumentu mazākos PDF.

Vai šis rīks var izvilkt tekstu no skenēta PDF?

Ne tad, ja skenējumā ir tikai lapu attēli. Šis pārveidotājs nolasa esošo atlasāmo tekstu un neveic OCR. Skenētam PDF vajag OCR rīku, kas atpazīst rakstzīmes no pikseļiem. Dažos jauktos PDF atsevišķās lapās var būt atlasāms teksts, bet citās nē; rezultāts atzīmē lapas bez teksta.

Kāpēc izvilktais teksts ir nepareizā secībā?

PDF lapas izvieto teksta fragmentus ar koordinātām un var nesaglabāt skaidru rindkopu vai kolonnu secību. PDF.js seko dokumenta teksta vienumiem un rindu pārnesumiem, kas daudzkolonnu izkārtojumos, tabulās, galvenēs vai sarežģītās formās var atšķirties no vizuālās lasīšanas kārtības.

Vai PDF uz tekstu saglabā noformējumu un attēlus?

Nē. TXT faili satur tikai vienkāršas rakstzīmes, tāpēc fonti, krāsas, attēli, saites, kolonnas un tabulu apmales netiek saglabātas. Rindu pārnesumi rodas no PDF teksta slāņa un pēc izvilkšanas var būt jāpārrediģē.

Kāpēc parolei aizsargāts PDF tiek noraidīts?

Pārlūks nevar nolasīt šifrētu dokumentu bez paroles. Atveriet PDF uzticamā skatītājā, ievadiet paroli un saglabājiet atbloķētu kopiju, ja jums ir atļauja. Tad pievienojiet šo kopiju pārveidotājam.

Kuras valodas var izvilkt no PDF?

Parsētājs nav piesaistīts vienai valodai. Tas var atgriezt Unicode tekstu jebkurā rakstībā, ja PDF satur pareizu rakstzīmju karti un atlasāmu tekstu. Ja dokumentā ir trūkstošas vai pielāgotas fontu kartēšanas, kopētās rakstzīmes joprojām var būt nepilnīgas vai nepareizas.