CanDoYa
SL

PDF v besedilo

Vse poteka v vašem brskalniku - brez nalaganja, brez registracije.

Izberite digitalni PDF za izvlek izbirljivega besedila.

Delite to orodje

Kako pretvorim PDF v besedilo?

Uporabite ta pretvornik PDF v besedilo za استخراج besedila, ki je že shranjeno v digitalnem PDF-ju kot izbirljiva besedilna plast, nato ga kopirajte ali prenesite kot TXT datoteko. Obdelava poteka v vašem brskalniku, zato se dokument ne nalaga na strežnik. Skenirani PDF-ji, kjer so besede le kot piksli, potrebujejo OCR, ta orodje pa OCR ne izvaja.

Kako uporabljati

  1. 1Izberite digitalni PDF. PDF povlecite v orodje ali ga izberite na napravi. Za najboljši rezultat preverite, ali lahko besede označite že v običajnem pregledovalniku PDF.
  2. 2Izvlecite besedilno plast. Kliknite Izvleci besedilo. PDF.js lokalno prebere vsako stran in prikazuje napredek brez pošiljanja datoteke na strežnik.
  3. 3Preglejte navadno besedilo. Preverite odstavke, stolpce, tabele in simbole glede na izvirnik. Bralni vrstni red v PDF-ju se lahko razlikuje od vizualnega vrstnega reda strani.
  4. 4Kopirajte ali prenesite. Po potrebi rezultat uredite, ga kopirajte v odložišče ali shranite kot UTF-8 TXT datoteko.

Komu je namenjeno

Ta pretvornik uporablja Mozilla PDF.js za branje obstoječe besedilne plasti vsake strani na vaši napravi. Ohranita se vrstni red strani in poročani prelomi vrstic, nato dobite en urejen rezultat v navadnem besedilu. Slike, pisave, stolpci, tabele in vizualno oblikovanje se v izpisu TXT ne ohranijo.

Pomembna je meja: digitalni PDF vsebuje znake, ki jih lahko programska oprema označi in išče. Sken lahko hrani le fotografijo strani. Izvleček prve vrste je razčlenjevanje besedila; branje druge vrste zahteva optično prepoznavanje znakov. To orodje opravi samo prvi del.

Pogosta vprašanja

Ali se moje PDF datoteke nalagajo na strežnik?

Ne. Vaš brskalnik izbrani PDF bere lokalno s PDF.js, datoteka pa se ne pošilja v CanDoYa. Koda pogona PDF se lahko prenese ob prvi uporabi orodja, vendar vaš dokument ni del te zahteve.

Je ta pretvornik PDF v besedilo brezplačen?

Da. Besedilo lahko izvlečete, uredite, kopirate in prenesete brez računa, vodnega žiga ali plačila. Obdelava teče na vaši napravi, zato ni strežniške čakalne vrste in ni treba kasneje prevzemati naložene datoteke.

Kakšne so omejitve velikosti in števila strani pri PDF-ju?

Orodje sprejme en PDF do 100 MB in do 2.000 strani. Razpoložljiv pomnilnik in hitrost naprave lahko postavita nižjo praktično mejo, zlasti na telefonu. Zelo velik dokument po potrebi razdelite na manjše PDF-je, če brskalnik ne dokonča obdelave.

Ali lahko to orodje izvleče besedilo iz skeniranega PDF-ja?

Ne, kadar sken vsebuje samo slike strani. Ta pretvornik bere obstoječe izbirljivo besedilo in ne izvaja OCR. Skeniran PDF potrebuje OCR orodje, ki prepozna znake iz pikslov. Nekateri mešani PDF-ji vsebujejo izbirljivo besedilo na določenih straneh, na drugih pa ne; rezultat označi strani brez besedila.

Zakaj je izpisano besedilo v napačnem vrstnem redu?

Strani v PDF-ju besedilne fragmente postavljajo po koordinatah in morda ne shranijo jasnega vrstnega reda odstavkov ali stolpcev. PDF.js sledi besedilnim elementom in prelomom vrstic dokumenta, kar se lahko razlikuje od vizualnega vrstnega reda branja v večstolpčnih postavitvah, tabelah, glavi ali zahtevnih obrazcih.

Ali PDF v besedilo ohrani oblikovanje in slike?

Ne. Datoteke TXT vsebujejo samo navadne znake, zato pisave, barve, slike, povezave, stolpci in robovi tabel niso ohranjeni. Prelomi vrstic prihajajo iz besedilne plasti PDF-ja in jih bo po izvleku morda treba urediti.

Zakaj je z geslom zaščiten PDF zavrnjen?

Brskalnik šifriranega dokumenta ne more prebrati brez gesla. PDF odprite v zaupanja vrednem pregledovalniku, vnesite geslo in shranite odklenjeno kopijo, če imate dovoljenje. Nato to kopijo dodajte v pretvornik.

Katere jezike lahko izvlečem iz PDF-ja?

Razčlenjevalnik ni vezan na en sam jezik. Vrne lahko Unicode besedilo v katerem koli zapisu, kadar PDF vsebuje pravilno preslikavo znakov in izbirljivo besedilo. Če dokument uporablja manjkajoče ali lastne preslikave pisav, so lahko kopirani znaki še vedno nepopolni ali napačni.