CanDoYa
ET

PDF tekstiks

Töötab täielikult sinu brauseris - midagi ei laadita üles, kontot pole vaja.

Vali digitaalne PDF, et ekstraktida valitav tekst.

Jaga seda tööriista

Kuidas PDF tekstiks muuta?

Kasuta seda PDF tekstiks tööriista, et võtta digitaalsesse PDF-i juba salvestatud valitav tekst, seejärel kopeeri see või laadi alla TXT-fail. Töötlemine toimub sinu brauseris, seega dokumenti ei laadita üles. Skannitud pildipõhised PDF-id vajavad OCR-i, kuid see konkreetne tööriist OCR-i ei tee.

Kuidas kasutada

  1. 1Vali digitaalne PDF. Lohista üks PDF tööriista või vali see oma seadmest. Parima tulemuse jaoks kontrolli, kas saad tavapärases PDF-vaaturis sõnu valida.
  2. 2Ekstrakti tekstikiht. Klõpsa Ekstrakti tekst. PDF.js loeb faili kohapeal ja näitab edenemist, ilma et fail serverisse saadetaks.
  3. 3Vaata lihtteksti üle. Kontrolli lõike, veerge, tabeleid ja sümboleid originaaliga. PDF-i lugemisjärjekord võib visuaalsest leheküljekorrast erineda.
  4. 4Kopeeri või laadi alla. Muuda tulemust vajadusel, kopeeri see lõikepuhvrisse või salvesta UTF-8 TXT-failina.

Kellele see sobib

See teisendaja kasutab Mozilla PDF.js-i, et lugeda sinu seadmes iga lehe olemasolevat tekstikihti. See säilitab lehekülgede järjekorra ja teatatud reavahetused ning annab ühe redigeeritava lihtteksttulemuse. Pilte, fonte, veerge, tabeleid ega visuaalset vormingut TXT-väljund ei säilita.

Siin on oluline piir: digitaalne PDF salvestab märgid nii, et tarkvara saab neid valida ja otsida. Skann võib aga sisaldada ainult lehekülje fotot. Esimese liigi ekstraktimine on tekstianalüüs; teise lugemiseks on vaja optilist märgituvastust. See tööriist teeb ainult esimest.

Korduvad küsimused

Kas minu PDF failid laaditakse serverisse üles?

Ei. Sinu brauser loeb valitud PDF-i kohapeal PDF.js-iga ja faili ei saadeta CanDoYa-sse. PDF-mootori kood võib esimesel kasutamisel alla laadida, kuid sinu dokument ei ole selle päringu osa.

Kas see PDF tekstiks tööriist on tasuta?

Jah. Saad teksti ekstraktida, redigeerida, kopeerida ja alla laadida ilma konto, vesimärgi või tasudeta. Töö toimub sinu seadmes, seega pole serveripõhist järjekorda ega hiljem üleslaaditud faili, mida tagasi otsida.

Millised on PDF-i suuruse ja lehekülgede piirid?

Tööriist aktsepteerib ühte PDF-i kuni 100 MB ja 2 000 leheküljega. Seadme mälu ja kiirus võivad seada madalama praktilise piiri, eriti telefonides. Kui brauser ei lõpeta tööd, jaga väga suur dokument väiksemateks PDF-ideks.

Kas see tööriist suudab skannitud PDF-ist teksti ekstraktida?

Mitte siis, kui skann sisaldab ainult lehekülje pilte. See teisendaja loeb olemasolevat valitavat teksti ega tee OCR-i. Skannitud PDF vajab OCR-tööriista, mis tunneb märgid pikslitest ära. Mõnes segatud PDF-is võib mõnel lehel olla valitav tekst ja mõnel mitte; tulemus märgib lehed, kus teksti ei leitud.

Miks ekstraktitud tekst on vales järjekorras?

PDF-i lehed paigutavad tekstilõigud koordinaatidele ega pruugi salvestada selget lõigu- või veerujärjekorda. PDF.js järgib dokumendi tekstielemente ja reavahetusi, mis võivad mitme veeruga paigutustes, tabelites, päistes või keerukates vormides visuaalsest lugemisjärjekorrast erineda.

Kas PDF tekstiks säilitab vormingu ja pildid?

Ei. TXT-fail sisaldab ainult lihtmärke, seega fonte, värve, pilte, linke, veerge ja tabelipiire ei säilitata. Reavahetused tulevad PDF-i tekstikihist ja võivad pärast ekstraktimist vajada käsitsi parandamist.

Miks parooliga kaitstud PDF lükatakse tagasi?

Brauser ei saa krüptitud dokumenti ilma paroolita lugeda. Ava PDF usaldusväärses vaaturis, sisesta parool ja salvesta lukustamata koopia, kui sul on selleks luba. Seejärel lisa tööriista just see koopia.

Milliseid keeli saab PDF-ist ekstraktida?

Parser ei ole seotud ühe keelega. Kui PDF sisaldab korrektset märgikaarti ja valitavat teksti, saab see tagastada Unicode teksti mis tahes kirjas. Kui dokumendis on puudulikud või kohandatud fondikaardistused, võivad kopeeritud märgid siiski jääda puudulikuks või valeks.