CanDoYa
HR

PDF u tekst

Radi u cijelosti u pregledniku - bez slanja podataka i bez registracije.

Odaberite digitalni PDF za izdvajanje odabirivog teksta.

Podijelite ovaj alat

Kako pretvoriti PDF u tekst?

Upotrijebite ovaj alat za PDF u tekst kako biste izdvojili postojeći odabirivi tekst koji je već pohranjen u digitalnom PDF-u, a zatim ga kopirajte ili preuzmite kao TXT datoteku. Obrada se odvija u vašem pregledniku, pa se dokument ne učitava nigdje. Skenirani PDF-ovi koji sadrže samo slike trebaju OCR, a ovaj alat ne izvodi OCR.

Kako se koristi

  1. 1Odaberite digitalni PDF. Ispustite jedan PDF u alat ili ga odaberite sa svog uređaja. Za najbolji rezultat provjerite možete li odabrati riječi u svom uobičajenom PDF pregledniku.
  2. 2Izdvojite tekstnu razinu. Kliknite Izdvoji tekst. PDF.js lokalno čita svaku stranicu i prikazuje napredak bez slanja datoteke na poslužitelj.
  3. 3Pregledajte obični tekst. Usporedite odlomke, stupce, tablice i simbole s izvornikom. Redoslijed čitanja u PDF-u može se razlikovati od vizualnog rasporeda na stranici.
  4. 4Kopirajte ili preuzmite. Po potrebi uredite rezultat, kopirajte ga u međuspremnik ili ga spremite kao UTF-8 TXT datoteku.

Za koga je

Ovaj alat koristi Mozilla PDF.js za čitanje postojeće tekstne razine svake stranice na vašem uređaju. Čuva redoslijed stranica i prijavljene prijelome redaka, a zatim vam daje jedan uređiv obični tekst. Slike, fontovi, stupci, tablice i vizualno oblikovanje ne zadržavaju se u TXT izlazu.

Važno je razlikovati dvije stvari: digitalni PDF sadrži znakove koje softver može označiti i pretraživati. Sken može sadržavati samo fotografiju stranice. Izdvajanje prve vrste je parsiranje teksta, a čitanje druge zahtijeva optičko prepoznavanje znakova. Ovaj alat radi samo prvi posao.

Česta pitanja

Prenose li se moje PDF datoteke na poslužitelj?

Ne. Vaš preglednik lokalno čita odabrani PDF pomoću PDF.js, a datoteka se ne šalje u CanDoYa. Kôd PDF enginea može se preuzeti pri prvom korištenju alata, ali vaš dokument nije dio tog zahtjeva.

Je li ovaj alat za PDF u tekst besplatan?

Da. Tekst možete izdvojiti, urediti, kopirati i preuzeti bez računa, vodenog žiga ili plaćanja. Obrada se odvija na vašem uređaju, pa nema reda čekanja na poslužitelju niti kasnijeg preuzimanja učitane datoteke.

Koja su ograničenja veličine i broja stranica PDF-a?

Alat prihvaća jedan PDF do 100 MB i do 2.000 stranica. Dostupna memorija i brzina uređaja mogu nametnuti nižu praktičnu granicu, osobito na telefonima. Ako preglednik ne može dovršiti obradu, podijelite vrlo velik dokument u manje PDF-ove.

Može li ovaj alat izdvojiti tekst iz skeniranog PDF-a?

Ne kada sken sadrži samo slike stranica. Ovaj alat čita postojeći odabirivi tekst i ne izvodi OCR. Za skenirani PDF potreban je OCR alat koji prepoznaje znakove iz piksela. Neki miješani PDF-ovi imaju odabiriv tekst na određenim stranicama, a rezultat označava stranice bez teksta.

Zašto je izdvojeni tekst u pogrešnom redoslijedu?

PDF stranice postavljaju tekstne fragmente na koordinate i možda ne pohranjuju jasan redoslijed odlomaka ili stupaca. PDF.js prati stavke teksta i prijelome redaka iz dokumenta, što se može razlikovati od vizualnog redoslijeda čitanja u rasporedu s više stupaca, tablicama, zaglavljima ili složenim obrascima.

Zadržava li PDF u tekst oblikovanje i slike?

Ne. TXT datoteke sadrže samo obične znakove, pa fontovi, boje, slike, poveznice, stupci i rubovi tablica nisu zadržani. Prijelomi redaka dolaze iz tekstne razine PDF-a i nakon izdvajanja ih je možda potrebno urediti.

Zašto je PDF zaštićen lozinkom odbijen?

Preglednik ne može čitati šifrirani dokument bez lozinke. Otvorite PDF u pouzdanom pregledniku, unesite lozinku i spremite otključanu kopiju ako imate dopuštenje. Zatim dodajte tu kopiju u alat.

Koje jezike mogu izdvojiti iz PDF-a?

Parser nije vezan uz jedan jezik. Može vratiti Unicode tekst u bilo kojem pismu kada PDF sadrži ispravnu mapu znakova i odabirivi tekst. Ako dokument koristi nedostajuća ili prilagođena mapiranja fontova, kopirani znakovi mogu i dalje biti nepotpuni ili netočni.