CanDoYa
HU

PDF szöveggé alakítása

Teljesen a böngésződben fut - feltöltés és regisztráció nélkül.

Válasszon egy digitális PDF-et a kijelölhető szöveg kinyeréséhez.

Oszd meg ezt az eszközt

Hogyan lehet PDF-et szöveggé alakítani?

Ezzel a PDF szöveggé konverterrel a digitális PDF-ben már eleve tárolt, kijelölhető szöveget tudja kinyerni, majd kimásolni vagy TXT fájlként letölteni. A feldolgozás a böngészőben fut, ezért a dokumentum nem kerül feltöltésre. A beolvasott, csak képként tárolt PDF-ekhez OCR kell, ezt az eszköz pedig nem végez.

Így működik

  1. 1Válasszon egy digitális PDF-et. Húzzon be egy PDF-et az eszközbe, vagy válassza ki a gépéről. A legjobb eredményhez ellenőrizze, hogy a megszokott PDF-megnyitóban ki tud-e jelölni szavakat.
  2. 2Nyissa ki a szövegréteget. Kattintson a Szöveg kinyerése gombra. A PDF.js helyben, a böngészőben olvassa be az oldalakat, és a fájlt nem küldi el szerverre.
  3. 3Ellenőrizze a sima szöveget. Nézze át a bekezdéseket, oszlopokat, táblázatokat és jeleket az eredetihez képest. A PDF olvasási sorrendje eltérhet a vizuális oldalképtől.
  4. 4Másolja vagy töltse le. Szükség esetén szerkessze az eredményt, másolja a vágólapra, vagy mentse UTF-8 TXT fájlként.

Kinek hasznos

Ez az átalakító Mozilla PDF.js segítségével helyben, az Ön eszközén olvassa be az egyes oldalak meglévő szövegrétegét. Megőrzi az oldalak sorrendjét és a jelzett sortöréseket, majd egy szerkeszthető, sima szöveges eredményt ad. A TXT kimenet nem tartja meg a képeket, a betűtípusokat, az oszlopokat, a táblázatokat és a vizuális formázást.

Van egy fontos határ: a digitális PDF olyan karaktereket tartalmaz, amelyeket a szoftver ki tud jelölni és keresni tud bennük. A szkennelés ezzel szemben csak egy oldal fényképét tárolhatja. Az első eset szövegkinyerés, a második optikai karakterfelismerést igényel. Ez az eszköz csak az előbbit tudja.

Gyakori kérdések

Feltöltődnek a PDF fájljaim egy szerverre?

Nem. A böngésző a kiválasztott PDF-et helyben, PDF.js segítségével olvassa be, és a fájl nem kerül elküldésre a CanDoYa-ra. Előfordulhat, hogy a PDF motor kódja az első használatkor letöltődik, de a dokumentum nem része ennek a kérésnek.

Ingyenes ez a PDF szöveggé alakító?

Igen. Bejelentkezés, vízjel és fizetés nélkül tud szöveget kinyerni, szerkeszteni, másolni és TXT-ként letölteni. A feldolgozás az Ön eszközén fut, ezért nincs szerveroldali sor és nincs későbbi fájlfelvétel sem.

Mekkora PDF-et és hány oldalt fogad el?

Az eszköz egyetlen PDF-et fogad el, legfeljebb 100 MB méretben és 2 000 oldalig. Az elérhető memória és az eszköz sebessége ennél szűkebb gyakorlati határt is jelenthet, főleg telefonon. Ha egy nagyon nagy dokumentum nem fér bele, érdemes kisebb PDF-ekre bontani.

Be tud szkennelt PDF-ből szöveget nyerni?

Nem, ha a szken csak oldalképeket tartalmaz. Ez az átalakító a meglévő kijelölhető szöveget olvassa ki, és nem végez OCR-t. A beolvasott PDF-hez olyan OCR eszköz kell, amely a képpontokból ismeri fel a karaktereket. Egyes vegyes PDF-ekben lehet szöveg néhány oldalon, másokon nem - az eredmény jelzi, ha egy oldalnak nincs szövege.

Miért rossz sorrendben jelenik meg a kinyert szöveg?

A PDF az oldalon koordinátákhoz kötve helyezi el a szövegrészleteket, és nem mindig tárol világos bekezdés- vagy oszlopsorrendet. A PDF.js a dokumentum szövegelemeit és sortöréseit követi, ami eltérhet a vizuális olvasási sorrendtől többoszlopos elrendezésben, táblázatokban, fejlécekben vagy összetett űrlapokon.

A PDF szöveggé alakítása megőrzi a formázást és a képeket?

Nem. A TXT fájl csak sima karaktereket tartalmaz, ezért a betűtípusok, színek, képek, linkek, oszlopok és táblázatszegélyek nem maradnak meg. A sortörések a PDF szövegrétegéből jönnek, és a kinyerés után szükség lehet szerkesztésre.

Miért utasítja el a jelszóval védett PDF-et?

A böngésző jelszó nélkül nem tud olvasni egy titkosított dokumentumot. Nyissa meg a PDF-et egy megbízható olvasóban, adja meg a jelszót, és ha van rá jogosultsága, mentse el feloldott másolatként. Ezután adja hozzá azt a másolatot az átalakítóhoz.

Milyen nyelvek nyerhetők ki egy PDF-ből?

A parser nincs egyetlen nyelvhez kötve. Bármely írásrendszerből tud Unicode szöveget visszaadni, ha a PDF-ben megfelelő karaktertérkép és kijelölhető szöveg van. Ha a dokumentum hiányos vagy egyedi fontleképezést használ, a kimásolt karakterek akkor is lehetnek hiányosak vagy hibásak.