CanDoYa
RO

PDF în text

Rulează integral în browserul tău - fără încărcare, fără cont.

Alege un PDF digital pentru a extrage textul selectabil.

Distribuie acest instrument

Cum transform un PDF în text?

Folosește acest convertor PDF în text ca să extragi textul selectabil deja stocat într-un PDF digital, apoi copiază-l sau descarcă un fișier TXT. Procesarea rulează în browserul tău, deci documentul nu este încărcat pe server. PDF-urile scanate, bazate doar pe imagini, au nevoie de OCR, iar acest instrument nu face OCR.

Cum se folosește

  1. 1Alege un PDF digital. Trage un singur PDF în instrument sau selectează-l de pe dispozitiv. Pentru rezultate bune, confirmă că poți selecta cuvintele în vizualizatorul PDF obișnuit.
  2. 2Extrage stratul de text. Apasă Extrage text. PDF.js citește fiecare pagină local și afișează progresul fără să trimită fișierul pe server.
  3. 3Verifică textul simplu. Compară paragrafele, coloanele, tabelele și simbolurile cu originalul. Ordinea de citire din PDF poate diferi de ordinea vizuală a paginii.
  4. 4Copiază sau descarcă. Editează rezultatul dacă e nevoie, copiază-l în clipboard sau salvează-l ca fișier TXT în UTF-8.

Pentru cine este

Acest convertor folosește Mozilla PDF.js pentru a citi stratul de text existent al fiecărei pagini direct pe dispozitivul tău. Păstrează ordinea paginilor și întreruperile de linie raportate, apoi îți oferă un rezultat în text simplu, editabil. Imaginile, fonturile, coloanele, tabelele și formatarea vizuală nu se păstrează în ieșirea TXT.

Există o limită importantă: un PDF digital stochează caractere pe care aplicațiile le pot selecta și căuta. Un scan poate stoca doar o fotografie a paginii. Extragerea primului tip este parsare de text; citirea celui de-al doilea necesită recunoaștere optică a caracterelor. Acest instrument face doar prima parte.

Întrebări frecvente

Fișierele mele PDF sunt încărcate pe un server?

Nu. Browserul tău citește PDF-ul selectat local, cu PDF.js, iar fișierul nu este trimis nicăieri. Codul motorului PDF se poate descărca la prima utilizare a instrumentului, dar documentul tău nu face parte din acea cerere.

Acest convertor PDF în text este gratuit?

Da. Poți extrage, edita, copia și descărca text fără cont, watermark sau plată. Procesarea rulează pe dispozitivul tău, deci nu există o coadă de conversie pe server și nici un fișier încărcat pe care să-l recuperezi mai târziu.

Care sunt limitele de mărime și pagini pentru PDF?

Instrumentul acceptă un singur PDF de până la 100 MB și 2.000 de pagini. Memoria disponibilă și viteza dispozitivului pot impune o limită practică mai mică, mai ales pe telefoane. Împarte un document foarte mare în PDF-uri mai mici dacă browserul nu poate termina.

Poate acest instrument extrage text dintr-un PDF scanat?

Nu dacă scanul conține doar imagini ale paginilor. Acest convertor citește textul selectabil existent și nu face OCR. Un PDF scanat are nevoie de un instrument OCR care recunoaște caracterele din pixeli. Unele PDF-uri mixte conțin text selectabil pe anumite pagini, dar nu pe altele; rezultatul marchează paginile fără text.

De ce textul extras apare în ordine greșită?

Paginile PDF poziționează fragmentele de text în coordonate și este posibil să nu stocheze o ordine clară de paragrafe sau coloane. PDF.js urmează elementele de text și întreruperile de linie din document, iar acestea pot diferi de ordinea vizuală în machete cu mai multe coloane, tabele, antete sau formulare complexe.

PDF în text păstrează formatarea și imaginile?

Nu. Fișierele TXT conțin doar caractere simple, așa că fonturile, culorile, imaginile, linkurile, coloanele și contururile tabelelor nu se păstrează. Săriturile de linie provin din stratul de text al PDF-ului și pot necesita editare după extragere.

De ce este respins un PDF protejat cu parolă?

Browserul nu poate citi un document criptat fără parola lui. Deschide PDF-ul într-un vizualizator de încredere, introdu parola și salvează o copie deblocată dacă ai permisiunea. Apoi adaugă acea copie în convertor.

Ce limbi pot fi extrase dintr-un PDF?

Parserul nu este legat de o singură limbă. Poate returna text Unicode în orice script atunci când PDF-ul conține o mapare corectă a caracterelor și text selectabil. Dacă un document folosește mapări de font lipsă sau personalizate, caracterele copiate pot rămâne incomplete sau incorecte.