CanDoYa
IT

PDF in testo - Estrai testo dal PDF

Funziona interamente nel browser: nessun caricamento, nessuna registrazione.

Scegli un PDF digitale per estrarre il testo selezionabile.

Condividi questo strumento

Come si converte un PDF in testo?

Usa questo strumento PDF in testo per estrarre il testo selezionabile già presente in un PDF digitale, poi copialo o scarica un file TXT. L'elaborazione avviene nel tuo browser, quindi il documento non viene caricato. I PDF scansionati con sole immagini richiedono OCR, e questo strumento specifico non esegue OCR.

Come si usa

  1. 1Scegli un PDF digitale. Trascina un solo PDF nello strumento oppure selezionalo dal dispositivo. Per il risultato migliore, verifica di poter selezionare le parole nel tuo visualizzatore PDF abituale.
  2. 2Estrai il text layer. Fai clic su Estrai testo. PDF.js legge ogni pagina in locale e mostra l'avanzamento senza inviare il file a un server.
  3. 3Controlla il testo semplice. Verifica paragrafi, colonne, tabelle e simboli rispetto all'originale. L'ordine di lettura del PDF può differire dall'ordine visivo della pagina.
  4. 4Copia o scarica. Modifica il risultato se serve, copialo negli appunti oppure salvalo come file TXT in UTF-8.

A chi serve

Questo convertitore usa Mozilla PDF.js per leggere nel tuo dispositivo il text layer già presente in ogni pagina. Mantiene l'ordine delle pagine e i ritorni a capo rilevati, poi ti restituisce un unico risultato in testo semplice modificabile. Immagini, font, colonne, tabelle e formattazione visiva non vengono preservati nell'output TXT.

C'è un confine importante: un PDF digitale contiene caratteri selezionabili e ricercabili dal software. Una scansione può contenere solo la fotografia di una pagina. Estrarre il primo caso è parsing del testo; leggere il secondo richiede il riconoscimento ottico dei caratteri. Questo strumento fa solo la prima cosa.

Domande frequenti

I miei file PDF vengono caricati su un server?

No. Il browser legge il PDF selezionato in locale con PDF.js e il file non viene inviato a CanDoYa. Il codice del motore PDF può essere scaricato quando usi lo strumento per la prima volta, ma il tuo documento non fa parte di quella richiesta.

Questo convertitore PDF in testo è gratuito?

Sì. Puoi estrarre, modificare, copiare e scaricare il testo senza account, watermark o pagamento. Il lavoro avviene sul tuo dispositivo, quindi non c'è nessuna coda di conversione su server e nessun file caricato da recuperare dopo.

Quali sono i limiti di dimensione e pagine del PDF?

Lo strumento accetta un solo PDF fino a 100 MB e 2.000 pagine. La memoria disponibile e la velocità del dispositivo possono imporre un limite pratico inferiore, soprattutto sui telefoni. Se il documento è molto grande, dividilo in PDF più piccoli se il browser non riesce a finire.

Questo strumento può estrarre testo da un PDF scansionato?

Non quando la scansione contiene solo immagini della pagina. Questo convertitore legge il testo selezionabile esistente e non esegue OCR. Un PDF scansionato richiede uno strumento OCR che riconosca i caratteri dai pixel. Alcuni PDF misti contengono testo selezionabile in certe pagine ma non in altre; il risultato segnala le pagine senza testo.

Perché il testo estratto è nell'ordine sbagliato?

Le pagine PDF posizionano i frammenti di testo con coordinate e possono non memorizzare un ordine chiaro di paragrafi o colonne. PDF.js segue gli elementi di testo e i ritorni a capo del documento, che possono differire dall'ordine visivo di lettura in layout a più colonne, tabelle, intestazioni o moduli complessi.

PDF in testo conserva formattazione e immagini?

No. I file TXT contengono solo caratteri semplici, quindi font, colori, immagini, link, colonne e bordi delle tabelle non vengono preservati. I ritorni a capo provengono dal text layer del PDF e possono richiedere una revisione dopo l'estrazione.

Perché un PDF protetto da password viene rifiutato?

Il browser non può leggere un documento cifrato senza la sua password. Apri il PDF in un visualizzatore affidabile, inserisci la password e salva una copia sbloccata se hai il permesso. Poi aggiungi quella copia al convertitore.

Quali lingue si possono estrarre da un PDF?

Il parser non è legato a una sola lingua. Può restituire testo Unicode in qualsiasi script quando il PDF contiene una mappa dei caratteri corretta e testo selezionabile. Se un documento usa mappature di font mancanti o personalizzate, i caratteri copiati possono comunque risultare incompleti o errati.