CanDoYa
CA

PDF a text

Funciona del tot al navegador: sense pujar res ni registrar-te.

Tria un PDF digital per extreure el text seleccionable.

Comparteix aquesta eina

Com converteixo un PDF a text?

Fes servir aquest convertidor PDF a text per extreure el text seleccionable que ja hi ha dins d’un PDF digital, i després copia’l o descarrega un fitxer TXT. El processament es fa al navegador, així que el document no s’envia a cap servidor. Si el PDF és un escaneig o només conté imatges, cal OCR, i aquesta eina no en fa.

Com s’utilitza

  1. 1Tria un PDF digital. Arrossega un PDF a l’eina o selecciona’l des del teu dispositiu. Per obtenir el millor resultat, comprova que pots seleccionar paraules amb el visor de PDF habitual.
  2. 2Extreu la capa de text. Fes clic a Extreu text. PDF.js llegeix cada pàgina localment i mostra el progrés sense enviar el fitxer a cap servidor.
  3. 3Revisa el text pla. Comprova paràgrafs, columnes, taules i símbols amb l’original. L’ordre de lectura del PDF pot diferir de l’ordre visual de la pàgina.
  4. 4Copia o descarrega. Edita el resultat si cal, copia’l al porta-retalls o desa’l com a fitxer TXT en UTF-8.

Per a qui és

Aquest convertidor fa servir Mozilla PDF.js per llegir la capa de text existent de cada pàgina al teu dispositiu. Manté l’ordre de les pàgines i els salts de línia que hi consten, i després et dona un resultat de text pla editable. Les imatges, les tipografies, les columnes, les taules i el format visual no es conserven en la sortida TXT.

Hi ha un límit important: un PDF digital guarda caràcters que es poden seleccionar i cercar. Un escaneig pot guardar només una fotografia de la pàgina. Extreure el primer tipus és parsejar text; llegir el segon requereix reconeixement òptic de caràcters. Aquesta eina només fa la primera feina.

Preguntes freqüents

Els meus PDF es pugen a un servidor?

No. El navegador llegeix el PDF seleccionat localment amb PDF.js, i el fitxer no s’envia a CanDoYa. El codi del motor PDF pot descarregar-se la primera vegada que fas servir l’eina, però el teu document no forma part d’aquesta petició.

Aquest convertidor PDF a text és gratuït?

Sí. Pots extreure, editar, copiar i descarregar text sense compte, marca d’aigua ni pagament. La feina es fa al teu dispositiu, així que no hi ha cua de conversió en servidor ni cap fitxer pujat que hagis de recuperar més tard.

Quins són els límits de mida i de pàgines del PDF?

L’eina admet un sol PDF de fins a 100 MB i 2.000 pàgines. La memòria disponible i la velocitat del dispositiu poden imposar un límit pràctic més baix, sobretot en telèfons. Divideix un document molt gran en PDFs més petits si el navegador no el pot acabar.

Aquesta eina pot extreure text d’un PDF escanejat?

No, si l’escaneig només conté imatges de pàgina. Aquest convertidor llegeix text seleccionable existent i no fa OCR. Un PDF escanejat necessita una eina d’OCR que reconegui caràcters a partir de píxels. Alguns PDFs mixtos tenen text seleccionable en certes pàgines però no en d’altres; el resultat indica les pàgines sense text.

Per què el text extret surt en un ordre incorrecte?

Les pàgines PDF situen fragments de text amb coordenades i poden no desar un ordre clar de paràgrafs o columnes. PDF.js segueix els elements de text i els salts de línia del document, i això pot diferir de l’ordre visual de lectura en dissenys de diverses columnes, taules, encapçalaments o formularis complexos.

PDF a text conserva el format i les imatges?

No. Els fitxers TXT només contenen caràcters plans, així que les tipografies, els colors, les imatges, els enllaços, les columnes i les vores de taula no es conserven. Els salts de línia venen de la capa de text del PDF i potser s’hauran d’editar després de l’extracció.

Per què s’ha rebutjat el meu PDF protegit amb contrasenya?

El navegador no pot llegir un document xifrat sense la contrasenya. Obre el PDF en un visor de confiança, introdueix la contrasenya i desa una còpia desbloquejada si tens permís. Després afegeix aquesta còpia al convertidor.

Quins idiomes es poden extreure d’un PDF?

L’analitzador no depèn d’un sol idioma. Pot retornar text Unicode en qualsevol escriptura quan el PDF conté una taula de caràcters correcta i text seleccionable. Si un document fa servir mapatges de font inexistents o personalitzats, els caràcters copiats encara poden ser incomplets o incorrectes.