CanDoYa
FR

PDF en texte

Fonctionne entièrement dans votre navigateur : aucun envoi, aucune inscription.

Choisissez un PDF numérique pour extraire le texte sélectionnable.

Partager cet outil

Comment convertir un PDF en texte ?

Utilisez ce convertisseur PDF en texte pour extraire le texte sélectionnable déjà présent dans un PDF numérique, puis copiez-le ou téléchargez un fichier TXT. Le traitement s’exécute dans votre navigateur, donc le document n’est pas envoyé sur un serveur. Les PDF scannés composés uniquement d’images nécessitent un OCR, et cet outil ne fait pas d’OCR.

Comment l’utiliser

  1. 1Choisissez un PDF numérique. Déposez un seul PDF dans l’outil ou sélectionnez-le depuis votre appareil. Pour de meilleurs résultats, vérifiez que vous pouvez بالفعل sélectionner des mots dans votre lecteur PDF habituel.
  2. 2Extrayez la couche de texte. Cliquez sur Extraire le texte. PDF.js lit chaque page localement et affiche la progression sans envoyer le fichier à un serveur.
  3. 3Relisez le texte brut. Contrôlez les paragraphes, colonnes, tableaux et symboles par rapport au document d’origine. L’ordre de lecture d’un PDF peut différer de l’ordre visuel de la page.
  4. 4Copiez ou téléchargez. Modifiez le résultat si besoin, copiez-le dans le presse-papiers ou enregistrez-le au format TXT UTF-8.

Pour qui

Ce convertisseur utilise Mozilla PDF.js pour lire la couche de texte déjà présente sur chaque page, directement sur votre appareil. Il conserve l’ordre des pages et les retours à la ligne détectés, puis vous fournit un résultat en texte brut que vous pouvez modifier. Les images, polices, colonnes, tableaux et la mise en forme visuelle ne sont pas conservés dans le TXT.

Il y a une limite importante : un PDF numérique contient des caractères que les logiciels peuvent sélectionner et rechercher. Un scan peut, lui, ne contenir qu’une photo de page. Extraire le premier type de fichier relève de l’analyse de texte ; lire le second demande une reconnaissance optique de caractères. Cet outil ne fait que la première partie.

Questions fréquentes

Mes fichiers PDF sont-ils envoyés sur un serveur ?

Non. Votre navigateur lit le PDF sélectionné localement avec PDF.js, et le fichier n’est pas envoyé à CanDoYa. Le code du moteur PDF peut se télécharger lors de la première utilisation, mais votre document ne fait pas partie de cette requête.

Ce convertisseur PDF en texte est-il gratuit ?

Oui. Vous pouvez extraire, modifier, copier et télécharger le texte sans compte, sans filigrane et sans paiement. Le traitement s’exécute sur votre appareil, donc il n’y a ni file d’attente serveur ni fichier à récupérer plus tard.

Quelles sont les limites de taille et de pages d’un PDF ?

L’outil accepte un seul PDF jusqu’à 100 Mo et 2 000 pages. La mémoire disponible et la vitesse de l’appareil peuvent imposer une limite pratique plus basse, surtout sur mobile. Si le document est trop volumineux, découpez-le en plusieurs PDF plus petits si le navigateur ne termine pas.

Cet outil peut-il extraire le texte d’un PDF scanné ?

Pas si le scan ne contient que des images de pages. Ce convertisseur lit le texte sélectionnable existant et ne fait pas d’OCR. Un PDF scanné a besoin d’un outil OCR capable de reconnaître les caractères à partir des pixels. Certains PDF mixtes contiennent du texte sélectionnable sur certaines pages, mais pas sur d’autres ; le résultat signale les pages sans texte.

Pourquoi le texte extrait est-il dans le mauvais ordre ?

Les pages PDF placent les fragments de texte à des coordonnées précises et ne stockent pas toujours un ordre clair des paragraphes ou des colonnes. PDF.js suit les éléments de texte et les retours à la ligne du document, ce qui peut différer de l’ordre de lecture visuel dans les mises en page en colonnes, les tableaux, les en-têtes ou les formulaires complexes.

PDF en texte conserve-t-il la mise en forme et les images ?

Non. Les fichiers TXT ne contiennent que des caractères bruts, donc les polices, couleurs, images, liens, colonnes et bordures de tableaux ne sont pas conservés. Les sauts de ligne proviennent de la couche de texte du PDF et peuvent nécessiter une retouche après extraction.

Pourquoi un PDF protégé par mot de passe est-il refusé ?

Le navigateur ne peut pas lire un document chiffré sans son mot de passe. Ouvrez le PDF dans un lecteur de confiance, saisissez le mot de passe, puis enregistrez une copie déverrouillée si vous êtes autorisé à le faire. Ajoutez ensuite cette copie dans le convertisseur.

Quelles langues peuvent être extraites d’un PDF ?

L’analyseur n’est pas limité à une langue. Il peut restituer du texte Unicode dans n’importe quel alphabet lorsque le PDF contient une table de correspondance des caractères correcte et une couche de texte sélectionnable. Si un document utilise des mappings de police manquants ou personnalisés, les caractères copiés peuvent néanmoins rester incomplets ou erronés.