Ce convertisseur utilise Mozilla PDF.js pour lire la couche de texte déjà présente sur chaque page, directement sur votre appareil. Il conserve l’ordre des pages et les retours à la ligne détectés, puis vous fournit un résultat en texte brut que vous pouvez modifier. Les images, polices, colonnes, tableaux et la mise en forme visuelle ne sont pas conservés dans le TXT.
Il y a une limite importante : un PDF numérique contient des caractères que les logiciels peuvent sélectionner et rechercher. Un scan peut, lui, ne contenir qu’une photo de page. Extraire le premier type de fichier relève de l’analyse de texte ; lire le second demande une reconnaissance optique de caractères. Cet outil ne fait que la première partie.