Ce convertisseur repose sur Tesseract.js 7, une adaptation pour navigateur du moteur OCR open source Tesseract. Le code, le noyau WebAssembly et les données linguistiques nécessaires ne se chargent qu’au lancement de l’extraction. Tesseract effectue la reconnaissance dans un processus en arrière-plan, ce qui maintient la page réactive pendant le traitement sur votre appareil.
La précision de l’OCR dépend surtout de la qualité de l’image d’origine. Un texte imprimé droit, une bonne netteté, un éclairage homogène, un contraste marqué et une résolution suffisante facilitent la reconnaissance. Les petites captures d’écran peuvent gagner en lisibilité après agrandissement, tandis que les pages inclinées, polices décoratives, colonnes, écritures manuscrites, reflets ou photos floues nécessitent souvent des corrections manuelles.