CanDoYa
FR

Convertisseur d’image en texte

Fonctionne entièrement dans votre navigateur : aucun envoi, aucune inscription.

Choisissez une image avec texte imprimé lisible pour commencer.

Partager cet outil

Comment fonctionne un convertisseur d’image en texte ?

Un convertisseur d’image en texte utilise la reconnaissance optique de caractères (OCR) pour détecter les caractères imprimés sur une photo ou un scan et restituer un texte modifiable. Cet outil exécute Tesseract WebAssembly directement dans votre navigateur, couvre les langues utilisées dans les 40 locales CanDoYa, et vous permet de copier ou télécharger le texte sans transfert de l’image source.

Comment l’utiliser

  1. 1Choisissez une image lisible. Déposez un fichier JPEG, PNG, WebP, BMP ou GIF (non animé) jusqu’à 15 Mo et 24 mégapixels, ou essayez l’exemple fourni.
  2. 2Sélectionnez la langue du texte. Choisissez la langue réellement imprimée sur l’image. Les données linguistiques Tesseract correspondantes sont téléchargées au lancement de l’extraction.
  3. 3Extrayez et vérifiez. Lancez l’OCR, comparez noms et chiffres avec l’image d’origine, corrigez si besoin, puis copiez le texte ou téléchargez-le au format TXT UTF-8.

Pour qui

Ce convertisseur repose sur Tesseract.js 7, une adaptation pour navigateur du moteur OCR open source Tesseract. Le code, le noyau WebAssembly et les données linguistiques nécessaires ne se chargent qu’au lancement de l’extraction. Tesseract effectue la reconnaissance dans un processus en arrière-plan, ce qui maintient la page réactive pendant le traitement sur votre appareil.

La précision de l’OCR dépend surtout de la qualité de l’image d’origine. Un texte imprimé droit, une bonne netteté, un éclairage homogène, un contraste marqué et une résolution suffisante facilitent la reconnaissance. Les petites captures d’écran peuvent gagner en lisibilité après agrandissement, tandis que les pages inclinées, polices décoratives, colonnes, écritures manuscrites, reflets ou photos floues nécessitent souvent des corrections manuelles.

Questions fréquentes

Mon image est-elle envoyée sur un serveur ?

Non. Le fichier sélectionné est traité localement sur votre appareil par un worker Tesseract. Le navigateur télécharge les fichiers publics du moteur OCR et des langues depuis des serveurs externes, mais ces requêtes n’incluent jamais votre image. CanDoYa ne reçoit ni ne stocke l’image source ni le texte extrait.

Ce convertisseur d’image en texte est-il gratuit ?

Oui. Il ne demande ni compte, ni paiement, ni filigrane, ni crédit de page, ni frais de téléchargement. Le traitement s’effectue sur votre appareil. Le téléchargement initial du moteur OCR et des données linguistiques utilise votre connexion internet, et les modèles de langue volumineux peuvent compter si votre forfait est limité.

Quels formats et tailles d’image sont pris en charge ?

Vous pouvez traiter un fichier JPEG, PNG, WebP, BMP ou GIF (non animé) jusqu’à 15 Mo et 24 mégapixels. Ces limites réduisent les risques d’erreur mémoire sur téléphone ou ordinateur portable. L’outil ne gère que les images : utilisez un OCR PDF dédié pour reconnaître des pages PDF scannées.

Quelle est la précision de la conversion image en texte par OCR ?

Un texte imprimé propre peut être bien reconnu, mais aucun résultat OCR n’est garanti. Une bonne netteté, des lettres grandes, un contraste élevé, une page droite et la langue correcte améliorent la précision. L’écriture manuscrite, les polices inhabituelles, les reflets, le flou, les tableaux, les colonnes ou les directions de lecture mixtes peuvent entraîner des erreurs ou des lignes réordonnées.

Peut-on extraire des notes manuscrites ?

Il est parfois possible de récupérer une écriture manuscrite très lisible, mais cet outil basé sur Tesseract est conçu principalement pour le texte imprimé. L’écriture cursive et les formes de lettres irrégulières sont beaucoup moins fiables. Considérez le résultat manuscrit comme un brouillon et vérifiez chaque mot, date et chiffre important avec l’image d’origine.

Quelle langue dois-je choisir ?

Choisissez la langue utilisée par les caractères sur l’image, pas celle de votre navigateur. La liste couvre les langues utilisées dans les 40 locales CanDoYa, y compris le chinois simplifié et traditionnel séparément. Si la page mélange plusieurs langues, sélectionnez la principale : un seul modèle de reconnaissance est chargé par extraction.

Pourquoi la première extraction est-elle plus longue ?

Le navigateur doit d’abord charger le code Tesseract.js, le noyau WebAssembly compatible et les données de la langue choisie. Le cache du navigateur accélère les utilisations suivantes, mais le mode privé, le nettoyage du stockage, un changement de langue ou la suppression du cache peuvent nécessiter un nouveau téléchargement.

Puis-je utiliser le texte extrait sans vérification ?

Relisez-le d’abord, surtout les noms, montants, dates, ponctuation et caractères similaires comme O et 0 ou l et 1. Le niveau de confiance affiché est une estimation générale. Il ne certifie pas chaque mot ni ne préserve la mise en page d’origine.