Este convertidor utiliza Tesseract.js 7, la versión para navegador del motor OCR Tesseract de código abierto. El código, el núcleo WebAssembly y los datos del idioma seleccionado se descargan solo al iniciar la extracción. Tesseract realiza el reconocimiento en un proceso en segundo plano, por lo que la página sigue respondiendo mientras tu dispositivo procesa la imagen.
La precisión del OCR depende más de la calidad de la imagen que del formato del archivo. El texto impreso, recto, bien enfocado, con buen contraste y suficiente resolución mejora los resultados. Las capturas pequeñas pueden mejorar al ampliarlas, mientras que las páginas torcidas, fuentes decorativas, columnas, escritura a mano, reflejos y fotos borrosas suelen requerir corrección manual.