Aquest convertidor fa servir Tesseract.js 7, una adaptació al navegador del motor OCR de codi obert Tesseract. El codi, el nucli WebAssembly i les dades de llengua només es descarreguen quan inicies l’extracció. Tesseract fa el reconeixement en un procés en segon pla, així la pàgina segueix fluida mentre el teu dispositiu processa la imatge.
L’exactitud de l’OCR depèn més de la qualitat de la imatge que no pas del format. El text imprès recte, amb bona il·luminació, enfocament nítid, contrast fort i prou detall de píxels sol donar millors resultats. Les captures petites poden millorar si s’escalen, mentre que pàgines tortes, tipografies decoratives, columnes, manuscrits, reflexos i fotos borroses solen requerir més correcció manual.