이 변환기는 오픈소스 Tesseract OCR 엔진의 브라우저 포트인 Tesseract.js 7을 사용합니다. 코드, WebAssembly 코어, 선택한 언어 데이터는 추출을 시작할 때만 불러옵니다. Tesseract는 별도의 백그라운드 프로세스(worker)에서 인식 작업을 처리하므로, 이미지 분석 중에도 페이지가 느려지지 않습니다.
OCR 정확도는 파일 형식보다 원본 상태에 더 크게 좌우됩니다. 똑바로 인쇄된 글자, 균일한 조명, 선명한 초점, 강한 대비, 충분한 해상도가 중요합니다. 작은 스크린샷은 확대하면 인식률이 오를 수 있고, 비뚤어진 페이지, 장식체, 칼럼, 손글씨, 빛 반사, 흐릿한 사진은 수작업 보정이 필요할 수 있습니다.