В основе - Tesseract.js 7, браузерная версия открытого движка Tesseract OCR. Код, WebAssembly-ядро и выбранные языковые данные загружаются только при запуске распознавания. Tesseract выполняет обработку в отдельном фоновом процессе, поэтому страница остается отзывчивой, пока ваше устройство распознаёт текст на изображении.
Точность OCR больше зависит от качества исходника, чем от формата файла. Прямой напечатанный текст, равномерное освещение, четкий фокус, высокий контраст и достаточное разрешение - всё это помогает получить лучший результат. Маленькие скриншоты можно улучшить увеличением, а косые страницы, декоративные шрифты, колонки, рукописный текст, блики и размытые фото чаще требуют ручной проверки и исправлений.