CanDoYa
BG

Конвертиране на изображение в текст

Работи изцяло в браузъра - без качване и без регистрация.

Изберете изображение с ясен печатен текст, за да започнете.

Споделете този инструмент

Как работи конвертирането от изображение в текст?

Конверторът от изображение в текст използва оптично разпознаване на знаци (OCR), за да открие отпечатани символи в снимка или сканирана страница и ги върне като текст. Този инструмент стартира Tesseract WebAssembly във вашия браузър, обхваща езиците, използвани във всички 40 CanDoYa локала, и ви позволява да копирате или изтеглите резултата без да качвате изходното изображение.

Как се използва

  1. 1Изберете ясно изображение. Плъзнете JPEG, PNG, WebP, BMP или неанимиран GIF до 15 MB и 24 мегапиксела, или заредете вградения пример.
  2. 2Изберете езика на текста. Изберете езика, който реално е отпечатан на изображението. Данните за съответния език се изтеглят при стартиране на извличането.
  3. 3Извлечете и проверете. Стартирайте OCR, сравнете имена и числа с оригинала, коригирайте грешки и след това копирайте текста или го изтеглете като UTF-8 TXT файл.

За кого е

Този конвертор използва Tesseract.js 7 - браузърна версия на отворения Tesseract OCR engine. Кодът, WebAssembly ядрото и избраните езикови данни се зареждат само когато стартирате извличането. Tesseract извършва разпознаването в отделен фонов процес, така че страницата остава бърза, докато устройството ви обработва изображението.

Точността на OCR зависи основно от качеството на източника, а не от файловия формат. Прав, ясен печатен текст, равномерна светлина, остър фокус, силен контраст и достатъчно пикселни детайли са от значение. Малките скрийншоти често се подобряват след увеличаване, докато наклонени страници, декоративни шрифтове, колони, ръкопис, отблясъци и размазани снимки по-често изискват ръчна корекция.

Често задавани въпроси

Качва ли се изображението на сървър?

Не. Избраният файл се декодира и разпознава на вашето устройство от Tesseract като фонов процес. Браузърът изтегля публичните OCR и езикови файлове от външни хостове, но тези заявки не съдържат вашето изображение. CanDoYa не получава и не съхранява изходното изображение или извлечения текст.

Наистина ли този конвертор от изображение в текст е безплатен?

Да. Не изисква регистрация, плащане, кредити или такса за изтегляне на резултата. Вашето устройство извършва обработката. Първоначалното изтегляне на OCR engine и езикови файлове използва вашия интернет, а по-големите езикови модели могат да са значими при ограничен трафик.

Какви формати и размери на изображения се поддържат?

Може да обработвате едно изображение във формат JPEG, PNG, WebP, BMP или неанимиран GIF до 15 MB и 24 мегапиксела. Тези ограничения намаляват риска от сривове на телефони и лаптопи. Инструментът работи само с изображения - за цели PDF страници използвайте специализиран OCR за сканирани PDF файлове.

Колко точен е OCR при конвертиране на изображение в текст?

Чистият печатен текст обикновено се разпознава добре, но няма гаранция за пълна точност. Остър фокус, големи букви, висок контраст, права страница и правилен език подобряват резултата. Ръкопис, необичайни шрифтове, отблясъци, размазване, таблици, колони и смесени посоки могат да доведат до грешки или разместени редове.

Може ли да извлича ръкописни бележки?

Може да разчете много четлив печатен ръкопис, но този инструмент на Tesseract е предназначен основно за отпечатан текст. Свързан ръкопис и неравномерни букви са много по-несигурни. Третирайте ръкописа като чернова и винаги проверявайте важните думи, дати и числа спрямо оригиналното изображение.

Кой език да избера за текста?

Изберете езика, използван от знаците в изображението, а не езика на браузъра. Списъкът обхваща езиците, използвани във всички 40 CanDoYa локала, включително отделно опростен и традиционен китайски. Ако на страницата има няколко езика, изберете основния; тази версия зарежда един езиков модел на извличане.

Защо първото извличане е по-бавно?

Браузърът първо трябва да зареди кода на Tesseract.js, съвместимо WebAssembly ядро и обучените данни за избрания език. Кеширането може да ускори следващите опити, но режим инкогнито, почистване на паметта, нов език или изчистване на кеша може да изискват ново изтегляне.

Мога ли да използвам извлечения текст без проверка?

Прегледайте го първо, особено имена, суми, дати, пунктуация и знаци, които си приличат, като O и 0 или l и 1. Показаната увереност е обща оценка от Tesseract. Тя не удостоверява всяка дума и не запазва точния визуален ред от оригинала.