CanDoYa
BG

PDF в текст

Работи изцяло в браузъра - без качване и без регистрация.

Изберете дигитален PDF, за да извлечете селектиращ се текст.

Споделете този инструмент

Как да конвертирам PDF в текст?

Използвайте този конвертор PDF в текст, за да извлечете селектиращия се текст, който вече е записан в дигитален PDF, след което го копирайте или изтеглете като TXT файл. Обработката се изпълнява в браузъра ви, така че документът не се качва. Сканираните PDF файлове, които съдържат само изображение, изискват OCR, а този конкретен инструмент не прави OCR.

Как се използва

  1. 1Изберете дигитален PDF. Пуснете един PDF в инструмента или го изберете от устройството си. За най-добър резултат проверете дали можете да селектирате думите в обичайния си PDF прегледач.
  2. 2Извлечете текстовия слой. Натиснете Извлечи текст. PDF.js чете файла локално и показва напредъка, без да изпраща документа към сървър.
  3. 3Прегледайте обикновения текст. Сверете абзаците, колоните, таблиците и символите с оригинала. Редът на четене в PDF може да се различава от визуалния ред на страницата.
  4. 4Копирайте или изтеглете. При нужда редактирайте резултата, копирайте го в клипборда или го запишете като TXT файл в UTF-8.

За кого е

Този конвертор използва Mozilla PDF.js, за да прочете съществуващия текстов слой на всяка страница на вашето устройство. Запазва реда на страниците и отчетените нови редове, а после ви дава един редактируем резултат в обикновен текст. Изображенията, шрифтовете, колоните, таблиците и визуалното форматиране не се запазват в TXT изхода.

Има важна граница: дигиталният PDF съхранява знаци, които софтуерът може да селектира и търси. Сканираният файл може да съдържа само снимка на страница. Извличането на първия вид е парсване на текст, а четенето на втория изисква оптично разпознаване на знаци. Този инструмент прави само първата задача.

Често задавани въпроси

Качват ли се PDF файловете ми на сървър?

Не. Браузърът ви чете избрания PDF локално с PDF.js и файлът не се изпраща към CanDoYa. Кодът на PDF engine може да се изтегли при първото използване на инструмента, но вашият документ не участва в това заявяване.

Този конвертор PDF в текст безплатен ли е?

Да. Можете да извличате, редактирате, копирате и изтегляте текст без акаунт, воден знак или плащане. Работата се изпълнява на вашето устройство, така че няма опашка за конвертиране на сървър и няма качен файл, който да търсите по-късно.

Какви са ограниченията за размер и страници на PDF?

Инструментът приема един PDF до 100 MB и 2 000 страници. Наличната памет и скоростта на устройството може да наложат по-ниска практическа граница, особено на телефон. Разделете много голям документ на по-малки PDF файлове, ако браузърът не може да завърши.

Може ли този инструмент да извлича текст от сканиран PDF?

Не, когато сканираният файл съдържа само изображения на страници. Този конвертор чете съществуващия селектиращ се текст и не прави OCR. Сканираният PDF има нужда от OCR инструмент, който разпознава знаци от пиксели. Някои смесени PDF файлове съдържат селектиращ се текст на отделни страници, но не и на други; резултатът отбелязва страници без текст.

Защо извлеченият текст е в грешен ред?

PDF страниците позиционират текстовите фрагменти чрез координати и може да не пазят ясен ред на абзаци или колони. PDF.js следва текстовите елементи и новите редове на документа, което може да се различава от визуалния ред на четене при много колони, таблици, колонтитули или сложни формуляри.

PDF в текст запазва ли форматиране и изображения?

Не. TXT файловете съдържат само обикновени знаци, така че шрифтове, цветове, изображения, връзки, колони и граници на таблици не се запазват. Новите редове идват от текстовия слой на PDF и може да изискват редакция след извличането.

Защо PDF защитен с парола се отхвърля?

Браузърът не може да прочете криптиран документ без паролата му. Отворете PDF в доверен прегледач, въведете паролата и запазете отключено копие, ако имате право. После добавете това копие в конвертора.

От кои езици може да се извлича текст от PDF?

Парсърът не е обвързан с един език. Той може да върне Unicode текст във всеки писменостен набор, когато PDF съдържа правилна карта на знаците и селектиращ се текст. Ако документът използва липсващи или персонализирани mappings на шрифтове, копираните знаци пак може да са непълни или грешни.