CanDoYa
UK

PDF у текст - конвертер для витягнення тексту

Працює повністю у вашому браузері - без завантаження на сервер і без реєстрації.

Оберіть цифровий PDF, щоб витягнути доступний для виділення текст.

Поділитися інструментом

Як перетворити PDF у текст?

Скористайтеся цим конвертером PDF у текст, щоб витягнути вже наявний у цифровому PDF текстовий шар, а потім скопіюйте його або завантажте TXT-файл. Обробка відбувається у вашому браузері, тому документ не завантажується на сервер. Для відсканованих PDF, де слова зберігаються лише як зображення, потрібен OCR, а цей інструмент OCR не виконує.

Як користуватися

  1. 1Оберіть цифровий PDF. Перетягніть один PDF у інструмент або виберіть його на пристрої. Для кращого результату переконайтеся, що ви можете виділяти слова у звичному переглядачі PDF.
  2. 2Витягніть текстовий шар. Натисніть «Витягнути текст». PDF.js читає кожну сторінку локально і показує прогрес без надсилання файлу на сервер.
  3. 3Перевірте простий текст. Звірте абзаци, колонки, таблиці та символи з оригіналом. Порядок читання в PDF може відрізнятися від візуального порядку на сторінці.
  4. 4Скопіюйте або завантажте. За потреби відредагуйте результат, скопіюйте його в буфер обміну або збережіть як TXT у кодуванні UTF-8.

Кому це знадобиться

Цей конвертер використовує Mozilla PDF.js, щоб прочитати на вашому пристрої наявний текстовий шар кожної сторінки. Він зберігає порядок сторінок і зафіксовані розриви рядків, а потім показує один редагований результат у вигляді простого тексту. Зображення, шрифти, колонки, таблиці та візуальне форматування у TXT-виводі не зберігаються.

Є важлива межа: цифровий PDF зберігає символи, які можна виділити та знайти. Скан може містити лише фотографію сторінки. Витягнення першого типу - це аналіз тексту, а читання другого потребує оптичного розпізнавання символів. Цей інструмент виконує лише перше завдання.

Часті запитання

Чи завантажуються мої PDF файли на сервер?

Ні. Ваш браузер читає вибраний PDF локально за допомогою PDF.js, і файл не надсилається до CanDoYa. Код PDF-рушія може завантажитися під час першого використання інструмента, але ваш документ не входить до цього запиту.

Цей конвертер PDF у текст безкоштовний?

Так. Ви можете витягувати, редагувати, копіювати і завантажувати текст без акаунта, водяних знаків або оплати. Обробка відбувається на вашому пристрої, тож немає серверної черги і файлу, який потрібно потім забирати.

Які є обмеження на розмір і кількість сторінок PDF?

Інструмент приймає один PDF розміром до 100 МБ і до 2 000 сторінок. Доступна пам'ять і швидкість пристрою можуть накласти нижчу практичну межу, особливо на телефонах. Розбийте дуже великий документ на менші PDF, якщо браузер не може завершити роботу.

Чи може цей інструмент витягнути текст зі сканованого PDF?

Ні, якщо скан містить лише зображення сторінок. Цей конвертер читає вже наявний доступний для виділення текст і не виконує OCR. Для сканованого PDF потрібен OCR-інструмент, який розпізнає символи з пікселів. Деякі змішані PDF містять доступний для виділення текст на окремих сторінках, але не на всіх; результат позначає сторінки без тексту.

Чому витягнутий текст у неправильному порядку?

PDF розміщує текстові фрагменти за координатами і може не зберігати чіткий порядок абзаців або колонок. PDF.js дотримується текстових елементів документа і розривів рядків, а це може відрізнятися від візуального порядку читання в багатоколонкових макетах, таблицях, колонтитулах або складних формах.

Чи зберігає PDF у текст форматування та зображення?

Ні. TXT-файли містять лише прості символи, тому шрифти, кольори, зображення, посилання, колонки та межі таблиць не зберігаються. Розриви рядків беруться з текстового шару PDF і після витягнення можуть потребувати редагування.

Чому PDF із паролем відхиляється?

Браузер не може прочитати зашифрований документ без пароля. Відкрийте PDF у надійному переглядачі, введіть пароль і збережіть розблоковану копію, якщо маєте на це дозвіл. Потім додайте цю копію до конвертера.

Які мови можна витягнути з PDF?

Аналізатор не прив'язаний до однієї мови. Він може повертати Unicode-текст будь-якою писемністю, якщо PDF містить правильну карту символів і доступний для виділення текст. Якщо документ використовує відсутні або нестандартні відповідності шрифтів, скопійовані символи можуть бути неповними або неправильними.