CanDoYa
RU

PDF в текст

Работает прямо в браузере - без загрузки файлов и регистрации.

Выберите цифровой PDF, чтобы извлечь выделяемый текст.

Поделиться инструментом

Как перевести PDF в текст?

Используйте этот конвертер PDF в текст, чтобы извлечь выделяемый текст, уже сохраненный в цифровом PDF, а затем скопировать его или скачать TXT. Обработка идет прямо в вашем браузере, поэтому документ не загружается на сервер. Для сканов и PDF с одними изображениями нужен OCR, а этот инструмент OCR не выполняет.

Как пользоваться

  1. 1Выберите цифровой PDF. Перетащите один PDF в инструмент или выберите файл на устройстве. Для лучшего результата убедитесь, что вы можете выделять слова в обычном PDF-просмотрщике.
  2. 2Извлеките текстовый слой. Нажмите «Извлечь текст». PDF.js читает каждую страницу локально и показывает ход обработки, не отправляя файл на сервер.
  3. 3Проверьте обычный текст. Сверьте абзацы, колонки, таблицы и символы с оригиналом. Порядок чтения в PDF может отличаться от визуального порядка на странице.
  4. 4Скопируйте или скачайте. При необходимости отредактируйте результат, скопируйте его в буфер обмена или сохраните как TXT в кодировке UTF-8.

Кому пригодится

Этот конвертер использует Mozilla PDF.js для чтения существующего текстового слоя каждой страницы прямо на вашем устройстве. Он сохраняет порядок страниц и найденные переводы строк, а затем показывает один редактируемый результат в виде обычного текста. Изображения, шрифты, колонки, таблицы и визуальное оформление в TXT не сохраняются.

Здесь есть важное ограничение: цифровой PDF хранит символы, которые можно выделить и найти поиском. Скан может содержать только фотографию страницы. Извлечение первого типа - это разбор текста; чтение второго требует оптического распознавания символов. Этот инструмент делает только первое.

Вопросы и ответы

Мои PDF-файлы загружаются на сервер?

Нет. Браузер читает выбранный PDF локально с помощью PDF.js, и файл не отправляется в CanDoYa. Код PDF-движка может загрузиться при первом использовании инструмента, но ваш документ в этот запрос не входит.

Этот конвертер PDF в текст бесплатный?

Да. Вы можете извлекать, редактировать, копировать и скачивать текст без учетной записи, водяных знаков и оплаты. Обработка идет на вашем устройстве, поэтому нет серверной очереди и файла, который нужно потом забирать.

Какие есть ограничения по размеру и страницам PDF?

Инструмент принимает один PDF размером до 100 МБ и до 2 000 страниц. Доступная память и скорость устройства могут снизить практический предел, особенно на телефонах. Если документ слишком большой, разделите его на несколько PDF и попробуйте снова.

Можно ли извлечь текст из сканированного PDF?

Нет, если скан содержит только изображения страниц. Этот конвертер читает уже существующий выделяемый текст и не выполняет OCR. Для сканированного PDF нужен OCR-инструмент, который распознает символы по пикселям. В смешанных PDF на одних страницах может быть текст, а на других нет; результат отмечает страницы без текста.

Почему извлеченный текст идет в неправильном порядке?

В PDF фрагменты текста размещаются по координатам и могут не хранить явный порядок абзацев или колонок. PDF.js следует текстовым элементам и переводам строк документа, поэтому в много-колоночных макетах, таблицах, колонтитулах или сложных формах порядок может отличаться от визуального.

Сохраняет ли PDF в текст форматирование и изображения?

Нет. TXT содержит только обычные символы, поэтому шрифты, цвета, изображения, ссылки, колонки и границы таблиц не сохраняются. Переносы строк берутся из текстового слоя PDF и после извлечения могут потребовать правки.

Почему PDF с паролем отклоняется?

Браузер не может прочитать зашифрованный документ без пароля. Откройте PDF в доверенном просмотрщике, введите пароль и сохраните разблокированную копию, если у вас есть на это право. Затем добавьте в конвертер уже эту копию.

На каких языках можно извлекать текст из PDF?

Парсер не привязан к одному языку. Он может вернуть Unicode-текст на любом письме, если в PDF есть корректная карта символов и выделяемый текст. Если в документе используются отсутствующие или нестандартные сопоставления шрифтов, скопированные символы все равно могут быть неполными или неверными.