CanDoYa
PL

PDF na tekst

Działa w całości w przeglądarce - bez wysyłania plików i bez rejestracji.

Wybierz cyfrowy PDF, aby wyodrębnić selektowalny tekst.

Udostępnij to narzędzie

Jak zamienić PDF na tekst?

Użyj tego narzędzia PDF na tekst, aby wyodrębnić selektowalny tekst zapisany już w cyfrowym PDF, a potem skopiuj go albo pobierz jako plik TXT. Przetwarzanie odbywa się w Twojej przeglądarce, więc dokument nie jest wysyłany na serwer. Skanowane PDF-y z samymi obrazami stron wymagają OCR, a to narzędzie nie wykonuje OCR.

Jak korzystać

  1. 1Wybierz cyfrowy PDF. Upuść jeden PDF do narzędzia albo wybierz go z urządzenia. Dla najlepszego efektu sprawdź, czy możesz zaznaczać słowa w zwykłym podglądzie PDF.
  2. 2Wyodrębnij warstwę tekstową. Kliknij Wyodrębnij tekst. PDF.js odczyta każdą stronę lokalnie i pokaże postęp bez wysyłania pliku na serwer.
  3. 3Sprawdź zwykły tekst. Porównaj akapity, kolumny, tabele i znaki z oryginałem. Kolejność odczytu PDF może różnić się od wizualnej kolejności na stronie.
  4. 4Skopiuj lub pobierz. W razie potrzeby popraw wynik, skopiuj go do schowka albo zapisz jako plik TXT w UTF-8.

Dla kogo

Ten konwerter korzysta z Mozilla PDF.js do odczytu istniejącej warstwy tekstowej każdej strony bezpośrednio na Twoim urządzeniu. Zachowuje kolejność stron i zgłaszane podziały wierszy, a następnie zwraca jeden edytowalny wynik w postaci zwykłego tekstu. Obrazy, fonty, kolumny, tabele i wygląd wizualny nie są zachowywane w wyjściu TXT.

Ważne jest jedno ograniczenie: cyfrowy PDF zapisuje znaki, które można zaznaczyć i przeszukać. Skan może zawierać tylko zdjęcie strony. Wyodrębnianie pierwszego typu to parsowanie tekstu, a odczyt drugiego wymaga optycznego rozpoznawania znaków. To narzędzie robi tylko pierwszą rzecz.

Najczęstsze pytania

Czy moje pliki PDF są wysyłane na serwer?

Nie. Twoja przeglądarka odczytuje wybrany PDF lokalnie z użyciem PDF.js, a plik nie jest wysyłany do CanDoYa. Kod silnika PDF może pobrać się przy pierwszym użyciu narzędzia, ale Twój dokument nie jest częścią tego żądania.

Czy ten konwerter PDF na tekst jest darmowy?

Tak. Możesz wyodrębniać, edytować, kopiować i pobierać tekst bez konta, znaku wodnego i płatności. Praca odbywa się na Twoim urządzeniu, więc nie ma kolejki konwersji na serwerze ani potrzeby późniejszego odbierania pliku z chmury.

Jakie są limity rozmiaru i liczby stron PDF?

Narzędzie przyjmuje jeden PDF do 100 MB i 2 000 stron. Dostępna pamięć i szybkość urządzenia mogą narzucić niższy praktyczny limit, zwłaszcza na telefonach. Jeśli duży dokument nie chce się przetworzyć, podziel go na mniejsze pliki PDF.

Czy to narzędzie wyodrębni tekst ze skanowanego PDF?

Nie, jeśli skan zawiera wyłącznie obrazy stron. Ten konwerter czyta istniejący selektowalny tekst i nie wykonuje OCR. Skanowany PDF potrzebuje narzędzia OCR, które rozpoznaje znaki z pikseli. Niektóre mieszane PDF-y mają selektowalny tekst tylko na części stron, a wynik oznacza strony bez tekstu.

Dlaczego wyodrębniony tekst jest w złej kolejności?

Strony PDF rozmieszczają fragmenty tekstu w określonych współrzędnych i mogą nie przechowywać czytelnej kolejności akapitów lub kolumn. PDF.js podąża za elementami tekstowymi i podziałami wierszy dokumentu, co może różnić się od wizualnej kolejności czytania w układach wielokolumnowych, tabelach, nagłówkach lub złożonych formularzach.

Czy PDF na tekst zachowuje formatowanie i obrazy?

Nie. Pliki TXT zawierają wyłącznie zwykłe znaki, więc fonty, kolory, obrazy, linki, kolumny i obramowania tabel nie są zachowywane. Podziały wierszy pochodzą z warstwy tekstowej PDF i po wyodrębnieniu mogą wymagać poprawy.

Dlaczego PDF zabezpieczony hasłem jest odrzucany?

Przeglądarka nie może odczytać zaszyfrowanego dokumentu bez hasła. Otwórz PDF w zaufanym podglądzie, wpisz hasło i zapisz odblokowaną kopię, jeśli masz do tego prawo. Dopiero potem dodaj tę kopię do konwertera.

W jakich językach można wyodrębnić tekst z PDF?

Parser nie jest przypisany do jednego języka. Może zwrócić tekst Unicode w dowolnym alfabecie, jeśli PDF ma poprawną mapę znaków i selektowalny tekst. Jeśli dokument używa brakujących lub niestandardowych mapowań fontów, skopiowane znaki nadal mogą być niepełne albo błędne.