이 변환기는 Mozilla PDF.js로 기기에서 각 페이지의 기존 텍스트 레이어를 읽습니다. 페이지 순서와 감지된 줄바꿈을 유지한 뒤, 편집할 수 있는 하나의 일반 텍스트 결과로 보여 줍니다. TXT 출력에서는 이미지, 글꼴, 열, 표, 시각적 서식은 보존되지 않습니다.
중요한 경계가 하나 있습니다. 디지털 PDF는 소프트웨어가 선택하고 검색할 수 있는 문자를 저장합니다. 스캔본은 페이지의 사진만 담고 있을 수 있습니다. 앞의 경우를 추출하는 것은 텍스트 파싱이고, 뒤의 경우를 읽으려면 OCR, 즉 광학 문자 인식이 필요합니다. 이 도구는 첫 번째 작업만 합니다.