CanDoYa
JA

PDFテキスト変換

すべてブラウザー内で動作します。アップロードも登録も不要です。

選択可能な文字を抽出するには、デジタルPDFを選んでください。

このツールをシェア

PDFをテキストに変換するには?

このPDFテキスト変換ツールを使うと、デジタルPDFに既に保存されている選択可能な文字列を抽出して、コピーまたはTXTファイルとして保存できます。処理はブラウザ内で実行されるため、文書はアップロードされません。スキャンした画像のみのPDFはOCRが必要ですが、このツールはOCRを行いません。

使い方

  1. 1デジタルPDFを選ぶ. PDFを1つドラッグ&ドロップするか、端末から選択します。普段使うPDFビューアで単語を選択できるか確認すると、結果の目安になります。
  2. 2テキストレイヤーを抽出する. 「テキスト抽出」をクリックします。PDF.js が各ページをローカルで読み取り、ファイルをサーバーに送らずに進行状況を表示します。
  3. 3プレーンテキストを確認する. 段落、段組み、表、記号が元PDFと合っているか確認します。PDFの読み取り順は、見た目のページ順と異なることがあります。
  4. 4コピーまたはダウンロードする. 必要に応じて結果を編集し、クリップボードへコピーするか、UTF-8 の TXT ファイルとして保存します。

こんな方に

この変換ツールは、Mozilla PDF.js を使って各ページに既にあるテキストレイヤーを端末上で読み取ります。ページ順と検出された改行を保ったまま、編集できるプレーンテキストとして結果を表示します。TXT出力では、画像、フォント、段組み、表、見た目のレイアウトは保持されません。

ここには重要な境界があります。デジタルPDFは、ソフトウェアで選択や検索ができる文字情報を保持します。一方、スキャンPDFはページの写真だけを持っていることがあります。前者を取り出すのはテキスト解析、後者を読むにはOCRが必要です。このツールは前者のみ対応です。

よくある質問

PDFファイルはサーバーにアップロードされますか?

いいえ。選択したPDFはブラウザがPDF.jsでローカルに読み取るだけで、ファイルがCanDoYaに送信されることはありません。PDFエンジンのコード自体は初回利用時にダウンロードされる場合がありますが、あなたの文書はその通信の一部ではありません。

このPDFテキスト変換は無料ですか?

はい。アカウント登録なし、透かしなし、料金なしで、抽出、編集、コピー、ダウンロードができます。処理は端末上で動くため、サーバー側の変換待ちや後で回収するためのアップロードはありません。

PDFのサイズとページ数の上限は?

1つのPDFにつき100 MB、2,000ページまで対応しています。実際には、端末のメモリや速度が先に限界になることがあり、特にスマートフォンではその傾向があります。非常に大きい文書は、ブラウザが完了できない場合に分割してください。

スキャンしたPDFの文字も抽出できますか?

ページ画像だけのスキャンPDFには対応しません。この変換ツールは既存の選択可能な文字を読むだけで、OCRは行いません。スキャンPDFには、画像の中の文字を認識するOCRツールが必要です。混在PDFでは、あるページはテキストあり、別のページはなしということもあり、その場合はテキストなしのページが示されます。

抽出した文字の順番が違うのはなぜですか?

PDFのページは、文字片を座標で配置しており、段落やカラムの明確な順序を持たないことがあります。PDF.js は文書内のテキスト項目と改行を追いますが、複数カラム、表、ヘッダー、複雑なフォームでは、見た目の読み順とずれることがあります。

PDFテキスト変換で書式や画像は保持されますか?

いいえ。TXTはプレーン文字だけを含むため、フォント、色、画像、リンク、段組み、表の罫線は保持されません。改行はPDFのテキストレイヤー由来で、抽出後に整える必要がある場合があります。

パスワード付きPDFが拒否されるのはなぜですか?

ブラウザは、パスワードなしでは暗号化された文書を読み取れません。PDFを信頼できるビューアで開き、パスワードを入力して、権限がある場合はロック解除済みのコピーを保存してください。そのコピーを変換ツールに追加します。

どの言語のPDFでも抽出できますか?

パーサーは特定の言語に固定されていません。PDFに正しい文字マップと選択可能なテキストがあれば、Unicode の文字列として返せます。ただし、欠落したフォントマッピングや独自の文字対応を使う文書では、コピーした文字が不完全または誤りになることがあります。