PDFテキスト抽出

PDFテキスト抽出はワンクリック。PDFをドロップして「テキストを抽出」を押すだけです。途中で切れた行はきれいな段落にまとめ、スキャンしたページは文字認識(OCR)で読み取ります。処理はすべてブラウザ内で、ファイルはアップロードされません。

出典:Adobe – ISO 32000-1:2008 Document management – Portable document format (PDF 1.7)。更新日:

ここにファイルをドラッグ&ドロップ または

PDFファイル1つ(200MBまで)

ファイルはブラウザー内だけで処理され、アップロードされません。お使いの端末の外に出ることはありません。

抽出したテキスト

PDFファイルを選んで「テキストを抽出」を押してください。

マイツールボックス

結果

計算方法

PDFから文章をコピーすると、文の途中の改行や、段組みが混ざったりしてがっかりすることがよくあります。このツールはpdf.jsでPDFのテキスト層を読み取り、ページ上の位置をもとに文字の断片を行にまとめ、さらに段落へつなげます。結果はその場で編集でき、コピーやTXTファイル(UTF-8)での保存も可能です。

使い方

  1. PDFをドロップするか選択します。
  2. テキストの形を選びます。「段落」は続けて編集しやすい文章に、「PDFと同じ行」は改行をそのまま残します(住所や箇条書き向け)。
  3. 必要なら「ページの区切りを入れる」にチェックすると、各ページの前に「--- 3ページ ---」が入ります。
  4. 「テキストを抽出」を押して確認し、コピーまたは保存します。抽出後にオプションを変えても、PDFを読み直す必要はありません。

スキャンPDFは文字認識(OCR)で

スキャンPDFはテキスト層のない画像です。1ページの文字数が20未満なら、そのページを約300dpiで描画し、画像から文字起こしでも使っている無料のOCRエンジンTesseractで読み取ります。文書の言語を選んでください。1ページ数秒かかり、きれいなスキャンなら高精度ですが、手書きや不鮮明なコピーは苦手です。日本語の縦書きには対応していません。

制限

プライバシー

PDFは端末の外に出ません。このサイトから読み込むのはPDFエンジンと、必要な場合のOCRだけで、第三者のサービスは文書を見ません。メモやAIチャット向けに構造化したテキストが欲しいならPDF Markdown 変換が便利です。

よくある質問

PDFのテキストを無料で抽出するには?

PDFをここにドロップして「テキストを抽出」を押します。ワンクリックでコピー、またはTXTで保存できます。登録もアップロードも不要です。

スキャンしたPDFの文字を抽出できますか?

できます。「スキャンしたページをOCRで読み取る」をオンのまま、文書の言語を選んでください。テキスト層のないページは自動でOCRにかかります。

コピーしたテキストに改行が多いのはなぜ?

PDFは文章を1行ずつ保存しているためです。「段落」を選ぶと、つながる行をまとめ、行末のハイフネーションも取り除きます。

抽出したテキストをWordに貼り付けられますか?

はい。「コピー」を押して貼り付けてください。見出しや段落を保ったWordファイルが必要なら「PDF DOCX 変換」を使います。

PDFはアップロードされますか?

いいえ。読み取りもOCRもすべてブラウザ内で行われます。

文字化けや四角だけが表示されるのはなぜ?

PDFのフォントが実際の文字と対応付けられていないためです。「全ページをOCRで読み取る」にチェックして再度抽出すると、印字された文字をOCRで読み取ります。

出典・根拠

更新日:

関連ツール