PDFテキスト抽出
PDFテキスト抽出はワンクリック。PDFをドロップして「テキストを抽出」を押すだけです。途中で切れた行はきれいな段落にまとめ、スキャンしたページは文字認識(OCR)で読み取ります。処理はすべてブラウザ内で、ファイルはアップロードされません。
出典:Adobe – ISO 32000-1:2008 Document management – Portable document format (PDF 1.7)。更新日:
計算方法
PDFから文章をコピーすると、文の途中の改行や、段組みが混ざったりしてがっかりすることがよくあります。このツールはpdf.jsでPDFのテキスト層を読み取り、ページ上の位置をもとに文字の断片を行にまとめ、さらに段落へつなげます。結果はその場で編集でき、コピーやTXTファイル(UTF-8)での保存も可能です。
使い方
- PDFをドロップするか選択します。
- テキストの形を選びます。「段落」は続けて編集しやすい文章に、「PDFと同じ行」は改行をそのまま残します(住所や箇条書き向け)。
- 必要なら「ページの区切りを入れる」にチェックすると、各ページの前に「--- 3ページ ---」が入ります。
- 「テキストを抽出」を押して確認し、コピーまたは保存します。抽出後にオプションを変えても、PDFを読み直す必要はありません。
スキャンPDFは文字認識(OCR)で
スキャンPDFはテキスト層のない画像です。1ページの文字数が20未満なら、そのページを約300dpiで描画し、画像から文字起こしでも使っている無料のOCRエンジンTesseractで読み取ります。文書の言語を選んでください。1ページ数秒かかり、きれいなスキャンなら高精度ですが、手書きや不鮮明なコピーは苦手です。日本語の縦書きには対応していません。
制限
- 表や段組みは行ごとに読むため、列が混ざることがあります。見出し付きの編集可能な文書が必要ならPDF DOCX 変換をどうぞ。
- 文字コード情報のないフォントを使ったPDFでは、四角や文字化けが出ます。その場合は「全ページをOCRで読み取る」にチェックしてください。
- パスワード付きPDFはパスワードを入力すれば開けます。コピー制限を回避する機能はありません。
プライバシー
PDFは端末の外に出ません。このサイトから読み込むのはPDFエンジンと、必要な場合のOCRだけで、第三者のサービスは文書を見ません。メモやAIチャット向けに構造化したテキストが欲しいならPDF Markdown 変換が便利です。
よくある質問
PDFのテキストを無料で抽出するには?
PDFをここにドロップして「テキストを抽出」を押します。ワンクリックでコピー、またはTXTで保存できます。登録もアップロードも不要です。
スキャンしたPDFの文字を抽出できますか?
できます。「スキャンしたページをOCRで読み取る」をオンのまま、文書の言語を選んでください。テキスト層のないページは自動でOCRにかかります。
コピーしたテキストに改行が多いのはなぜ?
PDFは文章を1行ずつ保存しているためです。「段落」を選ぶと、つながる行をまとめ、行末のハイフネーションも取り除きます。
抽出したテキストをWordに貼り付けられますか?
はい。「コピー」を押して貼り付けてください。見出しや段落を保ったWordファイルが必要なら「PDF DOCX 変換」を使います。
PDFはアップロードされますか?
いいえ。読み取りもOCRもすべてブラウザ内で行われます。
文字化けや四角だけが表示されるのはなぜ?
PDFのフォントが実際の文字と対応付けられていないためです。「全ページをOCRで読み取る」にチェックして再度抽出すると、印字された文字をOCRで読み取ります。
出典・根拠
- Adobe – ISO 32000-1:2008 Document management – Portable document format (PDF 1.7)
- pdf.js – getTextContent / getAnnotations (Mozilla, Apache-2.0)
- pdf.js 6.3.289 licence (Apache-2.0)
- Tesseract.js – OCR library for the browser (GitHub, Apache-2.0)
- Tesseract OCR documentation – Improving the quality of the output
- Unicode Standard – UTF-8 encoding form (TXT export)
- Open-source licenses of the libraries used (MIT, LGPL-3.0)
更新日:
関連ツール
- PDF → Markdown 変換PDFをMarkdownに変換。見出し・段落・箇条書き・リンクを.mdに。Obsidian、GitHub、メモ、ChatGPTやClaudeへの入力に。スキャンはOCR対応、アップロード不要です。
- PDFをDOCXに変換PDFをWordやLibreOfficeで編集できるDOCXにブラウザ内で変換。スキャンしたページはOCRで文字認識します。アップロード・登録不要、無料です。
- 画像の文字起こし(OCR)画像の文字起こしを無料で。写真・スキャン・スクリーンショットの文字をテキスト化してコピーできます。日本語・英語など11言語に対応し、画像はアップロードされません。
- PDF JPG変換:PDFをJPGに変換PDFをJPG・PNGに無料で変換。1ページずつ画像にし、72〜300dpiの高画質で個別またはZIPで保存できます。ブラウザ内で処理するのでアップロードは不要です。
- 改行削除・テキスト整形PDFからコピーした文章の改行を一括削除。余分な空白や空行、見えない文字の削除、重複行の削除、並べ替えもできるテキスト整形ツールです。
- BPM測定サイト:音声ファイルからBPMを測定曲のBPMを測定。音声ファイルを選ぶと、ブラウザー内でテンポを計算し、±の誤差、信頼度、半分・倍のテンポの候補まで表示します。無料でアップロード不要。