PDFから文字を取り出す — 埋め込みとOCRを自動で使い分け
PDFの文章をテキストとして取り出します。文字が埋め込まれていればそのまま正確に、スキャンされた画像だけのPDFなら自動でOCRに切り替えます。ファイルは端末の外に出ません。
PDFには二種類あります。文字が文字として入っているものと、紙をスキャンした画像が貼ってあるだけのものです。見た目では区別がつきませんが、前者は選択してコピーでき、後者はできません。
取り出し方も変わります。文字が入っていればそれをそのまま読み出せば正確です。画像だけなら、OCRで読み取るしかなく、誤りが混じります。このツールはまず埋め込まれた文字を探し、見つからないページだけOCRにまわします。
PDFの種類と結果
| PDFの作られ方 | 取り出し方 | 精度 |
|---|---|---|
| WordやWebから書き出した | 埋め込まれた文字 | 元の文章のまま |
| スキャナで紙を取り込んだ | OCR | 画質しだい。誤りが混じる |
| 文字入りと画像が混在 | ページごとに自動で切り替え | ページによる |
| パスワード保護 | 読み込めない | 保護を外してから |
文字が入っているのに取り出せない場合
PDFの作り方によっては、文字は入っていても順序がばらばらに取り出されることがあります。段組みの資料やレイアウトの凝った資料で起きやすく、左右の段が交互に混ざったような結果になります。
これはPDFの構造上の制約で、文字の位置は分かっても「どれが本文でどれが見出しか」までは書かれていないためです。取り出した後に整える前提で使ってください。
表もそのままの形では出てきません。行と列の対応が失われ、文字だけが並びます。表が重要な資料はPDFをJPGにして、必要な部分を目で写すほうが早いこともあります。
スキャンPDFの精度を上げる
OCRにまわる場合、元のスキャン画質がそのまま結果に出ます。300DPI以上でスキャンされたものは概ね読めますが、150DPI以下だと日本語はかなり厳しくなります。
傾いたまま取り込まれた書類、影の入ったスマートフォン撮影のPDFも精度が落ちます。可能なら取り込み直すのが最も確実です。
読み取った結果は必ず目で確認してください。数字や固有名詞は特に間違えやすく、そのまま使うと事故になります。
使うときのこつ
- •ページ数が多いPDFは時間がかかります。必要な範囲だけPDF分割で切り出してから読ませると速く終わります。
- •取り出した文章はそのままコピーできます。改行位置は元のレイアウトに従うので、整えてから使ってください。
- •OCRの言語は日本語を選んでください。英数字が多い資料では英語も併せると数字の精度が上がります。
- •PDFはどこにも送信されません。読み取りはすべてブラウザの中で行われます。
よくある質問
文字が取り出せません。
スキャンされた画像だけのPDFの可能性があります。その場合は自動でOCRに切り替わりますが、画質が低いと精度が落ちます。
順序がばらばらになります。
段組みや複雑なレイアウトのPDFで起きます。PDFの構造上、読む順序までは記録されていないためです。
表は取り出せますか?
行と列の対応は失われ、文字だけが並びます。表のまま使いたい場合は別の方法を検討してください。
ファイルはアップロードされますか?
されません。処理はすべてブラウザの中で行われます。
