PDF工房
変換サーバーで処理 · 終わり次第すぐ削除

スキャンPDFの文字認識

スキャン文書の文字を読み取り、検索できるようにします。

文字を読み取るスキャンPDFをアップロードしてください

スキャンや写真から作ったPDF · 最大30MB

スキャンPDFの文字認識は、こんなときに

スキャンした契約書から金額を一つ探すのに、最初から目で追った経験があると思います。スキャンはページ全体が写真なので、コンピューターから見ると文字が一つもない書類です。検索もコピーもできません。

このツールは写真の中の文字を読み取り、見えない文字の層として重ねます。見た目は元のままですが、そこからはCtrl+Fで探せて、ドラッグしてコピーできるようになります。ファイルは変換サーバーに送られて処理され、終わり次第すぐ削除されます。

使い方

  1. 1スキャンしたPDFをアップロードします。30MBまでです。
  2. 2「文字を認識する」を押すと、変換サーバーが1ページずつ読み取ります。ページ数が多いと数分かかることがあります。
  3. 3できたPDFを開き、検索やコピーができるか確かめてください。

よくある質問

どのくらい正確ですか。
韓国語の見積書をいくつかの条件で試しました。きれいなスキャンはもちろん、2度ほど傾き、ノイズが乗り、ぼけて強く圧縮された「スマホ写真」の状態でも、6行すべて一字も違わずに読めました。ただしこれは良い条件です。影が落ちた写真や紙が反った状態、印字の薄いレシートはこれより落ちます。
見た目は変わりますか。
変わりません。元の画像はそのままで、その下に見えない文字を置きます。画面上は何も変わらず、ドラッグしたときに初めて選択範囲が現れます。
認識したあとPDFをWordにできますか。
今のところできません。Word変換に使っている道具が、この見えない文字層を飛ばすように作られているため、結果が空になります。一方「PDF → Excel」はこの層を読み取れます。表のあるスキャンなら、そちらへ進んでみてください。
どの言語を読みますか。
韓国語と英語です。韓国語の書類に混ざった英文の社名や数字も一緒に読みます。日本語・中国語の書類には対応していません。
すでに文字があるPDFに使ってもよいですか。
使えますが損です。元の文字を捨ててページを写真に変え、読み直すことになるので、正確だった文字が認識結果に置き換わり、容量も増えます。すでに検索できるPDFはそのままにしてください。