スキャンPDFの文字認識は、こんなときに
スキャンした契約書から金額を一つ探すのに、最初から目で追った経験があると思います。スキャンはページ全体が写真なので、コンピューターから見ると文字が一つもない書類です。検索もコピーもできません。
このツールは写真の中の文字を読み取り、見えない文字の層として重ねます。見た目は元のままですが、そこからはCtrl+Fで探せて、ドラッグしてコピーできるようになります。ファイルは変換サーバーに送られて処理され、終わり次第すぐ削除されます。
使い方
- 1スキャンしたPDFをアップロードします。30MBまでです。
- 2「文字を認識する」を押すと、変換サーバーが1ページずつ読み取ります。ページ数が多いと数分かかることがあります。
- 3できたPDFを開き、検索やコピーができるか確かめてください。
よくある質問
- どのくらい正確ですか。
- 韓国語の見積書をいくつかの条件で試しました。きれいなスキャンはもちろん、2度ほど傾き、ノイズが乗り、ぼけて強く圧縮された「スマホ写真」の状態でも、6行すべて一字も違わずに読めました。ただしこれは良い条件です。影が落ちた写真や紙が反った状態、印字の薄いレシートはこれより落ちます。
- 見た目は変わりますか。
- 変わりません。元の画像はそのままで、その下に見えない文字を置きます。画面上は何も変わらず、ドラッグしたときに初めて選択範囲が現れます。
- 認識したあとPDFをWordにできますか。
- 今のところできません。Word変換に使っている道具が、この見えない文字層を飛ばすように作られているため、結果が空になります。一方「PDF → Excel」はこの層を読み取れます。表のあるスキャンなら、そちらへ進んでみてください。
- どの言語を読みますか。
- 韓国語と英語です。韓国語の書類に混ざった英文の社名や数字も一緒に読みます。日本語・中国語の書類には対応していません。
- すでに文字があるPDFに使ってもよいですか。
- 使えますが損です。元の文字を捨ててページを写真に変え、読み直すことになるので、正確だった文字が認識結果に置き換わり、容量も増えます。すでに検索できるPDFはそのままにしてください。