PDF OCR

光学文字認識(OCR)でスキャンしたPDFからテキストを抽出します。

PDFファイルをドラッグ&ドロップ、またはクリックして選択

PDFファイルに対応しています

使用例

スキャンした紙文書からテキストを取り出す

スキャナーや写真で紙の文書をPDF化した後、その中の文字を認識してコピー・編集可能なテキストに変換できます。

テキストレイヤーのないPDFを読み込む

pdf-to-textでは抽出できない、画像だけのPDFもOCRで内容を取り出せます。

複数の言語で書かれた文書を認識する

英語、韓国語、日本語など、希望する言語を選んでその言語の文書の認識精度を高められます。

よくある質問

アップロードしたPDFはサーバーに送信されますか?

いいえ。PDFを画像に変換してテキストを認識する処理はすべてブラウザ内で行われ、アップロードしたPDFやその内容がサーバーに送信されることはありません。唯一の例外は、選んだ言語の認識モデルファイルが初回利用時に公開CDNから1回だけダウンロードされることです — これは一般的なプログラムファイルであり、あなたの文書内容とは無関係です。

すでにテキストがある通常のPDFにも使えますか?

使えますが、すでにテキストレイヤーがあるPDFなら、より高速で正確な「PDFをテキストに変換」ツールの利用をおすすめします。OCRはスキャン文書のような画像だけのPDF向けの機能です。

認識精度はどの程度ですか?

スキャン品質、フォント、鮮明さによって変わります。高解像度で鮮明な文書ほど精度が高く、手書きやぼやけたスキャンは精度が下がることがあります。

ページ数が多いPDFはどのくらい時間がかかりますか?

ページごとに順番に認識するため、ページ数に比例して時間がかかります。時間がかかりすぎる場合は、処理中いつでもキャンセルボタンで中断できます。