スキャンPDF OCR
テキストレイヤーのないスキャン・画像PDFから文字を認識して抽出します · 100%ブラウザ処理
1. PDFを選択
2. 言語
認識言語
言語データは初回使用時に一度だけダウンロードされ、ブラウザにキャッシュされます。ファイルはサーバーへ送信されません。
3. 実行
テキストレイヤーのないスキャン・画像PDFから文字を認識して抽出します。各ページを画像化しtesseract.jsで認識します。ファイルはサーバーへ送信されません。
できること
- ✓スキャン・写真PDFからテキストを抽出
- ✓韓国語+英語・英語・日本語・中国語の認識
- ✓認識結果を画面で確認し、コピーまたはTXT保存
- ✓複数ページの一括処理(先頭30ページ)
- ✓100%ブラウザ内で処理 — アップロードなし
使い方
- 1スキャンPDFを追加します
- 2認識言語を選択し「テキスト認識」をクリックします
- 3結果をコピーするか、TXTとしてダウンロードします
対応フォーマット · PDF (入力) → テキスト / TXT