扫描版 PDF OCR
从没有文本层的扫描件或图片 PDF 中识别并提取文字 · 100% 浏览器内处理
1. 选择 PDF
2. 语言
识别语言
语言数据仅在首次使用时下载并缓存至浏览器。文件绝不会上传至服务器。
3. 执行
从没有文本层的扫描件或图片PDF中识别并提取文字。每一页都会被转换为图片并使用tesseract.js进行识别,文件绝不会上传至服务器。
您可以执行的操作
- ✓从扫描件或照片PDF中提取文本
- ✓支持韩语+英语、英语、日语、中文识别
- ✓在屏幕上查看识别结果,支持复制或保存为TXT
- ✓批量处理多页(前30页)
- ✓100%浏览器内处理 — 无需上传
使用方法
- 1上传扫描版PDF
- 2选择识别语言并点击“识别文本”
- 3复制结果或下载为TXT文件
支持的格式 · PDF (输入) → 文本/TXT