OCR PDF quét
Nhận diện và trích xuất văn bản từ các tệp PDF dạng ảnh/quét không có lớp văn bản · Xử lý 100% trong trình duyệt của bạn
1. Chọn PDF
2. Ngôn ngữ
Ngôn ngữ nhận diện
Dữ liệu ngôn ngữ được tải xuống một lần trong lần sử dụng đầu tiên và được lưu vào bộ nhớ đệm của trình duyệt. Tệp không bao giờ được gửi đến máy chủ.
3. Chạy
Nhận diện và trích xuất văn bản từ các tệp PDF dạng quét hoặc hình ảnh không có lớp văn bản. Mỗi trang được chuyển thành hình ảnh và nhận diện bằng tesseract.js; tệp tin không bao giờ được gửi đến máy chủ.
Bạn có thể làm gì
- ✓Trích xuất văn bản từ PDF dạng quét hoặc ảnh
- ✓Nhận diện tiếng Hàn+Anh, Anh, Nhật, Trung
- ✓Xem kết quả trên màn hình, sao chép hoặc lưu dưới dạng TXT
- ✓Xử lý hàng loạt nhiều trang (30 trang đầu)
- ✓100% xử lý trong trình duyệt — không tải lên
Cách sử dụng
- 1Thêm tệp PDF dạng quét
- 2Chọn ngôn ngữ nhận diện và nhấn 'Nhận diện văn bản'
- 3Sao chép kết quả hoặc tải xuống dưới dạng TXT
Định dạng hỗ trợ · PDF (đầu vào) → văn bản / TXT
Công cụ liên quan