OCR 文字识别
从 PDF 中提取文字内容
本地处理 · 即关即删
点击上传 PDF,或拖到此处
支持 .pdf 格式 · 自动检测扫描件
工具介绍
在线 PDF OCR 文字识别工具,结合 pdf.js 文本提取和 Tesseract.js 光学字符识别技术。对于已有文本层的 PDF 可直接快速提取,对于扫描件 PDF 自动启用 OCR 识别,支持中英文。
使用说明
- 1上传 PDF 文件。
- 2系统自动判断是否为扫描件:文本型直接提取,图片型启用 OCR。
- 3选择识别语言(中文 / 英文 / 中英混合)。
- 4查看识别结果,可一键复制或下载为 TXT 文件。
小贴士
- 文本型 PDF 提取速度快、准确率高
- 扫描件首次使用需要下载语言包(约 15-30MB)
- 手写体、艺术字体识别准确率较低