返回工具箱

OCR 文字识别

从 PDF 中提取文字内容

本地处理 · 即关即删

点击上传 PDF,或拖到此处

支持 .pdf 格式 · 自动检测扫描件

工具介绍

在线 PDF OCR 文字识别工具,结合 pdf.js 文本提取和 Tesseract.js 光学字符识别技术。对于已有文本层的 PDF 可直接快速提取,对于扫描件 PDF 自动启用 OCR 识别,支持中英文。

使用说明

  1. 1上传 PDF 文件。
  2. 2系统自动判断是否为扫描件:文本型直接提取,图片型启用 OCR。
  3. 3选择识别语言(中文 / 英文 / 中英混合)。
  4. 4查看识别结果,可一键复制或下载为 TXT 文件。

小贴士

  • 文本型 PDF 提取速度快、准确率高
  • 扫描件首次使用需要下载语言包(约 15-30MB)
  • 手写体、艺术字体识别准确率较低

相关工具