PDF

PDF OCR文字识别

使用设备端OCR从扫描或纯图片PDF中提取文本,然后下载为文本文件或Word文档。

使用方法

  1. 1

    拖放或选择扫描的PDF。

  2. 2

    点击运行OCR——首次运行会下载一个小型语言模型。

  3. 3

    处理完成后查看提取的文本。

  4. 4

    下载为纯文本文件或可编辑的Word文档。

功能特点

  • 设备端OCR——无需上传服务器
  • 适用于扫描页面和纯图片PDF
  • 可导出为.txt或.docx
  • 下载前可按页预览文本

常见问题

为什么首次运行需要更长时间?

首次使用会下载一个小型OCR语言模型,之后浏览器会将其缓存以便未来运行更快。

文本提取的准确度如何?

准确度很大程度上取决于扫描质量——使用标准字体的清晰、高分辨率扫描效果最好;模糊或低对比度的扫描可能出现更多错误。

支持哪些语言?

此工具目前使用英语OCR模型。

我扫描的PDF会被上传到哪里吗?

不会——OCR使用浏览器内引擎完全在您的设备上运行;不会向服务器发送任何内容。

相关工具