PDF 提取文字
本地运行,数据不上传服务器
文件在浏览器本地处理,不会上传服务器
使用说明
拿到电子合同或论文想复制其中的文字,但 PDF 不让你选;扫描件 PDF 完全没文字层,手动打字太累;整理会议资料时需要把内容粘到笔记软件;手头只有纸质文件扫描的 PDF,需要转成可检索文字。 这个工具逐页提取 PDF 的文本层,对没有文本层的扫描页可以启用本地 OCR 识别简体中文、繁体中文或英文。识别在 Web Worker 和本地语言模型中运行,PDF 和识别文本不上传服务器。 结果按页展示,也可以合并成全文,复制或下载为 UTF-8 TXT。适合处理合同、论文、扫描件、会议资料的人。多栏排版、表格、倾斜、模糊或手写内容的识别顺序和准确率无法保证。
核心功能
- ✓逐页提取 PDF 的文本层
- ✓扫描页可启用本地 OCR 识别
- ✓支持简体中文、繁体中文和英文
- ✓结果按页展示,也可合并全文
- ✓复制或下载为 UTF-8 TXT
- ✓OCR 在本地 Worker 中运行
- ✓不提供日文、韩文语言包
使用教程
1. 提取电子合同文字:上传 PDF,直接拿到文本层文字,复制到笔记或文档。 2. 扫描件转可检索文本:扫描 PDF 没有文本层时启用 OCR,识别出可复制的文字。 3. 整理会议资料:把整份资料的文本提取出来,统一整理到笔记软件。 4. 按页查看识别结果:一页一页核对,发现识别问题可以单独修正。 5. 下载 TXT 存档:全文合并后下载成 TXT 文件,方便长期保存或搜索。
常见问题
Q:支持日文、韩文吗?
A:不支持,只提供简体中文、繁体中文和英文语言包。
Q:扫描件的识别准确率如何?
A:多栏、表格、倾斜、模糊或手写内容无法保证顺序和准确率,需要人工核对。
Q:OCR 需要联网吗?
A:不需要,识别在本地 Worker 和语言模型中完成。
Q:文件有大小限制吗?
A:高配设备最多 50MB、500 页,中配 20MB、200 页,低配 10MB、50 页。
Q:可以只对某些页做 OCR 吗?
A:可以选择是否对无文本页启用 OCR,有文本层的页直接提取文字。
Q:文件会上传服务器吗?
A:不会,提取和识别都在浏览器本地完成。