OCR 文字识别
识别扫描件中的文字并叠加透明文本层,输出的 PDF 支持检索、选中与复制,可批量处理多文件。 · 免费 · 本地处理
拖拽文件到此处,或点击选择
支持多个 PDF 文件 · 全程本地处理,文件不上传
使用方法
- 01/上传扫描件或图像型 PDF 文件
- 02/选择识别语言、渲染精度与已有文字层页面的处理方式
- 03/执行识别并下载可检索的 PDF 文档
详细介绍
OCR 文字识别逐页分析文档中的图像内容,识别其中的文字及其位置,并在原页面上叠加一层不可见的文本。输出文档外观与原文件完全一致,但内容可被检索、选中与复制,也可被搜索引擎与文档管理系统索引。
支持简体中文、繁体中文与英文识别,可处理中英混排页面。识别引擎与语言数据在浏览器本地运行,文档不经过任何服务器。页数较多时处理耗时相应增加,进度条实时显示当前页码。
混合文档(部分页面已有文字层、部分页面为扫描图像)默认仅识别无文字层的页面,已有文字层原样保留,处理耗时显著降低;原文字层识别有误时可切换为强制重识别。
处理全程在浏览器本地完成,文件不上传服务器。
常见问题
- 识别后的文档外观会变化吗?
- 不会。识别文字以透明图层叠加在原页面上,页面外观与原文件完全一致,仅增加了可检索、可复制的文本层。
- 部分页面已有文字层的混合文档如何处理?
- 默认跳过已有文字层的页面,仅识别扫描页,速度更快且保留原文字层;若原文字层内容有误,可在选项中切换为强制重识别全部页面。
- 支持哪些语言?
- 支持简体中文、繁体中文、英文及中英混排。印刷体页面识别效果较好,手写文字不在适用范围。
- 如何提高识别质量?
- 识别效果取决于页面清晰度与排版复杂程度。请选择与文档匹配的语言,扫描件建议使用 300dpi 精度档。