办公实测指南 · 本站原创样例
PDF 看得到字却复制不了:用体检区分文字层与扫描页
一份 PDF 可以同时包含文字页和扫描页。用两页混合样例逐页检查,避免整份文件盲目做 OCR。
作者:办公工具大全编辑 · 实测与更新:
打开 PDF 文件体检下载两页混合样例
样例第一页由可搜索文字组成,第二页是一幅含字的扫描图,两页显示尺寸都是 210 × 297 毫米。它们视觉上都有字,但内部结构不同。
把混合样例上传体检,页面会列出每页尺寸、纸型、旋转角度、可提取字符数和图片对象数。处理会上传服务器;请先用公开样例熟悉流程。
核对预期结果
第一页应显示“含文字层”,非空白字符数 940,图片对象 0;第二页应显示“图片页,可能是扫描件”,字符数 0,图片对象 1。总页数为 2。
“可能是扫描件”是基于图片与文字对象的结构判断。照片、海报也可能得到同样结果;工具不会通过这个标签判定文件用途或内容真伪。
文字层并不保证复制正确
有些扫描 PDF 经过 OCR 后同时包含图片和隐藏文字层。体检会把它列为含文字层,但识别可能存在错字、阅读顺序错误或缺失。请实际复制一段文字,核对数字与分栏顺序。
矢量轮廓字虽然看起来像文字,也可能没有可提取字符。体检报告无文字、无图片时,并不一定是空白页,还可能是矢量图形。
按结果选择下一步
只有图片而需要可复制文字时,才考虑 OCR。本网站 PDF 编辑与 OCR 流程会调用第三方识别服务,上传前查看该功能的隐私说明,识别后人工校对。
只需要调整页面顺序或方向,不必先 OCR,直接使用页面整理。需要密码才能打开的 PDF 仅报告锁定状态,请在有权访问的前提下本地打开并另存。体检不替代签名验证和安全扫描。
下载输入与实际输出
所有文件均为本站制作的合成样例,不含真实业务信息,可下载、修改并复现操作。PDF 使用 PyMuPDF 1.28.2 与本站接口处理,图片使用 Chromium 153 的 Canvas 编码;不同浏览器或版本可能输出不同体积。