← 全部实测指南

办公实测指南 · 本站原创样例

PDF 看得到字却复制不了:用体检区分文字层与扫描页

一份 PDF 可以同时包含文字页和扫描页。用两页混合样例逐页检查,避免整份文件盲目做 OCR。

作者:办公工具大全编辑 · 实测与更新:

打开 PDF 文件体检

下载两页混合样例

样例第一页由可搜索文字组成,第二页是一幅含字的扫描图,两页显示尺寸都是 210 × 297 毫米。它们视觉上都有字,但内部结构不同。

把混合样例上传体检,页面会列出每页尺寸、纸型、旋转角度、可提取字符数和图片对象数。处理会上传服务器;请先用公开样例熟悉流程。

核对预期结果

第一页应显示“含文字层”,非空白字符数 940,图片对象 0;第二页应显示“图片页,可能是扫描件”,字符数 0,图片对象 1。总页数为 2。

“可能是扫描件”是基于图片与文字对象的结构判断。照片、海报也可能得到同样结果;工具不会通过这个标签判定文件用途或内容真伪。

文字层并不保证复制正确

有些扫描 PDF 经过 OCR 后同时包含图片和隐藏文字层。体检会把它列为含文字层,但识别可能存在错字、阅读顺序错误或缺失。请实际复制一段文字,核对数字与分栏顺序。

矢量轮廓字虽然看起来像文字,也可能没有可提取字符。体检报告无文字、无图片时,并不一定是空白页,还可能是矢量图形。

按结果选择下一步

只有图片而需要可复制文字时,才考虑 OCR。本网站 PDF 编辑与 OCR 流程会调用第三方识别服务,上传前查看该功能的隐私说明,识别后人工校对。

只需要调整页面顺序或方向,不必先 OCR,直接使用页面整理。需要密码才能打开的 PDF 仅报告锁定状态,请在有权访问的前提下本地打开并另存。体检不替代签名验证和安全扫描。

下载输入与实际输出

所有文件均为本站制作的合成样例,不含真实业务信息,可下载、修改并复现操作。PDF 使用 PyMuPDF 1.28.2 与本站接口处理,图片使用 Chromium 153 的 Canvas 编码;不同浏览器或版本可能输出不同体积。

文件实际字节数下载
两页混合 PDF714813 B下载文件
单独的文字页5390 B下载文件
单独的扫描页709772 B下载文件