办公实测指南 · 本站原创样例
PDF 压缩前先检查什么:扫描页与文字页实测
同样是一页 A4,文件内部可能完全不同。用两种原始样例比较压缩结果,再决定是否继续降低质量。
作者:办公工具大全编辑 · 实测与更新:
打开 PDF 压缩先确定文件由什么组成
用 PDF 体检打开文件,查看每页的文字层和图片对象。扫描页通常把整张纸当作一幅图片保存;文字页把字形和排版指令写入文件。两种结构对压缩参数的反应不同。
本次扫描页含一张图片,没有可提取文字;文字样例含 940 个非空白字符,没有图片对象。这是结构差异,不代表文字内容是否准确。
按同一输入做两次对照
下载扫描原件,每次都重新选择它,分别设置质量 70 和 40,输出选择 PDF。不要把第一次的压缩文件当作第二次的输入,否则比较中混入了重复编码的影响。
对两份输出分别查看小字、表格细线和灰度纹理。缩略图看着相似不代表打印清晰;请在阅读器里按 100% 查看,并尝试打印需要交付的关键页。
如何解释实测差异
扫描原件 709772 字节,质量 70 输出 356760 字节,质量 40 输出 256435 字节;三者均为一页 A4,没有新增可搜索文字层。
文字样例由 5390 字节降到 1395 字节,主要来自文档结构与内容流优化。本样例没有图片,不能把这次下降归因于图像质量参数,更不能外推成所有文字 PDF 的压缩率。
什么时候停止继续压缩
达到接收方的文件上限,并且关键信息清楚,就应停止。已压缩图像再次转码可能几乎不变,也可能变大;不同格式的编码开销会影响小文件。
若仍超限,优先删除无关页面或按要求拆成多份。压缩不是 OCR,也不会自动修复歪斜、模糊和缺字。保留原件,避免把低清输出作为后续编辑源。
下载输入与实际输出
所有文件均为本站制作的合成样例,不含真实业务信息,可下载、修改并复现操作。PDF 使用 PyMuPDF 1.28.2 与本站接口处理,图片使用 Chromium 153 的 Canvas 编码;不同浏览器或版本可能输出不同体积。