为什么同样一份PDF,有的能压掉一半体积,有的却几乎压不动?这要从PDF的文件结构说起。

PDF文件里存着文字、图片、字体等多种数据。文字是以矢量形式记录的,本身就很精简,占不了多少空间;真正占体积的往往是内嵌的高分辨率图片、完整字体文件和一些冗余数据。

压缩主要做四件事

  • 图片降采样:把300DPI的高清图片降到适合屏幕阅读的150DPI,体积大幅下降,肉眼几乎看不出区别
  • 图片重新编码:用更高效的算法重新压缩图片,把无损格式转成有损格式
  • 字体子集化:只保留文档中实际用到的字符,删掉字体文件里没用到的部分
  • 清理冗余:移除编辑历史、多余元数据和重复对象,优化内部结构

为什么效果差别大

压缩的收益主要来自图片。扫描件、设计稿这类图片多的PDF可压缩空间大,常常能减半以上;纯文字PDF本身已经很小,再压空间有限。理解这一点,就能对压缩效果有合理预期。