在第四十二期会员栏目中,我介绍了一种釜底抽薪的 PDF“脱敏”方案,即将 PDF 转换为纯图片,彻底消除 PDF 中的文本。由于新生成 PDF 本身就会重置元数据(metadata),之前的方案其实也覆盖了本文的脱敏功能——不过,若是文本类 PDF(PDF with Text),转换成图片未免粗暴了一些。向没有合作关系的机构发送文件时,我会采用前文所述的终极方案,彻底消除风险;而向合作伙伴或客户发送文件时,为方便对方浏览、复制文字,则设计了本方案:仅移除部分元数据,而不破坏 PDF 文件内容。
有必要澄清,为何元数据有可能泄漏隐私或商业秘密。PDF 元数据包括日期、来源等通用项,也含有标题、作者、项目名、创建者(一般是创建 PDF 的软件)和关键词等项目,它们通常是版权信息或其他权利声明,比如标题(title),即便你把文件名改了,PDF 的标题还是纹丝不动,有些人自作聪明搞拿来主义,结果就栽在元数据上面。另一些场合,发布者也可能不想留下痕迹,但自己或同事有意无意留下了元数据,暴露了来源,此时需求就成了如何去除元数据——不
