# 如何避免扫描版 PDF 超出 Google 翻译体积限额

> 本文开放前 70% 正文，剩余内容会员可见。

原文：https://utgd.net/article/21161

> 只送大脑。——《三体》

翻译服务如今已司空见惯，不过，PDF 文件因其格式特殊，依旧不易下手，通常只能在几家主流服务中选一个不那么糟糕的碰碰运气。相较之下，Google 的免费——甚至无需登录——额度较为大方，300页以内的文档可以正本翻译，就算要翻译整书，大不了拆成两三本。

但扫描版 PDF——本文显然在讨论已经 OCR（光线字符识别）处理过的 PDF，若无，通常须先处理——却依旧啃不动。这类文件，即便页数不多，却容易触及 Google 的另一个限制：体积大小不得超过 10MB。当然，我毫无责备 Google 之意，事实上，就所我见它已经是最大方的了。

扫描版 PDF 之大，在于其图片体积。若将 PDF 视作一份由多个图层组成的拼贴画，那么普通 PDF 就主要是文字图层，偶有一些配图；而扫描版 PDF 每一页皆是图片，待 OCR 处理后方才拥有文字图层，只不过这些文字完全透明，叠在图片上不会阻挡原始内容。一旦以这种材料视角看待 PDF，问题就简单了：我们本就不会处理图片图层，而是仅仅翻译那些透明的文字。

——把这些透明文字提取出来！

具体方法很多，我推荐稍稍学习一下命令行工具 ghostscript，它堪称 PDF 编辑领域的瑞士军刀，并且懂了一两句命令后旋能举一反三。从 PDF 中提取文字图层的 ghostscript 命令是：

```
gs -o "新文件路径" -sDEVICE=pdfwrite -dFILTERVECTOR -dFILTERIMAGE "原文件路径"
```

随后，将刚刚提取的纯文字版 PDF 上传到 Google 翻译，通常就可以一次性翻译。毕竟，在只有文字的情况下，文件体积一般不太可能超标，真正要操心的其实是页数，

---

[前往标准阅读页](https://utgd.net/article/21161?audience=web)
