# 打破魔鬼的拖延：将网页存为面向阅读的 PDF

> 本文开放前 70% 正文，剩余内容会员可见。

原文：https://utgd.net/article/20904

有一个思想实验。假设你不小心被关进了地狱，恶魔向你承诺，你有机会尝试逃离，但是相比现在就付诸冒险，明天的成功概率会提升一点点——于是，恶魔的选择就产生了：考虑到明天的成功概率更大，一个人很有可能不断推迟越狱计划，结果就是在地狱中永无翻身之日。这个思想实验我暂未找到原始处处，不过，诸位熟悉的古谚“明日复明日，明日何其多”也足够概括其宏旨。

在现实世界中，我们也常常陷入恶魔的选择之中，尤其在讨论阅读工具时，永远没有一款完美的工具，直接结果就是：相当一部分人永远不会开始阅读，或起码永远不会开始严肃阅读。而网页阅读又属重灾区，姑且抛开本地与在线的圣战不谈，仅仅是基于何种格式，也足以让前者内部分裂，你甚至有幸发现，临时组成的在野党数量比参与讨论者人数还多。

——这，其实就掉进了工具生产商和经销商为我们打造的地狱，或局限在自己思维的地狱中。

本文尝试先确定讨论的前提，即以阅读为导向，在此基础上进一步讨论为何优先选择 PDF 保存网页，以及在理想情况下，怎样的 PDF 才更适合阅读。

## 何以是 PDF

一旦确定直接目的是阅读，那么，我们就不可能绕过 Hum 所言的不可能三角：

> 在线信息保存这一步现在有一个不可能三角：1\. 保存过程；2\. 便捷排版简洁；3\. 信息属于自己。

根据选择工具或方法的材料原则，选对材料，其余将势如破竹，而就保存在线文章来说，大概最合适的材料还是 PDF：排版可自定义，数据是你的，只是比起那些一键保存的时髦服务——天晓得你保存的东西还在不在，请翻翻自己最早的几篇文章以验证这句话——PDF 需要一些手工工作（见下文）。

我个人的阅读习惯沿袭自纸质报刊杂志时代，网页对我来说就是一个可长可短的卷轴（scroll），可等距裁成印刷物，比如一套小册子或一本书（还请诸位原谅我这块活化石）。而页面的数字对应物，自然就是 PDF。这种视角，远非仅仅在数字世界中寻觅熟悉感，它还意味着我确确实实可以把网页打印成纸质件，随身携带、随时抽出来阅读。

必须澄清，从来没有人强迫你只能选一种格式，我也一直很诧异，究竟是何种教育体系，才能生产出那么多以单一选择为前提的人？如果有人担心 PDF 不能保存网页的全部信息——当然不能，例如视频和动图——那么，他可以保存一个 Webarchive 档案或带附件的 HTML。

## 读物尚需自己制作？

获得阅读资料的途径良多，正式纸质出版物之外，内刊、影印本、手抄本乃至盗版层出不穷……正规出版物从来都没有统一阅读的世界，爱好阅读之士，总难免自动动手制作读物。

不知从何时开始，“个人出版”这个词被贴上了文艺、小清新、小而美但不实用的标签，似乎自己制作读物，总有作秀之嫌。实则不然，上世纪末麦金塔电脑所开启的数字革命，对于许多人来说其实恰是一场个人出版革命，你可以制作自己的书籍或杂志。大洋彼岸的浪潮迟到了十几年才抵达中国大陆，但余波仍然不容小觑。世纪之初，我父亲在学校教书时，他的讲义全由自己撰写，并用配备盗版墨盒的打印机自行印刷。

这种利用数字科技实践传统出版的手工做法，从小就给我留下了深刻印象。如今，当我面对着一个满是垃圾元素的网页时，我的第一反应是如何修整打印以便阅读，而非其他。若不分青红皂白照搬孔夫子那套“这个不吃那个不吃”，亏的是您自己。

盖一篇好文章，你可能要看两刻钟到几小时，甚至以后还会重温，如果只花十几秒就能获得赏心悦目的 PDF 文件，准备工作和实际的饕餮时间相比实在可以忽略不计。反过来说，阅读前若不愿意花时间自己处理，堪比连订书钉都懒得钉，抓起一把散乱的纸张就开始看书，完全是捡了芝麻丢了西瓜。

类似的，在翻译外文书籍时，我完全不介意花十分钟调整排版，并确认目录、配图和脚注等细节显示正常。而那些傻瓜相机式的翻译工具，常常吐出一些排版稀烂的电子文档。如果前期节省一杯咖啡的时间，代价是之后折磨你短则几天长则半年，这样的生意是否还值得做，也不必我来回答。

但不可能三角依然悬在我们头顶。回到保存网页为 PDF，本文与其说提出什么解决方案，不如说只是描绘一幅愿景，讨论在以阅读为重的语境之下，如何制作一份体面的 PDF 文件。

## 考虑的诸多方面

怎样的 PDF 才算适合阅读？比起那些玄学成分和美学因素，我更愿意先考虑更硬的方面：文件内容、体积大小以及页面尺寸等等。管见以为，若只敢讨论字体、行间距、页边距以及中文和英文之间要不要加空格之类，纯粹是在无力解决问题时采取的鸵鸟策略，实际上，那些美学问题基本上只是套上个性化 CSS 主题就能搞定的细枝末节。

与其分类讨论各种潜在因素，不如实际展示我从网页保存 PDF 的真实流程，这样也能展示某些取舍的现实限制，毕竟，你可以在保存 PDF 之前随意修改网页上的内容，但是在存好文件之后，除了压缩体积、裁剪多余空白或者多余页面外，几乎做不了别的事情（除非你购买价格不菲的 PDF 编辑器，但这些工作不如在网页上解决）。

### 翻译外文网页

若遇上外文页面，我可能会先使用对照翻译工具，获得中文和译文一段接着一段的页面，扫清阅读阻力的同时又保留原文，以便对照查阅。我为此还写了一个通用插件，几乎可以用在任何现代浏览器上运行，包括手机。

工闲时，我主要的娱乐的便是读杂文，那些按用量计费的软件根本满足不了吾辈胃口，而我自己设计的工具采用浏览器自带翻译功能，可无限量免费翻译。有趣的是，除了彩云小译，我的方案早于市面上任何一款软件，但是那些后起的商业软件往往走向收租模式，诸位笑笑就好。

拓展阅读： \- 一种几乎永不失效的网页中英对照翻译方案 \- 将外文电子书翻译成双语对照版本，并在任何设备上阅读 \- 一种长寿可靠的网页中英分屏翻译方案 \- 在 DEVONthink 中对照翻译外文 Newsletter

### 删除多余元素

翻译后，网页上往往多出一些不必要的元素，其实，即便不翻译，页面本身也常常充斥了广告、横幅或推荐，不仅妨碍阅读，在检索时还会掺入无关元素，打印时最好移除。我使用一款很轻巧的浏览器小书签（bookmarklet），相当于把鼠标变成刻刀，点击页面上的任何位置就能删掉相应元素。

拓展阅读：剪藏网页到本地的轻量化思路

### 附上参考链接

除了删除，有时可能也有必要添加元素。网页文章通常用超链接引用其他资料，而在传统的印刷物中，更常见的做法是上文下注，正文与材料来源一览无遗。就保存网页而言，上文下注的古老形式也有可取之处，盖很多网站的链接显示不明显，除非你把光标移上去，不然都看不出哪儿是链接；至于打印成 PDF 后，这些动态效果也随之消失，你往往在不小心按到链接时才发现此处别有洞天。如果打印成纸质版，则彻底失去了链接。

来源的阙如进一步导致了两个问题，其一，你误把文中所有的话当作作者的思想结晶，张冠李戴；另一方面，你失去了一次检验原始来源（或至少是直接来源）的机会。

为此，我写了一个小工具，模仿印刷书形式提取各段落中的超链接，并将其直接列在段落下方。其小书签版本的链接（代码）如下，使用方式请参阅《工具论ABC：用 Bookmarklet 自制低技术通用浏览器插件》。

```
javascript:(function()%7Bvar%20paragraphs%20%3D%20document.querySelectorAll('p')%3Bparagraphs.forEach(function(paragraph)%20%7Bvar%20links%20%3D%20paragraph.querySelectorAll('a')%3Bif%20(links.length%20%3E%200)%20%7Bvar%20linkList%20%3D%20document.createElement('div')%3BlinkList.className%20%3D%20'link-list'%3Blinks.forEach(function(link)%20%7Bvar%20linkItem%20%3D%20document.createElement('span')%3BlinkItem.textContent%20%3D%20link.href%3BlinkItem.style.color%20%3D%20'grey'%3BlinkList.appendChild(linkItem)%3BlinkList.appendChild(docum
```

---

[前往标准阅读页](https://utgd.net/article/20904?audience=web)
