有一个思想实验。假设你不小心被关进了地狱,恶魔向你承诺,你有机会尝试逃离,但是相比现在就付诸冒险,明天的成功概率会提升一点点——于是,恶魔的选择就产生了:考虑到明天的成功概率更大,一个人很有可能不断推迟越狱计划,结果就是在地狱中永无翻身之日。这个思想实验我暂未找到原始处处,不过,诸位熟悉的古谚“明日复明日,明日何其多”也足够概括其宏旨。
在现实世界中,我们也常常陷入恶魔的选择之中,尤其在讨论阅读工具时,永远没有一款完美的工具,直接结果就是:相当一部分人永远不会开始阅读,或起码永远不会开始严肃阅读。而网页阅读又属重灾区,姑且抛开本地与在线的圣战不谈,仅仅是基于何种格式,也足以让前者内部分裂,你甚至有幸发现,临时组成的在野党数量比参与讨论者人数还多。
——这,其实就掉进了工具生产商和经销商为我们打造的地狱,或局限在自己思维的地狱中。
本文尝试先确定讨论的前提,即以阅读为导向,在此基础上进一步讨论为何优先选择 PDF 保存网页,以及在理想情况下,怎样的 PDF 才更适合阅读。
何以是 PDF
一旦确定直接目的是阅读,那么,我们就不可能绕过 Hum 所言的不可能三角:
在线信息保存这一步现在有一个不可能三角:1. 保存过程;2. 便捷排版简洁;3. 信息属于自己。
根据选择工具或方法的材料原则,选对材料,其余将势如破竹,而就保存在线文章来说,大概最合适的材料还是 PDF:排版可自定义,数据是你的,只是比起那些一键保存的时髦服务——天晓得你保存的东西还在不在,请翻翻自己最早的几篇文章以验证这句话——PDF 需要一些手工工作(见下文)。
我个人的阅读习惯沿袭自纸质报刊杂志时代,网页对我来说就是一个可长可短的卷轴(scroll),可等距裁成印刷物,比如一套小册子或一本书(还请诸位原谅我这块活化石)。而页面的数字对应物,自然就是 PDF。这种视角,远非仅仅在数字世界中寻觅熟悉感,它还意味着我确确实实可以把网页打印成纸质件,随身携带、随时抽出来阅读。
必须澄清,从来没有人强迫你只能选一种格式,我也一直很诧异,究竟是何种教育体系,才能生产出那么多以单一选择为前提的人?如果有人担心 PDF 不能保存网页的全部信息——当然不能,例如视频和动图——那么,他可以保存一个 Webarchive 档案或带附件的 HTML。
读物尚需自己制作?
获得阅读资料的途径良多,正式纸质出版物之外,内刊、影印本、手抄本乃至盗版层出不穷……正规出版物从来都没有统一阅读的世界,爱好阅读之士,总难免自动动手制作读物。
不知从何时开始,“个人出版”这个词被贴上了文艺、小清新、小而美但不实用的标签,似乎自己制作读物,总有作秀之嫌。实则不然,上世纪末麦金塔电脑所开启的数字革命,对于许多人来说其实恰是一场个人出版革命,你可以制作自己的书籍或杂志。大洋彼岸的浪潮迟到了十几年才抵达中国大陆,但余波仍然不容小觑。世纪之初,我父亲在学校教书时,他的讲义全由自己撰写,并用配备盗版墨盒的打印机自行印刷。
这种利用数字科技实践传统出版的手工做法,从小就给我留下了深刻印象。如今,当我面对着一个满是垃圾元素的网页时,我的第一反应是如何修整打印以便阅读,而非其他。若不分青红皂白照搬孔夫子那套“这个不吃那个不吃”,亏的是您自己。
盖一篇好文章,你可能要看两刻钟到几小时,甚至以后还会重温,如果只花十几秒就能获得赏心悦目的 PDF 文件,准备工作和实际的饕餮时间相比实在可以忽略不计。反过来说,阅读前若不愿意花时间自己处理,堪比连订书钉都懒得钉,抓起一把散乱的纸张就开始看书,完全是捡了芝麻丢了西瓜。
类似的,在翻译外文书籍时,我完全不介意花十分钟调整排版,并确认目录、配图和脚注等细节显示正常。而那些傻瓜相机式的翻译工具,常常吐出一些排版稀烂的电子文档。如果前期节省一杯咖啡的时间,代价是之后折磨你短则几天长则半年,这样的生意是否还值得做,也不必我来回答。
但不可能三角依然悬在我们头顶。回到保存网页为 PDF,本文与其说提出什么解决方案,不如说只是描绘一幅愿景,讨论在以阅读为重的语境之下,如何制作一份体面的 PDF 文件。
考虑的诸多方面
怎样的 PDF 才算适合阅读?比起那些玄学成分和美学因素,我更愿意先考虑更硬的方面:文件内容、体积大小以及页面尺寸等等。管见以为,若只敢讨论字体、行间距、页边距以及中文和英文之间要不要加空格之类,纯粹是在无力解决问题时采取的鸵鸟策略,实际上,那些美学问题基本上只是套上个性化 CSS 主题就能搞定的细枝末节。
与其分类讨论各种潜在因素,不如实际展示我从网页保存 PDF 的真实流程,这样也能展示某些取舍的现实限制,毕竟,你可以在保存 PDF 之前随意修改网页上的内容,但是在存好文件之后,除了压缩体积、裁剪多余空白或者多余页面外,几乎做不了别的事情(除非你购买价格不菲的 PDF 编辑器,但这些工作不如在网页上解决)。
翻译外文网页
若遇上外文页面,我可能会先使用对照翻译工具,获得中文和译文一段接着一段的页面,扫清阅读阻力的同时又保留原文,以便对照查阅。我为此还写了一个通用插件,几乎可以用在任何现代浏览器上运行,包括手机。
工闲时,我主要的娱乐的便是读杂文,那些按用量计费的软件根本满足不了吾辈胃口,而我自己设计的工具采用浏览器自带翻译功能,可无限量免费翻译。有趣的是,除了彩云小译,我的方案早于市面上任何一款软件,但是那些后起的商业软件往往走向收租模式,诸位笑笑就好。
拓展阅读: - 一种几乎永不失效的网页中英对照翻译方案 - 将外文电子书翻译成双语对照版本,并在任何设备上阅读 - 一种长寿可靠的网页中英分屏翻译方案 - 在 DEVONthink 中对照翻译外文 Newsletter
删除多余元素
翻译后,网页上往往多出一些不必要的元素,其实,即便不翻译,页面本身也常常充斥了广告、横幅或推荐,不仅妨碍阅读,在检索时还会掺入无关元素,打印时最好移除。我使用一款很轻巧的浏览器小书签(bookmarklet),相当于把鼠标变成刻刀,点击页面上的任何位置就能删掉相应元素。
拓展阅读:剪藏网页到本地的轻量化思路
附上参考链接
除了删除,有时可能也有必要添加元素。网页文章通常用超链接引用其他资料,而在传统的印刷物中,更常见的做法是上文下注,正文与材料来源一览无遗。就保存网页而言,上文下注的古老形式也有可取之处,盖很多网站的链接显示不明显,除非你把光标移上去,不然都看不出哪儿是链接;至于打印成 PDF 后,这些动态效果也随之消失,你往往在不小心按到链接时才发现此处别有洞天。如果打印成纸质版,则彻底失去了链接。
来源的阙如进一步导致了两个问题,其一,你误把文中所有的话当作作者的思想结晶,张冠李戴;另一方面,你失去了一次检验原始来源(或至少是直接来源)的机会。
为此,我写了一个小工具,模仿印刷书形式提取各段落中的超链接,并将其直接列在段落下方。其小书签版本的链接(代码)如下,使用方式请参阅《工具论ABC:用 Bookmarklet 自制低技术通用浏览器插件》。
javascript:(function()%7Bvar%20paragraphs%20%3D%20document.querySelectorAll('p')%3Bparagraphs.forEach(function(paragraph)%20%7Bvar%20links%20%3D%20paragraph.querySelectorAll('a')%3Bif%20(links.length%20%3E%200)%20%7Bvar%20linkList%20%3D%20document.createElement('div')%3BlinkList.className%20%3D%20'link-list'%3Blinks.forEach(function(link)%20%7Bvar%20linkItem%20%3D%20document.createElement('span')%3BlinkItem.textContent%20%3D%20link.href%3BlinkItem.style.color%20%3D%20'grey'%3BlinkList.appendChild(linkItem)%3BlinkList.appendChild(docum
