Adobe Acrobat 或 ABBYY FineReader Pro 或许是终极 OCR 工具,但如同越野车,大家都知道性能好,可真正买的人却不多。一般人更愿意使用 PDF 阅读器或文件管理工具中的 OCR 功能,而 DEVONthink 刚好内置了稍旧一些的 ABBYY OCR 引擎,堪称 OCR 处理中的 SUV:马力够,买得起,也用得起——意思是,性能最差的 MacBook Air 也跑得动。
但有个问题。DEVONthink 通常只能处理其数据库内的文件,最起码也要把文件索引(Index)到其库中,处理完再导出或者复制一份出去,导入导出频繁。而处理一份 PDF 文件并不意味着要永远将其存于 DEVONthink 数据库中。例如我每天收到少则几份、多则几十份的扫描版文件,大多需要转为可复制文本的版本,但绝大多数属于工作文件,用完就移到硬盘里归档,不会留在 DEVONthink 里。
此事令我介意很久,甚至一度想再买一个 ABBYY FineReader Pro,免得反复导入导出。理想情况下,OCR 应当成为复制粘贴一样的基础设施,在文件右键上下文菜单或 Finder 中有现成的按钮,点一下,即可就地 OCR——至少只有几页或十来页的小文件应当如此。
就像下图。易言之,我已经找到了用 DEVONthink 处理几乎任何 PDF 的方法。
首先,找个不耽误日常干活的文件夹,稍后它索引(Index)到 DEVONthink,用作中继站。此前最好创建一个新的 DEVONthink 数据库,以免误处理无关文件,当然用现有的也无妨。这个文件夹以后将专门用于存储待处理文件的替身文件(Alias)。
薅 DEVONthink 羊毛的核心原理在于,尽管只有替身文件被索引到 DEVONthink 库中,但是 DEVONthink 可以隔着替身径达原始文件;进而,只要做好 DEVONthink 这边的自动 OCR 设置,并挑一个顺手的替身文件创建方法,就能用 DEVONthink 处理电脑上几乎任意一个 PDF 文件了。
接下来准备 DEVONthink 这边的自动处理流程。DEVONthink 自带了文件自动化“smart rules”,和 Automator 中的文件夹操作以及 Hazel 的智能规则类似,只要在目标文件夹中出现符合条件的文件,就执行预设操作。就原地 OCR 这一案例来说,所需的 smart rules 并不复杂:
- 监控(Search in)一开始准备好的
