适用人群
把读过的内容存成多年后仍能打开的格式
书签指向的页面会改动、会消失;稍后阅读服务会关闭、被收购,或者开始对导出收费。剪藏保存的是文字本身,格式不属于任何厂商,也没有过期一说,存放位置由你决定。
保存的阅读为什么会消失
长期大量阅读的人,几乎都至少丢过一次自己的收藏。某个稍后阅读服务关停了,导出来的却只是一个装满 URL 的 JSON 文件,其中大部分链接早已失效。某个笔记软件改了格式,旧文件得用旧版本才能打开。2014 年的书签文件夹,现在点开一页又一页,不是停放域名,就是跳转到别人的首页。
这些情况的共同点是依赖。如果你保存的阅读内容需要某家公司继续存在、某个账号继续可用,或者只有一个程序认得它的格式,那它就是借来的,不是你的。纯文本没有这些依赖,这正是二十年前写下的文件今天照样能直接打开的原因。
人们后来才注意到的问题出在查找,而不是存储。一个没法搜索的存档,只是出于好意堆起来的垃圾场:你记得读过某个主题的文章,大概在某一年,在一个叫不出名字的网站上,却无从找起。纯文本解决这个问题的方式是任何界面都做不到的:每个操作系统上的每个工具都能搜索它,对十年的阅读做一次 grep 就能找到那个文件,而文件自己的文件头会告诉你它是哪一页、何时发布。
剪藏组成的存档是什么样子
- 持久、开放的格式:带 YAML frontmatter 的纯文本,任何编辑器和
grep都能读。 - 不要账号,什么都不上传:你剪藏的内容留在你自己的硬盘上。
- 发布日期和来源 URL 与正文一起保存,多年以后仍能认出这篇笔记是什么。
extraction字段记录提取途径:dom表示取自渲染出的页面,jsonld-articlebody表示取自页面自带的结构化数据。- 剪藏数量不设限:没有配额,没有每日上限,没有付费版。
- 文件重名时加数字后缀,同一页面较早的那份剪藏永远不会被覆盖。
- 按行组织的文本可以像源代码一样压缩、去重、同步和比较差异,备份十年的阅读几乎不占空间,恢复时也不需要专门的工具。
- 按网站规则在保存时就把整个域名归档,存档一边读一边自己整理好,不必等一次永远不会到来的整理时间。
--- title: "理解RESTful架构" source: "https://www.ruanyifeng.com/blog/2011/09/restful.html" author: "阮一峰" date: "2011-09-12" extraction: "dom" --- 越来越多的人开始意识到,网站即软件,而且是一种新型的软件。
建立一个存档文件夹
所有配置都只为了一件事:让剪藏的成本低于“要不要剪藏”这个决定的成本。其余的一切都由此而来。
- 选定一个文件夹作为存档,比如文档目录顶层的
存档。只要一个文件夹,不要按主题分:主题是搜索要解决的事,而文件夹树是一个你必须在阅读当下做出的归类决定。 - 从扩展程序图标打开 Options,把保存位置指向这个文件夹,并把点击图标时的操作设为“保存到文件夹”。没有窗口,没有对话框,不用做决定:整个习惯能否坚持,就看它是不是只要一次按键。
- 把文件名模板设为
{date}-{domain}-{title}。这样文件按时间排序,网站一眼可见,而且足够唯一,两个不同页面的剪藏不会争同一个文件名。 - 在 frontmatter 中打开所有字段。
date是页面自己的发布日期,extraction记录正文是怎么取得的,这两样事后都没法补上。 - 为你经常读的几个网站添加按网站规则,每个网站一个子文件夹。这样你剪藏最多的内容会自动归好类,而平铺的文件夹最先变得难用的恰恰是这部分。
- 把这个文件夹纳入你平时备份文档的范围,并且真的做一次:从备份里恢复一个文件,把它打开。一个从来没恢复过的存档,只是一个假设。
- 边读边剪藏,而不是攒到整理时间再做。那些你以后想回头找的页面,恰恰就是到时候已经没了的页面。
长期保存用的设置
这些取值假定存档会比最初那台电脑活得更久,很可能也比这个浏览器活得更久。这里没有任何一项会带来一个必须跟着它一起存活的依赖。
| 设置 | 取值 | 为什么这里这样设 |
|---|---|---|
| 点击图标 | 保存到文件夹 | 一次按键,习惯能坚持下去;三次按键,习惯就断了 |
| 保存位置 | 一个 `存档` 文件夹 | 阅读时按主题归类,是人们到第三周就不再做的那一步 |
| 文件名模板 | `{date}-{domain}-{title}` | 一行文件名里就有时间顺序、来源和唯一性,不需要任何索引 |
| Frontmatter | 全部字段打开 | 发布日期和提取途径事后无法重建 |
| 按网站规则 | 常读的域名 → 子文件夹 | 你剪藏最多的网站,正是平铺文件夹最先显得拥挤的地方 |
| 图片 | 保留为链接 | 链接记录了这里曾有一张图,尽管网站没了它也会失效 |
| 备份 | 把文件夹纳入日常备份,并恢复过一次 | 文本从任何备份里都能恢复;没测试过的备份只是一种信念 |
存档/ 2011-09-12-ruanyifeng.com-理解RESTful架构.md 2011-09-12-ruanyifeng.com-理解RESTful架构-2.md 第二个文件是几年后对同一页面的再次剪藏。文件名里的日期是文章的发布日期, 所以两次剪藏重名,后一次加上数字后缀,而不是覆盖前一次。 第一份剪藏在任何编辑器里都能打开,frontmatter 里仍然写着它来自哪个 URL。
同一个习惯,坚持三年
早上读文章,存档顺手就有了
一周里读了六篇长文,每篇读完按一下键就剪藏了。不弹窗口,不归类,也不用判断这一篇值不值得留:这正是关键,因为正是这个判断让存档始终建不起来。
积累下来的是一个文件夹:文件名给出日期、网站和标题,每个文件的前几行给出 URL、作者和发布日期。你什么都没整理,它照样可以搜索,因为命名已经替你整理好了。
找回几年前读过的东西
你只记得一句话,别的都不记得:不记得网站,不记得年份,也不记得作者。在存档文件夹里搜索一次,文件就出来了,文件头写着是哪个页面。没建过索引,不需要哪个应用还在运行,断网也能搜。
这恰恰是书签文件夹做不到的。书签存的是内容在哪里,而不是内容说了什么,所以在书签里搜索,只能匹配别人起的标题。
网站关了,文字还在
一个你读了很多年的博客打不开了。剪藏不受影响:正文、作者和发布日期都在你硬盘上的文件里,source 行也仍然记着那个地址,尽管那里已经没有任何回应。
图片是需要老实承认的例外。它们是链接,网站没了链接就失效,一个价值在于照片的页面,靠这种方式是保存不下来的。这是文本存档必须做的取舍,值得弄清楚你的哪些页面落在了取舍的另一边。
与其他保存阅读内容的方式对比
这张表里最强的选项并不是它。完整保真的存档保存得更多,代价也更高:占用空间更多,搭建更麻烦,需要持续正常运转的东西也更多。
| 现在的做法 | 能得到什么 | 代价是什么 |
|---|---|---|
| 书签 | 一份地址列表,免费 | 只存在哪里,从不存说了什么;十年前的书签文件夹大多已是停放域名 |
| 稍后阅读服务 | 干净的阅读体验,多端同步 | 这个服务得一直存在,得一直保留导出功能,价格也得一直不变 |
| 把网页另存为 HTML | 带资源和版式的完整页面 | 体积大,跨文件搜索不方便,要读得舒服还得靠浏览器 |
| 自托管的归档服务器 | 完整保真,包括截图和资源文件 | 要运行软件、管理存储、安装更新,而且没有尽头 |
| 打印成 PDF | 一份在哪里都能打开的固定记录 | 无法在整个文件夹里按文本搜索,不能比较差异,每读一次就是一个文件 |
| Clean Web Clipper | 正文、元数据,别无其他,长期可用 | 没有版式,没有图片,没有第三方时间戳:只存文本,这是有意为之 |
多年下来会出什么问题
为什么旧剪藏里的图片都打不开了?
它们是链接,而链接指向的网站已经搬家、改版或关闭。扩展程序不下载任何二进制资源,所以剪藏组成的存档是文字存档。如果图片才是重点(摄影专题、示意图、漫画),要么当时就另外保存图片,要么接受这个工具保存不了它们。
为什么文件夹里越来越多几乎重复的文件?
这是重名规则在起作用:同一页面第二次剪藏时会加上数字后缀,而不是替换第一份,因为一个已经改动过的页面,第二次保存下来的往往更有意思。不会自动去重。在纯文本上找重复,用任何常用工具都是一行命令的事,比较其中两份就是一次 diff。
为什么存档里一半文件叫“首页”或“无标题”?
标题取自页面自己的元数据,有些网站给每一页都设同一个标题。这正是文件名模板里 {domain} 和 {date} 的用处:文件名里有了这两项,标题再没用,文件也找得到。如果存档里已经有上百个这样的文件,它们也只是文本文件,手动或用脚本改名就能解决,而且无论怎么改,文件里的内容都不会丢。
为什么有些页面就是剪藏不了?
有三类。浏览器保护的页面:chrome:// 地址和扩展程序商店,任何扩展程序都不能在上面运行。没有文章正文的页面,比如信息流、商品页和搜索结果页,扩展程序会报告“没有文章”,而不是返回一堆链接。还有任何在你这里没有渲染出来的内容,包括嵌入式查看器里的内容,那是另一个独立的文档,剪藏够不到里面。
它保存不了什么
它保存的是文字,不是页面:没有版式,没有截图,没有字体,没有脚本,也不下载图片,图片链接仍然指向原网站,网站没了链接也就失效了。它不是网页存档工具,也没有第三方时间戳。它不读取你的浏览记录,也不批量导入书签,你剪藏的是眼前这一页。另外,它保存的是浏览器渲染出来的内容,一个在你这里从来没显示出来的页面,是保存不下来的。
常见问题
如果这个扩展程序不再维护了,我的文件怎么办?
能保存图片吗?
剪藏数量有上限吗?
能批量导入我现有的书签吗?
十年后这些文件还能打开吗?
还需要另外做一份完整保真的存档吗?
能在手机上看存档吗?
.md 文本文件,手机上的笔记应用、文本编辑器或 Markdown 阅读器都能打开,搜索方式也和电脑上一样。