Clean Web Clipper 添加到 Chrome(免费)

适用人群

把读过的内容存成多年后仍能打开的格式

书签指向的页面会改动、会消失;稍后阅读服务会关闭、被收购,或者开始对导出收费。剪藏保存的是文字本身,格式不属于任何厂商,也没有过期一说,存放位置由你决定。

保存的阅读为什么会消失

长期大量阅读的人,几乎都至少丢过一次自己的收藏。某个稍后阅读服务关停了,导出来的却只是一个装满 URL 的 JSON 文件,其中大部分链接早已失效。某个笔记软件改了格式,旧文件得用旧版本才能打开。2014 年的书签文件夹,现在点开一页又一页,不是停放域名,就是跳转到别人的首页。

这些情况的共同点是依赖。如果你保存的阅读内容需要某家公司继续存在、某个账号继续可用,或者只有一个程序认得它的格式,那它就是借来的,不是你的。纯文本没有这些依赖,这正是二十年前写下的文件今天照样能直接打开的原因。

人们后来才注意到的问题出在查找,而不是存储。一个没法搜索的存档,只是出于好意堆起来的垃圾场:你记得读过某个主题的文章,大概在某一年,在一个叫不出名字的网站上,却无从找起。纯文本解决这个问题的方式是任何界面都做不到的:每个操作系统上的每个工具都能搜索它,对十年的阅读做一次 grep 就能找到那个文件,而文件自己的文件头会告诉你它是哪一页、何时发布。

剪藏组成的存档是什么样子

一篇 2011 年的文章,至今仍能打开ruanyifeng.com/blog
---
title: "理解RESTful架构"
source: "https://www.ruanyifeng.com/blog/2011/09/restful.html"
author: "阮一峰"
date: "2011-09-12"
extraction: "dom"
---

越来越多的人开始意识到,网站即软件,而且是一种新型的软件。

建立一个存档文件夹

所有配置都只为了一件事:让剪藏的成本低于“要不要剪藏”这个决定的成本。其余的一切都由此而来。

  1. 选定一个文件夹作为存档,比如文档目录顶层的 存档。只要一个文件夹,不要按主题分:主题是搜索要解决的事,而文件夹树是一个你必须在阅读当下做出的归类决定。
  2. 从扩展程序图标打开 Options,把保存位置指向这个文件夹,并把点击图标时的操作设为“保存到文件夹”。没有窗口,没有对话框,不用做决定:整个习惯能否坚持,就看它是不是只要一次按键。
  3. 把文件名模板设为 {date}-{domain}-{title}。这样文件按时间排序,网站一眼可见,而且足够唯一,两个不同页面的剪藏不会争同一个文件名。
  4. 在 frontmatter 中打开所有字段。date 是页面自己的发布日期,extraction 记录正文是怎么取得的,这两样事后都没法补上。
  5. 为你经常读的几个网站添加按网站规则,每个网站一个子文件夹。这样你剪藏最多的内容会自动归好类,而平铺的文件夹最先变得难用的恰恰是这部分。
  6. 把这个文件夹纳入你平时备份文档的范围,并且真的做一次:从备份里恢复一个文件,把它打开。一个从来没恢复过的存档,只是一个假设。
  7. 边读边剪藏,而不是攒到整理时间再做。那些你以后想回头找的页面,恰恰就是到时候已经没了的页面。

长期保存用的设置

这些取值假定存档会比最初那台电脑活得更久,很可能也比这个浏览器活得更久。这里没有任何一项会带来一个必须跟着它一起存活的依赖。

设置取值为什么这里这样设
点击图标保存到文件夹一次按键,习惯能坚持下去;三次按键,习惯就断了
保存位置一个 `存档` 文件夹阅读时按主题归类,是人们到第三周就不再做的那一步
文件名模板`{date}-{domain}-{title}`一行文件名里就有时间顺序、来源和唯一性,不需要任何索引
Frontmatter全部字段打开发布日期和提取途径事后无法重建
按网站规则常读的域名 → 子文件夹你剪藏最多的网站,正是平铺文件夹最先显得拥挤的地方
图片保留为链接链接记录了这里曾有一张图,尽管网站没了它也会失效
备份把文件夹纳入日常备份,并恢复过一次文本从任何备份里都能恢复;没测试过的备份只是一种信念
同一个页面剪藏两次,两份都保留存档文件夹的文件列表
存档/
  2011-09-12-ruanyifeng.com-理解RESTful架构.md
  2011-09-12-ruanyifeng.com-理解RESTful架构-2.md

第二个文件是几年后对同一页面的再次剪藏。文件名里的日期是文章的发布日期,
所以两次剪藏重名,后一次加上数字后缀,而不是覆盖前一次。
第一份剪藏在任何编辑器里都能打开,frontmatter 里仍然写着它来自哪个 URL。

同一个习惯,坚持三年

早上读文章,存档顺手就有了

一周里读了六篇长文,每篇读完按一下键就剪藏了。不弹窗口,不归类,也不用判断这一篇值不值得留:这正是关键,因为正是这个判断让存档始终建不起来。

积累下来的是一个文件夹:文件名给出日期、网站和标题,每个文件的前几行给出 URL、作者和发布日期。你什么都没整理,它照样可以搜索,因为命名已经替你整理好了。

找回几年前读过的东西

你只记得一句话,别的都不记得:不记得网站,不记得年份,也不记得作者。在存档文件夹里搜索一次,文件就出来了,文件头写着是哪个页面。没建过索引,不需要哪个应用还在运行,断网也能搜。

这恰恰是书签文件夹做不到的。书签存的是内容在哪里,而不是内容说了什么,所以在书签里搜索,只能匹配别人起的标题。

网站关了,文字还在

一个你读了很多年的博客打不开了。剪藏不受影响:正文、作者和发布日期都在你硬盘上的文件里,source 行也仍然记着那个地址,尽管那里已经没有任何回应。

图片是需要老实承认的例外。它们是链接,网站没了链接就失效,一个价值在于照片的页面,靠这种方式是保存不下来的。这是文本存档必须做的取舍,值得弄清楚你的哪些页面落在了取舍的另一边。

与其他保存阅读内容的方式对比

这张表里最强的选项并不是它。完整保真的存档保存得更多,代价也更高:占用空间更多,搭建更麻烦,需要持续正常运转的东西也更多。

现在的做法能得到什么代价是什么
书签一份地址列表,免费只存在哪里,从不存说了什么;十年前的书签文件夹大多已是停放域名
稍后阅读服务干净的阅读体验,多端同步这个服务得一直存在,得一直保留导出功能,价格也得一直不变
把网页另存为 HTML带资源和版式的完整页面体积大,跨文件搜索不方便,要读得舒服还得靠浏览器
自托管的归档服务器完整保真,包括截图和资源文件要运行软件、管理存储、安装更新,而且没有尽头
打印成 PDF一份在哪里都能打开的固定记录无法在整个文件夹里按文本搜索,不能比较差异,每读一次就是一个文件
Clean Web Clipper正文、元数据,别无其他,长期可用没有版式,没有图片,没有第三方时间戳:只存文本,这是有意为之

多年下来会出什么问题

为什么旧剪藏里的图片都打不开了?

它们是链接,而链接指向的网站已经搬家、改版或关闭。扩展程序不下载任何二进制资源,所以剪藏组成的存档是文字存档。如果图片才是重点(摄影专题、示意图、漫画),要么当时就另外保存图片,要么接受这个工具保存不了它们。

为什么文件夹里越来越多几乎重复的文件?

这是重名规则在起作用:同一页面第二次剪藏时会加上数字后缀,而不是替换第一份,因为一个已经改动过的页面,第二次保存下来的往往更有意思。不会自动去重。在纯文本上找重复,用任何常用工具都是一行命令的事,比较其中两份就是一次 diff。

为什么存档里一半文件叫“首页”或“无标题”?

标题取自页面自己的元数据,有些网站给每一页都设同一个标题。这正是文件名模板里 {domain}{date} 的用处:文件名里有了这两项,标题再没用,文件也找得到。如果存档里已经有上百个这样的文件,它们也只是文本文件,手动或用脚本改名就能解决,而且无论怎么改,文件里的内容都不会丢。

为什么有些页面就是剪藏不了?

有三类。浏览器保护的页面:chrome:// 地址和扩展程序商店,任何扩展程序都不能在上面运行。没有文章正文的页面,比如信息流、商品页和搜索结果页,扩展程序会报告“没有文章”,而不是返回一堆链接。还有任何在你这里没有渲染出来的内容,包括嵌入式查看器里的内容,那是另一个独立的文档,剪藏够不到里面。

它保存不了什么

它保存的是文字,不是页面:没有版式,没有截图,没有字体,没有脚本,也不下载图片,图片链接仍然指向原网站,网站没了链接也就失效了。它不是网页存档工具,也没有第三方时间戳。它不读取你的浏览记录,也不批量导入书签,你剪藏的是眼前这一页。另外,它保存的是浏览器渲染出来的内容,一个在你这里从来没显示出来的页面,是保存不下来的。

添加到 Chrome(免费)完全免费:无需账号,无需注册,没有限制。

常见问题

如果这个扩展程序不再维护了,我的文件怎么办?
文件不受任何影响。它们是存在你自己文件夹里的纯 Markdown,写入之后就不再依赖扩展程序。
能保存图片吗?
保存的是图片链接,仍然指向原网站。如果你需要图片本身,请另外保存:扩展程序不下载任何二进制资源。
剪藏数量有上限吗?
没有。没有页数限制,没有每日配额,不要账号,也没有付费版。
能批量导入我现有的书签吗?
不能。扩展程序剪藏的是你当前打开的页面,所以旧书签需要一个个打开、一个个剪藏,这也是弄清哪些链接还能打开的唯一办法。
十年后这些文件还能打开吗?
它们是带 YAML 文件头的 UTF-8 文本,和二十年前写下、今天依然能打开的文件是同一种形态。写入之后,文件里没有任何东西依赖扩展程序。
还需要另外做一份完整保真的存档吗?
对于版式、图片或外观本身就是内容的页面,需要。这是文字存档,它也明说了这一点。两者是互补而不是替代:文字用来保存你想搜索的阅读内容,完整保真的副本留给少数你想原样再看一遍的页面。
能在手机上看存档吗?
可以,通过任何文件同步工具。它们是 .md 文本文件,手机上的笔记应用、文本编辑器或 Markdown 阅读器都能打开,搜索方式也和电脑上一样。
存档会占多少空间?
很少,因为是文本。同样的页面如果连同图片和脚本另存为 HTML,体积要大好几个数量级;而文本在备份里也是压缩和去重效果最好的格式。
能把我多年前保存的 HTML 网页转换过来吗?
不能直接转换。它只处理浏览器正在显示的页面,不处理硬盘上的文件。可以在浏览器里打开旧的网页文件再剪藏,这样可行,但只能一页一页来,没有批量转换。
会自动去重或合并多次剪藏吗?
不会。不会自动合并、替换或清理任何内容,每次剪藏都是一个新文件。对存档来说这是有意的:自动整理删错了副本,是唯一无法挽回的失败。