Clean Web Clipper 添加到 Chrome(免费)

适用人群

收集参考资料,引用时仍有出处可查

用截图和书签收集的资料,到了需要注明出处的那一刻就用不上了。Markdown 文件把标题、作者、日期和网址与正文放在同一个文件里,核查事实时随手就能找到。

找不到出处的引文

那段话已经在你的稿子里,加了引号,可你想不起它出自哪里。也许在四百个书签中的某一个里,也许在一张没有网址的截图里,也许在一个后来被改写过的网页上。追查出处花的时间比写这一段还长,有时根本查不到,这句话只好从稿子里删掉。

从浏览器复制粘贴也有代价。网站的页面元素会跟着文字一起过来:夹在两个分享按钮之间的署名,插在段落中间的订阅框,文章结尾处的“延伸阅读”列表。每次都得清理一遍,这就是为什么大多数资料文件夹会悄悄变成一堆没人再打开的半成品碎片。

然后还得有人来核查。编辑或事实核查员打不开你的书签,看不到你订阅后才能读的内容,也不会把截图当作出处,于是核查变成一场对话:你凭记忆重建每句话的来源。一文件夹的文本文件,每个文件里都有网址和日期,是可以直接交出去的东西;能不能交出去,往往决定了一个疑问是五分钟解决,还是耗掉一下午。

资料文件夹会变成什么样

作者跟着段落一起保存zh.wikisource.org:鲁迅《野草·秋夜》
---
title: "野草/秋夜"
source: "https://zh.wikisource.org/wiki/野草/秋夜"
author: "鲁迅"
extraction: "dom"
---

在我的后园,可以看见墙外有两株树,一株是枣树,还有一株也是枣树。

这上面的夜的天空,奇怪而高,我生平没有见过这样奇怪而高的天空。

为一篇约稿做好设置

一篇稿子一个文件夹,里面每条剪藏都自带出处。真正重要的设置,是那些让这个文件夹能直接交给别人的设置。

  1. 开始阅读之前,先为这篇稿子建一个资料文件夹,比如 pieces/baltic-charts/sources。存进事先建好的文件夹,叫收集资料;事后再整理,就成了考古。
  2. 点击扩展程序图标,打开设置,把保存位置设为你的资料目录,在子文件夹一栏填上这篇稿子的名称。以后换稿子,只改这一栏就行。
  3. 把文件名模板设为 {date}-{title}。这个日期是你剪藏的时间,网页之后被修改过时,编辑问的正是这件事。
  4. 打开所有 frontmatter 字段。authordate 让一条剪藏可以被引用,source 则是事实核查员真正会点开的那一项。
  5. “点击图标时”保持为打开窗口(预览窗口)。花两秒钟就能看出署名有没有提取对,而署名错误恰恰是会一路错到付印的那种错误。
  6. 只有某一段重要时,先在页面上选中,再剪藏:窗口会以选中内容打开,顶部的切换确认你看的是哪一种。
  7. 读到网页的当天就剪藏,不要等到动笔那天。网页会被悄悄修改,而编辑要的,往往正是你没存下来的那一版。

能直接交出去的资料设置

下面每一项的检验标准是:一个拿到文件夹的陌生人,能不能不问你任何问题就核实一条引文。

设置为什么这样设
保存位置每篇稿子一个子文件夹出处按约稿整理,整个文件夹可以交给事实核查员
文件名模板`{date}-{title}`记下你剪藏的时间:网页之后改过时,问的就是这个
Frontmatter全部字段打开`author`、`date` 和 `source` 是出处,其余是背景信息
点击图标打开窗口(预览)花两秒确认署名,免得错误的署名进了草稿
图片保留为链接图片的署名往往只能从图片网址里查到
选中内容先选中段落,再剪藏一篇长篇特稿只引用一段,没必要整篇保存
按网站规则常用网站 → 各自的子文件夹到了核查阶段,背景阅读和一手资料是两堆不同的材料
摘引仍是引文,署名就是署名一篇长篇杂志特稿
---
title: "波罗的海最后的海图绘制员"
source: "https://example-magazine.com/features/baltic-charts"
author: "Ingrid Salo"
date: "2025-11-18T06:00:00.000Z"
extraction: "dom"
---

这艘测量船上仍然带着纸质海图,折好放在一个抽屉里;自从二副退休,
就再没有人打开过。

> 我们从 2019 年起就不再修正它们了。没有人决定停下来,
> 只是修正通知再也没有寄来。

水文局证实,纸质海图的修正在那一年停止。

稿子里的三个时刻

网页已被改写的引文

你在 11 月剪藏了一家公司的声明,在 2 月的草稿里引用了它。网页还在,但已经不是那样写的了:措辞被改得缓和了,既没有更正说明,也没有修改时间。你的文件里有原来那句话、网址,以及网页自己声明的日期。

再剪藏一次这个网页,用任何 diff 工具都能把两个版本并排显示。这和“网页上说过这句话”是不同的主张:它是“这是我当时存下的,这是它现在的样子”,而这样的主张可以摆到编辑面前。

把资料交给别人

事实核查员拿到的是整个文件夹。每个文件用任何编辑器都能打开,前几行就是段落、署名、发表日期和网址,原本要问你的问题,变成了对方自己就能查的事。

截图在这一步最不中用。网页的图片里没有网址、没有日期,也没有可搜索的文字,资料文件夹里的每一张截图,最后都会变成一条问“这是从哪儿来的”消息。

采访前的背景阅读

前一天晚上,把六篇背景文章剪藏进这篇稿子的文件夹。通话时你搜索的是这个文件夹,而不是八个打开的标签页,一次搜索就覆盖六篇文章的全部文字,包括其中两篇要订阅才能看的。

因为是文本文件,搜索没有任何成本,在没有信号的楼里断了网也能用。换成标签页,它们可能已经过期、被重新加载、再次弹出 Cookie 提示,或者把你登出了。

和常见的资料收集习惯对比

这些都不算坏习惯,每一种都是某个人的工作方法。区别在于,到了核查那一步还剩下什么。

目前的做法得到什么代价是什么
给网页加书签一个指针,一秒完成它指向网页今天的内容,而不是你读到时的内容
截图保存段落看得见的文字没有网址、没有日期、文字不可搜索,核查员也无法独立核实
粘贴进资料文档文字集中在一处网站的页面元素跟着过来,出处却没有
稍后读服务干净的副本,还能同步取决于这项服务是否继续存在、是否允许导出
把网页打印成 PDF版式固定的记录连 Cookie 提示栏一起打印,文字无法在整个文件夹里搜索,也没有元数据头
Clean Web Clipper正文、署名、日期和网址都在一个文件里没有版式、没有截图,也没有第三方证明你是何时存下的

剪藏内容没法引用时

作者字段为什么是空的?

网页没有扩展程序能识别的署名,或者署名所在的标记和章节标题无法区分。作者提取会读取结构化数据和署名标记,再过滤已知的误判(标题、刊物名称、按钮文字);过滤之后什么都不剩,字段就留空,而不是填上页面上第一个粗体字符串。你可以自己补上:它就是一个文本文件。

为什么只剪下了前三段?

通常是计量式付费墙:网页确实只渲染了一段试读,其余部分只对它认为有订阅的会话加载。也可能是延迟加载,正文随着滚动才出现。滚到文章末尾,确认最后一段已经显示在屏幕上,再剪藏一次。扩展程序保存的是浏览器在那一刻渲染出的内容。

有些网站在你做出选择之前什么都不渲染,DOM 里没有文章可提取,扩展程序会如实提示。按你平时的习惯处理弹窗,等网页渲染完成,再剪藏。无论选了什么,同意提示栏本身都不会进入剪藏内容。

文件名里的日期和 frontmatter 里的日期为什么对不上?

它们本来就不是同一个日期,也不该一样。文件名里的 {date} 是你剪藏网页的那天;frontmatter 里的 date 字段是网页自己声明的发表日期。把两者分开,你才能同时说清文章何时发表、你何时看到;frontmatter 日期为空,说明网页没有声明日期。

它不做的事

它不按网页原样存档:没有截图,没有版式,也不保存页面资源。它不做摘要,也不改写:文章正文是转换,不是编辑。图片保留为指向原网站的链接,所以原网站出问题,图片也会失效。网页上没有作者或日期时,字段会留空,而不是填上一个看似合理的猜测。

添加到 Chrome(免费)完全免费:无需账号,无需注册,没有限制。

常见问题

会保留作者吗?
会,前提是网页写明了作者。Clean Web Clipper 读取结构化数据和署名标记,并过滤掉误判(章节标题、刊物名称、按钮文字),而不是把第一个看似合理的字符串填进字段。
我付费订阅的文章能剪藏吗?
能,照常剪藏。扩展程序读取的是浏览器为你渲染出的网页,所以屏幕上看得到的内容都能保存。
能保留图片吗?
能,默认保留为链接。你可以全局关闭,也可以只对某个网站关闭。
它会改动措辞吗?
不会。变的是结构,HTML 变成 Markdown,但文章正文里的文字不会被增加、删除或调换顺序。
免费吗?
是的,全部免费。没有付费版,不用账号,剪藏多少也没有限制。
引文里的斜体和链接能保留吗?
能。粗体、斜体、链接、行内代码和列表都会转成对应的 Markdown,摘引或引文块仍然是引文块,所以标明是别人原话的段落,在你的文件里看起来依然是别人的原话。
剪藏能证明网页上说过这句话吗?
不能,也不应该当作证据拿出来。它只是你自己电脑上的一个文件,没有第三方时间戳:它记录的是你存下了什么,用作自己的工作笔记足够,用来支撑有争议的说法则不够。可能引起争议的地方,请同时使用独立的网页存档服务。
能剪藏邮件简报或邮件吗?
只有以网页形式发布的才行。很多邮件简报有网页版存档,那样的页面和其他网页一样能剪藏。邮件客户端里的邮件不是扩展程序能访问的网页。
剪藏下来的内容可以转载吗?
这是来源内容的版权问题,与工具无关。剪藏是阅读和做笔记的行为;能引用什么、能引用多少,由许可和法律决定,和你手抄这段话时完全一样。
事件还在发展时,能反复剪藏同一个网页吗?
能,每次剪藏都是一个单独的文件:文件重名时会加数字后缀,而不是覆盖。一个不断更新的网页存下的两个版本,用任何 diff 工具一比,就是新增了什么、又悄悄删掉了什么的记录。