适用人群
收集参考资料,引用时仍有出处可查
用截图和书签收集的资料,到了需要注明出处的那一刻就用不上了。Markdown 文件把标题、作者、日期和网址与正文放在同一个文件里,核查事实时随手就能找到。
找不到出处的引文
那段话已经在你的稿子里,加了引号,可你想不起它出自哪里。也许在四百个书签中的某一个里,也许在一张没有网址的截图里,也许在一个后来被改写过的网页上。追查出处花的时间比写这一段还长,有时根本查不到,这句话只好从稿子里删掉。
从浏览器复制粘贴也有代价。网站的页面元素会跟着文字一起过来:夹在两个分享按钮之间的署名,插在段落中间的订阅框,文章结尾处的“延伸阅读”列表。每次都得清理一遍,这就是为什么大多数资料文件夹会悄悄变成一堆没人再打开的半成品碎片。
然后还得有人来核查。编辑或事实核查员打不开你的书签,看不到你订阅后才能读的内容,也不会把截图当作出处,于是核查变成一场对话:你凭记忆重建每句话的来源。一文件夹的文本文件,每个文件里都有网址和日期,是可以直接交出去的东西;能不能交出去,往往决定了一个疑问是五分钟解决,还是耗掉一下午。
资料文件夹会变成什么样
- 每篇笔记的 frontmatter 里都有
title、author、date和source,出处和正文待在一起。 - 作者字段经过过滤:章节标题、刊物名称和按钮文字不会被当成署名。
- 只保留文章正文:订阅框、分享栏和“延伸阅读”栏不会进入笔记。
- 选中一段,就只剪藏这一段,整个网页不值得保留时就这么做。
- 你付费订阅的文章也能照常剪藏,因为扩展程序读取的是浏览器渲染出的网页。
- 文件存进你自己的文件夹,格式不受任何厂商控制,不会被停止支持,也不会被重新定价。
- 引文块和摘引仍然是引文块,所以在你自己的文件里,不能改写的原话依然一眼看得出是别人的话。
- 发表日期和剪藏日期分开记录:网页的日期是 frontmatter 字段,剪藏的日期是文件名里的
{date}。
--- title: "野草/秋夜" source: "https://zh.wikisource.org/wiki/野草/秋夜" author: "鲁迅" extraction: "dom" --- 在我的后园,可以看见墙外有两株树,一株是枣树,还有一株也是枣树。 这上面的夜的天空,奇怪而高,我生平没有见过这样奇怪而高的天空。
为一篇约稿做好设置
一篇稿子一个文件夹,里面每条剪藏都自带出处。真正重要的设置,是那些让这个文件夹能直接交给别人的设置。
- 开始阅读之前,先为这篇稿子建一个资料文件夹,比如
pieces/baltic-charts/sources。存进事先建好的文件夹,叫收集资料;事后再整理,就成了考古。 - 点击扩展程序图标,打开设置,把保存位置设为你的资料目录,在子文件夹一栏填上这篇稿子的名称。以后换稿子,只改这一栏就行。
- 把文件名模板设为
{date}-{title}。这个日期是你剪藏的时间,网页之后被修改过时,编辑问的正是这件事。 - 打开所有 frontmatter 字段。
author和date让一条剪藏可以被引用,source则是事实核查员真正会点开的那一项。 - “点击图标时”保持为打开窗口(预览窗口)。花两秒钟就能看出署名有没有提取对,而署名错误恰恰是会一路错到付印的那种错误。
- 只有某一段重要时,先在页面上选中,再剪藏:窗口会以选中内容打开,顶部的切换确认你看的是哪一种。
- 读到网页的当天就剪藏,不要等到动笔那天。网页会被悄悄修改,而编辑要的,往往正是你没存下来的那一版。
能直接交出去的资料设置
下面每一项的检验标准是:一个拿到文件夹的陌生人,能不能不问你任何问题就核实一条引文。
| 设置 | 值 | 为什么这样设 |
|---|---|---|
| 保存位置 | 每篇稿子一个子文件夹 | 出处按约稿整理,整个文件夹可以交给事实核查员 |
| 文件名模板 | `{date}-{title}` | 记下你剪藏的时间:网页之后改过时,问的就是这个 |
| Frontmatter | 全部字段打开 | `author`、`date` 和 `source` 是出处,其余是背景信息 |
| 点击图标 | 打开窗口(预览) | 花两秒确认署名,免得错误的署名进了草稿 |
| 图片 | 保留为链接 | 图片的署名往往只能从图片网址里查到 |
| 选中内容 | 先选中段落,再剪藏 | 一篇长篇特稿只引用一段,没必要整篇保存 |
| 按网站规则 | 常用网站 → 各自的子文件夹 | 到了核查阶段,背景阅读和一手资料是两堆不同的材料 |
--- title: "波罗的海最后的海图绘制员" source: "https://example-magazine.com/features/baltic-charts" author: "Ingrid Salo" date: "2025-11-18T06:00:00.000Z" extraction: "dom" --- 这艘测量船上仍然带着纸质海图,折好放在一个抽屉里;自从二副退休, 就再没有人打开过。 > 我们从 2019 年起就不再修正它们了。没有人决定停下来, > 只是修正通知再也没有寄来。 水文局证实,纸质海图的修正在那一年停止。
稿子里的三个时刻
网页已被改写的引文
你在 11 月剪藏了一家公司的声明,在 2 月的草稿里引用了它。网页还在,但已经不是那样写的了:措辞被改得缓和了,既没有更正说明,也没有修改时间。你的文件里有原来那句话、网址,以及网页自己声明的日期。
再剪藏一次这个网页,用任何 diff 工具都能把两个版本并排显示。这和“网页上说过这句话”是不同的主张:它是“这是我当时存下的,这是它现在的样子”,而这样的主张可以摆到编辑面前。
把资料交给别人
事实核查员拿到的是整个文件夹。每个文件用任何编辑器都能打开,前几行就是段落、署名、发表日期和网址,原本要问你的问题,变成了对方自己就能查的事。
截图在这一步最不中用。网页的图片里没有网址、没有日期,也没有可搜索的文字,资料文件夹里的每一张截图,最后都会变成一条问“这是从哪儿来的”消息。
采访前的背景阅读
前一天晚上,把六篇背景文章剪藏进这篇稿子的文件夹。通话时你搜索的是这个文件夹,而不是八个打开的标签页,一次搜索就覆盖六篇文章的全部文字,包括其中两篇要订阅才能看的。
因为是文本文件,搜索没有任何成本,在没有信号的楼里断了网也能用。换成标签页,它们可能已经过期、被重新加载、再次弹出 Cookie 提示,或者把你登出了。
和常见的资料收集习惯对比
这些都不算坏习惯,每一种都是某个人的工作方法。区别在于,到了核查那一步还剩下什么。
| 目前的做法 | 得到什么 | 代价是什么 |
|---|---|---|
| 给网页加书签 | 一个指针,一秒完成 | 它指向网页今天的内容,而不是你读到时的内容 |
| 截图保存段落 | 看得见的文字 | 没有网址、没有日期、文字不可搜索,核查员也无法独立核实 |
| 粘贴进资料文档 | 文字集中在一处 | 网站的页面元素跟着过来,出处却没有 |
| 稍后读服务 | 干净的副本,还能同步 | 取决于这项服务是否继续存在、是否允许导出 |
| 把网页打印成 PDF | 版式固定的记录 | 连 Cookie 提示栏一起打印,文字无法在整个文件夹里搜索,也没有元数据头 |
| Clean Web Clipper | 正文、署名、日期和网址都在一个文件里 | 没有版式、没有截图,也没有第三方证明你是何时存下的 |
剪藏内容没法引用时
作者字段为什么是空的?
网页没有扩展程序能识别的署名,或者署名所在的标记和章节标题无法区分。作者提取会读取结构化数据和署名标记,再过滤已知的误判(标题、刊物名称、按钮文字);过滤之后什么都不剩,字段就留空,而不是填上页面上第一个粗体字符串。你可以自己补上:它就是一个文本文件。
为什么只剪下了前三段?
通常是计量式付费墙:网页确实只渲染了一段试读,其余部分只对它认为有订阅的会话加载。也可能是延迟加载,正文随着滚动才出现。滚到文章末尾,确认最后一段已经显示在屏幕上,再剪藏一次。扩展程序保存的是浏览器在那一刻渲染出的内容。
文章被 Cookie 同意弹窗挡住,一直不出现?
有些网站在你做出选择之前什么都不渲染,DOM 里没有文章可提取,扩展程序会如实提示。按你平时的习惯处理弹窗,等网页渲染完成,再剪藏。无论选了什么,同意提示栏本身都不会进入剪藏内容。
文件名里的日期和 frontmatter 里的日期为什么对不上?
它们本来就不是同一个日期,也不该一样。文件名里的 {date} 是你剪藏网页的那天;frontmatter 里的 date 字段是网页自己声明的发表日期。把两者分开,你才能同时说清文章何时发表、你何时看到;frontmatter 日期为空,说明网页没有声明日期。
它不做的事
它不按网页原样存档:没有截图,没有版式,也不保存页面资源。它不做摘要,也不改写:文章正文是转换,不是编辑。图片保留为指向原网站的链接,所以原网站出问题,图片也会失效。网页上没有作者或日期时,字段会留空,而不是填上一个看似合理的猜测。