适用人群
保存论文,也留住它的发表日期
保存下来的论文如果没有发表日期,日后引用时就得重新去查。Clean Web Clipper 从网页自身的元数据里读取日期,而不是从正文里猜;网页上没有日期时,这个字段就留空,不会填成今天。
论文在哪一步丢了出处
你在浏览器里读了一篇预印本,存了下来;三个月后再看,笔记里既没有发表时间,也看不出读的是哪个版本。摘要页早已更新到 v3,参考文献链接变成了指向原网页的失效锚点,作者一栏写着 “Skip to main content”,因为剪藏工具抓了页面上第一个粗体字符串。
日期是最麻烦的,因为出错时毫无动静。把保存当天写进笔记的剪藏工具,生成的文件看起来没问题,实际上是错的。一年后,两百篇笔记里哪些是真实的发表日期、哪些只是你碰巧阅读的那一天,已经分不清:文件里没有任何东西能把两者区分开。
原文和思考最后散落在不同的地方。文献管理软件存着元数据,笔记软件存着你的批注,而你批注的那段原文哪边都没有。写论文时回头去找,一半的链接跳到了付费墙:当初你是通过学校的机构账号读的,那次登录早已过期。把原文本身和你对它的笔记放在同一个文件里,这一趟往返就彻底省掉了。
笔记里记下了什么
citation_date和citation_publication_date(arXiv、PubMed 和 IEEE 输出的 meta 标签)会被直接读取。- 也读取 JSON-LD 的
datePublished、article:published_time、time[datetime]和 Unix 时间戳,按这个优先顺序。 - 网页上没有日期,字段就留空,绝不填成今天的日期。
- 参考文献链接变成
[^1]脚注,脚注内容统一收在笔记末尾。 - 作者字段经过过滤:章节标题、期刊名称和按钮文字不会被当成作者。
extraction字段记录提取途径:dom表示来自渲染后的网页,jsonld-articlebody表示网页没有渲染完成、正文取自结构化数据。- 发表日期和剪藏日期不会混在一起:网页的日期是 frontmatter 里的字段,你剪藏的那天是文件名里的
{date},两者有意分开存放。 - 在实测的 512 个网页上,残留的 HTML 标签为零,所以粘贴进稿件的段落不会夹带多余的
span或半截图注。
--- title: "Attention Is All You Need" source: "https://arxiv.org/abs/1706.03762" author: "Ashish Vaswani, Noam Shazeer, Niki Parmar" date: "2017-06-12" extraction: "dom" --- The dominant sequence transduction models are based on complex recurrent or convolutional neural networks.[^1] [^1]: Submitted 12 June 2017. Comments: 15 pages, 5 figures.
为读论文做好设置
默认设置是为快速读文章调校的。文献文件夹需要的恰恰相反:保留所有元数据字段,并且在归档之前先看一眼结果。
- 点击扩展程序图标,打开设置,把保存位置设为项目资料所在的文件夹:稿件旁边的
sources/,或 vault 中的某个文件夹。 - “点击图标时”保持为打开窗口(预览窗口),不要改成“存到文件夹”。对论文来说这个窗口很值得:文件生成之前,你能在这里确认日期和作者有没有真的提取出来。
- 把文件名模板设为
{domain}-{title}。预印本服务器、期刊和机构知识库上的同一篇论文标题相同,却是三份不同的文献;在文件夹列表里,要靠域名才能区分。 - 打开所有 frontmatter 字段,包括
extraction。这个字段在这里比在任何场景都重要:jsonld-articlebody表示正文来自网页的结构化数据而不是渲染出的内容,两者并不总是同一个版本。 - 图片保持“保留为链接”。插图往往就是论证本身,链接至少说明这里有过一张图;直接跳过,就悄悄抹掉了论文有插图这件事。
- 摘要页和全文 HTML 页都存在时,分别剪藏。两者带的元数据不同:摘要页通常有
citation_date标签,全文页则有参考文献。 - 第一次剪藏某个没用过的出版方网站后,看一下
date字段。如果为空,说明该网站的标记里没有日期,任何设置都变不出日期来。
文献文件夹的推荐设置
这张表的重点不是速度,而是确保两年之后,文件依然说得清自己从哪里来、是怎么得到的。
| 设置 | 值 | 为什么这样设 |
|---|---|---|
| 点击图标 | 打开窗口(预览) | 变成文件之前,唯一一次确认日期和作者是否完整的机会 |
| 保存位置 | 稿件旁边的 `sources/` 文件夹 | 原文段落和关于它的写作放在一处,一起备份 |
| 文件名模板 | `{domain}-{title}` | 预印本、期刊版本和知识库副本标题相同,却不是同一份文献 |
| Frontmatter | 全部字段,包括 `extraction` | 提取途径很重要:结构化数据和渲染出的正文偶尔是不同版本 |
| 图片 | 保留为链接 | 图片链接记下了这里有过一张图;跳过就把这件事藏起来了 |
| 按网站规则 | `arxiv.org` → 子文件夹 `preprints` | 预印本会被新版本取代,值得作为一组集中复查 |
| 选中内容 | 只要某一节时,先选中再剪藏 | 方法部分被引用的次数,远多于整篇论文被通读的次数 |
--- title: "不同测序平台间变异检测的可重复性" source: "https://example-journal.org/articles/vc-repro" author: "M. Ilves, R. Okonkwo" date: "" extraction: "jsonld-articlebody" --- ## 摘要 对于长度超过 8 个碱基的插入缺失,平台间的一致性低于 0.90; 而在测试的全部四个流程中,碱基替换的检测结果均一致。
三种典型用法
引用之后内容变了的预印本
你在 3 月读了某篇预印本的 v1 并剪藏下来。到了 9 月,摘要页显示的是 v3:结果部分重写了,还多了两位作者。你再剪藏一次,第二个文件会加上数字后缀,而不会覆盖第一个。
现在用任何 diff 工具都能看清,你引用的版本和读者打开同一网址看到的版本之间,哪些论断变了。没有 3 月那份文件,你连“有东西变了”都无法证明:网址一模一样,而网页只显示它现在的样子。
要机构登录才能看的全文
你在校园网内,或者通过图书馆登录,文章就能正常显示。扩展程序读取的是浏览器已经渲染出的内容,所以全文和其他网页一样能剪藏,参考文献会变成 [^1] 脚注,统一收在笔记末尾。
半年后这一点就显出价值了:登录已经过期,同一个链接开始要你付费。而那段原文、作者和日期都在你磁盘上的文件里,文件的任何部分都不依赖订阅是否还有效。
写论文时,资料就在同一个文件夹
稿件放在 paper/,剪藏的资料放在 paper/sources/。稿件里的每一处引文都能对照原文件核实,不用打开浏览器;参考文献列表需要的网址和日期,就是文件开头的两行。
因为都是纯文本,在文件夹里用 grep 一搜,就能回答文献管理软件回答不了的问题:不是你存了哪些论文,而是其中哪几篇真的用过某个说法。
和常见的文献阅读方式对比
大多数人已经在用其中两三种。诚实地比较,不是说它们不行,而是每种方式丢掉的东西各不相同。
| 目前的做法 | 得到什么 | 代价是什么 |
|---|---|---|
| 文献管理软件的浏览器按钮 | 结构化的元数据,常常还有 PDF | 正文锁在数据库里,引文还得重新打一遍 |
| 下载 PDF | 正式出版的版本,版式完整 | 不借助额外工具,无法在整个文件夹里搜索,也无法比对不同版本 |
| 给摘要页加书签 | 一个指针,一秒完成 | 预印本在原地更新,书签悄无声息地跟着变 |
| 复制粘贴段落 | 你需要的那段文字 | 没有日期、没有网址,也没有参考文献的内容 |
| Clean Web Clipper | 网页正文、元数据和脚注,存成一个文件 | 只支持 HTML:不读 PDF,也不生成引用键 |
元数据没提取出来时
日期字段为什么是空的?
网页上没有扩展程序能识别的日期。它先找 citation_date 和 citation_publication_date(arXiv、PubMed 和 IEEE 使用的标签),再依次找 JSON-LD 的 datePublished、article:published_time、time[datetime] 和 Unix 时间戳。这些都不存在时,字段留空,不会填成今天:文献文件夹里一个看似合理的错误日期,总是在最要命的时候才被发现。
论文明明有作者,作者字段却是空的?
作者提取会读取结构化数据和署名标记,再过滤掉常见的误判:章节标题、期刊名称、“authority control” 区块和按钮文字。有些出版方把作者列表放在由 JavaScript 渲染的组件里,完全没有署名标记,过滤之后什么也不剩。留空是有意为之:在不止一个剪藏工具里,作者一栏都出现过 “Skip to main content”。
为什么只剪下了摘要,没有全文?
你剪藏的是摘要落地页,对大多数预印本服务器和期刊来说,这个页面确实只有摘要。全文在另一个网址,通常是同一页面上的“全文”“HTML”或“阅读”链接。把那个页面也剪藏下来:两个页面带的元数据不同,值得存成两个文件。
公式为什么不见了?
以图片形式渲染的数学公式会保留为图片链接;如果你把图片设成了“跳过”,公式就会完全消失。出版方用文本渲染公式时,字符会原样保留。扩展程序不会转换成 LaTeX:它读取网页渲染出的内容,不会从公式图片里还原符号。
它做不到的事
它读取的是 HTML,不是 PDF:只有 PDF 版本的论文,扩展程序无法转换。它不获取 BibTeX,也不生成引用键;frontmatter 是元数据,不是参考文献条目。以图片形式渲染的数学公式仍然是图片链接。还有些网站的标记里根本不写日期,遇到这种网站,字段会留空而不是靠猜:这是诚实的结果,但字段终究是空的。
常见问题
网页上没有发表日期怎么办?
能剪藏 PDF 吗?
剪藏后脚注链接还能用吗?
需要机构登录才能看的论文能剪藏吗?
它怎么判断作者是谁?
数据表和补充材料里的表格能保留吗?
它会获取 DOI、BibTeX 或引用键吗?
笔记里的 `jsonld-articlebody` 是什么意思?
笔记会记录我读的是预印本的哪个版本吗?
source 一行里也会有;文件名里的 {date} 记下了你剪藏的时间。以后再剪藏同一篇论文,两个文件可以直接比对,这是版本发生过变化唯一可靠的记录。