Clean Web Clipper 添加到 Chrome(免费)

适用人群

逐字保存法规条文的原始措辞

法规、服务条款和官方指引会在不另行通知的情况下变动。一份带着来源网址和页面声明日期的 Markdown 副本,记录的是你阅读当天这段文字的原话。

当措辞本身就是事实

供应商更新了服务条款,一份指引重新发布,某个门户网站把一条规定换了编号重新挂出,而你当初据以出具意见的那个版本,在原网址上已经不存在了。截图截下的是一屏画面,不是一份文件。打印成 PDF 会带上 Cookie 提示条,却丢了那张门槛表格。把页面丢进通用转换器,条款编号又会被压平成连续的正文。

真正要紧的细节,恰恰是转换最容易毁掉的部分。某个单元格里放了列表,费用表就会散架。脚注变成指回一个你已经离开的页面的失效锚点。项、目的序号并进上一款。结果读起来依然通顺,这比明显的出错更糟,因为没有任何迹象提示结构已经移位。

还有一个问题:页面在变成你的文件之前经过了哪里。一个把页面内容发到服务器上转换的剪藏工具,等于把你正在读的东西,在你读的那一刻,发给了第三方,而律师读什么,本身就是关于客户的信息。Clean Web Clipper 不上传它读到的任何内容,也不申请你所浏览网站的访问权限,所以它只能读取你点击的那个标签页,而且只在你点击的那一刻。它写出的文件也不绑定任何厂商,多年以后案卷仍需打开时,这一点又会变得重要。

转换之后保留下来的

条文结构在转换后完整保留:款、项的层次清楚npc.gov.cn:《中华人民共和国个人信息保护法》
---
title: "中华人民共和国个人信息保护法"
source: "http://www.npc.gov.cn/npc/c2/c30834/202108/t20210820_313088.html"
date: "2021-08-20"
extraction: "dom"
---

## 第四章 个人在个人信息处理活动中的权利

第四十七条 有下列情形之一的,个人信息处理者应当主动删除个人信息;
个人信息处理者未删除的,个人有权请求删除:

(一)处理目的已实现、无法实现或者为实现处理目的不再必要;

(二)个人信息处理者停止提供产品或者服务,或者保存期限已届满;

(三)个人撤回同意;

(四)个人信息处理者违反法律、行政法规或者违反约定处理个人信息;

(五)法律、行政法规规定的其他情形。

为案卷做好设置

下面的设置假定:多年以后,会有一个当时不在场的人来读这个文件。这和明天自己再读一遍,是完全不同的要求。

  1. 点击扩展程序图标打开 设置,把保存位置设为这件案子的文件所在的文件夹,在子文件夹一栏填入案号。换到下一件案子时,只需改这一栏。
  2. 把点击图标保持为 打开窗口。处理法律材料时,这两秒值得花:条款编号和费用表正是转换最容易损坏的地方,而窗口能让你在文件生成之前就看到问题。
  3. 把文件名模板设为 {date}-{domain}-{title}。当同一条文挂在四个网址上时,能确定版本的,是保存日期和发布机构。
  4. 打开 frontmatter 的全部字段,包括 extraction。一条注明正文取自渲染后的页面、而非结构化数据的记录,属于能回答问题而不是引出问题的细节。
  5. 把图片设为 跳过。官方页面上的图片多是徽标、分享按钮和本来就没有文字的示意图,而案卷里一个失效的图片链接,看起来像是缺了东西,而不是本来就没存。
  6. 把条文页面和“施行日期”或版本说明页面分成两次剪藏。两者的日期不同,而施行日期往往只出现在版本页面上。
  7. 在每个复核节点重新剪藏同一页面。第二个文件会加数字后缀,任意 diff 工具都能显示你出具意见时的版本和现行版本之间的差别。

法律材料用的设置

和默认设置相比,这组设置的区别主要在于谨慎:归档前先核对,记录正文的来路,绝不让第二次保存覆盖第一次。

设置为什么在这里用这个值
点击图标时打开窗口条款编号和费用表是转换最容易出错的地方,归档前先看一眼
保存位置案件文件夹,案号作为子文件夹记录属于这件案子,而不是一堆通用剪藏
文件名模板`{date}-{domain}-{title}`同一条文发布在多个网址上,靠发布机构和保存日期区分是哪一份
属性(frontmatter)全部字段,包括 `extraction`正文的来路本身就是记录的一部分,记下它只占一行
图片跳过只有徽标和分享图标,而文件里失效的图片链接看起来像记录有缺口
按网站规则监管机构或登记机关的域名 → 独立子文件夹一手资料和评论文章不该归在一起
重复剪藏每个复核节点再剪藏一次数字后缀会让两份都留下,diff 正需要两个文件
一张费用表,脚注仍然对得上号(原文为英文官方页面,仅译出表头与注释)一个官方收费标准页面
## 附表 2:应缴费用

| 申请事项                        | 费用    | 期限            |
| ------------------------------- | ------- | --------------- |
| 首次注册                        | £170[^1]| 28 天           |
| 每增加一个类别                  | £50     | 随申请一并提交  |
| 逾期续展                        | £50[^2] | 6 个月          |

[^1]: 未通过在线服务提交申请的,费用为 £200。
[^2]: 在续展费之外另行缴纳。

三个实际用法

供应商条款,改动前后

你在为供应商服务条款出具意见的当天剪藏了它。十一个月后,关于责任上限的那一条措辞变了,网站上没有公布任何版本历史,也没有通知客户。

因为第二次剪藏加了数字后缀、没有覆盖第一次,两个文件都在案件文件夹里,diff 工具会把改动的条款打印出来,可以直接附在备忘录后面。如果只有截图,就只能把两张图并排对照,然后祈祷没有看漏。

保留脚注的收费标准

一个官方收费页面上有一张三列表格,其中两个金额带着脚注标记,脚注正文在页面底部。表格保存为表格,参考链接变成 [^1][^2] 定义,集中在笔记末尾。

脚注正是通用转换器会丢掉的部分,因为参考链接依赖元素 id,而清理程序会把 id 删掉。这里的脚注在清理之前就已收集好:一个关于先后顺序的细节,决定了费用上的限定条件能不能保住。

重新编号后再次发布的指引

监管机构重新发布了一份指引,段落重新编号,其中两段合并。你手里有早先的剪藏,所以给客户的说明里可以写清旧文本的哪一段变成了新文本的哪一部分,并同时引用两者。

网址没变,页面只显示当前状态,没有早先的剪藏就无从比较。发布机构自己的档案里也许有旧版副本,也许没有,而这个文件的意义,就是不必在时间紧迫时去碰这个运气。

和常见的保存页面方法比

这张表里最重要的是最后一行。这个工具提供的是工作记录,不是证据;在这个区别要紧的场合,它非常要紧。

现在的做法得到什么代价是什么
给条款截图屏幕上的画面截下的是一屏画面,不是文件;长条文要截十几张
把页面打印成 PDF按页排版的副本Cookie 提示条也在里面,门槛表格常常丢失,文字无法 diff
把页面另存为 HTML完整的本地副本作为文件没法读,两次保存之间的 diff 也没法读
公证或电子存证服务独立的、带时间戳的副本每个页面都要花钱花时间,而且要事先判断哪些页面日后会用上
复制进案件笔记措辞,立刻到手项、目的序号并进正文,来源网址也不会带过来
Clean Web Clipper逐字原文、结构、网址和页面声明的日期没有时间戳、没有签名:这是你看到了什么的记录,不是对第三方的证明

转换结果不干净时

登记簿或搜索页没有返回文章

文件登记簿、案例检索页或结果列表大部分是链接文字,提取出的字符中如果超过大约四分之一位于链接内,扩展程序就会拒绝。请打开具体文件本身再剪藏。拒绝是有意为之:案卷里放着三百个被当作条文的链接文字,比什么都没有更糟。

条款编号不见了

先看看这些编号是否真的存在于页面文字中。网站如果正确标记了有序列表,嵌套和编号都会保留下来。如果编号是由样式表画出来的(生成的计数器,而不是文档里的字符),文字中就没有可以保存的东西,任何扩展程序都读不到只作为渲染指令存在的数字。解决办法是剪藏带真实编号的文件版本,通常是打印版或“纯文本”视图。

正式版本是 PDF

那么这个工具就不适合它。扩展程序转换的是渲染后的 HTML,而大量官方材料只以 PDF 发布。同一条文如果两种形式都有,剪藏 HTML 版并把 PDF 放在旁边;如果只有 PDF,就保留 PDF,同时剪藏它所在的页面,至少让网址和日期留档。

日期字段为空,或显示的是修订日期

扩展程序只记录页面在自身标记中声明的日期,别无其他。许多官方页面根本不声明日期,这时字段留空,而不是填上你阅读的那天。另一些页面声明的是最近一次修订的日期,而不是首次发布日期。这是页面对自己的说法,扩展程序照录,不做解读。网站如果公布施行日期,通常也在版本页面上,而不在正文页面上。

它不承诺什么

它不是经过认证的存档:没有第三方时间戳,也没有签名,文件记录的是你保存了什么,而不能向任何其他人证明这一点。它不读取 PDF,而大量官方材料恰恰以 PDF 形式发布。它不做解读、不抽取条款、不追踪修订,只转换一个页面。在文件登记簿或搜索结果页上没有文章正文,它会提示“没有文章”,而不是返回一串链接。

添加到 Chrome(免费)完全免费:无需账号,无需注册,没有限制。

常见问题

文字会被改动吗?
只有结构上的变化:HTML 变成 Markdown。正文中不增加、不删除、不调换任何字词。文章周围的导航和推广版块会被去掉,扩展程序还会记录它用的是哪条提取路径。
复杂的表格能保住吗?
通常能。Clean Web Clipper 自己序列化表格,而不依赖通用转换器;在 15 个表格的语料上,它保住了 12 个,参与对比的引擎各保住 7 个。深度嵌套的排版表格对任何工具来说仍然很难。
能剪藏法律文本的 PDF 吗?
不能。它转换的是页面渲染后的 HTML。同一条文如果两种形式都有发布,请剪藏 HTML 版本。
文件存在哪里?
存在你在自己磁盘上选定的文件夹里。你剪藏的任何内容都不会上传。
可以用于客户工作吗?
可以。无论个人使用还是职业使用都免费,没有付费版,没有许可证要管理,也没有账号要开通。
处理保密案件时用它安全吗?
扩展程序不申请你所浏览网站的访问权限,因此无法观察浏览行为,页面的文字、标题和内容都不会离开这台电脑。它确实会发送:剪藏成功时的纯域名、转换失败的页面地址、你打开了扩展程序的哪些界面,以及一个随机安装编号。处理保密案件时,请在设置中关闭这项,这样就什么都不会发出去。对标签页的访问由你自己点击图标或按快捷键授予,而且只针对那一个标签页。文件之后存在哪里、谁能读取那个文件夹,是你所在机构的问题,而不是扩展程序的问题。
能从付费订阅的法律数据库里剪藏吗?
技术上可以:扩展程序读取的是浏览器为你的会话渲染出来的页面。但你是否可以保存副本,由该数据库的许可条款决定,这类条款常常限制系统性下载,剪藏并不会改变条款的规定。
它能帮我比较两个版本吗?
不能。它只负责写文件,比较是 diff 工具的事;因为输出是纯文本,任何 diff 工具都能胜任。扩展程序保证的是,第二次保存不会悄悄替换第一次。
条款之间的交叉引用会怎样?
链接变成指向原始网址的 Markdown 链接,所以指向另一部法律文件的交叉引用仍然指向那份文件。页内锚点指回它们所在的页面,参考式脚注则作为 [^1] 定义集中在笔记末尾。
能不能每件案子一个文件夹,又不用每次改设置?
按网站规则是按网址模式分流,而不是按案件分流,所以监管机构或登记机关可以有一个固定的专属子文件夹。至于案件本身,开新案卷时改一行子文件夹就行。