适用人群
逐字保存法规条文的原始措辞
法规、服务条款和官方指引会在不另行通知的情况下变动。一份带着来源网址和页面声明日期的 Markdown 副本,记录的是你阅读当天这段文字的原话。
当措辞本身就是事实
供应商更新了服务条款,一份指引重新发布,某个门户网站把一条规定换了编号重新挂出,而你当初据以出具意见的那个版本,在原网址上已经不存在了。截图截下的是一屏画面,不是一份文件。打印成 PDF 会带上 Cookie 提示条,却丢了那张门槛表格。把页面丢进通用转换器,条款编号又会被压平成连续的正文。
真正要紧的细节,恰恰是转换最容易毁掉的部分。某个单元格里放了列表,费用表就会散架。脚注变成指回一个你已经离开的页面的失效锚点。项、目的序号并进上一款。结果读起来依然通顺,这比明显的出错更糟,因为没有任何迹象提示结构已经移位。
还有一个问题:页面在变成你的文件之前经过了哪里。一个把页面内容发到服务器上转换的剪藏工具,等于把你正在读的东西,在你读的那一刻,发给了第三方,而律师读什么,本身就是关于客户的信息。Clean Web Clipper 不上传它读到的任何内容,也不申请你所浏览网站的访问权限,所以它只能读取你点击的那个标签页,而且只在你点击的那一刻。它写出的文件也不绑定任何厂商,多年以后案卷仍需打开时,这一点又会变得重要。
转换之后保留下来的
- 逐字保留原文:正文中没有任何内容被概括、改写或调换顺序。
- 来源网址和页面声明的发布日期 写在每条笔记的 frontmatter 里。
- 费用、期限和门槛表格 由扩展程序自己序列化:在技术语料上保住了 15 个表格中的 12 个,参与对比的每个引擎各保住 7 个。
- 脚注和参考链接变成
[^1]定义,集中在笔记末尾,而不是失效的锚点。 - 编号列表和字母列表保留嵌套层级,条款结构依然看得清。
- 文件留在你自己的磁盘上:不上传、无需账号,整个链条中没有任何第三方。
- 不申请你所浏览网站的访问权限,扩展程序只能在你点击时读取那一个标签页,无从观察你的浏览行为。
- 同一条文的第二次剪藏永远不会覆盖第一次。文件重名时加数字后缀,早先的措辞留档备查。
--- title: "中华人民共和国个人信息保护法" source: "http://www.npc.gov.cn/npc/c2/c30834/202108/t20210820_313088.html" date: "2021-08-20" extraction: "dom" --- ## 第四章 个人在个人信息处理活动中的权利 第四十七条 有下列情形之一的,个人信息处理者应当主动删除个人信息; 个人信息处理者未删除的,个人有权请求删除: (一)处理目的已实现、无法实现或者为实现处理目的不再必要; (二)个人信息处理者停止提供产品或者服务,或者保存期限已届满; (三)个人撤回同意; (四)个人信息处理者违反法律、行政法规或者违反约定处理个人信息; (五)法律、行政法规规定的其他情形。
为案卷做好设置
下面的设置假定:多年以后,会有一个当时不在场的人来读这个文件。这和明天自己再读一遍,是完全不同的要求。
- 点击扩展程序图标打开 设置,把保存位置设为这件案子的文件所在的文件夹,在子文件夹一栏填入案号。换到下一件案子时,只需改这一栏。
- 把点击图标保持为 打开窗口。处理法律材料时,这两秒值得花:条款编号和费用表正是转换最容易损坏的地方,而窗口能让你在文件生成之前就看到问题。
- 把文件名模板设为
{date}-{domain}-{title}。当同一条文挂在四个网址上时,能确定版本的,是保存日期和发布机构。 - 打开 frontmatter 的全部字段,包括
extraction。一条注明正文取自渲染后的页面、而非结构化数据的记录,属于能回答问题而不是引出问题的细节。 - 把图片设为 跳过。官方页面上的图片多是徽标、分享按钮和本来就没有文字的示意图,而案卷里一个失效的图片链接,看起来像是缺了东西,而不是本来就没存。
- 把条文页面和“施行日期”或版本说明页面分成两次剪藏。两者的日期不同,而施行日期往往只出现在版本页面上。
- 在每个复核节点重新剪藏同一页面。第二个文件会加数字后缀,任意 diff 工具都能显示你出具意见时的版本和现行版本之间的差别。
法律材料用的设置
和默认设置相比,这组设置的区别主要在于谨慎:归档前先核对,记录正文的来路,绝不让第二次保存覆盖第一次。
| 设置 | 值 | 为什么在这里用这个值 |
|---|---|---|
| 点击图标时 | 打开窗口 | 条款编号和费用表是转换最容易出错的地方,归档前先看一眼 |
| 保存位置 | 案件文件夹,案号作为子文件夹 | 记录属于这件案子,而不是一堆通用剪藏 |
| 文件名模板 | `{date}-{domain}-{title}` | 同一条文发布在多个网址上,靠发布机构和保存日期区分是哪一份 |
| 属性(frontmatter) | 全部字段,包括 `extraction` | 正文的来路本身就是记录的一部分,记下它只占一行 |
| 图片 | 跳过 | 只有徽标和分享图标,而文件里失效的图片链接看起来像记录有缺口 |
| 按网站规则 | 监管机构或登记机关的域名 → 独立子文件夹 | 一手资料和评论文章不该归在一起 |
| 重复剪藏 | 每个复核节点再剪藏一次 | 数字后缀会让两份都留下,diff 正需要两个文件 |
## 附表 2:应缴费用 | 申请事项 | 费用 | 期限 | | ------------------------------- | ------- | --------------- | | 首次注册 | £170[^1]| 28 天 | | 每增加一个类别 | £50 | 随申请一并提交 | | 逾期续展 | £50[^2] | 6 个月 | [^1]: 未通过在线服务提交申请的,费用为 £200。 [^2]: 在续展费之外另行缴纳。
三个实际用法
供应商条款,改动前后
你在为供应商服务条款出具意见的当天剪藏了它。十一个月后,关于责任上限的那一条措辞变了,网站上没有公布任何版本历史,也没有通知客户。
因为第二次剪藏加了数字后缀、没有覆盖第一次,两个文件都在案件文件夹里,diff 工具会把改动的条款打印出来,可以直接附在备忘录后面。如果只有截图,就只能把两张图并排对照,然后祈祷没有看漏。
保留脚注的收费标准
一个官方收费页面上有一张三列表格,其中两个金额带着脚注标记,脚注正文在页面底部。表格保存为表格,参考链接变成 [^1] 和 [^2] 定义,集中在笔记末尾。
脚注正是通用转换器会丢掉的部分,因为参考链接依赖元素 id,而清理程序会把 id 删掉。这里的脚注在清理之前就已收集好:一个关于先后顺序的细节,决定了费用上的限定条件能不能保住。
重新编号后再次发布的指引
监管机构重新发布了一份指引,段落重新编号,其中两段合并。你手里有早先的剪藏,所以给客户的说明里可以写清旧文本的哪一段变成了新文本的哪一部分,并同时引用两者。
网址没变,页面只显示当前状态,没有早先的剪藏就无从比较。发布机构自己的档案里也许有旧版副本,也许没有,而这个文件的意义,就是不必在时间紧迫时去碰这个运气。
和常见的保存页面方法比
这张表里最重要的是最后一行。这个工具提供的是工作记录,不是证据;在这个区别要紧的场合,它非常要紧。
| 现在的做法 | 得到什么 | 代价是什么 |
|---|---|---|
| 给条款截图 | 屏幕上的画面 | 截下的是一屏画面,不是文件;长条文要截十几张 |
| 把页面打印成 PDF | 按页排版的副本 | Cookie 提示条也在里面,门槛表格常常丢失,文字无法 diff |
| 把页面另存为 HTML | 完整的本地副本 | 作为文件没法读,两次保存之间的 diff 也没法读 |
| 公证或电子存证服务 | 独立的、带时间戳的副本 | 每个页面都要花钱花时间,而且要事先判断哪些页面日后会用上 |
| 复制进案件笔记 | 措辞,立刻到手 | 项、目的序号并进正文,来源网址也不会带过来 |
| Clean Web Clipper | 逐字原文、结构、网址和页面声明的日期 | 没有时间戳、没有签名:这是你看到了什么的记录,不是对第三方的证明 |
转换结果不干净时
登记簿或搜索页没有返回文章
文件登记簿、案例检索页或结果列表大部分是链接文字,提取出的字符中如果超过大约四分之一位于链接内,扩展程序就会拒绝。请打开具体文件本身再剪藏。拒绝是有意为之:案卷里放着三百个被当作条文的链接文字,比什么都没有更糟。
条款编号不见了
先看看这些编号是否真的存在于页面文字中。网站如果正确标记了有序列表,嵌套和编号都会保留下来。如果编号是由样式表画出来的(生成的计数器,而不是文档里的字符),文字中就没有可以保存的东西,任何扩展程序都读不到只作为渲染指令存在的数字。解决办法是剪藏带真实编号的文件版本,通常是打印版或“纯文本”视图。
正式版本是 PDF
那么这个工具就不适合它。扩展程序转换的是渲染后的 HTML,而大量官方材料只以 PDF 发布。同一条文如果两种形式都有,剪藏 HTML 版并把 PDF 放在旁边;如果只有 PDF,就保留 PDF,同时剪藏它所在的页面,至少让网址和日期留档。
日期字段为空,或显示的是修订日期
扩展程序只记录页面在自身标记中声明的日期,别无其他。许多官方页面根本不声明日期,这时字段留空,而不是填上你阅读的那天。另一些页面声明的是最近一次修订的日期,而不是首次发布日期。这是页面对自己的说法,扩展程序照录,不做解读。网站如果公布施行日期,通常也在版本页面上,而不在正文页面上。
它不承诺什么
它不是经过认证的存档:没有第三方时间戳,也没有签名,文件记录的是你保存了什么,而不能向任何其他人证明这一点。它不读取 PDF,而大量官方材料恰恰以 PDF 形式发布。它不做解读、不抽取条款、不追踪修订,只转换一个页面。在文件登记簿或搜索结果页上没有文章正文,它会提示“没有文章”,而不是返回一串链接。
常见问题
文字会被改动吗?
复杂的表格能保住吗?
能剪藏法律文本的 PDF 吗?
文件存在哪里?
可以用于客户工作吗?
处理保密案件时用它安全吗?
能从付费订阅的法律数据库里剪藏吗?
它能帮我比较两个版本吗?
条款之间的交叉引用会怎样?
[^1] 定义集中在笔记末尾。