Clean Web Clipper 添加到 Chrome(免费)

Chrome 扩展程序

把网页保存为不用再手动清理的 Markdown

点击图标,剪藏就已经完成:标题、作者、发布日期和来源收进 frontmatter,正文去掉了导航。一切都在你的浏览器中进行:无需账号,你剪藏的任何内容都不会上传到任何地方。

Clean Web Clipper 窗口,显示一篇剪藏下来的维基百科文章的 Markdown

Clean Web Clipper 是一款免费的 Chrome 扩展程序,可以把网页保存为干净的 Markdown:复制到剪贴板、保存为 .md 文件、写入文件夹,或直接存入 Obsidian vault,无需账号,也无需登录。在访问量最高的网站上测试了 512 个页面:没有崩溃,提取出的文章中没有任何残留的 HTML 标签。

添加到 Chrome(免费)完全免费,无需账号,没有限制。提取可以离线完成;联网时会发送使用事件,关闭一个开关即可停止。

在全球访问量最高的网站上测试了 512 个页面

共进行了两轮测试。第一轮从全球和俄罗斯访问量最高的一百个网站中取了 109 个页面,把输出与另外三个提取引擎逐一对比。第二轮取了十二个欧洲国家各自排名前五十的网站:又是 403 个页面,每个页面都以该国语言抓取,只用我们的核心处理。引擎、版本、日期,以及它落后的地方

512个测试页面
0次崩溃
0提取出的文章中残留的 HTML 标签
102在 109 个页面的对比中重复出现的菜单行,其他引擎分别为 282、478 和 491

问题从来不在转换本身,而在转换时一起带进来的那些东西。

每个剪藏工具都会把 HTML 转成 Markdown。然后你打开笔记,发现里面有 Cookie 提示条、侧栏菜单、“相关阅读”列表,还有一个在转换途中散了架的表格。Clean Web Clipper 正是围绕去掉这些东西而设计的,而且去除的效果是测量出来的,不是嘴上说说。

其他剪藏工具保留的内容

[跳到正文](#main) [登录](/login) [注册](/register)
[首页](/) [新闻](/news) [体育](/sport) [文化](/culture) [更多](/more)

我们使用 Cookie 及类似技术来改善你的体验。
[全部接受] [管理偏好]

# 你要看的那篇文章

正文真正的第一段。

<div class="promo-inline">

## 相关阅读
[另一个标题](/a) [又一个标题](/b) [还有第三个](/c)

最终进入笔记的内容

# 你要看的那篇文章

正文真正的第一段。
同一个新闻页面:一般剪藏工具保留了什么,Clean Web Clipper 保存了什么

输出为什么干净

真实输出,未经修改(节选开头)zh.wikipedia.org/zh-cn/马尔可夫链
---
title: "马尔可夫链 - 维基百科,自由的百科全书"
source: "https://zh.wikipedia.org/zh-cn/马尔可夫链"
date: "2005-10-05T22:17:32.000Z"
extraction: "dom"
---

马尔可夫链(英语:Markov chain),又称离散时间马尔可夫链(discrete-time
Markov chain,缩写为DTMC),因俄国数学家安德烈·马尔可夫得名,为状态空间中
经过从一个状态到另一个状态的转换的随机过程。该过程要求具备“无记忆”的性质:
下一状态的概率分布只能由当前状态决定,在时间序列中它前面的事件均与之无关。

如何在 Chrome 中把网页保存为 Markdown

安装扩展程序后,只需三步。不需要事先做任何设置:默认情况下,点击图标会打开一个预览窗口,Markdown 已经生成好,可以直接复制或保存为文件。以后你也可以改为点击一次就把笔记直接写入文件夹或 vault,跳过预览。

  1. 固定图标。 打开地址栏旁边的拼图图标菜单,把 Clean Web Clipper 固定到工具栏。
  2. 打开你想保存的文章:是文章页面本身,而不是列出文章链接的页面。
  3. 点击图标。 Markdown 会出现在预览窗口中:复制它,或者保存为 .md 文件。

保存到哪里

点击图标后的行为可以设置。可以保留预览窗口,也可以设成点击一次就把笔记放进 vault,什么窗口都不打开。

Clean Web Clipper 设置:选择点击图标时执行什么操作
设置决定一次点击做什么:预览、复制到剪贴板、保存文件、写入文件夹,或直接存入 vault。

如实标明来源

每篇笔记都带有一个 extraction 字段。dom 表示文本来自浏览器实际渲染出的内容。jsonld-articlebody 表示页面始终没有渲染完成,正文只能从页面自带的结构化数据中读取。而当页面上根本没有文章时,比如商品页、信息流或搜索结果页,扩展程序会直说,而不是把三百个链接倒给你。

Clean Web Clipper 的“效果”界面:剪藏次数、节省的时间、常用网站和失败的页面
效果:多少次剪藏成功,节省了多少时间,以及每一个没有成功的页面。
Clean Web Clipper 拒绝剪藏一个没有文章的页面,并提供发送其地址的选项
页面上没有文章:如实拒绝,而不是给你三百个菜单链接。
Clean Web Clipper 首次运行页面,包含三个设置步骤
首次运行:固定图标,剪藏一个页面,选择点击后的操作。

它不做什么

十五种使用方式

开发者代码块保留语言标签,文档粘贴进笔记,语法高亮立刻生效。

Clean Web Clipper 从页面本身读出代码语言:代码块的 class、父元素,或者高亮库留下的标记,再把它写进 Markdown 代码块。在九个页面的技术语料上,156 个代码块中有 73 个保留了语言标签,两款对比引擎分别只有 20 个和 0 个。

  • 代码块带着标签出来。 是 ```js,不是空的代码块:粘贴进 Obsidian、VS Code 或 GitHub,高亮马上就有。
  • 语言是读出来的,不是猜出来的。 它来自网站自己的高亮库留下的 class,所以标签的准确程度和原页面一致。
  • 单元格里带代码的表格保持完整:技术语料上 15 个表格保留了 12 个,对比的引擎各保留 7 个。
了解更多
Obsidian 用户在 vault 里选好一次文件夹,之后点一下,笔记就写进去,Obsidian 不用开着。

Clean Web Clipper 通过浏览器的 File System Access API,自己把 .md 文件写进你的 vault。中间没有社区插件,没有本地 REST 服务,也没有 obsidian:// 链接,笔记写入时 Obsidian 不需要在运行。

  • 不需要插件、本地服务或 obsidian:// 链接:浏览器把文件写进你授权的文件夹。
  • Obsidian 不必开着。 下次打开时,笔记已经在那里了。
  • YAML 属性包含 titlesourceauthordateextraction,保留哪些由你决定。
了解更多
AI 与大模型上下文页面上反复出现的导航也按 token 计费。文字交给模型之前,它们已经被删掉。

在 109 个页面的正面对比中,Clean Web Clipper 留下 102 行重复的导航,另外三个提取引擎分别留下 282、478 和 491 行,而且完全没有残留的 HTML 标签。送到模型面前的,是文章正文,外加一段写明来源网址和发布日期的属性头。

  • 重复导航大约只有对比引擎平均值的四分之一:102 行重复,对比引擎分别是 282、478 和 491 行。
  • 在测试的 512 个页面上,残留的 HTML 标签为零:模型没有任何需要绕开的标记。
  • 属性头写明来源网址和发布日期,所以一个说法可以被准确归属,而不是靠猜。
了解更多
研究人员直接读取 citation_date(arXiv、PubMed、IEEE 输出的标签),并把参考文献链接变成脚注。

保存下来的论文如果没有发表日期,日后引用时就得重新去查。Clean Web Clipper 从网页自身的元数据里读取日期,而不是从正文里猜;网页上没有日期时,这个字段就留空,不会填成今天。

  • citation_datecitation_publication_date(arXiv、PubMed 和 IEEE 输出的 meta 标签)会被直接读取。
  • 也读取 JSON-LD 的 datePublishedarticle:published_timetime[datetime] 和 Unix 时间戳,按这个优先顺序。
  • 网页上没有日期,字段就留空,绝不填成今天的日期。
了解更多
学生把课件、教材章节和参考网页剪藏成 Markdown 文件,课程账号停用之后,文件依然在你手里。

学期一结束,课程资料就会消失:链接失效,课程页面被归档,研讨课的阅读材料换了地址。存在你自己磁盘上的 Markdown 文件不会,十年后用任何编辑器都能打开,来源网址也还在文件里。

  • 先选中一段文字,就只剪藏选中内容:只要一个定义、不要整页时就这么做。
  • 每篇笔记都带来源网址,以后引用不用再找。
  • 阅读视图把剪藏显示为普通文字,保存之前看不到 Markdown 符号。
了解更多
写作者每次剪藏都带着标题、作者、发表日期和来源网址,引文的出处跟着文字走。

用截图和书签收集的资料,到了需要注明出处的那一刻就用不上了。Markdown 文件把标题、作者、日期和网址与正文放在同一个文件里,核查事实时随手就能找到。

  • 每篇笔记的 frontmatter 里都有 titleauthordatesource,出处和正文待在一起。
  • 作者字段经过过滤:章节标题、刊物名称和按钮文字不会被当成署名。
  • 只保留文章正文:订阅框、分享栏和“延伸阅读”栏不会进入笔记。
了解更多
记者你读到的原文、网址和发布日期,保存为你自己磁盘上的一个文件。

网页会被修改,也会被删除。一次剪藏会保存全文、来源网址,以及页面自己声明的发布日期,存成一个由你保管的普通文件,而不是放在一个可能关停、改规则或悄悄丢失记录的服务里。

  • 发布日期取自页面自身的元数据:JSON-LD、article:published_timetime[datetime],而不是从正文里猜。
  • 来源网址写在每条笔记的 frontmatter 里
  • 文章全文,去掉每次访问都在变的导航和推广版块
了解更多
法律工作条文按发布时的原样保存,附来源网址和日期,存进由你掌控的文件。

法规、服务条款和官方指引会在不另行通知的情况下变动。一份带着来源网址和页面声明日期的 Markdown 副本,记录的是你阅读当天这段文字的原话。

  • 逐字保留原文:正文中没有任何内容被概括、改写或调换顺序。
  • 来源网址和页面声明的发布日期 写在每条笔记的 frontmatter 里。
  • 费用、期限和门槛表格 由扩展程序自己序列化:在技术语料上保住了 15 个表格中的 12 个,参与对比的每个引擎各保住 7 个。
了解更多
分析师单元格里有代码、列表或链接,整行也不再散架:15 个表格保住 12 个。

通用的 HTML 转 Markdown 转换器,偏偏在最要紧的表格上出错:单元格里带列表、链接或代码示例的那种。Clean Web Clipper 自己序列化表格,把单元格内容压平,而不是丢掉整行。

  • 专门为此编写的 GFM 表格序列化器,而不是给通用转换器外挂的插件。
  • 技术语料上 15 个表格保住 12 个,参与对比的每个引擎各保住 7 个。
  • 参差不齐的两列表格 转成加粗的键和值,而不是一张散架的网格。
了解更多
教师只要材料,不要网站本身:打印出来的纸上没有菜单、没有 Cookie 提示栏,也没有广告。

直接从浏览器打印网页,菜单、Cookie 提示栏和广告都会一起印到讲义上。剪藏只留下正文,来源网址写在文件里,注明出处不必再多花功夫。

  • 打印按钮打印的是剪藏内容,而不是它周围的整个网页。
  • 阅读视图把结果显示为普通文本,不带 Markdown 符号,打印或保存之前就能看到。
  • 选中一道练习或一个定义,只剪藏这一部分。
了解更多
译者菜单、横幅和重复的导航,一行都不会进入句段列表。

从网页粘贴过来的原文会带着导航,每个菜单项都变成一个句段:要跳过,要计数,最后还得在账单上解释。Clean Web Clipper 在文件进入你的工具之前就把它们去掉。

  • 菜单、分页器、Cookie 提示栏和“继续阅读”信息流,在文件生成之前就被去掉。
  • 重复的导航大约只剩四分之一:与参与比较的引擎相比,重复的菜单行是 102 行,对方分别是 282、478 和 491 行。
  • 512 个实测网页中,残留的 HTML 标签为零,不会有零散的标记变成内嵌标签。
了解更多
产品经理把更新日志、文档和发布说明剪藏成可以搜索、对比和引用的文件。

存成书签的竞品调研,会慢慢退化成一串搜不了的链接。剪藏成 Markdown 之后,它就成了一个语料库:可以用 grep 搜索,可以和上季度的采集做 diff,也可以连同日期一起引用到决策文档里。

  • 发布日期从网页读取,更新日志条目保留真实的时间,而不是你发现它的那一天。
  • 按网站规则自动把每个竞品放进各自的文件夹
  • 定价和限额表格保持完整:技术语料中的 15 个表格保留了 12 个,参与比较的引擎各为 7 个。
了解更多
技术写作者标题、表格、代码块和脚注都能带过来,网站的导航和外壳留在原处。

迁移文档通常是先把 HTML 转换一遍,再花更长的时间删掉转换器留下的东西。Clean Web Clipper 正是围绕这一步设计的,也是经过测量的部分:512 个页面中残留的 HTML 标签为零。

  • 标题、列表、表格、代码块和脚注都对应为标准 Markdown。
  • 代码块保留语言标记:在技术语料上,156 个代码块中保留了 73 个,对比的引擎分别为 20 个和 0 个。
  • 残留的 HTML 标签为零,共测量 512 个页面。
了解更多
个人存档存在你自己硬盘上的纯 Markdown 文件。不要账号,不依赖服务,也就没有什么会被关停。

书签指向的页面会改动、会消失;稍后阅读服务会关闭、被收购,或者开始对导出收费。剪藏保存的是文字本身,格式不属于任何厂商,也没有过期一说,存放位置由你决定。

  • 持久、开放的格式:带 YAML frontmatter 的纯文本,任何编辑器和 grep 都能读。
  • 不要账号,什么都不上传:你剪藏的内容留在你自己的硬盘上。
  • 发布日期和来源 URL 与正文一起保存,多年以后仍能认出这篇笔记是什么。
了解更多
无干扰阅读一个没有菜单、没有横幅、没有 Markdown 符号的阅读视图,跟随浏览器自己的主题。

页面上的附属元素不只是视觉上的杂乱:它们是读屏软件每次都要朗读、读者每次都要跳过的文字。剪藏窗口只显示文章本身,跟随浏览器的浅色或深色设置,而且不运行任何页面脚本。

  • 阅读视图把剪藏显示为普通文本:没有 Markdown 符号,链接可以点击,标题是真正的标题。
  • 它跟随浏览器的浅色和深色设置,而不是网站的配色。
  • 遇到长文,窗口可以扩大到大约四分之三屏幕
了解更多
添加到 Chrome(免费)完全免费,无需账号,没有限制。提取可以离线完成;联网时会发送使用事件,关闭一个开关即可停止。

常见问题

Clean Web Clipper 会把我的页面发送到别处吗?
你的页面,不会。提取和转换完全在你的浏览器内完成:复制的内容进入剪贴板,文件写到你的磁盘,页面文本和标题都不会离开这台电脑。会发送到我们自己统计服务器的有四样东西:找不到文章的页面地址、剪藏成功时的纯域名、你打开的扩展程序界面名称,以及一个把这些事件关联起来的随机安装编号。服务器还会记录根据 IP 地址推算出的大致位置(国家、地区和城市),IP 地址本身不会保存。这些都不会交给第三方,在设置中关闭一个开关就能全部停止,并删除这个编号。扩展程序不会在你浏览的网站上申请任何权限,所以它无法查看你没有点击的页面。
保存到 vault 时需要让 Obsidian 保持运行吗?
不需要。Clean Web Clipper 通过浏览器的 File System Access API,把文件直接写入你授权访问的文件夹。Obsidian 下次查看 vault 时就会读到这个文件。
在不是文章的页面上会怎样?
它会直说。在商品页、信息流和搜索结果页上没有可提取的文章,扩展程序会把这次剪藏标记为“没有文章”,而不是返回一整页链接。
支持哪些浏览器?
Chrome 和其他 Chromium 内核浏览器:Edge、Brave、Vivaldi、Opera。它是 Manifest V3 扩展程序,唯一可能通信的地址是我们自己的统计地址,从不与你浏览的网站通信。
它是免费的吗?
是的,全部免费。本网站描述的每一项功能都在免费的扩展程序中可用:没有页数限制的剪藏、Obsidian vault、按网站规则、脚注、表格、代码语言标签和阅读视图。界面支持 19 种语言,并跟随你的浏览器语言设置。没有付费版,没有账号,无需注册。