Clean Web Clipper 添加到 Chrome(免费)

测量 · ·

Defuddle、Readability 与 MarkSnip 对比:测了什么,结果如何

Clean Web Clipper 于 2026 年 8 月底在 512 个页面上接受测试:109 个与另外三个引擎逐一对比,403 个只用我们的核心处理。没有崩溃,提取的文章中没有残留 HTML 标签。语料和脚本将随下一轮测试公布;在那之前,本基准测试页面就是完整记录。

四个引擎如何在同样 109 个页面上对比?

在同样 109 个页面上,Clean Web Clipper 留下的重复菜单行最少:102 行,其他三个引擎为 282–491 行,而且没有崩溃。语料来自全球和俄罗斯访问量最高的各一百个网站。非内容类域名(即时通讯、网上银行、流媒体、政府门户)事先已排除。页面用真实浏览器抓取,只要首页上有内容链接,就顺着它打开一个内容页面。

四个引擎处理同样的 109 个抓取页面:Defuddle 0.19.3 加 Turndown 7.2.4(官方 Obsidian Web Clipper 的核心)、Mozilla Readability 0.6.0 加同一个 Turndown(MarkDownload 的核心)、MarkSnip 5.2.0(它实际发布的代码,从 Chrome 应用商店的安装包中解压得到),以及 Clean Web Clipper 0.1.0。

指标Defuddle 0.19.3Mozilla Readability 0.6.0MarkSnip 5.2.0Clean Web Clipper 0.1.0
页面109107107109
崩溃0220
残留 HTML53271820
重复的菜单行491282478102
短行比例0.2780.2620.2630.221
识别出的作者23272828
识别出的发布日期28131324
提取出的表格(共 56 个)38115
有用文本占比0.8780.9310.9340.890

Defuddle 0.19.3 是官方 Obsidian Web Clipper 的核心,见 github.com/kepano/defuddle;Mozilla Readability 0.6.0 是 MarkDownload 的核心,见 github.com/mozilla/readability;两者都搭配 Turndown 7.2.4 完成 Markdown 转换。MarkSnip 5.2.0 运行的是它 Chrome 应用商店安装包中的真实代码,解压后用桩代码替代浏览器 API 运行。第一个语料是 Similarweb 的全球前 100 名(2026 年 5 月),以及 Similarweb、Semrush 和 Mediascope 的俄罗斯互联网前 100 名(2026 年);第二个语料是十二个欧洲国家各自排名前五十的网站。

添加到 Chrome(免费)免费,无需账号 · 2026 年 8 月测试了 512 个页面,0 次崩溃。提取可以离线完成;在设置中关闭一个开关即可停止使用事件。For Chrome on a computer

查看 Clean Web Clipper 落后的地方

基准测试汇总:测试 512 个页面,0 次崩溃,0 个残留标签;在 109 个页面上,重复的菜单行有 102 条,另外三个引擎为 282–491 条
维基百科“马尔可夫链”页面,页头、横幅、目录侧栏和信息框被红框标出,旁边的剪藏窗口只显示文章的 Markdown
剪藏为 Markdown 的 MDN String.prototype.replace() 页面:标有 js 的代码块,以及保留为 Markdown 行的“模式 | 插入值”表格

查看核心在十二种欧洲语言 403 个页面上的结果

十二个国家各自排名前五十的网站,抓取时浏览器语言设为该国语言,否则其中一半会返回英文页面,测到的就是别的东西了。

403 个页面中有 152 个得到的回答是“没有文章”:商店首页、门户首页和信息流,这些页面上没有可提取的文章。这个回答是有意为之的,这也是这些页面被计为“已测试”而不是“已剪藏”的原因。如果你需要的文章被拒绝了,那就是 bug:这里说明如何报告这个页面

语言页面崩溃残留 HTML链接占比
德语40000.058
法语39000.050
西班牙语40000.060
意大利语40000.036
波兰语30000.064
葡萄牙语36000.060
荷兰语37000.049
土耳其语31000.042
乌克兰语13000.054
捷克语28000.039
瑞典语28000.036
罗马尼亚语41000.039

每个页面 4 分 38 秒是怎样计算的?

lessroutinemorelife.com 上的计数器为你对其做过操作(复制、保存、打印或发送到 AI 聊天)的每个页面按 4 分 38 秒计算,每个页面每天只计一次。打开窗口不算节省,计为零。这个时间由所有者手动计时得出(2026 年,1,000 多个不同的内容页面):复制文本、粘贴、清理、加上标题和来源,再检查有没有残留的 HTML 标记。平均值和中位数都计算过。

因此,计数器显示的是这类页面的数量乘以这个时间,而不是每次操作用秒表计时的总和。它并不测量某一个页面原本会花掉你多少时间。

了解这些指标的含义

了解这次测量的局限

复现这次基准测试

第一轮于 2026 年 8 月 30 日抓取并评分,第二轮于 2026 年 8 月 31 日,环境为 Node 24、jsdom 29.1.1 和 Playwright 1.62.1(Chromium)。版本:Defuddle 0.19.3、Mozilla Readability 0.6.0、MarkSnip 5.2.0、Turndown 7.2.4 加 turndown-plugin-gfm 1.0.2、Clean Web Clipper 0.1.0。第一轮依次运行三个脚本:capture-top.mjsrun-engines.mjsscore-top.mjs;第二轮是 capture-eu.mjs 之后运行 score-eu.mjs。这些脚本尚未公开:它们将随下一轮测试以代码仓库形式发布,不包含抓取下来的第三方页面。汇总结果已经可以下载:benchmark.json

添加到 Chrome(免费)免费,无需账号 · 2026 年 8 月测试了 512 个页面,0 次崩溃。提取可以离线完成;在设置中关闭一个开关即可停止使用事件。For Chrome on a computer

查看常见问题的解答

我能复现这个结果吗?
目前还不能自己复现。语料列表、抓取脚本和评分脚本将随下一轮测试一起公布。在那之前,本页给出了引擎版本和日期,以后的测试可以据此对照。抓取依赖在线网站,所以随着这些网站变化,具体数字会有偏差。
为什么这里写出了其他产品的名字,而商店页面上没有?
商店页面不提其他产品的名字;这个页面会提。隐去比较对象的对比无法核实,所以这里每个引擎都写明了名称和版本。
提取出的文本越多越好吗?
单看数量不是。返回满是链接的信息流页面的引擎,在数量上得分高,在有用性上得分低。所以上面的表格测量的是噪音,而不是大小。