Clean Web Clipper 添加到 Chrome(免费)

测量 ·

测了什么,在什么上测的,结果如何

在 512 个页面上测试:其中 109 个与另外三个引擎逐一对比,403 个只用我们的核心处理。没有崩溃,提取出的文章中没有任何残留的 HTML 标签。语料和脚本将随下一轮测试一起公布;在那之前,本页就是运行内容和结果的完整记录。

第一轮:109 个页面,四个引擎逐一对比

语料来自全球访问量最高的一百个网站和俄罗斯访问量最高的一百个网站。非内容类域名(即时通讯、网上银行、流媒体、政府门户)事先已排除。页面用真实浏览器抓取,只要首页上有内容链接,就顺着它打开一个内容页面。

四个引擎处理同样的 109 个抓取页面:Defuddle 0.19.3 加 Turndown 7.2.4(官方 Obsidian Web Clipper 的核心)、Mozilla Readability 0.6.0 加同一个 Turndown(MarkDownload 的核心)、MarkSnip 5.2.0(它实际发布的代码,从 Chrome 应用商店的安装包中解压得到),以及 Clean Web Clipper 0.1.0。

指标Defuddle 0.19.3Mozilla Readability 0.6.0MarkSnip 5.2.0Clean Web Clipper 0.1.0
页面109107107109
崩溃0220
残留 HTML53271820
重复的菜单行491282478102
短行比例0.2780.2620.2630.221
识别出的作者23272828
识别出的发布日期28131324
提取出的表格(共 56 个)38115
有用文本占比0.8780.9310.9340.890

Clean Web Clipper 落后的地方

第二轮:十二种欧洲语言的 403 个页面,只用我们的核心

十二个国家各自排名前五十的网站,抓取时浏览器语言设为该国语言,否则其中一半会返回英文页面,测到的就是别的东西了。

403 个页面中有 152 个得到的回答是“没有文章”:商店首页、门户首页和信息流,这些页面上没有可提取的文章。这个回答是有意为之的,这也是这些页面被计为“已测试”而不是“已剪藏”的原因。

语言页面崩溃残留 HTML链接占比
德语40000.058
法语39000.050
西班牙语40000.060
意大利语40000.036
波兰语30000.064
葡萄牙语36000.060
荷兰语37000.049
土耳其语31000.042
乌克兰语13000.054
捷克语28000.039
瑞典语28000.036
罗马尼亚语41000.039

每次剪藏的时间:4 分 38 秒

lessroutinemorelife.com 上的计数器把每次剪藏按 4 分 38 秒计算。这个时间是所有者在 1,000 多个不同的内容页面上手动计时得出的:复制文本、粘贴、清理、加上标题和来源,再检查有没有残留的 HTML 标记。平均值和中位数都计算过。

因此,计数器显示的是剪藏次数乘以这个时间,而不是每次剪藏用秒表计时的总和。它并不测量某一次剪藏原本会花掉你多少时间。

这些数字是什么意思

这次测量的真实局限

添加到 Chrome(免费)完全免费,无需账号,没有限制。提取可以离线完成;联网时会发送使用事件,关闭一个开关即可停止。

常见问题

我能复现这个结果吗?
目前还不能自己复现。语料列表、抓取脚本和评分脚本将随下一轮测试一起公布。在那之前,本页给出了引擎版本和日期,以后的测试可以据此对照。抓取依赖在线网站,所以随着这些网站变化,具体数字会有偏差。
为什么这里写出了其他产品的名字,而商店页面上没有?
商店页面不提其他产品的名字;这个页面会提。隐去比较对象的对比无法核实,所以这里每个引擎都写明了名称和版本。
提取出的文本越多越好吗?
单看数量不是。返回满是链接的信息流页面的引擎,在数量上得分高,在有用性上得分低。所以上面的表格测量的是噪音,而不是大小。